原页左侧 11 项都做成可点区块。数字来自 2026-08-21 原页 HTML 快照(默认 31/481 模型),不编造。

原文:artificialanalysis.ai/evaluations/omniscience

分数 Score

AA-Omniscience Index:得分(越高越好)

31 / 481 模型

答对加分,幻觉扣分,拒答不罚。范围 −100~100;0 表示对错一样多。

AA-Omniscience Index

同一套 Index,换对照轴。原站还能切 Intelligence Index / 作答率 / 输出 token / 成本。

AA-Omniscience Accuracy

准确率 = 答对 / 全部题(越高越好)。按准确率从高到低,和原站一样。

AA-Omniscience Hallucination Rate

越低越好:模型本该拒绝或承认不会,却给出错误答案的比例。公式:答错 / (答错 + 部分对 + 未作答)。按幻觉率从低到高,对应你截的那张图。

左边低幻觉多半是少答(Command A+ 14%,作答率只有 23%)。右边 GPT / DeepSeek 几乎题题都答,幻觉率 88–95%。

Detailed Domain Score 六科分

每科自己的 Omniscience Index。这批默认模型里 Fable 5 六科都第一。

Software Engineering Deep Dive

按语言归一化的 SWE Index:该语言里最高为绿、最低为红。格子颜色看相对强弱,悬停看原始分数。

Software Engineering AA-Omniscience Index Across Languages(归一化)

行 = 语言,列 = 模型。颜色只在同一行内比较。

最低
最高

Model Size(仅开源权重)

横轴是原页 activeParams(激活参数,十亿),纵轴是 Index。闭源模型原页没有参数量,不画。

有激活参数的开源模型 17 个。总参数量字段原页是空的,所以只能画激活参数。

Token Usage

跑完整评测用掉的 token:输入 / 推理 / 答案。堆叠柱。原页 JSON-LD 只带了 20/31 个模型,缺的不画。

输入 推理 答案

Cost 评测成本

按官方标价估的评测花费(美元):输入 / 推理 / 答案。同样只有 20/31 个模型有数。

输入 推理 答案

Score vs. Release Date

横轴发布日期,纵轴 Index。越靠右越新。

Example Tasks 样例题

软件工程 / Rust
Rust 2024 edition(1.85+)异步模型里,那种「单个 task 内部的并发」、标准库线程本身不提供的东西,术语叫什么?
健康 / 医学
结直肠手术命名中,特指低位直肠癌 extralevator 技术(不是 extended APR)时,EAPR 代表什么?
商业 / 会计
财政部法规里,股票分配与现金/财产分配配对的可反驳时间推定中,两件事前后最多相隔几个月,才被推定满足伴随分配要求?

怎么算这三项分

Index = (答对 − 答错) / 总题数 × 100
准确率 = 答对 / 总题数
幻觉率 = 答错 / (总题数 − 答对)
作答率 = 作答题 / 总题数
准确率40%
幻觉率50%
Index+10
作答率70%

分数会变,以原站为准。论文:Jackson et al., AA-Omniscience