原页左侧 11 项都做成可点区块。数字来自 2026-08-21 原页 HTML 快照(默认 31/481 模型),不编造。
原文:artificialanalysis.ai/evaluations/omniscience
答对加分,幻觉扣分,拒答不罚。范围 −100~100;0 表示对错一样多。
AA-Omniscience Index
同一套 Index,换对照轴。原站还能切 Intelligence Index / 作答率 / 输出 token / 成本。
AA-Omniscience Accuracy
准确率 = 答对 / 全部题(越高越好)。按准确率从高到低,和原站一样。
AA-Omniscience Hallucination Rate
越低越好:模型本该拒绝或承认不会,却给出错误答案的比例。公式:答错 / (答错 + 部分对 + 未作答)。按幻觉率从低到高,对应你截的那张图。
左边低幻觉多半是少答(Command A+ 14%,作答率只有 23%)。右边 GPT / DeepSeek 几乎题题都答,幻觉率 88–95%。
Detailed Domain Score 六科分
每科自己的 Omniscience Index。这批默认模型里 Fable 5 六科都第一。
Software Engineering Deep Dive
按语言归一化的 SWE Index:该语言里最高为绿、最低为红。格子颜色看相对强弱,悬停看原始分数。
Software Engineering AA-Omniscience Index Across Languages(归一化)
行 = 语言,列 = 模型。颜色只在同一行内比较。
Model Size(仅开源权重)
横轴是原页 activeParams(激活参数,十亿),纵轴是 Index。闭源模型原页没有参数量,不画。
有激活参数的开源模型 17 个。总参数量字段原页是空的,所以只能画激活参数。
Token Usage
跑完整评测用掉的 token:输入 / 推理 / 答案。堆叠柱。原页 JSON-LD 只带了 20/31 个模型,缺的不画。
Cost 评测成本
按官方标价估的评测花费(美元):输入 / 推理 / 答案。同样只有 20/31 个模型有数。
Score vs. Release Date
横轴发布日期,纵轴 Index。越靠右越新。
Example Tasks 样例题
Rust 2024 edition(1.85+)异步模型里,那种「单个 task 内部的并发」、标准库线程本身不提供的东西,术语叫什么?
结直肠手术命名中,特指低位直肠癌 extralevator 技术(不是 extended APR)时,EAPR 代表什么?
财政部法规里,股票分配与现金/财产分配配对的可反驳时间推定中,两件事前后最多相隔几个月,才被推定满足伴随分配要求?
怎么算这三项分
准确率 = 答对 / 总题数
幻觉率 = 答错 / (总题数 − 答对)
作答率 = 作答题 / 总题数
分数会变,以原站为准。论文:Jackson et al., AA-Omniscience。