非工程类 LLM 评测榜单深度对比

Arena 事实性榜 · Arena Expert · Arena Occupational · AA-Omniscience · HLE · LiveBench · ARC-AGI-3

聚焦"知识 / 推理 / 通用智能"评测:从偏好与事实性、专家级知识,到抗污染通用榜与流体智能。

数据截至 2026-08 7 个基准 / 5 类 含来源与新鲜度标注
一句话结论:工程类榜单测"能不能把事做完",非工程类这组测的是"知道什么、会不会推理、是否可靠、面对全新事物能否自学"。 在"知识+可靠性"维度,AA-Omniscience 显示几乎所有前沿模型在难题上"幻觉多于正确"(最佳仅 +30 上下); 在"专家级知识"维度,HLE 龙头 ~46%;在"抗污染综合能力"维度,LiveBench 龙头 ~80%; 而 ARC-AGI-3 把前沿模型按在 <1%,人类 100%——它是目前唯一直接拷问"通用流体智能"的标尺,也是整组里最刺眼的分水岭。

一、这组榜单在做什么:从"偏好→知识→推理→通用智能"

它们沿着一条能力纵深递进:

Arena 系列(arena.ai / LMArena):用盲测人类偏好rank模型—— 事实性榜(2026-07 新增,偏好+事实查核复合)、Expert(仅 5.5% 最难提示)、Occupational(23 个职业分类)。 胜在规模(6.8M+ 投票)与持续更新,弱在偏好≠事实。
AA-Omniscience(Artificial Analysis, 2025-11):6,000 题/42 主题,惩罚幻觉、奖励"知之为不知",测知识可靠性
HLE(Humanity's Last Exam)(Scale AI / CAIS, 2025-01;Nature 2026-01):~2,500 专家级、多模态、闭卷学术题,测前沿知识天花板
LiveBench(Abacus.AI 等, 2024-06;ICLR'25 Spotlight):每月换题、客观可验证、无 LLM 裁判,测抗污染综合能力
ARC-AGI-3(Chollet / ARC Prize, 2026-03):135 个交互式无指令小世界,测流体智能(面对全新任务的习得效率)
贯穿线索:越往右,越刻意排除"记忆/检索/偏好迎合"这类捷径——Arena 靠真人、AA-Omniscience 靠惩罚猜测、HLE 靠不可搜索、 LiveBench 靠换题、ARC-AGI-3 靠无指令交互。难度与"对真实智能的区分度"同步上升。

二、逐个基准深度拆解

ARENA Arena 事实性榜 (Factuality)

出身:arena.ai(原 LMSYS Chatbot Arena),2026-07-15 上线,文本/搜索竞技场新增"事实性"维。
方法:对真实对战回答抽取"原子化断言",用搜索 agent 网络验证;复合 Bradley-Terry 模型,默认事实权重 25%(可调 0–100%)。
规模:标注 200 万+ 断言(文本 130 万+ / 搜索 70 万+),覆盖 ~13 万场文本对战。
关键发现:事实权重拉满时,OpenAI GPT / Grok 上升或持平,Claude / Gemini 下降或持平,Meta Muse Spark、百度 Ernie 大幅下跌。法律类最不 factual,数学类最准。
定位:补"偏好≠真相"的洞;不惩罚拒答,只罚"自信的错误"。

ARENA Arena Expert

出身:arena.ai,2025 推出,作为 Arena Hard 的"更难版"。
方法:用 LLM(DeepSeek-v3)零样本标记"专家级"提示——只看提示本身是否体现专家式推理与领域深度。
范围:仅占全部提示的 5.5%(Arena Hard 占 1/3);Top-30 模型分差达 84(Overall 56、Hard 66),区分度最强。
结论:通用最强为 Gemini 2.5 Pro,其后 Claude Opus 4.1、o3、GPT-5;Claude Opus 4.1 / GPT-5 high / Qwen3 max 在 Expert 上显著上升,GPT-4o 显著下降。

ARENA Arena Occupational

出身:与 Expert 同期,源自美国 BLS 职业分类(SOC),适配 Arena 数据得 23 个职业类别
覆盖:医学与健康、法律与政府、工程与建筑、数学、写作/文学/语言、哲学/宗教、商业等;捕捉真实任务的广度。
用法:按职业等权重重算 Bradley-Terry,找"最佳通才";与 OpenAI GDPval 高度一致(无需真人专家标注即可近似)。
局限:基于 LLM 自动打标,比人工专家标注更噪;反映平台自然分布而非均衡采样。

OMNI AA-Omniscience

出身:Artificial Analysis,2025-11(arXiv 2511.13029)。
规模:6,000 题 / 42 主题 / 6 大域(商业、人文社科、健康、法律、软件工程、科工数学);开源 10% 数据集。
评分:Omniscience Index(-100~+100):正确 +1、错误 -1、拒答 0。奖励承认不确定、惩罚幻觉
核心发现:除 3 个模型外,其余"幻觉多于正确"(Index<0)。首发最佳 Claude 4.1 Opus 仅 +4.8;2026 实时榜 Gemini 3.1 Pro +33、Claude Opus 4.8 +27、GPT-5.5 +20 居前。Anthropic 靠"低幻觉率"领先,OpenAI/xAI 靠"高准确率"领先。

HLE Humanity's Last Exam

出身:Scale AI + CAIS,2025-01(arXiv 2501.14249);2026-01 登 Nature("专家级学术问题基准")。1,000+ 作者,50 万美元奖金。
规模:~2,500 题,100+ 学科,多模态(含图表/铭文/化学结构),单答案、不可搜索、需真专家。
评分:Accuracy(o3-mini 评判)+ 校准误差(confidence 是否匹配真实正确率)。
成绩:GPT-4o 2.7%(2025-01) → GPT-5.4 Pro 44.3%(2026-03) → Claude Opus 4.7 46.9%(2026-05, no-tools)。带工具更高(Mythos Preview 64.7%)。人类专家~90%、普通人 5–10%。未饱和但快速逼近

LIVE LiveBench

出身:Abacus.AI + NYU + NVIDIA + UMD + USC(含 Yann LeCun),2024-06;ICLR'25 Spotlight。
规模:23 任务 / 7 类(推理、编码、Agentic 编码、数学、数据分析、语言、指令遵循);每 6 个月整体刷新,~1/6 月更、近期题延迟公开。
方法:题源自近期数学竞赛/arXiv/新闻/数据集;客观可验证、无 LLM 裁判、无人工——直接对抗污染。
成绩:首发顶级 <65%;2026-01-08 版龙头 GPT-5.4 Thinking xHigh ~80.3%未饱和,但已明显高于早期。

ARC ARC-AGI-3

出身:François Chollet + ARC Prize Foundation,2026-03-24(arXiv 2603.24621);Kaggle $200 万奖。
形态:135 个交互式小世界(64×64 网格、16 色、极小动作空间),无指令、无目标说明、无语言;需探索→建模→自定目标→规划执行。
评分:RHAE(相对人类动作效率):(人动作/AI动作)²,暴力摸索被平方惩罚;≥5×人类步数直接终止。
成绩:人类 100% 首试通过(中位 7.4 分钟);前沿模型 Gemini 3.1 Pro 0.37%、GPT-5.4 0.26%、Claude Opus 4.6 0.25%、Grok 4.20 0.00%。Duke 自建脚手架下 TR87 达 97.1%,陌生环境 0%——"智能在脚手架,不在模型"。几乎未饱和

三、横向对比矩阵

维度Arena 事实性Arena ExpertArena Occupational AA-OmniscienceHLELiveBenchARC-AGI-3
测什么偏好+事实性专家级推理职业广度知识可靠性专家级知识抗污染综合能力流体智能
机构 / 年arena.ai / 26arena.ai / 25arena.ai / 25AA / 25Scale+CAIS / 25Abacus 等 / 24ARC Prize / 26
规模200万+断言全量 5.5% 提示23 类6,000 题~2,500 题23 任务/7 类135 环境
评分复合 BT(ELO)BT(ELO)BT(等权)Index -100~+100Accuracy+校准客观准确率RHAE(效率平方)
抗污染/捷径中(搜索验证)中(众包)中(众包)强(惩罚猜测)强(不可搜索)最强(月更题)最强(无指令交互)
龙头成绩Claude Opus 5(Max) 1512*Gemini 2.5 Pro(通才首)Claude Opus 4.1 居前Gemini 3.1 Pro +33~46.9%(no-tools)~80.3%<1%(人 100%)
饱和状态持续更新持续更新持续更新远未饱和快速逼近未饱和几乎未饱和
是否需要工具否(文本/搜索)否(纯记忆)可带工具交互 agent

*Arena 事实性为 ELO 分(默认含 25% 事实权重,可调),与其余"准确率/指数"量纲不同,仅列作参照。各"龙头成绩"来自不同日期与机构,绝对值不可横比。

四、当前前沿模型得分(归一化难度对照)

仅作直观对照:AA-Omniscience 用 Index(-100~+100,已映射到 0–100)、HLE/LiveBench 用准确率%、ARC-AGI-3 用原始分(≈0);Arena 系列为 ELO 不并入。 越靠左越难——ARC-AGI-3 几乎贴地,HLE/Omniscience 处于中低区,LiveBench 已较高,反映"知识/综合能力"比"流体智能"更接近饱和。

五、四条贯穿性结论

1)"可靠性"正成为独立维度。Arena 事实性榜与 AA-Omniscience 都证明:听起来对 ≠ 真的对。 AA-Omniscience 显示多数模型在难题上"幻觉多于正确";Arena 事实性发现拉满事实权重后排名大洗牌(OpenAI/Grok 升、Claude/Gemini 降、Meta/百度大跌)。 选模型时,factuality/calibration 可能比偏好 ELO 更关乎落地安全。
2)"抗污染"有不同强度等级。Arena 靠真人众包(规模大但可被品牌/话术带偏);AA-Omniscience/HLE 靠"不可搜索/奖励拒答"; LiveBench 靠"每月换题+延迟公开+客观判分";ARC-AGI-3 靠"无指令交互小世界"——后者几乎无法被记忆或检索绕过,是最硬的抗污染。
3)饱和速度差异巨大。LiveBench(~80%)、HLE(~47%,一年内 GPT-4o 2.7%→46.9%)快速爬升; AA-Omniscience 仍低位(最佳 +33);ARC-AGI-3 则几乎是"为人类保留的阵地"(<1% vs 100%)。 若关心"离 AGI 还有多远",看 ARC-AGI-3 而非 LiveBench/HLE。
4)脚手架 vs 智能的边界在 ARC-AGI-3 被撕开。Duke 为单一环境手写脚手架后 Opus 4.6 从 0%→97.1%,但换环境即归零。 Chollet 的判断:"脚手架里的才是智能,模型只是在执行。"这与工程类报告里"脚手架与模型能力纠缠"互为镜像—— 任何榜都该追问:分数是模型本身,还是人类工程的外壳?

六、怎么用这些榜(选型建议)

数据新鲜度提示:本报告引用了 2026 年的模型/榜单版本(如 Claude Opus 4.7/4.8、GPT-5.4/5.5、Gemini 3.1 Pro、ARC-AGI-3 实时分)。 评测迭代极快,引用具体数字请以官方当日值为准:arena.ai/leaderboard、artificialanalysis.ai(AA-Omniscience)、 lastexam.ai / lab.scale.com(HLE)、livebench.ai、arcprize.org(ARC-AGI-3)。