它们沿着一条能力纵深递进:
Arena 系列(arena.ai / LMArena):用盲测人类偏好rank模型——
事实性榜(2026-07 新增,偏好+事实查核复合)、Expert(仅 5.5% 最难提示)、Occupational(23 个职业分类)。
胜在规模(6.8M+ 投票)与持续更新,弱在偏好≠事实。
AA-Omniscience(Artificial Analysis, 2025-11):6,000 题/42 主题,惩罚幻觉、奖励"知之为不知",测知识可靠性。
HLE(Humanity's Last Exam)(Scale AI / CAIS, 2025-01;Nature 2026-01):~2,500 专家级、多模态、闭卷学术题,测前沿知识天花板。
LiveBench(Abacus.AI 等, 2024-06;ICLR'25 Spotlight):每月换题、客观可验证、无 LLM 裁判,测抗污染综合能力。
ARC-AGI-3(Chollet / ARC Prize, 2026-03):135 个交互式无指令小世界,测流体智能(面对全新任务的习得效率)。
贯穿线索:越往右,越刻意排除"记忆/检索/偏好迎合"这类捷径——Arena 靠真人、AA-Omniscience 靠惩罚猜测、HLE 靠不可搜索、
LiveBench 靠换题、ARC-AGI-3 靠无指令交互。难度与"对真实智能的区分度"同步上升。
ARENA Arena 事实性榜 (Factuality)
出身:arena.ai(原 LMSYS Chatbot Arena),2026-07-15 上线,文本/搜索竞技场新增"事实性"维。
方法:对真实对战回答抽取"原子化断言",用搜索 agent 网络验证;复合 Bradley-Terry 模型,默认事实权重 25%(可调 0–100%)。
规模:标注 200 万+ 断言(文本 130 万+ / 搜索 70 万+),覆盖 ~13 万场文本对战。
关键发现:事实权重拉满时,OpenAI GPT / Grok 上升或持平,Claude / Gemini 下降或持平,Meta Muse Spark、百度 Ernie 大幅下跌。法律类最不 factual,数学类最准。
定位:补"偏好≠真相"的洞;不惩罚拒答,只罚"自信的错误"。
ARENA Arena Expert
出身:arena.ai,2025 推出,作为 Arena Hard 的"更难版"。
方法:用 LLM(DeepSeek-v3)零样本标记"专家级"提示——只看提示本身是否体现专家式推理与领域深度。
范围:仅占全部提示的 5.5%(Arena Hard 占 1/3);Top-30 模型分差达 84(Overall 56、Hard 66),区分度最强。
结论:通用最强为 Gemini 2.5 Pro,其后 Claude Opus 4.1、o3、GPT-5;Claude Opus 4.1 / GPT-5 high / Qwen3 max 在 Expert 上显著上升,GPT-4o 显著下降。
ARENA Arena Occupational
出身:与 Expert 同期,源自美国 BLS 职业分类(SOC),适配 Arena 数据得 23 个职业类别。
覆盖:医学与健康、法律与政府、工程与建筑、数学、写作/文学/语言、哲学/宗教、商业等;捕捉真实任务的广度。
用法:按职业等权重重算 Bradley-Terry,找"最佳通才";与 OpenAI GDPval 高度一致(无需真人专家标注即可近似)。
局限:基于 LLM 自动打标,比人工专家标注更噪;反映平台自然分布而非均衡采样。
OMNI AA-Omniscience
出身:Artificial Analysis,2025-11(arXiv 2511.13029)。
规模:6,000 题 / 42 主题 / 6 大域(商业、人文社科、健康、法律、软件工程、科工数学);开源 10% 数据集。
评分:Omniscience Index(-100~+100):正确 +1、错误 -1、拒答 0。奖励承认不确定、惩罚幻觉。
核心发现:除 3 个模型外,其余"幻觉多于正确"(Index<0)。首发最佳 Claude 4.1 Opus 仅 +4.8;2026 实时榜 Gemini 3.1 Pro +33、Claude Opus 4.8 +27、GPT-5.5 +20 居前。Anthropic 靠"低幻觉率"领先,OpenAI/xAI 靠"高准确率"领先。
HLE Humanity's Last Exam
出身:Scale AI + CAIS,2025-01(arXiv 2501.14249);2026-01 登 Nature("专家级学术问题基准")。1,000+ 作者,50 万美元奖金。
规模:~2,500 题,100+ 学科,多模态(含图表/铭文/化学结构),单答案、不可搜索、需真专家。
评分:Accuracy(o3-mini 评判)+ 校准误差(confidence 是否匹配真实正确率)。
成绩:GPT-4o 2.7%(2025-01) → GPT-5.4 Pro 44.3%(2026-03) → Claude Opus 4.7 46.9%(2026-05, no-tools)。带工具更高(Mythos Preview 64.7%)。人类专家~90%、普通人 5–10%。未饱和但快速逼近。
LIVE LiveBench
出身:Abacus.AI + NYU + NVIDIA + UMD + USC(含 Yann LeCun),2024-06;ICLR'25 Spotlight。
规模:23 任务 / 7 类(推理、编码、Agentic 编码、数学、数据分析、语言、指令遵循);每 6 个月整体刷新,~1/6 月更、近期题延迟公开。
方法:题源自近期数学竞赛/arXiv/新闻/数据集;客观可验证、无 LLM 裁判、无人工——直接对抗污染。
成绩:首发顶级 <65%;2026-01-08 版龙头 GPT-5.4 Thinking xHigh ~80.3%。未饱和,但已明显高于早期。
ARC ARC-AGI-3
出身:François Chollet + ARC Prize Foundation,2026-03-24(arXiv 2603.24621);Kaggle $200 万奖。
形态:135 个交互式小世界(64×64 网格、16 色、极小动作空间),无指令、无目标说明、无语言;需探索→建模→自定目标→规划执行。
评分:RHAE(相对人类动作效率):(人动作/AI动作)²,暴力摸索被平方惩罚;≥5×人类步数直接终止。
成绩:人类 100% 首试通过(中位 7.4 分钟);前沿模型 Gemini 3.1 Pro 0.37%、GPT-5.4 0.26%、Claude Opus 4.6 0.25%、Grok 4.20 0.00%。Duke 自建脚手架下 TR87 达 97.1%,陌生环境 0%——"智能在脚手架,不在模型"。几乎未饱和。
*Arena 事实性为 ELO 分(默认含 25% 事实权重,可调),与其余"准确率/指数"量纲不同,仅列作参照。各"龙头成绩"来自不同日期与机构,绝对值不可横比。