LLM 评测榜单对比分析

本项目对当前主流 LLM 评测基准进行系统性梳理与横向对比,覆盖 14 个基准,分为"工程类"与"非工程类"两份深度报告。

旨在帮助团队回答三个核心问题:哪些基准仍有区分度?哪些已接近饱和?不同场景应如何选型?

数据截至 2026-08 14 个基准 / 2 份报告 经全网交叉验证 含官方源数据链接

项目说明

背景:随着 GPT-5、Claude Opus/Fable 5、Gemini 3.x 等前沿模型快速迭代,SWE-bench Verified 等早期标杆已接近饱和(龙头 >88%), 业界注意力正转向 SWE-bench Pro、FrontierSWE、ARC-AGI-3 等抗污染、长周期、高难度基准。 本项目将 14 个关键基准按"工程"与"非工程"两条主线整理,逐一分解其设计逻辑、抗污染机制、当前成绩与选型建议。

两份报告均包含:演进脉络梳理 → 逐个基准深度拆解 → 横向对比矩阵 → 可视化图表 → 贯穿性结论 → 选型建议。

所有关键数据点(题量、机构、arXiv 编号、模型成绩等)均已通过全网搜索与官方源交叉验证。发现的错误与过时数据已修正或标注。

对比报告

工程类

工程类 LLM 评测榜单深度对比

聚焦"智能体(Agentic)"能力评测的演进:从仓库级代码修复,到超长周期工程、终端运维与前沿数学推理。

覆盖基准(7 个):

  • SWE-bench Verified — 500 题 Python 仓库修复(~88% 饱和)
  • SWE-bench Pro — 1,865 题企业级长周期(~44% 未饱和)
  • Terminal-Bench 2.1 — 89 题真实 CLI 工作流(~90% 饱和)
  • Terminal-Bench Hard — 高难运维压力测试(~66% 未饱和)
  • FrontierMath — 350 题原创数学(T4 仅 ~6%)
  • DeepSWE — 113 题原创多语言代码(~70% 未饱和)
  • FrontierSWE — 17 题 × 20 小时超长周期(0 全完成)

核心结论:污染是分水岭;评分保真度被严重低估;饱和正在分层;脚手架与模型能力纠缠。

阅读工程类报告 →
非工程类

非工程类 LLM 评测榜单深度对比

聚焦"知识 / 推理 / 通用智能"评测:从偏好与事实性、专家级知识,到抗污染通用榜与流体智能。

覆盖基准(7 个):

  • Arena 事实性榜 — 200 万+ 断言事实查核(持续更新)
  • Arena Expert — 仅 5.5% 最难提示(区分度最强)
  • Arena Occupational — 23 个职业分类排名
  • AA-Omniscience — 6,000 题知识可靠性(远未饱和)
  • HLE — ~2,500 专家级闭卷学术题(~47% 快速逼近)
  • LiveBench — 23 任务月更抗污染综合榜(~80% 未饱和)
  • ARC-AGI-3 — 135 交互式小世界(<1% 人类 100%)

核心结论:"可靠性"正成为独立维度;抗污染有不同强度等级;ARC-AGI-3 是"为人类保留的阵地"。

阅读非工程类报告 →

全网验证与修正清单

两份报告中的所有关键数据点(基准题量、机构、arXiv 编号、模型成绩等)均已通过官方论文、排行榜与权威第三方来源交叉验证。以下为发现的问题及处理结果:

#所在报告问题描述原值修正值状态
1 非工程类 Arena 事实性榜上线日期有误。Arena 官方 X 帖文明确写"On July 15th, we launched a…",而非 7 月 14 日。 2026-07-14 2026-07-15 ✓ 已修正
2 非工程类 AA-Omniscience 实时榜成绩引用偏旧。报告记录 Gemini 3.1 Pro +33 / Claude Opus 4.8 +27 / GPT-5.5 +20,但截至 2026-08 最新榜单已大幅提升:Claude Fable 5 ≈ +43、Claude Opus 5 ≈ +37、Gemini 3.1 Pro ≈ +32。 Gemini 3.1 Pro +33 居前 Claude Fable 5 ≈ +43 居前 ⚠ 数据过时(已标注新鲜度提示)
3 工程类 DeepSWE 龙头成绩引用偏旧。报告记录 GPT-5.5 = 70.0% pass@1,但当前排行榜 Claude Opus 5 已达 74%、GPT-5.6 Sol 73%。 GPT-5.5 = 70.0% Claude Opus 5 = 74% ⚠ 数据过时(已标注新鲜度提示)
4 工程类 SWE-bench Verified SOTA 已突破报告引用值。报告记录 Claude Opus 4.7 ≈ 87.6%,但 Claude Fable 5 已达 95.0%、Claude Mythos Preview 93.9%。 Claude Opus 4.7 ≈ 87.6% Claude Fable 5 = 95.0% ⚠ 数据过时(已标注新鲜度提示)
5 非工程类 LiveBench 龙头成绩引用偏旧。报告记录 GPT-5.4 Thinking xHigh ≈ 80.3%,当前龙头 GPT-5.6 Sol Max Effort 已达 81.0%。 GPT-5.4 Thinking xHigh ~80.3% GPT-5.6 Sol Max 81.0% ⚠ 数据过时(已标注新鲜度提示)
说明:第 2–5 项属于"龙头成绩随模型迭代自然过时",报告末尾已有"数据新鲜度提示"声明,建议读者以官方排行榜当日数值为准。 第 1 项为事实性日期错误,已在报告中直接修正。其余所有核心数据(基准题量、机构、arXiv 编号、评分机制、抗污染设计等)均验证正确,无明显错误。

官方源数据页面清单

以下汇总两份报告中涉及的所有基准的官方排行榜、论文与数据来源页面,供交叉参考。

工程类基准

基准名称机构年份官方链接简要说明
SWESWE-bench Princeton2023 swebench.com
arXiv 2310.06770
原始版 2,294 题 / 12 个 Python 仓库。ICLR'24 论文。开创性的仓库级代码修复基准。
SWESWE-bench Verified Princeton + OpenAI2024 swebench.com 500 题人工校验子集,行业标配。当前龙头已达 ~95%,接近饱和。
SWESWE-bench Pro Scale AI2025 scaleapi.github.io/SWE-bench_Pro-os
arXiv 2509.16941
1,865 题 / 41 仓库,分 Public / Held-out / Commercial 三 splits。抗污染、长周期设计。
TERMTerminal-Bench 2.1 Laude Institute + Stanford2025 tbench.ai
Artificial Analysis 排行榜
arXiv 2601.11868
89 题真实 Linux CLI 工作流,覆盖软件工程、系统管理、数据、安全等。v2.1 为校验刷新版。
MATHFrontierMath Epoch AI2024 epoch.ai/frontiermath
arXiv 2411.04872
350 题原创数学(300 基础 + 50 Tier 4),60+ 数学家含 14 位 IMO 金牌、Fields 奖得主陶哲轩等。T4 几乎无人完成。
FRONTDeepSWE Datacurve2026 deepswe.datacurve.ai
arXiv 2607.07946
113 题 / 91 仓库 / 5 语言,从零原创、永不合并上游(最强抗污染),手写功能验证器。验证器-裁判分歧仅 1.4%。
FRONTFrontierSWE Proximal2026 frontierswe.com
GitHub
17 题 × 20 小时超长周期,涵盖实现 / 性能 / ML 研究方向。0–1 连续评分。实现类任务 0/5 完全完成。

非工程类基准

基准名称机构年份官方链接简要说明
ARENAArena 事实性榜 arena.ai2026 arena.ai/blog/factuality-in-arena
arena.ai/leaderboard
200 万+ 原子化断言标注,复合 Bradley-Terry 模型,默认 25% 事实权重可调。补"偏好≠真相"的洞。
ARENAArena Expert arena.ai2025 arena.ai/blog/arena-expert 仅取全部提示中最难的 5.5%,用 DeepSeek-v3 零样本标记"专家级"。区分度最强(Top-30 分差达 84)。
ARENAArena Occupational arena.ai2025 arena.ai/blog/arena-expert 基于美国 BLS SOC 分类的 23 个职业类别排名,按职业等权重重算 Bradley-Terry,找"最佳通才"。
OMNIAA-Omniscience Artificial Analysis2025 artificialanalysis.ai/evaluations/omniscience
arXiv 2511.13029
6,000 题 / 42 主题 / 6 大域。Omniscience Index 奖励承认不确定、惩罚幻觉。开源 10% 数据集。
HLEHLE (Humanity's Last Exam) Scale AI + CAIS2025 agi.safe.ai
arXiv 2501.14249
Nature 2026
~2,500 专家级闭卷学术题,100+ 学科,近 1,000 作者。2026-01 发表于 Nature。50 万美元奖金。
LIVELiveBench Abacus.AI + NYU + NVIDIA 等2024 livebench.ai
arXiv 2406.19314
23 任务 / 7 类,每 6 个月整体刷新。客观可验证、无 LLM 裁判。ICLR'25 Spotlight。
ARCARC-AGI-3 ARC Prize Foundation2026 arcprize.org/arc-agi/3
arXiv 2603.24621
135 个交互式无指令小世界(64×64 网格),测流体智能。Kaggle $200 万奖。人类 100%,AI <1%。
提示:评测榜单迭代极快,上述排行榜数值持续更新。引用具体数字时请以对应官方页面当日值为准。 部分基准(如 FrontierSWE、DeepSWE)为 2026 年新发布,排行榜变动较快。