本项目对当前主流 LLM 评测基准进行系统性梳理与横向对比,覆盖 14 个基准,分为"工程类"与"非工程类"两份深度报告。
旨在帮助团队回答三个核心问题:哪些基准仍有区分度?哪些已接近饱和?不同场景应如何选型?
两份报告均包含:演进脉络梳理 → 逐个基准深度拆解 → 横向对比矩阵 → 可视化图表 → 贯穿性结论 → 选型建议。
所有关键数据点(题量、机构、arXiv 编号、模型成绩等)均已通过全网搜索与官方源交叉验证。发现的错误与过时数据已修正或标注。
聚焦"智能体(Agentic)"能力评测的演进:从仓库级代码修复,到超长周期工程、终端运维与前沿数学推理。
覆盖基准(7 个):
核心结论:污染是分水岭;评分保真度被严重低估;饱和正在分层;脚手架与模型能力纠缠。
阅读工程类报告 →聚焦"知识 / 推理 / 通用智能"评测:从偏好与事实性、专家级知识,到抗污染通用榜与流体智能。
覆盖基准(7 个):
核心结论:"可靠性"正成为独立维度;抗污染有不同强度等级;ARC-AGI-3 是"为人类保留的阵地"。
阅读非工程类报告 →两份报告中的所有关键数据点(基准题量、机构、arXiv 编号、模型成绩等)均已通过官方论文、排行榜与权威第三方来源交叉验证。以下为发现的问题及处理结果:
| # | 所在报告 | 问题描述 | 原值 | 修正值 | 状态 |
|---|---|---|---|---|---|
| 1 | 非工程类 | Arena 事实性榜上线日期有误。Arena 官方 X 帖文明确写"On July 15th, we launched a…",而非 7 月 14 日。 | 2026-07-14 | 2026-07-15 | ✓ 已修正 |
| 2 | 非工程类 | AA-Omniscience 实时榜成绩引用偏旧。报告记录 Gemini 3.1 Pro +33 / Claude Opus 4.8 +27 / GPT-5.5 +20,但截至 2026-08 最新榜单已大幅提升:Claude Fable 5 ≈ +43、Claude Opus 5 ≈ +37、Gemini 3.1 Pro ≈ +32。 | Gemini 3.1 Pro +33 居前 | Claude Fable 5 ≈ +43 居前 | ⚠ 数据过时(已标注新鲜度提示) |
| 3 | 工程类 | DeepSWE 龙头成绩引用偏旧。报告记录 GPT-5.5 = 70.0% pass@1,但当前排行榜 Claude Opus 5 已达 74%、GPT-5.6 Sol 73%。 | GPT-5.5 = 70.0% | Claude Opus 5 = 74% | ⚠ 数据过时(已标注新鲜度提示) |
| 4 | 工程类 | SWE-bench Verified SOTA 已突破报告引用值。报告记录 Claude Opus 4.7 ≈ 87.6%,但 Claude Fable 5 已达 95.0%、Claude Mythos Preview 93.9%。 | Claude Opus 4.7 ≈ 87.6% | Claude Fable 5 = 95.0% | ⚠ 数据过时(已标注新鲜度提示) |
| 5 | 非工程类 | LiveBench 龙头成绩引用偏旧。报告记录 GPT-5.4 Thinking xHigh ≈ 80.3%,当前龙头 GPT-5.6 Sol Max Effort 已达 81.0%。 | GPT-5.4 Thinking xHigh ~80.3% | GPT-5.6 Sol Max 81.0% | ⚠ 数据过时(已标注新鲜度提示) |
以下汇总两份报告中涉及的所有基准的官方排行榜、论文与数据来源页面,供交叉参考。
| 基准名称 | 机构 | 年份 | 官方链接 | 简要说明 |
|---|---|---|---|---|
| SWESWE-bench | Princeton | 2023 |
swebench.com arXiv 2310.06770 |
原始版 2,294 题 / 12 个 Python 仓库。ICLR'24 论文。开创性的仓库级代码修复基准。 |
| SWESWE-bench Verified | Princeton + OpenAI | 2024 | swebench.com | 500 题人工校验子集,行业标配。当前龙头已达 ~95%,接近饱和。 |
| SWESWE-bench Pro | Scale AI | 2025 |
scaleapi.github.io/SWE-bench_Pro-os arXiv 2509.16941 |
1,865 题 / 41 仓库,分 Public / Held-out / Commercial 三 splits。抗污染、长周期设计。 |
| TERMTerminal-Bench 2.1 | Laude Institute + Stanford | 2025 |
tbench.ai Artificial Analysis 排行榜 arXiv 2601.11868 |
89 题真实 Linux CLI 工作流,覆盖软件工程、系统管理、数据、安全等。v2.1 为校验刷新版。 |
| MATHFrontierMath | Epoch AI | 2024 |
epoch.ai/frontiermath arXiv 2411.04872 |
350 题原创数学(300 基础 + 50 Tier 4),60+ 数学家含 14 位 IMO 金牌、Fields 奖得主陶哲轩等。T4 几乎无人完成。 |
| FRONTDeepSWE | Datacurve | 2026 |
deepswe.datacurve.ai arXiv 2607.07946 |
113 题 / 91 仓库 / 5 语言,从零原创、永不合并上游(最强抗污染),手写功能验证器。验证器-裁判分歧仅 1.4%。 |
| FRONTFrontierSWE | Proximal | 2026 |
frontierswe.com GitHub |
17 题 × 20 小时超长周期,涵盖实现 / 性能 / ML 研究方向。0–1 连续评分。实现类任务 0/5 完全完成。 |
| 基准名称 | 机构 | 年份 | 官方链接 | 简要说明 |
|---|---|---|---|---|
| ARENAArena 事实性榜 | arena.ai | 2026 |
arena.ai/blog/factuality-in-arena arena.ai/leaderboard |
200 万+ 原子化断言标注,复合 Bradley-Terry 模型,默认 25% 事实权重可调。补"偏好≠真相"的洞。 |
| ARENAArena Expert | arena.ai | 2025 | arena.ai/blog/arena-expert | 仅取全部提示中最难的 5.5%,用 DeepSeek-v3 零样本标记"专家级"。区分度最强(Top-30 分差达 84)。 |
| ARENAArena Occupational | arena.ai | 2025 | arena.ai/blog/arena-expert | 基于美国 BLS SOC 分类的 23 个职业类别排名,按职业等权重重算 Bradley-Terry,找"最佳通才"。 |
| OMNIAA-Omniscience | Artificial Analysis | 2025 |
artificialanalysis.ai/evaluations/omniscience arXiv 2511.13029 |
6,000 题 / 42 主题 / 6 大域。Omniscience Index 奖励承认不确定、惩罚幻觉。开源 10% 数据集。 |
| HLEHLE (Humanity's Last Exam) | Scale AI + CAIS | 2025 |
agi.safe.ai arXiv 2501.14249 Nature 2026 |
~2,500 专家级闭卷学术题,100+ 学科,近 1,000 作者。2026-01 发表于 Nature。50 万美元奖金。 |
| LIVELiveBench | Abacus.AI + NYU + NVIDIA 等 | 2024 |
livebench.ai arXiv 2406.19314 |
23 任务 / 7 类,每 6 个月整体刷新。客观可验证、无 LLM 裁判。ICLR'25 Spotlight。 |
| ARCARC-AGI-3 | ARC Prize Foundation | 2026 |
arcprize.org/arc-agi/3 arXiv 2603.24621 |
135 个交互式无指令小世界(64×64 网格),测流体智能。Kaggle $200 万奖。人类 100%,AI <1%。 |