工程类 LLM 评测榜单深度对比
SWE-bench Verified · SWE-bench Pro · Terminal-Bench 2.1 · Terminal-Bench Hard · FrontierMath · DeepSWE / FrontierSWE
聚焦"智能体(Agentic)"能力评测的演进:从仓库级代码修复,到超长周期工程、终端运维与前沿数学推理。
数据截至 2026-08
覆盖 7 个基准 / 2 个分支
含来源与新鲜度标注
一句话结论:这一组榜单共同描绘了一条清晰的"难度—抗污染"演进曲线。SWE-bench Verified 已接近饱和(龙头 ~88%),
Terminal-Bench 2.1 同样逼近天花板;而 SWE-bench Pro、Terminal-Bench Hard、DeepSWE、FrontierSWE 与 FrontierMath
通过"长周期 + 抗污染 + 手写验证器"把前沿模型打回 6%–44% 区间——尤其是 FrontierSWE 与 FrontierMath Tier 4,目前几乎无人完成。
一、评测体系的演进脉络
这些榜单不是孤立的,而是一条应对"饱和 + 污染"问题的迭代链:
SWE-bench(Princeton, 2023; 2,294 题/12 个 Python 仓库)
→ SWE-bench Verified(OpenAI+Princeton, 2024; 人工校验 500 题,成行业标配)
→ SWE-bench Pro(Scale AI, 2025; 1,865 题/41 仓库,抗污染、长周期)
→ DeepSWE(Datacurve, 2026; 113 题/5 语言,原创题+手写验证器)
→ FrontierSWE(Proximal, 2026; 17 题/20 小时,超长周期、0–1 连续评分)。
Terminal-Bench(Laude Institute; 1.0→2.0→2.1,89 题真实 CLI 工作流)
→ Terminal-Bench Hard(更难切片,多小时运维压力测试)。
FrontierMath(Epoch AI, 2024; 350 题原创数学,IMO 金牌出题,反污染)。
关键转折点:OpenAI 于 2025-09 公开宣布不再在 SWE-bench Verified 上评测,理由是其测试存在"捷径奖励"且训练数据泄漏抬高分数。
业界注意力整体转移到 Pro / DeepSWE / FrontierSWE 等抗污染、长周期基准。
二、逐个基准深度拆解
SWE SWE-bench Verified
出身:Princeton(Jimenez 等)2023 原版 2,294 题;2024-08 OpenAI 合作筛选 500 题人工校验子集。
任务:给定真实 GitHub issue + 仓库快照,生成能通过测试套件的补丁。FAIL_TO_PASS + PASS_TO_PASS 双通过才算解决。
范围:12 个 Python 仓库(Django、sympy、sklearn、flask…);平均改 1.7 文件 / 3.0 函数 / 32.8 行。
评分:Resolve Rate(Pass@k);二元通过/失败。
当前 SOTA:Claude Opus 4.7 ≈ 87.6%(2026-04);官方 all-agents 榜 ~79–80%。接近饱和。
局限:仅 Python、单仓库、题目相对良构;存在污染与捷径测试隐患。
SWE SWE-bench Pro
出身:Scale AI,2025-09(arXiv 2509.16941),Deng 等。
规模:1,865 题 / 41 个活跃仓库。分三块:Public 731(11 个强 copyleft/GPL 仓库)、Held-out 858、Commercial 276(18 个初创私有库)。
难度:长周期(人工需数小时~数天),平均改 107.4 行 / 4.1 文件;保留模糊需求,由专家改写为清晰需求书。
抗污染:GPL/私有代码天然不在训练语料;含 held-out 与 commercial 不可见集。
当前成绩:发布时 GPT-5=23.3%、Claude Opus 4.1=23.1%(Public,Pass@1,<25%);实时榜 Public 最高 ≈ 43.7%(claude-4-5-sonnet)。Commercial 集更低(GPT-5 仅 14.9%)。远未饱和。
TERM Terminal-Bench 2.1
出身:Laude Institute + 斯坦福 + 开源社区;v2.1 是 v2.0 的"校验刷新版"。
规模:89 题精心策展,覆盖软件工程、系统管理、数据处理、模型训练、安全。
任务:真实 Linux 沙箱内用终端完成任务;每题带唯一环境、人工解法与验证脚本(检验最终文件系统状态)。
改进:v2.1 修复 Dockerfile 与指令-测试错配,使分数反映能力而非环境缺陷。
当前成绩:Artificial Analysis(Terminus 2 / e2b,pass@1×3):GPT-5.6 Sol(xhigh) 89.5%、Claude Opus 5 89.1%;Mercor 榜 Opus 5 High 83.9%。接近饱和。
TERM Terminal-Bench Hard
出身:Terminal-Bench 的"更难切片",由 Artificial Analysis 评分;2025 发布。
任务:更长的工具调用链、更深错误恢复、更紧预算——被视为"多小时运维任务"最接近的公开代理。
评分:任务通过率;每题验证脚本检验终端最终状态。
规模:策展高难子集(129 个模型被测)。
当前成绩:最高 GPT-5.6 Sol 65.9%、Claude Fable 5 62.9%、GPT-5.5 60.6%;均值 28.2 / 中位 31.1。开/闭源差 +15.1 分。未饱和。
MATH FrontierMath
出身:Epoch AI,2024-11(arXiv 2411.04872);OpenAI 委托 300 题。
规模:350 题(300 基础 + 50 Tier 4);60+ 数学家,含 14 位 IMO 金牌、1 位菲尔兹奖(陶哲轩、Gowers 参与)。
分层:T1 高年级本科 / T2 研究生 / T3 研究级 / T4 短研究项目(50 题)。自动验证、原创未发表→抗污染。
成绩:发布时 GPT-4o/Claude 3.5 <2%;现 T1–3 龙头 ≈ 40%(2026-03),GPT-5 ≈24.8%;Tier 4 仅 o4-mini 6.3%,多数≈0%。MIT 竞赛:8 队优本+专家,4.5h/23 题,队均 19%、合并 35%。T4 几乎未解。
FRONT DeepSWE & FrontierSWE
⚠ 名称歧义:"DeepSWE" 有两义——①Together.ai+Agentica 的 RL 训练编码智能体(Qwen3-32B,SWE-bench Verified 42.2%/TTS 59%);②Datacurve 的 评测基准(下文)。
DeepSWE 基准(arXiv 2607.07946, 2026):113 题/91 仓库/5 语言(TS,Go,Py,JS,Rust),从零原创、永不合并上游(抗污染),手写功能验证器。验证器-裁判分歧仅 1.4%(vs SWE-bench Pro 32.4%)。提示词约为 Pro 一半,但参考解触达 5.5× 代码量。龙头 GPT-5.5 = 70.0% pass@1,跨度 69.8 分。未饱和。
FrontierSWE(Proximal, 2026):17 题(实现 5/研究 3/性能 9),每题 20 小时;性能工程、计算科学、ML 研究方向。0–1 连续评分(非二元)。龙头 Claude Fable 5(Claude Code)均秩 ~2.2、主导率 90%;实现类任务 0/5 完全完成(最佳 17% 测试通过率)。极少数未饱和公开编码榜。
三、横向对比矩阵
| 维度 | SWE-bench Verified | SWE-bench Pro | Terminal-Bench 2.1 |
Terminal-Bench Hard | FrontierMath | DeepSWE(基准) | FrontierSWE |
| 领域 | 仓库级代码修复 | 企业级长周期代码 | 真实 CLI 工作流 | 高难 CLI/运维 | 前沿数学推理 | 原创长周期代码 | 超长周期工程 |
| 机构 / 年 | Princeton+OpenAI / 24 | Scale AI / 25 | Laude+Stanford / 25 | Terminal-Bench 社区 / 25 | Epoch AI / 24 | Datacurve / 26 | Proximal / 26 |
| 题量 | 500 | 1,865 | 89 | 策展子集 | 350 | 113 | 17 |
| 语言/范围 | 12×Python 仓库 | 41 仓库(多语言) | 多域 CLI | 多域 CLI | 数学(无代码) | 5 语言/91 仓库 | 性能/科学/ML |
| 抗污染设计 | 弱(公开 PR) | 强(GPL+私有+held-out) | 中 | 中 | 强(原创未发表) | 最强(原创不合并) | 强(伙伴独家题) |
| 评分方式 | 测试套件二元 | 测试套件二元 | 验证脚本(终态) | 验证脚本(终态) | 自动验证 | 手写功能验证器 | 0–1 连续评分 |
| 龙头成绩 | ~87.6% | ~43.7%(Pub) / 23.3%(首发) | ~89.5% | ~65.9% | T1–3 ~40% / T4 ~6% | ~70.0% | 均秩~2.2 / 0 全完成 |
| 饱和状态 | 接近饱和 | 远未饱和 | 接近饱和 | 未饱和 | T4 几乎未解 | 未饱和 | 几乎未饱和 |
| 单题耗时预算 | 中 | 长(数小时~天) | 中 | 长(多小时) | 数小时~天 | 长 | 20 小时 |
说明:各榜"龙头成绩"来自不同机构/脚手架,绝对值不可直接横比;本表仅用于勾勒当前前沿所处的相对位置。SWE-bench Pro 同时存在"首发论文 23.3%"与"实时 Public 榜 43.7%"两档,反映模型与脚手架的进步。
四、当前前沿模型得分(难度粗略代理)
越短越难:条形为该基准上"当前最强公开成绩"的近似位置,仅作难度直观对照,不代表基准优劣。FrontierMath Tier 4(≈6%)与 FrontierSWE(0 个任务全完成)因量纲不同未并入此图,见正文。
五、四条贯穿性结论
1)污染是分水岭。凡从公共 GitHub 合并 PR 挖掘的榜单(Verified、Terminal-Bench),分数易被"记忆"而非"推理"推高。
Pro(GPL+私有)、DeepSWE(原创不合并)、FrontierMath(未发表)、FrontierSWE(伙伴独家)用不同机制把污染压到最低——
代价是分数断崖式下跌(Verified 70%+ → Pro ~23–44%)。
2)评分保真度(grading fidelity)被严重低估。DeepSWE 论文给出硬证据:其手写验证器与独立 LLM 裁判的分歧仅 1.4%,
而 SWE-bench Pro 继承的合并 PR 测试分歧高达 32.4%。继承测试会"误杀正确替代解"或"放过残缺桩代码"——
这意味着 Pro 上的分数噪声与误判风险显著高于 DeepSWE。
3)饱和正在分层。Verified(~88%)与 Terminal-Bench 2.1(~89%)已逼近天花板,适合做"回归/准入"测试而非区分前沿;
Pro / Terminal-Bench Hard / DeepSWE(44%–70%)仍能有效区分模型;FrontierMath T4 与 FrontierSWE 则是"下一个时代"的标尺。
4)脚手架(scaffold)与模型能力纠缠。同一模型在不同 Agent 循环下分数可差 20+ 分。Verified 上 OpenAI 已停用自有评测;
Pro/FrontierSWE 多用统一脚手架(SWE-Agent / 各家 CLI)。读任何榜都要问:"用什么脚手架、什么算力预算、几次尝试?"
六、怎么用这些榜(选型建议)
- 招聘/准入/日常能力雷达:SWE-bench Verified、Terminal-Bench 2.1——快速、可比、已成熟。
- 评估"真实企业长周期任务"落地风险:SWE-bench Pro(尤其 Commercial 子集)——更贴近私有/多语言代码库。
- 评估 DevOps/数据/安全终端自主能力:Terminal-Bench Hard——多小时运维压力测试的最佳公开代理。
- 评估研究级推理上限(数学):FrontierMath(关注 T3/T4,而非已饱和的 T1)。
- 评估"抗污染 + 长周期原创工程":DeepSWE(验证器保真度最高)与 FrontierSWE(20 小时超长周期,最接近真实硬仗)。
数据新鲜度提示:本报告中若干"龙头成绩"引用了 2026 年的模型与榜单版本(如 Claude Opus 4.7、GPT-5.6、FrontierSWE 实时榜)。
评测榜单迭代极快,引用具体数字时请以对应官方榜单(swebench.com / scaleapi.github.io/SWE-bench_Pro-os / tbench.ai / frontierswe.com / epoch.ai/frontiermath / deepswe.datacurve.ai)当日数值为准。