工程类 LLM 评测榜单深度对比

SWE-bench Verified · SWE-bench Pro · Terminal-Bench 2.1 · Terminal-Bench Hard · FrontierMath · DeepSWE / FrontierSWE

聚焦"智能体(Agentic)"能力评测的演进:从仓库级代码修复,到超长周期工程、终端运维与前沿数学推理。

数据截至 2026-08 覆盖 7 个基准 / 2 个分支 含来源与新鲜度标注
一句话结论:这一组榜单共同描绘了一条清晰的"难度—抗污染"演进曲线。SWE-bench Verified 已接近饱和(龙头 ~88%), Terminal-Bench 2.1 同样逼近天花板;而 SWE-bench Pro、Terminal-Bench Hard、DeepSWE、FrontierSWE 与 FrontierMath 通过"长周期 + 抗污染 + 手写验证器"把前沿模型打回 6%–44% 区间——尤其是 FrontierSWE 与 FrontierMath Tier 4,目前几乎无人完成。

一、评测体系的演进脉络

这些榜单不是孤立的,而是一条应对"饱和 + 污染"问题的迭代链:

SWE-bench(Princeton, 2023; 2,294 题/12 个 Python 仓库) → SWE-bench Verified(OpenAI+Princeton, 2024; 人工校验 500 题,成行业标配) → SWE-bench Pro(Scale AI, 2025; 1,865 题/41 仓库,抗污染、长周期) → DeepSWE(Datacurve, 2026; 113 题/5 语言,原创题+手写验证器) → FrontierSWE(Proximal, 2026; 17 题/20 小时,超长周期、0–1 连续评分)。
Terminal-Bench(Laude Institute; 1.0→2.0→2.1,89 题真实 CLI 工作流) → Terminal-Bench Hard(更难切片,多小时运维压力测试)。
FrontierMath(Epoch AI, 2024; 350 题原创数学,IMO 金牌出题,反污染)。
关键转折点:OpenAI 于 2025-09 公开宣布不再在 SWE-bench Verified 上评测,理由是其测试存在"捷径奖励"且训练数据泄漏抬高分数。 业界注意力整体转移到 Pro / DeepSWE / FrontierSWE 等抗污染、长周期基准。

二、逐个基准深度拆解

SWE SWE-bench Verified

出身:Princeton(Jimenez 等)2023 原版 2,294 题;2024-08 OpenAI 合作筛选 500 题人工校验子集。
任务:给定真实 GitHub issue + 仓库快照,生成能通过测试套件的补丁。FAIL_TO_PASS + PASS_TO_PASS 双通过才算解决。
范围:12 个 Python 仓库(Django、sympy、sklearn、flask…);平均改 1.7 文件 / 3.0 函数 / 32.8 行。
评分:Resolve Rate(Pass@k);二元通过/失败。
当前 SOTA:Claude Opus 4.7 ≈ 87.6%(2026-04);官方 all-agents 榜 ~79–80%。接近饱和
局限:仅 Python、单仓库、题目相对良构;存在污染与捷径测试隐患。

SWE SWE-bench Pro

出身:Scale AI,2025-09(arXiv 2509.16941),Deng 等。
规模:1,865 题 / 41 个活跃仓库。分三块:Public 731(11 个强 copyleft/GPL 仓库)、Held-out 858、Commercial 276(18 个初创私有库)。
难度:长周期(人工需数小时~数天),平均改 107.4 行 / 4.1 文件;保留模糊需求,由专家改写为清晰需求书。
抗污染:GPL/私有代码天然不在训练语料;含 held-out 与 commercial 不可见集。
当前成绩:发布时 GPT-5=23.3%、Claude Opus 4.1=23.1%(Public,Pass@1,<25%);实时榜 Public 最高 ≈ 43.7%(claude-4-5-sonnet)。Commercial 集更低(GPT-5 仅 14.9%)。远未饱和

TERM Terminal-Bench 2.1

出身:Laude Institute + 斯坦福 + 开源社区;v2.1 是 v2.0 的"校验刷新版"。
规模:89 题精心策展,覆盖软件工程、系统管理、数据处理、模型训练、安全。
任务:真实 Linux 沙箱内用终端完成任务;每题带唯一环境、人工解法与验证脚本(检验最终文件系统状态)。
改进:v2.1 修复 Dockerfile 与指令-测试错配,使分数反映能力而非环境缺陷。
当前成绩:Artificial Analysis(Terminus 2 / e2b,pass@1×3):GPT-5.6 Sol(xhigh) 89.5%、Claude Opus 5 89.1%;Mercor 榜 Opus 5 High 83.9%。接近饱和

TERM Terminal-Bench Hard

出身:Terminal-Bench 的"更难切片",由 Artificial Analysis 评分;2025 发布。
任务:更长的工具调用链、更深错误恢复、更紧预算——被视为"多小时运维任务"最接近的公开代理。
评分:任务通过率;每题验证脚本检验终端最终状态。
规模:策展高难子集(129 个模型被测)。
当前成绩:最高 GPT-5.6 Sol 65.9%、Claude Fable 5 62.9%、GPT-5.5 60.6%;均值 28.2 / 中位 31.1。开/闭源差 +15.1 分。未饱和

MATH FrontierMath

出身:Epoch AI,2024-11(arXiv 2411.04872);OpenAI 委托 300 题。
规模:350 题(300 基础 + 50 Tier 4);60+ 数学家,含 14 位 IMO 金牌、1 位菲尔兹奖(陶哲轩、Gowers 参与)。
分层:T1 高年级本科 / T2 研究生 / T3 研究级 / T4 短研究项目(50 题)。自动验证、原创未发表→抗污染。
成绩:发布时 GPT-4o/Claude 3.5 <2%;现 T1–3 龙头 ≈ 40%(2026-03),GPT-5 ≈24.8%;Tier 4 仅 o4-mini 6.3%,多数≈0%。MIT 竞赛:8 队优本+专家,4.5h/23 题,队均 19%、合并 35%。T4 几乎未解

FRONT DeepSWE & FrontierSWE

⚠ 名称歧义:"DeepSWE" 有两义——①Together.ai+Agentica 的 RL 训练编码智能体(Qwen3-32B,SWE-bench Verified 42.2%/TTS 59%);②Datacurve 的 评测基准(下文)。
DeepSWE 基准(arXiv 2607.07946, 2026):113 题/91 仓库/5 语言(TS,Go,Py,JS,Rust),从零原创、永不合并上游(抗污染),手写功能验证器。验证器-裁判分歧仅 1.4%(vs SWE-bench Pro 32.4%)。提示词约为 Pro 一半,但参考解触达 5.5× 代码量。龙头 GPT-5.5 = 70.0% pass@1,跨度 69.8 分。未饱和
FrontierSWE(Proximal, 2026):17 题(实现 5/研究 3/性能 9),每题 20 小时;性能工程、计算科学、ML 研究方向。0–1 连续评分(非二元)。龙头 Claude Fable 5(Claude Code)均秩 ~2.2、主导率 90%;实现类任务 0/5 完全完成(最佳 17% 测试通过率)。极少数未饱和公开编码榜

三、横向对比矩阵

维度SWE-bench VerifiedSWE-bench ProTerminal-Bench 2.1 Terminal-Bench HardFrontierMathDeepSWE(基准)FrontierSWE
领域仓库级代码修复企业级长周期代码真实 CLI 工作流高难 CLI/运维前沿数学推理原创长周期代码超长周期工程
机构 / 年Princeton+OpenAI / 24Scale AI / 25Laude+Stanford / 25Terminal-Bench 社区 / 25Epoch AI / 24Datacurve / 26Proximal / 26
题量5001,86589策展子集35011317
语言/范围12×Python 仓库41 仓库(多语言)多域 CLI多域 CLI数学(无代码)5 语言/91 仓库性能/科学/ML
抗污染设计弱(公开 PR)强(GPL+私有+held-out)强(原创未发表)最强(原创不合并)强(伙伴独家题)
评分方式测试套件二元测试套件二元验证脚本(终态)验证脚本(终态)自动验证手写功能验证器0–1 连续评分
龙头成绩~87.6%~43.7%(Pub) / 23.3%(首发)~89.5%~65.9%T1–3 ~40% / T4 ~6%~70.0%均秩~2.2 / 0 全完成
饱和状态接近饱和远未饱和接近饱和未饱和T4 几乎未解未饱和几乎未饱和
单题耗时预算长(数小时~天)长(多小时)数小时~天20 小时

说明:各榜"龙头成绩"来自不同机构/脚手架,绝对值不可直接横比;本表仅用于勾勒当前前沿所处的相对位置。SWE-bench Pro 同时存在"首发论文 23.3%"与"实时 Public 榜 43.7%"两档,反映模型与脚手架的进步。

四、当前前沿模型得分(难度粗略代理)

越短越难:条形为该基准上"当前最强公开成绩"的近似位置,仅作难度直观对照,不代表基准优劣。FrontierMath Tier 4(≈6%)与 FrontierSWE(0 个任务全完成)因量纲不同未并入此图,见正文。

五、四条贯穿性结论

1)污染是分水岭。凡从公共 GitHub 合并 PR 挖掘的榜单(Verified、Terminal-Bench),分数易被"记忆"而非"推理"推高。 Pro(GPL+私有)、DeepSWE(原创不合并)、FrontierMath(未发表)、FrontierSWE(伙伴独家)用不同机制把污染压到最低—— 代价是分数断崖式下跌(Verified 70%+ → Pro ~23–44%)。
2)评分保真度(grading fidelity)被严重低估。DeepSWE 论文给出硬证据:其手写验证器与独立 LLM 裁判的分歧仅 1.4%, 而 SWE-bench Pro 继承的合并 PR 测试分歧高达 32.4%。继承测试会"误杀正确替代解"或"放过残缺桩代码"—— 这意味着 Pro 上的分数噪声与误判风险显著高于 DeepSWE。
3)饱和正在分层。Verified(~88%)与 Terminal-Bench 2.1(~89%)已逼近天花板,适合做"回归/准入"测试而非区分前沿; Pro / Terminal-Bench Hard / DeepSWE(44%–70%)仍能有效区分模型;FrontierMath T4 与 FrontierSWE 则是"下一个时代"的标尺。
4)脚手架(scaffold)与模型能力纠缠。同一模型在不同 Agent 循环下分数可差 20+ 分。Verified 上 OpenAI 已停用自有评测; Pro/FrontierSWE 多用统一脚手架(SWE-Agent / 各家 CLI)。读任何榜都要问:"用什么脚手架、什么算力预算、几次尝试?"

六、怎么用这些榜(选型建议)

数据新鲜度提示:本报告中若干"龙头成绩"引用了 2026 年的模型与榜单版本(如 Claude Opus 4.7、GPT-5.6、FrontierSWE 实时榜)。 评测榜单迭代极快,引用具体数字时请以对应官方榜单(swebench.com / scaleapi.github.io/SWE-bench_Pro-os / tbench.ai / frontierswe.com / epoch.ai/frontiermath / deepswe.datacurve.ai)当日数值为准。