2026年8月,如果你还在问「谁是全球最强的 Coding Agent」,这个问题本身已经过时了。
过去一年,Claude Code 曾是唯一答案——它改变了软件工程,也开启了一场「Coding Agent 大战」。但今天,答案分裂了:不是「谁第一」的问题,而是「排行榜」这个概念已经失效,它裂成了三张互不相干的榜——模型智力榜、终端执行力榜、真实工程榜。而三张榜的冠军,是三个完全不同的产品。
一、第一张榜:模型智力榜——SWE-bench 的黄昏
先看最「传统」的一张榜。独立评测机构 vals.ai 在 8月6日更新了 SWE-bench Verified 榜单(统一使用 mini-swe-agent 最小化 harness,公平对比模型本身):
| 排名 | 模型 | 得分 | 备注 |
|---|---|---|---|
| 1 | Claude Opus 5 | 97.0% | 闭源 |
| 2 | GPT-5.6 Sol | 96.2% | 闭源 |
| 3 | Claude Fable 5 | 95.0% | 6月12日已暂停 |
| 4 | Kimi K3 | 93.4% | 开源历史最高分 |
| 5 | GPT-5.6 Luna | 93.0% | 闭源 |
| 6 | Claude Opus 4.8 | 88.6% | 闭源 |
| 7 | Grok 4.5 | 86.6% | 闭源 |
但这张榜正面临信用危机。OpenAI 早在 2026年2月就宣布 SWE-bench Verified 已被污染,停止自报该基准。厂商自报数字与第三方复测之间的差距越来越大,SWE-bench 正在从「行业标尺」退化为「宣传素材」。
真正值得注意的,是第 4 名的 Kimi K3——月之暗面 7月16日在 WAIC 发布的 2.8T 参数模型,7月27日 MIT 权重上线 HuggingFace,是目前史上最大的开源权重模型。93.4% 意味着开源模型第一次摸到了闭源旗舰的天花板,差距从「代际」缩小到「个位数百分点」。
二、第二张榜:终端执行力榜——Codex 登顶
第二张榜测的是「能不能在真实终端里把活干完」。Terminal-Bench 2.1 公开榜(tbench.ai)的当前排名:
| 排名 | Agent | 默认模型 | 得分 |
|---|---|---|---|
| 1 | Codex CLI | GPT-5.5 | 83.4% |
| 2 | Claude Code | Opus 4.8 | 78.9% |
| 3 | Gemini CLI(Antigravity) | Gemini 3.1 Pro | 70.7% |
故事的转折点是:2025年的霸主 Claude Code,正在被 Codex 反超。DoltHub CEO Tim Sehn 花了三个月、用 agent 生成了 1500+ 个 PR(一个 C 语言嵌入式数据库项目),在 8月5日给出了他的实测排名:Codex 第一,Claude 第二,Grok Build 第三。
他的理由很直白:Claude 太慢、太贵、太「谨慎」——「Codex 单位时间完成的工作量是 Claude 的五倍」。Anthropic 的麻烦不止于此:旗舰 Fable 5 在 6月12日被暂停无法运行;Opus 5 被实测者吐槽「比 Opus 4.8 还笨」;$100/月的最高档套餐是唯一会烧完 token 的。Claude 只剩一张底牌——模糊任务的设计能力(代码评审、性能优化、架构建议),这也是它长期以来的「秘制酱料」。
三、第三张榜:真实工程榜——Harness 锁定时代
第三张榜最反直觉:它排的不是「谁最强」,而是「谁和谁绑定」。
Augment Code 做过一个经典实验:同一个模型(Claude Opus 4.5),跑在不同 harness 上,SWE-bench Pro 得分从 51.8%(Auggie)到 49.8%(Claude Code)不等——同样的脑子,不同的手脚,能差出 2-6 个点。
更关键的结构变化发生在过去一年:模型和 harness 彻底锁死了。DoltHub 的观察一针见血——「Anthropic 的模型就应该用 Claude Code,OpenAI 的模型就应该用 Codex。模型是为自家 harness 训练出来的」。2025年8月那种「任意模型混搭任意 harness」的黄金时代,结束了。
这意味着竞争的单位从「单品」变成了「生态」:模型 + harness + 云服务 + IDE 插件 + 定价,一整套。单独评测任何一环,意义都在快速衰减。
四、中国变量:第四张榜其实是中国的
如果只看开源赛道,2026年8月的排行榜几乎是一张中国榜。HuggingFace 2026 Q2 报告显示:中国开源模型的下载量已占全球 58%,首次超过美国(28%)。
| 模型 | 发布时间 | 参数 | 亮点 | 价格(每百万 token) |
|---|---|---|---|---|
| Kimi K3 | 7月16日 | 2.8T | SWE-bench 93.4%,开源最高 | MIT 开源 |
| DeepSeek V4 Flash 0731 | 7月31日 | 284B / 激活13B | Terminal-Bench 82.7%,反超 GLM 5.2 | $0.14 / $0.28 |
| GLM 5.2 | 6月中旬 | 约 744B | Code Arena 全球第一 | $0.29(OpenRouter) |
| Qwen 3.8 Max | 7月19日 | 2.4T / 激活95B | 首个开源 Max 旗舰,声称「仅次于 Fable 5」 | 待定 |
其中 DeepSeek V4 Flash 0731 是当下性价比最没有悬念的冠军:Terminal-Bench 2.1 拿到 82.7%(高于 GLM 5.2 的 81.0%),DeepSWE 54.4 对 46.2 全面领先,而价格约为 Claude Opus 4.8 输出价的 1.1%。
但注意区分「声称」与「验证」:Kimi K3 有完整第三方成绩(Artificial Analysis 智能指数开源模型历史最高排名、Arena 前端编码榜第一),而 Qwen 3.8 Max 发布至今仍无任何独立复测。这组对照本身就是 2026 年最值得养成的信息习惯——厂商公告是广告,第三方复测才是数据。
五、框架:三轴选型,而不是一个冠军
把三张榜叠起来看,结论很清晰:不存在全能冠军,只有分轴冠军。这就是「三轴选型框架」:
智力轴(模型上限,处理最难、最模糊的任务)——冠军:Claude Opus 5 / GPT-5.6 Sol。
执行力轴(harness,把任务快速干完、time-to-PR 最短)——冠军:Codex CLI。
经济轴(每任务成本,机械任务与预算敏感场景)——冠军:DeepSeek V4 Flash 0731,以及免费的 Gemini CLI。
谁告诉你「有一个最强的」,谁就在卖你过时的认知。2026年的正确问法不是「哪个第一」,而是「我的工作在哪个轴」。
六、推演:这是产业成熟的标志
数据库、云、编译器都走过同一条路:从「单一霸主」到「分轴竞争」。Coding Agent 只是轮到而已。顺着这个框架推演,接下来有三个确定性的战场:
其一,第三方评测机构的话语权将大幅上升。vals.ai、Scale、tbench.ai 这类独立评测,正在取代厂商自报,成为采购决策的依据——「评测」本身正在变成一门生意。
其二,路由层会成为新基础设施。既然没有全能冠军,按任务类型自动分发到不同 agent 的「路由器」就会出现——就像当年的负载均衡器,它不生产算力,但决定算力去哪。
其三,对 Anthropic 而言,这是经典的领先者陷阱:冠军心态 + 定价傲慢。Fable 5 暂停、Opus 5 翻车,表面是模型问题,本质是组织问题——2025年的霸主正在用行动演示「被追赶的速度可以有多快」。
七、落到行动
- 个人开发者:主力选一个(Codex 或 Claude Code),留一个便宜的做机械活(Grok 或 DeepSeek Flash),别同时开三个 $100 订阅——成本是排名的隐形维度。
- 团队决策者:别信厂商自报数字。从自己仓库挑 20 个真实 issue,让 2-3 个 agent 各跑一遍,用 10 个小时换一整年的选型正确,这是性价比最高的投资。
- 中国 / 预算敏感团队:从 DeepSeek V4 Flash 0731 或 GLM 5.2 起步;Kimi K3 等生态成熟后自托管;Qwen 3.8 Max 等第三方验证再上生产。
- 观望者:Anthropic 的动荡期(Fable 5 暂停、Opus 5 翻车)是观察窗口——别急着迁移,但更别续一年约。
最后一句:2026年8月,Coding Agent 的世界没有王座,只有三把椅子。先搞清楚自己坐在哪把椅子上,再谈谁最强。
来源备注
- vals.ai SWE-bench Verified(更新于 2026-08-06,mini-swe-agent 统一 harness)
- Terminal-Bench 2.1 公开榜(tbench.ai)
- DoltHub「What's the Best Coding Agent? 2026 Edition」(Tim Sehn,2026-08-05)
- Augment Code「Auggie tops SWE-bench Pro」
- Artificial Analysis Coding Agent Index
- HuggingFace 2026 Q2 开源生态报告
