2026年8月全球 Coding Agent 排行榜:榜单已死,它裂成了三张

2026年8月,如果你还在问「谁是全球最强的 Coding Agent」,这个问题本身已经过时了。

过去一年,Claude Code 曾是唯一答案——它改变了软件工程,也开启了一场「Coding Agent 大战」。但今天,答案分裂了:不是「谁第一」的问题,而是「排行榜」这个概念已经失效,它裂成了三张互不相干的榜——模型智力榜、终端执行力榜、真实工程榜。而三张榜的冠军,是三个完全不同的产品。

一、第一张榜:模型智力榜——SWE-bench 的黄昏

先看最「传统」的一张榜。独立评测机构 vals.ai 在 8月6日更新了 SWE-bench Verified 榜单(统一使用 mini-swe-agent 最小化 harness,公平对比模型本身):

排名模型得分备注
1Claude Opus 597.0%闭源
2GPT-5.6 Sol96.2%闭源
3Claude Fable 595.0%6月12日已暂停
4Kimi K393.4%开源历史最高分
5GPT-5.6 Luna93.0%闭源
6Claude Opus 4.888.6%闭源
7Grok 4.586.6%闭源

但这张榜正面临信用危机。OpenAI 早在 2026年2月就宣布 SWE-bench Verified 已被污染,停止自报该基准。厂商自报数字与第三方复测之间的差距越来越大,SWE-bench 正在从「行业标尺」退化为「宣传素材」。

真正值得注意的,是第 4 名的 Kimi K3——月之暗面 7月16日在 WAIC 发布的 2.8T 参数模型,7月27日 MIT 权重上线 HuggingFace,是目前史上最大的开源权重模型。93.4% 意味着开源模型第一次摸到了闭源旗舰的天花板,差距从「代际」缩小到「个位数百分点」。

二、第二张榜:终端执行力榜——Codex 登顶

第二张榜测的是「能不能在真实终端里把活干完」。Terminal-Bench 2.1 公开榜(tbench.ai)的当前排名:

排名Agent默认模型得分
1Codex CLIGPT-5.583.4%
2Claude CodeOpus 4.878.9%
3Gemini CLI(Antigravity)Gemini 3.1 Pro70.7%

故事的转折点是:2025年的霸主 Claude Code,正在被 Codex 反超。DoltHub CEO Tim Sehn 花了三个月、用 agent 生成了 1500+ 个 PR(一个 C 语言嵌入式数据库项目),在 8月5日给出了他的实测排名:Codex 第一,Claude 第二,Grok Build 第三。

他的理由很直白:Claude 太慢、太贵、太「谨慎」——「Codex 单位时间完成的工作量是 Claude 的五倍」。Anthropic 的麻烦不止于此:旗舰 Fable 5 在 6月12日被暂停无法运行;Opus 5 被实测者吐槽「比 Opus 4.8 还笨」;$100/月的最高档套餐是唯一会烧完 token 的。Claude 只剩一张底牌——模糊任务的设计能力(代码评审、性能优化、架构建议),这也是它长期以来的「秘制酱料」。

三、第三张榜:真实工程榜——Harness 锁定时代

第三张榜最反直觉:它排的不是「谁最强」,而是「谁和谁绑定」

Augment Code 做过一个经典实验:同一个模型(Claude Opus 4.5),跑在不同 harness 上,SWE-bench Pro 得分从 51.8%(Auggie)到 49.8%(Claude Code)不等——同样的脑子,不同的手脚,能差出 2-6 个点

更关键的结构变化发生在过去一年:模型和 harness 彻底锁死了。DoltHub 的观察一针见血——「Anthropic 的模型就应该用 Claude Code,OpenAI 的模型就应该用 Codex。模型是为自家 harness 训练出来的」。2025年8月那种「任意模型混搭任意 harness」的黄金时代,结束了。

这意味着竞争的单位从「单品」变成了「生态」:模型 + harness + 云服务 + IDE 插件 + 定价,一整套。单独评测任何一环,意义都在快速衰减。

四、中国变量:第四张榜其实是中国的

如果只看开源赛道,2026年8月的排行榜几乎是一张中国榜。HuggingFace 2026 Q2 报告显示:中国开源模型的下载量已占全球 58%,首次超过美国(28%)

模型发布时间参数亮点价格(每百万 token)
Kimi K37月16日2.8TSWE-bench 93.4%,开源最高MIT 开源
DeepSeek V4 Flash 07317月31日284B / 激活13BTerminal-Bench 82.7%,反超 GLM 5.2$0.14 / $0.28
GLM 5.26月中旬约 744BCode Arena 全球第一$0.29(OpenRouter)
Qwen 3.8 Max7月19日2.4T / 激活95B首个开源 Max 旗舰,声称「仅次于 Fable 5」待定

其中 DeepSeek V4 Flash 0731 是当下性价比最没有悬念的冠军:Terminal-Bench 2.1 拿到 82.7%(高于 GLM 5.2 的 81.0%),DeepSWE 54.4 对 46.2 全面领先,而价格约为 Claude Opus 4.8 输出价的 1.1%

但注意区分「声称」与「验证」:Kimi K3 有完整第三方成绩(Artificial Analysis 智能指数开源模型历史最高排名、Arena 前端编码榜第一),而 Qwen 3.8 Max 发布至今仍无任何独立复测。这组对照本身就是 2026 年最值得养成的信息习惯——厂商公告是广告,第三方复测才是数据

五、框架:三轴选型,而不是一个冠军

把三张榜叠起来看,结论很清晰:不存在全能冠军,只有分轴冠军。这就是「三轴选型框架」:

智力轴(模型上限,处理最难、最模糊的任务)——冠军:Claude Opus 5 / GPT-5.6 Sol。
执行力轴(harness,把任务快速干完、time-to-PR 最短)——冠军:Codex CLI。
经济轴(每任务成本,机械任务与预算敏感场景)——冠军:DeepSeek V4 Flash 0731,以及免费的 Gemini CLI。

谁告诉你「有一个最强的」,谁就在卖你过时的认知。2026年的正确问法不是「哪个第一」,而是「我的工作在哪个轴」。

六、推演:这是产业成熟的标志

数据库、云、编译器都走过同一条路:从「单一霸主」到「分轴竞争」。Coding Agent 只是轮到而已。顺着这个框架推演,接下来有三个确定性的战场:

其一,第三方评测机构的话语权将大幅上升。vals.ai、Scale、tbench.ai 这类独立评测,正在取代厂商自报,成为采购决策的依据——「评测」本身正在变成一门生意。

其二,路由层会成为新基础设施。既然没有全能冠军,按任务类型自动分发到不同 agent 的「路由器」就会出现——就像当年的负载均衡器,它不生产算力,但决定算力去哪。

其三,对 Anthropic 而言,这是经典的领先者陷阱:冠军心态 + 定价傲慢。Fable 5 暂停、Opus 5 翻车,表面是模型问题,本质是组织问题——2025年的霸主正在用行动演示「被追赶的速度可以有多快」。

七、落到行动

  • 个人开发者:主力选一个(Codex 或 Claude Code),留一个便宜的做机械活(Grok 或 DeepSeek Flash),别同时开三个 $100 订阅——成本是排名的隐形维度。
  • 团队决策者:别信厂商自报数字。从自己仓库挑 20 个真实 issue,让 2-3 个 agent 各跑一遍,用 10 个小时换一整年的选型正确,这是性价比最高的投资。
  • 中国 / 预算敏感团队:从 DeepSeek V4 Flash 0731 或 GLM 5.2 起步;Kimi K3 等生态成熟后自托管;Qwen 3.8 Max 等第三方验证再上生产。
  • 观望者:Anthropic 的动荡期(Fable 5 暂停、Opus 5 翻车)是观察窗口——别急着迁移,但更别续一年约。

最后一句:2026年8月,Coding Agent 的世界没有王座,只有三把椅子。先搞清楚自己坐在哪把椅子上,再谈谁最强。

来源备注

  • vals.ai SWE-bench Verified(更新于 2026-08-06,mini-swe-agent 统一 harness)
  • Terminal-Bench 2.1 公开榜(tbench.ai)
  • DoltHub「What's the Best Coding Agent? 2026 Edition」(Tim Sehn,2026-08-05)
  • Augment Code「Auggie tops SWE-bench Pro」
  • Artificial Analysis Coding Agent Index
  • HuggingFace 2026 Q2 开源生态报告
滚动至顶部