OpenAI 不再把 Codex 当编程 Agent 卖,而是把它当平台卖。8 月 20 日官方博客《Codex as a platform: build on the open agent harness》发布时,距离 DeepSeek 开源 DSH(DeepSeek Harness)仅六天——后者 GitHub Star 已超 17.3 万。AI 的竞争前线正在从模型层下沉到执行层:谁掌握 Harness,谁就掌握模型跑真实任务的方式,以及最重要的——训练下一代模型的数据闭环。
OpenAI 开放了什么
核心动作是统一。Codex App、CLI 和 IDE 扩展共用同一套底层 Harness,统一管理会话状态、上下文、工具调用、沙箱与人工审批。开发者可以通过 codex exec、SDK 或 app-server 把这套运行时嵌入企业控制台、客服系统、安全工具和内部应用。OpenAI 的潜台词是:别再把 Codex 当产品,把它当执行底座。
数字解释了为什么 Harness 比想象的更重要。ARC-AGI-3 上,GPT-5.6 Sol 单独运行得分 13.3%;套上 Codex Harness 的持续推理与上下文压缩后,同一模型得分 38.3%,输出 Token 降为原来的约六分之一。运行时不是薄薄一层封装,而是模型能力的放大器。
落地案例同样直白:Cisco 在 Cloud Control 的 App Builder 里用 Codex SDK;GitHub 和 JetBrains 把它接进现有 IDE 流程;Thrive Holdings 与 Crete 用 Codex 做税务准备,试点处理约 7000 份申报表,准备时间缩短约三分之一。共同点是:企业数据、工具、审批与任务记录都流经 OpenAI 提供的同一套运行时。
黑鲸 DSH:把运行时做成插件盒
DSH 的设计哲学截然不同。Codex 是调校好的发动机,你围绕它适配非核心组件;DSH 则是可拆装的零件盒——模型适配器、工具、Skill、会话、沙箱、存储、Agent Loop、调度甚至 UI 全部插件化,由 Cordis 统一管理挂载、卸载与依赖关系。开发者圈子的比喻很直接:Codex 让你接上其他零件,DSH 允许你自己组装发动机。
一个 Preview 阶段的框架能引发如此热度并不常见:截至 8 月 20 日,DSH 约 17.37 万 Star、1.88 万 Fork,Hacker News 讨论 744 分;国内社区约 300 名测试者在两周内做出 200 多个插件,发布两天后精选列表已有 270 个,Web UI、移动端控制、模型适配、额度监控、插件市场纷纷出现。隐忧同样真实:约 45.3 万行代码、219 个包,首个公开版本只有一笔压缩提交,Benchmark 材料不足,Reddit 上还有速度慢、Token 消耗高的反馈。
模型厂为什么必须做 Harness
有开发者直言:除了交互流程优化,其他方向别碰 Harness。理由是它很难形成长期稳定壁垒——模型迭代快,不同模型需要的执行策略不同:有的适合先规划再调工具,有的需要边执行边修正;同一组工具在不同模型上的稳定性也可能天差地别。按这个逻辑,DSH 短期内追不上 Codex,因为 Codex 站在 OpenAI 模型能力之上,脱离模型的 Harness 没有意义。
那为什么还要做?答案是闭环。过去 DeepSeek 只提供 API 时,任务跑在 Claude Code、Codex 等外部 Harness 里,DeepSeek 看得到请求,却看不到请求之前发生了什么、输出之后任务是否真正完成。有了 DSH,模型团队能同时观察模型与执行过程:任务在哪一步失败、工具调用卡在哪里、一次任务重试几次、哪种上下文策略最省 Token——这些是训练下一版模型和下一版 Harness 的养料。
商业层面同样微妙。DeepSeek 目前没有官方 Token Plan,OpenCode Go、Cola 等第三方把 API 包装成月费套餐,掌握用户入口。有了 DSH,DeepSeek 可以精确计算每个 Session 的轮数、缓存命中率、无效重试消耗,甚至判断哪些步骤该用 Flash、哪些该调 Pro。若未来推出托管版 DSH 或订阅套餐,计费单位可能从 API Token 转向额度、任务数、并发与 Pro 用量——目前尚无证据,但仪器已经就位。
开放光谱:Kimi Code、ZCode 与后来者
中国模型厂早就开始自建执行层。月之暗面 2025 年 9 月的 Kimi CLI 已含 Agent Loop,如今演化为 MIT 许可证的 Kimi Code——管理上下文、调用工具、读写文件、执行命令,功能上是一套完整 Harness,且开源可改。智谱 7 月发布的 ZCode 是围绕 GLM 的 Agentic Development Environment,自研 Agent 管理任务、上下文、终端、文件、权限与代码审查,但核心运行时未开源,开发者只能加插件、Skill 和 MCP 扩展,无法改写底层 Agent Loop。
三者构成清晰的开放光谱:ZCode 是 GLM 的官方执行环境,Kimi Code 是开源的编程 Agent 及其运行时,DSH 则把可拆解、可重组的运行时本身做成产品。连 MIT 许可的 Pi Harness(维护者正是 Flask 作者 Armin Ronacher)也重新进入视野——Ronacher 说 DSH 是让他重新审视 Pi 部分设计的第一个新项目。这场竞赛争的不是 Star 数,而是哪个运行时能成为真实工作的默认执行层——因为工作本身会产生反馈,而反馈会训练出下一代模型。
该关注什么
对团队而言,选 Harness 现在是基础设施决策,不是工具决策。DSH 仍是早期预览,兼容性破坏随时可能发生——可以 Fork 学习,别急着押上生产;动手前先要 Benchmark 材料。对开发者而言,运行时之战把模型选择与执行策略解耦了:按工具调用稳定性和 Token 经济性选 Harness,而不是按谁嗓门大。两个信号值得盯:DeepSeek 是否推出托管版 DSH 或订阅计费(计费从 Token 转向额度/任务/并发),以及 Codex 是否像进入 Cisco、GitHub 工作流那样,成为企业默认 Agent 底座。谁拥有运行时,谁就拥有闭环——而闭环正是下一代模型的来源。
想动手装 DSH 插件,可参考 DeepSeek Harness 插件实战;想看谷歌如何从训练侧攻同一层,见 EnvHarness:训练环境随 Agent 进化。
FAQ
Q: Codex Harness 和 DeepSeek Harness 有什么区别?
A: Codex 是调校好的发动机,你围绕它适配;DSH 是插件盒,模型适配器、工具、会话、沙箱、存储、Agent Loop、调度和 UI 都可以替换重组,由 Cordis 管理依赖。
Q: DeepSeek 为什么要把 Harness 开源?
A: 开源换来数据闭环:任务失败点、工具调用卡点、重试次数、Token 成本都会回流给模型团队。DeepSeek 不再只看到 API 请求,而是能看到请求前后发生了什么——这是纯 API 业务永远拿不到的反馈。
Q: Harness 真的能提升模型表现吗?
A: ARC-AGI-3 上 GPT-5.6 Sol 单独得分 13.3%,套上 Codex Harness 的持续推理与上下文压缩后得分 38.3%,输出 Token 约为原来的六分之一。