DeepSeek 下场造 Harness:只卖模型的时代结束了

本周,DeepSeek 的「Harness 团队」公众号正式完成注册,主体为北京深度求索人工智能基础技术研究有限公司。消息本身很轻,信号却很重:这家靠模型封神的实验室,正式下场做「模型之外的那层工程系统」,而且对标目标直接写在了脸上——Claude Code。

过去几年行业默认「模型最强就赢」,这个假设正在失效。头部模型的能力快速趋同,真正的护城河转移到了模型外围的工程层。DeepSeek 内部有一句公式说得很直白:Model + Harness = Agent。

Harness 到底是什么

Harness 就是让模型真正「能干活」的一切能力:工具调用、任务规划、文件与终端操作、记忆管理、执行调度、异常恢复。模型只会推理,但不会读代码仓库、批量改源码、跑单元测试、构建失败后自动重试——这些活全在 Harness 里。

这也是多数人对市场最大的误判。开源圈子里绝大多数「Agent 框架」本质是轻量级 Prompt 编排:拼几个工具调用、串一串指令,就自称 Agent,缺乏工业化落地所需的完整运行能力。DeepSeek Harness 的定位是生产级智能体运行系统——能自主解析代码仓库、批量改文件、跑测试、定位缺陷、端到端闭环交付,直接对标 Claude Code,是国内稀缺的工业化代码智能体底层系统。

团队配置同样说明问题。负责人崔添翼毕业于浙大计算机系,在 Jane Street 做了九年高频量化系统——那是一个靠极端负载下的稳定执行、异常兜底、全程可追溯吃饭的领域。用系统工程专家而非模型研究员来带队,本身就是判断:智能体的瓶颈早已不是模型智力,而是系统工程能力。

缓存才是真正的战略

最有信息量的证据不在官方公告里,而在已经跑起来的开源生态。GitHub 约 8.6 万 Star 的编程 Agent「Pi」成了 DeepSeek 事实上的最佳第三方 Harness,原因纯粹是经济学。

机制不复杂:编程 Agent 每执行一步,都要把系统提示词、工具定义、历史对话、代码重新发给模型。任务越做越长,请求越滚越大,其中绝大部分内容是模型早就计算过的。自动前缀缓存会复用此前的结果,模型只需处理新增的尾巴——缓存命中率,就是成本的第一杠杆。

Pi 的设计恰好把命中率推到极致:默认只有四个工具(读、写、改、执行),会话内容持续向后追加而不是回头改写,前面算过的内容稳定可复用。有开发者实测,Pi 接 DeepSeek 的缓存命中率达 99.93%,不命中率只有 0.07%。Composio 用 DeepSeek V4 Flash 横向测了 8 款 Harness,Pi 完成一次成功任务平均只要 0.028 美元;为自家模型深度优化的 Claude Code 平均要约 0.195 美元——同一个模型,成本差了近 7 倍。

这不是说 Claude Code 不行,而是说**「模型 × Harness」的匹配度,现在能让成本差出一个数量级**。对把 Token 卖到地板价的 DeepSeek 来说,缓存命中率决定低价策略到底是可持续的经济模型,还是烧钱补贴——这正是它要亲自下场造 Harness 的原因:把决定成本的那个变量,握在自己手里。

三个值得关注的趋势

1. 竞争换层了。 模型基准测试的重要性每个季度都在下降,战场转移到「把模型变成交付物」的工程栈——谁掌握 Harness,谁就掌握工作流。

2. 商业模式在变形状。 DeepSeek 正在从「卖算力」(按 Token 收费,不管活有没有干成)转向「交结果」(为修好的 bug、交付的功能付费)。这对仍靠 API 费过日子的国内 AI 实验室是一次结构性示范。

3. Harness 大战开打。 Codex 和 Claude Code 定义了品类,Pi 证明了开源路径,DeepSeek 带着它端到端可控的成本曲线入场,而且已经在向开源 Agent 开发者公开征集内测,用真实边界问题打磨系统稳定性。

你现在可以做什么

  • 用 DeepSeek 做 Agent 的,现在就去试 Pi。 官方 Harness 还没上线,而 Pi 的缓存行为比任何模型参数表都更能预告你的账单。
  • 选 Harness 时先问缓存,别只看工具列表。 默认工具数量和上下文处理方式,决定你的请求能不能持续命中缓存——这才是成本数字的来源。
  • 盯住官方发布。 DeepSeek 自家 Harness 是围绕 V4 推理输出从零造的(包括通用框架经常处理错的 reasoning_content),目标直指 Claude Code 的工作流。

只卖模型的时代有过它的好日子。AI 竞争的下半场,比的不是谁的大脑最聪明,而是谁的神经系统最好用。

相关资讯