训练一个 Agent 到底有多贵?
如果你自己搭过,应该知道答案:不是模型贵,是基础设施贵。
每个 Agent 都需要一个沙箱环境——隔离的容器、文件系统、网络访问、执行权限。做 SWE 要模拟真实代码仓库,做浏览器 Agent 要渲染真实页面,做个人助理要挂载邮箱和日历。每换一个任务方向,就要重新搭一套。每换一个模型,也要重新搭一套。每进入训练新阶段(数据蒸馏、RL rollout、评估),还得再搭一套。
这不是「写代码」的问题,这是「造基础设施」的问题。大部分研究者把精力和算力花在了重复造轮子上,而不是研究 Agent 本身。
这恰恰是 Microsoft 在 8 月 3 日开源 Orchard 时瞄准的核心瓶颈。
Orchard 做了什么
Orchard 是一个 MIT 协议的开源框架,核心是一个叫 Orchard Env 的 Kubernetes 原生环境服务。
它的设计哲学一句话概括:把「环境」从 Agent 训练框架中抽出来,做成一个独立的、可复用的服务层。
这个思路乍看简单,但现有框架几乎都做不到。LangGraph、CrewAI、AutoGen 这些框架的「环境」是嵌入在代码逻辑里的——你要用它的 sandbox,就得用它的训练管线。E2B、Daytona、Modal 这些基础设施服务能提供隔离环境,但它们是绑死在特定云平台上的,迁移成本高,也不开源。
Orchard Env 用 Kubernetes 作为底层,提供了一套标准化的 REST API 来管理沙箱生命周期:创建、执行命令、读写文件、网络控制、销毁。因为它是独立服务,同一个 Env 实例可以同时服务于数据收集、RL rollout、评估三个阶段,不需要为每个阶段重建。
更关键的是,Orchard 支持直接在真实部署框架(harness)中训练 Agent——包括 Codex、OpenClaw、ZeroClaw、ReACT。以前训练和部署之间总有一层「模拟 mismatch」:你在简化环境里训好模型,放到真实 harness 里就不太灵了。Orchard 通过一个轻量级代理记录 harness 自己的模型调用作为训练数据,每次 rollout 跑在自己的容器里,让 Agent 从训练第一天就在最终部署的 harness 里运行。
三个 Recipe 证明一件事:小模型 + 好环境 = 强 Agent
Orchard 不只是框架,还附带了三个经过验证的 Agent 训练配方。
Orchard-SWE:软件工程 Agent
用两个先进开源模型(MiniMax-M2.5 和 Qwen3.5-397B)蒸馏出 10.7 万条 Agent 交互轨迹。训练时采用 credit-assignment SFT——Agent 没完全解决问题不要紧,从它做对的片段里也能学到东西。RL 阶段引入 Balanced Adaptive Rollout 应对稀疏奖励,再加上 dense reward(on-policy 蒸馏 + 过程奖励模型)来提供更细粒度的指导。
结果:仅约 30 亿活跃参数,在 SWE-bench Verified 上达到 69.7%,加上 value model reranking 后到 73.0%——逼近参数大 10 倍以上的前沿系统。
Orchard-GUI:浏览器 Agent
40 亿参数的视觉语言模型,只用了 400 条蒸馏演示 + 2200 个开放训练任务。在 WebVoyager(74.1%)、Online-Mind2Web(67.0%)、DeepShop(64.0%)上平均 68.4%,是目前最强的开源 GUI Agent,与 OpenAI 和 Google 的闭源系统持平。
数据效率惊人——用那么少的数据就能达到这个水平,说明环境设计对了,数据质量比数据量重要得多。
Orchard-Claw:个人助理 Agent
仅靠 200 条合成任务训练,在 Claw-Eval 上单次尝试完成率 59.6%,配合 ZeroClaw 提升到 73.9%。在 Codex harness 下,训练后成功率从 18.6% 跃升至 51.5%。
这组数据最直接地证明了「在真实 harness 里训练」的价值——脱离部署环境的训练,效果会断崖式下降。
成本对比:开源不仅是理念,更是预算
RuntimeWire 的报道给出了一个直接的成本对比:在 128 个沙箱、每个 2 vCPU + 8 GiB 内存、运行 240 小时的负载模型下:
- Orchard Env:$3,362(按需实例)/ $673(spot 实例)
- E2B / Daytona:$7,078
- Modal:$10,305
成本优势来自两层:一是 Kubernetes 原生的弹性调度天然比专有平台便宜;二是跨阶段复用减少了资源浪费——同一个沙箱集群可以同时跑数据蒸馏、RL 训练、评估,而不是为每个阶段单独开集群。
深层结构:为什么 Orchard 不只「又一个框架」
回答 Tim 三问法的第二问——这篇论文的深层结构变化是什么?
第一层:解耦环境层。 过去 Agent 开发是「环境-训练-部署」三位一体的,换一个就得重来。Orchard 把环境抽成独立服务,这是 Agent 基础设施的「关注点分离」——类似操作系统把文件系统从应用程序中分离出来之后,所有应用都能共享同一套文件系统。
第二层:训练-部署 gap 的消失。 在真实 harness 中训练 Agent 可能听起来 trivial,但几乎没人做得到。Orchard 做到了,这意味着 Agent 的「模拟-部署」落差不再是一个需要手动弥合的问题。
第三层:累积式 Agent 学习。 论文里提到一个方向——把训练轨迹视作持久资产,而不是用完即弃。通过蒸馏成可复用的 value model,让新一代 Agent 继承上一代的知识。如果这个方向走通,Agent 训练将从「每代从零开始」变成「代际传承」。
落到行动:这对我们意味着什么
对于正在做 Agent 开发或研究的团队,Orchard 有几个直接可用的价值点:
- 如果你们在搭 Agent 基础设施,Orchard Env 可以直接替代自建的沙箱管理系统,Kubernetes 原生意味着不需要额外学习一套新的编排体系。
- 如果在做 SWE Agent,Orchard-SWE 的 credit-assignment SFT 和 dense reward 设计是可直接复用的训练策略,代码和数据全部开源。
- 如果在做开源 Agent 对比,Orchard-GUI 和 Orchard-Claw 提供了新的强基线——尤其是 Orchard-GUI 用 400 条演示就达到 68.4% 平均分的效率,值得认真分析。
- 长期来看,如果 Orchard 的「训练轨迹作为持久资产」路径被社区验证,Agent 领域的竞争将从「谁的模型更大」转向「谁的环境和训练管线设计更优」——这恰恰是开源社区的优势所在。
Orchard 的代码仓库在 GitHub(microsoft/Orchard),模型和数据在 Hugging Face(microsoft/Orchard)。对于想深入研究的读者,论文预印本在 arXiv 上(2605.15040)。
最后多说一句:Orchard 在论文中明确提到了 OpenClaw 和 ZeroClaw 作为受支持的部署 harness。这不仅仅是「兼容性列表」上的一个名字,而是说明这套框架在设计时就考虑了如何与现有 Agent 生态系统对接。对于 Claw 生态的使用者来说,这意味着一个开源、可复现、成本可控的训练基础设施已经就位。
