破题:Anthropic 在七月给 Agent 平台来了一次"系统更新"
过去 45 天,Anthropic 几乎没停过手。
Fable 5 和 Mythos 5 同时落地,Sonnet 5 降价抢市场,Claude Code 几乎日更。昨天 Cowork 刚迭代完,今天托管智能体平台(CMA)又一口气推出六项更新。
如果把这些更新放在一起看,会发现一个清晰的信号:Anthropic 赌的不是入口,不是算力,而是 Agent 本身的"能力密度"。
技能上限 20→500、思考力度五档可调、子 Agent 实时流可观测、种子会话一步创建……这些不是功能堆叠,而是一套"Agent 操作系统"的基础设施拼图。
拆解:六项更新,三层逻辑
表面上,这是六项独立的功能更新。但把它们按层次排列,逻辑就清晰了:
第一层:能力密度(Skills + Effort)
技能上限从 20 拉到 500。 CMA 的技能(Skills)是为 Agent 注入专业指令的知识包。之前上限只有 20 个——一个金融客服 Agent,光覆盖开户、KYC、反洗钱、投诉处理、合规免责、多语言切换就七八个了,再加上监管差异和 AB 测试版本,直接撞上天花板。
现在 500 个。这 500 个技能位由一个会话里的所有 Agent 共享,跑在统一的托管沙盒里,Agent 之间共享内存和环境变量——足以对应一个完整的业务单元。
甚至可以把整套代码库规范、CI 流水线配置、部署目标全塞进一个会话,让 Agent 从写代码到上线一条龙全知道。
思考力度五档调速。 以前 CMA 只能统一跑默认档位——问「今天几号」和「审计 500 页财报」用同一套深度。现在直接写进每个 Agent 的模型配置里:low / medium / high / xhigh / max。
一个多 Agent 客服系统:分流 coordinator 用 low,产品答疑用 medium,投诉升级用 high,法律合规用 max。同一个会话里,不同 Agent 按任务难度跑在不同档位上。成本和质量之间终于有了连续的旋钮。
第二层:可运维性(Observability + Cold Start)
种子会话一步创建。 以前要两步:先 POST 一个空壳,再逐条塞初始事件。高并发下冷启动拖得很慢。现在直接 POST /v1/sessions 带 initial_events,最多 50 条初始事件,会话"生下来就知道自己要干什么"。
子 Agent 黑盒已拆。 6 月底 CMA 刚上线会话级的 event_deltas,能实时预览主 Agent 的文本输出。但子 Agent 还是黑盒——跑偏了?卡死了?等超时才知道。这次直接下探到线程级:订阅子 Agent 的独立线程流,想到哪里、写到哪里,实时可见。
第三层:事件驱动(Webhook 补全)
7 种新 Webhook。 CMA 在 6 月底已上线 Agent 和部署生命周期的 Webhook。这次补上剩下的两大块:4 种环境事件 + 3 种记忆存储事件。
至此,CMA 的整个生命周期——环境搭建、Agent 部署、运行状态、记忆管理——全部可以事件驱动地与外部系统打通。 环境暂停时自动触发告警,记忆存储更新时同步到自家数据库,新环境创建时自动挂上监控。
从「API 产品」到「可运维平台」,这是最后一块拼图。
建框架:Agent 基础设施竞赛的三种路线
走到 2026 年 7 月,AI Agent 基础设施竞赛已经进入深水区,更新频率几乎按天计算。三家巨头的差异化路线已经非常清晰:
OpenAI 赌入口。 把聊天、编程、自主工作全塞进一个 ChatGPT 超级应用,用最大用户基数锁住开发者。
Google 赌基础设施。 GCP + TPU + 协议标准,底层建护城河。
Anthropic 赌 OS 级深度。 托管沙盒 + 全栈 Agent 控制 + 思考力度调速,在单 Agent 的能力密度上做文章。
从 20 到 500,Anthropic 盘算的是:什么时候能把 Agent 变成和操作系统一样基础的东西。
这个类比很准确。操作系统的本质不是某个应用有多强,而是它提供了进程管理、内存管理、文件系统、设备驱动这些通用基础设施,让上层应用可以任意组合。CMA 正在做同样的事——Skills 是「应用安装」,Effort 是「CPU 调度」,子 Agent 线程流是「任务管理器」,Webhook 是「中断处理」。
推演:Agent OS 化意味着什么
如果 Anthropic 真的把 CMA 做成了「Agent 操作系统」,会有几个关键推论:
1. 竞争从模型层转移到平台层。 模型本身正在快速商品化(Sonnet 5 降价就是信号)。真正的护城河不是参数大小,而是运行 Agent 的「操作系统」有多完善。
2. 企业采用门槛大幅降低。 500 个技能意味着一个 Agent 会话就能覆盖一个完整业务部门。企业不再需要自己搭建复杂的 Agent 编排系统,直接在一个会话里配置就行。
3. 「思考预算」成为新的管理维度。 五档思考力意味着企业可以精细控制每个 Agent 的推理成本。未来 CFO 和 CTO 之间的对话可能会多出一个议题:「我们部门的思考预算还剩多少?」
4. 可观测性是 Agent 落地的关键前提。 子 Agent 线程级可观测不是锦上添花——没有它,企业不敢把真正关键的流程交给 Agent。拆掉黑盒,信任才能建立。
落到行动
对于正在评估 Agent 平台的技术团队,有几个具体建议:
- 优先测试多 Agent 协作场景。 新版的 500 技能上限和五档思考力是真正的差异化能力——设计一个需要不同复杂度级别的多 Agent 流程(比如客服 + 合规 + 升级),看看效果。
- 关注可观测性。 如果 Agent 平台不提供子 Agent 级别的实时可见性,它就不适合生产环境。
- 计算「思考预算」。 不同档位的成本差异很大,提前建立成本模型,别等到账单来了再慌。
- 对比三家,不要只用一家。 OpenAI 的入口优势、Google 的基础设施、Anthropic 的深度控制——三者各有适用场景,押注单一生态是危险的。
Anthropic 这波更新不是终点。当 Agent 基础设施的竞争从「功能多少」转向「OS 级深度」时,真正的战争才刚刚开始。
参考:Anthropic CMA 官方文档、新智元报道
