智谱发布长文,披露了一个很少被完整讲清的故事:GLM-5.3 驱动的 Infra Agent,在超过 10 万张国产芯片的集群上,从零搭建了 GLM-5.3-Flash 的整套生产级推理服务,不到两周将端到端吞吐提升至初始基线的 3 倍。唐杰的概括是「模型优化系统,系统服务模型」——智谱实现了递归自我改进(RSI)的最小闭环。
多数解读聚焦在「AI 开始造 AI」这个叙事上。但把智谱这篇长文读完,你会发现真正值得记住的不是模型多聪明,而是一个反直觉的结论,而且是智谱自己写出来的:真正缩短工程周期的,不只是更强的模型能力,更是一个能让模型持续获得反馈、验证判断并修正行动的工程闭环。
换句话说:RSI 竞赛的下一个分水岭,不在模型的智商,而在反馈的密度。
一、三个数字,与一个被忽略的前提
先看成绩单。GLM-5.3-Flash 上线一周即成为 OpenCode 与 OpenRouter 上调用量最大的模型(以匿名模型 Ox-Alpha 接受真实调用检验),6 天 token 调用量超过 62 万亿。技术栈包括节点内张量并行、ReplaySSM、W8A8 量化与 EPD 分离式架构,硬件利用效率与单 Token 成本达到主流 NVIDIA GPU 的相当水平。
这些数字的前提是:此前没人成功部署过如此大规模的国产芯片集群——内存和带宽受限、要支持 1M 上下文窗口和多模态请求、生态不成熟、算子不完备,「许多文档基本靠猜」。做成这件事的不是一支资深 infra 团队,而是 Agent。
但智谱在文中承认了一个关键事实:即使 Agent 能理解整个代码库,如果一次修改后的反馈只是「精度测试未通过」「TTFT 增加 30%」,它仍然无法判断问题出在哪一层、假设为何不成立、下一步该验证什么。端到端指标只能告诉 Agent「结果变差了」,无法解释「为什么变差」。
这就是问题的核心。人类的资深工程师之所以能优化复杂系统,靠的不是读代码,而是在压测结果之后知道该选哪一种观测手段、如何把不同工具的信息连起来。这种经验没有被组织成工作流之前,Agent 拿到的反馈是稀疏的——而稀疏反馈之下,再强的模型也只能瞎猜。
二、什么是稠密反馈
智谱把解法命名为「稠密反馈」:把正确性测试、运行日志、执行 Trace、运行时事件、微基准测试和端到端指标,纳入 Agent 的迭代流程,把系统优化拆分为可局部观测、可局部验证的环节。
注意,「稠密」不是指喂给 Agent 尽可能多的日志。智谱明确了三个特征:反馈要足够局部——关联到具体算子、线程、代码路径,帮 Agent 缩小问题范围;要低成本、及时——能用算子测试回答的问题,不必等完整服务部署和端到端压测;要支持客观验证——不能凭现象相关性确认根因,必须用控制变量的对照实验。
三个真实案例说明了这套机制的威力:
其一,正确性。Agent 在算子验证中发现 KDA 算子上下文并行路径的精度问题——tl.dot 即使接收 FP32 输入也默认用 TF32 计算,误差在长上下文下不断累积。修复方式是显式指定 input_precision="tf32x3",相关修复已合并进 Flash Linear Attention 上游(PR #1180)。
其二,并发瓶颈。Agent 发现 Prefill + KV Transfer 的性能差距超过 20%(验收标准是 5%),顺藤摸瓜查到 DeepEP v1.2.1 的 intranode_dispatch 未释放 Python GIL,阻塞了 Mooncake Transfer 线程。释放 GIL 后,差距缩小到 1% 以内。这是一个横跨 Python/C++ 边界、连人类工程师都要啃一阵的问题。
其三,性能优化。Agent 从 SGLang、Flash Linear Attention、DeepGEMM 等项目的存量手写 Kernel 中提炼「优化骨架」,用于承载自身推理的算子:除法优化缩短 9.6% 执行时间,合并重复计算的归一化分块后拿到 1.71× 提升。验证通过的经验回流骨架库,供下一轮使用。
看到共同点了吗?三个案例里,模型能力只是入场券。决定成败的,是反馈环境能不能把模糊的异常转化为可验证的假设。
三、反馈密度框架:自动化上限由环境决定
这里提出一个可复用的判断工具,姑且叫反馈密度框架:一个 AI 系统能被自动化到什么程度,上限不取决于模型智能,而取决于任务环境能提供的反馈密度——即反馈的局部性、时效性和可验证性。
这个框架能解释一系列正在发生的事。
Anthropic 9 月 17 日公布的内部数据显示:截至 2026 年 8 月,Claude 已「主导」(AL4)约 26% 的内部 AI 研发工作,而今年 2 月这个比例还不到 1%;处于「AI 协作」(AL3)及以上的工作超过 90%。为什么研发任务能被率先自动化?因为 AI 研发恰好是反馈密度最高的任务之一:代码可以跑测试,实验有指标,假设可以被快速证伪。
反过来,Google DeepMind 的研究人员今年 7 月指出,Agent 生成假设的成本快速下降后,科研正面对新的「验证瓶颈」:想法越来越便宜,确认一个想法是否成立依然昂贵且缓慢——尤其在生命科学这类现实实验无法加速的领域。验证瓶颈,本质上就是反馈密度不足。
Google 9 月 14 日发布的 Dream-RSI 论文同样印证了这一点:它让系统在历史实验构造的 Replay Simulator 里低成本测试不同探索策略,Coding Agent 和 Evaluator 本身保持固定。真正改进的,是「验证历史」的复用效率。
四家头部玩家——智谱做 Infra Agent、Anthropic 量化和扩展 Agent 化实验室(3 万个 Agent 同时运行)、OpenAI 规模化「AI 研究员」、Google 优化探索与验证机制——路线各异,但都撞在同一堵墙上:谁先把高价值任务的反馈环境建成可自动化执行的工作流,谁的自动化指数就涨得快。
四、这对各行业意味着什么
把反馈密度框架推演到 AI 研发之外,判断力立刻变得锋利。
哪些行业会被 Agent 先改造?不是「数字化程度高」的行业,而是「反馈密度高」的行业:软件开发(测试即反馈)、量化交易(回测即反馈)、投放优化(A/B 实验即反馈)。而医疗、法律、教育这些反馈稀疏、验证周期以月计的领域,自动化会慢得多——不管模型多强。基础科研的瓶颈不在假设生成,而在实验验证,这正是 DeepMind 判断的延伸。
对企业用户也一样:评估「AI 能不能替我干活」时,别先问模型跑分,先盘自己的反馈环境。你的业务有没有可归因的局部指标?有没有低成本、快速的验证回路?有没有客观的成败判据?三样都缺,Agent 只能给你一个看起来很聪明的瞎猜。
五、如果你是决策者
给几类读者的可执行建议:
- 技术管理者:在给团队配 Coding Agent 之前,先补三件事——分层测试体系、可归因的观测工具链、明确的验收标准。智谱的经验表明,这三样是 Agent 生产力的乘数,缺一项,Agent 产出至少打对折。
- AI 从业者:把「设计反馈环境」当作一个新的一等工程学科来对待。它比 prompt 工程更接近 infra:智谱那套「并行策略到算子映射」的验证设计,本质是给 Agent 造仪器。
- 投资人:判断一家「AI 自动化」公司,看它对反馈密度的处理深度,而不是演示视频里 Agent 的流畅程度。强调 Evaluator、验证闭环、防 reward hacking 的团队,比只讲 Agent 灵感的团队靠谱。
- 普通用户:短期内不必担心「AI 完全取代研发」。智谱自己写明:选择目标、设定边界、判断风险,仍然是人的工作,而且「这条线应当由人来守」——但两周、三倍、十万卡这些数字也说明,这条线不会因为你希望它慢一点就慢下来。
RSI 还没有到来,但通往它的中间环节正在变成真实的工程。而工程比叙事诚实:它逼着每一家公司回答同一个问题——你的反馈环境,配得上你的模型吗?
