7 月 29 日,OpenAI 甩出一组数字:GPT-5.6 Sol 参与的生产系统优化,让对外服务成本降了 20%,Token 生成效率提升了 15% 以上。
省 20% 不是新闻。但「省这 20% 的方法」是。
因为优化这些指标的,不是 OpenAI 的工程师——GPT-5.6 Sol 自己分析生产流量、自己重写 GPU 内核代码、自己跑几百次实验验证方案,最后把改进部署回承载自己的生产系统。
这不是 Demo,不是实验室里的玩具。它动的是 OpenAI 每天承载十亿级用户请求的那套生产系统。
AI 从「被优化的对象」,变成了「做优化的主体」。
一、GPT-5.6 到底干了什么?
根据 OpenAI 官方技术报告,GPT-5.6 Sol 通过 Codex 接入了生产推理栈,在四个核心环节动手:
1. 负载均衡优化
分析全球生产流量,找出过去被忽略的负载不均,测试新的路由策略。让请求更合理地分配到不同机器和服务节点,避免某几张卡忙到冒烟、另外几张却闲着。
2. 重写生产 GPU 内核
深入模型的 forward pass(前向计算),寻找可以预计算、省略或并行执行的部分,然后用 Triton 和 Gluon(OpenAI 维护的开源 GPU 编程语言)自主重写生产环境的内核代码。Triton 之父 Philippe Tillet 也是这篇报告的署名作者之一——五年前教人类写 Kernel,五年后模型用 Triton 给自己改 Kernel。
3. 优化推测解码(Speculative Decoding)
为配套的 draft model 设计架构改进方案,自动运行数百次实验测试不同尺寸、结构和特征。在训练过程中持续监控,硬件故障或训练不稳定时主动介入。最终让 Token 生成效率提升超过 15%。
4. 系统级部署参数调优
针对短对话、长上下文、代码任务等不同负载,自动搜索 batching、sharding 和 KV Cache 管理的最优组合。这个配置空间太大,人类工程师此前只能靠粗略的启发式规则拍脑袋。
四件事连起来,GPT-5.6 参与的已不再是孤立代码任务,而是一条完整的工程反馈回路:
观察生产系统 → 定位瓶颈 → 提出方案 → 运行实验 → 处理故障 → 部署改进 → 拿生产指标验证 → 进入下一轮
二、比节省 20% 更重要的:一个闭环跑通了
每一次「决策→调用工具→读取结果→再决策」的循环,过去依赖稀缺的 GPU 工程师凭经验和直觉手工操作,一个配置一个配置试,动辄几个月。
现在,模型能把这个「测量、优化、验证」的循环压到极短。于是团队能探索更多想法,更快响应不断变化的负载。
更关键的是,这个闭环会自己滚起来。
模型越强 → 越能优化推理栈 → 推理栈越高效 → 同样硬件服务更多 Token → 成本更低 → 更强模型铺给更多人用 → 模型更强
OpenAI 的内部数据佐证了这个环转得有多快:
- GPT-5.6 内测阶段,每位活跃研究员的日均 Token 输出是 GPT-5.5 时期峰值的两倍以上
- 过去半年,内部代码推理的研究算力占比涨了 100 倍
- 内部 Agent Token 用量涨了约 22 倍
省下的每一分算力,都变成了更多人能用上的智能。
三、这算「AI 自进化」吗?
OpenAI 这套心法在内部被称为 RSI(Recursive Self-Improvement,递归式自我改进)。坦白说,GPT-5.6 离真正的「AI 自己造 AI 自己」还有距离。
它优化的不是「智能」本身——没有证据表明它在在线改动自己的主体权重,也没有证据表明它能独立升级出下一代模型。如果权重是智能的「货物」,内核和配置就是运货的卡车和路线。它这次优化了运输,没碰货物。
人类依然站在圈里——优化目标由谁定、接进哪套生产系统、拿什么工具验证、怎么部署上线,这些环节还攥在 OpenAI 的工程体系手里。比如验证环节,OpenAI 专门搬出 FpSan(浮点消毒器)开源工具检查内核正确性。
但飞轮确实转起来了。OpenAI 内部衡量自我改进能力的 RSI Index 上,GPT-5.6 比 GPT-5.5 高出 16.2 分。而 Anthropic 的联创 Jack Clark 更激进地判断:2028 年底前出现完整递归自我改进,概率超过 60%。
四、竞争轴变了:从「谁 GPU 多」到「谁榨出更多 Token」
这 20%,意味着同样一批卡,OpenAI 现在能多接两成的活。它指向一个被很多人忽视的结构性变化。
过去几年,AI 公司比拼的是谁买得起更多 GPU。这套逻辑简单粗暴,也砸钱如流水。但在一个算力永远不够、需求涨得比产能快的世界里,效率正在变成和芯片数量同样重要的筹码。
GPT-5.6 一口气分成 Sol、Terra、Luna 三档,卖点就是同一个:同等智力,更少 Token。效率被摆到了和智能同等重要的位置。而帮 OpenAI 提升推理效率的,正是模型自己。
这和另一趋势合流:OpenAI 同期还优化了 Agent Harness(由 Rust 编写的 Agent 执行框架),通过延迟发现工具(不一股脑塞所有工具到上下文)、只追加不回写(让 Prompt 缓存一直有效)等方法,减少 Agent 循环里的重复工作。
一次循环省一点,当成千上万只 Agent 每天循环几十轮,省下的就不是一点。
五、对开发者:这意味着什么
这不是只属于 OpenAI 的故事。几个可以带走的判断:
- 推理效率成为竞争主战场。 谁能从每块 GPU 中榨出更多 Token,谁就拥有更低的价格和更广的覆盖。模型能力差距在缩小,效率差距在拉大。
- "模型做优化"不是 OpenAI 的专利。 推理栈优化中的思路——负载感知路由、自动内核调优、推测解码架构搜索——可以也应该通过智能体工具引入到自己的 AI 系统中。
- Token 成本的边际革命刚开始。 当模型开始参与优化自己的运行环境,成本下降曲线可能比摩尔定律更陡。这反过来会催生更多 Token 密集型的应用形态。
- Agent 循环本身的效率同样重要。 模型推理栈省下来的 20%,如果被 Agent 循环里的冗余上下文消耗掉,等于没省。优化 Agent 的工程链路和优化模型推理同等重要。
参考文献:
- OpenAI: How GPT-5.6 fuses frontier intelligence with frontier efficiency
- OpenAI: Introducing GPT-5.6
- Greg Brockman: X post on GPT-5.6 efficiency
