GPT-5.6 自优化飞轮转起来了:AI 开始给自己写内核代码,服务成本直降 20%

7 月 29 日,OpenAI 甩出一组数字:GPT-5.6 Sol 参与的生产系统优化,让对外服务成本降了 20%,Token 生成效率提升了 15% 以上。

省 20% 不是新闻。但「省这 20% 的方法」是。

因为优化这些指标的,不是 OpenAI 的工程师——GPT-5.6 Sol 自己分析生产流量、自己重写 GPU 内核代码、自己跑几百次实验验证方案,最后把改进部署回承载自己的生产系统。

这不是 Demo,不是实验室里的玩具。它动的是 OpenAI 每天承载十亿级用户请求的那套生产系统。

AI 从「被优化的对象」,变成了「做优化的主体」。

一、GPT-5.6 到底干了什么?

根据 OpenAI 官方技术报告,GPT-5.6 Sol 通过 Codex 接入了生产推理栈,在四个核心环节动手:

1. 负载均衡优化

分析全球生产流量,找出过去被忽略的负载不均,测试新的路由策略。让请求更合理地分配到不同机器和服务节点,避免某几张卡忙到冒烟、另外几张却闲着。

2. 重写生产 GPU 内核

深入模型的 forward pass(前向计算),寻找可以预计算、省略或并行执行的部分,然后用 TritonGluon(OpenAI 维护的开源 GPU 编程语言)自主重写生产环境的内核代码。Triton 之父 Philippe Tillet 也是这篇报告的署名作者之一——五年前教人类写 Kernel,五年后模型用 Triton 给自己改 Kernel。

3. 优化推测解码(Speculative Decoding)

为配套的 draft model 设计架构改进方案,自动运行数百次实验测试不同尺寸、结构和特征。在训练过程中持续监控,硬件故障或训练不稳定时主动介入。最终让 Token 生成效率提升超过 15%。

4. 系统级部署参数调优

针对短对话、长上下文、代码任务等不同负载,自动搜索 batching、sharding 和 KV Cache 管理的最优组合。这个配置空间太大,人类工程师此前只能靠粗略的启发式规则拍脑袋。

四件事连起来,GPT-5.6 参与的已不再是孤立代码任务,而是一条完整的工程反馈回路:

观察生产系统 → 定位瓶颈 → 提出方案 → 运行实验 → 处理故障 → 部署改进 → 拿生产指标验证 → 进入下一轮

二、比节省 20% 更重要的:一个闭环跑通了

每一次「决策→调用工具→读取结果→再决策」的循环,过去依赖稀缺的 GPU 工程师凭经验和直觉手工操作,一个配置一个配置试,动辄几个月。

现在,模型能把这个「测量、优化、验证」的循环压到极短。于是团队能探索更多想法,更快响应不断变化的负载。

更关键的是,这个闭环会自己滚起来。

模型越强 → 越能优化推理栈 → 推理栈越高效 → 同样硬件服务更多 Token → 成本更低 → 更强模型铺给更多人用 → 模型更强

OpenAI 的内部数据佐证了这个环转得有多快:

  • GPT-5.6 内测阶段,每位活跃研究员的日均 Token 输出是 GPT-5.5 时期峰值的两倍以上
  • 过去半年,内部代码推理的研究算力占比涨了 100 倍
  • 内部 Agent Token 用量涨了约 22 倍

省下的每一分算力,都变成了更多人能用上的智能。

三、这算「AI 自进化」吗?

OpenAI 这套心法在内部被称为 RSI(Recursive Self-Improvement,递归式自我改进)。坦白说,GPT-5.6 离真正的「AI 自己造 AI 自己」还有距离。

它优化的不是「智能」本身——没有证据表明它在在线改动自己的主体权重,也没有证据表明它能独立升级出下一代模型。如果权重是智能的「货物」,内核和配置就是运货的卡车和路线。它这次优化了运输,没碰货物。

人类依然站在圈里——优化目标由谁定、接进哪套生产系统、拿什么工具验证、怎么部署上线,这些环节还攥在 OpenAI 的工程体系手里。比如验证环节,OpenAI 专门搬出 FpSan(浮点消毒器)开源工具检查内核正确性。

但飞轮确实转起来了。OpenAI 内部衡量自我改进能力的 RSI Index 上,GPT-5.6 比 GPT-5.5 高出 16.2 分。而 Anthropic 的联创 Jack Clark 更激进地判断:2028 年底前出现完整递归自我改进,概率超过 60%。

四、竞争轴变了:从「谁 GPU 多」到「谁榨出更多 Token」

这 20%,意味着同样一批卡,OpenAI 现在能多接两成的活。它指向一个被很多人忽视的结构性变化。

过去几年,AI 公司比拼的是谁买得起更多 GPU。这套逻辑简单粗暴,也砸钱如流水。但在一个算力永远不够、需求涨得比产能快的世界里,效率正在变成和芯片数量同样重要的筹码。

GPT-5.6 一口气分成 Sol、Terra、Luna 三档,卖点就是同一个:同等智力,更少 Token。效率被摆到了和智能同等重要的位置。而帮 OpenAI 提升推理效率的,正是模型自己。

这和另一趋势合流:OpenAI 同期还优化了 Agent Harness(由 Rust 编写的 Agent 执行框架),通过延迟发现工具(不一股脑塞所有工具到上下文)、只追加不回写(让 Prompt 缓存一直有效)等方法,减少 Agent 循环里的重复工作。

一次循环省一点,当成千上万只 Agent 每天循环几十轮,省下的就不是一点。

五、对开发者:这意味着什么

这不是只属于 OpenAI 的故事。几个可以带走的判断:

  • 推理效率成为竞争主战场。 谁能从每块 GPU 中榨出更多 Token,谁就拥有更低的价格和更广的覆盖。模型能力差距在缩小,效率差距在拉大。
  • "模型做优化"不是 OpenAI 的专利。 推理栈优化中的思路——负载感知路由、自动内核调优、推测解码架构搜索——可以也应该通过智能体工具引入到自己的 AI 系统中。
  • Token 成本的边际革命刚开始。 当模型开始参与优化自己的运行环境,成本下降曲线可能比摩尔定律更陡。这反过来会催生更多 Token 密集型的应用形态。
  • Agent 循环本身的效率同样重要。 模型推理栈省下来的 20%,如果被 Agent 循环里的冗余上下文消耗掉,等于没省。优化 Agent 的工程链路和优化模型推理同等重要。

参考文献:

滚动至顶部