当"最便宜的模型"读懂了"最贵的模型"的内心,护城河的叙事就变味了。MATS Research、ELLIS 图宾根等机构的 8 位研究者发布了一篇 116 页论文:用两次 API 调用,Claude、GPT、Gemini 从未公开的原始推理被大规模恢复——而完成解码的,正是各家定价最低、能力最弱的小模型。约 720 美元的解码成本,对着千亿级算力投入,这种极端不对称,让"推理护城河"第一次显得像一句营销话术。
护城河的第一道裂缝:藏在架构里,不在密钥里
讨论这次提取,人们容易聚焦"加密被攻破"。但真正值得拆解的是它的架构根源。推理模型执行任务时要搜索网页、运行代码、调用工具,每一步都需要承接此前的思考状态。把状态完整存在服务器上,成本高昂,又违背零数据保留承诺。于是厂商选择把原始推理加密成块,交给客户端暂存,下次调用再传回解密。
问题出在"块的复用边界"上。这些密文并未严格绑定会话、用户或模型——跨会话、跨用户、跨模型都可以流转。这套互通性是为产品体验设计的:模型降级、历史压缩、无缝接续。但它同样向防守最薄弱的低价模型敞开了门。旗舰藏起来的推理,被同门最便宜的小模型一句一句念了出来。也就是说:护城河不是被外部攻破的,它从设计那天起,就没把"内部最弱的守卫"当回事。
为什么说这是商业问题,不只是安全事件
把它只看成一次安全漏洞,会错过更大的信号。720 美元解码 1 万条推理轨迹,这个数字本身就在重估模型的定价权。当"隐藏思考"可以用几百美元批量恢复,闭源模型在"推理不可见"上建立的溢价,就失去了物理支撑。蒸馏的物证也同步落地:16-token 指纹测试显示某款模型复现 Opus 原话的容易程度高出同行最多百万倍,开头 1% 测试把相似度从 0.17 拉高到 0.33。蒸馏不再只是猜测,而成了可复现的实验事实——这直接关系到闭源厂商的合规与诉讼风险。
对三类玩家的不同含义
对模型厂商:短期止血是把推理块绑定会话、用户与模型,加防重放校验,或把状态搬回服务端并设短 TTL。但更长期的问题是——当"思考过程保密"这条护城河失效,你真正的壁垒是什么?答案大概率不在推理层,而在数据、工具链与生态闭环。
对开发者:Agent 轨迹就是敏感数据。这次研究从 6708 条公开轨迹中重建出 31.5 万个推理块,其中 328 条(约 4.9%)泄露了 62 个 API 密钥、33 个密码、24 个访问令牌。你的密钥可能正躺在某个可被解码的推理块里。轮换密钥、用短期凭证、清理日志,是最低成本的防线。
对选型团队:闭源与开源在隐藏推理上的差距,没有跑分表显示的那么大。选择应回到数据、工具链与 alignment 契合度上——而不是为"看不见的思考"付溢价。这次事件恰好提供了一个重新校准的参照系。
姊妹篇《116页论文实锤:Claude和GPT的隐藏思维链,被两步API调用提取》侧重攻击的技术细节与防护清单,本篇聚焦其商业与产业含义,两篇对照阅读效果更完整。
延伸阅读:DeepSeek V4 Pro API 指南、MiniMax 的 Model-Harness 协同、Qwen 3.8 开源分析;论文原文见 arXiv 2608.09867。