核心结论:OpenAI 的 GPT-5.6 家族不是又一次小步迭代。旗舰 Sol 把目标检测精度提升了近 3 倍,登顶编码 Agent 榜单,而 Terra 和 Luna 用大约十六分之一的成本打出了接近一线模型的表现。真正值得关注的不是排行榜本身,而是「每个有效 token 的智能」正在大幅变便宜。
三档阵容:Sol、Terra、Luna
OpenAI 用三个档位替代「一个模型打天下」:Sol 是旗舰,面向最难的推理、编码和 Agent 任务;Terra 是日常工作的均衡款;Luna 是面向高吞吐量的成本优先款。一个模型家族从廉价批处理一路覆盖到前沿任务,定价也随之分层——上线后不久 OpenAI 就把 Luna 降价 80%、Terra 降价 20%。每一档都试图让每个 token 产出更多有效工作。
视觉跃迁:从短板变成可用能力
最惊人的数字在目标检测。Roboflow 的独立评测显示,Sol 从 GPT-5.5 的 13.8 mAP@50 跃升到 46.2——约 3 倍提升,把检测从明显的短板变成了实用能力。Terra(44.7)和 Luna(43.3)也咬得很紧,连最便宜的 Luna 在计数上(66.2% vs 64.9%)都超过了 GPT-5.5。文档版面检测是另一大亮点:Sol 能在 OCR 之前稳定识别标题、段落、表格、图片和签名,这正是大量文档工作流的地基。这也是业内开始称 Sol 为 OpenAI 迄今最强视觉模型的原因。
完整数字与「OCR 定向提取反而退步」的翻车点拆解,见我们此前的视觉专项评测。
更强的编码,更低的成本
在独立的 Artificial Analysis Coding Agent Index 上,开启 max 推理的 Sol 以 80 分刷新 SOTA,比 Claude Fable 5 高 2.8 分,同时输出 token 不到一半、耗时不到一半、成本便宜约三分之一。更有意思的是档位阶梯:Terra 略高于 Fable 5,Luna 超过 Opus 4.8——两者都只花约三分之一的时间、一半的 token、四分之一的成本。在覆盖 55 个领域长流程任务的 Agents' Last Exam 上,Sol 拿到 53.6 分,满推理下比 Fable 5 高 13.1 分,即便中等推理也高 11.4 分。所有榜单都在讲同一件事:用更少的 token、更少的钱,拿到相当甚至更好的结果。当「跑哪个基准」本身变成算力分配问题,Meta 那种给研究实验排优先级的路子就顺理成章了。
硬仗怎么打:ultra 与 Programmatic Tool Calling
两个新特性改变了开发者的用法。ultra 是 OpenAI 最高能力档位,协调多个 Agent 在并行工作流里推进,更快完成复杂任务——直接回应了当下主导前沿评测的长时间 Agent 负载。Programmatic Tool Calling 让模型在 Responses API 里自己写并运行轻量程序来调度工具、过滤海量中间数据、只保留关键信息,在工具密集型任务上大幅减少模型往返和 token 消耗。两者都是效率机制:每个 token 干更多活,少回几趟模型。
这不是一次发布,而是价格-性能曲线的拐点
从结构上看,故事的核心是价格-性能前沿。前沿本身当然在动(Sol 是实打实的 SOTA),但更大的变化是:同一档能力现在只要四分之一甚至十六分之一的成本。当前沿级结果跌到「白菜价」,AI 产品的经济学就变了——原本不划算的高吞吐、成本敏感应用变得可行,竞争壁垒也从「谁的模型最好」转向「谁能以最低成本部署最强的模型」。这次发布还配套了 OpenAI 迄今最全面的红队与自动化安全测试,正好呼应「AI 安全压力该不该前移到训练环节」的讨论。
给你的行动建议
- 重测成本敏感管线。如果当初按价格选模型,Terra 和 Luna 已经改写了算式——试试某个 GPT-5.6 档位能否用几分之一的花费跑赢你现在的模型。
- 重看视觉工作流。13.8 mAP 时不可用的检测,40+ 就够用了。文档版面、计数、目标检测管线值得重新评估,哪怕你以前直接否掉了多模态输入。
- 给 Agent 循环上 Programmatic Tool Calling。如果你的 Agent 把工具输出整个传回模型烧 token,编程式路径能砍掉大量往返和成本。
- 从算力侧盯着前沿。更便宜的前沿智能会抬高推理基建的价值——这和我们写的 Arm CPU 正在成为 AI 数据中心底座 一脉相承,也和 Meta 给研究实验排优先级 是一个硬币的两面。