GPT-5.6 Sol 视觉评测:目标检测暴涨 3 倍,OCR 反而退步

视觉圈刚被第三方评测机构 Roboflow 打了一针清醒剂。这家计算机视觉基准测试平台把 GPT-5.6 全家桶拖进自家 VLM 测试集跑了一圈,结果同时打破两个旧印象:OpenAI 终于能在目标检测上打正面战场,而且最便宜的档位,把上一代旗舰按在地上摩擦。

暴涨的分数:检测从 13.8 到 46.2

目标检测一直是 GPT 系列的重灾区。任务本身很简单:把图里的每个物体框出来。上一代 GPT-5.5 只拿到 13.8 分,在视觉模型圈基本等于交白卷。GPT-5.6 Sol 直接冲到 46.2,三倍还多;Terra 和 Luna 也紧随其后,分别拿下 44.7 和 43.3。

计数同样在涨:Sol 的准确率从 64.9% 升到 73%,Terra 和 Luna 分别是 67.6% 和 66.2%。

最亮眼的是文档版面识别。标题、正文、表格、插图、签名,Sol 都能干净地圈出来——这几乎是所有文档流水线的第一步:先找到「该看哪一块」,再去认字。合同、发票、报表处理的团队都会在意这个变化。

密集场景也扛住了。几十个同款物体挤在一起的图(药片、鸡蛋)是 VLM 的传统翻车现场,这次没有出现漏框、重框、坐标写飞。更刁的测试也过了:一张靶纸只数指定环数区域内的弹孔,Sol 既知道数什么,也知道规则管到哪儿为止。

最便宜的档位,打赢了上代旗舰

对预算敏感的人来说,这里的信息量最大:GPT-5.6 最便宜的 Luna 档,检测 43.3、计数 66.2%,两项都超过上一代旗舰 GPT-5.5。一年的进步,被压缩进了折扣档。

这就是能力通缩:当新一代的入门档跑赢上一代旗舰,价格性能曲线移动的速度,已经快过采购周期的跟进速度。

翻车点:OCR 定向提取反而退步

最反常识的是认字能力变差了。整段转写 Sol 拿到 90.7%,和 GPT-5.5 的 91.2% 基本持平;但「定向提取」——不要全文,只要那一条信息,比如从发票上把日期揪出来——从 87.6% 掉到 82.5%,跌了 5 个点。

失败是具体的,不是全面的。手写笔记它能整段转写,脏轮胎弧面上的尺寸编号它读得出来,冰球直播里的实时比分能按指定格式吐出来。翻车的是一板药上的有效期:字小、竖排、低对比度、还有反光。

一个能读懂比赛转播画面的模型,读不出药盒上的保质期。前沿能力是不均衡的——综合分数恰恰会掩盖这种不均衡。

对 AI 开发者意味着什么

对文档 AI 团队来说,检测一直是瓶颈也是门槛。如果检测真的强起来了,那些围绕「检测会失败」而设计的流水线,值得重新跑一遍基准——仅版面解析这一步,就可能释放下游 OCR 的准确率空间。

模型选型上,别再默认无脑升级最大型号。新一代最便宜的档位,在好几个维度上已经追平甚至超过上一代旗舰。按任务选模型,比按品牌选模型更重要。

评测方法上,单一综合分数会骗人。同一个模型,检测涨三倍、定向提取反而退步——评估集应该贴近真实任务的分布,而不是盯住头条指标。

怎么落地

动手前先跑自己的评估集:合同、发票、表单——就是你流水线真正会遇到的文档。Sol、Terra、Luna 按任务逐个比,别只看总分。

密集计数和版面识别这类任务,GPT-5.6 现在值得一试;定向字段提取,先拿自己的数据验证——退步是真的。

再往远看:检测一旦变成标配能力,竞争就会上移到 Agent 和工作流层。OpenAI 六千亿美元的算力押注(AI 早报-2026年8月18日)是这条曲线还能跑多快的注脚;与此同时,Transformer 标配设计遭集体质疑:COLM 三篇论文揭示隐藏代价提醒我们,模型的地基本身也远未定型。

想看这次发布的全景——三档阵容、编码 Agent、定价策略——见GPT-5.6 发布全景:视觉登顶,更强也更便宜

发表评论

滚动至顶部