神秘匿名模型 Ox Alpha 代码跑赢 GPT-5.6,被扒出智谱血缘

大模型圈又上演了一场「猜猜我是谁」:一款名叫 Ox Alpha 的匿名模型突然出现在 OpenRouter 上——100 万 token 上下文、支持文本/图片/视频输入、可调用工具、完全免费,却没有署名厂商。开发者把它接进编码 Agent 后,它在真实代码仓库的 DeepSWE 任务上完成了 8/10(80%),跑赢了 GPT-5.6 Sol Max(52%)、Fable 5 Max(65%)、GLM-5.3 Max 与 Grok 4.6 xhigh(均为 62%)。随后社区的「验 DNA」式分析直指智谱未发布的 GLM-5.x。它到底是谁固然重要,但更值得关注的是那个结构变化——匿名预发布测试,正在成为前沿模型厂商的新标配。

在代码基准上的成绩

开发者 Ben Davis 从 DeepSWE 抽取了 10 项真实软件工程任务——读仓库、定位 bug、改代码、跑测试、按报错继续修。Ox Alpha 完成 8 项(80%),同一组对比中 Fable 5 Max 为 65%,GLM-5.3 Max 与 Grok 4.6 xhigh 均为 62%,GPT-5.6 Sol Max 为 52%。另一位开发者在另一组 DeepSWE 子集上测得约 63%。

先说限制:10 项任务的样本很小,两次测试的任务集与运行配置并不一致,不能据此排定名次。但它至少说明,这款匿名模型具备很强的长程编码潜力——那种单轮编程题无法衡量的、持续多步的 Agent 式工作。

「验 DNA」:为什么都指向智谱 GLM-5.x

社区随即展开身份排查,证据相当具体。最有力的一条来自视频编码器:四段不同帧率、时长、分辨率的视频中,Ox Alpha 消耗的视觉 token 与 GLM-5V-Turbo 完全一致,而 MiMo、Qwen、GLM-4.6V 都有明显差异。文本 tokenizer 也对得上——25 组提示词下,它与 GLM-5.3 保持固定 75 token 的差值。它还以与 GLM-5V 相同的方式拒绝处理音频,回答风格、Agent 执行步数、推理接口也都接近 GLM 系。智谱此前就用 Pony Alpha 匿名测试过 GLM-5,有完全相同的操作先例。

有测试者把置信度打到 99%「这就是 GLM-5.x」,最主流的猜测是尚未发布的 GLM-5.3 Flash。紧接着,Code Arena 又冒出一个匿名模型 korrine,猜测从 Kimi K3.1 到 Qwen、MiMo V3 众说纷纭。谜底已在数日后揭晓:智谱把「牛来」认领为 GLM-5.3 Flash,发布即开源、320B/18B 激活、62T tokens 全跑国产芯片(智谱认领「牛来」:GLM-5.3 Flash 开源原生多模态)。

为什么匿名发布正在变成标配

这才是对行业真正重要的部分。在盲测 Arena 里隐藏厂商与型号,可以削弱品牌带来的先入为主——用户只凭实际输出选择,积累的结果更接近真实偏好。OpenRouter 提供的是另一种测试:开发者把模型接进编码 Agent、丢进真实仓库、连续数小时调用工具,上下文能否稳定、工具调用是否可靠、长程任务会不会循环或跑偏,都会在高强度使用中暴露。

对模型厂商来说,这相当于一次免费公开压测:提前看失败案例、验证推理服务的承载能力、在正式发布前积累真实口碑。而「猜模型」本身也成了营销手段——身份悬念能把讨论周期拉长好几天。

对代码前沿意味着什么

如果一款 Flash 级(更小、更快、更便宜)的模型,在真实仓库任务上已经逼近前沿水平,那么可以推出两件事。第一,完整版的实力上限只会更高,而且还没人见过它。第二,代码前沿的评判标准正在从合成单轮题转向真实仓库的 Agent 任务。同一周里,前沿厂商正在竞相降价——OpenAI 把 GPT-5.6 Sol 价格下调约 20%——而中国开源模型厂商则在把接近前沿的编码能力压缩进更小、更便宜、匿名的「试飞」模型里,让市场自己发现它们。

你现在可以做什么

  • 趁免费实测。把编码 Agent 接上 OpenRouter 的 Ox Alpha,跑一轮真实仓库任务。重点看长程工具调用的可靠性与上下文保持,而不是只看单次回答。
  • 盯住新马甲。Arena、Code Arena、OpenRouter 上出现新的匿名条目,通常意味着一次临近的发布。
  • 读懂定价信号。如果智谱以这个成绩、低价落地 GLM-5.x Flash,依赖前沿模型的团队做 Agent 编程会显著变便宜——这与我们 最新一期 AI 早报里 OpenAI 降价的方向一致。
  • 保持平常心。10 项任务不足以给一个模型加冕,但匿名发布、真实仓库评测、压缩版前沿编码这些类别信号是真实的。

常见问题(FAQ)

Ox Alpha 到底是谁家的模型?

社区最主流的猜测是智谱未发布的 GLM-5.3 Flash 或 GLM-5.x 多模态版本。证据包括:四段视频中视觉 token 消耗与 GLM-5V-Turbo 完全一致、文本 tokenizer 与 GLM-5.3 固定相差 75 token、音频拒绝的路由方式相同。OpenRouter 与智谱均未证实。

它真的比 GPT-5.6 更擅长写代码吗?

在一个 10 项任务的 DeepSWE 子集上,它完成 8 项(80%),同期 GPT-5.6 Sol Max 为 52%、Fable 5 Max 为 65%、GLM-5.3 Max 与 Grok 4.6 xhigh 均为 62%;另一组子集约 63%。样本较小,结论以参考为主。

厂商为什么要在发布前匿名测试?

匿名能消除品牌先入为主,还能在 OpenRouter 上做公开压测——开发者会把模型接进编码 Agent、跑真实仓库、连续数小时调用工具,上下文漂移和可靠性问题会提前暴露;同时积累真实口碑,「猜模型」本身也拉长了讨论周期。

发表评论

滚动至顶部