智谱认领「牛来」:GLM-5.3 Flash 开源原生多模态,62T tokens 全跑国产卡

在 OpenRouter 上火了几天、被海外开发者反复实测的神秘模型「牛来」Ox Alpha,终于被智谱认领:它就是GLM-5.3 Flash——5 系列首个原生多模态模型,发布即开源。更关键的是:线上 62T tokens 的真实流量,全部跑在国产加速芯片上。

认领之前,已被实测一周

在身份曝光前,开发者已经拿 Ox Alpha 做了大量测试:博主 Tim Jayas 用同一段 Prompt 做了两次 SpaceX Raptor 猛禽发动机的 3D 交互页,发现第二次明显更好,感慨「这是一个能自己持续学习的模型」。它在 OpenRouter 首日冲上榜首,刷新单日 tokens 用量纪录;在 OpenCode 上终结了 DeepSeek 连续 56 天的霸榜。智谱认领后补上的细节,才是这条新闻真正的分量:这个爆火模型是 5 系列 Flash 版,train 和 serve 全在国产卡上。

小模型为什么反而更强

GLM-5.3 Flash 的「小」只是参数口径:总参数 320B,单次激活仅 18B,层数从 GLM-4.5 时代的 92 层压到 45 层——能力却全面超越 753B 的 GLM-5.2。效率来自注意力机制的重做:

  • 线性注意力 + 稀疏注意力混合架构:线性部分抓局部信息,稀疏部分靠轻量索引器捞回全局上下文。1M 超长上下文不再需要所有 token 两两全算。
  • IndexPool:把索引器的 4 个缓存向量压成 1 个,注意力计算量比 GLM-5.3 降低 3.01 倍,KV Cache 缩小 4.44 倍
  • 30T token 多模态预训练语料,加上专门为 Visual Coding 做的数据合成流水线:模型在执行任务时能「自己看」最终页面、交互和 3D 场景,再根据视觉反馈继续修改。

最后这一点,正是实测观感不同的原因:给一整部电影,它能剪辑出配好字幕的解说视频(甚至抓取只出现一次的名签,用来对齐人物、声音和名字);给一张 UI 设计稿,它能做出可交互的购物 App;给它 12 个小时,它能独立搭完一个 Blender 场景。这不是「轻量版」模型做轻活,而是效率优先的架构做长任务。

价格信号

AA 榜单上 GLM-5.3 Flash 拿下 57 分,与 Claude Opus 4.8 持平。定价更说明问题:GLM-5.3 的 1/10(限时折扣 1/20),约为 Opus 4.8 的 1/40,低于 DeepSeek V4 Flash。比自家上一代便宜、比自家大哥强——这是架构级效率,不是促销降价。

结构信号:国产全栈闭环第一次跑通

真正的头条不是模型本身,而是:GLM-5.3 Flash 的线上流量在国产卡上,用 Encode-Prefill-Decode 分离式架构 + Layer Split + 混合缓存量化扛住了多模态和 1M 上下文。相比同一套硬件上的初始基线,端到端服务性能提升 3 倍,单 token 成本做到与主流英伟达 GPU 相当。

请再读一遍这句话:一个前沿级、原生多模态、1M 上下文、带视觉反馈环、创纪录线上用量的旗舰开源模型,在国产全栈上端到端跑通,单位成本对齐英伟达。过去「国产芯片」总是出现在条件句里——「如果国产算力能…」。这次,一个旗舰开源模型把它写成了完成时:硅片、服务软件、模型权重三者闭环,并且已经量产。

可以怎么用

  • 直接上手:权重已开源,Ox Alpha / GLM-5.3 Flash 在 OpenRouter 上可用,1M 上下文和长任务自主执行不是演示专用。
  • 重点测试视觉反馈工作流:设计稿转代码、视频转字幕这类任务,最能体现「原生多模态 + 自我修正」相对拼接式模型的差异。
  • 盯单位成本而不是标价:3 倍服务收益 + 4.44 倍 KV Cache 缩减,是能逼对手跟着改成本曲线的动作。
  • 关注芯片叙事的人:值得问的问题已不再是「国产卡能不能服务旗舰模型」,而是「什么价位」——而答案刚刚变得更实了。

发表评论

滚动至顶部