Qwen3.8-2.4T 开源:阿里首个 Max 级开放权重模型,旗舰配方与 Kimi K3 趋同

阿里首次开源 Max 级模型

8 月 13 日,阿里正式开放 Qwen3.8-2.4T 的模型权重。这是 Qwen 历史上第一个开放权重的 Max 级模型——过去一直是「中小模型开源、Max 模型闭源走 API」的双轨路线,这次等于拆掉了那条线。

发布本身很克制:没有配套技术报告,只有架构、后训练、推理基础设施和开源规则。但把它和半个月前的 Kimi K3 放在一起读,更有意思的事情浮现了:开源旗舰的技术配方正在收敛。

配方:3:1 混合注意力,约 100B 激活

Qwen3.8 总参数 2.4T,每个 Token 激活 95B,512 个专家(10 个路由 + 1 个共享)。92 层由 23 组「3 层 Gated DeltaNet + 1 层 Gated Attention」构成,线性注意力与全注意力的比例接近 3:1——Kimi K3 的 69 层 KDA + 24 层 Gated MLA 也是同样的 3:1。两家属于同一技术谱系,K3 的 KDA 可以看作对门控遗忘机制的更细粒度版本,另外还多了注意力残差(AttnRes),这是 Qwen3.8 没有的。

原生上下文 262,144 Token,可扩展到 1M 以上,并做了多 Token 预测(MTP)训练——DeepSeek V4 的技术报告里也用了一样的招(参考DeepSeek V4 Pro API 指南)。

推理侧:差异还剩在 Infra

官方提供 BF16/FP8 checkpoint,Inferact 额外提供 NVFP4/MXFP4 量化版本。FP8 完整版要两台 B300 或 MI355X 节点,量化到 FP4 后单节点就能部署——2.4T 参数跑在一台机器上,这是重新定义「谁能托管旗舰模型」的数字。

服务端是现在的标准分工:Attention 靠张量并行,MoE 靠专家并行,配合融合算子与机架级高速互联压低专家通信开销。Kimi K3 面对同样的问题,用 MoonEP 让热门专家按负载动态复制。真正的差异化空间已经不在注意力配比,而在并行调度。

后训练:增量几乎全部给了 Agent

模型卡把 Agent Execution 列为核心升级方向:自主规划、环境反馈处理、端到端任务完成。官方数据也印证:Terminal Bench 74.5 到 86.6,PaperBench 64.8 到 93.0,JobBench 31.3 到 53.4,Toolathlon 49.7 到 72.5;而 GPQA Diamond 只从 92.4 涨到 92.6。这一代的提升几乎全部发生在 Agent 与编程场景,传统知识基准已经不是区分旗舰的战场。

另一个关键信号:preserve_thinking 默认开启,跨工具调用时保留此前的推理上下文。Kimi K3 也做了同样的选择。「保留推理状态」正在从 harness 的职责迁入模型本身——这条边界移动值得单独关注(我们在这篇MiniMax Agent 战略拆解里讨论过 harness 一侧)。

开源 ≠ Apache 开放

许可证也变了。Qwen3.8 用的是专门的 Qwen3.8-Max License 而非 Apache 2.0:允许使用、修改、微调、甚至出售衍生品,但月活过 1 亿或月收入过 2000 万美元的商业产品需要显著展示模型名;做 MaaS 或 AI Work Assistant、集团年收入超 5000 万美元的,商用前还要另拿授权。Kimi K3 的许可也是同一套形状。到了 3T 级旗舰,「开放权重 + 自定义商业许可」已经成了事实标准。

判断:配方已收敛,等谁先打破

把两家放在一起,2026 年旗舰模型的配方基本定型:总参数 2–3T、激活约 100B、3:1 混合注意力、百万级上下文、Agent 优先的后训练、FP4/EP 推理、开放权重加分级许可。剩下的是微优化,不是架构路线之争。

给开发者的建议:评估旗舰别只看 GPQA,用 PaperBench、Terminal Bench 这类 Agent 基准;推理侧把 FP4 单节点部署当作大模型的新成本基线;做 MaaS 或 AI 工作助手的,接入前先读许可阈值。接下来值得等的,是谁先打破这套配方。

这篇聚焦配方与推理侧;姊妹篇《阿里开源 Qwen3.8-2.4T-A95B:旗舰权重首次开放》从基准表现与行业结构角度解读同一发布。两篇互补,值得对照阅读。

发表评论

滚动至顶部