8 月 13 日,阿里千问团队正式开放 Qwen3.8-2.4T-A95B 模型权重——这是 Qwen3.8-Max 旗舰背后的那个 2.4 万亿参数 MoE 模型,也是千问第一次把 Max 级旗舰权重开源。时间点不是巧合:同一晚 Grok 4.6、DeepSeek V4 Pro 接连上线,三家顶流押注的是同一个方向——长周期自主 Agent。但「开源」这件事本身,可能比榜单更能改变格局:Unsloth 当天就把 4.9TB 的原始体积压到 397GB,一台内存+显存合计 410GB 的机器就能本地跑起前沿级模型。
这次放出了什么
- 总参数 2.4 万亿,每 Token 激活 95B(MoE),基于 Qwen3.5 架构
- 原生 262,144 Token 上下文,可扩展到约 100 万 Token
- 能力增益集中在编程、办公、科研、长周期 Agent 任务
- 强制思考模式:输出前必出
<think>…</think>,无法关闭 - 支持 SGLang、vLLM、TokenSpeed 部署,需用 Qwen3.8 专属 Recipe
- 更小的 Qwen3.8-27B 已在路上
权重已上线 Hugging Face 和 魔搭社区。
基准:Agent 场景领先,经典编码仍有差距
成绩是分裂的。赢的:PaperBench 93.0(超 GPT-5.6 Sol、Fable 5、Claude Opus 4.8)、OSWorld-Verified 86.1(电脑操作类参评模型第一)、参数化 CAD 91.5(超 Fable 5、GPT-5.6 Sol、Gemini 3.1 Pro)。输的:SWE-bench Pro 67.7,落后 Fable 5 的 80.0 和 Opus 4.8 的 69.2;TerminalBench 2.1 86.6,低于 GPT-5.6 Sol 的 88.8;VideoMME v2 也不如 GPT-5.6 Sol。
比榜单更值得注意的是阿里实际测了什么:连续自主编程 16 天(自己搭自进化 Harness、收集社区需求、派发 issue、生成代码、验证、自我修复),独立复现并改进一篇研究论文,参加真实算法竞赛,并在 2000+ 轮交互中经营一家虚拟电商。评测前沿正从「单次回答质量」转向「几周内把活干完」。
结构变化:开源第一次摸到前沿
过去开源权重约等于「去年的模型」——适合微调,够不到前沿。Qwen3.8-2.4T 打破了这条规则:旗舰本身可复现,与最强闭源模型的差距从「一代」缩小到「几分」。压缩在放大这个效应——Unsloth 的动态 1-bit 分层选择性量化把体积砍掉 91%,「工作站能跑」的门槛持续下移。开源不再是在追赶,而是在把前沿压缩成可部署的形态。
对行业意味着什么
- 自托管成为监管行业的真实选项。银行、政府、医疗可以把前沿级能力放进自家防火墙,数据主权与长周期 Agent 任务不再二选一。
- 推理引擎变成护城河。权重公开后,价值转移到 Recipe:谁把 SGLang/vLLM/TokenSpeed 调得最好,谁就掌握分发。
- 闭源 API 面临定价压力。输入只要 ¥12/$2 每百万 Token,千轮级 Agent 任务的成本骤降——而这正是全行业都在抢的工作负载。
- 榜单战场重新定义。SWE-bench 一家独大的叙事结束,论文复现(PaperBench)和电脑操作(OSWorld)成为新战场。
接下来怎么做
- 做 Agent 的团队:先用 Qwen3.8-Max API 跑长周期任务,单 Token 定价让实验成本足够低。
- 管基础设施的:试试 Unsloth 的 397GB 版本,410GB 内存+显存是一台买得到的机器。
- 选型的:别只看一张榜,用你自己的 SWE 任务复测——这个模型赢在论文复现和电脑操作,不是所有编码榜。
- 关注 27B:小模型往往是采纳加速器。
想了解这条线往哪走:2026 AI 趋势盘点梳理了 Agent 进入生产的七条主线,DeepSeek V4 Pro 正式版解读呈现了同一晚闭源侧的「工具化执行」押注,2026 模型选型指南可帮你按赛道对比。
姊妹篇《Qwen3.8-2.4T 开源:阿里首个 Max 级开放权重模型,旗舰配方与 Kimi K3 趋同》从配方、Infra 与后训练 Agent 化角度深挖同一模型。