当大多数模型公司还在争论「要不要开放权重」时,斯坦福 CRFM 的 Marin 项目做了一件更激进的事:把 5350 亿参数模型的训练过程直接搬到了网上——训练还没跑完、甚至可能中途失败,训练曲线、数据配方、模型配置、技术讨论就已全部公开。
上周,斯坦福计算机系副教授、Together AI 联合创始人 Percy Liang 在 X 上宣布启动 Marin 535B-A23B 的训练。帖子浏览量破 80 万,吴恩达公开转发,称这是捍卫 AI 开放性的一次「珍贵示范」,并提醒行业:公开发表 AI 研究成果「曾经是行业常态」。若你想回看启动本身,可读我们此前的启动报道;这篇不再重复「宣布了什么」,而是拆解它「为什么这样训练」——MoE 数学、手写专家并行与缩放梯,如何把公开训练变成一场可控的实验。
这次开放的不仅是模型,更是配方和过程本身。
「开放实验室」机制长什么样
Marin 采用一套 open lab 机制:每个实验在开跑前先用 GitHub Issue 声明假设与目标,配置以代码和 Pull Request 提交,外部研究者可以参与 Review;训练启动后 W&B 指标实时公开,成功、失败、中途修改全部留痕;数据、代码、配方和最终权重持续开放。
本次规模:18.75 万亿 Token(约 80% 预训练、20% 中期训练),11 套 NVIDIA GB200 NVL72,预计约 3 个月,总计算量约 2.7×10²⁴ FLOPs,之后进入后训练阶段。
MoE 拆解:535B 不等于 535B
Marin 535B-A23B 是混合专家模型:535B 是总参数量,A23B 意味着每个 Token 实际只激活约 230 亿参数,由路由模块决定 Token 分配给哪些专家。这也是 MoE 重新成为主流路线的原因——总容量可以继续做大,单个 Token 的计算成本不必同步增长。
细节决定成败。每层保留 2 个共享专家 + 8 个路由专家,均为半宽结构,路由专家再做 2 倍压缩;约三分之一的专家计算来自常驻的共享专家——这是刻意设计,目的是压低 MoE 训练中的 Token 丢弃(token dropping)风险。
Token 丢弃是负载不均的代价:专家收到的 Token 过多时,容量上限会迫使部分 Token 被直接丢弃。Marin 自己的数据显示,上下文从 4K 拉到 65K 时,丢弃率从约 7% 飙到约 40%——批次 Token 总量固定时,上下文越长、批次内独立序列越少,负载越难均衡。因此 535B 选择从 4K 上下文起步,配合自研的 pooled/wave 专家并行,把 4K 下的丢弃率压到约 3%;团队也坦承,拉到 65K 后可能再度恶化。
基础设施豪赌:在 GB200 上手写 EP
MoE 训练的瓶颈往往不是算力,而是 All-to-All 通信、专家负载不均和内存访问。Token 被路由到其他 GPU 甚至其他机架上的专家时,系统要先把 Token 传过去、再把结果传回来。
Marin 的 8B/32B 跑在 Google TPU 上,535B 转向 GB200 NVL72 GPU 集群后,团队在 JAX/XLA/Levanter 栈上手写了一套专家并行(Expert Parallelism)实现——因为没找到现成的高性能方案。GB200 NVL72 把 72 颗 Blackwell GPU 和 36 颗 Grace CPU 组织在机架级 NVLink 域内,正是通信密集的 MoE 想要的硬件形态。硬件竞赛的另一面是自研芯片——OpenAI 首颗芯片 Jalapeño 的实测展示了推理端如何被重新定义。
缩放梯:把 Scaling Law 当故障检测系统
Marin 没有把算力直接砸向 535B,而是先训练了一组四级 缩放梯(scaling ladder)小模型:从 1.6B 总参数(61M 激活)到 27.7B(约 1.2B 激活),只占最终算力的约 1%。
这组小模型承担三个任务:预测 535B 各阶段应达到的损失(偏离即可早期报警,不必等几万亿 Token 后才发现问题);以极低成本暴露稳定性风险(此前缩放实验发现长周期训练下梯度范数一度超过 4,最终引入 logit z-loss 防止训练发散);区分「正常波动」和「失控前兆」。
项目还留了预案:如果问题出现在前 25% 的 Token 预算内,团队可能缩短最终训练量、重新调整学习率衰减与数据配比,而不是机械地跑完原计划。
从开放权重到开放过程
这不是第一个直播训练的项目。2022 年 BigScience 训练 BLOOM 时就公开了 TensorBoard 日志;Pythia、LLM360、Ai2 的 OLMo 也开放了数据、代码、日志和中间检查点。Marin 的公告明确列举了这些先行者——EleutherAI、AI2、Hugging Face、BigScience、BigCode、LLM360——而开放权重一侧的投入也在加码——英伟达以 60 亿美元押注开源权重模型;Marin 则想再进一步:把「开放」从一次发布行为变成实验室的默认工作方式,从提假设、提交代码到训练失败都实时公开,而不是训练结束后再整理一份干净的复盘。
类比很精确:软件开发者可以在 GitHub 上看 Issue、提代码、做 Review、复现 Bug;而大模型实验过去都在封闭集群里跑,外界只能看到成品权重和技术报告——看不到决策过程,也看不到失败的实验。
成与败,都有价值
开放权重回答了「谁能用模型」,Marin 在追问「谁有权知道模型是怎么被训练出来的」。如果训练成功,开源社区将拿到一份罕见的大规模 MoE 训练样本;如果中途失败,公开的故障路径本身就是研究资料。
无论结果如何,专家路由、Token 丢弃动态、梯度异常、长上下文扩展、JAX 在 GB200 上的专家并行——这些经验与模型规模无关,可以复用到任何规模的训练上。对负担不起 2.7×10²⁴ FLOPs 的团队来说,这是一堂免费的前沿训练实战课。
但也别过度兴奋:公开不等于前沿性能。535B MoE 不等价于 535B 稠密模型;预训练损失只说明对数据的拟合程度;代码、数学、工具调用和 Agent 能力还取决于中期训练与后训练。项目仍在早期——连 Token 口径都还没对齐(GitHub 上写 18T,公告写 18.75T)。
可以怎么用
- 训或微调 MoE 模型的团队:盯住 Token 丢弃率和 pooled/wave 专家并行方案,「先 4K 起步、再逐步拉长上下文」是个低成本且立刻能用的经验。
- 算力有限的研究者:缩放梯方法论可以在小规模复刻——梯度范数监控和 z-loss 几乎零成本,却能提前拦住发散。
- 做开源 AI 的组织:「Issue → PR → 公开指标」的开放实验室流程,是权重之外做透明度的一个具体模板。
- 普通读者:收藏 GitHub 仓库和 W&B 面板,围观一场约 100 天的公开训练,是理解前沿训练成本结构最直观的案例。
常见问题
Q:为什么围观 Marin 535B 训练值得?
A:这是首个把前沿训练当科学实验全程公开的项目——18.75 万亿 Token、11 套 GB200、约 3 个月、约 2.7×10²⁴ FLOPs;成功则拿到大规模 MoE 样本,中途失败也留下公开的故障路径,都是研究资料。
Q:535B MoE 和 535B 稠密模型有什么区别?
A:535B 是总参数量,A23B 表示每个 Token 只激活约 230 亿参数,单 Token 计算成本远低于同规模稠密模型——这正是 MoE 重回主流的原因。
Q:我在自己的训练里能立刻用上什么?
A:三件事:从 4K 上下文起步(把 Token 丢弃率从约 40% 压到约 3%)、用缩放梯小模型预警(只花约 1% 算力)、梯度范数监控加 logit z-loss 防发散(几乎零成本)。