结论先行:斯坦福教授、Simile AI 创始人 Percy Liang 正在全程公开训练一个 5350 亿参数的大模型——实时 loss 曲线、训练数据配比、工程日志全部开放。这是前沿模型训练第一次被当作「可观察的科学」来做,也是训练黑箱开始终结的信号。
Percy Liang 宣布由 Marin 开放实验室正式启动 Marin 535B-A23B 的主训练(hero run),整个过程全程公开。今后几个月,任何人都能围观一个前沿大模型如何从零到一生长——不再只有最终 benchmark,而是数据进、loss 出的完整现场。
计划:535B MoE 全程公开
Marin 535B-A23B 是 MoE(混合专家)架构,总参数 5350 亿、激活参数 230 亿。团队准备了 18.75 万亿 token 训练数据,部署了 11 套 GB200 NVL72 系统(约 792 颗 GB200 GPU),预计连续训练约 3 个月,总计算量约 2.7e24 FLOPs,之后还有 post-training 阶段。一句话:接下来几个月,你可以看着一个前沿模型从零开始成长。
Scaling Ladder:先小跑四步,再冲主训练
正式启动前,团队先训练了一套 4 个阶段的 Scaling Ladder(规模扩展阶梯):从 1.6B-A61M(48B tokens)一直到 27.7B-A1.2B(926B tokens)。目的有两个:一是用小型实验提前发现并调试问题;二是根据小规模表现预测主训练(hero run)的行为。Percy 也坦言,这是团队迄今最大规模的一次训练,他确实期待过程中出现一些意料之外的情况——这种「诚实的不可预测」,本身就是公开训练的价值。
公开训练到底打开了什么
过去 GPT-4、Claude、Gemini 都是黑箱:外界只能看到最终分数和少量论文,数据配比、失败记录、超参数是否有效、loss 如何变化、Scaling law 预测准不准,全部未知。Marin 把这些全部公开:数据混合比例、各领域数据如何进入模型、训练配置、代码、实验设计、实时 loss、模型状态与分阶段预测。连小细节都是教材——社区成员 James Thewlis 发现约第 500 step 出现 norms 峰值,追查后确认来自 router_bias:MoE 中用于 token 平衡的启发式参数,并非梯度训练出来的。这种「提问-查证-解释」的循环,正是公开训练的意义:训练过程变得可讨论、可协作,像开源软件和论文一样。
为什么这是结构变化,不只是噱头
三层原因。第一,可观测性把 scaling 主张变成可核查的事实——外推错了,实时就能看到。第二,透明度是 AI 治理讨论的前提:看不见的东西没法审计。第三,直播训练是规模空前的「学徒制」,成千上万工程师可以围观一次 800 GPU 级训练到底怎么跑。最根本的是,它重新定义了「开源」:不只是开放权重,而是开放过程。当一笔价值数千万美元、为期三个月的算力投入刻意在公开环境下运行,开放就不再是姿态,而成了战略本身。这与英伟达 60 亿美元押注开源权重模型 形成呼应——权重开源之后,过程开源是下一站。我们对这场公开训练的机制拆解做了更细的展开。
现在你可以做什么
- 围观训练:W&B 实时看板(wandb.ai/marin-community/marin_moe)、数据构成页面,以及 GitHub 讨论线程(github.com/marin-community/marin/issues/8435)。
- 研究细节:第 500 step 附近的 router_bias 峰值,就是现成的 MoE 动力学案例。
- 复制方法论:自己做大训练前,先跑一轮小规模 scaling ladder——四阶段打法可移植到任何算力预算。
- 如果你是实验室负责人:把过程透明当作治理与招人的基础设施,而不是成本。
Q:真的能实时围观 535B 模型训练吗?
A:可以。Marin 团队在 Weights & Biases(wandb.ai/marin-community/marin_moe)实时公开训练曲线,另有数据构成页面和 GitHub 线程,训练持续约 3 个月。
Q:Marin 535B-A23B 是什么?
A:MoE 架构大模型,总参数 5350 亿、激活参数 230 亿,用 18.75 万亿 token、11 套 GB200 NVL72(约 792 颗 GB200 GPU)训练,总计算量约 2.7e24 FLOPs。
Q:全程公开训练为什么重要?
A:前沿实验室从不公开数据配比、失败记录和超参数,外界只能看到最终成绩;Marin 公开的是过程本身——数据、配置、代码与实时 loss,让训练成为可观察、可审计的科学。