1300张卡打赢十万张卡的赌注:AI的下一桶燃料,藏在实验室里

1300张卡打赢十万张卡的赌注:AI的下一桶燃料,藏在实验室里

## 一、破题:跑分不重要,跑分背后的燃料结构才重要

前OpenAI研究副总裁Liam Fedus的创业公司Periodic Labs,上周交出了第一份答卷:一个一万亿参数的模型Periodic Neon,在X射线衍射(XRD)分析基准FrontierXRD上拿到55.3%的成功率,超过了GPT-6 Astra和Claude Fable 5.1。

热闹的数字是这些:Neon的最终训练只用了峰值1300张H200,而Astra背后是超过10万张Blackwell。一边是1300,一边是十万。Jeff Dean第一时间去Fedus的帖子下留言祝贺。

多数人会把这当成又一个「小团队吊打巨头」的故事。这个解读是错的,而且错得危险。

真正值得看的不是跑分,是跑分的来源。Neon的超越不是靠更聪明的架构,也不靠惊人的工程效率——这两样都有,但都只是配角。主角是Periodic自建的那座高通量材料实验室:机械臂24小时连轴转,合成样品、送进衍射仪、拍下「指纹」、喂给模型。

Fedus去年创业时把话挑明了:互联网上的文本总共约10T token,最好的前沿模型已经把它读完了。AI要再往前走,需要互联网上没有的新数据。

Thesis在这里:**下一阶段Scaling的分水岭,不在谁买得起更多芯片,而在谁拥有能源源不断产出新数据的环境。** 飞轮还是那个飞轮,变的只是喂进去的东西——从人类写下的文字,换成自然给出的回答。

## 二、拆解:一道题,看清缺省数据的天花板

先看这道题本身,因为它暴露了通用模型的天花板到底在哪。

XRD是材料合成的「质检环节」:X射线照进晶体粉末,不同晶相在不同角度衍射出特征峰,像指纹。麻烦在于,实验室合成出来的样品往往极不纯净——目标产物、未反应的前驱体、意外的副产物混在一起,多种物相的峰彼此重叠。Periodic说,一次合格的分析平均要拆开5个物相,专家对着软件、数据库、文献折腾几个小时才能下结论。

这正是通用模型的弱项。GPT-6 Astra再强,它的知识来自互联网文本,而互联网上没有你上周三下午在门洛帕克实验室里合成出来的那坨东西。

Periodic挑了134道「连专家都头疼」的题组成FrontierXRD基准。Neon的成绩轨迹很说明问题:它从一个开源权重模型Kimi K2.6起步,在同样这道题上的初始成功率只有2.7%;经过实验室数据的中训练和强化学习,拉到55.3%。二十倍的提升,模型底座没换,换的是数据。

顺便说清成本:Neon每题分析约4美元出头,Astra约7美元多但成绩更低,Claude Fable 5.1成本相近、成功率只有约40%。团队还准备了198道训练中被刻意剔除的化学体系做泛化测试,Neon依然领先。

但这里要拆掉一个流行错觉:「1300对10万」不等于效率倍数。Periodic自己承认,把训练算力扩到今天前沿模型的量级,能解锁更强的科学能力。他们省卡的秘密不在神奇算法,而在三个朴实得近乎笨拙的做法:自研沙箱pbox利用GPU节点的闲置CPU跑科学工具,数据不出集群,比托管沙箱服务延迟低4.5倍、吞吐高3.3倍;训练吞吐做到Megatron基线的4.1倍;整个集群通过错峰跑物理模拟,利用率常年95%以上。

算力总量拼不过巨头,就拼每个GPU小时换回多少科学产出。这不是颠覆Scaling Law,是在Scaling Law的账单上换了一栏计入项。

## 三、建框架:数据矿与数据井

把这件事抽象一下,可以得到一个判断未来AI竞争格局的工具——我把它叫「矿与井」框架。

互联网文本是一座**数据矿**:储量有限,挖一点少一点。10T token的总量摆在那里,前沿模型已经读完。矿还剩多少品位可以再挖,是个越来越紧迫的问题。

与之相对的是**数据井**:环境本身在持续产出新的、私有的、带物理反馈的数据。Periodic的实验室每循环一圈——先猜要合成什么,再预测怎么合成,最后搞清楚实际做出了什么——就吐出一批新鲜的实验数据。官方博客的标题起得很直白:Nature Is Our Learning Environment(自然就是学习环境)。

矿与井的分野,解释了为什么Periodic的模型能把通用前沿模型甩在身后:考题就出在井里,井水的成分只有井主知道。这也预示了一个不舒适的推论——**最值钱的训练数据,从「全人类写的」变成「只有我有环境才能产生的」。** 数据优势第一次和物理资产绑定:实验室、工厂、医院、气象站。

框架的第二层是验证问题,这是把RL搬进物理世界最要命的一环。数字世界RL的成功秘诀是海量智能体做又快又能自动判分的题;物理世界三样全卡住——智能体不能说加就加(多一路实验多一份电力和设备)、实验动辄数天、结果模棱两可。Periodic的原话很精辟:科学可以被证伪,却不容易被验证。

他们的解法是把专家判断蒸馏成裁判:材料学博士给数千张XRD图谱打标签,校准出一个由Opus 5和GPT-5.6 Sol组成的LLM裁判组。数字很硬:专家彼此之间一致率77.2%,LLM裁判与单个专家一致率74.6%,与专家共识一致率84%。AI裁判的靠谱程度已逼近人类专家彼此的水平。把「说不清」变成能训练的奖励,井才算真正通了水。

## 四、推演:井不止长在实验室

矿与井框架的用处,在于它能迁移到实验室之外。

生产线上:西门子南京工厂的人形机器人,本质也是一口井——机器人在真实产线上搬电路板,每一次成功与失败都在生产带物理反馈的数据。装配线产出的不是产品,是训练数据。

用户侧:一家App如果让Agent替用户操作界面,Agent的每次交互轨迹就是井水。豆包手机与超级App关于「谁交出入口」的拉锯,底层争的正是井的所有权。

资本侧:AI基础设施投资潮里的芯片、数据中心、电力,都还是矿逻辑的延伸——堆算力把已有数据算得更透。而实验室、工厂、机器人这类「长在物理世界里的环境」,是另一种资产类别,估值逻辑完全不同。

也要推演反方向:井有边界。Neon这次证明的只是发现循环的最后一段——看懂实验室做出了什么。让AI决定做什么、设计合成路径,两个环节还没打通,Fedus的措辞很克制:模型目前是「帮我们决定」,不是替科学家拍板。井转得起来,不等于井能自动加深。

## 五、落到行动

如果你在规划未来两年的AI投入,矿与井框架给出三类具体动作:

- **如果你在巨头或大模型公司**:算力护城河仍在,但要开始盘点「环境资产」——你有多少条数据管线产出的东西,是竞争对手拿钱买不到的?
- **如果你在垂直行业(材料、生物、制造、医疗)**:你手里的实验流程、产线、临床记录,就是别人眼里的井。最快的姿态不是卖数据,是「数据不离开现场」的共建——Periodic连沙箱都自研,就是为了让数据不出集群。
- **如果你是投资者**:区分两种标的。堆卡的逻辑已被充分定价;把稀缺物理环境转化为私有训练数据的能力,目前几乎没有定价。后者风险在于环境闭环周期长——Neon离全自主闭环还有两步没走完。

回看Fedus的履历:GPT-4技术报告里,他的职责是「数据飞轮」负责人。三年后,他把同一个飞轮从互联网搬进了实验室。飞轮没换,燃料换了。

下一阶段的Scaling,比的也许不再只是谁能买下十万张芯片,还要看谁的实验室能一刻不停地往模型里送真实世界的数据。

来源备注:本文事实来自Periodic Labs官方博客(building-labs-that-learn、nature-is-our-learning-environment、ai-infrastructure-at-periodic)及新智元/36氪报道、Liam Fedus的X帖子。

滚动至顶部