过去两年,AI 进步的故事主线是算力:更大的集群、更长的训练、更多的 token。而 BigBang-V1 这个开源模型的发布,指向一个正在收紧的更隐蔽的瓶颈——人类出题的速度。这个由无尽前沿团队(上海交大人工智能学院、深势科技、上海算法创新研究院)发布的 35B 参数基座模型(推理时激活 3B),其后训练数据100% 由 AI 自主合成:出题、解题、验证全部交给 AI。在 8 项代表性基准上,它拿遍 35B 档最高分;在 FrontierScience Research、Humanity's Last Exam、PaperBench(Code-Dev)、BioMysteryBench-HD 上,甚至超过了 1.6T 的 DeepSeek V4 Pro Preview——一个体量大它 45 倍的模型。
数据管线:两个 Agent,一座会自我改造的工厂
BigBang-V1 基于 Qwen3.6-35B-A3B,模型、代码与评测结果已在 Hugging Face 和 GitHub 开源。团队的野心是做出首个以递归自我改进(RSI)原生方式训练出的基座模型,并把 RSI 从概念落到工程。其数据系统由两类 Agent 协作:Generator Agent 负责提出并解决科学、工程与 AI 研究中的高难度任务——它不是按固定提示词出题的生成器,而是直接编写、运行、调试数据合成程序,能决定任务来自哪些领域、推理链要多长、哪些样本保留、哪些淘汰,并把每轮失败原因记录下来供下轮继承;Critic Agent 从对抗角度审查候选数据——第一层查格式、工具执行、数据完整性与约束满足,第二层判断任务是否正确、可验证、够难、够多样、真正有训练价值。
任务要进入这套循环,必须同时满足两个条件:前沿性——位于当前知识或模型能力边界、甚至没有已知最优答案,不会被静态题库那样迅速耗尽;可验证性——能通过形式化方法、代码执行、数值计算、模拟器等客观检查。科学恰好同时满足两者,所以被选作训练场:它会源源不断产生新问题,且每个答案都能被客观检验。
AlphaGo 式的自我对弈,外加一条外循环
Generator 与 Critic 的对抗,本质上是 AlphaGo 自我对弈的翻版,只是棋盘换成了开放的科学任务空间。但自我对弈有个知名隐患:Generator 会学会迎合 Critic,造出表面复杂、评分很高、训练后却无法迁移的数据。BigBang 的解法是再加一层更慢的外循环——生成不同版本的数据管线,分别训练模型,再用留出的真实研究任务评测。Critic 认为高价值的数据若没能让模型变强,就用真实结果反向校准 Critic、调整 Generator 的选题方向;某个看似狭窄的科学任务若带来搜索、推理上的广泛增益,就加大投入。这条外循环让管线保持诚实,也保持动态:模型越强,旧任务越"不值钱",系统就淘汰它们、推向新的前沿。
这才是"数据层 RSI"的关键:数据生产系统本身成为被优化的对象,跟着模型一起进化。它区别于业界多数实验室正在做的两类尝试——给模型套 harness 调工具改提示词(训练管线原封不动),或用人类写死的规则给生成数据打分(模型变强后旧标尺很快失效)。
三个结构性信号
- 竞争焦点从堆算力转向数据智能。当 35B 模型能靠更好的训练数据赢过 1.6T 模型,模型质量就越来越取决于数据飞轮而非 GPU 数量——这会改变谁能参与竞争,也让"算力护城河"的真实宽度被打上问号。
- 静态题库快速贬值。模型会像消耗固定数据一样消耗固定基准。能自主生成前沿任务的系统,彻底移除了"人类出题"这个瓶颈,也在悄悄重塑评估与基准数据的市场。
- AI 研发中的生产关系重新分工。人类仍定义研究目标、资源预算、风险边界与验收标准;AI 负责大规模探索、实验执行、失败经验整理和下一轮数据生产。约束从"每个训练样本都由专家撰写"变成"人类审计生产样本的系统"。
风险同样真实:Critic 合谋、评测过拟合,以及自指系统缺乏外部锚点的普遍难题。团队的解法是验证链兜底加训练结果外循环校准——这套架构能否在大规模下成立,值得持续跟踪。值得注意的是,模型不能修改自己的评测标准,Critic 打高分也不能单独批准数据进入下一轮训练。
可以怎么用
- 做训练或评测数据的团队:用"前沿性 + 可验证性"两条标准审一遍自己的管线——两者皆无的数据,再怎么清洗也会快速贬值。
- 上手试试:BigBang-V1 已开源,模型见 Hugging Face,代码见 GitHub,含 harness 与完整评测结果。
- 盯住经济账:如果数据层 RSI 成立,前沿模型的约束条件就从"有多少张 GPU"转向"你的数据生产循环有多好"。把数据生成当成一等系统来做的实验室,才是值得关注的那批。
算力买来了过去两代进步。下一代,可能靠一个更好的问题买到。
