强化学习之父 Rich Sutton:大模型已困在「局部最优」,持续学习是下一站

强化学习之父、写下《苦涩的教训》的 Rich Sutton,最近接受红杉资本访谈时把矛头对准了大模型行业:行业已经陷入「局部最优」——继续堆 GPU、做 Scaling 性能还能上涨,头部实验室因此越来越难转向一条短期表现可能更差的新路线。他更大的判断是:大模型的真正瓶颈不是算力,而是上线之后不再学习。为此他与学生 Khurram Javed 创办 Oak Lab 押注持续学习(continual learning);这条路一旦走通,被重写的将不是某一代模型,而是「训练—冻结—上线」的整套基础模型范式。

为什么行业会卡在「局部最优」

Sutton 并不否认 LLM 的成功,他甚至称其为「惊人的科学突破」:语言一度被看作符号主义 AI 最后的堡垒,神经网络靠规模化训练硬生生学会了它。这正是《苦涩的教训》里的结论——长期来看,能随计算规模扩展的通用方法,会战胜依赖大量人工规则的设计。

但同一套逻辑现在反过来咬人。在他看来,行业陷入了局部最优:继续 scaling 还能刷高分数,各头部实验室越来越没有动力切换到短期表现可能更差的新路线。越是擅长 scaling 的公司,越是难以掉头——每一次继续增长,都让「退出」变得更贵。

数据天花板:互联网不等于真实世界

更深的约束不是算力而是数据。大模型摆脱了人工规则,却被另一种「人类知识」重新限制住:互联网。

论文、代码、书籍、网页、视频、聊天记录——存到网上的东西,都是人类已经记录下来的知识。Sutton 的判断很直接:真实世界包含的信息量,远超人类至今存到互联网上的一切。只靠把训练数据准备得越来越充分,总有一天会撞墙。这背后是他的「大世界假说」(Big World Hypothesis):智能体面对的世界永远比它自己复杂,任何预先收集的数据都覆盖不完。

合成数据是「一个大错误」

数据不够的流行答案是合成数据——算力足够就能无限生成。Sutton 直言这是「一个大错误」,甚至可能成为下一条「苦涩的教训」。

理由很朴素:合成数据仍然绕不开人的瓶颈。谁决定什么数据值得生成?谁判断什么问题重要?谁来定义奖励?每一环都还是人。看起来逃出了数据天花板,实际上只是换了一扇门,把人类知识又请了回来。

这也是为什么自训练循环值得关注——像 Ornith 1.5 那样自己出题、自己判分的模型,正在试着把「出题」这个最贵的人工环节也自动化。

缺失的一环:上线之后的持续学习

今天模型的生命周期被切成两段:训练时拼命学,上线后权重基本冻结。Context 能临时塞进新信息,Memory 能记住偏好,但 Sutton 对「学习」的定义严格得多:真正的学习,是经历一件事之后系统本身发生变化。

他的类比很生活化:做了 1000 台手术的医生,和刚毕业的实习生判断方式完全不同;开了 10 年车的司机,不用刻意思考就知道旁边那辆车要加塞。经验真的改变了他们。而大模型更像一个毕业时就冻结的大脑——以后工作多少年,都主要靠翻自己的毕业笔记。

所以他的核心质疑是:既然训练时改变权重能产生智能,为什么模型上线后就不能继续做这件事?为什么形成新概念、修改内部结构的能力,只能发生在训练阶段?

灾难性遗忘:为什么权重不敢动

持续学习这么符合直觉,OpenAI、Anthropic 为什么不直接每天更新权重?因为模型很快会被「学废」——经典障碍是灾难性遗忘(catastrophic forgetting)

神经网络里的知识不是一行行独立存放的。一个权重变了,可能牵动一片旧能力。教它一条新事实(比如「内部项目 X 改叫 Apollo」),可能顺手损坏已经学好的本领。这正是今天各家宁愿把新信息塞进 Context、RAG 或 Memory,也不轻易动底层权重的原因。

Cursor 这类产品式的批量重训对公共模型有效——攒几百万用户数据统一训一次。但到了个人智能体就开始别扭:我想教自己的助手一个新习惯,为什么要等十万人的数据一起训?而且我想让它学的,很可能跟另外十万人毫无关系。这是 Agent 可恢复状态问题最难的形式:把个人经验变成持久能力,而不是塞进上下文窗口。

步长优化:让每个权重有自己的学习速度

Oak Lab 押注的是一个底层的算法问题。方向叫步长优化(step-size optimization),出发点很简单:不同知识不该有同样的「可塑性」。

被验证过无数遍的知识应该极其稳定,刚学到的东西应该容易修改。落地机制是给每个权重配不同的学习速度,让模型能吸收单条新经验,却不让这次更新把其他知识全部重写。这很像人脑:成年人不会因为今天看到一只绿色的猫,就推翻过去几十年对「猫」的认知。

持续学习走通后,范式被重写

如果 Oak Lab——或者任何人——把「上线后持续学习」规模化做通,被重写的不是更好的模型,而是整个「训练—冻结—上线」范式:

  • 基础模型厂商:护城河转移——数据加算力的优势不再那么值钱,因为模型上线后还能继续从自身经验学习。
  • Agent 公司:持久记忆与经验累积成为产品本身,而不是挂在上下文窗口上的附加功能。
  • 推理基础设施:推理变成循环——运行中持续更新权重,而不是 API 后面一组静态权重。
  • 仿真与真实世界:世界永远比训练集大,仿真器有用但不够——无人机第一次起飞遇到的风、摩擦、电机误差、障碍物,永远不会出现在任何仿真器里。世界模型能帮忙,但替代不了亲身经验。

现在能做什么

  • 别再把 Context、RAG、Memory 当终局——它们只是「不能学习的模型」的脚手架。设计系统时,把稳定知识和快速变化的知识从结构上分开。
  • 先度量遗忘:上任何持续更新机制之前,先建一套核心能力的回归测试,每次更新后重跑。
  • 盯住每个权重独立学习速度的研究方向(步长优化、带正则的持续学习)。如果走通,赢的架构不是更大的预训练,而是带学习回路的模型。
  • Agent 团队现在就存结构化经验:试过什么、失败在哪、什么改变了结果——这份日志就是下一个范式的训练数据。

FAQ

Q: Rich Sutton 为什么说大模型陷入「局部最优」?
A: 因为继续加算力还能刷高现有指标,头部实验室没有动力转向短期表现可能更差的新路线——每一次 scaling 增长都让掉头变得更贵。

Q: Oak Lab 想做什么?
A: 做上线后还能持续学习的 AI Agent:从自身经验中更新对世界的理解、提炼新概念、适应环境变化,同时不遗忘已经学会的东西。

Q: 为什么合成数据是「一个大错误」?
A: 因为仍由人类决定什么值得生成、什么算对——数据管道的扩展速度再次被人类知识锁死,只是换了一扇门。

发表评论

滚动至顶部