2024年图灵奖得主、强化学习之父Richard Sutton正式宣布离开Keen Technologies,与弟子Khurram Javed创立Oak Lab。
目标很明确:搭建万亿参数规模、可以实时学习和实时规划、整机功耗仅20瓦的智能体。
20瓦,恰好是人脑的耗能水平。而当前最先进的AI模型,单次训练耗电以兆瓦计。
这条消息本身不算大——一个69岁的老教授创业,听起来像是学术理想主义的最后一次尝试。但如果你把Sutton过去四十年的思想轨迹和他要挑战的东西放在一起看,会发现这绝不是一个「老科学家最后一次创业」的温情故事。
这是一次对当前AI行业最核心假设的正面质疑。
一、Sutton在质疑什么
他在推文中说得很直白:
"我们认为当前的深度学习方法又弱又低效,需要的不是修修补补,而是全新的基础思想和彻底重构。"
注意,说这话的不是某个边缘学者,不是被主流抛弃的异见者。
Richard Sutton是现代强化学习的开山之人。他提出了时序差分算法,和导师Andrew Barto合著的《Reinforcement Learning: An Introduction》是该领域四十年来的全球教材。他的学生包括AlphaGo的核心设计者David Silver、DeepMind蒙特利尔负责人Doina Precup。2017到2023年,他是DeepMind的杰出研究科学家。
2019年,他写下了那篇被无数人引用的《苦涩的教训》(The Bitter Lesson),核心观点是:能够随计算规模扩展的通用学习方法,长期来看终将胜过依赖人类手工知识的系统。
这篇文章后来被很多人当作"Scaling Law"的背书——你看,Sutton自己说了,更大的模型、更多的数据、更强的算力,才是通往通用智能的正确路径。
但Sutton这几年越来越清楚地意识到:他的文章被误读了。
被误读的"苦涩的教训"
《苦涩的教训》说的不是"堆算力就行",而是"不要试图把人类知识硬编码进系统,要让系统自己从经验中学习"。
问题是,当前的主流深度学习方法,本质上仍然高度依赖人类生产的数据。模型学的是人类已经写下的文字、拍下的照片、标注过的数据。它不是从自己的行动中学习,它是在模仿人类过往的痕迹。
2025年,Sutton与David Silver联合提出了"经验时代"(Experience Era)的概念,明确指出:AI的发展正在从"依赖人类数据"转向"依赖智能体与环境互动产生的经验"。
Oak Lab,就是这套主张的创业化落地。
二、离线学习 vs 实时学习:两种AI的哲学分歧
要理解Sutton为什么走,首先要理解两种学习范式的根本区别。
当前的主流范式——离线预训练
耗费数月时间、投入数亿美元、在海量文本数据上完成一次性的离线训练。
训练结束后,模型参数基本固定,随后上线使用。即便每天和亿万用户对话,绝大部分交流内容也无法转化为模型自身的新能力。模型只能复用训练阶段学到的知识,或在上下文窗口里短暂记住信息。
它像一个读完大学就再也不学习的人——一切回答都基于毕业时的知识储备。
Sutton的目标范式——实时在线学习
智能体一边感知环境、做出行动、根据结果调整自身行为。每产生一条新经验,学习就同步发生,不需要间隔很长时间再集中训练。
Sutton的原话是:"AI运行的每时每刻,都应当是学习的过程。"
Oak Lab围绕一套名为OaK(Options and Knowledge)的架构展开。核心思想是让智能体从自身经验中发现具有时间跨度的抽象结构,并将其转化为可验证、可规划、可反复调用的"技能"。
举个例子:机器人第一次去厨房接水,包含辨认房间、躲避障碍物、拿起水杯、打开水龙头等一系列动作。传统AI会把全部步骤当作单次决策任务。OaK架构则让智能体从实操中拆解出"走到厨房""拿起杯子""接水"等高层次技能。下次遇到相似目标时,直接调取已有技能,再结合环境灵活调整。
这种"时间抽象"机制——把零散动作沉淀为可复用的技能——是人类智能的核心能力之一。AI目前几乎没有这个能力。
更激进的是:Oak Lab的学习阶段既不储存历史数据,也不会回放历史经验。他们设想的是一种batch size为1的实时学习方式——每得到一条新经验,就立刻完成一次更新。
如果这套方法与事件驱动神经网络结合,系统所需的计算量和能耗可以下降数个数量级。
于是便有了那个看似激进的远期目标:万亿参数、实时学习、20瓦功耗。
三、三种AI范式:一个分析框架
把Sutton的主张放到更大的坐标系里,我们可以看到AI学习范式的三个时代:
范式一:数据驱动时代(Data Era)
特征:依赖人类标注的数据集,模型学会的是人类已有的知识
代表:早期机器学习、监督学习黄金时代
局限:天花板来自数据质量和规模,模型无法超越人类知识边界
范式二:算力驱动时代(Compute Era)
特征:大模型+Scaling Law,用极大规模的计算资源从海量数据中提取统计规律
代表:GPT系列、Claude、Gemini
局限:训练是一次性的,模型上线后无法继续学习;训练成本极高(兆瓦级);数据终将耗尽
范式三:经验驱动时代(Experience Era)
特征:智能体在运行时持续产生新经验,每时每刻都在学习
代表:Oak Lab(如果成功的话)
潜力:可以持续适应环境变化;能耗接近生物智能水平;不依赖人类数据,可以探索人类未曾到达的知识领域
当前AI行业的几乎所有资源和注意力,都集中在范式二上。Sutton在赌的是:范式二的天花板已经不远了,范式三才是通向AGI的真正路径。
四、这个框架的解释力
这个"三种范式"框架不只是为了理解Sutton。它可以帮助我们看清当前AI行业的很多现象:
为什么强化学习突然变得重要
DeepSeek的R1之所以让人惊讶,不是因为模型更大,而是因为它用强化学习让模型在推理过程中学会了"思考"。OpenAI的o系列、Google的推理模型,本质上都在往"从经验中学习"的方向试探。
为什么具身智能和Agent成为热点
如果AI只能靠离线数据回答问题,它永远无法在物理世界或复杂工作流中执行任务。Agent热潮的本质,是行业在集体寻找从范式二向范式三过渡的桥梁。
为什么能耗问题会成为AI的终极瓶颈
范式二的能耗是指数级增长的。OpenAI CEO Sam Altman说"未来AI的瓶颈不是模型能力,是能源",这在范式二的世界里是对的。但如果范式三成立——20瓦的万亿参数智能体——整个算力经济的底层逻辑都要重写。
为什么"边缘AI"不只是一个技术名词
如果AI的最终形态是实时学习的智能体,那么它必须运行在靠近行动的地方——机器人上、汽车上、手机里。当前的云端推理架构只是过渡形态。
一个有趣的注脚:2017年到2023年,Sutton在DeepMind领导Edmonton团队。2023年DeepMind关闭了这个实验室,Sutton随后加入了Carmack的Keen Technologies。不到三年,他又离开了。这不是一个容易合作的人——不是因为性格,是因为他的思想一直在往主流之外走。
五、所以,你能做什么
如果你是大模型公司的技术决策者——不要把"实时学习"当作五年后的事。现在就可以开始在模型架构中预留持续学习的接口。当前所有基于pre-training+fine-tuning的交付模式,迟早会被"持续学习"取代。
如果你是AI创业者——Sutton的创业方向值得认真关注。不是因为他一定会成功,而是因为他指出的方向——实时学习、低功耗、高自主性——代表着AI基础设施的下一个增长极。20瓦的万亿参数模型如果真能做到,整个边缘计算市场都会被重新定义。
如果你是AI研究者——OaK架构中的"时间抽象"和"batch size为1的实时学习"是两个值得深挖的技术方向。无论Oak Lab最终能否实现目标,这些技术探索本身就有价值。
如果你只是关注AI的用户——记住Sutton的一句话就够了:"真正的智能不是从数据中学会的,是从行动中长出来的。"这不仅仅是他的创业信条,也是评估任何AI产品价值的一个简单尺度:它能从经验中学习吗?还是只会重复学过的答案?
来源:
- Richard Sutton on X: https://x.com/RichardSSutton/status/2076663628301058329
- 量子位报道(经36氪转载)
