持续学习:AI能力从"提示词空间"到"参数空间"的范式转移

7月,AI行业三件大事几乎同时发生:图灵奖得主、强化学习之父Richard Sutton下场创业做持续学习Agent;Mira Murati创办的Thinking Machines Lab(TML)发布975B参数开放权重模型Inkling,定位就是"适合微调定制的基座";国内Mind Lab推出Macaron V1,基于GLM-5.2构建,原生支持持续学习。

三件事指向同一个方向:持续学习(Continuous Learning)正在从学术概念变成可落地的产业赛道。而让这一切成为可能的,是一个被低估的技术底座——LoRA。

一、为什么持续学习是必须解决的问题

过去两年,LLM的能力提升有两条清晰的路径:

路径一:部署前优化。预训练、SFT、RLHF、RLVR……所有训练都在模型上线前完成。模型一旦部署,参数就冻结了。

路径二:运行时补充。通过prompt、memory、RAG、skill库、Agent harness等外部机制,在模型参数不变的前提下补充上下文和能力。

今天几乎所有的Agent产品都走的是路径二。Mind Lab在官方博客中给了一个精准的概括——这本质上是"提示词空间的迭代":经验保存在模型之外,每次使用时必须被重新读取、重新理解。

这条路有一个结构性天花板:

  • 经验越积越多,上下文越来越长,记忆可能相互冲突;
  • 规则和检查不断叠加,执行成本持续上升;
  • 最关键的是,把信息放进context,不等于模型掌握了其中的规律。

当模型缺某项能力时,再多的prompt也补不上。

持续学习走的是另一条路——"参数空间的迭代":把经验直接写进模型的可训练参数。一个Coding Agent反复接触的代码规范,一个个人助理逐渐确认的用户偏好,都可以通过训练沉淀成稳定的行为,而非每次从上下文重新读一遍。

这是两条互补的路径,不是替代关系。事实可以继续放在context/RAG里,验证过的操作流程可以存成skill。但那些反复出现、相对稳定的行为变化,应该写进参数。

二、LoRA:持续学习在工程上能成立的前提

参数空间的迭代本身不新鲜——SFT和RLHF就是。但过去后训练的问题是:数据、奖励、流程,全得靠人。持续学习要做的是让训练这件事在部署之后自己转起来:模型行动→获得经验→找到信号→写回参数。

要让这个循环跑通,工程上必须满足三个条件:

  1. 训练成本足够低——不能每次学习都做全参数微调;
  2. 学习单元可插拔——新能力不能动摇已有知识;
  3. 可以随时回滚——学坏了能退回去。

LoRA恰好同时满足这三点。

关键转折发生在2025年10月。TML首席科学家、OpenAI联合创始人、PPO算法发明者John Schulman发表了《LoRA Without Regret》,给出了一个关键结论:在大多数后训练场景下,LoRA的样本效率和最终性能与全参数微调完全一致。他把这种情况称为"低遗憾区间"(low-regret regime),发现它覆盖了绝大多数实际的后训练任务。在强化学习场景中,即使是rank-1的LoRA(最小配置)也能匹配全参数微调的效果。

这篇论文扭转了行业对LoRA的认知:效果几乎无损,还能独立训练、独立部署、随时回滚。

Mind Lab随后在更大规模上验证了这个结论。他们在Kimi K2(总参数1.04万亿,激活326亿)上跑通了LoRA强化学习,算力压到全参数微调的约10%,训练曲线保持稳定。压缩极限也比预期更低:轻量适配模块可以压到rank-1,每层只保留一个可调方向,仍然稳定可靠。

三、产业链正在成形:基础模型 + 大量LoRA + 持续学习切换

当LoRA在效果上无损、在成本上可接受、在工程上可回滚,持续学习的产业基础就具备了。三个信号同时出现:

信号一:头部玩家押注

TML的Inkling(975B参数MoE,激活41B,原生支持文本/图像/音频,100万token上下文),发布当天就能在Tinker上微调。官方坦率承认它不是最强模型,定位就是"适合微调定制的基座"。

Mind Lab的Macaron V1采用Mixture-of-LoRA(MoL)架构:在冻结的GLM-5.2基座(744B参数)上搭载四个1B的LoRA专家,分别负责对话、Agent、编程和生成式UI。新能力以插件式LoRA加入,不动摇已有知识,不同来源的专家可以在同一个基座上组合和路由。

Sutton创办的Oak Lab方向是低成本、高效持续学习的万亿参数Agent模型。

信号二:基础设施层在跟进

Fireworks AI(估值175亿美元)已经能在一个基座模型上托管数百个LoRA,根据每次请求动态选择adapter。Together AI(刚完成8亿美元C轮,估值83亿美元)也将LoRA设为默认微调方式。

过去一年,三家后训练方向的创业公司被大厂收购:Predibase被Rubrik收购,OpenPipe被CoreWeave收购,Adaptive ML被Datadog收购。大厂的意图很明确——后训练是基础设施级的能力,值得买下来。

信号三:一个意外的发现——"群体智能"

Mind Lab在做控制实验时有一个意外发现:从相同的Qwen3-30B出发,保持训练目标和方法一致,只改变数据顺序和masking,训出一批不同的adapter。单个adapter在AIME24上准确率36.44%,198个不同adapter多数投票后提升到48.67%——而从同一个adapter重复采样只能到43.78%。

不同学习轨迹带来的差异,包含超出普通采样的互补性。模型数量本身成了一个新的scaling维度。

Mind Lab由此给了LoRA一个新定位:"持久的本地状态"。共享的基础模型管通用能力,adapter管每个具体实例的个性化行为。

四、从"数据时代"到"经验时代"

2025年4月,Sutton和David Silver联合发表《Welcome to the Era of Experience》,判断AI的下一阶段能力,主要不会再来自继续吸收人类已有的数据,而是来自Agent自己在真实环境中行动、获取反馈、持续学习。Sutton把这称为"经验时代",和之前靠人类数据喂出来的"数据时代"做了区分。

这个判断正在被验证:

  • Mind Lab商业化从7月开始,两周内实现1000万美金ARR,交付的不是推理算力,而是"让模型在客户场景中持续成长"的能力;
  • TML的Inkling发布演示中,模型自己用Tinker写微调任务、跑训练、换上新权重,全程无人插手;
  • Mind Lab的目标是"让训练模型像调用模型一样简单,会用Token就能训Token"。

方向很明确,但技术今天还没收敛。从经验中找到可靠的学习信号仍是未解问题——现实反馈延迟、模糊、难以归因,模型的自我反思可能出错;持续更新还带来了稳定性问题,新经验可能覆盖旧能力。正如梁文锋所说,目前"全世界都还没有找到好的方法"。

但趋势已经清晰:基座模型管通用智能,持续学习管场景适配。基模公司不一定自己干后训练这层活,也不一定干得最好。一批专门做后训练、帮模型和Agent变强的公司正在冒出来——Mind Lab、TML、Oak Lab走的是同一条路。

五、对从业者的启示

这场范式转变带来的几个具体信号:

  1. LoRA从"凑合用的微调技巧"升级为"持续学习的核心基础设施"。如果你在做Agent产品,需要开始思考:哪些行为值得沉淀到参数里,而不仅仅是塞进prompt。
  2. 模型数量本身成为scaling维度。不同adapter的"群体智能"意味着,在基座模型上挂的adapter越多,整体智能可能持续提升——这给Agent产品带来了新的竞争维度。
  3. 后训练产业链正在形成。基座模型、LoRA训练平台、推理时adapter路由、持续学习监控——这些以前是内部工具的东西,正在变成独立的产品和服务。
  4. 成本弹性让持续学习在商业上可成立。最小的个人级LoRA"一个人一个月的数据去训,可能就是几十美金";最大的企业级LoRA也不过几万到几十万美金。这个成本区间让中小团队也能参与。

持续学习离完全跑通还有距离,但基础设施已经摆好了。会训模型的人,正在成为Agent时代最稀缺的资源。

滚动至顶部