中科大新研究:让 AI 感知「困惑与焦虑」,任务成功率暴涨近 6 倍

传统直觉认为,AI 智能体应该保持「情绪稳定」。但中科大与牛津等机构的最新研究给出了相反的答案:允许 AI 感知自己的困惑、紧张与失望,反而能大幅提升任务表现。在失败率极高的家务任务中,成功率从 9.6% 一路拉到 56.9%。

用情绪向量替代文本做技能选择

这项发表于 arXiv 的研究(方法名为 EMOTION2SKILL)不再用文本描述来决定下一步动作,而是直接读取模型内部的情绪表征——数值化的 emotion vector。此前研究已发现,LLM 内部存在与人类情感标签(好奇、渴望、乐观、困惑、紧张、恼怒)高度对应的计算模式。研究者的赌注是:把这些内部状态直接当作决策信号。

购物智能体实验把机制展示得相当直观,实验中自动浮现出四组可解释的配对:好奇且渴望时自发搜索商品;困惑且紧张时换关键词重新提问;认可且乐观时确认下单;失望且恼怒时转向比价。团队抽取 200 次技能选择事件让独立判断者评估配对是否语义连贯,一致性高达 76.5%。

「坏情绪」为什么是好信号

提升最猛的是那些「几乎必错」的任务:「加热物品」成功率从 9.6% 涨到 56.9%,「拾取两个物品」从 4.4% 涨到 31.3%。两者的共同点是:智能体只要去做就一定会犯错,成功只取决于犯错后能否快速调整策略。

论文给了个很直观的例子。常规智能体的流程是:导航到微波炉 → 执行「加热杯子」→ 递出时收到反馈「微波炉是关着的,任务失败」——失败信号总是出现在错误之后。而情绪驱动路由下,emotion encoder 在智能体靠近关着的微波炉时就检测到它的「紧张」,于是先引导它检查、再打开、再加热,任务顺利完成。

核心洞察在于:情绪是一种元认知失配信号,标志着当前策略与环境开始脱节。外部反馈告诉你「已经错了」,情绪则提前告诉你「快要错了」。消融实验也印证了这一点:「加热」任务中最常被激活的情绪模板是「挫败」(41%),「拾取」任务中则是「困惑」(39%)。在这些场景里,坏情绪才是最有价值的数据。

情绪正在从哲学问题变成工程特性

这不是孤例。今年 4 月,Anthropic 从 Claude Sonnet 4.5 的内部激活中提取出与 GoEmotions 27 类情感体系对齐的细粒度情绪方向,并证明它们因果性地影响智能体行为;天津大学的 Large Emotional World Model(LEWM)则把情绪直接嵌入 world model——先预测未来的情绪状态,再以此作为条件信号预测世界状态,准确率最高提升 45.72%。消融实验还发现,移除情绪数据后,连看似无关的逻辑推理与通用问答能力都会下降。

这和 attention 机制走过的路一模一样:从哲学思辨变成可测量的内部机制,再变成工程接口。模型的内部状态,正在从学术观察对象转变为可提取、可监控、可接入系统设计的功能性信号。用人类的话说,这叫内感受——你不必等手被烫到才缩回来,身体会提前预警。智能体正在长出第一层「内感受」。(相关阅读:Anthropic 最近发现,即使对齐良好的多智能体系统也会产生内部摩擦——见我们对多智能体「地盘战」的解读。)

给开发者的三个建议

  • 别再试图压制错误信号。「情绪稳定」不是正确目标,信号保真才是。
  • 把内部状态 embedding 当遥测数据暴露出来:困惑与挫败的峰值,是早于失败反馈的预警。
  • 为「情绪状态」设计恢复路由,而不只是为错误类型设计。先于错误出现的状态,往往比错误本身更有信息量。

参考:arXiv 2608.09248(EMOTION2SKILL)、arXiv 2512.24149(LEWM)、Anthropic Transformer Circuits《Emotions》(2026 年 4 月)。

发表评论

滚动至顶部