今天的 Agent 能在一次会话里写代码、调工具、做计划,可一旦会话结束,经验就清零。同一类任务跑过十遍,第十一遍仍要从头规划;用户纠正过的错误、试出来的最佳路径,全部随着聊天窗口关闭而消失。
浙江大学人工智能省部共建协同创新中心开源的 HugAgentOS 把这个问题当成操作系统问题来解决。它不只是给 Agent 加一个更长的记忆模块,而是搭了一套能力沉淀系统:把执行痕迹变成可复用技能,把技能组合成默认打法,再为整个进化过程加上归因、回放与回滚。目标不是让单轮对话更聪明,而是让 Agent 越用越强。
真正要解决的问题:经验如何长成能力
HugAgentOS 团队认为,单靠长期记忆不够。经验变成能力至少要走完四步:
- 沉淀:成功执行的路径不能被埋没在聊天记录里。
- 结构化:反复奏效的路径要变成显式、可复用的资产。
- 泛化迁移:单个技能要能组合成端到端的工作流。
- 闭环反馈:改进必须可追溯、可验证、可批准、可撤销。
长期记忆只解决了第一步。HugAgentOS 把四步都内置进了 OS。
三个可自进化的引擎
1. 记忆引擎(Memory Engine)
保存执行痕迹,自动合并重复内容,逐步淡出过时信息。它不是把所有生成内容都存下来,而是把“到底发生了什么”整理成可用于下一步蒸馏的记录。
2. 技能引擎(Skill Engine)
当同一类任务反复成功,系统会把共同路径蒸馏成一个可复用的 Skill,类似一份 SKILL.md。它不仅包含检查点,还附带失败记录。以项目中的产业链调研为例,系统从历史失败中归纳出三条硬规则:未核验的企业不得进入正文表格;正面舆情不等于没有风险;专利数量不等于技术实力。
3. 编排引擎(Orchestration Engine)
真实任务往往需要多个能力配合:检索、可视化、文档生成、评审子 Agent。当这些角色以稳定方式协作成功,编排引擎会把整套组合固化成该类任务的默认打法。下一次遇到同类任务,Agent 不必从零判断该调用什么、按什么顺序调用,而是直接带着完整装备上场。
记忆 → 技能 → 编排,三级接力构成一个越用越强的飞轮。
两道关卡,防止无序进化
归因关卡:一次失败,只允许一个责任人
一次失败可能同时触发三个引擎的修复冲动:记忆引擎想记录状态,技能引擎想加核验步骤,编排引擎想换数据源。三方同时动手,结果就是互相冲突的补丁。
归因模块位于三个引擎之前,职责不是决定“怎么改”,而是裁定“该不该改、由哪一层负责”。一次失败最多只能有一个责任层;如果证据同时指向多个模块、证据强度不足,或者根因根本不在引擎之内(例如知识库缺失、模型格式限制、外部 API 变更),模块有权拒绝更新。
确认修改后,新能力也不会直接生效。系统会在隔离环境中回放历史任务,只替换这一处,其余资产版本冻结,验证结果真的变好。最终还要经用户确认才会进入正式体系,且全程可撤回。
本体关卡:为进化划定可执行边界
领域本体把行业知识写成机器可执行的规则库,包含概念、关系、约束和工作流。例如企业风险本体规定:风险事件必须有至少一个证据来源;查询企业风险必须先检索并核验企业主体。
在 LLM 执行之前,确定性门禁会检查动作是否符合本体。若 Agent 试图跳过核验直接查询风险,门禁会当场拦截,返回命中的规则编号和整改路径。该门禁不经过 LLM,毫秒级响应,不消耗 Token。新沉淀的记忆、技能和打法在正式启用前,也必须通过本体校验。
一个类比:从便利贴到可版本化的操作手册
把普通长记忆 Agent 比作一个把每次会议便利贴都留下的员工:他能找到旧笔记,但每个项目仍从零开始。
HugAgentOS 更像一本会自己更新的操作手册。每次项目都会刷新流程:成功的序列变成标准 SOP,反复配合的工具组合变成默认打法,每一项改动都经过 lightweight 的变更控制——谁负责、证据是什么、是否经过回放验证、如何撤销。
产业信号
- 从重复成本到复利资产。每完成一次任务,留下的不是聊天记录,而是可复用能力。重复任务的边际成本会随时间下降。
- 可审计性成为设计目标。归因、回放、回滚把黑箱变成了可版本控制的能力栈,这对高风险或受监管场景至关重要。
- 开放基础设施。该项目开源,意味着这种“能力沉淀 + 可控进化”的思路可能扩散到 Agent 框架、可观测性与合规工具中,而不是某一家厂商的封闭功能。
如果 2026 上半年的关键词是更大上下文窗口和更便宜推理,那么下半年的关键很可能是能力基础设施:Agent 如何记忆、如何进化、如何被约束。HugAgentOS 是这一转向的明确信号。如果你正在做 Agent 工具选型,可对照我们整理的 Agent 工具清单 和 Manus 实测 一起看。
如何上手
- 代码仓库:github.com/ZJU-REAL/HugAgentOS
- 桌面端下载:GitHub Releases(支持 Windows、macOS、Linux)
- 项目官网:hugagentos.com
建议从一个重复任务开始,例如每周行业扫描或竞品简报,跑 5–10 次后查看技能库中蒸馏出的 Skill,再打开归因关卡并定义一条领域约束(例如“每条风险结论必须附带来源”)。重点不是替代 LLM,而是把 LLM 的输出沉淀成团队可拥有、可审查、可复用的资产。