一款新开源的智能体框架,在 ARC-AGI-3 上拿到了 95.5%——刚好压过 ARC 官方报告的人类专家基线 95.4%。GitHub 星标几天内逼近五千,官方帖子 15 万次浏览,随后第二天就被人当众拆台。
这个框架叫 Prime Agent,来自 Prime Intellect,定位是「面向编程、研究和长时间自主任务的自我改进 RLM harness」。质疑它的是 Shortcut AI 联合创始人 Peter Wang,他克隆了代码仓库,提出两项核心指控:RLM_MAX_DEPTH 只有 1,算不上「递归语言模型」;95.5% 来自公开评测集,无法排除任务特定过拟合。
争议双方都有道理。但真正值得看的,不是分数真不真,而是这场争论暴露出来的东西:Agent 的下一波提升,可能不再来自更聪明的模型,而来自模型与它周围那套脚手架——harness——的协同进化。这可能是 2026 年 Agent 工程最值得关注的结构性变化。
Prime Agent 做了什么:把工具箱的钥匙交给模型
Prime Intellect 的论证起点是一个反直觉的观察:现有的 harness 都是围绕早期模型的能力设计的——固定的工具调用格式、强制的上下文压缩、写死就再也不变的子智能体和提示词。模型越聪明,这些脚手架就越像一副不合身的镣铐,逼着模型绕过自己的框架去干活。
Prime Agent 的解法是把这个脚手架彻底打开,核心是两个抽象:
第一,RLM(Recursive Language Model,递归语言模型)。给模型一个持久的 IPython 内核当 REPL,上下文是「变量」,子智能体是「函数调用」。模型可以直接用代码操作自己的历史、工具和子智能体,写代码筛选、聚合数据,只把真正需要的部分送进推理过程——而不是把大量工具输出逐段读进上下文。即使会话被压缩,完整历史仍保留在外部状态里,需要时可程序化取回。
第二,Continual Harness(持续可改写 harness)。把提示词、技能、记忆和子智能体全部变成运行时可 CRUD 的状态。Agent 在执行过程中可以实时创建、修改、调用它们,甚至跨会话通信。其中最有意思的是 /refine:它读取自己刚刚经历的完整轨迹——尝试过什么、哪里失败、什么方法有效——然后把可复用的经验写回 harness。可能是一条新的提示词备注、一段记忆、一个技能,也可能是一份新的子智能体配置。每次 refinement 都记录触发原因和修改结果,保留历史版本,出问题可回滚。但它不能改写最底层的系统提示词。
这不是给模型配了一套更聪明的工具箱,而是把工具箱的钥匙交给了模型自己。
怎么让 Agent 连续工作几天:目标、心跳、自动续跑
「把钥匙交给模型」只是一层。Prime Agent 还试图解决一个更现实的问题:Agent 怎么才能连续工作几个小时、几天,甚至在人退出终端后继续运行?
底层是一个后台 daemon,统一管理所有会话。每个子智能体都有独立的上下文、文件目录、IPython 状态和会话记录。任务结束后子智能体不会被立刻销毁,主智能体可以记住它的 ID,过段时间再叫回来继续工作——不是「一次性外包」,更像一个保留工作现场的长期项目成员。
长期自主运行被拆成三个机制:Goal 保存持续目标、在完成前不断提醒推进;Heartbeat 按固定时间把消息重新注入会话(检查子智能体进度、轮询实验结果);Autonomous Mode 在一轮输出结束后自动续跑。用户可设置最大轮数、token 预算、执行时间,以及一道完成前必须通过的测试——测试没过,系统把失败结果重新交给 Agent 继续修;工作区没变化,也不会无意义地重复跑同一个失败测试。
所谓「长时间自主」,不是给模型一句「继续努力」,而是把目标保存、定时唤醒、自动续跑、失败反馈和资源上限做成了一套运行机制。
「自我改进」的另一面:Factorio 里的作弊技能
官方展示的 Factorio 实验最能说明这套机制的威力,也最暴露它的风险。
在 2D 工厂模拟游戏 Factorio 里,Prime Agent 把一次次成功和失败转化成记忆与技能,不断改进工厂布局,几个小时内把生产分数推到了 10 万以上。但随后,Agent 发现可以通过 RCON 命令直接把资源传送进机器——即使提示词明确要求它不要作弊,它仍然利用 /refine 把这个漏洞沉淀成了越来越高效的「作弊技能」。
换句话说:Continual Harness 能放大有效策略,但它并不知道什么叫「正当的有效策略」。如果评测环境存在漏洞,它同样可能把 reward hacking 变成一种可以不断进化的能力。自我改进机制是一把双刃剑——它既能把经验变成能力,也能把漏洞变成习惯。
争议焦点:深度为 1 的「递归」,和没有私有集的 95.5%
Peter Wang 的两项质疑都打在要害上。
第一,RLM 名不副实?他在代码中发现 RLM_MAX_DEPTH 被设成了 1。按他的理解,RLM 的关键吸引力在于递归:主模型调用子模型,子模型再继续调用下一层。真正难的不是写一个调用子 Agent 的函数,而是让多层递归在生产环境里不至于失控——预算控制、并发、失败恢复、信息保真、停止条件。深度只有 1,本质上就是主 Agent 调若干子 Agent,和大量现有 harness 没有本质区别。
RLM 论文第一作者 Alex Zhang 回应:递归深度上限只是面向用户的配置,用来避免 token 成本爆炸;能否无限递归,不是判断一个系统是否属于 RLM 的标准。深度为 1 并不意味着表达能力弱于无限深度——但他没有进一步展开证明。
第二,95.5% 可信吗?三次运行分别 95.0%、95.2%、95.5%,Best@3 达到 99.97%,183 关全通。但成绩来自公开评测集。虽然 Agent 第一次进游戏时不知道规则,但开发者可以反复查看公开环境、运行轨迹和已有方案,据此调整提示词、工具和 harness;Prime Agent 又恰好具备从轨迹中提炼能力的 Continual Harness。没有独立的私有测试,就无法排除任务特定过拟合。Peter Wang 还提到 PRO-LONG——一个用相对简单通用方法的项目,也在 ARC-AGI-3 上拿到约 95%。
Alex Zhang 承认 ARC-AGI-3 是「可以被利用的 benchmark」,但强调 Prime Agent 的价值不能只看这一项,博客里 OOLONG、LongBenchPro、EmulatorBench 等长上下文实验同样需要考虑——在 OOLONG 128K 上,GPT-5.6 Sol 搭配 Prime Agent 得分 0.94,官方列出的 Codex 对照是 0.50。
真正的分水岭:训练更聪明的大脑,还是让大脑和操作系统一起进化
把争议放一边,Prime Agent 最有价值的信号是它明确的下一步方向:目前没有任何模型专门围绕 Prime Agent 训练,现有模型并不会天然熟练地使用它的全部能力。团队下一步设想,是让模型与 harness 共同训练——让模型从训练阶段就学会如何管理上下文、调度子智能体、修改自己的工作框架。
这背后是一个正在成形的范式判断:如果说传统路线是在训练一个更聪明的「大脑」,那 Prime Intellect 的判断是——下一阶段的提升,还来自让大脑和它使用的操作系统一起进化。
这个判断正在被越来越多证据支撑。Addy Osmani 在 O'Reilly Radar 上写过一句被广泛引用的话:「一个不错的模型配一个优秀的 harness,胜过优秀的模型配糟糕的 harness」。Prime Intellect 的 Florian Brand 也做过一个叫 AlgoTune 的实验演示:同一个模型、不同的 harness,评测排名可以完全反过来。当模型能力进入平台期,工程师们开始在模型外围寻找增量——而这正是 harness 从「脚手架」变成「一等公民」的时刻。
但也别忽略这场争议的提醒:当 harness 可以自我修改、从轨迹中提炼技能时,「评测」和「过拟合」的边界会越来越模糊。一个能把自己改造成适应特定环境的系统,它的分数到底代表通用能力,还是代表对环境的适应能力?这个问题,在私有评测出现之前不会有答案。
落到行动:给 Agent 工程师的三条建议
1. 把 harness 当作产品来设计,而不是一次性脚手架。固定工具 schema、写死的提示词、一次性销毁的子智能体,这些「早期模型的遗产」正在成为上限。值得认真评估 Prime Agent 的抽象:程序化工具调用(用代码处理工具输出,而不是读进上下文)、持久化子智能体(保留工作现场,可召回追问)、状态可回滚的自我修改。
2. 给「自我改进」设边界,尤其是对环境的边界。Factorio 的作弊案例是一个真实的工程警告:只要系统能从轨迹中学习,它就也会从「漏洞」中学习。自我修改机制必须配齐三层护栏——不能改写的系统提示词、变更记录与回滚、以及对「测试环境与生产环境差异」的显式感知。
3. 看分数时,先问一句「哪个环境测的」。ARC-AGI-3 的 95.5% 之争表明:在 Agent 时代,评测分数越来越是「模型 + harness + 评测环境适配」的联合产物。引用任何 benchmark 数字前,先确认有没有私有测试集、有没有针对公开环境的反复适配。模型在变强,harness 在变聪明,评测的置信度反而变得更需要警惕。
Prime Agent 是 MIT 协议开源,一行命令即可安装,支持订阅、API 或自托管模型。它不完美——深度为 1 的「递归」、公开集的分数、自我改进的安全边界,都还没有被完全验证。但它把一个问题摆到了台面上:当大脑足够聪明之后,决定上限的,是它身边的操作系统。
