35B 打败万亿参数?不是参数不够大,是 Horizon 不够长
过去两年,AI 行业有一个近乎信仰的假设:模型越强,参数越大。万亿参数是豪强的入场券,千亿参数是中产的及格线,百亿参数……不好意思,你不在牌桌上。
上海 AI Lab 开源的一个 35B MoE 模型——Agents-A1,对着这个共识轻轻敲了一下。
它不是来证明"35B 就能取代万亿参数模型"——它没那个野心。它真正做的事情更根本:把 Agent 的能力竞争,从"谁的模型更大"拉到了"谁能把事情做得更长"。
论文标题说得很清楚:Scaling the Horizon, Not the Parameters。
这不是一篇给大模型唱反调的檄文。但它揭示了一个被低估的选择:Agent 能力的扩展,不只有堆参数一条路。
一、"大"的叙事正在漏气
万亿参数模型的优势是无可争议的。它们知识更密、推理更深、理解更广。在 Chatbot Arena 上跟它们对话,你会觉得"嗯,确实聪明"。
但当任务从"回答一个问题"变成"完成一个流程"——从一个想法到找资料、调工具、跑代码、看反馈、修正、再跑——大模型的表现开始出现断层。
这不是我编的。Agents-A1 的论文清晰地展示了这个现象:在长程搜索基准 GAIA 上,一个万亿参数级别的基座模型(Qwen3.5-35B 版本的搜索增强教师)得分从 59.8 飙升到 95.1——提升的不是参数,而是工具调用和搜索链条长度。
同样,在科学推理基准 FS-R 上,提升幅度从 2.5 到 54.3——不是模型变聪明了,而是它学会了在长的科学推理链条中调用外部工具、检查中间证据、验证推理步骤。
这不是一个"小模型逆袭"的故事。
这是一个"大模型的聪明在短跑里能赢,但长跑需要不同的训练方式"的故事。
二、不是堆参数,是拉链子
Agents-A1 的训练方法,本质上是在做一个转换:从训练"一个模型答对一道题",到训练"一个模型做完一个流程"。
技术路线很清晰,三阶段推进:
第一阶段:全领域 SFT。先拿多领域、高质量的长程轨迹数据做一轮监督微调,让模型在长上下文下能理解任务、遵循指令。这一步是打地基,但结果也揭示了问题——全领域 SFT 在长程搜索、工程任务上确实有提升,但在通用 Agent 任务和指令遵循上反而回落。不同推理模式之间存在冲突,统一训练不足以解决。
第二阶段:领域教师。团队把 Agent 能力拆成四块——搜索、科学推理、指令遵循、工具调用——分别针对每个领域训练专门的教师模型。搜索教师先 SFT 后 RL,GAIA 直接拉到 95.1;科学教师两阶段 SFT,FS-R 从 2.5 蹦到 54.3;指令遵循教师上两阶段 RL,LongBench V2 和 IFBench 明显提升;工具调用教师通过 SFT+RL 学会何时调用、如何纠错、何时结束。
第三阶段:多教师 On-Policy Distillation。这是论文的核心技术贡献。不是简单的 ensemble 或 MoE 路由——而是一个按领域路由的多教师蒸馏框架(Domain-Routed OPD with Salient Vocabulary Alignment),让每个领域教师直接评估学生模型自己生成的轨迹,而不是用预成对的离线数据做模仿学习。
为什么要做 OPD?因为在长程任务中,学生模型在现场生成的轨迹跟教师模型在训练集里看到的轨迹,分布可能完全不同。离线模仿学到的是一种"答案匹配",而 on-policy 蒸馏学到的是一种"过程匹配"。论文也证实,多教师 OPD 比单纯的全领域 SFT 更能缓解不同推理模式之间的冲突,既保住广泛能力覆盖,又吸收各领域专长。
支撑这三阶段的,是论文提出的知识-动作图(Knowledge-Action Graph,KAG)基础设施。KAG 不只是记录事实,而是把每一次任务的中间状态——模型查到了什么、用了什么工具、工具返回了什么、验证是否通过、失败后如何调整——全部记录下来。论文提到,这些 Agent 轨迹的平均长度约 4.5 万个 token,是典型问答对的上百倍。这种"过程级"的监督信号,是 Agents-A1 能学会长程执行能力的关键。
再配合一个 proposer-solver-verifier 的自博弈循环来持续扩增高质量轨迹数据,训练数据不再是一次性生成的,而是不断进化的。
三、框架:Scaling the Horizon
Agents-A1 的价值不在于它的跑分——跑分总是过时的。它的价值在于提示了一个框架:Agent 能力 = 底模能力 × 任务链长度 × 轨迹质量。
过去行业的注意力集中在乘数第一个因子——底模做多大。Scaling Law 驱动着万亿参数竞赛,每翻一个数量级,训练成本就跳一个台阶,推理成本也水涨船高。这是 OpenAI、Anthropic、Google 的牌桌。
但 Agents-A1 告诉我们,还有两个被低估的因子:
任务链长度。一个模型能连续做多少步决策而不偏离目标?能不能在多轮搜索、多次工具调用、多轮代码执行中保持一致性?这跟参数大小有关系,但不是线性关系——一个 35B 模型如果能处理 4.5 万 token 的轨迹,它在长程任务上的表现可能超过一个能答对单题但忘记上下文的万亿参数模型。
轨迹质量。模型在长程任务中学到的不是"记住答案",而是"记住怎么找到、验证和修正答案"。KAG 提供的不是问答对,而是带验证信号的过程记录——哪一步走对了、哪一步应该反思、证据链是否完整。这种训练数据的密度和可验证性,决定了 Agent 的泛化能力。
Scaling the Horizon 的含义是:限制 Agent 能力的瓶颈,正在从模型的知识密度,转移到模型的任务持久性和决策闭环能力。
四、框架的跨场景解释力
这个框架不只在论文里成立。把它放到当前的 AI 产品竞争中,很多现象都有了新的解释:
编程助手。Cursor、Windsurf、Copilot 的竞争焦点,已经从"代码补全多准"转移到了"能处理多长的 issue 到 PR 的闭环"。一线开发者已经开始比较各 Agent 在编一个完整的 feature 或修一个复杂的 bug 时,能在多少步内保持聚焦而不偏离。这本质上是 Horizon 之争。
Deep Research 类产品。Google 的 Deep Research、OpenAI 的 Deep Research、以及各种研究助手——它们的核心壁垒不是调用的模型有多强,而是能搜索多少轮、能交叉验证多少来源、能在多长的报告中保持逻辑一致。一个 35B 的 Agent + 好的搜索轨迹可能超过一个闭源万亿模型 + 单轮搜索。
企业 RPA。传统 RPA 靠规则脚本,AI Agent 的 RPA 靠模型理解流程。但企业流程往往跨系统、跨工具、涉及多步验证和异常处理。一个 Agent 的长程任务能力越强,它能替换的 RPA 脚本就越复杂。
科研自动化。Agents-A1 在鲸鱼叫声检测上的案例不是噱头——一个模型能在 12 小时内从简单 CNN 开始,把 AUC 从 0.58 优化到 0.9935,经历了数十轮代码修改、训练、评估、反思、再修改的循环。这种"自主科研 Agent"的能力,比它能答多难的数学题更能定义未来的科研范式。
五、落到行动
这篇文章不是在唱多 35B 模型,也不是唱空万亿参数路线。它只是想说明一件事:Agent 能力的竞争正在变得多维——参数是一个维度,Horizon 是另一个,而工具调用和数据轨迹质量是第三和第四个。
如果你是AI 应用开发者——选型时,别只看模型的 Chatbot Arena 排名,看它在你需要的任务链长度下的表现。35B 的模型如果能跑 5 万 token 的工具调用轨迹,可能比一个只有单轮问答能力的 200B 模型更适合你的场景。Agents-A1 已经开源(Apache-2.0),支持 vLLM 和 SGLang 部署,值得一试。
如果你是模型训练团队——构建高质量的长程轨迹数据基础设施,可能比简单扩大参数规模更有杠杆效应。KAG 式的过程级数据采集、自博弈扩展、多域蒸馏,这些技术方向值得认真投入。在资源有限的情况下,优化"怎么训练"比追求"多大参数"可能有更高 ROI。
如果你是技术决策者——重新理解"scaling"的含义。万亿参数的竞赛是顶级 AI 实验室的战场,但更广泛的应用层竞争发生在 Horizon 上。关注那些能拉长 Agent 执行链、提升轨迹质量、降低部署门槛的技术方向,它们可能在你们公司的应用场景里带来比模型升级更显著的回报。
跑分在变,框架在变,但核心问题没变:你的 Agent,到底能帮你做完多长的一件事?
论文:Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent(arXiv: 2606.30616)
GitHub:github.com/InternScience/Agents-A1
许可证:Apache-2.0
