模型越来越强、token 越来越便宜,那 AI 的下一个瓶颈会是什么?在 AGI Playground 2026 圆桌上,Axiom Math CTO Shubho Sangupta、Radixark 核心成员鲍科、SoTALab 联合创始人于林希给出的答案高度一致:可验证。一旦 AI 真正进入生产环境,核心问题就不再是「模型能不能给个好答案」,而是「系统能否在可预测的成本与延迟下,稳定、可重复、可追溯地交付结果」。
这背后是一个价值迁移的判断:当生成能力被商品化,真正的护城河不再来自模型本身,而是向上移动,落在「保证结果正确」的那一层。两家公司的路径刚好互补——Axiom Math 把形式化验证嵌进 AI 推理的每一步,用确定性工具对抗模型的捷径行为;Radixark 则扎根推理基础设施层,围绕 SGLang 优化长任务智能体在生产环境中的稳定性与效率。
长任务智能体的隐藏成本
鲍科描述了生产现场的真实变化:单次任务越来越长、调用链越来越复杂,端到端正确性和稳定性成了最被关心的事。客户先要 benchmark 确认模型能输出正确答案、function calling 可靠,上线前再做大量压测,确保线上不崩溃不卡死。体验层面则设 SLO,盯首 token 延迟和 token 间隔,并在自有的硬件上压吞吐。
Shubho 给出了数学场景的同款问题。定理证明 agent 运行时间极长、上下文极大,因为数学本质就是搜索和回溯:分解定理、探索、回退。上下文超出单个模型的容量后,你必须判断哪些推理属于模型、哪些属于 agent 框架,以及何时喊停——「这条路走不通,解法可能别处」。他预测超长时长的 coding agent 很快会撞上同样的墙。
两条构建信任的路线
两条路线互补而非对立。Axiom Math 从形式化验证切入,回答「结果到底对不对」;Radixark 在推理基建层回答「系统能不能便宜、可靠地把正确结果交付出来」。合在一起,正好勾勒出新的产业结构:模型沦为商品化输入,可防御的价值沉淀在结果层——上面是验证,下面是基础设施。
对工程团队的实际启示
- 为验证而非仅生成本付费。 错误答案贵,就把预算投给 checker、评测器和确定性工具,而不是再买一次基座模型调用。
- 把搜索与回退状态显式做进 agent。 长任务要能判断何时放弃路径——这段逻辑属于框架层,要和模型推理清晰分离。
- 围绕可靠性 SLO 优化,而非只看原始质量。 生产买家为延迟与稳定性定价,不只是 benchmark 分数。
- 押注让验证变便宜的基础设施。 能稳住长任务工作负载的推理栈,正是可验证时代的底层助力。
一句话:过去两年是生成的故事,接下来两年是可验证结果的故事。在能保证正确性的那一层做文章,就是站在价值迁移的方向上。
