WAM 在优化什么?
2026 年世界模型赛道最热的概念是 WAM(World Action Model,世界动作模型)。GigaWorld-Policy 把推理压到 85 毫秒,酷哇的 DAWN 让世界预测与动作生成在隐空间里"博弈",星源智的 ω-EVA 让机器人在动手前先预演后果。所有人都在证明同一件事:让机器人"想清楚再动"。
但动作从来不是工作的本质。让机器人"把 A 零件装到 B 位置",它要完成的不只是"移动手腕、闭合夹爪、施力 5 牛"这三步动作,而是"装好、拧紧、不伤件"这一个任务。WAM 死盯着"下一步动作对不对",却对"最后任务成不成"视而不见。
这个盲区是结构性的。WAM 本质是"动作优化器",不是"任务完成者"。它像一个极度自律的马拉松选手——每一步配速、呼吸、摆臂都精确到极致,却从没看过赛道全程:前面有坡、有折返、有补给站。
乘法效应不会骗人:一个 10 步任务,每步成功率 95%,整体只有 60%;每步 99%,整体也只有 90%。这就是展会现场 VLA 和 WAM 演示频频翻车的原因——单步看着都稳,连起来就是垮。
把"任务完成度"当成第一性指标
于是 WTM(World Task Model,世界任务模型)出现了:在联合建模世界动态与动作的同时,显式地把"任务进度 / 子目标完成度 / 最终任务成功率"作为核心监督信号。每一次动作决策,都被放在"它是否推动任务更接近完成"的天平上称量。
WTM 与 WAM 的本质差异有三点:
- 优化目标不同。WAM 优化"下一步动作是否正确";WTM 优化"整条轨迹能否成功"。
- 误差处理不同。WAM 里每一步误差独立累积,最后乘法效应爆发;WTM 里误差在任务进度空间里被"吸收"——走偏了,任务进度没涨,模型立刻调整,不会让偏差一路乘到任务结束。
- 数据真实性不同。"单步成功率 95%"在展会上会被现实打脸;WTM 直接给"任务成功率",客户一眼就能看懂,没法造假。
通俗类比:WAM 是"步步精心"的工匠,WTM 是"交房验收"的项目经理。客户付钱,是为"能住的房子"付钱,不是为"雕得匀的木头"付钱。
谁离 WTM 最近
按"距离 WTM 的距离"给典型玩家排序:
- Physical Intelligence:最接近 WTM 的 VLA 派。π0.5 引入了 high-level subtask prediction,π0.7 更进一步加了 visual subgoal images 和 episode metadata——这是在 VLA 的壳里硬塞了"任务进度 + 子目标"的显式表征。UR5e 双臂叠衣服零样本成功率 80.0%,接近人类资深远程操作员的 80.6%。PI 就差最后一步:subtask/subgoal 目前还是 conditioning 输入,没被当成联合训练的核心监督信号。
- 星源智:有 WTM 的"交互骨架",但仍是 WAM 进阶。ω-EVA 的 Envision-Verify-Act 三段式让世界模型进入动作决策闭环,还能从失败数据里学习——已经很接近"任务级反馈学习"。但它的修正闭环局限在"当前状态 + 候选动作 + 想象后果"的局部三元组里,没有显式的任务图、子目标序列、任务进度回归。1.2B 参数跑出 LIBERO 98.6%,仍是单任务评测。
- 酷哇:连续控制场景的 WAIM 强者。DAWN 的递归互修正很漂亮(NAVSIM 89.1 PDMS),但驾驶本身就是连续动作流,没有清晰的子任务边界——它和"操作任务"的 WTM 是平行宇宙。
- 极佳视界:纯 WAM 工程派。为了部署效率,推理时干脆关掉未来视频生成,把"世界"的部分都砍了。工程化最强,但离 WTM 最远。
- 橡木果:异类路径。明确"别卷 VLA 了",走"本能驱动"第三条路——端侧触觉闭环、毫秒级响应,让单步几乎不出错,从而把乘法效应的乘积逼近 1。换产时间 6–40 分钟(传统方案要数周),不靠世界模型,也拿到了"任务级可靠完成"的效果。
真正推动切换的,是甲方的账本
催化剂不在论文里,在甲方的账本里。毕马威 WAIC 报告说得很直白:投资评价已彻底脱离"比拼参数量、演示效果"的旧框架,全面转向真实场景任务完成率、陌生环境泛化能力、单位部署成本三类工程化指标。项目尽调,正从"看论文和演示"转向"看产线和订单复购"。
工厂招标文件更直接:"这条线良率能不能提 5 个点?换个 SKU 要停线多久——一周还是几分钟?这笔 CAPEX 多久能回本?"头部 3C 厂已把"任务完成度"和"换型效率"列为一票否决项。2026 上半年具身智能融资总额突破 900 亿元、同比 5 倍,钱烧到这个量级,demo 期就必须结束。这和AI Agent 融资寒冬里幸存者的逻辑一致:资本最终要的是回本,不是概念。
这就是"8 个月"的真正含义:不是技术成熟周期,而是甲方耐心的极限。监管要求年底前人形机器人必须在产线跑出常态化效果;3C 招标已经在用任务完成度投票;资本等着看回报。这些时钟叠在一起,把"任务级答案"的窗口锁在 2027 年初。这也和多 Agent 必须补上"生成—运行—检查—修复"闭环是同一个道理:可靠性只在"成品层面"才算数。
从业者现在该做什么
- 盯任务成功率,别盯单步精度。如果模型报的是"LIBERO 99%",却没人告诉你 50 步长批次端到端的通过率,这个指标在掩盖失效模式。
- 留意"进度头"的出现。WTM 化的标志信号,是显式的任务进度 / 子目标回归头进入联合训练目标。
- 按换产定价,别按演示定价。分钟级换产,才是甲方真正写进招标文件的那个数。
- 接受 WTM 是"结果"而非"某种架构"。世界模型、VLA 外壳还是本能驱动——只要它可靠地完成任务,就是事实上的 WTM。
具身智能的"玩具期"结束了,"工具期"开始了。接下来的问题不再是模型跑多快,而是它能否在真实的产线上,把那个"任务完成"的勾选上。WTM 不会在实验室里诞生,它只会在甲方的催促声中、在产线的轰鸣里,被迫长大。