2026年,物理AI领域最不缺的就是宏大叙事。黄仁勋在CES上17次提及物理AI,全球一季度融资超过64亿美元,从英伟达的GR00T N1.6到小鹏的X-Foresight、吉利的WAM,各路玩家都在拥挤的技术路线上抢位。但一个尴尬的事实正在发酵:机器人会空翻、能跳舞,到了真实的厨房却打翻沙拉碗。
翻车的本质,不是机器人不够聪明,而是它连「眼前有什么」都看不太懂。
6月27日至29日,一家不太引起媒体轰动的中国AI公司——杭州联汇科技(Om AI联汇)——连续三天发布了三款模型组成的VLX系列。三名发布会,三款模型,对应三个朴素的技术目标:持续感知、精准定位、行动执行。
这套模型背后藏着一个反直觉的论断:物理AI目前最紧迫的技术瓶颈,不在「大脑」的推理深度,也不在「想象力」的预测能力,而在最基础的感知环节——AI能否像人一样持续地、主动地观察世界。
一、主流路线遗漏的那个"感知盲区"
物理AI目前的技术地图早已不是空白。VLA(视觉-语言-动作模型)负责说人话、做决策,世界模型负责提前模拟动作后果、验证可行性。两条主线都在快速收敛,产业界甚至已开始讨论VLA与世界模型的融合路径。
但所有人的目光都集中在「决策」和「预测」两个环节,却默契地跳过了一个更前置的问题:AI的感知,从根本上就是断断续续的。
当前主流的多模态模型处理视频的方式,本质上仍然是「翻连环画」——截一帧、分析一次、回答一次,下一帧来了再重新来一遍。每截一次帧,模型的上下文就断一次。如果用户在视频播放过程中突然提问,模型只能基于当前帧作答,对之前发生了什么一无所知。
这种「按帧索骥」的感知方式,在数字AI的对话场景下够用——用户问一句,模型答一句,交互的发起方永远是用户。但在物理世界里,环境不会暂停。无人机在飞,机器狗在走,摄像头一直在记录。AI没有权利说「你等一下,我先算算」,因为物理世界的每一帧之间都可能发生重要变化——一个障碍物突然出现、一个工具被移动了位置、一个人走进了危险区域。
如果感知本身就是断层的,决策再聪明也没有用——你在用正确的方式处理错误的信息,结果仍然是错误的。
这是VLX要解决的问题,也是它最容易被人低估的地方。
二、VLX三连:从持续感知到直接行动
VLX系列不是一个单模型,而是三款模型组成的完整能力链:VLX-Flow、VLX-Seek、VLX-Go,恰好对应物理世界智能体的三个基础能力——持续看、精准找、直接动。
VLX-Flow:让AI真正「在线」
Flow这个名字起得很准确——核心不是换个更强的视觉编码器,而是把模型处理信息的方式从「截帧」改成「流式」。
具体怎么做?其实非常工程化:视频被切分成连续的小块,每来一块就增量编码,然后更新模型的内部记忆。这个记忆分两层——一层视觉缓存保留近期的画面细节,一层语义记忆维护长程上下文。当用户提问时,模型不再需要从头重看整个视频,而是从已经维护好的记忆里直接作答。
单路视频的处理延迟最低0.06秒。同时处理多路视频也不会堆积,因为增量更新的计算量是恒定的,不随视频时长增长而增长。
相比之下,传统视频理解的延迟是随视频长度线性增长的——截的帧越多,重处理的计算量越大,响应就越慢。这在离线分析场景下可以容忍,但对实时物理设备而言,每一毫秒的延迟都可能意味着撞上墙或者错过目标。
VLX-Flow的核心创新不在算法指标的突破,而在一个「管道改造」式的工程选择:把模型从「等用户提问才加载上下文」改为「自己一直在线维护上下文」。
这个区别,决定了AI是手机应用还是物理设备的大脑。
VLX-Seek:从「猜坐标」到「选区域」
即使模型能持续感知,它也面临第二个问题:知道不远处有个东西,但说不准那东西在哪。
传统方法让模型直接输出坐标——X、Y、宽、高——本质上是在一张图上让模型「猜坐标」。猜对猜错全凭参数拟合,在小样本场景下稳定性堪忧。
VLX-Seek换了一个思路:不输出坐标,而是从预定义的候选区域中「选」出正确区域。把连续回归问题转化为离散检索问题。
这不是一个无关紧要的实现细节。两者的区别就像:一个足球运动员要在不看球门的情况下盲射,和他在球门面前选择一个方向踢进去。候选区域的质量决定了上限,但选择比生成要稳定得多。
结果也很直接:VLX-Seek能用更小的模型规模、更少的数据量,达到更高的定位精度。这在端侧设备上意义重大——工业级无人机和巡检机器人的嵌入式芯片根本撑不起几十B参数的巨量模型,但一个经过合理设计的0.6B-10B模型,配上区域检索的范式,反而能做出稳定的精度。
这对物理AI行业提出了一个值得思考的问题:我们是不是太喜欢「大而全」的暴利解决了?有时候「小而准」比「大而全」更值钱。
VLX-Go:直接给航点,不输出建议
人能感知、能定位之后,下一步是行动。传统VLA模型的输出是文本(「往左走」「向前两米」),然后由控制系统再把这些文本翻译成电机指令。这个「翻译」环节里藏着很多不确定性。
VLX-Go的路线是:直接输出短时航点,即机器人可以直接执行的路径坐标轨迹。用「航点预测+离线轨迹学习+在线RL优化」替代「文本建议+控制解释」。
更关键的是,VLX-Go的参数规模只有0.6B。它不参与深度推理,只参与实时响应。这起到的效果恰好是——它知道自己能做多少事、做事的边界在哪里,不会越俎代庖。
这三个模型的共同出发点是同一件事:端侧的硬件条件不可回避——算力有限、功耗受限、延迟必须确定。面对这样的约束,它们没有选择「把云端模型压缩塞进去」,而是反过来:先在端侧的边界内做能力最大化的原生架构设计。
三、「端侧原生」vs「云端压缩」——两种物理AI哲学
这引出一个核心框架:物理AI的模型部署当前存在两条截然不同的路线。
路线一:云端压缩。先在大算力集群上训练一个巨大的模型,再通过蒸馏、剪枝、量化等方式把它压缩到能在端侧跑的大小。这条路的好处是上限高——云端模型可以做最重的推理、吸收最全的知识。但问题也很直接:压缩过程不可避免地损失能力;当模型能力被压缩到端侧可接受的范围时,它在物理世界中的表现往往是「看起来什么都懂,但现场什么都做不好」。
路线二:端侧原生。先在端侧算力的天花板内设计模型架构——你只有那么点算力、那么点功耗预算、那么点允许的延迟——然后在边界内做能力最大化。这条路的上限受限于硬件条件,但稳定性极强。因为模型从一开始就没有依赖云端的算力和带宽,它在现场的所有决策都是本地完成的,不会受网络波动、延迟抖动影响。
Om AI联汇的VLX选择了路线二。这不是什么秘密——它的CEO赵天成在采访中说过,公司做的是「通用物理AI大脑」,目标是让不同的终端通过统一协议接入,像插USB一样即插即用。
框架的命名:「端侧原生 vs 云端压缩」。
这个框架不只适用于AI视觉模型。把它迁移到Edge Computing、IoT、自动驾驶的感知模块,甚至移动端应用开发中,几乎都能看到相似的抉择:是先做大的再压缩,还是直接在边界内做最优解。
这个选择没有绝对的对错。当算力充分、带宽充足、延迟容忍度大时,云端压缩是高效的。但当物理世界的三大约束——时间连续、环境动态、端侧算力受限——同时叠加时,端侧原生设计的价值反而被低估了。
四、框架的推演:物理AI行业存在一个「倒置的优先级」
用「端侧原生 vs 云端压缩」这个框架去重新审视物理AI行业当前的技术路线选择,会发现一个有意思的现象。
几乎所有头部玩家都在做大算力的云端推理——英伟达的Alpamayo、特斯拉的Optimus路线的底层、World Labs的空间智能——这些项目的算力消耗动辄百卡小时级别。它们解决的是「AI在物理世界中能有多聪明」的问题。
但Om AI联汇选择了解决一个更基础的问题:「AI在物理世界中能不能稳定地待着」。
这里有一个行业优先级倒置的可能。物理AI在展示环节可以依赖预设编排、可控环境、充足的云端算力。但在真实部署中——一个工厂的无人机、一个地铁工地的巡逻机器人、一个跨区域的巡检系统——网络断连是常态、算力天花板是硬约束、延迟的不确定性是致命伤。
在这个层面,端侧原生的价值被严重低估了。不是所有终端设备都需要「深度推理」。工业巡检机器人需要的不是看懂复杂的人类行为,而是在规定的路线内稳定地发现异常、标记位置、触发告警。0.6B的模型如果做得好这件事,它的产业价值可能远超100B模型在实验室中的演示。
这是VLX带来的最大思考:物理AI的行业优先级有没有被扭曲?当所有人都在往上堆算力、堆参数、堆模型规模时,有没有人在想「让现有的硬件先稳定工作」这个朴素的目标 ?
五、落到行动
对于物理AI的从业者,VLX提供一个值得参考的坐标:
- 如果你做终端设备(无人机/机器人/安防摄像头):不要满足于拿云模型跑演示。测一下端侧推理的延迟稳定性——如果你必须等到画面回传到云端才能做决策,那这个产品永远锁定在可控环境中。
- 如果你做AI视觉模型:考虑一下端侧原生这条路。先蹲在硬件的边界内设计架构,再寻求能力最大化,可能比先做大量级再做压缩更务实。
- 如果你做物理AI技术投资:不要只盯着参数规模和演示效果。追问一个简单的问题:没有网络的时候它还能干活吗?如果答案是不能,那它适合做发布会PPT,但不适合部署到真正的物理世界。
物理AI还是一场格局未定的马拉松。有人押注大脑的深度推理,有人下注想象力的预测能力。但Om AI联汇的选择提出了一个更加朴素的问题:在你开始思考之前,能不能先看明白眼前的世界?
对物理AI而言,「一直在线」的感知能力,或许比「偶尔聪明」的推理能力更有产业价值。
参考来源:
