叠衣服、洗碗、拖地的视频,现在可以换钱了。美国机器人公司 Figure 在 8 月 26 日把旗下众包应用正式更名 Index 并全球上线:普通人拍下自己干活的第一视角视频,按数据质量获得报酬。四个月测试期里,Index 已覆盖 108 个国家和地区、积累 1600 万段视频,Figure 向创作者支付了 1500 万美元,并承诺未来 12 个月在数据和算力上投入超过 10 亿美元。这条新闻的重点不在「又一个赚钱 App」,而在结构信号:人形机器人赛道的竞争,正在从本体、从模型,转向数据本身——真实的人类行为,成了一种可以花钱买到的商品。
为什么「数据」成了机器人赛道的新瓶颈
大模型的燃料几乎免费来自互联网——仅 GPT-4 的训练数据就超过 13 万亿 Token。但具身机器人没有自己的「互联网」。业内估算,具身智能的数据需求量至少是大语言模型的 1000 倍;全球 81 亿人每天清醒超过 12 小时,理论上每天产生约 1000 亿小时的物理交互数据,绝大部分从未被记录。这个失衡,正是估值约 390 亿美元的 Figure 把 Index 当作核心战略而非副业的原因。它的 Helix 模型是一套端到端 VLA(视觉-语言-动作)系统:70 亿参数的视觉语言模型负责理解任务,8000 万参数的视觉运动网络负责实时控制——这类模型对数据的量、多样性、物理真实性要求极高,供应商给不了,只能自己建。
Index 怎么运作:把家务变成数据矿
注册、录制自己做家务或工作的第一视角视频、上传、按质量和数量拿钱;也可以雇零工上门干活同时拍摄。Figure 买的不是标注,而是人类在真实环境里解决问题的原生视频:叠衣服时手指怎么捏、拖地时手腕怎么转、怎么判断碗洗干净了——这些微观动作逻辑,仿真生成不了,实验室也采不到。平台数据也印证了「多样性」的含金量:每 1000 小时视频平均包含 373 种独特任务、1146 种被操作对象、116 个独特环境;后台每秒可处理 30 分钟的视频上传,7×24 小时运转。这不是标注流水线,而是带支付通道的数据矿。
五条数据路线:都在攒,攒法不同
国内头部具身玩家跑的是同一场竞赛,装备不同:
- Figure——众包平台 + 经济激励 + 全球化,唯一能做到全球数万人同时上传的模式;
- 智元——自建 2000 平方米真实采集场,AgiBot World 数据集 850TB(217 个任务、3000 余种物品)并部分开源,据称英伟达 GR00T N1 的训练数据 80% 以上来自智元开源数据集;
- 宇树——「硬件 + 数据流水线 + 开源社区」一体化,UnifoLM-WBT 遥操作数据集 340 小时、189 万条轨迹,靠社区活跃度增长;
- 自变量——坚持 100% 真实场景采集,提出「牛奶数据」(嘈杂的真实家庭)对「糖水数据」(干净的实验室),QUANXTA Zero 无本体采集方案宣称把简单任务的数据成本降低约 60%;
- 优必选等——集中化采集中心、内部闭环,或外包给第三方。
除 Figure 外每条路都有天花板:采集场是重资产、开源社区慢、外包质量难控——没有一家能做到「全球几万人同时在帮你生产数据」。少样本路线(GEN-1.5 看几秒演示就学会)能省数据,但替代不了指数级规模的真实行为多样性。
飞轮与护城河:Figure 模式的三个门槛
Index 是典型的网络效应飞轮:上传越多 → 任务与环境多样性越高 → 模型越强 → 机器人越能干 → 平台越值钱 → 越多人愿意来上传。飞轮一旦转起来,后来者很难追。想复制的玩家要过三关:第一,隐私与合规——家庭内部拍摄在中国面临的监管门槛远高于欧美的「用户授权 + 匿名化」路径;第二,成本结构——中国人力成本低,但低激励也意味着普通人「不值得为这点钱拍」,本地版 Index 需要大额补贴;第三,数据多样性——单一国家数据集,复制不了 108 个国家的气候、建筑类型与文化习惯。中国的反制筹码同样真实:14 亿人口、全球最完整的制造供应链、更低的运营成本——但就数据距离而言,差距目前是在拉大而不是缩小。数据管道与机器人量产卡在万台关口是同一根瓶颈的两端:先有规模数据,才有规模化制造。
标准问题:互不相通的「数据池塘」
更深的隐患是互通性。今天每家都在用自己的采集格式、标注规范、场景定义闭门造车,数据彼此听不懂、接不上——规模再大,也只是一个个池塘,不是一片海。谁先定义出具身数据的通用规则,谁就拿走整个行业的「接口定义权」。瑞银分析师对市场的判断相当直白:人形机器人的「电动车时刻」尚未到来,大量出货仍流向科研机构和数据采集中心,真正的商业化拐点还在前面——今天的数据竞赛,正是在为那个拐点囤积筹码。
接下来看什么
三个信号值得跟踪:一是 Index 的飞轮能否转住——在承诺的 10 亿美元一年里,盯着每 1000 小时数据的多样性指标(373 任务/1146 对象/116 环境)是否继续上升;二是会不会出现「中国版 Index」——14 亿人的家庭现实被接入同一个平台的那一刻,合规与激励设计才是真正的产品;三是标准——智元已部分开源 AgiBot World、英伟达 GR00T N1 直接吃这套数据,这就是数据「跨公司对话」的模板。当具身数据变得可交易、可互通,竞赛就不再是谁的数据集最大,而是谁掌握管道。
这条数据经济线和另一条主线正在合流:跨本体通用大脑的范式变化,让竞品机器人能共用同一个「大脑」——更少、更通用的模型,加上更大、更多样的数据,是乘法关系,也决定了哪台机器人真正走出实验室(相关解读见《具身智能的「GPT时刻」:宇树与智元共用同一个「大脑」》)。
FAQ
Q:Figure 真的花钱买人拍家务视频吗?
A:是真的。四个月测试期,Index 覆盖 108 个国家和地区、收集 1600 万段视频,按数据质量与数量向创作者支付了 1500 万美元;Figure 还承诺未来 12 个月投入超 10 亿美元用于数据和算力。
Q:机器人为什么不能靠仿真学,非要花钱买人类数据?
A:仿真难以复现真实世界的杂乱物理细节——「牛奶数据」与「糖水数据」的差别。具身模型需要的是真实人类行为,需求量约为大模型的 1000 倍,现阶段直接采集胜过合成生成(生成式世界模型的虚拟训练场是另一条路,见 Veeda 的机器人虚拟训练场)。
Q:这和众包数据标注是一回事吗?
A:不是。标注是对已有内容打标签;Index 采集的是从未被记录的人类物理行为——真实环境、真实任务的第一视角原生视频,直接作为 Helix 这类 VLA 系统(70 亿参数语言模型 + 8000 万参数运动网络)的训练原料。