数据市场正在转向:企业真实工作流,为何成了下一代训练数据的核心战场?

数据市场正在转向:企业真实工作流,为何成了下一代训练数据的核心战场?

如果只用一个问题来理解今天 AI 行业最隐蔽的结构性变化,我会问:「最有价值的训练数据」现在长什么样?

两年前的答案是「高质量人工标注」,一年前的答案是「专家 Chain-of-Thought」,而今天,答案正在变成——企业的真实工作流。

这不是一个渐进的变化。它触及了模型训练范式的底层逻辑,也决定了未来三年哪些公司会崛起、哪些会被淘汰。


一、破题:数据是一门「冲浪生意」

AI 行业有一个容易被忽视的规律:数据市场的赢家始终在换。每当模型的能力瓶颈被突破一个,最值钱的数据就会换一种形态。

回顾一下:

  • Scale AI 抓住了自动驾驶和早期 LLM 的数据标注机会
  • Mercor、Surge AI 赶上了专家数据(Expert Data)浪潮
  • 今天,当训练范式进一步转向 Long-Horizon Tasks,风向标正在指向真实工作流数据(Real-World Data)

Reasoning 和 Long-Horizon 是模型进步最关键的主线方向。模型处理任务的单位,正在从「一次代码修改」上升到「一个文件」、「一个 codebase」,最终是「一个完整项目」。任务越长,人工搭建模拟环境就越难。因为真实项目里充满了历史状态、工具依赖、组织规则和意外分支——这些细节很难靠专家坐在沙盒里凭空编出来。

于是,Frontier Labs 开始采购真实世界的数据。


二、拆解:数据的两种「质地」

要理解这个转变,先要理解今天市场上的数据其实分两种质地:

Type 1:从真实工作中捕获的数据

它比较接近「工作过程录像」——Session Replay、屏幕操作、公司内部协作记录。最好的 Type 1 数据不仅记录动作,还能还原动作背后的意图。

GitHub 就是一个很好的例子。Commit message、Issue 和 Ticket Resolution 串在一起,几乎完整保留了一个问题从出现到解决的全过程:一个人想解决什么、尝试了哪些修改、为什么这样改、最终是否被接受。这是天然的 Type 1 数据宝库。

Type 2:人为构造的数据

这是今天绝大部分 Human Data 公司在做的事情:找领域专家 → 人工设计任务 → 让专家在沙盒里完成工作 → 收集结果 → 加工成可训练格式。

Type 2 适合预训练和早期能力爬坡。但它的天花板很明显:模拟环境永远无法完全复现真实世界的复杂性。当你需要模型理解一个企业内部的审批流程、跨部门协作节奏、或者某个特定行业的潜规则时,Type 1 是不可替代的。

现实中最可行的路线是 Type 1.5:把 Type 2 做得更像 Type 1。核心手段包括:长期绑定少量高质量专家并让他们理解训练逻辑、重新设计激励机制防止 Reward Hacking、设计多层 QA 体系并逐步工程化。


三、建框架:判断数据质量的三把尺子

一个数据供应商能否获得 Model Labs 的信任,取决于三种能力:

1. Data Taste——是否真正知道好数据长什么样。这不是玄学,而是能否区分「看起来对的数据」和「模型真正需要的数据」。

2. Research Taste——知道模型现在卡在哪里,也知道该为此寻找什么类型的数据。这一点尤其稀缺,因为大部分数据供应商不懂模型训练,大部分研究员不懂数据生产。

3. Scalability——能否在规模扩大后维持同样质量。很多公司在 Demo 阶段会找最好的专家、创始人亲自盯项目、叠加大量人工 QA,小规模交付看起来非常漂亮。但这不代表它们能把同样的质量复制 10 倍、100 倍。

判断一家数据公司是「卖人力」还是「建工厂」,一个简单的指标是看招聘结构:

  • 频繁招 SPL(Special Project Leads)= 不断接订单、扩团队、做定制交付 → 卖人力
  • 只招「Members of Technical Staff」= 重点放在数据工程、环境工程和 QA 自动化 → 建工厂

如果数据价值继续向 Type 1 迁移,Type 2 模式的窗口可能只剩两年。

「爬坡能力」才是核心指标

很多公司设计训练任务时的逻辑是——「只要我做出一个模型不会的任务,就证明这里有价值。」但问题在于,设计一个让前沿模型做不出来的任务并不难。难的是让任务刚好卡在模型能力边界上。

可以设想两种情景:

  • 值得训练: Pass@1 = 0%,Pass@32 = 30%。模型一次做不对,但探索 32 次后有 30% 概率成功。这说明模型已经偶尔摸到正确路径,只是还不稳定。
  • 不值得训练: Pass@1 = 0%,Pass@256 = 0%。尝试 256 次依然没有一次成功,说明任务远超模型能力,或者任务本身太偏门。

这个框架——Hillclimbability(爬坡能力)——远比「模型会不会做」更能衡量数据的训练价值。


四、推演:RL 环境的四个进化方向

当模型从「回答问题」进化到「完成任务」,训练范式必然从 Supervised Fine-Tuning 转向 强化学习(RL)。而 RL 环境本身,正在朝四个方向剧烈演变:

1. 空间变大。 一个 Agent 不再只在一个沙盒里完成所有工作,而是能穿梭于多个环境。一个销售运营 Agent 可能需要同时操作 CRM、邮箱、客户数据库、审批系统。

2. 工具变活。 未来 Agent 可能直接调用输出不确定的工具——环境中的「搜索工具」可能是另一个 SOTA 模型。Agent 要学会控制参数、判断结果和交叉验证。

3. 组织变复杂。 复杂任务会由一个 Agent 拆解给多个 Sub-Agent,再统一汇总。Reward 不仅要衡量任务是否完成,还要考虑成本和延迟。同样的结果,40 分钟完成和 3 分钟完成,商业价值完全不同。

4. 任务边界上移。 模型变强后,原来需要拆成 20 步的任务可能变成 1 步就能做好。RL Env 的训练目标也会不断上移——从执行一个动作,到完成一个子流程,再到规划和编排一整套工作流。

Coding 为什么天然适合 RL?

Jason Wei 提出过一个 Verifier's Law:训练 AI 解决某个任务的容易程度,与该任务的可验证性成正比。

Coding 特别适合强化学习,不只是因为有清晰的 Reward Signal,更因为整个环境很容易复制、并行和重置。一个代码仓库可以复制成上万个 Container,模型可以不断改代码、跑测试、失败后重来。

但真实世界没有这么多存档点。创业、管理、投资、法律、销售——这些领域都有「结果」,但很难开出一万个平行世界让模型反复尝试。

这就是为什么未来 AI 要进入真实世界,不能永远依赖暴力刷题。它必须提高自己的 Sample Efficiency——从少量、不可重复、反馈模糊的经历中,快速提取可迁移的规律。这仍然是人类相对模型最明显的优势之一。


五、落到行动:如果你是创业者或 CTO

这套框架可以转化为三个具体的决策问题:

1. 你的企业需要自己 Post-Train 模型吗?

自己 Post-Train 本质上是用 Capex 换 Opex——用一次性训练成本替代长期重复的推理开销。这笔账能不能算过来,取决于四个乘数的乘积:

数据独特性 × Eval 清晰度 × 任务频率 × 单次改善价值

其中任何一个乘数接近于零,这笔投资就很难成立。

2. 你是数据公司吗?

如果数据价值向 Type 1 迁移的趋势成立,那么今天只有 Type 2 能力但没有 Type 1 路线图的公司,窗口期可能不到两年。如果你是 VC,不应该投资一家对 Type 1 没有任何规划的数据公司。

3. 你是 AI 使用者吗?

当真实工作流本身成为训练数据,这意味着:你每天的工作方式,正在变成模型的能力。谁在工作中沉淀更多结构化的高质量操作轨迹(代码、文档、决策记录、流程复盘),谁就在无形中为自家模型积累数据护城河。


数据市场的逻辑正在从「找更多人标注」转向「从真实工作中提取」。这背后的驱动力不是技术理想,而是经济理性——当训练转向 Long-Horizon 任务时,人工搭建环境的成本指数级上升,而真实世界的数据已经在那里了,只差一个有效的采集和转化管道。

这个管道,将是未来两三年最值得关注的 AI 基础设施机会。

滚动至顶部