大数跨境

真实工作流,正在成为下一代训练数据

真实工作流,正在成为下一代训练数据 海外独角兽
2026-07-22
6
导读:Real-world Data 背后的创业机会


编译:Celia

编辑:Siqi



近期与多家 AI Labs 及数据公司的交流显示出一个显著趋势:Real-world Data(企业真实工作流产生的数据)正成为新的训练刚需。

相比已充分挖掘的互联网数据,这仍是一座待开采的富矿。当前市场呈现明显的供需错配:模型公司通常"MLE-rich、Data-poor",而企业则恰恰相反,是"Data-rich、MLE-poor"。

在此背景下,市场上涌现出两类互补的公司形态:

• Human Data Company:服务模型实验室,提供高质量数据。

• RLaS (RL-as-a-Service) Company:服务企业,将业务流程转化为可训练的模型环境。本质是提供外包 MLE 咨询、Agent 系统搭建及 Post-training 服务。

本文整理了关于该数据赛道的 20 条核心观察与复盘,旨在为从业者提供一线视角的深度参考。




数据市场是一门冲浪生意

1.数据市场具有周期性迭代特征。数据需求长期存在,但随着模型能力瓶颈的突破,“高价值数据”的类型与形态不断演变,市场玩家需紧随训练范式的更迭。

2.每一轮新需求都造就新赢家。Scale AI 抓住了自动驾驶与早期 LLM 标注机遇;Mercor、Surge AI 等赶上了专家数据浪潮;随着训练转向真实工作流,Protege、Sunset、SF Data 等新势力正在崛起。老牌玩家如 Mercor 和 Handshake 也开始布局企业数据故事以卡位下一轮浪潮。

3.新一波浪潮:Real-world Data。Frontier Labs 的预算重点已从专家标注转向 RL 环境,进而聚焦真实世界数据。核心驱动力在于"Long Horizon"(长程任务)是模型进化的关键。任务单元正从单次代码修改升级为文件、代码库乃至整个项目。真实项目中复杂的历史状态、工具依赖和组织规则难以在沙盒中凭空构建,迫使实验室采购真实数据。

4.市场远未饱和,供应链将细化。尽管淘金热升温,但供给仍未跑赢需求。大量白领工作、企业流程和专业知识尚未转化为可训练数据或环境。未来将涌现更多围绕“数据生产”和“环境生产”的公司,甚至出现企业数据中介等新型中间层,形成更成熟的细分供应链。

如何做好一家数据公司

1.数据来源的两类划分:

• Type 1:真实工作捕获数据。接近“工作过程录像”,如 Session replay、屏幕操作及内部协作记录。优质 Type 1 数据不仅记录动作,更能还原意图。GitHub 的 Commit message、Issue 及解决过程即为典型,完整保留了问题从出现到解决的全链路逻辑。

• Type 2:人为构造数据。当前多数 Human Data 公司的模式:寻找专家→设计任务→在特定环境中执行→收集并加工结果。此类数据适合预训练或早期能力爬坡,但在处理长链路、高价值任务时,Type 1 数据的重要性日益凸显。

鉴于纯 Type 1 数据获取难度大,现实可行的路径是实现Type 1.5(让 Type 2 更像 Type 1),具体措施包括:

  • 长期绑定少量高质量专家,使其理解 Reward Shaping 及训练逻辑;
  • 重构激励机制,防止人类标注员进行 Reward Hacking;
  • 建立多层 QA 体系:运营 QA 外包、ML 工程师 QA 运营,并将检查方法工程化(异常检测、行为分析、训练效果反向验证)。

2.核心指标:Hillclimbability(爬坡能力)。设计训练任务的关键不在于让模型完全失败,而在于将任务卡在模型能力边界上,使其既有挑战性又能通过训练逐步优化。例如,Pass@1=0% 但 Pass@32=30% 的任务具有高训练价值,而 Pass@256 仍为 0% 的任务则往往缺乏意义。

3.当前市场的四大痛点:

  • 数据失真:Type 2 数据常被包装成 Type 1;
  • Eval 失真:供应商刻意增加评估难度以制造提升空间假象;
  • QA 不可规模化:过度依赖人力堆叠而非工程化质检;
  • 需求传递失真:Researcher 与供应商之间存在沟通磨损。

4.赢得信任的三大能力:

  • Data Taste:精准把握数据质量;
  • Research Taste:洞察模型瓶颈并匹配对应数据类型;
  • Scalability:在规模扩张后仍能维持高质量交付。

证明方式包括发布 Benchmark、展示实际训练提升效果以及提供可审计的数据血缘(Data Lineage)。

5.公司 DNA 判断:偏 Type 2 的公司重项目管理与运营(卖人力),频繁招聘 SPL;偏 Type 1 的公司重技术与工程(建工厂),主要招聘 Technical Staff。随着价值向 Type 1 迁移,Type 2 的窗口期可能仅剩两年。

RL 如何持续进化

1.RL Environment 的定义。指模型能够进入、调用工具、完成任务并接受奖励的软件环境。以销售 Agent 为例,其环境需包含模拟的 CRM、邮箱、数据库等,并根据预设规则对任务完成度、风险判断合理性等进行评分。

2.环境与任务的四大演变趋势:

  • 空间变大:Agent 穿梭于多个环境之间;
  • 工具变活:调用输出不确定的工具(如另一个 SOTA 模型),需学会参数控制与结果验证;
  • 组织变复杂:多 Agent 协作,Reward 需综合考量成本与延迟;
  • 任务边界上移:从单一动作训练升级为全流程规划与编排。

3.最适合学习的数据特征。基于 Jason Wei 的 Verifier's Law,任务的可验证性决定了训练效率。可验证性涵盖七个维度(见图)。

4.关键挑战:环境重置与 Sample Efficiency。Coding 适合 RL 是因为环境易复制重置。而真实世界(如创业、投资)反馈慢、因果模糊且不可重复。未来 AI 必须提高样本效率,从少量经历中提取可迁移规律。

5.提升样本效率的两条路径:

• 思路 1: OPSD (On-Policy Self-Distillation)。一种“经验压缩”机制。利用积累了完整上下文记忆的“老员工模型”作为 Teacher,指导基础模型(Student)学习决策策略,而非简单复述记录。这将稀疏的现实反馈转化为密集的训练信号。

• 思路 2: Dreaming。一种“经验展开”机制。模型基于已有经历构建内部 World Model,并在其中进行大量模拟推演(如设想不同的谈判策略)。类似人类的复盘与想象,通过内部模拟实现 Test-time Training,大幅提升学习效率。

企业要自训模型吗?

1.企业 Post-train 的驱动力。目前主要出于两点:一是通用模型无法理解企业独特偏好(如客服场景的特定规则);二是成本考量,通过自研模型以 Capex 换 Opex,降低长期推理成本并避免受制于人。

2.决策公式。是否自训取决于四个乘数:数据独特性 × Eval 清晰度 × 任务频率 × 单次改善价值。任一因子趋近于零,投资均难成立。DoorDash 菜单录入即为典型案例,利用内部数据 RL 专用小模型以符合业务标准。

3.应用公司的优势。

  • 占据真实工作流入口,天然拥有高质量 Agentic Trajectory Data;
  • 任务领域窄,无需顾虑跨领域泛化导致的灾难性遗忘,可高效进行专项 RL。

4.非 Coding 领域的 Agentic 数据价值。此类数据稀缺且珍贵。即便缺乏硬 Reward,用户行为中的隐性偏好(如成功/失败、接受/拒绝、修改幅度等)也可整理为 Preference Pair,用于 DPO 等训练方法。

Reference

To Build an RL Envs and Human Data Startup | Sean Cai

The next big breakthrough will be AIs learning on the job | Dwarkesh Patel

Stanford MS&E 435: Economics of the AI Supercycle, Enterprise Internal Knowledge | Yash Patil


排版:陈宇聪

【声明】内容源于网络
0
0
海外独角兽
各类跨境出海行业相关资讯
内容 393
粉丝 0
海外独角兽 各类跨境出海行业相关资讯
总阅读22.1k
粉丝0
内容393