编译:Celia
编辑:Siqi
数据市场是一门冲浪生意
1.数据市场具有周期性迭代特征。数据需求长期存在,但随着模型能力瓶颈的突破,“高价值数据”的类型与形态不断演变,市场玩家需紧随训练范式的更迭。
2.每一轮新需求都造就新赢家。Scale AI 抓住了自动驾驶与早期 LLM 标注机遇;Mercor、Surge AI 等赶上了专家数据浪潮;随着训练转向真实工作流,Protege、Sunset、SF Data 等新势力正在崛起。老牌玩家如 Mercor 和 Handshake 也开始布局企业数据故事以卡位下一轮浪潮。
3.新一波浪潮:Real-world Data。Frontier Labs 的预算重点已从专家标注转向 RL 环境,进而聚焦真实世界数据。核心驱动力在于"Long Horizon"(长程任务)是模型进化的关键。任务单元正从单次代码修改升级为文件、代码库乃至整个项目。真实项目中复杂的历史状态、工具依赖和组织规则难以在沙盒中凭空构建,迫使实验室采购真实数据。
4.市场远未饱和,供应链将细化。尽管淘金热升温,但供给仍未跑赢需求。大量白领工作、企业流程和专业知识尚未转化为可训练数据或环境。未来将涌现更多围绕“数据生产”和“环境生产”的公司,甚至出现企业数据中介等新型中间层,形成更成熟的细分供应链。
如何做好一家数据公司
1.数据来源的两类划分:
• Type 1:真实工作捕获数据。接近“工作过程录像”,如 Session replay、屏幕操作及内部协作记录。优质 Type 1 数据不仅记录动作,更能还原意图。GitHub 的 Commit message、Issue 及解决过程即为典型,完整保留了问题从出现到解决的全链路逻辑。
• Type 2:人为构造数据。当前多数 Human Data 公司的模式:寻找专家→设计任务→在特定环境中执行→收集并加工结果。此类数据适合预训练或早期能力爬坡,但在处理长链路、高价值任务时,Type 1 数据的重要性日益凸显。
鉴于纯 Type 1 数据获取难度大,现实可行的路径是实现Type 1.5(让 Type 2 更像 Type 1),具体措施包括:
- 长期绑定少量高质量专家,使其理解 Reward Shaping 及训练逻辑;
- 重构激励机制,防止人类标注员进行 Reward Hacking;
- 建立多层 QA 体系:运营 QA 外包、ML 工程师 QA 运营,并将检查方法工程化(异常检测、行为分析、训练效果反向验证)。
2.核心指标:Hillclimbability(爬坡能力)。设计训练任务的关键不在于让模型完全失败,而在于将任务卡在模型能力边界上,使其既有挑战性又能通过训练逐步优化。例如,Pass@1=0% 但 Pass@32=30% 的任务具有高训练价值,而 Pass@256 仍为 0% 的任务则往往缺乏意义。
3.当前市场的四大痛点:
- 数据失真:Type 2 数据常被包装成 Type 1;
- Eval 失真:供应商刻意增加评估难度以制造提升空间假象;
- QA 不可规模化:过度依赖人力堆叠而非工程化质检;
- 需求传递失真:Researcher 与供应商之间存在沟通磨损。
4.赢得信任的三大能力:
- Data Taste:精准把握数据质量;
- Research Taste:洞察模型瓶颈并匹配对应数据类型;
- Scalability:在规模扩张后仍能维持高质量交付。
证明方式包括发布 Benchmark、展示实际训练提升效果以及提供可审计的数据血缘(Data Lineage)。
5.公司 DNA 判断:偏 Type 2 的公司重项目管理与运营(卖人力),频繁招聘 SPL;偏 Type 1 的公司重技术与工程(建工厂),主要招聘 Technical Staff。随着价值向 Type 1 迁移,Type 2 的窗口期可能仅剩两年。
RL 如何持续进化
1.RL Environment 的定义。指模型能够进入、调用工具、完成任务并接受奖励的软件环境。以销售 Agent 为例,其环境需包含模拟的 CRM、邮箱、数据库等,并根据预设规则对任务完成度、风险判断合理性等进行评分。
2.环境与任务的四大演变趋势:
- 空间变大:Agent 穿梭于多个环境之间;
- 工具变活:调用输出不确定的工具(如另一个 SOTA 模型),需学会参数控制与结果验证;
- 组织变复杂:多 Agent 协作,Reward 需综合考量成本与延迟;
- 任务边界上移:从单一动作训练升级为全流程规划与编排。
3.最适合学习的数据特征。基于 Jason Wei 的 Verifier's Law,任务的可验证性决定了训练效率。可验证性涵盖七个维度(见图)。
4.关键挑战:环境重置与 Sample Efficiency。Coding 适合 RL 是因为环境易复制重置。而真实世界(如创业、投资)反馈慢、因果模糊且不可重复。未来 AI 必须提高样本效率,从少量经历中提取可迁移规律。
5.提升样本效率的两条路径:
• 思路 1: OPSD (On-Policy Self-Distillation)。一种“经验压缩”机制。利用积累了完整上下文记忆的“老员工模型”作为 Teacher,指导基础模型(Student)学习决策策略,而非简单复述记录。这将稀疏的现实反馈转化为密集的训练信号。
• 思路 2: Dreaming。一种“经验展开”机制。模型基于已有经历构建内部 World Model,并在其中进行大量模拟推演(如设想不同的谈判策略)。类似人类的复盘与想象,通过内部模拟实现 Test-time Training,大幅提升学习效率。
企业要自训模型吗?
1.企业 Post-train 的驱动力。目前主要出于两点:一是通用模型无法理解企业独特偏好(如客服场景的特定规则);二是成本考量,通过自研模型以 Capex 换 Opex,降低长期推理成本并避免受制于人。
2.决策公式。是否自训取决于四个乘数:数据独特性 × Eval 清晰度 × 任务频率 × 单次改善价值。任一因子趋近于零,投资均难成立。DoorDash 菜单录入即为典型案例,利用内部数据 RL 专用小模型以符合业务标准。
3.应用公司的优势。
- 占据真实工作流入口,天然拥有高质量 Agentic Trajectory Data;
- 任务领域窄,无需顾虑跨领域泛化导致的灾难性遗忘,可高效进行专项 RL。
4.非 Coding 领域的 Agentic 数据价值。此类数据稀缺且珍贵。即便缺乏硬 Reward,用户行为中的隐性偏好(如成功/失败、接受/拒绝、修改幅度等)也可整理为 Preference Pair,用于 DPO 等训练方法。
排版:陈宇聪

