作者丨元元
图源丨midjourney
AI 数据或许是本轮 AI 浪潮中最被低估的赛道。
Menlo Ventures 合伙人 Deedy 近期发布的 AI 训练数据公司全景图显示,图中收录的 28 家创业公司合计年收入约 85 亿美元,总估值近 1000 亿美元。从收入规模看,训练数据已成为继算力和大模型之后,AI 产业第三大细分领域。
该赛道正经历爆发式增长。Mercor 在九个月内收入增长三倍,规模翻四番;原为招聘平台的 Handshake 切入 AI 数据业务后,一年内收入激增百倍。目前,Scale AI、Surge AI、Mercor 和 Handshake 四家头部企业占据了全行业超四分之三的收入份额。
短短一年,AI 训练数据不仅孕育出近百亿美元市场,更诞生了多家十亿美元级营收公司。为何该赛道今年突然爆发?其背后的商业逻辑与趋势值得深究。
数据公司集体“印钞”的底层逻辑
数据公司营收激增的核心原因,在于数据在模型训练中的角色发生了根本性转变:从一次性投入的原材料,演变为持续消耗的燃料。
在大模型发展早期,数据采购多为项目制,交付周期长,导致数据公司收入呈现脉冲式特征。然而,随着模型迭代节奏显著加快,这一模式被彻底打破。从 GPT-4 到 GPT-4o 间隔 13 个月,而至 2026 年,GPT-5 系列模型的迭代间隔已缩短至一个月;Anthropic 推出旗舰模型的间隔甚至仅为 11 天。
迭代加速迫使实验室频繁发现能力缺口,对“新增、针对性、高价值数据”的需求从年度项目转变为日常动作。供给端随之升级,如 Scale AI 已将交付模式从按月打包升级为 API 按需交付,最快一小时即可提供生产级标签数据。
除频次提升外,单位需求的数据体量也在膨胀。以代码智能体为例,训练范围从单一语言的十几个项目扩展至四种语言的四十多个项目;单条样本的信息密度从几百个 token 激增至数万个 token,涵盖需求理解、多文件定位及测试验证等完整流程。频次、场景复杂度与单条数据权重的三重叠加,将训练数据总需求量推高了一个数量级。
与此同时,数据价格水涨船高。标注人员从众包工人升级为博士、律师等专家,时薪从几美元提升至近百美元。更重要的是,数据公司与模型研发的结合日益紧密,从单纯的人力外包转向承担部分研发、评测及工程服务工作。这种深度参与带来了显著的服务溢价,使得 Mercor、Scale AI 等企业的毛利率远超传统人力外包公司,最高可达 50% 以上。
当数据直接决定模型能力上限,其定价权与行业天花板便被彻底打开。
AI 数据的两大核心趋势
除了市场规模扩张,AI 数据行业在供给侧也呈现出两大显著趋势。
趋势一:真实工作流数据取代人工标注
业内将训练数据分为两类:由专家完成的人工设计任务(Type 2)和从真实业务中捕获的数据(Type 1)。过去主流供给为 Type 2,但随着模型能力提升,Type 1 数据的边际收益快速上升。模型已学会“做题”,现在亟需学习真实世界的工作流程。
GitHub 作为全球最大的 Type 1 数据宝库,其完整的代码提交记录验证了这一路径的价值。为此,供给端开始主动制造 Type 1 数据源。Handshake 通过组织自由职业者上传原生文档及直接采购企业运营数据,激进地布局这一领域;Protege、Sunset 等新玩家则专注于将企业内部工作流数据加工为可训练格式。
以医疗数据为例,Protege 通过提前聚合数据源、利用 AI 精筛高价值阳性样本、以及合规打包授权等三步策略,将原本需数月甚至一年的采购周期压缩至 30 天,成为连接数据持有方与模型厂商的关键基础设施。
趋势二:RL 环境取代静态数据集
强化学习(RL)环境正成为实验室采购重点。如果说静态数据集是课本,RL 环境则是供 AI 自主探索、试错的训练场。这一变化标志着 AI 从“对话时代”迈入“智能体时代”,完成任务的能力需在动态环境中习得。
目前市场存在两种玩法:一是模型厂商自建,如 OpenAI 搭建数百个网站环境训练 Agent,Anthropic 计划年投入超 10 亿美元;二是外包给专业数据公司。Mercor 收购软件仿真公司 Deeptune,复刻 Excel、Salesforce 等办公沙盒环境,计划在短期内将 RL 环境业务收入提升至千万美元级别。
头部玩家的战略分化
面对底层逻辑的变迁,四家头部公司基于自身资源禀赋,选择了不同的演进路径,但目标一致:从“数据供应商”向价值链深处迁移。
Scale AI:向下游延伸,打造政企 AI 总包商
依托深厚的数据集优势,Scale AI 不再局限于数据生意,转而为客户开发内部 AI 应用。其企业级应用业务年化收入已达 2 亿美元,预计将成为公司最大收入来源。
Surge AI:向上游走,专注高端精品
Surge AI 坚持不做众包,仅服务于 OpenAI、Google 等五家顶级实验室,专注于高难度的 RLHF 和安全评估。这家仅百人的公司以极高的客单价实现了 12 亿美元的营收。
Mercor:横向扩张,构建全球专家网络
作为最年轻的独角兽,Mercor 建立了覆盖全球的博士、律师及科学家专家网络,并收购 Deeptune 布局 RL 环境,形成“专家数据 + 仿真环境”的双轮驱动。
Handshake:深耕管道,垄断供需两端
凭借 12 年积累的求职者与企业资源,Handshake 充当纯粹的数据管道,一边组织职场人上传原生数据,一边采购企业运营数据。在 Type 1 数据稀缺的当下,掌握供给两端的管道位置极具战略价值。
综上所述,单纯的数据标注正沦为价值链中利润最薄的一环,行业整体正向更高附加值环节迁移。正如上一代互联网巨头的边界由数据决定,本轮 AI 竞赛中,数据已不再是副产品,而是一门独立且奔向千亿美元的宏大生意。




