大数跨境

AI所需数据胃口越来越大,有数据公司年化收入突破20亿美元

AI所需数据胃口越来越大,有数据公司年化收入突破20亿美元 Ai时代前沿
2026-09-11
5
导读:对于AI行业之外的企业,这带来了一个新问题:它们积累的信息到底值多少钱?

不再隐藏于幕后,大模型的光芒逐渐移动到AI数据公司。它们将模型开发者与专业领域专家连接起来,由后者创建和评估用于改进AI系统的、日益专业化的数据。

这一增长发生在AI基础设施支出持续飙升之际,同时也凸显了构建先进模型中另一个日益昂贵的部分:数据本身

互联网为早期AI模型提供了海量数据,但这些数据质量已经不再合适让今天更先进的模型变得更好,难度已大幅提升。数据资产的未来价值不是简单地提供大量工人来标注数据,而是招募具有技术领域专业知识的人才,将他们与寻求改进模型的AI公司对接。围绕"AI开发者提供人类专业知识"在建立庞大的业务。

整个行业的快速增长表明,更好的模型并没有减少开发过程中对人的需求。不过,所需的人类专业能力正在发生变化。

不仅是专业知识——现有数据集也吸引了严肃兴趣

AI公司愿意为之付费的不只是专业知识。据报道,Mercor今年夏天年化总收入已超过20亿美元Handshake在今年早些时候达到了10亿美元

现有数据集也在吸引严肃的竞价。数据公司以1250万美元竞购Spirit Airlines破产后的企业数据,击败了来自Google1000万美元出价。这场不同寻常的竞价大战展现了AI数据热潮的另一面——公司不仅在花钱让人创造新的训练素材,也在关注那些无法简单从公开互联网获取的专有数据。

专有数据的价值逻辑

专有数据的价值主要在于:别人不容易拿到。主要AI开发者可以访问几乎相同的公开互联网,最大的玩家也都可以在训练和运行模型所需的算力上大笔投入。但一家公司的内部数据是另一回事——它可能是多年交易、运营和交互的产物,无法被其他公司简单复制。

随着AI开发者寻找仍能提升日益强大模型的数据,这一点变得更加重要。

我们知道网上有海量信息,但其中大部分已被广泛用于AI训练。这些数据对竞争对手同样开放。这意味着,仅靠公开数据越来越难获得竞争优势。

独特的私有数据集可能提供模型从未见过的东西。从这个意义上说,更好的AI竞争正日益变成一场"获取他人没有的信息"的竞争。

企业数据的二次价值

对于AI行业之外的企业,这带来了一个新问题:它们积累的信息到底值多少钱?

大多数企业数据的创建是为了运营业务或满足监管要求——而不是为了训练AI模型。但愿意为非常规数据集付费的买家的出现,似乎可能赋予这些信息第二个用途。

不过,将企业记录转化为AI可用的数据绝非易事。隐私限制、所有权问题和商业敏感信息,只是限制公司能够或愿意分享什么的部分挑战。

这意味着,任何数据集的有用性,也将高度取决于其质量,以及AI开发者想要实现什么目标。

即使有这些限制,数据也开始看起来越来越不像做AI生意的副产品,而更是一种拥有自己庞大市场的独特资产。

【声明】内容源于网络
0
0
Ai时代前沿
最新Ai发展动态,新闻、热门应用、未来前瞻。 助力科技企业先进技术商用落地; 协助传统企业数字化转型和智能加速。
内容 54
粉丝 0
Ai时代前沿 最新Ai发展动态,新闻、热门应用、未来前瞻。 助力科技企业先进技术商用落地; 协助传统企业数字化转型和智能加速。
总阅读676
粉丝0
内容54