大数跨境

Arena:让用户给 AI 答案投票,8 个月做到 1 亿美元年化收入

Arena:让用户给 AI 答案投票,8 个月做到 1 亿美元年化收入 Fun AI Everyday
2026-07-12
11
导读:今天分享一个还挺有趣的产品:Arena,一家做大模型测评的网站,收费 8 个月后,年化收入做到 1 亿美元。

今天分享一个还挺有趣的产品:Arena,https://arena.ai/

2023 年,UC Berkeley 的团队做出开源大模型 Vicuna 后,遇到一个问题:

AI 写邮件、写文章这类问题没有标准答案,到底怎么判断哪个模型更好?

于是,他们做了一个很简单的网站:

同一个问题交给两个匿名 AI 模型回答,用户看完直接投票选更好的那个。

这就是后来的 Arena。

2023 年 4 月上线时,Arena 只有 9 个模型。第一个星期,它就收到了 4700 张用户投票。

到 2026 年 6 月,Arena 官方披露,平台已经产生超过 7 亿次对话、8200 万张投票,每月访问用户超过 1000 万。

更夸张的是收入。

2025 年 9 月,Arena 才正式推出面向 AI 公司收费的评测服务

8 个月后,年化收入做到 1 亿美元。

一个最早让用户“给 AI 答案投票”的学生项目,8 个月把商业化收入推到这个数字,非常夸张。

所以,Arena 到底卖了什么?

一开始,他们只是想知道:Vicuna 到底行不行

Arena 最早并不是一家创业公司,它来自 UC Berkeley 的 Sky Computing Lab。

2023 年,Berkeley 团队参与开发开源大模型 Vicuna。

模型做出来以后,研究人员需要回答一个问题:

ChatGPT 相比,Vicuna 到底怎么样?

负责 Arena 的两位核心创始人 Anastasios Angelopoulos 和 Wei-Lin Chiang,当时都是 Berkeley 计算机博士项目的研究人员,两个人还是室友。

后来,他们成为 Arena 的 CEO 和 CTO。项目背后还有 Berkeley 教授 Ion Stoica 等研究者参与。

传统的大模型评测,很像考试:提前准备一套题,把模型放进去做,最后计算正确率。

但模型越来越强以后,这种方法开始遇到两个问题。

第一个是题目会变旧。

一套公开测试题发布几年以后,模型很可能已经在各种训练数据、网页和讨论中见过类似内容。

第二个问题更麻烦:很多 AI 任务,本来就没有唯一正确答案。

比如:“帮我把这封辞职邮件写得委婉一点。”

A 模型写了 300 字,B 模型写了 100 字。两封都没有事实错误。怎么打分?

再比如:

“给我的 AI 创业公司想 10 个名字。”

“把这篇文章写得更有说服力。”

“帮我设计三天东京旅行计划。”

很难拿一份标准答案逐字比对。

所以 Arena 换了一个办法。

不再让研究人员猜用户喜欢什么,直接让用户选。

Arena 最早发表的研究论文,把这套方法称为基于人类偏好的两两比较:

同一个问题,两个模型回答,用户直接选择更好的一个。

研究团队发现,这些真实用户投票与专家评审结果有较好的一致性。

方法不复杂。

复杂的是,当这个方法开始大规模运行以后,Arena 得到了一种非常难买到的数据。

真实的人,拿着自己的真实问题,在两个 AI 答案之间做出的选择。

产品只有四步:提问、盲测、投票、揭晓

现在打开 Arena,核心玩法依然很简单。

第一步,输入自己的问题。

不是 Arena 给你一道测试题,是你本来就想问 AI 的问题。

第二步,系统随机给出两个匿名模型。

你不知道左边是谁,也不知道右边是谁。这样做是为了减少品牌影响。

假设一开始就告诉用户:左边是一个刚发布的陌生模型,右边是 GPT。

很多人可能还没认真看答案,心里已经有了判断。所以 Arena 先把名字藏起来。

第三步,看答案,投票。

左边好、右边好、平局、两个都差。

第四步,投完以后,才公布模型名字。

Arena 官方说明,真正进入公开排行榜计算的,是这种匿名 Battle,也就是“对战模式”里的投票。

用户也可以自己指定两个模型并排比较,但因为模型身份已经公开,这类投票不会进入公开排行榜。

大量结果积累以后,Arena 再用统计方法给模型排名。

可以简单理解成国际象棋排名。

不是让每个模型做同一张卷子,而是不断安排比赛。

A 赢 B、B 赢 C、C 又在另外一类问题上赢了 A。

比赛越来越多,系统逐渐估算每个模型的相对表现。

Arena 目前公开的排名方法主要基于两两比较模型,同时展示排名的不确定范围,而不是简单地给一个“准确到个位数”的固定分数。

这里还有一个非常关键的数据。

Arena 官方披露,它每个月大约 70% 的用户问题都是新的

也就是说,大部分问题不是不断重复的固定题库。

昨天有人问:“Gemini 和 Claude 谁更会写 Python?”

今天可能有人上传一张设计稿,让两个模型分别写网页。

明天又有人拿一份合同问 AI。

模型很难提前背答案,这也是 Arena 和固定测试集最大的区别。

考试题是研究人员出的,Arena 的题,是每天几百万用户临时出的。

为什么用户愿意免费帮 Arena 给 AI 打分?

看到这里,你可能会有一个问题:

Arena 没有给用户发工资,为什么有这么多人愿意帮它投票?

因为对用户来说,他并不是在“做数据标注”,他只是在免费使用 AI。

假设我正在写一段代码,我本来就想问 Claude。

现在 Arena 同时给我两个答案,我反而多了一次比较。

左边的代码能跑,右边报错,我顺手点一下左边。

再比如,我让 AI 改文章。

两个版本都已经摆在面前,我本来就要选一个,点一下投票,只需要几秒钟。

Arena 官方甚至没有给投票设置现金奖励。

它认为这种没有外部报酬的投票,反而更接近用户真实判断:大家是因为真的关心自己的问题,才去比较答案。

平台上还存在大量开发者、研究人员和不同领域的专业用户,这些人很难通过普通的数据标注公司统一招募。

所以 Arena 做了一件很聪明的事情。

过去,AI 公司想收集“人更喜欢哪个答案”,通常要自己准备问题。

找标注员、培训规则、给两份答案、让标注员选择、然后按条付钱。

Arena 把顺序倒过来了:用户自己带问题进来、AI 自己回答。

用户本来就需要选一个答案,Arena 只是把这个选择动作保存下来。

一次点击没有多少价值。

8200 万次点击放在一起,价值完全不同。

后来,OpenAIGoogle 这些公司开始把新模型偷偷放进来

Arena 最早只是想评测 Vicuna。

但网站上线以后,大模型公司很快注意到了它。

原因很简单,模型公司也有同样的问题:

新模型做出来了,发布之前,怎么知道普通用户到底喜不喜欢?

一家大模型公司内部,可能同时有很多模型版本。

参数不同,提示词不同,训练数据不同,回答长度不同,安全规则也不同。

内部测试都不错,但最后只能发布一个。

以前,这种选择很大程度依赖内部测试和固定评测集。

Arena 出现以后,多了一个办法:

把模型匿名放进去,让真实用户测。

2024 年,根据报道,OpenAI、Google、Meta 和 xAI 等公司都曾在 Arena 上测试模型。

一个曾以“im-also-a-good-gpt2-chatbot”匿名出现的神秘模型,后来正式发布时,就是 GPT-4o

用户当时并不知道自己在测试 OpenAI 下一代产品。

他只是问了一个问题,看两份答案,选一个。

这对模型公司非常有价值。

因为内部员工知道自己在测试什么,专业评测人员也知道任务目标。

但 Arena 用户不知道。

一个还没有正式发布的模型,被直接扔进真实用户的问题里。

有人让它写诗,有人问代码,有人拿图片给它看,有人故意问很奇怪的问题。

这种测试很乱,但真实世界本来就很乱。

一张排行榜是免费的,模型公司为什么还愿意花钱?

这也是 Arena 商业模式里最容易误解的地方。

很多人第一次看到 Arena,会认为:它就是一个 AI 排行榜网站。

Claude 第一,Gemini 第二,GPT 第三。

把榜单做出来,然后靠广告赚钱。

不是。Arena 的公开排行榜一直免费。

真正收费的是 AI Evaluations,AI 模型评测服务

2025 年 9 月,Arena 正式推出这项商业产品,面向大模型公司、企业和开发者提供基于真实用户反馈的深度模型评测。

Arena 对这项服务的公开描述包括跟踪模型表现、分析强项和弱项,以及提供更深入的评测数据。

为什么“谁排第一”还不够?

看一个 Arena 自己做过的分析就明白了。

2024 年,Meta 发布 Llama 3。

Arena 单独分析了 Llama 3-70B 和几个头部模型的对战数据。

结果发现:

Llama 3 在开放式写作和创意问题上表现很好。但在数学和代码问题上更容易输。

问题越难,它面对头部模型的胜率下降越明显。

同时,Llama 3 的回答更加友好、更像聊天,这种表达方式也更容易获得部分用户喜欢。

对于普通用户来说,一张排行榜已经够了。

但假设你是 Meta 的模型团队。你要看的显然不只是:“我们现在排第六。”

你会继续问:

为什么是第六?用户在哪些问题上喜欢我?哪些问题上输了?是模型不会做?还是答案太长?是不是代码能力有问题?同一个模型,专家用户和普通用户的评价一样吗?不同语言有没有差异?

Arena 后来甚至单独研究搜索模型里的用户偏好。

它分析真实投票后发现,回答长度、引用数量,以及引用更具体的网页来源,都与用户偏好存在明显相关性。

这类数据,才是模型团队能拿回去改产品的东西。

所以,模型公司付的钱并不是“买 Arena 上一个好排名”。

Arena 官方明确表示,商业客户不能获得公开排行榜优待,公开模型仍按照同一套评测方法计算。

客户买的是评测。

把一个模型放进真实用户环境,收集大量比较,然后告诉团队:

用户到底在哪些地方选择了你,又在哪些地方选择了别人。

4 个月做到 3000 万美元年化收入

Arena 的商业化速度非常快。

2024 年的时候,项目团队甚至还公开表示,没有急着把 Arena 变成一家盈利公司。

当时,两位主要负责人还在忙着完成博士学业,运营排行榜本身已经占用了大量时间

2025 年,事情开始变化。

4 月,Arena 团队宣布成立公司,希望用公司化方式继续运营平台、扩充团队和支持更多模型评测。

5 月,Arena 完成 1 亿美元种子轮融资,由 a16z 和 UC Investments 领投。

9 月,AI Evaluations 正式上线。开始收费。

到了 2026 年 1 月,也就是商业产品推出大约四个月以后,Arena 的年化收入运行水平已经达到约 3000 万美元。

同一个月,公司又完成 1.5 亿美元 A 轮融资,投后估值 17 亿美元;算上此前种子轮,累计融资达到 2.5 亿美元。

再过几个月,2026 年 6 月,3000 万美元变成 1 亿美元。

Arena 官方宣布,AI Evaluations 上线八个月后,公司年化收入运行水平已经达到 1 亿美元。

为什么增长这么快?

因为它碰到的是 AI 公司现在越来越大的一个成本:

模型做得越来越多,但判断模型到底有没有变好,也越来越难。

一个大模型团队可能花大量算力训练新版本。

但训练结束不是终点,后面还要做:

评测、比较、调参数、找失败案例、再训练、再评测。

模型迭代速度越快,评测次数就越多。

Arena CEO 对外说明,目前商业收入采用按使用量计算的方式。

换句话说,客户做的评测越多、使用越深,Arena 收入越高。

它卖的不是一个人每月 99 美元的软件账号。

它卖的是模型公司反复需要的评测基础设施。

最厉害的一点:这台机器自己会越转越快

Arena 现在已经形成了一个非常清楚的循环。

先给普通用户免费用。

那用户为什么来?因为这里可以体验、比较大量前沿模型。

用户来了以后,会带来真实问题和投票。

问题和投票越来越多,Arena 的评测数据越来越丰富。

模型公司发现:这里有大量真实用户。

于是愿意把新模型、测试版本甚至未发布模型放进来。

新模型越多,用户又越想来。

毕竟很多 AI 爱好者会专门跑到 Arena 猜:“这个匿名模型到底是谁?”

用户继续增加,投票继续增加。

最后,Arena 再把基于这些真实使用产生的评测能力卖给模型公司。

免费产品带来用户,用户产生评测数据,模型公司为评测付钱,模型公司又把更新的模型带回来。

这也是为什么 Arena 的“免费排行榜”和收费业务并不冲突。

公开平台本身,就是商业产品的数据来源。

2026 年 6 月,Arena 已经披露超过 7 亿次对话和 8200 万次投票。

平台也早已不只比较文字模型,而是扩展到代码、图片、视频、搜索和 AI Agent 等不同类型的评测。

它最近上线的 Agent Mode,就是让不同 AI Agent 处理研究、写报告、做网页、调试代码等多步骤任务。

上线一个月,Agent Mode 已经达到每月超过 500 万次交互,周增长约 10%。

原因也很好理解。

以前比较两个聊天机器人,只需要问:谁回答得更好?

Agent 开始真正执行任务以后,问题变了:

谁完成了任务?用户有没有反复重试?有没有中途纠正它?最后有没有下载结果?

Arena 现在已经开始把文件下载、用户否定、重试和可控性等行为,加入 Agent 评测。

模型越复杂,评测也要越复杂。

Arena 的生意,正好跟着这个变化一起往前走。

一个不能出问题的地方:大家必须相信它

Arena 现在最大的资产,其实很脆弱。

就是:信任。

假设有一天,模型公司觉得:花钱的客户能获得更好的排行榜位置。

用户就不会再相信这个榜单,如果用户不相信,就不会认真投票。

真实数据减少,模型公司也不再需要 Arena。

所以 Arena 一边向模型公司收费,一边必须反复强调:

商业评测和公开榜单要分开。

所有公开模型按照统一规则评测。

匿名测试模型正式发布以后,排行榜分数还会先标记为“初步结果”,继续收集新的公开投票。

投票本身也存在被操纵的风险。

2025 年,一篇由 Arena 研究人员共同参与的论文专门研究了这个问题。

研究人员在离线模拟中发现,如果平台没有机器人防护和其他安全措施,攻击者可能只需要大约一千次恶意投票,就有机会明显影响排行榜。

Arena 随后加强了机器人防护、恶意用户检测、限流,并继续引入验证码和登录等措施。

这也是 Arena 和普通数据公司的区别。

一家数据公司,数据质量下降,可能只是产品变差,Arena 如果失去中立性,整个商业模式都会出问题。

因为模型公司真正愿意花钱买的,就是:

这些票确实来自真实用户,而且用户投票时不知道自己在帮谁。

以上,祝你今天开心。

【声明】内容源于网络
0
0
Fun AI Everyday
每天分享一个好玩的AI应用
内容 23
粉丝 0
Fun AI Everyday 每天分享一个好玩的AI应用
总阅读115
粉丝0
内容23