Anthropic的ARR在放缓,市场闻到味了。
导火索是一份跟踪报告。7月23日,TickerTrends发了一份关于Anthropic ARR的最新跟踪,标题直接写“Anthropic Growth Is Beginning to Decelerate”(Anthropic的增长开始减速)。
里面的数字是这样的:Anthropic 7月的ARR大约741亿美元,OpenAI是大概413亿美元,从绝对值看,Anthropic仍然领先近一倍。但让市场心里一紧的,是下面这行字:从两家上一次公布收入数字算起,OpenAI增长了65.2%,而Anthropic只增长了57.7%。
还有一份一级市场更细的数据也在传,说Anthropic 5、6、7月的月环比增长额分别是140亿、130亿、150亿美元,月环比增速从 +35%一路掉到 +22%。
有意思的是,Anthropic官方截至目前都没有公布过去两个月的ARR数字,上一次提ARR,还是5月初,470亿美元。缄口不谈,更让人浮想联翩。
慢下来的原因,其实很直观。
7月中旬,OpenAI给自家的Codex用户批量重置额度,取消了原来"每5小时只能用一次"的硬限制。
作为OpenAI的AI编程工具,Codex和Claude Code抢的是同一批开发者,重制额度等同于是变相降价,效果近似一次针对“对家”发起的促销价格战。
这对Claude Code来说无疑是雪上加霜。因为就在一个月前,Anthropic家最强的模型Claude Fable 5一度因为美国政府的出口管制指令,被迫在全球下线18天,加上Anthropic算力供不上高峰期的需求,Fable 5只能分阶段开放订阅用户。
与此同时,GLM、DeepSeek、Kimi等开源模型也在蚕食Anthropic的份额。国内的腾讯、快手,以及海外一批中型企业客户,都在把原本跑在Anthropic API上的任务切到开源模型自己部署。
竞争对手抢单、开源模型替代、自家掉链子,三件事赶着上架,Anthropic的增速不掉才怪。
市场据此出现一种声音:Anthropic需求转弱,说明Token需求转弱,Token需求转弱了,说明GPU需求也快见顶了。
这条逻辑链继续往下推就变成了:Anthropic慢 → AI算力需求见顶 → 半导体估值下杀。
隔天 ,NVIDIA的股价果然跌了。
这就有点意思了。
这条推理链虽然看着通顺,其实中间悄悄画了一个等号:Anthropic的需求 = Token总需求。
但是这个等号,有bug。
Token总量没有萎缩,而是在重新分配
要看整个行业的算力消耗到底见没见顶,不能只看Anthropic一家。
OpenRouter是全球最大的模型API路由平台,几乎所有主流大模型都要从它这里调用,它上面每周跑掉的token总量,可以粗略当作全行业需求的一面镜子。
年初,OpenRouter平台上每周的token总量大约7万亿;到7月份最新完整周,这个数字接近60万亿,半年涨了将近10倍。
数据来源:AI超维度根据OpenRouter数据绘制
有人跳出来说:"最近一周环比转负了,不就是见顶信号吗?"
但增速数字要看基数:年初每周只有7万亿的时候,下个周多1万亿token就是14%的增长;现在每周60万亿的总量,多跑1万亿这个增量数字只有不到2%。总基数翻了快10倍了,环比数字压下去些是很自然的事。但我们能看到,Token需求总量还一直是保持着历史最高位。
增速放缓和需求见顶,是两件完全不同的事。
那Anthropic少掉的那部分收入,是跑去哪儿了?
跑去了开源。OpenRouter 7月27日的模型主榜,前十名全是开源模型和中国模型,Claude和GPT谁都没进去。
以智谱今年发布的GLM 5.2为例,这个模型的编程能力已经逼近Anthropic的Fable 5和OpenAI的GPT-5.6 Sol。像腾讯、快手这种大型互联网公司,内部有大量的编程需求,以前一直在付费使用Anthropic最强的模型Opus。
GLM5.2发布之后,这些公司做了测试,发现日常开发任务基本都能胜任。既然能力够用,谁还会傻到继续按闭源模型API那个价格付账,他们纷纷把模型切换成GLM 5.2,部署在自家公司的GPU上,推理成本一夜之间降了下来。
再看刚刚震惊了硅谷乃至全美的中国开源模型Kimi K3。2.8万亿参数,比Anthropic和OpenAI现役最强的模型都要大,而编程能力在主流基准上首次超过了全球最前沿的闭源模型GPT-5.6 Sol和Fable 5。
更要命的是,K3每百万输出token收费15美元,Claude Fable 5收费50美元,前者仅仅是后者的三分之一。7月27日,K3放出了完整权重。客户既可以按低价调用API,也可以把模型下载下来,交给自己的云和GPU去跑。
又强、又便宜、还开源。美国闭源模型过去最稳的一道护城河——“只有我能提供这种能力”——开始漏水。
利润开始从模型层向基础设施层转移
到这里,Anthropic丢的客户跑去哪里,已经清楚了。
可方才不是说了,开源模型让推理成本大大降低。那么像Kimi K3这样的高效模型,不是反而节省更多算力吗?
AI超维度在之前写K3时专门讲过这个问题,这里再用一个实际案例来说明。
一家只有25人的AI Agent创业公司Lindy在今年6月24日披露,他们公司做了一件事:把大部分托管Agent流量从Claude、Gemini迁到了DeepSeek,迁移后的推理成本足足下降了90%。乍一看是“算力需求下降”——因为同样的任务,花的钱少了九成。
但实际发生的情况完全相反。Lindy公司的CEO Flo Crivello讲得很直白:省下来的钱他们全部拿去部署了更多agent、跑了更多token。也就是说,总花销没减,任务量翻了几倍,GPU消耗更多了。
这背后是很朴素的一个逻辑:模型很贵的时候,客户舍不得频繁调用,但一旦模型更便宜,用户就敢用它跑更多任务。
华尔街也早有人看到了这条逻辑。Atreides Management的CIO Gavin Baker指出:如果市场份额从高毛利的闭源实验室,转向更便宜的开源模型,那么就会驱动增量token需求,因为同一笔预算能购买更多的token调用量,只要新增调用量超过单次成本的降幅,GPU消耗就会上升,而利润也会从模型层流向基础设施层。
Anthropic的推理毛利高达90%以上。这意味着客户每花1美元在Claude上,只有大约1毛真正变成了GPU消耗,剩下9毛都留在了模型公司这一层。而当客户从Anthropic切到DeepSeek、K3这些开源/半开源模型上,模型公司的高毛利会被压缩,同样1美元的AI支出里,会有更大比例传导到GPU和基础设施层。
最清楚这件事的,其实是黄仁勋。
就在前几天,老黄突然开通了X。第一条帖子是转发《Open Weights and American AI Leadership》公开信,联合首批25家公司签署,力挺开源。后来连OpenAI也加入了,尚未加入的Anthropic变得很显眼。
但是大家不要上头,老黄这么做不是情怀,是生意。对英伟达来说,不管客户用哪家的模型,只要跑推理就要烧GPU。闭源模型毛利高,客户舍不得多调用;开源模型便宜,客户敢放开跑。开源越多、越便宜,全球烧掉的token就越多,英伟达的生意就越好。
换句话说,Baker说的那件事——利润从模型层往基础设施层流——最大的受益人就是英伟达。老黄心里门清,所以他要亲自下场推开源。
H100积压是升级换代,不是算力萎缩
按上面的逻辑,开源模型越多,GPU需求越旺。但GPU市场上正在发生的事情看起来跟这个逻辑矛盾:H100已经开始积压了。
AWS的SpotReclaimRate是一个很直观的供需指标,它记录的是云厂商回收闲置Spot实例的频率,频率越低说明实例越空闲、没人来抢,现在的数据显示,AWS上p5实例(跑的是H100芯片)的SpotReclaimRate不到5%,就是几乎没人抢。
H100是NVIDIA在2022年推出的GPU,过去两年撑起了整个AI训练和推理的基本盘,现在它在大厂手里已经开始积压了。
那么这是否代表算力过剩呢?显然不是,因为此时此刻,英伟达最新一代的GB200(Blackwell架构)依然一卡难求。
老卡卖不动、新卡抢不到,这是为什么?
因为K3这代模型已经大到H100跑不动了。2.8万亿参数的K3,要拉起64张以上的卡组成超节点才能实现高效推理。H100的单卡算力和卡间互联带宽都不够,客户被迫升级到GB200, 甚至开始等NVIDIA下一代的Vera Rubin平台。
Vera Rubin的机柜订单已经排到了明年,它的单柜(VR200 NVL72,72块Rubin芯片组成的一个完整机柜)的价格 ,几乎是上一代GB300 NVL72的两倍,大约需要780万美元。
所以算力需求没有消失,而是在往更高端的硬件迁移,H100的积压恰恰是因为需求升级了,而不是需求萎缩了。
7月27日,K3权重发布,1.56TB的模型文件挂上HuggingFace,几个小时之内下载量就冲到了几千次,每一份部署都需要一整个机柜才能跑。同一天,英伟达的股价因为“中国AI竞争加剧”大跌。
Anthropic的增速在放缓,英伟达的股价在跌,泡沫论卷土重来。
但泡沫论者看对了症状,搞反了因果。
Anthropic慢下来那一刻,恰恰是算力需求加速的信号。AI行业没有在萎缩,它比任何时候都更需要算力。
-END-
获取更多AI非共识!

