
当华尔街仍在为科技巨头每年数千亿美元的 AI 资本开支争论不休时,一线企业买家却给出了截然不同的答案。
近日,VentureBeat 对百余家百人规模企业的技术负责人进行调查,发现未来 IT 采购规划出现显著变化:非英伟达芯片及加速器(如 AWS Trainium、Google TPU、AMD Instinct 等)在企业评估列表中的占比,竟高出英伟达下一代 Blackwell(GB300)系列 GPU 整整 14 个百分点(42% 对 28%)。
从 2023 年“抢购英伟达 GPU"的全民狂欢,到 2026 年风向骤变,这场“用户叛逃”大戏究竟意味着什么?
“算力饥渴”背后:企业 86% 的 GPU 处于“半闲置”状态
公众认知中,算力依然是稀缺资源。英伟达创始人黄仁勋强调“算力即收入”,预计 2026 年各大巨头的设备投资总额将逼近6900 亿美元。然而,VentureBeat 的调查揭示了另一番景象:
86% 的企业承认,其运营的 GPU 实际利用率在 50% 或以下;近一半(49%)的企业利用率甚至低于 25%;仅有 12% 的企业实现了 50% 以上的“高效利用”。
新闻里的“算力荒”与现实中的“芯片闲置”,实则发生在两类完全不同的玩家身上。
“算力荒”属于云厂商与模型巨头。OpenAI、Anthropic、微软、谷歌、亚马逊、Meta 及 xAI 等超级大厂,为建设数万乃至数十万张卡的超大规模集群以训练前沿模型和承接推理流量,短期内确实供不应求。
闲置 GPU 多来自被 FOMO(错失恐惧)情绪裹挟的普通企业。自 2023 年以来,“不买卡就落后”的恐慌蔓延至董事会,大量缺乏云业务基础及 AI 工程能力的公司盲目囤卡。由于缺乏配套的数据中心、电力冷却条件及专业工程团队,这些芯片只能沦为仓库里的库存。典型案例如硅谷顶级风投 a16z,身为投资机构却因 FOMO 情绪在 2024 年囤积超 2 万张英伟达 H100,甚至通过出租 GPU 换取被投公司股权。
既然 GPU 利用率不高,为何企业仍倾向于采购其他芯片?这背后折射出 AI 产业的深层趋势逆转。
产业逆转:AI 从“训练时代”跨入“推理时代”
大模型正经历从“训练”向“推理”的重心转移。在 2021 至 2023 年的早期阶段,最昂贵的环节是“训练”,即培养 AI 模型的过程,任务完成后开销即止。而到了 2026 年,推理(用户使用大模型、调用 API 的阶段)已占据企业 55% 至 80% 的 AI 算力消耗。
推理是一场“永不停歇”的长跑。以一个 70B 参数的中量级模型为例,若日活用户 1000 人,人均请求 1000 次,每次消耗 500 Token,日消耗量达5 亿 Token。若在公有云租用按需 H100 节点(CPM 成本约 1.90 美元),日计算成本高达950 美元。一年下来,单模型的日常推理开销近 35 万美元,迅速超越初始训练成本。
在训练阶段,英伟达凭借成熟的 CUDA 生态及 NVLink/InfiniBand 互联网络稳居王者地位。但在推理阶段,胜负手不再是极端的算力峰值(FLOPS),而是“系统经济性”与"Token 成本”。
推理阶段的物理制约已从“计算性能”转向“内存带宽”和缓存容量(KV Cache 瓶颈)。生成式 AI 每生成一个 Token 均需重读模型参数,若显存带宽不足,强悍的计算核心将陷入空转等待。
在此维度上,竞品纷纷发力。AMD MI300X 主打价格优势,宣称售价比英伟达低一半,云端租赁成本低 40%-60%。AWS 自研的Trainium 2、谷歌的TPU Ironwood(v7)及微软的 Maia 200 均已大规模部署。这些定制化 ASIC 芯片剥离了不必要的图形处理功能,专攻张量计算。AWS 宣称,在其云生态内使用 Trainium 进行推理,可实现 50% 至 80% 的成本节省。
面对新一轮趋势,云厂商与下游客户的关注点已悄然转移。
2026 AI 芯片新势力版图:英伟达真的会失利吗?
AI 芯片市场正从英伟达“一家独大”走向多元共存。谷歌发布 TPU v7,亚马逊推出Trainium 3 和 Inferentia 2 双卡集群,OpenAI 联合博通推出 Jalapeño 推理芯片,种种迹象似乎表明格局已变。
然而,断言英伟达遭遇冲击为时尚早。英伟达真正的护城河早已超越单颗芯片性能或 CUDA 软件生态,演变为一种全新的数据中心计算范式。要判断产业何时发生颠覆,不仅需关注芯片与服务器架构的技术演进,更需洞察整体产业格局的变迁。

