大数跨境

造出H200级芯片,为什么国产GPU依旧不敢松口气?

造出H200级芯片,为什么国产GPU依旧不敢松口气? 游方AI
2026-09-08
4
导读:很多人评判国产GPU,习惯拿单卡算力对标英伟达:性能够不够?能不能打平海外旗舰?


很多人评判国产GPU,习惯拿单卡算力对标英伟达:性能够不够?能不能打平海外旗舰?

当壁仞亮出BR20X,FP16算力对标H200,很多人的第一反应是:国产GPU终于在硬件层面摸到国际第一梯队的门槛了。

但壁仞CEO张文在路演上抛出的判断,打破了这套惯性认知。

对今天的国产GPU厂商而言,把芯片性能做出来,只是闯关的第一关。真正决定企业能不能活下来、能不能站上全球牌桌的,是三件事:HBM存储供给、软件生态迁移、营收规模带来的供应链话语权。

硬件可以追赶,生态、供应链、规模,才是慢变量的生死局。

500亿才是GPU公司入场券

成立于2019年的壁仞,走过整整六年。

六年前,国产通用GPU还被普遍视作“遥不可及的追赶目标”;六年后,BR20X完成流片,定下2027年大规模商业化出货的目标,券商机构给出预测:2026‑2028年营收分别为23亿、101亿、239亿。

如果这条增长曲线能够落地,意味着壁仞将从持续烧钱的研发阶段,转向具备自我造血能力的商业化阶段。

但张文算过一笔非常现实的行业账,给整个国产GPU行业敲了警钟:

年收入500亿,才是GPU企业的入场起点,达不到这个规模,连牌桌都上不去; 营收摸到2000亿,才能在供应链拿到真正话语权,HBM配额、产能排期,不完全取决于技术实力,取决于你的采购体量。

2027年100亿营收目标,依靠BR20X大规模出货来支撑。客观来看,即便目标达成,距离500亿的行业及格线,依旧还有很远距离。百亿只是阶段性门票,远不是终点。

理想的增长路径已经画好,但路上横亘着两道绕不开的高墙:存储供给,以及开发者生态。

HBM悬在国产AI芯片头顶

的达摩克利斯之剑

硬件性能再强,没有足够的HBM高带宽存储,一切都是空谈。

这也是张文并不避讳的现实困境:未来一年,国产GPU行业最大的瓶颈,恰恰是HBM供给。

全球范围内能够稳定供应HBM的厂商屈指可数,国内GPU企业的供货配额,很大程度受制于海外存储厂商的排产节奏。存储供给的约束,会直接拉长国内产业收敛的周期,原本预期2‑3年的追赶窗口,可能被拉长至3‑4年。

当然行业也并非全无转机:国产HBM预计明年上半年逐步起量,2028年供给能力才会真正缓解行业压力。

而BR20X大规模出货的时间窗口,恰好踩在国产HBM起量的节点上。能不能抢到足够的HBM配额,直接决定100亿营收目标究竟是务实规划,还是空中楼阁。

芯片可以流片成功,但存储拿不到,就没有大规模商业化。这是当下国产算力产业共同要面对的现实难题。

BR20X:硬件已经追上

差距藏在看不见的地方

BR20X作为壁仞第二代主力芯片,是冲击百亿营收的核心载体,硬件指标交出了一份亮眼答卷:

● FP16算力超越H200,原生支持FP8、FP4低精度格式,精准匹配当下大模型推理对低成本、高吞吐的需求。

● 自研BLink2.0互联技术,单通道双向带宽64GB/s,单超节点最高可扩展至1024卡。

● 完整搭建三级产品矩阵:16卡服务器、128卡整机柜、1024卡分布式解耦方案;基于BR20X打造的光互连方案“光跃Lightsphere X”千卡集群已经落地,集群训练性能提升超30%。

放在三年前,国产GPU做到这个硬件水准,几乎是不敢想象的事情。

但我们必须清醒:单卡性能追平,不等于整体竞争力追平。英伟达十几年沉淀下来的软件工具链、开发者习惯、海量模型适配,不是短短数年就能够抹平的鸿沟。

硬件可以通过研发投入快速追赶,软件生态是慢功夫,也是国产GPU最难啃的骨头。

TorchSUPA站在

PyTorch肩膀上建生态

摆在国产GPU厂商面前有两条路:

● 第一条,从零完整自研一套软件栈,全部算子、框架、工具重新开发。这条路完全自主,但开发周期漫长,开发者迁移成本极高,生态很难做起来。

● 第二条,兼容主流开源生态,降低开发者迁移门槛,借成熟生态壮大自己。

壁仞选择了后者。

壁仞推出TorchSUPA,本质不是重新造一套新框架,而是做PyTorch的扩展插件。

它利用PyTorch官方PrivateUse1接口,以插件形式拓展硬件能力,不需要改动PyTorch官方源码,维护成本可控。开发者原有的CUDA代码可以做到零修改迁移,现有CUDA Kernel可以直接复用,不必从零手写算子。

功能层面覆盖PyTorch主流API、集合通信原语、动态图捕获、静态图优化,同时提供显存、运行时间分析调试能力。

截至目前,BIRENSUPA™平台已经兼容PyTorch、vLLM、SGLang等主流大模型框架,500+AI模型开箱即用。

阿里云李三红曾点破行业痛点:AI全链路高度碎片化,生态割裂,才是产业规模化最大瓶颈。壁仞高级副总裁魏明也提出一个判断:训练与推理边界不断消融,深度绑定PyTorch生态,将成为下一代AI基础设施的胜负手。

生态的核心从来不是芯片有多强,而是开发者愿不愿意过来。迁移成本越低,生态扩张速度越快。 TorchSUPA的逻辑,就是尽可能抹平迁移门槛,让开发者几乎不用改变原有开发习惯,就能跑在国产硬件之上。

抱团布局全栈

清晰的三代产品路线已经铺开

单靠一颗芯片,很难撑起完整算力生态。壁仞选择抱团共建的路线,把芯片、互联、集群、软件全部纳入布局:

● 和中兴通讯深度协同,联合曦智科技落地光互连千卡集群。

● TorchSUPA选择开源,提前吸引开发者适配、调试,把生态建设前置。

● 产品迭代节奏清晰可控:BR20X今年完成流片,2027年大规模商业化;下一代BR30X计划明年流片,直接对标Blackwell架构,新增LPU逻辑处理单元。

从对标H200,再向Blackwell发起冲击,代际路线已经明确。

硬件、互联集群、软件工具、开源生态,多条战线同步推进,不再只是单纯卖芯片,而是输出整套AI算力基础设施。

从“造得出来”到“站得住脚”

才是真正大考

六年时间,壁仞完成了从“国产GPU能不能做出来”到“硬件性能对标国际旗舰”的跨越。

但行业的终极命题,从来不是“流片成功”。

能不能拿到足够的存储供给、能不能把软件生态跑通、能不能完成规模出货、能不能真正拿到供应链话语权,才是接下来的核心考验。

100亿只是阶段性目标,距离500亿入场门槛,依旧长路漫漫。

国产GPU已经跨过有无的坎,接下来要闯的,是商业化、生态、供应链的三重关。硬件追赶看得见,生态与规模的博弈,才是真正的战场。

扫码关注



游方AI



【声明】内容源于网络
0
0
游方AI
AIGC生态玩家,从数字化工具到变现
内容 339
粉丝 0
游方AI AIGC生态玩家,从数字化工具到变现
总阅读3.6k
粉丝0
内容339