很多人评判国产GPU,习惯拿单卡算力对标英伟达:性能够不够?能不能打平海外旗舰?
当壁仞亮出BR20X,FP16算力对标H200,很多人的第一反应是:国产GPU终于在硬件层面摸到国际第一梯队的门槛了。
但壁仞CEO张文在路演上抛出的判断,打破了这套惯性认知。
对今天的国产GPU厂商而言,把芯片性能做出来,只是闯关的第一关。真正决定企业能不能活下来、能不能站上全球牌桌的,是三件事:HBM存储供给、软件生态迁移、营收规模带来的供应链话语权。
硬件可以追赶,生态、供应链、规模,才是慢变量的生死局。
成立于2019年的壁仞,走过整整六年。
六年前,国产通用GPU还被普遍视作“遥不可及的追赶目标”;六年后,BR20X完成流片,定下2027年大规模商业化出货的目标,券商机构给出预测:2026‑2028年营收分别为23亿、101亿、239亿。
如果这条增长曲线能够落地,意味着壁仞将从持续烧钱的研发阶段,转向具备自我造血能力的商业化阶段。
但张文算过一笔非常现实的行业账,给整个国产GPU行业敲了警钟:
年收入500亿,才是GPU企业的入场起点,达不到这个规模,连牌桌都上不去; 营收摸到2000亿,才能在供应链拿到真正话语权,HBM配额、产能排期,不完全取决于技术实力,取决于你的采购体量。
2027年100亿营收目标,依靠BR20X大规模出货来支撑。客观来看,即便目标达成,距离500亿的行业及格线,依旧还有很远距离。百亿只是阶段性门票,远不是终点。
理想的增长路径已经画好,但路上横亘着两道绕不开的高墙:存储供给,以及开发者生态。
硬件性能再强,没有足够的HBM高带宽存储,一切都是空谈。
这也是张文并不避讳的现实困境:未来一年,国产GPU行业最大的瓶颈,恰恰是HBM供给。
全球范围内能够稳定供应HBM的厂商屈指可数,国内GPU企业的供货配额,很大程度受制于海外存储厂商的排产节奏。存储供给的约束,会直接拉长国内产业收敛的周期,原本预期2‑3年的追赶窗口,可能被拉长至3‑4年。
当然行业也并非全无转机:国产HBM预计明年上半年逐步起量,2028年供给能力才会真正缓解行业压力。
而BR20X大规模出货的时间窗口,恰好踩在国产HBM起量的节点上。能不能抢到足够的HBM配额,直接决定100亿营收目标究竟是务实规划,还是空中楼阁。
芯片可以流片成功,但存储拿不到,就没有大规模商业化。这是当下国产算力产业共同要面对的现实难题。
BR20X作为壁仞第二代主力芯片,是冲击百亿营收的核心载体,硬件指标交出了一份亮眼答卷:
● FP16算力超越H200,原生支持FP8、FP4低精度格式,精准匹配当下大模型推理对低成本、高吞吐的需求。
● 自研BLink2.0互联技术,单通道双向带宽64GB/s,单超节点最高可扩展至1024卡。
● 完整搭建三级产品矩阵:16卡服务器、128卡整机柜、1024卡分布式解耦方案;基于BR20X打造的光互连方案“光跃Lightsphere X”千卡集群已经落地,集群训练性能提升超30%。
放在三年前,国产GPU做到这个硬件水准,几乎是不敢想象的事情。
但我们必须清醒:单卡性能追平,不等于整体竞争力追平。英伟达十几年沉淀下来的软件工具链、开发者习惯、海量模型适配,不是短短数年就能够抹平的鸿沟。
硬件可以通过研发投入快速追赶,软件生态是慢功夫,也是国产GPU最难啃的骨头。
摆在国产GPU厂商面前有两条路:
● 第一条,从零完整自研一套软件栈,全部算子、框架、工具重新开发。这条路完全自主,但开发周期漫长,开发者迁移成本极高,生态很难做起来。
● 第二条,兼容主流开源生态,降低开发者迁移门槛,借成熟生态壮大自己。
壁仞选择了后者。
壁仞推出TorchSUPA,本质不是重新造一套新框架,而是做PyTorch的扩展插件。
它利用PyTorch官方PrivateUse1接口,以插件形式拓展硬件能力,不需要改动PyTorch官方源码,维护成本可控。开发者原有的CUDA代码可以做到零修改迁移,现有CUDA Kernel可以直接复用,不必从零手写算子。
功能层面覆盖PyTorch主流API、集合通信原语、动态图捕获、静态图优化,同时提供显存、运行时间分析调试能力。
截至目前,BIRENSUPA™平台已经兼容PyTorch、vLLM、SGLang等主流大模型框架,500+AI模型开箱即用。
阿里云李三红曾点破行业痛点:AI全链路高度碎片化,生态割裂,才是产业规模化最大瓶颈。壁仞高级副总裁魏明也提出一个判断:训练与推理边界不断消融,深度绑定PyTorch生态,将成为下一代AI基础设施的胜负手。
生态的核心从来不是芯片有多强,而是开发者愿不愿意过来。迁移成本越低,生态扩张速度越快。 TorchSUPA的逻辑,就是尽可能抹平迁移门槛,让开发者几乎不用改变原有开发习惯,就能跑在国产硬件之上。
单靠一颗芯片,很难撑起完整算力生态。壁仞选择抱团共建的路线,把芯片、互联、集群、软件全部纳入布局:
● 和中兴通讯深度协同,联合曦智科技落地光互连千卡集群。
● TorchSUPA选择开源,提前吸引开发者适配、调试,把生态建设前置。
● 产品迭代节奏清晰可控:BR20X今年完成流片,2027年大规模商业化;下一代BR30X计划明年流片,直接对标Blackwell架构,新增LPU逻辑处理单元。
从对标H200,再向Blackwell发起冲击,代际路线已经明确。
硬件、互联集群、软件工具、开源生态,多条战线同步推进,不再只是单纯卖芯片,而是输出整套AI算力基础设施。
六年时间,壁仞完成了从“国产GPU能不能做出来”到“硬件性能对标国际旗舰”的跨越。
但行业的终极命题,从来不是“流片成功”。
能不能拿到足够的存储供给、能不能把软件生态跑通、能不能完成规模出货、能不能真正拿到供应链话语权,才是接下来的核心考验。
100亿只是阶段性目标,距离500亿入场门槛,依旧长路漫漫。
国产GPU已经跨过有无的坎,接下来要闯的,是商业化、生态、供应链的三重关。硬件追赶看得见,生态与规模的博弈,才是真正的战场。

