2019—2026:Cerebras Systems 企业发展调研报告
调研对象:Cerebras Systems(NASDAQ: CBRS)
时间范围:2019 年走出隐身模式至 2026 年 9 月
报告日期:2026 年 9 月
一、摘要与核心定位
自 2015 年成立以来,Cerebras Systems 一直试图用「晶圆级计算(Wafer-Scale Computing)」这一路线打破传统芯片的物理限制:它把一整块 12 英寸晶圆当作一颗芯片来用,而不是像行业半个世纪以来那样把晶圆切成几百颗小芯片。
2019 年至 2026 年,Cerebras 完成了三次身份切换:从 2019 年走出隐身模式的硬件破局者,到 2023 年与阿联酋 G42 合建超算集群的算力供应商,再到 2026 年凭借 OpenAI 大单和 750 Petaflops 的 CS-4 系统成为极速 AI 推理基础设施的核心玩家,并在 2026 年 5 月完成募资 55.5 亿美元的 IPO。
这七年最重要的结论不是「Cerebras 做出了更大的芯片」,而是它在 2025 年之后把产品重心从训练彻底转向了超低延迟推理 ——WSE-3 的片上内存带宽 21 PB/s,官方称比 NVIDIA H100 高出约 7000 倍,这个优势在大模型 token 生成(decode)阶段被放大到极致 [5]。
二、发展历程与关键里程碑
2019—2022:破局者登场与架构演进
2019 年 8 月,Cerebras 在 Hot Chips 大会上发布第一代晶圆级引擎 WSE-1:TSMC 16nm 工艺、46,225 平方毫米、1.2 万亿晶体管、40 万核心,是当时最大 GPU 面积的 56.7 倍。11 月发布把这颗芯片封装成整机的 CS-1,并完成 2.72 亿美元 E 轮融资,投后估值 24 亿美元。
这一阶段的客户是 Argonne、LLNL、PSC、爱丁堡 EPCC、GSK、AstraZeneca、TotalEnergies 这类国家级超算和大型药企,单台 CS-1 售价数百万美元。公司本质上在用一级市场的钱做技术验证 ——2022 全年收入仅 2460 万美元。
2021 年 4 月发布第二代 WSE-2:TSMC 7nm、2.6 万亿晶体管、85 万核心,性能翻倍;11 月完成 2.5 亿美元 F 轮,估值 40 亿美元 [8][9]。2022 年 11 月发布自研超算 Andromeda(16 台 CS-2、1 exaFLOPS、1350 万核心),作为晶圆级集群的参考设计。
2023—2024:超算集群扩张与 WSE-3 问世
2023 年是商业转折点。7 月与阿联酋 G42 合作发布 Condor Galaxy 1(4 exaFLOPS、5400 万核心、64 节点),规划共 9 台超算组网、总算力 36 exaFLOPS;2024 年 3 月 CG-3 动工,采用 64 台新发布的 CS-3。
2024 年 3 月发布第三代 WSE-3:TSMC 5nm、4 万亿晶体管、90 万 AI 核心、125 PFLOPS 峰值算力、44GB 片上 SRAM,外部存储可配置到 1.2PB,单逻辑设备支持训练最大 24 万亿参数模型。
这一阶段收入快速放大:2024 年收入约 2.9 亿美元,同比增长超过 10 倍。但客户结构也因此高度集中 ——S-1 披露,2025 年 MBZUAI(G42 关联的阿联酋人工智能大学)占收入 62%,G42 占 24%,两家合计 86%。
2025—2026:推理云转型、OpenAI 大单与 IPO
2025 年 9 月完成 11 亿美元 G 轮融资,投后估值 81 亿美元;同期客户扩展到 AWS、Meta、IBM、Mistral。
2026 年 1 月,Cerebras 与 OpenAI 签订多年期 750MW 算力协议,价值超 200 亿美元,2028 年前交付;OpenAI 同时提供 1 亿美元运营贷款。3 月 AWS 签订有约束力 term sheet,成为首个在其数据中心内部署 Cerebras 系统的超大规模云厂商。
2026 年 5 月 15 日,公司以代码「CBRS」在纳斯达克上市。发行价从最初区间 115–125 美元一路上调到 185 美元,发行 3450 万股、募资 55.5 亿美元,发行估值约 564 亿美元;首日开盘 350 美元、收盘 311.07 美元(+68%),成为 2026 年最受瞩目的科技 IPO 之一。
2026 年 8 月 18 日发布第四代机架级系统 CS-4:单机架集成 3 颗 WSE-3 Turbo,总算力 750 PFLOPS,内存带宽 129.6 PB/s,晶圆间延迟低至 2 微秒,官方称推理速度比 GPU 系统快 30 倍。8 月 13 日,OpenAI 在 Cerebras 硬件上推出 GPT-5.6 Sol 的 Ultrafast 模式,生成速度高达 750 token/s,为标准模式的约 14 倍。
三、技术核心护城河
1. 晶圆级集成:用片上带宽绕开「内存墙」
传统多 GPU 架构在参数规模增长时,瓶颈不在算力而在数据搬运 —— 数据要在 GPU 片上 SRAM、片外 HBM、以及多张 GPU 之间来回走。Cerebras 的做法是把 90 万核心和 44GB SRAM 全部放在同一块硅片上,核心之间用 2D mesh 直接通信,从物理上消除「把数据搬出芯片再搬回来」这一步。
WSE-3 的片上聚合内存带宽 21 PB/s,官方称比 NVIDIA H100 高出约 7000 倍。这个数字在训练场景下优势会被多卡互联稀释,但在推理 decode 阶段 —— 每次只生成一个 token、对延迟极度敏感 —— 被放大到极致。
2. 解耦推理:与 AMD 瓜分 GPU 流水线
2026 年 7 月公布的 disaggregated 推理方案里,AMD Helios 负责高吞吐 prefill(提示词预处理),Cerebras WSE 负责超低延迟 token 生成。这等于 Cerebras 公开承认:在通用训练和大规模 prefill 上,它不和 NVIDIA/AMD 正面竞争;它占的是「decode 阶段延迟最敏感」这一个细分位置。
这种定位的商业含义是:Cerebras 不是要替换 GPU,而是在 GPU 推理流水线里切走延迟最敏感的那一段。
3. 开发者生态:兼容 OpenAI 接口
相较于 GPU 集群需要繁琐的模型切分逻辑,Cerebras 支持以纯数据并行模式训练 1B 到 24T 参数的模型,并已提供兼容 OpenAI 接口标准的 API 服务(云端和本地私有化部署)。这降低了 AI 创业公司和企业用户的迁移门槛。
四、商业模式演进与市场格局
Cerebras 的商业模式完成了从「卖超算整机」到「硬件销售 + 推理云服务」双轮驱动的转型 [18]。早期收入靠卖 CS-1/CS-2 机柜给国家实验室;中期靠为 G42 建 Condor Galaxy 集群;2025 年之后,云收入(按 token 用量计费)成为增长最快的板块 ——2026 年 Q2 云收入同比增长 281%。
客户圈层也从国家级实验室扩展到全行业:科研端有 Argonne、LLNL、Sandia、PSC;药企和医疗端有 GSK、AstraZeneca、Mayo Clinic;商业端有 OpenAI、AWS、Meta、IBM、Mistral、Cognition(Devin 开发公司)、Lovable、AlphaSense 。
但客户集中度风险依然存在:2025 年 86% 收入来自两家阿联酋关联实体;OpenAI 大单在 2026 年开始确认后,Customer A 占上半年收入 49%。截至 2026 年中,订单积压约 254 亿美元,绝大部分来自 OpenAI 单一合同。
五、财务现实与市场定价
收入曲线很陡峭:2022 年 2460 万 → 2024 年约 2.9 亿 → 2025 年 5.1 亿(+76%)→ 2026 Q1 单季 1.934 亿(+92%)。但盈利质量有几个需要诚实指出的问题:
2025 年 GAAP 净利润 2.378 亿美元中,包含 3.633 亿美元一次性非现金会计调整;扣掉后非 GAAP 净亏损 7570 万美元,经营层面仍在亏钱。
整体毛利率从 2024 年 42.3% 降至 2025 年 39.0%,云业务毛利率从 61% 降至 30%。
2025 年自由现金流约 -3.93 亿美元;OpenAI 的 1 亿美元运营贷款和 IPO 募的 55.5 亿美元,本质上是在为 600MW 数据中心建设融资。
上市后股价从首日高点 386 美元回落到 2026 年 9 月中旬的约 184 美元,较高点腰斩。市场在重新定价 OpenAI 大单的执行风险、客户集中度、毛利率下滑,以及双层股权结构下公众股东仅掌握约 0.8% 投票权、流通盘仅约 14% 的治理现实。
六、总结
2019 到 2026 的七年,Cerebras 走通了「用单块巨型晶圆对抗整个 GPU 集群」这条在 1980 年代就被尝试过、但从未商业化的技术路径。它的关键转折不是某一代芯片做得更大,而是在 2025 年算力市场诉求从「训练为主」转向「高吞吐、低延迟推理」时,凭借片上带宽优势占据了 decode 这一段最敏感的位置 ——GPT-5.6 Sol 在其硬件上跑到 750 token/s、CS-4 宣称比 GPU 快 30 倍,都是同一个架构红利在不同产品上的体现。
接下来的关键问题已经不是「晶圆级芯片能不能做出来」,而是:254 亿美元 OpenAI 订单能否按期转化为收入、云业务毛利率能否在产能爬坡后企稳、以及客户集中度能否从 OpenAI/G42 两家扩散到多云和更多模型实验室。这些问题的答案,决定 Cerebras 是「Agentic 时代的即时响应基础设施」,还是又一家押注单一客户的硬件公司。