大数跨境

热点丨谷歌将Gemini架构写入芯片,TPU之外的新分支

热点丨谷歌将Gemini架构写入芯片,TPU之外的新分支 AI芯天下
2026-07-27
6
导读:英伟达把铲子卖给所有人,谷歌选择自己挖矿,还顺手改造了矿井的岩石结构。

聚焦:人工智能、芯片等行业




前言:

英伟达向全行业出售通用算力“铲子”,谷歌则选择自建矿井并改造岩石结构。软件与硬件博弈半个世纪后,大模型正将芯片收编为专属“器官”,训练者开始直接改写晶体管图纸。

作者 | 方文三
图片来源 | 网络

冻结的艺术:从权重到架构的战略退让

据 The Information 披露,谷歌正在研发代号"Frozen v2"的服务器芯片,旨在将 Gemini 模型的部分架构永久写入硅片。预计其单位功耗的 Token 处理量将达到最新一代 TPU 的 6 至 10 倍。

在机器学习领域,“冻结”通常指训练完成后锁定参数以停止更新。而 Frozen v2 将这一概念推进至物理世界:它锁定的并非具体参数权重,而是 Gemini 神经网络的架构蓝图。数据流动路径与注意力汇聚方式将直接转化为硅片上的固定电路。

该方案源自 Google DeepMind 首席科学家 Jeff Dean 的构想。初版方案曾试图将模型权重整体固化,但这相当于将特定版本的 Gemini 铸成“铜像”,芯片出厂即过时。鉴于模型迭代以月计而芯片寿命以年计,谷歌果断否决了此路线。

Frozen v2 采取了更明智的折中方案:冻结架构,放行权重。只要底层结构不变,新训练出的参数仍可加载至芯片,使其能服务于多代 Gemini 模型。工程师仍在权衡固化深度:固化越多能效越高,但灵活性越低。通过将架构修进电路,计算步骤减少,数据迁移量下降,从而实现了每瓦 Token 吞吐量的显著提升。

尽管该性能数据目前仍属理论推演,正式部署需等到 2028 年,但方向已十分明确。过去十几年,芯片行业信奉“通用性”,即一颗 GPU 训练所有模型。Frozen v2 颠覆了这一信条:当单一模型的调用量达到亿级,为其单独定制芯片的经济账已然算得过来。

效率翻倍背后:谷歌亟需拯救现金流

谷歌面临的核心挑战已超越芯片性能本身,急速膨胀的推理需求正在吞噬电力、服务器资源及现金流。

2026 年第二季度,谷歌模型 API 处理量增至每分钟约 220 亿 Token,较上季度增长 37.5%。用户数量未成倍增加,但服务器内部的计算链条却大幅拉长。需求激增而供给紧绷,Alphabet 当季资本开支高达 449 亿美元,绝大部分投向 AI 基础设施,并将 2026 年全年资本开支指引上调至 1950 亿至 2050 亿美元。

重投入直接压制了现金流,当季自由现金流降至负 59 亿美元。与此同时,Google Cloud 收入同比增长 82% 至 248 亿美元,待履约合同金额增至 5140 亿美元。谷歌云手握巨额订单,却因算力不足难以交付。

内部信源显示,资源短缺已引发团队摩擦,云部门被迫拒绝部分外部客户,并每月花费数亿美元租用英伟达 GPU 救急。管理层计划第三季度增加第三方数据中心租赁,但这将使云业务利润率承受短期压力。一家自研芯片十一年的巨头,回头高价租用竞争对手产品,这一细节比资本开支数字更具警示意义。

Frozen v2 的价值正是在于此:通过将 Gemini 部分架构固化进硬件,牺牲部分通用性以压低单位推理成本。该芯片无对外销售计划,纯粹作为内需工具,旨在从每一次 Gemini 调用中挤出更多 Token,帮助谷歌在模型 API 价格竞争中构建更低、更难复制的成本防线。

TPU 向外成为平台,Frozen 向内成为工厂

今年 4 月,谷歌将第 8 代 TPU 细分为训练型 TPU 8t 和推理型 TPU 8i。TPU 8i 针对采样、服务和推理进行了定向设计,配备 288 GB HBM 及专用通信引擎。数据显示,相较前代,TPU 8i 在特定低延迟大规模混合专家模型上性价比提升 80%,每瓦性能提升最高达 2 倍。

即便如此,TPU 8i 仍需支持不同模型与客户,兼容 JAX、PyTorch 等多种框架。这种灵活性虽增加了运行开销,却是云平台商业化的基础。TPU 的商业边界正不断外扩,Alphabet 已确认向客户自有数据中心交付 TPU 系统,产品形态正演变为一套开放的 AI 计算平台。

相比之下,Frozen 承担的任务更为单一:只需将 Gemini 跑得更快、更便宜,无需为外部客户的 Claude、Llama 等模型预留空间。它专注于承接谷歌自有产品中稳定、高频的推理流量。谷歌对外出售的是 Gemini 服务结果,而非可编程的芯片。

两条路线互为补充而非替代:TPU 如同允许客户更换产线的工业园,通过兼容性扩大收入边界;Frozen 则像围绕 Gemini 定制的专线工厂,通过专用性压低内部成本。谷歌在 TPU 之外另开分支,有效隔离了彼此冲突的产品目标。

Taalas 点火,英伟达转向,专用化合围成型

将模型植入硅片,谷歌并非首创,却是分量最重的入局者。今年 2 月,加拿大初创公司 Taalas 将 Llama 3.1 8B 的全部权重刻入台积电 6nm 工艺芯片,整机功耗仅 2.5 千瓦,每用户每秒可输出 17000 个 Token。

巨头们的动作更为激进。英伟达收购 Groq,将 LPU 融入 Vera Rubin 平台,官方宣称每兆瓦推理吞吐提升 35 倍。Cerebras 坚守整片晶圆方案,Etched 专攻 Transformer,Taalas 只做 Llama。从通用到模型专用,芯片本身正逐渐演变为模型。

技术路线上存在差异:Taalas 冻结权重,芯片仅识别单一版本,依赖 LoRA 适配器续命;谷歌冻结架构,服务于整个 Gemini 家族,被称为“弹性固化”。谷歌拥有独特的双重优势:既掌握模型又掌控芯片。当芯片定义权从架构师移交至训练师,拥有完整软硬件生态闭环的,唯谷歌一家。

结语

架构创新的边际收益正在衰减,模型竞争的决胜点已从发明新结构滑向工程效率与成本曲线的优化。GPU、TPU、工作负载专用芯片与模型专属芯片将长期共存于同一座数据中心,区别仅在于不同任务愿意为多少自由度付费。

AI 基础设施的分界线,将从 GPU 与 TPU 的品牌之争,移向通用平台与模型专属工厂的成本之争。

参考资料:36 氪、智东西、半导体行业观察、TrendForce 集邦咨询、高盛研究院相关报告



END


【声明】内容源于网络
0
0
AI芯天下
聚焦人工智能,AI芯片,5G通讯等行业动态
内容 5668
粉丝 0
AI芯天下 聚焦人工智能,AI芯片,5G通讯等行业动态
总阅读98.8k
粉丝0
内容5.7k