大数跨境

同受物理法则约束,GPU、TPU、FPGA与大脑,为何选择不同计算路径

同受物理法则约束,GPU、TPU、FPGA与大脑,为何选择不同计算路径 AI大模型智能体前沿
2026-08-12
1
导读:真正的瓶颈,藏在计算发生之前

导读

 

GPU、TPU、FPGA与碳基大脑都无法绕开面积、能量、通信距离和时间的约束,却没有走向同一种计算架构。原因藏在矩阵乘法落地后的物理成本里:精度越高,需要的逻辑门越多;数据走得越远,搬运代价越大;时钟频率越高,全局同步越困难。不同架构的分叉,本质上是对这些成本的不同取舍。


为什么“乘加运算”是硬件设计的关键

大模型里的矩阵乘法,看起来是一行公式。落到硅片上,核心动作却很朴素:两个数相乘,再把结果加到累加器里。

这叫 乘加运算(Multiply-Accumulate,MAC)。模型里一层层漂亮的线性代数,通电以后就是晶体管、逻辑门、金属连线和寄存器在接力。

Google 2017 年公开的第一代数据中心 TPU 论文给了一个很直观的实体:它的矩阵乘法单元包含 65,536 个 8 位 MAC,旁边配有 28 MiB 软件管理的片上存储。一大块芯片面积,就这样被固定成了做乘加的机器。

把镜头再拉近。两个二进制数相乘,需要先生成部分积,再逐层压缩、求和。1965 年的 Dadda 并行乘法器已经把这种门级关系画得很清楚。现代 Tensor Core 复杂得多,但底层成本没有消失:每多一位精度,背后都要多摆门、多拉线。

数学对象没有重量,数据通路有。

一个朴素的 p 位乘 q 位乘法器,部分积数量与 p×q 相关。8 位降到 4 位,乘法核心的部分积可能按近似平方关系缩小。于是,低精度不仅减少一半存储,还可能让同一块面积容纳更多计算单元。

听起来像白捡四倍?先别急。

NVIDIA 的 Volta Tensor Core 展示了更真实的处理方式:乘法输入可以用 FP16,累加保留 FP32。到了 Blackwell,FP4 又和微张量缩放、动态范围管理绑定。低精度不是把所有数字一刀切短,而是把误差预算分给不同环节。

所以,“位宽减半,性能四倍”只能描述某些门级资源的变化趋势,不能直接套到整颗芯片上。NVIDIA 对特定 Blackwell FP4 路径给出的说法是性能和参数带宽翻倍。累加器、控制逻辑、片上存储与互连还在,模型精度也得过关。

更麻烦的是,算完之前得先把数据送到计算单元门口。

数据搬运指权重和激活值在 DRAM、片上缓存、寄存器与 MAC 之间移动。它本身不产生新的数学结果,却要占带宽、耗能量、铺设物理连线。MIT 关于高效深度神经网络处理的研究因此反复强调数据复用:同一份权重或激活如果能在阵列附近多用几次,就不必一次次跑到远处内存取货。

这事挺反常识。我们买芯片时盯着峰值算力,真正运行模型时,计算单元却可能在等数据。

算力在饿肚子。

脉动阵列(Systolic Array)就是为这种矛盾设计的空间化结构。数据沿相邻处理单元逐拍流动,每个单元就地完成乘加,不必每次都绕回巨大的共享寄存器文件。像街区之间接力传货,不让所有卡车都挤进市中心。

这个思路不是 TPU 发明的。Kung 与 Leiserson 在 1970 年代已经提出并命名脉动阵列。Google 的工程增量,是把大规模 8 位 MAC 阵列、片上存储和确定性执行模型组合起来,并在 2015 年开始部署第一代 TPU。

到这里,分叉的起点已经出现了。它们做的是同一道数学题,只是数据在哪里复用、走多远、由谁调度,答案不同。

为什么追求高时钟频率,反而会限制算力

如果低精度能塞进更多 MAC,一个自然想法是:再把时钟拉高,不就能继续提高吞吐了吗?

问题是,时钟不是悬在芯片上空的一只虚拟秒表。它也是电信号,也要穿过金属线和缓冲器,送到一片片寄存器。

同步数字芯片通常用 时钟树(Clock Tree) 分发节拍。时钟边沿像统一口令,告诉大量寄存器何时接收新状态。为了让远近不同的寄存器尽量同时听到口令,设计者要平衡路径、插入缓冲器并控制 时钟偏差(Clock Skew),也就是时钟抵达不同位置的时间差。

频率越高,一个周期越短,留给组合逻辑计算和信号传播的时间就越少。Intel 的 Agilex 时钟文档写得很直接:时钟目标距离增加,会推高插入延迟;不同分支之间的最坏偏差也会增长,进而降低可达到的最高性能。

这就形成了一种拧巴的局面。

想跑得更快,要缩短逻辑路径,把复杂运算拆成更多流水级;流水级增加,又需要更多寄存器和时钟网络。想让更多计算单元同时工作,时钟树就要覆盖更大面积;覆盖越远,布线、缓冲、功耗和偏差越难控制。

频率不是免费的性能旋钮,它会反过来吞噬面积、功耗和时序余量。

而芯片面积是一场零和争夺。时钟缓冲、流水寄存器与长距离布线多占一块,留给 MAC 和本地存储的空间就少一块;功耗预算花在不停翻转的时钟网络上,也不能再拿去唤醒更多计算单元。高频提高了每秒周期数,却可能压低同一面积能容纳的有效计算密度。

快,不等于划算。

这也解释了为什么 AI 加速器常常不靠无限抬高频率,而是增加并行度、提高数据复用率,并用更宽的矩阵单元在一个周期里完成更多工作。NVIDIA 的 GPU 峰值计算能力,本身就是“每个 SM 每周期完成多少乘加 × SM 数量 × 时钟频率”的共同结果。只拉高时钟,前两项与数据供给跟不上,纸面数字很容易发虚。

三类架构在这里又做出不同取舍。

GPU 保留复杂调度、多级存储与通用编程生态,再用 Tensor Core 加速矩阵乘加。它为适应不同任务付出控制和数据通路成本。

TPU 更愿意固定数据流,把面积交给规则的 MAC 阵列与本地存储。它牺牲一部分通用性,换取计算密度与可预测性。

FPGA 允许开发者重新配置逻辑和路由,把任务直接铺成专用流水线。它保留硬件可塑性,代价是可编程开关与通用路由占用面积、增加延迟,因此频率通常不是它最想争的指标。

三条路,三笔账。不存在一块什么都要、还什么都不肯付出的神仙芯片。

当全局同步越来越沉,一个自然问题就冒出来了:能不能干脆不要这棵覆盖全局的时钟树?硅基通用计算很难彻底放弃它,大脑却从一开始就没有这么设计。

硅基芯片与碳基大脑,为什么选择了不同计算路径

把时钟问题推到极致,就会碰到一个更有意思的对照:真实大脑为什么不需要一棵覆盖全局的时钟树?

神经元通过局部连接和脉冲事件通信。一个神经元何时活动,取决于收到的输入、膜电位与自身动力学,不存在数字芯片那种要求所有单元在同一个时钟边沿更新的机制。

这里得卡住一个容易被说过头的结论:脑内存在振荡、节律与同步现象。“没有数字式全局时钟”不等于“没有时间结构”。

硅基同步芯片偏爱统一节拍,是因为它让复杂系统更容易验证:只要数据在下一个时钟边沿前稳定,电路就能按确定顺序推进。代价是无论某块逻辑有没有活干,时钟网络都可能继续切换;规模越大、频率越高,这套协调系统越沉。

大脑走的是局部、稀疏、事件相关的路线。有信号才传,没有一条全局总线要求千亿神经元一起跨步。它牺牲了数字计算那种逐位精确、全局确定的状态更新,换来了另一种并行性与能效。

两套账本。

IBM 的 TrueNorth 提供了一个可核验的脑启发案例。它包含 4096 个神经突触核心、100 万数字神经元和 2.56 亿突触,核心之间通过事件驱动路由交换脉冲。IBM 更早的神经突触核心研究也采用异步电路:只有执行神经更新时,相关电路才切换。

很诱人。先刹一下。

TrueNorth 是受大脑启发的数字芯片,不是大脑复刻版。IBM 后续的 NorthPole 甚至从 TrueNorth 的脉冲与异步设计转回同步设计,因为低频神经脉冲并不一定能高效利用 GHz 级硅晶体管。脑启发计算提供的是另一组取舍,不是对 GPU、TPU 的天然降维打击。

所以,GPU、TPU、FPGA 与碳基大脑没有生活在不同的物理世界。它们面对的仍是器件数量、通信距离、能量和时间,只是各自愿意支付的成本不同:GPU 为通用性付费,TPU 用固定数据流节省控制开销,FPGA 为可重构性付费,大脑则用局部事件通信避开数字式全局同步。

对 AI 工程师来说,这个答案也落回软件:量化对应降低位宽,算子融合对应减少中间结果搬运。屏幕上的每一个张量,下面都有距离、面积、功耗和等待时间。

算力不是一个数字,是数据穿过物理世界的全过程。

同一套物理法则不会给出唯一架构。架构没有脱离场景的高低,只有你愿意把晶体管、能量和时间花在哪里。

参考资料

  • Google 第一代数据中心 TPU 论文: https://research.google/pubs/in-datacenter-performance-analysis-of-a-tensor-processing-unit/
  • NVIDIA Volta Tensor Core 编程说明: https://developer.nvidia.com/blog/programming-tensor-cores-cuda-9/
  • NVIDIA Blackwell FP4 与 Transformer Engine: https://docs.nvidia.com/multi-node-nvlink-systems/multi-node-tuning-guide/overview.html
  • NVIDIA GPU 性能基础文档: https://docs.nvidia.com/deeplearning/performance/pdf/GPU-Performance-Background-User-Guide.pdf
  • MIT 高效深度神经网络处理综述: https://arxiv.org/abs/1703.09039
  • AMD FPGA Architecture(UG1291): https://docs.amd.com/r/en-US/ug1291-viv/FPGA-Architecture
  • Intel Agilex 时钟网络文档: https://www.intel.com/content/www/us/en/docs/programmable/683761/23-1/programmable-clock-routing.html
  • Kung 与 Leiserson 脉动阵列资料: https://www.sciencedirect.com/science/article/pii/B9780121005603500196
  • Luigi Dadda 并行乘法器论文: https://ieeemilestones.ethw.org/File%3ASome_schemes_for_parallel_multipliers_%28reprint%29.pdf
  • IBM TrueNorth 架构论文: https://research.ibm.com/publications/truenorth-design-and-tool-flow-of-a-65-mw-1-million-neuron-programmable-neurosynaptic-chip
  • IBM 事件驱动神经突触核心论文: https://research.ibm.com/publications/a-digital-neurosynaptic-core-using-event-driven-qdi-circuits
  • IBM 神经形态计算说明: https://research.ibm.com/blog/what-is-neuromorphic-or-brain-inspired-computing
  • 参考文章公开预览: https://mp.weixin.qq.com/s/t9hUpK1kZMBPGTPhhar7Qg
—THE END—

文章仅做学术分享,如有侵权请联系删除,非常感谢!


【声明】内容源于网络
0
0
AI大模型智能体前沿
分享AI大模型智能体前沿知识,探寻多元应用,洞察未来趋势,带你一路 “卷” 赢行业!🔥
内容 1111
粉丝 0
AI大模型智能体前沿 分享AI大模型智能体前沿知识,探寻多元应用,洞察未来趋势,带你一路 “卷” 赢行业!🔥
总阅读17.0k
粉丝0
内容1.1k