大数跨境

拆开Panther Lake:18A造了什么,没造什么

拆开Panther Lake:18A造了什么,没造什么 半导体产业报告
2026-10-01
5
导读:打开一颗Panther Lake,最先看到的不是“一整块18A芯片”。

解析Panther Lake处理器,其核心特征并非简单的“18A单芯片”,而是采用了复杂的异构封装架构:CPU及部分系统功能集成于18A计算芯片;GPU独立分片,轻量版采用Intel 3工艺,高配版采用台积电N3E工艺;I/O芯片则延续使用台积电N6工艺。各组件并排置于一块无源硅基底上,最终封装为单一处理器。

这种工艺分工策略表明,Panther Lake将最先进工艺精准应用于关键区域,其余部分则根据面积、复用性及性能需求灵活配置。深入拆解该设计,有助于厘清18A工艺带来的实际增益与潜在代价。

Panther Lake 配置概览

背面供电技术(PowerVia)的革新与权衡

传统芯片设计中,信号线与供电线均位于晶体管上方。随着器件密度增加,供电路径需穿过上层金属,占用宝贵的布线资源,导致电阻和压降问题日益严峻。

18A工艺引入的PowerVia技术彻底改变了这一路径:正面金属层专注于信号传输,主供电网络迁移至晶体管背面。背面铜线通过纳米级硅通孔连接至局部源漏接触。制造流程包括:先在正面完成通孔与电路制作,随后将晶圆键合至载片并翻面,移除原衬底以暴露通孔末端,最后构建背面供电金属层。值得注意的是,成品中的载片作为永久结构保留,而非临时支架。

PowerVia通用工艺流程及不同供电方案对比

截面图显示,四层RibbonFET沟道上方为正面互连,下方则通过通孔连接背面供电网络。这证实PowerVia并非简单翻转布线,而是在晶体管两侧重新分配电源与信号路径。

Intel 18A Panther Lake P-core逻辑(左)与 Samsung SF2 Exynos 2600逻辑(右)对比

优势与代价并存:局部信号布线空间得以释放,供电线路更宽更短,降低了阻抗。然而,通孔仍需在标准单元内寻找落点,背面金属层和载片增加了工序复杂度,并改变了散热路径。背面供电主要优化了布线与供电条件,并不意味着标准单元中原本用于电源的面积可完全转化为逻辑面积。

四层纳米片(RibbonFET)的技术实质

18A工艺的另一项核心变革是RibbonFET。相较于FinFET栅极包裹鳍片三面,RibbonFET使栅极四面围住每层纳米片。这不仅增强了对缩短沟道电流的控制能力,还允许根据电路需求调整纳米片宽度,摆脱了仅靠增加鳍片数量来提升驱动能力的限制。

拆解显示,Intel器件采用四层纳米片,而三星SF2器件为三层。但片数并不直接等同于速度或密度优势,单片宽度、间距、接触电阻及线路连接方式均影响最终性能。

Intel 18A RibbonFET(左)与 Samsung SF2 MBCFET(右)截面对比

以SRAM为例,纳米片宽度可调使得设计者能在不增加整根鳍的情况下,精细调节上拉、下拉和访问晶体管的强弱比例。Panther Lake的部分SRAM单元无需写入辅助电路;高密度单元则采用负位线写入辅助,通过将位线电位短暂拉低至地电位以下,确保低电压下的可写性。密度的提升伴随辅助电路、切换能耗及电压应力等成本,需综合考量。

Intel 18A SRAM位单元特性

在逻辑单元层面,PowerVia技术支持18A使用五轨高度的紧凑单元,同时保留较宽的底层信号金属。代表性单元模型显示,18A计算逻辑与台积电N3E GPU逻辑密度接近;18A样本比Intel 3 GPU样本高出18.6%。需注意,这是基于NAND门和扫描触发器加权的单元几何比较,而非整颗芯片的密度差异。真实芯片还需容纳缓存、模拟电路及互连,实际布线效果会影响最终结果。

代表性单元密度及输入敏感度分析

面积优化分布与潜在代价

观察计算芯片版图,CPU核心面积并未显著缩小。与Lunar Lake相比,P核面积基本持平,但每核L2缓存从2.5MiB增至3MiB。此举虽提升了数据本地化效率,但也增加了存储面积及其相关的访问延迟和漏电开销。四个低功耗E核仍共享一组缓存,适用于轻负载场景以降低P核参与度。

带标注的 Panther Lake-U 4+0+4 计算模块

显著的面积变化体现在NPU上。NPU 5实测区域较Lunar Lake的NPU 4缩小36.9%,但INT8乘加单元总数未减。其架构由六组神经计算引擎调整为三组更大规模的阵列,并相应缩减了附近的scratchpad本地存储。

Lunar Lake NPU 4(左)与 Panther Lake NPU 5(右)对比

面积数据显示,仅本地存储区域的缩小就贡献了约42.7%的N总面积节省。Scratchpad原本用于在计算阵列旁反复利用权重和中间结果;容量缩减后,超出容量的工作负载需更细碎地切片或增加数据搬运频率。

基于实测布局图区域的 NPU 面积节省分析

NPU 5支持FP8格式,较窄的操作数有助于缓解存储与传输压力,但具体模型的适用性与精度接受度仍需逐一验证。面积缩小证明了芯片物理尺寸的优化,但不能直接推导出所有模型运行速度的提升。

GPU与I/O的工艺选择逻辑

Panther Lake的GPU并非同一芯片的不同规格版本,而是独立分片。GT1配置四个Xe3核心,采用Intel 3工艺,配备4MiB L2缓存;GT2配置十二个Xe3核心,采用台积电N3E工艺,配备16MiB L2缓存。随着核心数增加,缓存、渲染单元及接口需重新布局,无法简单复制扩展。

拆解显示,N3E版Xe核心实测面积小于Intel 3版,且缓存宏单元存储位密度更高。但由于工艺、缓存和布线同时变化,面积差异不能全归因于制程。对Panther Lake而言,关键在于GPU实现了模块化替换:不同价位产品可搭载不同规模GPU,无需重新设计整块计算芯片。

I/O芯片沿用N6工艺的原因更为直接。PCIe、Thunderbolt等接口的性能受外部链路物理限制,数字逻辑升级至18A并不能带来等比例收益。沿用经过验证的N6模块,避免了接口移植和重新认证的复杂过程。拆解图显示,多个接口模块布局与上一代高度一致。

Foveros-S封装架构的连接机制

Panther Lake采用Foveros-S封装技术:计算、GPU、I/O三块有源芯片并排置于无源硅基底上,通过微凸点连接,再经由基底内的连线和通孔接至下方封装基板。这种近似2.5D的横向拼装模式,区别于CPU与GPU垂直堆叠的结构。

分块制造的優勢在于工艺灵活性和模块复用,GPU规模可变,成熟I/O模块可直接沿用。代价则是增加了基底、芯片间连接以及键合、测试和组装步骤。跨芯片数据传输存在延迟和能耗,因此切割位置至关重要:Panther Lake将内存控制器与CPU集成在同一计算芯片上,避免CPU访问内存时跨越GPU接口;而GPU访问内存需经过芯片间连接,凸显了本地缓存的重要性。

同为18A工艺的Wildcat Lake提供了另一种思路:将计算与图形更多整合至单芯片,去除无源基底以降低封装复杂度,但牺牲了更换大GPU芯片的灵活性。两种方案并存,印证了先进制程并非唯一的设计变量。

18A的RibbonFET和PowerVia已在实物中得到验证,单元、缓存、NPU及封装结构均可逐层核对。然而,截面图和面积数据无法反映长期良率、制造成本及整机性能。判断该路线成功与否,关键在于Intel能否稳定量产18A计算芯片,并实现不同工艺GPU与I/O的高效、经济整合。


【声明】内容源于网络
0
0
半导体产业报告
1234
内容 619
粉丝 1
半导体产业报告 1234
总阅读36.6k
粉丝1
内容619