作者 |Tofu
来源 | 至顶AI实验室
一台原本几乎没为独立显卡预留空间的 Framework Desktop,被强行接上了两张32GB专业显卡。128GB机身内存,再加64GB独立显存,总容量直接来到192GB。更夸张的是,两张显卡之间还能通过PCIe 5.0高速通信。
乍看之下,这似乎是一台不到7500美元、足以挑战昂贵AI工作站的“本地大模型怪兽”。真的动手之后,这套“缝合怪”到底能不能正常工作,才是最麻烦的部分。
给没有显卡位的主机,装上两张专业卡
Framework Desktop采用AMD Strix Halo平台,拥有128GB统一内存。它本身已经能运行不少大模型,但在稠密模型推理和提示词预填充阶段,集成GPU的性能仍然有限。
作者决定继续扩展:接入两张华硕R9700专业显卡,每张拥有32GB显存。
问题在于,这台电脑对外只有PCIe 4.0 ×4连接,双向带宽约为8GB/s。对于一张显卡来说都算不上宽裕,更不用说同时连接两张显卡。
解决办法是一块采用Broadcom PLX,也就是PEX系列芯片的PCIe交换板。
Framework Desktop先通过PCIe 4.0 ×4接入交换芯片,两张R9700再通过MCIO线缆连接到交换板。作者原本希望将它配置成两个PCIe 5.0 ×16接口,但最终只成功配置为四个×8接口,并实际使用其中两个。
这并不会凭空增加主机的总带宽。两张显卡访问CPU和系统内存时,依旧要挤过那条PCIe 4.0 ×4链路。不过,PLX交换芯片提供了另一项关键能力:让两张显卡直接进行高速通信。
它们之间可以按照PCIe 5.0 ×8运行,带宽大致相当于PCIe 4.0 ×16。这样一来,显卡之间的数据交换便不需要每次都绕道主机。
这也是整套实验能够成立的核心。
作者还特别强调,这里需要的是完整的PCIe Bridge,也就是PCIe交换芯片,而不是常见的Retimer信号增强器。带有Oculink接口的Strix Halo迷你主机同样可以尝试这种连接方式,但仍然需要PLX/PEX交换板,普通显卡坞并不能解决问题。
192GB能跑大模型,但并不是统一内存
接线完成后,这套机器拥有128GB平台内存和64GB独立显存,合计192GB。
不过,这个数字需要打一个问号。它并不是类似未来高端APU可能提供的192GB统一内存,而是两个相互分离的内存池。模型需要在Strix Halo和两张R9700之间切分,数据跨设备移动时还会受到PCIe 4.0 ×4主链路的限制。
这种架构对稠密模型并不友好。稠密模型运行时需要频繁访问大量参数,一旦数据不断经过狭窄的主机链路,性能很快便会遇到瓶颈。作者的早期测试也印证了这一点:双R9700虽然比单独使用Strix Halo快,但整套系统并不会因为“总内存达到192GB”就自动变成一台高性能AI服务器。
真正适合它的是MoE,也就是混合专家模型。
在这类模型中,每次推理通常只激活部分专家参数。作者可以把计算密集的部分、稠密层或者Prompt Prefill放到两张R9700上,再把其余参数和KV Cache放在Strix Halo的128GB内存中。由于两张独显能够高速互联,它们之间的通信不再严重受限于主机链路。
Qwen 35B-A3B之类的MoE模型本来就能在Strix Halo上运行,加入双R9700后,提示词处理速度明显提升,还能腾出更多空间支持大上下文。对于GPT-OSS 120B以及更新的1200亿参数Qwen模型,这套架构也提供了更大的模型容量和KV Cache空间。
某些针对慢速存储设计的数据甚至可以继续放到NVMe SSD中。如此一来,系统形成了GPU显存、APU统一内存和SSD三级存储结构,在性能与容量之间进行调度。
换句话说,Strix Halo在这里更像“容量放大器”,而不是“性能加速器”。
真正的瓶颈,是没人考虑过这种组合
硬件虽然点亮了,软件却开始轮番报错。
Framework Desktop的BIOS没有开放完整的PCIe BAR空间配置,作者只能通过Linux内核启动参数手工调整。系统还出现了`kworker`占用大量CPU、Wayland耗尽资源以及连续内核报错等问题。
更复杂的是,这套机器同时包含两种并不完全相同的RDNA GPU:Strix Halo集成GPU和R9700独立GPU。ROCm、RCCL以及上层推理软件此前几乎没有针对这种组合进行充分测试。
两张独显之间的点对点通信可以工作,但iGPU与独显混合进行P2P通信仍有Bug。使用llama.cpp把同一个模型切分到三台设备上,效果也不算理想。相较之下,让Strix Halo和双R9700分别运行不同模型,或者把特定计算阶段交给独显,反而更稳定。
有趣的是,RCCL通过PLX交换芯片连接时,某些场景甚至比显卡直接连接消费级桌面CPU更加稳定。作者推测,这是因为真正的大型八卡服务器原本就普遍使用PCIe交换架构,AMD的软件栈可能更熟悉这种拓扑。
因此,这台机器最大的价值或许不是跑出多漂亮的基准成绩,而是成为一套极端的ROCm测试平台。它能集中暴露RDNA多GPU、混合架构、内存调度和点对点通信中的问题。
最终,作者并不推荐普通用户照着搭建。这不是一条成熟、稳定的低成本本地AI路线,而是供开发者、实验室和高校研究多GPU通信的“科学实验”。
但它至少证明了一件事:即使主机只有PCIe 4.0 ×4,只要加入合适的交换芯片,也能让两张高端GPU有效协作。未来的本地AI设备,或许真的会越来越依赖这种架构。
这台192GB的“缝合怪”还没有成为理想中的AI工作站,却已经提前展示了个人多GPU系统可能走向的下一步。

