作者 |Tofu
来源 | 至顶AI实验室
AI工作站的军备竞赛,可能从一开始就盯错了重点。
四张RTX Pro 6000 Blackwell、3000W电源、32核64线程Threadripper Pro,显卡理论总功耗高达1800W——这套配置,怎么看都是一台围绕GPU打造的“算力怪兽”。但当机器真正运行起来,最令人意外的结论却与显卡无关。
在YouTuber Alex Ziskind测试的一次完整编程Agent任务中,模型推理只占一部分时间。搭建环境、编译代码、运行测试、分析语法树、计算哈希、打包结果……这些环节加起来,占据了任务约71%的时间,而它们主要依赖的不是GPU,而是CPU。
为了用上四张顶级显卡,他最后做出的,居然是一场关于CPU的实验。
四张顶级显卡,逼出一台“电力怪兽”
一切源于几张迟迟没有拆封的RTX Pro 6000。
过去一年,大模型的使用方式发生了变化。以前,人们关注模型能不能装进显存、每秒可以生成多少Token;现在,越来越多任务开始交给Agent完成。它们不只是回答问题,还会读代码、改文件、调用工具、执行命令和运行测试。
单纯堆显卡,未必还能解决所有问题。
为了搭建一台真正面向多Agent并发的机器,他拿出了华硕提供的ET900机箱和一块WRX90工作站主板。这块主板拥有7个PCIe 5.0插槽,需要搭配Threadripper Pro处理器,并能提供128条PCIe 5.0通道。
这意味着,多张显卡可以分别获得通向CPU的高速通道,不必挤在有限的PCIe带宽里互相等待。
Threadripper Pro的选择却让他犯了难,从16核、24核、32核一路到64核和96核,价格也从“昂贵”逐渐走向“财务不负责任”。
更高端的型号不会让单次模型推理直接快一倍,也不会凭空解锁更多GPU。增加的核心主要用于数据加载、模型转换、虚拟机和多任务并发,让显卡少花时间等待CPU。
他最后选择了售价约4000美元的Threadripper Pro 9975WX:32核、64线程。在这条产品线里,它甚至只能算“中间档”。
随后装入的是128GB DDR5内存。WRX90支持八通道内存,但由于手头只有4根,他只能按照说明书插入指定槽位,暂时没有跑满处理器的全部内存带宽。
真正夸张的还是供电。四张RTX Pro 6000中,两张是最高300W的Max-Q版本,另外两张工作站版最高可达600W,仅显卡理论功耗就达到1800W。为了留出足够余量,他把机箱原配的2000W电源换成了3000W版本,还必须使用240V供电。
这已经不是一台普通插座随手一接就能运行的电脑,更像是一台被塞进办公桌旁的小型服务器。
装机过程也没有想象中顺利。第四张显卡是双槽设计,主板底部空间又被前置USB和音频接口占据,导致显卡无法完全插入。第一次启动后,`nvidia-smi`只识别出三张卡。
排查之后,他改用PCIe延长线连接,系统才终于显示出四张GPU。更新BIOS、确认内存和NVMe硬盘、开启Resizable BAR、关闭Secure Boot与Fast Boot,再安装Ubuntu 24.04,这台庞然大物总算正式启动。
模型跑起来,GPU却只忙了一小会儿
他首先运行了一个DeepSeek模型。
四张GPU同时工作时,单个Agent的生成速度约为33 tokens/s;并发数提高到2,整体吞吐达到62 tokens/s;4并发时达到116 tokens/s;16个Agent同时请求时,则上升到364 tokens/s。
继续增加并发,吞吐不再稳定增长,甚至开始下降。从数字看,四张显卡确实提供了强大的本地推理能力。但他随后把一个Agent回合完整拆开,才发现模型调用只是其中的一段。
Agent先向大模型发起请求,得到规划或者代码;接着还要搭建项目脚手架、编译程序、运行测试、解析抽象语法树、检查文件变化,再把结果重新整理给模型。
GPU只负责其中的推理片段,其余大量工作都落在CPU、内存和存储系统上。在任务时间线上,代表GPU运算的部分只是几段短促的切片,后面却拖着一长串CPU任务。按照他的测量,在这套工作流中,约71%的时间并没有发生在GPU上。
这也解释了为什么他没有让四张显卡长期跑满。虽然显卡理论总功耗可达1800W,但他把GPU功耗限制在1200W。对于编程Agent而言,GPU经常在生成结束后等待CPU处理后续工作,一味提高功耗,并不会等比例缩短整个任务时间。
过去谈本地AI,人们习惯先问:“模型每秒能吐出多少Token?”进入Agent工作流后,更值得追问的问题却是:模型停止生成以后,机器还需要多长时间,才能把事情真正做完?
4000美元的CPU值不值?答案取决于并发数
为了看清CPU究竟有多重要,他又搭建了一套使用Ryzen 7 9700X的开放式平台,与Threadripper Pro 9975WX进行对比。
两颗处理器同属Zen 5架构,但9700X只有8核16线程,Threadripper则拥有32核64线程。
只运行一个Agent时,结果几乎出人意料。9700X每分钟完成89.7次迭代,Threadripper为85.6次,差距可以忽略,普通桌面处理器甚至略微领先。
两个Agent并发时,两者仍然非常接近。
到了8并发,差距才开始拉开:Threadripper完成任务约需11.57秒,9700X则需要14.96秒。增加到16个Worker后,桌面处理器的耗时接近Threadripper的两倍,并逐渐失去继续扩展的能力。
在32并发下,9700X的吞吐停在每分钟约568个回合;Threadripper则达到2113个。继续提高到64并发,9975WX最终跑到每分钟2239个回合。按照两颗处理器各自的峰值计算,Threadripper的吞吐量接近9700X的4倍。
这场测试也说明,4000美元的CPU并不会让单个Agent明显变快。它真正购买的是并发能力:当几十个Agent同时编译代码、运行测试和操作文件时,更多核心可以让它们不必争抢有限的CPU资源。
CPU扛住以后,瓶颈又转移了
不过,当他重新加入本地模型调用,新的问题又出现了。
32个Agent的CPU任务可以分散到64条线程上,但它们的模型请求全部进入同一个、共享四张GPU的推理服务。超过16并发后,请求开始排队,平均模型延迟从约0.5秒暴涨到12秒。
CPU已经扛住了压力,GPU也并不少,但推理服务的调度方式又变成了新的瓶颈。
这组实验最终给出了几个截然不同的答案。
如果只运行一个Agent,8核桌面CPU已经足够,高价Threadripper几乎不会带来收益;如果要同时运行十几个甚至几十个Agent,高核心数CPU才能避免编译、测试和工具调用互相争抢资源。
如果模型部署在本地,GPU依然是预算的第一优先级,因为显存容量和推理吞吐决定模型能否运行、请求需要排队多久。但GPU数量增加后,也必须配套足够的CPU核心、PCIe通道和更合理的推理调度,否则瓶颈只会从一个部件转移到另一个部件。
如果本地Agent调用的是云端模型,情况则完全不同:本地GPU几乎不参与推理,CPU反而决定机器能同时驱动多少个Agent、处理多少套代码和测试任务。
所以,这台机器真正证明的并不是“四张显卡有多快”,而是AI硬件的衡量标准已经变了。
在聊天机器人时代,问题是模型跑得快不快;在Agent时代,问题变成了整套系统能不能同时把更多事情做完。
下一次配置AI工作站之前,最应该先回答的,或许不再是“我要买几张显卡”,而是——
我准备让多少个Agent一起工作?

