在 2026 WAIC 世界人工智能大会上,无问芯穹首次公布了其在大模型推理系统架构中的新突破——跨集群异构推理架构 PDD。

该架构利用高性价比的广域网以太网串联多地已建成的同构数据中心,将传统的 PD 分离链路创新解构为"P-RLD-MD"三级分离式推理架构。这一设计不仅让不同特性的硬件专注于各自擅长的任务,更突破性解决了以太网环境下 KV Cache 的传输延迟痛点。
实测数据显示,该架构在实现首 Token 延迟降低 51.5% 的同时,单 Token 成本可降低 37.5%。这不仅显著提升了用户端的速度体验,更实现了全域异构算力的最大化调度,充分释放了分散各地的存量集群资源价值。
跨集群异构推理的理想与现实
过去一年,大模型推理的成本与效率成为行业关注的焦点。业界共识认为,LLM 推理包含 Prefill(预填充,计算密集型)和 Decode(解码,访存密集型)两个特性迥异的阶段。理论上,最优解法是“异构分离”:由算力强的芯片负责 Prefill,显存带宽高的芯片负责 Decode。
然而现实情况复杂。在同一集群内构建大规模异构算力资源采购成本高昂,且一旦模型架构变更,固定配比的硬件极易出现闲置。因此,利用低成本广域网以太网连接各地已有的同构集群,进行跨集群异构分离式推理,成为了自然的演进方向。
但在工程实践中,这一构想面临巨大挑战:KV Cache 的跨集群传输带宽和延迟瓶颈。PDD 架构正是为攻克此难题而生。
痛点与洞察:硬件“偏科”与流量的“二八定律”
理解 PDD 的设计逻辑,需从无问芯穹团队发现的三个核心洞察入手。
洞察一:硬件性能的“极度偏科”
LLM 推理的 Prefill 与 Decode 阶段对硬件需求截然不同。基准测试显示,芯片性能存在极度“偏科”现象:某厂商 E 芯片在处理计算密集的 Prefill 阶段时,性能约为旗舰 GPU 基线的 81%;但在访存密集的 Decode 阶段,其性能可达基线的 210%。

若将此类“偏科”芯片置于同构集群中兼顾两项任务,不仅无法发挥其长板优势,反而会拖慢整体效率。这坚定了团队将 Prefill 与 Decode 拆分解耦、分别部署的思路。
洞察二:DRC 技术带来的带宽优化
跨集群传输庞大的 KV Cache 会迅速耗尽广域网带宽。针对 Agent 业务前缀缓存命中率极高的特征,团队在 Decode 端部署了前缀缓存 RadixCache(DRC)。当 Prefill 端发现请求命中前缀缓存时,仅需传输少量“增量”数据。
在 90% 的平均命中率下,DRC 理论上可将跨集群带宽需求降低高达 10 倍,初步缓解了带宽压力,但延迟问题依然严峻。
洞察三:智能体工作负载下的“非均匀延迟”
智能体工作负载具有上下文极长、缓存命中率极高但输出极短的特征。对于此类请求,KV Cache 传输耗时占端到端总延迟的 43%~56%,成为主要瓶颈。


深入分析真实业务 Trace 后发现,输入请求的命中率分布极度偏斜:70%-80% 的请求命中率在 95% 以上,仅极少数低命中率请求携带巨大数据包。微基准测试表明,在真实偏斜分布下,绝大多数请求传输延迟极低,仅少数“刺头请求”会出现长尾延迟。


结论明确:解决跨集群 PD 传输延迟瓶颈,无需全局优化网络,只需针对少部分低命中率请求进行针对性优化。
创新解法:PDD 三层架构与“中继接力”机制
基于上述洞察,无问芯穹提出了 PDD(Prefill-RelayDecode-MainDecode)架构。该架构在传统 PD 两层基础上,插入一个“中继站”——RelayDecode(RLD)实例,用于掩盖以太网 KV Cache 传输延迟。

系统分为三层:
- P 实例:位于主集群,负责处理输入 Prompt 并生成 KV Cache。
- RLD 实例:与 P 实例同集群,通过高速 RDMA 网络互联,延迟仅几十毫秒。
- MainDecode 实例(MD 实例):位于远端集群,通过广域网以太网连接,延迟为数秒及以上。
工作流程类似"2x100 米接力赛”:P 实例完成计算后,同时通过 RDMA 将 KV Cache 传给 RLD,并通过以太网传给 MD。RLD 拿到数据后立即开始解码并输出 Token 给用户,从而让用户感知不到跨集群传输延迟。待 MD 收到完整数据后,解码任务无缝交接给 MD 完成后续工作。
核心机制解析:优雅完成“接力棒交接”
PDD 架构的工程难点在于如何将 RLD 正在进行的解码任务无缝接管至 MD。传统做法是 RLD 边解码边传增量 KV Cache,但这仍受限于网络延迟及繁琐的内存拷贝。
无问芯穹提出了"Extend-Decode Handoff(扩展解码交接)”机制:RLD 仅将生成的少量"Token ID"传给 MD,MD 收到后利用 Extend-Decode 技术在本地重算对应的 KV Cache 并生成新 Token。
由于 Decode 阶段是访存密集型,计算轻量,重算 100 个 Token 的平均耗时仅约 305ms,且延迟确定性高。相比之下,传统以太网传输 KV Cache 不仅平均耗时相近,且在网络拥堵时延迟波动极大。
通过“只传 Token,本地重算”,系统将不可控的网络操作转化为确定性的本地计算。此外,团队设计了“追赶式”和“一次性”两种交接模式,可根据实时负载动态切换,确保用户体验与同集群部署无异。
流水线编排:避免 RLD 成为系统瓶颈
为防止 RLD 占用过多算力,团队依据命中率偏斜规律设计了两种流水线:
- P-MD 流水线:针对命中率>95% 的高频请求(占比超 70%),数据包极小,直接经以太网传给 MD,无需 RLD 中继。
- P-RLD-MD 流水线:仅针对低命中率、大数据包的“刺头请求”,启用 RLD 进行延迟掩盖。
实测显示,RLD 仅承担系统 6.2% 的 Token 生成任务,93.8% 的重活由 MD 完成。这种设计既保证了 MD 端缓存命中率与 P 端一致,又避免了因请求生命周期终结于 RLD 而导致的负载恶性循环。

实战成绩单:降本增效的终极证明
团队在 DeepSeek-V4-pro 模型上使用真实 Agentic 工作负载 Trace 进行了全方位测试,对比了 CDC-PD(跨集群无 RLD)和 IDC-PD(单机房同构)两种基线。
延迟表现:近乎 100% 掩藏网络延迟
在跨集群场景下,传统架构受网络拥堵影响,TTFT 的 P90 延迟高达 18.3 秒。PDD 架构利用 RLD 抢先输出,成功掩盖后台传输延迟,使 P90 TTFT 降低约 46%(降至 9.8 秒),P99 从 29.7 秒降至 14.4 秒。

负载分布:中继站高效运转
实测数据证实,RLD 实例仅承担约 6.2% 的 Token 生成任务,远端 MD 实例包揽 93.8%,两者负载差异达 15.2 倍,证明了路由策略的有效性。

性价比:更低成本,更高吞吐
在严格的延迟约束下,PDD 架构在总成本下降 3.5%~7.1% 的前提下,请求有效吞吐量(RPS Goodput)提升 27.8%,最终使性价比(BCR)提升高达 37.5%。



值得注意的是,受限于测试资源,本次实验未开启 MTP 等关键优化机制,未来在更大规模部署及引入专用推理芯片后,性价比仍有巨大提升空间。
未来展望:MaaS 基础设施的新蓝图
PDD 架构体现了无问芯穹对下一代 MaaS 基础设施的核心理念:“极简局部异构 + 灵活远端分离”。未来,无需在同一机房堆砌庞杂的异构芯片,只需在主算力中心保留极小比例的“接力手”,即可将庞大的解码任务分发至全球低成本算力节点。
这种范式不仅能构建具有复杂拓扑的推理基建,还能大幅盘活存量算力,压低资源空置比例,让每一块芯片都能发挥最大产业价值。


大模型的规模化落地是一场漫长的技术长跑,无问芯穹将继续在系统架构领域深耕探索。
技术报告地址:https://github.com/infinigence/pdd

