出品丨奇点折射
AI 正从“聊天时代”迈向"Agent 时代”。未来的 AI 不仅具备问答能力,更能调用工具、理解复杂任务、保持长期记忆并自主执行多步推理。这一趋势重塑了 AI 基础设施需求,相较于单纯算力,显存容量与带宽已成为本地部署的关键瓶颈。
为评估新一代 NVIDIA Blackwell 架构对 Agentic AI 场景的支持表现,我们开展了一系列大模型性能测试,旨在为部署方案提供专业参考。

硬件测试平台
硬件平台与选型
主机平台:选用旗舰级塔式工作站 Dell Precision 7960 Tower。该设备支持从单卡到四卡双宽 GPU 的灵活扩展,内存最高可达 4TB DDR5,确保大参数量模型稳定加载,满足从轻量化到重负载的全场景推理验证需求。
GPU 选型:采用基于 Blackwell 架构的顶级专业显卡 NVIDIA RTX PRO™ 5000 Blackwell (72GB)。作为最新款桌面端专业卡,其技术突破显著:
- 引入第五代 Tensor Core 与 FP4 精度,大幅提升推理效率;
- PCIe 5.0 接口极大优化 CPU 与 GPU 间数据吞吐;
- GDDR7 显存提供超高带宽,配合 72GB 大容量,使桌面端显卡能够承载更大规模模型及长上下文任务。
NVIDIA RTX PRO™ 5000 Blackwell 在显存、算力与稳定性上表现均衡,尤其适合 Agent 复杂任务中的多模型并行加载与长上下文处理,兼具可靠性与成本优势。

NVIDIA RTX PRO™ 5000 Blackwell(图片来源:NVIDIA)
通过在该平台部署单卡、双卡及四卡配置,可分别获得 72GB、144GB 及 288GB 显存容量,全面验证 Blackwell 显卡在不同智能体任务负载下的性能表现。
模型选择
测试综合考量任务复杂度、响应速度与并发需求,选取不同规模模型。所有测试均基于原生模型精度,未进行额外后训练或微调,以真实反映 Blackwell 平台的性能输出。
测试模型
软件环境
- NVIDIA Driver: 580.x+
- CUDA Toolkit: 12.8+
- vLLM: 0.20.0+
- PyTorch: 2.10
场景选择与测试指标
测试基于 vLLM 推理框架,设定三类梯度场景,输入 Token 数分别为 4K、20K、40K,贴合主流智能体使用情况。
测试场景:
- 短对话(4K 输入/200 输出):基准性能摸底,验证日常推理稳定性。
- 智能体任务(20K 输入/200 输出):模拟完整 Agent 闭环,包含指令约束、工具调度、RAG 检索、多轮记忆及数据解析,验证工作流性能。
- 超长上下文(40K 输入/200 输出):高阶场景,涵盖长文档分析、日志研判、连续复盘及代码编写,考验显存容量、带宽及缓存调度极限。
测试指标:
- 首字延迟 (TTFT):从接收请求到输出首个 Token 的时间。
- P50 吞吐率:平均每用户每秒生成 Token 数量 (tokens/s) 的中位数。
- 总吞吐率:单位时间内系统总吞吐峰值。
智能体应用场景实测与分析
以 DeepSeek-V4-Flash-284B-NVFP4 模型为例进行详细数据分析。该模型参数量 284B,NVFP4 精度下需占用约 160GB 显存。测试平台采用 Dell Precision 7960 搭配四张 NVIDIA RTX PRO™ 5000 Blackwell (72GB),总显存 288GB,完美支持其原生运行。
DeepSeek V4 Flash-284B-NVFP4
测试场景 A:短对话(4K 输入 + 200 输出)
注:数据报告基于 P50 指标,吞吐率由 1/median_itl 计算得出。
性能趋势图 (P50):

吞吐量时序图:
并发 8:

并发 16:

性能分析:随并发数增加,首字时延快速上升。四卡并行配置可良好支持 8-16 个并发用户的短对话场景。
测试场景 B:智能体任务(20K 输入 + 200 输出)
性能趋势图 (P50):

吞吐量时序图:
并发 4:

并发 8:

性能分析:此场景更关注吞吐率。四卡支持下,智能体任务在 8-16 并发区间体验良好,首字时延对整体体验影响有限。
测试场景 C:超长上下文(40K 输入 + 200 输出)
性能趋势图 (P50):

吞吐量时序图:
并发 4:
并发 8:
性能分析:即便在复杂的超长上下文场景中,四卡配置仍可支持 4-8 个并发。结合 KV Cache 优化,保守估计可支持约 10 个用户同时访问。
综合实测结果
基于上述测试方法,我们对多款模型进行了验证,并整理了相应的硬件适配建议。
智能体应用性能优化测试
除硬件配置外,关键优化实践亦能显著提升效率。我们在同一平台上进行了三项拓展测试:NVFP4 精度优化、KV Cache TurboQuant 增益及 MTP 性能增益。
拓展测试一:NVFP4 性能跃升
Blackwell 架构支持 NVFP4 精度,相比 FP8 可将权重显存占用减少约 75%,有效支撑翻倍上下文长度或批处理大小,对长上下文智能体应用价值巨大。
测试选取 Qwen3.6-35B-A3B 与 Gemma-4-26B-A4B 模型,对比 FP16 与 NVFP4 精度下的性能表现。
测试场景:短对话、智能体任务、超长上下文(输出均为 500 Token)。
测试指标:吞吐率、首字时延。
Qwen3.6-35B-A3B (FP16 vs NVFP4)
Qwen 3.6-35B-A3B 不同精度下最高吞吐量对比 (GPU: 2 x NVIDIA RTX PRO™ 5000 Blackwell)

Qwen 3.6-35B-A3B 不同精度下首字时延对比 (GPU: 2 x NVIDIA RTX PRO™ 5000 Blackwell)
测试显示,NVFP4 相比 FP16,首字时延降低约 18-20%。在中高并发(8-64)区间,最高吞吐量提升 22%-45%。在高负载长上下文场景中,综合性能提升显著,并发数大于 8 时收益最佳。
Gemma-4-26B-A4B (FP16 vs NVFP4)
Gemma-4-26B-A4B 不同精度下最高吞吐量对比 (GPU: NVIDIA RTX PRO™ 5000 Blackwell)

Gemma-4-26B-A4B 不同精度下首字时延对比 (GPU: NVIDIA RTX PRO™ 5000 Blackwell)
NVFP4 使首字时延降低约 22-35%,长上下文场景降幅超 34%。高负载长上下文场景中,综合性能提升达 40%-130%,收益极高。
结论:在 Blackwell 平台上,NVFP4 精度是应对高并发、长序列复杂场景的优选方案。
拓展测试二:KV Cache TurboQuant 性能增益
针对 KV Cache 占用显存大的痛点,测试采用 NVIDIA TurboQuant 量化方案(FP8 keys + 4-bit values),基于双卡配置对 Qwen 3.6-35B-A3B 模型进行评估。

启用与未启用 TurboQuant 的吞吐率对比

启用与未启用 TurboQuant 的首字时延对比
结果显示,KV Cache TurboQuant 主要优化 Prefill 阶段性能,显著降低首字时延,尤其在智能体任务与超长上下文场景中增益明显。但在高并发下可能导致吞吐率下降,建议将并发控制在 32 以内以获得最佳性能。
拓展测试三:MTP 性能增益
Multi-Token-Prediction (MTP) 旨在提高推理吞吐率。测试基于双卡配置,使用 Qwen 3.6-27B 模型进行对比。

启用与未启用 MTP 的吞吐率对比

启用与未启用 MTP 的首字时延对比
MTP 是轻负载下的提速利器。在短对话和智能体任务等低并发场景(8 以内),吞吐率可提升 12%-60%。但在重负载或超高并发情况下,建议关闭 MTP。
不止于性能
测试验证表明,Dell Precision T7960 工作站搭配 NVIDIA RTX PRO™ 5000 Blackwell (72GB) 展现出卓越的智能体推理能力,成功突破超长上下文瓶颈,并发性能出色且办公友好。
即便在 GPU 满载状态下,机器噪音控制在 50 分贝以内,显卡温度维持在 85 度,实现静音运行。对于开发团队而言,该方案具备极高的性价比:配置灵活可调,从单卡轻量起步至四卡超大模型,无需重金投入即可在桌面端部署顶级模型,是推动 Agent 应用开发的理想选择。



