第一章:核心原理——为什么显存是第一硬指标
1.1 推理的两个阶段
大模型推理分为预填充(Prefill)和解码(Decode)两个阶段,其对硬件资源的需求截然不同:
| 阶段 | 名称 | 做什么 | 瓶颈 | 体感影响 |
|---|---|---|---|---|
| 预填充(Prefill / PP) | 处理输入 | 一次性处理提示词,计算 KV 缓存 | 算力 + 带宽 | 首字延迟(TTFT),长文档/RAG 场景差距巨大 |
| 解码(Decode / TG) | 生成回答 | 逐 Token 生成输出 | 显存带宽 | 打字速度(token/s) |
关键数据:RTX 5090 的预填充速度约为 4090 的 2 倍(9800 vs 4800 tok/s),但解码速度仅快 40%-70%。这意味着在短对话中两者差距不大,但在处理长文档、RAG 检索及大上下文场景时,5090 具备碾压级优势。
1.2 显存计算公式
模型能否完整装入显存,可参考以下估算公式:
所需显存 ≈ 模型参数量 (B) × 每参数字节数 + KV 缓存 + 系统开销 (约 10%-20%)
以 32B 模型、Q4_K_M 量化(约 0.6 bytes/weight)为例:
- 权重占用:32 × 0.6 = 19.2 GB
- KV 缓存(32k 上下文):约 3-5 GB
- 系统开销:约 2 GB
- 合计:约 24-26 GB
结论:32B Q4 模型需要 24GB 显存才能完整运行。若使用 16GB 显卡,必须将部分层卸载至内存,导致速度暴跌。
1.3 显存不足的影响
| 状态 | 表现 | 速度影响 |
|---|---|---|
| 完整装入显存 | 流畅,GPU 全速运行 | 100% |
| 部分层卸载到内存 | 仍能运行,但需 CPU↔GPU 频繁搬运 | 降至 30%-50% |
| 大部分在内存 | 极慢,几乎不可用 | 降至 5%-15% |
| 完全装不下 | 直接 OOM 报错,无法运行 | 0% |
核心结论:显存是"0 和 1"的门槛。装不下即为不可用,而非仅仅是变慢的问题。
第二章:显卡深度对比——精确性能基准
2.1 主流消费级显卡规格总表
| 显卡 | 显存 | 显存类型 | 显存带宽 | TDP | 架构 | 国内参考价 | MSRP |
|---|---|---|---|---|---|---|---|
| RTX 5090 | 32GB | GDDR7 | 1792 GB/s | 575W | Blackwell | ¥16,500‑22,000 | $1,999 |
| RTX 5080 | 16GB | GDDR7 | 960 GB/s | 360W | Blackwell | ¥8,000‑10,000 | $999 |
| RTX 5070 Ti | 16GB | GDDR7 | 896 GB/s | 300W | Blackwell | ¥5,000‑6,500 | $749 |
| RTX 5070 | 12GB | GDDR7 | 672 GB/s | 250W | Blackwell | ¥4,000‑5,000 | $549 |
| RTX 5060 | 8GB | GDDR7 | 448 GB/s | 180W | Blackwell | ¥3,000‑3,800 | $299 |
| RTX 4090 | 24GB | GDDR6X | 1008 GB/s | 450W | Ada | ¥12,000‑18,000(二手) | $1,599 |
| RTX 4080 Super | 16GB | GDDR6X | 736 GB/s | 320W | Ada | ¥7,000‑9,000 | $999 |
| RTX 4070 Ti Super | 16GB | GDDR6X | 672 GB/s | 285W | Ada | ¥5,500‑7,000 | $799 |
| RTX 4060 Ti | 16GB | GDDR6 | 288 GB/s | 165W | Ada | ¥3,000‑4,000 | $499 |
| RTX 3090 | 24GB | GDDR6X | 936 GB/s | 350W | Ampere | ¥3,500‑5,500(二手) | $1,499 |
| RTX 3060 | 12GB | GDDR6 | 360 GB/s | 170W | Ampere | ¥1,500‑2,500(二手) | $329 |
2.2 大语言模型推理速度基准(单流)
以下数据基于 llama.cpp / vLLM 实测,采用 Q4_K_M 量化:
| 显卡 | 7‑8B 模型 | 14B 模型 | 32B 模型 | 70B 模型 |
|---|---|---|---|---|
| RTX 5090 (32G) | 186‑215 tok/s | 103‑124 tok/s | 61‑85 tok/s | 37 tok/s* |
| RTX 4090 (24G) | 125‑150 tok/s | 69‑95 tok/s | 47 tok/s | 28 tok/s* |
| RTX 3090 (24G) | 112 tok/s | 75 tok/s | 37 tok/s | - (显存够但慢) |
| RTX 5080 (16G) | 120 tok/s | 70 tok/s | 需卸载 | 不可 |
| RTX 5070 Ti (16G) | 90‑110 tok/s | 55 tok/s | 需卸载 | 不可 |
| RTX 5070 (12G) | 70‑80 tok/s | 30 tok/s | 不可 | 不可 |
| RTX 4060 Ti (16G) | 55‑65 tok/s | 25‑35 tok/s | 需卸载 | 不可 |
| RTX 3060 (12G) | 40‑50 tok/s | 18‑22 tok/s | 不可 | 不可 |
*注:70B 在单卡上需部分卸载到内存,速度为估算值;完整流畅运行需 48GB+ 显存。人类舒适阅读速度约 5-8 tok/s,超过 20 tok/s 体感即为“秒出”。
2.3 文生图速度基准
| 显卡 | Flux.1 Dev (1024², BF16) | Flux.1 Dev (FP4) | SDXL (1024², batch4) |
|---|---|---|---|
| RTX 5090 | 8‑9.5 秒/张 | 5 秒/张 | 3.75 秒/张 |
| RTX 4090 | 14‑15 秒/张 | 不支持 (无 FP4 硬件) | 5‑6 秒/张 |
| RTX 5070 Ti | 18‑22 秒/张 | 8‑10 秒/张 | 7‑9 秒/张 |
| RTX 3090 | 20‑25 秒/张 | 不支持 | 8‑10 秒/张 |
2.4 专业卡对比
| 显卡 | 显存 | 带宽 | TDP | 国内参考价 | 核心优势 |
|---|---|---|---|---|---|
| RTX PRO 5000 (48GB) | 48GB GDDR7 ECC | 1344 GB/s | 300W | ¥30,000‑40,000 | 单卡跑 70B,ECC 纠错,7×24 稳定 |
| RTX PRO 5000 (72GB) | 72GB GDDR7 ECC | 1344 GB/s | 350W | ¥80,000‑100,000 | 单卡跑 100B+,企业级 |
| RTX PRO 6000 (96GB) | 96GB GDDR7 ECC | 1792 GB/s | 600W | ¥80,000‑120,000 | 单卡天花板,可跑 200B |
RTX PRO 5000 48GB vs RTX 5090 32GB 关键区别:
- 显存多 16GB:32B 模型可支持更长上下文(5090 超过 2 万 token 易爆显存)。
- ECC 显存:长时间运行无静默数据损坏。
- 功耗更低:300W vs 575W,电费省一半,散热压力小。
- 带宽略低:1344 vs 1792 GB/s,解码速度约为 5090 的 75%。
- 价格更高:贵约¥10,000‑15,000。
第三章:量化方式深度解析
3.1 各量化档位详细对比
以 8B 模型为例:
| 量化格式 | 平均 bits/weight | 文件大小 | 显存占用 | 质量 (vs FP16) | 速度 (vs FP16) | 适用场景 |
|---|---|---|---|---|---|---|
| FP16/BF16 | 16 | 16GB | 18‑20GB | 100%(基准) | 1x | 专业研究、质量敏感 |
| Q8_0 | 8.0 | 8.5GB | 10‑12GB | ~99%(+0.02 困惑度) | 1.8x | 显存充裕时首选 |
| Q6_K | 6.6 | 6.6GB | 8‑10GB | ~97%(+0.05) | 2.2x | 代码/数学推理 |
| Q5_K_M | 5.7 | 5.7GB | 7‑9GB | ~95%(+0.10) | 2.5x | 高质量日常使用 |
| Q4_K_M | 4.8 | 4.9GB | 6‑8GB | ~92%(+0.15‑0.20) | 3.0x | 通用默认推荐 |
| Q4_K_S | 4.0 | 4.4GB | 5.5‑7GB | ~90%(+0.20) | 3.1x | 显存极度紧张 |
| Q3_K_M | 3.5 | 3.8GB | 5‑6GB | ~85%(+0.55) | 3.3x | 仅简单问答 |
| Q2_K | 2.6 | 2.8GB | 4‑5GB | ~75%(明显下降) | 3.5x | 极小设备尝鲜 |
3.2 量化对不同任务的质量影响
| 任务类型 | Q4_K_M vs FP16 | 建议最低量化 |
|---|---|---|
| 日常聊天/写作 | 几乎无感知差异 | Q4_K_M |
| 摘要/翻译 | 差异极小 | Q4_K_M |
| 代码生成 | 有轻微下降(约 5%) | Q5_K_M |
| 数学推理 | 下降较明显(5‑8%) | Q6_K / Q8_0 |
| 复杂逻辑/Agent 规划 | 下降明显 | Q8_0 / FP16 |
3.3 特殊量化技术
| 技术 | 说明 | 适用硬件 | 效果 |
|---|---|---|---|
| AWQ‑INT4 | 激活感知量化,比 Q4 质量更好 | NVIDIA 全系列 | 质量≈Q5,体积=Q4 |
| GPTQ | 经典 4‑bit 量化方案 | NVIDIA 全系列 | 成熟稳定,ExLlamaV2 专用 |
| NVFP4 | Blackwell 架构专属 4‑bit 浮点 | RTX 50 系 only | 吞吐量 1.6x,能耗 -41%,质量损失 2‑4% |
| FP8 | 8‑bit 浮点,质量接近 FP16 | RTX 40/50 系 | 显存减半,速度 1.8x |
| 2‑bit (Qwen3.6‑A3B) | 极致压缩,MoE 模型专用 | 全系列 | 35B 模型仅 12.3GB,12GB 显卡可跑 |
第四章:推理引擎选型
4.1 六大推理引擎深度对比
| 引擎 | 硬件支持 | 量化格式 | 单流速度 | 并发吞吐 | 部署难度 | 最佳场景 |
|---|---|---|---|---|---|---|
| Ollama | 全平台 (N 卡/A 卡/CPU/Mac) | GGUF(Q2‑Q8) | 基线 | 弱 (单进程) | ★☆☆☆☆ 极简 | 个人用户、快速体验 |
| LM Studio | 全平台 | GGUF | 基线 | 弱 | ★☆☆☆☆ 图形界面 | 非技术用户、新手 |
| llama.cpp | 全平台 | GGUF(全档位) | 快 (基线 +10%) | 弱 | ★★☆☆☆ | 单用户低延迟、跨平台 |
| ExLlamaV2/V3 | NVIDIA only | EXL2/GPTQ | 最快 (+50‑85%) | 中 | ★★★☆☆ | 追求极致速度、多卡 |
| vLLM | NVIDIA/A 卡 | AWQ/GPTQ/FP8 | 快 | 最强 (2‑4x) | ★★★★☆ | 多用户 API 服务、生产部署 |
| TensorRT‑LLM | NVIDIA only | FP8/INT4/FP4 | 最快 (+10‑30% vs vLLM) | 最强 | ★★★★★ 复杂 | 企业级、极致性能 |
| MLX | Apple Silicon only | 原生/量化 | 快 (Mac 最优) | 中 | ★★★☆☆ | MacBook/Mac Studio |
4.2 引擎选择决策
你是谁?
├── 普通用户/新手 → Ollama 或 LM Studio(双击即用)
├── 个人开发者,追求速度 → ExLlamaV2(单卡)或 llama.cpp
├── 要给团队/客户提供 API 服务 → vLLM(PagedAttention,高并发)
├── 企业级 7×24 生产环境 → TensorRT‑LLM(最稳定最高性能)
└── Apple Silicon 用户 → MLX(苹果芯片专属优化)
4.3 vLLM 的核心优势
vLLM 的 PagedAttention 技术将 KV 缓存像虚拟内存一样分页管理,带来以下优势:
- 显存利用率提升 3-5 倍(传统方案大量显存被碎片浪费)。
- 支持连续批处理(continuous batching),吞吐量提升 2-4 倍。
- 实测:同样硬件跑 13B 模型,Ollama 吞吐 120 tok/s,vLLM 达 610 tok/s。
- 首 Token 延迟从 150-300ms 降至 50-80ms。
第五章:台式机完整配置方案
5.1 各配件选型逻辑
CPU:推理的配角,但不能太弱
| CPU 定位 | 作用 | 推荐 |
|---|---|---|
| 模型加载/预处理 | 加载模型到显存、tokenize 输入 | 6 核以上即可 |
| CPU 卸载推理 | 显存不够时,部分层在 CPU 跑 | 核越多越好,主频高更好 |
| 多卡数据搬运 | PCIe 数据传输、多卡协调 | PCIe 通道数充足 |
| 同时跑其他服务 | RAG 向量库、数据库、Web 服务 | 8 核以上 |
结论:纯推理单卡场景,i5/R5 级别足够;多卡或同时跑 RAG/数据库,建议 i7/R7 以上。
内存:至少是显存的 2 倍
| 显存 | 推荐系统内存 | 原因 |
|---|---|---|
| 8‑12GB | 32GB | 模型卸载 + 系统 + 应用 |
| 16‑24GB | 64GB | 部分卸载 + 大上下文 KV 缓存 |
| 32GB+ | 128GB | 70B 模型卸载 + 多模型共存 |
| 多卡 48GB+ | 128‑256GB | 企业级并发 |
内存频率:DDR5 5600-6000MHz 是甜点。ECC 内存仅工作站/服务器场景需要。
主板:PCIe 通道数是多卡关键
- 单卡:任意 PCIe x16 插槽即可,B 系列主板够用。
- 双卡:需要支持双 x8 PCIe 4.0/5.0,X670E/Z790 起步。
- 三卡/四卡:需工作站主板(如技嘉 MU72-SU0),支持 7 个 PCIe 插槽。
注意:消费级主板插双卡时,通常是 x8+x8(不是 x16+x16),对推理影响可接受。
电源:必须留足余量
| 显卡 | 推荐电源 | 原因 |
|---|---|---|
| RTX 5060/4060Ti | 650W | 整机满载约 350W |
| RTX 5070/5070Ti | 750‑850W | 整机满载约 450W |
| RTX 5080 | 850‑1000W | 整机满载约 550W |
| RTX 5090 | 1000‑1200W | 整机满载约 700W,瞬时功耗可能更高 |
| RTX 4090 | 850‑1000W | 整机满载约 600W |
| 双卡 5090 | 1600‑2000W | 整机满载约 1200W |
| 四卡 4090 | 2000W+ 服务器电源 | 整机满载约 1800W |
5090 特别提醒:575W TDP 但瞬时功耗尖峰可能达到 700W+,且 12V-2x6 接口有烧毁风险,必须用原厂或认证转接线,电源必须留 30% 以上余量。
散热:AI 推理是长时间满载
- 5060/4060Ti:原装风冷即可,常规中塔机箱。
- 5070/5070Ti:三风扇风冷或 240 水冷,前进后出风道。
- 5080:三风扇风冷或 360 水冷,高风压机箱。
- 5090/4090:强烈建议 360 水冷,全塔 + 多风扇。
- 多卡:服务器机箱 + 暴力扇或开放式机架,风道优先于静音。
5.2 第一档:入门尝鲜型 — ¥4,000‑6,000
定位:新手入门、7B/14B 模型、SD 文生图、学习部署流程。
| 配件 | 推荐型号 | 价格 | 选型理由 |
|---|---|---|---|
| CPU | AMD R5 7500F (6 核 12 线程) | ¥800 | 6 核足够推理,性价比高 |
| 主板 | 微星 B650M 爆破弹 | ¥650 | 支持 DDR5,够用 |
| 显卡 | RTX 4060 Ti 16GB(二手) | ¥2,500 | 16GB 显存是这个价位唯一选择 |
| 内存 | 金百达 32GB DDR5 6000 (16G×2) | ¥550 | 32G 起步,双通道 |
| 硬盘 | 致态 TiPlus7100 1TB | ¥450 | 国产靠谱 NVMe |
| 电源 | 航嘉 WD650K 金牌 | ¥400 | 650W 留足余量 |
| 散热 | 利民 AX120R SE | ¥70 | 压 7500F 绰绰有余 |
| 机箱 | 先马平头哥 M2 | ¥180 | 常规 MATX |
| 合计 | - | 约¥5,600 | - |
备选显卡:RTX 3060 12GB(更便宜,但 14B 吃力);RTX 3090 24GB(加预算上这个,体验质变,可跑 32B)。
能跑的模型:Qwen3.5:7b (流畅),Qwen3.5:14b (可用),Qwen3.5:32b (勉强,需卸载)。
5.3 第二档:主流实用型 — ¥9,000‑15,000
定位:日常主力机、14B 极速、32B 可跑、Flux 文生图舒适。
| 配件 | 推荐型号 | 价格 | 选型理由 |
|---|---|---|---|
| CPU | AMD R7 9700X (8 核 16 线程) | ¥1,600 | 8 核兼顾推理和日常 |
| 主板 | 华硕 B650M 重炮手 WIFI | ¥1,100 | 供电扎实,接口全 |
| 显卡 | RTX 5070 Ti 16GB | ¥5,500 | 新卡保修,GDDR7 高带宽 |
| 内存 | 64GB DDR5 6000 (32G×2) | ¥1,000 | 64G 是 AI 主机舒适线 |
| 硬盘 | 致态 TiPlus7100 2TB | ¥800 | 多模型存储需要 |
| 电源 | 海韵 FOCUS GX850 | ¥750 | 850W 金牌全模 |
| 散热 | 利民 Frozen Magic 360 | ¥400 | 360 水冷压 9700X |
| 机箱 | 追风者 G400A | ¥350 | 风道好,支持 360 水冷 |
| 合计 | - | 约¥11,500 | - |
显卡二选一分析:
- 方案 A:RTX 5070 Ti 16GB(新)。优势:保修、GDDR7 带宽、NVFP4 支持、低功耗。劣势:16GB 显存,32B 需卸载。
- 方案 B:RTX 4090 24GB(二手)。优势:24GB 显存可完整跑 32B、Flux 全精度。劣势:二手风险、高功耗、无 FP4。
如果预算能到¥15,000+,强烈建议方案 B(二手 4090):24GB 显存带来的模型能力提升是质变级的,4090 的推理速度也比 5070Ti 快约 50%。
5.4 第三档:高端性能型 — ¥20,000‑35,000
定位:32B 流畅、70B 可尝试、Flux.2 全精度、专业创作。
方案 A:单卡 RTX 5090 32GB(总价约¥31,000)
- CPU:AMD R9 9900X (12 核)
- 主板:华硕 X670E-F GAMING WIFI (PCIe 5.0)
- 显卡:RTX 5090 32GB (消费级天花板)
- 内存:128GB DDR5 6000 (支持 70B 卸载)
- 电源:海韵 PRIME TX1000 白金 (1000W)
- 散热:恩杰 Z73 360 水冷
方案 B:双卡 RTX 4090 24GB(总显存 48GB,总价约¥42,000)
- CPU:AMD R9 9950X (16 核,多卡协调)
- 主板:华硕 ProArt X670E-Creator (支持双 PCIe 5.0 x8)
- 显卡:RTX 4090 24GB ×2(涡轮版,适合多卡风道)
- 电源:海韵 PRIME TX1600 白金 (1600W)
- 机箱:追风者 PH-ES620PC 全塔服务器机箱
双卡方案注意事项:消费级卡无 NVLink,卡间通信走 PCIe。5090 硬件层面关闭了 P2P 功能,不建议多卡并行。双卡 4090 在 vLLM 张量并行下效率约为单卡的 1.6-1.8x。
双卡 4090 能力:Qwen3.5:32b (极速),Qwen3.5:72b/Llama3.1:70B (流畅)。
5.5 第四档:旗舰工作站型 — ¥50,000‑120,000
定位:70B+ 完整运行、企业私有化、多用户并发、7×24 运行。
方案 A:RTX PRO 5000 48GB 单卡工作站(约¥64,000)
- CPU:Intel Xeon w5-3435X (16 核)
- 主板:华硕 Pro WS W790-ACE (7 个 PCIe 插槽)
- 显卡:RTX PRO 5000 48GB (ECC 显存)
- 内存:128GB DDR5 ECC 5600
- 电源:1600W 服务器级冗余电源
方案 B:四卡 RTX 4090 24GB(总显存 96GB,约¥82,000)
- CPU:AMD EPYC 7542 (32 核 64 线程)
- 主板:技嘉 MU72-SU0 服务器主板
- 显卡:RTX 4090 24GB 涡轮版 ×4
- 内存:256GB DDR4 ECC
- 电源:2000W 服务器冗余电源 ×2
四卡方案能力:总显存 96GB,可完整运行 120B+ 模型(Q4),vLLM 部署可支持 20-50 人同时使用。需注意噪音极大,必须放机房。
第六章:笔记本完整方案
6.1 笔记本的特殊限制
| 限制 | 说明 | 影响 |
|---|---|---|
| 功耗墙 | 移动端显卡通常 115-175W | 同型号性能约为台式机的 60-80% |
| 显存缩水 | 移动端 4090 仅 16GB,5090 仅 24GB | 能跑的模型规模小一档 |
| 散热瓶颈 | 长时间满载会降频 | 持续推理速度可能下降 10-20% |
| 不可升级 | 显卡焊死在主板上 | 一步到位,没有升级路径 |
6.2 移动端显卡规格
| 移动端显卡 | 显存 | 功耗范围 | 性能 (约台式机) | 笔记本价格区间 |
|---|---|---|---|---|
| RTX 5090 Laptop | 24GB GDDR7 | 175W | ≈台式机 5070Ti-5080 | ¥22,000‑35,000 |
| RTX 5080 Laptop | 16GB GDDR7 | 150-175W | ≈台式机 5070 | ¥13,000‑18,000 |
| RTX 5070 Ti Laptop | 12GB GDDR7 | 115-150W | ≈台式机 4070Ti | ¥10,000‑14,000 |
| RTX 5070 Laptop | 8GB GDDR7 | 115-140W | ≈台式机 4060Ti | ¥8,000‑11,000 |
| RTX 4090 Laptop | 16GB GDDR6X | 150-175W | ≈台式机 4080 | ¥18,000‑30,000(清仓) |
6.3 入门便携型 — ¥7,000‑10,000
推荐机型:联想拯救者 R7000P 2025 (RTX5060 8G)、惠普暗影精灵 11 (RTX5070 8G)。
能力:流畅运行 Qwen3.5:7b,可用运行 14B Q4,支持 SD 1.5/SDXL 文生图。适合学生及轻度出差使用。
6.4 主流性能型 — ¥10,000‑16,000
推荐机型:机械革命耀世 16Ultra (RTX5070Ti 12G)、惠普暗影精灵 Max16/ROG 枪神 9 (RTX5080 16G)。
重点推荐:RTX 5080 16GB 笔记本。16GB 显存是笔记本跑 AI 的黄金容量,可流畅运行 14B 模型,32B Q4 可部分卸载运行,Flux.1 Dev Q4 可舒适生成。性价比最高的笔记本 AI 档位。
6.5 旗舰移动工作站 — ¥20,000‑40,000
Windows 阵营:微星泰坦 16AI、ROG 枪神 9 Plus、未来人类 X98 (均搭载 RTX5090 24G)。能力:完整运行 32B Q4,部分卸载运行 72B,支持 Flux.2-dev FP8。
Apple Silicon 阵营(MacBook Pro):
| 配置 | 统一内存 | 价格 | AI 能力 |
|---|---|---|---|
| M4 Pro 14 寸 | 24GB | ¥15,000‑18,000 | 14B 流畅,32B 卸载 |
| M4 Max 14 寸 | 36GB | ¥19,000‑22,000 | 32B 流畅,70B 卸载 |
| M4 Max 14/16 寸 | 64GB | ¥25,000‑28,000 | 32B 极速,70B 可跑 |
| M4 Max 16 寸 | 128GB | ¥35,000‑40,000 | 70B 流畅,120B 可尝试 |
MacBook Pro M4 Max 独特优势:统一内存无壁垒(64GB 内存即 64GB“显存”),MLX 框架深度优化,功耗极低且安静。劣势:内存带宽低于 N 卡,推理速度约为同显存 N 卡的 50-60%,文生图生态较弱。
结论:主要跑大语言模型、看重便携续航选 M4 Max 64GB;需跑文生图/视频、追求极致速度选 RTX 5090 笔记本。
第七章:Apple Silicon 台式方案(Mac Studio / Mac mini)
7.1 机型对比
| 机型 | 芯片 | 最高统一内存 | 内存带宽 | 起售价 | 定位 |
|---|---|---|---|---|---|
| Mac mini (M5) | M5 | 32GB | 273 GB/s | ¥5,000 | 入门,常驻智能体 |
| Mac mini (M5 Pro) | M5 Pro | 64GB | 546 GB/s | ¥12,000 | 中型本地模型 |
| Mac Studio (M4 Max) | M4 Max | 128GB | 546 GB/s | ¥16,499 | 高性能工作站 |
| Mac Studio (M3 Ultra) | M3 Ultra | 192GB | 819 GB/s | ¥32,999 | 顶级大内存 |
| Mac Studio (M5 Max) | M5 Max | 512GB | 1.2 TB/s | 约¥20,000 起 | 未来旗舰 |
7.2 Apple Silicon 优劣势总结
优势:统一内存架构打破“显存墙”,内存容量即 AI 能力上限;功耗极低;静音;macOS 生态友好;M5 Max 将至 512GB 统一内存。
劣势:内存带宽低于同价位 N 卡;推理速度较慢;CUDA 生态不兼容;文生图/视频生态弱;内存不可升级。
第八章:多卡互联深度解析
8.1 消费级卡的互联现状
| 显卡 | NVLink | P2P 支持 | 卡间带宽 | 多卡体验 |
|---|---|---|---|---|
| RTX 3090 | 有 (NVLink 3-slot 桥) | 支持 | 约 50-60 GB/s | 较好,双卡效率 1.7-1.8x |
| RTX 4090 | 无 | 驱动限制 P2P | 20-25 GB/s (PCIe) | 一般,双卡效率 1.5-1.7x |
| RTX 5090 | 无 | 硬件关闭 P2P | 经 CPU 中转 (更低) | 较差,不推荐多卡 |
重要结论:RTX 3090 是消费级唯一支持 NVLink 的卡,双卡 3090+NVLink 桥是性价比最高的多卡方案(二手双卡约¥8,000-10,000,总显存 48GB)。RTX 5090 硬件关闭了 P2P,不建议买多张做并行。
8.2 两种并行策略
- 张量并行 (Tensor Parallel):每层切分到多卡同时计算。通信频率高,带宽敏感度极高,首字延迟低。适用于延迟敏感、单模型场景。
- 流水线并行 (Pipeline Parallel):按层切分,卡 1 算前半,卡 2 算后半。通信频率低,带宽敏感度低,但首字延迟高(气泡)。适用于吞吐优先、大 batch 场景。
8.3 多卡配置推荐
| 预算 | 方案 | 总显存 | 预估价格 | 能跑的最大模型 |
|---|---|---|---|---|
| ¥8,000‑12,000 | 2× RTX 3090 24GB + NVLink 桥 | 48GB | ¥10,000 | 70B Q4 流畅 |
| ¥25,000‑35,000 | 2× RTX 4090 24GB 涡轮 | 48GB | ¥30,000 | 70B Q4 流畅 |
| ¥60,000‑80,000 | 4× RTX 3090 24GB + NVLink | 96GB | ¥70,000 | 120B Q4 |
| ¥80,000‑100,000 | 4× RTX 4090 24GB 涡轮 | 96GB | ¥90,000 | 120B Q4 |
第九章:魔改 RTX 4090 48GB 深度分析
9.1 什么是魔改 4090
以 3090 双面显存 PCB 为基础,正反各焊 12 颗 2GB GDDR6X 颗粒,共 24 颗=48GB,配合流出的 48G VBIOS。国内价格约¥15,000-25,000。
9.2 风险清单
| 风险 | 严重程度 | 说明 |
|---|---|---|
| 失去保修 | 致命 | 100% 不在保修范围内,NVIDIA 官方不承认 |
| 驱动兼容性 | 高 | 472.12+ 驱动识别异常,需锁定旧驱动 |
| 稳定性 | 中 | 专业改装商故障率约 2%,高温下显存通道问题 |
| 静默数据损坏 | 中 | 无 ECC,显存错误可能导致生成结果异常 |
| 二手残值 | 高 | 出手极难,圈内人都知道风险 |
9.3 结论
不推荐普通用户购买魔改 4090。同样预算可买全新保修的 RTX 5090 32GB,或加预算上 RTX PRO 5000 48GB,或选择双卡 3090+NVLink 方案。魔改卡仅适合有能力自行排查驱动/散热问题的极客玩家。
第十章:软件部署完整方案
10.1 工具栈全景
用户界面层
├── Open WebUI(最漂亮的 Web 聊天界面,类 ChatGPT)
├── Cherry Studio(桌面客户端,支持多模型管理)
├── LM Studio(自带图形界面,一体化)
├── AnythingLLM(RAG 知识库 + 聊天一体化)
└── 浏览器插件/IDE 插件(Cursor、Continue 等)
推理引擎层
├── Ollama(个人首选,一键部署)
├── vLLM(多用户/API 服务首选)
├── llama.cpp(轻量跨平台)
├── ExLlamaV2(极致速度)
├── TensorRT‑LLM(企业级)
└── MLX(Apple Silicon 专属)
模型层
├── 语言模型:Qwen3.5、Llama3.1、DeepSeek、Mistral、Gemma
├── 多模态:Qwen3.5‑VL、Llama3.2‑Vision、MiniCPM‑V
├── 文生图:Flux.1/2、SDXL、SD 1.5
├── 文生视频:WAN 2.2、CogVideoX、HunyuanVideo
└── 代码:Qwen3.5‑Coder、DeepSeek‑Coder‑V2
应用扩展层
├── RAG 知识库:LlamaIndex、LangChain、Dify、AnythingLLM
├── Agent 框架:AutoGen、CrewAI、LangGraph
├── 向量数据库:Chroma、Milvus、Qdrant
└── API 网关:OpenAI 兼容接口,可接任何第三方工具
10.2 Ollama 快速部署
# 1. 安装(Windows/macOS/Linux 全平台)
# 官网下载:ollama.com/download
# 2. 运行模型(自动下载)
ollama run qwen3.5:7b
