作者 |Don
来源 | 至顶AI实验室
想在自己的电脑上运行大模型,Mac mini 是不少人会考虑的选择:机身小,能配置较大容量的统一内存,也省去了自己组装电脑的麻烦。视频作者 Kai 一度把高配机型放进购物车,准备为本地 AI 花上约 2700 美元。但在核算模型占用和实际使用成本后,他决定先不买。让他犹豫的关键是:模型即使装得进内存,系统和长对话还要占空间;参数表上的 64GB,未必等于使用时的充裕余量。
从 899 美元看到 2699 美元
Kai 最初关注的是售价 899 美元的入门款。这个价格对应 16GB 内存的 M6 Mac mini;如果目标是运行更大的模型,就得考虑增加内存。苹果目前销售 M6 与 M5 Pro 两种 Mac mini,前者最高可配 32GB,后者最高 64GB。Kai 把内存选到 64GB 后,购物车里的价格来到约 2699 美元。
贵在哪里?除了容量,还有带宽。M6 的内存带宽为 153GB/s,选配 24GB 或 32GB 内存时为 170GB/s;M5 Pro 则达到 307GB/s。大语言模型生成每个新词元时都要读取模型权重,因此带宽会明显影响连续输出的速度。不过,带宽更高不代表所有环节都会按比例变快:模型读取提示词、开始输出首个词元的等待时间,还受推理软件等因素影响。
64GB 为什么仍可能不够
Kai 用 gpt-oss-120b 说明高配 Mac mini 的边界。这是 OpenAI 发布的开放权重模型,采用“混合专家”架构:总参数约 1170 亿,每次计算只激活其中一部分。即使如此,官方提供的量化模型文件仍约为 60.8GiB,官方介绍的运行目标是 80GB 内存级别的设备。64GB Mac mini 还要给系统、推理程序和对话上下文留空间,不能只看模型文件大小就认定它能顺畅运行。
长对话还会带来另一笔内存开销:KV 缓存。它保存对话过程中已经计算过的信息,让模型继续回答时不用从头处理全部内容。对话越长,缓存通常越大;具体占用则随模型结构、上下文长度和软件设置变化。视频给出的“长对话可能多占数十 GB”可以作为警示,却不能当作所有 70B 模型通用的固定数值。若确实需要 128GB,产品选择就会从 Mac mini 转向 Mac Studio 等更大内存的设备。
先查等待时间,再换模型
算完硬件,Kai 把注意力转向现有设备上的软件。视频引用的一组用户测试中,界面显示生成速度为每秒 57 个词元,但把首字等待时间算进去后,整体体验远没有这个数字看起来那么快;更换推理服务后,同一设备上的提示词处理时间显著缩短。这是视频转述的个案,效果未必能照搬。它提醒我们,评估本地 AI 时要同时看首字等待时间和开始回答后的生成速度。
另一条思路是换模型。混合专家模型虽然总参数多,但每次生成只调用部分“专家”,有机会在相同设备上比某些稠密模型输出得更快。视频展示了一组在 M4 Pro 上运行的对比:35B 混合专家模型约每秒 78.8 个词元,27B 稠密模型约每秒 14.7 个词元。这组结果取决于具体模型、量化方式和软件环境,不能推成“混合专家模型一定更快、更聪明”。而且,总权重仍须占用内存;运行速度与能否装下,是两道不同的题。
让任务决定配置
Kai 最后的建议是按顺序验证需求:先在现有设备上尝试不同的推理软件和较小的模型,再用实际任务确认需要多长的上下文、能接受多久的等待。只有确认常用模型确实需要约 50GB 至 60GB 内存,64GB M5 Pro 的投入才有了明确依据。对用途尚未确定的人,他更倾向于 32GB M6。
这套思路比直接推荐某个配置更有参考价值。隐私、离线使用和数据不能外传,是本地运行的真实价值;模型质量、长上下文和等待时间,也可能让云端服务更适合某些工作。先拿自己的任务试一段时间,再决定是否购买一台内存无法事后升级的电脑,需求会比参数表说得更清楚。

