作者 | Don
来源 | 至顶AI实验室
离开 CUDA,一张以 Tensix 计算核心和 RISC-V 处理器为基础的 AI 加速卡,能把本地模型跑到什么程度?
在英伟达和 CUDA 之外,Tenstorrent 正在尝试从芯片架构、卡间互联到软件栈搭建一套完整的 AI 计算体系。目前担任公司 CEO 的 Jim Keller,是芯片行业最知名的架构师之一,曾参与 AMD K7、K8、Zen,以及苹果 A4、A5 等芯片的设计。
Wormhole n300 是 Tenstorrent 推出的一张 AI 加速卡。它长得像显卡,插在 PCIe 插槽里,也能运行大模型,但没有视频输出接口。它的实际表现究竟怎么样呢?

最近,我看到 YouTube 博主 Alex Ziskind 做了一次横向测试。他在同一台主机中先后安装 Wormhole n300、RTX 5080和 AMD Radeon AI PRO R9700,用几组本地模型测试了三张卡的推理速度、并发吞吐和能效。
24GB显存,背后是一套不同的计算思路
视频中的 Wormhole n300 售价约1400美元。按照 Tenstorrent 当前官方规格,n300 系列搭载两颗 Wormhole 芯片,拥有24GB GDDR6显存、576GB/s带宽和300W整卡功耗上限;主动散热版 n300d 标价1449美元,被动散热版 n300s 标价1399美元。
这块卡所处的产品位置需要先说明。Tenstorrent 当前已将Blackhole 放在卡片产品页的主力位置,并把 Wormhole 明确列为上一代技术。Blackhole p100a、p150a和p150b已经上市,显存最高32GB,p150系列还把卡间互联提升到4个800G QSFP-DD接口。因此,这次测试更适合观察 Tenstorrent 上一代硬件与软件栈的实际状态,不能直接代表其当前一代产品与英伟达的完整差距。
n300 拥有128个可用 Tensix 核心。每个核心内部包含五个 RISC-V 处理器,负责数据搬运和计算调度,主要的矩阵与向量运算交给 Tensix Engine。各个核心通过片上网络交换数据。开发者可以使用开源的TT-Metalium 接触底层硬件,也可以借助适配后的推理框架部署模型。
上手过程仍有明显门槛。视频作者将卡搁置数月后重新开机,设备一度无法使用,需要强制刷新固件,还遇到了版本不匹配。修复并完成预热后,Llama 3.1 8B 的单路生成速度稳定在每秒30至31个 token;首次请求只有每秒3.6个 token,属于一次性预热造成的低速。
八个请求同时运行时,总吞吐达到每秒164个 token,约为单路的五倍;提示词处理,也就是 prefill 阶段,测得每秒3700至4000个 token。对于多用户调用的小型推理服务,并发吞吐往往比单个对话窗口的生成速度更有参考价值。
两个QSFP接口,指向多卡扩展
n300 尾部的两个接口实际是 QSFP-DD 高速互联接口。官方文档显示,每个接口支持200G连接,可用于 Wormhole 卡或相关系统之间互联。消费级 GeForce 自 RTX 3090 之后不再提供 NVLink,多卡推理需要更多地依赖 PCIe;Tenstorrent 把高速互联留在千美元级加速卡上,希望用户可以把多张卡组成更大的计算网格。
这套设计对单卡用户暂时没有直接收益。视频作者认为,24GB显存更适合7B至9B级模型,但字幕没有给出完整的运行条件。实际可运行的模型规模还会受到量化精度、上下文长度、KV Cache占用和主机内存卸载方式影响;扩大模型规模也不只有增加卡数一条路径。软件支持同样限制了模型选择。视频录制时,它已能运行 Llama 3.1 8B 和 Qwen3 8B,一些更新模型尚未完成适配。新架构上的模型和算子需要逐项移植、优化,这段时间差会直接影响硬件价值。
RTX 5080拉开速度,R9700赢得容量
视频作者在同一台主机中换上 RTX 5080,以 Llama 3.1 8B 和相近的8位精度进行对比。n300 单路解码约为每秒30个 token,RTX 5080达到每秒93个 token,接近前者的三倍;在prefill 阶段,RTX 5080同样大幅领先。
不过,视频没有完整披露主机配置、操作系统、驱动与推理框架版本,也缺少上下文和输出长度、预热与重复次数、批量口径及测试日期。n300 使用的 BFP8 与 RTX 5080 使用的 FP8 也只能视为相近精度,不能当作完全相同的量化条件。这些数据可以展示作者当时环境中的运行结果,无法严格拆分硬件能力、软件版本和测试设置各自造成的影响。
n300 在生成时测得的芯片功耗约70W,远低于300W整卡上限,但每瓦 token 数依然落后。RTX 5080功耗更高,输出速度的增幅更大,因此在视频测试的各个批量设置下占据能效优势。这里需要保留两个条件:70W读数只对应芯片,未计入整卡及高速互联;测试也只覆盖一张 n300,无法体现其卡间互联能力。
第三张卡 Radeon AI PRO R9700 采用 RDNA 4 架构,拥有32GB GDDR6显存、640GB/s峰值带宽和 FP8 支持,整卡功耗上限为300W。视频中,R9700运行 Llama 3.1 8B 的解码速度位于 n300 与 RTX 5080之间,运行 Qwen3 8B 时接近 n300,测得的能效在三张卡中最低。
R9700仍有容量优势。RTX 5080配备16GB显存,R9700的32GB显存可以容纳更大的模型和更长的上下文。在模型无法完整装入显存时,能否运行会先于速度成为选择标准。AMD也在持续扩展 ROCm 对工作站显卡的支持,只是从这次8B模型测试看,软件优化还没有充分释放硬件规格。
至顶AI实验室洞见
在视频作者的测试环境中,Wormhole n300运行 Llama 3.1 8B 的单路解码速度约为 RTX 5080的三分之一,RTX 5080在速度和能效上都占据优势。CUDA长期积累的编译器、算子库、推理框架和开发者社区,很可能是差距的重要来源。由于测试条件披露不完整,目前还无法准确拆分硬件与软件的影响。
Wormhole属于 Tenstorrent 的上一代产品。当前一代 Blackhole的 BLOCKFP8理论算力约为 n300的2.5倍,显存和卡间互联也得到升级,但理论算力无法直接换算成模型解码速度。它能否接近 RTX 5080,还需要在相同模型、量化精度和软件版本下进行测试。
如果现在只想快速、稳定地运行本地模型,成熟的 NVIDIA 方案依然更省时间。Wormhole n300更适合研究非 CUDA 架构和多卡互联的开发者。它的价值不在于已经追上英伟达,而在于让本地 AI 市场多了一条可以继续观察的技术路线。

