AI 算力圈的竞争,彻底升维了。
7 月 24 日,AMD Advancing AI 2026 大会正式召开。苏姿丰携全线新品亮相,直接把战场从「单颗 GPU 性能」卷到了「整套机架系统」。
从云端推理到端侧 Agent,从服务器 CPU 到机器人计算,从硬件芯片到软件开发生态,AMD 打出了一套全维度组合拳,正面冲击英伟达构筑的 AI 壁垒。
整场发布会的主线非常清晰:AI 计算正在从训练加速全面转向推理,Agent 又把单次模型调用扩展为持续的任务执行链。当算力投入从 “一次性训练成本” 变成 “日复一日的运营开支”,行业需要的不再只是最强的单卡,而是更低的 Token 成本、更高的机架吞吐、更省心的系统交付。

一、核心杀招:Helios 机架 + MI455X GPU,竞争升级到系统级
本次发布的绝对主角,是Helios 机架级 AI 平台,以及搭载其上的新一代Instinct MI455X GPU。
先看单卡的硬参数升级,堪称全方位暴力提升:
-
配备432GB HBM4 显存,显存带宽达到23.3TB/s -
峰值 MXFP8 算力 20PFLOPS,峰值 MXFP4 算力 40PFLOPS -
相比上一代 MI355X,显存容量最高提升 1.5 倍,显存带宽最高提升 2.9 倍,低精度峰值算力最高提升 4 倍
显存是这次升级的核心落点。随着大模型参数扩容、上下文窗口持续拉长,推理需要常驻更多模型权重与 KV Cache,显存容量和带宽已经成为制约真实业务吞吐的核心瓶颈。
AMD 现场公布的数据显示,在 DeepSeek V4 Flash FP4 推理场景下,MI455X 的Token 吞吐最高可达上一代的 34 倍,Token 成本最高降低 18 倍。该成绩包含硬件架构、低精度计算与软件优化的多重增益,量产落地的实际表现仍待验证,但代际提升幅度足够震撼。
单卡只是基础,Helios 才是 AMD 真正的战略武器。
苏姿丰在 keynote 中直接点明:前沿 AI 已经无法依靠单颗芯片或单台服务器满足需求,整个机架必须作为一个系统来设计。
传统 72 卡 AI 集群通常由 9 台八卡服务器拼接而成,GPU 跨服务器通信需要多次网络跳转,容易产生延迟、拥塞,算力利用率难以拉满。而 Helios 将 72 颗 MI455X 整合为一个统一的机架级计算系统,提供约31TB HBM4 总显存与260TB/s 聚合 Scale-up 带宽,真正实现了 “机架即一台超级计算机”。

整套系统通过 UALoE 高速互连架构,让 72 颗 GPU 实现机架内单跳全互连,每颗 GPU 访问其他所有 GPU 的带宽一致,软件无需再针对复杂网络拓扑做专项适配。同时系统采用多平面冗余路径设计,单条链路或交换节点故障时,流量可自动切换,故障被隔离在局部范围。
在最受关注的性价比上,AMD 给出了对标数据:基于 Kimi K2 Thinking 模型与预估系统价格的测算中,Helios 每美元 Token 产出最高比 NVIDIA Vera Rubin NVL72 高 30%,单 GPU Token 吞吐高出 10% 至 15%。
除此之外,Helios 搭建了完整的三层网络体系:前端由 Salina DPU 承担网络、存储与安全卸载,机架内靠 UALoE 实现 GPU 高速互连,跨机架扩展由 Vulcano AI NIC 支持 800G 网络。此前收购的 Pensando 业务,也彻底融入 AMD AI 平台的核心架构。
二、Venice CPU 登场:Agent 时代,CPU 不再是配角
不少人意外的是,这次发布会给了服务器 CPU 极重的篇幅。
在 AMD 的判断里,Agent 的爆发不只是 GPU 的红利。一个完整的 Agent 流程,包含网关、上下文组装、规划、检索、工具执行、校验输出,大量环节都运行在 CPU 上。当 Agent 规模从百万级走向十亿级,服务器 CPU 市场将迎来新一轮增长。
借此契机,AMD 正式推出第六代 EPYC 9006 系列服务器 CPU,代号 Venice。
这并非单一旗舰型号,而是覆盖不同场景的完整产品家族,分为四条主线:
-
EPYC 9006 SP7:主打高核心数与极致计算性能 -
EPYC 9006 SP8:面向企业场景,侧重系统整体性价比 -
EPYC 9006X SP7:针对 HPC 与 AI 数据预处理专项优化 -
EPYC 9006 LP:采用 LPDDR 内存,面向高性能 AI Host 节点
规格上,Venice 最高搭载256 个核心、512 个线程,采用全新 Zen 6 架构,支持 PCIe 6.0,兼容 DDR5、MRDIMM、LPDDR 等多种内存配置,全面覆盖通用计算、企业应用、HPC、AI 宿主等场景。
目前 AMD EPYC 服务器 CPU 的收入份额已达到46%,官方称每周都有一家福布斯全球 2000 强企业转向 AMD,已有超过 475 个 EPYC 硬件平台、1600 个 EPYC 云实例落地。接下来 Venice 既要继续和 Intel Xeon 争夺传统服务器市场,也要在 AI 机架中与 GPU 平台深度绑定,应对 Arm 架构服务器 CPU 的入局挑战。
三、ROCm.AI 上线:用 AI 补上软件生态短板
硬件足够能打,软件生态能不能跟上,一直是 AMD 对抗英伟达的核心痛点。这一次,AMD 拿出了针对性解法 ——ROCm.AI。
简单来说,ROCm.AI 是在原有 ROCm 基础软件栈之上,加入了 AI 辅助开发能力,专门解决 GPU 编程门槛高、CUDA 代码迁移成本高的问题。开发者可以借助 AI 自动分析代码、完成 CUDA 到 HIP 的转换、定位性能瓶颈、生成优化方案,同时支持与 Cursor、Claude、Gemini 等主流开发工具联动。
AMD 还同步推出了FlyDSL,采用类 Python 的领域特定语言,让 Python 开发者无需深入掌握线程、内存、底层调度等 GPU 细节,更专注于算法逻辑本身。官方表示,在示例场景中,FlyDSL 能用更低的代码复杂度达到同等甚至更优的性能。
ROCm.AI 计划于 2026 年 8 月正式推出。生态方面,目前 Hugging Face 上超过 300 万个模型已可在 AMD 平台开箱运行,排名前十的开源 AI 项目均已原生支持 AMD,相关开源贡献数量增长超过 10 倍。

从补齐底层算子,到优化开发者体验,AMD 正在一步步缩小与 CUDA 的生态差距。
四、端侧 + 机器人双线落地:把 AI 铺到每一个场景
云端之外,AMD 也在加速推进 “让 AI 无处不在” 的战略,本地 Agent 与实体机器人 AI 双线发力。
本地 Agent:大模型直接跑在终端设备上
本次 AMD 没有发布新的锐龙消费级处理器,而是围绕现有锐龙 AI 400、锐龙 AI MAX 系列,展示了本地 Agent 的落地能力与生态进展。
本地 AI 的核心价值十分明确:数据不出设备、降低高频推理的持续 Token 成本、断网环境下仍可使用。目前锐龙 AI 400 可流畅运行 24B 以内的模型,锐龙 AI MAX 则支持更大规模的本地模型部署。
AMD 还预告了下一代平台:代号Gorgon Halo的开发者平台,统一内存将提升至 192GB,本地可运行模型的参数上限扩大到约300B。
企业级场景也有新突破:AMD 与思科合作推出端侧全栈方案,将锐龙 AI 硬件、本地推理引擎、Agent 沙箱与思科的网络安全管控能力结合,企业可以统一限制 Agent 访问范围、执行安全策略、追踪推理成本与 Token 效率。
Physical AI:机器人计算全栈布局成型
在实体机器人领域,AMD 一次性发布五项内容,完成了从芯片到生态的全链条布局:
- Ryzen AI Embedded X100 系列
集成 CPU、GPU、NPU,面向机器人感知、推理、规划与控制,目前已进入送样阶段 - Kria AI 系统级模块
基于 X100 打造,采用标准 COM-HPC 形态,面向量产机器人,可实现低于 100 毫秒的 VLA 推理 - Kria AI 机器人开发平台
一体化交钥匙开发平台,计划 2026 年第四季度上线 - 机器人软件套件
包含核心 SDK、物理 AI SDK、加速 ROS 节点等,云端与机器人端共用统一软件栈 - 机器人合作伙伴网络
首批覆盖 30 多家伙伴,涵盖整机厂商、AI 模型、传感器、仿真与系统集成等环节
五、AI 算力竞争,进入全新赛段
整场发布会看下来,一个行业趋势已经非常清晰:AI 算力的战争,彻底从单芯片时代进入了系统级时代。
过去几年,行业的目光集中在单卡算力与训练速度,为了最快完成大模型训练,客户愿意为顶级性能支付溢价。但现在,推理正在成为 AI 算力的主力 —— 按照 AMD 的预测,2026 年全球约 60% 的 AI 算力将用于推理。

推理是长期运营成本,Token 规模越大,对单价越敏感。而 Agent 进一步拉长了任务链路,一个请求可能触发多轮模型调用、检索、工具执行与校验,需要 CPU、GPU、网络、存储深度协同。客户算账的单位,也从 “单卡多少钱” 变成了 “每机架能产出多少 Token”“每美元能服务多少用户”。
面对这个变化,英伟达的路径是全栈封闭整合,从芯片、网卡、交换机到 CUDA 一手把控,给客户高度确定的性能与部署效率。
而 AMD 选择的是开放架构路线:用标准化组件、开放的软件生态,给客户更大的定制空间与议价权,用更低的 Token 成本撬动市场。
当然,开放路线也意味着更高的执行难度:跨厂商的兼容调试、性能调优、生态协同,都需要更长的落地周期。Helios 的系统级优势能否在量产中充分兑现,ROCm 能否持续缩小与 CUDA 的体验差距,都还需要时间与客户的双重验证。
但可以确定的是,AI 算力市场一家独大的格局,正在被一步步打破。
免责声明:本文章来源公众号36氪,版权归属原作者所有!转载出于传递更多信息和学习之目的,如觉侵权,可回复本平台我们会尽快处理删除。另外,欢迎朋友们推荐或者投稿文章给本微信公众号。
关注抖音【靓哥聊创业】
抖音号|54707203975
保存二维码打开抖音扫一扫

