新智元报道

仅用一个周末,Claude 成功在搭载全新 AMD MI355X 的机架上运行了最前沿模型,且人类工程师全程未修改一行代码。这一突破意味着,英伟达耗时 20 年构建的 CUDA 护城河,正被 AI Agent 跨越。
一个周末,Claude 调通 AMD 新 GPU
此前,AMD 向 Anthropic 交付了一台搭载 MI355X 的机架。面对新平台与新软件栈的适配挑战,团队并未按常规投入大量人力,而是让一名工程师尝试将 Claude 接入机器,并下达指令:“把这台机器跑起来”。
周末结束后,系统不仅成功运行,性能曲线更在持续优化中不断攀升。Anthropic 联合创始人兼首席计算官 Tom Brown 透露,当 AMD CEO 苏姿丰得知仅有一名工程师介入时,曾提议派遣团队支援,但被告知无需帮忙,任务已全部由 AI 完成。
此次实验迅速转化为实际部署计划。Anthropic 宣布,将在 AMD Helios 系统中部署高达 2GW 的 Instinct GPU,首批 1GW 预计于 2027 年上半年启动。双方还将利用 Claude 优化 AMD 工作负载,加速 ROCm 软件生态发展。
芯片说明书迎来非人类读者
Claude 之所以能实现对 CUDA 生态的“降维打击”,核心在于 AMD 为 AI 开发了一套可直接调用 GPU 的工具链。在 AMD Advancing AI 2026 大会上发布的 ROCm.AI,专为 Claude、Codex 和 Cursor 等模型打造。
该工具集入口名为"AMD Skills",内置经校验的 ROCm 知识库。Agent 可据此自动配置环境、部署模型、分析日志及排查故障,并通过 ROCm CLI 直接操控硬件。开发者只需设定目标,具体执行路径由 Agent 自主探索。
值得注意的是,AMD 甚至重构了芯片说明书的编写逻辑。AMD AI 软件与解决方案副总裁 Anush Elangovan 表示,每一代 GPU 都将公开指令集并提供 AI 可读的 ISA(指令集架构)。Agent 读懂手册后,即可直接进行性能调优。
此项工作由 Hyperloom 系统承担:它负责拉起推理服务,建立基线,定位 CPU 与 GPU 瓶颈,测试不同配置并生成定制内核,最终验证新方案。现场演示显示,Hyperloom 将 MiniMax M3 的输出速度提升了 38%。此外,该系统已对 1.4 万个模型进行测试,并将结果沉淀为可复用的经验库。
AMD 正与前沿模型公司合作训练此类能力,旨在让模型“天生精通 AMD 编程”。未来,芯片的核心参数表除了峰值算力和显存带宽外,还将增加"AI 可读性与可调用性”这一关键维度。芯片厂商争夺的开发者群体中,正式加入了"Agent"这一新类别。
来自 ASI 的降维打击
CUDA 生态历经 20 年积累,依靠无数工程师构建了涵盖编译器、数学库、调试器及文档的完整体系。更难复制的是隐含在专家脑海中的经验:算子调优、通信加速、显存分配及分布式部署的痛点处理。
传统追赶模式需按年积累生态,而 Agent 的出现改变了这一规则。它能阅读文档、调用分析工具、定位瓶颈、修改代码并编译测试。若方案无效则自动切换,若效果显著则深入优化。
培养一名顶级 GPU 工程师需数年,而启动一个 Agent 仅需创建一个任务。一名工程师可指挥一群 Agent 并行排查错误、定位瓶颈。已验证的配置、内核代码及避坑指南,可立即成为后续任务的起点。
AI 的价值在于将“按年计算”的追赶过程压缩为“按任务计算”。这正是 ASI(超级人工智能)式能力对 CUDA 生态的降维打击。目前,中国工程师已站在改造 GPU 软件栈的前沿,将底层经验转化为 Agent 可调用的能力。
追赶 CUDA 的新起点已然确立:将硬件接口与软件工具交给 AI,让 Agent 直接开工。20 年的生态差距,首次有望通过一群昼夜不息的 Agent 迅速抹平。
参考资料:
https://www.theregister.com/ai-and-ml/2026/07/24/amd-vibe-codes-its-way-past-the-cuda-moat-with-rocmai/5278580
https://x.com/austinsemis/status/2080336781782753635
编辑:摩西

