大数跨境

Arm如何为Agentic AI时代重写芯片逻辑?|Arm Everywhere China观察

Arm如何为Agentic AI时代重写芯片逻辑?|Arm Everywhere China观察 科技行者
2026-09-08
2
导读:从生成式AI到智能体AI的转变,让计算变得跨环境、跨设备、跨场景,Arm为此改写芯片逻辑。

作者 | 周雅

来源 | 科技行者


Arm Everywhere China 今日在上海举行。Arm 执行副总裁兼首席商务官 Will Abbey 率先披露关键数据:过去 30 年,Arm 与合作伙伴累计交付设备总数达 3500 亿台。他幽默表示,若逐一清点这些设备需耗时约 1.1 万年。

3500 亿这一数字背后,折射出深刻的产业质变:Arm 架构已从早期的移动便携设备,延伸至云端数据中心及智能汽车等领域,正成为承载全球计算的通用底座。

本次活动中,Arm 公布了三条核心业务线的最新进展:面向手机与个人设备的边缘 AI(Edge AI)、面向机器人与自动驾驶的物理 AI(Physical AI),以及面向数据中心的云业务(Cloud)。重磅新品包括:面向边缘 AI 的新一代移动计算平台 CSS for Mobile 2(含 C2 CPU 集群和 Mali G2-Ultra NX GPU);面向物理 AI 的新设计 Arm Total Design for Physical AI 及机器人能力分级框架;以及新一代 Neoverse CSS 云端平台。此外,Arm 继续深化 AGI CPU 在中国市场的生态合作与落地。

/01/

"CPU 重新成为智能体 AI 时代的编排中心”

“下一代计算的形态,不会由单一的设备、模型或云端定义,而取决于‘智能如何在所有设备与环境之间连接与流动’。”Will Abbey 如此判断。

当前的 AI 工作负载已发生根本性转变,即从“生成式 AI"向“智能体 AI(Agentic AI)”过渡。

在生成式 AI 阶段,交互模式为“一问一答”的离散事件:用户提问,AI 响应,若不满意则重复多轮直至获得答案。此时大量智能运行于云端,任务结束即计算终止。

而在智能体 AI 阶段,系统转变为主动方:主动理解上下文、主动发现信息,并在合适时机将结果呈现给用户。

Arm 边缘 AI 事业部执行副总裁 Chris Bergey 将智能体工作流拆解为四步:感知(Perceive)、记忆(Remember)、推理(Reason)、执行(Act)。

这四个阶段往往同时发生、彼此触发,形成持续运转的智能体循环:“感知”环境与意图,“记忆”偏好与历史数据,“推理”规划最佳路径,“执行”实际任务。

此类工作负载具有“连续、突发、低延迟敏感、依赖内存且高度异构”的特征。关键在于,这四步未必由同一模型完成,也不一定适合同一种硬件。用户的意图可能始于手机,重推理在云端,最终由具身智能硬件执行。

因此 Arm 断言:"CPUs are the heart of Agentic AI。”在智能体 AI 时代,CPU 因负责大量编排、逻辑控制、低延迟任务及传统软件调用,重新回归工作流中心。Chris Bergey 补充数据称:“今天 95% 的 Android AI 推理跑在 CPU 上。”

据悉,Arm CPU 占据全球 99% 的智能手机市场,Mali GPU 累计出货量超 140 亿颗,覆盖从入门到旗舰的绝大多数移动设备。

/02/

CSS for Mobile 2:重构 CPU、GPU 与系统能力

Arm 正式推出 CSS for Mobile 2(第二代移动终端计算子系统),可将其视为下一代移动芯片的“基础设计”。

CSS 并非如高通骁龙或联发科天玑般可直接装机的完整 SoC,而是 Arm 预先将 CPU、GPU、系统互连、软件及部分芯片实现方案进行组合、验证和优化,再交付给芯片厂商。厂商可在此基础上加入自研 NPU、基带、图像处理器等模块,打造最终产品。

Arm 边缘 AI 智能终端计算副总裁 James McNiven 强调了两大关键点:

第一,CSS for Mobile 2 是"AI 原生平台”。其核心理念是让 CPU、GPU、系统 IP 及软件层围绕 AI 原生目标协同重构,而非仅在单一模块上叠加 AI 能力。

第二,延续“通用平台 + 合作伙伴自研”模式。Arm 提供软 IP(部分支持硬宏交付),合作伙伴可根据产品需求定制着色器核心数、NX 单元数、频率及工艺等。例如,昨日发布的小米玄戒 O3 已首发采用 Mali G2-Ultra NX。

关于命名变化,去年产品名为 Arm® Lumex™,今年更名为 CSS for Mobile 2。James 解释这是为了“简化”:继 COMPUTEX 发布面向 PC 的 CSS for PC 后,未来每一代计算子系统均将以"CSS for xxx"形式命名,使移动、PC、云端产品线定位一目了然。

CSS for Mobile 2 主要包含四大部分:

1. C2 CPU 集群:由全新微架构的 C2-Ultra(性能核)、经工艺优化的 C2-Pro(与去年 C1-Pro 同微架构)及 DSU(动态共享单元)组成。C2-Ultra 专注最强单核性能,负责应用启动、交互及 Agent 突发响应;C2-Pro 处理持续性负载如后台同步与多任务;DSU 连接所有核心并提供共享 L3 缓存。参考设计为 2 颗 Ultra+6 颗 Pro,最高支持 14 核,厂商可灵活调整。

2. Mali G2-Ultra NX:Arm 宣称其为“首款 AI 原生 GPU"。它将神经加速器(NX)集成至着色器核心内部,并大幅升级传统执行引擎和光追单元。

3. SI L2 系统互联:完整支持 LPDDR6,兼容 LPDDR5X/5,负责连接计算模块与主存及外设,优化访存延迟、内存标签安全、能效及服务质量(QoS)。

4. 软件栈:包括加速库 KleidiAI 及新上线的开发者门户 AI Portal。KleidiAI 为 CPU 侧 SME2 提供高效实现;AI Portal 则是模型、工具与集成流程的一站式入口,并提供 MCP Server,支持智能体自主发现和调用 Arm AI 能力。

核心变革在于,Arm 首次明确围绕两种新 AI 负载重新设计整套移动平台:一是智能体 AI,二是神经图形(让 AI 直接参与游戏画面生成与渲染)。为此,C2 CPU 集群与 Mali G2-Ultra NX GPU 两大核心同步换代。

/03/

CPU:C2-Ultra 微架构化解多智能体等待

提及“手机 AI 算力”,以往焦点多在 NPU。但 Arm 此次着重阐释了 CPU 在 Agent 时代的重要性:Agent 并非仅做一次大模型推理。

以“规划并预订结婚十周年纪念晚餐”为例,Agent 需执行一长串操作:

  • 感知:语音转文字,理解需求;
  • 记忆:检索本地日历、照片及常去餐厅等个人数据,判断偏好;
  • 推理:用小语言模型整理上下文,生成可执行提示词;
  • 执行:打开 App 查询座位、完成预订并发送消息。

这四步对硬件要求各异:语音识别需快速响应,本地检索依赖内存访问,小模型需矩阵计算,执行阶段则回归浏览器与操作系统。因此,Agent 体验不可能仅靠一颗 NPU 决定。

Arm 实测显示:在感知阶段,C2-Ultra 配合 SME2 比上一代快约40%;记忆阶段快约41%;推理阶段提升约25%。在执行阶段,传统 CPU 指标依然关键:C2 CPU 集群单线程提升约15%,多线程约12%,网页性能与应用启动均提升约12%-15%

综合来看,上一代 C1-Ultra 完成该流程约需 2 秒,C2-Ultra 缩短至1.72 秒(提升 15%);若加入 SME2,进一步压至1.55 秒(提升 24%)。

人类对 100 毫秒级的响应变化已有感知。对于需多次交互的 Agent,数百毫秒的节省累积后将带来显著体验差距。

因此,C2 CPU 集群旨在平衡延迟、能效、通用性、兼容性及安全性,而非追求单一指标极致。C2-Ultra 作为智能体 AI 的高效编排中枢,其微架构改进分为三部分:

1. 前端(Front-end):针对分支判断密集的场景,提升预测准确性、加强指令传递并降低误判恢复成本,保持高吞吐效率。

2. 执行引擎(Execution):扩大并行处理能力,当某指令阻塞时可执行后续无关指令;同时采用更积极的推测执行,提前准备大概率路径,显著提升单核真实性能。

3. 数据侧(Data path):现代软件负载对数据加载速度的敏感度已超越纯计算能力。C2-Ultra 改进数据加载、预取及缓存体系:核心独占 L2 缓存,集群共享 DSU 提供的 L3 缓存,减少访问慢速主存的次数。

上述改进使 C2-Ultra 单线程性能提升 15%,同性能下功耗降低 30%,显著延长移动端续航或支撑更复杂负载。

此外,C2 CPU 集群依托 SME2(第二代可伸缩矩阵扩展)加速 AI 推理。虽微架构未变,但通过增加硬件资源配置及 KleidiAI 软件层优化,进一步挖掘潜力。

SME2 针对大模型推理的两个阶段采取不同策略:

编码阶段(输入处理):侧重计算能力。SME2 结合量化感知训练与极低精度矩阵乘法,在 2-bit 测试中带来最高1.75 倍性能提升。

解码阶段(Token 生成):侧重数据搬运。通过 LUTi 查找表指令保持低比特数据压缩状态,减少内存读取量,在 2-bit 测试中解码阶段提升约1.6 倍

简言之,前半段“算得快”,后半段“少搬数据”。

现场演示了基于 CPU 的实时语音翻译与克隆:英语发言经腾讯混元 2-bit 量化模型(约 300MB)翻译为中文,再由通义千问 TTS 模型(FP32 精度)还原音色。全过程在设备本地多线程并发完成,全靠 SME2 加速。

/04/

GPU:Mali G2-Ultra NX 让 AI 进入图形渲染流水线

若 C2 CPU 为智能体而生,Mali G2-Ultra NX 则致力于解决手游画质问题。

随着虚幻引擎 5 将 Lumen、Nanite 等桌面级技术引入移动端,手游视觉规格迅速向 PC/主机看齐,传统 GPU 能效提升已近物理极限,亟需架构级重塑。

Mali G2-Ultra NX 作为首款 AI 原生 Mali GPU,更新集中在三处:

1. 集成神经加速器 NX:NX 深度融入着色器核心内部,非独立芯片。它以低至 1 瓦功耗提供高质量 AI 推理,速度可达 GPU 时钟频率的 2 倍。开发者无需额外学习调度机制,NX 空闲时会自动关闭以省电。

2. 重构执行引擎:这是 Mali 七代以来最大规模的 ISA 重构,专为 Nanite 类复杂着色器设计。G2-Ultra NX 将寄存器分配粒度从 32/64 细化至 16,减少“寄存器溢出”导致的性能损失,提升资源利用率。

3. 引入第三代光追单元:采用更紧凑的共享边三角形表示法,减少重复几何信息存储,主流光追基准中 DRAM 流量最高减少约13%。同时加入硬件透明度微贴图(OMM)技术,将透明度信息嵌入光追加速结构,避免遍历中断。实测显示,在含大量透明物体场景中,光追负载降低最高70%,帧率提升最高30%

Mali G2-Ultra NX 提供旗舰、Premium 及 Pro 三个变体,以软 IP 或部分硬宏形式交付,供合作伙伴灵活定制。

在联合开发的手游《光影新生》(Neural Dawn)中,该技术实效显著:三帧序列中仅 1/8 像素来自真实渲染,其余 7/8 由 AI 重建。在约 2 瓦功耗下维持 60 帧,相比上一代同场景不足 40 帧的表现,帧率与能效最高提升4 倍,DRAM 带宽最高降低70%

传统渲染性能亦未忽视:标准游戏基准测试 GPU 性能提升24%,非 AI 游戏实测提升最高14%

关键技术解析:

  • NSS(神经超级采样):GPU 仅渲染 1/4 像素,其余由神经网络超分补齐,大幅降低渲染负担。
  • NFRU(神经帧率超分):在两真实帧间插入 AI 重建帧,将 30 帧翻倍至 60 帧,提升画面连贯性。
  • NSSD(神经超采样加降噪):面向光追,在超采样基础上进行降噪,允许减少光线数量以省电,同时保证画质。

需注意,"AI 重建”基于 CNN 架构而非 Transformer,需真实渲染帧作为输入,并非凭空生成。

Arm 已将相关模型权重开源至 GitHub 和 Hugging Face,并与 Unity 中国合作,计划 10 月将神经图形技术直接集成至引擎。生态方面,Arm 与腾讯游戏成立联合实验室,探索神经动态全局光照等技术,《暗区突围》《无限暖暖》等头部手游已纳入合作案例。

/05/

物理 AI:从机器人能力框架到现实世界实时计算

Arm 物理 AI 业务拓展副总裁 Dermot O'Driscoll 将话题延伸至机器人与汽车等自主系统。

物理 AI 的关键指标是延迟:从光子进入传感器到执行器产生动作的时间。机器人需在极短时间内完成感知、判断和行动,同时满足功耗与安全限制。

据 Arm 估算,2025 年物理 AI 计算市场规模约 250 亿美元,2030 年代有望达 2000 亿美元,增长空间约 8 倍。全球 GDP 中约三分之二来自制造、交通等物理产业,AI 的渗透将极大提升生产效率。

汽车与机器人是典型代表:单车计算价值可能有 4 倍增长空间;机器人正从固定程序执行转向自主感知与行动。

Arm 宣布三项举措:

1. Arm Total Design for Physical AI:将 Total Design 模式扩展至物理 AI,组织 80 多家产业链公司共同解决系统集成难题。

2. Robotics Capability Framework(机器人能力框架):参照自动驾驶 L0-L5 分级,将机器人能力划分为 RL0 至 RL5 六个阶段,提供统一描述语言。博泰车联网、银河通用机器人等作为站台伙伴参与其中。

3. 发布 Manifesto:由 Arm 首席架构师 Richard Grisenthwaite 撰写,呼吁行业共建标准,降低集成成本。

/06/

Cloud:Neoverse CSS N4 承接智能体时代基础设施变革

Arm 云 AI 业务拓展副总裁 Eddie Ramirez 披露:Neoverse CPU 核心全球累计部署超 150 亿个,其中最近 50 亿个仅用不到一年时间。

智能体 AI 驱动 Token 消耗量几何级暴涨,对数据中心全天候编排调度与能效提出挑战。Arm 发布新一代 Neoverse CSS N4,支持 8 核至 128 核灵活配置及多 Chiplet 系统。相比 N3,每插槽性能最高提升2 倍,每瓦性能提升1.25 倍,内存带宽提升1.75 倍

CSS 另一价值在于缩短开发周期:合作伙伴借助预集成、预验证的 CSS,可将样片时间压缩至约 13 个月,量产约 18 个月。

面向高密度 AI 基础设施,Arm 展示 AGI CPU 方案:在 200kW 液冷机架中部署 336 颗 AGI CPU(超 4.5 万核心),性能可达最新 x86 系统的 2 倍以上。

中国生态方面,新紫光集团宣布将与 Arm 围绕 IP、CSS 及 AGI CPU 展开长期合作,并计划成立通用人工智能联合创新中心。

/07/

Arm 战略方向:NPU 取舍与中国生态

CSS for Mobile 2 未提及 NPU,这体现了 Arm 的战略取舍。James 明确表示:Arm 聚焦于助力合作伙伴打造最优 CPU 与 GPU,NPU 技术创新交由合作伙伴主导,尤其是针对厂商自研的“第一方 AI 应用”。

对于旗舰芯片厂商,NPU 是差异化核心,Arm 无意介入。此外,第三方开发者面对碎片化的 NPU 架构,适配成本高企。相比之下,CPU 具备跨平台、易兼容、低延迟及安全等优势,是 AI 应用落地的首选起点。

发布会尾声,Will Abbey 强调:中国科技产业不仅是技术的接受者,更是生态的塑造者与定义者。他向全场抛出终极之问:“接下来,你准备用技术来构建什么?”




·  FIN  ·

科技行者团队出品


豆包手机第二次进场,这次先学会了“敲门”
PEC 2026 定档 9 月 12 日:用一条 Token 产业链,串起 AI 从业者最关心的四个问题

【声明】内容源于网络
0
0
科技行者
科技行者,至顶科技旗下的创新生态媒体,多年来一直站在科技的最前沿,致力于与打造“更深刻的创新“和“更硬核的科技”的创业者、企业家对话,连接产品与市场,项目与资本让创新更有价值。
内容 1370
粉丝 0
科技行者 北京第二十六维信息技术有限公司 科技行者,至顶科技旗下的创新生态媒体,多年来一直站在科技的最前沿,致力于与打造“更深刻的创新“和“更硬核的科技”的创业者、企业家对话,连接产品与市场,项目与资本让创新更有价值。
总阅读23.6k
粉丝0
内容1.4k