大数跨境

行业迎来大洗牌!4万 Agent 挤进一个机柜,AI Infra 要如何构建?

行业迎来大洗牌!4万 Agent 挤进一个机柜,AI Infra 要如何构建? AI前线
2026-07-21
7
导读:过去两年,AI 基础设施几乎讲的是同一个故事:更大的模型、更多的 GPU、更高速的网络,以及功率不断上升的智算集群。
作者|冬梅

过去两年,AI 基础设施的演进逻辑主要围绕更大规模的模型、更多的 GPU 算力、更高速的网络以及高功率智算集群展开。然而,随着 AI 应用从单纯的对话机器人向能够拆解任务、调用工具、执行代码并持续运行的 Agent(智能体)转变,底层基础设施正面临结构性变革。

Agent 规模化应用倒逼基础设施重构

传统大模型部署主要关注 GPU 数量、显存容量及推理速度,CPU 仅承担辅助角色。但在 Agent 时代,模型推理仅是任务执行的一环,大量工作涉及任务拆解、流程编排、信息检索、工具调用、状态管理及安全隔离等。这些琐碎却关键的任务需依靠 CPU、内存、存储和网络协同完成,单纯堆砌 GPU 的建设模式已难以支撑海量 Agent 长期运行与频繁交互的新需求。

一次复杂的模型调用背后,可能同时运行数十个 Agent,它们需理解需求、拆分步骤、查询信息、调用模型并整合结果。GPU 仍负责核心的模型推理(Token 生成),但越来越多的工作负载转移至 CPU、内存、存储及沙箱环境。

在 2026 开放计算大会上,浪潮信息副总经理赵帅指出:"Agent 正在迫使 AI 基础设施重新分工。”他强调,AI 算力未来十年仍是核心,但 CPU 算力重回关注焦点。Agent 将催生一批独立于传统 GPU 服务器之外的 CPU 计算需求。这并非 CPU 取代 GPU,而是形成两套耦合系统:一套负责“生产 Token",另一套负责让 Agent“真正行动”。

GPU 负责“想”,CPU 负责“干”

在传统推理中,CPU 主要负责输入输出与任务管理。而在 Agent 架构下,任务接收后需先进行需求拆解、工具匹配及实时信息查询,再将步骤分发给不同模型。赵帅将此运行环境描述为"CPU 沙箱”,因为整型运算、逻辑推理、分支预测等工作必须运行在 CPU 之上。

以八步任务为例,仅部分环节需 GPU 推理,其余如信息查询、决策分析、流程控制均依赖 CPU。这意味着企业可能需要额外建设高密度 CPU 宿主机集群,专门承载 Agent 编排、工具服务及状态管理,而非简单地在现有 AI 服务器中增加 CPU 数量。

随着这一变化,企业 AI 系统中 CPU 与 GPU 的数量比例将发生显著调整。Agent 的资源消耗高度依赖任务类型:临时性任务完成后即释放资源,而企业级 Agent 需长期驻留;简单查询占用资源较少,而 AI 编程等复杂任务对内存、存储和网络提出更高要求。测试显示,日常 Agent 任务单核 2G 内存即可支撑稳定运行,但长上下文复杂任务需配置更多资源。企业面临的挑战在于如何根据 Agent 生命周期与任务特征动态分配资源。

多 Agent 协同提升质量与成本博弈

为解决单个模型处理复杂任务不稳定的问题,行业涌现出“群智协同”与“多模融合”两种路径。前者通过多 Agent 拆解任务、多轮协作提高稳定性;后者利用不同专长模型分别处理任务再统一生成结果。赵帅认为,GPU 决定模型上限,多 Agent 是用工程化手段拔高治理水平,多模融合则是用技术能力打破智能上限。

质量提升伴随成本增加。多模型融合可能导致 Token 消耗成倍增长。对此,专家建议对任务分级:简单问答交由小模型,OCR 等特定任务无需万亿参数模型,仅代码生成、复杂逻辑分析等高价值决策才进入融合链路。例如市场洞察报告生成,可先用小模型处理图片 PDF,中模型归纳内部文档,最后仅在整合报告时调用大模型。

核心难点在于“模型路由”。精准的 routing 能将简单任务卸载,使融合系统的总成本低于全量使用大模型。若路由失效,将简单请求误送入大模型,系统将成为新的成本黑洞。未来企业的竞争力将取决于能否精准判断何时调用何种模型,甚至何时不调用大模型。

Agent Infra:从单一设备到系统重构

浪潮信息此次发布了 CPU 原生液冷整机柜服务器及面向多模融合的元脑 SD200 超节点 AI 服务器。其中,CPU 整机柜可容纳 384 颗处理器,支持 4 万以上 Agent 并发;SD200 提供 4TB 统一显存,支持 4 个万亿参数模型运行。但比产品参数更重要的是其背后的架构判断:Agent Infra 要求原本独立的 CPU 计算集群与 GPU 推理集群必须深度连接。

这种连接不仅是网络层面,更涉及数据读取、模型调用及状态传递。CPU 与 GPU 集群间的距离、带宽和延迟直接决定任务效率。传统的“东数西算”布局可能不再适用,Agent 需更靠近 AI 集群以减少往返延迟。这意味着数据中心选址、网络架构及存储布局均需调整。

对于已有传统数据中心的企业,改造成本高昂,可能需更新服务器、交换机并将网络升级至 400G 甚至 800G。因此,Agent Infra 并非所有企业的标准配置。中小企业可通过云服务、托管集群或一体机实现平滑过渡。行业目前尚未形成统一的部署形态,正处于探索期。

芯片竞赛之后,系统能力成新变量

随着 AI 机柜功率向 300 千瓦乃至兆瓦级发展,供电与散热成为瓶颈。赵帅预测,800V 高压直流供电进柜将是基础设施的首要变革,随之带动 UPS、变压器及液冷系统的升级。浪潮推出的 CPU 机柜采用“算电分离”设计,以提高计算密度并实现液冷覆盖。

尽管吉瓦级智算中心是未来设想,但当前多数企业更应关注如何提高现有算力利用率。未来 AI 基础设施将不仅包含 CPU 和 GPU,还将出现针对 Prefill、Decode、Attention 等环节设计的专用芯片(ASIC/NPU)。正如汽车流水线,不同环节由不同芯片承载以提升效率。最终决定 AI 应用规模化能力的,是如何将各类芯片、内存、存储和网络组合成一套稳定高效的系统。

声明:本文为 InfoQ 整理,不代表平台观点,也不构成投资建议,未经许可禁止转载。

【声明】内容源于网络
0
0
AI前线
面向AI爱好者、开发者和科学家,提供大模型最新资讯、AI技术分享干货、一线业界实践案例,助你全面拥抱AIGC。
内容 8641
粉丝 0
AI前线 面向AI爱好者、开发者和科学家,提供大模型最新资讯、AI技术分享干货、一线业界实践案例,助你全面拥抱AIGC。
总阅读172.4k
粉丝0
内容8.6k