
新智元报道

为何 OpenAI 与 Anthropic 不惜重金自研芯片?全球模型厂商是否正迈向全产业链整合的新趋势?
8 月 5 日,Anthropic 确认组建内部定制芯片团队,专为 Claude 打造推理芯片。紧随其后,在 8 月下旬的 Hot Chips 大会上,OpenAI 公布自研推理芯片 Jalapeño 基准测试:功耗仅 700W,却在对标 NVIDIA GB200(1200W)和 GB300(1400W)时,实现每瓦吞吐提升 1.5 至 1.9 倍,端到端延迟降低 1.7 至 3.6 倍。

同期,英伟达发布收购 Groq 后的首款量产推理加速器,Cerebras 推出新一代晶圆级系统,Intel 则展示三条面向 Agentic AI 的芯片架构。两周后,高通与亚马逊签署价值 600 亿美元的跨代定制推理芯片合作协议。
三周内,头部玩家不约而同聚焦“推理”。其背后逻辑清晰:真实应用负载正在反向定义计算体系的每一层。AI 计算日益凸显基础设施属性,体系能否提供稳定、经济、可扩展的智能供给,远比单颗芯片的跑分关键。
反观中国,拥有全球最多的白领群体与最大的推理需求。面对这一新趋势,中国需要给出怎样的解决方案?

Agent 重塑计算范式:从短请求到长任务链
传统 AI 推理多为一次性请求:用户发起指令,模型输出结果,算力随即释放。而 Agent 的工作模式截然不同。
一次 Agent 任务往往包含多轮推理、工具调用、记忆检索、中间校验及失败重试,形成持续运行的任务链。这不仅要求系统长时间在线且具备可恢复性,还需在延迟累积中严格控制成本。负载形态从“短请求”向“长任务链”的转变,对算力架构提出了全新挑战。
这一变化已深刻影响芯片架构设计。英伟达长期采用预填充(Prefill,算力密集)和解码(Decode,带宽密集)两阶段方案。而 OpenAI 在 Hot Chips 上展示了三步拆分的新架构:

- 预填充(Prefill):算力密集阶段;
- 草稿生成(Draft):执行投机采样,对延迟极度敏感;
- 验证(Verification):带宽密集阶段,伴随突发的 MoE 通信。

OpenAI 增加“草稿生成”一步,源于 Agent 真实负载的动态特性:不同模型与上下文长度会改变各阶段占比,专用加速器闲置仍消耗功耗。Jalapeño 芯片通过单一架构覆盖三种模式,保留本地 KV 缓存,并动态关闭闲置计算单元,以均衡架构适应负载变化。这正是其以 700W 功耗击败 1400W 竞品的底层原因。

全球纵向整合背景下,中国的破局之道
回归中国视角,本土 AI 产业优势显著:应用层场景丰富,涵盖电商、金融、教育及政务;芯片路线多元,RISC-V、Chiplet、存算协同等架构齐头并进;开源生态活跃,国产模型已在多项基准中跻身第一梯队。
然而,优势之间存在断层:芯片间、芯片与系统间、系统与软件间的适配、迁移及调度成本高昂。单一芯片上的高效方案,扩展至集群时可能遭遇全新瓶颈。若在全球巨头打通全栈之时,中国多元路线各自为战,“多元”恐将演变为“碎片化”。
9 月 21 日,AICC2026 人工智能计算大会将在北京中关村国际创新中心举行。大会由北京市发展改革委、市科委中关村管委会等支持,汇聚全产业链力量,旨在探讨如何从应用负载出发,打破芯片、互联、存储、系统、框架及算子间的壁垒,实现协同演进。

北京中关村国际创新中心
看点一:全产业链共议 Agent 负载
大会集结近 60 场报告,参会者涵盖两院院士、清华大学、IDC、北京智源研究院、北极雄芯、摩尔线程、昆仑芯、浪潮信息,以及 Dify、Fireworks、SGLang 等开源核心作者与智能体平台代表。各方将围绕以下核心议题展开研讨:
- Agent 从单次调用走向持续任务链,下一代 AI 需要怎样的计算体系?
- 存算一体、Chiplet 等新架构如何突破复杂负载瓶颈?
- 多元芯片路线如何融入统一系统,形成整体能力?
- 硬件多样化背景下,软件如何协同以构建可扩展的系统能力?
看点二:七大论坛直击产业痛点
大会设立七大主题论坛,全景式锚定 Agent 时代的算力全貌,直指当前尚未形成统一答案的产业争论:
- 芯片论坛:北京开源芯片研究院与智源联合主办,阿里达摩院、摩尔线程等共话下一代架构;
- Token 工厂论坛:CSDN 主办,Fireworks、PPIO 等拆解推理供给商业闭环;
- 开放超节点论坛:OCTC 主办,百度智能云、浪潮信息等探讨国产 AI 硬核底座标准;
- 大模型论坛:Datawhale 主办,上海人工智能实验室等聚焦模型架构创新;
- AI Infra 论坛:SGLang 核心维护者主导,重构大模型推理基础设施;
- 具身智能论坛:清华具身智能研究院主办,切入人机共生临界点问题;
- AI Work 论坛:Datawhale 主办,Dify、商汤等探讨智能体企业级落地。
看点三:发布首份 Agent 基础设施研究报告
除技术路线探讨外,大会还将发布业内首份聚焦 Agent 基础设施的《2026 中国人工智能计算力发展评估报告》,并公布中国 AI 算力城市排名。除了杭州等领先城市,哪些新一线或二三线城市将成为黑马,备受期待。
OpenAI 用时 9 个月完成一代芯片流片,后续迭代已在路上。按此节奏,全球推理芯片格局或将在两三年内定型。AICC2026 的核心价值,在于让不同技术路线在真实负载与产业需求面前接受检验,避免削足适履,共同探索适合中国国情的 AI 算力演进之路。
参考资料:智能体牵引算力新变革,AICC2026 人工智能计算大会将于 9 月 21 日在京举行

