海南省跨境电子商务协会行业研判
7 月 16 日,月之暗面发布全球最大开源模型 Kimi K3,参数量达 2.8 万亿,编程评测能力略超 GPT-5.6。然而上线仅三天,因用户涌入量过大,Kimi 被迫限制新用户注册。
开源模型服务器被注册流量压垮并非孤例。7 月 23 日,谷歌母公司 Alphabet 披露 Q2 财报,将全年资本开支指引上调至 1950-2050 亿美元,CFO 直言“仍处于算力供不应求状态”。同期,工信部数据显示:中国智能算力规模已达 2185 EFLOPS,同比增长 177%,算力设施上架率高达 71.4%。
当市场仍在争论 AI 泡沫时,算力端的“硬缺口”已用数据给出答案。
表 1:2026 年 Q2 全球科技巨头 AI 算力资本开支
| 公司 | Q2 资本开支(亿美元) | 全年指引(亿美元) | 同比变动 | 关键表述 |
|---|---|---|---|---|
| 谷歌 | 449 | 1950-2050 | 翻倍 | “仍处供不应求状态,下半年继续加速” |
| 微软 | 约 380 | 1500-1600 | +60% | 云计算增速未达标,但 AI 投入不加码 |
| 亚马逊 | 约 340 | 1300-1400 | +55% | AWS AI 业务增速超预期 |
| Meta | 约 290 | 1100-1200 | +50% | Llama 4 训练集群持续扩容 |
| 苹果 | 约 80 | 350-400 | +40% | 端侧 AI 芯片自研为主,外采为辅 |
数据来源:各公司 Q2 财报及分析师电话会;五大巨头 2026 年合计资本开支预计 7450-7750 亿美元
谷歌策略最为激进。单季 449 亿美元的投入导致自由现金流转负,但管理层明确表示只要投资回报率具备吸引力便“继续加码”。这并非泡沫期的盲目扩张,而是典型的“需求快于交付,被迫加速建设”。
一、Kimi K3“注册限制”背后的信号
月之暗面并非缺乏算力的初创公司。Kimi K3 采用自研 KDA 混合线性注意力机制,原生支持百万级 Token 上下文,发布后获马斯克高度评价,特斯拉随即宣布跟进研发新模型。然而,即便是头部企业,上线三天也不得不限流。
这一现象释放三个关键信号:首先,即便开源模型推理成本较低,现有算力仍无法满足远超预估的用户量级;其次,Kimi K3 的火爆源于产品力自发扩散,这种“算力吃紧”是真实需求而非营销制造;最后,头部创业公司已显捉襟见肘,中小 AI 企业的处境更为严峻。
当算力瓶颈从“买不起”演变为“买不到且跑不动”,产业洗牌逻辑将彻底改变。
表 2:中国智能算力供需态势(截至 2026 年 6 月)
| 指标 | 数值 | 同比变动 | 说明 |
|---|---|---|---|
| 智能算力总规模 | 2185 EFLOPS(FP16) | +177% | 工信部国新办发布会 |
| 算力设施上架率 | 71.4% | — | 高于 60% 健康线,证实“建而有用” |
| 万卡以上智算设施 | 52 个 | — | 集中在八大枢纽节点 |
| 算力大通道 | 超 70 条 | — | 连接国家枢纽节点 |
| 集成电路出口额 | — | +88.7% | AI 与绿色转型需求拉动 |
数据来源:工信部 2026 年 7 月 20 日国新办发布会
71.4% 的上架率有力反驳了“算力中心沦为闲置资产”的质疑。数据显示,这批设施正全负荷运行于 AI 训练和推理任务,缺口依然显著。正如工信部相关负责人所言,大模型和智能体应用的爆发式增长推动智能算力需求持续提升。
二、结构切换:训练让位,推理接管
算力需求不仅在总量增长,结构上正经历深刻变革。巴克莱与德勤联合数据显示,2026 年推理算力需求占比超 70%,是训练算力的 4.5 倍。推理芯片市场规模达 1450 亿美元,正式取代训练芯片成为行业核心引擎。
此次切换蕴含三层深意:
第一,训练具有一次性特征,边际效益递减;而推理伴随每一次用户交互永续存在,随渗透率呈线性甚至指数增长。
第二,Agent(智能体)的出现大幅推高单次交互 Token 消耗。相比传统对话 AI,Agent 在执行规划、检索、决策等任务时,Token 消耗量可达前者的 20-30 倍,被形容为“忘关的水龙头”。
第三,推理是 AI 商业化的核心。训练决定模型可用性,推理则直接关联企业的现金流与盈利能力。
表 3:AI 算力结构性切换——训练 vs 推理
| 维度 | 训练 | 推理 |
|---|---|---|
| 消耗特征 | 一次性,集中在模型迭代期 | 永续性,随用户增长线性/指数扩张 |
| 当前占比 | 约 30% | 约 70%(4.5 倍于训练) |
| 2026 市场规模 | — | 1450 亿美元 |
| 驱动因素 | 大模型参数竞赛趋缓 | Agent、实时 AI、端侧智能爆发 |
| 商业属性 | 研发成本 | 运营收入的核心成本 |
| 增长曲线 | 边际效益递减 | 与用户渗透率正相关 |
数据来源:巴克莱研究、德勤 2026 年 AI 芯片市场报告
三、Agent:3418% 增速背后的算力黑洞
IDC 最新预测揭示了一组重塑 AI 基建认知的数据。
表 4:全球 AI Agent 增长预测(2025-2030)
| 指标 | 2025 年 | 2030 年预测 | 年复合增长率 |
|---|---|---|---|
| 全球活跃 Agent 数量 | 2860 万 | 22.16 亿 | 139% |
| 年执行任务数 | 440 亿次 | 415 万亿次 | 524% |
| 年度 Token 消耗 | 0.0005 Peta Tokens | 152,667 Peta Tokens | 3418% |
数据来源:IDC 2026 年 7 月全球 AI Agent 市场预测
Token 消耗量从微乎其微跃迁至 15 万 Peta Tokens 量级,增长超 3 亿倍。若该预测准确,当前包括谷歌在内的所有科技巨头算力扩建计划均严重低估了中长期需求。22 亿个 Agent 并行运行所需的底层算力,远超现有基础设施规划。
AMD CEO 苏姿丰在 CES 2026 上指出,当前计算能力远不足以应对创新速度,提出未来五年需将全球算力提升 1000 倍至 10 YottaFlops 级别。她同时驳斥"AI 泡沫论”,强调 AI 活跃用户已从百万级增至十亿级,预计 2030 年将覆盖全球半数人口。
四、泡沫论 vs 缺口论:两套逻辑的碰撞
关于 AI 算力的争论,本质是逻辑框架的分歧。
表 5:AI 算力“泡沫论”与“缺口论”的核心分歧
| 维度 | 泡沫论 | 缺口论 |
|---|---|---|
| 核心逻辑 | 投资超前于回报,资本开支将坍塌 | 需求超前于供给,产能仍在追赶 |
| 关键论据 | 谷歌自由现金流转负;大模型参数竞赛趋缓 | 上架率 71.4%;Kimi K3 被迫限流;推理占比超越训练 |
| 对标参照 | 2000 年互联网泡沫——光缆过剩 | 云计算早期——AWS 连亏 6 年后盈利 |
| 风险点 | 巨头 CAPEX 一旦收缩,全产业链承压 | 算力缺口不补,AI 应用层将被基础设施卡脖子 |
| 对中国的含义 | 警惕地方算力中心重复建设 | 2185 EFLOPS 仍在追赶需求,缺口明确 |
两者根本分歧在于时间尺度。“泡沫论”关注 12-24 个月的财务回报,确实看到短期压力;而“缺口论”着眼于 5-10 年的技术渗透,指向康波周期量级的产业革命。
历史经验表明,云计算早期的巨额投入虽曾受质疑,但最终被验证为必要基石。当前 AI 面临的情况更为紧迫:需求不仅“可能到来”,而是“已经爆发”。Kimi 限流、谷歌供不应求、高上架率及巨头巨额资本开支,均为“缺口论”提供了坚实佐证。
五、海南视角:跨境电商的算力挑战与机遇
跨境电商是 AI Agent 最早落地的场景之一。多语言客服、合规审查、海关编码分类及选品定价等 Agent 已在头部企业投产。随着 Agent 数量激增,算力成本将从 IT 预算问题转化为商业模式的核心成本结构问题。
作为国家级数据标注基地及自贸港窗口,海口无需重复巨头“建算力中心”的路径,而应聚焦于确保本地企业在 Agent 时代不被算力成本挤出竞争。建议关注三个方向:
第一,推动算力成本透明化。协会可编制“跨境 AI Agent 算力成本基准报告”,帮助企业厘清单次调用的真实成本,建立科学认知。
第二,构建数据闭环。借鉴韶关“来数加工”模式,推动海口数据标注基地与跨境电商企业联动,实现交易数据的本地标注、训练与应用,降低对外部算力的依赖。
第三,布局端侧推理。随着 AI 眼镜及手机端侧大模型的发展,实时翻译、商品识别等场景的推理算力将下沉至终端。海南丰富的免税零售与跨境直播场景,天然适合开展端侧 AI 试点。
算力“硬缺口”短期内难以消除。当短缺成为常态,先发优势将属于那些最清楚自身算力需求的企业。
本文数据截至 2026 年 7 月 24 日,核心来源:工信部国新办发布会、谷歌 Q2 财报、IDC 全球 AI Agent 市场预测、巴克莱研究、德勤 AI 芯片市场报告、AMD CES 2026 演讲、月之暗面官方发布。

