摘要:
Token 是 AI 世界的"原子货币":Token(词元)最初只是自然语言处理中把文本切分为子词单元的技术概念,2020 年 OpenAI 推出商业 API 后,它正式成为 AI 计算的计费与计量单位——如同电力行业的"千瓦时"。今天,全球每天生成约 300~477 万亿 token(已披露口径下限约 300 万亿/天),短短两年半内增长约两个数量级(估计)。
Token 价格由"能力税"而非"成本税"主导:同一段话在不同模型上价格可相差千倍(输出最高 $600/百万 token 对比最低 $0.4/百万 token)。价格差异来自模型规模、推理成本、输出/输入不对称、上下文长度、缓存与批处理、竞争(DeepSeek 引发的价格战)、以及"思考强度"的增值定价。市场并未收敛成单一价格,而是分裂成"接近边际成本的商品层"与"高溢价的前沿层"。
全球 token 版图高度集中:美国拥有约 65%~75% 的全球 AI 算力(token"发电"能力),中国约 12%~15%;而消费端美国约 30%~35%、中国约 15%~20%(国内模型生态),印度用户基数巨大(约 2.4 亿用户)但算力自给率极低(估计)。
算力版图 ≈ 政治版图:美国 5 家超大规模云厂商掌握全球约 71% 的累计 AI 算力;仅 32 个国家拥有 AI 专用数据中心,非洲与拉美合计约 3%。而台积电则成为全球 AI 芯片的"咽喉"。
Token 正在成为新的地缘政治基础设施:出口管制已从"芯片管制"演进到"模型管制"(2026 年 6 月美国首次对 Anthropic 模型实施出口管制),再到对"远程访问"即 token 出口的控制。没有 token 基础设施的国家面临 API 依赖、数据主权流失、外汇流出与数字经济边缘化,但也拥有通过开源模型与效率创新实现"跳跃式发展"的机会。
对企业AI的核心启示:token 是 AI 产品的"电力账单"——成本结构、模型选择、区域合规与算力备选方案,将直接决定 AI 业务的毛利与地缘韧性。
第一章 Token 从何而来:起源与技术演进
1.1 什么是 Token
在大型语言模型(LLM)中,Token 是模型读写的最小原子单元:一段文本先被映射为一系列整数 ID,模型实际上是在处理这些 ID 序列。一个 token 约等于 0.75 个英文单词(即每个单词约 1.3~1.4 个 token),或约 4 个英文字符。
关键认知:Token 不是词、不是字符、也不是字节,而是模型通过统计学习得到的"子词块"。它平衡了词表大小与生僻词覆盖两个矛盾需求,让模型可以处理任意语言、人名、复合词与多语言文本。
主流分词算法谱系:
算法 |
提出 |
代表模型 |
特点 |
|---|---|---|---|
BPE(字节对编码) |
1994 年 Gage(压缩算法);2016 年 Sennrich 等引入 NLP |
GPT 系列 |
反复合并最高频相邻对,简单高效 |
WordPiece |
2012 年 Schuster & Nakajima;BERT 采用 |
BERT |
按似然增益合并,而非原始频率 |
SentencePiece |
2018 年 Kudo & Richardson |
多种开源模型 |
直接在原始文本上操作,无需预分词 |
字节级 BPE |
2019 年 GPT-2 引入 |
GPT-2 及之后 |
基于 UTF-8 字节(基础词表 256),任意 Unicode 可编码 |
各代模型词表规模:GPT-2 约 5 万;GPT-3.5/GPT-4 约 10 万(cl100k_base);GPT-4o 约 20 万(o200k_base);Llama 3 约 12.8 万;DeepSeek-V3 约 12.8 万。Claude 词表未公开,但 Anthropic 官方提示其新分词器较旧版对同一文本多产生约 30% 的 token——这对成本规划有直接影响。[已验证]
1.2 关键里程碑时间线
时间 |
事件 |
意义 |
|---|---|---|
1994 |
Gage 发明 BPE(数据压缩) |
技术源头 |
2016 |
Sennrich 等发表《Neural Machine Translation of Rare Words with Subword Units》 |
BPE 进入 NLP,成为所有 LLM 分词器的直接祖先 |
2018-06 |
GPT-1 发布 |
首个使用 BPE 式分词的 Transformer 语言模型 |
2019-02 |
GPT-2 引入字节级 BPE |
任意语言文本可编码,词表 50,257 |
2020-06 |
GPT-3 论文发布(175B 参数,2048 token 上下文) |
定义"上下文窗口"概念 |
2020-06-11 |
OpenAI 推出商业 API |
Token 正式成为金钱:按 token 计费的商业模式诞生 |
2020-2022 |
各家 API 均以 token 计价 |
token 成为行业标准计量单位 |
2023 |
ChatGPT 爆发,"上下文军备竞赛"(Claude 200K、Gemini 1M) |
上下文窗口成为产品卖点,token 成为营销指标 |
2024-2026 |
微软公布季度"100 万亿 token"、中国国家数据局公布全国日 token 量(约 140 万亿/天)、谷歌披露约 105 万亿/天 |
Token 从公司财报指标升级为国家统计指标 |
2025-2026 |
NVIDIA/SemiAnalysis 发布 token/秒/GPU 基准;Tokens Per Day 指数上线 |
token 吞吐量成为硬件基准与宏观统计 |
1.3 Token 如何从"技术概念"变成"货币"
2020 年 6 月 11 日,OpenAI 推出付费 API——"文本进、文本出"的商业产品,按 token 计费(当时最大 davinci 模型约 $0.06/千 token)。这一模式定义了整个行业:此后所有大模型供应商(OpenAI、Anthropic、Google、DeepSeek 等)均按"输入/输出 token 数 × 单价"收费,token 计数接口、速率限制、上下文窗口全部以 token 为单位。
更重要的是,token 催生了新的叙事语言:
对开发者:token = 成本单位,"这个功能要花多少 token";
对模型厂商:token = 收入单位,"每天处理多少万亿 token";
对算力厂商:token = 产能单位,"AI 工厂的日产量是 token"(NVIDIA 官方将数据中心定位为"AI 工厂",产出即 token);
对国家:token = 统计单位,中国国家数据局与微软财报出现"每日/每季度万亿 token"的官方披露。
1.4 全球 Token 规模:从"万亿"走向"百万亿/天"
已披露口径(下限,约 300 万亿 token/天):
主体 |
披露量 |
时点 |
性质 |
|---|---|---|---|
谷歌 |
约 105 万亿 token/天 |
2026 |
公司披露 |
字节跳动豆包 |
超过 180 万亿 token/天(另有口径 120 万亿/天) |
2026 |
火山引擎披露 |
中国全国 |
约 140 万亿 token/天 |
2026 |
国家数据局披露 |
微软 |
单季 >100 万亿 token(2025 年 3 月单月 50 万亿) |
2025-04 |
财报电话会 |
OpenAI |
约 8.6~21.6 万亿 token/天 |
2025-12 |
Epoch AI 估算/第三方统计 |
独立机构估算: Epoch AI/Exponential View 估算全球约 432 万亿 token/天(约 50 亿 token/秒),一个前沿实验室约 10~100 万亿/天;a16z + OpenRouter 研究约 400 万亿/天;"Tokens Per Day"指数三角互证区间 308~477 万亿/天,累计自 2024 年 1 月以来已处理约 9.26 万万亿 token。高盛预测 2030 年 token 需求约为现在的 24 倍(约 4000 万亿/天),因为 Agent 工作负载将占主导——这是预测而非实测。
1.5 "Token = 算力产出":GPU 成了"发电机"
Transformer 推理成本与 token 数成正比,因此行业现在把 GPU 视为"token 发电机",正如发电机组之于电力:
吞吐基准:NVIDIA/SemiAnalysis 基准显示,Blackwell B200 单卡约 10,000 token/秒(Llama 3.3-70B,50 TPS/用户),是 H200 的 4 倍以上;极限吞吐可达每卡 6 万 token/秒;B200 上推理成本降至约 $0.02/百万 token。
单流时延:H100 上 Llama-70B 约 37 token/秒/用户;读 3,500 个输入 token 的耗时约等于生成 99 个输出 token。
宏观对应:Epoch AI 估算全球累计高端算力约 1,500~2,000 万 H100 当量——这就是全球 token "装机容量"。
结论: OpenAI 的"1 token ≈ 0.75 词",与电力行业"1 度电"的定位如出一辙——token 是 AI 时代横跨技术、商业、政策三界的统一计量单位。它诞生于 2016 年的论文,成熟于 2020 年的定价页,2026 年的今天是国家统计局级别的指标。
第二章 为什么不同的 Token 价格不同
2.1 主流 API 定价全景(美元/百万 token,2026 年 9 月)
前沿/旗舰档:
厂商 |
模型 |
输入 |
输出 |
|---|---|---|---|
OpenAI |
GPT-6 Astra(旗舰) |
$10(长上下文 $20) |
$50(长上下文 $75) |
OpenAI |
GPT-5.5 Pro |
$30(长 $60) |
$180(长 $270) |
OpenAI |
o3-pro(老一代) |
$20 |
$80 |
Anthropic |
Claude Fable 5.1(旗舰) |
$10 |
$50 |
Anthropic |
Claude Opus 5 |
$5 |
$25 |
Gemini 3.1 Pro(预览) |
$2(>200K 上下文 $4) |
$12(>200K $18) |
|
DeepSeek |
DeepSeek-V4 Pro |
$1.32 高峰 / $0.66 低谷 |
$3.96 高峰 / $1.98 低谷 |
xAI |
Grok 4.6 |
$2(>200K $4) |
$6(>200K $12) |
中端/小模型/开源档:
厂商 |
模型 |
输入 |
输出 |
|---|---|---|---|
OpenAI |
GPT-5.4-mini / nano |
$0.75 / $0.20 |
$4.50 / $1.25 |
OpenAI |
GPT-5-nano / GPT-4o-mini |
$0.05 / $0.15 |
$0.40 / $0.60 |
Anthropic |
Claude Sonnet 5 / Haiku 4.5 |
$2.00 / $1.00 |
$10.00 / $5.00 |
Gemini 2.5 Flash-Lite |
$0.10 |
$0.40 |
|
DeepSeek |
DeepSeek-V4 Flash |
$0.44 高峰 / $0.22 低谷 |
$1.32 高峰 / $0.66 低谷 |
Mistral |
Mistral Small 4(开源) |
$0.15 |
$0.60 |
Meta |
Llama 4(经第三方托管) |
约 $0.05~0.25 |
约 $0.2~1.3 |
通义千问 Qwen3.8 Max |
$2.00 |
$6.00 |
折扣/溢价结构: 缓存命中输入价约为原价 3%~10%(DeepSeek 缓存命中仅 3%);批量 API 约五折;DeepSeek 非高峰五折;按需加速约 2 倍;欧盟数据驻留加价约 10%;"Pro 思考模式"溢价 3~6 倍;音频 token 约为文本的 8 倍。同一段话,价格可以从"分"级到"千倍之差"——输出价 $600(o1-pro,老)对比 $0.40(GPT-5-nano),相差 1,500 倍。
2.2 价格差异的九大驱动因素
模型规模与能力(主导因素):参数量、MoE 激活参数、推理深度与评测分数与价格高度相关。前沿模型每 token 需要更多算力(更大的 KV 缓存、更长的推理链),且价格中包含了研发摊销与"稀缺租金"——不只是边际成本。
边际推理成本:每个输出 token 都有真实的计算成本(解码阶段受内存带宽限制,逐 token 串行生成)。服务效率(投机解码、批处理、量化、自研芯片)决定成本下限。开源权重模型被多家厂商托管,价格被压向边际成本。
输入/输出不对称:输出普遍比输入贵 2.5~6 倍。原因:输出是串行解码、独占显存带宽、延迟敏感;且"模型思考"才是交付物——按价值定价。
上下文长度:长上下文 KV 缓存线性增长,OpenAI/Google/xAI 都在约 20 万 token 以上加价约 2 倍。
缓存/批量/低谷/优先级分层:缓存命中 3%~10%、批量五折、低谷五折、加速 2 倍——这证明价格确实锚定成本(峰值负荷定价,教科书式的电力市场逻辑)。
竞争与市场策略(价格战):DeepSeek 2024-2025 年的开源发布(MoE 效率 + 低谷折扣)把整个市场价格中枢打下来;每个美国厂商都推出 nano/lite/haiku 级别低价小模型应对。
企业 vs 消费者 vs API 分层:消费者订阅是"包月限流",API 按量计价最贵,企业协议走量折扣。
地缘与主权定价:区域推理端点加价约 10%;Mistral 明确向欧洲公共部门卖"主权、开源权重"模型;中国厂商(DeepSeek、Qwen、GLM、Kimi)结构性低于美元计价美国模型。
分词器效率:Token 不是通用单位——每家分词器不同。英文约 0.75 token/词;中文/多语言文本在不同分词器下消耗的 token 数差异很大。同样的"词",在不同模型上即便单价相同,实际花费也不同。
2.3 价格趋势:三年下降 10~100 倍
时代 |
模型 |
输入→输出($/百万 token) |
|---|---|---|
2023 |
GPT-3.5-turbo |
$1.00 → $2.00 |
2023 |
GPT-4 |
$30 → $60 |
2024-05 |
GPT-4o 首发 |
$5 → $15 |
2024-08 |
GPT-4o 降价 |
$2.50 → $10 |
2025 |
GPT-4.1 / GPT-5 |
$2 → $8 / $1.25 → $10 |
2026 |
GPT-6 Astra / Claude Fable |
$10 → $50(新旗舰上限) |
2024→2026 |
Claude Opus 4.1→Opus 5 |
从 $15/$75 降到 $5/$25(降 3 倍) |
2024→2026 |
Gemini 1.5 → 2.5 Flash-Lite |
从 $1.25/$5+ 降到 $0.10/$0.40 |
规律:按单位能力衡量的价格下降了约 10~100 倍,性价比改善快于名义降价(Artificial Analysis 指数:2026 年旗舰"智能指数"每任务成本低于 2023 年的 GPT-4 时代)。但"前沿税"始终存在——新旗舰定价总是高于上一代中端;市场呈"哑铃形":底部几美分商品化,顶部超高溢价推理。
2.4 Token 会像电力一样价格趋同吗?
不会完全趋同,而是分层:
商品层(开源权重小模型、批量/低谷、无差异化能力):价格收敛逼近边际成本——像电力/大宗商品;
前沿层(旗舰、思考模式、Agent 可靠性、品牌与数据治理):溢价 10~100 倍——像头等舱与奢侈品;
缓存 3%~10% 的价格是"价格远超边际成本"的最强证据(前沿层标价以策略而非物理成本为主);
"思考时间"被货币化:推理 token(思维链)按输出计价,厂商开始按"努力程度"(低/中/高)分层定价——新增了"努力"这个定价轴。
一句话总结: token 市场更像航空业的舱位体系(同一航班几十种票价),而不是单一电价。边际成本在下降且真实存在,但前沿价格由能力、品牌与地缘决定。
第三章 Top 5 国家:谁在"发电",谁在"用电"
方法说明:研究将"生成 token"视为算力供给能力(数据中心、GPU 装机、模型服务设施),"消费 token"视为实际使用(用户数、API 调用、企业采纳)。国家层面的 token 官方统计尚不存在,以下排名为"已验证基础设施 + 明确标注的估算"。
3.1 生成(算力供给)Top 5
排名 |
国家 |
估算全球算力份额 |
证据要点 |
|---|---|---|---|
1 |
美国 |
约 65%~75% [估计] |
拥有 5,427 个数据中心,是第二名国家的 10 倍以上(Stanford HAI 2026,已验证);全球在建的 23GW 数据中心容量约 75% 在美国(Brookings 引 BNEF);全球前十数据中心市场中 8 个在美国(弗吉尼亚第一);五家美国超大规模云厂商掌握全球约 71% 累计 AI 算力(Epoch AI 2026-04) |
2 |
中国 |
约 12%~15% [估计] |
约 280 万 H100 当量 GPU(90% 置信区间 180 万~480 万,ChinaTalk 供需两侧估算),约为全球约 2000 万 H100 当量装机(Epoch AI)的 1/8;华为昇腾为主的本土算力约 90 万;上海、北京进入亚太前十数据中心市场(C&W) |
3 |
英国 |
低个位数 [估计] |
伦敦为 EMEA 第一大数据中心市场、全球前十;DeepMind 主场,微软/OpenAI/AWS 大规模布局 |
4 |
低个位数 [估计] |
法兰克福全球前十、欧洲 FLAP-D 集群核心;欧盟算力主力之一,但远逊美中 |
|
5 |
印度 |
约 1%~3%,快速上升 [估计] |
孟买、海得拉巴、钦奈、德里、浦那均为亚太主要/次级市场;印度 AI 使命建立约 18,000 张 GPU 的公共算力池(Brookings,已验证) |
荣誉提名与特别说明:
阿联酋/沙特:主权 AI 资本雄厚(沙特 PIF 承诺超 $400 亿;阿布扎比、迪拜为顶级 EMEA 数据中心市场),是未来五年的变量;
新加坡/柔佛:区域算力枢纽,承接中美两大阵营的超大规模集群;
3.2 消费(实际使用)Top 5
排名 |
国家 |
估算消费份额 |
证据要点 |
|---|---|---|---|
1 |
美国 |
约 30%~35% [估计] |
用户强度高、单用户 token 消耗最高(付费订阅+API+企业);约 28.3% 劳动人口使用生成式 AI(Stanford HAI 2026);美国消费者年价值 $1,720 亿;ChatGPT 最大收入市场;全球企业采纳率 88% 主要由美国企业驱动 |
2 |
印度 |
用户数口径约 15%~20% [估计] |
约 17.6% 采纳率 × 14 亿人口 ≈ 2.4 亿生成式 AI 用户(OWID 数据推算);OpenAI 为其推出印度专属低价版 ChatGPT Go(₹399/月)——高潜力高性价比市场的直接证据;但单用户 token 消耗低于美国 |
3 |
中国 |
约 15%~20% [估计] |
消费基于国内模型生态(豆包、通义、DeepSeek、文心);豆包月活 3.3 亿、火山引擎单日 120~180 万亿 token(中国日报/火山引擎披露,为全球单一厂商最大验证数字);全国生成式 AI 用户约 6 亿(CNNIC口径,本报告未独立复核) |
4 |
英国 |
约 3%~4% [估计] |
约 38.9% 劳动人口使用生成式 AI(OWID 2025-12),约 2,500~3,000 万用户(推算);企业深度使用美国云平台 |
5 |
法国 |
约 3%~4% [估计] |
欧洲大国中采纳率最高,约 44%~47.8% 劳动人口(OWID 2026-03),约 3,000 万用户(推算);德国(约 28.6%)、韩国(约 30.7%)为接近者;阿联酋(64%)与新加坡(61%)采纳率全球最高但绝对人口小 |
3.3 生成 vs 消费:谁自给自足,谁依赖进口
国家/地区 |
估算算力份额 |
估算消费份额 |
自给状况 |
|---|---|---|---|
美国 |
65%~75% |
30%~35% |
自给自足 + 净出口(超大规模云服务全球;依赖台积电晶圆,但数据中心能力主导全球) |
中国 |
12%~15% |
15%~20% |
近乎自足:国内模型+国产芯片闭环;仍依赖走私与远程访问 GPU 补足 (ChinaTalk) |
印度 |
1%~3% |
用户口径 15%~20% |
典型依赖进口:消费主要在美国超大规模云上;主权算力池仅 1.8 万 GPU,正在追赶 |
英国 |
低个位数 |
3%~4% |
依赖(使用美国云),但拥有 DeepMind 等前沿实验室 |
法国 |
1%~2% |
3%~4% |
依赖;欧盟主权算力建设滞后于雄心 |
德国 |
1%~2% |
约 3% |
依赖 |
阿联酋/沙特 |
上升中(约 1%) |
绝对量小 |
重金投资主权 AI,硬件仍依赖美国 |
新加坡/柔佛 |
区域枢纽(约 1%) |
约 1% |
枢纽而非终端消费国;承接他人算力 |
台湾 |
晶圆代工枢纽 |
小 |
关键供应商:制造几乎所有领先 AI 芯片 |
非洲+拉美合计 |
约 3% |
低 |
深度依赖;"数字殖民地"风险最高 |
核心结论:
美国是垄断型"产电大国":发电全球第一、用电全球第一,还出口给全世界;
中国是"独立电网":近 6 亿用户消费在自己的模型生态上,用"国产发电机(昇腾等)+ 少量走私进口(约 45 万张)+ 远程访问(约 103 万张当量)"维持闭环;
印度是"进口依赖型电网"的典型:用户爆炸式增长,但算力地基在美国云上,这正是各国主权 AI 运动的焦虑来源;
"发电能力"比"用电量"集中得多:即便消费端相对分散,供给端(芯片-晶圆-数据中心)始终握在少数玩家手里——这是地缘政治章节的全部伏笔。
第四章 Token 作为新基础设施:会改变地缘政治竞争吗?
4.1 "算力即新石油":类比成立与不成立之处
这一表述已成为主流叙事:美国国务院"硅和平宣言"称"20 世纪靠石油与钢铁运转,21 世纪靠算力与矿物";《外交事务》2025 年 12 月刊发"算力是新石油";CSIS 认为海湾战争级的地缘风险因"算力是新石油"而更高;微软布莱德·史密斯称"AI 是新电力,但要警惕南北鸿沟"。连"token 期货"都已出现——CME 与洲际交易所 2026 年 6 月宣布推出 AI 算力期货,Kalshi 上线 GPU 价格预测市场。
类比成立之处:
巨额前期资本 + 长期投入(算力与石油均需数十亿美元级投资周期);
战略咽喉点与军民两用属性(数据中心/电网/海底光缆 = 新管道与炼厂;2024 年红海切断四条光缆影响亚欧约 25% 流量);
出口管制为主要政策工具(对石油是制裁,对算力是 BIS 许可);
能源相互依赖(美国数据中心 2023 年占全国电力约 4.4%,预计 2028 年翻三倍;爱尔兰约占 20% 并已暂停新接入)。
类比不成立之处(Token 的独特性):
非竞争性:一个模型可以同时服务数十亿用户,规模化后边际成本趋近于零;不存在"资源枯竭";
以 API 而非管道出口:token 以服务形式在网络中流动——这一特性曾让远程云访问长期不被视为"出口"(EAR 下的"云漏洞"),直到 2026 年才被强行管制;
延迟敏感与数据引力:推理受距离影响,训练则不然——造就了海湾枢纽、"数字使馆"甚至轨道数据中心的布局逻辑;
非均质:电力/水是同质商品,算力分为训练/推理、内存受限/算力受限、H100 级/国产加速器——市场与管制都很"乱",而 token 期货正在试图让它可交易化;
咽喉点不止一个:石油只有一个地理捕获点(油井),算力则有芯片-晶圆厂(台积电)-软件(CUDA)-能源-数据中心-模型权重-API 访问七个环节;
增值而非耗竭:算力越来越便宜、越来越好(Epoch AI:每美元 AI 芯片性能自 2023 年以来每年提升约 49%;DeepSeek 式算法效率进步)。今天落后的国家明天可能跳跃式赶超——这与石油储量的"消耗"逻辑完全不同。
结论: "算力是新石油"捕捉了重要性,但误导了机制。算力地缘政治 = 半导体 + 电信 + 能源地缘政治的叠加,且关键新变量是——"出口物"从实体货物变成了 API 调用。因此最关键的资产不只是拥有 GPU,而是控制"芯片→模型→访问"的完整栈。
4.2 从芯片管制到模型管制:算力治理时间线
时间 |
事件 |
意义 |
|---|---|---|
2022-10-07 |
美国 BIS 禁止向中国出口 A100/H100 等先进 AI 芯片 |
芯片管制起点 |
2023-10-17 |
收紧:封堵 A800/H800 漏洞,加入性能密度阈值,扩大实体清单 |
中国获取前沿加速器渠道被系统切断 |
2025-04 |
英伟达中国特供 H20 被要求新许可证,销售暂停 |
依赖美国芯片的中国厂商承压 |
2025-01 |
拜登政府发布《人工智能扩散框架》:全球三级制——Tier1 盟友无上限、Tier2 大多数国家限购(约 5 万台起)、Tier3(中俄伊朝等)全面禁止;并首次将 AI 模型权重纳入管辖 |
从"芯片"到"模型/智能体"的管制升级 |
2025-05 |
特朗普政府宣布废除扩散规则,模型权重管制停止执行 |
政策摇摆 |
2025-07 |
白宫《美国 AI 行动计划》:将 AI 算力定义为国内基础设施,并通过可信伙伴向全球扩散美国技术栈 |
"扩散美国栈"成为国策 |
2026-06-12 |
美国商务部首次对 Anthropic 最先进模型实施出口管制:任何外国人访问均需许可(包括其外国籍员工);Anthropic 对所有客户紧急关闭访问 |
人类历史上第一次"模型级/Token 级"管制;"切断 token 供应"从假设变成现实 |
2026-06-30 |
商务部将模型出口管制扩展至先进 AI 模型总体,仅授权特定可信伙伴 |
管制制度化 |
2026-08 |
新管制瞄准"中国远程访问美国 AI 服务器"("削减版扩散规则");台湾起诉英伟达/超微员工非法向大陆出口 AI 服务器 |
"云漏洞"被正式封堵;执法延伸到个人 |
4.3 全球算力版图:极端集中
五家美国超大规模云厂商(亚马逊、谷歌、Meta、微软、甲骨文)持有全球约 71% 的累计 AI 算力(Epoch AI,2026-04,数据截至 2025Q4;2024Q1 时为 63%——集中度在上升);
仅 32 个国家拥有 AI 专用数据中心;非洲+拉美合计约 3%;
全球生成式 AI 能力差距:2023 年以来所有前沿模型均出自美国,中国模型平均落后约 7 个月(Epoch AI,2026-01);
中国应对:华为昇腾 2026 年约产出英伟达算力的 <4%(无国外 HBM 情况下 2028 年约 1%,Epoch AI 2026-09)——出口管制封住了中国的规模化杠杆;而走私估计已向中国输送 29 万~160 万 H100 当量(中位数约 66 万,Epoch AI 2026-04);
主权 AI 浪潮:欧盟 AI 工厂与 100 亿欧元"AI 千兆工厂"招标(2026-07,被 Politico 批评为"烧 200 亿欧元的梦想");英国国家级算力计划;印度 1.8 万 GPU 公共池;阿联酋 G42、沙特 PIF(>400 亿美元)、卡塔尔;新加坡 SEA-LION;肯尼亚/尼日利亚的非洲语言模型 InkubaLM;2026-07"AI 共享算力实验室"面向 118 个发展中国家。
4.4 没有 Token 基础设施的国家会怎样:风险与机会
风险面(结构性不利):
API 依赖 = 战略脆弱:2026 年 6 月 Anthropic 事件是最有力的实证——一国对前沿模型的访问可以被一夜切断,甚至美国厂商自己的外籍员工都被禁止访问。依赖外国 LLM API,等于把国运抵押在外国的出口法、许可证与政治风向之上。
数据主权与"数字榨取":没有本土算力,全球南方数据被出口到境外处理,"价值在别处沉淀"(Brookings)。轨道数据中心甚至会把数据置于任何国家监管之外。
经济依赖:token 进口账单以外汇支付给外国厂商;价值链与利润向全球北方集中(非洲+拉美仅 3% 算力,却居住着全球约 88% 人口);AI 治理框架中来自全球南方的不足 10%——他们是"规则接受者"而非"规则制定者"。
安全风险:政府与敏感数据外包出海;监视能力模型在威权语境中的扩散;军民两用时代的军事情报差距。
人才流失:人才追随算力与资本。IMF AI 就绪指数先进经济体 0.68 vs 低收入国家 0.32;非洲到 2030 年还需约 2,300 万名 STEM 毕业生。
价格歧视与配给风险:算力期货与 GPU 市场(CME/ICE、Kalshi)意味着波动与容量配给;Tier 体系就是按地缘站队定价与分配算力的制度。
机会面:
API 与开源模型的跳跃式发展:没有前沿资本也能获得前沿能力;开源权重模型(DeepSeek、Llama、Qwen 级)可以在中等规模的本地集群运行——DeepSeek 正是"以少算力做出世界级模型"的证明。
小而精的本地模型:InkubaLM、SEA-LION、Humain、印度 AI 使命证明,面向本地语言与场景的精调小模型,可以在十分之一成本下超越巨型通用模型。
共享/公共算力:印度 1.8 万 GPU 补贴池、南非 CHPC、AI 共享算力实验室,降低了入场门槛。
结构性禀赋:可再生能源富国(巴西水电 88%、肯尼亚/尼日利亚地热)可以成为"绿色 AI 枢纽";南南合作与数字公共基础设施(印巴 DPI 经验)可以复用。
实实在在的经济增量:微软估计 AI 到 2030 年可为非洲 GDP 增加约 $1.2 万亿(约 6%);全球非正规部门(61% 的劳动者)的生产率提升是现实红利。
美国的战略意图本来就是"出口技术栈":《美国 AI 行动计划》明确向盟友开放;卖 token 的动机非常强——对 Tier1 盟友,访问是被设计为开放的。
4.5 未来五种情景(范围分析,非预测)
"算力欧佩克" / Token 大宗商品地缘:算力富国(美、海湾、中、北欧水电国)像卖石油一样货币化 token;期货市场成熟;token 价格冲击成为宏观经济事件。
"两套技术栈"的割裂互联网:美国栈与中国栈围绕出口管制与模型发布管制硬化边界;第三国被迫选边、多栖或套利;Anthropic 先例推动外国买家转向本地托管开源模型。
主权 AI 竞赛:中等强国(欧盟、印度、海湾、日本)重金砸向国家级大模型与 AI 工厂;部分成功(印度/海湾),部分沦为"主权表演"(仍依赖美国芯片与云)。
效率革命压缩鸿沟:DeepSeek 式算法进步 + 开源模型 + 算力降价(每年性能/美元 +49%、token 吞吐约每年 5 倍)侵蚀"囤卡为王"的战略价值;"算力鸿沟"的重要性让位于"人才/算法鸿沟"。
"API 关口"成为新咽喉:管制从芯片转向推理访问与模型发布("终止开关"争论、远程访问安全法案);新外交工具出现(数字使馆、数据信托、可信伙伴许可、云验证终端用户)——地缘政治的战场从晶圆厂转移到 API 网关。
综合判断: 把 token 类比电力/水是"会改变地缘竞争"的充分条件——2026 年的模型出口管制已经证明 token 供应链可以被武器化。但机制不是"资源战争",而是"平台控制权的战争"。没有 token 基础设施的国家短期注定"进口依赖",中期可借开源与效率跳跃,长期取决于人才、数据主权与政策智慧——而非单纯的 GPU 数量。
第五章 结论与对企业AI的启示
5.1 核心结论
Token 是 AI 时代的技术、商业与政策通用计量单位,其地位正在从"API 计费单位"升格为"国家算力统计单位";
Token 价格是"能力-成本-竞争-地缘"四力博弈的结果,市场呈"商品化底层 + 前沿溢价顶层"的哑铃结构,不会收敛为单一电价;
全球 token 版图极端集中:美国垄断供给、中国自成闭环、印度等新兴市场"用电多、发电少",台积电是所有人的咽喉;
Token 基础设施正在重演电力/水的战略地位,但以"平台控制"而非"资源占有"为核心机制;模型出口管制(2026)实证了"token 断供"的可行性;
没有 token 基础设施的国家,短期损失是确定的(依赖、外流、脆弱),长期结局是开放的(跳跃、绿色枢纽、区域生态)。
5.2 对企业AI的实操启示
把 token 当"电力账单"管理:建立 token 成本仪表盘(按模型、按功能、按客户维度),缓存命中率、批量任务调度、低谷时段负载迁移,可立省 30%~70% 推理成本;
模型组合策略:哑铃式模型路由——简单任务走 nano/lite 商品层,复杂推理走前沿层,不要为 95% 的简单流量付前沿价;
地缘韧性设计:多供应商、多区域部署;把"Anthropic 断供"当作压力测试场景;关键客户数据优先本地化;
紧跟主权 AI 政策:欧盟 AI 工厂、印度算力池、海湾主权基金补贴,都是低成本进入区域市场的窗口;
技术栈选择影响地缘风险:开源权重模型(DeepSeek/Llama/Qwen 类)+ 可迁移部署,是对冲"模型出口管制"的保险单;
把握 token 期货与成本曲线:2026 年出现的算力期货与 GPU 市场,意味着未来可以像采购电力一样锁定远期算力成本——值得 CFO 与 CTO 共同研究。
(同样的TOKEN,GPT4画的独角兽和GPT6画的独角兽)
参考资料(机构与来源域名)
研究与智库
Epoch AI(epochai.org):全球算力集中度、中国算力估算、走私估计、效率进步、模型差距
Stanford HAI AI Index 2026(hai.stanford.edu):数据中心数量、投资、采纳率、芯片格局
Brookings(brookings.edu):全球 AI 鸿沟、在建容量、IndiaAI、非洲增量
CSIS(csis.org):算力与海湾、模型出口管制分析
RAND / ITIF / PIIE / Lawfare / CEPA / FDD:出口管制政策辩论
Carnegie Endowment / MEI / ORF / Atlantic Council:主权 AI 与地缘
ChinaTalk(chinatalk.media):中国 GPU 存量的供需两侧估算
Bruegel / Politico / HPCwire / The Next Web / Euronews:欧盟主权算力
IMF(imf.org):AI 就绪指数
McKinsey(mckinsey.com):企业采纳调研
Our World in Data(ourworldindata.org):各国生成式 AI 采纳率
Cushman & Wakefield(cushmanwakefield.com):全球数据中心市场排名
企业与官方来源
OpenAI(openai.com / developers.openai.com):API 定价、发布历史
Anthropic(anthropic.com):定价、token 计数文档、模型发布
Google(ai.google.dev):Gemini 定价
DeepSeek(api-docs.deepseek.com):定价、低谷与缓存折扣
Mistral(mistral.ai)、xAI(docs.x.ai)、OpenRouter(openrouter.ai):跨厂商定价
NVIDIA(nvidia.com):AI 工厂、token 吞吐基准
Microsoft(microsoft.com):季度 token 披露
中国国家数据局、火山引擎/字节跳动:全国及豆包日 token 量
美国商务部 BIS / 白宫(bis.gov / whitehouse.gov):扩散规则、AI 行动计划
学术论文:Sennrich et al. 2016(arXiv 1508.07909);GPT-3(arXiv 2005.14165);DeepSeek-V3(arXiv 2412.19437)
Wikipedia:Byte pair encoding、GPT-3、Doubao、ChatGPT、AI arms race 等条目
Tokens Per Day(tokensperday.com):全球 token 日产量索引
Artificial Analysis(artificialanalysis.ai):模型智能指数与成本
NBER 工作论文 34255(OpenAI 合著):ChatGPT 用户规模

