一、Token本质:AI服务的"度量衡"
技术层面,Token(词元)是大模型处理信息的最小单元,1个Token约等于1.5到2个汉字。
业务层面,Token有三层含义:既是算力消耗的度量单位,又是AI服务的计价单位,还是智能经济的"通用货币"。
移动互联网时代,衡量线上业务规模的度量衡是"流量"。AI时代,衡量智能服务规模的度量衡是Token。
那么,Token和算力、大模型的关系是什么呢?
算力、大模型与Token的关系
🧱 算力是生产资料 → ⚙️ 大模型是生产设备 → 📦 Token是生产输出
网络连接算力,算力生产Token,Token提供动能(智能)
二、Token供给的五种模式和对应商业模式
根据Token供给方和需求方之间生产关系的不同,Token供给有五种模式:
🔥 模式一:模型原厂直营
大模型厂商对外开放API,企业或个人直接调用官方接口,按Token付费。数据链路最简单:企业应用经公网或专线调用厂商的共享推理集群,Prompt和企业数据随请求离开企业边界。
这种方式上手最快,但致命缺陷是数据安全——金融、政务行业涉及客户信息和敏感数据等场景没法用。
▲ 图1:模型原厂直营模式
商业模式上只有两个角色:原厂向企业按Token计费,行业惯例是输入和输出分开计价(输出通常是输入的3到6倍),命中缓存的输入打到一折甚至更低,部分厂商也卖包月订阅套餐。站在大模型原厂角度,Token费用体现的是算力基础设施和人工成本:算卡、机房、模型训练人工等等。
📊 国内主流大模型API官方刊例价(单位:元/百万Token)
|
|
|
|
|
|---|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
☁️ 模式二:云厂商全栈
云厂商封装自身或第三方大模型,并和自有算力、云平台打通,对外提供"模型+算力+平台"整套服务。互联网云和国资云是两条不同路线:
互联网云:代表是阿里云百炼和火山引擎方舟,以自研模型(千问、豆包)为绝对主力,同时上架第三方模型作为补充。
国资云:代表是移动云(MoMA)、天翼云(息壤)和联通云(元景)。在自研模型之外,引入DeepSeek、千问等第三方开源模型,同时也转售闭源模型。
▲ 图2:云厂商全栈模式
牌桌上有三个角色:企业、云厂商、模型原厂。商业模式包含两段关系:
第一段:云厂商 ↔ 企业:核心是按Token计费,要么直接卖Token,要么打包为套餐,比如天翼云星辰TokenHub的Token Plan,1500万Token 39.9元/月、7000万 159.9元/月。
第二段:云厂商 ↔ 模型原厂。按模型开闭源分为两种情况:开源模型(如DeepSeek)免费自部署不付费;闭源模型(如豆包)则采购Token或按收入分成,再卖给企业。
这种模式下,token费用体现的是云厂商在算力建设、模型部署调优、运维安全等方面的成本及其溢价——同一个基础大模型,部署在不同的芯片、采用不同的推理方式,效果和效率完全不同。此外,云厂商可以向企业屏蔽掉不同模型的接口和计费差异,统一度量衡,进一步降低企业接入门槛。
🛒 模式三:聚合分发平台
模式三是模式二的纯粹版:像OpenRouter、硅基流动这类"模型超市",一侧接入几百个模型,统一账单、智能路由、故障切换,一侧向企业提供统一封装后的大模型API。
▲ 图3:聚合分发平台模式
但对应的商业模式,中美呈现出巨大差异:
🇺🇸 美国 OpenRouter:几乎纯是"路由器"。因国外算力被英伟达芯片和CUDA生态高度标准化,只做转发和清算,在原厂Token费用之上上浮5%。但这也是OpenRouter作为月处理百万亿Token、增速高达500%的行业龙头,上个月选择寻求收购机会的根本原因。
🇨🇳 中国 硅基流动:国内算力有华为昇腾、寒武纪等多芯并存,除了路由和转发,还做了大量跨芯片适配、推理引擎优化、异构算力调度等苦活累活——这些工程壁垒让TA更难被替代,商业护城河更为稳固。
模式三的利益相关方和模式二完全一样:企业、聚合平台、模型原厂,那商业模式区别到底在哪呢?主要是两条:
第一,聚合平台有没有自己的云生态。云厂商卖Token可以亏本,因为背后有存储、数据库、甚至网络等资源可以收钱;但聚合平台没有,Token费就是它的全部——这决定了它天然没有打价格战的家底,必须靠工程效率把成本做到极致。
第二,平台有没有自研模型。互联网云厂商对外提供的模型以自研模式为绝对主力,第三方只是补充;但聚合平台没有自研模型,价值在于“中立”和“统一”——屏蔽底层几百个模型的差异,统一账单、智能路由、故障切换,企业只对接一家就能随时切换底层模型,不被任何单一厂商锁定。
具体到收费上,硅基流动的刊例与原厂基本持平,但这也是其软肋:转卖token不挣钱,挣的是苦活累活的钱——从硅基流动今年的招股书就能看到:公有云MaaS业务收入占52.9%,毛利率是负119%;本地部署业务收入占47.1%,毛利率高达82.5%。
所以,对于没有模型能力的云厂商也好、聚合平台也好,单纯转卖Token都没戏。
🔒 模式四:私有化部署
企业自建算力,将模型部署到自己机房,数据完全不出域,所有交互在企业内网闭环:业务系统经过企业AI网关,调用本地推理集群,外接本地向量库做知识库检索。
▲ 图4:私有化部署模式
模型本身免费,成本主要来自算卡、基础设施、部署和运维人工等。门槛不在软件在硬件:一台能跑70B级模型的8卡整机约两百万元,还要算上数据工程、每年几十万的人力运维。
详细可以看:https://juejin.cn/post/7639943951479422985🔀 模式五:混合架构
自建算力毕竟太贵,现实中大部分企业会选择混合架构:按数据敏感度,敏感数据走本地模型,通用任务走公有API,用一层统一AI网关做调度、脱敏和记账。
▲ 图5:混合架构模式
这种方式兼顾能力上限与合规底线,代价是架构和治理的复杂度。商业模式上是模式四+模式一/二/三。
📝 三、小结
Token是AI时代的度量衡,但这门生意的胜负手,从来不在Token本身的价格。
🧑💼 对供给方:胜负手在算力成本、部署质量和离客户场景的远近
🏢 对需求方:胜负手在合规先行、用量测算和成本工程
It's just beginning.

