文丨海风
01
Uber的警钟:四个月烧光全年预算
2025年12月,Uber给工程师配上了Claude Code,还在内部搞了个排行榜,按token消耗量给团队排名。结果到了2026年4月,Uber全年的AI编码预算就见底了。
总裁兼COO Andrew Macdonald直言:目前看不出AI工具用得多和给骑手司机交付更好产品之间有什么关系。这件事后来还衍生出一个词——tokenmaxxing,专门形容token消耗猛涨但找不到对应投资回报的现象。
不只是Uber。Gartner预计,2026年全球AI代理软件支出将接近2070亿美元,比2025年的864亿美元增长超过139%。
但钱花出去了,效果怎么衡量?目前AI使用率和token消耗最多只能算企业评估AI价值的参考输入。就算几乎所有工程师都在用AI,企业也很难证明这些投入换来了更多功能上线、更多漏洞修复或者更多客户问题解决。
token的定价逻辑和传统软件完全不同。同一个工程师用同一个工具,一天消耗多少token完全取决于当天在干什么——写几行自动补全和跑并行代理做大型数据库迁移,成本差着数量级。
于是乎,Uber把单员工单AI编码工具的月支出上限卡在1500美元;微软体验与设备部门算了算Claude Code的授权成本,直接取消了采购;多邻国本来想把AI使用情况纳入绩效考核,员工一闹,又撤回来了。
02
token烧得快,砍用量还是设网关?
很多人第一反应是员工浪费,但业内人士的看法不太一样。
企业合同生命周期管理平台Agiloft的AI运营副总裁Noe Ramos认为,token消耗过高的核心原因是基础设施设置,不是人。多数企业把选什么模型的权力直接交给了写prompt的人,结果大量本来用低价开源模型就能搞定的任务,全丢给了最贵的前沿模型——这是架构问题,不是员工问题。
语言学习公司Promova的工程负责人Dmytro Palaniichuk也有类似观察。他发现多数AI工具的默认设置本身就在推高成本:团队版和企业版默认预选高端模型,默认开高推理能力模式,对应套餐的Opus会话默认升级到100万token上下文窗口。很少有人会主动去改这些设置,甚至出现过用高端模型查邮件这种事。
Promova正在推一个目标:Opus、Sonnet、Haiku三类模型的使用比例做到40/50/10。但Palaniichuk承认这只是个方向,真正难的是改习惯——就算把组织默认模型设成Sonnet,搞不清使用场景的员工还是会回到老路子。关键是让员工在开会话之前有意识地看一眼当前选的是什么模型。
不是所有企业都在砍用量。SUSE技术与产品总经理Rick Spencer的观点是:优化AI使用不等于减少AI使用。如果花16000美元的token能省10万美元成本,这种高消耗反而该鼓励。SUSE的做法是先诊断再动手,把AI使用场景分成日常工作、自主代理、一次性战略突破三类,由管理人员针对性指导。
诉讼与调查AI服务商Everlaw也设了单人员token上限,但逻辑和Uber不一样——员工达到上限后向工具团队申请,通常当天就能拿到双倍额度。Everlaw是少数能拿出具体回报数据的企业:一个核心Java基础设施优化项目花了3500美元token,把原计划9.5个工程师月的工作量压缩到2.5个;另一款未发布产品已经花了27000美元token,预计总消耗4万美元,对应的研发工作量从预估90到100个工程师月缩短到19个。
但也不是每次都能成。Everlaw曾花几千美元让AI代理把界面代码从Dojo迁移到React,结果输出全部作废——两个框架对状态和视图的底层假设根本不一样。现在团队调整了流程,先让AI代理记录旧系统的行为,再基于文档写新代码。
Agiloft走得更远,直接取消了token上限。原因是原来的上限只影响26%的用户,既挡了真正有高需求的人,也没碰到成本驱动的核心因素。他们把低价模型设为默认,只在任务需要时才升级到前沿模型,路由调整在基础设施层完成,同时加了缓存机制。Agiloft的判断是:多数企业团队最快的优化方式是部署公司级大语言模型网关,实现低价默认模型加智能路由。稀缺性管控只是临时补丁,智能路由才是根本解。
03
自动路由来了,但效果还是难量化
目前Merge、Databricks、AWS Bedrock、Azure AI Foundry等多家厂商都推出了自动路由工具,根据任务复杂度匹配最合适且成本可控的模型。
Databricks在6月的Data + AI峰会上,于Unity AI Gateway中推出了智能路由功能,同步上线支出上限和跨托管模型、编码代理、自定义代理的成本归因功能,目前还在测试阶段,支持"仅推荐"和"自动路由"两种模式。
Databricks产品管理总监David Nasi介绍,路由工具会根据prompt意图和长度、关联文件、堆栈跟踪、变更范围、推理深度、执行复杂度等因素评估每个请求,同时适配不同的模型运行框架。路由决策全程透明,不搞黑盒。达到支出上限时,管理员可以选择直接阻断后续请求,或者先尝试降级到更便宜的合规模型。针对代理类工作负载单次任务会触发数十次模型调用的情况,路由工具在执行边界做评估,而不是逐次调用审批。
但无论是人工选模型还是自动路由,能拿出具体成本节约数据的企业仍然很少。Promova的遥测数据显示,100万token上下文窗口的Opus模型占每月支出的三分之一,但模型使用比例调整是和其他工作同步推进的,没法单独核算成本优化效果。SUSE目前也没有具体量化指标,只有案例支撑——比如一个项目把依赖项中的数百个通用漏洞披露降到零,相关代理自5月以来已在VEX数据库中分类了近10000个通用漏洞披露。
Databricks的早期数据倒是有一点:此前全部流量都走前沿模型的团队,现在把样板代码生成、简单漏洞修复、小幅编辑等常规任务转移到低成本模型,解决率没有出现可测量的下降。为了帮团队掌握成本优化效果、捕捉路由调整后的质量波动,Unity AI Gateway还附带了统一追踪、大语言模型作为裁判的评估框架、评估数据集、追踪分析和自动反馈闭环。不过特定业务领域的准确率验证仍需客户自己完成——大语言模型输出本身有不确定性,模型基本按季度迭代,针对某一版模型调好的评估方案未必能直接用到下一版。
多位业内人士提到,当前这些具体的AI使用优化策略会逐步失效,但底层的管控逻辑会留下来。
Everlaw CTO Max Christoff预计,未来1到2年内,token支出会被视为类似年度人力或生产成本的类别,而不是普通的IT或软件支出。部门负责人做年度规划时,会同步提交人力和token投入规划以及对应的商业论证——有的团队可能规划数百万美元token投入、几乎不新增招聘,有的团队则可能反过来。
到那时候,"AI用了多少"不再是问题,"AI花得值不值"才是。

