大数跨境

别再盲目堆Token了!警惕AI时代的“复合增长陷阱”与认知稀释

别再盲目堆Token了!警惕AI时代的“复合增长陷阱”与认知稀释 AI人工智能D1net
2026-09-28
2
导读:本文深度拆解了智能体循环中的“Token复利灾难”,并指出:盲目堆砌上下文不仅在疯狂烧钱,更在暗中瓦解模型的推理能力。与其靠一刀切的上限勒紧裤腰带,不如掌握六大检索优化策略,用“每个任务的成本”打破A
点击上方“蓝色字体”,选择 “设为星标”

关键讯息,D1时间送达!


图片




企业网D1net




为什么即便AI提升了效率,CFO依然不愿批预算?Uber四个月烧光全年AI额度并紧急设限的背后,折射出整个行业对AI成本度量的集体失语。本文深度拆解了智能体循环中的“Token复利灾难”,并指出:盲目堆砌上下文不仅在疯狂烧钱,更在暗中瓦解模型的推理能力。与其靠一刀切的上限勒紧裤腰带,不如掌握六大检索优化策略,用“每个任务的成本”打破AI投资回报的黑箱。

上个月我曾探讨过ROI(投资回报率)汇率的概念:即在部署前与财务部门协商确定的公式,用于将KPI(关键绩效指标)的变动转化为具体的美元金额。例如,一次呼叫解决率相当于多少美元,节省的一小时工程时间相当于多少美元。


一个普遍的反驳意见大同小异:好吧,我们同意这个价值确实存在,但它的成本是多少?


在大多数公司,这一栏是空白的。不是“大致知道”或“正在统计中”,而是完全空白,然而,分母为空会使分子失去意义。你可能证明了KPI有所提升,但最终依然会在辩论中败北,因为CFO(首席财务官)资助的不是改进本身,而是那些回报大于成本的改进。


这就引出了今年讨论度最高的AI预算事件,以及为什么我认为几乎所有人都从中总结出了错误的教训。


Uber真正耗尽的是什么


我们得感谢Uber表现得如此透明,他们在2025年12月推出了Claude Code。到了2月,32%的工程师在使用智能编码工具,3%到了3月,这一比例达到了84%。正是在这个过程中,该公司在短短四个月内烧光了其2026年的全年AI预算,这一数字由CTO(首席技术官)Praveen Neppalli Naga于4月向《信息报》(The Information)证实。6月,彭博社报道了他们的应对举措:对每位员工每月的每个工具设定了1500美元的硬性上限。


西蒙·威利森(Simon Willison)称这一上限是理性的,他是对的。面对在智能编码出现之前就已制定的预算,设置上限是正确的应急举措,换作我也会这么做。


但让我们看看Uber的COO(首席运营官)在被问及这笔开销是否有效时是怎么说的。安德鲁·麦克唐纳(Andrew Macdonald)在《快速反应》(Rapid Response)播客中表示:“很难在其中某项统计数据和‘好吧,我们现在确实多产出了25%有用的消费者功能’之间划清界限。”


这不是对成本的抱怨,而是对度量的抱怨。Uber设定上限并不是因为Token(词元)昂贵,而是因为它无法为Token购买到的价值定价,而你无法为一个无法与任何事物建立联系的数字进行辩护。当你没有建立汇率那一栏时,上限就是你不得不采取的手段。


接下来这一点,应该比预算超支更让你感到担忧,软件开发是企业中配备度量工具最完善的工作流。Pull Request(拉取请求)、交付周期(Cycle Time)、部署频率、漏到外部的缺陷,它是唯一一个已经拥有我上个月告诉大家去构建的“记分牌”的职能部门。Uber拥有这一切,然而“每个任务的成本”依然不在记分牌上。


如果连这里都缺失了,那么它在任何地方都会缺失。


两个杠杆,却只动了一个


看看整个行业是如何应对Token最大化(Token Maxing)的:配额、每座(Per-seat)上限、模型降级、审批门禁、仪表盘,每一个控制的都是你进行了多少次调用。


但没有一个触及单次调用的成本。


这就是核心论点,这里有两个杠杆,而整个行业在过去六个月里一直在猛拉其中一个,却对另一个视而不见。


没人做预算的复利效应


在一个简单的智能体循环中,完整的对话历史会在每一步被重新序列化并重新注入。消息历史呈线性增长,而计费的输入Token则呈二次方增长。


运行一个温和的20步循环,每步增加1000个历史Token,将20乘以1000,得到20000,这是大多数人脑海中的数字,但实际计费的输入却是210000,因为第19步要为第1步到第18步所说过的一切买单。


长期读者会认出这种形态,今年6月我曾论证过,AI云策略本质上是一个物理问题,因为50毫秒的跨区域延迟并不只让你损失50毫秒,而是让你损失“50毫秒乘以循环中的每一次跳转”,同样的结构,不同的维度,从单次调用中砍掉80万的垃圾数据,你可以节省单次调用80%的开销,而如果从每一次跳转中砍掉它,你就能节省一个二次方开销的80%。


“但是我们有Prompt缓存”


现在,各大主流提供商都对重新发送的前缀Token提供了折扣。Anthropic按标准输入的0.1倍收取缓存读取费用,写入则有1.25倍的溢价。OpenAI的新模型也落在了同样的0.1倍乘数上,谷歌的隐式缓存则能节省约75%的费用。


缓存可以将未缓存的账单削减79%,这是目前可用、规模最大的成本杠杆,阅读本文的每个团队都应该使用它,但它也让你的实际开销达到了你脑海中数字的2.2倍。缓存能够拉平二次方增长,但它并不能完全消除它,而且伴随着一个前提条件。


缓存是以确切的前缀作为键(Key)的,因此前端的任何变动都会使它后面的所有内容失效。如果你的检索管道在每个回合的顶部附近注入了新挑选的数据片段(Chunks),你不仅在为那些没有发挥价值的Token买单,还在破坏其后所有稳定Token的缓存。如果在同等循环中模拟25%的前缀破坏率,那么44000个有效Token就会变成90000个。


请将Prompt按照从“稳定”到“多变”的顺序排列:系统Prompt(System Prompt)、工具定义、长寿命上下文,然后是当前回合,接着去测量命中率,这只需要花一个下午的时间,却能保护你最好的成本杠杆。


让它超越FinOps备忘录的部分


通常情况下,降低成本会牺牲质量。你买更便宜的东西,就会得到更次的东西。


但这里并非如此,你花钱发送的那些低相关性上下文,正是正在使回答质量下降的罪魁祸首,这是本文中承重的核心主张,由于这个领域充斥着厂商的花言巧语,这里列出两篇同行评议(Peer-reviewed)的文献,它们可都不是卖检索基础设施的。


经典的结论来自Liu等人的研究《迷失在中部》(Lost in the Middle,TACL, 2024):准确率在整个窗口中呈U型曲线分布,边缘表现强劲,中间较弱,并且随着输入规模的增长,准确率会下降——即便在专为长上下文构建的模型中也是如此。


让我感到惊讶的是Du等人的研究《仅上下文长度就会损害LLM性能,即便检索完美无瑕》(Context Length Alone Hurts LLM Performance Despite Perfect Retrieval,EMNLP Findings, 2025)。作者们保持了完美的检索效果,但依然增加了输入。结果准确率仍然下降了,根据模型和任务的不同,降幅在13.9%到85%之间,完全落在了标称的限制之内。当填充物是空白字符时,这一现象依然存在,当无关的Token被完全掩码(Mask)掉时,它依然存在。大部分的性能损害都发生在头7K的范围内。


你不需要的Token即使被缓存了也并非免费,它们正在稀释你花钱购买的推理能力。更便宜且更准确,一石二鸟。这不是一种权衡,而是一种定价错误。


问题于是变成:在我可以发送的一百万个Token中,究竟哪20万个才配得上它们的位置?


这既不是采购问题,也不是政策问题,这是一个检索问题,可以通过你的RAG(检索增强生成)管道或智能体记忆来解决。与支出上限不同,它有一个工程学上的答案。


挑选正确的20万个Token的六种方法


从成本最低到最高排序,每种方法旁边都附带了相应的业务后果,因为一个永远不会接触分块策略的CIO仍然需要知道跳过它的代价是什么。


1. 在搜索前进行过滤,元数据和范围缩小(Scope Narrowing)不产生任何成本,并且能在语义搜索运行之前过滤掉绝大部分不相关的候选内容,你本不该花钱去做相似性搜索来重新发现你已经知道的事。


2. 重排(Rerank),而不仅仅是检索,向量搜索优化的是召回率(Recall),但在注入点,你需要的是精确率(Precision)。如果没有重排,精确率就只能取决于你的嵌入模型(Embedding Model)碰巧给你的水平。


3. 按语义分块,而不是按字符数,固定大小的分块会割裂本来需要保持完整的推理逻辑。为了一个想法你付出了3倍的代价,而模型看到的却是一片片碎片。


4. 精简,而不是累积,总结先前的回合,而不是重新发送原始的对话记录,这是唯一能改变曲线形态的项目。


5. 跨回合去重,智能体循环会重复检索相同的块,而几乎没有人去衡量这一点,你在每个会话中为相同的文本支付了好几次费用。


6. 知道何时停止,在哪个点上,下一个数据块在资金和稀释效应上不再划算?如果没有答案,那就说明你没有检索策略,你有的只是默认设置。


第一、二、五条在不需要经历预算周期的本周内就可以核查。


你带回给财务部门的数字


第六点值得从列表中单独拿出来,因为它产生的是一个具体指标,而不仅仅是改进方案。


每个任务的成本,不是每个Token的成本(那衡量的是供应商的定价),也不是每个座位的成本(那衡量的是你的人头规模),而是每个解决的Ticket(工单)、每个合并的Pull Request、每个关闭的Claim(理赔)的成本。也就是汇率之下的那个分母。前面五条是如何改善它,而这一条是如何报告它,这也是当它赚回价值时,让你有底气去争取预算的依据。任何处于一刀切上限之下的公司都无法进行这样的对话。


反驳意见与一个诚实的警告


• “上下文窗口在不断增长,模型使用它们的能力也越来越强。”——这两点都是事实,但这并不能让为无关Token买单变得合理。Du的研究结果表明,长度本身就带有技术债务和成本,而这是能力提升尚未消除的,并且这种复利是结构性的:随着智能体变得越来越自主,情况只会恶化,而不会变好。


• “我们已经在做RAG了。”——一个采用固定大小分块、没有重排器(Reranker)、也没有评估(Eval)的管道,本质上只是带着额外步骤的Token最大化。


• “上限对Uber有效。”——它们控制了预算,这确实解决了当下的燃眉之急,但试着问问他们为每个交付功能所付出的成本改变了多少,以及你最优秀的工程师现在是不是那些最擅长进行严苛配给的人。


关于那个警告,与其被别人挑出来,不如我自己先说出来:某些工作负载确实需要整个文档都在窗口中。长篇法律审查、整个代码库的重构——任何远距离章节之间的关联性才是关键的场景。


账  本


支出上限控制了账单,它是正确的应急举措,但也等于永久承认你从未建立过度量体系。


每个任务的成本是另一栏,它告诉你昂贵的工作负载与浪费的工作负载之间的区别,而这两者并不是一回事。


上下文长度是你无法控制的杠杆,而单次调用的成本则是你能控制的。



版权声明:本文为企业网D1net编译,转载需在文章开头注明出处为:企业网D1net,如果不注明出处,企业网D1net将保留追究其法律责任的权利。封面图片来源于摄图网

(来源:企业网D1net)




关于企业网D1net(www.d1net.com)




企业网(D1net.com)-企业 IT 第 1 门户。面向 IT 行业高端甲方人群(CIO 首席信息官)最精准专业的媒体,面向约六万政企  CIO、信息中心主任、科技部总经理等 IT 主管,提供资讯、营销、活动、项目合作推介等服务。拥有专业注册会员(IT 从业者)约  188万人,主要读者为政企用户及其信息主管、软硬件厂商等,服务过的企业级厂商逾五百家,国内toB的头部IT厂商基本都是D1net的客户。


同时,企业网D1net也运营着国内最大的CIO(首席信息官)专家智库和智力输出变现及社交平台-信众智,也是国内最大的科技高管社交平台。旗下运营19个IT行业公众号(微信搜索D1net即可关注)。


如果您在企业IT、网络、通信行业的某一领域工作,并希望分享观点,欢迎给企业网D1net投稿。

投稿邮箱:

editor@d1net.com

合作电话:

010-58221588(北京公司)

021-51701588(上海公司) 

合作邮箱:

Sales@d1net.com


企业网D1net旗下信众智是CIO(首席信息官)的专家库和智力输出及资源分享平台,有六万多CIO专家,也是目前较大的CIO社交平台。


信众智对接CIO为CIO服务,提供数字化升级转型方面的咨询、培训、需求对接等落地实战的服务。也是国内较早的toB共享经济平台。同时提供猎头,选型点评,IT部门业绩宣传等服务。

扫描 “二维码” 可以查看更多详情

【声明】内容源于网络
0
0
AI人工智能D1net
企业网D1Net-国内精准专业的企业IT媒体。涵盖:云计算;智慧城市;数据中心;大数据;物联网;BYOD;企业移动应用;服务器;存储;虚拟化;安全;企业应用软件;UC协作;视频会议;视频监控;呼叫中心;运营商企业业务;IT咨询;渠道等。
内容 791
粉丝 0
AI人工智能D1net 企业网D1Net-国内精准专业的企业IT媒体。涵盖:云计算;智慧城市;数据中心;大数据;物联网;BYOD;企业移动应用;服务器;存储;虚拟化;安全;企业应用软件;UC协作;视频会议;视频监控;呼叫中心;运营商企业业务;IT咨询;渠道等。
总阅读811
粉丝0
内容791