每年都有人说"今年是Agent之年",2025年喊过,2026年接着喊。
可一份2025年8月完成的调查,访问了95位已经在生产环境跑AI Agent的工程负责人,结论相当冷静:就算在这批"跑通了"的人里,Agent也远没有成熟。
今年,大概率仍不是Agent之年。
01
95%的项目没落地,落地的5%也不轻松
MIT调查了1837家企业,只有95家让AI Agent真正跑在生产环境,其余95%都卡在实验和试点。
落地的这5%也没好到哪去:受监管行业70%的企业每3个月就要重建一次技术栈,只有5%把"准确调用工具"列为头号技术难题,63%承认连Agent干得好不好都看不清。
结论:大多数公司还没走到"能用"这一步。
02
AI技术栈像流沙,昨天能用的今天就得重写
受监管行业里,70%的企业每季度换一次技术栈,不受监管的也有41%这么干。有受访者两个月内从一套框架换到另一套,刚换完又开始琢磨要不要换回去。
模型、框架、编排层迭代太快,试点能跑的东西一到生产就过时。内部自建AI工具失败率是外部合作的两倍,根源就是技术栈换得太快,自建团队追不上。
结论:不是大家不想稳定,是底座一直在晃。
03
生产里的Agent,大多在干"打杂"
落地最多的场景:文档处理76%、文档分析74%、回答FAQ和技术文档70%、数据提取66%、数据分析64%,还有一半在给人工客服打下手。
这些活的共同点:重复、量大、回报好算。只有5%的工程负责人把"工具调用准确"当头号难题,恰恰说明多数Agent还在拼表面回复,没到拼深度推理和精准控制的阶段。
结论:Agent还处在"能干活",远没到"能扛事"。
04
评估靠自建,可观测性是最弱一环
技术栈各环节里,满意度最低的是可观测性和评估,不到三分之一的团队满意,近一半在找替代方案。79%的公司用内部自建的办法评估Agent准不准,只有21%用第三方工具。
内部方法可控,但覆盖不全、难以规模化,Agent一面向更多用户,盲区就露出来。构建方式上,22%纯自建、10%纯外部,剩下68%都是混合路线。
结论:看不见Agent在干什么,就谈不上信任它。
05
规模一大,问题全变
交互量小的Agent,头号挑战是成本,占37%到40%;交互量超过1万次的Agent,延迟立刻顶上来,占比35%,可靠性也成了主角。
小规模跑得好,不代表放量后还跑得动。所以未来一年,62%的团队把头号投资放在可观测性和评估上,57%打算微调定制模型,56%要压幻觉。
结论:Agent越深入业务,地基越拖后腿。
06
出路不在更强的模型,在人
调查给出的方向很朴素:让Agent变好,跟带人是一个道理,靠反馈、纠错和问责,而不是每几个月推翻重训。
受监管行业42%的企业计划给Agent加审批、复核、审查行为这类管理功能,不受监管的只有16%。
当Agent开始扛更多责任,把人的审批嵌进流程不是退步,是它安全长大的前提。
结论:人和流程,才是Agent能不能成事的答案。
07
变化速度
有人会说,这是2025年8月的调查,2026年AI变化这么快,结论还成立吗?
一句话:变化越快,底座越晃——技术栈每季度重建、评估靠自建、可观测性缺失,这些结构性问题一年时间改变不了,只会随迭代加速更突出,Agent离成熟只会更远。
08
国内的情况怎样?
虽然调查数据都来自海外,但国内情况只能说更不乐观。因为压根还没想到这些评价标准,就不要提改进了。
轰轰烈烈的Agent demo,只能说明与事实完全相反。
写在最后
押注今年就是Agent元年,大概率押错了。明年、后年是不是,现在也看不出来。
2026年不会以"Agent之年"被记住。95%的项目还在试错,落地的5%还在频繁换底座、补可观测性、建审批流程。
判断Agent成没成年,不看谁喊得响,看它能不能在真实业务里稳定、可控、透明地跑起来。
这一年,是打地基的一年,不是狂欢的一年。

