大数跨境

一半企业的AI智能体,通过了测试却在客户面前翻车

一半企业的AI智能体,通过了测试却在客户面前翻车 响指HaiSnap
2026-07-20
6
导读:智能体拿到的权限,已经跑在了企业验证能力的前面。
本期推文说明:本文全部由响指 Haisnap 中的三个 Skill 协同完成,包括「生成深度研究分析V2」「公众号文章写作」「公众号内容创作助手」。从资料整理、逻辑分析到公众号成文与排版优化,均由响指完成。
Research · VB Pulse · 2026

一半企业的AI智能体,通过了测试却在客户面前翻车

评估鸿沟:当自主权扩张跑赢验证能力
VentureBeat 调查 · 157 家百人以上规模企业交叉比对 Gartner、MIT NANDA、NIST、Fiddler AI 多方研究,本文约 3200 字 · 阅读时间约 8 分钟

你以为企业部署AI智能体翻车,是因为没做测试。

其实恰恰相反:车祸都发生在通过测试之后。

2026年7月,VentureBeat 发布的一项覆盖157家企业的调查,揭开了一组极具张力的数据:过去一年,50% 的企业部署过通过内部评估、却仍在客户面前出故障的AI智能体,其中四分之一不止翻车一次。

更扎心的是另外两个数字。表示完全信任自动化评估的企业,只有 5%。但已经允许、或计划在未来12个月内实现无人工审核生产部署的企业,高达 66%

翻译成人话:绝大多数企业都知道自己的"考卷"测不准,但还是决定让AI直接上岗,不设监考。

这不是某家公司的技术事故,而是整个行业进入了一个新阶段——智能体拿到的权限,已经跑在了企业验证能力的前面。业内给它起了个名字:评估鸿沟(Evaluation Gap)。


01 Core Data

四个数字,拼出一个行业悖论

50%
企业部署过"通过评估仍在客户侧翻车"的智能体,四分之一不止一次
5%
仅有这个比例的企业完全信任自动化评估
66%
已允许或计划一年内实现无人工审核的生产部署
54%
企业已发生过AI智能体安全事件,多数仍允许智能体共享凭据

如果说这组数据还可能有幸存者偏差,那第三方研究给出的画面只会更冷峻。

Fiddler AI 汇总的研究显示,AI智能体在真实生产环境中的任务失败率介于 70%~95%。在 WebArena 基准上,最强的 GPT-4 级智能体端到端任务成功率只有 14.41%,而人类是 78.24%。

还有一个更隐蔽的指标:一致性。同一个智能体,单次运行成功率60%,但在连续8次运行的严格口径下,骤降到 25%

"能通过一次"和"每次都能通过",是两个完全不同的命题。

最反直觉的是规模效应:员工2500人以上的大企业,推进零人工部署的比例是70%,高于中小企业的64%;但它们的智能体导致客户故障的比例也更高——54%对48%。资源更充裕、流程更规范的大公司,反而翻车更多。

这说明评估鸿沟不是"能力不足"的问题,而是自动化野心与验证基础设施之间的结构性错配。Gartner 的判断是:到2028年,40%的企业AI失败将归因于智能体系统评估与监控的不足,而不是模型能力的缺口。


02 Root Cause

传统测试的三大公理,在智能体上全部失效

为什么测试测不准?因为传统软件测试站在三个公理之上:相同输入产生相同输出、结果非对即错、系统行为不会自己变。而LLM驱动的智能体,把这三条全部踩碎了。

  • 确定性假设失效。同一个提示词跑十次,可能得到十个不同结果。智能体还会自主选择行动路径:它可能检索到正确的账户却更新了错误的字段,可能连续成功调用五个工具、却在第六步泄露敏感信息。每一步单独看都"貌似合理",整体却抵达错误终点——这类路径依赖型故障,静态测试用例根本无法枚举。
  • 二元正确性失效。智能体的输出存在于质量光谱上:一份研究摘要可能90%准确但漏掉一个关键信源,一段代码可能功能正确但架构糟糕。对客户侧业务来说,偶尔产出卓越答案、下一次却不可预测地失败的系统,仍然不可接受。
  • 静态行为假设失效。模型供应商会在不发布详细行为差异文档的情况下更新模型——研究显示 GPT-4 在2023年3月至6月间,同一基准上的准确率从97%掉到87%。工具API变更、用户输入分布漂移,同样会静默改变智能体的行为。你昨天测过的,不等于今天还成立。

多智能体系统还有一个"误差复利"效应:如果单个智能体的成功率是70%,三个智能体串联,链路成功率只剩约 34%(0.7的三次方)。故障不是相加,是相乘。这解释了为什么越复杂的智能体编排,在生产环境里越脆弱。


03 The Paradox

明知评估不可信,为什么还要拆掉人工审核

5%的信任度和66%的自动化意愿并存,看起来像集体非理性。但拆开看,这其实是一场"理性的冒险",背后有三重力量。

第一重,是绕不开的经济账。人工审核无法在数百万次低后果决策上规模化——如果每个智能体动作都要人批准,自动化的经济价值直接归零。从业者调查显示,73%的团队构建智能体的首要动因是提升生产力,而"改善运营稳定性"是最少被选的选项。收益指标进KPI,风险指标往往不进。

第二重,是"落后即出局"的竞争叙事。全球AI智能体市场2025年规模约80.3亿美元,预计2034年达到2513.8亿美元,年复合增长率46.61%。在这种叙事下,部署速度本身成了战略目标,验证基础设施被降格为"之后再补"的技术债。

第三重,也是最隐蔽的一重:风险感知的滞后回路。调查里有个耐人寻味的细节——在已经着手构建治理型上下文层的企业中,78%报告过"自信但错误"的故障;而在没有任何构建计划的企业中,这个比例只有20%。

表面看,后者更安全。

实质是后者还没被烧伤,也还没建立起"发现这类故障"的观测能力。"没出过事",很可能只是"没看见出事"。

这形成一个危险的组织学习回路:只有事故本身才能触发投入,而在事故到来之前,评估投资在预算竞争中永远弱势。Gartner 预测,超过 40% 的 agentic AI 项目将在2027年底前因成本攀升、商业价值不明或风险控制不足而被取消——正是这一回路在项目组合层面的宏观投影。


04 Industry Response

行业的解法:从"刷分"转向"全生命周期评估"

好消息是,行业没有装睡。解法正在从"更好的基准分数"转向"全生命周期的评估基础设施",实践者社区已经收敛出一个四层评估栈:

L1
部署前能力基准 —— 50到100个按难度分层的场景,参考答案必须经领域专家人工校验,而不是让另一个LLM来出题打分
L2
集成测试 —— 重点验证智能体间交接保真度、工具错误处理、上下文传播。大量故障发生在智能体的边界,而非智能体内部
L3
生产监控 —— 任务完成率、人工干预率、幻觉率、越权行为率。其中人工干预率的持续攀升,是重大故障最有预测力的领先指标
L4
持续人工反馈回路 —— 抽样评审、盲测A/B、升级案例聚类分析,让每一次生产事故都变成永久性回归测试用例

方法论上还有一个反常识的共识:用LLM当裁判打分时,配备详细评分细则的评分与专家判断的相关性可达 0.85~0.92,没有细则时降到0.60~0.75。评分细则比裁判模型更重要。

数据基础设施层面,"治理型上下文层"成了供应商竞赛的新焦点:微软、Snowflake、Oracle、AWS、谷歌各押一条路线。57%的企业计划在未来12个月内更换或新增检索/上下文平台,而在被"自信错误"反复烧伤过的企业中,这个比例高达81%——采购决策,正集中发生在挨过打的企业身上。

治理框架层面,OWASP 把"过度代理"列入LLM应用十大风险,拆成过度功能、过度权限、过度自主三个根因;NIST 则明确要求:受控环境中的测量结果无法干净迁移到部署环境,现场测试与部署后监控必须成为标配。


05 Counterpoints

先泼三盆冷水:这组数据该打几折

说实话,这份调查本身也得接受评估。

第一盆冷水:样本是自选的。157家企业是自愿填写问卷,不是概率抽样——遭遇过故障的技术负责人更有动力吐槽,50%的故障率可能存在高估。调查方自己也承认:"结论应作方向性解读,而非精确值。"

第二盆冷水:媒体调查有传播导向。"50%翻车""仅5%信任"这类高对比度数字自带流量属性,读者需要意识到商业媒体调查与学术研究在激励结构上的差异。而且"客户侧故障"缺乏严格定义,从措辞不当的邮件到错误的退款操作都可能被计入。

第三盆冷水:评估本身也可能被高估。有实践者指出,生产环境中多数故障来自系统级问题——API超时、状态漂移、权限配置——而不是模型质量。就算建成完美的模型评估体系,仍拦不住大部分生产故障。把预算全押在评估工具上,可能是又一轮供应商叙事。

但即便把折扣打足,评估鸿沟的存在性结论依然稳健。主流观点的落点也不是"要不要移除人工审核",而是"按什么顺序、拿什么证据来移除"——零人工运行应当由持续的一致性证据授予,并由故障后果的严重度设定边界。


06 Verdict

自主权应按风险授予,而不是按野心扩张

把事实层、因果层摆在一起,可以给出四条能落地的判断:

  • 按后果分级授予自主权。起草内部摘要、文档分类这类低风险动作,可以给更宽的自主边界;金融交易、客户通信、代码部署、权限变更、数据删除,必须绑定更严格的阈值、一致性测试、回滚机制和人工升级路径。高风险场景的默认架构应该是"共同笔"模式:置信度低于阈值,立刻路由给人。
  • 把可重复性升格为一级指标。同一场景多次运行、变换措辞、注入工具故障,看业务结果是否依然正确。用"八连跑成功率"而不是"单次最佳成绩"作为放行标准。
  • 让每次事故变成资产。客户升级、失败的工具调用、错误的审批,都应沉淀为部署前回归套件的永久用例,而不是停留在客服工单里。同时锁定模型版本、用影子测试验证新版本、保持分钟级回滚能力。
  • 在预算上承认"改装周期"。评估、身份、上下文、编排四类控制层的投入,应与智能体部署预算同步规划,而不是等第一次客户侧事故来倒逼。控制层缺位的项目,大概率就是Gartner预言里"2027年底前被取消的那40%"。

拉远了看,这场评估鸿沟只是技术采纳史的又一次重演:能力扩散快于制度建设,收益前置而风险后置。

但这一次有个本质区别——AI智能体把决策权本身交给了机器。

移除人类并不消除不确定性,只是把不确定性转换成了自动执行的生产决策。

—— VentureBeat,评估鸿沟调查报告

未来12到24个月,评估基础设施能不能追上自主权扩张的速度,将决定这轮 agentic AI 浪潮,最终沉淀为生产力,还是沉淀为教训。

对每个正在给智能体"松绑"的团队来说,真正的问题只有一个:

你给出去的权限,有没有拿得出手的证据来配?

数据截至 2026 年 7 月 · 核心调查为自选样本,结论宜作方向性参考
     本文由响指 Haisnap 生成 · 不构成投资、法律或技术采购建议

扫描立刻下载“响指HaiSnap APP”

【声明】内容源于网络
0
0
响指HaiSnap
零代码创作者社区
内容 27
粉丝 0
响指HaiSnap 零代码创作者社区
总阅读215
粉丝0
内容27