本月早些时候,业界对Anthropic一篇题为《Anthropic如何用Claude实现自助式数据分析》博文印象深刻。虽然发布时机出人意料,但内容并不令人意外。其中的关键内容是:没有人类技能加持的情况下,Claude准确回答分析问题的能力不超过21%。添加技能后,这些数字总体上持续超过95%。
如果这是Anthropic在自家数据上运行AI得到的结果,那么其他所有企业AI领导者看到的又是什么呢?根据博文发布后的反应和对话,业内许多人将Anthropic的发现视为一记警钟。但更重要的教训不在于人类技能,而在于上下文。
讨论很快从Anthropic的具体实现扩展到一个更广泛的问题:AI需要多少业务上下文才能在企业内部可靠运行?答案越来越明确——比许多组织意识到的要多。
语义层(semantic layer)为AI系统提供了对企业数据含义的共识性理解。将原始数据转化为每个系统都认同的、受治理的业务定义,正成为一个关键步骤——不仅关乎准确性,更关乎可被规模化信任的AI。
Anthropic并非个例。最近的Harris Poll研究发现,55%的技术决策者有时会亲自纠正或反驳AI输出。另有89%的人表示,在底层数据得到信任和验证之前,他们无法对AI洞察完全有信心。
这就是“幻觉税”(hallucination tax):当AI系统在缺乏可信上下文的情况下运行时,所需的人工监督、验证、返工和风险管理所产生的隐性成本。每当员工必须验证一个答案、纠正一项输出,或对一条建议心存疑虑时,组织就在支付这笔“税款”。
而治理问题并非新事物。企业多年来一直在努力建立干净、准确、无偏见的数据,大多数仍在为此努力。随着AI智能体(AI agents)更深地进入企业核心工作流,风险要高得多。这些智能体不再只是搜索答案,它们正在采取行动——而当它们所依赖的数据未受治理时,就会推动错误的决策。到了那个地步,准确性就不再只是一个技术指标,而是一种业务风险,而企业正在为此付出代价。
Gartner的研究凸显了这一差距。实施分类法(taxonomies)和本体论(ontologies)等语义建模方法的组织,在支持AI用例的数据工程实践中实现高效能的可能性高达2.2倍。然而,仅有40%的组织实施了这些方法。
对于技术领导者来说,有三个优先事项值得立即关注:
治理含义,而非仅仅治理存储:企业AI的瓶颈不在于数据存储,而在于业务含义。当原始数据缺乏统一定义时,每个AI系统都会以不同方式解读它。共享语义层创造了共识性理解,让人类和AI能在同一上下文中运作。随着组织部署更多AI系统和智能体,这一基础变得日益重要。
将数据质量视为AI基础设施:数据质量一直是AI信任的前提,但大多数企业仍将其视为一个勾选框,而非核心基础设施。这行不通了。坏数据不再只是产生错误答案——随着AI智能体从回答问题转向采取行动,坏数据会产生错误行动。
在你的智能体行动之前关闭问责缺口:当AI从回答问题转向采取行动时,未受治理的数据就不再是准确性问题,而变成了责任问题。治理必须从一开始就内置,而不是在部署过程中事后补救。否则,幻觉税将不可避免。
成功运用AI的组织未必是那些能获得最好模型的组织。这些模型正越来越普及。差异将在于信任——为AI提供准确、受治理的上下文的能力,在业务条件变化时维护该上下文的能力,以及确保自主系统在既定护栏内运行的能力。
Anthropic的博文提供了一个有益的提醒:更好的模型本身并不能解决企业AI的挑战。随着AI智能体嵌入日常运营,对话必须从模型性能转向运营信任。率先降低幻觉税的组织,将最有能力获取AI的全部价值。

