大数跨境

从 BI 到 Agentic BI:让数据应用从展示走向受控行动

从 BI 到 Agentic BI:让数据应用从展示走向受控行动 DataFunSummit
2026-09-27
6
导读:商渭清 安克创新 数据负责人

导读本文以安克创新数据负责人商渭清的演讲为核心,围绕"从 BI 到Agentic BI"的主题,系统阐述面向 AI Agent 的第三代数据平台建设理念与实践路径。文章首先从企业文化变革切入,说明 AI 驱动的组织基础如何为数据平台转型提供前提条件;继而梳理从静态 HTML 到动态数据应用的技术演进脉络;随后深入分析 BI 的三代演进逻辑,重点阐释 Agentic BI 的核心交付物变化;在此基础上,剖析 Agent 面临的数据可用性挑战,提出"数据专辑"这一面向 Agent 的语义治理方案;最后介绍 DOM(Data Object Management)的整体架构定位与三代数据平台的演进方向。

全文目录:

1. 引言:AI 驱动的企业文化变革与组织基础

2. 从 HTML 到数据应用:技术载体的三级跃迁

3. BI 的三代演进:从"看数据"到"受控行动"

4. Agent 面临的核心挑战:数据可用性的三个层次

5. 数据专辑:面向 Agent 的业务语义治理方案

6. 行动信任升级:从只读查询到受控执行

7. DOM:面向人与 Agent 的企业级数据与知识底座

8. 三代数据平台的演进逻辑与核心洞察

01

引言:AI 驱动的企业文化变革与组织基础

数据平台的建设从来不是纯粹的技术命题,其根基深植于组织的文化土壤与能力结构之中。安克创新在这一领域的实践,始于一次自上而下的文化变革。

自 2024 年底起,公司明确要求:禁止手写完整的技术方案或产品方案。所有正式文档的产出必须借助 AI 工具完成。这一制度并非简单的工具替换,而是对组织工作方式的根本性重塑——AI 不再是被动的辅助工具,而是主动参与思考过程的协作者。

在技术社区围绕 Markdown 与 HTML 格式适用性的讨论中,安克创新形成了清晰的判断:HTML 格式在交互体验与结构化表达方面具备显著优势。当 AI 生成一份实验报告时,它能够从实验设计、执行过程、问题分析到改进建议形成完整链条,输出可能涵盖十个结构化要点,而人工撰写通常仅能覆盖四五个维度。这种数量级的差异,正是 AI 驱动结构化思考能力的直观体现。这一认知构成了后续数据平台建设的基础前提。

在组织能力层面,安克创新要求所有新入职员工——无论岗位是研发、销售还是客服——必须通过内部 AI 工具使用考试方可入职。公司使用的 AI 编程工具为内部自研产品,所有员工日常工作中均需使用该工具。当 HTML 编写被视为"写代码"的一种形式时,全员 AI 化的直接结果便是:组织中的每一个成员都具备了生成前端页面的能力。这一能力基础为数据平台的架构设计提供了全新的可能性——不再需要依赖专业的 BI 工程师来构建可视化看板,业务人员自身即可通过 AI 工具生成所需的数据展示页面。

这种组织能力的变化,直接改变了对数据产品的容忍度与期望值。在传统模式下,管理者往往对 BI 界面的样式细节有极高要求。而在 AI 驱动的工作模式下,管理者的关注点从"形式完美"转向"思想表达清晰",只要数据呈现对人类友好、逻辑结构完整,即可满足决策需求。这一认知转变为后续的技术架构选择奠定了文化基础。

02

从 HTML 到数据应用:技术载体的三级跃迁

安克创新的数据应用演进遵循一条清晰的路径:Launch HTML → Launch BI → Launch App。这三级跃迁的核心逻辑并非页面变得越来越复杂,而是页面与数据、业务、行动之间的连接逐步深化。

第一级:Launch HTML:静态只读。 聚焦于稳定交付、安全访问与便捷分享。AI 生成的 HTML 页面作为静态内容载体,具备完整的布局、视觉层级与基础交互性。在这一阶段,Markdown 适合表达与生成内容(Content),而 HTML 则提供真正的应用体验(Experience)。AI 极大地降低了内容生成成本,但 Markdown 仅是内容源稿,缺乏交互设计;HTML 则赋予内容以布局、视觉层级与交互性,让用户真正"使用"一个系统。

第二级:Launch BI:动态只读。 让静态内容转为响应真实业务状态的实时图表。传统报表的核心功能模块——数据源连接、数据建模、可视化画布、可视化组件、预览发布——本质上可以通过低代码方式实现。但当全员具备 AI 辅助编程能力后,这些功能模块可以被解构为 SDK 化的服务能力,由 AI 在生成 HTML 时自动嵌入。

第三级:Launch App:动态读写。 托管支持复杂交互与事务读写的全功能业务系统。页面不再仅仅是数据的展示窗口,而是成为业务操作的入口,具备写入、修改、触发流程的能力。

这三级跃迁的核心演进逻辑可以概括为:不是页面变得更复杂,而是页面连接了数据,数据具备了业务意义,系统开始承担行动责任。

03

BI 的三代演进:从"看数据"到"受控行动"

在数据应用领域,BI 经历了三代显著的范式跃迁,每一代的核心交付物发生了根本性变化。

第一代:传统 BI——看数据(View)。 核心交付物是数据视图。用户通过人工观察与解读已加工的静态仪表盘获取信息。分析师预先定义指标、设计报表,业务人员被动消费。

第二代:ChatBI——问数据(Query)。 核心交付物是交互式查询结果。用户通过自然语言交互生成 SQL 或特定图表,降低了数据获取的门槛。然而,必须清醒认识到:换成聊天框依然未跨越 BI 的边界。ChatBI 本质上仍是"查询-展示"模式的变体,并未触及业务行动层面。破除幻觉的关键在于认识到,交互形式的改变不等于能力边界的突破。

第三代:Agentic BI——理解场景(Context)到受控行动(Action)。 核心交付物是受控行动与效果反馈。Agentic BI 围绕业务目标持续工作,能够选择正确知识、提出计划,并在权限与事务边界内协调执行。这标志着数据应用从"展示"走向"行动"的根本性转变。

传统 BI 交付的是"数据视图",Agentic BI 交付的是"受控行动与效果反馈"。这一核心交付物的转移,是区分两代系统的根本标志。

04

Agent 面临的核心挑战:数据可用性的三个层次

当数据应用进入 Agentic 阶段,一个根本性的架构拷问浮现:页面连接了数据库,是否等于理解业务?Agent 能直接查表,是否等于能正确使用数据?

答案是否定的。数据可用性存在三个递进的层次:

Level 1:技术上能访问(Technical Access)。 这是最基础的层次,解决的是"能否连接到数据"的问题。传统的数据库连接、API 调用均属于此层次。

Level 2:业务上能被正确理解(Business Comprehension)。 这一层次涉及数据口径、业务语义的理解。例如:销售数据的范围是按门店物理位置还是销售组织划分?口径是订单金额还是确认收入?退货订单是否已从底层扣除?这些问题的答案不存在于 Schema 本身——Schema 仅包含字段名称与数据类型,不包含业务语义。

Level 3:具体场景中能被正确使用(Scenario Application)。 这一层次涉及权限控制与行动边界。例如:当前触发用户能否查看渠道级明细?如果确认缺货,允许系统触发哪些补救动作?这些是场景化的治理问题。

Agent 面临的不仅是模型能力问题,更是业务语义缺失问题。结论明确:Schema 本身不包含业务语义。这是当前 Agent 在数据应用领域最大的痛点。

05

数据专辑:面向 Agent 的业务语义治理方案

针对上述挑战,安克创新提出了"数据专辑"(Data Album)的概念。其核心价值在于:让权威资产从"可被找到",变成"可被 Agent 正确使用"。

数据专辑的构成要素包括五个维度:

  • 场景边界(Scenario Boundary): 明确定义该专辑适用的业务场景范围与约束条件。

  • 权威资产引用(Authoritative Asset Pointers): 指向企业核心数据表、预定义治理指标、权威知识库与文档。

  • 场景语义补充(Semantic Context): 为原始数据 Schema 补充业务含义、口径定义、计算逻辑等语义信息。

  • 策略与权限引用(Policy References): 定义数据访问的权限规则与行动边界。

  • 评测基线(Eval Baselines): 为 Agent 的表现提供可量化的评估标准。

数据专辑的设计遵循严格的边界红线:

  • 不复制事实数据: 不创造第二套语义源头或权限源。真实读写必须由服务端重新鉴权。

  • 不是流程编排系统: 专注为 Agent 提供上下文,读写动作必须由受治理的底层 API 真正执行。

对数据专辑的本质定位可以概括为:数据专辑不是给模型准备的一摞资料,而是给数据智能体准备的一间业务工作室。Agent 进来之后,不是自由发挥,而是在被安全护航的环境中,按照预定义的规则与知识开展工作。其目标是让问数智能体从"会生成盲盒 SQL"升级为"会选择最正确、最稳妥的数据访问路径"。

在具体的数据访问路径设计上,安克创新建立了五级优先级降级机制:

  • 经营分析 API 首选命中(最高优先级)

  • 结构化指标(Metric DSL)确定性计算

  • 已验证查询服务(Verified Services)

  • 验证级查询样例(Verified Examples)

  • Text2SQL 只读兜底(必须经过严格权限与 SQL Explain 审核)

这一设计确保了 Agent 在数据访问时始终优先选择最可靠、最可控的路径,仅在必要时才降级到灵活性最高但风险也最大的 Text2SQL 方案。

06

行动信任升级:从只读查询到受控执行

Agentic BI的核心突破在于从"回答问题"(Read-only)走向"受控行动"(Action)。这一转变必须建立在严格的信任升级机制之上。

行动信任分为三个层级:

  • 低风险:自动执行(Auto-Action)。 经过充分验证的低风险操作可由 Agent 自主完成。

  • 中风险:人工确认(Human-in-the-loop)。 需要人工审核确认后方可执行的操作。

  • 高风险:工单转交(Ticket Handoff)。 超出 Agent 权限范围的高风险操作转交人工处理。

与行动信任升级对应的是知识的信任升级。核心原则是:没有权威认证的上下文只是资料;有认证的上下文,才能成为智能体的行动依据。知识必须经过"可校验的结构化"处理,并通过反复纠错使用与持续自学习的闭环,才能成为可靠的行动依据。可检索文本(Docs)仅是知识的基础形态,唯有经过验证的结构化知识(Structured & Verified)才具备驱动行动的资格。

07

DOM:面向人与 Agent 的企业级数据与知识底座

在整体架构层面,安克创新提出了 DOM(Data Obiect Management)的概念,将其定位为面向人与 Agent 的企业级数据与知识底座。

DOM 的架构包含四个核心层次:

  • 应用端(Applications)与智能体(Agents): 作为消费层,通过标准化接口调用底层能力。

  • 知识资产(Knowledge Base): 提供业务语义、治理规则、场景上下文等知识服务。

  • 数据资产(Data Assets)与预定义指标(MetricSpec): 提供经过治理的权威数据与标准化指标定义。

  • 治理服务(Governance Services): 提供权限控制、审计追踪、质量监控等基础治理能力。

DOM 存在的根本原因在于:场景语义绝对不能靠 Prompt 临时编造,也不能任由每个独立 Agent 各自维护。数据口径必须建立在企业已有的权威资产之上。

DOM 的边界红线同样明确:DOM 不负责创建 Agent,也不是通用工作流平台。当前阶段优先通过 API 与预定义 MetricSpec 消费,严禁临时捏造非正式口径。

08

三代数据平台的演进逻辑与核心洞察

从更宏观的视角审视,数据平台经历了三代演进:

第一代:数据供给平台。 关键能力为数仓、数据湖、ETL、计算引擎。核心问题是"数据有没有?能不能算出来?"

第二代:人类消费平台。 关键能力为指标体系、语义层、BI、自助分析。核心问题是"人类能不能理解和使用数据?"

第三代:Agent-Ready 平台。 关键能力为数据与知识深度融合、受控调用、系统评测体系。核心问题是"Agent 能不能可靠地寻址、理解、调用和被治理?"

对此,商渭清提出了一个关键洞察:第三代绝非推翻前两代,而是深度叠加。如果底层的第一、第二代平台在数据质量、口径和权限上存在缺陷,直接引入大模型只会让错误以光速传播。这一判断对行业实践具有重要的警示意义——在追求 Agentic BI 的先进性之前,必须首先确保数据基础设施的可靠性。

需要强调的是,此三代划分是本次架构演进的观察框架,并非行业强制的代际标准。

09

总结

从安克创新的实践中,可以提炼出面向 Agent 的第三代数据平台建设的核心逻辑:

第一,文化先行。AI 驱动的数据平台建设,其前提是组织文化的根本性变革——从"人写文档"到"AI 驱动思考",从"专业分工"到"全员 AI 化"。

第二,载体演进。从静态 HTML 到动态数据连接再到受控读写,技术载体的演进本质上反映了数据应用从"展示"到"行动"的价值跃迁。

第三,语义治理。Agent 的核心瓶颈不是模型能力,而是业务语义的缺失。数据专辑作为面向 Agent 的语义治理方案,其价值在于将散落的业务知识结构化、权威化、可校验化。

第四,信任分级。从只读查询到受控行动,必须建立严格的信任升级机制,确保 Agent 的每一步行动都在可控范围内。

第五,叠加而非颠覆。第三代数据平台是对前两代的深度叠加,而非替代。底层数据基础设施的质量,决定了上层AI应用的上限。

10

问答环节

Q1:为什么安克创新将 HTML 而非 Markdown 作为数据可视化的核心输出格式?

A:这一选择基于三方面考量。第一,HTML 具备完整的交互能力,支持动态筛选、图表联动等复杂交互,而 Markdown 仅适合静态内容表达。第二,HTML 的结构化表达能力更强,能够承载多层次的信息架构,适配 AI 生成的结构化分析成果。第三,HTML 赋予内容以布局、视觉层级与交互性,让用户真正"使用"一个系统,而非仅仅"阅读"一段文本。Markdown 是内容源稿,HTML 是应用体验。

Q2:ChatBI 与 Agentic BI 的本质区别是什么?

A:两者的核心区别在于交付物的根本性变化。ChatBI 的交付物仍是"查询结果"——用户提问,系统返回数据或图表,本质上仍是"查询-展示"模式的变体,只是交互形式从拖拽变为自然语言。Agentic BI 的交付物是"受控行动与效果反馈"——系统不仅理解数据,还能理解业务场景,在权限与事务边界内协调执行具体行动。换成聊天框并不等于跨越了 BI 的边界,这是需要破除的幻觉。

Q3:数据专辑与传统的语义层(Semantic Layer)有何区别?

A:传统语义层主要解决"指标定义统一"的问题,面向的是人类分析师的理解需求。数据专辑则面向 Agent 的使用需求,除指标定义外,还包含场景边界、权限策略、行动约束、评测基线等维度。其核心差异在于:传统语义层让"人能找到正确的指标",数据专辑让"Agent 能在正确的边界内采取正确的行动"。数据专辑不是给模型准备的一摞资料,而是给数据智能体准备的一间业务工作室。

Q4:如何理解"第三代绝非推翻前两代,而是深度叠加"这一判断?

A:第三代 Agent-Ready 平台的能力建立在第一代(数据供给)和第二代(人类消费)平台的基础之上。如果底层数据仓库存在数据质量问题、指标口径不一致、权限体系不健全等缺陷,引入大模型和 Agent 只会将这些错误以更快的速度、更广的范围传播。因此,第三代建设的前提是第一、第二代基础设施的扎实可靠。这不是技术路线的选择问题,而是工程实践的先后顺序问题。

Q5:五级数据访问路径的降级机制如何保障数据安全?

A:该机制通过优先级排序确保Agent始终优先使用最可控的数据访问方式。经营分析 API 和结构化指标(Metric DSL)经过充分验证,输出确定性最高;已验证查询服务和查询样例次之;Text2SQL 作为最后兜底方案,必须经过严格的权限校验与语法审核。这种设计将风险最高的自由文本生成 SQL 限制在最小使用范围内,同时为 Agent 提供了明确的"最优路径优先"原则,避免其在高风险路径上自由发挥。

以上就是本次分享的内容,谢谢大家。

往期推荐


百家企业语义建设思考:下一站是业务本体,AI从“秀操作”到“跑通业务”

OpenAI发现Agent会给“下一任自己”留后门:Compaction成了新攻击面

MemoHarness来了:Agent的下一次进化,开始发生在模型之外

AI FDE+本体平台,百度让Agent接管企业核心工作流

智能体架构与实践:构建下一代推荐与搜索系统

从写代码,到构建产品:AI Agent 正在改变 Builder 的工作流

Palantir CEO:AI时代,不做“有”的企业,就等着被掏空

京东健康:放弃RAG后,AI交付从“大概率”走向“确定性地对”

从分析闭环到行动闭环:Data Agent 的边界突破

阿里开源 3.5 万 Star 项目:生产级 Agent 开始主动“收权”

【声明】内容源于网络
0
0
DataFunSummit
DataFun社区旗下账号,专注于分享大数据、人工智能领域行业峰会信息和嘉宾演讲内容,定期提供资料合集下载。
内容 1394
粉丝 0
DataFunSummit 北京鸿润嘉诚企业管理咨询有限公司 DataFun社区旗下账号,专注于分享大数据、人工智能领域行业峰会信息和嘉宾演讲内容,定期提供资料合集下载。
总阅读50.7k
粉丝0
内容1.4k