最近,往Agent身上挂图这件事,都快成信仰了。做查询的挂结构图,做分析的先把表手工连起来;做检索的干脆把知识图谱当成外挂的记忆。连数据团队也在推语义层,话术换了个名字而已。念头都差不多,好像只要把一张图画好递过去,模型忽然就读懂了这家公司。这件事,微软和伊利诺伊大学的一篇新论文把它摆上了台面。论文叫《BI-Agent and BI-Bench》,2026年9月挂上arXiv,编号2609.20886。报告里最难看的一项,不在模型那一栏。 PART 01商业智能的考点在哪里 先看它到底在考什么,商业智能的难,从来不在最后那一步。一个分析师打开仪表盘,看见“本月收入”,他要能回答的是一串连着的账,得先把几十上百张表里相关的那几张挑出来,再把数据做变形,还要把表跟表的连接关系定下来,最后才轮到回答一个业务问题。前面这三步不解决,最后那一步无从谈起。过去这三步压在人身上,而人总有办法补上。他在这家公司待了几年,知道“收入”落在哪张表,知道算这个月的数要排掉哪些内部交易。机器则做不到这一点,它眼前只有表名和列名。论文想试的,正是把这三步也交给机器。于是从公开网页上扒下3000多份真实的Power BI工程文件,又花掉400多个人工时,从这些仪表盘里抠出100道题,配齐100份标准答案,建成第一份端到端的商业智能考卷,取名BI-Bench。成绩单贴在arXiv上,最强的o4-mini也只做到48.2%。几套在BIRD这个text-to-SQL公开榜单上排前四的开源模型,掉到6.0%到17.3%。这批题里最重的一道,要模型同时把38张表理清楚。要知道,放在各自熟悉的榜单上,这些模型动辄七十几分。而它们脚下的那些工程文件,全都有图。事实表坐中间,维度表围着它转,哪张表跟哪张表连、按哪一列连,早就画死了。图并不是没有给,是给了也还是不够用。 PART 02图没给的那一半 于是问题就摆在这儿了,明明图已经给了,它怎么还是答不上来。答案就藏在图恰好没给的那一半里面。一套图交代的是表在哪里、彼此怎么连。它交代不了“收入”这两个字该落到哪张表哪一列,也交代不了算这笔账要按哪条业务规矩去筛。前一半是结构,机器自己看得见;后一半是理解,得有人真懂这家公司才写得出来。而理解恰恰是画不进图里的,它不是连线的活,是懂行的活。举个最普通的例子,同一个词,销售系统里的“客户”指签了合同的那家公司,客服系统里的“客户”指报修过的那个人。图能把两个系统的表连起来,连不上的是,这两个“客户”根本不是一回事。这种事,机器自己琢磨不出来,得有人告诉它。微软那套BI-Agent,其实吃到了前一半的红利。它把挑表、变形、连表这几个动作封成agent手里的工具,尤其那张连接工具,专门对雪花型这种结构做全局推理,比让模型自己猜要准得多。这类工具只认这一种结构,结构还在,它就能推理;结构换了,工具得跟着重写。红利跟着结构走,结构一动,红利也就没了。但红利到头也就到这儿,结构交代得再清楚,理解那一半还是得每个任务从零猜起,猜完就扔,下一个任务从头再来一遍。真要补上理解,多派几个人手工补不就完了。可是补不上,而且拦路的还不是钱,是尺子。一家中等规模的制造企业,把本体建起来要18个月,建完每年还得拿出4到6个月维护。它要服务的那条产线,却是按周在变的。这两个时间尺子差着整整两个数量级。等你把图修好,图上画的那家厂,已经不是今天这家厂了。论文那边讲的是同一件事,只是换了词。它把语义层说成预先定义、手工维护的东西,建起来贵,还挪不动,数据源一换、任务一换、换个人来问,它就接不住。PART 03静态图的过期时间 图准不准,说到底还是次要的一件事,一张画死了的图,从画完那天起就在过期。静态图不是打一开始就错,前些年数据源就那么几个,口径几年不变,人工画一遍能用很久,谁画得全谁厉害。变的是另一头,数据源一年翻几倍,任务天天换新,人工那套跟不上,图从资产变成负债,也就是这几年的事,这笔账,做数据的人心里都有数。这两年数据圈里,语义层、上下文层、本体这三个词常被混着说。其实各有各的活,本体管的是“是什么”,语义层管的是“怎么算”,上下文层管的是“这一轮该看什么”。吵归吵,它们底下压着一个共同的假设,这三样都是一次性交付的资产,建好往那一摆,长期不管你。 PART 04撬动旧假设的新方案 人大的一篇论文想撬动的正是这个假设,它叫《EvoOntology》,也是这个月挂上arXiv的,编号2609.15779。它把病根叫作agent与数据之间的那道缝。数据住在agent外面,agent只能靠SQL接口、文件读取器这类通用工具,摸到列名和文件路径,数据究竟长什么样、是什么意思,它事先一概不知,只能一遍遍发查询去盲探。探到的还得自己记住,记不住就再探一遍。论文判断,眼下这两条路都通不到头,一条是让agent自己摸索,数据小还行,一宽一杂就陷进重复又低效的探测里;另一条就是前面那张语义图,整张塞进prompt,也就是给模型的那段提示里,既塞不下,也用不好。EvoOntology动手的地方有两处。一处是把画图这件事交给agent去做,另一处是把画好的图从prompt里搬出来,放进agent够得着的工具箱。 交付方式比内容更重要把图搬出来这一步,比听上去要紧得多。同一份语义,一个是塞进prompt当背景,一个是做成工具让agent自己去查。论文里有一组对照,塞进prompt让Claude Sonnet 5掉了15个点;做成工具挂上去,这个模型转成涨8.8分。内容一个字没改,只是交付的方式换了,方向就掉了个头。道理本身不难想,prompt是整块塞进去的,塞进去就占着地方,还跟别的指令抢注意力,这一轮用不上的部分,下一轮也删不掉。工具不一样,agent每走一步,只把当前用得上的那几个概念取回来。同一份知识,捧在手里是负担,搁在架子上随时能取,才是资产。 三层结构的自改图这套图分了三层,最底下一层定规矩,说清图里能有哪些节点、哪些边。中间一层装内容,四个类型各管一段,有概念本身,有概念对应的字段和连接路径,有使用上的约束,还有每次探查留下的证据;两种边把概念跟概念、概念跟证据各自挂起来。最上面一层负责对外,把整张图做成两个工具,用MCP这套通用接口挂出去,一个按查询找出相关节点,另一个把跟它相关的一整片内容取回来。这张图不是人一条条画上去的,是系统自己改出来的。一个专门负责建图的agent,先读一批训练任务,提出候选概念,再对真实数据发探查查询去验证,验不上的不要,过了的才收进初始那张图。这之后,循环接着转,从走过的轨迹里找出失败的样子,把问题归到三层里的某一层,只改那一层,改完还得过一道门。 最关键的一道门这道门是整篇论文里最值得记的一笔。候选的新版本,要和上一版在留出来没训过的那批题上,用同样的生成条件比,涨不过事先划的那条线,就退回,被否掉的方案还留档,免得下一轮再撞一次。把这四步一样样拿掉再测,掉得最狠的就是这道门,11.2分。原因也直白,不设门,系统会把改坏的那一版也一起收进来,而下一轮不一定补得回来。让图自己改的前提,是先学会自己否掉改坏的那一版。难的地方还在改哪儿,系统发现效果变差,先得判断是内容错了、工具不好使,还是这张图的规矩本身就容不下。归错层,就会在内容出问题的时候去改规矩,越改越乱。论文的办法是三层各留一条改法,一次只动一层,改动才比得了,也退得回。PART 05效果和边界 涨的分数是实打实的,而且涨得还不算小。在DDR-Bench这个多源数据研究的测试集上,六个模型全线往上,平均加17.8分,GPT-5.5从74跳到90.9。这套方案另外还跟一种做法比过,把做过的任务存下来、下次照着回放,也能涨,但只涨6.3分;换成这套图,涨20分。区别在于,存下来的是一条条具体经历,图存的是拆开的概念和关系。经历只能照着抄,概念能拿去拼新的,碰上没做过的任务,前者就没辙了。在BIRD上,把知识库先给足,执行准确率和查询效率两个数一起动,双双往上7.4和8.6,说明它不只让答案更对,也让查询跑得更省。省这件事上,其实还另有一笔账要算清楚。前面微软那套BI-Agent,把模型后训练一轮,小模型就能把整套BI-Bench跑完,只花0.19美元,论文说比大模型便宜54倍,拿到答案的门槛一下降了下来。但先别急着把它当成一剂万能药来用。别处的评述还提到一条边界,收益集中在又宽又乱的数据上,短的分析任务,提升缩到两个点左右。这条边界,比它涨了多少分更值得记住。数据源窄、任务短,这套东西带来的好处有限,先量再上,别听人一鼓吹就冲进去。 PART 06企业判断的朴素标准 对企业来说,这事有一条很朴素的判断标准。先问自己一句,你们家的数据到底多久变一次。变得越勤、来源越杂,人工维护的语义层就越像一笔亏本买卖,自动化那一侧才开始划算。反过来,一套几年不动、就那么几张表的账,人工建好一劳永逸,没必要上这套东西。真正该问的是,这张图上一次更新是什么时候,又是谁在负责更新。这两问答不上来,图再全也只能是个摆设。图也不是越细越好,节点太密,agent每次查都要先挑一遍,又成了新的负担;太疏,又接不住任务。论文里那四个类型的分法,其实给出了一个能落地的粗细刻度,这尺子不是拍脑袋拍的,是从实打实的失败轨迹里量出来的。要是没人管它更不更新,图就只是墙上挂着的一张画,好看,却不顶用。回头看,图会被当成一种信仰,是因为大家默认图越全越好。真正卡住人的地方,不在图全不全,在谁负责让图跟上变化。会自己改的图,比画得最全的那张值钱;而要让它能自己改,先得让它学会否掉自己改坏的那一版。