导读工业 Agent 真正进入生产流程后,问题不只是“能不能回答”,而是答案有没有统一口径、能不能回到真实数据、跨智能体协同时语义会不会变化,以及知识更新后旧结论能否被及时识别。围绕这些问题,这套实践把本体作为工业 Agent 的“语义罗盘”,为检索、生成、协同和执行提供一套可校验、可追溯的语义底座。本文据 2026 年 7 月 25 日 Agentic AI Summit 深圳站现场演讲整理,配图取自现场终稿。
1. 先解决语义漂移,再谈 Agent 上产线
2. 什么是本体:定义、口径与证据
3.半自动构建:机器提议、数据裁决、标准把关、人工定夺
4. 本体增强 RAG:让答案从“像样”变成可检查
5. 可信不是模型属性,而是系统属性
分享嘉宾|余锦泽 博士 卡奥斯工业智能首席科学家
出品社区|DataFun
先解决语义漂移,再谈 Agent 上产线
制造现场从方案、AI+ 产品走向 AI 原生产品,意味着系统不再只是提供建议,而是逐步参与流程重构、决策与执行。此时,模型能力之外更关键的问题是:不同数据源、不同工具和不同 Agent 是否始终理解同一件事。把这件事没做好的后果,可以归纳成三种典型的“语义漂移”。第一是术语不通,大模型不懂工艺术语,把“直通率”当成“良率”——前者是一次合格数除以投入数、不计返修,后者包含返修件,口径张冠李戴,给出的数字也没有出处;第二是语境丢失,多智能体协同的链路越长,摘要与转述越容易损失关键条件,A 说的“工单”和 B 理解的“工单”不是一回事;第三是知识陈旧,工艺改了、文档没改,知识库悄悄过时,检索回来的是过期知识,而且很难察觉。这三件事,靠堆更大的模型解决不了。

什么是本体:定义、口径与证据
本体可以理解为给数据装上一份“机器能读的说明书”——把“这是什么、和谁有关、怎么算、能不能信”写成机器可校验的规则。展开看,它记录六类元素:对象(贴片工单、贴片机、元器件)、关系(投产、执行于、供应)、事件(贴装、焊点不良、AOI 测试)、指标(直通率、稼动率)、动作(派工、报修)和场景(SMT 贴片、AOI 检测)。它比知识图谱多三样东西:带类型,能被 schema 校验;挂口径,分子分母固定下来,跨部门不再各算各的;带证据,每条关系都标着 verified 还是 candidate,可以追溯。以“直通率”为例,这个指标归属到“产线”这个对象,计算口径写死为一次合格数除以投入数,统计维度是产线、班次、按日或按周,数据出处挂到指标汇总层的三张表,并且显式写出易混淆项——它不等于含返修的良率。把这些写死,大模型就没有自由发挥的空间。整套本体可以按 W3C 标准导出为 OWL2/RDF、SHACL 与 SKOS,随时与外部工具互操作。

同一份数据,可以有三种形态。用一个贯穿全篇的现场问题来检验:这批 PCB 焊点不良,能不能追到是哪批元器件、哪个供应商?关系数据库只管“怎么存”——四张表没有外键,跨表 JOIN 全靠人猜,这个问题答不了;知识图谱解决“怎么连”——贴片工单、贴片机、元器件、供应商这些实例连起来了,能查了,但没有类型、没有约束,查出来对不对很难校验;工业本体解决“怎么懂”——同样的节点,每个都带类型,贴片工单是对象、过站是事件、供应商是角色,直通率挂着口径,还有“元器件必须有供应商”这样的约束,于是那个问题可以沿焊点缺陷、元器件、供应商一步查到,而且带证据。一句话:关系库把关联和口径丢给人,本体把它们固化成一张可推理的图。

概念讲完,落到真实的库上看看有多难。样板场景来自某电子 SMT 产线数仓:16 张表,没有一条外键;单表 11 到 80 列;表名是 ods_、dwd_、dim_这类分层前缀加拼音缩写,注释残缺。最典型的是同一个“工单号”在六张表里有五种列名,想跨表查,得先有人记得这几个名字说的是同一件事。做法是用取值重合度代替外键,三组真实判定结果可以说明尺度:不良记录到生产工单,两万两千多个取值全部对上,重合度 100%,判 1:N 并标 verified;元器件到供应商,506 个供应商编码只对上 356 个,重合度 70.4%,同样判 1:N 但带着缺口,那 150 个查无对应的编码如实计入 gap 清单;不良记录到过站明细,重合度只有 3.4%,判定不成立,也进 gap。阈值写在流程里:重合度至少 60%,且父键近似唯一(≥0.95)、子键不唯一,才判 1:N,不达标的不建关系。这一轮共判出 12 条关系,9 条 verified、3 条 gap。于是那个追溯问题有了一条能自动走通的路径:不良记录、生产工单、元器件、供应商——本体不凭空造关系,它把开发者记忆里的 JOIN 变成一条条带重合度、可复核、也可以被否掉的判定。

有了这样一张本体,它在 Agent 系统里承担三个角色。一是引导 RAG 检索:以对象、关系、口径为锚点组织检索,追求找得准,而不是找得多。二是约束大模型输出:生成结果必须落在本体定义的边界内,口径错了直接拦截。三是共享语义中枢:多个智能体读写同一套语义,“工单”在所有 Agent 里是同一个“工单”。为什么叫“罗盘”而不叫“地图”?地图是静态的,画完就过时;罗盘是动态的——不论 Agent 走到哪个任务、哪条链路,都用它校正方向:检索时校正查询,生成时校正口径,协同时校正上下文。

这也决定了技术路线的取舍。纯 LLM 上手快、demo 惊艳,但不懂工艺术语、幻觉不可控、结论无出处,知识更新还得靠重训;纯知识图谱关系显式、可查询,但缺类型与约束、难校验、构建维护成本高,而且与大模型的生成链路是脱节的;本体增强方案把语义、约束和证据合并到同一套机制中:口径锚定真实库表,输出受本体边界约束,证据分层、可审计。这个判断不只靠讲道理——我们设计了 RAG、GraphRAG、Ontology-aware GraphRAG 三组对照实验来验证,目前处于 PoC 阶段,具体数字见后文。

半自动构建:机器提议、数据裁决、标准把关、人工定夺
进入技术方案之前,先把 2026 年上半年的六项工程突破摆出来,它们围绕两个词:可信、可用。可信侧三项:多模态反造假构建——大模型只负责提议,关系成不成立由真实数据裁决,重合度至少 60%、父键近似唯一,才给 verified;三级控制环——提议、语义评审、数据裁决三道关,专拦“共享域巧合”和“标识符错位”这两类最隐蔽的假关系;IOF/BFO 语义接地——把中文关系动词接到国际本体标准的关系上,并标注“始终成立”还是“某时成立”。可用侧三项:深度问数流式回传,本体上下文生成 SQL、带来源作答,每一步可见、可回放;对话式本体编辑,自然语言进来后走受治理的动作协议,高风险改动必须人确认;SPARQL 的健壮性与安全,标准查询、禁联邦查询、只读三重防写。这六件事共同指向一件事:把“由 Agent 决断”改成“以数据与标准为准、人工把关”。

可信的本体从哪来?方法论就四个词:机器提议、数据裁决、标准把关、人工定夺。机器提议——大模型从库表、建表代码、文档图纸里并行召回候选的对象、关系和口径,它负责广度和速度;数据裁决——每条提议用真实取值核验,过了阈值才叫 verified,数据负责判真伪;标准把关——IOF/BFO 接地、SHACL 校验,再加独立的对抗审查,标准负责互操作;人工定夺——置信分层,高置信的自动通过,低置信的和高风险的改动必须人来审,人负责最终责任。产出是每条关系都带证据、带状态,全程可回放、可审计。

这套分工不是偏好,是被现实逼出来的。全人工这条路,知识工程师加领域专家逐表梳理,千表万字段,梳理以月计;专家稀缺、成本高,难以规模化;更麻烦的是业务一变就过时,维护跟不上——质量高,但慢而贵、难复制。全自动这条路,让大模型端到端直接生成本体,可现实是无外键、命名晦涩、语义隐含,它很容易生成“幻觉关系”,结论没有证据,开放场景到今天也没有成熟的端到端方法,只在受限子任务、强约束下可靠。所以走得通的只有第三条路:机器提议、标准把关、人审定夺,每一步都挂证据——可回放、可审计、可追责。

方法论落成系统,是一个四层架构。最底下 L1 数据层,七类来源:业务数据库、数据仓库、工业代码(建表语句、ETL 脚本等)、指标看板、文档图纸、现场 IoT、业务 API——工业代码在这里是和数据库并列的语义来源。L2 引擎层,三组能力:语义理解、知识建模、可信治理,按确定性流程编排多个智能体,每一步可缓存、可回放,关键步骤后面都跟着一个独立的审查 Agent。L3 图谱层是本体中枢、单一真相源:六类元素,加上可信分层、证据挂载、缺口清单、版本快照等可信机制。最上面 L4 应用层,是智能问数、质量追溯、排产调度、智能体决策等九大场景。右侧贯通的一列是标准导出:OWL2/RDF、SHACL、SKOS、SPARQL。另外,大模型按任务选型——建模用 deepseek-v3,代码用 qwen3-coder,对抗校验用 gpt-5 系列,谁擅长什么就让谁干什么。

原型是一个可以现场实机演示的工作台:构建、图谱、指标、问数在同一界面联动,背后是同一套本体语义。几个特点——前后端全部自研,迭代快;本地化运行,数据不出域;指标全量分层,包括原子、派生与复合;除此之外还有本体对话和 SPARQL 查询。

往下一层是代码结构。自研 PoC 原型 Cosmo DataMind 把前端、HTTP 层、能力层和执行底座拆开:构建链负责取证、抽取、裁决、语义评审与落盘,就是前面说的三级控制环;问数链负责组上下文、出 SQL 计划、执行与生成叙述;导出链把统一 IR 确定性转换为 Turtle,再过 SHACL 校验和 HermiT 推理机——这条链是确定性的,没有大模型参与。工程细节上,SQLite 全程只读连接、三重防写,本体数据的写入用原子写加锁,推理引擎可以在多个运行时之间降级切换。一次真实的 PoC 首跑记录:某电子 SMT 数仓,212 秒跑完整条链路,得到 9 条 verified 关系与 3 条 gap;质量门是 109 条集成断言、构建产物过 SHACL 与 HermiT、静态检查零告警。

构建方法论被做成六个可插拔的技能,技能等于方法论加可复现流水线:由 SKILL.md 定义,一键装进 Agent 工作区,再由问询台按需编排。挑三个说:ontology-build 吃库表、建表代码、ETL 与知识包,温度置零加固定种子,连跑两遍结果一致;ontology-build-v2 全程走数据治理平台的 gov API,不依赖大模型,拿的是权威中文名,天然可复现;ontology-agentic 最自主,规划、取证、提议、工具裁决、critic 对抗、迭代,只保留有数据或文档证据支撑的结论。另外三个,forge 按 OWL2 公理和 SHACL 走标准化路线,gov-app 面向应用本体、把对象与动作、事件显式分开,auto-ontology 以对象为中心做补全。共同的纪律只有一条:候选语义永远标成待确认,不冒充已验证。

技能怎么被调起来?一个 HTTP 接口,流式回传每一步。六步依次是:接诉求、选数据源、编排技能;解析建模意图;多模态取证,包括库表结构、建表代码与文档;注入技能方法论,由大模型提议对象和关系;语义评审,只看 schema 判语义,拦“共享域巧合”;最后是数据裁决,重合度加父键唯一性,过了才 verified。它调用的工具来自数据治理平台的 gov API:采集列结构、取值重合度核验、ETL 血缘、标准对齐、OWL 导出、写回平台。还有一条兜底:大模型超时或离线时,自动退到纯数据驱动构建,反造假规则不变——宁可少给结论,绝不臆造。一句话概括:技能给方法,工具给证据,裁决给可信。

把整条构建流程摊开,是八个确定性步骤,用固定流程图而不是让模型自由调度,节点之间只传本体数据,每一步都是纯函数。采集是双流并行,数据库流看结构和分布,代码流做静态解析、抓 JOIN 和注释;双源融合遇到冲突时,代码里的 JOIN 证据优先于命名猜测;然后归一切分,用社区发现把千表级的库切成六到十二个场景;接着抽取对象、事件与动作,把拼音翻成中文;关系抽取还是那条规矩,重合度至少 60% 且列名有据。后面三步是质量环:对抗审查,由独立的审查 Agent 多数否决则打回重抽;完备性校验,三项覆盖率不到 90% 就循环补,补不上的进 gap 清单;最后是人工审核确认环节,任何一道闸口都可以暂停、草案可以撤销,通过了才发布成 OWL2 与 SHACL。两条工程铁律:大模型调用全部有缓存,整条流程可回放;失败不阻断,单表或单 Agent 失败降级成 candidate 或 gap,在前端看得见,而不是静默丢失。

流程讲完,拿真实数据走一遍查验。关系发现的公式很朴素:子表取值与父表取值的交集除以子表取值数,至少 60% 才判 1:N;再加两道保险,子键必须不唯一、父键必须近似唯一;列名还要打一致性分,没有列名证据的降为 candidate。中间那条时间轴是踩过的一个坑,值得所有做数据的同行注意:同一对字段,只看一天的数据,重合度 100%,像极了真关系;把窗口拉到三十天,掉到 3.4%——纯粹是巧合。所以定了硬规矩:采样窗口不足,一律降 candidate。输出按证据分层,verified 实线、asserted 短虚线、gap 点虚线,每个节点可溯源。还有两行边界特意保留:指标覆盖率目前只有 18.8%,没有达标,因此以“基线本体 + 显式 gap 清单”的方式发布;代码侧证据目前只解析出一列,双源裁决的逻辑已经写好,但还没有被真正触发。做到什么程度,就写到什么程度。

本体增强 RAG:让答案从“像样”变成可检查
本体建出来了,好不好用得有数字。先看动机。同一个问题——"3 号线上周直通率是多少?”没有本体的检索会把直通率当成良率,猜表猜字段,最后编一个看起来合理的数字,没有出处,不敢用;本体接地之后,系统先锚口径,一次合格数除以投入数,再沿关系锁定真实的表,答案带着来源表和字段回来,可追溯、可审计。下面是三组对照实验的设计:朴素 RAG 检索的是文档切片,没有关系、没有口径,基线定在 78% 左右;GraphRAG 沿实体关系召回,能查了,但缺类型与约束,作为对照组,定在 85%;本体增强的 Onto-GraphRAG 在关系之上加本体边界约束和口径证据,验收目标 88% 到 95%。这里必须说明:题集是某电子 SMT 库上的工艺问答加根因诊断,判对的标准是口径正确、关系正确、还要有出处;以上数字是 PoC 的验收目标,不是实测结果,更没有在生产平台验证过。先把标尺立在这里,做到多少,后续用数字说话。

最后把全篇串起来,回到电子车间现场。工程师问:"SMT 贴片 3 号线本周 PCB 直通率从 98.6% 降到 95.2%,可能是什么原因?”先解释一下“一周直通率”:按自然周汇总的直通率,一次通过、无需返修才算合格,它不等于含返修的良率;一周掉 3.4 个百分点,通常不是偶发波动,而是系统性问题。系统走四步:第一步,本体识别意图,实体是 SMT 贴片 3 号线,类型是质量异常;第二步,沿本体关系召回相关参数和历史案例;第三步,在 schema 约束下生成,输出必须落在本体边界内,给出三条候选根因和一份检查清单;第四步,工程师反馈写回,标“正确”或“需补充”,进入本体的迭代队列。三条根因每条都能回溯到表和字段:3 号线贴片机吸嘴磨损,verified;元器件批次更换供应商,verified 但带缺口,就是前面那个 70.4%;回流焊温区参数偏移,只有单表佐证,老老实实标 candidate。检查清单也给到现场:吸嘴磨损量复测、来料批次追溯、温区曲线复核。这一轮 PoC 的结果如实呈现:9 条 verified、3 条 gap;16 个实体来自专家种子,不是自动发现的;指标覆盖率 18.8%,没有达标,进 gap 清单。PoC 的价值不在数字亮眼,而在证据可查、缺口透明——工程师既能按图逐项排查,也能清楚看到系统能力的边界。

同一套本体底座上,还有三类交互。业务人员用对话式问数,开口问,不用懂表结构,自然语言定位到对象和口径,生成可执行 SQL,答案带来源,这条链路是只读的。维护本体的人用对话式编辑,自然语言进来后被翻译成受治理的动作协议,走白名单操作,低风险直接改、一键撤销,写操作要预览差异、人确认之后才落盘。开发者和外部系统走 SPARQL,本体导出成 OWL2/RDF,标准可查,同时禁掉联邦查询这类危险能力。关键设计就一句话:大模型唯一的写权限,是把自然语言翻译成带类型的操作;校验、预览、人确认之后才落盘。每一次改动都留痕、可回滚、可追责,业务人员才能放心用。

可信不是模型属性,而是系统属性
本体在产品里的位置可以一页带过:它不是独立产品,而是 COSMO-Sphere 平台里的核心语义模块——向上支撑 COSMO-Claw(天启)编排的各类智能体,向下统一天数、天智、天工这些底座的数据口径。标准方面,正在参与 IEEE P3945(工业智能体系统架构)与 ISO/PAS 24644-1(大规模个性化定制)的共建;生态方面,做行业本体库沉淀、跨企业迁移,并与高校共建本体公共地基。本体做好了,上面的智能体才有统一语义可用。

收尾是三句话。第一,看清瓶颈:工业 Agent 的症结不在模型规模,而在语义底座——术语不通、语境丢失、知识陈旧,这三种漂移靠堆模型解决不了。第二,建对架构:在本体、大模型、多智能体的组合里,本体是那个语义罗盘,引导检索、约束输出、共享语义。第三,走对路径:从行业本体,到场景适配,再到产线可信 Agent;六条原则——本体优先、可降级、可溯源、可校验、飞轮可见、最小依赖。整套方法最终收敛为一条质量保障链:语义锚定、检索约束、输出校验、对抗审查、人工审核确认、证据回流。

工业 Agent 要从 Demo 进入真实生产流程,不能只依赖更大的模型或更长的上下文。真正需要工程化的是语义、证据、标准、审查与版本更新。本体在这里不是一张画完即止的静态图谱,而是一套贯穿检索、生成、协同、执行和反馈的动态“语义罗盘”。可信,不是模型的属性,而是系统的属性——本体,让工业 Agent 的可信可以被工程化。
分享嘉宾
INTRODUCTION
余锦泽 博士
卡奥斯
工业智能首席科学家
东京大学博士。深耕工业视觉、数字孪生与具身智能,以第一/通讯作者发表顶会顶刊 29 篇、第一发明人授权专利 29 项,曾获日本机器人大奖、泰山产业领军人才。
往期推荐
点个在看你最好看
SPRING HAS ARRIVED

