-
名字先归一,文中出现“比亚迪股份有限公司”,在别名表里落到本体节点“比亚迪”;标题里只有“云帆”两个字,它同样认得出这是品牌名。 -
类型决定读哪几列,产品事故类的事件读产品名、部件、失效现象,服务投诉类的事件读门店、区域、时间,这份对照表写在行业配置里。 -
关系负责往下传导,一条舆情命中了产品P001,而P001的货来自宁德那家电池供应商,这条舆情就同时落在那家供应商头上,走的是本体里已经写好的对象关系,不是算出来的相似度。
-
主干是语义与判断,规则退到兜底:采集进来的内容先过语义筛选,本体别名表在筛选阶段就当约束用,而不是等模型出结果再拿关键词筛一遍。规则没有被扔掉,它在语义判断给不出结论的时候接手,保证系统不掉线。 -
知识往外扩,但要人点头:系统从真实事件里抽出候选实体,先放进待确认区,人工确认之后才并入别名表,本体版本加一,现在是第11版。如果让模型自动往母本体里写东西,几次之后错的名词和错的关系就混进了底座,此后所有判断都在脏数据上做。待确认区把这条路堵住,母本体只收被确认过的东西。 -
判断可解释,也能复算:前面讲过的依据、摘要和版本记录都落在这条上,同一句话再跑一遍,得出的结论对得上。 -
人和agent都能用:对外是接口,再往上收成工具层,agent可以像人一样调它,拿到的不是一段描述,而是带依据的结构化结果。
-
本体能导出,STIX2.1的子集导出已经落地,实测导出276个对象,必备字段校验通过,界面上点一下就能拿到文件。 -
本体能版本化,母本体慢变、行业共享,事件专属的二次本体快变、跟着事情走。两层分开之后母本体不会被一次热点事件带偏,版本号、指纹、体检结果都记在库里。 -
换行业不用改代码,行业之间的差别写在一份配置里,包括本体类、关系、事件类型对应的字段和影响列。现在系统里并存三套行业,云帆新能源的合成演示数据、真实科技新闻、阀门行业,顶栏切一下就换,代码一行不动。

