图博数智
AI技术

AI知识库怎么搭才答得准本体论3个真实实践

· 图老师

AI知识库怎么搭才答得准?本体论3个真实实践

最近有人问图老师,公司搭了半年的AI知识库,员工换个问法,答案就跟着变,统计类的问题更夸张,基本没一次靠得住

这种情况太常见了,来问的企业里,一大半的病根都不在模型上。

模型能力早就够用了,AI答不准,多数是因为它根本没听懂你公司的业务。

缺的这样东西,行业里叫业务本体,今天图老师用3个真实实践,把本体论这件事讲透。

图博数智inFab企业AI知识库主屏与业务本体图谱

先说一个一线最常见的现象。

员工问AI:A项目现在推进到哪一步了。

AI检索了半天,引用回来的却是B项目的文档,因为知识库里管这个项目叫一期工程,合同系统里叫项目编号,AI不知道这两个是同一个东西。

同一个客户也一样,销售表里一个名字,合同里一个名字,老员工邮件里干脆用简称。

普通的rag知识库碰到这种事没辙,它的原理是把文档切片后做检索,能匹配到相似的字,对不上同一个事物

你让它统计这位客户去年签了几份合同,它要么漏算,要么把别家的事算进来。

模型不笨,它只是手里缺一本你公司的字典。

再往下追问一层,为什么换个问法答案就变。

因为切片检索靠的是字面相似度,问题里出现的词不同,召回的文档就不同,答案自然跟着漂。

这也是很多企业的AI知识库搭完之后,员工觉得还不如直接搜索的原因,检索能找到文档,但答不出结论

想要稳定的结论,AI就得先知道这些文档在讲同一件事,这正是本体要解决的问题。

本体论到底是什么

本体论这个词听着玄,说白了就是两样东西。

一本字典,把企业里同一事物的所有叫法统一成标准名,别名全部挂在这个标准名下面。

一张关系地图,谁跟谁有关系、是什么关系,全部画清楚,这个客户签过哪些合同,这份合同对应哪个项目,这个项目用了哪些原料。

字典加地图备齐,AI回答问题前先对齐名词,再顺着关系找数据,答案立刻就稳了。

有意思的是,国外把这件事做得最出名的是Palantir,他们给每家客户都配FDE,也就是前沿部署工程师,原因很简单,本体建模没法标准化,必须贴着客户业务一单一单做

图博数智的inFab走的就是这条路:先由FDE调研客户业务,AI出初版本体,客户确认后再迭代,从来不把它吹成客户自己拖拽几下就能建好。

这也是inFab敢叫国内首家依托业务本体建模、支持本地化交付的产业级AI知识库平台的底气。

场景一 配方本体统一叫法

第一个实践来自日化配方行业。

一家日化企业,同一个原料,采购叫商品名,研发叫化学名,老配方师张口就是行话。

更麻烦的是配伍关系,哪些原料放一起会分层、变色、失效,这些规则散落在几十年的配方卡和老员工的脑子里。

图博数智把原料本体建起来,统一命名、挂上别名,把配伍关系一条条维护进去。

建完之后,AI给配方建议前会先查配伍关系,会冲突的组合直接被拦下来,不用等打样出来才发现白做。

图博数智原材料配伍关系管理界面

场景二 项目本体打通系统

第二个实践是环保行业的昆山源和环保。

他们的历史项目资料,方案、图纸、报价单,散落在不同的文件夹和系统里。

新项目进来想参考类似规模的污水处理经验,全靠老工程师的记性。

我们帮他们把项目本体建起来,项目、工艺、设备、客户之间的关系打通之后,AI能自动匹配历史案例,直接生成新方案初稿。

前期方案撰写时间大幅压缩,完整案例在官网案例页能看到。

南通华为电力也是类似逻辑,复杂标书的数据跨多份文档对齐之后,过去耗费大量人工的解析和报价,AI几分钟就能完成。

这类跨文档、跨系统的统计和追溯,普通检索几乎必然错漏,名词对齐之后才敢交给AI。

图博数智inFab连接MES、ERP等业务系统界面

场景三 科研本体零容错

第三个实践在高校。

科研场景对名词的严谨度要求最高,同一个材料在中文文献、英文文献和课题组内部记录里,写法能差出好几个字段。

南京大学的课题组用MatSeek构建私有知识库之后,检索结果可以直接引用,还能辅助预测实验方向。

底层逻辑就是名词体系先统一,AI才敢在文献和实验数据之间做关联。

科研、法务合规、半导体失效分析这类输出零容错的场景,本体建模的价值最大。

讲到这你可能会问,本体和rag知识库到底是什么关系,是不是二选一。

打个比方,rag知识库是拿着题库做题的学生,本体是他手里的字典和关系地图。

没有字典,他只能拿原文片段拼答案,统计和汇总类的题目极易错漏。

有字典,他先对齐名词再顺着关系取数,该算的算全,该追溯到的一步不落。

所以两者不冲突,本体是让rag知识库在企业里真正可信的那层地基。

一句结论可以单独记下:普通检索解决找得到,本体建模解决算得对

图博数智inFab科研论文解析与图表结构化界面

哪些企业需要本体建模

这事不是人人都要上,图老师的判断标准是下面五条,命中两条以上再考虑

业务名词体系稳定,客户、项目、产品这些概念不会几周一换。

信息散落在多个系统,同一事物有好几种叫法。

经常有跨文档、跨系统的统计和追溯需求。

输出零容错,内容要进高管汇报、客户方案或合规材料。

有人力持续维护这些名词和关系。

说实话,也要讲另一面。

如果你主要靠追热点快速出稿,或者业务概念几个月就重构一次,本体建模反而是负担,轻量AI工具更划算。

图老师的习惯是先把不适合的情况讲在前面,把不适合的方案硬卖给你,这生意做不长。

AI知识库落地三步走

落到实操,图老师的建议分三步。

第一步,搭AI知识库之前,先花一周盘点自家的名词,核心概念有哪些、一个概念几种叫法、散落在哪几个系统。

这一步不花钱,却能直接判断你需要的是轻量工具还是本体建模。

第二步,挑一个零容错又高频的场景先做,做深了再扩展。

第三步,把AI私有化部署提上日程,名词字典和关系地图是你家最值钱的业务资产,喂给公网AI等于把家底送出去。

图博数智的inFab支持纯内网部署,数据不出企业,字段级的权限也能管到。

图博数智inFab本地化部署与企业权限管理界面

团队方面多说一句,我们约80%的成员是FDE,自研GPU算力调度能把利用率不到25%的硬件吃出3倍业务量,这些交付经验最后都沉淀在自研产品底座上。

本体建模这种苦活,恰恰需要这样的团队蹲在客户业务里一点点磨。

图博数智科研AI方案框架图


关注我,图老师每天分享一个企业AI落地的真问题、真办法。

先进团队正在用的 AI 落地方案

判断您的业务里哪些环节已经适合用 AI 替代?