rag知识库为什么怕追问知识图谱3个真实实践
rag知识库为什么怕追问?知识图谱3个真实实践
最近有人问图老师,他们公司的rag知识库上线三个月,验收指标都挺好看,员工就是不爱用。
拉了提问日志一看,问题出在第二问。
员工第一句问这家供应商靠不靠谱,AI答得头头是道。
接着追问它股东名下那几家公司去年有没有出过交付问题,AI立刻开始一本正经地编。
第一问答得好,第二问就露馅,今天图老师就专门讲讲这个现象,顺带说说GitHub上刚火起来的开源版Palantir给这件事提的醒。

rag知识库怕什么追问
先给这类追问起个名字。
行话叫多跳查询,第一问查一个实体,第二问沿着关系再跳两步。
供应商的股东的其他公司,这台设备同型号的泵在别的产线出过什么故障,这位客户经理经手的合同里有多少逾期。
这类问题的共同点:答案不在任何一份文档里,散在好几处,中间靠关系串着。
rag知识库的原理决定了它接不住。
文档切片,转成向量,按相似度召回,本质是拿你的问题去找长得像的段落。
向量懂远近,不懂关系。
它知道供应商年报和处罚公告都提到这家公司,但它不知道股东这个词要求它顺着股权链路再跳一层。
所以一追问,它要么召回一堆不相干的段落硬拼,要么干脆编一段。
GitHub上最近爆火的开源项目Semantica把这个短板摆上了台面。
这个自称开源版Palantir的项目,核心思路就一句话:企业信息光存向量不够,得存成一张有节点、有连线的知识图谱,智能体才能顺着关系走路。
方向被开源社区验证,说明这已经是行业共识,不是某家厂商的推销话术。
向量加图谱怎么配合
讲到这你可能会问,是不是要把现有rag知识库推倒重来。
不用,两者干的活不一样。
向量的强项是入口,员工提问的说法千奇百怪,泵坏了、设备故障、异常振动,向量都能对上文档。
图谱的强项是走路,名词对齐之后,从这台设备跳到同型号泵,再跳到故障工单,再跳到处置记录,每一步都有据可查。
务实路线是向量做召回,图谱做追问,第一问用向量把上下文捞回来,员工追问时改走图谱遍历。
图博数智给南通华为电力做标书解析时用的就是这个配合。
标书里的设备、数量、报价散在几十页的不同表格里,纯检索怎么都对不齐,名词挂上关系图谱之后,跨页跨表的数据才能串成一张完整的报价单。
这种活在企业里到处都是,只是过去都靠老员工脑子里的关系网扛着。

知识图谱三个真实实践
实践一,化工配方的配伍拦截。
图博数智服务过一家日化企业,几十年的配方卡里记着哪些原料搭一起会分层、变色。
这些规则做成原料关系图谱之后,AI推荐新配方前会先查一遍配伍关系,有冲突的组合直接拦下,不用等打样出来才发现白做。
实践二,环保项目的历史复用。
昆山源和环保的历史方案、图纸、报价散在不同文件夹,新项目想参考同规模污水处理经验,全凭老工程师的记性。
项目本体建起来之后,工艺、设备、客户之间的关系打通,AI顺着关系匹配历史案例,直接生成新方案初稿,前期方案撰写时间大幅压缩。
实践三,科研数据的跨库关联。
南京大学课题组用MatSeek建私有知识库,同一个材料在中文文献、英文文献和课题组内部记录里,写法能差出好几个字段。
名词体系统一之后,AI才敢在文献和实验数据之间来回跳着查,检索结果直接引用进论文。
三个实践的共性就一条:先把关系理清楚,AI才答得出链条上的问题。
哪些企业需要知识图谱
照例把判断标准摆出来,图老师的经验是看三条,命中两条再考虑上。
信息散在三个以上系统,同一事物有好几种叫法。
业务问题里经常带它的、名下的、相关的这类连环追问。
答案错了有实际损失,要进汇报、进方案、进合规材料。
反过来讲,如果你的场景就是单文档问答,查规章制度、翻产品手册这类,rag知识库本身够用,别为图谱多花冤枉钱。
图老师习惯先把不适合的挡回去,把不适合的方案硬卖出去,这生意做不长。
rag知识库升级三步走
真要做,按三步来。
第一步,盘点一周,把公司里同一事物有几种叫法、关系藏在哪几个系统列清楚,这一步不花钱。
第二步,挑一个连环追问最频繁的场景试点,设备故障追溯、供应商背调都合适,跑通一条关系链就算赢。
第三步,把图谱接进问答链路,员工追问时走图谱路径,答案从关系链上取,每次都稳定一致。
底层能力多说一句,图博数智的inFab支持全私有化部署,团队约八成是FDE,贴着客户业务把名词和关系一条条理出来,图谱这种活没有捷径,全靠蹲在现场磨。

一句话收尾:rag知识库解决找得到,知识图谱解决串得起,员工的第二问,才是企业AI知识库真正的试金石。
关注我,图老师每天分享一个企业AI落地的真问题、真办法。