先别急着上图谱

很多人做知识库,一上来就想用 GraphRAG、GNN、混合检索,听起来很高级。但真正的问题往往不是“技术不够猛”,而是你连用户会怎么问、答案该引用哪些证据、错了怎么排查,都还没想清楚。

我的判断是:GraphRAG 不是知识库的起点,而是知识库进入“关系问题”之后的升级件。

普通 RAG 先解决 80 分问题

普通向量检索适合什么?适合“这段话里有没有答案”。比如制度解释、课程讲义问答、文章素材查找、客服常见问题,只要原文写得清楚,切片合理,Simple RAG 就够用了。

它的好处是便宜、快、好维护。运营人员也能理解:用户问一句,系统找几段相似内容,再让 AI 组织答案。

但它的短板也明显:一旦问题涉及多个人物、多条线索、多层因果,向量相似度就容易“看起来相关,实际没答到点”。这时你才需要考虑图谱。

GraphRAG 解决的是关系,不是面子

GraphRAG 的核心价值,不是右边能展示一个漂亮的图,而是把知识拆成实体、关系和路径。

比如教育内容里常见的问题不是“某个概念是什么”,而是“这个概念和那个题型有什么关系”“这个政策变化会影响哪类学生”“这几个考点为什么容易一起错”。这类问题靠单段相似文本,有时召回不到完整链路。

图谱的优势,是能让系统沿着“人、事、概念、时间、因果、适用条件”去找证据。但要注意:图结构相关,不等于问题相关。两个节点连得近,只能说明它们在资料里有关系,不能说明它们一定能回答当前问题。

白盒化比堆模型更重要

我更看重这类工作流里的“白盒化拆解”:答案是什么、召回了哪些上下文、命中了哪些实体、走了哪条图谱路径、最后哪些证据被融合进回答。

这对普通团队很关键。因为知识库不是一次性产品,而是要持续运营的系统。用户问错了、答案跑偏了,不能只说“模型幻觉”。你要能判断是切片问题、实体抽取问题、图谱关系问题、检索权重问题,还是提示词没有约束证据来源。

没有可排查链路的知识库,越复杂越像玄学。

一套更稳的落地步骤

第一步,先做 Simple RAG。整理 30 到 100 个真实问题,跑通问答、引用和人工校验。

第二步,给问题分类。凡是单段文本能回答的,不要硬上图谱;凡是跨章节、跨角色、跨条件、跨时间的问题,单独标出来。

第三步,再抽实体和关系。不要追求一次建全量大图,先围绕高频问题建“小图谱”,比如概念、题型、政策、适用人群、常见误区。

第四步,做对照测试。每个问题同时看普通检索、图谱检索、混合检索的差异,不只看答案好不好,还要看证据是否更准、上下文是否更少、更可解释。

第五步,保留失败样本。真正让知识库变强的,不是成功案例,而是那些“看似召回了,实际没答中”的问题。

运营上的真正机会

对内容和教育从业者来说,GraphRAG 最值得借鉴的不是技术名词,而是一个运营思路:把内容从“文章堆”升级成“关系网”。

当你的资料能被拆成概念、场景、误区、方法、案例和适用条件,AI 才不只是帮你搜索,而是能帮你组合、解释、追问和复盘。

所以别问“我要不要上 GraphRAG”,先问一句:我的用户问题,是否已经复杂到需要关系推理?如果没有,先把 Simple RAG 做扎实;如果有,就用图谱把答案链路照亮。