RAG 成败先看文档解析
先别急着上向量库
很多人做 RAG,一上来就问:用哪个向量库?切多少字?相似度阈值设多少?但真正决定效果的,往往不是检索那一步,而是前面那句最土的话:文档有没有被读明白。
如果你的资料是 Word、PDF、扫描件、课件截图、表格混排,直接丢给模型切块,结果大概率是“看起来能跑,问起来乱答”。RAG 不是把文件塞进知识库,而是把文件还原成可被机器理解的知识单元。
Word 和 PDF 不是一类东西
Word 的优势是结构相对清楚。标题、段落、表格、列表、批注、页眉页脚,大多能被程序直接识别。所以处理 Word 时,重点不是 OCR,而是保留层级:一级标题下面讲什么,表格属于哪个小节,某个定义对应哪段解释。
PDF 麻烦得多。电子版 PDF 可能有文字层,但阅读顺序不一定对;扫描版 PDF 本质上是图片,需要 OCR;双栏排版、页码、水印、脚注、表格跨页,都会把内容打碎。很多 RAG 项目答得差,不是模型笨,是 PDF 被解析成了一锅粥。
正确流程是“先还原,再切片”
一个实用的文档 RAG 流程,可以分五步走。
第一步,先给文档分类:Word、电子 PDF、扫描 PDF、图片型资料,不同类型走不同解析链路。别用一个方案硬吃所有文件。
第二步,抽取内容时保留来源信息。至少要有文件名、页码、标题层级、段落位置、表格标题。以后模型回答时能引用出处,用户才敢信。
第三步,做结构感知切片。不要机械按 500 字切。政策文件按条款切,课程讲义按知识点切,面试题按“题目 + 答案 + 解析”切,表格按行或主题切。一个好切片应该能独立回答一个小问题。
第四步,检索不要只靠向量。向量适合语义相近,关键词适合专有名词、年份、编号、法规条款。更稳的做法是关键词检索 + 向量检索 + 规则召回,再用重排模型筛一遍。
第五步,给 OCR 和解析结果做验收。随机抽 20 个问题,看答案是否引用到正确页码;抽几张扫描件,看错别字、漏行、表格错位是否严重。没有验收集,RAG 迟早变成玄学调参。
普通人怎么落地
如果你是内容或教育从业者,不用一开始就搭很重的系统。先把资料分成三类:干净 Word、可复制文字的 PDF、扫描件。前两类优先自动入库,扫描件先做小范围测试,不要全量盲灌。
再建一个“入库清单”:资料名称、类型、解析方式、是否有表格、是否需要人工复核、典型问题。这个清单比炫技更重要,因为它能告诉你哪些资料适合自动化,哪些资料暂时不值得折腾。
最后记住一个判断:RAG 的本质不是“让 AI 读很多文件”,而是“让 AI 在正确结构里找到正确证据”。文档解析做扎实,后面的检索、重排、生成才有意义。