复杂 PDF 做 RAG,别先切片
先说判断
几百页、带表格和图纸的 PDF,最容易把 AI 项目做成玄学:一上来就切片、向量化、接大模型,然后发现问什么都像在碰运气。真正的关键不是“RAG 怎么调参”,而是先把这份 PDF 从“文件”拆成“证据系统”。
第一步:别急着切,先盘点
复杂 PDF 不是一种资料,而是很多种资料装在一个壳里。正文、目录、表格、扫描页、图纸、脚注、附件,它们的处理方式都不一样。
开工前先做一张清单:哪些页是纯文字,哪些页是表格,哪些页是图纸,哪些页 OCR 质量差,哪些页只是封面和目录。普通人做 AI 工作流,经常败在这里:把所有页面当成同一种文本处理,后面再怎么补 Prompt 都救不回来。
第二步:把“版面”保留下来
RAG 不是把字抽出来就完事。复杂 PDF 里,信息常常藏在位置关系里:表格的行列、图纸的标注、标题和正文的层级、页码和章节的对应关系。
所以入库时至少要保留三类信息:原文内容、页码来源、结构位置。表格不要粗暴拆成一堆碎句,最好转成结构化表;图纸不要只丢给 OCR,可以先生成一段“图纸说明”,再把图片路径、页码、说明一起入库。
第三步:做两层知识库
一层叫“证据库”,尽量忠于原 PDF,负责可追溯;另一层叫“任务库”,把证据整理成常见问答、概念解释、字段索引、流程摘要,负责好用。
这对内容和教育从业者很重要。比如你要把政策文件、教材、讲义、真题解析做成 AI 助手,不能只追求“答得像人”。更重要的是:它能不能指出答案来自哪一页,能不能区分原文结论和自己的推断。
第四步:检索要分流
不要所有问题都走同一条向量检索。问定义,查正文;问数值,查表格;问位置和关系,查图纸说明;问整章逻辑,先查章节摘要。
一个实用做法是:先让 AI 判断问题类型,再决定去哪个索引里找材料。普通文本用关键词加向量,表格用字段检索,图纸用说明和页码定位。这样比单纯扩大 Top K 更稳。
第五步:答案必须带刹车
复杂资料的 AI 助手,最怕一本正经地编。输出规则要提前写死:能回答就引用页码;证据不足就说不足;表格数字要说明来源;涉及图纸细节时提醒用户查看原页。
最后给一个落地清单:先分类页面,再做 OCR 和版面识别;表格单独结构化;图纸生成说明并绑定原图;建立证据库和任务库;按问题类型分流检索;答案强制带来源和不确定性。
这套打法不酷,但可靠。复杂 PDF 的 RAG,本质不是“让 AI 读完几百页”,而是把几百页资料整理成一个能查、能引、能校验的工作台。