知识库分片别先问字数
先别纠结切 500 字还是 1000 字
很多人做 RAG 知识库,第一反应是问:分片到底切多大?这个问题问早了。真正影响效果的,不是某个神奇字数,而是你有没有按“用户会怎么问、答案该怎么用”来组织知识。
RAG 不是资料仓库,它更像一个随叫随到的助教。助教要能回答问题,就不能只会背全文,而要知道“这个问题属于哪类场景、该引用哪段依据、下一步怎么做”。
分片的本质是按任务切
如果你是内容或教育从业者,最实用的分片原则是:按任务单元切,而不是按自然段机械切。
一份课程讲义里,可能同时有概念解释、例题、误区、答题模板、运营话术。如果全部混在一个大块里,AI 检索时容易拿到一锅粥;如果切得太碎,又会丢掉上下文。好的分片,应该让每一块都能独立回答一个小问题。
比如“申论归纳概括怎么审题”可以是一块,“常见丢分点”可以是一块,“学生追问时的解释话术”可以是一块。它们彼此相关,但用途不同。
一个普通人也能照做的流程
第一步,先列问题清单。不要先整理资料,先写出用户最常问的 30 个问题,比如“怎么入门”“哪里容易错”“有没有模板”“能不能举例”。
第二步,把资料按问题归类。每个分片只服务一个主要问题,最多带一个补充问题。标题要写清楚,例如“资料分析速算:截位直除适用场景”,不要叫“第 3 章内容”。
第三步,给每个分片补上下文。至少包含对象、场景、结论、例子。比如“适合公考新手”“用于判断题型”“不适合精算题”。AI 拿到这块时,才知道该不该用。
第四步,建立元信息。给分片打标签:知识点、难度、适用人群、内容类型、更新时间。运营知识库尤其需要这一层,否则后期内容多了,检索会越来越乱。
第五步,用真实问题测试。不要问“请总结这篇文档”,而要问用户真的会问的话,比如“我做题总慢,资料分析先练什么?”看 AI 引用的是不是对的、回答能不能直接执行。
分片太粗和太细都会坏
太粗的问题是召回不准。AI 找到了一大段,但里面只有一小部分有用,回答就容易虚。
太细的问题是语境不够。AI 找到一句孤立结论,却不知道前提条件,回答就容易绝对化。
一个实用判断是:每个分片读完后,真人能不能直接回答一个明确问题?如果不能,说明它可能太碎;如果里面能拆出三四个问题,说明它可能太大。
运营知识库要留“更新口”
知识库不是一次性工程。课程、政策、产品、话术都会变,所以分片时要方便替换。不要把十个知识点绑成一个大分片,也不要把临时活动信息混进长期方法论里。
我更建议把知识分成三层:底层是稳定原理,中层是方法步骤,上层是当下案例或话术。越靠上的内容越容易更新,越靠下的内容越要慎改。
最后的判断
企业级 RAG 听起来很技术,但对普通团队来说,第一性原理很简单:让 AI 每次都能找到“刚好够用”的知识块。分片不是为了好看,也不是为了追参数,而是为了让知识能被检索、被引用、被执行。
先按问题切,再按场景补,再用真实问法测。做到这三步,知识库就已经比大多数“上传一堆 PDF 然后许愿”的系统靠谱。