RAG 知识库别先喂资料
先别急着搭知识库
很多人一听 RAG 知识库,就开始整理 PDF、切文档、上传资料。结果折腾一圈,AI 还是答得虚、答得慢、答得像复读机。真正的问题不是“资料不够多”,而是你没有先想清楚:这个知识库到底要帮谁,在什么场景下,做出什么判断。
RAG 不是资料仓库,是回答生产线
普通资料库解决的是“我把东西放哪”。RAG 知识库解决的是“用户问一句话,AI 怎么找到依据,并组织成能用的答案”。
所以搭建顺序应该反过来:先从高频问题开始,而不是从存量资料开始。比如内容团队可以先列“选题怎么判断”“标题怎么改”“爆款结构怎么拆”;教育团队可以先列“学员为什么卡住”“某类题型怎么讲”“咨询时怎么解释课程价值”。
每个问题都要配一个合格答案标准:要不要引用依据?要不要给步骤?要不要区分新手和老手?要不要提醒风险?这些标准,比多上传 100 份文件更重要。
四步搭一个能用的知识库
第一步,列问题清单。不要写大而空的“帮我学习 AI”,要写成真实提问,比如“我有 20 篇文章,怎么判断哪篇适合二次改写”。
第二步,整理答案素材。资料不要按来源堆,要按问题归类。一个知识点最好只服务一类问题,避免 AI 检索时把相似但不相关的内容混在一起。
第三步,给资料加标签。标签不需要复杂,先用人能理解的字段:适用人群、使用场景、内容类型、时效性、可信等级。这样后续更新和排错会轻很多。
第四步,做追问测试。不要只问标准题,要故意问含糊的问题、反向的问题、带错误前提的问题。一个好的 RAG 系统,不是每次都硬答,而是该追问时追问,该拒答时拒答,该引用依据时引用依据。
面试里真正想听什么
如果这是 AI 产品经理面试题,面试官通常不是想听你背“向量数据库、切片、召回、重排”。他们更想看你有没有产品判断:谁来用、痛点是什么、答案怎么算好、错了怎么发现、知识怎么更新。
你可以这样讲:先定义业务场景和用户问题,再设计知识结构和答案标准,然后用小样本跑通检索效果,最后建立运营机制,包括新增资料、过期资料下线、错误答案复盘、命中率和满意度监控。
给普通人的落地清单
如果你只是想用 AI 提效,不用一上来买复杂系统。先拿一个文件夹、一个表格、一个 AI 工具就够了:
- 先整理 30 个真实问题。
- 每个问题配 1 到 3 条可信资料。
- 给每条资料写一句“什么时候用”。
- 每周记录 AI 答错的 5 个问题。
- 把答错原因分成:资料缺失、问题没识别、答案格式差、资料过期。
- 只修最高频的错误,不追求一次性完美。
RAG 知识库的核心,不是让 AI 看过更多东西,而是让 AI 在正确的问题里,找到正确的依据,输出正确形态的答案。能做到这一点,它才是工作流;做不到,它只是一个更贵的网盘。