企业 AI Agent 接入 RAG 知识库:8 个踩坑实录
从"把文档丢进向量库"到"回答稳定可依赖"——RAG 落地的真实坑位清单
2026-08-17 · Leo · 踩坑 · 12 分钟阅读
⚠️ 本文是通用操作手册,基于多个 RAG 落地的通用方法论整理,不指代任何真实客户,所有数字为通用行业参考基线,仅作 SOP 参考。
TL;DR — 把企业文档接进 AI Agent 只完成了 20%。真正的坑在:chunk 切分策略、embedding 模型选型、检索召回调优、权限隔离、幻觉控制、增量更新、评估闭环。本文列出 8 个高频坑位 + 每个坑的"现象 → 根因 → 修法",最后给一份可直接落地的通用 SOP。
一、坑 1:无脑按固定字数切 chunk,上下文被腰斩
现象
500 字的固定 chunk,把一份合同的关键条款从中间切断。Agent 检索到的是"半句话",回答自然对不上。
根因
按字符硬切,破坏了语义边界。表格、代码、条款列表最容易被切碎。
修法:先按结构切(标题/段落/表格/列表),再对超长块做软切(带 10-20% 重叠)。优先用 Markdown/HTML 结构感知切分器;表格单独成一个 chunk,并保留表头上下文。
二、坑 2:embedding 模型选错,中文检索像撞大运
现象
用英文优化的 embedding 处理中文文档,用户问"报销流程",召回的是"财务报表",相关性一塌糊涂。
根因
embedding 模型有语言倾向。中文场景需要中文语料训练/微调的模型,且要关注 MTEB 中文榜单表现。
修法:中文场景优先选中文优化模型(如 bge-m3、bge-large-zh 等),并实测同义词、行业术语的召回。选型后固定版本,不要随意换模型——换模型 = 全部向量要重算。
三、坑 3:只靠向量检索,精确关键词反而找不到
现象
用户问"ERP 系统停机了怎么办",向量检索召回了一堆"系统维护计划",唯独没有包含"停机"的运维手册。
根因
纯向量检索对精确术语、编号(如"GB/T 19001")、缩写(如"API、CRM")的召回不稳定。BM25 关键词检索恰好擅长这个。
修法:混合检索(Hybrid Search)——向量召回 + BM25 关键词召回,再用 RRF(Reciprocal Rank Fusion)合并排序。这是 RAG 工程里的标配做法,能同时抓住语义相关和精确匹配。
四、坑 4:权限不隔离,Agent 变成信息泄露出口
现象
普通员工问一句"公司今年奖金方案是什么",Agent 把只有管理层可见的文档答出来了。
根因
知识库是全局共享的,检索阶段没有做权限过滤。
修法:文档入库时打权限标签(部门/角色/密级),检索时按用户身份过滤后再召回,LLM 只看到用户有权看的内容。这个必须在检索层做,不能指望模型"自觉"。
五、坑 5:幻觉没控住,"编造"比"不知道"更致命
现象
Agent 在知识库没覆盖的领域"自信地"给出错误答案,用户拿去执行,出了问题。
根因
没有设置"不知道就说不知道"的护栏,也没有召回置信度阈值。
修法:① prompt 强制"仅基于检索内容回答,内容不足时明确说不知道";② 设置召回分数阈值,低于阈值直接拒绝回答;③ 对关键业务领域做答案校验(如让模型自检引用来源)。
六、坑 6:文档更新了,Agent 还在回答旧版本
现象
新制度 7 月 1 日生效,员工 7 月中旬问 Agent,答的还是旧制度。
根因
知识库只做了全量重建,没有增量更新机制;或者更新后没重新生成受影响文档的向量。
修法:建立"文档变更 → 重切分 → 重嵌入 → 覆盖旧向量"的增量管线。文档要带版本号和生效日期,检索时优先取生效中的版本。管理后台要有"最近更新"可审计。
七、坑 7:没有评估集,优化全靠感觉
现象
切分参数改了、模型换了,但没人说得清效果是变好还是变差。
根因
没有标注好的问答评估集,也没有可量化的召回/回答指标。
修法:从真实用户问题里挑 50-100 条做成评估集(问题 + 标准答案 + 引用来源),每次改动跑一遍:召回命中率、答案准确率、引用正确率。没有评估集,RAG 优化就是开盲盒。
八、坑 8:把 RAG 当"一次性项目",没人维护
现象
上线热闹两周,之后文档没人更新、评估没人跑、坏掉的源文档没人修,Agent 回答质量肉眼可见下滑。
根因
RAG 不是一次性交付,是持续运营的知识资产。
修法:明确知识库 Owner + 更新频率 + 月度质量回顾。把 RAG 当作"内容运营"来管理,而不是"上线即结束"的项目。
九、通用 SOP:4 周从零到可用的 RAG 落地清单
- W1:盘点与切分 — 梳理知识源清单(制度/手册/FAQ/表格),确定文档结构,选结构感知切分器,跑通"文档 → chunk → 向量"管线。
- W2:检索调优 — 选定 embedding 模型 + 混合检索,用 30-50 条真实问题验证召回率,调整 chunk 大小与重叠参数。
- W3:接入与护栏 — 接入 Agent,加权限过滤、置信度阈值、"不知道就说不知道"的 prompt 护栏。
- W4:评估与上线 — 建 50-100 条评估集,跑基线指标,定更新机制与 Owner,灰度放量。