RAG 系统上线后,回答质量并非一成不变。知识库膨胀、模型版本更替、用户提问分布变化,都可能让原本表现良好的系统出现各类退化。建立实用的监控与告警机制,是保障系统长期可靠运行的最后一道防线。
23.3.1 需要监控的关键指标
监控不能只看“能不能用”,更要关注“用得好不好”。建议围绕以下几个维度设置核心指标:
1. 检索质量指标
- 平均检索相关度:每次查询返回的 top‑k 片段与问题的语义相似度均值。持续下降可能意味着索引老化或嵌入模型不再适配当前提问方式。
- 低相关度查询占比:统计相似度低于某个阈值(例如 0.6)的查询比例。若此比例突然升高,可能预示知识库未能覆盖新增业务领域。
- 检索命中率:人工抽检中,检索结果是否包含真正能回答问题的片段。这是衡量检索效果的最终标尺。
2. 生成质量指标
- 答案采纳率:用户是否对提供的答案进行了“采纳”或“解决”操作(如果产品上有这类反馈入口)。采纳率陡降往往是质量问题的直接信号。
- 人工抽检准确率:定期随机抽取一批问答对,人工评判是否事实正确、信息完整。这是最可靠但也成本较高的方式,建议每周或每两周执行一次。
- 重复提问率:同一个用户或会话中反复提出类似问题,往往表明首次回答未能满足需求。
3. 系统健康度指标
- 端到端时延(P50/P95/P99):用户从提问到看到完整答案的时间。检索耗时、LLM 生成耗时都应分别记录,便于定位性能瓶颈。
- 请求成功率:排除因超时、服务异常导致的失败请求比例。
- 知识库规模与新鲜度:文档总数、最近更新时间。若知识库长期未更新,业务信息可能已经过时。
23.3.2 告警机制的设计原则
告警的目的在于及时发现异常,而不是淹没在噪音中。以下是几条实战中沉淀下来的原则:
1. 基于趋势而非瞬时波动
单一低分查询不必触发告警。应设置滑动窗口统计,例如“过去 30 分钟内,低相关度查询占比超过 40%”才通知。这样可以避免由于个别生僻问题造成的误报。
2. 分级告警,对应不同响应
- 紧急(P0):平均检索相关度骤降、请求成功率跌破 95% 等,需立即介入排查服务异常或知识库损坏。
- 警告(P1):人工抽检准确率连续两次低于预定标准、用户采纳率缓慢下滑,应在 24 小时内安排分析。
- 提示(P2):知识库超过预设天数未更新、存在较多未覆盖的新问题,作为日常维护提醒。
3. 告警携带上下文信息
告警消息中应包含触发时间段、受影响的典型查询样例、目前各项核心指标的快照。这样接手人员可以直接开始排查,无需先手动拉取数据。例如:
[RAG‑告警] 近 30 分钟低相关度查询占比 52%(阈值 40%)。
样例问题:“新上线的国际汇款手续费是多少?” 最高相似度 0.51。
当前时延 P95: 1.8s,成功率 99.2%。
收到这种告警,运维人员立刻能判断可能是新增的国际汇款政策尚未入库。
23.3.3 实用监控工具与方案
不一定要搭建复杂的大数据平台。许多团队基于现有技术栈就能快速建立有效监控:
- 日志 + 指标聚合:将每次查询的检索相似度、是否命中、耗时等写入结构化日志,用 Elasticsearch + Kibana 或 Grafana + Prometheus 进行可视化和告警。
- LLM 辅助评估:用少量标注数据训练一个评分模型,或者直接调用更强、更慢的 LLM 对线上回答进行批量打分(例如评判是否与检索原文一致),作为人工抽检的补充。
- 用户反馈闭环:在回答下方提供“有帮助 / 无帮助”按钮及可选原因,将反馈数据回写到监控系统,持续追踪净推荐值(NPS 式)变化。
23.3.4 常见退化模式及应对线索
在实际运营中,RAG 系统退化的表现往往有迹可循。熟悉这些模式有助于快速诊断:
| 现象 | 可能原因 | 排查方向 |
|------|----------|----------|
| 检索相关度普遍下滑 | 嵌入模型版本更新、提问分布漂移 | 对比新旧模型在相同查询上的向量距离;抽样分析用户真实问题是否类型发生变化 |
| 生成答案频繁出现“资料中未找到” | 知识库未覆盖新领域或分块策略不当 | 统计低相关度查询中的高频词,更新知识库;检查切块大小是否导致关键信息被割裂 |
| 答案事实错误但检索片段正确 | 提示词约束不足,模型自由发挥 | 强化提示词中的“严格基于资料作答”要求,或替换生成模型 |
| 端到端时延突增 | 检索库膨胀、模型服务资源不足 | 监控检索本身耗时,必要时增加向量索引节点或开启近似搜索;检查 LLM 服务配额 |
23.3.5 建立持续改进的闭环
监控不是终点,而是优化的起点。建议将监控数据与迭代流程打通:
- 定期召开质量回顾会议,基于监控指标和抽检结果,明确本周最优先修复的知识缺口或系统问题。
- 将告警中高频出现的问题类型沉淀为文档检查清单,在新增文档入库前进行自动校验。
- 对于反复被标记“无帮助”的问题,建立补答或人工介入流程,并同步更新知识库,避免相同问题持续产生差答。
最终,这套效果监控与告警体系的意义在于:让 RAG 系统从“上线即巅峰”走向“持续可进化”。当团队能够第一时间知道系统何时变差、为什么变差,并及时修复时,才能真正把企业知识问答的可靠性长期维持在业务可接受的水平之上。