一个 RAG 系统上线后表现如何,不能仅靠“感觉回答还不错”来判断。必须有一份可量化、可复现的评估基准。这份基准的核心,就是评估数据集和黄金标准集(也称为 ground truth)。本节介绍如何在真实项目里,以合理的成本构建这份基准。
10.4.1 理解评估数据集的构成
评估数据集是一组有代表性的“问题-标准答案”对,用于系统性的衡量 RAG 输出质量。每个条目至少包含:
- 问题:用户可能提出的自然语言问题(不限单一模板,应包括多种问法)。
- 标准答案:对于该问题,期望系统给出的理想回答。可以是完整段落,也可以是关键信息列表。
- 参考来源(可选但强烈建议):标准答案所依据的文档 ID 或片段 ID,用于后续评估检索和溯源环节。
一个完整的评估数据集通常包含 200–1000 条样本,太少缺乏统计意义,太多则人工标注成本过高。实际项目可以从 200 条起步,随着使用积累逐步扩展。
10.4.2 构建数据集的三种实用方法
方法一:从业务核心知识中人工整理
适合系统首次构建,尚未有用户日志的场景。
- 梳理高频知识点:与业务团队一起,列出最常被问到的话题(例如产品参数、退换货政策、合规要求等)。
- 针对每个知识点编写 3–5 个不同问法:例如“X 产品保修多久?”“X 产品有保修吗?”“买了 X 之后坏了怎么修?”等,覆盖口语化和专业提问风格。
- 在知识库中找到对应的标准答案:直接从权威文档中摘录,或由专家根据文档编写,确保答案完全正确。
- 标注来源片段:记录答案是依据哪些 chunk 得出的,便于后续单独评测检索质量。
这种方式的优点是答案质量绝对可靠,缺点是比较耗时,且可能无法覆盖真实用户提问的全部方式。
方法二:从真实用户日志中抽样+人工校订
适合系统已运行一段时间的场景,能更准确反映用户实际需求。
- 收集历史提问数据:对用户问题做清洗,去掉涉及个人隐私、过于模糊或明显恶意的问题。
- 聚类并选择代表性样本:按问题频次和语义相似度进行聚类,从每个类中抽取 1–2 个典型问题,确保数据集覆盖主要问题类型,同时避免冗余。
- 人工撰写标准答案:让业务专家对照知识库,为每个采样问题编写最准确的回答,并标记来源。如果某些问题目前在知识库中找不到答案,也可作为知识缺口记录下来,但不适合直接纳入评估集(除非要测试系统明确拒绝回答的能力)。
- 标注难度标签(可选):可给问题附加“简单/中等/困难”标记,方便后期分层分析性能。
这种方法投入产出比很高:标注的每个问题都来自真实场景,能更真实地反映系统在实际用户眼中的表现。
方法三:使用 LLM 辅助生成,人工审核修正
适合已有较完整知识库,但缺少人力大规模编写问答题的场景。
- 从知识库中抽取代表性 chunk:按文档分布均匀选取一批片段。
- 用 LLM 根据每个片段生成多个假想问题:例如提示词“请根据以下文档内容,生成 3 个用户可能会提出的问题,要求风格不同”。建议为每个片段生成 3–5 个问题。
- 使用片段本身作为标准答案:此时标准答案就是原文片段,或由 LLM 生成一段基于该片段的简洁回答。
- 人工复核:这是关键步骤,必须检查生成的问题是否合理、答案是否准确,剔除不恰当或过于生僻的条目。
这种方式能快速扩增数据集规模,但必须投入人工审核,否则可能把 LLM 的错误问题当成评估基准,导致后续评估失去意义。
10.4.3 黄金标准集的制作标准
无论用哪种方法,黄金标准集的质量直接决定了评估的可靠性。实践中需把握以下几点:
- 准确性绝对优先:标准答案中的每一个事实都必须与知识库原文一致,不能有模糊、歧义或编造。标注者需要逐条核对。
- 答案形式统一:是提供完整句子回答,还是仅提供要点清单?确定一种格式,并在整个数据集中保持,以免评分标准不一致。
- 独立性:评估集不能与系统开发和调优过程中使用的测试样本重叠,否则会导致“过拟合”评测,性能虚高。
- 定期更新:知识库变化后,相关标准答案也应同步更新。建议将黄金标准集与知识库版本关联,每次重大知识更新都触发一次复核。
10.4.4 数据集的规模与分层建议
- 最小可行规模:如果资源有限,优先保证 50–100 条高质量人工标注。可以先覆盖最关键的 3–5 个业务域,每个域约 20 条。
- 推荐规模:200–500 条,能提供稳定的评测指标,同时人工维护成本可控。
- 分层策略:按知识类型(手册、FAQ、合同条款)、问题难度或业务线分层,确保每个重要子集均有足够样本,便于在评测报告中发现薄弱环节。
10.4.5 一个真实的构建示例
某制造企业为内部售后助手构建评估集,采用了方法二:
- 从一个月内的客服提问日志中,导出 2000 条脱敏后的问题。
- 用文本聚类工具将问题归纳为 45 个类别,如“保养周期”“故障代码解读”“配件编号查询”等。
- 每个类目选取 2 个出现频率最高的问题,合计 90 个问题。
- 三位资深售后工程师根据最新的维修手册和通函撰写标准答案,并标注引用文档片段 ID。
- 人工交叉核对,确保答案与文档一致。
- 最终形成一份 90 条问题的黄金标准集,涵盖 45 个知识点。
后续每次模型或检索策略调整时,都用这 90 条问题自动跑一遍评估,输出事实准确率、召回率等指标。这种方法让他们在快速迭代中始终能客观把握系统真实水平。
构建高质量的评估数据集确实需要前期投入,但它是所有优化工作的“指南针”。没有它,就只能凭主观感觉判断好坏;有了它,每一次调整都能得到明确的方向反馈,从而高效地将 RAG 系统打磨到生产级水准。