人人都会AI编程

人工评估:评分标准、标注规范

更新时间:2026-07-12

在 RAG 系统的质量保障体系中,自动化指标(如检索命中率、答案相似度)能快速发现明显问题,但想要真正判断“这个回答对用户有没有用”,离不开人工评估。人工评估不追求自动化指标的大规模覆盖,而是聚焦于回答的真实质量、可读性和业务适用性,为系统调优提供方向性指导。

1. 为什么人工评估不可或缺

RAG 系统的输出是自然语言,而自然语言的质量评判通常比较主观。以下问题很难用自动化方式完全解决:

  • 回答的逻辑是否通顺、表达是否自然?
  • 在信息不完整时,系统的回复是否得体、提供了有用引导?
  • 在某些高风险场景(如医疗、法律),回答是否存在潜在误导?

人工评估通过小量但深度的抽样,能捕获到自动化指标遗漏的质量细节,也为自动化评估的优化提供“金标准”参照。

2. 评分标准设计

好的评分标准需要明确、可操作、覆盖多重质量维度,同时避免过于繁琐导致标注员疲劳和一致性下降。实战中常用的是 1–3 或 1–5 的等级评分,以下是一个实用范本:

| 维度 | 说明 | 评分指引 |
|------|------|----------|
| 准确性(Accuracy) | 回答内容是否与提供的事实来源(检索到的片段)一致,是否有编造或遗漏关键信息。 | 3 分 – 所有关键事实均与来源一致,无编造、无歪曲。<br>2 分 – 大部分事实正确,但存在个别轻微偏差或遗漏。<br>1 分 – 存在明显事实错误、编造内容或关键信息缺失。 |
| 完整性(Completeness) | 回答是否涵盖了用户问题所需的全部要点。如果问题复杂,是否给出了充分解释。 | 3 分 – 全面覆盖问题所有方面,无重要遗漏。<br>2 分 – 覆盖了主要方面,但忽略了一些次要或补充细节。<br>1 分 – 回答片面,大量关键信息缺失。 |
| 相关性(Relevance) | 回答是否紧扣用户提问,有无答非所问、过度引申或包含无关信息。 | 3 分 – 完全切题,无无关内容。<br>2 分 – 基本相关,但夹杂了少量不必要信息。<br>1 分 – 明显偏题,回答了另一个问题或包含大量无关内容。 |
| 可读性与实用性(Readability & Utility) | 表达是否清晰流畅,结构是否合理,用户能否直接使用回答解决问题。 | 3 分 – 表达清晰,易于理解,用户可直接据此行动。<br>2 分 – 基本通顺,但存在拗口或需要用户二次处理之处。<br>1 分 – 难以阅读或逻辑混乱,基本不可用。 |
| 溯源质量(Attribution) | 如果系统提供了引用或来源,引用是否正确对应了出处,是否有助于验证答案。 | 3 分 – 所有引用均准确对应原文,出处标注清晰。<br>2 分 – 大部分引用正确,个别引用指向错误或模糊。<br>1 分 – 引用大量错误或缺失,无法追溯验证。 |

使用建议:对于一般业务场景,准确性、完整性、相关性为必评维度;可读性和溯源质量可根据系统设计看情况评审。评分时应当以“对用户的实际帮助”为最终判断准则。

3. 标注规范

标注规范旨在让不同标注员对同一回答给出尽量一致的评分,减少主观性。一套好的规范应当包含:

  • 评分原则
  • 以用户视角评估,而非开发者视角。
  • 基于提供的检索材料(即“标准答案”),而不是标注员自己的知识。
  • 遇到模糊情况时,倾向给较低分并记录原因,便于后续分析。
  • 标注流程
  1. 阅读问题与检索到的上下文:标注员需明确系统当时能看到哪些资料。
  2. 阅读系统回答:对照上下文,逐条核对回答中每个事实声明是否有据可查。
  3. 独立打分:先在脑海中对各维度形成判断,再参考评分细则打分。
  4. 记录评语:当给出非满分(如低于3分)时,必须注明具体问题,例如“第2段中关于退款期限的表述与原文不符”。这些评语是后续优化的重要线索。
  • 校准与一致性
  • 在正式开始标注前,所有标注员需共同标注一批样本(建议 20~50 条),计算一致率。
  • 对于分歧较大的案例,集体讨论、统一认识后调整评分细则,再启动正式标注。
  • 正式标注过程中,可定期抽取部分样本(如 10%)进行双人标注,监测一致性。
  • 特殊情况处理
  • 检索失败(无相关片段):若系统正确表示“未找到信息”,准确性应评满分(因为它没有瞎编),但完整性可能较低,需结合场景判断。若系统强行编造,则准确性与溯源质量直接最低分。
  • 安全 & 合规:如发现回答存在明显安全隐患或违反公司规定,应设立独立的“安全否决项”,该回答整体标记为不合格,不受其他维度影响。
  • 非事实类问题(如“给我几个营销邮件标题”):侧重评估创造性和实用性,准确性维度可放宽。

4. 执行建议

  • 样本量:每周或每双周评估 100~200 条真实用户问题,基本能捕捉质量波动趋势。样本应当覆盖不同问题类型(事实查询、比较、指引、有歧义等),而不是随机抽取。
  • 标注员选择:优选熟悉业务领域的人员,他们更容易判断回答在真实场景中是否“可用”。如果条件有限,至少要进行最基本的领域知识培训。
  • 输出物:标注完成后生成报告,包含各维度均分、典型低分案例、分类统计(按问题类型或知识来源),直接指导改进检索策略、分块方式或提示词。
  • 与自动指标结合:人工评分可以作为自动评估模型的训练数据,也可以用来自动校验线上回答的质量抽查环节,建立更系统化的质量闭环。

人工评估虽然耗时,但它是确保 RAG 系统真正“好用”而不仅仅是“指标好看”的底线保障。开始时尽量简化评分表,确保标注员能轻松执行;随着对系统理解的加深,再逐步细化维度,这样的过程才会更真实有效。