人人都会AI编程

指令强化、格式约束、引用要求

更新时间:2026-07-12

在 RAG 系统中,检索模块负责找到相关材料,而生成模块负责将这些材料转化为用户能直接使用的答案。为了让模型严格按照给定材料作答、不随意发挥,同时保持输出风格统一、便于后续处理,需要在提示词中对模型提出明确的指令强化、格式约束和引用要求。这三者是保证回答质量和可用性的关键。

1. 指令强化:明确“可以用什么,不能做什么”

指令强化的核心,是清晰告诉模型它的角色、行为边界和任务目标。有效的系统指令通常包含以下几点:

  • 角色设定:例如“你是一个基于公司内部知识库回答问题的助手”。角色设定帮助模型理解回答的语境和专业程度。
  • 信息来源限定:明确指出只能使用提供的资料,如“请严格根据以下参考资料回答问题”。如果不做此限制,模型仍可能调用其训练参数中的通用知识,从而引入无关或过时信息。
  • 边界行为定义:当资料信息不足时,规定模型应如何回应。常见做法是要求模型明确说“在现有资料中未找到相关信息”,而不是猜测或硬凑答案。这样从机制上遏制了因检索失败而引发的幻觉。
  • 禁止行为列举:例如“不要添加参考资料中没有的细节”“不要使用主观推测”“不要编造日期或数字”。明确否定项更能让模型精确理解行为底线。

示例片段

你是一个专业的客服助手,只能根据下方【参考资料】中的内容回答问题。如果资料信息不足以回答,请回复“很抱歉,我暂时无法根据现有资料确认,请提供更多信息或联系人工客服”。禁止引用任何培训数据中的外部知识,禁止随意推断。

2. 格式约束:让回答结构化、可处理

即使模型回答内容准确,如果格式混乱,也不利于用户快速获取信息或后续系统解析。常见的格式约束包括:

  • 回答结构:要求模型按“要点式、分条列出”或“先给结论,再展开细节”的方式组织语言。例如:“请按要点逐条回答,每条不超过两句话,并在前面加上序号。”
  • 字段化输出:在某些自动化场景中,可能需要模型输出 JSON 或其他结构化数据,便于程序直接提取结果。此时需明确格式,如“只输出 JSON,不要添加解释或其他内容”。
  • 长度控制:限制回答的篇幅,或要求摘要化,避免不必要的冗长。
  • 语言风格:如“使用正式商务中文”“语速平稳、面向非技术用户”等。

示例片段

回答格式要求:
1. 先简要总结核心信息,不超过 20 字。
2. 然后分点列出支持该结论的详细说明,每条前面加“-”。
3. 最后附上引用来源,格式为【来源:文档名称,章节/条款】。

3. 引用要求:让回答可追溯、可验证

RAG 天然可以给出信息来源,但必须通过提示词要求模型显式引用,否则模型可能不会自动加上引用标注。引用要求的具体设计可以包括:

  • 引用位置:要求在每一条事实性陈述后紧跟引用标记,或在回答末尾集中列出所用材料。
  • 引用格式:统一使用方括号、书名号或特定符号,便于前端渲染为链接。例如“《员工手册》第 3.2 节”。
  • 引用内容:指定模型从系统提供的来源标识(如文档名、章节、页码、更新时间)中提取哪些字段。一般传递给模型的上下文中已经带有这些元数据,只需要求模型引用即可。
  • 一致性检查:可提醒模型“每条重要事实都应有引用,如果不确定出处,请勿引用”。

示例片段

每一条回答中涉及的关键规定、数据或条款,必须在句子末尾用括号注明来源,格式为:【《文档名称》,第 X 条】。如果参考资料中没有明确出处,不要编造引用。

4. 组合使用,形成稳定的生成基线

这三者不是孤立的,实际部署的提示词会将其融为一个完整的“系统提示”,并在每次调用时拼接检索结果和用户问题。好的组合示例如下:

你是一个严格基于资料回答的助手。请遵守以下规则:

1. 只能根据【参考资料】回答,资料不充分时回复“当前资料无法回答该问题”。
2. 回答结构:先给出一句话核心结论,再逐条说明依据,每条前面加“-”。
3. 每一条依据必须在末尾用【来源:<文档名>,<章节>】标注出处。
4. 不得增加资料中没有的信息,不得猜测。

【参考资料】
{{retrieved_chunks}}

通过这种设计,模型的行为被约束在可预期的轨道上:它不会大胆想象,只会忠实复述;它的回答格式规整,便于用户阅读;它的每一条结论都可以被追溯到原文,满足了合规和质量管理的要求。实践表明,清晰且强力的指令、格式与引用约束,能将一个通用模型的可靠性提升至企业可接受的水平,成本远低于微调。