RAG 系统从知识库取回资料并生成答案后,并不意味着就可以直接推送给终端用户。在真正面对员工、客户或公众之前,还需要经过一道关键的安全关卡——内容安全校验。它的职责是确保最终输出的内容不仅“答得对”,而且“不出事”。
在很多生产环境中,这道关卡不是可选项,而是准出底线。尤其在金融、政务、医疗等受强监管的行业,一条不合规的回答可能直接触发合规风险、泄露敏感信息甚至引发舆论危机。因此,答案合规校验与敏感内容拦截是 RAG 落地闭环中必不可少的一环。
24.2.1 答案合规校验的核心场景
答案合规校验的目标很明确:保证模型输出在业务规则、法规要求和企业准则的框架内。常见需要校验的维度包括:
- 事实合规
金融产品推荐是否擅自承诺收益?“本产品年化收益不低于 5%”这样的绝对化表述即使基于知识库原文,也需要被拦截或改写。校验模块可以识别包含收益承诺、保本等违规则表述的句式。
- 法律一致性
合同条款解读不可与现行法规冲突。比如一份过期的合同解释文档可能还在知识库中被检索到,校验层需要对比法规库,对存在冲突的语句打上风险标记,必要时阻断输出或强制回退到合规话术。
- 公司内部政策对齐
内部 HR 助手回答“加班工资怎么算”时,必须严格匹配最新工时管理制度,不能出现已经被废止的老标准。这可以通过维护一份结构化政策摘要,与生成答案进行关键要素比对来实现。
24.2.2 敏感内容拦截的实施方法
敏感内容拦截主要防止输出中出现违法违规、有害、侵犯隐私或违背伦理的内容。它通常以规则匹配和模型检测相结合的方式完成。
1. 关键词与正则过滤(基础防线)
这是最直接有效的手段。维护一份敏感词和正则表达式清单,在生成环节之后、返回用户之前执行快速扫描。清单内容可按企业需求定制:
- 涉黄、涉暴、政治敏感词:这一部分可以对接通用敏感词库,针对中国境内业务也可以参考监管部门发布的词汇范围。
- 隐私信息模板:手机号、身份证号、银行卡号、家庭住址等可用正则精准匹配。即便知识库中不慎含有脱敏不彻底的文本,这一层过滤也能兜底。
- 内部机密指标:比如项目代号、未公开的财务数字等。只要在清单中,就能被高效拦截。
由于过滤是对最终文本做字符串检查,延迟极低,适合作为第一道关口。
2. 安全意图识别模型(语义防线)
关键词匹配无法处理变体、换说法、上下文诱导等复杂情形。因此较完善的系统会接一个轻量级文本安全分类模型,判断整段回答是否含有恶意、违规或不适内容。常见做法:
- 使用预训练的安全审查模型(如一些开源的风控模型)进行二分类或多分类;
- 针对垂直领域微调小模型(如仅检测金融误导话术或医疗夸大宣传),降低误杀率。
在实践中,通常会设计一个“双通道”方案:先规则快速过滤,不确定的、低置信度的内容再走模型判断,做到效率与准确性平衡。
3. 关键词遮罩与改写(柔性处理)
对于部分可修复的轻微违规内容(例如用词过于绝对、语气不当、出现合规模板外的免责声明),不必简单粗暴地阻断。可采用自动改写策略,让模型在安全委员会配置的约束下重新生成或修订相应片段,再走一次校验流程。这需要配合提示词工程,将原始不合规回答和修改要求一起提交,生成修正后的版本。
24.2.3 整体校验流水线与真实案例
通常将内容安全做成一个独立的“安全网关”微服务,置于 RAG 生成模块之后、前端接口之前。请求流程如下:
- LLM 生成原始回答;
- 原始回答进入安全校验服务:
- 执行正则过滤:命中阻断级敏感词则直接返回预设话术(如“抱歉,我无法回答这个问题”);
- 若无阻断,调用安全分类模型打分;
- 若分数落在待审区间,触发人工复核或自动改写策略;
- 校验通过的回答返回前端,并附上校验日志;未通过的进入异常处理通道。
真实案例:某银行内部知识库助手上线初期,遇到知识库中一份旧版培训材料包含已取消的理财产品推荐话术,生成回答里出现了“收益稳健、保本保息”的表述。安全网关通过正则匹配到“保本保息”这个违禁短语,直接阻断了这条回答,并将日志推送给知识库管理员。管理员据此定位问题文档并立即下架,同时更新了敏感词库。
24.2.4 实施中的实用建议
- 从需求出发建词库,不求全:优先覆盖业务场景中真正敏感的类型,避免过度过滤导致正常回答被误杀。可先以正则为主,快速上线,再逐步引入模型。
- 分级处置,而非一刀切:明确哪些内容必须阻断,哪些可以提醒用户注意,哪些只需记录日志以备审计。设计合理的话术返回策略,避免因“硬拦截”把用户体验打到谷底。
- 闭环监控与反馈:所有被拦截或者被用户举报的回答,都应记录完整上下文,定期由运营或合规团队复盘,优化规则和知识库。这正是系统持续变安全的关键。
- 与知识库维护联动:很多合规问题根源在知识库内部。安全校验的输出可以反向驱动知识审核,形成“生成防护 + 源头治理”的双保险。
内容安全绝非可有可无的附加组件,而是让 RAG 从“能答”走向“敢用”的最后一块拼图。通过灵活搭配规则、模型与人工审核,可以在保障安全合规的前提下,尽可能保留回答的完整性和帮助性。