前面章节介绍的标准 RAG 流程——“接收问题 → 检索 → 整合资料 → 生成答案”——能很好地处理单轮、事实性、边界清晰的问答场景。但现实中,越来越多的问题无法用一次检索、一次生成就彻底解决。比如:
- “先查一下上季度销售额,再对比去年同期,如果下降超过10%,帮我列出主要流失客户的清单。”
- “根据这份合同草案,先找出违约责任条款,再转成简洁的表格,最后用邮件草稿的形式发给法务。”
这类任务涉及多步推理、工具调用、计划与执行,需要的不再是“回答的机器”,而是一个能够拆解任务、调用外部工具(包括检索、计算、API)、根据反馈调整行动的智能体。将 RAG 的输出能力与 Agent 的行动能力融合,便形成了能应对复杂业务流的 RAG + Agent 架构。
20.1.1 什么是 Agent,为什么需要与 RAG 融合
Agent(智能体) 是一个能够感知环境、自主规划并执行动作以达到目标的软件实体。在大语言模型应用领域,Agent 通常由大模型驱动,核心能力包括:
- 任务分解:将复杂意图拆解成多个可执行的子任务;
- 工具使用:决定何时调用检索、计算器、数据库查询、发邮件等外部工具;
- 记忆与反思:保持对话状态,根据上一步结果调整下一步计划。
RAG 擅长的是“基于资料准确回答问题”,而 Agent 擅长的是“编排流程、多步执行”。两者天然互补:
- RAG 为 Agent 提供可信信息的获取能力,让每个行动步骤都能基于最新业务数据。
- Agent 让 RAG 从被动回答升级为主动完成任务,能够串联多个检索、分析、操作步骤,真正跑通端到端业务流程。
融合后的系统不再是“你问它答”,而是“你说目标,它设计方案并执行”。
20.1.2 融合架构的典型模式
在实践中,RAG + Agent 的融合通常采用 Agent 作为调度中心,RAG 作为核心工具之一 的设计。架构示意如下:
用户输入 → Agent(大模型驱动)
│
├─ 理解意图,制定执行计划
│
├─ 调用各种工具:
│ ├─ RAG 检索工具(查知识库、查政策、查产品信息)
│ ├─ 数据库查询工具(查订单、查报表)
│ ├─ 计算工具(执行统计、比较)
│ ├─ 外部 API(发送邮件、创建工单)
│ └─ 其他自定义工具
│
├─ 汇总工具返回结果,综合生成回复或执行后续动作
│
└─ 返回最终答案或操作结果给用户
Agent 作为大脑,反复循环“思考 → 行动 → 观察 → 思考”,直到任务完成。RAG 在此过程中扮演“企业内部知识查阅员”的角色,按需为 Agent 提供精准的文档依据。
20.1.3 一个真实多步场景:合同审阅与行动生成
某公司法务部每天接收大量供应商合同,需要完成:识别关键条款 → 比对内部标准条款库 → 标注差异 → 生成评审意见邮件。
传统 RAG 能做到“根据合同库回答某个条款是否合规”,但无法自动串联全过程。融合 Agent 后,流程变为:
- Agent 分解任务:第一步读取上传的合同文件,第二步检索公司标准合同条款库,第三步对比差异,第四步起草邮件。
- Agent 调用工具:
- 先调用“文档解析工具”提取合同内容;
- 调用 RAG 检索工具,以提取的条款为 query,从标准条款库中找回对应的公司模板条款;
- 调用“文本对比工具”或直接用大模型对比差异,生成差异清单;
- 调用“邮件草拟工具”(或模板拼接),生成包含差异说明和建议的邮件文本。
- Agent 整合输出:将邮件草稿呈现给用户,同时附上差异来源(引自哪份标准条款),用户可以一键发送或再做修改。
整个过程无需人工在多个系统间切换复制粘贴,不仅提效,还保证了每一步都有据可查。
20.1.4 融合架构带来的核心提升
- 从“查询”到“闭环执行”:不只返回信息,还能基于信息完成后续操作(发邮件、建工单、更新数据库),直接产出业务结果。
- 处理模糊或探索性问题:用户不必把问题表述得非常精准,Agent 可以通过多轮检索、对比、追问来逐步明确意图,就像一位有经验的同事。
- 动态路由与自适应检索:Agent 根据当前需要决定检索哪个知识库、用什么检索策略(关键词、向量、结构化查询),甚至可以先检索元信息再决定深度检索。
- 可审计的决策链:因为 Agent 的每一步动作(包括调用了哪些 RAG 查询、使用了哪些工具)都会被记录,整条决策路径可以完整回放,便于合规审查和出错排查。
20.1.5 落地建议与注意事项
- 从简单场景起步:先选择一个多步但规则明确的任务(如“查政策+计算费用+生成通知”),验证融合流程的可靠性,再扩展到更复杂的自主决策场景。
- 工具定义保持原子化:每个工具只做一件事(检索、计算、发信等),方便组合与调试。RAG 检索工具应返回结构化的片段+来源信息,让 Agent 能准确引用。
- 增加安全检查点:在执行高风险动作(如发送邮件、修改数据)前,Agent 应向用户确认,或通过规则引擎拦截不符合权限的操作。
- 监控与回退机制:记录每步的工具调用和结果,当 Agent 走错分支时,可以人工干预或让 Agent 自行根据错误信号重试。
将 RAG 坚实的知识基础与 Agent 灵活的编排能力融合,正是当前企业应用从“智能问答”迈向“智能行动”的关键演进。它让大模型不再只是一个被动的信息提供者,而是成为真正能分担复杂工作的数字员工。