人人都会AI编程

19.4 多模态答案生成:图文结合回复

更新时间:2026-07-12

在许多真实场景中,最佳的回答往往不是纯文字,而是图文并茂的说明——产品示意图、操作流程图、数据趋势折线图,都比冗长描述更直观。当知识库中包含图片、表格、截图等信息时,RAG 系统可以扩展为多模态答案生成,将文字说明与相关图片一同返回,真正实现“一图胜千言”。

1. 为什么需要图文结合回复

纯文字回答在某些问题上存在天然局限:

  • 操作指引类:如“打印机卡纸如何处理?”,一张标注了部件位置的示意图远比几百字的描述清晰。
  • 数据汇报类:如“上季度各区域销售额趋势”,一张折线图或柱状图能一瞬间传达变化规律。
  • 产品展示类:如“这款背包内部结构是怎样的?”,实物照片或内部隔层图示是用户最想看到的信息。

在这些情况下,文字负责解释“为什么”“怎么做”,图片负责展示“长什么样”“在哪里”,两者互补,能显著提高信息传递效率和用户满意度。

2. 多模态 RAG 的实现思路

传统 RAG 以文本切片为最小检索单元,多模态扩展的关键在于让图片也“可检索”,并在生成环节将它们融入答案。

整体流程:

  1. 图片预处理与索引

将文档中的图片提取出来,为每张图片生成文本描述(captioning)或提取图片中的文字(OCR),同时为图片本身生成嵌入向量(通过多模态嵌入模型,如 CLIP)。向量数据库中既存文本切片,也存图片切片,两者共享语义空间。

  1. 检索时召回图文片段

用户提问后,系统在向量数据库中同时检索文本和图片,召回相关度最高的前 k 个片段(可能混合文本和图片)。元数据中标记片段类型(text / image),便于后续组合。

  1. 生成图文混合答案

将检索到的文本片段与图片的 URL、描述文本一起,填入提示模板,让模型规划答案结构。模型输出不仅包含文字,还通过特殊标记(如 [IMAGE: url])指示在哪些位置插入图片。应用层解析这些标记,将图片渲染到最终回复中。

一个具体的例子

某设备厂商的售后知识库中,包含“更换滤芯”的步骤文档,文档中有连续的操作图。用户提问:“怎样更换净水器滤芯?”

  • 检索模块召回:① 文字步骤说明(文本片段)② 步骤一、二、三的图片(图片片段,带描述)。
  • 提示词要求模型:“请根据提供的文字和图片信息,生成分步骤的操作指南,并在适当位置引用图片。”
  • 模型生成回答:

> 更换滤芯步骤如下:
> 1. 关闭水源并拧下旧滤芯,注意逆时针旋转。【图片:关闭水源操作】
> 2. 取出新滤芯,撕掉保护膜,对准卡槽顺时针旋紧。【图片:新滤芯安装】
> 3. 打开水源检查是否漏水,运行冲洗 3 分钟。
>
> 具体操作请参考上方图示。

应用层解析标记,将对应图片插入到步骤旁边,用户看到的即是带图的操作指南。

3. 关键技术点与实用建议

  • 图片的“可检索性”是基础

仅依赖文件名或页数远远不够。强烈建议使用多模态嵌入模型(如 OpenAI CLIP、SigLIP 等)直接对图片生成向量,这样可以用自然语言问题直接搜索图片内容。同时保留图片的文本描述(OCR 结果、人工标注),作为备用检索通道。

  • 图片片段需携带上下文

单张图片脱离文档可能难以理解。索引时,可以把图片所在的段落文字一并作为元数据存储,或采用“父文档”策略:图片与周围文字属于同一大块,检索时一并召回,确保模型有足够信息来安排图片位置。

  • 生成时明确指示图片插入位置

在提示词中规定固定格式,例如“当需要展示图片时,使用 <img src='图床URL' alt='描述'/>”。这样应用层可以轻松解析并渲染,也方便前端做响应式适配。

  • 不要忽略图片的版权与安全

如果是面向客户的外部系统,确保知识库中的图片无版权问题;内部系统也需注意不要暴露涉密图片。同时避免直接返回图片原始地址可能引发 SSRF 等安全问题。

4. 多模态答案的实际价值

  • 降低理解门槛:特别是对非技术用户,图形化指引可大幅减少文字歧义。
  • 提升信任感:产品实拍、界面截图等增强了信息的真实性,用户更易相信。
  • 减少反复追问:一个带示意图的答案往往能一次性解决用户疑问,降低人工介入率。

在架构上,多模态 RAG 是文本 RAG 的自然延伸。它没有颠覆原有流程,而是在索引层和生成层分别加入了对图片的处理能力。对于知识密集型且图像资源丰富的业务(如设备维修、电商导购、医疗影像辅助),图文结合的回复能让整个系统的可用性跃升一个台阶。