人人都会AI编程

19.3 多模态嵌入与跨模态检索

更新时间:2026-07-12

前面的章节主要围绕纯文本的检索增强生成展开,但在真实业务中,知识往往不只存在于文字中。产品图片、架构图、演示视频、音频会议记录,这些非文本信息同样承载着关键知识。多模态嵌入与跨模态检索,就是将 RAG 的能力边界从文本扩展到图像、音频甚至视频,让系统能够跨越不同信息形态进行统一检索和增强生成。

19.3.1 从文本嵌入到多模态嵌入

在文本 RAG 中,我们使用嵌入模型将文本片段映射到向量空间,使语义相近的内容向量距离更近。多模态嵌入则更进一步:用一个统一的嵌入空间来表示不同类型的数据。例如,一段描述“红色运动鞋”的文字,和一张红色运动鞋的图片,在这个空间中的向量位置应该非常接近。

实现多模态嵌入的常见做法是使用多模态模型,如 OpenAI 的 CLIP(Contrastive Language–Image Pre-training)。这类模型在训练时同时学习图像编码器和文本编码器,通过对比学习让配对的图文在向量空间中对齐。类似的技术也逐步扩展到音频、视频与文本的对齐。

19.3.2 跨模态检索:用任意形式查找任意内容

多模态嵌入直接催生了跨模态检索:用户可以用一种模态的查询,去检索另一种模态的数据。

  • 文搜图:输入“退货流程示意图”,检索到知识库中的流程图或界面截图。
  • 图搜文:上传一张设备报错界面的照片,检索到对应的故障排查文档或维修手册。
  • 文搜音/视频:输入“年度战略会中关于新品发布的讨论”,直接定位到某段视频或音频的对应时间点,并进一步获得文字转录内容用于生成。

在 RAG 流程中,跨模态检索扩展了“知识库”的定义。原先只能被索引的文字材料,现在扩大到图片、音视频的嵌入表示。检索到的多模态结果可以在生成阶段被引用,或者先被转成文本描述后再提供给模型。

19.3.3 给 RAG 系统带来的实际提升

将多模态检索引入 RAG,可以解决纯文本方案无法覆盖的几类需求:

  1. 回答需要视觉依据的问题

技术支持场景下,用户问:“这个错误灯亮了怎么处理?”系统可以检索到仪表盘上对应指示灯的照片和维修步骤文档,生成图文并茂的回答,甚至直接在答案中嵌入那副图。

  1. 利用非文本资产丰富答案

市场团队询问某个产品卖点时,除了产品说明文档,还可以同时检索到宣传视频片段和发布会 PPT 截图,全面支撑内容创作。

  1. 自动化处理非结构化富媒体知识

企业积累的大量视频培训材料、会议录像,通过音视频转写和关键帧提取,构建多模态索引,让这些沉睡资产也能被问答系统有效利用。

19.3.4 落地时的关键技术点

  • 索引构建

需要为每种模态选择或训练对应的编码器。对于图像,可以使用 ViT(Vision Transformer)或 CNN 模型;对于音频,可以先转写文本然后同时对音频做声学嵌入。所有模态的向量最后存入支持多模态的向量数据库(如 Milvus、Weaviate 等),并保留原始的元数据(文件路径、时间戳等),便于回溯和展示。

  • 检索策略

常见做法是分别对多模态查询进行编码,然后在混合索引中做相似度搜索,返回跨模态的结果。也可以增加重排序步骤,结合元数据过滤(如时间范围、文件类型)提高精准度。

  • 生成阶段的融合

检索到的图片、视频帧不会直接塞给文本型大模型。通常的做法是:将图像通过视觉理解模型(如 GPT-4V)生成一段文字描述,或者直接提取视频的字幕、音频转录文本,然后把这些描述作为上下文片段送给生成模型。这样,生成模型仍然只需要处理文字,却间接利用了多模态信息。

  • 成本和延迟考量

多模态嵌入的计算量显著大于纯文本,尤其是视频多帧处理和音频长序列。实际落地中可以考虑有损的提前策略:对视频只提取关键帧,对音频先用轻量级 ASR 转写,主要对文本做嵌入,在必要时才对原始非文本媒体做精细索引。

19.3.5 真实场景示例

某工业设备厂商的售后服务知识库使用了 RAG。维修工程师在现场通过手持终端拍摄故障设备的局部照片,系统自动将照片编码为向量,跨模态检索到设备手册中相似的结构图以及对应的维修步骤文字说明。同时,系统还能从历史维修视频中定位到相同维修操作的教学片段,生成回答:“您遇到的问题很可能与传动皮带磨损有关,请参考以下步骤更换皮带。”并附带结构图和视频链接。整个过程无需工程师手动输入复杂的故障描述,极大缩短了维修时间。

多模态嵌入与跨模态检索让 RAG 从“文字问答”走向真正的“富媒体知识服务”。它并不需要颠覆已有的检索增强框架,而是在嵌入层和索引层做合理扩展,让知识库能够容纳更多真实世界的信息形态。