在第 1.3 节中,我们将多模态能力列为大模型的核心能力边界之一,并指出其技术实质是“将图像或音频通过独立编码器打成 Token,与文本 Token 拼接后进行联合接龙”。但那是 2023–2024 年的主流方案。进入 2025 年,行业正在向更深层的目标冲刺:不再把视觉、听觉当作“外挂插件”,而是让它们与文本在同一个原生框架中被平等对待。
本节回答三个问题:当前技术走到了哪一步?统一架构在工程上意味着什么?对开发者的实际影响是什么?
一、从“拼接式多模态”到“原生多模态”
第一阶段:外挂式多模态(2023 年前后)
这是 GPT-4V、早期 Gemini 和开源 LLaVA 系列的共同范式:
- 图像/音频经独立编码器(如 ViT、Whisper)抽取特征;
- 特征向量通过一个“投影层”(通常是简单的 MLP)映射到文本 Token 的向量空间;
- 拼接进 LLM 的输入序列,文本模型“看到”这些向量,完成跨模态理解。
优点:可以复用已有的纯文本 LLM,开发成本低,效果立竿见影。
致命局限:视觉/音频信号本质上被当作文本 Token 的“二等公民”——它们必须经过降维才能被文本模型消费,大量细粒度信息在这个过程中被不可逆地丢弃。1.3 节所说的“细粒度感知缺失”(忽略背景小字、无法精确定位空间关系)正是这一架构的先天性缺陷。
第二阶段:原生统一架构(2024–2025 年,进行中)
代表方向是 Early Fusion(早期融合) 与 Next-Token Prediction on Everything:
- 不再把图像压缩后塞给文本模型,而是让 Transformer 从输入层就同时处理原始的多模态信号;
- 图像被切分成 Patch 后,与文本 Token 以同等地位进入注意力计算(如 LLaVA-OneVision、Gemini 2.0);
- 更进一步的方向是“一切皆 Token”——视频帧、音频频谱、传感器数据、UI 截图,全部统一为同一种序列格式,由同一个 Transformer 进行自回归预测。
这一架构的终极愿景是:无论输入什么模态的信息,输出什么形态的内容,底层都只跑一套模型参数。Google Gemini 2.0、OpenAI GPT-4o 和 Meta 的 Chameleon 系列都在朝这个方向推进。
实用判断标准:
- 是否原生支持多模态交叉注意力:早期融合模型能看到“图里的哪部分对应了这句话”,而非文本先“看”完整张图再回答问题;
- 是否统一词表:原生模型往往为图像 Patch、音频片段分配独立的 Token ID(或专用向量空间),而非强行映射到文本 Token;
- 是否重建信号:部分架构在训练时加入跨模态重建损失(如根据文本描述重建图像 Patch),迫使模型内在建立更精确的“概念-像素”映射。
二、视频理解:时间维度的加入
将“理解图片”升级为“理解视频”,问题复杂度提升了一个数量级。视频不再是单帧的图像集合,而是附带时间顺序的动态语义流。
当前主流技术方案:
| 方案 | 做法 | 效果与成本 |
|------|------|-----------|
| 关键帧采样 + 图片理解 | 从视频中抽取若干帧,用图文模型逐帧理解,再总结 | 能回答“场景中有什么”,但无法理解“动作顺序”和“因果时序” |
| 视频 Tokenization | 用 3D 卷积或时空 Transformer 把视频切分成时空 Patch | 保留更多时序信息,但计算量与帧数成正比,成本极高 |
| 音频-视觉-文本联合 | 画面 Token + 音频频谱 Token 同时输入,跨模态注意力 | 最接近“人类看视频”的体验,但工程复杂度最高 |
实用认知:
- 长视频(30 分钟以上)的全量理解,在 2025 年仍然是算力密集型任务。大多数商业产品(如 GPT-4o、Gemini 2.0)采用滑动窗口 + 摘要递归的折中方案——先分段理解,再把摘要拼接起来。
- 时序因果推理是短板:即使原生多模态模型,对“他先打开水龙头,然后去拿杯子”这种动作顺序的精确判断,准确率仍显著低于人类。这是视频 Agent 尚未大规模落地的核心瓶颈。
三、音频与语音:从 ASR 到原生理解
2025 年以前,语音交互是一条长链:ASR(语音转文字)→ LLM(理解+生成)→ TTS(文字转语音)。OpenAI 的 GPT-4o 首次将这条链压缩进单个模型——直接输入语音,直接输出语音。
技术实质:
- 语音被编码为频谱特征 Token,与文本 Token 共同训练;
- 模型学会的不只是“听懂文字”,还包括语气、停顿、情感色彩、背景音等副语言信息;
- 输出时直接生成音频 Token(而非先生成文本再调用 TTS),延迟大幅降低。
实用边界:
- 方言、多语混杂仍是挑战。训练数据中标准英语/中文占比过高,导致对真实世界中不标准的语音输入鲁棒性不足;
- 音频幻觉:模型可能在噪声中“听”到不存在的词语(与文字幻觉类似);
- 隐私风险:原生音频模型能提取大量个人信息(性别、年龄、情绪状态),这对应用落地时的合规性提出更高要求。
四、生成端:从“图+文”到“统一输出”
多模态的另一个方向是生成。DALL·E、Stable Diffusion、Sora 等模型解决了图像/视频生成问题,但它们与 LLM 是分离的。
2025 年的统一趋势:
- Autoregressive Image Generation:不再用扩散模型,而是将图像也视为 Token 序列(类似文本),由同一个 Transformer 逐块生成。代表:Meta 的 CM3Leon、OpenAI 的早期探索。
- Any-to-Any 模型:一个模型接收任意模态的输入(图+文+音频),输出任意模态的内容,且模态之间的转换通过统一 Token 空间完成,无需多个子模型的流水线拼接。
实用影响:当生成端也收敛到统一架构,整个系统将简化为“一个输入编码器 + 一个 Transformer + 一个输出解码器”。对开发者而言,这意味着:
- 无需为不同模态部署多套推理服务;
- 多模态 Agent 可以同时规划“生成一段文字 + 绘制一张示意图 + 输出一句语音提示”;
- 但代价是模型本身的参数量会进一步膨胀,单次推理的资源消耗远高于纯文本 LLM。
五、对开发者的实际影响与选型建议
现状(2025 年初):
- 多模态理解(图生文、视频摘要、图表问答)已经生产可用,且 API 成本持续下降。GPT-4o、Gemini 2.0 Flash、Qwen-VL-Max 等是首选;
- 原生音频/视频全量理解仍处于“准生产”阶段——能做 Demo,但成本和延迟还难以支撑高并发商业场景;
- 统一生成远未成熟,Any-to-Any 模型更多是科研前沿,暂无开箱即用的工业方案。
选型决策树:
| 你的场景 | 推荐方案 | 原因 |
|---------|---------|------|
| 图文理解(OCR、图表、截图) | GPT-4o / Gemini 2.0 / Qwen-VL-Max API | 成熟度高,成本可控 |
| 视频内容简要摘要 | 同上 API 的视频模式 | 30 分钟内视频效果可用 |
| 长视频精细分析(监控、体育裁判) | 分段模型 + 专家系统 | LLM 无法处理单帧级别的时序定位 |
| 语音助手(低延迟交互) | GPT-4o 语音模式 / 专用 ASR+LLM+TTS 链 | 原生语音模型延迟优势明显,但云服务可用性待观察 |
| 多模态 Agent(同时看图、读文档、操作软件) | GPT-4o / Claude 3.5 + RAG 框架 | 图文输入能力已足够,核心瓶颈在 Agent 规划而非感知 |
| 本地端侧多模态 | Qwen2-VL-7B / LLaVA-NeXT 微调 | 7B 级别模型可在 RTX 4090 运行,垂直场景够用 |
关键提醒:
- 不要被“原生多模态”概念绑架。如果你的业务只看图识字、做 OCR,GPT-4V 级别的拼接式多模态已经足够,等待“全原生架构成熟”是过度优化;
- 关注推理成本。视频理解消耗的 Token 量是纯文本的数十倍甚至百倍,一个小时的视频分析可能花掉几百元 API 费。在生产中必须评估 ROI;
- 垂直场景优先微调小模型。通用多模态 API 在医学影像、工业质检等专业领域表现远不如专用模型,这与纯文本微调的逻辑一致(见 2.2 节和 10.2 节)。
六、展望:统一架构进入“语言”不再是特权
多模态统一架构的终极形态,正在重新定义“语言”这个词——从“人类自然语言”扩展到“一切可被序列化编码的信号”。当图像的像素块、音频的频谱片段、视频的时空 Patch、机器人的关节角度、传感器的读数都可以被统一 Token 化并输入同一模型时,Transformer 将从一个“语言模型”蜕变为 “世界模型”(World Model)。
但 2025 年的开发者需要冷静:这条路的技术债远未偿还完毕。在可以预见的两年内,“图+文”将成为标配,“视频+音频”将逐步成熟,而“任意模态 in, 任意模态 out”的统一模型,仍然处在从实验室走向工程化的第一步。
这意味着,你在设计产品和技术栈时,应该用多模态扩展业务边界,但用纯文本守住核心逻辑——最稳的系统架构,仍然是“文本负责推理与决策,多模态负责感知与表达”。这一点,在 1.3 节组合策略表中就已埋下伏笔。