Skip to content

多模态模型

本页速览 多模态模型能同时理解与生成文本、图像、音频、视频。本文讲透模态编码、CLIP 对齐、Q-Former 融合、统一 token 空间等核心技术路线,对比 GPT-4o、Gemini、Claude、Qwen-VL 等代表模型,并梳理模态幻觉、评测基准与应用场景。

本页含时效性内容,数据截止于 2025-06;JD、榜单、产品功能等信息可能已变化,引用前请核对原始出处。

多模态模型 ​

概念定义:让 AI 同时读懂图文声画 ​

多模态模型(multimodal model)是能同时理解与生成多种模态(文本、图像、音频、视频)信息的 AI 模型,如 GPT-4o、Gemini、Qwen-VL。它不是"一个模型加上读图的插件",而是从架构到训练数据都把多种模态当作一等公民的模型:同一个参数体系里,既装得下语言的语法与语义,也装得下图像的像素结构与物体关系、声音的节奏与情绪。

过去十年,AI 的发展呈现两条平行线:NLP 一路沿着 Transformer 走向大语言模型,CV 一路沿着卷积与 ViT 走向图像大模型,语音在 ASR/TTS 各自为战。多模态模型把这三条线缝在一起:一条输入管线同时吞下文字、图片、录音、视频,输出也横跨多种模态。对普通用户来说,最直观的变化是"AI 能看见、能听见了"——上传一张菜单照片就能问"帮我算人均",发一段语音就能得到语音回复。

今天的主流对话产品(ChatGPT、Gemini、Claude 等,见ChatGPT 与对话式 AI)几乎全部升级成了多模态入口。理解多模态模型,等于理解了下一代 AI 系统的默认形态。

为什么多模态重要 ​

现实信息天然是多模态的 ​

人类感知世界的通道从来不是单一文本:语言在大部分场景里只是现实世界的压缩编码,而图像、视频、语音才是信息的原始形态。一张手术影像、一段施工现场录像、一段婴儿啼哭的录音——这些信息要么无法文字化,要么文字化的代价极高。只处理文本的模型,天生只能看到世界的一道窄缝。

「全模态」是通往 AGI 的关键路径之一 ​

业内有一种共识(需谨慎表述):通用人工智能需要对世界有"全模态"的理解。人类智能的一个重要来源,正是把视觉、听觉、语言、触觉等多种信号在同一时刻整合成统一的心智模型——儿童学"苹果"这个词,同时看到形状、摸到质感、尝到味道。相应地,让模型接触多种模态、并学会跨模态迁移,被认为是逼近 AGI 的候选路径之一。当然,"全模态是否是 AGI 的充分条件"尚无定论,模态更多并不自动等于更强的推理能力,这只是众多前沿假说中的一个(详见什么是 AI 热门概念)。

人机交互的自然化 ​

文字输入是键盘时代的遗产,而多模态让交互回归人类本能:说话、指图、挥视频。实时语音对话让延迟从"打字+读字"降到接近真人对话(见语音 AI:Whisper 与 TTS),指着一张图提问比输入三百字描述高效得多。这不是体验优化,而是把 AI 从"打字机助手"变成"贴身同事"的关键一步。

维度纯文本 LLM多模态模型
输入文本 token文本 + 图像 + 音频 + 视频
输出文本文本 + 图像 + 音频(视频)
信息密度依赖用户文字描述直接吃原始信号,无损
使用门槛键盘自然语言 + 感官
世界建模文字中的世界感官中的世界

一句话判断

判断一个模型算不算"多模态",不看它能否生成图片,而看它的输入是否跨模态、是否用统一参数体系联合建模。纯文生图模型(如只做扩散生成)通常不算完整的多模态模型。

核心技术路线 ​

模态编码:把一切变成向量 ​

所有模态进入模型前,都要先被切成"数字碎片"并映射成向量。不同模态的"分词"方式完全不同:

模态编码器切分单元代表做法
文本tokenizer(BPE 等)subword tokenGPT、Llama 系列
图像ViT 视觉编码器固定尺寸 patch(如 16×16)CLIP-ViT、SigLIP
音频频谱编码器 / 采样编码器频谱帧或离散 tokenWhisper 编码器、HuBERT
视频帧级图像编码 + 时间建模帧序列 / 3D patchViViT、Video-LLaMA

文本侧沿用 Transformer 体系的 tokenizer;图像侧最有代表性的是 ViT(Vision Transformer):把一张图切成若干 patch,每个 patch 拉平成向量后当作"图像 token"送进 Transformer——ViT 本质上就是 Transformer,只是把 token 从"词"换成了"图像块"。这也是为什么 Transformer 统一了 CV 与 NLP:同一个注意力机制,既能对文字 token 建模,也能对 patch token 建模。

音频则有两种路线:频谱路线把波形转成梅尔频谱图(当图像处理),离散 token 路线把音频量化成声学 token(如 SoundStream 编码,语音大模型常用)。无论哪种,最终都落入同一个 Transformer 框架。

对齐与融合:让模态彼此听得懂 ​

编码之后是核心难题——把不同模态的表示放进同一个"语义空间"。历史上有三代主流做法:

第一代:双塔对比学习(CLIP) ​

2021 年 OpenAI 的 CLIP(Contrastive Language-Image Pre-training) 确立了图文对齐的范式:用图像编码器与文本编码器两个塔,各自把"图"和"图配文"编码成向量,然后通过**对比学习(contrastive learning)**拉近"正确配对"的距离、推开"错误配对"的距离。训练数据是 4 亿对互联网图文对,学完以后,图像向量与文本向量共享语义空间——"一只狗的照片"和"dog"两个向量彼此靠近。

第二代:视觉编码器 + 投影层(LLaVA) ​

2023 年的 LLaVA 把 CLIP 思路嫁接到 LLM 上:冻结一个 CLIP 视觉塔 + 一个大语言模型,中间用一层可训练的 MLP 投影层把图像特征映射到文本 embedding 空间,再用 GPT-4 生成的高质量指令数据微调,做出一个能"看图说话"的开源助手。Q-Former(BLIP-2 提出)则是另一种投影器:用一个轻量 Transformer 对图像特征做"查询式压缩",提炼出与文本最相关的若干向量,参数量更省。这一代模型被称为视觉语言模型(Vision-Language Model, VLM)。

LLaVA 式架构(对齐路线 2.0):

图像 ──→ CLIP-ViT ──→ patch 特征 ──┐
                                   ├──→ MLP 投影 ──→ [图像 token] ─┐
文本 ──→ tokenizer ──→ [文本 token] ─────────────────────────────┴─→ LLM(自回归生成)

第三代:统一 token 空间(GPT-4o) ​

2024 年的 GPT-4o 走得更远:所有模态统一转成 token,进入同一个神经网络。文本不再经过"投影"环节,图像、音频同样被切成 token 与文本 token 混合后一起做注意力——这让输入输出延迟降到平均 320 毫秒,接近真人对话节奏。Google 的 Gemini 则走"原生多模态"路线:从预训练一开始就在文本、图像、音频、视频上联合训练,而不是"先训文本 LLM 再加视觉头"。

路线代表优点代价
双塔对比学习CLIP(2021)训练数据易得、检索/对齐能力强只对齐、不生成,需配解码器
投影桥接LLaVA、BLIP-2(2023)复用成熟 LLM、开源可复现投影层损失信息,跨模态推理弱
统一 tokenGPT-4o、Gemini(2024)端到端、延迟低、能力均衡训练数据与算力要求极高

架构脉络

从 CLIP 到 LLaVA 到 GPT-4o,实质是对齐越来越深入:CLIP 只对齐两个编码器,LLaVA 把视觉特征"塞进"语言模型,GPT-4o 干脆让所有模态原生共享一套参数。理解这条脉络,就理解了多模态模型十年的设计主线(对照阅读总体架构解剖)。

生成侧:把理解反过来 ​

多模态的"生成"按模态分属不同技术栈:

生成任务核心技术相关阅读
文生图扩散模型(Diffusion)扩散模型与生成式 AI、Midjourney 与图像生成
文生视频扩散 + 时序建模(DiT)Sora 与视频生成
语音合成(TTS)声学模型 + 声码器 / 离散 token 生成语音 AI:Whisper 与 TTS
图文混合输出联合 token 自回归 / 扩散分支GPT-4o、Gemini 等旗舰

一个容易混淆的点:很多"多模态模型"只做理解(VLM 只读图输出文字),生成能力由单独的扩散模型承担。真正的"全模态"旗舰才具备"输入图像+输出图像/语音"的闭环。做产品选型时,要按"理解能力"和"生成能力"分别看规格表。

代表模型对比 ​

不同路线的多模态模型能力边界差异很大,选型前先看这张表:

模型图片理解视频理解音频输入语音输出文生图/视频开源定位
GPT-4o✅✅✅✅(原生)⚠️ 另接 DALL·E/Sora❌全模态对话旗舰
Gemini 2.x✅✅(长视频)✅✅(原生)✅(Gemini 图像/Veo)⚠️ 部分原生多模态、超长上下文
Claude 3.x✅⚠️ 有限❌(截至 3.7)❌❌❌视觉理解 + 长文档
Qwen-VL / Qwen2.5-VL✅✅✅(通义家族)✅(通义家族)⚠️ 家族内联动✅开源多模态标杆
LLaVA✅❌❌❌❌✅视觉语言助手(研究)
InternVL✅⚠️ 部分❌❌❌✅开源 VLM 性能前列

时效提示

上表按 2025 年中的公开资料整理(dataAsOf: 2025-06),模型迭代极快:Claude 后续版本可能已补齐音频能力,Qwen 家族每月发新版本。选型前请以厂商最新文档为准(可查模型与榜单速查)。

从这张表能读出三个趋势:

  1. 理解模态在普及:图片理解几乎成为大模型标配,视频理解正从旗舰下放;
  2. 语音是分水岭:原生语音输入输出的模型仍是少数,因为它要求低延迟端到端;
  3. 生成能力普遍外置:多数厂商让"理解大模型"和"扩散生成模型"各司其职,再在产品层拼接。

评估与挑战 ​

模态幻觉 ​

**模态幻觉(multimodal hallucination)**是文本幻觉的多模态翻版:模型看到不存在的物体却一本正经地描述,把图中男歌手说成女歌手,或在图表上"读"出错误数字。由于图像信息密度高、难以逐像素核对,多模态幻觉比纯文本幻觉更隐蔽、更危险——医疗影像、财报图表场景里,一次幻觉可能造成实际损失。缓解手段包括专门的对抗评测集、细粒度指代数据微调,以及让模型学会说"看不清楚"(见LLM 评估与基准)。

跨模态对齐怎么评 ​

多模态评估远不止"看图答对问题",目前公认的评测维度包括:

评测维度代表基准(截至 2025)测什么
视觉问答MMMU、MM-Vet、MathVista图上有信息时能不能答对
细粒度感知POPE、HallusionBench会不会幻觉、指错、漏读
跨模态推理MMMU、MMBench图表/示意图上的多步推理
长视频理解Video-MME、LongVideoBench分钟级视频的信息抓取
语音对话SpeechArena、seed-bench 语音版语音交互自然度、口音鲁棒性
指令跟随MMMT、MultiModalBench多模态场景下的多轮指令

一句话判断

评测多模态模型,先测幻觉,再测推理,最后测指令跟随。一个 MMMU 分数再高、但 POPE 幻觉率爆炸的模型,在真实业务里往往不可用。

训练数据的规模与质量 ​

多模态对数据的要求是"质与量"双重苛刻:图文对数据(如 LAION-5B、DataComp)噪声极大,"图是狗、文字是猫"的错误配对比比皆是;视频数据的标注成本是静态图的数倍;而语音数据还涉及说话人隐私与版权。数据配比(文本:图像:音频:视频的权重)是旗舰模型训练中最玄学也最关键的工程决策之一——数据配比失衡,模型就会"偏科"。数据集档案见数据集与工具档案。

应用场景 ​

场景做什么典型形态
图像问答拍图提问、看图总结拍照问菜谱、截图问报错
文档解析PDF/扫描件/票据的版面理解与抽取合同审查、发票 OCR+语义
视频理解长视频检索、精彩片段定位、安全监控体育集锦、安防告警
具身智能机器人的"眼睛",感知环境再决策机械臂抓取、扫地机导航
实时语音对话低延迟语音进、语音出同传、客服、车载助手
多模态创作文生图、图生图、视频生成设计稿、短视频、电商素材

其中**具身智能(embodied AI)**值得单独一提:机器人、自动驾驶的核心问题不是"生成",而是"用感知驱动动作",多模态视觉语言模型恰好提供了"看见→理解→指令化"的中间层,是当前机器人领域最热的底座之一(机器人 Agent 的完整讨论见AI 智能体(Agent))。

与 LLM / 扩散模型 / Agent 的关系 ​

  • 多模态是 LLM 的"感官扩展":语言模型本身是"无感官的思考者",多模态给它装上眼睛、耳朵、声带。GPT-4o 的底层推理能力与 GPT-4 一脉相承,但只有接上视觉与语音编码器后,"看+想+说"的闭环才成立。因此理解多模态,前提是理解大语言模型(LLM)与它的推理机制(推理模型如 DeepSeek-R1 也正在向多模态延伸)。
  • 与扩散模型是"生成分工"关系:扩散模型擅长从噪声重建像素(图像/视频/音频的底层生成),多模态大模型擅长"理解 + 规划 + 编排";旗舰产品通常是"大模型决策,扩散模型执行"。两者各自的机制见扩散模型。
  • 多模态是 Agent 感知世界的窗口:一个只会读字的 Agent 只能"阅读世界",多模态 Agent 才能"看见世界"——看截图操作软件、读路况图规划行程、看视频理解用户需求。多模态 + Agent 的组合正是 2024 年以来最活跃的产品方向(见Manus 与 Agent 应用)。而 Agent 要"记住"见过的图像、检索多模态内容,又离不开向量数据库与语义检索。
  • 与 RAG / 知识图谱的融合:企业落地时,多模态往往与检索增强生成(RAG)组合成"多模态 RAG"(检索图片/文档片段喂给 VLM),知识图谱侧则把图像实体与文本实体融合进知识图谱。
  • 工程侧的连锁影响:多模态模型参数量大、输入长,落地依赖推理优化与量化与部署实战;需要针对垂直业务调整时走微调与 PEFT;涉及安全边界的,参见AI 安全与治理。
一句话关系图:

扩散模型(像素生成)──┐
                       ├─→ 多模态模型(统一理解 + 规划)──→ Agent(感知 → 决策 → 行动)
LLM(语言推理)───────┘

权衡与取舍 ​

  • 端到端统一 vs 分模块拼接:统一 token 空间延迟低、能力均衡,但训练成本极高、工程黑盒;分模块(编码器 + 投影 + LLM + 扩散)可组合、可替换,但模块间信息有损。小团队起步建议先做拼接路线,再逐步向端到端演进。
  • 输入模态的"贪多"陷阱:模态越多,数据配比越难、评测越复杂、幻觉面越大。业务里"只做图文"常常比"强行全模态"更稳健。
  • 开源旗舰与闭源旗舰的差距在缩小:Qwen-VL、InternVL、LLaVA 系列已把开源 VLM 的能力推到接近闭源;但语音、视频等重模态仍需闭源旗舰或自研。
  • 延迟 vs 能力:原生语音的秒级延迟是"多模态对话"体验的分水岭,代价是推理链路复杂(流式 + 打断 + 韵律控制),见语音 AI。

延伸阅读 ​

参考资料 ​