外观
多模态模型
概念定义:让 AI 同时读懂图文声画
多模态模型(multimodal model)是能同时理解与生成多种模态(文本、图像、音频、视频)信息的 AI 模型,如 GPT-4o、Gemini、Qwen-VL。它不是"一个模型加上读图的插件",而是从架构到训练数据都把多种模态当作一等公民的模型:同一个参数体系里,既装得下语言的语法与语义,也装得下图像的像素结构与物体关系、声音的节奏与情绪。
过去十年,AI 的发展呈现两条平行线:NLP 一路沿着 Transformer 走向大语言模型,CV 一路沿着卷积与 ViT 走向图像大模型,语音在 ASR/TTS 各自为战。多模态模型把这三条线缝在一起:一条输入管线同时吞下文字、图片、录音、视频,输出也横跨多种模态。对普通用户来说,最直观的变化是"AI 能看见、能听见了"——上传一张菜单照片就能问"帮我算人均",发一段语音就能得到语音回复。
今天的主流对话产品(ChatGPT、Gemini、Claude 等,见ChatGPT 与对话式 AI)几乎全部升级成了多模态入口。理解多模态模型,等于理解了下一代 AI 系统的默认形态。
为什么多模态重要
现实信息天然是多模态的
人类感知世界的通道从来不是单一文本:语言在大部分场景里只是现实世界的压缩编码,而图像、视频、语音才是信息的原始形态。一张手术影像、一段施工现场录像、一段婴儿啼哭的录音——这些信息要么无法文字化,要么文字化的代价极高。只处理文本的模型,天生只能看到世界的一道窄缝。
「全模态」是通往 AGI 的关键路径之一
业内有一种共识(需谨慎表述):通用人工智能需要对世界有"全模态"的理解。人类智能的一个重要来源,正是把视觉、听觉、语言、触觉等多种信号在同一时刻整合成统一的心智模型——儿童学"苹果"这个词,同时看到形状、摸到质感、尝到味道。相应地,让模型接触多种模态、并学会跨模态迁移,被认为是逼近 AGI 的候选路径之一。当然,"全模态是否是 AGI 的充分条件"尚无定论,模态更多并不自动等于更强的推理能力,这只是众多前沿假说中的一个(详见什么是 AI 热门概念)。
人机交互的自然化
文字输入是键盘时代的遗产,而多模态让交互回归人类本能:说话、指图、挥视频。实时语音对话让延迟从"打字+读字"降到接近真人对话(见语音 AI:Whisper 与 TTS),指着一张图提问比输入三百字描述高效得多。这不是体验优化,而是把 AI 从"打字机助手"变成"贴身同事"的关键一步。
| 维度 | 纯文本 LLM | 多模态模型 |
|---|---|---|
| 输入 | 文本 token | 文本 + 图像 + 音频 + 视频 |
| 输出 | 文本 | 文本 + 图像 + 音频(视频) |
| 信息密度 | 依赖用户文字描述 | 直接吃原始信号,无损 |
| 使用门槛 | 键盘 | 自然语言 + 感官 |
| 世界建模 | 文字中的世界 | 感官中的世界 |
一句话判断
判断一个模型算不算"多模态",不看它能否生成图片,而看它的输入是否跨模态、是否用统一参数体系联合建模。纯文生图模型(如只做扩散生成)通常不算完整的多模态模型。
核心技术路线
模态编码:把一切变成向量
所有模态进入模型前,都要先被切成"数字碎片"并映射成向量。不同模态的"分词"方式完全不同:
| 模态 | 编码器 | 切分单元 | 代表做法 |
|---|---|---|---|
| 文本 | tokenizer(BPE 等) | subword token | GPT、Llama 系列 |
| 图像 | ViT 视觉编码器 | 固定尺寸 patch(如 16×16) | CLIP-ViT、SigLIP |
| 音频 | 频谱编码器 / 采样编码器 | 频谱帧或离散 token | Whisper 编码器、HuBERT |
| 视频 | 帧级图像编码 + 时间建模 | 帧序列 / 3D patch | ViViT、Video-LLaMA |
文本侧沿用 Transformer 体系的 tokenizer;图像侧最有代表性的是 ViT(Vision Transformer):把一张图切成若干 patch,每个 patch 拉平成向量后当作"图像 token"送进 Transformer——ViT 本质上就是 Transformer,只是把 token 从"词"换成了"图像块"。这也是为什么 Transformer 统一了 CV 与 NLP:同一个注意力机制,既能对文字 token 建模,也能对 patch token 建模。
音频则有两种路线:频谱路线把波形转成梅尔频谱图(当图像处理),离散 token 路线把音频量化成声学 token(如 SoundStream 编码,语音大模型常用)。无论哪种,最终都落入同一个 Transformer 框架。
对齐与融合:让模态彼此听得懂
编码之后是核心难题——把不同模态的表示放进同一个"语义空间"。历史上有三代主流做法:
第一代:双塔对比学习(CLIP)
2021 年 OpenAI 的 CLIP(Contrastive Language-Image Pre-training) 确立了图文对齐的范式:用图像编码器与文本编码器两个塔,各自把"图"和"图配文"编码成向量,然后通过**对比学习(contrastive learning)**拉近"正确配对"的距离、推开"错误配对"的距离。训练数据是 4 亿对互联网图文对,学完以后,图像向量与文本向量共享语义空间——"一只狗的照片"和"dog"两个向量彼此靠近。
第二代:视觉编码器 + 投影层(LLaVA)
2023 年的 LLaVA 把 CLIP 思路嫁接到 LLM 上:冻结一个 CLIP 视觉塔 + 一个大语言模型,中间用一层可训练的 MLP 投影层把图像特征映射到文本 embedding 空间,再用 GPT-4 生成的高质量指令数据微调,做出一个能"看图说话"的开源助手。Q-Former(BLIP-2 提出)则是另一种投影器:用一个轻量 Transformer 对图像特征做"查询式压缩",提炼出与文本最相关的若干向量,参数量更省。这一代模型被称为视觉语言模型(Vision-Language Model, VLM)。
LLaVA 式架构(对齐路线 2.0):
图像 ──→ CLIP-ViT ──→ patch 特征 ──┐
├──→ MLP 投影 ──→ [图像 token] ─┐
文本 ──→ tokenizer ──→ [文本 token] ─────────────────────────────┴─→ LLM(自回归生成)第三代:统一 token 空间(GPT-4o)
2024 年的 GPT-4o 走得更远:所有模态统一转成 token,进入同一个神经网络。文本不再经过"投影"环节,图像、音频同样被切成 token 与文本 token 混合后一起做注意力——这让输入输出延迟降到平均 320 毫秒,接近真人对话节奏。Google 的 Gemini 则走"原生多模态"路线:从预训练一开始就在文本、图像、音频、视频上联合训练,而不是"先训文本 LLM 再加视觉头"。
| 路线 | 代表 | 优点 | 代价 |
|---|---|---|---|
| 双塔对比学习 | CLIP(2021) | 训练数据易得、检索/对齐能力强 | 只对齐、不生成,需配解码器 |
| 投影桥接 | LLaVA、BLIP-2(2023) | 复用成熟 LLM、开源可复现 | 投影层损失信息,跨模态推理弱 |
| 统一 token | GPT-4o、Gemini(2024) | 端到端、延迟低、能力均衡 | 训练数据与算力要求极高 |
架构脉络
从 CLIP 到 LLaVA 到 GPT-4o,实质是对齐越来越深入:CLIP 只对齐两个编码器,LLaVA 把视觉特征"塞进"语言模型,GPT-4o 干脆让所有模态原生共享一套参数。理解这条脉络,就理解了多模态模型十年的设计主线(对照阅读总体架构解剖)。
生成侧:把理解反过来
多模态的"生成"按模态分属不同技术栈:
| 生成任务 | 核心技术 | 相关阅读 |
|---|---|---|
| 文生图 | 扩散模型(Diffusion) | 扩散模型与生成式 AI、Midjourney 与图像生成 |
| 文生视频 | 扩散 + 时序建模(DiT) | Sora 与视频生成 |
| 语音合成(TTS) | 声学模型 + 声码器 / 离散 token 生成 | 语音 AI:Whisper 与 TTS |
| 图文混合输出 | 联合 token 自回归 / 扩散分支 | GPT-4o、Gemini 等旗舰 |
一个容易混淆的点:很多"多模态模型"只做理解(VLM 只读图输出文字),生成能力由单独的扩散模型承担。真正的"全模态"旗舰才具备"输入图像+输出图像/语音"的闭环。做产品选型时,要按"理解能力"和"生成能力"分别看规格表。
代表模型对比
不同路线的多模态模型能力边界差异很大,选型前先看这张表:
| 模型 | 图片理解 | 视频理解 | 音频输入 | 语音输出 | 文生图/视频 | 开源 | 定位 |
|---|---|---|---|---|---|---|---|
| GPT-4o | ✅ | ✅ | ✅ | ✅(原生) | ⚠️ 另接 DALL·E/Sora | ❌ | 全模态对话旗舰 |
| Gemini 2.x | ✅ | ✅(长视频) | ✅ | ✅(原生) | ✅(Gemini 图像/Veo) | ⚠️ 部分 | 原生多模态、超长上下文 |
| Claude 3.x | ✅ | ⚠️ 有限 | ❌(截至 3.7) | ❌ | ❌ | ❌ | 视觉理解 + 长文档 |
| Qwen-VL / Qwen2.5-VL | ✅ | ✅ | ✅(通义家族) | ✅(通义家族) | ⚠️ 家族内联动 | ✅ | 开源多模态标杆 |
| LLaVA | ✅ | ❌ | ❌ | ❌ | ❌ | ✅ | 视觉语言助手(研究) |
| InternVL | ✅ | ⚠️ 部分 | ❌ | ❌ | ❌ | ✅ | 开源 VLM 性能前列 |
时效提示
上表按 2025 年中的公开资料整理(dataAsOf: 2025-06),模型迭代极快:Claude 后续版本可能已补齐音频能力,Qwen 家族每月发新版本。选型前请以厂商最新文档为准(可查模型与榜单速查)。
从这张表能读出三个趋势:
- 理解模态在普及:图片理解几乎成为大模型标配,视频理解正从旗舰下放;
- 语音是分水岭:原生语音输入输出的模型仍是少数,因为它要求低延迟端到端;
- 生成能力普遍外置:多数厂商让"理解大模型"和"扩散生成模型"各司其职,再在产品层拼接。
评估与挑战
模态幻觉
**模态幻觉(multimodal hallucination)**是文本幻觉的多模态翻版:模型看到不存在的物体却一本正经地描述,把图中男歌手说成女歌手,或在图表上"读"出错误数字。由于图像信息密度高、难以逐像素核对,多模态幻觉比纯文本幻觉更隐蔽、更危险——医疗影像、财报图表场景里,一次幻觉可能造成实际损失。缓解手段包括专门的对抗评测集、细粒度指代数据微调,以及让模型学会说"看不清楚"(见LLM 评估与基准)。
跨模态对齐怎么评
多模态评估远不止"看图答对问题",目前公认的评测维度包括:
| 评测维度 | 代表基准(截至 2025) | 测什么 |
|---|---|---|
| 视觉问答 | MMMU、MM-Vet、MathVista | 图上有信息时能不能答对 |
| 细粒度感知 | POPE、HallusionBench | 会不会幻觉、指错、漏读 |
| 跨模态推理 | MMMU、MMBench | 图表/示意图上的多步推理 |
| 长视频理解 | Video-MME、LongVideoBench | 分钟级视频的信息抓取 |
| 语音对话 | SpeechArena、seed-bench 语音版 | 语音交互自然度、口音鲁棒性 |
| 指令跟随 | MMMT、MultiModalBench | 多模态场景下的多轮指令 |
一句话判断
评测多模态模型,先测幻觉,再测推理,最后测指令跟随。一个 MMMU 分数再高、但 POPE 幻觉率爆炸的模型,在真实业务里往往不可用。
训练数据的规模与质量
多模态对数据的要求是"质与量"双重苛刻:图文对数据(如 LAION-5B、DataComp)噪声极大,"图是狗、文字是猫"的错误配对比比皆是;视频数据的标注成本是静态图的数倍;而语音数据还涉及说话人隐私与版权。数据配比(文本:图像:音频:视频的权重)是旗舰模型训练中最玄学也最关键的工程决策之一——数据配比失衡,模型就会"偏科"。数据集档案见数据集与工具档案。
应用场景
| 场景 | 做什么 | 典型形态 |
|---|---|---|
| 图像问答 | 拍图提问、看图总结 | 拍照问菜谱、截图问报错 |
| 文档解析 | PDF/扫描件/票据的版面理解与抽取 | 合同审查、发票 OCR+语义 |
| 视频理解 | 长视频检索、精彩片段定位、安全监控 | 体育集锦、安防告警 |
| 具身智能 | 机器人的"眼睛",感知环境再决策 | 机械臂抓取、扫地机导航 |
| 实时语音对话 | 低延迟语音进、语音出 | 同传、客服、车载助手 |
| 多模态创作 | 文生图、图生图、视频生成 | 设计稿、短视频、电商素材 |
其中**具身智能(embodied AI)**值得单独一提:机器人、自动驾驶的核心问题不是"生成",而是"用感知驱动动作",多模态视觉语言模型恰好提供了"看见→理解→指令化"的中间层,是当前机器人领域最热的底座之一(机器人 Agent 的完整讨论见AI 智能体(Agent))。
与 LLM / 扩散模型 / Agent 的关系
- 多模态是 LLM 的"感官扩展":语言模型本身是"无感官的思考者",多模态给它装上眼睛、耳朵、声带。GPT-4o 的底层推理能力与 GPT-4 一脉相承,但只有接上视觉与语音编码器后,"看+想+说"的闭环才成立。因此理解多模态,前提是理解大语言模型(LLM)与它的推理机制(推理模型如 DeepSeek-R1 也正在向多模态延伸)。
- 与扩散模型是"生成分工"关系:扩散模型擅长从噪声重建像素(图像/视频/音频的底层生成),多模态大模型擅长"理解 + 规划 + 编排";旗舰产品通常是"大模型决策,扩散模型执行"。两者各自的机制见扩散模型。
- 多模态是 Agent 感知世界的窗口:一个只会读字的 Agent 只能"阅读世界",多模态 Agent 才能"看见世界"——看截图操作软件、读路况图规划行程、看视频理解用户需求。多模态 + Agent 的组合正是 2024 年以来最活跃的产品方向(见Manus 与 Agent 应用)。而 Agent 要"记住"见过的图像、检索多模态内容,又离不开向量数据库与语义检索。
- 与 RAG / 知识图谱的融合:企业落地时,多模态往往与检索增强生成(RAG)组合成"多模态 RAG"(检索图片/文档片段喂给 VLM),知识图谱侧则把图像实体与文本实体融合进知识图谱。
- 工程侧的连锁影响:多模态模型参数量大、输入长,落地依赖推理优化与量化与部署实战;需要针对垂直业务调整时走微调与 PEFT;涉及安全边界的,参见AI 安全与治理。
一句话关系图:
扩散模型(像素生成)──┐
├─→ 多模态模型(统一理解 + 规划)──→ Agent(感知 → 决策 → 行动)
LLM(语言推理)───────┘权衡与取舍
- 端到端统一 vs 分模块拼接:统一 token 空间延迟低、能力均衡,但训练成本极高、工程黑盒;分模块(编码器 + 投影 + LLM + 扩散)可组合、可替换,但模块间信息有损。小团队起步建议先做拼接路线,再逐步向端到端演进。
- 输入模态的"贪多"陷阱:模态越多,数据配比越难、评测越复杂、幻觉面越大。业务里"只做图文"常常比"强行全模态"更稳健。
- 开源旗舰与闭源旗舰的差距在缩小:Qwen-VL、InternVL、LLaVA 系列已把开源 VLM 的能力推到接近闭源;但语音、视频等重模态仍需闭源旗舰或自研。
- 延迟 vs 能力:原生语音的秒级延迟是"多模态对话"体验的分水岭,代价是推理链路复杂(流式 + 打断 + 韵律控制),见语音 AI。
延伸阅读
- Transformer 与注意力机制——ViT 也是 Transformer,多模态的地基
- 大语言模型(LLM)——多模态模型的"思考内核"
- 扩散模型与生成式 AI——图像/视频生成的底层引擎
- AI 智能体(Agent)——多模态是 Agent 感知世界的窗口
- LLM 评估与基准——模态幻觉与跨模态评测的完整方法
- Midjourney 与图像生成——文生图案例
- Sora 与视频生成——文生视频案例
- 语音 AI:Whisper 与 TTS——语音识别与合成的工程全貌
- Manus 与 Agent 应用——多模态 Agent 的产品形态
- 模型与榜单速查——各模型多模态能力一手速查
参考资料
- Radford et al. Learning Transferable Visual Models From Natural Language Supervision(CLIP, 2021) —— 图文对比学习的开山之作
- Liu et al. Visual Instruction Tuning(LLaVA, 2023) —— 视觉指令微调,开源 VLM 事实标准
- Li et al. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and LLMs(2023) —— Q-Former 的出处
- OpenAI. GPT-4V(ision) System Card(2023) —— GPT-4V 能力与风险的系统说明
- OpenAI. Hello GPT-4o(2024) —— GPT-4o 发布说明与全模态对话演示
- Gemini Team. Gemini: A Family of Highly Capable Multimodal Models(2023) —— 原生多模态路线论文
- Dosovitskiy et al. An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale(ViT, 2020) —— 视觉 Transformer 的奠基论文
- Yue et al. MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark(2023) —— 大学级多模态推理基准
- OpenAI. Sora 技术报告 —— 视频生成的扩散/DiT 路线