什么是多模态大模型?它与纯文本大模型有什么区别?
简化版
多模态大模型(MLLM)能同时处理文本、图像、视频、音频等不同模态,在一个统一任务里完成理解或生成。与纯文本大模型相比,它多了模态编码器 + 跨模态连接器 + 对齐训练:以图文模型为例,视觉编码器把图像变成特征序列,连接器把视觉特征映射进语言模型的表示空间,语言模型再据此和文本指令生成答案。但「多模态」不等于像人一样完整感知——图像被缩放、切块、压成有限视觉 token,细节可能在进入 LLM 前就丢了。
详细版
以图文模型为例,典型系统三段式:
- 视觉编码器(如 ViT/CLIP):图像 → 视觉特征序列;
- 连接器(Projector / Q-Former / Cross-Attention):把视觉特征对齐到 LLM 能接收的空间;
- 语言模型:根据视觉表示 + 文本指令生成回答。
和纯文本 LLM 的关键区别:
- 多了「感知」环节,能力受分辨率、视觉 token 数、对齐数据限制;
- 视觉 token 会占用上下文、增加 Prefill 成本;
- 可能依赖语言先验而非视觉证据(视觉幻觉的根源)。
「多模态」不代表完整感知:图像会被缩放、切块、压缩成有限 token,视频还要抽帧,细小文字、空间关系、快速事件可能在进入 LLM 前就丢失。
完整版教学
记忆钩子:多模态题先看视觉信号如何变成 token,再看连接器如何对齐语言空间,最后看推理成本和幻觉风险。
一、什么叫「模态」,它们的数据结构差在哪
模态是信息的表现形式。不同模态的数据结构天差地别,这决定了它们不能直接混在一起处理:
| 模态 | 数据结构 | 天然维度 |
|---|---|---|
| 文本 | 离散 token 序列 | 一维(序列) |
| 图像 | 像素网格 | 二维(空间) |
| 音频 | 采样波形/频谱 | 一维(时间) |
| 视频 | 帧序列 | 三维(空间 + 时间) |
多模态学习的任务,就是把这些结构各异的表示,投射到一个能互相对应、能被语言模型联合使用的空间。这就是为什么需要「编码器 + 连接器 + 对齐训练」这套东西——把二维的图、三维的视频「翻译」成 LLM 熟悉的一维 token 序列。
二、主链路:编码 → 对齐 → 推理生成
以最主流的图文模型(如 LLaVA)为例,走一遍数据流:
图像 → [视觉编码器 ViT] → 视觉特征(如 576 个 patch 向量)
↓
[连接器 Projector](映射到 LLM 词向量维度)
↓
文本指令 "描述这张图" → tokenize → 文本 token
↓
[视觉 token + 文本 token 拼接] → LLM → 生成回答
关键点:视觉信息最终以「视觉 token」的形式和文本 token 一起进入 LLM,语言模型并不知道它们来自图像,只当成一串特殊的输入向量。连接器和对齐训练的作用,就是让这些视觉 token「说 LLM 听得懂的话」。
三、三类主流架构(各有取舍)
| 架构 | 代表 | 连接方式 | 特点 |
|---|---|---|---|
| Projector 拼接 | LLaVA | 线性/MLP 映射后与文本拼接 | 简单、保留信息多,但视觉 token 多 |
| 查询式重采样 | BLIP-2 (Q-Former) | 可学习查询提取固定数量表示 | 省上下文,但有信息瓶颈 |
| 门控交叉注意力 | Flamingo | 语言层间插入 Cross-Attention | 交互深、支持图文交错,但改结构多 |
也有更统一的方案,把不同模态都离散化/映射成同类 token 一起建模。架构选择决定训练成本、视觉信息容量、能否冻结既有模型——没有对所有任务都最优的连接方式。
四、训练目标:从「对齐」到「会用」
多模态训练大致解决三个递进问题(详见训练阶段专题):
- 视觉语言对齐:图文对比、图文匹配、图像描述,让视觉表示和语言概念对上;
- 连接器对齐:让视觉特征进 LLM 后能产出合理文本;
- 多模态指令微调:用「图 + 指令 + 回答」训练模型遵循指令、切换任务。
易错点:只让两个模态的全局向量接近(如 CLIP)适合检索/分类,但不足以生成细粒度长回答——那需要保留局部特征并让 LLM 逐 token 使用。
五、主要局限(也是幻觉和评测的根源)
- 感知损失:输入缩放、抽帧、连接器压缩,会在进 LLM 前丢信息(小文字、计数、快速事件);
- 数据噪声:网页图文对标题常与图像局部无关,噪声和偏见传入模型;
- 语言先验压过视觉:视觉证据弱时,模型用「常识共现」补全,产生幻觉(有桌子就补个椅子);
- token 爆炸:高分辨率、长视频产生海量视觉 token,挤占上下文、推高成本;
- 基准虚高:Benchmark 分数不等于真实场景可靠。
六、常见误区与追问
- 误区:多模态大模型像人一样看图。 图像被缩放/切块/压成有限 token,细节可能已丢失,它是「有损感知」。
- 误区:视觉 token 是免费的。 它们占上下文、推高 Prefill 成本,高分辨率时可能比文本 token 还多。
- 追问:多模态和纯文本 LLM 的核心差异? 多了模态编码器 + 连接器 + 对齐训练,能力受分辨率/对齐数据/语言先验制约。
- 追问:视觉信息怎么进 LLM? 编码成视觉 token,经连接器映射后与文本 token 拼接(或经交叉注意力被读取)。
- 追问:为什么会视觉幻觉? 感知端丢信息 + 生成端语言先验过强,视觉证据不足时用共现补全。
- 追问:CLIP 那种对齐够做对话吗? 不够,全局向量对齐适合检索/分类,生成细粒度长回答要保留局部特征 + LLM 使用。
七、加强记忆
多模态大模型记主链路「各模态编码 → 表示对齐/融合 → 语言模型推理生成」:它在纯文本 LLM 前面加了视觉编码器 + 连接器 + 对齐训练,把二维图/三维视频翻译成 LLM 能用的视觉 token。三类架构钉住取舍——Projector(简单信息多但 token 多)、Q-Former(省 token 有瓶颈)、Cross-Attention(交互深但改结构)。核心认知:它是”有损感知”(缩放/切块/抽帧会丢信息)+ 可能被语言先验带偏(视觉幻觉根源),扩展了输入通道,但「看清、对齐、正确使用」要分别验证。