← 返回题目列表

什么是多模态大模型?它与纯文本大模型有什么区别?

高频 中等 第 8 / 25 题 更新于 2026/07/28
多模态大模型MLLM视觉语言模型模态融合

简化版

多模态大模型(MLLM)能同时处理文本、图像、视频、音频等不同模态,在一个统一任务里完成理解或生成。与纯文本大模型相比,它多了模态编码器 + 跨模态连接器 + 对齐训练:以图文模型为例,视觉编码器把图像变成特征序列,连接器把视觉特征映射进语言模型的表示空间,语言模型再据此和文本指令生成答案。但「多模态」不等于像人一样完整感知——图像被缩放、切块、压成有限视觉 token,细节可能在进入 LLM 前就丢了。

详细版

以图文模型为例,典型系统三段式:

  1. 视觉编码器(如 ViT/CLIP):图像 → 视觉特征序列;
  2. 连接器(Projector / Q-Former / Cross-Attention):把视觉特征对齐到 LLM 能接收的空间;
  3. 语言模型:根据视觉表示 + 文本指令生成回答。

和纯文本 LLM 的关键区别:

  • 多了「感知」环节,能力受分辨率、视觉 token 数、对齐数据限制;
  • 视觉 token 会占用上下文、增加 Prefill 成本
  • 可能依赖语言先验而非视觉证据(视觉幻觉的根源)。

「多模态」不代表完整感知:图像会被缩放、切块、压缩成有限 token,视频还要抽帧,细小文字、空间关系、快速事件可能在进入 LLM 前就丢失。

完整版教学

记忆钩子:多模态题先看视觉信号如何变成 token,再看连接器如何对齐语言空间,最后看推理成本和幻觉风险。

一、什么叫「模态」,它们的数据结构差在哪

模态是信息的表现形式。不同模态的数据结构天差地别,这决定了它们不能直接混在一起处理:

模态数据结构天然维度
文本离散 token 序列一维(序列)
图像像素网格二维(空间)
音频采样波形/频谱一维(时间)
视频帧序列三维(空间 + 时间)

多模态学习的任务,就是把这些结构各异的表示,投射到一个能互相对应、能被语言模型联合使用的空间。这就是为什么需要「编码器 + 连接器 + 对齐训练」这套东西——把二维的图、三维的视频「翻译」成 LLM 熟悉的一维 token 序列。

二、主链路:编码 → 对齐 → 推理生成

以最主流的图文模型(如 LLaVA)为例,走一遍数据流:

图像 → [视觉编码器 ViT] → 视觉特征(如 576 个 patch 向量)

                        [连接器 Projector](映射到 LLM 词向量维度)

文本指令 "描述这张图" → tokenize → 文本 token

        [视觉 token + 文本 token 拼接] → LLM → 生成回答

关键点:视觉信息最终以「视觉 token」的形式和文本 token 一起进入 LLM,语言模型并不知道它们来自图像,只当成一串特殊的输入向量。连接器和对齐训练的作用,就是让这些视觉 token「说 LLM 听得懂的话」。

三、三类主流架构(各有取舍)

架构代表连接方式特点
Projector 拼接LLaVA线性/MLP 映射后与文本拼接简单、保留信息多,但视觉 token 多
查询式重采样BLIP-2 (Q-Former)可学习查询提取固定数量表示省上下文,但有信息瓶颈
门控交叉注意力Flamingo语言层间插入 Cross-Attention交互深、支持图文交错,但改结构多

也有更统一的方案,把不同模态都离散化/映射成同类 token 一起建模。架构选择决定训练成本、视觉信息容量、能否冻结既有模型——没有对所有任务都最优的连接方式

四、训练目标:从「对齐」到「会用」

多模态训练大致解决三个递进问题(详见训练阶段专题):

  • 视觉语言对齐:图文对比、图文匹配、图像描述,让视觉表示和语言概念对上;
  • 连接器对齐:让视觉特征进 LLM 后能产出合理文本;
  • 多模态指令微调:用「图 + 指令 + 回答」训练模型遵循指令、切换任务。

易错点:只让两个模态的全局向量接近(如 CLIP)适合检索/分类,但不足以生成细粒度长回答——那需要保留局部特征并让 LLM 逐 token 使用。

五、主要局限(也是幻觉和评测的根源)

  • 感知损失:输入缩放、抽帧、连接器压缩,会在进 LLM 前丢信息(小文字、计数、快速事件);
  • 数据噪声:网页图文对标题常与图像局部无关,噪声和偏见传入模型;
  • 语言先验压过视觉:视觉证据弱时,模型用「常识共现」补全,产生幻觉(有桌子就补个椅子);
  • token 爆炸:高分辨率、长视频产生海量视觉 token,挤占上下文、推高成本;
  • 基准虚高:Benchmark 分数不等于真实场景可靠。

六、常见误区与追问

  • 误区:多模态大模型像人一样看图。 图像被缩放/切块/压成有限 token,细节可能已丢失,它是「有损感知」。
  • 误区:视觉 token 是免费的。 它们占上下文、推高 Prefill 成本,高分辨率时可能比文本 token 还多。
  • 追问:多模态和纯文本 LLM 的核心差异? 多了模态编码器 + 连接器 + 对齐训练,能力受分辨率/对齐数据/语言先验制约。
  • 追问:视觉信息怎么进 LLM? 编码成视觉 token,经连接器映射后与文本 token 拼接(或经交叉注意力被读取)。
  • 追问:为什么会视觉幻觉? 感知端丢信息 + 生成端语言先验过强,视觉证据不足时用共现补全。
  • 追问:CLIP 那种对齐够做对话吗? 不够,全局向量对齐适合检索/分类,生成细粒度长回答要保留局部特征 + LLM 使用。

七、加强记忆

多模态大模型记主链路「各模态编码 → 表示对齐/融合 → 语言模型推理生成」:它在纯文本 LLM 前面加了视觉编码器 + 连接器 + 对齐训练,把二维图/三维视频翻译成 LLM 能用的视觉 token。三类架构钉住取舍——Projector(简单信息多但 token 多)、Q-Former(省 token 有瓶颈)、Cross-Attention(交互深但改结构)。核心认知:它是”有损感知”(缩放/切块/抽帧会丢信息)+ 可能被语言先验带偏(视觉幻觉根源),扩展了输入通道,但「看清、对齐、正确使用」要分别验证。