← 返回题目列表

多模态大模型通常如何训练?预训练、对齐和指令微调分别解决什么问题?

高频 困难 第 13 / 25 题 更新于 2026/07/25
多模态训练模态对齐指令微调数据质量

简化版

多模态训练通常分三个功能阶段:① 单模态初始化(拿成熟的视觉编码器 + LLM 起步)→ ② 视觉语言对齐/连接器预训练(用大规模图文对学「视觉表示怎么对应语言」)→ ③ 多模态指令微调(用「图 + 指令 + 回答」学「按指令用视觉信息回答」)。不同模型会合并阶段或冻结不同模块,所以这是功能划分,不是所有模型都遵守的固定三步。核心矛盾始终是:数据是否真的需要看图、答案是否可靠

详细版

  • 对齐阶段:图文对比、图文匹配、图像描述,让图像和文本在语义上对应;
  • 连接器对齐:让视觉特征进 LLM 后能产出合理文本;
  • 指令微调:用「图/视频 + 用户指令 + 回答」训练遵循指令、切换任务、按要求输出。

冻结策略是关键取舍:可以冻结视觉编码器和 LLM、只训连接器(省资源、少漂移);也可逐步解冻或端到端训练(容量大,但显存、数据质量要求高,灾难性遗忘风险大)。

完整版教学

一、为什么从「单模态初始化」开始

从零联合训练一个视觉 + 语言模型需要天量数据和算力。所以主流做法是站在巨人肩上:拿一个已经很会「看」的视觉编码器(CLIP-ViT 等)+ 一个已经很会「说」的 LLM,只训练中间的桥。

但一个关键易错点:冻结初始化的两端,并不保证它们天然对齐。同一个概念「狗」,在视觉空间和语言空间里的向量形状完全不同,中间必须靠连接器 + 对齐数据把它们「接上线」。初始化解决了「各自会表示」,但「彼此能对齐」还得训。

二、阶段的三个递进问题

把三阶段对应成三个能力问题,最好记:

① 各自会表示  ← 单模态初始化(视觉编码器 + LLM)
② 彼此能对齐  ← 视觉语言对齐 + 连接器预训练
③ 按指令会用  ← 多模态指令微调
  • 对齐阶段用图文对比(学全局语义/检索)、图文匹配(判断一对是否对应)、图像描述(从视觉生成文字)等目标。多目标组合能同时学对齐和生成,但各损失权重要验证
  • 难点在数据:网页图文对规模大但噪声高——标题可能只和图像局部相关,还有重复、偏见、隐私风险。

三、连接器对齐:把视觉「翻译」给冻结的 LLM

当采用「冻结视觉编码器 + 冻结 LLM」的省钱方案时,全部对齐压力都落在连接器上:它要把视觉表示转换成 LLM 能利用的条件。

  • LLaVA 早期方案:用图像描述数据训练投影层(Projector);
  • BLIP-2:用两阶段 Q-Former 连接冻结的两端。

关键易错点:连接器对齐的损失下降,不代表细粒度感知已经可靠。全局对齐好,不等于能数清物体、认出小文字、判断左右——这些要专门用 OCR、计数、空间任务检查。

四、多模态指令微调:教模型「看着图听话」

这是决定最终对话质量的阶段。指令数据要覆盖真实任务:描述、问答、多轮对话、拒答、证据不足、OCR、图表、多图关系……并且有几条硬要求:

  • 答案必须与图像一致:合成数据要过滤掉教师模型的幻觉,否则把幻觉蒸进模型;
  • 防语言捷径(最重要的坑):如果一个问题不看图也能靠常识答对,模型就会学会「不看图、走语言捷径」。

记忆钩子:多模态训练最大的陷阱是”模型学会不看图”——要构造「必须看图才能答」的题(反事实图、存在/不存在、左右位置、细粒度属性),逼模型真正使用视觉证据。

五、冻结还是解冻:成本与能力的取舍

策略成本能力上限风险
只训连接器最低受冻结表示限制
解冻 LLM指令/融合更好可能损伤纯文本能力
解冻视觉编码器适配领域图像可能破坏通用视觉表示

常见做法是分阶段解冻 + 不同学习率(给预训练模块更小的学习率),并同时回归文本和视觉能力,防止一边训好、另一边退化(灾难性遗忘)。

六、常见误区与追问

  • 误区:三阶段是所有模型的固定配方。 是功能划分,很多模型合并阶段、冻结策略各异。
  • 误区:只要对齐损失降了就训好了。 全局对齐 ≠ 细粒度感知可靠,要单独测 OCR/计数/空间。
  • 误区:指令数据越多越好。 若问题不看图也能答,会训出「走语言捷径」的模型,质量比数量重要。
  • 追问:三阶段各解决什么? 各自会表示(初始化)→ 彼此能对齐(对齐/连接器)→ 按指令会用(指令微调)。
  • 追问:为什么要防语言捷径? 不看图能答对的题会让模型忽略视觉证据,要用反事实/存在性题逼它看图。
  • 追问:冻结 vs 解冻怎么选? 冻结省资源少漂移但上限低;解冻容量大但有灾难性遗忘风险,常分阶段解冻。
  • 追问:多模态数据治理注意什么? 去重、过滤低质配对、记录来源许可、防评测集泄漏、控制数据比例(保留纯文本防语言退化)。

七、加强记忆

多模态训练记「各自会表示 → 彼此能对齐 → 按指令会用」三个递进问题:单模态初始化(站巨人肩上,但冻结≠天然对齐)→ 视觉语言/连接器对齐(图文对比/匹配/描述,但全局对齐≠细粒度可靠)→ 多模态指令微调(教看图听话,最大陷阱是”学会不看图走语言捷径”,要用反事实/存在性题逼它用视觉证据)。冻结 vs 解冻是「成本 vs 适配能力」的取舍,常分阶段解冻 + 双向回归防遗忘。最终瓶颈往往是数据是否真需要看图、答案是否可靠