← 返回题目列表

多模态大模型如何理解视频?抽帧、时序建模和长视频有哪些难点?

高频 中等 第 3 / 25 题 更新于 2026/07/25
视频理解抽帧时序建模长视频

简化版

视频模型通常先采样帧或短片段,用视觉编码器提空间特征,再加时间位置、压缩成 LLM 能处理的视觉 token。核心难点是在有限 token 预算下同时保留「关键瞬间 + 动作顺序 + 长程上下文」:均匀抽帧简单但可能漏掉短事件,而只看单帧无法推断动作因果(「拿起再放下」和「放下再拿起」帧集合相同、顺序相反)。长视频还面临「时间信息无限增长、token 预算有限」的根本矛盾,要靠分层检索 + 摘要扩展。

详细版

常见方案:把多帧当图像序列直接投影给 LLM、用时间注意力/视频编码器联合建模、或分层地「先理解片段再汇总长视频」。图像和视频可共享视觉表示和连接器,但必须显式表达帧序和时间,否则帧集合无法区分动作的先后。

帧数 × 每帧分辨率 × 每帧 token 数相乘后很快超出上下文预算。工程上结合均匀采样、镜头切分、事件检索、token 池化、分层摘要,并用时间定位任务验证模型是否真找到了证据。

完整版教学

一、视频比图像多了什么

视频不是「多张图片」那么简单,它多了运动、持续时间、先后顺序、跨镜头关系

  • 只识别每帧物体,能回答「出现了什么」;
  • 但回答「何时发生、动作如何变化为什么导致后续结果」,必须理解时序。

经典例子:「拿起杯子再放下」和「放下杯子再拿起」——两者的帧集合几乎相同,只是顺序相反。如果模型丢了帧序信息,就无法区分这两个相反的动作。此外音轨、字幕、时间戳也可能提供关键信息,但它们是额外模态,不能默认所有视频模型都用。

二、采样策略:信息瓶颈的第一道关

模型不可能处理每一帧,必须采样——而采样本身就是信息瓶颈

采样方式特点适合
均匀采样覆盖全局、简单内容平缓的视频
随机/分段采样增加多样性训练
镜头/运动感知采样保留事件变化点事件密集视频
问题相关检索先定位候选片段再精读长视频问答

记忆钩子:采样决定”看见什么”——事件没被采到,后续模型无论多强都无法凭空恢复。均匀抽帧最简单,但短暂事件(1 秒的动作)很可能整个被跳过。

三、时序表示:让模型知道「先后」

采样到帧后,要让模型理解它们的时间关系,几种做法:

  • 帧 token 加时间位置编码,在视觉编码器或 LLM 里做跨帧注意力
  • 专门的视频编码器提取时空特征;
  • Video-LLaVA 等让图像和视频在投影前进入统一视觉表示空间,再共享连接方式。

易错点:共享表示提高复用性,但不代表”用图像训练就能替代时序数据”——静态图学不会「动作如何演变」,时序能力必须用视频数据训。

四、控制 Token:长视频的核心矛盾

视频的 token 成本是「帧数 × 每帧 token」,很容易爆:

若 F 帧、每帧 T 个视觉 token,直接拼接 ≈ F × T
例:F=64 帧,T=196 → 64×196 = 12544 个视觉 token
  → 单个视频就吃掉上万上下文

压缩手段:每帧池化、跨帧合并相似 token、固定查询重采样、先生成片段级状态。但压缩越强,短动作、字幕、小物体越容易丢失

长视频(几十分钟) 更要靠分层处理:片段索引负责召回相关片段 → 精读模型处理这些片段 → 基于带时间戳的证据汇总。这和长文本 RAG 是一个思路——检索 + 精读,而非硬塞。

五、评估陷阱:小心「假时序能力」

视频评估最大的坑是——问题可能不看视频、只靠字幕/常识/单帧就能答对,这不能证明模型有时序能力。可靠的测试集应包含:

  • 动作顺序反转(区分先后);
  • 时间定位(找到事件发生的时刻);
  • 短暂事件(考验采样是否漏帧);
  • 跨镜头指代(这个人是前面那个人吗);
  • 音画冲突(画面和声音矛盾时信谁);
  • 不含关键帧的对照组(关键帧被移除后是否还”答得对”,暴露语言捷径)。

六、常见误区与追问

  • 误区:视频就是多张图片。 它多了运动、时长、顺序、跨镜头关系,只看单帧无法推断动作因果。
  • 误区:均匀抽帧够用。 短暂事件可能整个被跳过;采样是信息瓶颈,漏了就恢复不了。
  • 误区:图像训练能替代视频训练。 静态图学不会时序演变,时序能力要用视频数据。
  • 追问:为什么必须显式表达帧序? 否则「拿起再放下」和「放下再拿起」帧集合相同、无法区分。
  • 追问:视频 token 成本怎么算? ≈ F×T(帧数×每帧 token),几十帧就上万 token,很快爆上下文。
  • 追问:长视频怎么扩展? 分层——片段索引召回 + 精读相关片段 + 基于时间戳证据汇总(类似 RAG)。
  • 追问:怎么测真时序能力? 用动作反转、时间定位、短事件、跨镜头指代,加不含关键帧的对照组防语言捷径。

七、加强记忆

视频理解的主矛盾记「时间信息无限增长 vs 模型 token 有限」:采样决定”看见什么”(均匀抽帧漏短事件,漏了就恢复不了)、时序编码决定”先后关系”(否则拿起放下无法区分)、分层检索决定”长视频能否扩展”(片段召回+精读+时间戳汇总)。token 成本 ≈F×T,几十帧就上万、很快爆上下文。评估最大陷阱是**“假时序能力”**——问题若靠字幕/常识/单帧能答,就证明不了时序,要用动作反转/时间定位/不含关键帧对照来测。