← 返回题目列表

如何系统评估多模态大模型?常见指标和 Benchmark 有哪些局限?

高频 中等 第 6 / 25 题 更新于 2026/07/25
多模态评估MMEVQABenchmark

简化版

多模态评估要从多个能力维度分开测——感知、OCR、空间与数量、知识推理、幻觉、安全、效率——而不是看一个总分。选择题/短答用准确率;描述和开放问答要结合任务指标、人工评审或校准后的模型评分。任何单个 Benchmark 都不能代表总体能力,公开题还有训练污染风险,可靠报告要固定预处理/解码配置、给分类别结果和波动。

详细版

传统任务:图像描述(CIDEr)、图文检索(Recall@K)、VQA(Accuracy);综合基准如 MME(覆盖感知+认知子任务)、POPE(专测对象幻觉)。文档、图表、数学、多图、视频还需各自数据集。

自动指标会受答案格式、prompt、评分模型偏差影响,公开题存在训练污染。可靠报告应固定输入预处理与解码配置,给出分类别结果、置信区间或多次运行波动,并对关键失败做人工误差分析。

完整版教学

一、先定义「能力矩阵」再选指标

多模态能力是多维的,总分相同的两个模型可能能力结构完全不同。所以评估第一步是搭一个能力矩阵,分层测:

测什么
感知层物体、属性、文字、数量、位置
推理层跨模态知识、图表数学、多步关系
行为层指令遵循、拒答、安全
系统层延迟、显存、吞吐、输入上限

业务选型要看相关子项,而不是排行榜总分——一个总分高但 OCR 差的模型,对文档场景毫无用处。

二、封闭式指标:可复现但会被钻空子

选择题、是非题、标准短答适合 Accuracy / Precision / Recall / F1,好复现。但有几个陷阱:

  • 语言先验/选项模式:模型可能靠常识或选项分布蒙对,没真看图;
  • 答案位置偏差:总选 A 或总选「是」也能刷分。

记忆钩子:加一条”文本盲测基线”——把图去掉、只给问题,看模型能拿多少分。如果盲测就有 60 分,那这个 benchmark 很大程度在测语言先验而非视觉能力。这是识别「假多模态成绩」的利器。

三、生成式指标:词面重合 ≠ 事实正确

图像描述常用 BLEU / ROUGE / METEOR / CIDEr 和参考文本比对,但根本问题是:同一张图有很多种正确描述,词面重合度低不代表答错、高也不代表对

开放问答常用 LLM-as-a-Judge(用另一个强模型打分),但要小心:

  • 明确量规(rubric),别让评分模型自由发挥;
  • 隐藏参考里的泄漏信息
  • 抽样检查评分器的一致性和位置偏差(评分模型也可能偏爱第一个答案);
  • 高风险事实不能只由另一个通用模型评分——它自己也会错。

四、综合与专项基准:各管一段

  • MME:多个感知 + 认知子任务,覆盖较广,适合快速总览;
  • POPE:聚焦对象存在性幻觉;
  • 专项集:OCR、文档、图表、数学、视频、多图关系,要各自补充——综合集里少量样本无法代表长尾业务

关键认知:Benchmark 名称和排名会变,评估方案要围绕”能力定义”设计,而不是围绕”当前榜单”拼接。今天刷 MME、明天刷新榜单,不如稳定测你真正关心的能力维度。

五、污染与复现:成绩可信吗

公开 benchmark 的题目可能已进入模型的预训练或指令数据,导致成绩虚高(模型「见过答案」)。应对:

  • 私有时效数据(模型训练后才产生的)、图像变换、重新标注的样本;
  • 记录完整配置:模型版本、视觉分辨率、最大块数、prompt、采样参数、评分脚本版本;
  • 对随机解码或模型评分至少重复多次,观察方差——单次跑分不可信。

六、常见误区与追问

  • 误区:一个 benchmark 分高就是强模型。 单个 benchmark 不代表总体,能力是多维的,要分类别看。
  • 误区:VQA 准确率高=真看图。 可能靠语言先验/选项偏差蒙对,要加文本盲测基线判断。
  • 误区:CIDEr 高=描述正确。 词面重合≠事实正确,同图有多种正确描述。
  • 追问:怎么识别”假多模态成绩”? 加文本盲测基线(去图只给问题),盲测高说明在测语言先验。
  • 追问:LLM-as-a-Judge 要注意什么? 明确量规、防参考泄漏、查评分器一致性和位置偏差、高危事实不单靠通用模型评。
  • 追问:什么是数据污染,怎么防? 公开题进了训练集致虚高;用私有时效数据/图像变换/重标注,记录完整配置。
  • 追问:为什么要多次运行? 随机解码和模型评分有方差,单次跑分不可靠,要看波动。

七、加强记忆

多模态评估记「六方向拆开测」:看见(感知)、读懂(OCR/文档)、推理(知识/图表/数学)、诚实(幻觉)、安全、够快(系统指标)——总分相同能力结构可能天差地别,要分类别看。三个识别陷阱的利器钉死:文本盲测基线(去图看还能拿多少分,识别语言先验刷分)、词面重合≠事实正确(CIDEr 高不代表对)、数据污染(公开题进训练集致虚高,用私有时效数据+记录配置+多次跑观察方差)。自动分数用于规模化比较,人工误差分析负责解释「到底错在哪」。