如何系统评估多模态大模型?常见指标和 Benchmark 有哪些局限?
简化版
多模态评估要从多个能力维度分开测——感知、OCR、空间与数量、知识推理、幻觉、安全、效率——而不是看一个总分。选择题/短答用准确率;描述和开放问答要结合任务指标、人工评审或校准后的模型评分。任何单个 Benchmark 都不能代表总体能力,公开题还有训练污染风险,可靠报告要固定预处理/解码配置、给分类别结果和波动。
详细版
传统任务:图像描述(CIDEr)、图文检索(Recall@K)、VQA(Accuracy);综合基准如 MME(覆盖感知+认知子任务)、POPE(专测对象幻觉)。文档、图表、数学、多图、视频还需各自数据集。
自动指标会受答案格式、prompt、评分模型偏差影响,公开题存在训练污染。可靠报告应固定输入预处理与解码配置,给出分类别结果、置信区间或多次运行波动,并对关键失败做人工误差分析。
完整版教学
一、先定义「能力矩阵」再选指标
多模态能力是多维的,总分相同的两个模型可能能力结构完全不同。所以评估第一步是搭一个能力矩阵,分层测:
| 层 | 测什么 |
|---|---|
| 感知层 | 物体、属性、文字、数量、位置 |
| 推理层 | 跨模态知识、图表数学、多步关系 |
| 行为层 | 指令遵循、拒答、安全 |
| 系统层 | 延迟、显存、吞吐、输入上限 |
业务选型要看相关子项,而不是排行榜总分——一个总分高但 OCR 差的模型,对文档场景毫无用处。
二、封闭式指标:可复现但会被钻空子
选择题、是非题、标准短答适合 Accuracy / Precision / Recall / F1,好复现。但有几个陷阱:
- 语言先验/选项模式:模型可能靠常识或选项分布蒙对,没真看图;
- 答案位置偏差:总选 A 或总选「是」也能刷分。
记忆钩子:加一条”文本盲测基线”——把图去掉、只给问题,看模型能拿多少分。如果盲测就有 60 分,那这个 benchmark 很大程度在测语言先验而非视觉能力。这是识别「假多模态成绩」的利器。
三、生成式指标:词面重合 ≠ 事实正确
图像描述常用 BLEU / ROUGE / METEOR / CIDEr 和参考文本比对,但根本问题是:同一张图有很多种正确描述,词面重合度低不代表答错、高也不代表对。
开放问答常用 LLM-as-a-Judge(用另一个强模型打分),但要小心:
- 明确量规(rubric),别让评分模型自由发挥;
- 隐藏参考里的泄漏信息;
- 抽样检查评分器的一致性和位置偏差(评分模型也可能偏爱第一个答案);
- 高风险事实不能只由另一个通用模型评分——它自己也会错。
四、综合与专项基准:各管一段
- MME:多个感知 + 认知子任务,覆盖较广,适合快速总览;
- POPE:聚焦对象存在性幻觉;
- 专项集:OCR、文档、图表、数学、视频、多图关系,要各自补充——综合集里少量样本无法代表长尾业务。
关键认知:Benchmark 名称和排名会变,评估方案要围绕”能力定义”设计,而不是围绕”当前榜单”拼接。今天刷 MME、明天刷新榜单,不如稳定测你真正关心的能力维度。
五、污染与复现:成绩可信吗
公开 benchmark 的题目可能已进入模型的预训练或指令数据,导致成绩虚高(模型「见过答案」)。应对:
- 用私有时效数据(模型训练后才产生的)、图像变换、重新标注的样本;
- 记录完整配置:模型版本、视觉分辨率、最大块数、prompt、采样参数、评分脚本版本;
- 对随机解码或模型评分至少重复多次,观察方差——单次跑分不可信。
六、常见误区与追问
- 误区:一个 benchmark 分高就是强模型。 单个 benchmark 不代表总体,能力是多维的,要分类别看。
- 误区:VQA 准确率高=真看图。 可能靠语言先验/选项偏差蒙对,要加文本盲测基线判断。
- 误区:CIDEr 高=描述正确。 词面重合≠事实正确,同图有多种正确描述。
- 追问:怎么识别”假多模态成绩”? 加文本盲测基线(去图只给问题),盲测高说明在测语言先验。
- 追问:LLM-as-a-Judge 要注意什么? 明确量规、防参考泄漏、查评分器一致性和位置偏差、高危事实不单靠通用模型评。
- 追问:什么是数据污染,怎么防? 公开题进了训练集致虚高;用私有时效数据/图像变换/重标注,记录完整配置。
- 追问:为什么要多次运行? 随机解码和模型评分有方差,单次跑分不可靠,要看波动。
七、加强记忆
多模态评估记「六方向拆开测」:看见(感知)、读懂(OCR/文档)、推理(知识/图表/数学)、诚实(幻觉)、安全、够快(系统指标)——总分相同能力结构可能天差地别,要分类别看。三个识别陷阱的利器钉死:文本盲测基线(去图看还能拿多少分,识别语言先验刷分)、词面重合≠事实正确(CIDEr 高不代表对)、数据污染(公开题进训练集致虚高,用私有时效数据+记录配置+多次跑观察方差)。自动分数用于规模化比较,人工误差分析负责解释「到底错在哪」。