← 返回题目列表

视觉定位能力如何评估?

中等 第 24 / 25 题 更新于 2026/09/18
多模态大模型Visual GroundingIoU评测

简化版

视觉定位评估不能只看“答案对不对”,还要比较预测区域与标注区域的重合程度。检测式任务常用 IoU、Acc@IoU 和 mAP,指代表达定位常报 Acc@0.5;点定位可用 Point-in-Box,生成坐标还要统计格式有效率、越界率以及不同目标尺寸上的分层结果。

详细版

先按输出形态选指标:框用 IoU,掩码用 mask IoU,点用命中率,多个目标用 Precision、Recall 与 mAP。单框定位可定义 Acc@0.5 = IoU≥0.5 的样本数 / 总样本数,但必须同时报告小目标、遮挡、关系描述和拒答样本,否则总体均值会掩盖关键缺陷。

评测集应覆盖“左边第二个杯子”这类关系指代、无对应目标的负样本、一句话对应多个区域,以及分辨率和长宽比变化。生产评估还应检查坐标协议、解析失败、推理延迟与人工可接受率,并用同一解码和后处理比较版本,避免把后处理差异误算成模型能力。

表达 + 图像 -> 模型坐标 -> 协议解析 -> 映射回原图 -> 几何指标 -> 分桶诊断

完整版教学

一、先明确“定位正确”的对象

Visual Grounding 是把语言表达绑定到图像中的空间实体,输出可以是矩形框、分割掩码、关键点或一组区域。输出类型不同,正确性的定义也不同:框只描述粗粒度范围,掩码能评价轮廓,点只回答目标大致在哪里。面试时先声明任务和输出协议,后面的指标才有共同语境。

例如“指出穿红衣服的人”可能有三个合理输出:一个人框、人体掩码,或落在人身上的点击点。拿框的 IoU 去要求点击模型没有意义,拿 Point-in-Box 又无法区分一个紧框和覆盖半张图的宽框。因此评估首先是任务定义问题,其次才是公式问题。

二、IoU 衡量了什么

两个框的交并比定义为交集面积除以并集面积:

IoU(B_pred, B_gt) = area(B_pred ∩ B_gt) / area(B_pred ∪ B_gt)

若标注框为 (0,0,100,100),预测框为 (20,20,100,100),交集面积为 80×80=6400,并集为 10000+6400-6400=10000,所以 IoU 为 0.64。它通过阈值后可算一次命中,但 0.510.95 都记作 1,故应同时给平均 IoU 或多个阈值结果。

记忆钩子:IoU 看“框得准不准”,Acc@阈值看“有多少题过线”;两者回答的问题不同,不能只报一个数字。

三、从单目标扩展到多目标

指代表达只有一个目标时,常用 Acc@0.5;一条表达可能对应多个目标时,需要先做预测与标注的匹配,再统计 Precision、Recall 或 mAP。匹配通常依据 IoU 阈值并保证一一对应,重复框会产生假阳性,漏掉对象会产生假阴性。

场景推荐指标容易遗漏的问题
单个矩形框Acc@0.5、mean IoU阈值附近不稳定
多个同类目标Precision、Recall、mAP重复框与漏检
分割定位mask IoU、Dice细长边界
点击操作Point-in-Box、像素距离大框让命中虚高
无目标表达拒答准确率、FPR模型强行给框

四、坐标协议会制造“假失败”

模型可能输出绝对像素、0~1 浮点坐标或 0~1000 离散坐标。图片经过缩放、补边和裁剪后,预测必须按完全相反的变换映射回原图;否则模型看似偏移,其实是工程坐标系错了。评测程序还要约定 (x1,y1,x2,y2) 是否含边界、宽高顺序以及旋转方向。

假设原图 1920×1080 被等比缩放到 1024×576,再上下各补边 224 像素。模型输出的 y 坐标要先减 224,再除以缩放比 1024/1920;直接按 1024×1024 比例映射会产生系统性纵向偏差。应单独记录 JSON 解析失败率、坐标越界率和逆变换单测结果。

五、数据集必须按难度切片

总体准确率会被大量居中大目标主导。可靠评测至少按目标面积、遮挡程度、表达长度、关系推理、文字目标、图像分辨率和负样本切片。特别是小目标:面积占比低于 1% 时,同样 5 像素偏差可能让 IoU 从合格跌到很低。

可以构造 1000 条集合,其中大中小目标各 250 条,关系表达 150 条,无目标 100 条。若总体 Acc@0.5 为 78%,但小目标只有 42%、无目标拒答率只有 30%,就不能宣称模型定位可靠。切片结果还直接指向改进动作:提高分辨率、加强关系数据或增加拒答训练。

六、标注质量决定指标上限

自然语言表达可能有歧义,例如“桌上的杯子”在画面中存在两个。应允许多个可接受标注,或把歧义样本标记出来单独统计。标注框松紧不一致也会显著影响 IoU,尤其对细长物体,因此要制定边界规则并做标注者一致性抽检。

建议对至少 10% 样本双人标注,计算标注间 IoU 和分歧率。若人工之间 Acc@0.5 只有 85%,模型的 83% 未必代表能力差,而可能说明问题定义不稳。评测集版本、标注修订和排除规则都应随报告保存,保证历史结果可复现。

七、离线分数还要连接业务结果

机器人抓取、UI 点击和图像问答对定位误差的容忍度不同。UI 按钮框 IoU 不高,只要点击点落在可点击区域也可能成功;机器人抓取则可能需要关键点误差小于数毫米。业务评测应在几何指标之后再运行任务成功率,避免优化代理指标却伤害真实效果。

线上可监控合法坐标率、点击成功率、用户纠正率和 P95 延迟,并抽样回放失败轨迹。版本灰度时保持输入图片预处理、Prompt、解码参数一致,只替换待比较组件。这样才能判断提升来自模型,而不是某次裁剪或解析规则变化。

八、常见误区与追问

  • 误区:Acc@0.5 高就代表定位能力全面。 它会掩盖小目标、负样本和阈值附近的质量差异,应结合分桶与连续指标。
  • 误区:坐标解析失败可以从分母中删除。 解析失败就是系统失败,删除会人为抬高结果,应单列并计入端到端指标。
  • 误区:框越大越容易命中,所以输出整图最好。 Point-in-Box 可能被大框钻空子,IoU、面积惩罚或点击距离能约束这种行为。
  • 追问:为什么同时报告 Acc@0.25、0.5、0.75? 多阈值曲线能区分粗定位和精定位,也减少单一阈值偶然性。
  • 追问:无目标样本怎么评? 约定空输出,统计拒答召回率与错误框选率,并检查有目标样本是否被过度拒绝。
  • 追问:如何比较不同输入分辨率? 固定数据与后处理,报告准确率、视觉 Token、延迟和显存的 Pareto 曲线。

九、加强记忆

评估视觉定位可记成“型、标、系、片、业”:先确定输出类型,再选几何指标;核对坐标系与逆变换;按尺寸、关系、遮挡和负样本切片;最后连接点击、抓取等业务成功率。面试回答若能给出 IoU 算例、说明 Acc@0.5 的盲区,并补上解析失败与人工上限,就既覆盖模型能力,也覆盖端到端工程可靠性。