← 返回题目列表

评测标注一致性应该如何衡量?

中等 第 23 / 26 题 更新于 2026/09/17

简化版

标注一致性不能只看“有多少标签相同”,因为类别极不均衡时,标注员靠猜多数类也会高度一致。两名标注员的分类任务常用 Cohen’s Kappa,多人分类用 Fleiss’ Kappa,存在缺失值或序数/连续标签时可用 Krippendorff’s Alpha。

一致性低不一定是标注员能力差,也可能说明任务定义含糊、Rubric 不完整或样本本身有多种合理答案。应按类别和切片查看混淆,复盘分歧样本并更新指南,再独立重标。

一致性指标的价值不是给标注员排名,而是发现评测标准在哪里还不够可执行。

详细版

Cohen’s Kappa 会扣除随机一致:

κ = (p_o - p_e) / (1 - p_e)

p_o 是实际一致率,p_e 是根据双方标签边际分布计算的机会一致率。若两人 100 条中有 90 条一致,p_o=0.9;如果两人都几乎总标“通过”,p_e 可能达到 0.82,则 κ=(0.9-0.82)/(1-0.82)=0.44,说明扣除基准后只属中等一致。

指标适用场景优点注意点
Percent Agreement快速描述直观不扣随机一致
Cohen’s Kappa两人名义分类经典易算受类别流行率影响
Fleiss’ Kappa多人名义分类支持每题多人通常要求固定人数
Krippendorff’s Alpha多人、多尺度、缺失值最灵活距离函数要定义正确
ICC连续评分衡量评分一致性型号选择影响含义

不要机械使用“κ>0.8 即可”。高风险安全标签可能要求更高一致和专家仲裁,探索性审美评分则天然更主观,应同时报告分布和置信区间。

完整版教学

1. 一致性与准确性不是同一件事

两名标注员可以稳定地给出同一个错误标签,因此高一致不代表真值正确。准确性需要领域专家、可验证证据或黄金样本判断。

一致性回答“规则是否被不同人以相近方式执行”,准确性回答“执行结果是否正确”。二者都要监控。

2. 为什么简单一致率会误导

假设 95% 样本都应为“安全”,两个标注员全部标安全就有 100% 一致,却完全识别不了危险样本。

机会校正指标利用双方标签分布估计随机一致,使极端类别失衡下的问题更明显。

3. Cohen’s Kappa 怎样计算

先建立两名标注员的混淆矩阵,计算对角线比例 p_o,再用边际概率乘积求 p_e

p_e = P_A(pass)P_B(pass) + P_A(fail)P_B(fail)

κ=1 表示完全一致,κ=0 表示不优于机会基准,负值表示比随机预期更差。但小样本下区间可能很宽。

4. Kappa Paradox 是什么

类别极端不均衡时,即使观察一致率很高,Kappa 也可能偏低;反之边际分布差异也会改变数值。这不是公式错误,而是机会基准的结果。

遇到“90% 一致但 κ 很低”时,应同时看混淆矩阵、类别比例和正类一致率,而不是直接否定某一个数字。

可补充 Gwet’s AC1 或按类报告一致,但必须预先定义,不能为得到好看结果临时换指标。

5. 多标注员任务如何处理

Fleiss’ Kappa 适合多个标注员对名义类别评分;Krippendorff’s Alpha 支持每题人数不同和缺失值,更适合真实众包。

若每题随机分配 3 人,但某些题只有 2 人完成,Alpha 通常比强行丢弃样本更合理。

6. 序数和连续评分为什么需要距离

1 分与 2 分的分歧通常小于 1 分与 5 分。普通分类 Kappa 把它们都视为“不一致”,会丢失程度信息。

加权 Kappa 可给相邻等级较小惩罚;Krippendorff’s Alpha 可选择 ordinal/interval 距离;连续评分也可用 ICC。

7. 如何给指标估计置信区间

单个一致性数字有抽样误差。可以按样本 Bootstrap,例如重采样 1000 次,取 2.5% 和 97.5% 分位作为区间。

若只有 30 条安全样本,即使 κ=0.85,置信区间也可能很宽。发布门禁前应确保关键切片样本量足够。

8. 怎样设计一致性抽样

不必让所有样本多人标注,但应随机抽取一定比例,并对高风险、边界、低置信样本过采样。估计总体指标时要注意抽样权重。

如果只挑“看起来容易争议”的题,一致性会低估总体;只抽简单题则会高估。报告必须说明抽样策略。

9. 分歧分析比总分更重要

对每个标签对建立混淆矩阵,并按语言、领域、风险和标注员分组。常见模式可能是“完整但啰嗦”在 3/4 分间摇摆,或“软拒答”在安全/过拒间混淆。

这些模式直接指向 Rubric 需要补充的边界例,而一个总体 Kappa 无法告诉你原因。

分歧模式可能根因优先动作
某一类别系统性偏移标签定义或培训不一致补正反例并重新校准
仅专业领域分歧领域知识不足引入专家或补证据
相邻等级摇摆等级锚点过细合并等级或定义距离
单个标注员异常操作或质量问题定向复核与再培训

10. 仲裁流程如何设计

先独立标注,禁止标注员提前讨论以制造表面一致;分歧后由资深仲裁员参考证据裁决,并记录理由。

定期把高频争议转成指南案例,再用新样本验证一致性是否提升。旧样本上讨论后重标不能作为独立效果证明。

11. 如何防止标注员漂移

长周期项目中,标注员对标准的理解会变化。可以插入隐藏黄金题、监控滚动一致性,并定期校准培训。

黄金题本身也要复核,不能把与旧答案不一致自动认定为标注员错误。政策更新后应同步版本。

12. 一致性低时应该怎么办

先判断是样本信息不足、Rubric 歧义、领域知识缺失,还是个别标注质量问题。对应措施可能是补上下文、拆分标签、增加示例、安排专家或重新培训。

若任务本质主观,可保留标签分布而不是强行制造单一真值,并在模型评测中使用偏好概率或多参考答案。

13. 常见误区与追问

  • 误区:Percent Agreement 高就说明标注可靠。 类别失衡会制造虚高一致。
  • 误区:Kappa 低一定是标注员不认真。 也可能是任务边界或 Rubric 有问题。
  • 误区:所有任务都应该追求 κ>0.8。 阈值应结合风险、主观性和用途。
  • 误区:仲裁后标签相同可以计入原始一致性。 仲裁是产出真值,不是独立一致证据。
  • 误区:总体一致高就无需看切片。 少数高危类别可能几乎无法一致判断。
  • 追问:两人连续打分用什么? 根据目标选择 ICC 或相关系数;一致性通常优先 ICC。
  • 追问:多人且有缺失标签用什么? Krippendorff’s Alpha 通常更合适。

14. 加强记忆

  1. 一致不等于正确。
  2. 简单一致率不扣随机,Kappa/Alpha 会扣机会一致。
  3. 两人用 Cohen,多人用 Fleiss,复杂缺失优先 Alpha。
  4. 序数评分要考虑分歧距离,连续评分可看 ICC。
  5. 最终目的:通过分歧定位 Rubric、样本和培训问题。