评测标注一致性应该如何衡量?
简化版
标注一致性不能只看“有多少标签相同”,因为类别极不均衡时,标注员靠猜多数类也会高度一致。两名标注员的分类任务常用 Cohen’s Kappa,多人分类用 Fleiss’ Kappa,存在缺失值或序数/连续标签时可用 Krippendorff’s Alpha。
一致性低不一定是标注员能力差,也可能说明任务定义含糊、Rubric 不完整或样本本身有多种合理答案。应按类别和切片查看混淆,复盘分歧样本并更新指南,再独立重标。
一致性指标的价值不是给标注员排名,而是发现评测标准在哪里还不够可执行。
详细版
Cohen’s Kappa 会扣除随机一致:
κ = (p_o - p_e) / (1 - p_e)
p_o 是实际一致率,p_e 是根据双方标签边际分布计算的机会一致率。若两人 100 条中有 90 条一致,p_o=0.9;如果两人都几乎总标“通过”,p_e 可能达到 0.82,则 κ=(0.9-0.82)/(1-0.82)=0.44,说明扣除基准后只属中等一致。
| 指标 | 适用场景 | 优点 | 注意点 |
|---|---|---|---|
| Percent Agreement | 快速描述 | 直观 | 不扣随机一致 |
| Cohen’s Kappa | 两人名义分类 | 经典易算 | 受类别流行率影响 |
| Fleiss’ Kappa | 多人名义分类 | 支持每题多人 | 通常要求固定人数 |
| Krippendorff’s Alpha | 多人、多尺度、缺失值 | 最灵活 | 距离函数要定义正确 |
| ICC | 连续评分 | 衡量评分一致性 | 型号选择影响含义 |
不要机械使用“κ>0.8 即可”。高风险安全标签可能要求更高一致和专家仲裁,探索性审美评分则天然更主观,应同时报告分布和置信区间。
完整版教学
1. 一致性与准确性不是同一件事
两名标注员可以稳定地给出同一个错误标签,因此高一致不代表真值正确。准确性需要领域专家、可验证证据或黄金样本判断。
一致性回答“规则是否被不同人以相近方式执行”,准确性回答“执行结果是否正确”。二者都要监控。
2. 为什么简单一致率会误导
假设 95% 样本都应为“安全”,两个标注员全部标安全就有 100% 一致,却完全识别不了危险样本。
机会校正指标利用双方标签分布估计随机一致,使极端类别失衡下的问题更明显。
3. Cohen’s Kappa 怎样计算
先建立两名标注员的混淆矩阵,计算对角线比例 p_o,再用边际概率乘积求 p_e。
p_e = P_A(pass)P_B(pass) + P_A(fail)P_B(fail)
κ=1 表示完全一致,κ=0 表示不优于机会基准,负值表示比随机预期更差。但小样本下区间可能很宽。
4. Kappa Paradox 是什么
类别极端不均衡时,即使观察一致率很高,Kappa 也可能偏低;反之边际分布差异也会改变数值。这不是公式错误,而是机会基准的结果。
遇到“90% 一致但 κ 很低”时,应同时看混淆矩阵、类别比例和正类一致率,而不是直接否定某一个数字。
可补充 Gwet’s AC1 或按类报告一致,但必须预先定义,不能为得到好看结果临时换指标。
5. 多标注员任务如何处理
Fleiss’ Kappa 适合多个标注员对名义类别评分;Krippendorff’s Alpha 支持每题人数不同和缺失值,更适合真实众包。
若每题随机分配 3 人,但某些题只有 2 人完成,Alpha 通常比强行丢弃样本更合理。
6. 序数和连续评分为什么需要距离
1 分与 2 分的分歧通常小于 1 分与 5 分。普通分类 Kappa 把它们都视为“不一致”,会丢失程度信息。
加权 Kappa 可给相邻等级较小惩罚;Krippendorff’s Alpha 可选择 ordinal/interval 距离;连续评分也可用 ICC。
7. 如何给指标估计置信区间
单个一致性数字有抽样误差。可以按样本 Bootstrap,例如重采样 1000 次,取 2.5% 和 97.5% 分位作为区间。
若只有 30 条安全样本,即使 κ=0.85,置信区间也可能很宽。发布门禁前应确保关键切片样本量足够。
8. 怎样设计一致性抽样
不必让所有样本多人标注,但应随机抽取一定比例,并对高风险、边界、低置信样本过采样。估计总体指标时要注意抽样权重。
如果只挑“看起来容易争议”的题,一致性会低估总体;只抽简单题则会高估。报告必须说明抽样策略。
9. 分歧分析比总分更重要
对每个标签对建立混淆矩阵,并按语言、领域、风险和标注员分组。常见模式可能是“完整但啰嗦”在 3/4 分间摇摆,或“软拒答”在安全/过拒间混淆。
这些模式直接指向 Rubric 需要补充的边界例,而一个总体 Kappa 无法告诉你原因。
| 分歧模式 | 可能根因 | 优先动作 |
|---|---|---|
| 某一类别系统性偏移 | 标签定义或培训不一致 | 补正反例并重新校准 |
| 仅专业领域分歧 | 领域知识不足 | 引入专家或补证据 |
| 相邻等级摇摆 | 等级锚点过细 | 合并等级或定义距离 |
| 单个标注员异常 | 操作或质量问题 | 定向复核与再培训 |
10. 仲裁流程如何设计
先独立标注,禁止标注员提前讨论以制造表面一致;分歧后由资深仲裁员参考证据裁决,并记录理由。
定期把高频争议转成指南案例,再用新样本验证一致性是否提升。旧样本上讨论后重标不能作为独立效果证明。
11. 如何防止标注员漂移
长周期项目中,标注员对标准的理解会变化。可以插入隐藏黄金题、监控滚动一致性,并定期校准培训。
黄金题本身也要复核,不能把与旧答案不一致自动认定为标注员错误。政策更新后应同步版本。
12. 一致性低时应该怎么办
先判断是样本信息不足、Rubric 歧义、领域知识缺失,还是个别标注质量问题。对应措施可能是补上下文、拆分标签、增加示例、安排专家或重新培训。
若任务本质主观,可保留标签分布而不是强行制造单一真值,并在模型评测中使用偏好概率或多参考答案。
13. 常见误区与追问
- 误区:Percent Agreement 高就说明标注可靠。 类别失衡会制造虚高一致。
- 误区:Kappa 低一定是标注员不认真。 也可能是任务边界或 Rubric 有问题。
- 误区:所有任务都应该追求 κ>0.8。 阈值应结合风险、主观性和用途。
- 误区:仲裁后标签相同可以计入原始一致性。 仲裁是产出真值,不是独立一致证据。
- 误区:总体一致高就无需看切片。 少数高危类别可能几乎无法一致判断。
- 追问:两人连续打分用什么? 根据目标选择 ICC 或相关系数;一致性通常优先 ICC。
- 追问:多人且有缺失标签用什么? Krippendorff’s Alpha 通常更合适。
14. 加强记忆
- 一致不等于正确。
- 简单一致率不扣随机,Kappa/Alpha 会扣机会一致。
- 两人用 Cohen,多人用 Fleiss,复杂缺失优先 Alpha。
- 序数评分要考虑分歧距离,连续评分可看 ICC。
- 最终目的:通过分歧定位 Rubric、样本和培训问题。