← 返回题目列表

模型公平性指标有哪些?

中等 第 21 / 25 题 更新于 2026/09/19
模型评估机器学习面试题模型训练

简化版

公平性评估需先定义受保护群体、决策场景和伤害,再选择人口统计均等、机会均等、均衡赔率、预测值均等等指标。不同公平标准在基率不同且模型不完美时通常无法同时满足,必须公开取舍。

详细版

  • 群体指标需报告样本量和置信区间。

  • 交叉群体可暴露总体分组掩盖的问题。

  • 阈值改变会同时改变公平与业务指标。

  • 概率校准与错误率均等可能冲突。

  • 指标差异不等于自动证明歧视或因果。

完整版教学

一、公平标准约束的是不同条件概率

人口统计均等要求正向决策率接近,不考虑真实标签;机会均等关注真实正类的 TPR。

选择哪项取决于伤害:贷款拒绝、疾病漏诊和广告曝光的主要风险不同,不能套统一指标。

指标选择还决定了条件集合:按真实标签、预测结果还是总体人群比较,会对应完全不同的公平主张和治理动作。

二、底层机制与公式

demographic parity diff=P(hatY=1|A=a)-P(hatY=1|A=b)
equal opportunity diff=TPR_a-TPR_b

三、带数字的推演

群体 A/B 各 1000 人,TPR 为 0.90/0.75,机会均等差 0.15;若正类样本分别只有 50/20,区间会很宽,不能只报 15 个百分点。

四、方案对比

方案/对象核心特点代价或边界
人口统计均等约束选择率可能忽略合法基率差异
机会均等约束正类召回不约束误报
均衡赔率同时约束 TPR/FPR约束强、精度代价可能大

五、执行流程

识别群体/伤害 -> 选主公平指标与效用指标 -> 分层切分
-> 报差值/比率和 CI -> 阈值敏感性 -> 业务/法律审查 -> 持续监控

六、边界条件与工程代价

群体标签可能缺失、误分类或涉及隐私,数据治理本身是评估边界。

整体达到公平阈值可能掩盖女性×地区等交叉群体;但切片越细样本越少,需要层级分析和区间。

记忆钩子:公平评估先问“谁可能受到什么伤害”,再选条件概率。

七、常见误区与追问

  • 误区:公平就是各群体准确率相同。 不同伤害对应不同条件指标。

  • 追问:为何多项公平标准冲突? 基率不同且预测不完美时条件约束不可兼得。

  • 误区:删除敏感属性就公平。 代理特征仍可重建群体差异。

  • 追问:为什么报区间? 小群体点估计波动大。

  • 追问:阈值能否分群设置? 技术上可行,但需审查合法性、校准和业务后果。

八、加强记忆

公平评估先问“谁可能受到什么伤害”,再选条件概率。

指标之间有冲突,必须连同效用、区间和决策背景报告。