如何评估大模型的毒性和偏见?
简化版
毒性评估关注辱骂、威胁、仇恨和骚扰等有害表达;偏见评估关注模型是否因性别、族群、年龄、残障等属性,对内容、推荐或拒答做不合理差异处理。二者相关但不相同:没有脏话的回答也可能包含刻板印象。
可靠评测要同时使用真实分布、挑战样本和反事实配对,例如只替换群体属性,比较回答质量、情感、职业推荐和拒答率。自动毒性分类器需要在目标语言和群体上校准,再结合人工复核,避免把群体自称或讨论歧视的正常文本误判为有害。
公平不是要求所有群体的每个统计值完全相同,而是识别与任务无关、会造成实际伤害的系统性差异。
详细版
一个反事实测试对可写成:
Prompt A: 为一位 35 岁男性工程师写晋升建议
Prompt B: 为一位 35 岁女性工程师写晋升建议
除受保护属性外保持一致,比较能力假设、语气、建议力度和薪酬信息。对 N 个配对样本,可计算质量差异:
gap = mean(score_group_A - score_group_B)
应报告 Bootstrap 置信区间,而不是只看平均 Gap 是否非零。
| 维度 | 例子 | 推荐指标 |
|---|---|---|
| 显式毒性 | 侮辱、威胁 | Toxicity Rate、严重度 |
| 隐性偏见 | 职业刻板印象 | 反事实分差、偏好率 |
| 代表性伤害 | 描述群体时贬损 | 人工 Rubric、关联词 |
| 分配性伤害 | 推荐/筛选结果不同 | TPR/FPR、选择率差异 |
| 过度拒答 | 敏感群体话题被拒 | 分群拒答率 |
完整版教学
1. 毒性与偏见为什么要分开
毒性通常描述表达内容的伤害性,偏见描述模型对群体的系统差异。礼貌的招聘建议也可能更少推荐某群体承担领导角色。
分开评测后,才能选择内容过滤、数据平衡、策略修正或决策流程审计等不同手段。
2. 先定义受保护属性和使用场景
评测属性取决于地区法律、业务和文化语境。还要考虑交叉身份,例如性别与年龄组合,因为单轴均值可能掩盖特定小群体问题。
高风险决策场景需要领域专家和法务参与,生成式模型分数不能直接替代合规判断。
3. 毒性评测集如何构建
包含明确有害、隐晦暗示、引用讨论、反仇恨教育、群体自称和正常敏感话题。只有明显脏话会高估系统能力。
按语言、方言、目标群体和语境切片,避免主语言分类器在低资源语言上失效。
4. 自动毒性分类器有什么偏差
分类器可能看到群体身份词就提高毒性分,误伤“我是一名……”或学术讨论。它也可能漏掉没有脏词的隐性威胁。
用一个未经校准的偏见模型去评估另一个模型,可能只是把评测器的偏见包装成客观分数。
应在人工标注目标域上报告每群体 Precision、Recall 和 FPR。
5. 反事实配对如何控制变量
只替换群体属性,其余职业、资历、行为和语言保持一致。模板应覆盖正面、负面和中性情境,防止结论依赖单一措辞。
| 配对类型 | 改变项 | 观察项 |
|---|---|---|
| 姓名代理 | 群体关联姓名 | 推荐与语气 |
| 代词 | 他/她/TA | 能力假设 |
| 年龄 | 25/55 | 技术适应性描述 |
| 残障 | 有/无相关信息 | 雇佣与能力判断 |
姓名可能同时编码地区和社会经济属性,应谨慎解释。
6. 表征偏见如何评估
给定中性人物描述,观察模型补全的职业、性格、家庭角色和犯罪关联。统计关联频率并由人工判断是否强化贬损刻板印象。
频率差异本身不一定等于伤害,要结合事实基础、任务目标和表达方式解释。
7. 分配性伤害为什么更高风险
当模型参与筛选、定价、风控或资源推荐时,差异会影响真实机会。应评估每群体 TPR、FPR、选择率和校准。
不同公平指标可能互相冲突,无法脱离基准率与业务目标选择。最终决策需人工治理和法律审查。
8. 生成任务如何定义分母
毒性率可以按请求、回答或原子片段计算,拒答是否进入分母也会改变结果。必须在报告中明确。
多次采样时,可报告“至少一次有害”的 Prompt 比例和单次输出有害率,前者更接近攻击者重复尝试风险。
9. 如何同时评估过度拒答
模型可能对涉及某些身份的健康、历史或权益问题更常拒答。使用内容相同、身份变化的配对 Prompt,比较拒答和帮助质量。
降低毒性不能以让少数群体相关话题全面不可用为代价。
10. 人工标注如何降低二次伤害
提供清晰定义和升级渠道,限制单人持续暴露高毒内容,允许退出,并提供心理支持。敏感身份信息按最小必要原则展示。
多标注员独立判断并统计一致性;群体相关语境应邀请具备文化知识的审核者。
11. 统计显著与实际影响如何区分
百万样本下极小 Gap 也可能显著,小样本下严重差异又可能区间很宽。报告效应大小、置信区间、样本数和业务后果。
对小交叉群体可使用分层贝叶斯或合并周期积累数据,但不能因为样本少就不报告风险。
effect_size = metric_group_A - metric_group_B
report = effect_size + 95% confidence interval + sample counts
12. 线上监控应如何保护隐私
监控分群差异可能需要敏感属性,但收集本身有隐私风险。优先使用自愿、合法、聚合的数据,严格访问控制和保留期限。
无法收集真实属性时可用合成反事实探针监控模型行为,但不能把代理属性当作用户真实身份。
13. 改进措施如何验证副作用
数据清洗、对齐、分类器或拒答策略都可能降低某类毒性,却提高过拒或转向更隐晦表达。修复后重新跑毒性、偏见、帮助性和事实性全套切片。
记录策略版本和群体级指标,避免总体均值改善而小群体恶化。
14. 常见误区与追问
- 误区:没有脏话就没有偏见。 隐性刻板印象和分配差异可能非常礼貌。
- 误区:一个毒性分类器分数就是客观真值。 分类器也有语言和群体偏差,必须校准。
- 误区:群体均值相同就完全公平。 交叉群体和错误率分布仍可能不同。
- 误区:差异统计显著就一定有实际伤害。 还要看效应大小、任务和后果。
- 误区:拒绝所有敏感身份问题可消除风险。 这会造成系统性过度拒答和服务不平等。
- 追问:如何测试隐性偏见? 使用控制变量的反事实配对,比较内容、语气、建议与拒答。
- 追问:自动指标和人评冲突怎么办? 检查评测器切片误差,由领域与群体语境专家仲裁。
15. 加强记忆
- 毒性看伤害表达,偏见看群体系统差异。
- 三类数据:真实分布、挑战样本、反事实配对。
- 自动评分要校准:按语言和群体报告误报漏报。
- 双向风险:既看有害输出,也看敏感话题过拒。
- 统计完整:效应大小、置信区间、交叉切片和实际后果一起报告。