偏好建模的基本原理是什么?
简化版
偏好建模把“同一输入下回答 A 是否优于 B”转成概率学习问题。常见 Bradley-Terry 形式让模型输出标量奖励 r(x,y),并令 P(A>B)=sigmoid(r_A-r_B);训练最大化人类选择的概率。它学到的是采集人群和指南下的相对偏好,不是客观真理,必须处理平局、标注分歧、长度捷径和分布外样本,并用准确率之外的校准、切片与反事实测试评估。
详细版
训练数据包含共享 prompt、chosen、rejected 与元数据。奖励模型分别给两回答打分,用差值计算 pairwise loss:
L = -log σ(r_chosen - r_rejected)
只有分差参与损失,因此奖励绝对零点没有固有意义。部署中可用分数排序候选、训练 RL 策略或筛选数据,但阈值必须在具体数据上校准。若标注存在票数或平局,可使用软标签、置信权重或支持 tie 的模型,而不是强行指定赢家。
诊断要按语言、长度、来源与偏好维度切片,比较简单表面特征基线,并用交换顺序、等长改写和事实反转测试捷径。奖励模型与生成策略分布相互影响,策略优化后要持续用新样本人评,防止离线准确率高却被策略钻漏洞。
完整版教学
一、为什么使用成对偏好
给开放回答打绝对 1~10 分很难统一,不同标注者对“7 分”理解不同;比较同一问题的两个回答通常更容易。偏好建模把局部比较汇总成可泛化的排序函数。
但比较仍受标注指南、候选质量和人群影响。模型学到的是条件化偏好分布,不应称为普遍价值函数。
记忆钩子:奖励分数是“在这套数据与标准下更可能被选中”,不是回答的客观道德温度计。
二、Bradley-Terry 概率模型
奖励模型为回答输出标量 r,A 胜 B 的概率写为:
P(A > B | x) = exp(r_A) / (exp(r_A)+exp(r_B))
= σ(r_A-r_B)
若分差为 0,胜率 0.5;分差约 2 时胜率约 0.881。训练使被选回答的相对奖励更高。
给所有奖励同时加 100 不改变分差,因此绝对值不可跨模型直接比较。
三、从语言模型得到标量分数
常见做法在 Transformer 最后一层某个位置接线性 reward head,输入完整 prompt+response,输出一个标量。padding、截断和最后 token 位置处理必须一致。
| 设计项 | 风险 |
|---|---|
| 截断回答尾部 | 丢失最终结论或违规内容 |
| chat template 不一致 | 训练部署分布偏移 |
| 只看最后 token | padding 位置选错 |
| 超长 prompt | 回答信号被上下文稀释 |
模型也可做多维评分,再按策略组合,便于区分事实、安全与风格。
四、平局与标注分歧不是脏数据
A 与 B 质量接近时,三位标注者可能 2:1。把它压成硬标签会夸大确定性。可用胜票比例作为软目标,或设置 tie 区间与样本权重。
例如 A 获 6/10 票,目标概率可取 0.6,而不是 1.0。高风险样本仍需专家仲裁,因为多数票可能共享偏差。
记录标注者群体和偏好维度,有助于分析合理价值差异与随机噪声。
五、传递性假设可能不成立
标量排序隐含 A>B、B>C 时倾向 A>C,但人类偏好可能循环:A 最准确、B 最简洁、C 最安全,不同两两比较强调不同维度。
若循环频繁,说明单一标量过度压缩多目标。可训练分维度奖励、使用条件化权重,或在特定硬安全边界下再优化帮助性。
数据分析应查找偏好环和上下文依赖,而不是把所有冲突当标注错误删除。
六、奖励模型容易学习捷径
chosen 更长、列表更多或措辞更自信时,模型可能依赖表面特征。训练一个只用长度和标点的逻辑回归基线,若能达到 70% 准确率,数据偏差已很严重。
构造反事实对:保留事实内容只改变长度、顺序和格式,看 reward 是否异常变化。事实性训练则替换一个关键数字,检查分数方向。
消除捷径需要数据反平衡和困难对,而不只是增大模型。
七、离线指标不能只看 pair accuracy
pair accuracy 衡量排序方向,但不反映分数概率是否可信、不同切片是否公平,也不反映策略能否利用漏洞。
应报告 log loss、校准曲线、AUC、按语言/长度/来源的准确率、交换顺序一致性和人工相关。对接近平局样本,硬准确率本身波动大。
时间外或新策略生成的测试最关键,因为训练分布内高分容易来自记忆候选风格。
八、策略优化会改变输入分布
奖励模型训练时看到普通候选,RL 策略会主动搜索高奖励区域,产生极端长、模板化或异常回答。此时奖励模型处于分布外,错误会被放大。
循环应包含当前策略 rollout、人类复核、对抗样本加入和奖励模型更新。还可使用 KL 约束、奖励裁剪和多模型 ensemble 降低单一漏洞影响。
监控 reward 上升但人评下降的分叉,它是过优化的重要信号。
九、常见误区与追问
- 误区:奖励分数 8 就比 4 好一倍。 分数只通过差值定义,没有固定比例尺度。
- 误区:偏好准确率高就能安全用于 RL。 策略会产生分布外样本并放大漏洞。
- 误区:分歧样本都应删除。 它们可能表示真实边界和多目标冲突。
- 误区:更大模型自然不会学长度捷径。 捷径若预测标签,大模型更容易利用。
- 误区:一个标量足以表示所有价值。 安全、事实和风格可能需要多维建模。
- 追问:为什么奖励绝对值不可比较? Pairwise loss 对共同平移不敏感,只约束相对差。
- 追问:如何处理 tie? 使用软标签、tie 模型或低权重,而不是随机指定 chosen。
- 追问:怎样发现 reward hacking? 用当前策略样本人评、反事实测试并观察 reward—人评背离。
十、加强记忆
偏好建模记住“同题比较、分差定概率、分数非真理、分歧要保留、策略会找漏洞”:Bradley-Terry 用 σ(r_A-r_B) 学相对选择,奖励绝对值没有天然尺度;平局和票数表达不确定性,多维冲突不应全压成一个标量。评测同时查校准、切片与表面捷径,并持续用当前策略的新样本人评,防止离线高准确奖励被在线优化钻空子。