如何校准奖励模型的分数?
简化版
奖励模型的原始标量没有固定零点和概率含义,校准通常针对分差:把 r_A-r_B 映射为“A 被偏好的概率”,并在独立验证集上检查预测 0.8 的样本是否约有 80% 真被选择。可用温度缩放、Platt scaling 或 isotonic regression,但必须按语言、长度和任务切片验证;策略更新后分布变化,旧校准会失效。
详细版
先明确校准对象:pairwise 胜率、是否超过质量阈值,还是多维奖励中的某一项。对 pairwise 模型可令 p=σ((Δr-b)/T),在校准集学习 T 与偏置 b,再用 reliability diagram、ECE、Brier Score 和 log loss 评估。
reward difference Δr -> calibrator -> preference probability p
校准数据不能与 reward model 训练或最终测试重叠,且要保留真实票数和平局。总体校准良好不代表各切片良好;长度不同或新策略 rollout 可能显著漂移。校准不修复错误排序、数据偏差或 reward hacking,它只调整分数与经验概率的对应关系。
完整版教学
一、为什么原始 reward 不能直接解释
Pairwise loss 只关心差值。给所有回答奖励加 10,偏好概率不变;不同训练随机种子产生的分数尺度也可能完全不同。
因此“reward=5 表示 90% 好”没有依据。要输出概率或设置阈值,必须在有标签数据上建立映射。
记忆钩子:排序回答看 reward,解释概率看 calibration;原始分数没有天然温度计刻度。
二、校准对象通常是奖励分差
给定同一 prompt 的 A/B,计算 Δr=r_A-r_B。Bradley-Terry 已通过 sigmoid 映射,但训练后的尺度可能过尖或过平,需要重新校准。
p(A>B) = σ((Δr - b) / T)
T>1 会让过度自信的概率变平,b 修正系统性偏向。若任务需要单回答“是否合格”,则要单独收集质量阈值标签,不能从 pairwise 概率直接推导。
三、可靠性图直观检查概率含义
把预测概率分成 0.5~0.6、0.6~0.7 等桶,比较桶内平均预测与实际 A 胜率。理想点落在对角线。
| 概率桶 | 样本数 | 平均预测 | 实际胜率 |
|---|---|---|---|
| 0.5–0.6 | 200 | 0.55 | 0.53 |
| 0.7–0.8 | 150 | 0.75 | 0.64 |
| 0.9–1.0 | 80 | 0.94 | 0.78 |
示例显示高分段过度自信。样本数很少的桶误差大,要同时展示置信区间。
四、ECE、Brier 与 Log Loss 各看什么
ECE 加权汇总各桶预测与实际差异,直观但依赖分桶;Brier Score 是概率与 0/1 标签平方误差;Log Loss 对自信但错误的预测惩罚更重。
Brier = (1/N) Σ (p_i-y_i)^2
ECE = Σ_b (n_b/N)|acc_b-conf_b|
不要只优化一个指标。模型可能通过把概率全收缩到 0.5 改善某些校准表现,却失去区分能力,因此还需 AUC 或 pair accuracy。
五、常见校准方法与取舍
温度缩放参数少、保持排序,适合主要问题是整体过度自信;Platt scaling 加斜率和偏置;isotonic regression 非参数、更灵活但数据少时容易过拟合。
| 方法 | 是否保持排序 | 数据需求 | 风险 |
|---|---|---|---|
| 温度缩放 | 是 | 低 | 只能修全局尺度 |
| Platt | 通常是 | 中 | 线性假设 |
| Isotonic | 是(单调) | 高 | 分段过拟合 |
方法在独立校准集拟合,最终测试集只用于一次评价。
六、票数和平局提供更真实目标
若十名标注者中六人选 A,目标更接近 0.6 而非硬标签 1。使用票数能让校准器学习人类不确定性,平局样本不必丢弃。
标注者并非同质独立,群体偏差仍存在。可按标注群体和任务场景分别报告,不把多数票自动视为普遍真理。
样本展示顺序随机化,避免位置偏差污染概率目标。
七、切片校准比总体数字重要
模型可能对英文短回答校准良好,对中文长回答过度自信。按语言、长度、来源模型、偏好维度和风险类别绘图。
如果总体 ECE=0.03,但安全边界切片 ECE=0.18,不能用总体数字为高风险阈值背书。样本不足的切片采用更保守阈值或补数据。
校准器也可条件化于切片,但组件越复杂越需防过拟合。
八、策略变化后要重新校准
RL 或 DPO 优化会让生成分布向高 reward 区域移动,产生训练时少见的极端回答。原验证集上的映射可能失效。
每轮收集当前策略 rollout 的人类比较,画新可靠性曲线。若 reward 持续升高而人类胜率平台或下降,问题不仅是校准,还可能是过优化或 reward hacking。
校准只能调整置信解释,无法补救奖励模型把错误回答排在正确回答前。
九、常见误区与追问
- 误区:Reward=0.8 就是 80% 被偏好。 原始标量没有概率语义。
- 误区:Pair accuracy 高就无需校准。 排序正确仍可能对胜率过度自信。
- 误区:校准能修复错误排序。 单调校准只改尺度,不能交换样本顺序。
- 误区:总体 ECE 低就适合所有场景。 高风险与语言切片可能严重失准。
- 误区:校准一次可以长期使用。 策略和数据分布变化会导致漂移。
- 追问:为何用分差而非单个 reward? Pairwise 目标只约束同 prompt 下的相对差。
- 追问:校准集如何划分? 与训练、测试按 prompt/来源簇隔离,并匹配部署分布。
- 追问:何时选 isotonic? 校准数据充足且关系明显非线性时,否则优先简单方法。
十、加强记忆
奖励校准记住“分数看相对、概率靠验证”:对同 prompt 的 reward 分差学习胜率映射,用可靠性图、ECE、Brier 和 Log Loss检查;温度缩放简单保排序,复杂方法需要更多数据。总体指标之外必须看语言、长度与风险切片,策略更新后用新 rollout 重校准。校准只修刻度,不修错误排序、偏见和奖励漏洞。