← 返回题目列表

如何校准奖励模型的分数?

高频 困难 第 14 / 25 题 更新于 2026/09/17
Reward Model校准偏好概率RLHF

简化版

奖励模型的原始标量没有固定零点和概率含义,校准通常针对分差:把 r_A-r_B 映射为“A 被偏好的概率”,并在独立验证集上检查预测 0.8 的样本是否约有 80% 真被选择。可用温度缩放、Platt scaling 或 isotonic regression,但必须按语言、长度和任务切片验证;策略更新后分布变化,旧校准会失效。

详细版

先明确校准对象:pairwise 胜率、是否超过质量阈值,还是多维奖励中的某一项。对 pairwise 模型可令 p=σ((Δr-b)/T),在校准集学习 T 与偏置 b,再用 reliability diagram、ECE、Brier Score 和 log loss 评估。

reward difference Δr -> calibrator -> preference probability p

校准数据不能与 reward model 训练或最终测试重叠,且要保留真实票数和平局。总体校准良好不代表各切片良好;长度不同或新策略 rollout 可能显著漂移。校准不修复错误排序、数据偏差或 reward hacking,它只调整分数与经验概率的对应关系。

完整版教学

一、为什么原始 reward 不能直接解释

Pairwise loss 只关心差值。给所有回答奖励加 10,偏好概率不变;不同训练随机种子产生的分数尺度也可能完全不同。

因此“reward=5 表示 90% 好”没有依据。要输出概率或设置阈值,必须在有标签数据上建立映射。

记忆钩子:排序回答看 reward,解释概率看 calibration;原始分数没有天然温度计刻度。

二、校准对象通常是奖励分差

给定同一 prompt 的 A/B,计算 Δr=r_A-r_B。Bradley-Terry 已通过 sigmoid 映射,但训练后的尺度可能过尖或过平,需要重新校准。

p(A>B) = σ((Δr - b) / T)

T>1 会让过度自信的概率变平,b 修正系统性偏向。若任务需要单回答“是否合格”,则要单独收集质量阈值标签,不能从 pairwise 概率直接推导。

三、可靠性图直观检查概率含义

把预测概率分成 0.5~0.6、0.6~0.7 等桶,比较桶内平均预测与实际 A 胜率。理想点落在对角线。

概率桶样本数平均预测实际胜率
0.5–0.62000.550.53
0.7–0.81500.750.64
0.9–1.0800.940.78

示例显示高分段过度自信。样本数很少的桶误差大,要同时展示置信区间。

四、ECE、Brier 与 Log Loss 各看什么

ECE 加权汇总各桶预测与实际差异,直观但依赖分桶;Brier Score 是概率与 0/1 标签平方误差;Log Loss 对自信但错误的预测惩罚更重。

Brier = (1/N) Σ (p_i-y_i)^2
ECE   = Σ_b (n_b/N)|acc_b-conf_b|

不要只优化一个指标。模型可能通过把概率全收缩到 0.5 改善某些校准表现,却失去区分能力,因此还需 AUC 或 pair accuracy。

五、常见校准方法与取舍

温度缩放参数少、保持排序,适合主要问题是整体过度自信;Platt scaling 加斜率和偏置;isotonic regression 非参数、更灵活但数据少时容易过拟合。

方法是否保持排序数据需求风险
温度缩放只能修全局尺度
Platt通常是线性假设
Isotonic是(单调)分段过拟合

方法在独立校准集拟合,最终测试集只用于一次评价。

六、票数和平局提供更真实目标

若十名标注者中六人选 A,目标更接近 0.6 而非硬标签 1。使用票数能让校准器学习人类不确定性,平局样本不必丢弃。

标注者并非同质独立,群体偏差仍存在。可按标注群体和任务场景分别报告,不把多数票自动视为普遍真理。

样本展示顺序随机化,避免位置偏差污染概率目标。

七、切片校准比总体数字重要

模型可能对英文短回答校准良好,对中文长回答过度自信。按语言、长度、来源模型、偏好维度和风险类别绘图。

如果总体 ECE=0.03,但安全边界切片 ECE=0.18,不能用总体数字为高风险阈值背书。样本不足的切片采用更保守阈值或补数据。

校准器也可条件化于切片,但组件越复杂越需防过拟合。

八、策略变化后要重新校准

RL 或 DPO 优化会让生成分布向高 reward 区域移动,产生训练时少见的极端回答。原验证集上的映射可能失效。

每轮收集当前策略 rollout 的人类比较,画新可靠性曲线。若 reward 持续升高而人类胜率平台或下降,问题不仅是校准,还可能是过优化或 reward hacking。

校准只能调整置信解释,无法补救奖励模型把错误回答排在正确回答前。

九、常见误区与追问

  • 误区:Reward=0.8 就是 80% 被偏好。 原始标量没有概率语义。
  • 误区:Pair accuracy 高就无需校准。 排序正确仍可能对胜率过度自信。
  • 误区:校准能修复错误排序。 单调校准只改尺度,不能交换样本顺序。
  • 误区:总体 ECE 低就适合所有场景。 高风险与语言切片可能严重失准。
  • 误区:校准一次可以长期使用。 策略和数据分布变化会导致漂移。
  • 追问:为何用分差而非单个 reward? Pairwise 目标只约束同 prompt 下的相对差。
  • 追问:校准集如何划分? 与训练、测试按 prompt/来源簇隔离,并匹配部署分布。
  • 追问:何时选 isotonic? 校准数据充足且关系明显非线性时,否则优先简单方法。

十、加强记忆

奖励校准记住“分数看相对、概率靠验证”:对同 prompt 的 reward 分差学习胜率映射,用可靠性图、ECE、Brier 和 Log Loss检查;温度缩放简单保排序,复杂方法需要更多数据。总体指标之外必须看语言、长度与风险切片,策略更新后用新 rollout 重校准。校准只修刻度,不修错误排序、偏见和奖励漏洞。