← 返回题目列表

RLHF 的偏好数据是怎么收集的?标注质量为什么如此关键?

高频 中等 第 6 / 25 题 更新于 2026/08/02
偏好数据标注数据质量RLHF标注一致性

简化版

RLHF 的偏好数据是让标注者对同一提示下模型生成的多个回答做比较排序(如「A 比 B 好」),这些成对偏好用来训练奖励模型。标注质量至关重要,因为奖励模型的天花板就是偏好数据的质量:如果标注有偏(比如无脑偏好更长、更礼貌的回答)、不一致(不同人标准不同)或被钻空子,这些缺陷会被奖励模型学到、再被 RL 放大,最终让模型学会「取悦标注偏差」而非真正变好。所以要精心设计标注指南、多人标注、一致性校验、防偏措施

详细版

偏好数据长什么样

一条偏好样本:
  提示 x
  回答 A(chosen,被偏好)
  回答 B(rejected,被拒绝)
  (可选:排序、评分维度、置信度)

收集流程

  1. 构造提示集:覆盖真实使用分布(问答、写作、代码、拒答场景等),兼顾多样性和长尾。
  2. 采样多个回答:用当前模型(SFT/策略)对每个提示采样 2 个或多个回答。
  3. 人工比较标注:标注者按指南两两比较/排序,选出更好的。
  4. 质量控制:多人标注同一样本算一致性、设置陷阱题、专家复核。

为什么用比较而非打分:人对「谁更好」的相对判断远比「打几分」的绝对评分一致、稳定(详见奖励模型相关题)。

标注质量的影响

  • 偏差:标注者系统性偏好某些表面特征(长度、格式、语气)→ RM 学到偏差 → RL 放大 → 模型啰嗦套路化。
  • 噪声/不一致:标准不统一 → RM 学到矛盾信号 → 效果打折。
  • 覆盖不足:提示分布偏窄 → 模型在没覆盖的场景对齐差。

完整版教学

一、偏好数据是 RLHF 的”燃料质量”

RLHF 有句朴素但深刻的规律:奖励模型不会比它的偏好数据更好,策略又不会超出奖励模型太多。这意味着偏好数据的质量,从源头上封顶了整个对齐的效果。你可以有最强的 PPO 实现,但如果喂进去的偏好标注满是偏差和噪声,训出来的模型只会「精准地学会那些偏差」。

所以顶级团队在偏好数据上极其讲究:不是随便找人点点「哪个好」,而是像做严谨实验一样设计提示分布、撰写详尽标注指南、层层质检。数据工程在对齐里和在预训练里同样是胜负手。

二、提示集:决定”在哪些场景对齐”

偏好数据的第一步是构造提示集(prompt set),它决定了模型会在哪些场景被对齐:

  • 覆盖真实分布:提示要贴近用户真实用法——问答、写作、改写、代码、头脑风暴、以及需要拒答的有害/越界请求
  • 多样性与长尾:既要常见任务,也要边缘、模糊、对抗性的情形,否则模型在长尾场景对齐差。
  • 难度分层:既有容易分出好坏的,也有需要细腻判断的,让 RM 学到细粒度偏好。

提示集偏窄,模型就只在窄范围里「懂事」,一出圈就露馅。所以提示集的设计本身就是一门功夫。

三、为什么坚持”两两比较”

采样回答后,标注采用两两比较/排序而非绝对打分,原因在人类判断的特性:

  • 相对判断更一致:让人说「A 和 B 哪个好」比「给 A 打几分」稳定得多,绝对分因人而异、受锚定和情绪影响。
  • 更细腻:比较能捕捉「差一点点」的偏好差异,绝对分难以体现。

有时会让标注者对多个回答整体排序,再拆成成对偏好喂给奖励模型。这一设计从源头提升了数据的可靠性(详细机制见奖励模型相关题的 Bradley-Terry)。

四、标注质量的三大杀手

杀手一:系统性偏差(最隐蔽也最致命)。 标注者常无意识地偏好某些表面特征——更长、更多列表、更多免责声明、语气更客气。这些偏好被 RM 学成「长=好」「列表=好」,RL 再把它放大,于是模型变得又臭又长、满屏 123、动不动免责。缓解要靠:明确指南强调「看实质不看长度」、对长度等做去偏(如长度惩罚/平衡)、多样标注者。

杀手二:噪声与不一致。 不同标注者标准不一、同一人前后漂移,会给 RM 矛盾信号。缓解:详尽标注指南 + 培训 + 多人标注同一样本算一致性(agreement)+ 陷阱题筛掉不认真的标注者

杀手三:覆盖偏差。 提示或回答分布不代表真实使用,导致模型在未覆盖场景对齐失败。缓解:提示集贴近真实分布、持续用线上数据补充。

记忆钩子:偏好数据的偏差会被”RM 学到 → RL 放大”两级放大器放大。所以对齐里模型的很多毛病(啰嗦、套话、过度免责),根子往往在标注偏好,而非算法。

五、质量控制的实操手段

把偏好数据做扎实,业界常用组合拳:

  • 详尽标注指南:明确「什么算更好」的维度(准确性、有用性、安全性、简洁性…)和优先级,减少主观漂移。
  • 标注者培训与校准:先做校准集,对齐大家的标准。
  • 多人重叠标注 + 一致性度量:同一样本多人标,算一致率,低一致的样本重审或丢弃。
  • 陷阱/黄金样本:混入已知答案的题,筛掉乱标的标注者。
  • 专家复核 + 分层:高风险(安全)样本由专家把关。
  • 持续迭代:随模型进化,旧偏好数据会分布过时,需要用新策略的输出持续补标。

六、面试拆解算例

对齐题可以用一个偏好训练小实验来拆。假设有 20,000 条提示,每条采样 2 个回答,标注员选出更好的一个,就得到 20,000 对偏好样本。奖励模型不是学习“绝对正确答案”,而是学习 chosen 比 rejected 更符合规范的概率;如果样本里大量偏好“更长、更像解释”的回答,奖励模型就可能把啰嗦误学成高质量。

preference_pair = (prompt, chosen, rejected)
loss = -log sigmoid(r(prompt, chosen) - r(prompt, rejected))
KL_penalty = beta * KL(policy || reference_policy)
环节关键输入常见风险检查办法
偏好采集prompt 与候选回答标注偏见、覆盖不足一致性抽检
奖励建模chosen/rejected 对奖励作弊、长度偏置分桶评估
策略优化奖励 + KL 约束过优化、能力掉点回归集对比
安全评估红队与拒答样本过拒或漏拒人工审查
SFT 模型 -> 采样回答 -> 人类/AI 偏好 -> 奖励信号 -> 策略优化
    |          |             |              |             |
  基础能力    多样候选       规范边界        代理目标       行为改变

因此回答「RLHF 的偏好数据是怎么收集的?标注质量为什么如此关键?」时,要把“偏好从哪里来、奖励学到了什么、优化怎样被约束、上线怎么防奖励作弊”串起来。对齐不是单个算法名,而是一条把人类规范变成模型行为的工程链路。

七、常见误区与追问

  • 误区:偏好数据越多越好。 质量、代表性、去偏比数量更关键;大量有偏数据只会强化偏差。
  • 误区:模型啰嗦是算法问题。 常是标注者偏好长/格式被 RM 学到、RL 放大,根子在数据。
  • 追问:为什么用比较而非打分? 相对判断更一致稳定,绝对分噪声大、难校准。
  • 追问:标注偏差怎么影响最终模型? 被「RM 学到 → RL 放大」,导致模型迎合表面特征(长度、格式、免责)。
  • 追问:怎么保证标注一致性? 详尽指南 + 培训校准 + 多人重叠算一致率 + 陷阱题 + 专家复核。
  • 追问:提示集为什么重要? 它决定模型在哪些场景被对齐,偏窄则长尾场景对齐差。
  • 追问:偏好数据会过时吗? 会,随策略分布漂移需用新输出持续补标,否则 RM 打分失真。

八、加强记忆

偏好数据记「比较标注、质量封顶」:让人对同提示的多个回答两两比较/排序,成对偏好训奖励模型;而 RM 的上限就是数据质量的上限。三大杀手钉死——系统性偏差(偏爱长/格式/免责,会被”RM 学到→RL 放大”两级放大成模型毛病)、噪声不一致、覆盖不足;对应解药是去偏指南 + 多人一致性 + 陷阱题 + 贴近真实分布的提示集 + 持续补标。记住那句要害:模型的啰嗦套话,根子常在标注偏好而非算法——对齐的胜负,很大程度在数据。