对齐与 RLHF 面试题25 题
- 01 偏好数据如何影响大模型对齐效果?
- 02 什么是 Constitutional AI 和 RLAIF?用 AI 反馈替代人类反馈行不行?
- 03 什么是大模型对齐(Alignment)?预训练完为什么还要对齐?
- 04 什么是对齐税(alignment tax)和过度拒绝(over-refusal)?
- 05 Helpful、Harmless、Honest 如何在对齐中权衡?
- 06 RLHF 的偏好数据是怎么收集的?标注质量为什么如此关键?
- 07 奖励模型(Reward Model)是怎么训练的?为什么用两两比较而非打分?
- 08 奖励模型过优化是什么?为什么会伤害效果?
- 09 什么是 GRPO?为什么推理模型(如 DeepSeek-R1)用它做强化学习?
- 10 什么是奖励作弊(reward hacking)?为什么 RLHF 会"过度优化"?
- 11 DPO 的原理是什么?它为什么能跳过奖励模型和强化学习?
- 12 DPO 和 PPO 在实际对齐中怎么选?
- 13 PPO 在 RLHF 里是怎么工作的?为什么需要参考模型和 KL 惩罚?
- 14 RLHF 的完整流程是什么?三个阶段各做什么?
- 15 RLHF 和 DPO 有什么区别?偏好对齐应该如何选择?
- 16 安全拒答边界如何校准?
- 17 对齐后模型能力退化如何发现?
- 18 对齐模型的评测集应该如何设计?
- 19 偏好数据偏差会如何影响大模型对齐?
- 20 RLHF 标注员一致性为什么重要?
- 21 安全性和有用性冲突时如何权衡?
- 22 对齐模型上线后应该监控什么?
- 23 奖励模型需要校准吗?
- 24 Constitutional AI 的原则应该如何设计?
- 25 DPO 数据格式为什么使用 chosen/rejected 对?
没有符合条件的题目。