对齐与 RLHF 面试题25 题
25 题
- 01 如何理解 Helpful、Harmless、Honest 三个对齐目标?
- 02 什么是 Constitutional AI 和 RLAIF?用 AI 反馈替代人类反馈行不行?
- 03 什么是大模型对齐(Alignment)?预训练完为什么还要对齐?
- 04 什么是对齐税(alignment tax)和过度拒绝(over-refusal)?
- 05 RLHF 的偏好数据是怎么收集的?标注质量为什么如此关键?
- 06 对齐训练为什么会导致能力回退?如何检测?
- 07 奖励模型(Reward Model)是怎么训练的?为什么用两两比较而非打分?
- 08 偏好建模的基本原理是什么?
- 09 偏好数据中常见哪些偏差?如何诊断与修正?
- 10 如何构建模型对齐评测集?
- 11 如何权衡大模型的安全性与帮助性?
- 12 如何设计可执行的 Constitutional AI 原则?
- 13 如何校准大模型的拒答边界?
- 14 如何校准奖励模型的分数?
- 15 如何在线监控大模型对齐与安全表现?
- 16 什么是 GRPO?为什么推理模型(如 DeepSeek-R1)用它做强化学习?
- 17 什么是奖励模型过优化?如何避免 Reward Hacking?
- 18 什么是奖励作弊(reward hacking)?为什么 RLHF 会"过度优化"?
- 19 实际项目中如何选择 DPO 还是 PPO?
- 20 DPO 的原理是什么?它为什么能跳过奖励模型和强化学习?
- 21 DPO 偏好数据应该采用什么格式?
- 22 PPO 在 RLHF 里是怎么工作的?为什么需要参考模型和 KL 惩罚?
- 23 RLHF 的完整流程是什么?三个阶段各做什么?
- 24 RLHF 和 DPO 有什么区别?偏好对齐应该如何选择?
- 25 RLHF 中如何提高人工标注一致性?
没有符合条件的题目。