什么是大模型对齐(Alignment)?预训练完为什么还要对齐?
简化版
对齐(Alignment) 指让大模型的行为符合人类的意图和价值观,通常概括为 3H:有用(Helpful)、诚实(Honest)、无害(Harmless)。预训练完的 base 模型只会「预测下一个 token」——它像一个博学但不听话的续写机器:你问它问题,它可能续写出更多问题而不是回答;它可能一本正经地编造、输出有害内容。对齐就是把「会说话的续写机」调教成「听得懂指令、愿意帮忙、说真话、不作恶的助手」。主流做法是指令微调(SFT)+ 基于人类反馈的强化学习(RLHF)(或 DPO 等替代)。
详细版
base 模型的问题
预训练只优化「预测下一个词」,产出的 base 模型有三类不对齐:
- 不听指令:给它「翻译这句话」,它可能续写出更多类似句子,而非执行翻译(它在模仿语料里的模式,不理解「你在下命令」)。
- 不诚实:会自信地编造事实(幻觉),不会说「我不知道」。
- 可能有害:会输出危险、偏见、违法内容,因为语料里什么都有。
对齐的目标:3H
| 维度 | 含义 |
|---|---|
| Helpful | 理解并尽力完成用户真实意图 |
| Honest | 说真话、承认不确定、不编造 |
| Harmless | 拒绝有害请求、不产出危险/偏见内容 |
三者常有张力(越无害可能越不有用,见「对齐税」「过度拒绝」)。
对齐的主要手段
- 指令微调(SFT):用「指令→高质量回答」的示范数据微调,让模型学会遵循指令、以助手口吻回答。
- RLHF(人类反馈强化学习):用人类偏好训练奖励模型,再用强化学习优化模型输出,让它更贴合人类喜好。
- 替代方案:DPO(直接偏好优化)、Constitutional AI / RLAIF(用 AI 反馈)等。
完整版教学
一、为什么”会预测下一个词”不等于”会当助手”
预训练教会了模型海量知识和语言能力,但它的目标函数只有一个:最大化下一个 token 的似然。这意味着 base 模型学到的是「互联网文本的分布」,而不是「如何有帮助地回应一个人」。
举个直观例子:给 base 模型输入「请问北京到上海怎么走?」,它可能续写「请问上海到广州怎么走?请问广州到深圳怎么走?」——因为在语料里,问句后面经常跟着更多问句。它在模仿文本模式,而非理解你在提问并作答。base 模型的这种「答非所问」不是能力不足,而是目标不对齐:它优化的是续写,不是帮忙。
对齐要解决的正是这个鸿沟——把”预测文本”的目标,转向”满足人类意图”的目标。
二、对齐要达成的三个标准:3H
Anthropic/OpenAI 把对齐目标凝练成 3H:
- Helpful(有用):准确理解用户意图(哪怕表述不清),尽力提供有价值的帮助。这是助手存在的意义。
- Honest(诚实):输出真实信息,不知道就说不知道,不编造、不误导,校准自己的确定性。对抗「幻觉」。
- Harmless(无害):不协助危险/违法行为,不输出仇恨、偏见、隐私泄漏等有害内容。
关键认知是三者存在内在张力:一个只会说「这个我不能回答」的模型很无害,但毫无用处;一个有求必应的模型很有用,但可能被滥用作恶。对齐的艺术就在于在 3H 之间取得平衡,这也引出了后面的「对齐税」和「过度拒绝」问题。
三、对齐的两步走:先 SFT,再 RLHF
主流对齐流程分两大步,循序渐进:
第一步:指令微调(SFT)——先学会”听话”。 用人工编写或精选的「指令 + 优质回答」示范数据微调 base 模型。这一步让模型学会:识别「这是一条指令」、以助手身份组织回答、遵循格式。SFT 后模型就从「续写机」变成了「基本能对话的助手」,但回答质量参差、边界不稳。
第二步:RLHF(或 DPO)——再学会”讨人喜欢、守边界”。 SFT 只能模仿示范,无法表达「A 回答比 B 回答好」这种细腻偏好,也难覆盖所有该拒绝的情形。RLHF 用人类对模型输出的偏好比较训练一个奖励模型,再用强化学习把模型往「人类更偏好」的方向推,显著提升有用性、诚实性和无害性的平衡。
记忆钩子:SFT 教模型”怎么做”(模仿示范),RLHF 教模型”做到什么程度更好”(对齐偏好)。前者定下限,后者提上限、守边界。
四、为什么光有 SFT 不够,还要 RLHF
SFT 的本质是「模仿学习」——照着标准答案学。它有两个天花板:
- 只能学”正例”,学不了”比较”:SFT 告诉模型「这样答」,但没告诉它「这样答比那样答好在哪」。而人类偏好往往是相对的、细腻的(更礼貌、更简洁、更安全),用「一条标准答案」难以表达。
- 难以覆盖长尾和边界:该拒绝哪些请求、如何礼貌拒绝、如何处理模糊意图,靠穷举示范数据不现实。
RLHF 通过「让人对模型自己产出的多个回答排序」,把人类的相对偏好信号引入训练,能优化 SFT 覆盖不到的细腻维度。这就是为什么顶级对话模型都在 SFT 之上再做 RLHF/DPO。
五、对齐不是”能力提升”而是”行为塑造”
一个常见误解:对齐会让模型「更聪明」。实际上,对齐主要改变的是模型的”行为倾向”,而非”知识能力”——知识和推理能力主要来自预训练,对齐是把这些已有能力「引导」到有用、诚实、无害的表达方式上。
有时对齐甚至会轻微损害某些原始能力(这叫「对齐税」,alignment tax),比如 RLHF 后某些基准分数略降、回答变得啰嗦或过度谨慎。所以对齐要拿捏分寸:既要塑造好行为,又要尽量不折损底层能力。理解「对齐是行为塑造、可能有代价」,是这道题的深度所在。
六、面试拆解算例
对齐题可以用一个偏好训练小实验来拆。假设有 20,000 条提示,每条采样 2 个回答,标注员选出更好的一个,就得到 20,000 对偏好样本。奖励模型不是学习“绝对正确答案”,而是学习 chosen 比 rejected 更符合规范的概率;如果样本里大量偏好“更长、更像解释”的回答,奖励模型就可能把啰嗦误学成高质量。
preference_pair = (prompt, chosen, rejected)
loss = -log sigmoid(r(prompt, chosen) - r(prompt, rejected))
KL_penalty = beta * KL(policy || reference_policy)
| 环节 | 关键输入 | 常见风险 | 检查办法 |
|---|---|---|---|
| 偏好采集 | prompt 与候选回答 | 标注偏见、覆盖不足 | 一致性抽检 |
| 奖励建模 | chosen/rejected 对 | 奖励作弊、长度偏置 | 分桶评估 |
| 策略优化 | 奖励 + KL 约束 | 过优化、能力掉点 | 回归集对比 |
| 安全评估 | 红队与拒答样本 | 过拒或漏拒 | 人工审查 |
SFT 模型 -> 采样回答 -> 人类/AI 偏好 -> 奖励信号 -> 策略优化
| | | | |
基础能力 多样候选 规范边界 代理目标 行为改变
因此回答「什么是大模型对齐(Alignment)?预训练完为什么还要对齐?」时,要把“偏好从哪里来、奖励学到了什么、优化怎样被约束、上线怎么防奖励作弊”串起来。对齐不是单个算法名,而是一条把人类规范变成模型行为的工程链路。
七、常见误区与追问
- 误区:预训练完模型就能当助手。 base 模型只会续写、不听指令、会编造、可能有害,必须对齐。
- 误区:对齐让模型更有知识。 知识来自预训练;对齐塑造行为倾向,甚至可能有轻微能力代价(对齐税)。
- 追问:3H 指什么? Helpful、Honest、Harmless,三者常有张力需平衡。
- 追问:为什么 SFT 之后还要 RLHF? SFT 只能模仿正例、表达不了相对偏好和细腻边界;RLHF 用偏好比较优化 SFT 覆盖不到的维度。
- 追问:base 模型为什么答非所问? 它优化的是「续写文本分布」,不是「满足意图」,会模仿语料里问句接问句的模式。
- 追问:对齐有哪些主流方法? SFT + RLHF(PPO),以及 DPO、Constitutional AI/RLAIF 等替代。
八、加强记忆
对齐记「把续写机调成好助手,目标是 3H」:预训练只优化”预测下一个词”,产出的 base 模型不听指令、会编造、可能有害;对齐让它变得有用(Helpful)、诚实(Honest)、无害(Harmless)。路径记「两步走」:SFT 教”怎么做”(模仿示范、定下限)→ RLHF/DPO 教”怎样更好”(对齐人类偏好、提上限守边界)。再挂两个深度点——3H 之间有张力需平衡、对齐是行为塑造而非能力提升,甚至可能有”对齐税”。抓住「目标从续写转向满足意图」这句话,整道题就立住了。