大模型知识蒸馏是什么?学生模型如何学到教师模型能力?
简化版
知识蒸馏是用大模型教师的输出、偏好或中间信号训练更小的学生模型,让学生在目标任务上接近教师表现。它常用于降低推理成本,但学生模型受容量限制,通常只能在选定领域或任务上逼近教师。
详细版
- 蒸馏目标可以是最终答案、推理过程、logits 分布或偏好排序。
- LLM 场景常见做法是用教师生成指令数据,再对学生做 SFT。
- 高质量蒸馏要有过滤、去重、难例和真实用户分布。
- 学生模型容量小,不能期待全能力复制教师。
- 评测要同时看任务成功率、幻觉率、延迟和成本。
完整版教学
这道题考察候选人是否理解“用大模型教小模型”背后的数据和目标设计。
一、这题真正考什么
这道题考察候选人是否理解“用大模型教小模型”背后的数据和目标设计。
大模型蒸馏的目标不是复制参数,而是把教师在选定任务分布上的行为迁移给更小学生。可迁移信号包括软 logits、生成答案、推理轨迹、偏好排序和中间表示,不同信号对应不同成本与风险。
二、核心机制怎么工作
教师模型提供比人工标注更便宜、更丰富的监督信号。学生模型通过训练学习教师在特定输入上的输出模式、解释路径和决策边界。蒸馏的关键不是生成越多越好,而是让数据覆盖真实任务,并剔除教师错误。
软标签用温度 T 展平分布,让学生看到非目标 token 之间的相对关系;生成式蒸馏则把教师输出变成 SFT 数据。学生容量有限时必须选择能力边界,否则会出现平均指标尚可、长尾推理和安全行为大幅退化。
三、带数字的拆解
一个 70B 教师模型每次回答成本是 0.02 元,7B 学生是 0.002 元。如果日请求 100 万次,学生模型只要在 90% 高频任务达到教师质量,就可能节省大量成本;剩余复杂请求可路由回教师。
蒸馏损失 = alpha * CE(学生答案, 教师答案) + beta * KL(学生分布, 教师分布)
成本收益 = 教师单次成本 * 请求量 - 学生单次成本 * 请求量 - 训练成本摊销
有效蒸馏 = 好教师 + 好题目 + 好过滤 + 好评测
四、流程图和工程落点
可以把它拆成下面这条链路来讲:
收集真实任务
|
教师生成答案或偏好
|
过滤错误与低质量样本
|
训练学生模型
|
离线评测
|
线上路由与监控
五、和相近方案怎么区分
| 方式 | 监督信号 | 适用场景 |
|---|---|---|
| 答案蒸馏 | 最终回复 | 客服、摘要、分类 |
| 过程蒸馏 | 推理步骤 | 数学、代码、复杂问答 |
| Logit 蒸馏 | 概率分布 | 模型内部可访问时 |
| 偏好蒸馏 | 排序或选择 | 对齐和风格优化 |
六、上线或训练时最容易踩的坑
-
教师答案有错时,学生会稳定地学错,因此过滤比生成数量更重要。
-
只蒸馏简单样本会让学生看起来准确,但遇到难例迅速崩溃。
-
教师自信但错误的答案会被学生高频模仿,蒸馏集需要事实校验、去重和拒答边界审核。
-
教师生成风格过于单一会降低学生输出多样性,应控制采样参数并保留真实人工数据作为锚点。
七、常见误区与追问
- 误区:学生模型可以完整复制教师所有能力。 学生容量和训练覆盖有限,通常只能在目标分布上逼近教师;跨领域、长上下文和复杂推理差距仍会保留。
- 误区:蒸馏数据越多质量越高。 重复、错误或单一风格数据会放大教师偏差,覆盖与质量比原始条数更重要。
- 误区:教师生成数据不需要人工审核。 教师同样会幻觉、泄露敏感信息或给出越权建议,高风险样本必须规则过滤与人工抽检。
- 追问:蒸馏和微调有什么关系? 蒸馏规定监督信号来自教师,微调描述更新学生参数的训练过程;生成式蒸馏通常最终仍以 SFT 或偏好训练实现。
- 追问:什么时候要用教师路由兜底? 当学生置信度低、请求属于长尾领域或风险等级高时,可路由到教师;阈值要用成本—质量曲线选择。
- 追问:如何避免学生继承教师幻觉? 对教师答案做检索核验和一致性过滤,混入权威人工样本,并分别评估事实性而不是只看与教师的一致率。
八、加强记忆
记住“蒸馏是让小模型学老师的做题方式,但小模型容量有限”。面试要讲清目标任务、数据过滤和路由兜底。
蒸馏要记四件事:迁移哪种信号、覆盖哪段分布、学生容量能承接多少、教师错误怎样被阻断。学生“像教师”不是终点,目标任务上的正确、安全和低成本才是验收标准。