大模型知识蒸馏是什么?学生模型如何学到教师模型能力?
简化版
知识蒸馏是用大模型教师的输出、偏好或中间信号训练更小的学生模型,让学生在目标任务上接近教师表现。它常用于降低推理成本,但学生模型受容量限制,通常只能在选定领域或任务上逼近教师。
详细版
- 蒸馏目标可以是最终答案、推理过程、logits 分布或偏好排序。
- LLM 场景常见做法是用教师生成指令数据,再对学生做 SFT。
- 高质量蒸馏要有过滤、去重、难例和真实用户分布。
- 学生模型容量小,不能期待全能力复制教师。
- 评测要同时看任务成功率、幻觉率、延迟和成本。
完整版教学
这道题考察候选人是否理解“用大模型教小模型”背后的数据和目标设计。
一、这题真正考什么
这道题考察候选人是否理解“用大模型教小模型”背后的数据和目标设计。
面试官通常不是想听一个孤立定义,而是想看你能不能把概念、工程约束、质量风险和排查方法串起来。回答时先给边界,再讲机制,最后落到评估指标。
二、核心机制怎么工作
教师模型提供比人工标注更便宜、更丰富的监督信号。学生模型通过训练学习教师在特定输入上的输出模式、解释路径和决策边界。蒸馏的关键不是生成越多越好,而是让数据覆盖真实任务,并剔除教师错误。
需要特别注意的是,这类问题通常有“模型侧”和“系统侧”两层含义。模型侧解释原理,系统侧解释为什么上线后会遇到成本、延迟、质量或安全问题。
三、带数字的拆解
一个 70B 教师模型每次回答成本是 0.02 元,7B 学生是 0.002 元。如果日请求 100 万次,学生模型只要在 90% 高频任务达到教师质量,就可能节省大量成本;剩余复杂请求可路由回教师。
这个数字例子在面试里很有用,因为它能把抽象概念变成可估算的工程量。候选人如果能主动算出量级,通常比只背定义更有说服力。
蒸馏损失 = alpha * CE(学生答案, 教师答案) + beta * KL(学生分布, 教师分布)
成本收益 = 教师单次成本 * 请求量 - 学生单次成本 * 请求量 - 训练成本摊销
有效蒸馏 = 好教师 + 好题目 + 好过滤 + 好评测
四、流程图和工程落点
可以把它拆成下面这条链路来讲:
收集真实任务
|
教师生成答案或偏好
|
过滤错误与低质量样本
|
训练学生模型
|
离线评测
|
线上路由与监控
工程落点通常包括三件事:第一是输入输出边界,第二是运行时成本,第三是质量验收。只要这三件事没有闭环,原理讲得再漂亮也很难变成可靠系统。
五、和相近方案怎么区分
| 方式 | 监督信号 | 适用场景 |
|---|---|---|
| 答案蒸馏 | 最终回复 | 客服、摘要、分类 |
| 过程蒸馏 | 推理步骤 | 数学、代码、复杂问答 |
| Logit 蒸馏 | 概率分布 | 模型内部可访问时 |
| 偏好蒸馏 | 排序或选择 | 对齐和风格优化 |
面试时不要只说“看场景”。更好的回答是先给出区分维度,再说明每个方案为什么适合或不适合某类约束。
六、上线或训练时最容易踩的坑
- 教师答案有错时,学生会稳定地学错,因此过滤比生成数量更重要。
- 只蒸馏简单样本会让学生看起来准确,但遇到难例迅速崩溃。
- 只在 demo 样本上验证会低估真实风险,尤其是长文本、多轮、结构化输出和安全边界。
- 指标要和业务目标绑定,否则可能出现离线分数提升、线上体验下降的情况。
七、常见误区与追问
- 误区:学生模型可以完整复制教师所有能力。 面试中要主动补上边界条件和工程后果,避免把概念讲成绝对结论。
- 误区:蒸馏数据越多质量越高。 面试中要主动补上边界条件和工程后果,避免把概念讲成绝对结论。
- 误区:教师生成数据不需要人工审核。 面试中要主动补上边界条件和工程后果,避免把概念讲成绝对结论。
- 追问:蒸馏和微调有什么关系? 可以从数据、算法、系统和评测四个角度展开,先说判断标准,再说取舍。
- 追问:什么时候要用教师路由兜底? 可以从数据、算法、系统和评测四个角度展开,先说判断标准,再说取舍。
- 追问:如何避免学生继承教师幻觉? 可以从数据、算法、系统和评测四个角度展开,先说判断标准,再说取舍。
八、加强记忆
记住“蒸馏是让小模型学老师的做题方式,但小模型容量有限”。面试要讲清目标任务、数据过滤和路由兜底。
复习时建议按“定义、机制、数字、流程、对比、风险”六步默写一遍。能把这六步讲顺,就能覆盖大多数追问。