← 返回题目列表

大模型知识蒸馏是什么?学生模型如何学到教师模型能力?

高频 中等 第 2 / 25 题 更新于 2026/07/28
模型压缩知识蒸馏Teacher-StudentSFT小模型

简化版

知识蒸馏是用大模型教师的输出、偏好或中间信号训练更小的学生模型,让学生在目标任务上接近教师表现。它常用于降低推理成本,但学生模型受容量限制,通常只能在选定领域或任务上逼近教师。

详细版

  • 蒸馏目标可以是最终答案、推理过程、logits 分布或偏好排序。
  • LLM 场景常见做法是用教师生成指令数据,再对学生做 SFT。
  • 高质量蒸馏要有过滤、去重、难例和真实用户分布。
  • 学生模型容量小,不能期待全能力复制教师。
  • 评测要同时看任务成功率、幻觉率、延迟和成本。

完整版教学

这道题考察候选人是否理解“用大模型教小模型”背后的数据和目标设计。

一、这题真正考什么

这道题考察候选人是否理解“用大模型教小模型”背后的数据和目标设计。

面试官通常不是想听一个孤立定义,而是想看你能不能把概念、工程约束、质量风险和排查方法串起来。回答时先给边界,再讲机制,最后落到评估指标。

二、核心机制怎么工作

教师模型提供比人工标注更便宜、更丰富的监督信号。学生模型通过训练学习教师在特定输入上的输出模式、解释路径和决策边界。蒸馏的关键不是生成越多越好,而是让数据覆盖真实任务,并剔除教师错误。

需要特别注意的是,这类问题通常有“模型侧”和“系统侧”两层含义。模型侧解释原理,系统侧解释为什么上线后会遇到成本、延迟、质量或安全问题。

三、带数字的拆解

一个 70B 教师模型每次回答成本是 0.02 元,7B 学生是 0.002 元。如果日请求 100 万次,学生模型只要在 90% 高频任务达到教师质量,就可能节省大量成本;剩余复杂请求可路由回教师。

这个数字例子在面试里很有用,因为它能把抽象概念变成可估算的工程量。候选人如果能主动算出量级,通常比只背定义更有说服力。

蒸馏损失 = alpha * CE(学生答案, 教师答案) + beta * KL(学生分布, 教师分布)
成本收益 = 教师单次成本 * 请求量 - 学生单次成本 * 请求量 - 训练成本摊销
有效蒸馏 = 好教师 + 好题目 + 好过滤 + 好评测

四、流程图和工程落点

可以把它拆成下面这条链路来讲:

收集真实任务
   |
教师生成答案或偏好
   |
过滤错误与低质量样本
   |
训练学生模型
   |
离线评测
   |
线上路由与监控

工程落点通常包括三件事:第一是输入输出边界,第二是运行时成本,第三是质量验收。只要这三件事没有闭环,原理讲得再漂亮也很难变成可靠系统。

五、和相近方案怎么区分

方式监督信号适用场景
答案蒸馏最终回复客服、摘要、分类
过程蒸馏推理步骤数学、代码、复杂问答
Logit 蒸馏概率分布模型内部可访问时
偏好蒸馏排序或选择对齐和风格优化

面试时不要只说“看场景”。更好的回答是先给出区分维度,再说明每个方案为什么适合或不适合某类约束。

六、上线或训练时最容易踩的坑

  • 教师答案有错时,学生会稳定地学错,因此过滤比生成数量更重要。
  • 只蒸馏简单样本会让学生看起来准确,但遇到难例迅速崩溃。
  • 只在 demo 样本上验证会低估真实风险,尤其是长文本、多轮、结构化输出和安全边界。
  • 指标要和业务目标绑定,否则可能出现离线分数提升、线上体验下降的情况。

七、常见误区与追问

  • 误区:学生模型可以完整复制教师所有能力。 面试中要主动补上边界条件和工程后果,避免把概念讲成绝对结论。
  • 误区:蒸馏数据越多质量越高。 面试中要主动补上边界条件和工程后果,避免把概念讲成绝对结论。
  • 误区:教师生成数据不需要人工审核。 面试中要主动补上边界条件和工程后果,避免把概念讲成绝对结论。
  • 追问:蒸馏和微调有什么关系? 可以从数据、算法、系统和评测四个角度展开,先说判断标准,再说取舍。
  • 追问:什么时候要用教师路由兜底? 可以从数据、算法、系统和评测四个角度展开,先说判断标准,再说取舍。
  • 追问:如何避免学生继承教师幻觉? 可以从数据、算法、系统和评测四个角度展开,先说判断标准,再说取舍。

八、加强记忆

记住“蒸馏是让小模型学老师的做题方式,但小模型容量有限”。面试要讲清目标任务、数据过滤和路由兜底。

复习时建议按“定义、机制、数字、流程、对比、风险”六步默写一遍。能把这六步讲顺,就能覆盖大多数追问。