← 返回题目列表

大模型知识蒸馏是什么?学生模型如何学到教师模型能力?

高频 中等 第 2 / 25 题 更新于 2026/09/18
模型压缩知识蒸馏Teacher-StudentSFT小模型

简化版

知识蒸馏是用大模型教师的输出、偏好或中间信号训练更小的学生模型,让学生在目标任务上接近教师表现。它常用于降低推理成本,但学生模型受容量限制,通常只能在选定领域或任务上逼近教师。

详细版

  • 蒸馏目标可以是最终答案、推理过程、logits 分布或偏好排序。
  • LLM 场景常见做法是用教师生成指令数据,再对学生做 SFT。
  • 高质量蒸馏要有过滤、去重、难例和真实用户分布。
  • 学生模型容量小,不能期待全能力复制教师。
  • 评测要同时看任务成功率、幻觉率、延迟和成本。

完整版教学

这道题考察候选人是否理解“用大模型教小模型”背后的数据和目标设计。

一、这题真正考什么

这道题考察候选人是否理解“用大模型教小模型”背后的数据和目标设计。

大模型蒸馏的目标不是复制参数,而是把教师在选定任务分布上的行为迁移给更小学生。可迁移信号包括软 logits、生成答案、推理轨迹、偏好排序和中间表示,不同信号对应不同成本与风险。

二、核心机制怎么工作

教师模型提供比人工标注更便宜、更丰富的监督信号。学生模型通过训练学习教师在特定输入上的输出模式、解释路径和决策边界。蒸馏的关键不是生成越多越好,而是让数据覆盖真实任务,并剔除教师错误。

软标签用温度 T 展平分布,让学生看到非目标 token 之间的相对关系;生成式蒸馏则把教师输出变成 SFT 数据。学生容量有限时必须选择能力边界,否则会出现平均指标尚可、长尾推理和安全行为大幅退化。

三、带数字的拆解

一个 70B 教师模型每次回答成本是 0.02 元,7B 学生是 0.002 元。如果日请求 100 万次,学生模型只要在 90% 高频任务达到教师质量,就可能节省大量成本;剩余复杂请求可路由回教师。

蒸馏损失 = alpha * CE(学生答案, 教师答案) + beta * KL(学生分布, 教师分布)
成本收益 = 教师单次成本 * 请求量 - 学生单次成本 * 请求量 - 训练成本摊销
有效蒸馏 = 好教师 + 好题目 + 好过滤 + 好评测

四、流程图和工程落点

可以把它拆成下面这条链路来讲:

收集真实任务
   |
教师生成答案或偏好
   |
过滤错误与低质量样本
   |
训练学生模型
   |
离线评测
   |
线上路由与监控

五、和相近方案怎么区分

方式监督信号适用场景
答案蒸馏最终回复客服、摘要、分类
过程蒸馏推理步骤数学、代码、复杂问答
Logit 蒸馏概率分布模型内部可访问时
偏好蒸馏排序或选择对齐和风格优化

六、上线或训练时最容易踩的坑

  • 教师答案有错时,学生会稳定地学错,因此过滤比生成数量更重要。

  • 只蒸馏简单样本会让学生看起来准确,但遇到难例迅速崩溃。

  • 教师自信但错误的答案会被学生高频模仿,蒸馏集需要事实校验、去重和拒答边界审核。

  • 教师生成风格过于单一会降低学生输出多样性,应控制采样参数并保留真实人工数据作为锚点。

七、常见误区与追问

  • 误区:学生模型可以完整复制教师所有能力。 学生容量和训练覆盖有限,通常只能在目标分布上逼近教师;跨领域、长上下文和复杂推理差距仍会保留。
  • 误区:蒸馏数据越多质量越高。 重复、错误或单一风格数据会放大教师偏差,覆盖与质量比原始条数更重要。
  • 误区:教师生成数据不需要人工审核。 教师同样会幻觉、泄露敏感信息或给出越权建议,高风险样本必须规则过滤与人工抽检。
  • 追问:蒸馏和微调有什么关系? 蒸馏规定监督信号来自教师,微调描述更新学生参数的训练过程;生成式蒸馏通常最终仍以 SFT 或偏好训练实现。
  • 追问:什么时候要用教师路由兜底? 当学生置信度低、请求属于长尾领域或风险等级高时,可路由到教师;阈值要用成本—质量曲线选择。
  • 追问:如何避免学生继承教师幻觉? 对教师答案做检索核验和一致性过滤,混入权威人工样本,并分别评估事实性而不是只看与教师的一致率。

八、加强记忆

记住“蒸馏是让小模型学老师的做题方式,但小模型容量有限”。面试要讲清目标任务、数据过滤和路由兜底。

蒸馏要记四件事:迁移哪种信号、覆盖哪段分布、学生容量能承接多少、教师错误怎样被阻断。学生“像教师”不是终点,目标任务上的正确、安全和低成本才是验收标准。