← 返回题目列表

什么是灾难性遗忘?大模型微调时如何缓解?

高频 中等 第 5 / 25 题 更新于 2026/07/28
灾难性遗忘能力退化数据混合回归评测

简化版

灾难性遗忘是模型学习新任务后,原有通用知识或能力明显退化的现象。可通过更小更新、混合通用或保留数据、PEFT、早停和多维回归评测缓解,但 PEFT 也不能保证完全不遗忘。

详细版

常见诱因包括目标数据过窄、重复模板过多、学习率过高、训练过久以及数据分布与基座差异过大。

缓解措施:

  1. 在训练前建立通用能力和安全基线;
  2. 混入经过授权的通用或回放数据;
  3. 降低学习率、步数和更新范围;
  4. 使用 LoRA 等 PEFT 限制参数变化;
  5. 保证目标数据多样,避免单一表达模式;
  6. 同时监控目标任务与原能力,按回归早停;
  7. 重要领域保留旧 Adapter 或基座,支持快速回滚。

目标任务变好而通用能力变差是一种权衡,不能只看微调数据上的 loss。

完整版教学

记忆钩子:微调题先分清目标是改行为、补知识还是降成本,再谈 SFT、LoRA、QLoRA 和评估上线。

一、为什么会遗忘

神经网络的知识分布在共享参数中。新数据上的梯度会改变这些参数,当新目标与旧能力使用了重叠表示时,优化新任务可能破坏原来的解法。

微调数据量虽小,若分布狭窄或更新过强,也可能产生明显行为偏移。

二、如何测量

训练前保存基座在通用问答、推理、代码、安全和目标任务上的结果。训练中定期在同一套集合评估,并按任务切片比较,而不是只看平均分。

还要检查拒答率、回答长度和语言风格,因为遗忘可能先表现为行为变化。

三、数据混合

将一部分代表旧能力的数据与新任务数据混合,可给优化器提供保留信号。混合比例需要实验,过多会稀释新任务,过少又不足以约束退化。

回放数据同样要满足许可、隐私和质量要求。

四、PEFT 的作用与边界

冻结基座能减少直接修改,但 Adapter 输出仍会改变整网行为,因此 LoRA 可能缓解遗忘,却不能消除。rank、目标模块和缩放越激进,行为偏移仍可能很大。

五、其他控制方法

较小学习率、较少训练步数、正则化、参数约束和知识蒸馏都可用于保持旧能力。实际系统中,最可靠的手段仍是明确回归门槛、灰度上线和可回滚版本。

六、面试拆解算例

微调题可以用一个小项目来拆:基座模型 7B,业务只需要客服问答风格统一,训练集初筛 30,000 条,清洗后留下 8,000 条高质量样本。若全量微调,7B 参数按 BF16 仅权重就约 14GB,训练还要梯度和优化器状态;若用 LoRA,只训练低秩增量,显存压力会明显下降,但表达能力受 rank 和目标模块影响。

base_model: 7B
raw_samples: 30000
clean_samples: 8000
lora_rank: 8 or 16
learning_rate: 1e-5 ~ 2e-4
validation_split: 5% ~ 10%
方案适合目标主要风险验收重点
Prompt临时改格式、少量约束长提示不稳定单轮成功率
RAG接入动态知识检索召回不足引用与命中率
SFT/LoRA固化行为和领域表达遗忘与过拟合回归集与人工偏好
全量微调深度改模型能力成本高、风险大全面评测
数据清洗 -> 训练/验证切分 -> 小步试训 -> 回归评测 -> 灰度上线
   |              |             |             |
 去噪去重       防泄漏       看 loss       看坏例

因此回答「什么是灾难性遗忘?大模型微调时如何缓解?」时,不要直接说“用微调”。先问目标是什么、数据是否足够干净、是否有动态知识,再选择 Prompt、RAG、PEFT 或全量微调,最后用评估集证明它确实变好了。

七、常见误区与追问

  • 误区:微调就是把业务文档喂给模型让它记住。 微调更适合塑造行为格式、任务风格和领域表达,动态知识与事实更新通常更适合 RAG。
  • 追问:为什么这个问题不用 Prompt 或 RAG 解决? 面试里要先说明目标是改行为、补知识还是接外部数据,再选择微调方案。
  • 误区:训练集越大越好。 SFT 更怕低质、冲突、模板化和泄漏数据;少量高质量样本常常胜过大量脏样本。
  • 追问:上线前你会看哪些评估? 至少要覆盖基准集、人工偏好、回归用例、安全红线、延迟成本和灾难性遗忘检查。
  • 误区:LoRA/QLoRA 省显存就没有代价。 参数高效方法降低训练成本,但 rank、目标模块、量化误差和合并部署都会影响最终质量。

八、加强记忆

灾难性遗忘是“新课学会了,旧课退步了”;缓解它要同时提供保留数据、限制更新幅度,并用新旧两套考试持续验收,而不是只盯新任务成绩。