← 返回题目列表

全量微调和参数高效微调(PEFT)有什么区别?

高频 简单 第 1 / 26 题 更新于 2026/09/18
全量微调PEFTAdapter训练显存

简化版

全量微调更新模型全部参数,表达能力强,但梯度、优化器状态和检查点成本很高;PEFT 冻结大部分基座,只训练少量新增或选定参数,显著降低训练与存储成本。PEFT 不保证总能达到全量微调效果,也不意味着训练过程没有激活值显存开销。

详细版

主要区别如下:

维度全量微调PEFT
可训练参数全部或绝大多数少量 Adapter、低秩矩阵等
优化器与梯度内存明显较低
单任务检查点接近完整模型通常只保存小型增量参数
任务切换加载不同完整模型同一基座切换 Adapter
表达容量更高受方法、秩和目标模块限制
基座参数会改变通常冻结

资源有限、多任务部署或需要快速迭代时优先评估 PEFT;数据充足、任务与基座差异大且效果上限最重要时,可比较全量微调。最终选择必须基于同一评估集,而不是默认某一种一定更好。

完整版教学

一、全量微调为什么昂贵

训练不仅要加载权重,还要保存前向激活、梯度和优化器状态。以 Adam 类优化器为例,每个可训练参数还可能对应一阶、二阶动量等状态,所以训练显存远大于仅做推理时的权重显存。

分布式分片、混合精度和激活检查点能缓解成本,但系统复杂度也会上升。

二、PEFT 的核心思路

PEFT 不重新优化整个参数空间,而是在较小的可训练子空间中适配任务。常见方法包括 LoRA、Adapter、Prefix Tuning 和 Prompt Tuning。

LoRA 冻结原权重,用低秩矩阵表示权重增量;Adapter 在网络中加入小模块;软提示方法训练一组连续向量。它们的参数位置和表达能力不同。

三、为什么 PEFT 能省资源

冻结参数不需要保存对应梯度和优化器状态,小型 Adapter 也更容易存储、传输和版本管理。一个基座可以搭配多个任务 Adapter,避免每个任务保存一份完整模型。

但前向和反向仍要经过基座网络,激活值仍会占用显存。长序列、大批量时,PEFT 也可能显存不足,需要激活检查点、梯度累积或量化。

四、效果是否一定接近全量微调

不一定。目标任务需要的权重变化若能被低维子空间表示,PEFT 可能接近甚至在特定数据规模下优于全量微调;任务变化很大、数据充足时,受限的参数空间也可能成为瓶颈。

全量微调参数多,同样更容易在小数据上过拟合或破坏原能力。参数更多不是自动更好。

五、工程部署差异

未合并的 Adapter 需要基座模型版本、Tokenizer 和配置严格匹配。LoRA 可在部署前合并进权重,获得普通模型的推理路径,但会失去快速切换 Adapter 的便利。

多 Adapter 服务还要考虑显存驻留、并发路由、缓存和租户隔离。

六、怎么做选择

先用代表性数据分别训练候选方案,比较目标任务指标、通用能力保持、安全、训练成本、推理延迟和运维复杂度。不要只比较训练损失或可训练参数比例。

PEFT 的“参数高效”主要指可训练参数少,不等于所有硬件资源都会按相同比例下降。

七、算清可训练参数差距

对一个 4096×4096 的线性层,全量微调需要更新约 1678 万个参数。LoRA rank=16 时,两张低秩矩阵参数约为 4096×16+16×4096=131,072,仅为原矩阵的约 0.78%;但前向仍要运行完整基座,PEFT 省的是训练状态与多任务存储,不会按同一比例减少推理 FLOPs。

full = 4096 * 4096 = 16,777,216
LoRA = 4096 * 16 + 16 * 4096 = 131,072
ratio ≈ 0.78%
维度全量微调PEFT
可训练权重全部小型增量
多任务存储每任务完整模型基座 + 多个 Adapter
表达容量受 rank 与模块限制

全量微调容量更大,适合数据充足且需要深度改变模型分布的场景;PEFT 便于低成本试验、保存多个任务 adapter。公平比较要固定数据与训练 token,分别观察目标能力、通用回归、峰值显存、训练时长和部署复杂度。

八、常见误区与追问

  • 误区:PEFT 会让基座前向计算也缩小到 1%。 它主要减少可训练参数与优化器状态,推理仍运行完整基座。
  • 追问:全量微调何时更值得? 数据充分、预算允许且需要深度改变表示或能力,而 PEFT 已明显受容量限制时。
  • 追问:为什么 PEFT 便于多租户? 多个任务只保存小 adapter,可共享一份基座并动态加载。
  • 误区:LoRA 效果永远接近全量微调。 差距取决于任务变化幅度、数据量、rank 和模块覆盖,必须做同预算对照。
  • 追问:两种方案如何比较成本? 同时计算峰值显存、训练 GPU 时、checkpoint 大小、服务复制和版本治理。

九、加强记忆

全量微调更新全部权重,容量大但训练状态、checkpoint 和回归成本都高;PEFT 只学习小增量,便于多任务保存和快速试验。PEFT 减少可训练参数不等于按比例减少基座前向 FLOPs,也不保证质量总能追平全量。最终选择应看目标收益、通用回退、硬件预算与服务形态的共同 Pareto。