深度学习中多种正则化手段如何组合?
简化版
正则化不能简单叠满:数据增强、weight decay、Dropout、label smoothing、early stopping 分别约束数据、参数、表示、目标和训练时长,效果可能重叠甚至冲突。应从弱基线开始逐项消融,并同时观察训练损失、验证损失和校准。
详细版
-
增强注入任务不变性,优先级通常高于盲目加大网络内正则。
-
AdamW 的 decoupled weight decay 不等同于把 L2 项直接加进 Adam 损失。
-
BN 自带批统计噪声,某些 CNN 中再加大 Dropout 收益有限。
-
label smoothing 可减极端置信度,但会改变最佳训练损失与概率。
-
early stopping 是根据验证集限制优化时间,频繁调参会间接过拟合验证集。
完整版教学
一、不同正则作用于不同自由度
正则化的目标是降低泛化误差而非让训练损失最低。
多种手段都在增加偏差、降低方差,叠加强度过大会从过拟合直接跨到欠拟合。
判断组合是否互补,要看它们是否针对不同失效机制。
例如增强补覆盖、weight decay 控权重尺度,通常比两个强噪声手段更互补。
二、底层机制与公式
objective = data_loss(augmented x, smoothed y) + lambda * penalty(theta)
training stops at step chosen by validation
三、带数字的推演
某 CNN 训练/验证准确率为 99%/82%。
加入增强后变 95%/88%,再加适度 decay 为 94%/89%;若同时把 Dropout 提到 0.7 后变 80%/79%,说明已过度正则而非继续“防过拟合”。
四、方案对比
| 方案/对象 | 核心特点 | 代价或边界 |
|---|---|---|
| 数据增强 | 扩大有效分布 | 错误变换会改语义 |
| Weight decay | 限制参数尺度 | 强度与优化器相关 |
| Dropout | 随机屏蔽表示 | 训练推理行为不同 |
| Early stopping | 限制训练步数 | 依赖验证集稳定性 |
五、执行流程
固定强基线 -> 找到过拟合证据 -> 选择一个针对性正则
-> 单因素扫描 -> 再测互补组合 -> 多 seed/切片验证 -> 固化配方
六、边界条件与工程代价
小数据验证曲线抖动时,early stopping 的单次最佳点可能只是噪声;应设置 patience、保存平滑指标并用多折复核。
正则强度随模型规模、数据量和训练时长变化。
沿用另一模型的 dropout=0.5 或 decay=0.01 没有普适依据。
记忆钩子:按“数据—参数—表示—目标—时间”定位各正则的作用层。
七、常见误区与追问
-
误区:正则化种类越多泛化越好。 重叠约束会造成欠拟合。
-
追问:如何判断正则过强? 训练与验证性能同时偏低,且减弱正则后都改善。
-
误区:Adam 的 L2 与 AdamW 完全相同。 自适应预条件会改变耦合 L2 的效果,AdamW 将衰减解耦。
-
追问:为什么要逐项消融? 否则无法知道收益、冲突与必要复杂度来自哪项。
-
追问:组合如何验收? 比较训练差距、测试切片、校准和多随机种子方差。
八、加强记忆
按“数据—参数—表示—目标—时间”定位各正则的作用层。
每加入一项都要能指出它解决的具体失效模式,并用消融证明不是重复加药。