模型回归测试应该验证什么?
简化版
模型回归测试是在固定黄金集、关键切片和系统约束上比较候选与基线,阻止准确率、校准、延迟或安全能力倒退。门槛应包含允许波动与统计不确定性,不能要求所有指标逐点只升不降。
详细版
-
黄金集需版本化并防训练污染。
-
测试覆盖总体、少数类、边界和历史事故样本。
-
比较应配对,关注指标差值区间。
-
性能、模型大小、确定性也属于回归。
-
数据/依赖变化要能解释基线漂移。
完整版教学
一、回归测试把模型质量写成可执行契约
平均指标可能不变但关键群体严重退化,因此 Gate 要把整体与切片结合。
有限样本自然波动会导致 0.001 差异;允许区间或非劣效界比机械“不得下降”更合理。
二、底层机制与公式
delta=metric_candidate-metric_baseline
pass if lower_CI(delta)>-noninferiority_margin
and all critical slice constraints pass
三、带数字的推演
基线 F1=0.820,候选 0.818;若配对 95% 差值区间 [-0.003,0.001],预设非劣界 -0.005,则可判总体非劣,但关键安全切片仍必须单独过线。
四、方案对比
| 方案/对象 | 核心特点 | 代价或边界 |
|---|---|---|
| 固定黄金集 | 可重复快速 | 可能老化/被过拟合 |
| 滚动测试集 | 反映新分布 | 基线需重算 |
| 历史事故集 | 防已知故障复发 | 覆盖面有限 |
五、执行流程
冻结候选和基线 -> 同预处理推理 -> 配对计算总体/切片差值
-> 延迟/资源压测 -> 阈值 Gate -> 产出差异报告 -> 审批发布
六、边界条件与工程代价
反复针对黄金集修模型会形成测试集过拟合,需保留隐蔽集或周期换新。
随机推理和硬件噪声会影响可复现性,性能测试需预热、多次重复并固定环境。
记忆钩子:回归 Gate 是“总体非劣 + 关键切片硬约束 + 系统预算”。
七、常见误区与追问
-
误区:总体 AUC 不降就没有回归。 切片、校准和系统性能仍可能退化。
-
追问:为何用非劣界? 区分可接受微小变化与实质下降。
-
误区:黄金集永远不变最好。 分布和风险变化后会失去代表性。
-
追问:模型比较为何配对? 同一样本上的误差相关,差值估计更精确。
-
追问:Gate 失败后做什么? 定位样本/切片与变更来源,不能直接放宽门槛。
八、加强记忆
回归 Gate 是“总体非劣 + 关键切片硬约束 + 系统预算”。
固定集保证可比,滚动集保证不脱离现实。