← 返回题目列表

模型回归测试应该验证什么?

中等 第 22 / 25 题 更新于 2026/09/19
模型评估机器学习面试题模型训练

简化版

模型回归测试是在固定黄金集、关键切片和系统约束上比较候选与基线,阻止准确率、校准、延迟或安全能力倒退。门槛应包含允许波动与统计不确定性,不能要求所有指标逐点只升不降。

详细版

  • 黄金集需版本化并防训练污染。

  • 测试覆盖总体、少数类、边界和历史事故样本。

  • 比较应配对,关注指标差值区间。

  • 性能、模型大小、确定性也属于回归。

  • 数据/依赖变化要能解释基线漂移。

完整版教学

一、回归测试把模型质量写成可执行契约

平均指标可能不变但关键群体严重退化,因此 Gate 要把整体与切片结合。

有限样本自然波动会导致 0.001 差异;允许区间或非劣效界比机械“不得下降”更合理。

二、底层机制与公式

delta=metric_candidate-metric_baseline
pass if lower_CI(delta)>-noninferiority_margin
and all critical slice constraints pass

三、带数字的推演

基线 F1=0.820,候选 0.818;若配对 95% 差值区间 [-0.003,0.001],预设非劣界 -0.005,则可判总体非劣,但关键安全切片仍必须单独过线。

四、方案对比

方案/对象核心特点代价或边界
固定黄金集可重复快速可能老化/被过拟合
滚动测试集反映新分布基线需重算
历史事故集防已知故障复发覆盖面有限

五、执行流程

冻结候选和基线 -> 同预处理推理 -> 配对计算总体/切片差值
-> 延迟/资源压测 -> 阈值 Gate -> 产出差异报告 -> 审批发布

六、边界条件与工程代价

反复针对黄金集修模型会形成测试集过拟合,需保留隐蔽集或周期换新。

随机推理和硬件噪声会影响可复现性,性能测试需预热、多次重复并固定环境。

记忆钩子:回归 Gate 是“总体非劣 + 关键切片硬约束 + 系统预算”。

七、常见误区与追问

  • 误区:总体 AUC 不降就没有回归。 切片、校准和系统性能仍可能退化。

  • 追问:为何用非劣界? 区分可接受微小变化与实质下降。

  • 误区:黄金集永远不变最好。 分布和风险变化后会失去代表性。

  • 追问:模型比较为何配对? 同一样本上的误差相关,差值估计更精确。

  • 追问:Gate 失败后做什么? 定位样本/切片与变更来源,不能直接放宽门槛。

八、加强记忆

回归 Gate 是“总体非劣 + 关键切片硬约束 + 系统预算”。

固定集保证可比,滚动集保证不脱离现实。