← 返回题目列表

模型上线后如何监控数据漂移和效果衰减?

中等 第 23 / 25 题 更新于 2026/09/19
模型评估机器学习面试题模型训练

简化版

漂移监控的评估不能只看检测到多少分布变化,还要衡量告警提前量、误报、漏报和对性能下降的关联。应构建带已知漂移或历史事件的回放集,按特征、预测和概念漂移分层验收。

详细版

  • 统计显著不等于业务显著。

  • 阈值需在稳定期估计自然波动。

  • 持续窗口和冷却机制影响告警质量。

  • 标签延迟决定性能告警可用时间。

  • 评估单位应是事件/时间窗,不是单特征告警条数。

完整版教学

一、监控器本身也是需要评测的检测系统

把每个时间窗视为正常或异常,监控器就有 precision、recall 和 detection delay。

只追求召回会产生告警风暴。

历史事故标签不完整,可注入受控缺失率、均值偏移或类别变化,测试灵敏度边界。

二、底层机制与公式

alert_precision=true_incidents/alerts
alert_recall=detected_incidents/all_incidents
delay=alert_time-drift_start

三、带数字的推演

过去 20 次真实数据事故检测 16 次,发出 40 个告警,其中 16 个有效,则召回 80%、精确率 40%;即便召回尚可,值班负担可能不可接受。

四、方案对比

方案/对象核心特点代价或边界
历史回放真实根因与噪声事故标签不完整
合成注入可控强度/边界未必代表真实漂移
影子运行验证线上告警量确认周期较长

五、执行流程

定义事件标签/成本 -> 稳定期定阈值 -> 历史回放+合成注入
-> 统计精确率/召回/延迟 -> 影子运行 -> 分级与抑制调优

六、边界条件与工程代价

多个特征由同一上游故障引起时,应合并为一个事故评估,否则会把一次成功检测计成几十次。

预测分布稳定也可能性能下降,监控需覆盖 P(X)、P(score) 和标签回流后的 P(Y|X)。

记忆钩子:把漂移监控当二分类器验收:既看抓住多少事故,也看多少告警是真的、提前多久。

七、常见误区与追问

  • 误区:所有统计显著漂移都应报警。 大样本会放大无业务意义的小差异。

  • 追问:如何测提前量? 从漂移真实起点到首次有效告警计算。

  • 误区:告警越多监控越安全。 误报会造成疲劳并掩盖真事故。

  • 追问:没历史事故怎么办? 合成注入并影子运行,逐步积累标签。

  • 追问:如何处理关联告警? 按上游、时间和特征族聚合根因事件。

八、加强记忆

把漂移监控当二分类器验收:既看抓住多少事故,也看多少告警是真的、提前多久。

距离阈值只是手段。