特征漂移如何监控?
简化版
特征漂移监控比较线上特征分布与训练/稳定基线,可用 PSI、KS、JS 散度、缺失率和类别新值率;漂移只说明输入变了,不自动等于模型性能下降,必须联动预测、标签和业务切片。
详细版
-
连续与类别特征需选择合适分桶和统计量。
-
监控缺失率、范围、分位数比单一散度更易定位。
-
阈值应由历史自然波动和业务影响标定。
-
多特征同时告警要控制误报并聚合根因。
-
标签延迟时先监控代理指标,标签到齐再回填性能。
完整版教学
一、漂移检测是两样本比较,不是故障结论
训练基线代表模型学到的输入环境,线上窗口代表当前环境。
统计距离衡量差异,但不区分季节性、业务增长或采集故障。
模型只对决策边界附近、重要特征的某些变化敏感;一个无用特征大漂移可能无影响,关键特征小漂移也可能很严重。
二、底层机制与公式
PSI=sum_b (q_b-p_b)*ln(q_b/p_b)
KS=sup_x |F_online(x)-F_base(x)|
三、带数字的推演
训练分桶比例 [0.5,0.5],线上 [0.7,0.3],PSI 约 (0.7-0.5)ln1.4+(0.3-0.5)ln0.6≈0.169。
数值需结合历史基线,不能机械套阈值。
四、方案对比
| 方案/对象 | 核心特点 | 代价或边界 |
|---|---|---|
| PSI | 分桶直观 | 依赖分桶且零频需平滑 |
| KS | 连续分布最大差 | 大样本对小差异敏感 |
| 缺失/OOV率 | 根因明确 | 只覆盖数据质量局部 |
五、执行流程
采集原始+模型输入特征 -> 按时间窗聚合 -> 与多基线比较
-> 特征重要性加权分级 -> 联动预测/业务 -> 标签到齐后性能归因
六、边界条件与工程代价
预处理后的标准化特征可能掩盖原始单位漂移,最好同时监控原始值与模型实际输入。
节假日等周期变化不应总触发事故,可使用去年同期、最近稳定期和训练分布多基线。
记忆钩子:漂移告警回答“输入变了多少”,性能监控回答“结果坏了多少”。
七、常见误区与追问
-
误区:PSI 超过 0.2 就必须重训。 阈值不是跨业务定律,还要看影响与持续性。
-
追问:特征漂移等于概念漂移吗? 前者是 P(X) 变化,概念漂移涉及 P(Y|X)。
-
误区:只监控均值方差足够。 多峰、尾部和类别变化可能被平均量掩盖。
-
追问:没标签如何监控? 先看输入、预测分布与代理业务,标签回流后确认。
-
追问:如何减少告警风暴? 按根因聚合、设持续窗口并结合重要性分级。
八、加强记忆
漂移告警回答“输入变了多少”,性能监控回答“结果坏了多少”。
距离、业务影响和持续时间三者一起决定动作。