← 返回题目列表

特征漂移如何监控?

中等 第 18 / 25 题 更新于 2026/09/19
特征工程机器学习面试题模型训练

简化版

特征漂移监控比较线上特征分布与训练/稳定基线,可用 PSI、KS、JS 散度、缺失率和类别新值率;漂移只说明输入变了,不自动等于模型性能下降,必须联动预测、标签和业务切片。

详细版

  • 连续与类别特征需选择合适分桶和统计量。

  • 监控缺失率、范围、分位数比单一散度更易定位。

  • 阈值应由历史自然波动和业务影响标定。

  • 多特征同时告警要控制误报并聚合根因。

  • 标签延迟时先监控代理指标,标签到齐再回填性能。

完整版教学

一、漂移检测是两样本比较,不是故障结论

训练基线代表模型学到的输入环境,线上窗口代表当前环境。

统计距离衡量差异,但不区分季节性、业务增长或采集故障。

模型只对决策边界附近、重要特征的某些变化敏感;一个无用特征大漂移可能无影响,关键特征小漂移也可能很严重。

二、底层机制与公式

PSI=sum_b (q_b-p_b)*ln(q_b/p_b)
KS=sup_x |F_online(x)-F_base(x)|

三、带数字的推演

训练分桶比例 [0.5,0.5],线上 [0.7,0.3],PSI 约 (0.7-0.5)ln1.4+(0.3-0.5)ln0.6≈0.169

数值需结合历史基线,不能机械套阈值。

四、方案对比

方案/对象核心特点代价或边界
PSI分桶直观依赖分桶且零频需平滑
KS连续分布最大差大样本对小差异敏感
缺失/OOV率根因明确只覆盖数据质量局部

五、执行流程

采集原始+模型输入特征 -> 按时间窗聚合 -> 与多基线比较
-> 特征重要性加权分级 -> 联动预测/业务 -> 标签到齐后性能归因

六、边界条件与工程代价

预处理后的标准化特征可能掩盖原始单位漂移,最好同时监控原始值与模型实际输入。

节假日等周期变化不应总触发事故,可使用去年同期、最近稳定期和训练分布多基线。

记忆钩子:漂移告警回答“输入变了多少”,性能监控回答“结果坏了多少”。

七、常见误区与追问

  • 误区:PSI 超过 0.2 就必须重训。 阈值不是跨业务定律,还要看影响与持续性。

  • 追问:特征漂移等于概念漂移吗? 前者是 P(X) 变化,概念漂移涉及 P(Y|X)。

  • 误区:只监控均值方差足够。 多峰、尾部和类别变化可能被平均量掩盖。

  • 追问:没标签如何监控? 先看输入、预测分布与代理业务,标签回流后确认。

  • 追问:如何减少告警风暴? 按根因聚合、设持续窗口并结合重要性分级。

八、加强记忆

漂移告警回答“输入变了多少”,性能监控回答“结果坏了多少”。

距离、业务影响和持续时间三者一起决定动作。