决策树模型为什么可能需要概率校准?
简化版
单棵决策树的类别概率只是叶节点中的样本频率,深叶样本少时常出现 0 或 1 的极端置信度,通常校准较差。可用限制叶子规模、拉普拉斯平滑,以及在独立校准集上训练 Platt scaling 或 isotonic regression 来改善。
详细版
-
先区分排序能力与校准:AUC 高不代表预测 0.8 的样本真有约 80% 为正。
-
深树叶样本少,频率估计方差大;类别权重还会让加权频率偏离真实先验。
-
可靠性图比较概率分桶后的平均预测值与真实正例率。
-
Brier score 和 log loss 衡量概率质量,ECE 依赖分桶方式,应联合报告。
-
校准器必须使用未训练基础模型的数据拟合,防止乐观偏差。
完整版教学
一、概率质量不同于分类正确率
树的硬分类只需选最大概率类别,但风控、排序融合和成本决策需要概率有可解释含义。
若模型给出 0.9 的一组样本只有 0.6 为正,阈值决策的预期成本就会算错。
叶频率是有限样本估计。
叶越纯越小,训练拟合越好,概率方差却越大;校准因此与树复杂度直接相关。
二、数学机制怎么落到节点上
p_hat(y=1 | leaf) = n_positive / n_leaf;Laplace: (n_positive + alpha) / (n_leaf + 2*alpha)。
p_hat(y=1 | leaf) = n_positive / n_leaf
Laplace: (n_positive + alpha) / (n_leaf + 2*alpha)
Brier = mean((p_i - y_i)^2)
三、带数字的推演
一个叶子只有 3 个样本且全为正,原始概率为 1.0。
取拉普拉斯 α=1 后为 (3+1)/(3+2)=0.8,避免对微小样本给出绝对确定的结论。
四、方法对比
| 方法/对象 | 核心特点 | 代价或限制 |
|---|---|---|
| Platt scaling | 学习 sigmoid 映射 | 数据少时稳,形状受限 |
| Isotonic | 学习单调分段函数 | 灵活但更需数据 |
| 叶频率平滑 | 直接收缩极端值 | 简单,不能修复全局形状 |
五、从训练到验证的执行链
训练集拟合树 -> 校准集得到原始概率 -> 拟合校准映射
-> 测试集画 reliability diagram -> 报 Brier/log loss/ECE -> 固定映射上线
六、边界条件与工程代价
时间漂移会同时改变类别先验与条件分布,离线校准器可能失效。
线上需要监控概率分桶的实际发生率,并按时间窗口重新校准。
使用 class_weight 训练时,叶节点的加权比例不一定代表部署环境真实概率。
若目标是风险概率,应恢复真实先验或在代表线上分布的数据上校准。
记忆钩子:先说“叶频率不是天然真概率”,再用 3/3 经平滑变 4/5 的例子说明方差,最后给出独立校准集、可靠性图和 Brier。
七、常见误区与追问
-
误区:准确率高说明概率已经校准。 准确率只看类别是否正确,不检查置信度含义。
-
追问:AUC 与校准能否同时改善? 校准的单调映射通常不改变排序,因此 AUC 可不变。
-
误区:可以在训练集上拟合校准器。 会利用同一拟合噪声,得到过于乐观的概率。
-
追问:为什么深树常给 0/1? 纯叶或样本极少的叶频率容易达到边界。
-
追问:如何选 Platt 和 isotonic? 校准数据少选前者,数据充足且关系非 sigmoid 可试后者并交叉验证。
八、加强记忆
先说“叶频率不是天然真概率”,再用 3/3 经平滑变 4/5 的例子说明方差,最后给出独立校准集、可靠性图和 Brier。
排序、分类与校准是三件不同的事。