← 返回题目列表

决策树模型为什么可能需要概率校准?

中等 第 22 / 25 题 更新于 2026/09/19
决策树机器学习面试题模型训练

简化版

单棵决策树的类别概率只是叶节点中的样本频率,深叶样本少时常出现 0 或 1 的极端置信度,通常校准较差。可用限制叶子规模、拉普拉斯平滑,以及在独立校准集上训练 Platt scaling 或 isotonic regression 来改善。

详细版

  • 先区分排序能力与校准:AUC 高不代表预测 0.8 的样本真有约 80% 为正。

  • 深树叶样本少,频率估计方差大;类别权重还会让加权频率偏离真实先验。

  • 可靠性图比较概率分桶后的平均预测值与真实正例率。

  • Brier score 和 log loss 衡量概率质量,ECE 依赖分桶方式,应联合报告。

  • 校准器必须使用未训练基础模型的数据拟合,防止乐观偏差。

完整版教学

一、概率质量不同于分类正确率

树的硬分类只需选最大概率类别,但风控、排序融合和成本决策需要概率有可解释含义。

若模型给出 0.9 的一组样本只有 0.6 为正,阈值决策的预期成本就会算错。

叶频率是有限样本估计。

叶越纯越小,训练拟合越好,概率方差却越大;校准因此与树复杂度直接相关。

二、数学机制怎么落到节点上

p_hat(y=1 | leaf) = n_positive / n_leaf;Laplace: (n_positive + alpha) / (n_leaf + 2*alpha)。

p_hat(y=1 | leaf) = n_positive / n_leaf
Laplace: (n_positive + alpha) / (n_leaf + 2*alpha)
Brier = mean((p_i - y_i)^2)

三、带数字的推演

一个叶子只有 3 个样本且全为正,原始概率为 1.0。

取拉普拉斯 α=1 后为 (3+1)/(3+2)=0.8,避免对微小样本给出绝对确定的结论。

四、方法对比

方法/对象核心特点代价或限制
Platt scaling学习 sigmoid 映射数据少时稳,形状受限
Isotonic学习单调分段函数灵活但更需数据
叶频率平滑直接收缩极端值简单,不能修复全局形状

五、从训练到验证的执行链

训练集拟合树 -> 校准集得到原始概率 -> 拟合校准映射
-> 测试集画 reliability diagram -> 报 Brier/log loss/ECE -> 固定映射上线

六、边界条件与工程代价

时间漂移会同时改变类别先验与条件分布,离线校准器可能失效。

线上需要监控概率分桶的实际发生率,并按时间窗口重新校准。

使用 class_weight 训练时,叶节点的加权比例不一定代表部署环境真实概率。

若目标是风险概率,应恢复真实先验或在代表线上分布的数据上校准。

记忆钩子:先说“叶频率不是天然真概率”,再用 3/3 经平滑变 4/5 的例子说明方差,最后给出独立校准集、可靠性图和 Brier。

七、常见误区与追问

  • 误区:准确率高说明概率已经校准。 准确率只看类别是否正确,不检查置信度含义。

  • 追问:AUC 与校准能否同时改善? 校准的单调映射通常不改变排序,因此 AUC 可不变。

  • 误区:可以在训练集上拟合校准器。 会利用同一拟合噪声,得到过于乐观的概率。

  • 追问:为什么深树常给 0/1? 纯叶或样本极少的叶频率容易达到边界。

  • 追问:如何选 Platt 和 isotonic? 校准数据少选前者,数据充足且关系非 sigmoid 可试后者并交叉验证。

八、加强记忆

先说“叶频率不是天然真概率”,再用 3/3 经平滑变 4/5 的例子说明方差,最后给出独立校准集、可靠性图和 Brier。

排序、分类与校准是三件不同的事。