决策树输出的类别概率可靠吗?
简化版
决策树的类别概率通常等于样本落入叶节点后各类别的频率;它是局部经验估计,不保证可靠。叶子过小、采样偏差和类别权重都会让概率极端或失真,需要最小叶样本、平滑和独立校准。
详细版
-
预测路径决定叶节点,概率不是沿路径条件概率相乘,而是读取叶内类别计数。
-
叶内 8 个正例、2 个负例时原始正类概率为 0.8。
-
训练纯度驱动树不断分裂,容易制造概率为 0 或 1 的小叶。
-
sample_weight/class_weight 下库可能返回加权频率,要确认 API 语义。
-
概率用于阈值和期望成本前,应检查可靠性图与 Brier/log loss。
完整版教学
一、叶节点频率是局部估计器
树把特征空间切成若干矩形区域,并假设同一叶内的条件概率为常数。
叶越大,估计稳定但偏差高;叶越小,局部性强但方差高。
这正是概率估计的偏差—方差权衡。
分类准确率可能通过纯叶提高,而概率质量却因极端估计恶化。
二、数学机制怎么落到节点上
p_hat(k | leaf L) = n_(L,k) / sum_j n_(L,j);smoothed p = (n_(L,k) + alpha) / (n_L + K*alpha)。
p_hat(k | leaf L) = n_(L,k) / sum_j n_(L,j)
smoothed p = (n_(L,k) + alpha) / (n_L + K*alpha)
三、带数字的推演
三分类叶节点计数为 [6,3,1],原始概率是 [0.6,0.3,0.1]。
取 α=1 后变为 [7/13,4/13,2/13]≈[0.538,0.308,0.154],少数类不再被估为接近零。
四、方法对比
| 方法/对象 | 核心特点 | 代价或限制 |
|---|---|---|
| 大叶子 | 频率稳定 | 局部差异被平均 |
| 小叶子 | 更贴合局部 | 极端值与高方差 |
| 平滑/校准 | 改善概率含义 | 需要超参数或独立数据 |
五、从训练到验证的执行链
样本按规则下行 -> 到达叶节点 -> 读取各类加权计数
-> 归一化/平滑 -> 可选校准映射 -> 根据业务成本选阈值
六、边界条件与工程代价
叶频率只代表训练采样机制。
若训练对少数类过采样,原始叶比例对应的是重采样分布,不是线上先验,需要先验修正或部署分布校准。
随机森林对多棵树概率取平均通常比单树平滑,但若每棵树都偏置或训练分布错位,平均并不能自动保证校准。
记忆钩子:沿着“路径选区域、叶频率给概率”回答,再强调叶大小控制偏差与方差。
七、常见误区与追问
-
误区:树概率是路径上各切分概率的乘积。 常见实现直接使用最终叶的类别频率。
-
追问:为什么最小叶样本能改善概率? 它降低频率估计方差,减少 0/1 极端值。
-
误区:predict_proba 的数值天然可信。 API 返回概率形式,不等于统计上已校准。
-
追问:class_weight 会影响什么? 切分和叶计数可能按权重计算,结果不再是原始频数。
-
追问:如何验证概率? 在独立测试集画可靠性图,并计算 Brier 或 log loss。
八、加强记忆
沿着“路径选区域、叶频率给概率”回答,再强调叶大小控制偏差与方差。
看到 0/1 不要当作确定性,应检查样本数、权重、采样先验和平滑校准。