← 返回题目列表

决策树输出的类别概率可靠吗?

中等 第 17 / 25 题 更新于 2026/09/19
决策树机器学习面试题模型训练

简化版

决策树的类别概率通常等于样本落入叶节点后各类别的频率;它是局部经验估计,不保证可靠。叶子过小、采样偏差和类别权重都会让概率极端或失真,需要最小叶样本、平滑和独立校准。

详细版

  • 预测路径决定叶节点,概率不是沿路径条件概率相乘,而是读取叶内类别计数。

  • 叶内 8 个正例、2 个负例时原始正类概率为 0.8。

  • 训练纯度驱动树不断分裂,容易制造概率为 0 或 1 的小叶。

  • sample_weight/class_weight 下库可能返回加权频率,要确认 API 语义。

  • 概率用于阈值和期望成本前,应检查可靠性图与 Brier/log loss。

完整版教学

一、叶节点频率是局部估计器

树把特征空间切成若干矩形区域,并假设同一叶内的条件概率为常数。

叶越大,估计稳定但偏差高;叶越小,局部性强但方差高。

这正是概率估计的偏差—方差权衡。

分类准确率可能通过纯叶提高,而概率质量却因极端估计恶化。

二、数学机制怎么落到节点上

p_hat(k | leaf L) = n_(L,k) / sum_j n_(L,j);smoothed p = (n_(L,k) + alpha) / (n_L + K*alpha)。

p_hat(k | leaf L) = n_(L,k) / sum_j n_(L,j)
smoothed p = (n_(L,k) + alpha) / (n_L + K*alpha)

三、带数字的推演

三分类叶节点计数为 [6,3,1],原始概率是 [0.6,0.3,0.1]

α=1 后变为 [7/13,4/13,2/13]≈[0.538,0.308,0.154],少数类不再被估为接近零。

四、方法对比

方法/对象核心特点代价或限制
大叶子频率稳定局部差异被平均
小叶子更贴合局部极端值与高方差
平滑/校准改善概率含义需要超参数或独立数据

五、从训练到验证的执行链

样本按规则下行 -> 到达叶节点 -> 读取各类加权计数
-> 归一化/平滑 -> 可选校准映射 -> 根据业务成本选阈值

六、边界条件与工程代价

叶频率只代表训练采样机制。

若训练对少数类过采样,原始叶比例对应的是重采样分布,不是线上先验,需要先验修正或部署分布校准。

随机森林对多棵树概率取平均通常比单树平滑,但若每棵树都偏置或训练分布错位,平均并不能自动保证校准。

记忆钩子:沿着“路径选区域、叶频率给概率”回答,再强调叶大小控制偏差与方差。

七、常见误区与追问

  • 误区:树概率是路径上各切分概率的乘积。 常见实现直接使用最终叶的类别频率。

  • 追问:为什么最小叶样本能改善概率? 它降低频率估计方差,减少 0/1 极端值。

  • 误区:predict_proba 的数值天然可信。 API 返回概率形式,不等于统计上已校准。

  • 追问:class_weight 会影响什么? 切分和叶计数可能按权重计算,结果不再是原始频数。

  • 追问:如何验证概率? 在独立测试集画可靠性图,并计算 Brier 或 log loss。

八、加强记忆

沿着“路径选区域、叶频率给概率”回答,再强调叶大小控制偏差与方差。

看到 0/1 不要当作确定性,应检查样本数、权重、采样先验和平滑校准。