什么是决策树的替代划分?它解决什么问题?
简化版
替代划分是在主划分特征缺失时,使用另一个与主划分左右分配最一致的规则决定样本去向。它保留树结构并利用特征相关性处理缺失,但需要额外存储和计算,且分布漂移后替代关系可能失效。
详细版
-
先选正常的主切分,再让其他特征模仿主切分产生的左/右标签。
-
按加权一致率给候选替代规则排序,预测时使用第一个可用规则。
-
替代划分预测的是“主规则会往哪走”,不是直接预测最终类别。
-
若所有替代特征也缺失,可走多数分支或预设默认方向。
-
CART 经典实现支持该思路,但不同库可能改用 missing default direction。
完整版教学
一、把缺失路由转成一个辅助分类问题
主特征缺失时,树无法判断左右。
若收入与职位等级高度相关,可以用职位阈值近似复现收入切分,而不必先填补一个具体收入值。
替代规则只在当前节点局部学习,因此同一特征在不同节点可能有不同替代方式。
它利用相关结构,也会继承这种结构随时间变化的风险。
二、数学机制怎么落到节点上
agreement(surrogate) = weighted_count(surrogate_direction == primary_direction) / available_weight;adjusted_agreement can subtract majority-direction baseline。
agreement(surrogate) = weighted_count(surrogate_direction == primary_direction) / available_weight
adjusted_agreement can subtract majority-direction baseline
三、带数字的推演
主规则 income≤10万 在 100 个完整样本中把 60 个送左、40 个送右。
替代规则 job_level≤2 与其中 85 个方向一致,一致率 85%;若基线总走左已有 60%,调整后才更能体现增益。
四、方法对比
| 方法/对象 | 核心特点 | 代价或限制 |
|---|---|---|
| 替代划分 | 用相关特征复现主方向 | 局部灵活、需存多个规则 |
| 默认方向 | 缺失统一走一侧 | 快但信息利用少 |
| 预先插补 | 先补值再走普通树 | 流水线统一但引入插补假设 |
五、从训练到验证的执行链
选主切分 -> 生成主左右标签 -> 其他特征搜索最佳模仿规则
-> 按一致率排序保存 -> 预测遇缺失逐个尝试 -> 全缺失走默认分支
六、边界条件与工程代价
若缺失本身携带风险信息,单纯模仿主切分可能抹掉信号。
可增加 missing indicator,或使用原生缺失分支并验证。
一致率应只在主特征和候选特征同时可见的样本上估计,还要考虑覆盖率;99% 一致但只覆盖 5% 样本的规则并不实用。
记忆钩子:把替代划分记成“主路封闭时,找最像主路方向的备用路”。
七、常见误区与追问
-
误区:替代划分是在预测目标标签。 它首先模仿主切分的左右路由。
-
追问:如何选择替代规则? 综合与主方向的一致率、覆盖率和相对多数基线的提升。
-
误区:有替代划分就不必监控缺失率。 缺失模式和特征相关性漂移仍会让路由失真。
-
追问:所有替代特征也缺失怎么办? 使用节点的默认方向或训练时定义的多数分支。
-
追问:它和插补有什么区别? 替代划分直接决定局部方向,不构造完整的缺失特征数值。
八、加强记忆
把替代划分记成“主路封闭时,找最像主路方向的备用路”。
训练看一致率与覆盖率,预测按排序尝试;它不是插补,也不是直接预测标签。