← 返回题目列表

高基数特征为什么会影响决策树划分?

中等 第 21 / 25 题 更新于 2026/09/19
决策树机器学习面试题模型训练

简化版

高基数特征拥有更多候选切分,更容易仅凭随机波动获得较大训练集纯度增益,因此树会偏爱 ID、邮编等特征。应删除标识符、限制类别集合搜索、合并稀有类,并用验证集、置换重要性和目标编码防泄漏方案复核。

详细版

  • 偏差来自“多次尝试取最大值”,不是高基数本身必然有预测力。

  • 连续特征唯一值很多也有类似问题,可尝试大量阈值。

  • 基于 impurity decrease 的特征重要性会继承这种偏好。

  • one-hot 可改变搜索方式但造成稀疏高维,也不自动消除过拟合。

  • 随机 ID 若被树选中,是数据或约束报警信号。

完整版教学

一、候选越多,撞上虚假增益的机会越大

在有限样本中,即使特征与标签独立,不同切分也会出现随机纯度变化。

低基数特征只能试少数方案,高基数特征可以挑选大量方案,最大训练增益自然偏高。

这与多重比较问题相似。

贪心树只看到最好的那个切分,不会自动扣除“尝试次数”带来的乐观偏差。

二、数学机制怎么落到节点上

K unordered categories -> up to 2^(K-1)-1 binary partitions;20 categories -> 524,287 candidate partitions。

K unordered categories -> up to 2^(K-1)-1 binary partitions
20 categories -> 524,287 candidate partitions

more candidates => larger expected maximum noise gain

三、带数字的推演

用户 ID 有 1000 个唯一值,几乎能把训练样本逐个隔离;性别只有 2 个候选组。

即使二者都与标签无关,ID 也更可能找到看似纯净的小叶并获得虚假重要性。

四、方法对比

方法/对象核心特点代价或限制
删除/屏蔽 ID阻断记忆样本最直接
合并稀有类别减少候选与方差可能损失细粒度信号
折外目标编码压缩高基数实现复杂、需防泄漏

五、从训练到验证的执行链

统计 unique ratio -> 识别 ID/代理标识 -> 分组划分数据
-> 约束叶大小/类别处理 -> 比较置换重要性 -> 检查新类别与时间外泛化

六、边界条件与工程代价

邮编、商品 ID 有时确实携带地理或商品差异,不能只因基数高就全部删除。

应判断线上能否稳定获得、是否泄露目标以及对新类别能否泛化。

置换重要性也会受相关特征影响:两个代理变量互相替代时,单独打乱一个的重要性可能偏低。

需结合分组置换和消融实验。

记忆钩子:把高基数偏差理解成“抽奖次数多”:候选切分越多,抽到虚假大奖的概率越高。

七、常见误区与追问

  • 误区:高基数特征一定无用。 问题是虚假增益风险高,真实稳定信号仍可能存在。

  • 追问:连续特征也有偏差吗? 唯一值多意味着阈值候选多,同样存在选择偏差。

  • 误区:one-hot 后问题自动消失。 模型仍可逐个隔离稀有类别,并产生高维成本。

  • 追问:为什么 impurity importance 偏高? 训练中被更多候选选中的特征会累计更多纯度下降。

  • 追问:如何识别 ID 泄漏? 查看唯一率、业务生成逻辑,以及时间外或新主体测试性能。

八、加强记忆

把高基数偏差理解成“抽奖次数多”:候选切分越多,抽到虚假大奖的概率越高。

治理顺序是识别标识符、减少候选、提高叶样本量,再用真正独立的数据复核。