← 返回题目列表

低频类别特征应该如何处理?

中等 第 21 / 25 题 更新于 2026/09/19
特征工程机器学习面试题模型训练

简化版

稀有类别可按频数阈值合并为 OTHER、做平滑统计、哈希或使用原生类别正则;目标是降低小样本方差并稳定 OOV。阈值只能从训练集确定,不能盲目抹掉业务上重要的少数类别。

详细版

  • 合并依据可用绝对频数或占比,但要跨折稳定。

  • 验证/线上未见类别通常映射到 UNKNOWN,而非训练稀有 OTHER。

  • OTHER 内部类别异质,合并会增加偏差。

  • 目标编码对稀有类需强收缩到全局均值。

  • 公平/风控场景要单独保留关键少数群体。

完整版教学

一、合并是在方差与语义损失间交换

只有 1~2 个样本的类别,其目标率或专属权重几乎由偶然噪声决定。

共享 OTHER 统计能借更多样本降低方差。

但 OTHER 不是自然语义类,完全不同的类别被压在一起。

阈值过高会让模型失去真实细粒度信号。

二、底层机制与公式

mapped(c)=c if count_train(c)>=m else OTHER
smoothed_mean_c=(n_c*mean_c+alpha*global)/(n_c+alpha)

三、带数字的推演

训练有 10,000 条,类别 A 3 条全正。

直接目标率 1.0;全局率 0.1、α=20 时平滑为 (3+2)/23≈0.217

若阈值 m=5,A 也可进入 OTHER。

四、方案对比

方案/对象核心特点代价或边界
合并 OTHER稳定且易服务类别语义混杂
平滑编码保留类别身份需防目标泄漏
Hashing自然接收新值碰撞不可解释

五、执行流程

只在训练折统计频数 -> 设阈值/平滑 -> 映射验证未知值
-> 比较稀有切片 -> 固化字典 -> 监控 OTHER/UNKNOWN 占比

六、边界条件与工程代价

数据漂移会让曾经稀有的类别变常见,固定映射需定期评估并通过新版本更新,不能在线静默改字典。

合并受保护群体可能掩盖差异表现;频数小不等于业务不重要,应保留审计维度。

记忆钩子:稀有类处理不是“少就删”,而是问专属估计是否有足够证据。

七、常见误区与追问

  • 误区:所有低频类别都应删除。 少数类别可能有强业务语义。

  • 追问:OTHER 与 UNKNOWN 有何区别? 前者训练见过但合并,后者训练从未见过。

  • 误区:用全量数据频数决定合并。 验证类别出现情况会泄漏进训练变换。

  • 追问:阈值如何选? 用折内验证比较泛化、稳定性与业务保留。

  • 追问:线上监控什么? OTHER/UNKNOWN 比例和关键类别性能。

八、加强记忆

稀有类处理不是“少就删”,而是问专属估计是否有足够证据。

OTHER 降方差,平滑保身份,UNKNOWN 保证新值可服务。