低频类别特征应该如何处理?
简化版
稀有类别可按频数阈值合并为 OTHER、做平滑统计、哈希或使用原生类别正则;目标是降低小样本方差并稳定 OOV。阈值只能从训练集确定,不能盲目抹掉业务上重要的少数类别。
详细版
-
合并依据可用绝对频数或占比,但要跨折稳定。
-
验证/线上未见类别通常映射到 UNKNOWN,而非训练稀有 OTHER。
-
OTHER 内部类别异质,合并会增加偏差。
-
目标编码对稀有类需强收缩到全局均值。
-
公平/风控场景要单独保留关键少数群体。
完整版教学
一、合并是在方差与语义损失间交换
只有 1~2 个样本的类别,其目标率或专属权重几乎由偶然噪声决定。
共享 OTHER 统计能借更多样本降低方差。
但 OTHER 不是自然语义类,完全不同的类别被压在一起。
阈值过高会让模型失去真实细粒度信号。
二、底层机制与公式
mapped(c)=c if count_train(c)>=m else OTHER
smoothed_mean_c=(n_c*mean_c+alpha*global)/(n_c+alpha)
三、带数字的推演
训练有 10,000 条,类别 A 3 条全正。
直接目标率 1.0;全局率 0.1、α=20 时平滑为 (3+2)/23≈0.217。
若阈值 m=5,A 也可进入 OTHER。
四、方案对比
| 方案/对象 | 核心特点 | 代价或边界 |
|---|---|---|
| 合并 OTHER | 稳定且易服务 | 类别语义混杂 |
| 平滑编码 | 保留类别身份 | 需防目标泄漏 |
| Hashing | 自然接收新值 | 碰撞不可解释 |
五、执行流程
只在训练折统计频数 -> 设阈值/平滑 -> 映射验证未知值
-> 比较稀有切片 -> 固化字典 -> 监控 OTHER/UNKNOWN 占比
六、边界条件与工程代价
数据漂移会让曾经稀有的类别变常见,固定映射需定期评估并通过新版本更新,不能在线静默改字典。
合并受保护群体可能掩盖差异表现;频数小不等于业务不重要,应保留审计维度。
记忆钩子:稀有类处理不是“少就删”,而是问专属估计是否有足够证据。
七、常见误区与追问
-
误区:所有低频类别都应删除。 少数类别可能有强业务语义。
-
追问:OTHER 与 UNKNOWN 有何区别? 前者训练见过但合并,后者训练从未见过。
-
误区:用全量数据频数决定合并。 验证类别出现情况会泄漏进训练变换。
-
追问:阈值如何选? 用折内验证比较泛化、稳定性与业务保留。
-
追问:线上监控什么? OTHER/UNKNOWN 比例和关键类别性能。
八、加强记忆
稀有类处理不是“少就删”,而是问专属估计是否有足够证据。
OTHER 降方差,平滑保身份,UNKNOWN 保证新值可服务。