投票法和平均法在集成学习中有什么区别?
简化版
硬投票统计类别票数,软投票平均类别概率,回归则平均数值预测。软投票能利用置信度,但要求成员概率尺度可比且校准;硬投票更稳健,却丢掉置信度和成本信息。
详细版
-
硬投票每模型一票,可设置权重。
-
软投票先对齐类别顺序,再加权平均概率。
-
logit 平均与概率平均结果不同,必须说明融合空间。
-
成员高度相关时,投票数增加不等于独立证据增加。
-
权重只能在验证/OOF 数据学习,不能看测试集。
完整版教学
一、融合空间决定保留多少信息
硬投票把 0.51 和 0.99 都当一票,抗概率尺度差异但浪费置信度。
软投票保留强弱信息,坏处是一个过度自信模型可支配平均。
回归均值对极端成员敏感,中位数或截尾均值更稳健;融合规则应匹配误差分布。
二、底层机制与公式
hard: argmax_k sum_m w_m*1[pred_m=k]
soft: argmax_k sum_m w_m*p_m(k)
三、带数字的推演
三个二分类概率 [0.51,0.52,0.99] 都投正,硬票 3:0;概率均值约 0.673。
若为 [0.51,0.51,0.01],硬票仍判正 2:1,软平均 0.343 会判负。
四、方案对比
| 方案/对象 | 核心特点 | 代价或边界 |
|---|---|---|
| 硬投票 | 不依赖概率幅度 | 丢置信度 |
| 软投票 | 利用概率信息 | 需校准和类别对齐 |
| Logit 平均 | 融合未归一分数 | 尺度更敏感 |
五、执行流程
收集 OOF 分数 -> 对齐类别/输出空间 -> 检查校准与相关性
-> 验证等权和加权融合 -> 固定阈值 -> 独立测试
六、边界条件与工程代价
不同库的 classes_ 顺序可能不同,直接按列平均会把类别概率错位;必须按标签重排。
软投票后的阈值不一定是 0.5,尤其在不均衡、成本敏感或加权训练场景,应在验证集重新选择。
记忆钩子:硬投票数票、软投票算概率;前者丢强弱,后者怕失准。
七、常见误区与追问
-
误区:软投票总优于硬投票。 未校准成员会让概率平均受极端分数支配。
-
追问:概率平均与 logit 平均一样吗? 非线性 softmax/sigmoid 使两者不同。
-
误区:两个同构模型就是两份独立证据。 错误高度相关时增益有限。
-
追问:类别列为什么要对齐? 每个概率列必须代表同一标签。
-
追问:权重如何确定? 用 OOF 或验证预测优化,不能使用测试标签。
八、加强记忆
硬投票数票、软投票算概率;前者丢强弱,后者怕失准。
融合前先对齐类别和输出空间,融合后重新校准与选阈值。