← 返回题目列表

投票法和平均法在集成学习中有什么区别?

中等 第 18 / 25 题 更新于 2026/09/19
集成学习机器学习面试题模型训练

简化版

硬投票统计类别票数,软投票平均类别概率,回归则平均数值预测。软投票能利用置信度,但要求成员概率尺度可比且校准;硬投票更稳健,却丢掉置信度和成本信息。

详细版

  • 硬投票每模型一票,可设置权重。

  • 软投票先对齐类别顺序,再加权平均概率。

  • logit 平均与概率平均结果不同,必须说明融合空间。

  • 成员高度相关时,投票数增加不等于独立证据增加。

  • 权重只能在验证/OOF 数据学习,不能看测试集。

完整版教学

一、融合空间决定保留多少信息

硬投票把 0.51 和 0.99 都当一票,抗概率尺度差异但浪费置信度。

软投票保留强弱信息,坏处是一个过度自信模型可支配平均。

回归均值对极端成员敏感,中位数或截尾均值更稳健;融合规则应匹配误差分布。

二、底层机制与公式

hard: argmax_k sum_m w_m*1[pred_m=k]
soft: argmax_k sum_m w_m*p_m(k)

三、带数字的推演

三个二分类概率 [0.51,0.52,0.99] 都投正,硬票 3:0;概率均值约 0.673。

若为 [0.51,0.51,0.01],硬票仍判正 2:1,软平均 0.343 会判负。

四、方案对比

方案/对象核心特点代价或边界
硬投票不依赖概率幅度丢置信度
软投票利用概率信息需校准和类别对齐
Logit 平均融合未归一分数尺度更敏感

五、执行流程

收集 OOF 分数 -> 对齐类别/输出空间 -> 检查校准与相关性
-> 验证等权和加权融合 -> 固定阈值 -> 独立测试

六、边界条件与工程代价

不同库的 classes_ 顺序可能不同,直接按列平均会把类别概率错位;必须按标签重排。

软投票后的阈值不一定是 0.5,尤其在不均衡、成本敏感或加权训练场景,应在验证集重新选择。

记忆钩子:硬投票数票、软投票算概率;前者丢强弱,后者怕失准。

七、常见误区与追问

  • 误区:软投票总优于硬投票。 未校准成员会让概率平均受极端分数支配。

  • 追问:概率平均与 logit 平均一样吗? 非线性 softmax/sigmoid 使两者不同。

  • 误区:两个同构模型就是两份独立证据。 错误高度相关时增益有限。

  • 追问:类别列为什么要对齐? 每个概率列必须代表同一标签。

  • 追问:权重如何确定? 用 OOF 或验证预测优化,不能使用测试标签。

八、加强记忆

硬投票数票、软投票算概率;前者丢强弱,后者怕失准。

融合前先对齐类别和输出空间,融合后重新校准与选阈值。