← 返回题目列表

校准曲线和 Brier Score 有什么用?

高频 中等 第 8 / 25 题 更新于 2026/09/19
模型评估交叉验证AUC调参

简化版

校准曲线把预测概率分桶,比较每桶平均预测概率与真实正例率;落在对角线附近表示频率一致。分桶策略、样本量和置信区间会影响图形,应联合 Brier、NLL 与区分指标。

详细版

  • 横轴常为桶内平均预测,纵轴为实际正例率。

  • 等宽桶直观但高置信区域可能样本少。

  • 等频桶样本稳定但桶宽不同。

  • 曲线不能替代 AUC,二者回答不同问题。

  • 校准器必须在独立数据拟合。

完整版教学

一、可靠性图把概率承诺变成频率检验

若模型给一组样本 0.7 概率,长期约 70% 应为正;校准曲线就是对这种承诺分段核验。

小桶样本少会产生锯齿,不能把每个弯折都解释成系统偏差。

二、底层机制与公式

bin_conf_b=mean(p_i in b)
bin_acc_b=mean(y_i in b)
ECE=sum_b n_b/n*abs(bin_acc_b-bin_conf_b)

三、带数字的推演

某桶 100 个样本,平均预测 0.8,实际 65 个正例,则点为 (0.8,0.65),表现为过度自信 0.15;但还需为 65% 计算二项不确定性。

四、方案对比

方案/对象核心特点代价或边界
等宽分桶概率区间直观样本数悬殊
等频分桶每桶稳定横轴间隔不均
自适应/核方法曲线更细解释与实现复杂

五、执行流程

锁定测试/校准集 -> 选择并公开分桶 -> 统计每桶数量/均值/正例率
-> 画区间 -> 报 Brier/NLL/ECE -> 按类别和切片复核

六、边界条件与工程代价

ECE 可通过粗分桶被人为压低,跨模型比较必须固定规则并查看图和桶计数。

多分类可看 top-label calibration 或 classwise calibration,两者不能混为同一问题。

记忆钩子:校准曲线问“模型说 0.8 时,现实是否约八成发生”。

七、常见误区与追问

  • 误区:曲线在对角线就说明模型准确。 常数基率预测也可校准却无区分力。

  • 追问:为何显示桶样本数? 稀疏桶的正例率方差很大。

  • 误区:ECE 是无参数客观指标。 它依赖分桶方式。

  • 追问:横轴用桶中点吗? 更常用桶内实际平均预测概率。

  • 追问:校准和 AUC关系? 校准看数值可信,AUC看排序。

八、加强记忆

校准曲线问“模型说 0.8 时,现实是否约八成发生”。

看点的位置,也看每桶证据量;同时保留排序指标。