← 返回题目列表

模型指标为什么要看置信区间?

中等 第 18 / 25 题 更新于 2026/09/19
模型评估机器学习面试题模型训练

简化版

指标置信区间描述有限测试样本导致的抽样不确定性。比例指标可用 Wilson/Clopper-Pearson,AUC 或复杂指标常用 DeLong/bootstrap;相关样本必须按用户、时间块等独立单位处理。

详细版

  • 点估计没有展示结果可能波动多大。

  • 正态近似在小样本或接近 0/1 时可能失真。

  • 模型差值区间比两个独立区间更适合比较。

  • 重复调测试集不在普通 CI 覆盖范围内。

  • 区间窄只表示采样精确,不保证无偏。

完整版教学

一、区间估计依赖有效样本量

若日志有 10 万行但只来自 100 个用户,有效独立信息更接近用户数;按行算区间会虚假变窄。

比较模型时同一样本上的误差相关,配对方法利用这种相关性并直接回答差值是否跨零。

二、底层机制与公式

Wald approx: p_hat±1.96*sqrt(p_hat(1-p_hat)/n)
paired delta_b=metric_A(sample_b)-metric_B(sample_b)

三、带数字的推演

1000 个独立样本准确率 0.8,简单标准误约 sqrt(0.8×0.2/1000)=0.0126,95% 半宽约 0.0247;应报告约 [0.775,0.825],小样本宜用 Wilson。

四、方案对比

方案/对象核心特点代价或边界
Wilson比例指标稳定仅适合相应参数
Bootstrap通用、支持复杂指标计算高且需正确抽样单位
DeLongAUC 解析比较假设与实现专用

五、执行流程

识别独立单位 -> 选与指标匹配方法 -> 计算点估计和 CI
-> 模型比较算配对差值 CI -> 报样本/簇数 -> 做敏感性分析

六、边界条件与工程代价

类别切片样本很少时区间会很宽,这是证据不足而非算法失败;不应只隐藏区间保留漂亮点估计。

分布漂移与标签偏差属于系统误差,普通抽样区间不会覆盖,需外部验证和重加权。

记忆钩子:先找独立单位,再选区间方法。

七、常见误区与追问

  • 误区:95% CI 表示真值有 95% 概率在本次区间。 频率学派含义是重复抽样过程的覆盖率。

  • 追问:两个模型区间重叠能否判断差异? 应直接计算配对差值区间。

  • 误区:日志行数就是有效样本数。 组内相关会降低有效信息。

  • 追问:小比例为何不用 Wald? 边界附近正态近似覆盖差。

  • 追问:区间很窄说明什么? 仅说明在当前抽样假设下估计精确。

八、加强记忆

先找独立单位,再选区间方法。

模型比较看“差值是否跨零”,而不是肉眼比较两条独立误差棒。