模型指标为什么要看置信区间?
简化版
指标置信区间描述有限测试样本导致的抽样不确定性。比例指标可用 Wilson/Clopper-Pearson,AUC 或复杂指标常用 DeLong/bootstrap;相关样本必须按用户、时间块等独立单位处理。
详细版
-
点估计没有展示结果可能波动多大。
-
正态近似在小样本或接近 0/1 时可能失真。
-
模型差值区间比两个独立区间更适合比较。
-
重复调测试集不在普通 CI 覆盖范围内。
-
区间窄只表示采样精确,不保证无偏。
完整版教学
一、区间估计依赖有效样本量
若日志有 10 万行但只来自 100 个用户,有效独立信息更接近用户数;按行算区间会虚假变窄。
比较模型时同一样本上的误差相关,配对方法利用这种相关性并直接回答差值是否跨零。
二、底层机制与公式
Wald approx: p_hat±1.96*sqrt(p_hat(1-p_hat)/n)
paired delta_b=metric_A(sample_b)-metric_B(sample_b)
三、带数字的推演
1000 个独立样本准确率 0.8,简单标准误约 sqrt(0.8×0.2/1000)=0.0126,95% 半宽约 0.0247;应报告约 [0.775,0.825],小样本宜用 Wilson。
四、方案对比
| 方案/对象 | 核心特点 | 代价或边界 |
|---|---|---|
| Wilson | 比例指标稳定 | 仅适合相应参数 |
| Bootstrap | 通用、支持复杂指标 | 计算高且需正确抽样单位 |
| DeLong | AUC 解析比较 | 假设与实现专用 |
五、执行流程
识别独立单位 -> 选与指标匹配方法 -> 计算点估计和 CI
-> 模型比较算配对差值 CI -> 报样本/簇数 -> 做敏感性分析
六、边界条件与工程代价
类别切片样本很少时区间会很宽,这是证据不足而非算法失败;不应只隐藏区间保留漂亮点估计。
分布漂移与标签偏差属于系统误差,普通抽样区间不会覆盖,需外部验证和重加权。
记忆钩子:先找独立单位,再选区间方法。
七、常见误区与追问
-
误区:95% CI 表示真值有 95% 概率在本次区间。 频率学派含义是重复抽样过程的覆盖率。
-
追问:两个模型区间重叠能否判断差异? 应直接计算配对差值区间。
-
误区:日志行数就是有效样本数。 组内相关会降低有效信息。
-
追问:小比例为何不用 Wald? 边界附近正态近似覆盖差。
-
追问:区间很窄说明什么? 仅说明在当前抽样假设下估计精确。
八、加强记忆
先找独立单位,再选区间方法。
模型比较看“差值是否跨零”,而不是肉眼比较两条独立误差棒。