模型评估指标如何和业务目标对齐?
简化版
指标选择应从业务决策、错误成本、约束和数据分布反推,而不是默认 accuracy 或 AUC。先确定模型输出如何触发动作,再选离线代理指标,并验证它与线上收益的相关性。
详细版
-
分类阈值任务需考虑 FP/FN 成本。
-
排序任务关注位置权重与 Top-K 容量。
-
概率进入定价/风险计算时校准比硬准确率重要。
-
主指标之外设置延迟、公平和安全护栏。
-
指标定义必须固定聚合单位和时间窗。
完整版教学
一、指标是决策价值的代理函数
模型分数只有进入业务动作才产生价值。
相同 AUC 的两个模型,在每天只审核 100 单时 Top-100 precision 可能完全不同。
代理指标若与收益错位,优化会产生 Goodhart 效应;因此应通过历史回放或实验验证指标变化能否带来业务变化。
二、底层机制与公式
expected_value=sum_actions [benefit_TP*TP-cost_FP*FP-cost_review*N_review]
choose threshold/K under capacity constraint
三、带数字的推演
每天 10,000 请求但只能审核 100 个,模型 A Top-100 命中 40 个、B 命中 55 个;即使 A 的总体 AUC 更高,当前容量下 B 的业务价值可能更大。
四、方案对比
| 方案/对象 | 核心特点 | 代价或边界 |
|---|---|---|
| Accuracy | 直观 | 不均衡/成本不对称失真 |
| AUC | 总体排序 | 不看操作点 |
| Top-K precision/recall | 匹配固定容量 | 依赖 K 和基率 |
| NLL/Brier | 概率质量 | 不直接等于收益 |
五、执行流程
画出决策链 -> 量化错误/动作成本 -> 选主指标与约束
-> 离线回放多个操作点 -> 检查切片 -> A/B 验证业务因果 -> 固化口径
六、边界条件与工程代价
用样本平均指标可能让高频用户支配结果;若业务按用户决策,应先用户内聚合。
类别先验变化会让 precision 改变,即使排序能力相同;跨期比较要同时报告基率。
记忆钩子:指标选择从“模型分数之后会发生什么”倒推。
七、常见误区与追问
-
误区:AUC 最高的模型一定最适合上线。 业务只使用局部阈值/Top-K时未必。
-
追问:主指标怎么定? 选最接近可行动业务价值且可稳定测量的量。
-
误区:离线指标提升证明业务提升。 需要在线实验验证因果链。
-
追问:为什么要护栏? 防止主目标提升以延迟、公平或安全为代价。
-
追问:指标口径包括什么? 样本单位、聚合、窗口、阈值和缺失处理。
八、加强记忆
指标选择从“模型分数之后会发生什么”倒推。
主指标贴近价值,护栏限制副作用,线上实验确认代理没有走偏。