← 返回题目列表

模型评估指标如何和业务目标对齐?

中等 第 17 / 25 题 更新于 2026/09/19
模型评估机器学习面试题模型训练

简化版

指标选择应从业务决策、错误成本、约束和数据分布反推,而不是默认 accuracy 或 AUC。先确定模型输出如何触发动作,再选离线代理指标,并验证它与线上收益的相关性。

详细版

  • 分类阈值任务需考虑 FP/FN 成本。

  • 排序任务关注位置权重与 Top-K 容量。

  • 概率进入定价/风险计算时校准比硬准确率重要。

  • 主指标之外设置延迟、公平和安全护栏。

  • 指标定义必须固定聚合单位和时间窗。

完整版教学

一、指标是决策价值的代理函数

模型分数只有进入业务动作才产生价值。

相同 AUC 的两个模型,在每天只审核 100 单时 Top-100 precision 可能完全不同。

代理指标若与收益错位,优化会产生 Goodhart 效应;因此应通过历史回放或实验验证指标变化能否带来业务变化。

二、底层机制与公式

expected_value=sum_actions [benefit_TP*TP-cost_FP*FP-cost_review*N_review]
choose threshold/K under capacity constraint

三、带数字的推演

每天 10,000 请求但只能审核 100 个,模型 A Top-100 命中 40 个、B 命中 55 个;即使 A 的总体 AUC 更高,当前容量下 B 的业务价值可能更大。

四、方案对比

方案/对象核心特点代价或边界
Accuracy直观不均衡/成本不对称失真
AUC总体排序不看操作点
Top-K precision/recall匹配固定容量依赖 K 和基率
NLL/Brier概率质量不直接等于收益

五、执行流程

画出决策链 -> 量化错误/动作成本 -> 选主指标与约束
-> 离线回放多个操作点 -> 检查切片 -> A/B 验证业务因果 -> 固化口径

六、边界条件与工程代价

用样本平均指标可能让高频用户支配结果;若业务按用户决策,应先用户内聚合。

类别先验变化会让 precision 改变,即使排序能力相同;跨期比较要同时报告基率。

记忆钩子:指标选择从“模型分数之后会发生什么”倒推。

七、常见误区与追问

  • 误区:AUC 最高的模型一定最适合上线。 业务只使用局部阈值/Top-K时未必。

  • 追问:主指标怎么定? 选最接近可行动业务价值且可稳定测量的量。

  • 误区:离线指标提升证明业务提升。 需要在线实验验证因果链。

  • 追问:为什么要护栏? 防止主目标提升以延迟、公平或安全为代价。

  • 追问:指标口径包括什么? 样本单位、聚合、窗口、阈值和缺失处理。

八、加强记忆

指标选择从“模型分数之后会发生什么”倒推。

主指标贴近价值,护栏限制副作用,线上实验确认代理没有走偏。