← 返回题目列表

机器学习模型上线为什么需要 A/B 测试?

中等 第 16 / 25 题 更新于 2026/09/19
模型评估机器学习面试题模型训练

简化版

A/B 测试随机把实验单位分到控制组和实验组,用线上指标差异估计策略的因果效果。关键是随机化单位、样本量、曝光一致性、显著性与实际收益,而不只是看到实验组均值更高。

详细版

  • 先定义主指标、护栏指标和最小可检测效应。

  • 用户级实验必须按用户稳定分桶,防止跨组污染。

  • 实验前做 A/A 或 SRM 检查。

  • 置信区间同时表达效应大小与不确定性。

  • 提前偷看并随时停止会抬高假阳性。

完整版教学

一、随机化让两组除策略外可比

随机分配在期望上平衡已知与未知混杂,因此组间结果差可归因于处理。

随机化成立仍不保证执行正确;曝光丢失、串组和样本比例异常都会破坏推断。

因此实验分析必须先验证分流与曝光链路,再解释指标差异;跳过这一步,统计显著也可能只是工程偏差。

二、底层机制与公式

effect=mean(Y_t)-mean(Y_c)
SE=sqrt(s_t^2/n_t+s_c^2/n_c)
CI=effect±1.96*SE

三、带数字的推演

两组各 10,000 人,转化率 10.0% 与 10.8%,绝对提升 0.8 个百分点、相对提升 8%。

是否显著需结合二项方差算区间,不能只报 8%。

四、方案对比

方案/对象核心特点代价或边界
固定时长检验规则清晰不可随意早停
序贯检验允许受控监看设计更复杂
用户随机避免同人串组需稳定 ID

五、执行流程

预注册假设/指标 -> 估样本量 -> 稳定分桶 -> SRM/数据质量
-> 到期分析效应与 CI -> 护栏检查 -> 决策并记录

六、边界条件与工程代价

网络效应或推荐供给共享会违反单位独立性,可能需按城市、商家或集群随机。

多指标、多版本同时检验会增加假阳性,应控制多重比较或预先指定唯一主指标。

记忆钩子:A/B 的链条是“随机化保证可比、区间表达不确定、护栏约束副作用”。

七、常见误区与追问

  • 误区:p<0.05 就值得上线。 还要看效应大小、成本和护栏。

  • 追问:什么是 SRM? 实际组别比例显著偏离设计比例,提示分流或数据异常。

  • 误区:实验中途显著就立即停。 反复偷看会破坏固定样本检验错误率。

  • 追问:随机化单位怎么选? 选择能隔离处理且与决策对象一致的最小单位。

  • 追问:为什么报绝对提升? 相对比例会放大小基线变化,绝对值更利于算收益。

八、加强记忆

A/B 的链条是“随机化保证可比、区间表达不确定、护栏约束副作用”。

显著不等于重要,均值提升也不自动等于因果。