机器学习模型上线为什么需要 A/B 测试?
简化版
A/B 测试随机把实验单位分到控制组和实验组,用线上指标差异估计策略的因果效果。关键是随机化单位、样本量、曝光一致性、显著性与实际收益,而不只是看到实验组均值更高。
详细版
-
先定义主指标、护栏指标和最小可检测效应。
-
用户级实验必须按用户稳定分桶,防止跨组污染。
-
实验前做 A/A 或 SRM 检查。
-
置信区间同时表达效应大小与不确定性。
-
提前偷看并随时停止会抬高假阳性。
完整版教学
一、随机化让两组除策略外可比
随机分配在期望上平衡已知与未知混杂,因此组间结果差可归因于处理。
随机化成立仍不保证执行正确;曝光丢失、串组和样本比例异常都会破坏推断。
因此实验分析必须先验证分流与曝光链路,再解释指标差异;跳过这一步,统计显著也可能只是工程偏差。
二、底层机制与公式
effect=mean(Y_t)-mean(Y_c)
SE=sqrt(s_t^2/n_t+s_c^2/n_c)
CI=effect±1.96*SE
三、带数字的推演
两组各 10,000 人,转化率 10.0% 与 10.8%,绝对提升 0.8 个百分点、相对提升 8%。
是否显著需结合二项方差算区间,不能只报 8%。
四、方案对比
| 方案/对象 | 核心特点 | 代价或边界 |
|---|---|---|
| 固定时长检验 | 规则清晰 | 不可随意早停 |
| 序贯检验 | 允许受控监看 | 设计更复杂 |
| 用户随机 | 避免同人串组 | 需稳定 ID |
五、执行流程
预注册假设/指标 -> 估样本量 -> 稳定分桶 -> SRM/数据质量
-> 到期分析效应与 CI -> 护栏检查 -> 决策并记录
六、边界条件与工程代价
网络效应或推荐供给共享会违反单位独立性,可能需按城市、商家或集群随机。
多指标、多版本同时检验会增加假阳性,应控制多重比较或预先指定唯一主指标。
记忆钩子:A/B 的链条是“随机化保证可比、区间表达不确定、护栏约束副作用”。
七、常见误区与追问
-
误区:p<0.05 就值得上线。 还要看效应大小、成本和护栏。
-
追问:什么是 SRM? 实际组别比例显著偏离设计比例,提示分流或数据异常。
-
误区:实验中途显著就立即停。 反复偷看会破坏固定样本检验错误率。
-
追问:随机化单位怎么选? 选择能隔离处理且与决策对象一致的最小单位。
-
追问:为什么报绝对提升? 相对比例会放大小基线变化,绝对值更利于算收益。
八、加强记忆
A/B 的链条是“随机化保证可比、区间表达不确定、护栏约束副作用”。
显著不等于重要,均值提升也不自动等于因果。