上线还是不上线?A/B 实验小游戏
团队重新设计了结账页。现在有 5% 的访客会下单。每一轮开始时,系统会偷偷抛一次硬币,决定新版本 B 是真的更好(销量提升 15%),还是和旧版本 A 效果完全一样。
没有人故意往数据里加噪声。每位访客要么下单,要么不下单,全凭随机,所以哪怕两个页面一模一样,转化率也很少完全相同。这种波动有多大,只取决于访客有多少:每个版本 2,000 人时,单靠运气就能让 B 看起来比 A 好或差将近 27%,足以掩盖真实的 15% 提升。每个版本 15,000 人时,波动会缩小到 ±10% 左右。滑块下方那行字会随着你拖动实时显示这个范围。
选好每个版本分多少访客,点击开始,看着证据一点点进来。你随时可以拍板:上线 B 或者 保留 A。然后揭晓真相。
A(旧版)–
B(新版)–
判断正确 0
上线了无效版本 0
错过真提升 0
可以试试
- 先用 2,000 位访客玩几轮。 B 真的更好时,实验通常也发现不了。小实验看着省事,结果大多是噪声。把滑块拉到 15,000 左右,统计功效会超过 80%,这是大多数团队追求的水平。
- 在实验结束前盯着蓝线。 哪怕 B 毫无作用,p 值也会来回游走,常常短暂跌破 0.05。如果一看到显著就上线,你上线无效版本的次数会远超教科书承诺的 5%。这就是偷看问题,也是为什么团队会事先定好样本量,或者使用专门支持提前停止的序贯检验方法。
- 留意真实效果有多小。 这里的 15% 提升,只是从 5% 变成 5.75%。现实中大多数产品改动的效果只有这么大,甚至更小,所以好的实验更需要耐心,花哨的看板帮不上太多忙。
在产品工作里,很多上线决策最后都落在这样一份实验结果上。难点很少在统计本身,难在事先想清楚什么结果会改变你的判断,然后坚持下去。
Comments
Comments load here, powered by GitHub Discussions.