过去五年,A/B 测试已经从大公司的专利变成了所有产品团队的标配。但一个尴尬的现实是:很多团队跑了一堆实验,上线了一堆"显著"的版本,业务结果却没有对应改善。
问题出在哪?不是 A/B 测试方法本身有问题,而是大多数团队用 A/B 测试的方式有问题。下面五个陷阱,如果你的团队踩了三个以上,实验文化就必须重建。
陷阱一:边跑边看,看到显著就停
这是最经典的统计学陷阱。每天看一次数据,某天 p 值 < 0.05 了,立刻宣告实验胜利、上线新版本。
但统计学告诉我们:每天看的累积假阳性率会膨胀到 26% 以上(研究数据,基于 5% 显著性水平下,每天 peek 一次的累积错误率)。你的"显著"其实是大海捞针捞到的随机波动。
正确做法:
陷阱二:只看 p 值,不看效应量
p 值告诉你"这个差异不像随机波动",但不告诉你"这个差异有没有业务价值"。
一个统计显著的 0.1% 提升,可能根本不值得工程团队为它付出几个迭代周期的开发成本。但大多数 PM 看到显著性就兴奋地推动上线了。
正确做法:
陷阱三:实验运行时间不够
很多团队的实验只跑 3-5 天就草草收场。但这经常导致两个问题:
问题 A:周内效应没覆盖。如果实验周一上线周 3 结束,周末的用户行为没有进入样本,实验结果不代表真实情况。
问题 B:新奇效应(Novelty Effect)没消除。新设计上线初期,老用户会因为"新鲜"而短暂点击率上升,几周后回归正常。如果只看第一周的数字,会高估真实效果。
正确做法:
陷阱四:忽略护栏指标
实验的胜利不能只用主指标衡量。一个让转化率提高 5% 但把 30 天留存拉低 10% 的版本,不是胜利——是把未来的钱提前装兜里了。
正确做法:
陷阱五:实验后切分群体找意义
实验整体上"不显著",有人开始切分群体:按渠道、按设备、按地域、按新老用户……切到某个细分群体显示出"p < 0.05"了,被当作胜利宣布。
这是统计学上最危险的做法之一。20 个细分群体中,大概率有 1 个会"显著"——这就是统计学上的多比较问题(Multiple Comparisons Problem)。
正确做法:
如何建立可靠的实验文化
上面五个陷阱看起来是技术问题,本质是流程文化和决策习惯问题。一个真正可靠的实验文化需要这几样支撑:
支撑一:实验上线前的标准模板。包含假设、主指标、MDE、样本量、护栏指标、运行周期、停止规则七个要素。没有这七样的实验不允许启动。
支撑二:实验结果的双盲复盘。实验负责人不能单方面宣布"我的实验赢了"。团队一起读数据,按标准模板审视显著性、效应量、护栏、时间趋势、细分表现。
支撑三:失败实验被奖励。一个实验"证明假设错误"和"证明假设正确"同样有价值。但很多团队文化里,失败实验负责人会被质疑,导致大家只敢挑"看起来能赢"的假设去试。
支撑四:实验仓库。所有的实验(不论成败)都被记录,后续团队可以查询"这个我们试过,效果不好,原因是XX"。避免重复实验和互相矛盾的结论。
最后
A/B 测试是一个工具,工具的价值取决于使用者的严谨程度。当你的团队还在为"终于显著了"欢呼时,真正成熟的实验团队已经在做更精细的因果分析、用更长时间窗口验证、用多臂实验减少流量浪费。
实验文化没有捷径,就是一次一次把陷阱记下来、流程一次一次规范起来。一年后,你会发现团队的决策质量在数据上看得见。