过去十年,A/B 测试从一门只有大公司玩得起的专业技能,变成了所有产品团队的标配。
工具普及是好事。但随之而来的问题是:很多团队把 A/B 测试想得太简单了——上线变体、等几天、看到绿色、发布。流程跑得很顺,实验做了几十个,但产品迭代效果平平。
本文编译自海外产品分析专家 Niels Christian Laursen 的实战反思文章,聚焦一个被广泛忽视的话题:不是 A/B 测试本身,而是 A/B 测试的解读。
实验设置现在已经不难了。难的是解读。许多团队花了几个月时间设计 A/B 测试,却忽视了让实验真正可信的那些解读纪律。
最贵的实验错误不是技术性的——是决策性的:把噪声当真理,把不确定的提升当确定的产品胜利,然后自信地推进上线。两周后提效消失了,才发现是实验根本没读懂。
下面四个最常见的实验陷阱,正是大多数"假胜利"的来源。
陷阱 1:样本量不足——用小流量赌大提升
这是最隐蔽的陷阱。一个团队想检测小幅度提升,但只跑了短时间、拿到的数据根本不足以支撑他们的判断。结论常常是"看起来没显著差异,所以这个方案不好"——但这个结论可能是错的,因为实验从一开始就没有检测这个提升的能力。
正确的做法分四步:
如果跳过这一步,实验得到的不是决策,而是数据抽样下的随机波动。
陷阱 2:偷看效应——边跑边决策的累积陷阱
实验仪表盘是好事,也是陷阱。
如果团队每天看一眼,看到效果变好就提前终止实验,假阳性率会迅速膨胀。海外研究数据显示:每天监控的 5% 显著性水平的实验,实际累积假阳性率能到 26%——是预期的五倍。
这意味着大多数团队报告的高胜率,不是他们真的擅长做实验,是被偷看效应污染了。
正确的做法:
n3. 把"再多看一眼"当成技术债——会让自己产生假胜利
陷阱 3:p 值痴迷——只看显著性,不看效应量
p 值是一个被滥用的统计指标。它回答的是一个很窄的问题:"如果两个版本其实没差异,我们看到的差异有多极端"。但它不回答:"这个差异值得上线吗"。
一个统计上显著、但提升只有 0.1% 的实验,可能不值得投入工程资源去实现。
反之,一个统计上不显著、但提升幅度较大的实验,在样本量不足时可能是"还行但还没验证"。
正确的做法是关注三点:
当和团队一起读实验数据时,问一句话:"就算这个提升是真的,这个幅度值得做吗?"
这句话能很快过滤掉一些噪声。
陷阱 4:忽略样本比例偏差(SRM)
SRM(Sample Ratio Mismatch)是个特别隐蔽的问题。
设计 50/50 的实验,实际跑出 60/40。这背后的原因可能是流量分配逻辑、追踪代码、机器人过滤、受众筛选,或者是平台本身的不稳定。无论原因是什么,一旦出现 SRM,实验的统计推断就不再可信。
很多团队不加检查就解读实验结果,等到两周后"胜利消失"才发现统计基础就有问题。
正确的做法:
海外专家总结出的四个步骤:
步骤 1:上线前就承诺假设和决策阈值
实验不是让你看哪里涨就上线的。实验要有具体的、可证伪的假设,以及"假设成立"时触发什么动作。
步骤 2:带上明确的监控和停止计划
要么基于样本量、要么基于时间,不能基于"今天看起来不错"。这两类规则一旦定下来,中途不能改。
步骤 3:读效应量 + 区间,不只是显著性
"显著性"是门槛,"'是否值得上线'是决策"。这两个问题答案是分开的。
步骤 4:跑 SRM 和埋点检查,再做结果解读
统计可信度的前提是数据可信度。如果流量分配错了、埋点丢了、抽样方式变了,所有统计结果都不可信。
A/B 测试在操作层面已经变得很便宜了。这是好事,但也意味着"自信的胡说八道"更容易产生。
如果你希望真正提升实验驱动的迭代质量,少做点实验,把已做的实验解读得严谨一些,会比多做实验、解读粗糙产生更好的业务结果。
A/B 测试很容易。把 A/B 测试的解读做对、又不被数据骗——才是真正难的部分。