pm我是产品经理 返回首页

A/B 测试的统计学陷阱:别再只看 p 值

数据分析 GPMU原创 2026-08-20 13 次浏览
微信扫一扫分享

微信扫一扫,分享给好友

关闭
A/B 测试的统计学陷阱:别再只看 p 值
团队抢着发版实验,但 70% 的"胜利"是统计幻觉。本文拆解A/B测试中最常见的五个陷阱,以及如何建立真正可靠的实验文化。

过去五年,A/B 测试已经从大公司的专利变成了所有产品团队的标配。但一个尴尬的现实是:很多团队跑了一堆实验,上线了一堆"显著"的版本,业务结果却没有对应改善。

问题出在哪?不是 A/B 测试方法本身有问题,而是大多数团队用 A/B 测试的方式有问题。下面五个陷阱,如果你的团队踩了三个以上,实验文化就必须重建。

陷阱一:边跑边看,看到显著就停

这是最经典的统计学陷阱。每天看一次数据,某天 p 值 < 0.05 了,立刻宣告实验胜利、上线新版本。

但统计学告诉我们:每天看的累积假阳性率会膨胀到 26% 以上(研究数据,基于 5% 显著性水平下,每天 peek 一次的累积错误率)。你的"显著"其实是大海捞针捞到的随机波动。

正确做法:

陷阱二:只看 p 值,不看效应量

p 值告诉你"这个差异不像随机波动",但不告诉你"这个差异有没有业务价值"。

一个统计显著的 0.1% 提升,可能根本不值得工程团队为它付出几个迭代周期的开发成本。但大多数 PM 看到显著性就兴奋地推动上线了。

正确做法:

陷阱三:实验运行时间不够

很多团队的实验只跑 3-5 天就草草收场。但这经常导致两个问题:

问题 A:周内效应没覆盖。如果实验周一上线周 3 结束,周末的用户行为没有进入样本,实验结果不代表真实情况。

问题 B:新奇效应(Novelty Effect)没消除。新设计上线初期,老用户会因为"新鲜"而短暂点击率上升,几周后回归正常。如果只看第一周的数字,会高估真实效果。

正确做法:

陷阱四:忽略护栏指标

实验的胜利不能只用主指标衡量。一个让转化率提高 5% 但把 30 天留存拉低 10% 的版本,不是胜利——是把未来的钱提前装兜里了。

正确做法:

陷阱五:实验后切分群体找意义

实验整体上"不显著",有人开始切分群体:按渠道、按设备、按地域、按新老用户……切到某个细分群体显示出"p < 0.05"了,被当作胜利宣布。

这是统计学上最危险的做法之一。20 个细分群体中,大概率有 1 个会"显著"——这就是统计学上的多比较问题(Multiple Comparisons Problem)。

正确做法:

如何建立可靠的实验文化

上面五个陷阱看起来是技术问题,本质是流程文化和决策习惯问题。一个真正可靠的实验文化需要这几样支撑:

支撑一:实验上线前的标准模板。包含假设、主指标、MDE、样本量、护栏指标、运行周期、停止规则七个要素。没有这七样的实验不允许启动。

支撑二:实验结果的双盲复盘。实验负责人不能单方面宣布"我的实验赢了"。团队一起读数据,按标准模板审视显著性、效应量、护栏、时间趋势、细分表现。

支撑三:失败实验被奖励。一个实验"证明假设错误"和"证明假设正确"同样有价值。但很多团队文化里,失败实验负责人会被质疑,导致大家只敢挑"看起来能赢"的假设去试。

支撑四:实验仓库。所有的实验(不论成败)都被记录,后续团队可以查询"这个我们试过,效果不好,原因是XX"。避免重复实验和互相矛盾的结论。

最后

A/B 测试是一个工具,工具的价值取决于使用者的严谨程度。当你的团队还在为"终于显著了"欢呼时,真正成熟的实验团队已经在做更精细的因果分析、用更长时间窗口验证、用多臂实验减少流量浪费。

实验文化没有捷径,就是一次一次把陷阱记下来、流程一次一次规范起来。一年后,你会发现团队的决策质量在数据上看得见。

我是产品经理 · 产品经理学习社区 | 让每一个产品人持续成长
微信:superpcpcpc · 542027533@qq.com · 沪ICP备2026037686号