很多团队的A/B测试,本质上是「拍脑袋+看数字」。
两组数据有差异,就认为实验组更好。这种「伪A/B测试」不仅浪费流量,还可能做出错误决策。
前提一:随机分组
用户必须被随机分配到实验组和对照组。如果分组有偏差(如按用户ID的奇偶性分组,但奇偶性与用户特征相关),结果就不可靠。
前提二:样本量足够
样本量决定了能否检测到真实存在的差异。
计算公式(简化版):
n = 16 × σ² / δ²
其中σ是标准差,δ是希望检测的最小差异。
建议:用在线样本量计算器,输入基线转化率和预期提升幅度,得到所需样本量。
前提三:实验时间完整
实验必须运行到达到预定样本量。提前停止(peeking)会大大增加假阳性率。
p值:在原假设(实验组和对照组无差异)成立的情况下,观察到当前结果或更极端结果的概率。
p < 0.05通常被认为是「统计显著」。但注意:p值不表示实验组比对照组好的概率。
置信区间:真实差异的可能范围。如果95%置信区间不包含0,说明差异统计显著。
测试前:
测试中:
测试后:
A/B测试是科学方法在产品优化中的应用。它要求严谨、耐心、客观。
当你的团队能正确执行A/B测试时,产品优化就从「凭感觉」进化到了「靠证据」。