你的A/B测试有三个目标 他们不同意 现在怎么办?

2026年8月1日1 次浏览来源:Dev.to阅读原文

每个A/B测试教程都以同样的方式结束:运行测试,等待意义,将得分者运送.

然后进行真正的测试,变体B在通讯注册上转换得更好, 给每个访客带来4%的收入,反弹是平的。

除了报到之外,没有什么重要的事 船吗?

我在建设A/B引擎时花了相当多时间来讨论这个问题,我在网上读到的大部分内容都无济于事,因为大部分内容都假设一个尺度.

这个帖子是我最后的结果.

这不是小说——统计已经几十年了,但我找不到一个地方用工作代码写下来的,所以在这里.

P值为何不回答你问的两个问题,第二个是坏的.

多相比较. α = 0.05的3个度量值意味着,如果实际没有什么不同,至少一个假阳性概率约为14%。

Bonferroni解决这个问题,但现在你需要α=0.017每公分,你的测试需要运行三倍长。

在一个进行每月300次转换的站点上,这不是固定的,而是拒绝. p值是回答另一个问题。

它告诉你假设不存在差异的数据的概率。

你真正想知道的是:如果我船B, 如果我错了,我期望损失多少?

这些不是同一个问题,没有多少Bonferroni会变成另一个。

还有一个偷看的问题—— 每个人都每天检查仪表板, 当它变绿色时就停下来, 这悄悄地将假正率夸大, 远超过你写下来的α。

我会回到这个问题上,因为巴伊西亚的方法 并没有神奇地解决它,不管你读过什么。

后一,决定二 对于一个转换率,Beta-Binomial相接对 给予你后一行。

使用制服前, 转换出访客后: 就是这样。

两种Betas之间没有封闭式的比较,值得执行,所以样本.

PHP在核心中没有Beta采样器,也没有Gamma采样器,所以你建一个.

马萨格利亚- ang,需要下面的普通采样器: 现在单量比较: 取出两个数字而不是一个。

是每个人引用的直觉 也就是你放弃的平均换算率, 在整个后期, 在B更糟糕的世界里。

如果这个数字是0.0004,而你真正不在乎 四百分之一的百分点, 船B并停止思考它, 即使88%的概率。

在测试前选择那个门槛.

在测试配置中写入.

这是你为运输而费力的最小效果, 它迫使人们谈论测试的真正目的。

每名访客的收入不是Beta 我一开始就是在这里弄错了 我将每个访客的收入 当作一个类似转换的数量 并得到了后 远过于自信。

每名游客的收入是零膨胀(大多数游客买不到任何东西)和重尾巴(一个企业订单扭曲了一切)。

一个Beta是错的,一个正态是错的,一个对数正常是更接近的,但仍然假设了零.

我用靴子来代替。

用替换、时间、取每次重取的平均值来重取每一次重取观察到的每个访客的收入值。

这就是你的后传分布, 它继承了无论什么丑陋的形状 你真正的数据不用命名: 这是O (draws × n), 它会伤害到大样本。

用块来预先计算一个累积的阵列和样本指数,或者在固定的随机子样本上,每只手臂有5000名访客的"靴子"——与你已经生活的取样噪音相比,额外的蒙特卡洛噪音很小.

结合衡量标准而不欺骗自己 现在,真正的问题。 3个度量衡,3个后缀,1个决定.

标准答案是OEC——总体评价标准,取自Kohavi在微软的作品.

预先商定一个加权综合数据,即测试得分。

两种东西,人们错了:

1.

重量相对上升,而不是原始价值.

换算率

分享