单位 9 / 11

A/B 测试和实验设计:变体构建和意义

收益:

  • 能够理解 A/B 测试、对照/变体、转化率和统计显着性的概念,并利用人工智能建立假设和测试设计。
  • 能够在人工智能支持下隔离要测试的单个变量并生成变体文本/图像和测量计划
  • 能够区分人工智能的测试解释受到样本大小和显着性以及读取过早/不正确结果的风险的限制

广告中最危险的一句话是“我认为这个更好”。数据,而不是意见,可以告诉您标题、图像或按钮是否真的更好。衡量这一点的最常见方法是 A/B 测试:向真实用户展示同一广告的两个(或更多)版本,并比较哪一个效果更好。 “A”通常是当前版本(对照),而“B”是正在尝试的新版本(变体)。例如,您只能更改同一广告中的标题并衡量哪个标题点击次数更多。人工智能在此过程中有助于生成大量变体并解释结果;但测试的科学有效性取决于设计规则和耐心。

A/B 测试的黄金法则:一个变量

A/B 测试最基本的规则是隔离单个变量。如果您同时更改标题、图像和按钮并且版本 B 获胜,您将永远不知道哪个版本获胜。因此,在测试中仅应更改一个元素,其余元素应保持不变。如果您想同时系统地测试多个项目,这称为多变量测试,并且需要更大的样本;单变量 A/B 测试是开始的方法。

第二个基本概念是统计显着性。假设版本 A 获得了 3% 的点击次数,版本 B 获得了 3.3% 的点击次数。这种差异是真正的优势还是侥幸?如果您只向 100 个人展示测试,这种差异可能是巧合。统计显着性意味着观察到的差异不太可能是偶然造成的(即差异可能是真实的)。这需要足够的样本量(观看测试的人数)。在数据很少的情况下宣布“胜利者”是最常见且代价高昂的错误。

提示:在开始测试之前,回答“我什么时候宣布获胜者”的问题:有多少人/转换后,在什么显着性水平。提前做出这个决定可以防止您在最初的几个小时内陷入噪音并做出过早的决定。

下表比较了好的和坏的 A/B 测试设计:

项目

糟糕的设计

好的设计

变量数量

标题+图片+按钮在一起

仅标题

假设

(无)“让我们看看会发生什么”

“有问题的标题会增加点击量”

样品

80人

预先计算的法定人数

决策时间

2小时后

当你达到重要地位时

获奖者评选

“我觉得B不错”

基于数据和意义

一步一步:设置 A/B 测试

第 1 步——写一个假设。您正在测试什么以及为什么?诸如“具有优势的标题比具有功能的标题获得更多点击”之类的明确假设。

步骤 2 — 选择单个变量。只是标题,或者只是图像,或者只是 CTA。

第 3 步 — 生成变体。使用人工智能创建同一物品的不同版本;保持其余不变。

第 4 步 — 制定测量计划。哪个指标将决定获胜者(点击率、转化率)、需要多少样本、运行多长时间。

第 5 步 — 解释并验证结果。是否收集了足够的数据,差异是否显着?如果不显着,“无差异”也是有效结果。

三个迷你箱子

情况 1 — 单个变量的清晰度。一个电子商务品牌仅在其产品广告中测试了 CTA:“购买”和“添加到购物车”。其他一切都一样。经过足够的采样后,“添加到购物车”带来了显着更高的转化。由于单个变量是孤立的,因此可以清楚地解释差异。 AI 生成了两个 CTA,数据选出了获胜者。

案例 2——早期决策陷阱。 A品牌停止了测试,因为B版本在A/B测试的前3个小时内领先,并将B开放给整个预算。第二天看总数据,A其实稍微好一些;最初几个小时的差异纯属巧合。预算被浪费了。错误:样本量不足而做出过早的决定。

案例3——“没有区别”也是结论。一个品牌测试了两张不同的图像,经过足够的采样,它们都产生了几乎相同的结果。虽然团队正要感叹“测试失败”,但正确的解读是,图像并不是这次活动的决定因素,所以应该把精力集中在标题和优惠上。没有发现显着差异这一事实也是有价值的信息。

四个可复制模板

1)假设和测试设计:

我想测试什么:[例如。广告标题]。任务:(1) 编写一个可测试的假设(以“...增加...增加”的形式)。(2) 列出要隔离的单个变量和要保持不变的变量。(3) 建议确定获胜者的指标(点击率/转化)。(4) 写下验证测试时需要注意的事项(样本、持续时间、早期决策风险)。

2)变体生成器(单一变体):

粘性广告:图片[相同]、CTA [相同]、目标[相同]。测试变量:标题。主要消息:“[消息]”。任务:使用相同的消息生成 4 个不同的标题变体。每个问题都使用不同的方法(问题、好处、数量、紧迫性)。仅标题发生变化;添加未经证实的主张。

3)测量计划:

测试:[A 和 B 的定义]。指标:[点击/转化]。任务:起草一个衡量计划:(1)哪个指标是主要的,哪些是次要的,(2)需要多少数据/时间来宣布获胜者(解释逻辑),(3)如何在A和B之间均匀且公平地分配流量,(4)哪些外部因素会扭曲结果(季节,星期几)。假设我将使用显着性工具来计算精确的统计数据。

4)结果解释器(小心):

我的A/B测试结果(真实数据):[A:展示次数/点击次数/转化],[B:展示次数/点击次数/转化]。任务:(1)计算并显示每个版本的比率。(2)评论差异的大小,但如果样本不充分,请说“数据不足,无法得到有意义的结果。”(3)提醒过早/误读的风险。不明确声明显着性;我将使用单独的帐户工具进行确认。

弱提示/强提示

弱提示:

为我的广告制作 A 和 B 版本,告诉我哪一个更好。

变量不是孤立的,没有假设和测量;如果没有数据,人工智能无法知道哪一个是“好”的,它会弥补这一点。

强力提示:

我正在设置 A/B 测试。已修复:图像和 CTA 将保持不变。仅测试变量:广告标题。假设:“带数字的标题比一般标题获得更多点击。”主要信息:“3 天内交付。”任务:(1) 生成 1 个一般标题作为对照,3 个带数字的标题作为变体。(2) 告诉我应该查看哪个指标来衡量获胜者。(3) 提醒我 3 个可能使测试无效的错误。不要预测哪一个会赢;数据将决定它。

第二个主张分离出单个变量,涉及假设和测量;将胜利者留给数据。

常见错误

  • 一次更改许多项目。获胜者的原因变得不明朗;单个变量必须是孤立的。
  • 在样本不足的情况下做出决策。最初几个小时的差异往往是巧合的。
  • 没有假设的测试。 “让我们看看会发生什么”测试不会产生学习;首先写下你的期望。
  • 将结果“无差异”误认为失败。缺乏显着差异也提供了信息。
  • 根据口味选择获胜者。测试正是为了排除个人品味;遵循数据。
  • 忘记外部因素。季节、竞选日、新闻流都可能扭曲结果;保持测试条件公平。
注意:A/B 测试的目的不是“获胜”而是学习。即使是一个变体丢失也是有价值的信息;真正的损失是依赖于数据不足的错误结果并将预算与之挂钩。

总之

A/B 测试是一种将广告决策从想法转变为数据的强大方法。黄金法则是隔离单个变量:测试中仅应更改一个元素,其余元素应保持不变。第二个支柱是充分的抽样和统计意义;用很少的数据就宣布胜利者是最昂贵的错误。人工智能有助于生成多种变体以及计算和解释赔率,但决定获胜者的是数据,而不是人工智能。即使是“没有区别”的结果也是一种学习。应在测试开始之前写下假设、度量和决策阈值。

应用任务

选择广告素材(标题、图片或号召性用语)。 (1) 用“假设和检验设计”写出单个可检验的假设和孤立变量。 (2) 使用“变体生成器”生成1个对照+3个变体;只需更改该元素即可。 (3) 通过“测量计划”计划您将查看哪个指标、持续多长时间以及使用哪些数据。 (4) 提前写下宣布获胜者的门槛(有多少转化/什么意义)。 (5) 用“结果解释器”考虑假设的结果,并注意为什么在数据不足的情况下你不会做出决定。

清单

  • [ ] 我在测试中仅隔离了一个变量。
  • [ ] 测试前我写了一个明确的假设。
  • [ ] 我已经确定了获胜者所需的样品和时间。
  • [ ] 我根据数据而不是个人品味来选择获胜者。
  • [ ] 我认为“无差异”结果是有效的学习。
  • [ ] 我检查了可能扭曲结果的外部因素。