收益:
- 能够生成系统文本变体,隔离单个变量以进行 A/B 测试
- 能够将假设转化为可测量的实验设置
- 能够根据统计显着性和学习来解释测试结果
直觉在营销中很有价值,但证据更有价值。哪个标题获得更多点击,哪个 CTA 销售更多,哪个图片吸引更多关注?您可以通过 A/B 测试来衡量这一点,而不是猜测。 A/B 测试是一种实验方法,向真实观众展示相同内容的两个版本(A 和 B)并衡量哪个版本表现更好。人工智能快速生成这些测试的输入,即变体;但要使测试发挥作用,需要遵循科学规则:一次一个变量。在本单元中,您将学习如何生成变体、将假设转化为可测量的实验,并根据统计显着性解释结果。
黄金法则:隔离一个变量
要解释测试结果,A 和 B 之间必须只有一件事不同。如果您同时更改标题、图像和 CTA,您将永远不知道 B 获胜时哪一项造成了差异。隔离要测试的变量是使学习成为可能的唯一方法。
可测试的典型变量:
- 标题:相同的图像和正文,不同的标题。
- CTA 文字:“购买”还是“添加到购物车”?
- 主题行:影响电子邮件的打开率。
- 图片:相同的文字,不同的图像。
- 长度/语气:短与长,正式等真诚。
从假设到实验:一步一步
- 进行观察。 “我们的目标网页转化率很低。”
- 假设。 “以利益为中心的标题比以功能为中心的标题转化率更高。”
- 隔离变量。只有标题会改变。
- 生成变体。该模型有 2 个明显的变体(A:功能,B:优点)。
- 定义你衡量成功的标准。例如,转化率——采取所需操作的访问者的百分比。
- 确定样本和持续时间。足够的人,足够的时间。
- 测量、比较、学习。了解“为什么”,而不是获胜者。
“假设”是一种将在这里进行检验的预测,结果可能是对的,也可能是错的;一个好的假设会告诉你你的期望是什么以及为什么。
弱提示/强提示
弱提示:
为这个标题写一些替代方案。
强力提示:
生成 A/B 测试的变体。规则:只有标题会改变,正文和 CTA 将保持不变。假设:以利益为导向的标题比以功能为导向的标题获得更多点击。背景:着陆页。产品:项目管理应用程序。受众:小团队。要求:- 变体 A:以功能为导向的标题(描述产品的功能)- 变体 B:以利益为导向的标题(描述它为用户提供什么) 在每个变体下,写下它所触及的心理动机。只有 2 个变体;两者都应该是单行,长度相似。
重要的是希望变体具有相似的长度;否则“长度”无意中成为第二个变量。
测试前/测试后图
舞台
该怎么办
经常出错
假设
什么,我为什么要等?
没有假设的“让我们尝试一下”
变量
隔离一件事
一次改变很多事情
标准
选择一项明确的指标
不定的“更好”
样品
足够的人/时间
尽早决定
评论
了解原因
只拿获胜者
三个迷你箱子
案例 1 — CTA 测试给出了明确的结果。一个电子商务网站测试了产品按钮:A“购买”,B“添加到购物车”。仅按钮文本发生了变化。在对 3,000 名访问者进行的测试中,B 将其点击率从 4.0% 提高到了 4.9%。通过孤立的单一变量,获胜者就很明显了:“添加到购物车”感觉不那么具有约束力。
情况 2 — 多变量错误。一个团队设计了两个登陆页面,但标题、图像和颜色都不同。 B 赢了,但团队不知道是哪个因素造成了差异;学习变成了零。在下一次测试中,他们遵循了规则:一次一个变量。在那次测试中,他们清楚地看到标题是主要因素。
案例 3——早期决策陷阱。一个时事通讯团队针对 200 人的一组测试了两个主题行,并表示,“它在第一个小时内就获得了 A”。样本量非常小;差异在统计上不显着(即可能是由于偶然)。当测试增加到足够的采样和时间时,结果却相反。教训:没有足够的数据就不要做出决定。
注意:在小样本(少数人)中看到的差异可能会产生误导。统计显着性是指差异真实存在且并非偶然的概率。在得出结论之前,请确保覆盖了足够多的人,并且测试持续了足够长的时间。
可复制模板
模板 1 — 孤立变量生成器:
生成 A/B 测试的变体。要测试的唯一变量:[标题/CTA/图像]。其他一切都将保持不变。假设: [...]。上下文:[...].变体 A:[当前方法]。变体 B:[替代方法]。让两个变体具有相似的长度;不要改变任何其他东西。
模板 2 — 假设澄清:
根据以下观察构建可检验的假设:“[观察]”。以“如果我们进行[更改],[指标]会增加,因为[原因]”的格式写下假设。然后告诉我应该隔离哪个单一变量。
模板 3 — 主题行测试集:
为以下电子邮件创建 2 个主题行以进行 A/B 测试。单轴差异:[好奇心与清晰/简洁等长/问题等表达]。两者都不应包含“垃圾邮件”一词,并且长度应相似。电子邮件摘要:[...]
模板 4 — 解释结果:
解释 A/B 测试的结果。变量:[...]。变体 A 指标:[...]。变体 B 指标:[...]。样本大小:[...]。持续时间:[...]。告诉我:差异是否显着,或者样本很小?我们学到了什么?您对下一次测试有何建议?不要声称精确的统计数据;如果不清楚,请具体说明。
提示:仅从测试中获得“获胜者”是不够的;真正的收获是洞察“它为何获胜”。这种洞察力会融入到下一次测试的假设中,并随着时间的推移建立一个学习体系。
优先级:首先测试什么?
您可以测试无数的项目,但您的时间和流量是有限的。因此,根据影响潜力确定测试的优先顺序。一般规则:首先测试用户首先看到且对决策影响最大的元素。在着陆页上,标题对点击次数的影响最大;因为用户首先阅读它并决定是否继续。按钮颜色等细节通常影响较小;把它们留到最后。
确定优先级的一种实用方法是在三个轴上对每个测试想法进行评分:预期影响(如果获胜会产生多大的差异?)、置信度(我们对它获胜的信心有多大?)和易用性(设置速度有多快?)。具有高影响力、高置信度和低工作量的测试被放在首位。这使您可以将有限的流量分配给带来最多学习效果的实验。人工智能可以为您提供一个快速蓝图,用于沿着这三个轴对一系列想法进行评分和优先级排序;你决定。
模板 5 — 测试优先级:
优先考虑以下 A/B 测试想法。在影响(1-5)、可靠性(1-5)和易于安装(1-5)三个维度上对每一项进行评分,根据总分对它们进行排名,并用一句话解释为什么按这个顺序排列。测试想法:[列表]
常见错误
- 所以同时也是可变的。结果变得无法解释。
- 无假设检验。 “让我们尝试一下看看”不会产生学习。
- 早决定。在小样本中,这种差异被认为是偶然存在的。
- 不同长度的变体。第二个变量是无意创建的。
- 只拿获胜者。如果不了解原因,信息就不会积累。
综上所述
- A/B 测试的黄金法则:一次一个变量。
- 每个测试都应该从一个假设开始:我期望什么以及为什么?
- 定义一个明确的成功衡量标准和足够的样本。
- 小样本的差异具有误导性;注意统计显着性。
- 找出原因,而不是胜利者;这种见解将融入到下一个测试中。
应用任务
选择对您的内容之一的观察。使用模板 2,将其转化为明确的假设并确定要隔离的变量。使用模板 1 生成两个变体(长度相似,仅不同)。最后,拟合假设的结果数字,使用模板 4 对其进行解释,并注意模型对样本充分性的说明。持续时间:约 25 分钟。
清单
- [ ] 我以一个明确的假设开始测试。
- [ ] 我只分离出一个变量。
- [ ] 变体在其他轴(长度等)方面保持相似。
- [ ] 我定义了一个明确的成功指标。
- [ ] 没有足够的样本/时间我没有决定。
- [ ] 我记下下一次测试获胜的原因。