ユニット 9 / 11

A/B テストと実験設計: バリアントの構築と重要性

利益:

  • A/B テスト、コントロール/バリアント、コンバージョン率、統計的有意性の概念を理解し、人工知能を使用して仮説とテスト設計を確立する能力。
  • テスト対象の単一変数を分離し、人工知能のサポートによりさまざまなテキスト/画像と測定計画を作成する機能
  • 人工知能のテスト解釈を区別する能力は、サンプルサイズと重要性、および時期尚早または不正確な結果を読み取るリスクによって制限されます

広告で最も危険な文は「私はこれが良いと思います」です。見出し、画像、ボタンが本当に優れているかどうかは、意見ではなくデータによってわかります。これを測定する最も一般的な方法は A/B テストです。同じ広告の 2 つ (またはそれ以上) のバージョンを実際のユーザーに表示し、どちらがより効果的かを比較します。通常、「A」は現在のバージョン (コントロール) であり、「B」は試行中の新しいバージョン (バリアント) です。たとえば、同じ広告内のタイトルを変更して、どのタイトルがよりクリックされたかを測定することしかできません。人工知能は、多数のバリアントの生成と結果の解釈の両方において、このプロセスに役立ちます。しかし、テストの科学的妥当性は、設計ルールと忍耐力にかかっています。

A/B テストの黄金律: 変数は 1 つ

A/B テストの最も基本的なルールは、単一の変数を分離することです。タイトル、画像、ボタンを同時に変更してバージョン B が勝った場合、どちらが勝ったかわかりません。したがって、テストでは 1 つの要素のみを変更し、残りは一定のままにする必要があります。複数の項目を同時に系統的にテストしたい場合、これは多変量テストと呼ばれ、はるかに大きなサンプルが必要になります。まずは単変量 A/B テストから始めます。

2 番目の基本概念は統計的有意性です。バージョン A のクリック数が 3%、バージョン B のクリック数が 3.3% だったとします。この違いは本当に有利なのでしょうか、それともまぐれでしょうか?テストを 100 人だけに見せた場合、この違いは偶然である可能性があります。統計的有意性は、観察された差が偶然によるものである可能性が十分に低いことを意味します (つまり、差はおそらく本物です)。これには、十分なサンプル サイズ (テストを閲覧する人の数) が必要です。データがほとんどない状態で「勝者」を宣言することは、最も一般的で高くつく間違いです。

ヒント: テストを開始する前に、「いつ勝者を宣言しますか」という質問に答えてください。変換後の人数、有意水準はどれくらいですか。事前にこの決定を行うことで、最初の数時間で雑音に巻き込まれて早まった決定を下すことを防ぐことができます。

次の表は、良い A/B テスト設計と悪い A/B テスト設計を比較しています。

アイテム

悪いデザイン

良いデザイン

変数の数

タイトル + 画像 + ボタンの組み合わせ

タイトルのみ

仮説

(なし) 「何が起こるか見てみましょう」

「質問のあるタイトルはクリック数を増やす」

サンプル

80名

事前計算されたクォーラム

決断の時間

2時間後

意義に達したとき

勝者の選択

「Bさんは素敵だと思います」

データと重要性に基づいて

ステップバイステップ: A/B テストの設定

ステップ 1 — 仮説を書きます。何をテストしていますか?その理由は何ですか? 「メリットのある見出しは、特徴のある見出しよりもクリック数が多い」といった明確な仮説。

ステップ 2 — 単一の変数を選択します。タイトルだけ、画像だけ、または CTA だけ。

ステップ 3 — バリアントを生成します。 AI を使用して同じアイテムの異なるバージョンを作成します。残りを一定に保ちます。

ステップ 4 — 測定計画を設定します。どの指標が勝者 (クリックスルー率、コンバージョン)、必要なサンプルの量、実行時間を決定します。

ステップ 5 — 結果を解釈して検証します。十分なデータが収集されましたが、その違いは重要ですか?有意でない場合は、「差なし」も有効な結果となります。

ミニケース3個

ケース 1 — 単一変数の明確さ。ある e コマース ブランドは、商品広告で「購入」と「カートに追加」という CTA だけをテストしました。他はすべて同じでした。十分なサンプリングの後、「カートに追加」によりコンバージョンが大幅に増加しました。単一の変数が分離されているため、違いは明確に解釈できます。 AI が 2 つの CTA を作成し、データが勝者を選択しました。

ケース 2 — 早期意思決定の罠。あるブランドは、A/B テストの最初の 3 時間でバージョン B が先行していたためにテストを中止し、B を予算全体に開放しました。翌日の合計データを見ると、実際には A の方がわずかに優れていました。最初の数時間の差は偶然でした。予算が無駄になった。間違い: サンプルサイズが不十分なため、時期尚早な決定を下してしまいました。

ケース 3 — 「違いはない」という結論もあります。あるブランドが 2 つの異なる画像をテストしたところ、十分なサンプリングの後、どちらもほぼ同じ結果が得られました。チームは「テストは失敗した」と嘆きそうになりましたが、正しくは、このキャンペーンではイメージが決め手ではないので、見出しとオファーに力を注ぐべきだということでした。有意な差が見つからなかったという事実も貴重な情報です。

コピー可能な 4 つのテンプレート

1) 仮説とテスト設計:

テストしたいこと: [例:タスク: (1) 単一のテスト可能な仮説を作成します (「... 増加 ... 増加」の形式で)。(2) 分離する単一変数と一定に保つ変数をリストします。(3) 勝者を決定する指標を提案します (クリックスルー率/コンバージョン)。(4) テストを検証するために注意する必要があるものを書き込みます (サンプル、期間、早期意思決定リスク)。

2) バリアント ジェネレータ (単一バリアント):

スティッキー広告: 画像 [同じ]、CTA [同じ]、ターゲット [同じ]。テストされた変数: HEADLINE。メインメッセージ: 「[メッセージ]」。タスク: 同じメッセージを持つ 4 つの異なる見出しバリエーションを生成します。それぞれが異なるアプローチ (質問、メリット、数、緊急性) を使用します。見出しが変わるだけです。根拠のない主張を追加する。

3) 測定計画:

テスト: [A と B の定義]。メトリクス: [クリック/コンバージョン]。タスク: 測定計画の草案:(1) どのメトリクスがプライマリで、どれがセカンダリであるか、(2) 勝者を宣言するためにどのくらいのデータ/時間が必要か (ロジックの説明)、(3) A と B の間でトラフィックを均等かつ公平に分割する方法、(4) どのような外部要因が結果を歪める可能性があるか (季節、曜日)。正確な統計を計算するために重要度ツールを使用すると仮定します。

4) 結果インタープリター (注意):

私の A/B テスト結果 (実際のデータ): [A: インプレッション数/クリック数/コンバージョン]、[B: インプレッション数/クリック数/コンバージョン]。タスク: (1) 各バージョンのレートを計算して表示します。(2) 違いの大きさについてコメントしますが、サンプルが十分でない場合は、「有意義な結果を得るにはデータが不十分です」と述べます。(3) 時期尚早/誤読のリスクを思い出させます。重要性について決定的な主張はしません。別途アカウントツールで確認させていただきます。

弱いプロンプト / 強いプロンプト

弱いプロンプト:

私の広告の A バージョンと B バージョンを作成して、どちらが優れているか教えてください。

変数は孤立しておらず、仮説も測定もありません。 AIはデータがなければどれが「良い」かを知ることができず、それを作り上げます。

強力なプロンプト:

A/B テストを設定しています。修正済み: 画像と CTA は同じままです。テストされる変数のみ: 広告見出し。仮説: 「数字の付いた見出しは、一般的な見出しよりもクリック数が多い。」メイン メッセージ: 「3 日以内に配信される。」タスク: (1) コントロール用に一般的な見出しを 1 つ、バリアント用に数字付きの見出しを 3 つ作成します。(2) 勝者を測定するためにどの指標を見るべきかを教えてください。(3) テストを無効にする可能性のある 3 つの間違いを思い出させてください。どれがそうなるかは予測しないでください。勝つ;データがそれを決定します。

2 番目の主張は単一の変数を分離し、仮説と測定を伴います。勝者はデータに委ねられます。

よくある間違い

  • 多くの項目を一度に変更します。勝者の理由は不明瞭になります。単一の変数は分離する必要があります。
  • 不十分なサンプルで意思決定を行う。最初の数時間の違いは、多くの場合偶然です。
  • 仮説を持たないテスト。 「何が起こるか見てみましょう」というテストでは学習は生まれません。まず、あなたが期待していることを書き留めてください。
  • 「差なし」という結果を失敗と勘違いする。有意な差がないことも有益です。
  • 好みに基づいて勝者を選びます。テストはまさに個人の好みを排除するために行われます。データに従ってください。
  • 外的要因を忘れる。季節、キャンペーンの日、ニュースの流れによって結果が歪む可能性があります。テスト条件を公平に保ちます。
注意: A/B テストの目的は「勝つ」ことではなく、学ぶことです。バリアントが負けたとしても貴重な情報です。本当の損失は、不十分なデータによる誤った結果に依存し、それに予算を結びつけてしまうことです。

要約すれば

A/B テストは、広告に関する意思決定をアイデアからデータに移す強力な方法です。黄金律は、単一の変数を分離することです。テストでは 1 つの要素のみを変更し、残りは一定のままにする必要があります。 2 番目の柱は、適切なサンプリングと統計的有意性です。データがほとんどない状態で勝者を宣言することは、最も高価な間違いです。 AI は複数のバリアントを生成し、オッズを計算して解釈するのに役立ちますが、勝者を決定するのは AI ではなくデータです。 「差がない」という結果であっても、それは学びになります。仮説、測定基準、および決定しきい値は、テストを開始する前に作成する必要があります。

アプリケーションタスク

クリエイティブ (見出し、画像、または CTA) を選択します。 (1) 「仮説とテスト設計」で、テスト可能な単一の仮説と孤立変数を記述します。 (2) 「バリアント ジェネレーター」で 1 つのコントロール + 3 つのバリアントを生成します。その要素を変更するだけです。 (3) どの指標を、どのくらいの期間、どのデータで見るかを「測定計画」で計画します。 (4) 勝者を宣言する基準(コンバージョン数 / 重要性)を事前に書き留めてください。 (5) 「結果解釈者」を使用して仮説的な結果を検討し、データが不十分なシナリオで意思決定を行わない理由を書き留めます。

チェックリスト

  • [ ] テストで変数を 1 つだけ分離しました。
  • [ ] 私はテスト前に明確な仮説を書きました。
  • [ ] 当選者に必要なサンプルと所要時間はすでに決定しています。
  • [ ] 個人的な好みではなく、データに基づいて勝者を選びました。
  • [ ] 私は「差がない」という結果を有効な学習であると考えました。
  • [ ] 結果を歪める可能性のある外部要因がないかチェックしました。