Einheit 9 / 11

A/B-Tests und experimentelles Design: Variantenkonstruktion und Bedeutung

Gewinne:

  • Fähigkeit, die Konzepte von A/B-Tests, Kontrolle/Variante, Konversionsrate und statistischer Signifikanz zu verstehen und Hypothesen und Testdesigns mit künstlicher Intelligenz aufzustellen.
  • Möglichkeit, die einzelne zu testende Variable zu isolieren und mit Unterstützung künstlicher Intelligenz Varianten von Text/Bild und Messplan zu erstellen
  • Fähigkeit zu erkennen, dass die Testinterpretation durch künstliche Intelligenz durch die Stichprobengröße und -signifikanz sowie das Risiko vorzeitiger/falscher Ergebnisse begrenzt ist

Der gefährlichste Satz in der Werbung ist: „Das finde ich besser.“ Daten, nicht Meinungen, sagen Ihnen, ob eine Überschrift, ein Bild oder eine Schaltfläche wirklich besser ist. Die gebräuchlichste Methode, dies zu messen, ist A/B-Tests: Dabei werden zwei (oder mehr) Versionen derselben Anzeige echten Nutzern gezeigt und verglichen, welche davon besser funktioniert. „A“ ist normalerweise die aktuelle Version (Kontrolle), während „B“ die neue Version ist, die gerade ausprobiert wird (Variante). Sie können beispielsweise nur den Titel in derselben Anzeige ändern und messen, welcher Titel häufiger angeklickt wird. Künstliche Intelligenz ist dabei sowohl bei der Generierung einer großen Variantenvielfalt als auch bei der Interpretation des Ergebnisses hilfreich; Die wissenschaftliche Gültigkeit des Tests hängt jedoch von Designregeln und Geduld ab.

Die goldene Regel des A/B-Tests: eine Variable

Die grundlegendste Regel des A/B-Tests besteht darin, eine einzelne Variable zu isolieren. Wenn Sie gleichzeitig Titel, Bild und Schaltfläche ändern und Version B gewinnt, wissen Sie nie, was gewonnen hat. In einem Test sollte sich also nur ein Element ändern, der Rest sollte konstant bleiben. Wenn Sie mehr als einen Gegenstand gleichzeitig und systematisch testen möchten, spricht man von multivariaten Tests und erfordert eine viel größere Stichprobe; Univariate A/B-Tests sind der Anfang.

Das zweite Grundkonzept ist die statistische Signifikanz. Nehmen wir an, Version A hat 3 Prozent Klicks und Version B 3,3 Prozent Klicks. Ist dieser Unterschied ein echter Vorteil oder ein Zufall? Wenn Sie den Test nur 100 Personen zeigen würden, könnte dieser Unterschied zufällig sein. Statistische Signifikanz bedeutet, dass es hinreichend unwahrscheinlich ist, dass der beobachtete Unterschied auf Zufall beruht (d. h. der Unterschied ist wahrscheinlich real). Voraussetzung dafür ist eine ausreichende Stichprobengröße (Anzahl der Personen, die den Test sehen). Der häufigste und teuerste Fehler besteht darin, einen „Gewinner“ mit wenigen Daten zu erklären.

Tipp: Beantworten Sie vor Beginn des Tests die Frage „Wann werde ich den Gewinner bekannt geben?“: Wie viele Personen/Post-Conversion, auf welchem ​​Signifikanzniveau. Wenn Sie diese Entscheidung im Voraus treffen, verhindern Sie, dass Sie in den ersten Stunden in den Trubel geraten und eine voreilige Entscheidung treffen.

In der folgenden Tabelle werden gute und schlechte A/B-Testdesigns verglichen:

Artikel

schlechtes Design

good design

Number of variables

Titel + Bild + Schaltfläche zusammen

Nur Titel

Hypothese

(keine) „Mal sehen, was passiert“

„Titel mit Fragen erhöhen die Klicks“

Probe

80 people

Vorausberechnetes Quorum

decision time

2 hours later

Wenn Sie Bedeutung erreichen

Gewinnerauswahl

„Ich finde B schön“

Basierend auf Daten und Bedeutung

Schritt für Schritt: Einrichten eines A/B-Tests

Schritt 1 – Schreiben Sie eine Hypothese. Was testen Sie und warum? Eine klare Hypothese wie „Eine Überschrift mit Vorteilen erhält mehr Klicks als eine Überschrift mit Funktionen.“

Schritt 2 – Wählen Sie eine einzelne Variable aus. Nur der Titel oder nur das Bild oder nur der CTA.

Schritt 3 – Varianten generieren. Erstellen Sie mit KI verschiedene Versionen desselben Artikels. keep the rest constant.

Schritt 4 – Erstellen Sie einen Messplan. Welche Metrik bestimmt den Gewinner (Klickrate, Conversion), wie viele Stichproben werden benötigt und wie lange soll sie ausgeführt werden.

Schritt 5 – Interpretieren und überprüfen Sie das Ergebnis. Wurden genügend Daten gesammelt, ist der Unterschied signifikant? Wenn es nicht signifikant ist, ist auch „kein Unterschied“ ein gültiges Ergebnis.

drei Mini-Koffer

Fall 1 – Klarheit einer einzelnen Variablen. Eine E-Commerce-Marke testete in ihrer Produktanzeige nur den CTA: „Kaufen“ und „In den Warenkorb“. Alles andere war gleich. Nach ausreichender Auswahl brachte „In den Warenkorb“ deutlich höhere Conversions. Der Unterschied konnte eindeutig interpretiert werden, da eine einzelne Variable isoliert wurde. Die KI hat zwei CTAs erstellt, die Daten haben den Gewinner ermittelt.

Fall 2 – Frühe Entscheidungsfalle. Eine Marke brach den Test ab, weil Version B in den ersten 3 Stunden des A/B-Tests die Nase vorn hatte und öffnete B für das gesamte Budget. Betrachtet man die Gesamtdaten am nächsten Tag, war A tatsächlich etwas besser; Der Unterschied in den ersten Stunden war zufällig. The budget was wasted. Fehler: Eine voreilige Entscheidung aufgrund unzureichender Stichprobengröße treffen.

Fall 3 – „Kein Unterschied“ ist auch die Schlussfolgerung. Eine Marke hat zwei verschiedene Bilder getestet und nach ausreichender Auswahl ergaben beide fast das gleiche Ergebnis. Während das Team kurz davor war, zu beklagen, dass der „Test fehlgeschlagen“ sei, war die korrekte Lesart, dass das Bild in dieser Kampagne nicht der entscheidende Faktor ist, sodass die Bemühungen auf die Überschrift und das Angebot gerichtet werden sollten. Auch die Tatsache, dass kein signifikanter Unterschied festgestellt wurde, ist eine wertvolle Information.

Vier kopierbare Vorlagen

1) Hypothese und Testdesign:

Was ich testen möchte: [zB. Anzeigentitel].Aufgabe: (1) Schreiben Sie eine einzelne überprüfbare Hypothese (in der Form „... erhöht ... erhöht“). (2) Listen Sie die einzelne Variable auf, die isoliert werden soll, und diejenigen, die konstant gehalten werden sollen. (3) Schlagen Sie die Metrik vor, die den Gewinner bestimmt (Klickrate/Conversion). (4) Schreiben Sie, worauf ich achten muss, um den Test zu validieren (Stichprobe, Dauer, Risiko einer frühen Entscheidung).

2) Variantengenerator (Einzelvariante):

Sticky Ad: Bild [gleich], CTA [gleich], Ziel [gleich]. Getestete Variable: HEADLINE. Hauptnachricht: „[Nachricht]“. Aufgabe: Generieren Sie 4 verschiedene Überschriftenvarianten mit derselben Botschaft. Jeder verwendet einen anderen Ansatz (Frage, Nutzen, Anzahl, Dringlichkeit). Lediglich die Überschrift ändert sich; Adding an unsubstantiated claim.

3) Measurement plan:

Test: [Definition of A and B]. Metrik: [Klick/Conversion].Aufgabe: Erstellen Sie einen Messplan: (1) Welche Metrik ist primär, welche ist sekundär, (2) wie viele Daten/Zeit sind erforderlich, um den Gewinner zu ermitteln (die Logik erklären), (3) wie kann der Traffic gleichmäßig und fair zwischen A und B aufgeteilt werden, (4) welche externen Faktoren können das Ergebnis verzerren (Jahreszeit, Wochentag). Angenommen, ich werde ein Signifikanztool verwenden, um genaue Statistiken zu berechnen.

4) Ergebnisinterpreter (Vorsicht):

Meine A/B-Testergebnisse (echte Daten): [A: Impressionen/Klicks/Conversion],[B: Impressionen/Klicks/Conversion].Aufgabe: (1) Berechnen Sie die Raten jeder Version und zeigen Sie sie an.(2) Kommentieren Sie das Ausmaß des Unterschieds, aber wenn die Stichprobe nicht ausreicht, sagen Sie „unzureichende Daten für ein aussagekräftiges Ergebnis.“(3) Erinnern Sie an die Risiken vorzeitiger/falscher Interpretationen. Machen Sie keinen definitiven Anspruch auf Signifikanz; I will confirm with a separate account tool.

Schwache Eingabeaufforderung / Starke Eingabeaufforderung

Schwache Eingabeaufforderung:

Erstellen Sie eine A- und eine B-Version für meine Anzeige und sagen Sie mir, welche besser ist.

Die Variable ist nicht isoliert, es gibt keine Hypothese und Messung; Ohne Daten kann die KI nicht wissen, welches „gut“ ist, sie erfindet es.

Kraftvolle Aufforderung:

I'm setting up A/B testing. Behoben: Bild und CTA bleiben gleich. Nur getestete Variable: Anzeigenüberschrift. Hypothese: „Überschrift mit Zahlen erhält mehr Klicks als allgemeine Überschrift.“ Hauptbotschaft: „Lieferung in 3 Tagen.“ Aufgabe: (1) Erstellen Sie eine allgemeine Überschrift zur Kontrolle, 3 Überschriften mit Zahlen für die Variante. (2) Sagen Sie mir, auf welche Metrik ich achten sollte, um den Gewinner zu messen. (3) Erinnern Sie mich an drei Fehler, die den Test ungültig machen könnten. Sagen Sie nicht voraus, welcher win; The data will determine it.

Die zweite Behauptung isoliert eine einzelne Variable, beinhaltet Hypothese und Messung; leaves the winner to the data.

Häufige Fehler

  • Changing many items at once. The reason for the winner becomes unclear; A single variable must be isolated.
  • Entscheidungen mit unzureichenden Stichproben treffen. Der Unterschied in den ersten Stunden ist oft zufällig.
  • Testen ohne Hypothesen. „Mal sehen, was passiert“-Testen führt nicht zum Lernen; First write down what you expect.
  • Das Ergebnis „Kein Unterschied“ wird als Misserfolg verwechselt. Aufschlussreich ist auch das Fehlen eines signifikanten Unterschieds.
  • Choosing the winner based on taste. Beim Testen geht es gerade darum, den persönlichen Geschmack auszuschließen; Follow the data.
  • Äußere Faktoren vergessen. Jahreszeit, Wahlkampftag und Nachrichtenfluss können das Ergebnis verzerren; Halten Sie die Testbedingungen fair.
Achtung: Der Zweck von A/B-Tests besteht nicht darin, zu „gewinnen“, sondern zu lernen. Sogar eine Variante, die verloren geht, ist eine wertvolle Information; Der eigentliche Verlust besteht darin, sich auf das falsche Ergebnis mit unzureichenden Daten zu verlassen und das Budget daran zu binden.

Zusammenfassend

A/B-Tests sind eine leistungsstarke Methode, die Werbeentscheidungen von der Idee in die Daten umwandelt. Die goldene Regel besteht darin, eine einzelne Variable zu isolieren: In einem Test sollte sich nur ein Element ändern, der Rest sollte konstant bleiben. Die zweite Säule ist eine angemessene Stichprobe und statistische Signifikanz; Der teuerste Fehler ist es, mit wenigen Daten einen Gewinner zu ermitteln. KI ist hilfreich bei der Generierung mehrerer Varianten sowie bei der Berechnung und Interpretation von Quoten, aber die Daten bestimmen den Gewinner, nicht die KI. Selbst das Ergebnis „kein Unterschied“ ist eine Erkenntnis. Die Hypothese, die Metrik und die Entscheidungsschwelle sollten vor Beginn des Tests geschrieben werden.

Anwendungsaufgabe

Wählen Sie ein Motiv (Überschrift, Bild oder CTA). (1) Schreiben Sie eine einzelne testbare Hypothese und isolierte Variable mit „Hypothese und Testdesign“. (2) 1 Steuerung + 3 Varianten mit „Variantengenerator“ generieren; Ändern Sie einfach dieses Element. (3) Planen Sie mit dem „Messplan“, welche Metrik Sie wie lange und mit welchen Daten betrachten werden. (4) Notieren Sie sich im Voraus Ihren Schwellenwert für die Bekanntgabe des Gewinners (wie viele Conversions / welche Bedeutung). (5) Betrachten Sie hypothetische Ergebnisse mit einem „Ergebnisinterpreter“ und notieren Sie, warum Sie in einem Szenario mit unzureichenden Daten keine Entscheidung treffen würden.

Checkliste

  • [ ] Ich habe im Test nur eine Variable isoliert.
  • [ ] Ich habe vor dem Test eine klare Hypothese geschrieben.
  • [ ] Den Proben- und Zeitaufwand für den Gewinner habe ich bereits ermittelt.
  • [ ] Ich habe den Gewinner aufgrund von Daten ausgewählt, nicht aufgrund meines persönlichen Geschmacks.
  • [ ] Ich betrachtete das Ergebnis „kein Unterschied“ als gültiges Lernen.
  • [ ] Ich habe nach externen Faktoren gesucht, die das Ergebnis verfälschen könnten.