Enhed 9 / 11

A/B-testning og eksperimentelt design: Variantkonstruktion og betydning

Gevinster:

  • Evne til at forstå begreberne A/B-test, kontrol/variant, konverteringsrate og statistisk signifikans og etablere hypoteser og testdesigns med kunstig intelligens.
  • Evne til at isolere den enkelte variabel, der skal testes og producere variant tekst/billede og måleplan med støtte til kunstig intelligens
  • Evne til at skelne, at kunstig intelligenss testfortolkning er begrænset af stikprøvestørrelse og signifikans og risikoen for at læse for tidlige/forkerte resultater

Den farligste sætning i reklamer er "Jeg tror, ​​det her er bedre." Data, ikke mening, fortæller dig, om en overskrift, et billede eller en knap virkelig er bedre. Den mest almindelige måde at måle dette på er A/B-test: at vise to (eller flere) versioner af den samme annonce til rigtige brugere og sammenligne hvilken der fungerer bedst. "A" er normalt den nuværende version (kontrol), mens "B" er den nye version, der prøves (variant). Du kan for eksempel kun ændre titlen i den samme annonce og måle, hvilken titel der klikkes mest på. Kunstig intelligens er nyttig i denne proces både til at generere et stort antal varianter og til at fortolke resultatet; Men testens videnskabelige validitet afhænger af designregler og tålmodighed.

Den gyldne regel for A/B-test: én variabel

Den mest grundlæggende regel for A/B-test er at isolere en enkelt variabel. Hvis du ændrer titlen, billedet og knappen på samme tid, og version B vinder, ved du aldrig, hvad der vandt. Så i en test skal kun ét element ændre sig, resten skal forblive konstant. Hvis du ønsker at teste mere end et emne samtidigt og systematisk, kaldes dette multivariat test og kræver en meget større stikprøve; Univariat A/B-test er måden at starte på.

Det andet grundbegreb er statistisk signifikans. Lad os sige, at version A fik 3 procent klik, og version B fik 3,3 procent klik. Er denne forskel en reel fordel eller et lykketræf? Hvis du kun viste testen til 100 personer, kunne denne forskel være tilfældig. Statistisk signifikans betyder, at den observerede forskel er tilstrækkelig usandsynlig til at skyldes tilfældigheder (dvs. forskellen er sandsynligvis reel). Dette kræver en tilstrækkelig stikprøvestørrelse (antal personer, der ser testen). At erklære en "vinder" med få data er den mest almindelige og dyre fejl.

Tip: Inden du starter testen, besvar spørgsmålet "hvornår vil jeg erklære vinderen": hvor mange personer/efter-konvertering, på hvilket signifikansniveau. At træffe denne beslutning på forhånd forhindrer dig i at blive fanget af støjen i de første timer og træffe en for tidlig beslutning.

Følgende tabel sammenligner godt og dårligt A/B-testdesign:

vare

dårligt design

godt design

Antal variable

Titel + billede + knap sammen

kun titel

hypotese

(ingen) "lad os se hvad der sker"

"Titler med spørgsmål øger antallet af klik"

prøve

80 personer

Forudberegnet beslutningsdygtighed

beslutningstidspunkt

2 timer senere

Når du når betydning

Vinder udvælgelse

"Jeg synes B er dejlig"

Baseret på data og betydning

Trin for trin: opsætning af en A/B-test

Trin 1 — Skriv en hypotese. Hvad tester du og hvorfor? En klar hypotese som "En overskrift med fordele får flere klik end en overskrift med funktioner."

Trin 2 — Vælg enkelt variabel. Bare titlen, eller bare billedet, eller bare CTA.

Trin 3 — Generer varianter. Opret forskellige versioner af det samme emne med AI; holde resten konstant.

Trin 4 — Opret en måleplan. Hvilken metric vil afgøre vinderen (klikfrekvens, konvertering), hvor meget stikprøve er nødvendigt, hvor længe den skal køre.

Trin 5 — Fortolk og bekræft resultatet. Er der indsamlet nok data, er forskellen signifikant? Hvis det ikke er signifikant, er "ingen forskel" også et gyldigt resultat.

tre minisager

Tilfælde 1 — Klarhed af en enkelt variabel. Et e-handelsmærke testede kun CTA i sin produktannonce: "Køb" og "Læg ​​i kurv". Alt andet var det samme. Efter nok prøveudtagning gav "Læg ​​i kurv" betydeligt højere konverteringer. Forskellen kunne fortolkes klart, fordi en enkelt variabel var isoleret. AI producerede to CTA'er, data valgte vinderen.

Sag 2 — Tidlig beslutningsfælde. Et mærke stoppede testen, fordi version B var foran i de første 3 timer af A/B-testen og åbnede B for hele budgettet. Ser man på de samlede data den næste dag, var A faktisk lidt bedre; Forskellen i de første timer var tilfældig. Budgettet var spildt. Fejl: at træffe en for tidlig beslutning med utilstrækkelig stikprøvestørrelse.

Case 3 - "Ingen forskel" er også konklusionen. Et mærke testede to forskellige billeder, og efter nok prøveudtagning producerede de begge næsten det samme resultat. Mens holdet var ved at beklage, at "testen mislykkedes", var den korrekte læsning, at billedet ikke er den afgørende faktor i denne kampagne, så indsatsen bør rettes mod overskriften og tilbuddet. Det faktum, at der ikke blev fundet nogen signifikant forskel, er også værdifuld information.

Fire kopierbare skabeloner

1) Hypotese og testdesign:

Hvad jeg vil teste: [f.eks. annoncetitel].Opgave: (1) Skriv en enkelt testbar hypotese (i formen "... stiger ... stiger").(2) Angiv den enkelte variabel, der skal isoleres, og dem, der skal holdes konstant.(3) Foreslå den metrik, der bestemmer vinderen (klikfrekvens/konvertering).(4) Skriv, hvad jeg skal være opmærksom på for at validere testens varighed (eksempel,).

2) Variantgenerator (enkeltvariant):

Sticky annonce: billede [samme], CTA [samme], mål [samme]. Variabel testet: HEADLINE. Hovedmeddelelse: "[besked]". Opgave: Generer 4 forskellige overskriftsvarianter med samme budskab. Hver bruger en anden tilgang (spørgsmål, fordel, antal, haster). Kun overskriften ændres; Tilføjelse af en udokumenteret påstand.

3) Måleplan:

Test: [Definition af A og B]. Metrik: [klik/konvertering].Opgave: Udarbejd en måleplan:(1) hvilken metrik er primær, hvilke er sekundære,(2) hvor meget data/tid er nødvendig for at erklære vinderen (forklar logikken),(3) hvordan man deler trafikken jævnt og retfærdigt mellem A og B,(4) hvilke eksterne faktorer kan forvrænge resultatet (sæson, den nøjagtige ugedag, som statistikken vil bruge).

4) Resultattolk (forsigtig):

Mine A/B-testresultater (rigtige data): [A: visninger/klik/konvertering],[B: visninger/klik/konvertering]. Opgave: (1) Beregn og vis satserne for hver version.(2) Kommenter størrelsen af forskellen, men hvis prøven ikke er tilstrækkelig, sig "utilstrækkelig data til et meningsfuldt resultat."(3) Remind the risks of claim premature. betydning; Jeg vil bekræfte med et separat kontoværktøj.

Svag prompt / Stærk prompt

Svag prompt:

Fremstil A- og B-version til min annonce, fortæl mig hvilken der er bedst.

Variablen er ikke isoleret, der er ingen hypotese og måling; AI kan ikke vide, hvilken der er "god" uden data, det gør det op.

Kraftig prompt:

Jeg er ved at opsætte A/B-test. Rettet: billede og CTA forbliver de samme. Kun variabel testet: annonceoverskrift.Hypotese: "Overskrift med tal får flere klik end generel overskrift." Hovedbudskab: "Leveret om 3 dage." Opgave: (1) Lav 1 generel overskrift til kontrol, 3 overskrifter med tal for variant.(2) Fortæl mig, hvilken metric jeg skal se på, hvilken metric jeg skal se på, hvilken metric jeg skal huske på. kan gøre testen ugyldig. Forudsige ikke, hvilken der vinder; Dataene vil afgøre det.

Den anden påstand isolerer en enkelt variabel, involverer hypotese og måling; overlader vinderen til dataene.

Almindelige fejl

  • Ændring af mange elementer på én gang. Årsagen til vinderen bliver uklar; En enkelt variabel skal isoleres.
  • At træffe beslutninger med utilstrækkelige prøver. Forskellen i de første timer er ofte tilfældig.
  • Test uden hypoteser. "Lad os se, hvad der sker" test giver ikke læring; Skriv først ned, hvad du forventer.
  • At forveksle resultatet "Ingen forskel" som en fiasko. Manglen på en væsentlig forskel er også informativ.
  • Udvælgelse af vinderen efter smag. Test er netop for at udelukke personlig smag; Følg dataene.
  • At glemme ydre faktorer. Sæson, kampagnedag, nyhedsflow kan forvrænge resultatet; Hold testbetingelser rimelige.
OBS: Formålet med A/B-test er ikke at "vinde", men at lære. Selv en variant af tab er værdifuld information; Det reelle tab er at stole på det forkerte resultat med utilstrækkelige data og binde budgettet til det.

Sammenfattende

A/B-test er en kraftfuld metode, der flytter reklamebeslutninger fra idé til data. Den gyldne regel er at isolere en enkelt variabel: kun ét element skal ændres i en test, resten skal forblive konstant. Den anden søjle er tilstrækkelig stikprøveudtagning og statistisk signifikans; At erklære en vinder med få data er den dyreste fejl. AI er nyttig til at generere flere varianter og beregne og fortolke odds, men dataene bestemmer vinderen, ikke AI'en. Selv resultatet "ingen forskel" er en læring. Hypotesen, metrikken og beslutningstærsklen skal skrives, før testen begynder.

Ansøgningsopgave

Vælg en annonce (overskrift, billede eller CTA). (1) Skriv en enkelt testbar hypotese og isoleret variabel med "Hypotese og testdesign". (2) Generer 1 kontrol + 3 varianter med "Variantgenerator"; Skift bare det element. (3) Planlæg hvilken metrik du vil se på, hvor længe og med hvilke data, med "måleplanen". (4) Skriv din tærskel ned for at erklære vinderen (hvor mange konverteringer / hvilken betydning) på forhånd. (5) Overvej hypotetiske resultater med en "resultatfortolker" og bemærk, hvorfor du ikke ville træffe en beslutning i et scenarie, hvor data er utilstrækkelige.

tjekliste

  • [ ] Jeg isolerede kun én variabel i testen.
  • [ ] Jeg skrev en klar hypotese før testen.
  • [ ] Jeg har allerede bestemt prøven og den tid, der kræves for vinderen.
  • [ ] Jeg valgte vinderen baseret på data, ikke personlig smag.
  • [ ] Jeg betragtede resultatet "ingen forskel" som gyldig læring.
  • [ ] Jeg tjekkede for eksterne faktorer, der kunne forvrænge resultatet.