Enhet 9 / 11

A/B-testing og eksperimentell design: Variantkonstruksjon og betydning

Gevinster:

  • Evne til å forstå begrepene A/B-testing, kontroll/variant, konverteringsrate og statistisk signifikans og etablere hypoteser og teste design med kunstig intelligens.
  • Evne til å isolere den enkelte variabelen som skal testes og produsere variant tekst/bilde og måleplan med støtte for kunstig intelligens
  • Evne til å skille at kunstig intelligenss testtolkning begrenses av utvalgsstørrelse og signifikans og risikoen for å lese for tidlige/feilaktige resultater

Den farligste setningen i reklame er "Jeg tror dette er bedre." Data, ikke mening, forteller deg om en overskrift, et bilde eller en knapp virkelig er bedre. Den vanligste måten å måle dette på er A/B-testing: vise to (eller flere) versjoner av samme annonse til ekte brukere og sammenligne hvilken som fungerer best. "A" er vanligvis gjeldende versjon (kontroll), mens "B" er den nye versjonen som prøves (variant). Du kan for eksempel bare endre tittelen i samme annonse og måle hvilken tittel som klikkes mest på. Kunstig intelligens er nyttig i denne prosessen både for å generere et stort antall varianter og for å tolke resultatet; Men den vitenskapelige gyldigheten av testen avhenger av designregler og tålmodighet.

Den gylne regelen for A/B-testing: én variabel

Den mest grunnleggende regelen for A/B-testing er å isolere en enkelt variabel. Hvis du endrer tittelen, bildet og knappen samtidig og versjon B vinner, vil du aldri vite hva som vant. Så i en test skal bare ett element endres, resten skal forbli konstant. Hvis du ønsker å teste mer enn ett element samtidig og systematisk, kalles dette multivariat testing og krever et mye større utvalg; Univariat A/B-testing er måten å starte på.

Det andre grunnleggende konseptet er statistisk signifikans. La oss si at versjon A fikk 3 prosent klikk og versjon B fikk 3,3 prosent klikk. Er denne forskjellen en reell fordel eller et lykketreff? Hvis du bare viste testen til 100 personer, kan denne forskjellen være tilfeldig. Statistisk signifikans betyr at det er tilstrekkelig usannsynlig at den observerte forskjellen skyldes tilfeldigheter (dvs. at forskjellen sannsynligvis er reell). Dette krever en tilstrekkelig utvalgsstørrelse (antall personer som ser testen). Å erklære en "vinner" med lite data er den vanligste og dyreste feilen.

Tips: Før du starter testen, svar på spørsmålet "når vil jeg erklære vinneren": hvor mange personer/etterkonvertering, på hvilket betydningsnivå. Å ta denne avgjørelsen på forhånd forhindrer at du blir fanget av støyen de første timene og tar en for tidlig avgjørelse.

Følgende tabell sammenligner god og dårlig A/B-testdesign:

element

dårlig design

god design

Antall variabler

Tittel + bilde + knapp sammen

bare tittel

hypotese

(ingen) "la oss se hva som skjer"

«Titler med spørsmål øker antallet klikk»

prøve

80 personer

Forhåndsberegnet beslutningsdyktighet

beslutningstidspunkt

2 timer senere

Når du når betydning

Vinnervalg

"Jeg synes B er hyggelig"

Basert på data og betydning

Trinn for trinn: sette opp en A/B-test

Trinn 1 — Skriv en hypotese. Hva tester du og hvorfor? En klar hypotese som «En overskrift med fordeler får flere klikk enn en overskrift med funksjoner».

Trinn 2 — Velg enkelt variabel. Bare tittelen, eller bare bildet, eller bare CTA.

Trinn 3 — Generer varianter. Lag forskjellige versjoner av det samme elementet med AI; hold resten konstant.

Trinn 4 — Sett opp en måleplan. Hvilken beregning vil avgjøre vinneren (klikkfrekvens, konvertering), hvor mye prøve som trengs, hvor lenge den skal kjøres.

Trinn 5 — Tolk og bekreft resultatet. Er det samlet inn nok data, er forskjellen signifikant? Hvis det ikke er signifikant, er "ingen forskjell" også et gyldig resultat.

tre minisaker

Tilfelle 1 — Klarhet av en enkelt variabel. Et e-handelsmerke testet bare CTA i produktannonsen sin: «Kjøp» og «Legg i handlekurv». Alt annet var det samme. Etter nok sampling ga «Legg i handlekurv» betydelig høyere konverteringer. Forskjellen kunne tolkes klart fordi en enkelt variabel ble isolert. AI produserte to CTAer, data valgte vinneren.

Sak 2 — Tidlig beslutningsfelle. Et merke stoppet testen fordi versjon B var foran i de første 3 timene av A/B-testen og åpnet B for hele budsjettet. Når vi ser på de totale dataene dagen etter, var A faktisk litt bedre; Forskjellen i de første timene var tilfeldig. Budsjettet var bortkastet. Feil: å ta en for tidlig beslutning med utilstrekkelig utvalgsstørrelse.

Sak 3 - "Ingen forskjell" er også konklusjonen. Et merke testet to forskjellige bilder, og etter nok sampling ga de begge nesten samme resultat. Mens teamet var i ferd med å beklage at "testen mislyktes", var den korrekte lesningen at bildet ikke er den avgjørende faktoren i denne kampanjen, så innsatsen bør rettes mot overskriften og tilbudet. At det ikke ble funnet noen signifikant forskjell er også verdifull informasjon.

Fire kopierbare maler

1) Hypotese og testdesign:

Hva jeg vil teste: [f.eks. annonsetittel].Oppgave: (1) Skriv en enkelt testbar hypotese (i formen "... øker ... øker").(2) List opp enkeltvariabelen som skal isoleres og de som skal holdes konstant.(3) Foreslå beregningen som vil avgjøre vinneren (klikkfrekvens/konvertering).(4) Skriv hva jeg trenger å være oppmerksom på for å validere varighetstesten, tidlig avgjørelse,).

2) Variantgenerator (enkeltvariant):

Klistret annonse: bilde [samme], CTA [samme], mål [samme]. Variabel testet: HEADLINE. Hovedmelding: "[melding]". Oppgave: Generer 4 forskjellige overskriftsvarianter med samme budskap. Hver bruker en annen tilnærming (spørsmål, fordel, antall, haster). Bare overskriften endres; Legger til en udokumentert påstand.

3) Måleplan:

Test: [Definisjon av A og B]. Beregning: [klikk/konvertering].Oppgave: Lag en måleplan:(1) hvilken metrikk som er primær, hvilke er sekundære,(2) hvor mye data/tid som trengs for å erklære vinneren (forklar logikken),(3) hvordan man deler trafikken jevnt og rettferdig mellom A og B,(4) hvilke eksterne faktorer som kan forvrenge resultatet (sesongen, den eksakte ukedagen jeg skal bruke).

4) Resultattolk (forsiktig):

Mine A/B-testresultater (reelle data): [A: visninger/klikk/konvertering],[B: visninger/klikk/konvertering]. Oppgave: (1) Beregn og vis frekvensene for hver versjon.(2) Kommenter størrelsen på forskjellen, men hvis prøven ikke er tilstrekkelig, si "utilstrekkelig data for et meningsfylt resultat."(3) Remind the risks of claim premature. betydning; Jeg vil bekrefte med et eget kontoverktøy.

Svak forespørsel / Sterk forespørsel

Svak melding:

Lag A- og B-versjon for annonsen min, fortell meg hvilken som er best.

Variabelen er ikke isolert, det er ingen hypotese og måling; AI kan ikke vite hvilken som er "bra" uten data, den utgjør det.

Kraftig ledetekst:

Jeg setter opp A/B-testing. Rettet: bilde og CTA forblir de samme. Bare variabel testet: annonseoverskrift.Hypotese: "Overskrift med tall får flere klikk enn generell overskrift." Hovedbudskap: "Leveres på 3 dager."Oppgave: (1) Produser 1 generell overskrift for kontroll, 3 overskrifter med tall for variant.(2) Fortell meg på hvilken metrikk jeg skal måle på vinneren. kan ugyldiggjøre testen. Ikke forutsi hvilken som vil vinne; Dataene vil avgjøre det.

Den andre påstanden isolerer en enkelt variabel, involverer hypotese og måling; overlater vinneren til dataene.

Vanlige feil

  • Endre mange elementer samtidig. Årsaken til vinneren blir uklar; En enkelt variabel må isoleres.
  • Ta beslutninger med utilstrekkelige prøver. Forskjellen i de første timene er ofte tilfeldig.
  • Testing uten hypoteser. "La oss se hva som skjer" testing produserer ikke læring; Skriv først ned hva du forventer.
  • Å misforstå resultatet "Ingen forskjell" som en fiasko. Mangelen på en betydelig forskjell er også informativ.
  • Å velge vinneren basert på smak. Testing er nettopp for å utelukke personlig smak; Følg dataene.
  • Å glemme eksterne faktorer. Sesong, kampanjedag, nyhetsflyt kan forvrenge resultatet; Hold testforholdene rettferdige.
Oppmerksomhet: Hensikten med A/B-testing er ikke å "vinne", men å lære. Selv en variant å miste er verdifull informasjon; Det virkelige tapet er å stole på feil resultat med utilstrekkelig data og knytte budsjettet til det.

Oppsummert

A/B-testing er en kraftig metode som flytter annonsebeslutninger fra idé til data. Den gylne regelen er å isolere en enkelt variabel: bare ett element skal endres i en test, resten skal forbli konstant. Den andre pilaren er tilstrekkelig utvalg og statistisk signifikans; Å erklære en vinner med lite data er den dyreste feilen. AI er nyttig for å generere flere varianter og beregne og tolke odds, men dataene bestemmer vinneren, ikke AI. Selv resultatet "ingen forskjell" er en læring. Hypotesen, metrikken og beslutningsterskelen bør skrives før testen starter.

Søknadsoppgave

Velg en reklame (overskrift, bilde eller CTA). (1) Skriv en enkelt testbar hypotese og isolert variabel med "Hypotese og testdesign". (2) Generer 1 kontroll + 3 varianter med "Variantgenerator"; Bare endre det elementet. (3) Planlegg hvilken beregning du skal se på, hvor lenge og med hvilke data, med "måleplanen". (4) Skriv ned terskelen din for å erklære vinneren (hvor mange konverteringer / hvilken betydning) på forhånd. (5) Vurder hypotetiske resultater med en «resultattolk» og legg merke til hvorfor du ikke vil ta en avgjørelse i et scenario der dataene er utilstrekkelige.

sjekkliste

  • [ ] Jeg isolerte bare én variabel i testen.
  • [ ] Jeg skrev en klar hypotese før testen.
  • [ ] Jeg har allerede bestemt prøven og tiden som kreves for vinneren.
  • [ ] Jeg valgte vinneren basert på data, ikke personlig smak.
  • [ ] Jeg betraktet «ingen forskjell»-resultatet som gyldig læring.
  • [ ] Jeg sjekket for eksterne faktorer som kunne forvrenge resultatet.