Enhet 9 / 11

A/B-testning och experimentell design: Variantkonstruktion och betydelse

Vinster:

  • Förmåga att förstå begreppen A/B-testning, kontroll/variant, omvandlingsfrekvens och statistisk signifikans samt upprätta hypoteser och testdesigner med artificiell intelligens.
  • Förmåga att isolera den enskilda variabeln som ska testas och producera variant text/bild och mätplan med stöd för artificiell intelligens
  • Förmåga att urskilja att artificiell intelligenss testtolkning begränsas av urvalsstorlek och signifikans samt risken att läsa för tidigt/felaktiga resultat

Den farligaste meningen i reklam är "Jag tycker att det här är bättre." Data, inte åsikter, berättar om en rubrik, en bild eller en knapp verkligen är bättre. Det vanligaste sättet att mäta detta är A/B-testning: att visa två (eller flera) versioner av samma annons för riktiga användare och jämföra vilken som fungerar bäst. "A" är vanligtvis den nuvarande versionen (kontroll), medan "B" är den nya versionen som testas (variant). Du kan till exempel bara ändra rubriken i samma annons och mäta vilken titel som klickas mest på. Artificiell intelligens är till hjälp i denna process både för att generera ett stort antal varianter och för att tolka resultatet; Men testets vetenskapliga giltighet beror på designregler och tålamod.

Den gyllene regeln för A/B-testning: en variabel

Den mest grundläggande regeln för A/B-testning är att isolera en enda variabel. Om du ändrar titel, bild och knapp samtidigt och version B vinner, kommer du aldrig att veta vad som vann. Så i ett test bör bara ett element ändras, resten bör förbli konstant. Om du vill testa mer än ett objekt samtidigt och systematiskt kallas detta multivariattestning och kräver ett mycket större urval; Univariat A/B-testning är sättet att börja.

Det andra grundbegreppet är statistisk signifikans. Låt oss säga att version A fick 3 procent klick och version B fick 3,3 procent klick. Är denna skillnad en verklig fördel eller en slump? Om du bara visade testet för 100 personer kan denna skillnad vara en slump. Statistisk signifikans betyder att den observerade skillnaden är tillräckligt osannolik för att bero på slumpen (dvs skillnaden är troligen verklig). Detta kräver en tillräcklig urvalsstorlek (antal personer som ser testet). Att utropa en "vinnare" med lite data är det vanligaste och dyraste misstaget.

Tips: Innan du startar testet, svara på frågan "när kommer jag att utse vinnaren": hur många personer/efter konvertering, på vilken signifikansnivå. Att fatta detta beslut i förväg förhindrar att du fastnar i bullret de första timmarna och tar ett för tidigt beslut.

Följande tabell jämför bra och dålig A/B-testdesign:

objekt

dålig design

bra design

Antal variabler

Titel + bild + knapp tillsammans

endast titel

hypotes

(ingen) "låt oss se vad som händer"

"Titlar med frågor ökar antalet klick"

prov

80 personer

Förberäknat beslutförhet

beslutstid

2 timmar senare

När du når betydelse

Val av vinnare

"Jag tycker B är trevligt"

Baserat på data och signifikans

Steg för steg: ställa in ett A/B-test

Steg 1 — Skriv en hypotes. Vad testar du och varför? En tydlig hypotes som "En rubrik med fördelar får fler klick än en rubrik med funktioner."

Steg 2 — Välj en enda variabel. Bara titeln, eller bara bilden, eller bara CTA.

Steg 3 — Generera varianter. Skapa olika versioner av samma föremål med AI; håll resten konstant.

Steg 4 — Skapa en mätplan. Vilket mätvärde avgör vinnaren (klickfrekvens, konvertering), hur mycket prov som behövs, hur länge det ska köras.

Steg 5 — Tolka och verifiera resultatet. Har tillräckligt med data samlats in, är skillnaden signifikant? Om det inte är signifikant är "ingen skillnad" också ett giltigt resultat.

tre minifodral

Fall 1 — Tydlighet för en enskild variabel. Ett e-handelsvarumärke testade bara CTA i sin produktannons: "Köp" och "Lägg till i kundvagn". Allt annat var sig likt. Efter tillräckligt med urval gav "Lägg till i kundvagnen" betydligt fler konverteringar. Skillnaden kunde tolkas tydligt eftersom en enda variabel var isolerad. AI producerade två CTA:er, data valde vinnaren.

Fall 2 – Tidiga beslutsfälla. Ett märke stoppade testet eftersom version B var före under de första 3 timmarna av A/B-testet och öppnade B för hela budgeten. När man tittade på den totala datan dagen efter var A faktiskt något bättre; Skillnaden de första timmarna var en slump. Budgeten var bortkastad. Misstag: fatta ett för tidigt beslut med otillräcklig urvalsstorlek.

Fall 3 – "Ingen skillnad" är också slutsatsen. Ett varumärke testade två olika bilder, och efter tillräckligt många provtagningar gav de båda nästan samma resultat. Medan teamet var på väg att beklaga att "testet misslyckades", var den korrekta läsningen att bilden inte är den avgörande faktorn i denna kampanj, så ansträngningen bör riktas mot rubriken och erbjudandet. Det faktum att ingen signifikant skillnad hittades är också värdefull information.

Fyra kopierbara mallar

1) Hypotes och testdesign:

Vad jag vill testa: [t.ex. annonsrubrik].Uppgift: (1) Skriv en enstaka testbar hypotes (i formen "... ökar ... ökar").(2) Lista den enskilda variabeln som ska isoleras och de som ska hållas konstant.(3) Föreslå måtten som kommer att avgöra vinnaren (klickfrekvens/konvertering).(4) Skriv vad jag behöver vara uppmärksam på för att validera varaktighetstestet (exempel,).

2) Variantgenerator (enkel variant):

Klibbig annons: bild [samma], CTA [samma], mål [samma]. Variabel testad: HEADLINE. Huvudmeddelande: "[meddelande]". Uppgift: Generera 4 olika rubrikvarianter med samma budskap. Var och en använder olika tillvägagångssätt (fråga, nytta, antal, brådskande). Endast rubriken ändras; Lägger till ett ogrundat påstående.

3) Mätplan:

Test: [Definition av A och B]. Mått: [klick/omvandling]. Uppgift: Utforma en mätplan:(1) vilket mått som är primärt, vilket är sekundärt,(2) hur mycket data/tid som behövs för att utse vinnaren (förklara logiken),(3) hur man delar trafiken jämnt och rättvist mellan A och B,(4) vilka externa faktorer som kan förvränga resultatet (en säsong, vilken veckodag jag ska använda exakt).

4) Resultattolk (försiktig):

Mina A/B-testresultat (verkliga data): [A: visningar/klick/omvandling],[B: visningar/klick/omvandling]. Uppgift: (1) Beräkna och visa hastigheterna för varje version.(2) Kommentera skillnadens storlek, men om urvalet inte är tillräckligt, säg "otillräcklig data för ett meningsfullt resultat."(3) Remind the risks of claim. betydelse; Jag kommer att bekräfta med ett separat kontoverktyg.

Svag prompt / Stark prompt

Svag uppmaning:

Producera A- och B-versioner för min annons, berätta vilken som är bättre.

Variabeln är inte isolerad, det finns ingen hypotes och mätning; AI kan inte veta vilken som är "bra" utan data, den utgör det.

Kraftfull uppmaning:

Jag ställer in A/B-testning. Fixat: bild och CTA kommer att förbli desamma. Endast variabel som testats: annonsrubrik. Hypotes: "Rubrik med siffror får fler klick än allmän rubrik." Huvudbudskap: "Levereras inom 3 dagar." Uppgift: (1) Producera 1 allmän rubrik för kontroll, 3 rubriker med siffror för variant.(2) Berätta för mig på vilket mätvärde som jag ska mäta på vinnaren.(3) kan ogiltigförklara testet. Förutsäg inte vilken som kommer att vinna; Data kommer att avgöra det.

Det andra kravet isolerar en enda variabel, involverar hypotes och mätning; lämnar vinnaren till uppgifterna.

Vanliga misstag

  • Ändra många objekt samtidigt. Orsaken till vinnaren blir oklart; En enda variabel måste isoleras.
  • Fatta beslut med otillräckliga prover. Skillnaden de första timmarna är ofta en slump.
  • Testa utan hypoteser. "Låt oss se vad som händer" testning producerar inte lärande; Skriv först ner vad du förväntar dig.
  • Misstag resultatet "Ingen skillnad" som ett misslyckande. Bristen på en signifikant skillnad är också informativ.
  • Att välja vinnaren efter smak. Att testa är just för att utesluta personlig smak; Följ uppgifterna.
  • Att glömma yttre faktorer. Säsong, kampanjdag, nyhetsflöde kan förvränga resultatet; Håll testförhållandena rättvisa.
Observera: Syftet med A/B-testning är inte att "vinna" utan att lära sig. Även en variant som förlorar är värdefull information; Den verkliga förlusten är att förlita sig på fel resultat med otillräcklig data och binda budgeten till det.

Sammanfattningsvis

A/B-testning är en kraftfull metod som flyttar reklambeslut från idé till data. Den gyllene regeln är att isolera en enda variabel: endast ett element ska ändras i ett test, resten ska förbli konstant. Den andra pelaren är adekvat urval och statistisk signifikans; Att utropa en vinnare med lite data är det dyraste misstaget. AI är till hjälp för att generera flera varianter och beräkna och tolka odds, men data avgör vinnaren, inte AI. Även resultatet "ingen skillnad" är en lärdom. Hypotesen, måtten och beslutströskeln bör skrivas innan testet börjar.

Applikationsuppgift

Välj ett annonsmaterial (rubrik, bild eller CTA). (1) Skriv en enda testbar hypotes och isolerad variabel med "Hypotes och testdesign". (2) Generera 1 kontroll + 3 varianter med "Variantgenerator"; Byt bara det elementet. (3) Planera vilket mått du ska titta på, hur länge och med vilken data, med "mätningsplanen". (4) Skriv ner din tröskel för att utse vinnaren (hur många konverteringar / vilken betydelse) i förväg. (5) Överväg hypotetiska resultat med en "resultattolk" och notera varför du inte skulle fatta ett beslut i ett scenario där data är otillräckliga.

checklista

  • [ ] Jag isolerade bara en variabel i testet.
  • [ ] Jag skrev en tydlig hypotes innan testet.
  • [ ] Jag har redan bestämt provet och tiden som krävs för vinnaren.
  • [ ] Jag valde vinnaren baserat på data, inte personlig smak.
  • [ ] Jag betraktade resultatet "ingen skillnad" som ett giltigt lärande.
  • [ ] Jag kollade efter externa faktorer som kunde förvränga resultatet.