Eenheid 9 / 11

A/B-testen en experimenteel ontwerp: variantconstructie en betekenis

Winst:

  • Vermogen om de concepten van A/B-testen, controle/variant, conversiepercentage en statistische significantie te begrijpen en hypothesen op te stellen en ontwerpen te testen met kunstmatige intelligentie.
  • Mogelijkheid om de enkele te testen variabele te isoleren en varianttekst/afbeelding en meetplan te produceren met ondersteuning voor kunstmatige intelligentie
  • Vermogen om te onderscheiden dat de testinterpretatie van kunstmatige intelligentie wordt beperkt door de omvang en significantie van de steekproef en het risico op het lezen van voortijdige/onjuiste resultaten

De gevaarlijkste zin in reclame is: 'Ik denk dat dit beter is.' Gegevens, en geen meningen, vertellen u of een kop, een afbeelding of een knop echt beter is. De meest gebruikelijke manier om dit te meten is A/B-testen: twee (of meer) versies van dezelfde advertentie aan echte gebruikers tonen en vergelijken welke beter werkt. "A" is doorgaans de huidige versie (controle), terwijl "B" de nieuwe versie is die wordt geprobeerd (variant). Zo kun je bijvoorbeeld alleen de titel in dezelfde advertentie wijzigen en meten op welke titel het meest wordt geklikt. Kunstmatige intelligentie helpt hierbij zowel bij het genereren van een groot aantal varianten als bij het interpreteren van het resultaat; Maar de wetenschappelijke validiteit van de test hangt af van ontwerpregels en geduld.

De gouden regel van A/B-testen: één variabele

De meest fundamentele regel van A/B-testen is het isoleren van één enkele variabele. Als je de titel, afbeelding en knop tegelijkertijd wijzigt en versie B wint, weet je nooit wat er heeft gewonnen. In een test zou dus slechts één element moeten veranderen, de rest zou constant moeten blijven. Als u meer dan één item tegelijkertijd en systematisch wilt testen, wordt dit multivariate testen genoemd en is een veel grotere steekproef vereist; Univariate A/B-testen zijn de manier om te beginnen.

Het tweede basisconcept is statistische significantie. Laten we zeggen dat versie A 3 procent klikken kreeg en versie B 3,3 procent klikken. Is dit verschil een reëel voordeel of een toevalstreffer? Als je de test maar aan 100 mensen zou laten zien, zou dit verschil op toeval kunnen berusten. Statistische significantie betekent dat het voldoende onwaarschijnlijk is dat het waargenomen verschil het gevolg is van toeval (dat wil zeggen: het verschil is waarschijnlijk reëel). Hiervoor is een voldoende steekproefomvang nodig (aantal mensen dat de test ziet). Met weinig gegevens een ‘winnaar’ uitroepen is de meest voorkomende en dure fout.

Tip: Beantwoord voordat u met de test begint de vraag "wanneer zal ik de winnaar uitroepen": hoeveel mensen/na de conversie, op welk significantieniveau. Door deze beslissing vooraf te nemen, voorkom je dat je de eerste uren verstrikt raakt in het lawaai en een voortijdige beslissing neemt.

In de volgende tabel worden goede en slechte A/B-testontwerpen vergeleken:

artikel

slecht ontwerp

goed ontwerp

Aantal variabelen

Titel + afbeelding + knop samen

alleen titel

hypothese

(geen) "laten we kijken wat er gebeurt"

"Titels met vragen verhogen het aantal klikken"

monster

80 personen

Voorberekend quorum

beslissingstijd

2 uur later

Wanneer je betekenis bereikt

Winnaar selectie

"Ik vind B leuk"

Gebaseerd op data en betekenis

Stap voor stap: een A/B-test opzetten

Stap 1 — Schrijf een hypothese. Wat test je en waarom? Een duidelijke hypothese als 'Een kop met voordelen krijgt meer klikken dan een kop met functies.'

Stap 2 — Selecteer een enkele variabele. Alleen de titel, of alleen de afbeelding, of alleen de CTA.

Stap 3 — Genereer varianten. Creëer verschillende versies van hetzelfde item met AI; houd de rest constant.

Stap 4 — Stel een meetplan op. Welke statistiek de winnaar zal bepalen (klikfrequentie, conversie), hoeveel monster nodig is, hoe lang de campagne moet duren.

Stap 5 — Interpreteer en verifieer het resultaat. Zijn er voldoende gegevens verzameld, is het verschil significant? Als het niet significant is, is ‘geen verschil’ ook een geldig resultaat.

drie minikoffers

Geval 1 – Duidelijkheid van een enkele variabele. Een e-commercemerk testte alleen de CTA in zijn productadvertentie: 'Kopen' en 'Toevoegen aan winkelwagen'. Al het andere was hetzelfde. Na voldoende sampling leverde ‘Toevoegen aan winkelwagen’ aanzienlijk hogere conversies op. Het verschil kon duidelijk worden geïnterpreteerd omdat er één enkele variabele werd geïsoleerd. AI produceerde twee CTA’s, data kozen de winnaar.

Geval 2 – Valkuil voor vroege beslissingen. Een merk stopte de test omdat versie B in de eerste 3 uur van de A/B-test voorop liep en B openstelde voor het volledige budget. Als we de volgende dag naar de totale gegevens kijken, was A eigenlijk iets beter; Het verschil in de eerste uren was toevallig. Het budget was verspild. Fout: een voortijdige beslissing nemen met onvoldoende steekproefomvang.

Geval 3 – “Geen verschil” is ook de conclusie. Een merk testte twee verschillende afbeeldingen en na voldoende bemonstering leverden ze allebei vrijwel hetzelfde resultaat op. Hoewel het team op het punt stond te klagen dat de "test mislukte", was de juiste lezing dat het beeld niet de doorslaggevende factor is in deze campagne, dus de inspanning moet worden gericht op de kop en het aanbod. Ook het feit dat er geen significant verschil werd gevonden is waardevolle informatie.

Vier kopieerbare sjablonen

1) Hypothese en testontwerp:

Wat ik wil testen: [bijv. advertentietitel].Taak: (1) Schrijf een enkele testbare hypothese (in de vorm "... neemt toe ... neemt toe"). (2) Noem de afzonderlijke variabelen die je wilt isoleren en de variabelen die je constant moet houden. (3) Stel de statistiek voor die de winnaar zal bepalen (klikfrequentie/conversie). (4) Schrijf op waar ik op moet letten om de test te valideren (steekproef, duur, risico op vroege beslissing).

2) Variantgenerator (enkele variant):

Vastgezette advertentie: afbeelding [hetzelfde], CTA [hetzelfde], doel [hetzelfde]. Variabele getest: HEADLINE. Hoofdbericht: "[bericht]". Taak: Genereer 4 verschillende kopvarianten met dezelfde boodschap. Ieder hanteert een andere aanpak (vraag, voordeel, aantal, urgentie). Alleen de kop verandert; Een ongefundeerde claim toevoegen.

3) Meetplan:

Test: [Definitie van A en B]. Metriek: [klik/conversie]. Taak: Stel een meetplan op: (1) welke metriek is primair, welke secundair, (2) hoeveel gegevens/tijd zijn nodig om de winnaar aan te duiden (leg de logica uit), (3) hoe kan het verkeer gelijkmatig en eerlijk worden verdeeld tussen A en B, (4) welke externe factoren kunnen het resultaat vertekenen (seizoen, dag van de week). Stel dat ik een significantiehulpmiddel zal gebruiken om exacte statistieken te berekenen.

4) Resultaattolk (voorzichtig):

Mijn A/B-testresultaten (echte gegevens): [A: vertoningen/klikken/conversie],[B: vertoningen/klikken/conversie]. Taak: (1) Bereken en toon de tarieven van elke versie. (2) Geef commentaar op de omvang van het verschil, maar als de steekproef niet voldoende is, zeg dan "onvoldoende gegevens voor een betekenisvol resultaat." (3) Herinner de risico's van voortijdig/verkeerd lezen. Maak geen definitieve aanspraak op significantie; Ik bevestig dit met een aparte accounttool.

Zwakke prompt/sterke prompt

Zwakke prompt:

Maak een A- en B-versie voor mijn advertentie en vertel me welke beter is.

De variabele is niet geïsoleerd, er is geen hypothese en meting; AI kan zonder gegevens niet weten welke ‘goed’ is, maar verzint het.

Krachtige prompt:

Ik ben bezig met het opzetten van A/B-testen. Opgelost: afbeelding en CTA blijven hetzelfde. Alleen geteste variabele: advertentiekop. Hypothese: 'Kop met cijfers krijgt meer klikken dan algemene kop.' Hoofdboodschap: 'Geleverd in 3 dagen.' Taak: (1) Produceer 1 algemene kop voor controle, 3 koppen met cijfers voor variant. (2) Vertel me naar welke statistiek ik moet kijken om de winnaar te meten. (3) Herinner me aan 3 fouten die de test ongeldig kunnen maken. Voorspel niet welke. winnen; De data zullen het bepalen.

De tweede claim isoleert een enkele variabele, omvat hypothese en meting; laat de winnaar aan de data over.

Veel voorkomende fouten

  • Veel items tegelijk veranderen. De reden voor de winnaar wordt onduidelijk; Er moet één enkele variabele worden geïsoleerd.
  • Beslissingen nemen met onvoldoende monsters. Het verschil in de eerste uren is vaak toeval.
  • Testen zonder hypothesen. “Laten we eens kijken wat er gebeurt” testen leidt niet tot leren; Schrijf eerst op wat je verwacht.
  • Het resultaat "Geen verschil" als een mislukking beschouwen. Het ontbreken van een significant verschil is ook informatief.
  • De winnaar kiezen op basis van smaak. Testen is juist bedoeld om persoonlijke smaak uit te sluiten; Volg de gegevens.
  • Externe factoren vergeten. Seizoen, campagnedag en nieuwsstroom kunnen de uitkomst vertekenen; Houd de testomstandigheden eerlijk.
Let op: Het doel van A/B-testen is niet om te "winnen", maar om te leren. Zelfs een variant die verliest is waardevolle informatie; Het echte verlies is het vertrouwen op het verkeerde resultaat met onvoldoende gegevens en het daaraan koppelen van het budget.

Samengevat

A/B-testen is een krachtige methode die advertentiebeslissingen van idee naar data verplaatst. De gouden regel is om één enkele variabele te isoleren: slechts één element mag tijdens een test veranderen, de rest moet constant blijven. De tweede pijler is adequate steekproeftrekking en statistische significantie; Een winnaar uitroepen met weinig gegevens is de duurste fout. AI is nuttig bij het genereren van meerdere varianten en het berekenen en interpreteren van kansen, maar de gegevens bepalen de winnaar, niet de AI. Zelfs het resultaat "geen verschil" is een leerproces. De hypothese, de metriek en de beslissingsdrempel moeten worden geschreven voordat de test begint.

Applicatie taak

Kies een advertentiemateriaal (kop, afbeelding of CTA). (1) Schrijf een enkele toetsbare hypothese en geïsoleerde variabele met "Hypothese en testontwerp". (2) Genereer 1 besturing + 3 varianten met "Variantgenerator"; Verander gewoon dat element. (3) Plan met het ‘meetplan’ naar welke statistiek je gaat kijken, voor hoe lang en met welke gegevens. (4) Noteer vooraf uw drempelwaarde voor het bekendmaken van de winnaar (hoeveel conversies / welke betekenis). (5) Overweeg hypothetische resultaten met een “resultateninterpreter” en noteer waarom u geen beslissing zou nemen in een scenario waarin de gegevens onvoldoende zijn.

controlelijst

  • [ ] Ik heb slechts één variabele in de test geïsoleerd.
  • [ ] Ik heb vóór de test een duidelijke hypothese geschreven.
  • [ ] Ik heb het monster en de benodigde tijd voor de winnaar al bepaald.
  • [ ] Ik heb de winnaar gekozen op basis van gegevens, niet op basis van persoonlijke smaak.
  • [ ] Ik beschouwde het resultaat "geen verschil" als een geldige leerervaring.
  • [ ] Ik heb gecontroleerd of er externe factoren zijn die het resultaat kunnen vertekenen.