Üksus 9 / 11

A/B testimine ja eksperimentaalne projekteerimine: variandi ehitus ja olulisus

Kasu:

  • Oskus mõista A/B testimise, kontrolli/variandi, konversioonimäära ja statistilise olulisuse mõisteid ning püstitada tehisintellektiga hüpoteese ja testimise kavandeid.
  • Võimalus isoleerida üksainus testitav muutuja ja koostada tehisintellekti toega varianttekst/pilt ja mõõtmisplaan
  • Võimalus eristada, et tehisintellekti testi tõlgendus on piiratud valimi suuruse ja olulisuse ning enneaegsete/valede tulemuste lugemise riskiga

Kõige ohtlikum lause reklaamis on "Ma arvan, et see on parem." Andmed, mitte arvamus, näitavad, kas pealkiri, pilt või nupp on tõesti parem. Kõige tavalisem viis selle mõõtmiseks on A/B testimine: sama reklaami kahe (või enama) versiooni näitamine tegelikele kasutajatele ja võrdlemine, milline neist töötab paremini. "A" on tavaliselt praegune versioon (kontroll), samas kui "B" on uus versioon, mida proovitakse (variant). Näiteks saate muuta ainult sama reklaami pealkirja ja mõõta, millisel pealkirjal rohkem klikitakse. Tehisintellekt on selles protsessis abiks nii suure hulga variantide genereerimisel kui ka tulemuse tõlgendamisel; Kuid testi teaduslik kehtivus sõltub disainireeglitest ja kannatlikkusest.

A/B testimise kuldreegel: üks muutuja

A/B-testimise põhireegel on ühe muutuja eraldamine. Kui muudate pealkirja, pilti ja nuppu samal ajal ja versioon B võidab, ei saa te kunagi teada, mis võitis. Seega peaks testis muutuma ainult üks element, ülejäänud peaks jääma konstantseks. Kui soovite testida mitut üksust samaaegselt ja süstemaatiliselt, nimetatakse seda mitme muutujaga testimiseks ja see nõuab palju suuremat valimit; Alustuseks on ühemõõtmeline A/B testimine.

Teine põhikontseptsioon on statistiline olulisus. Oletame, et versioon A sai 3 protsenti klikke ja versioon B 3,3 protsenti klikke. Kas see erinevus on tõeline eelis või juhus? Kui näitaksite testi ainult 100 inimesele, võib see erinevus olla juhuslik. Statistiline olulisus tähendab, et täheldatud erinevuse põhjuseks on ebatõenäoline juhus (st erinevus on tõenäoliselt reaalne). Selleks on vaja piisavat valimi suurust (testi nägevate inimeste arv). Võitjaks kuulutamine väheste andmetega on kõige levinum ja kulukam viga.

Näpunäide: enne testi alustamist vastake küsimusele "millal ma võitja välja kuulutan": kui palju inimesi/konversioonijärgne, mis olulisuse tasemel. Selle otsuse ette tegemine väldib esimestel tundidel mürasse sattumast ja enneaegse otsuse langetamist.

Järgmises tabelis võrreldakse head ja halba A/B-testi disaini:

üksus

halb disain

hea disain

Muutujate arv

Pealkiri + pilt + nupp koos

ainult pealkiri

hüpotees

(pole) "vaatame, mis juhtub"

"Küsimustega pealkirjad suurendavad klikkide arvu"

näidis

80 inimest

Eelarvestatud kvoorum

otsustamise aeg

2 tundi hiljem

Kui saavutate tähtsuse

Võitja valik

"Ma arvan, et B on tore"

Andmete ja olulisuse põhjal

Samm-sammult: A/B-testi seadistamine

1. samm – kirjutage hüpotees. Mida sa testid ja miks? Selge hüpotees, näiteks "Eelistega pealkiri saab rohkem klikke kui funktsioonidega pealkiri".

2. samm – valige üks muutuja. Lihtsalt pealkiri või lihtsalt pilt või lihtsalt CTA.

3. samm – genereerige variandid. Loo tehisintellektiga samast elemendist erinevaid versioone; hoidke ülejäänud osa pidevalt.

4. samm – koostage mõõtmisplaan. Milline mõõdik määrab võitja (klikkimise määr, konversioon), kui palju valimit on vaja, kui kaua seda esitada.

5. samm – tõlgendage ja kontrollige tulemust. Kas andmeid on kogutud piisavalt, kas erinevus on märkimisväärne? Kui see ei ole oluline, on ka "erinevusteta" kehtiv tulemus.

kolm minikarpi

Juhtum 1 – ühe muutuja selgus. E-kaubanduse bränd testis oma tootereklaamis ainult CTA-d: „Osta” ja „Lisa ostukorvi”. Kõik muu oli sama. Pärast piisavat proovivõttu tõi valik „Lisa ostukorvi” oluliselt rohkem konversioone. Erinevust saab selgelt tõlgendada, kuna üks muutuja oli isoleeritud. Tehisintellekt koostas kaks CTA-d, andmed valisid võitja.

Juhtum 2 – varajase otsustamise lõks. Bränd peatas testimise, kuna versioon B oli A/B testi esimese 3 tunniga ees ja avas B kogu eelarvele. Järgmise päeva koguandmeid vaadates oli A tegelikult veidi parem; Esimeste tundide vahe oli juhuslik. Eelarve läks raisku. Viga: ennatliku otsuse tegemine ebapiisava valimi suurusega.

Juhtum 3 – „Ei ole vahet” on samuti järeldus. Bränd katsetas kahte erinevat pilti ja pärast piisavat proovivõttu andsid mõlemad peaaegu sama tulemuse. Samal ajal kui meeskond hakkas hädaldama, et "test ebaõnnestus", oli õige lugemine, et pilt ei ole selles kampaanias otsustav tegur, seega tuleks pingutused suunata pealkirja ja pakkumise poole. Väärtuslik teave on ka asjaolu, et olulist erinevust ei leitud.

Neli kopeeritavat malli

1) Hüpotees ja testi ülesehitus:

Mida ma tahan testida: [nt. kuulutuse pealkiri].Ülesanne: (1) Kirjutage üks testitav hüpotees (kujul "... suureneb ... suureneb").(2) Loetlege üksik muutuja, mida eraldada ja muutujad, mida hoida konstantsena.(3) Pakkuge välja mõõdik, mis määrab võitja (klikkimise määr/konversioon).(4) Kirjutage, mida pean tähelepanu pöörama (varajase otsuse kontrollimiseks, kestus).

2) Variantide generaator (üks variant):

Kleepreklaam: pilt [sama], CTA [sama], sihtmärk [sama]. Testitud muutuja: HEADLINE. Põhisõnum: "[sõnum]". Ülesanne: genereerige sama sõnumiga 4 erinevat pealkirja varianti. Igaüks neist kasutab erinevat lähenemist (küsimus, kasu, arv, kiireloomulisus). Muutub ainult pealkiri; Põhjendamata väite lisamine.

3) Mõõtmisplaan:

Test: [A ja B määratlus]. Mõõdik: [klikk/konversioon]. Ülesanne: koostage mõõtmisplaan:(1) milline mõõdik on esmane, millised on teisejärgulised,(2) kui palju andmeid/aega kulub võitja väljakuulutamiseks (loogika selgitamiseks),(3) kuidas jagada liiklus ühtlaselt ja õiglaselt A ja B vahel,(4) millised välistegurid võivad tulemust moonutada (hooaeg, nädalapäev). Kasutan statistika arvutamiseks täpset olulisust.

4) Tulemuste tõlk (ettevaatust):

Minu A/B testi tulemused (tegelikud andmed): [A: näitamised/klikid/konversioon],[B: näitamised/klikid/konversioon].Ülesanne: (1) Arvutage ja kuvage iga versiooni määrad.(2) Kommenteerige erinevuse suurust, kuid kui valim ei ole piisav, öelge "ebapiisavad andmed tähendusliku tulemuse saavutamiseks." olulisuse väide; Kinnitan eraldi kontotööriistaga.

Nõrk viip / Tugev viip

Nõrk viip:

Koostage minu kuulutuse jaoks A- ja B-versioon, öelge, kumb on parem.

Muutuja ei ole isoleeritud, puudub hüpotees ja mõõtmine; AI ei saa ilma andmeteta teada, milline neist on "hea", see teeb selle välja.

Võimas viip:

Seadistan A/B testimise. Parandatud: pilt ja CTA jäävad samaks.Testitud ainult muutuja: reklaami pealkiri.Hüpotees: "Numbreid sisaldav pealkiri saab rohkem klikke kui üldine pealkiri."Põhisõnum: "Tarnitakse 3 päevaga."Ülesanne: (1) koostage kontrollimiseks 1 üldpealkiri, 3 numbritega pealkirja variandi jaoks.(2) Ütle mulle, milline on võitja.(2) Ütle mulle, milline on võitja. 3 viga, mis võivad testi kehtetuks muuta.Ära ennusta, kumb võidab; Andmed määravad selle.

Teine väide eraldab ühe muutuja, hõlmab hüpoteesi ja mõõtmist; jätab võitja andmete hooleks.

Levinud vead

  • Mitme üksuse korraga muutmine. Võitja põhjus jääb ebaselgeks; Üks muutuja peab olema isoleeritud.
  • Otsuste tegemine ebapiisavate valimitega. Esimeste tundide erinevus on sageli juhuslik.
  • Testimine ilma hüpoteesideta. "Vaatame, mis juhtub" testimine ei tooda õppimist; Kõigepealt kirjutage üles, mida ootate.
  • Tulemuse "Ei ole vahet" eksimine ebaõnnestumisena. Informatiivne on ka olulise erinevuse puudumine.
  • Võitja valimine maitse järgi. Testimine on just isikliku maitse välistamiseks; Jälgi andmeid.
  • Väliste tegurite unustamine. Hooaeg, kampaaniapäev, uudistevoog võivad tulemust moonutada; Hoidke testimistingimused õiglased.
Tähelepanu: A/B testimise eesmärk ei ole "võita", vaid õppida. Isegi kaotatud variant on väärtuslik teave; Tegelik kahju on ebapiisavate andmetega valele tulemusele lootmine ja eelarve sellega sidumine.

Kokkuvõttes

A/B testimine on võimas meetod, mis viib reklaamiotsused ideelt andmetele. Kuldne reegel on isoleerida üks muutuja: testis peaks muutuma ainult üks element, ülejäänud peaks jääma konstantseks. Teine sammas on piisav valim ja statistiline olulisus; Võitja väljakuulutamine väheste andmetega on kõige kallim viga. Tehisintellekt on abiks mitme variandi genereerimisel ning koefitsientide arvutamisel ja tõlgendamisel, kuid võitja määravad andmed, mitte tehisintellekt. Isegi "vahet pole" tulemus on õppimine. Hüpotees, mõõdik ja otsustuslävi tuleks kirjutada enne testi algust.

Rakenduse ülesanne

Valige reklaam (pealkiri, pilt või CTA). (1) Kirjutage üks testitav hüpotees ja isoleeritud muutuja "Hüpotees ja testi disain". (2) Genereeri 1 kontroll + 3 varianti "Variantide generaatoriga"; Lihtsalt muutke seda elementi. (3) Planeerige "mõõtmisplaaniga", millist mõõdikut, kui kaua ja milliste andmetega vaatate. (4) Kirjutage eelnevalt üles oma võitja väljakuulutamise lävi (mitu konversiooni / mis tähtsus). (5) Kaaluge hüpoteetilisi tulemusi "tulemuste tõlgendajaga" ja pange tähele, miks te ei teeks otsust stsenaariumi korral, kus andmed on ebapiisavad.

kontrollnimekiri

  • [ ] Isoleerisin testis ainult ühe muutuja.
  • [ ] Kirjutasin enne testi selge hüpoteesi.
  • [ ] Olen juba määranud võitja valimi ja ajakulu.
  • [ ] Võitja valisin andmete, mitte isikliku maitse järgi.
  • [ ] Pidasin tulemust "vahet pole" kehtivaks õppimiseks.
  • [ ] Kontrollisin väliseid tegureid, mis võiksid tulemust moonutada.