Ieguvumi:
- Spēja izprast A/B testēšanas, kontroles/variantu, konversijas likmju un statistiskās nozīmīguma jēdzienus un izvirzīt hipotēzes un testēšanas projektus ar mākslīgo intelektu.
- Spēja izolēt vienu pārbaudāmo mainīgo un izveidot teksta/attēla variantu un mērījumu plānu ar mākslīgā intelekta atbalstu
- Spēja atšķirt, ka mākslīgā intelekta testa interpretāciju ierobežo izlases lielums un nozīmīgums, kā arī risks nolasīt priekšlaicīgus/nepareizus rezultātus
Bīstamākais teikums reklāmā ir "Es domāju, ka tas ir labāk". Dati, nevis viedoklis, norāda, vai virsraksts, attēls vai poga patiešām ir labāki. Visizplatītākais veids, kā to novērtēt, ir A/B testēšana: vienas un tās pašas reklāmas divu (vai vairāku) versiju rādīšana reāliem lietotājiem un salīdzināšana, kura darbojas labāk. "A" parasti ir pašreizējā versija (vadība), savukārt "B" ir jaunā versija, kas tiek izmēģināta (variants). Piemēram, tajā pašā reklāmā varat mainīt tikai virsrakstu un izmērīt, uz kura nosaukuma tiek noklikšķināts vairāk. Mākslīgais intelekts šajā procesā palīdz gan liela variantu skaita ģenerēšanā, gan rezultāta interpretācijā; Bet testa zinātniskais derīgums ir atkarīgs no projektēšanas noteikumiem un pacietības.
A/B testēšanas zelta likums: viens mainīgais
Visvienkāršākais A/B testēšanas noteikums ir viena mainīgā izolēšana. Ja vienlaikus mainīsit nosaukumu, attēlu un pogu un uzvarēs versija B, jūs nekad nezināt, kas uzvarēs. Tātad testā jāmainās tikai vienam elementam, pārējiem jāpaliek nemainīgiem. Ja vēlaties vienlaikus un sistemātiski pārbaudīt vairāk nekā vienu vienumu, to sauc par daudzfaktoru testēšanu, un tam ir nepieciešams daudz lielāks paraugs; Vienfaktoru A/B testēšana ir veids, kā sākt.
Otrs pamatjēdziens ir statistiskā nozīmība. Pieņemsim, ka versija A saņēma 3 procentus klikšķu, bet versija B saņēma 3,3 procentus klikšķu. Vai šī atšķirība ir reāla priekšrocība vai nejaušība? Ja jūs parādītu testu tikai 100 cilvēkiem, šī atšķirība varētu būt nejauša. Statistiskais nozīmīgums nozīmē, ka novērotā atšķirība ir maz ticama nejaušības dēļ (t.i., atšķirība, iespējams, ir reāla). Tam nepieciešams pietiekams izlases lielums (to cilvēku skaits, kuri redz testu). “Uzvarētāja” pasludināšana ar maziem datiem ir visizplatītākā un dārgākā kļūda.
Padoms. Pirms testa uzsākšanas atbildiet uz jautājumu "kad pasludināšu uzvarētāju": cik cilvēku/pēc konversijas, kādā nozīmīguma līmenī. Iepriekš pieņemot šo lēmumu, jūs pirmajās stundās nevarēsit ieraut troksnī un pieņemt priekšlaicīgu lēmumu.
Šajā tabulā ir salīdzināts labs un slikts A/B testa dizains:
vienumu
slikts dizains
labs dizains
Mainīgo lielumu skaits
Virsraksts + attēls + poga kopā
tikai virsraksts
hipotēze
(nav) "skatīsimies, kas notiks"
"Nosaukumi ar jautājumiem palielina klikšķu skaitu"
paraugs
80 cilvēki
Iepriekš aprēķināts kvorums
lēmuma pieņemšanas laiks
2 stundas vēlāk
Kad jūs sasniedzat nozīmi
Uzvarētāja izvēle
"Manuprāt, B ir jauks"
Pamatojoties uz datiem un nozīmīgumu
Soli pa solim: A/B testa iestatīšana
1. solis — uzrakstiet hipotēzi. Ko jūs testējat un kāpēc? Skaidra hipotēze, piemēram, "virsraksts ar priekšrocībām iegūst vairāk klikšķu nekā virsraksts ar funkcijām".
2. darbība — atlasiet vienu mainīgo. Tikai nosaukums vai tikai attēls, vai tikai CTA.
3. darbība — ģenerējiet variantus. Izveidojiet dažādas viena un tā paša vienuma versijas, izmantojot AI; saglabājiet pārējo nemainīgu.
4. darbība — izveidojiet mērījumu plānu. Kurš rādītājs noteiks uzvarētāju (vidējais klikšķu skaits, reklāmguvums), cik daudz izlases ir nepieciešams, cik ilgi darboties.
5. darbība. Interpretējiet un pārbaudiet rezultātu. Vai ir savākts pietiekami daudz datu, vai atšķirība ir būtiska? Ja tas nav nozīmīgs, arī "nav atšķirības" ir derīgs rezultāts.
trīs mini futrāļi
1. gadījums — viena mainīgā lieluma skaidrība. E-komercijas zīmols savā produkta reklāmā pārbaudīja tikai CTA: “Pirkt” un “Pievienot grozam”. Viss pārējais bija tāpat. Pēc pietiekamas atlases opcija “Pievienot grozam” nodrošināja ievērojami lielāku reklāmguvumu skaitu. Atšķirību varēja skaidri interpretēt, jo tika izolēts viens mainīgais. AI izveidoja divus CTA, un dati izvēlējās uzvarētāju.
2. gadījums — agrīna lēmuma slazds. Zīmols apturēja testu, jo versija B bija priekšā pirmajās 3 A/B testa stundās un atvēra B līdz visam budžetam. Aplūkojot kopējos datus nākamajā dienā, A patiesībā bija nedaudz labāks; Atšķirība pirmajās stundās bija nejauša. Budžets tika izšķiests. Kļūda: priekšlaicīga lēmuma pieņemšana ar nepietiekamu izlases lielumu.
3. gadījums — “Nav atšķirības” ir arī secinājums. Zīmols pārbaudīja divus dažādus attēlus, un pēc pietiekamas paraugu ņemšanas tie abi radīja gandrīz vienādu rezultātu. Kamēr komanda grasījās vaimanāt, ka "pārbaude neizdevās", pareizais lasījums bija tāds, ka attēls nav noteicošais faktors šajā kampaņā, tāpēc pūles jāvērš uz virsrakstu un piedāvājumu. Vērtīga informācija ir arī fakts, ka netika konstatēta būtiska atšķirība.
Četras kopējamas veidnes
1) Hipotēze un testa dizains:
Ko es vēlos pārbaudīt: [piem. reklāmas virsraksts].Uzdevums: (1) Uzrakstiet vienu pārbaudāmu hipotēzi (formā "... palielinās ... palielinās").(2) Norādiet vienu mainīgo, kas jāizolē, un tos, kas jāsaglabā nemainīgi.(3) Iesakiet metriku, kas noteiks uzvarētāju (vidējais klikšķu skaits/reklāmguvums).(4) Uzrakstiet, kas man ir jāpievērš uzmanība (sample Decision validle the time, testēšana, lai pārbaudītu risku, ilgums).
2) Variantu ģenerators (viens variants):
Līmējošā reklāma: attēls [tas pats], CTA [tas pats], mērķis [tas pats]. Pārbaudīts mainīgais: HEADLINE. Galvenais ziņojums: "[ziņa]". Uzdevums: ģenerējiet 4 dažādus virsrakstu variantus ar vienu un to pašu ziņojumu. Katrs izmanto atšķirīgu pieeju (jautājums, ieguvums, skaits, steidzamība). Mainās tikai virsraksts; Nepamatotas prasības pievienošana.
3) Mērījumu plāns:
Tests: [A un B definīcija]. Metrika: [klikšķis/reklāmguvums].Uzdevums: uzmetiet mērījumu plānu:(1) kura metrika ir primārā, kura ir sekundārā,(2) cik daudz datu/laika ir nepieciešams, lai paziņotu uzvarētāju (izskaidrojiet loģiku),(3) kā vienmērīgi un godīgi sadalīt trafiku starp A un B,(4) kādi ārējie faktori var izkropļot rezultātu (sezona, nedēļas diena).
4) Rezultātu tulks (uzmanīgs):
Mani A/B testa rezultāti (reālie dati): [A: seansi/klikšķi/reklāmguvums],[B: seansi/klikšķi/reklāmguvums]. Uzdevums: (1) Aprēķiniet un parādiet katras versijas rādītājus.(2) Komentējiet atšķirības lielumu, bet, ja izlase nav pietiekama, sakiet "nepietiekami dati jēgpilnam rezultātam."(3) Nepietiekami. pretenzija par nozīmīgumu; Apstiprināšu ar atsevišķu konta rīku.
Vāja uzvedne / spēcīga uzvedne
Vāja uzvedne:
Izveidojiet manai reklāmai A un B versiju, pastāstiet man, kura ir labāka.
Mainīgais nav izolēts, nav hipotēzes un mērījumu; AI nevar zināt, kurš no tiem ir "labs" bez datiem, tas to veido.
Spēcīga uzvedne:
Es iestatu A/B testēšanu. Labots: attēls un CTA paliks nemainīgi.Tikai pārbaudītais mainīgais: reklāmas virsraksts.Hipotēze: "Virsraksts ar skaitļiem saņem vairāk klikšķu nekā vispārīgais virsraksts."Galvenais ziņojums: "Piegādāts 3 dienu laikā."Uzdevums: (1) Izveidojiet 1 vispārīgu virsrakstu kontrolei, 3 virsrakstus ar cipariem variantam.(2) Pastāstiet man, kurš 3, lai izmērītu. 3 kļūdas, kas var padarīt testu par nederīgu. Neprognozējiet, kura uzvarēs; Dati to noteiks.
Otrais apgalvojums izdala vienu mainīgo, ietver hipotēzi un mērījumus; atstāj uzvarētāju datu ziņā.
Biežas kļūdas
- Daudzu vienumu maiņa vienlaikus. Uzvarētāja iemesls kļūst neskaidrs; Viens mainīgais ir jāizolē.
- Lēmumu pieņemšana ar nepietiekamiem paraugiem. Atšķirība pirmajās stundās bieži vien ir nejauša.
- Pārbaude bez hipotēzēm. “Paskatīsimies, kas notiks” testēšana neveicina mācīšanos; Vispirms pierakstiet, ko jūs sagaidāt.
- Rezultātu "Nav atšķirības" kļūdaini uzskatīt par neveiksmi. Informatīvs ir arī būtiskas atšķirības trūkums.
- Uzvarētāja izvēle pēc gaumes. Testēšana ir tieši tā, lai izslēgtu personīgo gaumi; Sekojiet datiem.
- Aizmirstot ārējos faktorus. Sezona, kampaņas diena, ziņu plūsma var izkropļot rezultātu; Saglabājiet godīgus testēšanas apstākļus.
Uzmanību: A/B testēšanas mērķis nav “uzvarēt”, bet gan mācīties. Pat zaudējuma variants ir vērtīga informācija; Patiesie zaudējumi ir paļaušanās uz nepareizu rezultātu ar nepietiekamiem datiem un budžeta piesaistīšana tam.
Rezumējot
A/B testēšana ir jaudīga metode, kas pārceļ reklāmas lēmumus no idejas uz datiem. Zelta likums ir izolēt vienu mainīgo: testā jāmainās tikai vienam elementam, pārējiem jāpaliek nemainīgiem. Otrais pīlārs ir adekvāta atlase un statistiskā nozīme; Uzvarētāja pasludināšana ar maziem datiem ir visdārgākā kļūda. AI palīdz ģenerēt vairākus variantus un aprēķināt un interpretēt izredzes, taču uzvarētāju nosaka dati, nevis AI. Pat rezultāts "nav atšķirības" ir mācīšanās. Hipotēze, metrika un lēmuma slieksnis ir jāuzraksta pirms pārbaudes sākuma.
Lietojumprogrammas uzdevums
Izvēlieties reklāmu (virsrakstu, attēlu vai CTA). (1) Uzrakstiet vienu pārbaudāmu hipotēzi un izolētu mainīgo ar "Hipotēze un testa dizains". (2) ģenerēt 1 kontroli + 3 variantus ar "Variantu ģeneratoru"; Vienkārši mainiet šo elementu. (3) Plānojiet, kādu metriku skatīsit, cik ilgi un ar kādiem datiem, izmantojot “mērījumu plānu”. (4) Iepriekš pierakstiet savu uzvarētāja pasludināšanas slieksni (cik reklāmguvumu / kāda nozīme). (5) Apsveriet hipotētiskos rezultātus, izmantojot “rezultātu tulku”, un atzīmējiet, kāpēc jūs nepieņemtu lēmumu scenārijā, kurā dati ir nepietiekami.
kontrolsaraksts
- [ ] Es testā izolēju tikai vienu mainīgo.
- [ ] Pirms pārbaudes es uzrakstīju skaidru hipotēzi.
- [ ] Es jau noteicu uzvarētājam nepieciešamo paraugu un laiku.
- [ ] Uzvarētāju izvēlējos pēc datiem, nevis pēc personīgās gaumes.
- [ ] Es uzskatīju rezultātu "nav atšķirības" kā derīgu mācīšanos.
- [ ] Es pārbaudīju ārējos faktorus, kas varētu izkropļot rezultātu.