Unitate 9 / 11

Testarea A/B și proiectarea experimentală: construcția variantelor și semnificația

Câștiguri:

  • Abilitatea de a înțelege conceptele de testare A/B, control/variantă, rata de conversie și semnificația statistică și de a stabili ipoteze și proiecte de testare cu inteligență artificială.
  • Capacitatea de a izola singura variabilă care urmează să fie testată și de a produce variante de text/imagine și plan de măsurare cu suport de inteligență artificială
  • Capacitatea de a distinge faptul că interpretarea testelor de inteligență artificială este limitată de dimensiunea și semnificația eșantionului și de riscul de a citi rezultate premature/incorecte

Cea mai periculoasă propoziție din reclamă este „Cred că este mai bine”. Datele, nu opinia, vă spun dacă un titlu, o imagine sau un buton este cu adevărat mai bun. Cea mai obișnuită modalitate de a măsura acest lucru este testarea A/B: afișarea a două (sau mai multe) versiuni ale aceluiași anunț utilizatorilor reali și compararea dintre care dintre ele funcționează mai bine. „A” este de obicei versiunea curentă (control), în timp ce „B” este noua versiune încercată (varianta). De exemplu, puteți schimba doar titlul din același anunț și puteți măsura pe ce titlu se face clic mai mult. Inteligența artificială este de ajutor în acest proces atât în ​​generarea unui număr mare de variante, cât și în interpretarea rezultatului; Dar validitatea științifică a testului depinde de regulile de proiectare și de răbdare.

Regula de aur a testării A/B: o variabilă

Cea mai de bază regulă a testării A/B este izolarea unei singure variabile. Dacă schimbi titlul, imaginea și butonul în același timp și versiunea B câștigă, nu vei ști niciodată ce a câștigat. Deci într-un test ar trebui să se schimbe doar un element, restul ar trebui să rămână constant. Dacă doriți să testați mai mult de un item simultan și sistematic, aceasta se numește testare multivariată și necesită un eșantion mult mai mare; Testarea A/B univariată este modalitatea de a începe.

Al doilea concept de bază este semnificația statistică. Să presupunem că versiunea A a primit 3 procente de clicuri, iar versiunea B a primit 3,3 procente de clicuri. Este această diferență un avantaj real sau o întâmplare? Dacă ai arăta testul doar la 100 de persoane, această diferență ar putea fi întâmplătoare. Semnificația statistică înseamnă că diferența observată este suficient de puțin probabil să se datoreze întâmplării (adică, diferența este probabil reală). Acest lucru necesită o dimensiune suficientă a eșantionului (numărul de persoane care văd testul). Declararea unui „câștigător” cu puține date este cea mai frecventă și costisitoare greșeală.

Sfat: Înainte de a începe testul, răspunde la întrebarea „când voi declara câștigătorul”: câte persoane/post-conversie, la ce nivel de semnificație. Luarea acestei decizii în avans te împiedică să fii prins de zgomot în primele ore și să iei o decizie prematură.

Următorul tabel compară designul bun și negativ al testului A/B:

articol

design prost

design bun

Numărul de variabile

Titlu + imagine + buton împreună

numai titlul

ipoteza

(niciunul) „hai să vedem ce se întâmplă”

„Titlurile cu întrebări cresc clicurile”

probă

80 de persoane

Cvorum precalculat

timp de decizie

2 ore mai tarziu

Când ajungi la semnificație

Selecția câștigătorului

„Cred că B este drăguț”

Bazat pe date și semnificație

Pas cu pas: configurarea unui test A/B

Pasul 1 — Scrieți o ipoteză. Ce testezi si de ce? O ipoteză clară precum „Un titlu cu beneficii primește mai multe clicuri decât un titlu cu caracteristici”.

Pasul 2 — Selectați o singură variabilă. Doar titlul, sau doar imaginea, sau doar CTA.

Pasul 3 — Generați variante. Creați versiuni diferite ale aceluiași articol cu ​​AI; păstrați restul constant.

Pasul 4 — Configurați un plan de măsurare. Ce valoare va determina câștigătorul (rata de clic, conversie), cât de mult eșantion este necesar, cât timp se rulează.

Pasul 5 — Interpretați și verificați rezultatul. Au fost colectate suficiente date, diferența este semnificativă? Dacă nu este semnificativ, „nicio diferență” este, de asemenea, un rezultat valid.

trei mini cutii

Cazul 1 — Claritatea unei singure variabile. O marcă de comerț electronic a testat doar CTA în anunțul său de produs: „Cumpără” și „Adaugă în coș”. Toate celelalte erau la fel. După suficient eșantionare, „Adăugați în coș” a adus conversii semnificativ mai mari. Diferența a putut fi interpretată clar deoarece o singură variabilă a fost izolată. AI a produs două CTA, datele au ales câștigătorul.

Cazul 2 – Capcană de decizie timpurie. Un brand a oprit testul pentru că versiunea B a fost înainte în primele 3 ore ale testului A/B și a deschis B pentru întregul buget. Privind datele totale a doua zi, A a fost de fapt puțin mai bun; Diferența din primele ore a fost întâmplătoare. Bugetul a fost irosit. Greșeală: luarea unei decizii premature cu o dimensiune insuficientă a eșantionului.

Cazul 3 – „Fără diferență” este, de asemenea, concluzia. O marcă a testat două imagini diferite și, după suficient eșantionare, ambele au produs aproape același rezultat. În timp ce echipa era pe cale să deplânge că „testul a eșuat”, lectura corectă a fost că imaginea nu este factorul decisiv în această campanie, așa că efortul ar trebui îndreptat către titlu și ofertă. Faptul că nu a fost găsită nicio diferență semnificativă este, de asemenea, o informație valoroasă.

Patru șabloane copiabile

1) Ipoteza și proiectarea testului:

Ce vreau să testez: [ex. Titlul anunțului].Sarcina: (1) Scrieți o singură ipoteză testabilă (sub forma „... crește... crește”).(2) Enumerați singura variabilă de izolat și pe cele de menținut constant.(3) Sugerați metrica care va determina câștigătorul (rata de clic/conversie).(4) Scrieți la ce trebuie să fiu atent pentru a valida testul de durată, riscul de decizie timpurie (proba de decizie).

2) Varianta generator (varianta o singura):

Anunț lipicios: imagine [la fel], CTA [la fel], țintă [la fel]. Variabilă testată: HEADLINE. Mesajul principal: „[mesaj]”. Sarcină: generați 4 variante diferite de titlu cu același mesaj. Fiecare folosește o abordare diferită (întrebare, beneficiu, număr, urgență). Se schimbă doar titlul; Adăugarea unei revendicări nefondate.

3) Plan de măsurare:

Test: [Definiția lui A și B]. Valoarea: [clic/conversie]. Sarcină: Elaborarea unui plan de măsurare: (1) care măsurătoare este primară, care sunt secundare, (2) câte date/timp sunt necesare pentru a declara câștigătorul (explicați logica), (3) cum să împărțiți traficul în mod egal și echitabil între A și B, (4) ce factori externi pot distorsiona rezultatul (sezonul I va folosi instrumentul pentru a calcula o semnificație exactă). statistici.

4) Interpret de rezultate (atenție):

Rezultatele testului meu A/B (date reale): [A: afișări/clicuri/conversie],[B: afișări/clicuri/conversie]. Sarcină: (1) Calculați și afișați ratele fiecărei versiuni.(2) Comentați amploarea diferenței, dar dacă eșantionul nu este suficient, spuneți „date insuficiente pentru un rezultat semnificativ.”(3) Amintiți-vă riscurile de pretenție de semnificație. Voi confirma cu un instrument separat de cont.

Prompt slab / Prompt puternic

Prompt slab:

Produceți versiunea A și B pentru anunțul meu, spuneți-mi care este mai bună.

Variabila nu este izolată, nu există ipoteză și măsurare; AI nu poate ști care dintre ele este „bun” fără date, el inventează.

Solicitare puternică:

Am configurat testarea A/B. Remediat: imaginea și CTA vor rămâne aceleași. Numai variabila testată: titlul anunțului. Ipoteza: „Titlul cu numere primește mai multe clicuri decât titlul general.” Mesajul principal: „Livrat în 3 zile”. greșeli care ar putea invalida testul. Nu preziceți care dintre ele va câștiga; Datele o vor determina.

A doua revendicare izolează o singură variabilă, implică ipoteză și măsurare; lasa castigatorul in seama datelor.

Greșeli comune

  • Schimbarea multor elemente deodată. Motivul câștigătorului devine neclar; O singură variabilă trebuie izolată.
  • Luarea deciziilor cu mostre insuficiente. Diferența din primele ore este adesea întâmplătoare.
  • Testare fără ipoteze. Testarea „Să vedem ce se întâmplă” nu produce învățare; Mai întâi scrieți la ce vă așteptați.
  • Confundând rezultatul „Fără diferență” ca un eșec. Lipsa unei diferențe semnificative este, de asemenea, informativă.
  • Alegerea câștigătorului în funcție de gust. Testarea este tocmai pentru a exclude gustul personal; Urmăriți datele.
  • Uitând factorii externi. Sezonul, ziua campaniei, fluxul de știri pot distorsiona rezultatul; Păstrați condițiile de testare corecte.
Atenție: Scopul testării A/B nu este de a „câștiga”, ci de a învăța. Chiar și o variantă care pierde este o informație valoroasă; Pierderea reală este să te bazezi pe rezultatul greșit cu date insuficiente și să legați bugetul de acesta.

În concluzie

Testarea A/B este o metodă puternică care mută deciziile de publicitate de la idee la date. Regula de aur este să izolați o singură variabilă: un singur element ar trebui să se schimbe într-un test, restul ar trebui să rămână constant. Al doilea pilon este eșantionarea adecvată și semnificația statistică; Declararea unui câștigător cu puține date este cea mai scumpă greșeală. AI este de ajutor în generarea mai multor variante și în calcularea și interpretarea cotelor, dar datele determină câștigătorul, nu AI. Chiar și rezultatul „fără diferență” este o învățare. Ipoteza, metrica și pragul de decizie trebuie scrise înainte de începerea testului.

Sarcina de aplicare

Alegeți o reclamă (titlu, imagine sau CTA). (1) Scrieți o singură ipoteză testabilă și o variabilă izolată cu „Ipoteza și proiectarea testului”. (2) Generați 1 control + 3 variante cu „Generator de variante”; Doar schimba acel element. (3) Planificați ce metrică veți analiza, pentru cât timp și cu ce date, cu „planul de măsurare”. (4) Notează-ți în avans pragul pentru declararea câștigătorului (câte conversii / ce semnificație). (5) Luați în considerare rezultatele ipotetice cu un „interpret de rezultate” și notați de ce nu ați lua o decizie într-un scenariu în care datele sunt insuficiente.

lista de verificare

  • [ ] Am izolat o singură variabilă în test.
  • [ ] Am scris o ipoteză clară înainte de test.
  • [ ] Am stabilit deja eșantionul și timpul necesar câștigătorului.
  • [ ] Am ales câștigătorul pe baza datelor, nu a gustului personal.
  • [ ] Am considerat rezultatul „fără diferență” drept învățare validă.
  • [ ] Am verificat dacă există factori externi care ar putea distorsiona rezultatul.