Unità 9 / 11

Test A/B e progettazione sperimentale: costruzione e significato delle varianti

Guadagni:

  • Capacità di comprendere i concetti di test A/B, controllo/variante, tasso di conversione e significatività statistica e di stabilire ipotesi e testare progetti con l'intelligenza artificiale.
  • Capacità di isolare la singola variabile da testare e produrre varianti di testo/immagine e piano di misurazione con il supporto dell'intelligenza artificiale
  • Capacità di distinguere che l'interpretazione dei test dell'intelligenza artificiale è limitata dalla dimensione e dalla significatività del campione e dal rischio di leggere risultati prematuri/errati

La frase più pericolosa nella pubblicità è "Penso che questo sia meglio". I dati, non le opinioni, ti dicono se un titolo, un'immagine o un pulsante è davvero migliore. Il modo più comune per misurarlo è il test A/B: mostrare due (o più) versioni dello stesso annuncio a utenti reali e confrontare quale funziona meglio. "A" è solitamente la versione corrente (controllo), mentre "B" è la nuova versione provata (variante). Ad esempio, puoi modificare solo il titolo nello stesso annuncio e misurare quale titolo viene cliccato di più. L’intelligenza artificiale è utile in questo processo sia nel generare un gran numero di varianti sia nell’interpretare il risultato; Ma la validità scientifica del test dipende dalle regole di progettazione e dalla pazienza.

La regola d'oro del test A/B: una variabile

La regola più elementare del test A/B è isolare una singola variabile. Se cambi titolo, immagine e pulsante contemporaneamente e vince la versione B, non saprai mai cosa ha vinto. Quindi in un test dovrebbe cambiare solo un elemento, il resto dovrebbe rimanere costante. Se si desidera testare più di un elemento simultaneamente e sistematicamente, questo si chiama test multivariato e richiede un campione molto più ampio; Il test A/B univariato è il modo per iniziare.

Il secondo concetto fondamentale è la significatività statistica. Supponiamo che la versione A abbia ottenuto il 3% di clic e la versione B il 3,3% di clic. Questa differenza è un vero vantaggio o un colpo di fortuna? Se mostrassi il test solo a 100 persone, questa differenza potrebbe essere casuale. La significatività statistica significa che è sufficientemente improbabile che la differenza osservata sia dovuta al caso (vale a dire, la differenza è probabilmente reale). Ciò richiede una dimensione del campione sufficiente (numero di persone che vedono il test). Dichiarare un “vincitore” con pochi dati è l’errore più comune e costoso.

Suggerimento: prima di iniziare il test, rispondi alla domanda "quando dichiarerò il vincitore": quante persone/post-conversione, a quale livello di significatività. Prendere questa decisione in anticipo evita di farsi prendere dal rumore nelle prime ore e di prendere una decisione prematura.

La tabella seguente mette a confronto la progettazione del test A/B buona e quella cattiva:

elemento

pessima progettazione

buon disegno

Numero di variabili

Titolo + immagine + pulsante insieme

solo titolo

ipotesi

(nessuno) "vediamo cosa succede"

"I titoli con domande aumentano i clic"

campione

80 persone

Quorum precalcolato

momento della decisione

2 ore dopo

Quando raggiungi il significato

Selezione del vincitore

"Penso che B sia carino"

Basato su dati e significato

Passo dopo passo: impostare un test A/B

Passaggio 1: scrivere un'ipotesi. Cosa stai testando e perché? Un'ipotesi chiara come "Un titolo con vantaggi ottiene più clic di un titolo con funzionalità".

Passaggio 2: seleziona una variabile singola. Solo il titolo, o solo l'immagine, o solo il CTA.

Passaggio 3: genera varianti. Crea versioni diverse dello stesso oggetto con l'intelligenza artificiale; mantieni il resto costante.

Passaggio 4: impostare un piano di misurazione. Quale metrica determinerà il vincitore (percentuale di clic, conversione), la quantità di campione necessaria e la durata della pubblicazione.

Passaggio 5: interpretare e verificare il risultato. Sono stati raccolti dati sufficienti? La differenza è significativa? Se non è significativo, anche "nessuna differenza" è un risultato valido.

tre mini custodie

Caso 1 – Chiarezza di una singola variabile. Un marchio di e-commerce ha testato solo il CTA nell'annuncio del prodotto: "Acquista" e "Aggiungi al carrello". Tutto il resto era uguale. Dopo un sufficiente campionamento, "Aggiungi al carrello" ha portato conversioni significativamente più elevate. La differenza potrebbe essere interpretata chiaramente perché è stata isolata una singola variabile. L'intelligenza artificiale ha prodotto due CTA e i dati hanno scelto il vincitore.

Caso 2 – Trappola della decisione anticipata. Un brand ha interrotto il test perché la versione B era in vantaggio nelle prime 3 ore del test A/B e ha aperto la B all'intero budget. Guardando i dati totali il giorno successivo, A era in realtà leggermente migliore; La differenza nelle prime ore è stata casuale. Il budget è stato sprecato. Errore: prendere una decisione prematura con una dimensione del campione insufficiente.

Caso 3 – “Nessuna differenza” è anche la conclusione. Un brand ha testato due immagini diverse e, dopo un sufficiente campionamento, entrambe hanno prodotto quasi lo stesso risultato. Anche se il team stava per lamentarsi del "test fallito", la lettura corretta era che l'immagine non è il fattore decisivo in questa campagna, quindi lo sforzo dovrebbe essere diretto al titolo e all'offerta. Anche il fatto che non sia stata riscontrata alcuna differenza significativa è un'informazione preziosa.

Quattro modelli copiabili

1) Ipotesi e disegno del test:

Cosa voglio testare: [es. titolo dell'annuncio].Attività: (1) Scrivi una singola ipotesi verificabile (nella forma "... aumenta ... aumenta"). (2) Elenca la singola variabile da isolare e quelle da mantenere costanti. (3) Suggerisci la metrica che determinerà il vincitore (percentuale di clic/conversione). (4) Scrivi a cosa devo prestare attenzione per convalidare il test (campione, durata, rischio di decisione anticipata).

2) Generatore di varianti (variante singola):

Annuncio persistente: immagine [stesso], CTA [stesso], target [stesso]. Variabile testata: TITOLO. Messaggio principale: "[messaggio]". Compito: genera 4 diverse varianti di titolo con lo stesso messaggio. Ciascuno utilizza un approccio diverso (domanda, vantaggio, numero, urgenza). Cambia solo il titolo; Aggiunta di un'affermazione infondata.

3) Piano di misurazione:

Test: [Definizione di A e B]. Metrica: [clic/conversione].Attività: elaborare un piano di misurazione: (1) quali metriche sono primarie e quali secondarie, (2) quanti dati/tempo sono necessari per dichiarare il vincitore (spiegare la logica), (3) come suddividere il traffico in modo uniforme ed equo tra A e B, (4) quali fattori esterni possono distorcere il risultato (stagione, giorno della settimana). Supponiamo che utilizzerò uno strumento di significatività per calcolare statistiche esatte.

4) Interprete dei risultati (attento):

Risultati del mio test A/B (dati reali): [A: impressioni/clic/conversione],[B: impressioni/clic/conversione].Attività: (1) Calcolare e visualizzare le tariffe di ciascuna versione.(2) Commentare l'entità della differenza, ma se il campione non è sufficiente, dire "dati insufficienti per un risultato significativo".(3) Ricordare i rischi di lettura prematura/errata. Non fare alcuna dichiarazione definitiva di significatività; Confermerò con uno strumento di account separato.

Prompt debole / Prompt forte

Suggerimento debole:

Produci la versione A e B per il mio annuncio, dimmi qual è la migliore.

La variabile non è isolata, non esiste alcuna ipotesi e misurazione; L'intelligenza artificiale non può sapere quale sia "buono" senza dati, lo inventa.

Suggerimento potente:

Sto configurando i test A/B. Risolto: immagine e invito all'azione rimarranno gli stessi. Unica variabile testata: titolo dell'annuncio. Ipotesi: "Il titolo con numeri ottiene più clic del titolo generale." Messaggio principale: "Consegnato in 3 giorni." Compito: (1) Produrre 1 titolo generale per il controllo, 3 titoli con numeri per la variante. (2) Dimmi quale metrica dovrei guardare per misurare il vincitore. (3) Ricordami 3 errori che potrebbero invalidare il test. Non farlo pronosticare quale vincerà; Lo determineranno i dati.

La seconda affermazione isola una singola variabile, coinvolge ipotesi e misurazioni; lascia il vincitore ai dati.

Errori comuni

  • Modifica di molti elementi contemporaneamente. Il motivo del vincitore diventa poco chiaro; Una singola variabile deve essere isolata.
  • Prendere decisioni con campioni insufficienti. La differenza nelle prime ore è spesso casuale.
  • Test senza ipotesi. La sperimentazione “vediamo cosa succede” non produce apprendimento; Per prima cosa scrivi cosa ti aspetti.
  • Confondere il risultato "Nessuna differenza" come un fallimento. Anche la mancanza di una differenza significativa è informativa.
  • Scegliere il vincitore in base al gusto. Testare serve proprio ad escludere il gusto personale; Segui i dati.
  • Dimenticare i fattori esterni. La stagione, il giorno della campagna elettorale, il flusso di notizie possono distorcere il risultato; Mantenere le condizioni dei test eque.
Attenzione: lo scopo dell'A/B testing non è "vincere" ma imparare. Anche una variante persa è un'informazione preziosa; La vera perdita è fare affidamento su un risultato sbagliato con dati insufficienti e vincolare ad esso il bilancio.

In sintesi

Il test A/B è un metodo potente che sposta le decisioni pubblicitarie dall'idea ai dati. La regola d'oro è isolare una singola variabile: solo un elemento dovrebbe cambiare in un test, il resto dovrebbe rimanere costante. Il secondo pilastro è il campionamento adeguato e la significatività statistica; Dichiarare un vincitore con pochi dati è l’errore più costoso. L'intelligenza artificiale è utile per generare più varianti e calcolare e interpretare le probabilità, ma sono i dati a determinare il vincitore, non l'intelligenza artificiale. Anche il risultato "nessuna differenza" è un apprendimento. L'ipotesi, la metrica e la soglia decisionale dovrebbero essere scritte prima dell'inizio del test.

Compito dell'applicazione

Scegli una creatività (titolo, immagine o CTA). (1) Scrivere una singola ipotesi verificabile e una variabile isolata con "Ipotesi e disegno del test". (2) Genera 1 controllo + 3 varianti con "Generatore di varianti"; Basta cambiare quell'elemento. (3) Pianifica quale metrica esaminerai, per quanto tempo e con quali dati, con il “piano di misurazione”. (4) Annota in anticipo la tua soglia per dichiarare il vincitore (quante conversioni / quale significato). (5) Considera i risultati ipotetici con un "interprete dei risultati" e nota perché non prenderesti una decisione in uno scenario in cui i dati sono insufficienti.

lista di controllo

  • [ ] Ho isolato solo una variabile nel test.
  • [ ] Ho scritto un'ipotesi chiara prima del test.
  • [ ] Ho già determinato il campione e il tempo richiesto per il vincitore.
  • [ ] Ho scelto il vincitore in base ai dati, non al gusto personale.
  • [ ] Ho considerato il risultato "nessuna differenza" come un apprendimento valido.
  • [ ] Ho verificato la presenza di fattori esterni che potrebbero distorcere il risultato.