zisky:
- Schopnost porozumět pojmům A/B testování, kontrola/varianta, konverzní poměr a statistická významnost a stanovit hypotézy a návrhy testů s umělou inteligencí.
- Schopnost izolovat jednu testovanou proměnnou a vytvořit variantní text/obrázek a plán měření s podporou umělé inteligence
- Schopnost rozlišit, že interpretace testu umělé inteligence je omezena velikostí a významem vzorku a rizikem předčasného/nesprávného čtení výsledků
Nejnebezpečnější věta v reklamě je "Myslím, že tohle je lepší." Data, nikoli názor, vám řeknou, zda je skutečně lepší nadpis, obrázek nebo tlačítko. Nejběžnějším způsobem měření je A/B testování: zobrazení dvou (nebo více) verzí stejné reklamy skutečným uživatelům a porovnání, která z nich funguje lépe. "A" je obvykle aktuální verze (kontrola), zatímco "B" je zkoušená nová verze (varianta). Můžete například změnit pouze nadpis ve stejné reklamě a měřit, na který nadpis se kliklo více. Umělá inteligence je v tomto procesu nápomocna jak při generování velkého množství variant, tak při interpretaci výsledku; Ale vědecká platnost testu závisí na pravidlech návrhu a trpělivosti.
Zlaté pravidlo A/B testování: jedna proměnná
Nejzákladnějším pravidlem A/B testování je izolovat jednu proměnnou. Pokud změníte název, obrázek a tlačítko současně a vyhraje verze B, nikdy nebudete vědět, co vyhrálo. Takže v testu by se měl změnit pouze jeden prvek, zbytek by měl zůstat konstantní. Pokud chcete testovat více než jednu položku současně a systematicky, nazývá se to vícerozměrné testování a vyžaduje mnohem větší vzorek; Jednorozměrné A/B testování je způsob, jak začít.
Druhým základním pojmem je statistická významnost. Řekněme, že verze A získala 3 procenta kliknutí a verze B získala 3,3 procenta kliknutí. Je tento rozdíl skutečnou výhodou nebo náhodou? Pokud byste test ukázali pouze 100 lidem, tento rozdíl by mohl být náhodný. Statistická významnost znamená, že pozorovaný rozdíl je dostatečně nepravděpodobný, aby byl způsoben náhodou (tj. rozdíl je pravděpodobně skutečný). To vyžaduje dostatečnou velikost vzorku (počet lidí, kteří test vidí). Vyhlášení „vítěze“ s malým množstvím dat je nejběžnější a nejdražší chybou.
Tip: Před zahájením testu si odpovězte na otázku „kdy vyhlásím vítěze“: kolik lidí/po konverzi, na jaké hladině významnosti. Toto rozhodnutí předem zabrání tomu, abyste se v prvních hodinách chytili do hluku a učinili předčasné rozhodnutí.
Následující tabulka porovnává dobrý a špatný design testu A/B:
položka
špatný design
dobrý design
Počet proměnných
Název + obrázek + tlačítko dohromady
pouze titul
hypotéza
(žádný) "uvidíme, co se stane"
"Názvy s otázkami zvyšují počet kliknutí"
vzorek
80 lidí
Předem vypočítané kvorum
čas rozhodování
o 2 hodiny později
Když dosáhnete významu
Výběr vítěze
"Myslím, že B je hezké"
Na základě dat a významnosti
Krok za krokem: nastavení A/B testu
Krok 1 — Napište hypotézu. Co testujete a proč? Jasná hypotéza jako „Nadpis s výhodami získá více kliknutí než nadpis s funkcemi.“
Krok 2 — Vyberte jednu proměnnou. Jen název, nebo jen obrázek, nebo jen CTA.
Krok 3 — Vygenerujte varianty. Vytvářejte různé verze stejného předmětu pomocí AI; zbytek udržujte konstantní.
Krok 4 — Nastavte plán měření. Která metrika určí vítěze (míra prokliku, konverze), kolik vzorku je potřeba, jak dlouho běží.
Krok 5 — Interpretujte a ověřte výsledek. Bylo shromážděno dostatek dat, je rozdíl významný? Pokud není významný, je platným výsledkem také „žádný rozdíl“.
tři mini pouzdra
Případ 1 – Jasnost jedné proměnné. Značka elektronického obchodu testovala ve své produktové reklamě pouze CTA: „Koupit“ a „Vložit do košíku“. Všechno ostatní bylo stejné. Po dostatečném vzorkování přineslo „Přidat do košíku“ výrazně vyšší konverze. Rozdíl lze jasně interpretovat, protože byla izolována jedna proměnná. AI vytvořila dvě CTA, vítěze vybrala data.
Případ 2 – Past včasného rozhodnutí. Značka zastavila test, protože verze B byla napřed v prvních 3 hodinách testu A/B a otevřela B pro celý rozpočet. Když se podíváme na celkové údaje následující den, A bylo ve skutečnosti o něco lepší; Rozdíl v prvních hodinách byl náhodný. Rozpočet byl promarněn. Chyba: předčasné rozhodnutí s nedostatečnou velikostí vzorku.
Případ 3 — „Žádný rozdíl“ je také závěr. Značka testovala dva různé obrázky a po dostatečném navzorkování oba přinesly téměř stejný výsledek. Zatímco se tým chystal naříkat, že „test selhal“, správné čtení bylo, že obrázek není v této kampani rozhodujícím faktorem, takže úsilí by mělo být zaměřeno na titulek a nabídku. Cennou informací je i fakt, že nebyl zjištěn žádný významný rozdíl.
Čtyři kopírovatelné šablony
1) Návrh hypotézy a testu:
Co chci otestovat: [např. ad title].Úkol: (1) Napište jednu testovatelnou hypotézu (ve tvaru "... zvyšuje ... zvyšuje").(2) Uveďte jednu proměnnou, kterou chcete izolovat, a ty, které se mají udržovat konstantní.(3) Navrhněte metriku, která určí vítěze (míra prokliku/konverze).(4) Napište, na co si musím dát pozor, abych test validoval (vzorek, trvání, riziko předčasného rozhodnutí).
2) Generátor variant (jediná varianta):
Reklama s pevným umístěním: obrázek [stejný], výzva k akci [stejný], cíl [stejný]. Testovaná proměnná: HEADLINE. Hlavní zpráva: "[zpráva]". Úkol: Vygenerujte 4 různé varianty nadpisu se stejným sdělením. Každá používá jiný přístup (otázka, přínos, počet, naléhavost). Mění se pouze nadpis; Přidání nepodloženého tvrzení.
3) Plán měření:
Test: [Definice A a B]. Metrika: [kliknutí/konverze].Úkol: Navrhněte plán měření:(1) která metrika je primární, která je sekundární,(2) kolik dat/času je potřeba k vyhlášení vítěze (vysvětlete logiku),(3) jak rozdělit provoz rovnoměrně a spravedlivě mezi A a B,(4) jaké vnější faktory mohou výsledek zkreslit (sezóna, den v týdnu). Předpokládejme, že použiji nástroj k výpočtu přesných statistik.
4) Tlumočník výsledků (opatrný):
Moje výsledky A/B testu (skutečné údaje): [A: imprese/kliknutí/konverze],[B: imprese/kliknutí/konverze].Úkol: (1) Vypočítejte a zobrazte míry jednotlivých verzí.(2) Vyjádřete se k velikosti rozdílu, ale pokud vzorek není dostatečný, řekněte „nedostatečná data pro smysluplný výsledek.“(3) Připomeňte si rizika předčasného čtení. Potvrdím pomocí nástroje pro samostatný účet.
Slabá výzva / Silná výzva
Slabá výzva:
Vytvořte verzi A a B pro mou reklamu, řekněte mi, která je lepší.
Proměnná není izolovaná, neexistuje žádná hypotéza a měření; Umělá inteligence bez dat nemůže vědět, který z nich je „dobrý“, tvoří je.
Výkonná výzva:
Nastavuji A/B testování. Opraveno: obrázek a výzva k akci zůstanou stejné. Testována pouze proměnná: nadpis reklamy.Hypotéza: „Nadpis s čísly získává více kliknutí než obecný nadpis.“Hlavní zpráva: „Doručeno za 3 dny.“ Úkol: (1) Vytvořte 1 obecný nadpis pro kontrolu, 3 nadpisy s čísly pro variantu. (2) Řekněte mi, na kterou metriku bych se měl podívat, chyby (3) Připomeňte mi neplatnost, abych změřil vítěze 3 test.Nepředvídejte, který z nich vyhraje; To určí data.
Druhý nárok izoluje jedinou proměnnou, zahrnuje hypotézu a měření; ponechává vítěze na datech.
Časté chyby
- Změna mnoha položek najednou. Důvod pro vítěze se stává nejasným; Jedna proměnná musí být izolována.
- Rozhodování s nedostatečnými vzorky. Rozdíl v prvních hodinách je často náhodný.
- Testování bez hypotéz. Testování „uvidíme, co se stane“ nepřináší učení; Nejprve napište, co očekáváte.
- Záměna výsledku „Žádný rozdíl“ za selhání. Neexistence významného rozdílu je také informativní.
- Výběr vítěze na základě vkusu. Testování je právě proto, aby se vyloučil osobní vkus; Postupujte podle údajů.
- Zapomínání na vnější faktory. Sezóna, den kampaně, tok zpráv může zkreslit výsledek; Udržujte podmínky testování spravedlivé.
Pozor: Účelem A/B testování není „vyhrát“, ale naučit se. I varianta prohry je cennou informací; Skutečnou ztrátou je spoléhat se na špatný výsledek s nedostatečnými daty a vázat na to rozpočet.
V souhrnu
A/B testování je výkonná metoda, která posouvá reklamní rozhodnutí od nápadu k datům. Zlatým pravidlem je izolovat jedinou proměnnou: v testu by se měl změnit pouze jeden prvek, zbytek by měl zůstat konstantní. Druhým pilířem je adekvátní výběr vzorků a statistická významnost; Vyhlášení vítěze s malým množstvím dat je ta nejdražší chyba. Umělá inteligence je užitečná při generování více variant a při výpočtu a interpretaci šancí, ale vítěze určují data, nikoli AI. I výsledek „žádný rozdíl“ je učením. Před zahájením testu by měla být napsána hypotéza, metrika a práh rozhodování.
Aplikační úkol
Vyberte kreativu (nadpis, obrázek nebo výzvu k akci). (1) Napište jednu testovatelnou hypotézu a izolovanou proměnnou pomocí "Hypotézy a návrhu testu". (2) Vygenerujte 1 ovládací prvek + 3 varianty s "Generátorem variant"; Stačí změnit ten prvek. (3) Naplánujte si, na kterou metriku se budete dívat, jak dlouho a s jakými údaji, pomocí „plánu měření“. (4) Zapište si předem svou hranici pro vyhlášení vítěze (kolik konverzí / jaký význam). (5) Zvažte hypotetické výsledky pomocí „interpretu výsledků“ a poznamenejte si, proč byste se nerozhodli ve scénáři, kdy jsou údaje nedostatečné.
kontrolní seznam
- [ ] V testu jsem izoloval pouze jednu proměnnou.
- [ ] Před testem jsem napsal jasnou hypotézu.
- [ ] Již jsem určil vzorek a čas potřebný pro vítěze.
- [ ] Vítěze jsem vybral na základě údajů, nikoli osobního vkusu.
- [ ] Výsledek „žádný rozdíl“ jsem považoval za platné učení.
- [ ] Zkontroloval jsem vnější faktory, které by mohly výsledek zkreslit.