יחידה 9 / 11

בדיקות A/B ותכנון ניסוי: בנייה ומשמעות וריאציות

רווחים:

  • יכולת להבין את המושגים של בדיקת A/B, בקרה/וריאנט, שיעור המרה ומובהקות סטטיסטית ולבסס השערות ועיצובי בדיקה עם בינה מלאכותית.
  • יכולת לבודד את המשתנה הבודד שייבדק ולייצר טקסט/תמונה ותוכנית מדידה וריאנטית עם תמיכה בבינה מלאכותית
  • היכולת להבחין כי פרשנות המבחנים של בינה מלאכותית מוגבלת על ידי גודל המדגם והמובהקות והסיכון לקריאת תוצאות מוקדמות/שגויות

המשפט המסוכן ביותר בפרסום הוא "אני חושב שזה עדיף". נתונים, לא דעה, אומרים לך אם כותרת, תמונה או כפתור באמת טובים יותר. הדרך הנפוצה ביותר למדוד זאת היא בדיקת A/B: הצגת שתי גרסאות (או יותר) של אותה מודעה למשתמשים אמיתיים והשוואה איזו מהן עובדת טוב יותר. "A" היא בדרך כלל הגרסה הנוכחית (שליטה), בעוד "B" היא הגרסה החדשה שניסתה (וריאנט). לדוגמה, אתה יכול רק לשנות את הכותרת באותה מודעה ולמדוד על איזו כותרת לוחצים יותר. בינה מלאכותית מועילה בתהליך זה הן ביצירת מספר רב של גרסאות והן בפירוש התוצאה; אבל התוקף המדעי של הבדיקה תלוי בכללי התכנון ובסבלנות.

כלל הזהב של בדיקת A/B: משתנה אחד

הכלל הבסיסי ביותר של בדיקת A/B הוא לבודד משתנה בודד. אם תשנה את הכותרת, התמונה והכפתור בו-זמנית וגרסה B תנצח, לעולם לא תדע מה ניצח. אז במבחן רק אלמנט אחד צריך להשתנות, השאר צריך להישאר קבוע. אם אתה רוצה לבדוק יותר מפריט אחד בו-זמנית ושיטתית, זה נקרא בדיקה רב-משתנית ודורש מדגם גדול בהרבה; בדיקת A/B חד משתנית היא הדרך להתחיל.

מושג היסוד השני הוא מובהקות סטטיסטית. נניח שגרסה A קיבלה 3 אחוז קליקים וגרסה B קיבלה 3.3 אחוז קליקים. האם ההבדל הזה הוא יתרון אמיתי או מזל? אם תראה את הבדיקה רק ל-100 אנשים, ההבדל הזה יכול להיות מקרי. מובהקות סטטיסטית פירושה שההבדל הנצפה אינו סביר מספיק שהוא נובע מקריות (כלומר, ההבדל הוא כנראה אמיתי). זה דורש גודל מדגם מספיק (מספר אנשים שרואים את הבדיקה). הכרזת "מנצח" עם מעט נתונים היא הטעות הנפוצה והיקרה ביותר.

טיפ: לפני תחילת המבחן, ענו על השאלה "מתי אכריז על הזוכה": כמה אנשים/אחרי המרה, באיזו רמת מובהקות. קבלת החלטה זו מראש מונעת מכם להיתפס לרעש בשעות הראשונות ולקבל החלטה מוקדמת.

הטבלה הבאה משווה תכנון בדיקות A/B טוב ורע:

פריט

עיצוב גרוע

עיצוב טוב

מספר משתנים

כותרת + תמונה + כפתור יחד

כותרת בלבד

השערה

(אף אחד) "בוא נראה מה קורה"

"כותרות עם שאלות מגדילות את הקליקים"

מדגם

80 איש

מניין מחושב מראש

זמן החלטה

2 שעות לאחר מכן

כשמגיעים למשמעות

בחירת הזוכה

"אני חושב ש-B זה נחמד"

מבוסס על נתונים ומשמעות

שלב אחר שלב: הגדרת מבחן A/B

שלב 1 - כתוב השערה. מה אתה בודק ולמה? השערה ברורה כמו "כותרת עם יתרונות מקבלת יותר קליקים מאשר כותרת עם תכונות".

שלב 2 - בחר משתנה בודד. רק הכותרת, או רק התמונה, או רק ה-CTA.

שלב 3 - צור גרסאות. צור גרסאות שונות של אותו פריט עם AI; לשמור את השאר קבוע.

שלב 4 - הגדר תוכנית מדידה. איזה מדד יקבע את המנצח (שיעור קליקים, המרה), כמה דגימה נדרשת, כמה זמן לרוץ.

שלב 5 — פרש ואמת את התוצאה. האם נאספו מספיק נתונים, האם ההבדל משמעותי? אם זה לא משמעותי, "אין הבדל" הוא גם תוצאה תקפה.

שלושה מיני תיקים

מקרה 1 - בהירות של משתנה בודד. מותג מסחר אלקטרוני בדק רק CTA במודעת המוצר שלו: "קנה" ו"הוסף לסל". כל השאר היה אותו דבר. לאחר מספיק דגימה, "הוסף לעגלה" הביא המרות גבוהות משמעותית. ניתן לפרש את ההבדל בבירור מכיוון שמשתנה בודד היה מבודד. AI הפיקה שני CTAs, הנתונים בחרו את המנצח.

מקרה 2 - מלכודת החלטה מוקדמת. מותג עצר את המבחן כי גרסה B הקדימה ב-3 השעות הראשונות של מבחן A/B ופתחה את B לכל התקציב. בהסתכלות על סך הנתונים למחרת, A היה למעשה מעט טוב יותר; ההבדל בשעות הראשונות היה מקרי. התקציב התבזבז. טעות: קבלת החלטה מוקדמת עם גודל מדגם לא מספיק.

מקרה 3 - "אין הבדל" היא גם המסקנה. מותג בדק שתי תמונות שונות, ולאחר מספיק דגימה, שניהם הניבו כמעט את אותה תוצאה. בעוד שהצוות עמד לבכות על כך שה"מבחן נכשל", הקריאה הנכונה הייתה שהתמונה היא לא הגורם המכריע בקמפיין הזה, ולכן יש להפנות את המאמץ לכותרת ולהצעה. גם העובדה שלא נמצא הבדל משמעותי היא מידע רב ערך.

ארבע תבניות הניתנות להעתקה

1) השערה ועיצוב מבחן:

מה אני רוצה לבדוק: [למשל. כותרת המודעה].משימה: (1) כתוב השערה יחידה הניתנת לבדיקה (בצורה "... מגדילה ... עולה").(2) רשום את המשתנה הבודד לבודד ואת אלו שיש לשמור על קבועים.(3) הצע את המדד שיקבע את המנצח (שיעור קליקים/המרה).(4) כתוב מה אני צריך לשים לב לאמת את הבדיקה, החלטה מוקדמת,).

2) מחולל וריאנטים (גרסה בודדת):

מודעה דביקה: תמונה [אותה], קריאה לפעולה [אותה], יעד [אותה]. משתנה שנבדק: HEADLINE. הודעה ראשית: "[הודעה]". משימה: צור 4 גרסאות שונות של כותרות עם אותה הודעה. כל אחד משתמש בגישה שונה (שאלה, תועלת, מספר, דחיפות). רק הכותרת משתנה; הוספת טענה לא מבוססת.

3) תוכנית מדידה:

מבחן: [הגדרה של A ו-B]. מדד: [קליק/המרה].משימה: נסח תוכנית מדידה:(1) איזה מדד הוא ראשוני, אילו הם משניים,(2) כמה נתונים/זמן נדרשים כדי להכריז על המנצח (הסבירו את ההיגיון),(3) איך לפצל את התעבורה באופן שווה והוגן בין A ל-B,(4) אילו גורמים חיצוניים יכולים לעוות את התוצאה (הכלי המדויק של עונה, יום בשבוע שאשתמש בו).

4) מתורגמן לתוצאות (זהירות):

תוצאות בדיקת ה-A/B שלי (נתונים אמיתיים): [A: הופעות/קליקים/המרה],[B: הופעות/קליקים/המרה].משימה: (1) חשב והצג את השיעורים של כל גרסה.(2) הגיבו על גודל ההבדל, אבל אם המדגם אינו מספיק, אמור "לא מספיק נתונים לתוצאה משמעותית."(3) Remind the definitive/remind the risk of premature of the claim. משמעות; אאשר באמצעות כלי חשבון נפרד.

הנחיה חלשה / הנחיה חזקה

הנחיה חלשה:

הפק גרסת A ו-B עבור המודעה שלי, אמור לי איזו מהן טובה יותר.

המשתנה אינו מבודד, אין השערה ומדידה; בינה מלאכותית לא יכולה לדעת מי מהן "טובה" בלי נתונים, היא מפצה אותה.

הנחיה עוצמתית:

אני מגדיר בדיקות A/B. תוקן: התמונה והקריאה לפעולה יישארו זהים. רק משתנה נבדק: כותרת מודעה. השערה: "כותרת עם מספרים מקבלת יותר קליקים מאשר כותרת כללית." הודעה ראשית: "נמסר תוך 3 ימים." משימה: (1) הפקת כותרת כללית אחת לבקרה, 3 כותרות עם מספרים לגרסה.(2) ספר לי באיזה מדד אני צריך למדוד את הטעות של 3 להזכיר לי את הטעות הזו. עלול לפסול את המבחן. אל תחזה מי מהם ינצח; הנתונים יקבעו זאת.

הטענה השנייה מבודדת משתנה בודד, כוללת השערה ומדידה; משאיר את המנצח לנתונים.

טעויות נפוצות

  • החלפת פריטים רבים בבת אחת. הסיבה לזוכה הופכת לא ברורה; יש לבודד משתנה בודד.
  • קבלת החלטות עם דגימות לא מספיקות. ההבדל בשעות הראשונות הוא לרוב מקרי.
  • בדיקה ללא השערות. מבחן "בואו נראה מה קורה" לא מייצר למידה; תחילה רשום מה אתה מצפה.
  • טעות בתוצאה "אין הבדל" ככישלון. היעדר הבדל משמעותי הוא גם אינפורמטיבי.
  • בחירת הזוכה לפי הטעם. הבדיקה היא בדיוק כדי לשלול טעם אישי; עקוב אחר הנתונים.
  • שוכחים גורמים חיצוניים. עונה, יום קמפיין, זרימת חדשות יכולים לעוות את התוצאה; שמור על תנאי בדיקה הוגנים.
שימו לב: מטרת בדיקת A/B היא לא "לנצח" אלא ללמוד. אפילו וריאנט מפסיד הוא מידע בעל ערך; ההפסד האמיתי הוא הסתמכות על תוצאה שגויה עם נתונים לא מספיקים וקשירת התקציב אליה.

לסיכום

בדיקת A/B היא שיטה רבת עוצמה המעבירה החלטות פרסום מרעיון לנתונים. כלל הזהב הוא לבודד משתנה בודד: רק אלמנט אחד צריך להשתנות במבחן, השאר צריך להישאר קבוע. הנדבך השני הוא דגימה נאותה ומובהקות סטטיסטית; הכרזת מנצח עם מעט נתונים היא הטעות היקרה ביותר. AI מועיל ביצירת גרסאות מרובות וחישוב ופירוש סיכויים, אבל הנתונים קובעים את המנצח, לא את ה-AI. אפילו התוצאה "אין הבדל" היא למידה. יש לכתוב את ההשערה, המדד וסף ההחלטה לפני תחילת המבחן.

משימת יישום

בחר קריאייטיב (כותרת, תמונה או קריאה לפעולה). (1) כתוב השערה יחידה הניתנת לבדיקה ומשתנה מבודד עם "השערה ותכנון מבחן". (2) צור שליטה אחת + 3 גרסאות עם "מחולל וריאנטים"; פשוט שנה את האלמנט הזה. (3) תכננו על איזה מדד תסתכלו, לכמה זמן ועם אילו נתונים, בעזרת "תכנית המדידה". (4) רשום מראש את רף ההכרזה על הזוכה (כמה המרות / איזו משמעות). (5) שקלו תוצאות היפותטיות עם "מתורגמן תוצאות" ושימו לב מדוע לא הייתם מקבלים החלטה בתרחיש שבו הנתונים אינם מספיקים.

רשימת בדיקה

  • [ ] בודדתי רק משתנה אחד בבדיקה.
  • [ ] כתבתי השערה ברורה לפני המבחן.
  • [ ] כבר קבעתי את המדגם ואת הזמן הנדרש עבור הזוכה.
  • [ ] בחרתי את הזוכה על סמך נתונים, לא על פי טעם אישי.
  • [ ] התייחסתי לתוצאת "אין הבדל" כלמידה תקפה.
  • [ ] בדקתי גורמים חיצוניים שעלולים לעוות את התוצאה.