واحد 9 / 11

تست A/B و طراحی تجربی: ساخت و اهمیت متفاوت

سود:

  • توانایی درک مفاهیم تست A/B، کنترل/نوع، نرخ تبدیل و اهمیت آماری و ایجاد فرضیه و طرح تست با هوش مصنوعی.
  • امکان جداسازی تک متغیر مورد آزمایش و تولید متن/تصویر متغیر و طرح اندازه گیری با پشتیبانی هوش مصنوعی
  • توانایی تشخیص اینکه تفسیر آزمون هوش مصنوعی با حجم نمونه و اهمیت و خطر خواندن نتایج نادرست یا زودرس محدود است.

خطرناک ترین جمله در تبلیغات این است که «به نظر من این بهتر است». داده ها، نه نظر، به شما می گویند که آیا یک عنوان، یک تصویر یا یک دکمه واقعا بهتر است. رایج‌ترین روش برای اندازه‌گیری این، تست A/B است: نمایش دو (یا بیشتر) نسخه از یک آگهی به کاربران واقعی و مقایسه اینکه کدام یک بهتر عمل می‌کند. "A" معمولاً نسخه فعلی (کنترل) است، در حالی که "B" نسخه جدیدی است که در حال آزمایش است (نوع). به عنوان مثال، شما فقط می توانید عنوان را در همان تبلیغ تغییر دهید و اندازه گیری کنید که کدام عنوان بیشتر کلیک شده است. هوش مصنوعی در این فرآیند هم در تولید تعداد زیادی از انواع و هم در تفسیر نتیجه مفید است. اما اعتبار علمی آزمون به قوانین طراحی و صبر بستگی دارد.

قانون طلایی تست A/B: یک متغیر

اساسی ترین قانون تست A/B جداسازی یک متغیر است. اگر عنوان، تصویر و دکمه را همزمان تغییر دهید و نسخه B برنده شود، هرگز نمی دانید چه چیزی برنده شد. بنابراین در یک تست فقط یک عنصر باید تغییر کند، بقیه باید ثابت بماند. اگر می خواهید بیش از یک مورد را به طور همزمان و سیستماتیک آزمایش کنید، این تست چند متغیره نامیده می شود و به نمونه بسیار بزرگتری نیاز دارد. تست A/B تک متغیره راهی برای شروع است.

دومین مفهوم اساسی معناداری آماری است. فرض کنید نسخه A 3 درصد کلیک و نسخه B 3.3 درصد کلیک داشته است. آیا این تفاوت یک مزیت واقعی است یا یک اتفاق؟ اگر تست را فقط به 100 نفر نشان دهید، این تفاوت می تواند تصادفی باشد. اهمیت آماری به این معنی است که تفاوت مشاهده شده به اندازه کافی بعید است که به دلیل شانس باشد (یعنی تفاوت احتمالا واقعی است). این به حجم نمونه کافی (تعداد افرادی که آزمون را می بینند) نیاز دارد. اعلام "برنده" با داده های کم رایج ترین و گران ترین اشتباه است.

نکته: قبل از شروع آزمون، به این سؤال پاسخ دهید "چه زمانی برنده را اعلام خواهم کرد": چند نفر / پس از تبدیل، در چه سطح اهمیتی. گرفتن این تصمیم از قبل باعث می شود که در همان ساعات اولیه درگیر سروصدا نشوید و تصمیمی زودهنگام بگیرید.

جدول زیر طراحی خوب و بد تست A/B را مقایسه می کند:

مورد

طراحی بد

طراحی خوب

تعداد متغیرها

Title + image + button together

فقط عنوان

فرضیه

(هیچ) "ببینم چه می شود"

"عناوین دارای سوال باعث افزایش کلیک می شوند"

نمونه

80 نفر

حد نصاب از پیش محاسبه شده

زمان تصمیم گیری

2 ساعت بعد

وقتی به اهمیت رسیدی

انتخاب برنده

"به نظر من B خوب است"

بر اساس داده ها و اهمیت

گام به گام: راه اندازی تست A/B

مرحله 1 - یک فرضیه بنویسید. چه چیزی را تست می کنید و چرا؟ یک فرضیه واضح مانند "عنوان با مزایا تعداد کلیک های بیشتری نسبت به عنوان دارای ویژگی ها دریافت می کند."

مرحله 2 - یک متغیر را انتخاب کنید. فقط عنوان، یا فقط تصویر، یا فقط CTA.

مرحله 3 - انواع مختلف را ایجاد کنید. با هوش مصنوعی نسخه های مختلف یک مورد را ایجاد کنید. keep the rest constant.

مرحله 4 - یک برنامه اندازه گیری تنظیم کنید. کدام معیار برنده (نرخ کلیک، تبدیل)، تعداد نمونه مورد نیاز، مدت زمان اجرا را تعیین می کند.

مرحله 5 - نتیجه را تفسیر و تأیید کنید. آیا داده های کافی جمع آوری شده است، آیا تفاوت معنی دار است؟ اگر معنی دار نباشد، «عدم تفاوت» نیز نتیجه معتبری است.

سه کیف کوچک

مورد 1 - وضوح یک متغیر واحد. یک برند تجارت الکترونیک فقط CTA را در تبلیغ محصول خود آزمایش کرد: «خرید» و «افزودن به سبد خرید». بقیه چیزها هم همینطور بود. پس از نمونه برداری کافی، «افزودن به سبد خرید» تبدیل به میزان قابل توجهی بالاتر را به همراه داشت. این تفاوت را می توان به وضوح تفسیر کرد زیرا یک متغیر منفرد جدا شده بود. هوش مصنوعی دو CTA تولید کرد، داده ها برنده را انتخاب کردند.

مورد 2 - تله تصمیم گیری زودهنگام. یک برند تست را متوقف کرد زیرا نسخه B در 3 ساعت اول تست A/B جلوتر بود و B را به کل بودجه باز کرد. با نگاهی به کل داده های روز بعد، A در واقع کمی بهتر بود. تفاوت در ساعات اول تصادفی بود. بودجه به هدر رفت. اشتباه: تصمیم گیری زودهنگام با حجم نمونه ناکافی.

مورد 3 - "بدون تفاوت" نیز نتیجه گیری است. یک برند دو تصویر مختلف را آزمایش کرد و پس از نمونه برداری کافی، هر دو تقریباً یک نتیجه را به دست آوردند. در حالی که تیم قصد داشت از اینکه "آزمون شکست خورده است" ابراز تاسف کند، قرائت صحیح این بود که تصویر عامل تعیین کننده در این کمپین نیست، بنابراین تلاش باید به سمت عنوان و پیشنهاد باشد. این واقعیت که تفاوت معنی داری پیدا نشد نیز اطلاعات ارزشمندی است.

چهار قالب قابل کپی

1) فرضیه و طراحی آزمون:

چیزی که می خواهم آزمایش کنم: [به عنوان مثال. عنوان آگهی]. وظیفه: (1) یک فرضیه منفرد قابل آزمایش بنویسید (به شکل «... افزایش می‌دهد ... افزایش می‌یابد»). (2) متغیرهای منفرد را برای جداسازی و آنهایی که ثابت نگه دارند فهرست کنید. (3) معیاری را پیشنهاد کنید که برنده را تعیین می‌کند (نرخ کلیک/تبدیل).

2) ژنراتور متغیر (تک نوع):

تبلیغ چسبنده: تصویر [همان]، CTA [همان]، هدف [همان]. متغیر تست شده: HEADLINE. پیام اصلی: "[پیام]". وظیفه: 4 نوع تیتر مختلف با یک پیام ایجاد کنید. هر کدام از یک رویکرد متفاوت (سوال، مزیت، شماره، فوریت) استفاده می کنند. فقط تیتر تغییر می کند. افزودن یک ادعای غیرمستند.

3) طرح اندازه گیری:

تست: [تعریف الف و ب]. متریک: [کلیک کنید/تبدیل]. وظیفه: یک طرح اندازه گیری پیش نویس کنید: (1) کدام معیار اولیه است، کدام ثانویه، (2) چه مقدار داده/زمان برای اعلام برنده لازم است (منطق را توضیح دهید)، (3) چگونه ترافیک را به طور مساوی و منصفانه بین A و B تقسیم کنیم، (4) چه عوامل خارجی می توانند مجموع ابزاری را که در هفته استفاده می شود مخدوش کنند. محاسبه آمار دقیق

4) مترجم نتایج (دقت):

نتایج آزمون A/B من (داده‌های واقعی): [A: impressions/clicks/conversion]، [B: impressions/clicks/conversion]. وظیفه: (1) محاسبه و نمایش نرخ‌های هر نسخه. (2) در مورد بزرگی تفاوت نظر دهید، اما اگر نمونه کافی نیست، بگویید "داده‌های ریسک (3) برای یک نتیجه معنی‌دار ناکافی است." نابهنگام/نادرست خواندن. من با یک ابزار حساب جداگانه تایید می کنم.

اعلان ضعیف / اعلان قوی

اعلان ضعیف:

نسخه A و B را برای تبلیغ من تولید کنید، به من بگویید کدام یک بهتر است.

متغیر جدا نیست، فرضیه و اندازه گیری وجود ندارد. هوش مصنوعی بدون داده نمی تواند بفهمد کدام یک "خوب" است، بلکه آن را می سازد.

اعلان قدرتمند:

من در حال راه اندازی تست A/B هستم. ثابت شد: تصویر و CTA ثابت خواهند ماند. فقط متغیر مورد آزمایش قرار گرفت: عنوان آگهی. فرضیه: "کلیک های تیتر دارای اعداد بیشتر از عنوان عمومی است." پیام اصلی: "در 3 روز تحویل می شود." وظیفه: (1) یک عنوان کلی برای کنترل تولید کنید، 3 عنوان با اعداد برای تغییر ایجاد کنید. از 3 اشتباهی که می تواند آزمون را باطل کند. پیش بینی نکنید که کدام یک برنده خواهد شد. داده ها آن را تعیین خواهند کرد.

ادعای دوم یک متغیر واحد را جدا می کند، شامل فرضیه و اندازه گیری است. برنده را به داده ها واگذار می کند.

اشتباهات رایج

  • تغییر چندین مورد به طور همزمان دلیل برنده نامشخص می شود. یک متغیر منفرد باید ایزوله شود.
  • تصمیم گیری با نمونه های ناکافی تفاوت در ساعات اول اغلب تصادفی است.
  • تست بدون فرضیه "بیایید ببینیم چه اتفاقی می افتد" آزمایش باعث یادگیری نمی شود. ابتدا آنچه را که انتظار دارید بنویسید.
  • اشتباه گرفتن نتیجه "بدون تفاوت" به عنوان یک شکست. عدم وجود تفاوت قابل توجه نیز آموزنده است.
  • انتخاب برنده بر اساس سلیقه آزمایش دقیقاً برای رد سلیقه شخصی است. داده ها را دنبال کنید.
  • فراموش کردن عوامل خارجی فصل، روز مبارزات انتخاباتی، جریان اخبار می تواند نتیجه را مخدوش کند. شرایط آزمایش را منصفانه نگه دارید.
توجه: هدف از تست A/B "برنده شدن" نیست بلکه یادگیری است. حتی یک نوع از دست دادن اطلاعات ارزشمند است. ضرر واقعی تکیه بر نتیجه اشتباه با داده های ناکافی و گره زدن بودجه به آن است.

به طور خلاصه

تست A/B یک روش قدرتمند است که تصمیمات تبلیغاتی را از ایده به داده منتقل می کند. قانون طلایی جدا کردن یک متغیر است: فقط یک عنصر باید در یک آزمایش تغییر کند، بقیه باید ثابت بماند. رکن دوم، نمونه گیری کافی و معنادار آماری است. اعلام برنده با داده های کم گران ترین اشتباه است. هوش مصنوعی در تولید انواع مختلف و محاسبه و تفسیر شانس مفید است، اما داده ها برنده را تعیین می کنند، نه هوش مصنوعی. حتی نتیجه "بدون تفاوت" یک یادگیری است. فرضیه، متریک و آستانه تصمیم باید قبل از شروع آزمون نوشته شود.

وظیفه کاربردی

یک خلاقیت (عنوان، تصویر یا CTA) انتخاب کنید. (1) یک فرضیه منفرد قابل آزمون و متغیر مجزا با «فرضیه و طرح آزمون» بنویسید. (2) با "Variant Generator" 1 کنترل + 3 نوع تولید کنید. فقط آن عنصر را تغییر دهید. (3) با «طرح اندازه‌گیری»، به کدام معیار، برای چه مدت و با چه داده‌هایی نگاه می‌کنید، برنامه‌ریزی کنید. (4) آستانه خود را برای اعلام برنده (چند تبدیل / چه اهمیتی) از قبل یادداشت کنید. (5) نتایج فرضی را با "مفسر نتیجه" در نظر بگیرید و توجه داشته باشید که چرا در سناریویی که داده ها کافی نیست، تصمیم نمی گیرید.

چک لیست

  • [ ] من فقط یک متغیر را در آزمون جدا کردم.
  • [ ] من قبل از آزمون یک فرضیه واضح نوشتم.
  • [ ] من قبلاً نمونه و زمان مورد نیاز برای برنده را مشخص کرده ام.
  • [ ] من برنده را بر اساس داده ها و نه سلیقه شخصی انتخاب کردم.
  • [ ] من نتیجه «بدون تفاوت» را به عنوان یادگیری معتبر در نظر گرفتم.
  • [ ] من عوامل خارجی را بررسی کردم که می تواند نتیجه را مخدوش کند.