واحد 6 / 11

آزمون فرضیه و p-value: اهمیت، قدرت و مقایسه‌های چندگانه

سود:

  • امکان تعریف صحیح فرضیه صفر، p-value، فاصله اطمینان و توان آماری و استفاده از هوش مصنوعی در انتخاب و تفسیر آزمون.
  • توانایی تشخیص اینکه چه چیزی یک مقدار p است و چه چیزی نیست (بدون اندازه اثر، نه احتمال دقت) و درک اینکه چرا اصلاح مقایسه چندگانه ضروری است.
  • توانایی تشخیص نظرات ایجاد شده توسط هوش مصنوعی که معنی‌داری را با مادی بودن اشتباه می‌گیرد و آنها را با اندازه اثر و عدم قطعیت گزارش می‌کند.

پرکاربردترین و اشتباه ترین ابزار آمار، آزمون فرضیه است. ایده اصلی ساده است: ما یک ادعا داریم (مثلاً "میانگین این دو گروه متفاوت است") و مخالف آن، یک فرضیه صفر (H0 - "در واقع هیچ تفاوتی وجود ندارد"). آزمون میزان مطابقت داده ها با فرضیه صفر را اندازه گیری می کند. در این بخش خواهیم دید که هوش مصنوعی (AI) چگونه انتخاب و تفسیر تست را آسان‌تر می‌کند، اما چرا دام‌های اطراف p-value بسیار رایج و خطرناک هستند. بیایید از ابتدا شروع کنیم: هوش مصنوعی می‌داند کدام دستور آزمایشی را بنویسد. اما وظیفه شما این است که تفسیر کنید که آیا فرض آزمون راضی است و نتیجه واقعاً به چه معناست.

در واقع مقدار p چیست؟

مقدار p احتمال این است که نتیجه ای که مشاهده می کنید، یا یک نتیجه شدیدتر، به طور تصادفی رخ دهد، زمانی که فرضیه صفر درست باشد (یعنی در واقع هیچ اثری وجود ندارد). یک مقدار p کوچک (0.05 آستانه سنتی است) به این معنی است که "اگر واقعاً هیچ تأثیری وجود نداشته باشد دیدن چنین داده‌هایی شگفت‌انگیز خواهد بود". این شواهدی علیه فرضیه صفر در نظر گرفته می شود.

حالا بیایید روشن کنیم که مقدار p چیست - که هوش مصنوعی اغلب آن را اشتباه می گیرد:

  • مقدار p احتمال درستی فرضیه صفر نیست. 03/0=p به این معنی نیست که "احتمال 3% عدم تاثیر وجود دارد".
  • p-value اندازه اثر را نشان نمی دهد. یک اثر بسیار کوچک ممکن است یک مقدار p کوچک در یک نمونه بزرگ ایجاد کند.
  • p-value معنی یا واقعی بودن یافته را ثابت نمی کند. "قابل توجه" یک اصطلاح آماری است، "معنی دار" یک قضاوت است.
  • p>0.05 به معنای "بدون اثر" نیست. این به این معنی است که "ما نتوانستیم اثر را با این داده ها نشان دهیم." فقدان مدرک دلیل بر غیبت نیست.
احتیاط: رایج‌ترین اشتباه در تفسیر هوش مصنوعی، ارائه کلمه «مهم» به عنوان «تاثیر قابل توجه/قوی/مهم» است. اهمیت آماری و اهمیت عملی دو چیز متفاوت هستند. همیشه این دو را جداگانه گزارش کنید.

فاصله اطمینان و اندازه اثر: اطلاعات غنی تر

به جای یک مقدار p منفرد، فاصله اطمینان بسیار آموزنده تر است: محدوده قابل قبولی از مقادیر را برای برآورد شما ارائه می دهد. جمله "اثر 1200، 95% فاصله اطمینان [300، 2100]" هم جهت، هم اندازه و هم عدم قطعیت را نشان می دهد. "p<0.05" فقط می گوید "دور از صفر". روش آماری مدرن از p-value نه به تنهایی استفاده می کند. گزارش دهی با سه اندازه اثر + فاصله اطمینان + p-value را توصیه می کند.

قدرت آماری و نمونه

قدرت آماری احتمال تشخیص اثری است که واقعاً وجود دارد (1 منهای احتمال خطای نوع II، یعنی "فقدان اثر واقعی"). یک مطالعه کم توان در معرض دو خطر است: (1) اثرات واقعی را از دست می دهد (منفی کاذب). (2) نتایج معدودی که به نظر می رسند قابل توجه هستند، دارای مقادیر متورم هستند - به اصطلاح نفرین برنده، زیرا فقط پیش بینی های متورم می توانند از آستانه عبور کنند. بنابراین، محاسبه توان/نمونه قبل از تجزیه و تحلیل، تمرین خوبی است. هوش مصنوعی کد این حساب را تولید می کند. اندازه اثر هدف را با تئوری تعیین می کنید.

مشکل مقایسه چندگانه

هنگام انجام آزمایش، آستانه 0.05 به معنای "5٪ خطر مثبت کاذب" است. اما اگر 20 تست انجام دهید، به طور متوسط ​​انتظار می رود که یک مورد به طور تصادفی 05/0p< بدهد، حتی اگر همه آنها واقعاً بی اثر باشند. به این مشکل مقایسه چندگانه می گویند. احتمال مثبت کاذب به سرعت افزایش می یابد زمانی که تعداد زیادی از متغیرها، زیر گروه ها یا متغیرهای نتیجه آزمایش شوند. راه حل این است که آستانه را اصلاح کنید: بونفرونی (تقسیم آستانه بر تعداد آزمایش - سخت)، روش های هولم یا بنجامینی-هوچبرگ که نرخ کشف نادرست (FDR) را کنترل می کنند. این خطر در عصر هوش مصنوعی حتی بیشتر می شود، زیرا هوش مصنوعی می تواند ده ها آزمایش را در چند ثانیه انجام دهد - این موضوع مستقیم واحد بعدی (هک p) است.

جدول مقایسه: مقدار p چه می گوید و چه چیزی نمی گوید

بیان

آیا حقیقت دارد؟

توضیحات

"p=0.02، احتمال عدم تاثیر 2٪ است"

اشتباه

p احتمال H0 نیست

"p<0.05، اثر بزرگ است"

اشتباه

p اندازه را نشان نمی دهد

"p=0.20، بدون تاثیر"

اشتباه

نشان ندادن غیبت نیست

"p<0.05، شواهدی علیه H0 وجود دارد"

درست است

محتاط و دقیق

"اثر 1.200 [300;2.100]، p=0.01"

بهترین

اندازه + عدم قطعیت + شواهد

چهار فرمان قابل کپی

1. انتخاب آزمون مناسب:

نقش شما: دستیار آزمون آماری. می خواهم میانگین دو گروه مستقل (متغیر پیوسته) را با هم مقایسه کنم. به من بگویید: کدام آزمون مناسب است (با مفروضاتش: نرمال بودن، برابری واریانس)، گزینه جایگزین اگر این فرض برآورده نشد (مثلاً ولش، من ویتنی)، و کد R. من نتیجه را اجرا می کنم و مفروضات را بررسی می کنم.

2. گزارش صحیح p-value:

خروجی تست را در زیر گزارش کنید، اما قوانین: - مقدار p را به‌عنوان "احتمال H0" یا "اندازه اثر" ارائه ندهید، - مطمئن شوید که اندازه اثر و فاصله اطمینان 95٪ را لحاظ کنید، - "معنی‌دار" و "معنی‌دار" را جداگانه بنویسید، - اگر p>0.05، نگویید "بدون اثر"، بگویید "ما نتوانستیم نشان دهیم". خروجی: [چسباندن]

3. محاسبه قدرت/نمونه:

من در حال برنامه ریزی یک آزمایش هستم: دو گروه، اندازه اثر مورد انتظار (d کوهن) ~ 0.4، توان 0.80، آلفا 0.05. کد R را بنویسید که حجم نمونه مورد نیاز (بسته pwr) را محاسبه می کند و خطرات یک مطالعه کم توان (نفرین برنده) را توضیح می دهد.

4. تصحیح مقایسه چندگانه:

من 15 آزمون فرضیه جداگانه انجام داده ام و مقدار p دارم. کد R را بنویسید که اصلاحات Bonferroni و Benjamin-Hochberg (FDR) را اعمال کند، تفاوت بین دو روش را توضیح دهید و در یک جمله خلاصه کنید که چرا نباید به p<0.05 خالی اعتماد کنم.

اعلان ضعیف / اعلان قوی

اعلان ضعیف:

آیا نتیجه این تست معنادار است؟ در مورد نتیجه نظر دهید.

این ادعا هوش مصنوعی را در باینری «معنادار/غیر معنادار» به دام می‌اندازد. به احتمال زیاد جمله ای تولید می کند که بزرگی را با اهمیت اشتباه می گیرد، مانند "بله، مهم است، تأثیر قوی است."

اعلان قدرتمند:

نقش شما: دستیار آماری دقیق. نتیجه را تفسیر کنید اما: (1) اندازه اثر + 95% فاصله اطمینان + مقدار p را با هم بدهید، (2) اهمیت را از معنی‌داری جدا کنید، (3) p>0.05 در "نمی‌توانم نشان دهم"، (4) بپرسید چند آزمایش انجام دادم. اگر بیش از یک مورد، اصلاح مقایسه چندگانه را پیشنهاد دهید، (5) یادآوری کنید که فرضیات آزمون باید بررسی شوند.

تفاوت: اعلان قوی گزارش های غنی را اعمال می کند و در برابر تله های p-value محافظت می کند.

سه کیف کوچک

مورد 1 - "اهمیت" غیر قابل توجه در نمونه بزرگ. یک تحلیلگر در داده‌ها با 500000 مشاهده، میانگین تفاوت بین دو گروه را «بسیار معنی‌دار» در 001/0p< یافت. اما این تفاوت تنها 0.3 امتیاز (از 100) بود و عملاً بی معنی بود. نمونه عظیم حتی این تفاوت کوچک را «معنی‌دار» کرد. وقتی اندازه اثر گزارش شد، یافته ناچیز بود. درس: اهمیت قدر نیست. اگر n بزرگ باشد، هر تفاوت معنادار است.

مورد 2 - توهم آزمایش چندگانه. یک تیم 22 متغیر نتیجه را آزمایش کرد. یکی از آنها 04/0=p نشان داد و به عنوان «اثر را پیدا کردیم» اعلام شد. با تصحیح بونفرونی، آستانه به 0.05/22 = 0.0023 کاهش یافت. 0.04 از این آستانه عبور نکرد. تنها نتیجه "معنادار" از بین 22 آزمایش تصادفی بود. درس: هنگام آزمایش زیاد، اصلاح لازم است.

مورد 3 - ناتوانی و نفرین برنده. یک مطالعه مقدماتی کوچک (15 نفر در هر گروه) اثری بسیار بزرگ (9/0=d) و معنی‌دار پیدا کرد. یک مطالعه تکرار بزرگ اثر را به 0.2 = d کاهش داد. نمونه کوچک فقط اجازه داده بود که یک تخمین بیش از حد از آستانه عبور کند. درس: نمی توان به اندازه افکت های قابل توجه در توان کم اعتماد کرد.

اشتباهات رایج

  • اشتباه گرفتن معناداری با اهمیت/میزان. اثر بزرگ نیست فقط به این دلیل که p کوچک است. اندازه افکت را جداگانه گزارش کنید.
  • اشتباه گرفتن مقدار p با احتمال H0. p "احتمال عدم تاثیر" نیست. از نظر مفهومی متفاوت است
  • خواندن p>0.05 به عنوان "بدون اثر". عدم نشان دادن دلیلی بر غیبت نیست. عدم قطعیت را بیان کنید.
  • برای چند تست اصلاح نمی شود. تعداد زیادی از آزمایشات مثبت کاذب تولید می کنند. Bonferroni/FDR را اعمال کنید.
  • نادیده گرفتن قدرت اثر قابل توجه در نمونه کوچک اغراق آمیز است. محاسبه توان قبل از تجزیه و تحلیل
نکته: قبل از اینکه نتیجه را به‌عنوان «معنی‌دار» بنویسید، دو سؤال بپرسید: «آیا تأثیر عملاً مهم است (میزان)؟» و "قبل از اینکه این نتیجه را پیدا کنم چند آزمایش انجام دادم؟" سوال دوم آزمون تورنسل صداقت است.

به طور خلاصه

آزمون فرضیه و p-value ابزارهای قدرتمندی هستند که درک درستی ندارند. مقدار p احتمال مشاهده داده ها در زمانی است که فرضیه صفر درست باشد. احتمال H0 بزرگی اثر یا اهمیت یافته نیست. همیشه اهمیت را همراه با اندازه اثر و فاصله اطمینان گزارش کنید. p>0.05 را به عنوان "بدون اثر" نخوانید. اگر تست های زیادی انجام داده اید، اصلاح مقایسه چندگانه را اعمال کنید. از خطر اثرات اغراق آمیز ناشی از مطالعات کم توان آگاه باشید. هوش مصنوعی کد آزمایش و طرح اولیه را تولید می کند. این مسئولیت شماست که بین معنی دار بودن و با اهمیت بودن تمایز قائل شوید و مفروضات را بررسی کنید.

وظیفه کاربردی

مقایسه میانگین ها بین دو گروه در یک مجموعه داده انجام دهید. از هوش مصنوعی تست مناسب (با مفروضاتش) و کد بخواهید، آن را اجرا کنید و مفروضات را بررسی کنید. نتیجه را با سه جزء گزارش دهید: اندازه اثر، فاصله اطمینان 95٪، مقدار p. سپس به این فکر کنید که چند مقایسه مختلف می توانید روی یک داده انجام دهید. اگر چندین آزمایش انجام داده اید، اصلاح Bonferroni یا FDR را اعمال کنید و اگر نتیجه همچنان پابرجاست گزارش دهید. در نهایت، یک ارزیابی قدرت تقریبی برای تحلیل خود بنویسید.

چک لیست

  • [ ] من آزمون را با فرضیات آن انتخاب کردم و فرضیات را بررسی کردم.
  • [ ] من نتیجه را به عنوان اندازه اثر + فاصله اطمینان + p-value گزارش کردم.
  • [ ] من "مهم" و "مهم" را جدا نگه داشتم. من فکر نمی کردم p احتمال H0 باشد.
  • [ ] من p>0.05 را به عنوان "ما نتوانستیم آن را نشان دهیم" به جای "بدون اثر" نوشتم.
  • [ ] در صورت اجرای چندین آزمایش، اصلاح مقایسه چندگانه را اعمال کردم.
  • [ ] من قدرت نمونه برداری را ارزیابی کردم. من در مورد اندازه اثر در قدرت کم محتاط بودم.