واحد 7 / 11

p-hacking، HARKing و یکپارچگی آماری: دام در عصر هوش مصنوعی

سود:

  • درک کنید که هک کردن p، HARKing، گزارش انتخابی، و باغ مسیرهای انشعابی یافته‌های نادرست ایجاد می‌کنند و ببینید که چگونه هوش مصنوعی می‌تواند این تله‌ها را تسریع کند.
  • امکان ایجاد دفاعی مانند پیش ثبت نام، طرح تحلیل، رشته مقایسه چندگانه و تحلیل حساسیت با پشتیبانی هوش مصنوعی
  • توانایی درونی کردن طرح درخواست صادقانه که هوش مصنوعی را قادر می‌سازد تا درخواست‌های نوع «پیدا کردن نتیجه معنادار» را رد کند و مسئولیت نهایی بر عهده محقق است.

در واحد قبلی دیدیم که p-value چیست و چیست. در این بخش به موضوع تیره‌تری می‌پردازیم، تله‌های سیستماتیکی که یکپارچگی آماری را تهدید می‌کنند. بیشتر اینها تقلب عمدی نیستند. اینها مکانیسم های موذیانه ای هستند که حتی محققین خوش نیت هم بدون اینکه متوجه باشند در آن قرار می گیرند. و هوش مصنوعی (AI) این دام‌ها را آسان‌تر و سریع‌تر می‌کند، زیرا امکان اجرای ده‌ها تحلیل را در چند ثانیه فراهم می‌کند. هدف این واحد ایجاد نظم و انضباط است که هوش مصنوعی را از یک "ماشین نتیجه یابی معنادار" به یک دستیار صادق تبدیل کند.

دام های اساسی

p-hacking (p-value hunting): مجدداً آنالیز را به روش های مختلف امتحان می کند تا نتیجه قابل توجهی به دست آید (p<0.05). افزودن و حذف متغیرها، انتخاب نمونه‌های فرعی، تغییر تعریف نقاط پرت، تلاش برای تبدیل‌های مختلف، استفاده از متغیرهای نتیجه متفاوت، توقف جمع‌آوری داده‌ها در صورت معنی‌دار شدن... هر تلاش «فرصتی» جدید می‌دهد. اگر به اندازه کافی تلاش کنید، یکی از آنها معنادار خواهد بود، حتی اگر واقعاً تأثیری نداشته باشد. نتیجه: یافته‌های جعلی منتشر شد اما قابل تکرار نبود.

HARKing (Hypothesizing After the Results Known) : فرضیه سازی پس از مشاهده نتایج و ارائه آن به صورت «از ابتدا اینطور پیش بینی کرده بودم». شما به داده ها نگاه می کنید و چشمگیرترین رابطه را پیدا می کنید، سپس مقاله را طوری می نویسید که گویی برای آزمایش این فرضیه طراحی شده است. این باعث گمراهی خواننده می شود و این کشف را تایید می کند.

گزارش انتخابی (گیلاس چیدن): از ده ها تحلیل، فقط «خوب» ها را گزارش می دهد و بقیه را بی صدا دفن می کند. این به عنوان «مشکل کشوی فایل» نیز شناخته می‌شود: نتایج بی‌معنی در کشو باقی می‌مانند و ادبیات را به‌طور سیستماتیک سوگیری می‌کنند.

باغ مسیرهای دوشاخه: اصطلاح اندرو گلمن. حتی بدون یک هک عمدی p، محقق بر اساس داده ها (کدام متغیر، کدام آستانه، کدام زیرگروه، کدام تبدیل) انتخاب های معقول زیادی انجام می دهد. این درجات آزادی تحقیقاتی به قدری زیاد است که شما به طور مؤثری از بین بسیاری از تجزیه و تحلیل‌ها، یک مورد معنادار را انتخاب می‌کنید - حتی بدون هیچ قصد بدی. نتیجه دوباره افزایش نرخ مثبت کاذب است.

احتیاط: بیشتر این تله ها ترفندهای عمدی نیستند. مجموع گام‌های به‌ظاهر بی‌گناهی مانند «من همین الان چند مدل دیگر را امتحان کردم»، «وقتی قسمت بیرونی را حذف کردم تمیزتر بود»، «اثر در این زیرگروه واضح‌تر است» می‌تواند یافته‌ای جعلی ایجاد کند. صداقت یک امر روشی است نه نیت.

چرا هوش مصنوعی این تله ها را بزرگ می کند؟

امتحان کردن 3 مدل با دست زمان بر است. YZ 50 مدل مدل، 10 تبدیل مختلف، 8 زیر گروه را در عرض چند دقیقه تولید می کند. این قدرت بدون یک برنامه صادقانه فاجعه آمیز است: درخواستی مانند "یافتن یک رابطه معنادار در این داده ها" یا "ساخت مدلی که از این فرضیه پشتیبانی می کند" هوش مصنوعی را مستقیماً به یک موتور هک p تبدیل می کند. هوش مصنوعی همچنین می خواهد مفید باشد. تمایل به یافتن یک نتیجه "معنی" دارد که شما را راضی کند. به همین دلیل است که طراحی سریع شما اولین خط دفاعی صداقت است.

دفاعیات: مسیر عادلانه تجارت

1. پیش ثبت نام: به معنای ثبت فرضیه، متغیرها، مدل و آزمون های خود به صورت کتبی (احتمالاً در یک پلت فرم دارای مهر زمان) قبل از انجام تجزیه و تحلیل است. بنابراین، کشف از تأیید جدا می شود; هر چیزی که پس از آن تغییر دهید با عنوان "کاوشگر" برچسب گذاری می شود.

2. طرح تجزیه و تحلیل: حتی اگر نمی توانید از قبل ضبط کنید، قبل از فرو رفتن در داده ها، یک طرح تحلیل بنویسید: فرضیه اولیه، متغیر نتیجه اولیه، مدل اصلی. تمایز بین «تحلیل اصلی» و «تحلیل اضافی/اکتشافی» را از ابتدا مشخص کنید و آن را در گزارش حفظ کنید.

3. همه چیز را گزارش دهید: مدل هایی را که امتحان کرده اید پنهان نکنید. در بخش "تجزیه و تحلیل حساسیت" (بررسی استحکام) نشان دهید که چگونه مشخصات مختلف نتیجه را تغییر می دهد. این یافته تنها در صورتی قوی است که در بسیاری از گزینه های قابل قبول باقی بماند.

4. رشته مقایسه چندگانه: اگر تست های زیادی انجام داده اید، آنها را تصحیح کنید (واحد 6). به سوال "چند تست انجام داده ام؟" پاسخ دهید. صادقانه

5. تجزیه و تحلیل حساسیت: یافته اصلی خود را با یک نمونه متفاوت، مجموعه کنترل متفاوت و تغییر شکل متفاوت تکرار کنید. اگر نتیجه تغییر کرد، آن را پنهان نکنید، گزارش دهید.

نمودار مقایسه: صادق در مقابل تله

برنامه

شکل تله

معادل صادقانه

انتخاب مدل

تلاش کنید تا زمانی که منطقی شود (p-hacking)

مدل اصلی از پیش برنامه ریزی شده

فرضیه

تناسب پس از واقعیت (HARKing)

از پیش ضبط شده، قبل از داده

گزارش دهی

فقط زیباها را نشان نده

تمام مشخصات + حساسیت

زیر گروه

انتخاب چشمگیرترین

از پیش تعریف شده، قابل اصلاح

جمع آوری داده ها

زمانی که منطقی شد متوقف شوید

نمونه از پیش تعیین شده

چهار فرمان قابل کپی

1. چارچوب ادعای صادقانه:

نقش شما: دستیار آمار صادق. هدف من یافتن یک نتیجه معنادار نیست، بلکه یافتن نتیجه درست است. قوانین: - به من پیشنهادهای نوع "مدل ها را امتحان کنید تا زمانی که منطقی نیست" به من ندهید، - اگر چندین مشخصات را پیشنهاد می کنید به من بگویید که همه آنها باید گزارش شوند، - در مورد هر مرحله ای که می تواند منجر به هک p شود به من هشدار دهید. به من کمک کنید ابتدا مدل اصلی خود را روشن کنم، کشف را از تایید جدا کنم.

2. پیش نویس طرح تحلیل:

به من کمک کنید تا یک طرح تحلیل اولیه برای یک مطالعه تهیه کنم: فرضیه اولیه، متغیر نتیجه اولیه، مشخصات مدل اصلی، زیر گروه های از پیش تعریف شده، استراتژی مقایسه چندگانه. تحلیل های «اکتشافی» و «تأییدکننده» را در سرفصل های جداگانه قرار دهید. به من یادآوری کن که این را بدون نگاه کردن به داده ها پر کنم.

3. تجزیه و تحلیل حساسیت:

یافته اصلی من نوشتن کد تحلیل حساسیت (R) برای هدف من این است که ببینم نتیجه چقدر محکم است، نه انتخاب بهترین. نمایش همه نتایج

4. خود نظارتی:

من روند تجزیه و تحلیل خود را توضیح خواهم داد. یک چک لیست برای p-hacking / HARKing / گزارش انتخابی به من بدهید و علامت بزنید که کدام یک از مراحل من خطرناک است. از من بپرسید که چند مدل/آزمایش را امتحان کرده‌ام و کدام‌ها را می‌خواهم گزارش کنم.

اعلان ضعیف / اعلان قوی

اعلان ضعیف:

کدام متغیرها روابط معنی داری را در این داده ها نشان می دهند، بهترین مدل را پیدا کنید.

این دستور یک دستورالعمل مستقیم هک p است: هوش مصنوعی ده ها ترکیب را امتحان می کند و ترکیبی را ارائه می دهد که "بیشترین منطق را دارد." نتیجه تقریباً به طور قطع یک یافته ساختگی است که قابل تکرار نیست.

اعلان قدرتمند:

نقش شما: دستیار صادق. مدل اصلی که من از قبل تعیین کرده‌ام این است: کنترل‌های Y ~ X +. کدی بنویسید که این مدل را پیش بینی کند. به دنبال مدل «معنادارتر» دیگری نباشید. همچنین یک تحلیل حساسیت پیشنهاد دهید تا بتوانم استحکام نتیجه را ببینم، اما بدانید که همه نتایج را گزارش خواهم کرد، نه بهترین را انتخاب کنم. اجازه ندهید هر یافته اکتشافی را به عنوان "تأیید شده" بنویسم.

تفاوت: اراده قوی مدل اصلی را اصلاح می کند، جستجو را ممنوع می کند و نیاز به گزارش همه نتایج دارد.

سه کیف کوچک

مورد 1 - شکار زیرگروهی. یک محقق هیچ تاثیری در نمونه کلی پیدا نکرد. او از هوش مصنوعی پرسید که در کدام زیرگروه مهم است؟ YZ ترکیبات سن، جنسیت و منطقه را اسکن کرد و "0.03 = p در زنان شهری 35-44 ساله" یافت. مقاله بر اساس این زیرگروه بود. تکرار او هیچ تاثیری پیدا نکرد: این نتیجه تصادف ده ها زیرگروه بود. درس: گروه فرعی انتخاب شده پس از HARK شدن داده ها، تایید نشدن.

مورد 2 - شکار تبدیلی. رابطه ای که در سطح دانشجویی بی معنی است. آن را در اشکال log، root مربع، مربع و lag امتحان کرد. او p=0.048 را در فرم log-log پیدا کرد و فقط آن را گزارش کرد. خوشبختانه یکی از 5 فرم امتحان شده از آستانه عبور کرد. روش صحیح این بود: از پیش انتخاب فرم با تئوری و نشان دادن نتیجه تمام فرم ها در جدول حساسیت. درس: گزارش انتخابی اهمیت کاذب تولید می کند.

مورد 3 - نحوه کار کادربندی صادقانه یک تیم قبل از تجزیه و تحلیل از قبل ثبت نام کرد: فرضیه اولیه تک، مدل اصلی واحد، دو زیر گروه از پیش تعریف شده، تصحیح بونفرونی. تأثیر اصلی مهم نبود، اما تیم صادقانه آن را گزارش کرد. فرد اکتشافی یک یافته را به عنوان "نیاز به آزمایش در آینده" علامت گذاری کرد. مطالعه تکرارپذیر و قابل اعتماد بود. درس: برنامه ریزی صادقانه حتی نتیجه "شکست" را نیز ارزشمند می کند.

اشتباهات رایج

  • به هوش مصنوعی گفتن "نتایج معنی دار" را پیدا کند. این مستقیماً هک p است. هوش مصنوعی را در چارچوبی صادقانه قرار دهید، نه از نتایج، بلکه از دقت بخواهید.
  • ارائه کشف به عنوان تایید (HARKing). این گمراه کننده است که فرضیه ایجاد شده پس از داده ها را به عنوان "من آن را از ابتدا پیش بینی کردم" بنویسیم. به یافته های اکتشافی برچسب بزنید.
  • فقط گزارش نتایج خوب نمایش تمام مشخصات تست شده؛ پنهان کردن تحلیل احساسات صداقت را به خطر می اندازد.
  • غربالگری زیرگروه/تبدیل. انتخاب مهم‌ترین آنها از میان ده‌ها زیرگروه یا تبدیل، یافته‌های جعلی ایجاد می‌کند. از قبل شناسایی و رفع شود.
  • فراموش کردن چند آزمایش که انجام داده اید. تعداد کل تلاش ها را پیگیری کنید. هیچ p-value را نمی توان صادقانه بدون دانستن این عدد تفسیر کرد.
نکته: قبل از نوشتن یک یافته، از خود بپرسید: "چند راه را بی سر و صدا امتحان کرده ام تا زمانی که این نتیجه را پیدا کنم، و آیا همه آنها را گزارش می کنم؟" اگر برخی از مقالات در کشو باقی بمانند، گزارش شما قوی تر از آنچه هست به نظر می رسد.

به طور خلاصه

p-hacking، HARKing، گزارش انتخابی، و باغ مسیرهای انشعابی. بسیاری از آنها تله هایی هستند که ناخواسته عمل می کنند اما یافته های جعلی و غیرقابل تکرار را تولید می کنند. هوش مصنوعی این مشکلات را تسریع می‌کند زیرا می‌تواند ده‌ها تحلیل را فوراً امتحان کند. درخواست های نوع «پیدا کردن نتایج معنادار» هوش مصنوعی را به یک موتور هک p تبدیل می کند. دفاع؛ جداسازی کشف از تایید با یک طرح پیش ثبت نام و تجزیه و تحلیل، گزارش تمام مشخصات و تجزیه و تحلیل حساسیت، اصلاح مقایسه های متعدد و قرار دادن هوش مصنوعی در چارچوبی صادقانه که "نتیجه صحیح" را می طلبد. مسئولیت نهایی همیشه بر عهده محقق است.

وظیفه کاربردی

یک سوال تحقیق را انتخاب کنید و قبل از مشاهده داده ها یک طرح تحلیل مختصر بنویسید: فرضیه اولیه، مدل اصلی، متغیر نتیجه اولیه، زیر گروه های از پیش تعریف شده، استراتژی مقایسه چندگانه. سپس مدل اصلی را تخمین بزنید. سپس یک تجزیه و تحلیل حساسیت انجام دهید (کنترل های مختلف، موارد پرت شامل / حذف شده، فرم تابع متفاوت) و همه نتایج را در یک جدول نشان دهید. در یک پاراگراف، ارزیابی کنید که کدام مراحل خطر هک p را ایجاد می کنند و چگونه چارچوب صادقانه شما آنها را محدود می کند.

چک لیست

  • [ ] من قبل از فرو رفتن در داده ها، طرح تحلیل/مدل اصلی را نوشتم.
  • [ ] من تجزیه و تحلیل های اکتشافی و تاییدی را جداگانه برچسب گذاری کردم. من HARKing نبودم
  • [ ] من تمام مشخصاتی را که امتحان کرده ام گزارش کرده ام. من فقط زیبا را انتخاب نکردم.
  • [ ] من زیر گروه ها و تبدیل ها را از قبل تعریف کردم، بعد از داده ها آنها را اسکن نکردم.
  • [ ] تعداد تست هایی که انجام داده بودم را پیگیری کردم و اصلاحات لازم را اعمال کردم.
  • [ ] من از هوش مصنوعی در زمینه «یافتن حقیقت» به جای «معنی پیدا کردن آن» استفاده کردم. من مسئولیت پذیرفتم