سود:
- درک کنید که هک کردن p، HARKing، گزارش انتخابی، و باغ مسیرهای انشعابی یافتههای نادرست ایجاد میکنند و ببینید که چگونه هوش مصنوعی میتواند این تلهها را تسریع کند.
- امکان ایجاد دفاعی مانند پیش ثبت نام، طرح تحلیل، رشته مقایسه چندگانه و تحلیل حساسیت با پشتیبانی هوش مصنوعی
- توانایی درونی کردن طرح درخواست صادقانه که هوش مصنوعی را قادر میسازد تا درخواستهای نوع «پیدا کردن نتیجه معنادار» را رد کند و مسئولیت نهایی بر عهده محقق است.
در واحد قبلی دیدیم که p-value چیست و چیست. در این بخش به موضوع تیرهتری میپردازیم، تلههای سیستماتیکی که یکپارچگی آماری را تهدید میکنند. بیشتر اینها تقلب عمدی نیستند. اینها مکانیسم های موذیانه ای هستند که حتی محققین خوش نیت هم بدون اینکه متوجه باشند در آن قرار می گیرند. و هوش مصنوعی (AI) این دامها را آسانتر و سریعتر میکند، زیرا امکان اجرای دهها تحلیل را در چند ثانیه فراهم میکند. هدف این واحد ایجاد نظم و انضباط است که هوش مصنوعی را از یک "ماشین نتیجه یابی معنادار" به یک دستیار صادق تبدیل کند.
دام های اساسی
p-hacking (p-value hunting): مجدداً آنالیز را به روش های مختلف امتحان می کند تا نتیجه قابل توجهی به دست آید (p<0.05). افزودن و حذف متغیرها، انتخاب نمونههای فرعی، تغییر تعریف نقاط پرت، تلاش برای تبدیلهای مختلف، استفاده از متغیرهای نتیجه متفاوت، توقف جمعآوری دادهها در صورت معنیدار شدن... هر تلاش «فرصتی» جدید میدهد. اگر به اندازه کافی تلاش کنید، یکی از آنها معنادار خواهد بود، حتی اگر واقعاً تأثیری نداشته باشد. نتیجه: یافتههای جعلی منتشر شد اما قابل تکرار نبود.
HARKing (Hypothesizing After the Results Known) : فرضیه سازی پس از مشاهده نتایج و ارائه آن به صورت «از ابتدا اینطور پیش بینی کرده بودم». شما به داده ها نگاه می کنید و چشمگیرترین رابطه را پیدا می کنید، سپس مقاله را طوری می نویسید که گویی برای آزمایش این فرضیه طراحی شده است. این باعث گمراهی خواننده می شود و این کشف را تایید می کند.
گزارش انتخابی (گیلاس چیدن): از ده ها تحلیل، فقط «خوب» ها را گزارش می دهد و بقیه را بی صدا دفن می کند. این به عنوان «مشکل کشوی فایل» نیز شناخته میشود: نتایج بیمعنی در کشو باقی میمانند و ادبیات را بهطور سیستماتیک سوگیری میکنند.
باغ مسیرهای دوشاخه: اصطلاح اندرو گلمن. حتی بدون یک هک عمدی p، محقق بر اساس داده ها (کدام متغیر، کدام آستانه، کدام زیرگروه، کدام تبدیل) انتخاب های معقول زیادی انجام می دهد. این درجات آزادی تحقیقاتی به قدری زیاد است که شما به طور مؤثری از بین بسیاری از تجزیه و تحلیلها، یک مورد معنادار را انتخاب میکنید - حتی بدون هیچ قصد بدی. نتیجه دوباره افزایش نرخ مثبت کاذب است.
احتیاط: بیشتر این تله ها ترفندهای عمدی نیستند. مجموع گامهای بهظاهر بیگناهی مانند «من همین الان چند مدل دیگر را امتحان کردم»، «وقتی قسمت بیرونی را حذف کردم تمیزتر بود»، «اثر در این زیرگروه واضحتر است» میتواند یافتهای جعلی ایجاد کند. صداقت یک امر روشی است نه نیت.
چرا هوش مصنوعی این تله ها را بزرگ می کند؟
امتحان کردن 3 مدل با دست زمان بر است. YZ 50 مدل مدل، 10 تبدیل مختلف، 8 زیر گروه را در عرض چند دقیقه تولید می کند. این قدرت بدون یک برنامه صادقانه فاجعه آمیز است: درخواستی مانند "یافتن یک رابطه معنادار در این داده ها" یا "ساخت مدلی که از این فرضیه پشتیبانی می کند" هوش مصنوعی را مستقیماً به یک موتور هک p تبدیل می کند. هوش مصنوعی همچنین می خواهد مفید باشد. تمایل به یافتن یک نتیجه "معنی" دارد که شما را راضی کند. به همین دلیل است که طراحی سریع شما اولین خط دفاعی صداقت است.
دفاعیات: مسیر عادلانه تجارت
1. پیش ثبت نام: به معنای ثبت فرضیه، متغیرها، مدل و آزمون های خود به صورت کتبی (احتمالاً در یک پلت فرم دارای مهر زمان) قبل از انجام تجزیه و تحلیل است. بنابراین، کشف از تأیید جدا می شود; هر چیزی که پس از آن تغییر دهید با عنوان "کاوشگر" برچسب گذاری می شود.
2. طرح تجزیه و تحلیل: حتی اگر نمی توانید از قبل ضبط کنید، قبل از فرو رفتن در داده ها، یک طرح تحلیل بنویسید: فرضیه اولیه، متغیر نتیجه اولیه، مدل اصلی. تمایز بین «تحلیل اصلی» و «تحلیل اضافی/اکتشافی» را از ابتدا مشخص کنید و آن را در گزارش حفظ کنید.
3. همه چیز را گزارش دهید: مدل هایی را که امتحان کرده اید پنهان نکنید. در بخش "تجزیه و تحلیل حساسیت" (بررسی استحکام) نشان دهید که چگونه مشخصات مختلف نتیجه را تغییر می دهد. این یافته تنها در صورتی قوی است که در بسیاری از گزینه های قابل قبول باقی بماند.
4. رشته مقایسه چندگانه: اگر تست های زیادی انجام داده اید، آنها را تصحیح کنید (واحد 6). به سوال "چند تست انجام داده ام؟" پاسخ دهید. صادقانه
5. تجزیه و تحلیل حساسیت: یافته اصلی خود را با یک نمونه متفاوت، مجموعه کنترل متفاوت و تغییر شکل متفاوت تکرار کنید. اگر نتیجه تغییر کرد، آن را پنهان نکنید، گزارش دهید.
نمودار مقایسه: صادق در مقابل تله
برنامه
شکل تله
معادل صادقانه
انتخاب مدل
تلاش کنید تا زمانی که منطقی شود (p-hacking)
مدل اصلی از پیش برنامه ریزی شده
فرضیه
تناسب پس از واقعیت (HARKing)
از پیش ضبط شده، قبل از داده
گزارش دهی
فقط زیباها را نشان نده
تمام مشخصات + حساسیت
زیر گروه
انتخاب چشمگیرترین
از پیش تعریف شده، قابل اصلاح
جمع آوری داده ها
زمانی که منطقی شد متوقف شوید
نمونه از پیش تعیین شده
چهار فرمان قابل کپی
1. چارچوب ادعای صادقانه:
نقش شما: دستیار آمار صادق. هدف من یافتن یک نتیجه معنادار نیست، بلکه یافتن نتیجه درست است. قوانین: - به من پیشنهادهای نوع "مدل ها را امتحان کنید تا زمانی که منطقی نیست" به من ندهید، - اگر چندین مشخصات را پیشنهاد می کنید به من بگویید که همه آنها باید گزارش شوند، - در مورد هر مرحله ای که می تواند منجر به هک p شود به من هشدار دهید. به من کمک کنید ابتدا مدل اصلی خود را روشن کنم، کشف را از تایید جدا کنم.
2. پیش نویس طرح تحلیل:
به من کمک کنید تا یک طرح تحلیل اولیه برای یک مطالعه تهیه کنم: فرضیه اولیه، متغیر نتیجه اولیه، مشخصات مدل اصلی، زیر گروه های از پیش تعریف شده، استراتژی مقایسه چندگانه. تحلیل های «اکتشافی» و «تأییدکننده» را در سرفصل های جداگانه قرار دهید. به من یادآوری کن که این را بدون نگاه کردن به داده ها پر کنم.
3. تجزیه و تحلیل حساسیت:
یافته اصلی من نوشتن کد تحلیل حساسیت (R) برای هدف من این است که ببینم نتیجه چقدر محکم است، نه انتخاب بهترین. نمایش همه نتایج
4. خود نظارتی:
من روند تجزیه و تحلیل خود را توضیح خواهم داد. یک چک لیست برای p-hacking / HARKing / گزارش انتخابی به من بدهید و علامت بزنید که کدام یک از مراحل من خطرناک است. از من بپرسید که چند مدل/آزمایش را امتحان کردهام و کدامها را میخواهم گزارش کنم.
اعلان ضعیف / اعلان قوی
اعلان ضعیف:
کدام متغیرها روابط معنی داری را در این داده ها نشان می دهند، بهترین مدل را پیدا کنید.
این دستور یک دستورالعمل مستقیم هک p است: هوش مصنوعی ده ها ترکیب را امتحان می کند و ترکیبی را ارائه می دهد که "بیشترین منطق را دارد." نتیجه تقریباً به طور قطع یک یافته ساختگی است که قابل تکرار نیست.
اعلان قدرتمند:
نقش شما: دستیار صادق. مدل اصلی که من از قبل تعیین کردهام این است: کنترلهای Y ~ X +. کدی بنویسید که این مدل را پیش بینی کند. به دنبال مدل «معنادارتر» دیگری نباشید. همچنین یک تحلیل حساسیت پیشنهاد دهید تا بتوانم استحکام نتیجه را ببینم، اما بدانید که همه نتایج را گزارش خواهم کرد، نه بهترین را انتخاب کنم. اجازه ندهید هر یافته اکتشافی را به عنوان "تأیید شده" بنویسم.
تفاوت: اراده قوی مدل اصلی را اصلاح می کند، جستجو را ممنوع می کند و نیاز به گزارش همه نتایج دارد.
سه کیف کوچک
مورد 1 - شکار زیرگروهی. یک محقق هیچ تاثیری در نمونه کلی پیدا نکرد. او از هوش مصنوعی پرسید که در کدام زیرگروه مهم است؟ YZ ترکیبات سن، جنسیت و منطقه را اسکن کرد و "0.03 = p در زنان شهری 35-44 ساله" یافت. مقاله بر اساس این زیرگروه بود. تکرار او هیچ تاثیری پیدا نکرد: این نتیجه تصادف ده ها زیرگروه بود. درس: گروه فرعی انتخاب شده پس از HARK شدن داده ها، تایید نشدن.
مورد 2 - شکار تبدیلی. رابطه ای که در سطح دانشجویی بی معنی است. آن را در اشکال log، root مربع، مربع و lag امتحان کرد. او p=0.048 را در فرم log-log پیدا کرد و فقط آن را گزارش کرد. خوشبختانه یکی از 5 فرم امتحان شده از آستانه عبور کرد. روش صحیح این بود: از پیش انتخاب فرم با تئوری و نشان دادن نتیجه تمام فرم ها در جدول حساسیت. درس: گزارش انتخابی اهمیت کاذب تولید می کند.
مورد 3 - نحوه کار کادربندی صادقانه یک تیم قبل از تجزیه و تحلیل از قبل ثبت نام کرد: فرضیه اولیه تک، مدل اصلی واحد، دو زیر گروه از پیش تعریف شده، تصحیح بونفرونی. تأثیر اصلی مهم نبود، اما تیم صادقانه آن را گزارش کرد. فرد اکتشافی یک یافته را به عنوان "نیاز به آزمایش در آینده" علامت گذاری کرد. مطالعه تکرارپذیر و قابل اعتماد بود. درس: برنامه ریزی صادقانه حتی نتیجه "شکست" را نیز ارزشمند می کند.
اشتباهات رایج
- به هوش مصنوعی گفتن "نتایج معنی دار" را پیدا کند. این مستقیماً هک p است. هوش مصنوعی را در چارچوبی صادقانه قرار دهید، نه از نتایج، بلکه از دقت بخواهید.
- ارائه کشف به عنوان تایید (HARKing). این گمراه کننده است که فرضیه ایجاد شده پس از داده ها را به عنوان "من آن را از ابتدا پیش بینی کردم" بنویسیم. به یافته های اکتشافی برچسب بزنید.
- فقط گزارش نتایج خوب نمایش تمام مشخصات تست شده؛ پنهان کردن تحلیل احساسات صداقت را به خطر می اندازد.
- غربالگری زیرگروه/تبدیل. انتخاب مهمترین آنها از میان دهها زیرگروه یا تبدیل، یافتههای جعلی ایجاد میکند. از قبل شناسایی و رفع شود.
- فراموش کردن چند آزمایش که انجام داده اید. تعداد کل تلاش ها را پیگیری کنید. هیچ p-value را نمی توان صادقانه بدون دانستن این عدد تفسیر کرد.
نکته: قبل از نوشتن یک یافته، از خود بپرسید: "چند راه را بی سر و صدا امتحان کرده ام تا زمانی که این نتیجه را پیدا کنم، و آیا همه آنها را گزارش می کنم؟" اگر برخی از مقالات در کشو باقی بمانند، گزارش شما قوی تر از آنچه هست به نظر می رسد.
به طور خلاصه
p-hacking، HARKing، گزارش انتخابی، و باغ مسیرهای انشعابی. بسیاری از آنها تله هایی هستند که ناخواسته عمل می کنند اما یافته های جعلی و غیرقابل تکرار را تولید می کنند. هوش مصنوعی این مشکلات را تسریع میکند زیرا میتواند دهها تحلیل را فوراً امتحان کند. درخواست های نوع «پیدا کردن نتایج معنادار» هوش مصنوعی را به یک موتور هک p تبدیل می کند. دفاع؛ جداسازی کشف از تایید با یک طرح پیش ثبت نام و تجزیه و تحلیل، گزارش تمام مشخصات و تجزیه و تحلیل حساسیت، اصلاح مقایسه های متعدد و قرار دادن هوش مصنوعی در چارچوبی صادقانه که "نتیجه صحیح" را می طلبد. مسئولیت نهایی همیشه بر عهده محقق است.
وظیفه کاربردی
یک سوال تحقیق را انتخاب کنید و قبل از مشاهده داده ها یک طرح تحلیل مختصر بنویسید: فرضیه اولیه، مدل اصلی، متغیر نتیجه اولیه، زیر گروه های از پیش تعریف شده، استراتژی مقایسه چندگانه. سپس مدل اصلی را تخمین بزنید. سپس یک تجزیه و تحلیل حساسیت انجام دهید (کنترل های مختلف، موارد پرت شامل / حذف شده، فرم تابع متفاوت) و همه نتایج را در یک جدول نشان دهید. در یک پاراگراف، ارزیابی کنید که کدام مراحل خطر هک p را ایجاد می کنند و چگونه چارچوب صادقانه شما آنها را محدود می کند.
چک لیست
- [ ] من قبل از فرو رفتن در داده ها، طرح تحلیل/مدل اصلی را نوشتم.
- [ ] من تجزیه و تحلیل های اکتشافی و تاییدی را جداگانه برچسب گذاری کردم. من HARKing نبودم
- [ ] من تمام مشخصاتی را که امتحان کرده ام گزارش کرده ام. من فقط زیبا را انتخاب نکردم.
- [ ] من زیر گروه ها و تبدیل ها را از قبل تعریف کردم، بعد از داده ها آنها را اسکن نکردم.
- [ ] تعداد تست هایی که انجام داده بودم را پیگیری کردم و اصلاحات لازم را اعمال کردم.
- [ ] من از هوش مصنوعی در زمینه «یافتن حقیقت» به جای «معنی پیدا کردن آن» استفاده کردم. من مسئولیت پذیرفتم