יחידה 7 / 11

p-hacking, HARKing ושלמות סטטיסטית: מלכודות בעידן הבינה המלאכותית

רווחים:

  • הבינו ש-p-hacking, HARKing, דיווח סלקטיבי וגן השבילים המתפצלים מייצרים ממצאים שקריים וראו כיצד בינה מלאכותית יכולה להאיץ את המלכודות הללו
  • יכולת לבסס הגנות כגון רישום מראש, תוכנית ניתוח, משמעת השוואה מרובה וניתוח רגישות עם תמיכה בבינה מלאכותית
  • היכולת להפנים את עיצוב הבקשות הכנה שיאפשר לבינה המלאכותית לדחות בקשות מסוג 'מצא את התוצאה המשמעותית' ושהאחריות הסופית היא של החוקר.

ביחידה הקודמת ראינו מהו ערך p ומה לא. ביחידה זו נבחן נושא אפל יותר, המלכודות השיטתיות המאיימות על שלמות סטטיסטית. רוב אלה אינם רמאות מכוונת; אלו מנגנונים ערמומיים שאפילו חוקרים בעלי כוונות טובות נופלים אליהם מבלי להבין זאת. ובינה מלאכותית (AI) הופכת את המלכודות הללו לקלות יותר ומהירות יותר, מכיוון שהיא מאפשרת להריץ עשרות ניתוחים בשניות. מטרת יחידה זו היא לבסס את הדיסציפלינה שתהפוך את הבינה המלאכותית מ"מכונת איתור תוצאות משמעותית" לעוזר ישר.

מלכודות בסיסיות

p-hacking (ציד של p-value): הוא מנסה את הניתוח שוב בדרכים שונות עד שמתקבלת תוצאה משמעותית (p<0.05). הוספה והסרה של משתנים, בחירת תת-דגימות, שינוי ההגדרה של חריגים, ניסיון טרנספורמציות שונות, שימוש במשתני תוצאה שונים, הפסקת איסוף הנתונים כשהיא הופכת למשמעותית... כל ניסיון נותן "הזדמנות" חדשה; אם תתאמצו מספיק, אחד מהם יתברר כמשמעותי, גם אם למעשה אין לו השפעה. התוצאה: ממצאים מזויפים שפורסמו אך לא ניתן לשחזר.

HARKing (השערה לאחר שהתוצאות ידועות): הנחת השערה לאחר שראיתי את התוצאות והצגתה כ"חבאתי את זה ככה מההתחלה". אתה מסתכל על הנתונים ומוצא את הקשר הבולט ביותר, ואז כותב את המאמר כאילו נועד לבדוק את ההשערה הזו. זה מטעה את הקורא בכך שהוא גורם לגילוי להיראות כמו אישור.

דיווח סלקטיבי (קטיף דובדבנים): דיווח רק על ה"טובים" מתוך עשרות ניתוחים וקובור בשקט את השאר. זה ידוע גם בשם "בעיית מגירת הקבצים": תוצאות חסרות משמעות נשארות במגירה, מה שהופך את הספרות למוטה באופן שיטתי.

גן השבילים המתפצלים: המונח של אנדרו גלמן. גם ללא פ-האק מכוון אחד, החוקר עושה הרבה בחירות סבירות על סמך הנתונים (איזה משתנה, איזה סף, איזו תת-קבוצה, איזו טרנספורמציה). דרגות החופש החקירתיות כל כך רבות שאתה בוחר ביעילות את המשמעותית מתוך שפע של ניתוחים - אפילו בלי שום כוונה רעה. התוצאה היא שוב שיעור חיובי כוזב עולה.

זהירות: רוב המלכודות הללו אינן טריקים מכוונים. סכום הצעדים התמימים לכאורה כגון "ניסיתי עוד כמה דגמים", "זה היה נקי יותר כשהסרתי את החריגה", "ההשפעה ברורה יותר בתת-קבוצה זו" יכול לייצר ממצא מזויף. כנות היא עניין של שיטה, לא כוונה.

מדוע AI מגדיל את המלכודות הללו?

ניסיון של 3 דגמים ביד לוקח זמן; YZ מייצרת 50 גרסאות מודל, 10 המרות שונות, 8 תת-קבוצות תוך דקות. הכוח הזה הוא הרסני ללא תוכנית כנה: בקשה כמו "מצא קשר משמעותי בנתונים האלה" או "בניית מודל שתומך בהשערה זו" הופכת את ה-AI ישירות למנוע p-hacking. AI גם רוצה להיות מועיל; נוטה למצוא תוצאה "משמעותית" שתספק אותך. זו הסיבה שהעיצוב המהיר שלך הוא קו ההגנה הראשון של היושר.

הגנות: מהלך עסקים הוגן

1. הרשמה מראש: זה אומר לרשום את ההשערה, המשתנים, המודל והמבחנים שלך בכתב (אפשר בפלטפורמה עם חותמת זמן) לפני ביצוע הניתוח. לפיכך, גילוי מופרד מאישור; כל דבר שתשנה לאחר מכן מתויג כ"חוקר".

2. תוכנית ניתוח: גם אם אינך יכול להקליט מראש, כתוב תוכנית ניתוח לפני הצלילה לנתונים: השערה ראשונית, משתנה תוצאה ראשוני, מודל ראשי. קבע את ההבחנה בין "ניתוח ראשי" ל"ניתוח נוסף/גישור" מלכתחילה ותשמור עליה בדוח.

3. דווחו על הכל: אל תסתירו את הדגמים שניסיתם. בסעיף "ניתוח רגישות" (בדיקת יציבות), הראה כיצד מפרטים שונים משנים את התוצאה. הממצא חזק רק אם הוא מחזיק מעמד תחת בחירות סבירות רבות.

4. משמעת השוואה מרובה: אם עשית יותר מדי מבחנים, תקן אותם (יחידה 6). ענה על השאלה "כמה בדיקות עשיתי?" בִּיוֹשֶׁר.

5. ניתוח רגישות: חזור על הממצא העיקרי שלך עם מדגם שונה, ערכת בקרה שונה ושינוי שונה. אם התוצאה משתנה, אל תסתיר אותה, דווח עליה.

תרשים השוואה: כנה מול מלכודת

יישום

צורת מלכודת

מקבילה כנה

בחירת דגם

מנסה עד שזה הגיוני (p-hacking)

מודל מאסטר מתוכנן מראש

השערה

מתאים לאחר מעשה (HARKing)

מוקלט מראש, לפני נתונים

דיווח

אל תראה רק את היפים

כל המפרט + רגישות

תת קבוצה

בוחרים את הבולט ביותר

מוגדר מראש, ניתן לתיקון

איסוף נתונים

תפסיק כשזה הגיוני

מדגם שנקבע מראש

ארבע הנחיות הניתנות להעתקה

1. מסגרת תביעה כנה:

תפקידך: עוזר סטטיסטיקה ישר. המטרה שלי היא לא למצוא תוצאה משמעותית, אלא למצוא את התוצאה הנכונה. כללים:- אל תיתן לי הצעות מסוג "נסה דגמים עד שיהיה הגיוני", - אמור לי אם אתה מציע מספר מפרטים שכולם צריכים להיות מדווחים, - הזהיר אותי מכל צעד שיכול להוביל ל-p-hacking. עזור לי קודם כל להבהיר את המודל הראשי שלי, להפריד בין גילוי לאישור.

2. טיוטת תוכנית ניתוח:

עזרו לי לנסח תוכנית ניתוח ראשונית למחקר: השערה ראשונית, משתנה תוצאה ראשוני, מפרט מודל ראשי, תת-קבוצות מוגדרות מראש, אסטרטגיית השוואה מרובה. שים ניתוחים "חקרניים" ו"מאשרים" בכותרות נפרדות. תזכיר לי למלא את זה בלי להסתכל על הנתונים.

3. ניתוח רגישות:

הממצא העיקרי שלי הוא לכתוב קוד ניתוח רגישות (R) עבור המטרה שלי היא לראות עד כמה התוצאה מוצקה, לא לבחור את הטוב ביותר; להציג את כל התוצאות.

4. ניטור עצמי:

אסביר את תהליך הניתוח שלי; תן לי רשימת בדיקה ל-p-hacking / HARKing / דיווח סלקטיבי וסמן אילו מהצעדים שלי מסוכנים. שאלו אותי בחזרה כמה דגמים/בדיקות ניסיתי ועל אילו מהם אני מתכנן לדווח.

הנחיה חלשה / הנחיה חזקה

הנחיה חלשה:

אילו משתנים מראים קשרים משמעותיים בנתונים אלה, מצאו את המודל הטוב ביותר.

הנחיה זו היא הוראה ישירה ל-p-hacking: ה-AI מנסה עשרות שילובים ומציגה את זה ש"הכי הגיוני". התוצאה היא כמעט בוודאות ממצא מזויף שלא ניתן לשכפל.

הנחיה עוצמתית:

תפקידך: עוזר ישר. המודל הראשי שקבעתי מראש הוא: Y ~ X + פקדים. כתוב קוד שמנבא את המודל הזה. אל תחפש דגם אחר "משמעותי יותר". הצע גם ניתוח רגישות כדי שאוכל לראות את החוסן של התוצאה, אבל דע שאני אדווח על כל התוצאות, לא אבחר את הטוב ביותר. אל תתנו לי למחוק כל ממצא גישוש כ'אומת'.

הבדל: רצון חזק מתקן את המודל הראשי, אוסר חיפוש ודורש דיווח על כל התוצאות.

שלושה מיני תיקים

מקרה 1 - ציד תת-קבוצות. חוקר אחד לא מצא השפעה במדגם הכולל; הוא שאל את ה-AI "באיזו תת-קבוצה זה משמעותי?" YZ סרקה את שילובי הגיל, המגדר והאזור ומצאה "p = 0.03 בנשים עירוניות בגילאי 35-44". המאמר התבסס על תת-קבוצה זו. השכפול שלו לא מצא שום השפעה: זה היה תוצאה של מקרה של עשרות תת-קבוצות. שיעור: תת-קבוצה נבחרה לאחר שהנתונים HARKing, לא מאשרים.

מקרה 2 - ציד המרות. מערכת היחסים שמתגלה כחסרת משמעות ברמת תלמיד; ניסיתי את זה בצורות יומן, שורש ריבוע, ריבוע ופיגור; הוא מצא p=0.048 בצורת log-log ודיווח רק על זה. למרבה המזל, אחד מ-5 הטפסים שנוסו חצה את הסף. הדרך הנכונה הייתה: לבחור מראש את הטופס עם התיאוריה ולהראות את התוצאה של כל הטפסים בטבלת הרגישות. לקח: דיווח סלקטיבי מייצר משמעות כוזבת.

מקרה 3 - איך מסגור כנה עובד. צוות אחד נרשם מראש לפני הניתוח: השערה ראשונית אחת, מודל ראשי יחיד, שתי תת-קבוצות מוגדרות מראש, תיקון Bonferroni. ההשפעה העיקרית לא הייתה משמעותית, אבל הצוות דיווח על כך בכנות; האדם החוקר סימן ממצא אחד כ"צריך להיבדק בעתיד". המחקר היה ניתן לשחזור ואמין. לקח: תכנון כנה הופך אפילו את התוצאה "נכשל" לכדאית.

טעויות נפוצות

  • אומר לבינה מלאכותית "למצוא תוצאות משמעותיות". זה ישר P-Hacking; שים AI במסגרת כנה, מבקש דיוק, לא תוצאות.
  • הצגת התגלית כאישור (HARKing). מטעה לכתוב את ההשערה שנקבעה לאחר הנתונים כ"ניבאתי את זה מההתחלה"; סמן את הממצא החקרני.
  • רק מדווח על תוצאות טובות. הצג את כל המפרטים שנבדקו; הסתרת ניתוח סנטימנטים פוגעת ביושרה.
  • מיון משנה/המרה. הבחירה המשמעותית ביותר מבין עשרות תת-קבוצות או טרנספורמציות מייצרת ממצאים מזויפים; לזהות ולתקן מראש.
  • שוכחים כמה בדיקות עשית. עקוב אחר המספר הכולל של ניסיונות; שום ערך p אינו יכול להתפרש בכנות מבלי לדעת את המספר הזה.
טיפ: לפני שכותבים ממצא, שאלו את עצמכם: "כמה דרכים ניסיתי בשקט עד שמצאתי את התוצאה הזו, והאם אני מדווח על כולן?" אם חלק מהמאמרים נשארים במגירה, הדוח שלך נראה חזק יותר ממה שהוא.

לסיכום

p-hacking, HARKing, דיווח סלקטיבי וגן השבילים המתפצלים; רבות מהן מלכודות הפועלות ללא כוונה אך מייצרות ממצאים מזויפים, בלתי ניתנים לשחזור. בינה מלאכותית מאיצה את המהמורות הללו מכיוון שהיא יכולה לנסות עשרות ניתוחים באופן מיידי; בקשות מסוג "מצא תוצאות משמעותיות" הופכות את הבינה המלאכותית למנוע P-Hacking. הֲגָנָה; הפרדת גילוי מאישור באמצעות תוכנית רישום וניתוח מראש, דיווח על כל המפרטים וניתוחי הרגישות, תיקון השוואות מרובות והצבת AI במסגרת כנה הדורשת את "התוצאה הנכונה". האחריות הסופית היא תמיד של החוקר.

משימת יישום

בחר שאלת מחקר וכתוב תוכנית ניתוח קצרה לפני שתסתכל על הנתונים: השערה ראשונית, מודל ראשי, משתנה תוצאה ראשוני, תת-קבוצות מוגדרות מראש, אסטרטגיית השוואה מרובה. ואז להעריך את המודל הראשי. לאחר מכן בצע ניתוח רגישות (בקרות שונות, חריג כלול/לא נכלל, צורת פונקציה שונה) והצג את כל התוצאות בטבלה אחת. בפסקה אחת, הערך אילו שלבים מהווים סיכון ל-p-hacking וכיצד המסגרת הכנה שלך מגבילה אותם.

רשימת בדיקה

  • [ ] כתבתי את תוכנית הניתוח/מודל האב לפני שצללתי לתוך הנתונים.
  • [ ] תייגתי בנפרד ניתוחי חקירה ומאשרים; לא הייתי HARK.
  • [ ] דיווחתי על כל המפרטים שניסיתי; לא סתם בחרתי את היפה.
  • [ ] הגדרתי את תת הקבוצות והטרנספורמציות מראש, לא סרקתי אותן אחרי הנתונים.
  • [ ] עקבתי אחרי כמה בדיקות ערכתי והחלתי את התיקון הדרוש.
  • [ ] השתמשתי ב-AI בהקשר של "מצא את האמת" במקום "מצא את זה משמעותי"; לקחתי אחריות.