יחידה 7 / 11

הערכת מודל: מדדים, אימות צולב ולמידה קיצונית

רווחים:

  • יכולת לבחור ולפרש מדדי סיווג ורגרסיה (מטריצת בלבול, דיוק/החזרה/F1, MAE/RMSE/R²) בהתאם למטרת המשרה
  • יכולת לזהות למידה יתר על ידי השוואת ציוני אימון וציוני מבחנים ולקבל ביצועים אמינים עם אימות צולב
  • יכולת להעריך אם כל מודל מוסיף ערך אמיתי על ידי השוואתו עם קו בסיס

קל להגדיר דגם; קשה למדוד בכנות אם זה באמת עובד. הנושא של יחידה זו הוא המיומנות הקריטית ביותר של מדען נתונים: הערכת המודל עם המדדים הנכונים, השגת ביצועי חיזוי מהימנים ותפיסת המלכודת התחמנית ביותר: לימוד יתר (שינון). AI מחשב, מפרש ומשווה מדדים; אבל זה תלוי באדם להחליט איזה מדד מתאים לעסק שלך והאם מודל הוא "טוב מספיק". צוות שמסתכל על המדד הלא נכון יכול לטעות במודל רע במשך חודשים כ"הצלחה".

למה דיוק לא מספיק: מטריצת בלבול

המדד הראשון שעולה על הדעת בסיווג הוא דיוק (דיוק - היחס הכולל בין התחזיות הנכונות). אבל כפי שראינו ביחידה 6, הדיוק מטעה עם נתונים לא מאוזנים. התחלה טובה יותר היא מטריצת הבלבול - טבלה המחלקת תחזיות לארבעה פחים:

  • חיובי אמיתי (TP): קראנו לזיוף מה שהוא באמת מזויף. (טוב)
  • שלילי אמיתי (TN): אמרנו ממש נקי. (טוב)
  • חיובי כוזב (FP): בטעות אמרנו שהנקי מזויף. (אזעקת שווא)
  • שלילי כוזב (FN): פספסנו את הזיוף וקראנו לו נקי. (החמצת איום)

שני מדדי מפתח נובעים מארבע התיבות הללו. דיוק: "כמה ממה שאני מכנה מזויף הוא בעצם מזויף?" - חשוב אם עלויות אזעקת שווא גבוהות. רגישות (ריקול באנגלית): "כמה זיופים אמיתיים תפסתי?" - חשוב כאשר החמצת איום היא יקרה. לעתים קרובות השניים מסוכסכים זה עם זה: אם מורידים את הסף ואומרים יותר "זיוף", הריקול עולה אך הדיוק פוחת. ציון F1 הוא הממוצע המאוזן (ממוצע הרמוני) של שני אלה.

שימו לב: התשובה לשאלה "איזה מדד חשוב" היא החלטה עסקית, לא טכנית. החמצת מקרה (ריקול נמוך) בבדיקת סרטן היא הרת אסון; זה מעצבן לשלוח מייל חשוב לספאם (דיוק נמוך) במסנן הספאם. העלות קובעת את המדד.

מדדי רגרסיה

אם הפלט הוא מספרים, נעשה שימוש במדדים שונים. MAE (Mean Absolute Error): עד כמה האומדנים חורגים מהממוצע בפועל, באותה יחידה (למשל "אנחנו טועים ב-4,200 TL בממוצע"). RMSE (Root Mean Squared Error): מעניש שגיאות עיקריות בצורה חמורה יותר ורגיש לחריגות. R² (R-squad — מקדם קביעה): כמה מהשונות ביעד המודל מסביר (קרוב ל-1 זה טוב, 0 גרוע כמו חיזוי הממוצע, שלילי הוא אפילו יותר גרוע).

המלכודת הכי ערמומית: לימוד יתר

התאמה יתר - כאשר המודל משנן נתוני אימון אך נכשל בנתונים חדשים - היא הטעות הנפוצה ביותר במדעי הנתונים. הסימפטום ברור: הדגם מצוין בסט האימונים (98%), גרוע בסט המבחן (72%). המודל שנן את הרעש של המדגם המסוים הזה, לא את הדפוס האמיתי בנתונים. יש גם את ההיפך: חוסר התאמה - המודל גרוע הן באימון והן בבדיקה כי הוא פשוט מדי לתפוס את הדפוס.

דרכים להילחם בלמידת יתר: פישוט המודל, יותר נתונים, רגוליזציה - הבלם המתמטי שמונע מהמודל להיות מורכב מדי - והכי חשוב, אימות צולב.

אימות צולב: אל תסמוך על חלונית אחת

אימון/מבחן יחיד עשוי להיות בר מזל או חסר מזל; אתה יכול לקבל ציונים גבוהים עבור ערכת המבחן רק בגלל שהדוגמה הזו קלה. אימות צולב (קיצור קורות חיים) פותר זאת. הצורה הנפוצה ביותר היא קפלי CV: הנתונים מחולקים ל-k חלקים (למשל 5); בכל סבב חלק אחד בוחן והשאר אימון; זה מתגלגל 5 פעמים וממוצע 5 הציונים. אז תראה שהביצועים מבוססים על הממוצע של מספר פיצולים, לא פיצול מזל אחד. גם התפלגות הציונים אינפורמטיבית: ציונים תנודתיים מאוד (85% בקומה אחת, 62% בשנייה) מעידים על חוסר יציבות של המודל.

קיפול k רגיל אינו בשימוש בסדרות זמן (מדלף את העתיד); במקום זאת, אתה עושה "שרשור קדימה" (פיצול סדרות זמן): תמיד מתאמנים עם העבר ובודקים את העתיד.

מדד

סוג הבעיה

מתי זה משנה?

דיוק

סיווג

אם השיעורים מאוזנים

דיוק

סיווג

אזעקת שווא היא יקרה

רגישות (היזכרות)

סיווג

אם זה יקר לפספס

F1

סיווג

אם יש צורך באיזון

MAE

רגרסיה

שגיאה ניתנת לפירוש

RMSE

רגרסיה

אם טעויות גדולות הן קריטיות

רגרסיה

כוח הסבר

שלושה מיני תיקים

מקרה 1 - אשליה של דיוק גבוה. מודל הונאה אחד הראה 99.2% דיוק והצוות חגג. בהסתכלות על מטריצת הבלבול, השיעור האמיתי: מזויף בנתונים היה 0.8%; הדוגמנית כמעט ולא תפסה זיופים, רק אמרה "הכל ברור". הריקול היה 6%. לקח: הסתכלו על המדדים, לא על הדיוק.

מקרה 2 - לימוד יתר סמוי. צוות אחד סיפק והגביר את XGBoost ל-97% על סט האימונים. מערך הבדיקות היה 69%, אבל אף אחד לא הסתכל. הדגם קרס בייצור. אם היה נעשה אימות צולב, ההבדל הגדול בין קיפולים (לימוד יתר) היה נראה לעין מההתחלה. שיעור: סמוך על קורות חיים וציון מבחן, לא ציון השכלה.

מקרה 3 - פיצול לאקי. אנליסט אחד שמח לקבל 88% בפיצול יחיד. כאשר עמית שלו עשה קורות חיים פי 5, הציונים היו 88%, 71%, 83%, 64%, 79% - הממוצע הוא 77%, אבל זה מאוד תנודתי. הדגם לא היה יציב; התא היחיד היה מטעה. לקח: הסתכלו על ממוצע קורות החיים והתפלגות, לא בפח הבודד.

ארבע תבניות הניתנות להעתקה

1) דוח סיווג מלא:

הכשרתי דגם וערכת מבחנים. צור: מטריצת בלבול, דיוק, ריקול, F1 (עבור כל מחלקה) וספירות תמיכה. אני מסיק, אבל זה תלוי בי: אני אגיד לך איזה מדד חשוב. שימו לב שהדיוק עלול להטעות עם נתונים לא מאוזנים.

2) שליטה בלמידה:

הדפס את הציונים של הדגם שלי הן בערכת ההדרכה והן במבחן זה לצד זה. חשבו את ההבדל ביניהם והזהירו שכן הבדל גדול הוא סימן למידת יתר. אם ההבדל גדול, הצע הסדרה או פישוט.

3) אימות צולב:

בצע אימות צולב פי 5 (לשכבות, סיווג). הדפס את הניקוד, הממוצע וסטיית התקן של כל קיפול. אם הציונים תנודתיים מאוד (סטד גבוה), ציין שהמודל אינו יציב. השתמש בצינורות כך שהטרנספורמציות ילמדו רק מקטע האימון בכל שכבה.

4) השוואה בסיסית:

שים את המדד של הדגם שלי זה לצד זה עם קו הבסיס של DummyClassifier. האם הדגם מנצח משמעותית את קו הבסיס? אם זה לא עובר, הבהירו שהמודל אינו מוסיף ערך אמיתי.

הנחיה חלשה / הנחיה חזקה

הנחיה חלשה:

האם הדגם שלי טוב?

"טוב" אינו מוגדר; לא ברור איזה מדד, איזה סף, איזה קו בסיס. AI יכול לתת מספר דיוק יחיד ולהטעות.

הנחיה עוצמתית:

תפקידך: עוזר הערכה. סיווג, נתונים לא מאוזנים (12% חיובי). עדיפות: ריקול (לא חסרים את הנקודות החיוביות). משימה: (1) מטריצת בלבול, (2) דיוק/החזרה/F1, (3) ממוצע CV ו-std מרובדים פי 5, (4) השוואה בסיסית של DummyClassifier. התמקד בהיזכרות ובהבדל בקו הבסיס, לא בדיוק. הערה, אבל אני מקבל את ההחלטה הסופית.

כאן, העדיפות המטרית, קורות החיים ותנאי הבסיס ברורים.

טעויות נפוצות

  • אמון על דיוק בנתונים לא מאוזנים. דיוק של 99% עשוי שלא לתפוס את מעמד המיעוט כלל; תסתכל על מטריצת הבלבול.
  • רק מסתכל על ציון ההשכלה שלך. השכלה גבוהה, ציון נמוך במבחן הוא למידה יתר; תמיד השוו שני ציונים.
  • מסתמכים על תא בודד. חלוקת מזל מטעה; תסתכל על הממוצע והתפלגות עם אימות צולב.
  • לא משווה לקו הבסיס. אתה לא יכול להגיד "טוב" מבלי לדעת אם המודל מנצח מנבא מטופש.
  • שימוש בקפל K רגיל בסדרות זמן. זה מדליף את העתיד; נדרש פיצול סדרות זמן.
טיפ: כתוב שלושה מספרים ליד כל דגם: ציון אימון, ממוצע אימות צולב וציון בסיס. השלישייה הזו חושפת במבט חטוף למידה יתר (אימון >> קורות חיים) והערכה נמוכה (CV ≈ בסיס).

לסיכום

בניית מודל היא קלה, אבל להעריך אותו בכנות זה קשה. בסיווג, מטריצת בלבול, דיוק וזכירה הם הרבה יותר אינפורמטיביים מאשר דיוק; עלות העבודה קובעת איזו מהן חשובה. MAE, RMSE ו-R² משמשים ברגרסיה. המלכודת הכי ערמומית היא למידה יתרה: תמיד השווה בין אימון וציון במבחן. הסתמכו על הממוצע והתפלגות של אימות צולב, לא פיצול אחד; השווה הכל לקו בסיס. בינה מלאכותית מחשבת את כל אלה, אבל זה תלוי באדם להחליט באיזה מדד להשתמש.

משימת יישום

חלץ מטריצת בלבול, דיוק, ריקול ו-F1 עבור מודל סיווג; לאחר מכן בצע אימות צולב פי 5 והסתכל על התפלגות הניקוד על פני הקפלים. לבסוף, רשום את ציון האימון, ממוצע קורות החיים וציון בסיס זה לצד זה. הגיבו במשפט אחד אם המודל שלכם לומד יתר על המידה ועובר את קו הבסיס.

רשימת בדיקה

  • [ ] האם הסתכלתי על המדד בפועל של העבודה (דיוק/ריקול/F1 וכו') במקום דיוק?
  • [ ] האם בדקתי את מטריצת הבלבול?
  • [ ] האם השוויתי אימון וציון מבחן ובדקתי למידת יתר?
  • [ ] האם הסתכלתי על הממוצע והתפלגות עם אימות צולב?
  • [ ] האם השוויתי את המודל לקו בסיס?