יחידה 10 / 11

הטיה, אתיקה ועלות: הנדסת בינה מלאכותית אחראית ובת קיימא

רווחים:

  • יכולת לזהות אפליה נסתרת על ידי הבנה שהטיה מגיעה מנתונים (היסטוריים, ייצוגיים, מדידה, צבירה) והערכת המודל על בסיס תת-קבוצות
  • יכולת לספק הסבר, פיקוח אנושי ואחריות בקבלת החלטות בעלות השפעה ושקיפות מסמכים עם כרטיס דגם
  • יכולת לנהל עלויות פיננסיות וסביבתיות מבלי להתפשר על האיכות עם הדגם הקטן ביותר המתאים, קיצור מהיר, מטמון ואצווה

מודל עשוי לעבוד בצורה מושלמת מבחינה טכנית אבל עדיין לטעות - אם הוא לא הוגן כלפי אנשים מסוימים, בלתי מוסבר או מייצר עלויות בלתי בנות קיימא. ביחידה זו אנו מכסים שלושה ממדים "בלתי נראים" אך מכריעים של הנדסת ML: הטיה והגינות, אתיקה ושקיפות, עלות וקיימות. לא מדובר בקישוטים שנוספו מאוחר יותר, אלא בחלקים בלתי נפרדים מאיכות הנדסית.

מאיפה מגיעות דעות קדומות?

הטיית מודל (הטיפול השיטתי של המודל בקבוצות מסוימות בצורה שונה/לא הוגנת) נובעת בדרך כלל מהנתונים, לא מהמודל. מקורות:

  • הטיה היסטורית: הנתונים משקפים חוסר צדק בעבר. אם קבוצה מסוימת קיבלה פחות קרדיט בעבר, המודל שהוכשר לפי הנתונים הללו ילמד וינציח את האפליה הזו.
  • הטיית ייצוג: חלק מהקבוצות מיוצגות בתת-ייצוג בנתונים; המודל מציג ביצועים גרועים עבורם (למשל דיוק נמוך במדגם דמוגרפי קטן).
  • הטיית מדידה: התוויות עצמן מוטות (למשל, אם ההגדרה של "עובד טוב" מבוססת על החלטות קידום בעבר).
  • הטיית צבירה: מכיוון שהנתונים מגיעים מערוץ מסוים, הם אינם מייצגים את היקום.

המודל לא רק לומד את ההטיות הללו; גדל על ידי אוטומציה שלו. החלטה מוטה של ​​אדם אחד משפיעה על אדם אחר; פסק הדין של מודל מוטה הוא מיליונים.

זהירות: אל תיפול לטעות של לומר "המודל הוא ניטרלי כי הוא רק מתמטיקה". המודל לומד וממכן הטיה אנושית בנתונים. ניטרליות היא לא ברירת מחדל, אלא תוצאה שיש למדוד ולהבטיח.

מדידת צדק

כדי לנהל את הצדק, יש צורך למדוד אותו תחילה. לשם כך, העריכו את המודל על בסיס תת-קבוצה: האם מדדים כגון דיוק, היזכרות, שיעור חיובי כוזב שווים בין קבוצות דמוגרפיות שונות? כמה מושגי צדק:

  • הוגנות קבוצתית: האם המודל מתייחס לקבוצות שונות בצורה נכונה/לא נכונה בשיעורים דומים?
  • שוויון הזדמנויות: האם המודל לוכד את החיוביים באמת באופן שווה בכל הקבוצות (ריקול שווה)?

עובדה חשובה: הגדרות שונות של צדק עשויות שלא להתקיים בו-זמנית (זוהי תוצאה מתמטית). איזו הגדרה של צדק מקבלת עדיפות בהקשר זה היא החלטה אתית ועסקית, לא טכנית, והיא מתקבלת יחד עם בעלי עניין.

גישה חלשה / גישה חזקה

גרוע: "הדיוק הכולל של הדגם הוא 88%, וזה הוגן".

Güçlü: "הדיוק הכולל היה 88%, אבל כשחילקנו את זה לתת-קבוצות, הריקול היה 91% בקבוצה אחת ו-67% בקבוצה אחרת - המודל היה חסר באופן שיטתי את הקבוצה הזו. תיעדנו את הסיבה (חוסר ייצוג), אספנו נתונים עבור אותה קבוצה והערכנו אותם מחדש עם הגדרת שוויון-זכירה של מחזיק העניין שנחליט על ההגדרה של בעל עניין הוגן".

ההבדל: הגישה החזקה לא מסתתרת מאחורי המדד הכללי, היא מפרידה בין תת-קבוצות ומתייחסת להוגנות כהחלטה פתוחה.

אתיקה ושקיפות

עקרונות הליבה של AI אחראי הם:

  • הסבר: האם ניתן להסביר מדוע המודל קיבל את ההחלטה הזו? בהחלטות בעלות השפעה רבה (אשראי, גיוס עובדים, שירותי בריאות) יש זכות להסבר. אין להשתמש במודל הבלתי מוסבר בתחומים אלה או שיש לתמוך בשיטה הניתנת להסבר.
  • פיקוח אנושי: אין לקבל החלטות בעלות השפעה רבה באופן אוטומטי; המודל מציע, האדם מאשר.
  • אחריות: צריך להיות ברור מי אחראי כאשר המודל עושה שגיאה. "המודל החליט" אינו תירוץ.
  • שקיפות: המשתמש צריך לדעת שהוא מקיים אינטראקציה עם AI וכיצד נעשה שימוש בנתונים שלו.

במדינות ומגזרים רבים, עקרונות אלו מוטמעים גם בחקיקה (שקיפות, ביקורת וחובות פיקוח אנושי על מערכות בינה מלאכותית בסיכון גבוה). המהנדס אחראי להכיר את התקנות בתחומו.

טיפ: שמור "כרטיס דגם" לכל מודל בעל השפעה רבה: מה המודל עושה, על אילו נתונים הוא הוכשר, עד כמה הוא עובד טוב/ גרוע באילו קבוצות, מה הגבולות הידועים שלו. מסמך זה הוא גם כלי שקיפות ואחריות.

עלות וקיימות

AI לא זול. העלות מנוהלת בשני מימדים:

עלות כספית:

  • עלות אסימון (LLM): כל בקשה ותגובה עולים אסימונים; ככל שהנפח גדל, החשבון גדל. הנחיות ארוכות שלא לצורך, מבחר דגמים גדול מדי ולולאות סוכנים לא מבוקרות (יחידה 5) מייקרים את העלות.
  • הדרכה ואירוח: כוונון עדין והצגת דגמים כרוכים בעלויות חומרה.
  • אופטימיזציה: אין להשתמש בדגם גדול אם מספיק דגם קטן; מטמון שאלות נפוצות; לקצר את ההנחיה; אצווה מה שניתן לעבד.

עלות סביבתית: הכשרה והסקת דגמים גדולים צורכים אנרגיה משמעותית. הקיימות הופכת את הימנעות מחישובים מיותרים (מודל גודל נכון, ארכיטקטורה יעילה) לאחריות מקצועית.

טיפ: הכלל הראשון של אופטימיזציית עלויות: "מהו הדגם הקטן ביותר המתאים לעבודה זו?" לשים את הדגם החזק ביותר בכל מקום זה כמו לתקוע מסמר עם פטיש - יקר ומיותר.

שלושה מיני תיקים

מקרה 1 - אפליה נסתרת. מודל מיון לגיוס נראה טוב בסך הכל. ניתוח תת-קבוצות מצא שהמודל הדגיש באופן שיטתי מועמדות נשיות מכיוון שהנתונים ההיסטוריים נשלטו על ידי גברים - הוא למד הטיה היסטורית. המודל הופסק, הנתונים מאוזנים ומדדי הוגנות נוטרו. צדקנות כללית כיסתה אפליה נסתרת.

מקרה 2 - דחייה בלתי מוסברת. מודל אשראי דחה בקשות, אבל איש לא ידע להסביר מדוע. כאשר לקוח ביקש הבהרה משפטית, הצוות לא הצליח להגיב. המודל הוצא משימוש בהחלטות בעלות השפעה רבה עד שנוספה שיטה ניתנת להסבר והופקה הצדקה לכל דחייה. שיעור: יכולת הסבר חיונית בקבלת החלטות בעלת השפעה רבה.

מקרה 3 - הלם ביל. צוות אחד השתמש ב-LLM הגדול ביותר ובהנחיות ארוכות מאוד עבור כל בקשה. החשבון החודשי גדל באופן בלתי צפוי. ניתוח פוסט: ניתן היה לפתור את רוב הבקשות באמצעות מודל קטן, מחצית מההנחיות היו מיותרות, וניתן היה לשמור שאלות תכופות במטמון. שלושת האופטימיזציות הללו הפחיתו את העלות באופן משמעותי, מבלי לפגוע באיכות. לקח: הדגם החזק ביותר אינו נחוץ בכל מקום.

תבניות הניתנות להעתקה

עזור לי להעריך את המודל הזה עבור הטיה/הוגנות. אילו תת-קבוצות (דמוגרפיה/פלח) עלי לחלק ולמדוד? אילו מדדים (דיוק, היזכרות, שיעור חיובי שגוי לפי קבוצה) עלי להשוות? האם הגדרות שונות של הוגנות יכולות להתנגש, מה עלי לתעדף בהקשר זה ומדוע? הקשר דגם/החלטה: [הסבר]

הפק טיוטה של כרטיס דגם עבור הדגם בעל ההשפעה הזו. צריך לכלול: מטרה, נתוני אימון ותאריך, ביצועים בתת-קבוצות, מגבלות ידועות, שימוש מתאים/לא הולם, מצב הסבר, נקודת פיקוח אנושית. דגם: [תיאור]

עזור לי להפחית את העלות של יישום LLM זה, מבלי לפגוע באיכות. זמין: גודל דגם, אורך הנחיות ממוצע, נפח בקשה, האם יש מטמון? הערכת: 1) האם המודל הקטן יותר מספיק (לאילו משימות)? 2) האם ניתן לקצר את הבקשה? 3) האם ניתן לאחסן בקשות תכופות במטמון? 4) האם יש עבודה זמינה עבור אצווה משוערת? רשום את ההשפעה של כל הערכה.

הפק רשימת אתיקה/אחריות עבור מערכת החלטות זו בעלת השפעה גבוהה.- הסבר: האם ניתן להפיק את הצדקת ההחלטה?- פיקוח אנושי: האם ההחלטה בעלת ההשפעה כפופה לאישור?- אחריות: מי אחראי במקרה של טעות?- שקיפות: האם המשתמש יודע שנעשה שימוש בבינה מלאכותית?- רגולציה: מהן החובות המשפטיות הכרוכות בכך?]מערכת: [תיאור

טבלת מקור הטיה

מקור

סימפטום

אמצעי זהירות

הטיה היסטורית

אפליית העבר נמשכת

ביקורת נתונים + מדד הגינות

הטיית ייצוג

דיוק נמוך בקבוצת מדגם קטנה

ניתוח תת-קבוצות + איזון

הטיית מדידה

תוויות מוטות

סקירת תהליך התווית

הטיית צבירה

היקום אינו מיוצג

גיוון משאבים

טעויות נפוצות

  • בהסתמך על המדד הכולל. לא ניתן לראות אפליה נסתרת ללא ניתוח תת-קבוצות.
  • בהנחה ש"מודל ניטרלי". המודל לומד ומגביר הטיה בנתונים.
  • משאירים את ההחלטה בעלת ההשפעה למודל הבלתי מוסבר. סיכון משפטי ואתי.
  • עקיפת פיקוח אנושי. "הדוגמנית החליטה" זה לא תירוץ.
  • לשים את הדגם הגדול ביותר בכל מקום. עלות ואנרגיה מיותרים.
  • לא עוקב אחר עלות. החשבון מתנפח בשקט.

לסיכום

מודל נכון מבחינה טכנית הוא עדיין כישלון אם הוא לא הוגן, ניתן להסבר ובר קיימא. ההטיה מגיעה בעיקר מהנתונים והמודל מגדיל אותם בקנה מידה; למדוד הוגנות לפי תת-קבוצות ולהסכים עם בעלי העניין איזו הגדרה של הוגנות לתעדף. הסבר, פיקוח אנושי ואחריות חיוניים בהחלטות בעלות השפעה; שקיפות מסמכים עם כרטיס דגם. נהל עלויות ואנרגיה: בחר את הדגם הקטן ביותר המתאים, קצר את ההנחיה, השתמש במטמון ובאצווה. מידות אלו הן חלק אינטגרלי של איכות הנדסית, לא סלסולים שנוספו מאוחר יותר.

משימת יישום

חלקו מודל לשתי תת-קבוצות לפחות והשוו את שיעור ההיזכרות והחיובים השגויים על בסיס קבוצתי; אם יש הבדל משמעותי, כתוב את הסיבה ואמצעי זהירות. נסח כרטיס מודל קצר למודל בעל השפעה גבוהה (מטרה, נתונים, ביצועי תת-קבוצה, גבולות, יכולת הסבר). זהה לפחות שתי אופטימיזציות קונקרטיות (מינימום / חיתוך מהיר / מטמון / אצווה) כדי להפחית את העלות של יישום LLM ורשום את ההשפעה המשוערת שלהם.

רשימת בדיקה

  • [ ] הערכתי את המודל על סמך תת-קבוצות, לא הסתמכתי על המדד הכללי.
  • [ ] החלטתי עם בעלי העניין איזו הגדרת צדק אתעדף.
  • [ ] החלטה בעלת השפעה גבוהה ניתנת להסבר וכפופה לאישור אנושי.
  • [ ] תיעדתי שקיפות וגבולות עם כרטיס הדפוס.
  • [ ] בחרתי בדגם ההולם הקטן ביותר; ביצעתי אופטימיזציה לפקודה/מטמון/אצווה.
  • [ ] אני עוקב אחר העלות והשפעת האנרגיה.