יחידה 10 / 10

יישום מקצה לקצה: הערכה, אימות, אתיקה וגבולות

רווחים:

  • יכולת להגדיר מערך בדיקה קטן (eval) שמעריך מודל עם הנתונים שלך
  • הטמע אימות אנושי, מגבלות ומדיניות שימוש אחראי בזרימת העבודה
  • זיהוי הזיות, פרטיות וסיכונים אתיים וליישם אמצעים מקלים

בחרת את הדגם הנכון; האם העבודה בוצעה? לא, העבודה האמיתית מתחילה עכשיו. הכנסת מודל לעסק שלך מסתכמת בבדיקתו מול הנתונים שלך, אימות התפוקה שלו ומסגרת אחראית. יחידה אחרונה זו הופכת את המודול כולו לאפליקציה מקצה לקצה: תלמדו כיצד להגדיר חבילת בדיקות קטנה (eval), להטמיע אימות אנושי בזרימת העבודה, לנהל הזיות וסיכוני פרטיות ולשרטט גבולות אתיים. לאחר סיום היחידה, תהיו מצוידים לא רק לבחור דגם אלא גם להזמין אותו בביטחון.

הערכה (Eval): בדיקה עם הנתונים שלך

עכשיו אתה יודע שרק הנתונים שלך בפועל, לא מודעות, יכולים לדעת אם מודל מתאים לעסק שלך. הדרך למדוד זאת היא להגדיר מערך הערכה (eval): אוסף קטן של דוגמאות מהעבודה שלך שהתשובה הנכונה לגביהם ידועה.

eval פשוט מוגדר כך:

  1. אסוף 10-30 דוגמאות אמיתיות. בחר תשומות האופייניות לעבודה שלך (לערבב קשה וקל).
  2. קבע את "הפלט הנכון/צפוי" עבור כל דוגמה. מה יענה מומחה?
  3. הפעל את המועמדים באמצעות אותן דוגמאות. בדוק את הדגמים שאתה משווה אחד אחד עם אותו סט.
  4. ציון את התוצאות. בכמה דוגמאות זה נכון? איפה הוא טעה? האם טעויות מקובלות?
  5. השוו ובחרו. בחר לא את הציון הכולל הגבוה ביותר, אלא את זה שהכי אמין בדוגמאות הקריטיות ביותר עבורך.
טיפ: אל תבטח בעיוורון בטבלאות ההישגים. מודל עשוי להיות מקום ראשון בעולם, אך ביצועים גרועים יותר מהמודל במקום השני בטקסטים המשפטיים הספציפיים שלך בטורקיה. הערכה משלך של 20 דגימות שווה יותר ממאות בדיקות פומביות.

הזיה: הסיכון הכי ערמומי של הדוגמנית

הזיה היא כאשר המודל מייצר מידע שאינו נכון למעשה, בשפה בטוחה. במקום לומר "אני לא יודע", המודל עשוי לייצר דבר חקיקה לא קיים, סטטיסטיקה מורכבת או תאריך שקרי; יתר על כן, הוא עושה זאת בשפה משכנעת ביותר. זהו ההיבט המסוכן ביותר של AI כי השגיאה מתחזה לאמת.

אתה לא יכול לחסל את ההזיה לחלוטין, אבל אתה יכול להפחית אותה ולתפוס אותה:

  • התבסס על המקור: בקש מהמודל להפיק תשובות מהמסמכים שאתה מספק, לא מה"זיכרון" שלו (לוגיקת RAG).
  • בקש מקורות: אמור, "לצד כל טענה, כתוב את המסמך/סעיף שעליו היא מבוססת"; אם הוא לא יכול לתת מקור, תהיו חשדניים.
  • לגרום לאנשים לומר שהם לא בטוחים: ההוראה "אם אתה לא בטוח, כתוב 'לא ברור'" מפחיתה את התאמת הדגם.
  • אימות אנושי: פלטים קריטיים חייבים להיות מאומתים על ידי אדם.
זהירות: לעולם אל תשתמש בפלט דגם מבלי לאמת אותו להחלטות משפטיות, רפואיות או פיננסיות. "מאמר חוק" או "מידע על מינון" המיוצר על ידי הדגם עשוי להיות מפוברק לחלוטין. בתחומים אלה, AI הוא כלי טיוטה/ראשוני; לאדם מוכשר תמיד יש את המילה האחרונה.

דרישה לאימות אנושית

בינה מלאכותית פועלת בצורה הטובה ביותר ככלי שמאיץ אנשים, לא מוציא אותם מעבודתם. ההגדרה הנכונה היא כדלקמן: מייצרת או מתאימה מראש את טיוטת הדגם; האדם סוקר, מתקן ומאשר. עד כמה האימות צריך להיות מחמיר תלוי בעלות השגיאה.

קווסט

עלות שגיאה

אימות אנושי

טיוטת תיאור המוצר

נמוך

שליטה לדוגמה מספיקה

תגובת לקוח באימייל

בינוני

סקירה לפני הגשה

ניתוח סיכונים בחוזה

גבוה

מאמר אחר מאמר אישור מומחה

ייעוץ רפואי/פיננסי

גבוה מאוד

אימות מלא של מומחה, תמיכה בבינה מלאכותית בלבד

טבלה זו מייצרת את האיזון בין "בדיקה ידנית של כל פלט" ו"לא בודק כלל". בעוד ששליטה לדוגמה מספיקה עבור עבודות בעלות נמוכה, כל פלט חייב להיות מאומת עבור עבודות במחיר גבוה.

שימוש אתי ואחראי

למרות שבחירת דגם עשויה להיראות כמו החלטה טכנית, יש מאחוריה אחריות אתית:

  • שקיפות: תן ללקוחות או לעובדים שלך לדעת שאתה משתמש בבינה מלאכותית במקומות מתאימים. ללקוח יש את הזכות לדעת אם הוא מדבר עם אדם או AI.
  • הטיה: מודלים יכולים לרשת הטיה מהנתונים עליהם הם מאומנים. מעקב אחר הגינות התוצאות בתחומים רגישים כגון גיוס והערכת אשראי.
  • פרטיות: הטמע את עקרונות הגנת הנתונים שלמדת ביחידה 8 לתוך זרימת העבודה; אל תשלח נתונים אישיים בפזיזות.
  • אחריות: כאשר מתרחשת טעות, ההגנה של "AI עשה את זה" אינה מספיקה. האחריות היא על המוסד המשתמש ברכב. אז תעדו תהליכי אימות.
טיפ: כתוב קצת "מדיניות שימוש אחראי" לתוך זרימת העבודה שלך: אילו עבודות יכולות להשתמש ב-AI, אילו נתונים לא ניתן לשלוח, מי יאמת אותם וכיצד ידווחו שגיאות. מסמך זה בן עמוד אחד מונע בעיות גדולות בעתיד.

שלושה מקרים מציאותיים

מקרה 1 - חרטה מבלי לבסס eval. צוות ביטוח מתחיל לסכם תביעות מבלי לבדוק את הדגם הפופולרי ביותר. אחרי שבועיים הם מבינים שהדגם עושה טעויות תכופות במונחים טכניים טורקיים וקורא כמה סכומים בצורה לא נכונה. כאשר הם מגדירים הערכה של 20 דוגמאות ומשווים בין שלושת הדגמים, הם עוברים לדגם שאינו הפופולרי ביותר אך מדויק יותר בטקסטים טכניים טורקיים. האובדן: שבועיים ועבודת הגהה. שיעור: תחילה בדוק, פרוס מאוחר יותר.

מקרה 2 - התהליך הלוכד את ההזיה. עורך דין רואה אסמכתא "החלטת בית המשפט העליון" בתדפיס הדגם. מאחר ולתהליך שלהם יש כלל "אמת כל התייחסות", הוא מחפש את ההחלטה ומוצא שלא קיימת החלטה כזו; הוא המציא דוגמנית. הודות לאימות אנושית, מידע מפוברק לעולם לא מגיע ללקוח. ללא כלל האימות, אובדן המוניטין יכול היה להיות חמור.

מקרה 3 - אמון עם שקיפות. חברת מסחר אלקטרוני מייצרת תגובות תמיכת לקוחות עם AI, אך מוסיפה הערה מתחת לכל תגובה: "תגובה זו הוכנה עם תמיכה בבינה מלאכותית ונבדקה על ידי אחד הנציגים שלנו". לקוחות מרוצים יותר הן מהתגובה המהירה והן מהביטחון של לראות בן אנוש מעורב. שקיפות היא לא חולשה להסתיר, אלא מקור לאמון.

הנחיה חלשה / הנחיה חזקה: פלט ניתן לאימות

הנחיה חלשה:

ספר לי על הסעיפים המסוכנים בחוזה הזה.

יכול להתאים לדגם; אין מקור, אין סימן לאי ודאות.

הנחיה עוצמתית:

תפקידך: מנתח חוזים (ההחלטה הסופית שייכת לעורך דין). משימה: הדגש סעיפים שעלולים להיות מסוכנים בחוזה הבא. לכל ממצא: (1) מספר סעיף וציטוט מילולי, (2) מדוע זה מסוכן, (3) רמת הביטחון שלך (גבוה/בינונית/נמוכה). הסתמכו רק על סעיפים בטקסט; אל תמציא שום דבר שאינו בטקסט. היכן שאינך בטוח, כתוב "דרוש אישור עורך דין". [חוזה]

הנחיה חזקה מקשרת כל טענה למקור (מספר מאמר + ציטוט), מחייבת רמת ביטחון ואוסרת בדיה; זה הופך את ההזיה לניתנת לתפיסה.

תבניות הניתנות להעתקה

1. עיצוב סט Eval:

תכנן ערכת הערכה עבור המשימה הבאה [TASK]. הצע 15 כניסות לדוגמה (מעורב קל-בינוני-קשה), כיצד יוגדר "הפלט הנכון הצפוי" עבור כל אחד מהם, וקבע קריטריון ניקוד (1-5).

2. עטיפת מפחית הזיות:

כתוב מחדש את ההנחיה הבאה כדי לצמצם את הייצור: "[PROMPT]". הוסף כללים לציטוט מקורות, ציון רמות אמון ו"תגיד לי אם אתה לא בטוח".

3. עיצוב זרימת אימות:

בזרימת העבודה הבאה [WORKFLOW] תכנן שלב אימות אנושי עבור פלט AI. קבע עד כמה האימות צריך להיות מחמיר על סמך עלות הטעות; לכתוב מי יבדוק מה, מתי.

4. טיוטת מדיניות שימוש אחראי:

נסח "מדיניות שימוש אחראית בבינה מלאכותית" של עמוד אחד עבור צוות ב[תעשייה]. כלול את הכותרות הבאות: שימושים מותרים, נתונים אסורים, אחריות אימות, דיווח שקיפות, דיווח על שגיאות.

טעויות נפוצות

  • פריסה ללא Eval: הפעלת המודל מבלי לבדוק אותו עם הנתונים שלך ולהבחין בשגיאות לאחר שהן משתקפות בלקוח/העבודה.
  • הסתמכות על הזיה: שימוש בשפה הבטוחה של המודל כאמת מבלי לאמת את ההפניות.
  • עקיפת אימות אנושי: השארת פלט ללא בדיקה בהחלטות בעלות גבוהה; נשען על הגנת "AI עשה את זה".
  • הימנעות משקיפות: הסתרת השימוש שלך בבינה מלאכותית; חווה אובדן ביטחון כשהוא מתרחש.
  • התעלמות מאתיקה והטיה: שימוש בהחלטות רגישות (גיוס עובדים, אשראי) ללא מעקב אחר הגינות התפוקה.

לסיכום

  • לפני פריסת מודל, הגדר ערכת הערכה קטנה עם הנתונים שלך ובדוק את המועמדים; הדירוג הכללי אינו מייצג את העסק שלך.
  • הזיה היא ייצור בטוח של הדוגמנית של שפה כוזבת; נתפס על ידי ייחוס מקור, רמת אמון ואימות אנושי.
  • קפדנות האימות האנושי מותאמת בהתאם לעלות הטעות; בתחומים קריטיים בינה מלאכותית היא רק תמיכה, ההחלטה היא של האדם.
  • שקיפות, בקרת הטיה, סודיות ואחריות; הם ארבעת עמודי התווך של שימוש בינה מלאכותית אחראית. מדיניות עמוד אחד מונעת סיכונים גדולים.

משימת יישום

הגדר ערכת הערכה של 15 דוגמאות עם תבנית 1 ביחידה זו (עיצוב סט הערכה) עבור המודל/ים המועמדים שבחרת לאורך המודול והשווה לפחות שני מודלים מול סט זה. לאחר מכן עצב כיצד הפלט יאומת על ידי בני אדם עם תבנית 3 (זרימת אימות) ועצב מדיניות של עמוד אחד עבור הצוות שלך עם תבנית 4 (מדיניות שימוש אחראי). שלוש התוצרים הללו הופכים את המודול כולו לתוכנית פריסה ניתנת לביצוע.

רשימת בדיקה

  • [ ] עם הנתונים שלי, אני יכול להגדיר מערך הערכה קטן ולהשוות מודלים.
  • [ ] אני יכול לזהות הזיות ולהפעיל אמצעים מקלים ומעצורים.
  • [ ] אני יכול להתאים את המחמירות של אימות אנושי על סמך עלות הטעות.
  • [ ] אני יכול להטמיע בזרימת העבודה עקרונות שקיפות, הטיה, סודיות ואחריות.
  • [ ] אני יכול לנסח מדיניות שימוש אחראית בינה מלאכותית של עמוד אחד.

מבחן מודול

1. מה ההבדל בין 'ספק' בינה מלאכותית ל'משפחת דוגמניות'?

  • א) הספק הוא החברה המפתחת את הדגם, ומשפחת הדגמים היא קבוצת הדגמים של אותה חברה תחת מותג ✔
  • ב) הם בדיוק אותו דבר ומשמשים לסירוגין
  • ג) הספק הוא מחיר הדגם, משפחת הדגמים היא מהירות הדגם.
  • ד) משפחת דגמים מתייחסת לחברה, ספק מתייחס לגרסת דגם יחיד

תיאור: הספק הוא החברה שפיתחה את המודל (למשל Anthropic); משפחת דוגמניות היא קבוצת הדגמים שאותה חברה אוספת תחת מותג (לדוגמה, קלוד). גרסת הדגם היא גרסה ספציפית בתוך המשפחה.

2. כיצד ניתן להגדיר בצורה המדויקת ביותר את ה'משקלים' של מודל?

  • א) זהו מספר האסימונים שהדגם יכול לייצר לדקה
  • ב) אלו מיליארדי הפרמטרים המספריים שהמודל לומד במהלך האימון ומאחסן את המידע שלו. ✔
  • ג) זהו דמי המנוי החודשיים של הדגם
  • ד) זהו מספר השפות הנתמכות על ידי המודל

תיאור: משקלים הם מיליארדי פרמטרים מספריים שהמודל לומד במהלך האימון; זה המקום שבו מאוחסן 'כל מה שהדוגמנית יודעת'. ההבחנה במשקל סגור/מפורש תלויה בשאלה אם ניתן להוריד ולהפעיל את הפרמטרים הללו.

3. איזו משפט נכון לגבי 'משקל פתוח' ו'קוד פתוח'?

  • א) הם בדיוק אותם מושגים ושניהם נותנים שימוש מסחרי בלתי מוגבל
  • ב) משקל פתוח תמיד הופך גם את נתוני האימון לציבוריים
  • ג) זה לא אותו דבר; בשקלול פתוח, בדרך כלל רק פרמטרים משותפים ותנאי הרישיון עשויים להגביל את השימוש המסחרי ✔
  • ד) לא ניתן להוריד דגמי קוד פתוח, ניתן להוריד דגמי משקל פתוח

הסבר: בשקלול פתוח, רק פרמטרי מודל משותפים; נתוני ההדרכה והתהליך לרוב אינם נחשפים, וכמה רישיונות מגבילים את השימוש המסחרי. אז 'משקל פתוח' זה לא בדיוק כמו 'קוד פתוח'.

4. איזו מהבאים היא תכונת המודל המכריעה ביותר עבור צוות משפטי הקורא ומנתח חוזים ארוכים?

  • א) בעל המחיר האסימון הנמוך ביותר
  • ב) בעל יכולת עיבוד ויזואלית (מולטימודאלית).
  • ג) בעל רישיון משקל פתוח
  • ד) בעל חלון הקשר רחב ✔

הסבר: המודל זקוק לחלון הקשר גדול כדי לעבד מסמכים ארוכים כמכלול; חלון ההקשר הוא הכמות הכוללת של אסימונים שהמודל יכול לזכור בכל פעם.

5. מה נכון לגבי תמחור סמלי עבור דגמי משקל סגור?

  • א) אסימון הפלט בדרך כלל יקר משמעותית מאסימון הקלט ✔
  • ב) קלט ופלט הם תמיד בדיוק אותו מחיר
  • ג) רק תשלום חודשי קבוע נגבה, סכום השימוש אינו רלוונטי
  • ד) אסימון קלט הוא תמיד יקר פי כמה מהפלט

הסבר: המחיר מחושב לפי אסימון, ואסימון הפלט שהדגם מייצר בדרך כלל יקר פי כמה מאסימון הקלט שאתה שולח. לכן, תדפיסים ארוכים ומיותרים מייקרים עלויות במהירות.

6. איזו תכונה במודל חיונית לצוות הנהלת חשבונות שרוצה לחלץ נתונים אוטומטית מתמונות חשבוניות?

  • א) חלון ההקשר הרחב ביותר האפשרי
  • ב) מולטי-מודאליות (יכולת עיבוד חזותי) ✔
  • ג) רישיון משקל פתוח
  • ד) רמת ההיגיון הגבוהה ביותר

הסבר: כדי להבין תוכן ויזואלי, על המודל להיות מסוגל לעבד תמונות וגם טקסט, כלומר, עליו להיות מולטי-מודאלי. מולטי-מודאליות היא היכולת של המודל לטפל במספר סוגי נתונים, כגון טקסט, תמונות ולפעמים אודיו.

7. מהי הבחירה ההגיונית ביותר למשימה פשוטה בנפח גבוה (למשל סיווג חיובי/שלילי של אלפי ביקורות)?

  • א) תמיד מודל החשיבה החזק והיקר ביותר
  • ב) דגם שעובד רק על משקל פתוח ועל שרת משלו
  • ג) דגם קל משקל ובעלות נמוכה, כי המשימה פשוטה והנפח גבוה ✔
  • ד) המודל עם חלון ההקשר הרחב ביותר

תיאור: דגם קל משקל ובעלות נמוכה עושה את העבודה עבור משימות פשוטות בנפח גבוה; שימוש בדגם החזק והיקר ביותר יוצר כאן עלויות מיותרות. הגישה הנכונה היא להתאים את קושי המשימה לשכבת המודל.

8. מה מעורר שליחת טקסט המכיל נתונים אישיים לספק AI זר במונחים של KVKK?

  • א) זה לא יוצר כל אחריות משפטית
  • ב) משנה רק אם הספק נמצא באיחוד האירופי, בשום מקרה אחר
  • ג) זה אסור בתכלית האיסור בכל הנסיבות, ללא קשר אם הנתונים אנונימיים או לא
  • ד) העברת נתונים לחו"ל נחשבת וכפופה לתנאים המיוחדים של KVKK ✔

הסבר: נתוני תפעול בשרתים של ספק בחו"ל נחשבים ל'העברת נתונים לחו"ל' וכפופים לתנאים המיוחדים של KVKK בנושא זה (כגון הסכמה מפורשת, החלטת הלימה, הבטחות מתאימות).

9. מה עושה מצב 'הנימוק' של דגם וכיצד הוא משפיע על העלות?

  • א) זה מגביר את הדיוק בבעיות מורכבות, אבל מגדיל את העלות והעיכוב מכיוון שהוא מייצר יותר אסימונים ✔
  • ב) תמיד עושה את הדגם בחינם
  • ג) רק מגדיל את מספר השפות הנתמכות על ידי המודל
  • ד) תמיד לקצר את התשובות ולהפחית את העלות

תיאור: מצב נימוק מאפשר למודל 'לחשוב' צעד אחר צעד לפני מתן התשובה; זה מגביר את הדיוק בבעיות מרובות שלבים ומורכבות, אבל זה גם מגדיל את העלות והעיכוב מכיוון שהוא מייצר יותר אסימונים.

10. מהי הגישה האמינה ביותר בעת הערכת (eval) מודל עבור העסק שלך?

  • א) רק בחירת הדגם הפופולרי ביותר ושימוש בו ללא בדיקה
  • ב) הגדר ערכת בדיקה קטנה של המשימות האמיתיות שלך והשווה איתה מודלים ✔
  • ג) רק להסתכל על ציון המדד המוזכר בפרסומות
  • ד) קבל באופן אוטומטי את המודל עם חלון ההקשר הגבוה ביותר בתור הטוב ביותר

הסבר: במקום להסתמך בצורה עיוורת על לוחות הישגים, יצירת מערך בדיקה קטן של המשימות האמיתיות שלך והשוואת מודלים על סט זה יגלה את זה שבאמת מתאים לעסק שלך.

11. כיצד אמורה הידיעה שפלט מודל עשוי להכיל 'הזיות' לעצב את זרימת העבודה שלך?

  • א) הפלט תמיד צריך להיחשב נכון ולפרסם ישירות
  • ב) הזיה רואים רק בדגמים בחינם, לא בדגמים בתשלום
  • ג) בהחלטות קריטיות, הפלט חייב להיות מאומת על ידי אדם ויש לאשר את המקורות ✔
  • ד) את ההזיה ניתן לבטל לחלוטין על ידי שינוי הדגם

הסבר: הזיה היא כאשר המודל מייצר מידע שאינו נכון בפועל, בשפה בטוחה. בגלל סיכון זה, יש לדרוש אימות של פלט על ידי אדם, במיוחד עבור החלטות משפטיות, רפואיות ופיננסיות.

12. מהו ההיגיון הבסיסי של גישת 'תיק המודל' שאומצה על ידי מוסדות בוגרים?

  • א) להבטיח פשטות על ידי ביצוע כל עבודה על ידי דגם יחיד, היקר ביותר.
  • ב) שימוש רק בדגם הזול ביותר והתעלמות מוחלטת מאיכות
  • ג) אין להשתמש בדגמים כלשהם ולבצע את כל העבודה באופן ידני
  • ד) ייעול עלות והפחתת התלות בספק יחיד על ידי שימוש במודלים שונים בהתאם למשימה ✔

תיאור: תיק המודלים הוא להשתמש במודלים שונים בהתאם למשימה: מודל זול לעבודות פשוטות ומגושמות, מודל חזק לעבודות מורכבות, משקל פתוח/מודל אזורי לנתונים חסויים. זה גם מייעל את העלות וגם מפחית את התלות בספק יחיד.

13. מדוע מדינת המקור ומדיניות שמירת הנתונים עשויים להיות קריטריון לבחירת הדגם?

  • א) מכיוון שהוא משפיע ישירות על דרישות הרגולציה, ריבונות הנתונים והפרטיות ✔
  • ב) רק בגלל שהוא קובע את מהירות התגובה של המודל
  • ג) מכיוון שהוא קובע את פורמטי הקבצים הנתמכים על ידי המודל
  • ד) מכיוון שאין לזה השפעה מעשית, זה רק פרט שיווקי

תיאור: מדינה שבה נמצא מפתח המודל והיכן/כמה נתונים מאוחסנים; הוא מכריע מבחינת רגולציה משפטית, ריבונות נתונים ופרטיות. לדוגמה, עבור ארגון שרוצה לארח בתוך האיחוד האירופי, ספק אזורי או אפשרות אחסון אפס הופכים חשובים.

14. מה מסביר בצורה הטובה ביותר מדוע חיפוש אחר 'דגם אחד הכי טוב' במשימה הוא מטעה?

  • א) לכל הדגמים יש למעשה את אותן יכולות
  • ב) הדגמים חזקים בגדלים שונים, כך שה'טוב ביותר' תלוי בדרישת העבודה ✔
  • ג) הדגם היקר ביותר הוא אוטומטית הטוב ביותר בכל משימה
  • ד) בחירת הדגם צריכה להיעשות באופן אקראי לחלוטין

תיאור: מודלים חזקים בממדים שונים כמו מהירות, עלות, הקשר, מולטי-מודאליות, פרטיות והיגיון. מודל שהוא מנהיג בממד אחד עשוי להיות חלש בממד אחר; אז 'הטוב ביותר' תלוי תמיד בדרישת העבודה.