רווחים:
- יכולת להגדיר מדדים המנטרים אותות שימוש, אבטחה, איכות וביצועים
- יכולת לזהות סחיפה של איכות הפלט עם קו בסיס ודגימה
- יכולת להגדיר לולאת אזעקה ומשוב עבור חריגות וגלי פריצת כלא
הכנסת מערכת AI לייצור היא ההתחלה, לא הסוף. גם אם המודל יישאר זהה, העולם משתנה: התנהגות משתמשים, נתונים נכנסים, טכניקות תקיפה והקשר עסקי משתנים כל הזמן. התשובה הנכונה של אתמול עשויה להיות שגויה היום. אז העמוד האחרון של האבטחה הוא ניטור וצפייה מתמשך - היכולת לראות מבחוץ מה קורה בתוך המערכת. ביחידה זו, נלמד אילו מדדים לנטר, כיצד ללכוד סחיפה של איכות הפלט וכיצד להתריע על חריגות.
למה ניטור רציף?
בתוכנה הקלאסית, "האם זה עובד" היא שאלה בינארית: או שהיא עונה או שלא. בבינה מלאכותית, בעוד שנראה שהמערכת "עובדת", היא עלולה להידרדר בשקט: התשובות הופכות לאט לאט לא מדויקות, העלויות מסלימות, ניסיונות פריצת הכלא עולים. הדרך היחידה ללכוד אותם היא למדוד כל הזמן את האותות הנכונים.
שימו לב: התקלה המסוכנת ביותר היא השקטה, לא הרועשת. המערכת לא זורקת שגיאות, האיכות שלה רק יורדת. אם לא תגדיר ניטור, האדם הראשון שישים לב אליו יהיה הלקוח או המבקר שלך, לא אתה.
ארבע משפחות איתות לצפייה
- שימוש ועלות: נפח בקשה, צריכת אסימון, עלות למשתמש. קפיצה פתאומית; זה יכול להיות סימן להתעללות, אינטגרציה עיוורת או מתג דולף.
- אותות אבטחה: ניסיונות פריצה/הזרקה, שיחות רכב נדחו, שגיאות הרשאה. עלייה עשויה להצביע על מסע תקיפה פעיל.
- איכות וסחיפה: ירידה באיכות הפלט לאורך זמן (סחיפה). לדוגמה, שיעור מעבר אימות, שיעור תיקון באישור אנושי, שביעות רצון המשתמש.
- ביצועים: חביון, שיעור שגיאות, פסק זמן. זה משפיע ישירות על חווית המשתמש והעלות.
מה זה דריפט ואיך לתפוס אותו?
סחיפה היא כאשר איכות הקלט או הפלט של הדגם משתנה ללא תשומת לב לאורך זמן. ישנם שני סוגים: סחיפה של נתונים (התפלגות הבקשות הנכנסות משתנה - נושא חדש, שפה חדשה) וסחיפה איכותית (התפוקה של אותה עבודה מחמירה בהדרגה). נדרש קו בסיס כדי ללכוד: לרשום את הטווח הנורמלי של מדדים כאשר המערכת בריאה; תן לסטייה להפוך לאזעקה.
שלב אחר שלב: הגדרת ניטור
- מדוד את קו הבסיס. רשום את הטווח התקין של כל אות כאשר המערכת בריאה.
- הגדר סף ואזעקה. איזו סטייה תזהיר את מי ואיך?
- דגימה + בדיקת אנוש. יש לבחון באופן אנושי דגימה של הפלטים באופן קבוע (סחף איכות נראה לרוב רק).
- התקן לוח מחוונים. ניטור ארבע משפחות אותות על מסך אחד.
- לולאת משוב. קשר את הממצאים מהניטור ועד לשיפור מהיר/בקרה.
ארבע תבניות הניתנות להעתקה
הנחיה להערכת דגימת איכות (מעקב סחף עם LLM-as-judge):
להלן 20 פריטי הדפסה אקראיים מהשבוע. דרג כל אחד כ"טוב / מקובל / רע" וכתוב נימוק קצר. לבסוף אשווה את התעריף הגרוע עם התעריף של שבוע שעבר; אם יש דפוס (הישנות של אותו סוג של טעות) שבולט השבוע, סמן אותו.<outputs>{{ דוגמאות }}</outputs>
הנחיה לסיכום חריגות:
בדוק את המדדים היומיים הבאים: מספר בקשות, אסימונים, עלות, קריאת כלי שנדחתה, ניסיונות פריצת jail, זמן אחזור ממוצע. סמן כל מדד החורג ביותר מ-30% מקו הבסיס כ-"ANOMALIT" והעריך את הסיבה האפשרית (התקפה, באג, שימוש לרעה).<metrics>{{ daily_data }}</metrics>
כלל הגדרת סף אזעקה:
הגדר אזעקות עבור כל אות:- עלות: אם עולה על ממוצע יומי פי 2 -> התראה בעדיפות גבוהה- ניסיונות פריצת Jail: אם עולה על 10 לשעה -> הודע לצוות האבטחה- שיעור מעבר אימות: אם יורד מתחת ל-90% -> סקירת איכות- חביון: אם p95 חורג מהיעד פי 2 -> סקירת ביצועים
הודעת מחקר סחיפה:
שיעור מעבר האימות ירד מ-94% ל-78% בשבועיים האחרונים. עזור לי לענות על שאלות אלה: (1) האם הופיע נושא/שפה/פורמט חדש בבקשות הנכנסות? (2) האם טעויות מתרכזות בקטגוריה מסוימת? (3) האם העיתוי עולה בקנה אחד עם הנחיה/דגם/שינוי כלי? תן שם את הנתונים שיש לבדוק עבור כל אחד מהם.
הנחיה חלשה / הנחיה חזקה
גישה גרועה
גישה חזקה
"אם יש שגיאה, נראה"
קו בסיס + סף + אזעקה יזומה
רק בודקים אם המערכת עומדת.
ניטור ארבע משפחות של אותות (שימוש, אבטחה, איכות, ביצועים)
לא דוגמת את איכות הפלט בכלל
דגימה אנושית רגילה + LLM-as-judge
לא אוספת ומסתכלת על מדדים
לוח מחוונים + לולאת משוב
שלושה מיני מארזים
מקרה 1 - אזעקת עלות תפסה את המפתח הדולף. עלות האסימון היומית של חברה שולשה בן לילה. אזעקת הסף התריעה לצוות האבטחה; חקירה הראתה שמפתח בדיקה הודלף והשתמש בו בוט. המפתח נשלל תוך 25 דקות; אם לא הייתה אזעקה, החשבון היה מורגש בסוף החודש.
מקרה 2 - סחף באיכות שקטה. שיעור מעבר האימות של עוזר תמיכה ירד בשקט מ-95% ל-80% תוך שלושה שבועות. דגימה שבועית תפסה זאת; הסיבה הייתה שלקוחות החלו לשאול על קו מוצרים חדש ומאגר הידע של הדגם עליו לא היה שלם. השיעור התאושש כאשר בסיס הידע עודכן.
מקרה 3 - גל פריצת הכלא היה מוקדם. ניסיונות ההזרקה של עוזר גדלו מ-2 ל-40 לשעה ביום אחד. אזעקת אבטחה מופעלת; נראה כי "מתכון" לפיצוח המערכת חולק בפורום. הצוות עדכן את הודעת ההגנה וחשבונות חשודים מוגבלים בשיעור; הגל דעך לפני שהפך לדליפה של ממש.
טיפ: אל תסתפקו רק במדדי מכונה. סחף איכותי נתפס לעתים קרובות רק על ידי כך שאדם יקרא את פלטי הדוגמאות. שגרה קטנה של סקירת 15-20 תדפיסים אקראיים בשבוע תתפוס מוקדם את הכשלים השקטים היקרים ביותר.
טעויות נפוצות
- לא להכניס את זה לייצור ולהגדיר ניטור ("זה עובד, בסדר").
- אי יכולת לזהות את האנומליה מבלי למדוד את קו הבסיס.
- מתגעגע לסחף האיכותי רק על ידי הסתכלות על "האם זה עומד".
- לא לדגום את איכות הפלט דרך עיניים אנושיות בכלל.
- לא להפעיל אזעקה ולברר את הבעיה מהלקוח/המפקח.
- לא מחבר ממצאי ניטור לשיפור (ללא לולאת משוב).
לסיכום
- מערכות AI יכולות להתדרדר בשקט; התקלה המסוכנת ביותר היא זו שלא זורקת שגיאות, אלא רק מפחיתה את האיכות.
- עקוב אחר ארבע משפחות של אותות: שימוש/עלות, בטיחות, איכות/סחיפה וביצועים.
- סחיפה (הסחף של איכות הקלט או הפלט לאורך זמן) נקלט רק בהשוואה לקו הבסיס.
- דגימה רגילה של בני אדם בנוסף למדדי מכונות לוכדת סחיפה איכותית.
- חבר ניטור ללולאת האזעקה והמשוב; למדוד ולא להסתכל זה לא ניטור.
משימת יישום
בחר לפחות מדד אחד מכל אחת מארבע משפחות האותות עבור מערכת הבינה המלאכותית שלך ורשום את קווי הבסיס הנוכחיים (או המשוערים) שלהם. הגדר סף אזעקה עבור כל מדד. לאחר מכן קח 15 מהתפוקות של הסמסטר האחרון שלך וציון אותם באמצעות הנחיית הדגימה שלמעלה; שימו לב לשיעור ה"רע". תן לזה להיות קו הבסיס הראשון שלך שאליו תוכל להשוות סחף בעתיד.
רשימת בדיקה
- [ ] הגדרתי מדדים מארבע משפחות אותות (שימוש, אבטחה, איכות, ביצועים).
- [ ] הגדרתי קו בסיס וסף אזעקה עבור כל מדד.
- [ ] אני דוגם באופן קבוע את איכות הפלט דרך עיניים אנושיות.
- [ ] אני עוקב אחר האותות במסך בודד עם פאנל תצוגה.
- [ ] אזעקה עוברת לצוות האבטחה על חריגות וגלי פריצה לכלא.
- [ ] אני מייחס את ממצאי הניטור לשיפור המהיר/בקרה.