יחידה 8 / 11

זיהוי דיפפייק ומדיה סינתטית: אימות תמונה מזויפת, אודיו ווידאו

רווחים:

  • יכולת להבין הן את הראיות הכוזבות והן את האיום של 'הרווח של שקרן' של מדיה סינתטית ואימות רב-שכבתי של אותנטיות מדיה
  • יכולת להעריך שכבות מקור, מטא נתונים, אנומליה טכנית, מקור (C2PA) ועקביות הקשר יחד ולא להסתמך על ציון רכב אחד
  • יכולת לבטא את התוצאה בשפה של רמת ביטחון, לא וודאות, ולאמץ שימוש בידע בטכניקת ייצור רק לגילוי והגנה.

סרטון מגיע כ"ראיה" בחקירה: הקלטת אודיו של מנהל נותן הנחיות לא נאותות, תמונה המראה אדם שנמצא במקום כלשהו, ​​סרטון של הודאה. אבל כעת נותרה השאלה בראש כל עדות: האם זה אמיתי, או שזה נוצר על ידי בינה מלאכותית? Deepfake (מדיה מזויפת המופקת על ידי למידה עמוקה המחקה את הפנים/קול/תנועה של אדם אמיתי) ובאופן רחב יותר, מדיה סינתטית (מדיה סינתטית - תמונות, אודיו, וידאו המופקים במלואם או בחלקם על ידי בינה מלאכותית) הם הגבול החדש והמאתגר ביותר של זיהוי פלילי דיגיטלי. ביחידה זו, נסקור את התפקיד הכפול הזה של בינה מלאכותית ככלי איומים וזיהוי, ומדוע האימות חייב להיות רב-שכבתי.

למה זה כל כך קריטי?

מדיה סינתטית היא איום דו-כיווני. ראשית, ראיות מזויפות: מישהו יכול לייצר זיוף עמוק כדי "להוכיח" אירוע שלא התרחש. שנית, ערמומי יותר, הוא "הדיבידנד של השקרן" (הדיבידנד של השקרן - בזכות ריבוי התקשורת המזויף, ניתן לפטור אפילו ראיות אמיתיות כ"זהו זיוף עמוק"). אז מדיה סינתטית לא רק מייצרת ראיות כוזבות; זה גם מערער את אמינותן של ראיות ממשיות. לכן, המנתח המשפטי חייב לאמת את האותנטיות של כל ראיה תקשורתית - שהיא באמת מגיעה מהמקור הנטען, ללא שינוי.

שימו לב: "כלי זיהוי AI אמר כי 98% זיוף עמוק" לבדו לא מספיק בבית המשפט. מודלים לזיהוי שגויים, טכניקות מהדור החדש מתחמקות מהם, וציון הסתברות אינו הוכחה מוחלטת. זיהוי Deep Fake צריך תמיד להיתמך על ידי אימות רב-שכבתי (טכני + הקשר + מקור).

שכבות של זיהוי

זיהוי מדיה סינתטית אינו יכול להסתמך על כלי קסם אחד; צריך להיות מרובד:

  1. ניתוח טכני/משפטי: אי עקביות דחיסה, חריגות פיקסלים/תדרים, עיוותים בגבול הפנים, היעדר אותות ביולוגיים כגון מצמוצי עיניים ודופק, דפוסי תדר לא טבעיים לשמע.
  2. מטא-נתונים וניתוח מקור: מטא-נתונים של EXIF/container של הקובץ, עקבות ייצור, טביעת אצבע של המכשיר, נתיבים בהם עבר הקובץ (שרשרת משמורת). מטא נתונים שנמחקו/לא עקביים הם אזהרה.
  3. מקור תוכן: מאומת על ידי תקנים כגון C2PA (תקן פתוח המוסיף מידע מקור בחתימה קריפטוגרפית למדיה, המציין מהיכן הגיע וכיצד נערך); האם יש חתימה, האם היא עקבית?
  4. אימות הקשר: האם האורות, הצללים, ההשתקפויות בסרטון עקביות פיזית? האם סינכרון הקול והליפ מתאימים? האם התוכן סותר עובדות ידועות (מזג אוויר, מיקום, זמן)?

בינה מלאכותית היא המאיץ ברבות מהשכבות הללו: מסמן חריגות, מזהה חוסר עקביות, יוצר רשימות ביקורת. אבל השיפוט הסופי של האותנטיות נעשה באמצעות שכבות מרובות של אימות צולב והערכת מומחים.

AI: גם איום וגם כלי

המתח המרכזי של יחידה זו: אותה טכנולוגיה גם מייצרת וגם מזהה זיופים עמוקים. המנתח המשפטי חייב להבין טכניקות ייצור (איך לזהות זיוף מבלי לדעת איך הוא בוצע?) אך משתמש בכך רק לצורכי גילוי והגנה. שימוש בבינה מלאכותית כדי לייצר מדיה מזויפת כדי לרמות מישהו אחר הוא הונאה וניצול לרעה של זהות; היקף מודול זה הוא זיהוי ואימות בלבד.

טיפ: בעת הערכת ראיות תקשורתיות, תחילה בצע את מבחן "ההסבר הפשוט ביותר": האם הקובץ הזה באמת הגיע מהמקום שבו הוא מתיימר להיות? האם שרשרת המשמורת בטוחה? לרוב, הבעיה היא לא ה-deepfake, אלא דה-קונטקסטואליזציה (סרטון מאירוע אמיתי אך ישן/אחר, המוצג בהקשר הלא נכון). אמת מקור והקשר לפני ניתוח עמוק זיוף מורכב.

הסתברות, לא ודאות

כלי זיהוי Deepfake מייצרים ציון הסתברות; לא "בהחלט מזויף" או "בהחלט אמיתי". לציון זה יש מרווח שגיאה, רווח סמך, והביצועים שלו יורדים בשיטות ייצור חדשות שהדגם לא ראה. בדו"ח הפורנזי, במקום לומר "זה מזויף" לתקשורת, יש לומר "האינדיקטורים הללו מצביעים על מניפולציה, שכבות האימות הללו הראו זאת, רמת הוודאות היא זו". שפה מדויקת מדי יוצרת התנגדויות בבית המשפט ואובדן מוניטין.

שלושה מיני תיקים

מקרה 1 - ניתוח מוצא נפתר לפני זיוף עמוק. סרטון שהוגש כ"ראיה" לוועדה נבדק. לפני המעבר לניתוח עמוק מזויף, המטא-נתונים נבדקו: הסרטון נוצר 8 חודשים לפני התאריך שהוגשה לגביו תביעה, והמטא-נתונים של המכולה הצביעו על אפליקציה אחרת. הסרטון לא היה מזויף, אבל הוא הוצג בהקשר הלא נכון; השכבה הפשוטה ביותר פתרה את הבעיה.

מקרה 2 - זיהוי רב-שכבתי תפס את הזיוף. בהקלטה קולית אמר כלי זיהוי הבינה המלאכותית 71% סינתטי (לא בטוח). המומחה בחן רבדים נוספים: דפוסים לא טבעיים בניתוח תדרים, היעדר צלילי נשימה והיעדר חתימת C2PA. השילוב של שלושה אינדיקטורים עצמאיים הניב תוצאה הרבה יותר חזקה מאשר ציון בודד.

מקרה 3 - חזרה מוודאות מופרזת. "הסרטון הוא בהחלט זיוף עמוק", נאמר בטיוטת דו"ח, שציטט ציון רכב בודד. המומחה הבכיר תיקן: לא מספיק כלי אחד, שפה לא יכולה להיות "לגמרי". הדוח תורגם לשפה המבטאת רבדים ורמות דיוק מרובות; ובכך הופך להגנה בבית המשפט.

ארבע תבניות הניתנות להעתקה

1) רשימת בדיקה לאימות מדיה:

תפקידך: מומחה לאימות מדיה סינתטית. הפק לי רשימת בדיקה שכבתית לאימות עדות תמונה/שמע/וידאו: (1) מקור/שרשרת משמורת, (2) מטא נתונים, (3) אנומליה טכנית, (4) מקור/C2PA, (5) עקביות הקשרית. כתוב שלבי בדיקה קונקרטיים עבור כל שכבה.

2) ניתוח עקביות של מטא נתונים:

אני אתן לך את המטא נתונים (EXIF/מיכל) של קובץ מדיה. חוסר עקביות בדגל: צור-שנה קונפליקט, מעקב אחר מכשיר/תוכנה, שדות חסרים/נמחקו, אי התאמה גיאו-זמנית. ציין כי אלו עשויים להיות סימנים של מניפולציה, אך אינם עדויות בפני עצמם.

3) בדיקת עקביות הקשר:

העריכו את העקביות הפיזית בתמונה/סרטון זה: האם כיוון התאורה והצללים עקביים, האם ההשתקפויות מדויקות, האם האודיו-ליפסינכרון תואם, האם הרקע תואם למיקום/זמן הנטען? קשר כל תצפית למיקום קונקרטי. אל תעשה פסק דין סופי; רשום את הנקודות המעוררות ספקות.

4) שפה ברמת דיוק:

תרגם את ממצאי האימות הבאים (ציונים + תוצאות ריבוד) לפסקת דוח. אל תגיד "בהחלט מזויף/אמיתי"; לתת לכל ממצא את מקורו ולהביע רמה כללית של ודאות (ביטחון נמוך/בינוני/גבוה). הימנע מטענות מעוררות התנגדות מוגזמות.

הנחיה חלשה / הנחיה חזקה

הנחיה חלשה:

תגיד לי, האם הסרטון הזה הוא זיוף עמוק?

שכבה אחת, שיפוט אחד מחכה; AI מייצר "כן/לא" ללא הקשר, זה יופרך בבית המשפט.

הנחיה עוצמתית:

תפקידך: מומחה לאימות מדיה סינתטית. אתאר לך את המטא נתונים של סרטון, הניקוד של כלי זיהוי וכמה פריימים. משימה: להעריך את שכבות המקור, המטא נתונים, חריגות טכנית ועקביות הקשר בנפרד; חבר את מה שאתה רואה בכל שכבה למקור. הביעו את התוצאה כרמת הביטחון המשולבת של השכבות, לא כ"מדויק". אל תסתמך על ניקוד אחד; לציין שכבות חסרות.

הערכה שכבתית, קישור למקור והאילוץ של "אין להתקשר" הופכים את הפלט להגנה.

טבלת שכבות אימות

שכבה

על מה הוא מסתכל?

נקודה חזקה

הגבלה

מקור/CoC

מאיפה הגיע הקובץ

פשוט, מדויק

ניתן להסתיר הונאה

מטא נתונים

EXIF/מיכל

טיפ מהיר

מחיק/ מזויף

אנומליה טכנית

פיקסל/תדר

שמץ של מניפולציה

טכניקה חדשה עוקפת

מקור/C2PA

מקור חתום

אמון קריפטוגרפי

לא בכל מקום

קונטקסטואלי

הרמוניה פיזיקה/מציאות

קשה לרמות

דורש הערה

טעויות נפוצות

  • מסתמכים על ציון רכב אחד. זיהוי Deep Fake צריך להיות רב-שכבתי; ציון יחיד אינו הוכחה.
  • זה אומר "מזוייף/אמיתי לחלוטין". השתמש בשפת ההסתברות; דיוק רב מדי מעלה התנגדויות.
  • השמטת מקור והקשר. רוב הבעיות אינן זיופים עמוקים אלא הקשר שגוי/מדיה ישנה.
  • אמון מוחלט במטא נתונים. ניתן למחוק וגם לזייף מטא נתונים.
  • שימוש לרעה בטכניקת ייצור. המידע מיועד לגילוי והגנה בלבד.

לסיכום

Deepfake ומדיה סינתטית הם הגבול החדש ביותר בזיהוי פלילי דיגיטלי; זה גם מייצר ראיות כוזבות וגם הופך ראיות אמיתיות לחשודות. AI הוא גם כלי איומים וגם כלי זיהוי. האימות לא צריך להתבסס על כלי בודד, אלא על אימות צולב של שכבות של מקור, מטא נתונים, אנומליה טכנית, מקור ועקביות הקשר. התוצאה באה לידי ביטוי לא בוודאות אלא ברמת הוודאות. והמידע הזה מיועד לגילוי והגנה בלבד - לא ליצירת מדיה מזויפת.

משימת יישום

תאר תרחיש של ראיות תקשורתיות (למשל הקלטת אודיו). צור תוכנית שכבות עם התבנית "רשימת אימות מדיה". לאחר מכן החל את התבניות "ניתוח עקביות של מטא נתונים" ו"שפה ברמת דיוק" עם מטא נתונים דמה וציון זיהוי; נסה להביע את התוצאה ברמת ביטחון רבתי במקום "בהחלט מזויפת".

רשימת בדיקה

  • [ ] ביססתי את האימות על מספר שכבות, לא על כלי אחד.
  • [ ] בדקתי תחילה את המקור וההקשר.
  • [ ] זכרתי שניתן למחוק/לזייף מטא נתונים.
  • [ ] הבעתי את התוצאה בשפה של רמת ביטחון, לא בוודאות.
  • [ ] השתמשתי במידע ייצור רק לגילוי/הגנה.