רווחים:
- יכולת לזהות מידע זיהוי מוטבע (כותרת ונתונים צרובים) בתמונות DICOM ולהחיל אנונימיזציה וכללי שיתוף מאובטח
- יכולת להעריך באופן ביקורתי את האימות, רמת הראיות, האישור הרגולטורי (CE/תקנה) ואימות מקומי של מודל AI
- יכולת לטפל בסוגיות אתיות כגון הטיה אלגוריתמית, הסכמת המטופל, אחריות ושקיפות בהקשר של הדמיה
נתונים רדיולוגיים הם אחד מסוגי הנתונים האישיים הרגישים ביותר. תמונה משדרת לא רק מחלה, אלא של מי היא מחלתה; MRI מוחי יכול לזהות אדם באמצעות שחזור פנים, קובץ DICOM מאחסן בכותרת שלו את שם המטופל, מספר זיהוי ותאריך הלידה שלו. בעידן הבינה המלאכותית, קל לטעון את הנתונים האלה לתוך כלי, לשתף אותם או להשתמש בהם כדי להכשיר מודל - ודווקא הקלות הזו יוצרת את סיכון הפרטיות הגדול ביותר. ביחידה זו, נדון בבעיות אנונימיזציה של DICOM, KVKK/פרטיות, אימות מודל ואתיקה מקצה לקצה.
עקרון ליבה: תמונות ודוחות רדיולוגיים הם נתונים אישיים מיוחדים. נתוני הזהות בכותרת DICOM והמשובצים בתמונה אינם נכנסים לשום כלי חיצוני מבלי להיות אנונימי. מהימנות של דגם; אימות מוערך לפי רמת ראיות, אישור רגולטורי ואימות מקומי. האחריות, החתימה וההחלטה הסופית מוטלת תמיד על הרדיולוג.
DICOM נושא זהות בשתי שכבות
נתונים רדיולוגיים, בניגוד לנתוני בריאות אחרים, נושאים את הזהות בשתי שכבות נפרדות והאנוניזציה אינה שלמה מבלי לנקות את שניהם.
1. כותרת DICOM: שדות מובנים בתחילת קובץ התמונה - שם המטופל, מספר זיהוי/פרוטוקול, תאריך לידה, מין, מוסד, תאריך בדיקה, מכשיר. אזורים אלו ניתנים למחיקה/מסכה בעזרת כלי, אך אם תישכח התמונה תמשיך לשאת זיהוי תוך כדי מחשבה שהיא "אנונימית".
2. נתונים צרובים: בתמונות מסוימות - במיוחד אולטרסאונד, צילומי מסך עם פלואורוסקופיה, סריקות חיצוניות - מידע המטופל נכתב ישירות בפיקסלים. ניקוי הכותרת אינו מסיר זאת; יש להסוות (לכסות) טקסט מוטבע או לחתוך את האזור הזה.
בנוסף, סיכון לשחזור פנים: ניתן לשחזר את הפנים בתלת מימד מבדיקות ראש/מוח ו-MRI ברזולוציה גבוהה; גם זו צורה של חשיפת זהות ובהקשרים מסוימים דורשת "השחתה".
שכבה
איפה
איך מנקים
אם נשכח
כותרת DICOM
כותרת הקובץ
כלי אנונימיזציה
תעודת הזהות נשארת פתוחה
טקסט מוטבע
תוך פיקסל
מיסוך/חיתוך
תמונה נושאת זהות
נתוני פנים
תצוגת ראש תלת מימדית
השחתה
ניתן לזיהוי על ידי הפנים
דווח על טקסט
RIS/טקסט
מסיר שם/מספר
האדם מזוהה
KVKK ושיתוף בטוח
בטורקיה, KVKK (חוק הגנת מידע אישי) מתייחס לנתוני בריאות כאל "נתונים אישיים בעלי אופי מיוחד" ברמת ההגנה הגבוהה ביותר; באירופה המקבילה שלו היא GDPR. כללים בסיסיים: עיבוד נתונים רק ככל הדרוש למטרה הדרושה; דה-אנונימיזציה מחוץ למוסד; אם אתה מתכוון להשתמש בו בהכשרת מודלים, ספק בסיס משפטי והסכמה מפורשת במידת הצורך; דע לאן הנתונים שלך הולכים. העלאת תמונות/דוחות לא אנונימיים לכלי בינה מלאכותית ציבורית היא הפרת נתונים. כלים תאגידיים שיש להם הסכם עיבוד נתונים (DPA), אינם משתמשים בנתונים שלך בהכשרת מודלים, ורצוי לעבוד בבית/מקומי יש להעדיף.
שימו לב: אמירת "הרגע מחקתי את שם המשפחה" או "הכלי כבר מאובטח" אינה אנונימיזציה. שום נתונים לא יוצאים אל מחוץ למוסד מבלי להסיר את כל נתוני השם, מזהה ה-TR, הפרוטוקול/מספר הבדיקה, תאריך הלידה, איש הקשר, המוסד ונתוני הזהות המוטבעים/כותרת. אנונימיזציה היא לא הרגל, לא משימה חד פעמית.
אימות מודל: מתי לסמוך על מודל
לא מספיק לומר שמודל "עובד"; צריך לשאול איך, איפה וכמה זה עובד.
- תיקוף ורמת ראיות: באיזו אוכלוסיה, בכמה מקרים, עם אילו מדדים (רגישות, ספציפיות, שלילי כוזב) נבדק המודל? האם יש ראיות בלתי תלויות שפורסמו?
- אישור רגולטורי: האם המוצר מאושר כמכשיר רפואי (למשל סימון CE, אישור רגולטורי רלוונטי)? איזה שימוש מכוסה באישור?
- אימות מקומי: השלב הקריטי ביותר. האם הדגם נבדק במכשיר שלך, בפרוטוקול שלך, באוכלוסיה שלך? סחף התפלגות (ירידה בביצועים ככל שמתרחקים מתנאי האימון) לא נראית ללא אימות מקומי.
- מעקב: האם מתבצע מעקב אחר גרסת הדגם, העדכונים ושינויי הביצועים?
מימד אתי
הטיה אלגוריתמית: אם המודל מאומן על אוכלוסיה מסוימת, הוא עשוי לתפקד גרוע יותר בקבוצות אחרות (גיל, מגדר, מוצא אתני, מחלה נדירה) ולהגדיל את אי השוויון. הסכמת המטופל ושקיפות: האם המטופל אמור לדעת כי נעשה שימוש בבינה מלאכותית באבחון שלו; איך המוסד הופך את זה לשקוף? אחריות: אם קריאה בסיוע בינה מלאכותית עושה שגיאה, מי אחראי - התשובה נמצאת אצל הרדיולוג שחתום; AI לא לוקח אחריות. גישה הוגנת: אם כלי AI זמינים במרכזים מסוימים ולא באחרים, זה יכול להיות מקור לאי שוויון.
שלושה מיני תיקים
מקרה 1 - הפרת טקסט מוטבע. רופא מעלה תמונת אולטרסאונד מעניינת, מנקה את הכותרת שלה ומעלה אותה לכלי AI ציבורי. אבל בפינת התמונה יש את שם המטופל ומספר הפרוטוקול חרוטים בפיקסל; למרות שהכותרת הייתה נקייה, היא נשאה מזהה פוסט מוטבע. המוסד נתקל בהודעת KVKK. הדרך הנכונה הייתה להסוות את האזור המוטבע ולשתף אותו כך.
מקרה 2 - הפצה ללא אימות מקומי. מרכז מציג באופן שגרתי מודל גיל עצם שהוכשר על אוכלוסייה מעבר לים מבלי לאמת אותו בקבוצת המטופלים שלו. חודשים לאחר מכן, ניתן לשים לב שהמודל מוטה באופן שיטתי באוכלוסיותיו. אם נעשה אימות מקומי, זה היה נראה מההתחלה. לקח: אפילו אישור רגולטורי אינו תחליף לאימות מקומית.
מקרה 3 - דווח על אנונימיזציה. רדיולוג רוצה לדון במקרה קשה עם עמיתו באמצעות כלי בינה מלאכותית. הוא משכתב את הסיפור כ"אישה בת 62, היסטוריה ידועה של סרטן השד" במקום "Ayşe Yılmaz, פרוטוקול 2024-114523, סרטן השד"; משתף את התמונה כשהכותרת DICOM מנוקה והטקסט המוטבע מוסווה. מתקיים דיון קליני, לא נחשפות זהויות. אנונימיזציה נכונה אפשרה שימוש בטוח ב-AI.
הנחיה חלשה / הנחיה חזקה
הנחיה חלשה:
Ayşe Yılmaz, TC 123..., פרוטוקול 2024-114523, סרטן השד, פרש את ה-MRI הזה.
זהות משותפת בגלוי; זו הפרת KVKK, היא הייתה צריכה להיפסק לפני כתיבת ההנחיה.
הנחיה עוצמתית:
תפקידך: עוזר בקרת אנונימיזציה. הסר את שמך, מזהה TR, מספר פרוטוקול/בחינה, תאריך לידה, פרטי קשר ומוסד מהטקסט למטה; החלף אותו ב-"[הוסר]". השאר רק מידע אנונימי הכרחי מבחינה קלינית (קבוצת גיל, מין, היסטוריה רלוונטית). תזכיר לי גם: אם אני הולך לשתף תמונה, אני צריך גם לנקות את הכותרת והטקסט של DICOM המוטמעים בתמונה, ולשקול נתוני פנים בתמונות ראש/מוח. טקסט: [הדבק טקסט]
הנחיה עוצמתית מחלצת מזהה, מזכירה נתונים מוטבעים/כותרת ופנים.
תבניות הנחיות הניתנות להעתקה
תבנית בקרת אנונימיזציה תפקידך: עוזר אנונימיזציה. חלץ מהטקסט שם, מספר תעודת זהות TR, מספר פרוטוקול/בחינה, תאריך לידה, איש קשר ומוסד; הקלד "[הוסר]". השאר רק מידע אנונימי הנדרש מבחינה קלינית. תזכיר לי שאם אני מתכוון לשתף תמונה, אני צריך לנקות נתוני כותרת + הטמעה + פנים. טקסט: [כתוב]
תבנית שאילתת אימות מודל התפקיד שלך: ASSISTANT. אני יעריך מודל AI. צור את השאלות שעליי לשאול: איזו אוכלוסיה/ספירת מקרים/מדדים, היקף האישור הרגולטורי, נעשה אימות מקומי, סיכון להיסחפות הפצה, מעקב אחר גרסאות. ההחלטה בידי המוסד. מידע על הדגם: [קיץ]
TEMPLATEI לבדיקת אתיקה/הטיה תיתן לך את ההקשר של שימוש במודל AI. להעריך הטיה אלגוריתמית (שעשויה לעבוד בצורה גרועה בקבוצות), הסכמה/שקיפות של המטופל, אחריות וגישה הוגנת; כתבו את השאלה שעל המוסד לשאול מתחת לכל כותרת. הקשר: [כתוב]
תבנית פרטיות זרימת נתונים תיתן לך תרחיש של שליחת נתונים לכלי בינה מלאכותית. צור רשימת בדיקה ששואלת לאן הנתונים הולכים, האם הם מאוחסנים, האם הם משמשים בהכשרת מודלים, ומצב ה-DPA/הבסיס המשפטי שלו. הזכירו לנו את חובת האנונימיזציה לרכבים חיצוניים. תסריט: [כתוב]
טעויות נפוצות
- פשוט נקה את הכותרת ושכח מהטקסט המוטבע. התמונה עדיין נושאת זהות.
- התעלמות מנתוני פנים. ניתן לזהות אדם מתמונות תלת מימד של ראש/מוח.
- החלפת אישור רגולטורי עבור אימות מקומי. הסכמה מציינת היקף; זה לא מבטיח ביצועים על הנתונים שלך.
- לא שואל על הטיה אלגוריתמית. המודל עשוי לעבוד גרוע עבור קבוצות מסוימות, ומגדיל את אי השוויון.
- העברת אחריות ל-AI. החתימה היא אצל הרדיולוג; האחריות לטעות מוטלת על בני האדם.
טיפ: לפני שליחת נתונים מחוץ למוסד, שאל שאלה אחת: "אם הנתונים האלה היו דלפים, האם ניתן לזהות מטופל?" אם התשובה היא "כן" או "לא בטוח", הנתונים עדיין לא אנונימיים - אל תשלחו אותם.
לסיכום
תמונות ודוחות רדיולוגיים הם נתונים אישיים מיוחדים ודורשים את ההגנה הגבוהה ביותר במסגרת KVKK/GDPR. נתוני DICOM נושאים זהות בשתי שכבות - הכותרת והטקסט המוטבעים בתמונה - ואף נתונים לא עוזבים את הארגון מבלי שניהם נקרצו, כמו גם נתוני פנים במידת הצורך. כדי לסמוך על מודל, האימות שלו, רמת הראיות, האישור הרגולטורי והאימות המקומי, במיוחד במכשיר/אוכלוסיה שלך, מוערכים; אישור רגולטורי אינו תחליף לאימות מקומית. במימד האתי, מוטלים הטיה אלגוריתמית, הסכמת המטופל, שקיפות, גישה הוגנת ואחריות. בכל המקרים, החתימה, האחריות וההחלטה הסופית שייכים לרדיולוג.
משימת יישום
צור טקסט עובדה ותרחיש שיתוף תמונות. הפוך טקסט לאנונימי עם התבנית "בדיקת אנונימיזציה" ורשום את שלבי בדיקת הכותרת/טקסט המוטבע/נתוני הפנים. לאחר מכן הערך מודל שבו אתה משתמש (או שוקל) עם התבנית "שאילתת אימות מודל": אוכלוסיה, היקף אימות, סטטוס אימות מקומי. לבסוף, עם התבנית "בקרת אתיקה/הטיה", רשום באילו קבוצות המודל הזה עשוי לעבוד בצורה גרועה ושאלות של שקיפות/אחריות.
רשימת בדיקה
- [ ] ניקיתי את שדות המזהה בכותרת DICOM.
- [ ] הסתרתי/חתכתי את הטקסט הצרוב בתמונה.
- [ ] הערכתי את הסיכון של נתוני פנים בתמונות ראש/מוח.
- [ ] עשיתי אנונימיות את הדיווח/טקסט הסיפור (שם, תעודה מזהה, פרוטוקול, תאריך לידה).
- [ ] תהיתי בזרימת הנתונים ובבסיס ה-DPA/חוקי של הכלי החיצוני.
- [ ] בדקתי את היקף האימות והאימות המקומי של המודל.
- [ ] הערכתי הטיה אלגוריתמית, שקיפות ואחריות; יש לי את החתימה.