יחידה 10 / 11

פרטיות נתונים, בחירת כלי מאובטח ואנונימיזציה

רווחים:

  • אנונימיזציה והערכה של ההכרח לפני מסירת הנתונים הרגישים והפיננסיים של הלקוח לכלי בינה מלאכותית
  • יכולת להבחין בהבדלים בין כלי AI ארגוניים וציבוריים בפרטיות, שמירת נתונים ושימוש בחינוך
  • יכולת לנהל פריצת מידע, תקופת שמירה ושיתוף צד שלישי במסגרת KVKK

ביטוח הוא אחד המקצועות שעובדים עם הנתונים הרגישים ביותר. תיק ביטוח; זה עשוי לכלול פרטי זהות, כתובת, הכנסה, חשבון בנק, היסטוריית בריאות, רישומי נזק, לוחית רישוי, שטר בעלות ואפילו מידע משפחתי. חלק מנתונים אלו כפופים להגנה הגבוהה ביותר כ"נתונים אישיים בעלי אופי מיוחד" ב-KVKK (חוק הגנת מידע אישי); נתונים בריאותיים, ביומטריים ודומים הם דוגמאות אופייניות לכך. שיתוף לא מבוקר של נתונים אלה בעת שימוש בכלי בינה מלאכותית (במיוחד כאלה מבוססי ענן) מהווה סיכון רציני להפרה ואובדן אמון. לאחר דליפה, לא ניתן לאחזר נתונים. ביחידה זו תלמד כיצד לבצע אנונימיות של נתוני לקוחות (הסרת מידע אישי מזהה) לפני מסירתם לבינה מלאכותית, הבדלי הפרטיות בין כלים ארגוניים וציבוריים וכיצד לנהל את הסיכונים של פריצת מידע, אחסון ושיתוף צד שלישי במסגרת KVKK. יחידה זו אינה ייעוץ משפטי; מסביר עקרונות כלליים, התייעץ עם מחלקת ציות/משפט במקרה ספציפי.

מדוע פרטיות היא קריטית: סוגי נתונים

בביטוח יש צורך להפריד נתונים לפי רמת ההגנה:

  • נתוני זהות: שם, שם משפחה, מספר תעודת זהות TR, תאריך לידה, איש קשר. זה מזהה ישירות את האדם.
  • נתונים פיננסיים: הכנסה, חשבון בנק, היסטוריית תשלומים. אישי ורגיש.
  • נתוני איכות מיוחדים: בריאות, נתונים ביומטריים. ההגנה הגבוהה ביותר; לעיבוד נדרשים תנאים מחמירים יותר (הסכמה מפורשת או חריג סטטוטורי).
  • נתוני תיק: מספר פוליסה, לוחית רישוי, שטר בעלות, פירוט נזק. בשילוב עם אחרים, זה יכול לחשוף זהות.

הסכנה הגדולה ביותר היא הזיהוי המתרחש כאשר אתה מביא את הנתונים הללו יחד. בעוד ש"אישה בת 45" היא אנונימית, "אישה בת 45 + לוחית רישוי מסוימת + כתובת מסוימת" יכול לחשוף זהות.

שימו לב: אמירת "מחק" לאחר מתן נתונים לכלי הבינה המלאכותית אינה מוחקת אותו בפועל. חלק מהכלים מאחסנים את הקלט ואף משתמשים בו כדי לאמן את המודל. כלל: לעולם אל תשלח נתונים רגישים; אנונימיזציה מגיעה לפני השליחה.

אנונימיזציה: איך עושים את זה

אנונימיזציה היא הסרה של מידע מזוהה והחלפת מידע שווה ערך עובדתי; המטרה היא להפוך את האדם לבלתי ניתן לזיהוי תוך שמירה על איכות הפלט. אנונימיזציה טובה:

  • מסיר שם, מזהה TR, טלפון, כתובת, מספר פוליסה, לוחית רישוי ושטר בעלות.
  • הוא מחליף אותם במקבילה בעלת משמעות אנליטית: "בן 45, גבר, פוליסת ביטוח, מרכז אנטוליה, התנגשות חד צדדית".
  • הוא נמנע משילובים נדירים/ייחודיים: מקצוע מאוד ספציפי + מקום קטן מאוד, שרק יכול לפתוח זהות.
  • שומר על משמעות רפואית/טכנית: כגון "בריאות משלימה, ניתוח אורטופדי מתוכנן".
טיפ: לאחר האנונימיות, שאלו את עצמכם: "אם אדם זר קרא את הטקסט הזה, האם הוא יכול למצוא את האדם?" אם התשובה חיובית, הכליל יותר. שילובים נדירים במיוחד (מחוז קטן + אירוע ספציפי) מסוכנים.

כלים ארגוניים מול ציבוריים

לא לכל כלי הבינה המלאכותית יש את אותה רמת פרטיות. הם נבדלים בשלושה מימדים:

  1. שמירת נתונים: האם היא שומרת את הקלט ולכמה זמן?
  2. שימוש באימון: האם הוא משתמש בקלט כדי לאמן את המודל?
  3. מיקום וחוזה: היכן מעובדים הנתונים, האם יש הסכם עיבוד נתונים תאגידי?

הכלים המוסדיים (ההבטחות החוזיות של המוסד לעיבוד נתונים) מציעים לעתים קרובות מגבלות על אי שימוש ואחסון נתונים בחינוך. כלים ציבוריים וחינמיים יכולים לאחסן קלט ולהשתמש בו בהדרכה. כלל: נתונים רגישים מעובדים רק באמצעים באישור המוסד ובצורה אנונימית ככל האפשר. הזנת נתוני לקוחות לכלי לא מאושר הופכת את מעבד הנתונים לבלתי ניתן לביקורת.

צעד אחר צעד: עבודה מאובטחת עם נתונים סודיים

  1. מסווג את הנתונים. זהות / פיננסי / איכות מיוחדת / נתוני קבצים.
  2. בדיקת הכרח. האם הנתונים האלה באמת נחוצים למשימה זו? אם לא, אל תשתמש בו.
  3. אנונימי. הסר מזהים, החלף מקבילות עובדתיות, הכללה צירופים נדירים.
  4. בחר רכב. רק רכבים באישור סוכנות, בחוזה; אין נתונים רגישים זמינים לכלי הציבורי.
  5. עבודה עם מינימום נתונים. שתף את המידע המינימלי הדרוש למשימה.
  6. נהל אחסון ושיתוף. איפה אתה מאחסן את הפלט, עם מי אתה משתף אותו; ציית לתקופת השמירה של KVKK ולכללי צד שלישי. השאר את חותמך.

שלושה מיני תיקים

מקרה 1 - הגנה על נתונים רגישים. מומחה תביעות רצה לשאול את ה-AI על תיק ביטוח בריאות מורכב. במקום לכתוב את שמו, תעודת הזהות והאבחנה של המבוטח, הוא יצר הקשר אנונימי כמו "גיל 52, פוליסת בריאות משלימה אישה, ניתוח שסתום לב מתוכנן, סכום שנוי במחלוקת". איכות הפלט לא ירדה; נתונים פרטיים לא הגיעו לאף ענן. נתוני בריאות כפופים להגנה הגבוהה ביותר; הרגל זה מנע את ההפרה.

מקרה 2 - מלכודת שילוב נדירה. "בת 38, אישה, רוקחת רק ב[מחוז קטן מאוד], מדיניות אחריות מקצועית", כתב מומחה אחד. למרות שמבחינה טכנית זה לא הכיל שם, זה חשף ישירות את זהותו שכן הוא היה הרוקח היחיד באותו מחוז. המומחה הבחין בכך והכליל זאת כ"יישוב קטן, מקצוע בריאות". אנונימיזציה היא לא רק מחיקת השם, היא הורסת את הזיהוי.

מקרה 3 - בחירת כלי שגוי. למען המהירות, עובד היה מעלה את פירוט התביעות של הלקוח לכלי ציבורי בחינם. מדיניות הצוות נכנסת לתוקף: נתוני הלקוחות מעובדים רק בכלי המאושר על ידי המוסד, המוסכם. העובד עשה תחילה אנונימי את הנתונים ולאחר מכן הפעיל אותם בכלי המאושר. אם נעשה שימוש בכלי לא מאושר, הסיכון של אחסון נתונים ושימוש בחינוך יהיה בלתי נשלט.

ארבע הנחיות הניתנות להעתקה

1) עוזר אנונימיזציה:

הסר את כל הנתונים האישיים והמזהים מהטקסט הבא: שם, שם משפחה, תעודת זהות, תאריך לידה, טלפון, כתובת, מספר פוליסה, לוחית רישוי, שטר בעלות, IBAN. החלף אותם בקבילה עובדתית בעלת משמעות אנליטית (למשל "בן 45, גבר, פוליסת ביטוח, התנגשות חד-צדדית"). הכללה שילובים נדירים/מיוחדים (מקום קטן + עיסוק מיוחד). שמור על משמעות רפואית/טכנית. טקסט: [הדבק]

2) בדיקת זיהוי:

בדוק את הטקסט האנונימי הבא לצורך זיהוי: [טקסט]שאל: האם זר יכול למצוא את האדם עם הטקסט הזה? האם יש שילוב נדיר (יישוב קטן + מקצוע/אירוע ספציפי), תאריך או סכום ייחודי? הדגש כל נקודה מסוכנת והצע כיצד להכליל בצורה בטוחה יותר.

3) דרישה וסיווג נתונים:

סיווג ובדוק את הנתונים הנדרשים למשימה הבאה:משימה: [תיאור] הנתונים שברשותי: [רשימה]לכל נתון: סוג (זהות/פיננסי/מיוחד/קובץ), האם נדרש למשימה זו (כן/לא), במידת הצורך, כיצד להשתמש בה באופן אנונימי. סמן נתונים מיותרים כ"לא להשתמש".

4) רשימת בדיקה לבחירת רכב:

צור רשימת בדיקה לפני השימוש בכלי AI עם נתוני ביטוח. כלול שאלות: האם הרכב מאושר על ידי המוסד? האם יש הסכם לעיבוד נתונים? האם הוא מאחסן/משתמש בקלט באימון? היכן מעובדים הנתונים? לאיזה סוג נתונים הוא מתאים/לא מתאים? האם אנונימיזציה מספיקה?

הנחיה חלשה / הנחיה חזקה

חלש: "הערך את התיק של הלקוח אחמט ילמז (TC 123..., דוח רפואי מצורף)".
בעיה: זהות ונתונים רגישים (בריאותיים) משותפים ישירות; סיכון גדול להפרת KVKK.
חזק: "שקול את ההקשר האנונימי הבא: גיל 52, אישה, מדיניות בריאות משלימה, ניתוח מתוכנן, סכום שנוי במחלוקת. אין מידע מזהה".
למה זה טוב: המשמעות האנליטית נשמרת, זהות ונתונים רגישים לא נחשפים.

טבלת השוואה

סוג נתונים

רמת הגנה

שימוש בבינה מלאכותית

שם/TC/איש קשר

גבוה

הסר, שים שווה ערך

פיננסי (הכנסה/IBAN)

גבוה

הסרה/הכללה

כישורים בריאותיים/מיוחדים

הגבוה ביותר

לעולם לא גולמי; רכב אנונימי + מאושר

מספר פוליסה/לוח/שטר בעלות

בינוני-גבוה

הסר; לבד זה מסוכן

מצטבר/סטטיסטיקה

נמוך

זמין (אם אין איש קשר)

טעויות נפוצות

  • הדבקת נתונים אישיים/בריאותיים גולמיים. ההפרה השכיחה והחמורה ביותר.
  • לחשוב שמספיק רק למחוק את השם. שילובים נדירים עדיין עשויים לחשוף את הזהות.
  • מסתמך על אמירת "מחק מאוחר יותר". ייתכן שהכלי מאחסן/משתמש בנתונים בהדרכה.
  • נהיגה לא מאושרת/ציבורי. עיבוד נתונים לא מבוקר.
  • לא מנהל אחסון ושיתוף. אחסון בלתי מוגבל של פלט, שיתוף בלתי מבוקר עם צדדים שלישיים.

לסיכום

נתוני הביטוח רגישים מאוד; נתונים מיוחדים כגון בריאות כפופים להגנה הגבוהה ביותר במסגרת KVKK. סיווג, אתגר ואנונימי נתונים לפני מתן אותם ל-AI: הסר מזהים, הצג מקבילות עובדתיות, הכלל שילובים נדירים. עיבוד נתונים רגישים רק בכלים שאושרו על ידי המוסד, בחוזה ובהיקף מינימלי. ניהול תקופת אחסון ושיתוף צד ג' במסגרת KVKK והשאיר עקבות. התייעץ עם ציות/משפטי במקרה הספציפי; לא ניתן לאחזר נתונים שדלפו.

משימת יישום

קבל טקסט נזק/הפניה אמיתי (למטרות בדיקה). אנונימי עם הנחיה מס' 1, ולאחר מכן בדוק את הזיהוי באמצעות הנחיה מס' 2: האם יש עדיין שילובים נדירים בטקסט שיכולים לחשוף את האדם? הכליל כל סיכון שאתה מוצא. הערך גם את כלי הבינה המלאכותית שבה אתה משתמש עם רשימת הבדיקה מספר 4: האם הוא מתאים לנתונים רגישים?

רשימת בדיקה

  • [ ] סיווגתי את הנתונים לפי סוגיהם.
  • [ ] יישמתי את מבחן הנחיצות; לא השתמשתי בנתונים מיותרים.
  • [ ] הסרתי את המזהים והחלפתי אותם בשווי ערך עובדתי.
  • [ ] הכללתי שילובים נדירים/מיוחדים.
  • [ ] עשיתי בדיקת זיהוי.
  • [ ] השתמשתי רק בכלי רכב שאושרו על ידי החברה.
  • [ ] ניהלתי אחסון ושיתוף צד שלישי בהתאם ל-KVKK; השארתי חותם.