المكاسب:
- فهم سبب اعتبار البيانات الجينية فئة خاصة من البيانات الشخصية وخطر إعادة تحديد الهوية
- القدرة على تطبيق مبادئ إخفاء الهوية والموافقة وتقليل البيانات قبل توفير بيانات المريض لفتح أدوات الذكاء الاصطناعي
- القدرة على احتضان حدود معالجة البيانات الجينية والمسؤولية الأخلاقية المهنية ضمن أطر عمل مثل KVKK/GDPR
البيانات الجينية ليست بيانات شخصية عادية. تسلسل الحمض النووي للشخص؛ إنه يحدد هويتك بشكل فريد، ولا يمكن تغييره (يمكنك تغيير كلمة المرور الخاصة بك ولكن ليس الجينوم الخاص بك)، ويمكن أن يكشف عن مخاطر الأمراض المستقبلية، ولا يتعلق بالفرد فحسب، بل بجميع أفراد الأسرة ذوي الصلة بالدم. ولذلك فإن استخدام الذكاء الاصطناعي عند التعامل مع البيانات الجينية يتطلب أعلى معايير السرية والأخلاق. في هذه الوحدة، ستتعرف على سبب وجوب حماية البيانات الجينية بشكل خاص، والأخطاء التي لها عواقب وخيمة عند استخدام أدوات الذكاء الاصطناعي، ونظام عمل آمن.
المبدأ الحاسم: لا تقم مطلقًا بلصق البيانات الجينية المحددة للمريض في أداة الذكاء الاصطناعي المتاحة للعامة. يمكن للعديد من خدمات الذكاء الاصطناعي ذات الأغراض العامة معالجة البيانات التي تدخلها أو تخزينها أو استخدامها لتحسين النموذج. عندما يتم إدخال مجموعة متغيرة نادرة للمريض أو الاسم أو رقم التعريف أو تاريخ الميلاد في إحدى الأدوات، فقد يحدث انتهاك لا رجعة فيه للخصوصية.
خمس ميزات تجعل البيانات الجينية مميزة
- الثبات: الجينوم هو نفسه طوال الحياة؛ إذا تم الكشف عنها، فلا يمكن "إلغاؤها".
- الهوية: حتى عدد قليل من المتغيرات النادرة يمكن أن تحدد هوية الشخص بشكل فريد؛ يمكن إعادة تحديد البيانات التي يُعتقد أنها "مجهولة المصدر".
- حجم العائلة: يحتوي جينوم الشخص أيضًا على المعلومات الجينية لأقاربه؛ وقد يتم الكشف عن المعلومات دون موافقتهم.
- القدرة على التنبؤ: يمكن أن تشير إلى خطر الإصابة بالأمراض في المستقبل؛ قد يكون التأمين سببًا للتمييز في العمل.
- خطر إعادة تحديد الهوية: يمكن ربط البيانات الجينومية بالهوية عن طريق التقاطع مع قواعد بيانات أخرى.
الإطار القانوني: لمحة موجزة
تندرج البيانات الجينية ضمن فئة البيانات الشخصية الخاصة (الحساسة) في تشريعات حماية البيانات وتتم حمايتها بشكل أكثر صرامة. في تركيا، يعتبر قانون حماية البيانات الشخصية (KVKK) البيانات الصحية والوراثية بمثابة بيانات خاصة، وكقاعدة عامة، يربط معالجتها بالموافقة الصريحة أو الاستثناءات الخاصة. وفي أوروبا، يحمي القانون العام لحماية البيانات بالمثل البيانات الجينية باعتبارها فئة خاصة. وفي الولايات المتحدة، يحظر قانون جينا التمييز في مجال التأمين والتوظيف على أساس المعلومات الجينية. وعلى الرغم من أن التفاصيل تختلف من بلد إلى آخر، فإن المبدأ المشترك هو نفسه: لا يمكن معالجة البيانات الجينية دون موافقة صريحة، وتحديد الغرض، وحماية قوية.
نصيحة: عند الحصول على موافقة المريض لإجراء الاختبار الجيني، قد يتضمن الكشف كيفية معالجة البيانات بواسطة أدوات الذكاء الاصطناعي. "ما هي الأدوات وأين نعالج بياناتك لتحليلها؟" كن في وضع يسمح لك بالإجابة على السؤال بشفافية.
خطوة بخطوة: استخدام الذكاء الاصطناعي الآمن مع البيانات الجينية السرية
1. التصنيف. هل يمكن التعرف على البيانات التي بحوزتك؟ هل يحتوي على مجموعة من الاسم ورقم الهوية والتاريخ والمتغير النادر؟
2. إخفاء الهوية أو عدم النقل على الإطلاق. إزالة المعرفات المباشرة؛ لكن تذكر أن "إخفاء الهوية" في البيانات الجينية لا يوفر ضمانًا كاملاً. من الأكثر أمانًا عدم إدخال بيانات التعريف الشخصية في السيارة المفتوحة على الإطلاق.
3. اقرأ سياسة بيانات الأداة. اختر أدوات مؤسسية، ولديها اتفاقية معالجة بيانات (DPA)، ووعد بعدم استخدام البيانات في التعليم، ويفضل العمل محليًا/عن قرب.
4. فصل الأسئلة المفاهيمية عن البيانات. "كيفية تطبيق ACMG PM2؟" يمكنك طرح أسئلة مفاهيمية حول الذكاء الاصطناعي مثل؛ لا توجد بيانات المريض مطلوبة لهذا الغرض. استخدم البيانات فقط عند الضرورة وفي شكل مجهول.
5. احفظ الأثر. توثيق البيانات التي تعالجها، وبأي أداة، ولأي غرض؛ إن قابلية التدقيق مطلب أخلاقي وقانوني.
ثلاث حالات صغيرة
الحالة 1 - التقرير المُلصق. من أجل السرعة، قام أحد المساعدين بلصق التقرير الذي يحتوي على الاسم الكامل للمريض وقائمة المتغيرات في دردشة عامة تعمل بالذكاء الاصطناعي وقال "تلخيص". أدرك كبير الأخصائيين ذلك: حدد الاسم والمتغير النادر معًا المريض، وتقوم الأداة بتخزين البيانات. تطلب الحادث إشعارًا بانتهاك الخصوصية. الدرس المستفاد: لا يتم نقل أي بيانات تعريفية، حتى بالنسبة للملخص.
الحالة 2 - موافقة الأسرة. أثناء استخدام بيانات المريض، أخبر أحد الباحثين منظمة العفو الدولية أنه تم العثور على المتغير أيضًا في شقيقه. إلا أن الأخ لم يوافق على معالجة بياناته. كما أدى الجانب العائلي للبيانات الجينية إلى إثارة الشكوك حول خصوصية الطرف الثالث؛ واستخرج المحقق معلومات عن الأخ.
الحالة 3 - تم الحصول على التأكيد. قام أحد المختبرات بتنفيذ "قائمة مرجعية لإخفاء الهوية" قبل التحليل. لقد استخرجوا الأسماء وأرقام الهويات والتواريخ قبل تسليمها إلى الذكاء الاصطناعي؛ علاوة على ذلك، فقد أدركوا أن مجموعة نادرة جدًا من المتغيرات وحدها يمكنها تحديد الهوية، ولم يبلغوا عن تلك العينة على الإطلاق. وبدون القائمة المرجعية، كان من الممكن إعادة تحديد البيانات التي يُعتقد أنها "مجهولة المصدر".
أربعة قوالب قابلة للنسخ
1) التحكم في إخفاء الهوية:
قبل تغذية هذا النص إلى أداة الذكاء الاصطناعي، قم بإدراج جميع العناصر فيه (الاسم، رقم الهوية، التاريخ، العنوان، مجموعة متغيرة نادرة، النمط الظاهري النادر) التي يمكن أن تحدد هوية المريض أو أقاربه. لكل منها، اقترح "حذف" أو "عدم نقل العينة على الإطلاق": [نص].
2) السؤال المفاهيمي (بدون بيانات):
دون مشاركة بيانات المريض، أجب عن هذا السؤال المفاهيمي: [سؤال ACMG/الطرق]. استخدم الأمثلة الشائعة؛ لا أريد معلومات حقيقية عن المريض.
3) مراقبة الموافقة والشفافية:
ساعدني في صياغة نص المعلومات/الموافقة لإجراء الاختبارات الجينية. وينبغي أن تشمل: لأي أغراض ستتم معالجة البيانات، وما هي أنواع الأدوات التي سيتم تحليلها، وكيف سيتم التعامل مع النتائج المتعلقة بأفراد الأسرة، وتخزينها وحذفها. قم بالرجوع إلى الوحدة القانونية/الأخلاقية لاتخاذ القرار القانوني.
4) معايير اختيار السيارة:
ما هي معايير الخصوصية (اتفاقية معالجة البيانات، والالتزام بعدم استخدامها في التعليم، والتشغيل المحلي، والتحكم في الوصول، والحذف) التي يجب أن أسألها عند اختيار أداة الذكاء الاصطناعي/التحليل التي ستعالج البيانات الجينية الحساسة؟ يتم إنشاء قائمة مرجعية للتقييم.
موجه ضعيف / موجه قوي
ضعيف: "تعليق على نتيجة BRCA1 الخاصة بأحمد يلماز (TC: ...): [قائمة المتغيرات الكاملة]."
المشكلة: المعرف المباشر + البيانات الجينية تدخل في الأداة المفتوحة؛ انتهاك صارخ للسرية.
غوتشلو: "دون تحديد أي شخص، اشرح باستخدام مثال عام كيف يتم تقييم متغير تغيير الإطارات في BRCA1 في ACMG. أنا لا أشارك بيانات المريض الفعلية."
لماذا هو قوي: يتم تلبية احتياجات التعلم/التقييم، ولكن لا يتم نقل أي بيانات تعريفية.
نوع البيانات
هل يدخل في أداة الذكاء الاصطناعي المفتوحة؟
بديل
اسم المريض/رقم الهوية
أبدا
لا نقل
نسخة نادرة + تاريخ
أبدا (يحدد)
نقل العينة
سؤال مفاهيمي
نعم
مثال عام
مجهول، مثال شائع
حذرا
أداة المؤسسة/المحلية
إحصائيات مجمعة ومجهولة
اعتمادا على الوضع
مركبة مع DPA
الأخطاء الشائعة
- لصق بيانات التعريف على أنها "للتلخيص فقط". ومهما كان الغرض فهو مخالفة.
- الخلط بين "إخفاء الهوية" وبين البيانات الجينية باعتباره أمانًا كاملاً. إعادة تحديد الهوية ممكنة.
- نسيان الجانب العائلي. تكشف بيانات الشخص أيضًا عن أقاربه.
- عدم قراءة سياسة بيانات المركبة. يمكن استخدام البيانات أو تخزينها في التدريب.
- عدم الاحتفاظ بسجلات المسار. إذا لم يكن هناك إمكانية للسيطرة، لا يمكن إثبات المسؤولية.
تحذير: في معظم الأحيان، لا تنشأ انتهاكات الخصوصية بسبب نية خبيثة، ولكن من رد الفعل "احصل عليها بسرعة". الخطر الأكبر هو لصق تقرير دون قصد في نافذة الدردشة في سير عمل غير رسمي. ابطئ؛ لا يوجد زر التراجع عن البيانات الجينية.
العمق: الرياضيات الحقيقية لإعادة تحديد الهوية والبنى الآمنة
لماذا من الخطأ الاعتقاد "لقد حذفت الاسم، والآن أصبح مجهولاً"؟ لأنه ليس هناك حاجة لاسم لتحديد هوية الشخص؛ مزيج من الميزات النادرة يكفي. وفقًا لنتائج كلاسيكية، فإن الثلاثي تاريخ الميلاد + الجنس + الرمز البريدي يمكن أن يميز الغالبية العظمى من سكان الولايات المتحدة. في علم الوراثة، الوضع أكثر حدة: مزيج من عدة متغيرات نادرة (يحدث كل منها بمعدل واحد في الألف من السكان، مجتمعة أقل من واحد في المليون) يشير إلى فرد واحد. علاوة على ذلك، يمكن مزج البيانات الجينومية مع قواعد بيانات الأنساب لربط الفرد بهوية قريب له حتى لو لم يقدم الفرد أي بيانات في أي مكان آخر - وهو شكل حقيقي من أشكال الهجوم الذي تم إثباته في الأدبيات.
لذا فإن عملية الحفظ تتطلب قرارات معمارية تتجاوز مجرد "حذف المعرفات". الخيارات العملية: استخدام النماذج المحلية/المستضافة ذاتيًا لعدم ترك البيانات خارج حدود المؤسسة أبدًا؛ إذا كان سيتم استخدام السحابة، فاختر مستويات المؤسسة مع اتفاقية معالجة البيانات (DPA) والالتزام "بعدم استخدام المدخلات في التدريب"؛ العمل مع المعلومات المشتقة والمجمعة بدلاً من البيانات الأولية الخاصة بالمريض كلما أمكن ذلك؛ والحد من الوصول إلى مبدأ الامتياز الأقل.
حالة ملموسة: قام أحد المراكز بتلخيص سلسلة حالات "مجهولة المصدر" في أداة عامة للذكاء الاصطناعي. لم تحتوي مجموعة البيانات على أسماء، ولكن كان لدى كل مريض مجموعة من التشخيص النادر + العمر + المدينة؛ عند مقارنته بتقرير إحدى الصحف المحلية، يمكن التعرف على المريض. عدم وجود معرفات أولية لا يمنع إعادة تحديد الهوية.
طبقة الحماية
ما يوفر
الحد
حذف المعرف
يزيل الهوية مباشرة
مجموعات نادرة لا تزال قائمة
نموذج محلي/مستضاف ذاتيًا
البيانات لا تترك المؤسسة
عبء التثبيت/الصيانة
DPA+ لا يستخدم في التعليم
الضمان القانوني/التعاقدي
ومن الضروري قراءة السياسة
التجميع/الاشتقاق
يقلل من الندبة الفردية
يقيد عمق التحليل
باختصار
- البيانات الوراثية هي بيانات خاصة وغير قابلة للتغيير ومحددة ومتعلقة بالأسرة؛ يتطلب أعلى مستوى من الحماية.
- ولا يتم أبدًا إدخال البيانات الجينية المحددة للمريض في أدوات الذكاء الاصطناعي المفتوحة؛ يتم فصل الأسئلة المفاهيمية عن البيانات.
- تتطلب أطر العمل مثل KVKK، وGDPR، وGINA موافقة صريحة، وحدودًا للأغراض، وحماية قوية.
- إخفاء الهوية ليس ضمانًا كاملاً؛ الشيء الأكثر أمانًا هو عدم نقل البيانات المهمة على الإطلاق.
مهمة التطبيق
تلقي عينة من التقرير الجيني (الخيالي). باستخدام النموذج 1، قم بإدراج جميع العناصر المحددة فيه وقرر ما إذا كنت تريد "حذف" أو "عدم النقل" لكل منها. ثم أعد كتابة نفس السؤال السريري دون أي بيانات تعريفية (باستخدام منطق القالب 2). صف فرق الخصوصية بين النسختين في جملة واحدة.
قائمة مرجعية
- [ ] لقد صنفت البيانات من حيث الهوية.
- [ ] لم أقم بإدخال بيانات التعريف الشخصية في الأداة المفتوحة.
- [ ] لاحظت أنه يمكن تحديد مجموعة من المتغيرات النادرة.
- [ ] لقد قمت بمراجعة سياسة بيانات الأداة (الاحتفاظ، التدريب، DPA).
- [ ] لقد أخذت في الاعتبار الجانب العائلي وموافقة الطرف الثالث.
- [ ] لقد قمت بتسجيل مسار المعاملة وأرسلته إلى وحدة الأخلاقيات/الشؤون القانونية عند الضرورة.