المكاسب:
- القدرة على تصنيف البيانات التي تحتوي على أسرار وبيانات شخصية وأصول تجارية سرية والتعرف على الخطوط الحمراء
- إخفاء البيانات الاصطناعية وإخفاء هويتها وتأمينها قبل إدخال البيانات
- اختيار الأداة المعتمدة وتقليل السياق والقدرة على تطبيق منعكس دوران المفتاح في حالة التسرب
من المحتمل أن يكون أي شيء تلصقه في مساعد البرمجة خارجًا عن سيطرتك. يمكن أن يصبح مفتاح واجهة برمجة التطبيقات (API)، أو تفريغ قاعدة بيانات العملاء، أو كود مصدر الملكية الذي لم يتم الإعلان عنه بعد، أو سجل المريض - بمثابة تسرب لا رجعة فيه بمجرد دخولهم إلى أداة غير معتمدة. أكبر خطر للذكاء الاصطناعي بالنسبة لفرق البرمجيات لا يأتي من خطأ في السطر، بل من النسخ واللصق المهمل. تهدف هذه الوحدة إلى جعل عملية النسخ واللصق آمنة.
وهنا نميز بين ثلاثة أشياء: ما هي البيانات التي لا ينبغي إدخالها مطلقًا، وما هي الأدوات التي يمكن استخدامها وما هي الضمانات، وكيفية تأمين البيانات قبل إدخالها (الإخفاء، البيانات الاصطناعية، العمل محليًا). هذا ليس اختياريًا "سيكون جميلًا"؛ وهو التزام تعاقدي وقانوني في معظم المؤسسات.
لماذا هو بالغ الأهمية؟
البيانات التي ترسلها إلى أداة الذكاء الاصطناعي؛ يمكن استخدامها على خوادم الموفر، والتي يتم تخزينها أحيانًا لفترة من الوقت، لتحسين النموذج في بعض إعدادات المنتج. غالبًا ما لا يكون قول "لقد حذفت الدردشة" كافيًا؛ في اللحظة التي تغادر فيها البيانات الشبكة، تنشأ المخاطر. علاوة على ذلك، فإن تكلفة التسرب مرتفعة: يمكن إساءة استخدام مفتاح السحابة المسرب في غضون دقائق، ويمكن أن تؤدي بيانات العميل المسربة إلى إخطار وعقوبات بموجب لوائح مثل KVKK/GDPR، ويمكن أن يؤدي تسرب كود المصدر الخاص إلى تدمير الميزة التنافسية.
لذا فإن القاعدة الأساسية بسيطة: لا تدخل أي شيء في مركبة غير معتمدة ولا يمكنك تحمل خسارتها. إذا كنت في شك، لا تدخل.
تحذير: عقلية "مرة واحدة فقط، بسرعة" هي السبب الأكثر شيوعًا للتسريبات. إن لصق سجل الإنتاج أو ملف التكوين كما هو عند حل خطأ عاجل هو بالضبط ما يحدث مع مثل هذه القرارات المتخذة تحت الضغط. الاستعجال لا يوقف قاعدة السرية.
ما لا ينبغي أبدا إدخاله (الخط الأحمر)
- الأسرار: مفاتيح واجهة برمجة التطبيقات، وكلمات المرور، ومفاتيح الوصول إلى السحابة، والشهادات الخاصة، والرموز المميزة، وسلاسل الاتصال.
- البيانات الشخصية (PII): الاسم واللقب ورقم معرف TR والبريد الإلكتروني والهاتف والعنوان والسجلات الصحية/المالية وبيانات العميل.
- أصول الأعمال السرية: كود المصدر غير المكشوف عنه، وخوارزميات الملكية، وأسرار البنية الداخلية، وتفاصيل العقد.
- البيانات المنظمة: الفئات المحمية الخاصة مثل الرعاية الصحية وبطاقات الدفع (PCI) والتمويل الشخصي.
خطوة بخطوة: تدفق الاستخدام الآمن
- تصنيف البيانات. ما هي فئة ما لديك - عامة، داخلية، سرية، خاضعة للتنظيم؟
- اختر السيارة حسب الفئة. تتم معالجة البيانات السرية/المنظمة فقط في الأدوات المعتمدة مؤسسيًا والتي توفر ضمان البيانات (عدم الاستخدام في التعليم، وحدود الاحتفاظ، والمعالجة الإقليمية).
- تأمين قبل الدخول. قم بتجريد الأسرار، وإخفاء/إخفاء هوية معلومات تحديد الهوية الشخصية، واستخدام البيانات الاصطناعية (الملفقة ولكن الواقعية) بدلاً من البيانات الحقيقية إن أمكن.
- تصغير السياق. قم بتقليل مشكلتك إلى أصغر مثال قابل للتكرار ولا يتضمن أجزاء حساسة.
- تحقق أيضًا من الإخراج. تأكد من عدم وجود سر مشفر أو بقايا من بياناتك في الكود الذي أنشأه الذكاء الاصطناعي.
ثلاث حالات صغيرة
الحالة 1 - تم إلغاء المفتاح الذي تم لصقه. قام أحد المطورين بلصق ملف التكوين بالكامل في الذكاء الاصطناعي أثناء إصلاح الخلل؛ يحتوي الملف على مفتاح API مباشر لجهة خارجية. عندما لاحظ الفريق، قاموا على الفور بإلغاء (تدوير) المفتاح وإنتاج مفتاح جديد؛ لم تكن هناك إساءة، لكنها كانت حادثة "رخيصة". الدرس المستفاد: قم بإزالة الطبقة الزجاجية قبل اللصق، وأدر المفتاح فورًا في حالة تسربه.
الحالة الثانية - البيانات الاصطناعية أنقذت العمل. واجه الفريق خطأً في التحليل في سجلات العملاء الفعلية. فبدلاً من إدخال بيانات حقيقية، أنتجوا 20 سطرًا من البيانات الاصطناعية بنفس البنية ولكنها مزيفة تمامًا، وأعادوا إنتاج الخطأ بها وحلوه باستخدام الذكاء الاصطناعي. ولم تتسرب معلومات تحديد الهوية الشخصية ولم يتباطأ التشخيص؛ وكانت البيانات الاصطناعية آمنة وكافية على حد سواء.
الحالة 3 - السر المخفي في النسخة المطبوعة. عند إنشاء نموذج تكوين، قام الذكاء الاصطناعي بتضمين مفتاح "عينة" ذو مظهر واقعي وإدخاله في الكود دون أن يلاحظ المطور ذلك؛ اكتشف فحص قاعدة التعليمات البرمجية (الماسح السري) هذا الأمر وحذره. لا ينبغي للسر غير القابل للتغيير أن يصل إلى الكود أبدًا؛ الطريقة الصحيحة هي استخدام متغير البيئة أو مدير الأسرار. الدرس المستفاد: قم بمسح المخرجات بحثًا عن الأسرار أيضًا.
أربعة قوالب قابلة للنسخ
قائمة التحقق من الإخفاء قبل الدخول (الذات):
قبل إعطاء هذا النص إلى الذكاء الاصطناعي، تأكد من إزالة ما يلي واستبدال ما تجده بـ [MASKED]: مفتاح واجهة برمجة التطبيقات، وكلمة المرور، والرمز المميز، وسلسلة الاتصال، والاسم واللقب، والبريد الإلكتروني، والهاتف، ورقم المعرف، وبيانات العميل. النص: {{نص}}
توليد بيانات الاختبار الاصطناعية:
قم بإنشاء بيانات اختبار الصف {{N}} ملفقة بالكامل (غير مرتبطة بالشخص/المؤسسة الحقيقية) وفقًا للمخطط أدناه. اجعل الأمر يبدو واقعيًا، لكن لا تستخدم أي معلومات تحديد هوية شخصية حقيقية. المخطط: {{الحقول والأنواع}} يتضمن حالات الحافة (فارغة، حدودية، تنسيق سيء).
البحث السري الثابت (في الكود):
ابحث عن السر المشفر في هذا الرمز/التكوين: المفتاح، كلمة المرور، الرمز المميز، عنوان URL المخصص. إذا وجدته حدد موقعه واقترح الطريقة الصحيحة (متغير البيئة / المدير السري). الكود:{{كود}}
تقييم مطابقة المركبة (حسب فئة البيانات):
لدي النوع التالي من البيانات: {{class: public / داخلي / سري / منظم}}. الأداة التي أنوي استخدامها هي: {{tool}}. ما هي الضمانات (التخزين، عدم الاستخدام في التعليم، المنطقة، الوصول) التي يجب أن أؤكدها قبل معالجة هذه البيانات في هذه الأداة؟ إعطاء قائمة مرجعية. القرار لي. قمت بتوضيح المعايير.
موجه ضعيف / موجه قوي
ضعيف: (لصق 200 صف مستخدم حقيقي تم سحبه من قاعدة بيانات الإنتاج) "لماذا يوجد خطأ في التحليل في هذه البيانات؟"
Strong: "يوجد أدناه 15 صفًا لها نفس بنية البيانات الحقيقية ولكنها مصطنعة تمامًا (بدون معلومات تحديد الهوية الشخصية). تقوم parse_user() بإلقاء خطأ ValueError على 3 و8 و12 من هذه الصفوف. ما هو النمط الشائع، وكيف يمكنني إصلاحه؟"
لا يحتوي الإصدار القوي على أي بيانات شخصية حقيقية مع الحفاظ على البنية اللازمة لإعادة إنتاج الخطأ. يبقى التشخيص كما هو، ويتم إعادة ضبط الخطر.
فئة البيانات
هل يمكن معالجتها بالذكاء الاصطناعي؟
شرط أساسي
عام
نعم
—
الاستخدام الداخلي (غير الدقة)
عموما
الامتثال لسياسة الشركة
سري (كود المصدر، سر العمل)
السيارة المعتمدة فقط
ضمان الشركات + التقليل
معلومات تحديد الهوية الشخصية / خاضعة للتنظيم
كقاعدة عامة لا
قناع/إخفاء الهوية أو استخدام الاصطناعية
الامتثال للسياسة والتتبع
الاستخدام الآمن هو أكثر من مجرد عادة شخصية، إنه نظام مؤسسي: ما هي الأدوات التي تمت الموافقة عليها، وفئة البيانات التي يمكن أن تذهب إلى أين، وما يجب فعله في حالة حدوث انتهاك يجب تحديده في سياسة مكتوبة. إذا تم تسريب سر، فإن الخطوة الأولى الأكثر أهمية هي عدم الذعر، ولكن الرجوع على الفور (إلغاء وإنشاء سر جديد) لبيانات الاعتماد المسربة والإبلاغ عن الحادث. إذا كنت لا تعرف قائمة مؤسستك للأدوات المعتمدة وقواعد تصنيف البيانات، فإن مهمتك الأولى هي التعرف عليها.
نصيحة: حدد قائمة "تجاهل" خاصة بالمشروع (مثل .env والمجلدات المخفية وملفات الهوية) في أداة Editor/CLI الخاصة بك حتى لا يتم تضمين هذه الملفات عن طريق الخطأ في سياق المساعد. الوقاية دائما أرخص من التنظيف.
الأخطاء الشائعة
- لصق البيانات الحساسة "مرة واحدة فقط". الاستعجال لا يوقف الخط الأحمر؛ يحدث التسرب الأكثر شيوعًا هنا.
- التفكير "سأحذف المحادثة". في اللحظة التي تغادر فيها البيانات الشبكة، تنشأ المخاطر؛ الحذف لا يتراجع عنه.
- اختيار السيارة دون النظر إلى فئتها. تعد معالجة بيانات الشركة السرية باستخدام حساب شخصي انتهاكًا خطيرًا.
- عدم مسح الإخراج. يمكن للذكاء الاصطناعي تضمين سر غير قابل للتغيير في التعليمات البرمجية؛ قم أيضًا بفحص الإنتاج باستخدام الماسح الضوئي السري.
- عدم تحويله عندما يتسرب السر. يؤدي عدم إلغاء المفتاح المسرب إلى تحويل التسرب إلى استغلال مباشر.
باختصار
أكبر خطر للذكاء الاصطناعي في البرمجيات هو تسرب الخصوصية، ومعظمه ينشأ من قرار النسخ واللصق الذي يتم اتخاذه تحت الإكراه. القاعدة واضحة: لا يتم إدخال الأسرار والبيانات الشخصية وأصول الأعمال السرية والبيانات الخاضعة للتنظيم في أدوات غير معتمدة. قم بتصنيف البيانات قبل الإدخال، وحدد الوكيل حسب الفئة، واستخرج الأسرار، وقم بإخفاء معلومات تحديد الهوية الشخصية (PII) أو استخدم البيانات الاصطناعية، وقم بتقليل السياق، ومسح المخرجات بحثًا عن الأسرار أيضًا. إذا كان هناك تسرب، أول شيء: قم بإعادة بيانات الاعتماد والإبلاغ عنه.
مهمة التطبيق
خذ جزءًا من الكود/السجل/البيانات التي قدمتها مؤخرًا (أو تفكر في تقديمها) إلى الذكاء الاصطناعي. أولاً، قم بتحديد المرشحين السريين ومعلومات تحديد الهوية الشخصية داخل قالب "قائمة التحقق من الإخفاء". ثم، إذا كانت تحتوي على بيانات حقيقية، فأنتج نسخة مطابقة لقالب "إنشاء بيانات الاختبار الاصطناعية" ولكنها مكونة بالكامل، واجعل مشكلتك قابلة للتكرار باستخدامها. وأخيرًا، ابحث عن قائمة الأدوات المعتمدة وسياسة تصنيف البيانات الخاصة بمؤسستك واقرأها؛ وإلا، لاحظ هذا الإغفال.
قائمة مرجعية
- [ ] أقوم بتصنيف البيانات قبل إدخالها (مفتوحة/داخلية/سرية/خاضعة للتنظيم).
- [ ] لا أقوم أبدًا بإدخال الأسرار ومعلومات تحديد الهوية الشخصية والأصول التجارية السرية في أدوات غير معتمدة.
- [ ] أستخدم البيانات المخفية أو الاصطناعية كلما أمكن ذلك بدلاً من البيانات الحقيقية.
- [ ] أقوم بتقليص السياق إلى أصغر مثال لا يتضمن أجزاء حساسة.
- [ ] أقوم بمسح مخرجات الذكاء الاصطناعي بحثًا عن سر مدفون.
- [ ] أعلم أنه إذا تم تسريب السر، فسوف أعيد على الفور معلومات التعريف وأبلغ عن الحادث.