وحدة 1 / 11

الذكاء الاصطناعي في هندسة تعلم الآلة: الدور والحدود والتحقق والمسؤولية

المكاسب:

  • القدرة على التمييز بين مكان الذكاء الاصطناعي في سير عمل تعلم الآلة (الكود والبيانات والمستند) الذي يوفر الوقت مع مخاطر منخفضة، وحيث تُترك القرارات مثل المقياس / البيانات / وضعها في الإنتاج للإنسان، وفقًا لمستوى مخاطر المهمة.
  • القدرة على تطبيق نظام يتحقق من كل مخرجات الذكاء الاصطناعي عن طريق توصيلها بالمصدر وإعادة تشغيلها وقياسها وتمريرها عبر مرشح هندسي.
  • القدرة على اكتساب عادة عدم إرسال البيانات السرية والشخصية الخام إلى أدوات خارجية، واستخدام الأدوات المعتمدة من الشركة، والتعامل مع المشكلات الأمنية للأغراض الدفاعية فقط.

الذكاء الاصطناعي في هندسة التعلم الآلي: الدور والحدود والتحقق والمسؤولية

يعمل مهندس التعلم الآلي (مهندس تعلم الآلة: متخصص في البرمجيات الذي يصمم، يدرب، ويجلب النماذج التي تتعلم من البيانات إلى الإنتاج) اليوم مع أداة ذكاء اصطناعي أخرى في كل خطوة من وظيفته. مساعد الترميز فعال عند كتابة التعليمات البرمجية، ونموذج المحادثة عند استكشاف البيانات، ونموذج اللغة الكبير (LLM: شبكة عصبية تحتوي على مليارات من المعلمات التي تفهم النص وتنتجه) عند إنتاج الوثائق. تنظر هذه الوحدة إلى الذكاء الاصطناعي باعتباره المنتج الذي تم تطويره وأداة العمل اليومية لمهندس تعلم الآلة. وهي تعمل من خلال رسم حدود المسؤولية بوضوح دون الخلط بين الدورين.

في هذه الوحدة الأولى، نجيب على السؤال الأساسي: أين يوفر الذكاء الاصطناعي في هندسة التعلم الآلي الوقت الفعلي، وأين يجب أن نترك القرار للبشر؟ الجواب يكمن في قلب النظام الهندسي: من يصنع سريعًا، ومن يتحقق هو المسؤول.

أين يصبح الذكاء الاصطناعي مفيدًا في هندسة ML؟

يمر مشروع تعلم الآلة تقريبًا بالخطوط التالية: جمع البيانات، وتنظيف البيانات، وهندسة الميزات (ترجمة البيانات الأولية إلى إشارات رقمية يمكن للنموذج فهمها)، والتدريب على النموذج، والتقييم، والنشر (النشر: فتح النموذج للمستخدم الحقيقي) والمراقبة. يساعد الذكاء الاصطناعي في كل محطة على هذا الخط، لكن مستوى سلطته يختلف.

مجالات المكافأة العالية والمنخفضة المخاطر: إنتاج هيكل عظمي للتعليمات البرمجية، وصياغة وظيفة تحويل البيانات، وتفسير رسائل السجل، ووصف تتبع المكدس، وتلخيص ملاحظات التجربة، وكتابة الوثائق والملفات التمهيدية، واقتراح حالة اختبار. هنا، أخطاء الذكاء الاصطناعي رخيصة؛ لأن المخرجات سوف تخضع بالفعل للاختبار والمراجعة.

المجالات عالية المخاطر: تحديد البيانات التي سيتم إدخالها في التدريب، وتأكيد ما إذا كان النموذج يجب أن يدخل في مرحلة الإنتاج، والحكم على أن المقياس "جيد بما فيه الكفاية"، وقرار معالجة البيانات الشخصية، وإغلاق الثغرة الأمنية باعتبارها "غير هامة". يؤثر ذلك على المال والخصوصية والمسؤولية القانونية وثقة المستخدم. الذكاء الاصطناعي يقدم اقتراحات هنا؛ ويتم اتخاذ القرار من قبل المهندس المختص والفريق المسؤول.

نصيحة: قبل الاستعانة بمصادر خارجية لمهمة ما إلى الذكاء الاصطناعي، اسأل: "ما هي التكلفة إذا كان هذا الناتج خاطئًا، وما مدى سهولة اكتشاف أي شخص للخطأ؟" إذا كان السعر منخفضًا وكان الالتقاط سهلاً، فقم بتمريره. إذا كان السعر مرتفعًا أو كان الالتقاط صعبًا، فاستخدم الذكاء الاصطناعي فقط للمسودة والقرار لك.

انضباط التحقق: ثلاث خطوات

في هندسة التعلم الآلي، لا يعد إخراج الذكاء الاصطناعي "عملًا مكتملًا" أبدًا؛ إنها مسودة. قم بتشغيل كل إخراج من خلال هذه الخطوات الثلاث:

  1. قم بتوصيله بالمصدر. إذا ذكر النموذج رقمًا أو حدًا أو "أفضل ممارسة"، فقم بإسناده إلى الوثائق الرسمية أو القيمة الفعلية في قاعدة التعليمات البرمجية أو مقياس مُقاس. "ملاءمة النموذج" (الهلوسة: الإنتاج الواثق لمعلومات غير حقيقية بواسطة نموذج اللغة) غالبًا ما يتم اكتشافه هنا.
  2. إعادة التشغيل والقياس. قم بتشغيل التعليمات البرمجية التي تم إنشاؤها، وإعادة حساب المقياس الذي ينتجه في مجموعة الاختبار الخاصة بك، والتحقق من صحة استعلام SQL المقترح على عينة صغيرة. الكود الذي لا يعمل لا قيمة له، حتى لو كان يبدو جميلًا.
  3. مررها عبر مرشح هندسي. هل يصمد الإخراج على نطاق واسع؟ هل تم أخذ حالات الحافة (البيانات الفارغة، المدخلات الكبيرة جدًا، الحقول المفقودة) في الاعتبار؟ هل هناك انتهاك للأمن والخصوصية؟ لا يستطيع القيام بهذه الخطوة إلا من يعرف المجال.

موجه ضعيف / موجه قوي

مطالبة ضعيفة: "اكتب لي بعض نماذج التعليمات البرمجية للتدريب."

موجه قوي: "اكتب نصًا تدريبيًا للتصنيف الثنائي باستخدام scikit-learn. الإدخال: data/train.parquet، العمود الهدف is_churn. يوجد خلل في الفصل (معدل إيجابي ~ 8%)، تعامل معه باستخدام class_weight. استخدم PR-AUC (المنطقة الواقعة أسفل منحنى الاستدعاء الدقيق) كمقياس للتقييم، لأن الدقة مضللة للبيانات غير المتوازنة. أصلح البذرة العشوائية إلى 42. اختبار في نهاية مجموعة طباعة التعليمات البرمجية الجامعة الأمريكية بالقاهرة."

الفرق: تحتوي المهمة السريعة الثانية على حقيقة البيانات والمقياس الصحيح ومعلومات عدم التوازن ومتطلبات التكرار. ومن هذا السياق يكون الناتج قابلاً للتحقق منه وقابلاً للاستخدام.

الخصوصية وأمن البيانات: مسؤولية المهندس الأولى

غالبًا ما يتطرق مهندس تعلم الآلة إلى البيانات الأكثر حساسية للشركة: سجلات العملاء، وتاريخ المعاملات، والبيانات الصحية أو المالية، وسجلات أنظمة الإنتاج. ثلاث قواعد عند إعطاء البيانات لأدوات الذكاء الاصطناعي:

  • لا ترسل البيانات الشخصية والسرية الأولية إلى أدوات خارجية. على سبيل المثال، بدلاً من لصق رسائل البريد الإلكتروني الخاصة بالعملاء في الموجه، أرسل المخطط والعينات الوهمية (الاصطناعية). استخدم مثالًا مقنعًا مثل "ex: ahmet@example.com" بدلاً من البيانات الحقيقية.
  • استخدم المركبات المعتمدة من قبل الشركة. اختر أدوات واضحة تعاقديًا حيث تتم معالجة البيانات، سواء تم تخزينها، سواء تم استخدامها للتعليم أم لا. تعد معالجة بيانات الشركة باستخدام حساب شخصي انتهاكًا في معظم الشركات.
  • سياسة الحد الأدنى من البيانات أعط الحد الأدنى من السياق اللازم لحل المهمة. ليس الجدول بأكمله، ولكن الأعمدة والمخطط الخمسة ذات الصلة.
تحذير: افترض أنه لا يمكن التراجع عن النص الذي قدمته لنموذج اللغة. لا ترسل بيانات شخصية أولية معتقدًا أنك "سوف أحذفها لاحقًا"؛ لقد حدث الخطر لحظة إرساله.

الاستخدام الدفاعي في مجال الأمن

غالبًا ما يقوم مهندسو تعلم الآلة بتثبيت أنظمة الأمان: كشف الاحتيال، وتصنيف حركة المرور الضارة، والمصادقة. خلال هذه الوحدة، نغطي المشكلات الأمنية للأغراض الدفاعية فقط: اكتشاف الهجوم، وتقوية النظام، وإغلاق الثغرة الأمنية. يعد استخدام الذكاء الاصطناعي للوصول غير المصرح به أو تسرب البيانات أو التدخل غير المصرح به في نظام شخص آخر أمرًا غير قانوني ويتعارض مع أخلاقيات المهنة. عندما تجد ثغرة أمنية، فإن الطريقة الصحيحة هي الإبلاغ عنها بشكل مسؤول وإصلاحها؛ لا استغلال.

ثلاث حالات صغيرة

الحالة 1 - الوقت المحفوظ. عادةً ما يقضي مهندس تعلم الآلة نصف يوم في إجراء تحليل البيانات الاستكشافية (EDA) لمجموعة بيانات مكونة من 40 عمودًا. لقد أعطى المخطط ومخرجات df.describe() إلى الذكاء الاصطناعي وسأل، "ما هي الأعمدة التي تحتوي على معدل مرتفع ومفقود، وما هي التحويلات التي توصي بها؟" وفي غضون 20 دقيقة، تلقى قائمة بالأولويات، والتحقق من كل عنصر باستخدام الكود الخاص به. الحفظ: حوالي 3 ساعات، خطر حدوث خطأ منخفض نظرًا لقياس كل مطالبة.

الحالة 2 - تم اكتشاف الخطأ. "دقة التدريب هي 99٪، عظيم"، قال النموذج مساعد الدردشة. طبق المهندس الخطوة الثالثة (الفلتر الهندسي) وأدرك: أن العمود المستهدف قد تسرب عن طريق الخطأ السمات (تسرب البيانات: يرى النموذج معلومات لا ينبغي أن يراها في التدريب). وكان الأداء الفعلي أقل من ذلك بكثير. إن شك المهندس، وليس التفسير "العظيم" للذكاء الاصطناعي، هو الذي أنقذ المهمة.

الحالة 3 - منع انتهاك الخصوصية. كان أحد الفريق يلصق سجلات أخطاء الإنتاج في نموذج خارجي ويقول "أصلح هذا الخطأ". كانت هناك أرقام تعريف العملاء في السجلات. وضع الفريق قاعدة تتمثل في كتابة برنامج نصي صغير يخفي السجلات أولاً (يصنع أرقام هوياتهم ***) ويرسلها بهذه الطريقة. لقد اختفى خطر الاختراق، ولم تتغير سرعة المساعدة.

قوالب قابلة للنسخ

المهمة: [ما يجب فعله، جملة واحدة] السياق: [مخطط البيانات، الحجم، القيود؛ لا توجد بيانات شخصية فعلية]القيود: [اللغة/المكتبة، الأداء، إمكانية التكرار]المقاييس: [كيفية قياس النجاح]الإخراج المطلوب: [الكود/الوصف/القائمة] ولماذا في هذا التنسيق

تحقق من هذا الرمز. لا تقم بتقييم نجاحه فحسب، بل أيضًا من حيث: 1) حالات الحافة (الإدخال الفارغ، العمود المفقود، البيانات الكبيرة جدًا) 2) خطر تسرب البيانات 3) إمكانية التكرار (الأصل، الإصدار) اقتراح إصلاحات لكل مشكلة تجدها. ضع علامة "تحقق" حيث لم تكن متأكدًا. الكود: [الكود]

قم بتفسير نتيجة هذا المقياس، ولكن اسأل أولاً: هل هذا المقياس صحيح لهذه المشكلة؟ المشكلة: [تصنيف متوازن/غير متوازن، انحدار، تصنيف...] المقياس والقيمة المبلغ عنها: [على سبيل المثال: الدقة 0.99] ما هو المقياس الذي توصي به ولماذا، وما هي العلامات التي يجب أن أبحث عنها لتجعلني أشك في النتيجة الحالية؟

تحقق مما إذا كانت هناك معلومات شخصية/سرية في البيانات التي سأقدمها للموجه التالي. قم بإدراج الحقول (الاسم، البريد الإلكتروني، رقم الهوية، الهاتف، العنوان) التي يجب إخفاؤها في النص أدناه. النص: [النص]

جدول الأدوار والصلاحيات

كويست

دور الذكاء الاصطناعي

صاحب القرار

هيكل الكود / وظيفة التحويل

مشروع مولد

مهندس (تعليقات)

EDA / ملخص البيانات

مسرع

مهندس (يتحقق عن طريق القياس)

التفسير المتري

اقتراح

مهندس

ما هي البيانات التي ستدخل في التدريب؟

اقتراح

الفريق + مالك البيانات

وضع النموذج في الإنتاج

تذكير قائمة المراجعة

مهندس مسئول + فريق عمل

معالجة البيانات الشخصية

لا شيء (غير مستخدم)

مراقب قانوني + بيانات

الأخطاء الشائعة

  • استخدام المخرجات دون التحقق من صحتها. الخطأ الأكثر شيوعا والأكثر تكلفة. الرمز أو المقياس الذي يبدو جيدًا لا يعني أنه صحيح.
  • لصق البيانات السرية الخام في الأداة. وبمجرد إرسالها، لا يمكن استرجاعها.
  • الاعتماد على المقياس الخاطئ. تعتبر المقاييس غير المتوافقة مثل الدقة في البيانات غير المتوازنة وRMSE في مشاكل التصنيف مضللة.
  • الخلط بين الذكاء الاصطناعي وصانع القرار. يقدم اقتراحات. المسؤولية تقع على عاتق الموقع .
  • موجه بدون سياق. الطلبات الغامضة مثل "اكتب نموذجًا" تنتج مخرجات لا يمكن التحقق منها.

باختصار

الذكاء الاصطناعي هو المنتج الذي طوره مهندس التعلم الآلي ونسخه اليومي. تكون قيمته أعلى في المهام منخفضة المخاطر والتي يمكن التحقق منها بسهولة مثل مستند بيانات التعليمات البرمجية؛ تظل القرارات التي تؤثر على المال والخصوصية والأمن في يد الشخص. قم بتوصيل كل مخرج بالمصدر، وقم بالقياس مرة أخرى، ثم قم بالمرور عبر المرشح الهندسي. حماية البيانات السرية، واستخدام المركبات المعتمدة، والعمل في مجال الأمن لأغراض دفاعية فقط. هذا الانضباط هو الأساس لجميع الوحدات اللاحقة.

مهمة التطبيق

اختر مهمة من مشروعك الخاص (مثل كتابة وظيفة تنظيف البيانات). اكتب أولاً موجهًا ضعيفًا، ثم اكتب موجهًا قويًا باستخدام القالب الموجود في هذه الوحدة. خذ كلا الناتجين، وقم بتطبيق التحقق من ثلاث خطوات (رابط إلى المصدر، إعادة التشغيل، عامل التصفية الهندسي). لاحظ أي مطالبة توفر عدد الدقائق وعدد التصحيحات.

قائمة مرجعية

  • [ ] لقد حددت مستوى المخاطرة (منخفض/مرتفع) لمهمتي.
  • [ ] لم أضع أي بيانات شخصية/سرية فعلية في الموجه؛ لقد قمت بإخفائها أو استخدمت عينة اصطناعية.
  • [ ] لقد قمت بتوصيل الإخراج بالمصدر، وقمت بتشغيله مرة أخرى، وقمت بتصفيته من منظور هندسي.
  • [ ] تأكدت من أنني قمت بتحديد المقياس الصحيح.
  • [ ] لقد اتخذت القرار الحاسم (وضعه في مرحلة الإنتاج ومعالجة البيانات) بنفسي/مع الفريق، ولم أترك الأمر للذكاء الاصطناعي.
  • [ ] لقد استخدمت سيارة معتمدة من الشركة.