المكاسب:
- القدرة على ضمان إمكانية التكرار باستخدام أربع ركائز (تثبيت البذور، وإصدار البيانات، وتجميد الوسائط، ومراقبة التجربة) وتحقيق نفس النتيجة عند تكرار نفس التشغيل
- القدرة على الجمع بين جميع نقاط الوحدة (المقاييس، البيانات، النموذج، مكونات LLM، التقييم، العدالة، الأمان، التوزيع، المراقبة) في سلسلة شاملة
- القدرة على التحقق من أن القرار الحاسم يظل بيد الإنسان في كل محطة وتوثيق المشروع بطريقة قابلة للتدقيق
إن الفشل الأكثر خطورة لمشروع تعلم الآلة ليس الانهيار؛ "عدم الحصول على نفس النتيجة مرة أخرى." إذا لم تتمكن من إعادة إنتاج النتيجة اليوم للنموذج الذي وضعته في مرحلة الإنتاج قبل ثلاثة أشهر، فأنت لا تتحكم حقًا في هذا النموذج. في هذه الوحدة الختامية، نقوم بتعميق إمكانية التكرار: القدرة على الحصول بشكل موثوق على نفس النتيجة بنفس المدخلات ودمج الوحدة بأكملها في نظام مشروع شامل.
لماذا التكاثر صعب
في البرامج العادية، نفس الكود يعطي نفس المخرجات. في ML هناك العديد من المتغيرات التي تحدد النتيجة:
- العشوائية: خلط البيانات، وتهيئة الوزن، وتقسيم البيانات - كلها تعتمد على العشوائية.
- البيانات: نفس الكود ينتج نموذجًا مختلفًا بإصدار بيانات مختلف.
- البيئة: يمكن لإصدارات المكتبة والأجهزة (CPU/GPU) وحتى نظام التشغيل تغيير النتيجة.
- الحالة المخفية: معلمة تشعبية غير محفوظة، وخطوة معالجة مسبقة يدوية، واختيار غير ملحوظ.
إن إمكانية التكرار ليست أمراً "من الجميل أن يكون لديك" ولكنها ضرورة علمية وهندسية. والنتيجة التي لا يمكن إعادة إنتاجها هي ادعاء لا يمكن إثباته.
أربع ركائز للاستنساخ
1. إصلاح العشوائية. قم بتعيين جميع البذور العشوائية في مكان واحد: تقسيم البيانات، وتهيئة النموذج، وخلط البيانات. البذرة الثابتة هي أساس ضمان "نفس النتيجة عند تكرار نفس التشغيل".
2. قم بإصدار البيانات. سجل إصدار البيانات الذي تم إجراء كل تجربة باستخدامه (إصدار البيانات في الوحدة 2). "أحدث البيانات" غامضة؛ "إصدار البيانات v3، التجزئة abc123" هو بالضبط.
3. قم بتجميد الوسط. قم بتثبيت جميع التبعيات بإصداراتها الدقيقة (على سبيل المثال، الإصدارات الدقيقة مثل numpy==1.26.4 في ملف require.txt، أو صورة الحاوية). "الإصدار الأحدث" سوف يكسر كل شيء في يوم من الأيام.
4. تتبع كل شيء (تتبع التجربة). حفظ تلقائيًا لكل تجربة: إصدار التعليمات البرمجية (التزام git)، وإصدار البيانات، وجميع المعلمات الفائقة، والمقاييس، وهياكل الإخراج. أدوات تتبع التجارب مثل MLflow، والأوزان والتحيزات تقوم بذلك بشكل منهجي. بدون التسجيل، يبقى السؤال "ما هو الإعداد الأفضل" دون إجابة.
تحذير: عبارة "سأتذكر لاحقًا" هي المغالطة الأكثر تكلفة. وبعد مرور أسبوعين، لن تتذكر أي بذرة أو بيانات أو معلمة تشعبية استخدمتها. التتبع التلقائي يلغي الاعتماد على الذاكرة.
نهج ضعيف / نهج قوي
ضعيف: "لقد وجدت أفضل نموذج، وهو موجود في دفتر الملاحظات، وأعتقد أن نتيجته كانت 89%."
Strong: "قم بتشغيل رقم 147 في أداة تتبع التجربة: git Commit a3f9c، إصدار البيانات v3 (hash abc123)، المصدر 42، جميع المعلمات الفوقية مسجلة، اختبار PR-AUC 0.887. عندما أقوم بتشغيل نفس الأمر مرة أخرى، أحصل على نفس النتيجة شيئًا فشيئًا. يعتمد النموذج على هذا التشغيل في السجل."
الفرق: في المنهج القوي النتيجة لا تعتمد على الذاكرة، بل على سلسلة ثابتة ومراقبة. يمكن للجميع إنتاج نفس النتيجة في كل مرة.
مشروع شامل: مزيج من الوحدة
الآن دعونا ندمج الوحدة بأكملها في تدفق مشروع واحد. يمر نظام ML الحقيقي عبر نقاط التوقف هذه، وكل محطة تعتمد على المحطة السابقة:
- تعريف المشكلة: ما الذي نقوم بحله، وكيفية قياس النجاح (الوحدة 3: المقياس الصحيح، سياق الأعمال). المقياس والعتبة واضحان منذ البداية.
- خط أنابيب البيانات: التجميع، والتحقق من الصحة، والتطهير، والتقسيم المانع للتسرب، وإصدار الإصدارات (الوحدة 2).
- تطوير النموذج: التدريب، المقارنة الأساسية، التحقق المتبادل، البذور الصلبة (الوحدة 3 + هذه الوحدة).
- مكونات LLM (إن أمكن): RAG (الوحدة 4) و/أو الوكلاء (الوحدة 5)؛ الضبط الدقيق إذا لزم الأمر (الوحدة 6).
- التقييم: مجموعة التقييم مع حالات الحافة والأمان، تقييم متعدد الطبقات في أنظمة LLM (الوحدة 8).
- تدقيق العدالة والأخلاق: تحليل المجموعات الفرعية، البطاقة النموذجية، قابلية الشرح (الوحدة 10).
- التدقيق الأمني: الحقن الفوري، الخصوصية، سلسلة التوريد (الوحدة 9).
- التوزيع: التغليف، التوزيع التدريجي، التراجع، تسجيل النموذج (الوحدة 7).
- المراقبة: مراقبة ثلاثية الطبقات، إنذارات الانجراف (الوحدة 8).
- إمكانية التكرار: تتبع البذور وإصدار البيانات والوسائط والتجربة في جميع أنحاء السلسلة بأكملها (هذه الوحدة).
في هذا التدفق، يعد الذكاء الاصطناعي بمثابة مُسرِّع ومولد مخطط في كل محطة؛ ولكن اختيار المقاييس، وقرارات البيانات، وتحديد أولويات العدالة، وعتبة النشر، والموافقة على الإصدار - تظل القرارات الحاسمة في يد الإنسان. هذا هو جوهر الوحدة.
التوثيق: المستقبل سوف يشكرك
مشروع تعلم الآلة الجيد يوثق نفسه. كحد أدنى، يجب كتابة ما يلي: معايير المشكلة والنجاح، مصدر البيانات وإصدارها، اختيارات النماذج ومبرراتها، نتائج التقييم (بما في ذلك المجموعات الفرعية)، الحدود والمخاطر المعروفة، إجراءات النشر والاسترجاع، خطة المراقبة. هذه الوثيقة هي أفضل صديق للشخص (ربما أنت) الذي يعود إلى المشروع بعد ستة أشهر.
ثلاث حالات صغيرة
الحالة 1 - النتيجة المفقودة. قام أحد المهندسين بتدريب نموذج رائع، لكنه لم يصلح البذرة ولم يحفظ نسخة البيانات. وعندما ترك الوظيفة، لم يتمكن أحد من إعادة إنتاج تلك النتيجة؛ أصبح النموذج "أسطورة الصندوق الأسود" وتم بناؤه في النهاية من الصفر. ضاعت الأسابيع. الدرس المستفاد: النتيجة غير القابلة للتكرار هي نتيجة غير موجودة.
الحالة 2 - انهيار البيئة. فريق واحد لم يصلح التبعيات. عندما يتم تحديث المكتبة تلقائيًا، تتغير مخرجات النموذج بصمت ويتعطل الإنتاج. استغرق الأمر أيامًا للعثور على المشكلة. عندما تم تجميد التبعيات ووضعها في حاوية مع الإصدارات النهائية، لم تحدث المشكلة مرة أخرى. الدرس: تجميد البيئة.
الحالة 3 - قوة المراقبة. قام الفريق تلقائيًا بمراقبة كل تجربة. وبعد ثلاثة أشهر، أثناء التدقيق التنظيمي، أجابوا على السؤال "بأي بيانات، وبأي إعدادات، وما الأداء الذي حصلت عليه في أي مجموعات؟" مع تسجيل كامل خلال دقائق. تمت عملية التفتيش بسلاسة. الدرس المستفاد: المراقبة هي أداة امتثال، وليست مجرد أداة هندسية.
قوالب قابلة للنسخ
قم بإجراء فحص استنساخ لمشروع ML هذا. - هل تم إصلاح جميع بذور العشوائية (تقسيم، تهيئة، خلط ورق اللعب)؟ - هل تم إصدار البيانات؟ - هل تم تجميد التبعيات إلى الإصدارات الدقيقة؟ - هل يتم تتبع كل تجربة (التزام التعليمات البرمجية، البيانات، المعلمة الفائقة، المقياس)؟ اكتب خطوات ملموسة حول كيفية إصلاح كل عمود مفقود. هيكل المشروع: [الوصف]
قم بإنتاج هيكل عظمي للخطة لمشروع تعلم الآلة الشامل هذا. المشكلة: [وصف] قم بتغطية المحطات التالية وحدد مكان القرار البشري في كل محطة: المشكلة/القياس، خط الأنابيب، النموذج، (RAG/الوكيل/الضبط الدقيق؟)، التقييم، العدالة، الأمان، التوزيع، المراقبة، إمكانية التكرار. اكتب خطوة المخاطرة والتحقق الرئيسية لكل محطة.
إنتاج قالب الوثائق الفنية لهذا المشروع. الأقسام: المشكلة+معايير النجاح، البيانات (المصدر+الإصدار)، اختيارات النموذج+المبرر، التقييم (بما في ذلك المجموعات الفرعية)، الحدود المعروفة+المخاطر، النشر+التراجع، خطة المراقبة. قم بإعطاء الحقول المراد ملؤها لكل قسم كأسئلة.
تحقق من إعداد مراقبة تجربتي: هل يتم حفظها تلقائيًا في كل عملية تشغيل: التزام git، وإصدار/تجزئة البيانات، وجميع المعلمات الفائقة، وجميع المقاييس، والبيئة (إصدارات المكتبة)؟ هل أحصل على نفس النتيجة عندما أقوم بنفس التشغيل مرة أخرى؟ الإعداد: [الوصف]. قائمة العيوب وتصحيحها.
جدول أعمدة الاستنساخ
عمود
ما هو ثابت
مثال مركبة
العشوائية
جميع البذور
وضع البذور
البيانات
إصدار البيانات/التجزئة
دي في سي
بيئة
إصدارات المكتبة
دبوس المتطلبات، دوكر
المراقبة
الكود+البيانات+الإعدادات+المقياس
إم إل فلوو، دبليو آند بي
الأخطاء الشائعة
- عدم تثبيت البذور. لا يمكن تكرار النتيجة.
- عدم حفظ نسخة البيانات. "بأي بيانات؟" يبقى دون إجابة.
- لا تجميد الإدمان. التحديث سوف يكسر كل شيء بصمت.
- ترك التجارب للذاكرة. وبعد اسبوعين لا شيء يتذكر.
- ترك القرارات الحاسمة للذكاء الاصطناعي. يجب أن تظل قرارات المقاييس والعدالة والتوزيع في أيدي الناس.
- تأجيل التوثيق. فريق المستقبل (وأنت) يدفعون الثمن.
باختصار
إن إمكانية التكرار هي السمة المميزة للهندسة الجادة لتعلم الآلة: والنتيجة غير القابلة للتكرار هي ادعاء غير قابل للإثبات. يأتي مزودًا بأربعة أعمدة - إصلاح العشوائية، وبيانات الإصدار، وتجميد البيئة، وتتبع كل تجربة. يجمع المشروع الشامل بين جميع نقاط توقف هذه الوحدة (المقياس، والبيانات، والنموذج، ومكونات LLM، والتقييم، والإنصاف، والأمن، والتوزيع، والمراقبة) في سلسلة مترابطة؛ الذكاء الاصطناعي هو عامل تسريع في كل محطة، لكن القرارات الحاسمة تظل بيد الإنسان. قم بتوثيق كل شيء – للفريق المستقبلي وعمليات التدقيق. هذا النظام هو الإطار الذي يدعم كل ما تتعلمه خلال الوحدة.
مهمة التطبيق
تحقق من مشروع تعلم الآلة مقابل أربعة ركائز قابلة للتكرار: هل البذور غير قابلة للتغيير، هل تم إصدار البيانات، هل البيئة مجمدة، هل يتم تتبع التجارب؟ قم بإصلاح أي أعمدة مفقودة وأثبت أنه يمكنك تشغيل نفس التشغيل مرتين والحصول على نفس النتيجة. ثم قم بإخراج التدفق الشامل للمشروع (10 محطات) على صفحة واحدة ووضع علامة "أين يوجد القرار البشري" في كل محطة. وأخيرًا، اكتب مسودة قصيرة للوثائق الفنية.
قائمة مرجعية
- [ ] تم إصلاح جميع بذور العشوائية.
- [ ] يتم تسجيل إصدار/تجزئة البيانات مع كل تجربة.
- [ ] يتم تجميد التبعيات إلى إصدارات ثابتة (دبوس/حاوية).
- [ ] تتم مراقبة كل تجربة تلقائيًا (الكود+البيانات+الإعدادات+المقياس).
- [ ] عندما أكرر نفس العملية، أحصل على نفس النتيجة.
- [ ] لقد قمت بالتحقق من وتوثيق أن القرارات الحاسمة في التدفق الشامل يتم اتخاذها من قبل البشر.
امتحان الوحدة
1. باعتبارك مهندس تعلم الآلة، ما هو أفضل نهج عند وضع الذكاء الاصطناعي في سير العمل؟
- أ) الذكاء الاصطناعي هو عامل تسريع في الأعمال منخفضة المخاطر؛ تظل القرارات الحاسمة مثل المقاييس والبيانات والإنتاج معتمدة وتترك للإنسان ✔
- ب) طالما أن مخرجات الذكاء الاصطناعي تبدو جيدة، فلا داعي للتحقق
- ج) ترك قرار وضع النموذج في الإنتاج للذكاء الاصطناعي يوفر الوقت.
- د) الذكاء الاصطناعي مفيد فقط لكتابة النص، ولا علاقة له بالبيانات وعمل النماذج
الوصف: يعد الذكاء الاصطناعي أداة تسريع قوية للمهام منخفضة المخاطر والتي يمكن التحقق منها بسهولة مثل التعليمات البرمجية وملخصات البيانات والمستندات؛ ومع ذلك، فإن مسؤولية القرارات التي تؤثر على المال والسرية والمسؤولية القانونية، مثل اختيار المقاييس، والبيانات التي يتم إدخالها في التدريب، ووضع النموذج في الإنتاج، تقع على عاتق المهندس والفريق المؤهلين. ولا ينبغي استخدام كل مخرجات دون التحقق منها.
2. لماذا يتم وضع التحقق من صحة المخطط في بداية مسار البيانات؟
- أ) لأنه يزيد بشكل مباشر من دقة النموذج
- ب) لأنه يجعل إصدار البيانات غير ضروري
- ج) لأنه يلتقط البيانات التالفة في أقرب وقت وأرخص نقطة ويمنعها من التسرب إلى الخطوات التالية ✔
- د) لأنه يلغي الحاجة إلى وضع العلامات
توضيح: كلما تم اكتشاف البيانات الفاسدة مبكرًا، كان إصلاحها أرخص. يمنع التحقق من صحة المخطط البيانات الفاسدة من التسرب بصمت إلى التدريب أو الإنتاج عن طريق رفض البيانات خارج النوع والنطاق المتوقعين في بداية السطر (على سبيل المثال، تغير السعر 100x مع تغيير الوحدة)؛ نفس الخطأ الذي تم اكتشافه في الإنتاج يكون أكثر تكلفة عدة مرات.
3. ما هو الأسلوب الصحيح عند تقسيم البيانات إلى تدريب واختبار في مشكلة تتعلق بالزمن (السلاسل الزمنية)؟
- أ) استخدام التقسيم العشوائي لأنه الطريقة الأعدل دائمًا
- ب) استخدام التقسيم الزمني: منع التسرب عن طريق التدريب بالماضي والاختبار بالمستقبل✔
- ج) استخدام جميع البيانات كتدريب واختبار
- د) دمج بيانات الاختبار في معايير القياس قبل التدريب
شرح: التقسيم العشوائي للسلاسل الزمنية يمنح النموذج ميزة "رؤية المستقبل" التي لن تحدث أبدًا في الإنتاج ويضخم المقاييس بشكل مصطنع (التسرب الزمني). والصحيح هو التقسيم الزمني: تدرب مع الماضي، واختبر في المستقبل. وهذا يقيس الأداء الفعلي الذي يبقيه في الإنتاج.
4. لماذا تكون الدقة مضللة في نموذج كشف الاحتيال بمعدل فئة إيجابي يبلغ 1.5%؟
- أ) لأن الدقة تكون دائمًا منخفضة في البيانات غير المتوازنة
- ب) لأنه لا يمكن استخدام الدقة إلا في مشاكل الانحدار
- ج) لأن حساب الدقة يتطلب الكثير من قوة المعالجة
- د) حتى النموذج التافه الذي يتنبأ بفئة الأغلبية يمكن أن يكون دقيقًا للغاية، وبالتالي يخفي النجاح الحقيقي ✔
توضيح: بالنسبة للبيانات غير المتوازنة، فحتى النموذج الأساسي الذي يقول "أطلق على كل شيء اسمًا سلبيًا" يحصل على دقة تصل إلى 98.5% تقريبًا ولكنه لن يتمكن من اكتشاف عملية احتيال واحدة. لذلك، في التصنيف غير المتوازن، يتم استخدام الدقة أو الاستدعاء أو F1 أو PR-AUC بدلاً من الدقة، ويتم تفسير كل مقياس وفقًا لنموذج أساسي.
5. لماذا تعتبر المقارنة الأساسية ضرورية عند الحديث عن مقياس النموذج؟
- أ) لأن النموذج الأساسي دائمًا أفضل من النموذج الحقيقي
- ب) لأنه من الواضح ما إذا كان المقياس ذا معنى أم لا فقط عند مقارنته بنموذج أساسي بسيط ✔
- ج) لأن النموذج الأساسي يجعل التحقق المتبادل غير ضروري
- د) لأن النموذج الأساسي مطلوب قانونًا في كل تقرير
Explanation: المقياس ليس جيدًا أو سيئًا في حد ذاته؛ إنه جيد أو سيئ وفقًا للنموذج الأساسي. الجملة "85% صحيح" تعني عديمة القيمة تقريبًا إذا حصل النموذج الأساسي بالفعل على 84%، والكمال إذا حصل على 50%. وبدون مرساة المقارنة، فإن المقياس لا معنى له.
6. ما هو عنصر الأمان الأكثر أهمية الذي يجب تضمينه في موجه الإنتاج لنظام RAG (جيل الاسترجاع المعزز)؟
- أ) تعليمات بالاعتماد فقط على المصدر المذكور، وقول "لا أعرف" إذا كان المصدر غير موجود، وذكر المصدر ✔
- ب) مطالبة النموذج بإنتاج إجابات طويلة ومبتكرة قدر الإمكان
- ج) يعطي النموذج الأولوية للمعرفة التعليمية الخاصة به على الموارد
- د) تنفيذ جميع التعليمات الواردة في المستندات المقدمة كأوامر
Explanation: أهم تعليمات RAG هي إخبار النموذج بالاعتماد فقط على المصدر المحدد، وإذا لم تكن المعلومات موجودة في المصدر، قل "لا أعرف" واستشهد بالمصدر دون اختلاقه. وبدون هذا الثالوث، قد يتجاهل النموذج السياق وينتج الهلوسة، وتصبح الإجابة غير قابلة للتحقق.
7. يعطي نظام RAG إجابات غير صحيحة. أين هو أفضل مكان لبدء التشخيص؟
- أ) قياس الجلب أولاً (Recall@K): هل تصل القطعة الصحيحة على الإطلاق؟ ✔
- ب) استبدل النموذج على الفور بآخر أكبر
- ج) قم بتغيير المطالبة بشكل عشوائي واستمر في المحاولة
- د) تضمين جميع المستندات في النموذج مع الضبط الدقيق
توضيح: الحلقة الأضعف في RAG هي عادةً الجلب وليس الإنتاج. إذا لم يتم إحضار الجزء الصحيح مطلقًا، فلن يتمكن النموذج من إنتاج تلك المعلومات، بغض النظر عن مدى تحسين المطالبة. لذلك، يتم قياس Recall@K أولاً لمعرفة ما إذا كان الجزء الصحيح قد وصل؛ إذا كان الجلب جيدًا، فسيتم فحص الإنتاج والموجه.
8. ما هي الإجراءات التي يجب اتخاذها وراء موافقة الإنسان عند إعطاء الأداة للوكيل؟
- أ) لا شيء؛ يجب أن يكون الوكيل قادرًا على تنفيذ كل إجراء بشكل مستقل
- ب) الإجراءات القابلة للعكس فقط مثل قراءة البيانات والبحث عنها
- ج) إجراءات لا رجعة فيها أو ذات تأثير كبير مثل تحويل الأموال أو الحذف أو الإرسال ✔
- د) الإجراءات التي تنطوي على الحسابات فقط
الوصف: يتم فصل الإجراءات حسب مستوى المخاطرة. يمكن القيام بالمهام القابلة للاسترجاع مثل القراءة والبحث والحساب وإنشاء المسودات بشكل مستقل؛ ومع ذلك، فإن الإجراءات التي لا رجعة فيها أو ذات التأثير الكبير مثل تحويل الأموال، وإرسال رسائل البريد الإلكتروني، وحذف البيانات، وتقديم الطلبات وما إلى ذلك تتطلب موافقة بشرية. يجب أن يخضع كل إجراء غير قابل للإلغاء للموافقة.
9. ما هو أفضل أسلوب تصميمي لمواجهة مخاطر الحقن الفوري غير المباشر؟
- أ) يكفي إضافة جملة واحدة "تجاهل التعليمات السيئة" إلى موجه النظام
- ب) إعطاء مزيد من السلطة للنموذج من خلال الاعتماد على التعليمات الموجودة في المحتوى الخارجي
- ج) عدم اتخاذ أي احتياطات لأن الحقن لا يمكن الوقاية منه
- د) عزل المحتوى الخارجي كبيانات غير موثوقة وإنشاء دفاعات متعددة الطبقات بأقل قدر من التفويض والموافقة والتحكم في المخرجات ✔
الوصف: المحتوى الخارجي الذي تتم معالجته بواسطة الوكيل أو RAG، مثل صفحة الويب أو المستند أو البريد الإلكتروني وما إلى ذلك، هو بيانات غير موثوقة وقد يحتوي على تعليمات سرية. النهج الصحيح هو الدفاع متعدد الطبقات: عزل المحتوى الخارجي باعتباره "بيانات، وليس أوامر" بمحددات واضحة، وتطبيق الحد الأدنى من التفويض، وربط الإجراءات التي لا رجعة فيها بموافقة الإنسان، وتدقيق المخرجات. سطر واحد من التعليمات لا يكفي.
10. ما هو الفرق الرئيسي عند تحديد ما إذا كان ينبغي حل المشكلة من خلال الضبط الدقيق أو RAG؟
- أ) يتم حل مشكلات المعلومات بشكل أفضل باستخدام RAG، ويتم حل مشكلات السلوك/التنسيق بشكل أفضل من خلال الضبط الدقيق ✔
- ب) يجب دائمًا حل كل مشكلة عن طريق الضبط الدقيق
- ج) يتم استخدام RAG فقط لإنشاء التعليمات البرمجية، ويتم استخدام الضبط الدقيق فقط للترجمة
- د) يمكن دائمًا تحديث الضبط الدقيق بسعر أرخص وأسرع من RAG
الشرح: الضبط الدقيق ضعيف ومحفوف بالمخاطر في تعليم النموذج معلومات جديدة؛ ولكنه قوي في تدريس السلوك والشكل والنبرة والأسلوب. "الشركة النموذجية لا تعرف بياناتنا" هي مشكلة معلوماتية وتخص RAG. إن "السماح للنموذج بالإخراج دائمًا بتنسيقنا الصارم" يمثل مشكلة سلوكية ومرشحًا للضبط الدقيق. بالإضافة إلى ذلك، يجب استهلاك اللقطات السريعة والقليلة قبل الضبط الدقيق.
11. ما الذي يعتبر إلزاميًا للنشر الآمن عند وضع نموذج جديد في مرحلة الإنتاج؟
- أ) إذا كان النموذج جيدًا في الاختبار، فافتحه مباشرةً أمام حركة المرور بنسبة 100%
- ب) عدم إعداد المراقبة على الإطلاق بعد النشر
- ج) النشر المرحلي (الظل/الكناري) وخطة التراجع التي تم اختبارها مسبقًا ✔
- د) نشر النموذج حتى لو لم يتم استيفاء حد التقييم
Explanation: يعد فتح النموذج الجديد مباشرة لكل حركة المرور أمرًا محفوفًا بالمخاطر؛ إذا كان الخطأ، فإن الجميع يتأثر. الصحيح أنه توزيع تدريجي (ظل، كناري) وكل توزيع له خطة تراجع مجربة. لا يكتمل التوزيع بدون خطة الاسترداد؛ إن القدرة على العودة إلى الإصدار السابق خلال دقائق تحمي المستخدم عندما يتصرف النموذج بشكل غير متوقع في الإنتاج.
12. كيف يمكن أن يفشل نموذج تعلم الآلة "بصمت" في الإنتاج وما هي طريقة اكتشاف ذلك؟
- أ) ينهار النموذج؛ تظهر سجلات الخادم هذا
- ب) عن طريق تقديم تنبؤات خاطئة دون ارتكاب الأخطاء؛ ✔ يلتقط مراقبة الطبقات التشغيلية والمدخلات والمخرجات
- ج) لا يمكن للنموذج أن يفشل أبدًا بصمت، ودائمًا ما يكون منبهًا
- د) مجرد مراقبة زمن الوصول يكفي لاكتشاف أي تدهور
Explanation: يمكن أن يفشل النموذج ببساطة عن طريق إنتاج تنبؤات غير صحيحة دون حدوث تعطل أو إعطاء أخطاء؛ السبب الرئيسي لذلك هو انجراف البيانات وانجراف المفهوم. إن مجرد مراقبة المقاييس التشغيلية (زمن الوصول، ومعدل الخطأ) لا يكفي؛ وينبغي أيضًا مراقبة توزيع المدخلات وتوزيع المخرجات/التنبؤات. يعطي انحراف الإدخال إنذارًا مبكرًا إذا تأخرت النتيجة الفعلية.
13. ما هو المبدأ الأساسي عند استخدام ماجستير القانون كقاضي لتقييم نظام ماجستير القانون؟
- أ) حكم LLM صحيح دائمًا، والتحقق البشري غير ضروري
- ب) يجب على الحكم أن يتخذ قرارًا بناءً على طول الإجابة فقط.
- ج) يجب التخلص تمامًا من الضوابط القائمة على القواعد والتقييم البشري عند استخدام الحكام
- د) يجب معايرة درجات القاضي باستخدام عينة تم تصنيفها بواسطة الإنسان وقياس تحيزها قبل الوثوق بها ✔
الوصف: حكم LLM هو أيضًا نموذج؛ يمكن أن تكون هلوسة ومتحيزة (تفضل الإجابات الطويلة والواثقة) وغير متسقة. لذلك، يجب معايرة درجات المحكمين باستخدام عينة بشرية مصنفة ويجب قياس تحيزها المنهجي قبل اتخاذ قرار الإنتاج. حكم لم يتم التحقق منه يعطي ثقة زائفة.
14. لماذا يعتبر النظر إلى الدقة الإجمالية غير كاف عند تقييم تحيز النموذج؟
- أ) الدقة الإجمالية كافية لأنها تعكس دائمًا أداء المجموعة الأسوأ
- ب) الدقة الإجمالية وحدها غير كافية لأنها يمكن أن تحجب الاختلاف المنهجي (التمييز الخفي) بين المجموعات الفرعية ✔
- ج) لأن الدقة مقياس لا علاقة له بالتحيز
- د) يأتي التحيز من النموذج فقط وليس له علاقة بالبيانات.
Explanation: الدقة الشاملة قد تحجب الاختلافات المنهجية بين المجموعات الفرعية. على سبيل المثال، في حين أن الدقة الإجمالية تبلغ 88%، فقد تصل نسبة التذكر إلى 91% في مجموعة واحدة و67% في مجموعة أخرى؛ يفتقد النموذج تلك المجموعة بشكل منهجي. ولذلك، ينبغي تقييم النموذج على أساس المجموعات الفرعية (التركيبة السكانية/القطاع) ويجب تحديد تعريف العدالة الذي يجب أن يحظى بالأولوية مع أصحاب المصلحة.
15. ما هي الأشياء الأربعة التي يجب إصلاحها معًا لكي تكون نتيجة تعلم الآلة قابلة للتكرار؟
- أ) اسم الطراز والحجم والسعر وتاريخ الإصدار فقط
- ب) العلامة التجارية GPU وسرعة الإنترنت فقط
- ج) فقط درجة الدقة النهائية للنموذج؛ ويمكن حفظ الباقي في الذاكرة
- د) بذور العشوائية وإصدار البيانات والبيئة (إصدارات التبعية) وتتبع التجربة ✔
الوصف: يتم تحقيق إمكانية التكرار من خلال أربع ركائز: إصلاح بذور العشوائية، وإصدار البيانات (الإصدار/التجزئة)، وتجميد البيئة (إصدارات/حاوية المكتبة الدقيقة)، وتتبع كل تجربة (التزام التعليمات البرمجية، والبيانات، والمعلمة الفائقة، والمقياس). وبدون هذه السلسلة لا يمكن الحصول على نفس النتيجة؛ النتيجة غير القابلة للتكرار هي ادعاء لا يمكن إثباته.