المكاسب:
- القدرة على بناء مشكلة التعلم الآلي بدقة باستخدام الذكاء الاصطناعي للتنبؤ بالخصائص الميكانيكية من معلمات التكوين والعملية
- القدرة على قراءة مخرجات النموذج بشكل نقدي من خلال التعرف على مخاطر جودة البيانات والتجهيز الزائد والاستقراء
- القدرة على اختبار نتائج نموذج التنبؤ مع المعقولية المادية وفاصل الثقة وتجربة التحقق
يتم تلخيص القانون الأساسي في علم المعادن على النحو التالي: "العملية تحدد البنية، والبنية تحدد الخاصية". قوة الخضوع للصلب لا تعتمد فقط على التركيب؛ وينشأ من كيفية معالجته (التزوير، والدرفلة، والمعالجة الحرارية) والبنية المجهرية الناتجة (حجم الحبوب، ونسبة الطور، والرواسب). يعد الذكاء الاصطناعي، وخاصة التعلم الآلي (ML: الأساليب التي تتعلم وتقوم بالتنبؤات من الأنماط الموجودة في البيانات)، قويًا في استخلاص علاقات التكوين والعملية والملكية من آلاف نقاط البيانات والتنبؤ بخصائص سبيكة جديدة. لكن هذه القوة تعتمد بشكل كامل على جودة البيانات ومعرفة أين يمكن الاعتماد على النموذج. في هذه الوحدة، ستتعلم كيفية إنشاء تنبؤ بالميزات يعتمد على التعلم الآلي وكيفية قراءة مخرجاته بشكل نقدي.
إعداد مشكلة التعلم الآلي بشكل صحيح
قبل إلقاء مشكلة التنبؤ بالميزات في تعلم الآلة، قم بتوضيح ثلاثة أشياء:
- الإدخال (السمات): المتغيرات التي سيتم استخدامها في التنبؤ. على سبيل المثال، نسب التركيب (C، Mn، Cr، Ni...) ودرجة حرارة المعالجة الحرارية ووقتها وحجم الحبوب.
- الإخراج (الهدف): الميزة التي سيتم التنبؤ بها. على سبيل المثال، قوة الخضوع، والاستطالة، والصلابة.
- البيانات: جدول أزواج المدخلات والمخرجات. كل صف هو عينة، كل عمود هو سمة أو هدف.
ويتعلم النموذج "وظيفة" من هذه البيانات: فهو يأخذ المدخلات ويتنبأ بالمخرجات. تعد الطرق مثل الانحدار الخطي (المجموع المرجح البسيط) أو الغابة العشوائية أو تعزيز التدرج شائعة. الذكاء الاصطناعي مفيد في اقتراح الطريقة المناسبة، وكتابة التعليمات البرمجية، وتفسير النتيجة؛ لكن عليك التحقق مما إذا كان النموذج صالحًا أم لا.
جودة البيانات: سقف النموذج
لا يمكن لنموذج ML أن يكون أفضل من البيانات التي تم تدريبه عليها. مبدأ "القمامة في، القمامة خارج" قوي جدا في علم المعادن لأن بيانات الاختبار باهظة الثمن ونادرة. احذروا هذه الفخاخ:
- القليل من البيانات: لا يمكنك بناء نماذج معقدة باستخدام 30 عينة؛ النموذج يحفظ البيانات.
- بيانات غير متوازنة: إذا كانت معظم البيانات عبارة عن فولاذ منخفض الكربون، فسيكون التنبؤ ضعيفًا في السبائك عالية الكربون.
- ضوضاء القياس: قد تختلف صلابة نفس العينة باختلاف المشغلين؛ وينعكس هذا الضجيج في النموذج.
- المتغير المفقود: إذا لم تقم بقياس حجم الحبوب، فإن النموذج الذي يحاول التنبؤ بالقوة من خلال التركيب وحده سوف يفتقد سببًا مهمًا.
تنبيه: إن مجرد نجاح النموذج في بيانات التدريب لا يعني أنه سيكون ناجحًا أيضًا في العينات الجديدة. قد يكون هذا أمرًا مفرطًا: لقد حفظ النموذج الضوضاء في بيانات التدريب، وليس العلاقة الحقيقية. يتم قياس النجاح الحقيقي على "بيانات الاختبار" التي لم يسبق للنموذج رؤيتها من قبل.
الاستقراء: الحد الأخطر
تعمل نماذج تعلم الآلة بشكل معقول ضمن النطاق الذي تغطيه بيانات التدريب (الاستيفاء). عندما تكون التنبؤات خارج هذا النطاق (الاستقراء)، تصبح غير موثوقة وغالباً لا يظهر النموذج ذلك؛ يستمر في إنتاج رقم واثق. على سبيل المثال، قد يُظهر النموذج الذي تم تدريبه على الفولاذ الذي يحتوي على محتوى كربون يتراوح بين 0.2 إلى 0.6% قيمته بالنسبة إلى سبيكة تحتوي على 1.2% من الكربون على أنها "آمنة"، ولكن هذه القيمة لا أساس لها من الصحة على الإطلاق. بالنسبة لكل توقع، "هل هذه العينة ضمن توزيع بيانات التدريب؟" من الضروري طرح السؤال.
خطوة بخطوة: بناء تدفق التنبؤ باستخدام الذكاء الاصطناعي
- حدد الهدف والمدخلات: ماذا ستتنبأ ومن أي المتغيرات؟
- تحضير البيانات: تنظيف الوحدات وإصلاحها ووضع علامة على القيم المفقودة. (الذكاء الاصطناعي: يكتب كود بايثون.)
- تقسيم البيانات: افصل بين مجموعات التدريب والاختبار حتى تتمكن من قياس النجاح بدقة.
- تحديد النموذج وتدريبه: ابدأ بشكل بسيط (خطي)، ثم انتقل إلى النموذج القائم على الشجرة إذا لزم الأمر.
- التقييم: انظر إلى مقاييس الخطأ في مجموعة الاختبار (على سبيل المثال، RMSE، R²).
- التعليق: ما هو المتغير الذي مدى فعاليته؟ هل هذا منطقي جسديا؟
- التحقق: اختبار التنبؤ النقدي بالتجربة الفعلية؛ التحقق من الاستقراء.
مفهوم
معنى
لماذا هو مهم في المعادن؟
التجهيز الزائد
نموذج حفظ الضوضاء
إنه سهل للغاية مع القليل من بيانات الاختبار
الاستيفاء
التنبؤ ضمن نطاق التدريب
منطقة آمنة نسبيا
استقراء
التنبؤ خارج نطاق التدريب
غير جدير بالثقة؛ التجربة مطلوبة
ص²
نسبة التباين التي يوضحها النموذج
مؤشر جودة الملاءمة
أهمية الميزة
حجم تأثير المدخلات
التحقق من المعقولية البدنية
ثلاث حالات صغيرة
الحالة 1 - نموذج الحفظ. قام فريق ببناء نموذج معقد يتنبأ بقوة الخضوع باستخدام 45 عينة من الفولاذ؛ تبين أن بيانات التدريب هي R² = 0.99 وابتهجوا. ومع ذلك، في بيانات الاختبار تنخفض إلى R² = 0.42. النموذج مبالغ فيه. وعندما يتحولون إلى نموذج أبسط ويزيدون البيانات، يزيد نجاح الاختبار إلى 0.80. الدرس المستفاد: النجاح التعليمي مضلل؛ يتم اتخاذ القرار باستخدام بيانات الاختبار.
الحالة 2 - فخ الاستقراء. يطبق المهندس نموذجًا تم تدريبه على الفولاذ منخفض السبائك على تركيبة مقاومة للصدأ عالية الكروم. يقول النموذج "حوالي 620 ميجا باسكال". يصل اختبار الشد الفعلي إلى 410 ميجا باسكال. التكوين خارج التوزيع التعليمي تمامًا. الدرس المستفاد: قبل التنبؤ، من الضروري التحقق مما إذا كانت الإدخال ضمن نطاق التدريب.
الحالة 3 - الاستخدام الصحيح. يقوم فريق البحث والتطوير بنمذجة تأثير تخفيف درجة الحرارة على الصلابة من خلال آلاف السجلات في عائلة من السبائك. يستنسخ النموذج الاتجاه الفيزيائي المعروف (تتناقص الصلابة مع زيادة درجة حرارة التخفيف) ويضيق نطاق التركيب الذي سيتم فيه تحقيق الصلابة المستهدفة. يستخدم الفريق النموذج لتقليل عدد التجارب: الوصول إلى الهدف من خلال 8 تجارب بدلاً من 40 والتحقق من صحة كل خطوة بالقياسات. الدرس المستفاد: يعمل تعلم الآلة بذكاء على تضييق نطاق تخطيط التجربة من خلال البيانات الجيدة والفحوصات المادية المعقولة.
قوالب سريعة قابلة للنسخ
قالب إعداد مشكلة ML "الدور: أنت مساعد علوم البيانات المادية. الهدف: [ميزة يمكن التنبؤ بها]. المدخلات: [السمات]. لدي [n] عينات. لهذه المشكلة: (1) اقتراح خيارات نموذجية بسيطة ومتقدمة مناسبة، (2) شرح تقسيم التدريب/الاختبار ومقياس التقييم، (3) تفسير مخاطر التجاوز والاستقراء بناءً على هذه البيانات. لا تعد بنجاح محدد؛ اكتب الحدود بوضوح."
نموذج تدقيق جودة البيانات"تحقق من جودة جدول البيانات التالي: [الصق الأعمدة والصفوف النموذجية]. علامة: القيم المفقودة، والقيم المتطرفة، وعدم اتساق الوحدة، والتوزيع غير المتوازن. لكل مشكلة، اقترح كيفية التعامل معها. قم بإدراج عمليات التحقق التي يجب أن أقوم بها قبل النمذجة."
قالب التحكم في الاستقراء "النطاق الأدنى والأقصى لكل مدخلات في ناتج التدريب الخاص بي هو: [نطاقات الكتابة]. العينة الجديدة التي أريد التنبؤ بها هي: [قيم الكتابة]. هل هذه العينة داخل أو خارج نطاق التدريب في كل سمة؟ إذا كانت خارج نطاق التدريب، اشرح فيها أي المتغيرات ولماذا سيكون التنبؤ غير موثوق. اقترح التحقق من خلال التجربة."
قالب المعقولية الفيزيائية "ترتيب النموذج لأهمية الميزة هو [الفرز]. هل هذا الترتيب يتوافق مع العلاقات المعدنية المعروفة (على سبيل المثال، Hall-Petch، التصلب الراسب، تأثير الكربون)؟ إذا كان هناك تأثير غير متوقع ماديًا، ضع علامة عليه واشرح مشكلة البيانات/النموذج المحتملة."
موجه ضعيف / موجه قوي
مطالبة ضعيفة: "توقع قوة الخضوع بناءً على هذه التركيبة."
مطالبة قوية: "الدور: أنت مساعد علوم بيانات المواد. لدي 800 سطر من بيانات الفولاذ منخفض السبائك (C، Mn، Cr، Ni، درجة حرارة التخفيف -> قوة الإنتاجية). عينة جديدة: C = 0.38، Mn = 0.8، Cr = 1.0، Ni = 0.2، درجة الحرارة = 550 درجة مئوية. تحقق أولاً مما إذا كانت هذه العينة ضمن نطاق التدريب. إذا كان ذلك مناسبًا، اضبط نهج التنبؤ وعدم اليقين اشرح؛ إذا لم يكن مناسبًا، اقترح تجربة للتحقق من المعقولية المادية باستخدام تأثير Hall-Petch ودرجة الحرارة، ولا تعطي قيمة دقيقة واحدة.
تطلب المطالبة القوية إجراء فحص استقراء قبل إجراء التنبؤ، وإزالة عدم اليقين، واختبار النتيجة وفقًا للقوانين الفيزيائية. وهذا يعطي أساس قرار أكثر موثوقية بكثير من الرقم الأولي.
الأخطاء الشائعة
- الخلط بين النجاح التعليمي والنجاح الحقيقي (تخطي الإفراط في التجهيز).
- تقييم النموذج دون القيام بتقسيم التدريب/الاختبار.
- قبول التقدير الناتج في منطقة الاستقراء على أنه آمن.
- بناء نماذج معقدة ببيانات قليلة وغير متوازنة.
- عدم مقارنة أهمية الميزة بالمعقولية المادية.
- وضع تخمين نقدي في التصميم دون التحقق منه من خلال التجربة.
باختصار
يلتقط التعلم الآلي بقوة علاقات التكوين والعملية والملكية باستخدام البيانات الجيدة ويضيق بذكاء تخطيط التجربة. لكن جودة النموذج لا تقل جودة عن بياناته؛ يمكن أن يكون الإنجاز التدريبي مضللاً (مبالغ فيه) والتقديرات خارج نطاق التدريب (الاستقراء) لا يمكن الاعتماد عليها. اختبر كل تنبؤ من خلال نجاح بيانات الاختبار، والتحكم في الاستقراء، والمعقولية المادية، وفي الحالات الحرجة، التجريب الفعلي.
مهمة التطبيق
حدد مشكلة التنبؤ بالخاصية باستخدام مجموعة بيانات مادية موجودة (أو خيالية): اكتب الهدف والمدخلات. اطلب نهجًا من الذكاء الاصطناعي باستخدام قالب "ML PROBLEM FIGURE". ثم حدد "عينة جديدة" وتحقق مما إذا كانت هذه العينة ضمن نطاق التدريب باستخدام قالب "التحقق من الاستقراء". أخيرًا، صف في فقرة التجربة التي ستتحقق من خلالها من مخرجات النموذج.
قائمة مرجعية
- [ ] لقد حددت الهدف والمدخلات بوضوح.
- [ ] لقد قمت بفحص جودة البيانات (المفقود، الخارج، الوحدة، الرصيد).
- [ ] لقد قمت بقياس النجاح الصادق من خلال تقسيم التدريب/الاختبار.
- [ ] لقد قمت بفحص مخاطر الاستقراء لكل تقدير.
- [ ] لقد قارنت أهمية الميزة بالمعقولية المادية.
- [ ] لقد وضعت خطة للتحقق من التنبؤ النقدي من خلال التجربة الفعلية.