وحدة 9 / 11

الهلوسة والأخطاء الرياضية الشائعة ونظام التحقق

المكاسب:

  • أن تكون قادرًا على التعرف على سبب ارتكاب الذكاء الاصطناعي للأخطاء في الرياضيات (كونه نموذجًا للغة، وليس التحقق من المنطق) والأنواع السبعة الرئيسية للأخطاء
  • القدرة على شرح سبب ضرورة التحقق من كل خطوة من خلال فهم أن الخطأ منتشر وأن الدقة أمر ثنائي في الرياضيات.
  • القدرة على تطبيق نظام تحقق متعدد الطبقات من خلال اختبار المنطق السليم، والتحقق من ترتيب الحجم، والمجاميع الاختبارية، والتحقق المتبادل والأساليب المستقلة

تعمل هذه الوحدة على تعميق الفكرة الموجودة في قلب الوحدة: لماذا وكيف يرتكب الذكاء الاصطناعي أخطاء في الرياضيات، وما هي أنواع هذه الأخطاء وكيف نكتشفها بشكل منهجي؟ لقد رأينا في الوحدات السابقة طرق التحقق لكل موضوع؛ هنا نجمع تشريح الأخطاء تحت سقف واحد. النقطة المهمة هي أنه عندما تنظر إلى مخرجات الذكاء الاصطناعي فإنك تتساءل "ما الخطأ الذي يمكن أن يكون هنا؟" إنه اكتساب عقلية التحقق التي تفكر بشكل انعكاسي.

تذكير: الهلوسة هي عندما ينتج الذكاء الاصطناعي بثقة معلومات غير صحيحة في الواقع. في الرياضيات، غالبًا ما تظهر الهلوسة في صورة "مقنعة ولكنها كاذبة". لماذا يرتكب الذكاء الاصطناعي الأخطاء؟ لأنه نموذج لغة، وليس محركًا منطقيًا - أي أنه ينتج نصًا بأنماط إحصائية، ولا يتحقق من الصحة المنطقية للخطوات. "الضرب المكون من ثلاثة أرقام" و"الدليل الصالح" بالنسبة له هو مهمة إنتاج نفس النوع من النص؛ ليس لديها آلية داخلية لضمان الدقة.

تشريح الأخطاء الرياضية: سبعة أنواع

تلخص قائمة الأنواع التالية الأخطاء الأكثر شيوعًا التي ستواجهها في إخراج الذكاء الاصطناعي والترياق لكل منها.

نوع الخطأ

كيف تبدو

ترياق

خطأ حسابي

خطأ في الرقم مثل 7×8=54

الحاسبة/SymPy

خطأ في التوقيع

−(أ−ب)=−أ−ب

افتح اسمي يدويا

نظرية مختلقة

اسم نظرية غير موجود

التأكيد من المصدر

سوء تطبيق القاعدة

لا تنسى قاعدة السلسلة

"أي قاعدة؟" سؤال

تم تخطي الحالة

تجاهل الجذر السلبي

قائمة كافة الحالات

فجوة الإثبات

"لذلك" دون مبرر

استجواب كل تمريرة

بيانات قديمة/غير صحيحة

معلومات قديمة

مصادر

لماذا تتطلب الرياضيات اهتماما خاصا؟

في معظم المجالات، الخطأ الصغير له عواقب صغيرة. في الرياضيات، الخطأ ينتشر وينمو. خطأ في الإشارة في السطر الأول من المعادلة يجعل الأسطر العشرة التالية والنتيجة النهائية خاطئة تمامًا. وجود فجوة في منتصف الدليل يجعل الدليل بأكمله غير صالح. هذه "الهشاشة" تجعل من الضروري التحقق من كل خطوة في الرياضيات - "بشكل عام يبدو صحيحًا" ليس كافيًا.

علاوة على ذلك، الحقيقة في الرياضيات ثنائية: النتيجة إما أن تكون صحيحة أو خاطئة، ولا يوجد بينهما. "دقيقة ثمانين بالمائة" قد تعتبر مقبولة في ملخص النص؛ لا يوجد شيء اسمه "صحيح ثمانين بالمائة" في التكامل، فإما أن تكون النتيجة صحيحة أو لا تكون كذلك. هذه الطبيعة المزدوجة تجعل التحقق أكثر أهمية و(لحسن الحظ) أكثر إمكانية: فالنتيجة إما أن تنجح في التحقق أو لا.

خطوة بخطوة: انضباط التحقق المنهجي

1. قم بتأكيد كل نتيجة رقمية باستخدام أداة. لا تترك الحساب أبدًا للاعتماد على الذكاء الاصطناعي؛ SymPy، آلة حاسبة أو باليد.

2. تحقق من كل نتيجة رمزية باستخدام SymPy. التكامل، المشتق، التبسيط، المعادلة - يمكن التحقق من كل ذلك باستخدام SymPy.

3. قم بتأكيد كل نظرية/صيغة من المصدر. هل الاسم والتعبير صحيحان؟ النظريات المختلقة هي الفخ الأكثر غدرا.

4. التشكيك في كل حدث في كل برهان. "هل هذا يتبع حقًا الخطوة السابقة؟" الحالة الأساسية، الافتراض الضمني، التحقق من الفجوة.

5. التحقق والتحقق المضاد. العملية العكسية، الاستبدال، الحالات الحدية، التحليل البعدي.

6. ضعه على المحك السليم. هل النتيجة معقولة؟ إذا كان الاحتمال أكبر من 1، فهناك خطأ إذا كان الطول سالبًا.

تلميح: أسرع اختبار للحس السليم هو التحقق من "ترتيب الحجم". هل النتيجة تقريبًا ضمن النطاق المتوقع؟ إذا كان متوسط ​​الفصل 250 (من 100)، أو كان الاحتمال 3.5، فستعرف أن هناك خطأ دون النظر إلى التفاصيل. يؤدي هذا الفحص الذي يستغرق 5 ثوانٍ إلى التخلص من العديد من النتائج السخيفة في مهدها.

ثلاث حالات صغيرة

الحالة 1 - خطأ في إشارة السلسلة. وجد أحد الطلاب أنه في عملية تبسيط جبري مكونة من 8 أسطر، انتشر خطأ الإشارة الذي ارتكبه الذكاء الاصطناعي في السطر 2 إلى الأسطر الستة التالية. وكانت النتيجة النهائية خاطئة تمامًا، لكن الذكاء الاصطناعي قدمها بثقة تامة. وعندما قام الطالب بتبسيط الأمر من الصفر باستخدام SymPy، تم الحصول على النتيجة الصحيحة وسمح للذكاء الاصطناعي بالعثور على الخطأ في السطر الثاني. علامة واحدة تدحض 6 أسطر.

الحالة الثانية - الفطرة السليمة أنقذت الاختبار. استخدم أحد المعلمين الذكاء الاصطناعي لحل مسألة احتمالية؛ وكانت النتيجة 1.4. دون النظر إلى التفاصيل، قال المعلم "لا يمكن أن يكون الاحتمال أكبر من 1" وبحث عن الخطأ: لقد جمع الذكاء الاصطناعي أحداثًا غير منفصلة كما لو كانت منفصلة. وأشار اختبار الفطرة السليمة إلى الخطأ في غضون ثوان.

الحالة 3 - صيغة مختلقة. طلب أحد المهندسين من الذكاء الاصطناعي "صيغة مغلقة" لمجموع متسلسل. لقد أعطى الذكاء الاصطناعي صيغة مقنعة. اختبر المهندس الصيغة للحصول على قيمة صغيرة n (n=3) سواء من خلال الصيغة أو الجمع اليدوي؛ النتائج لم تتطابق. تم تكوين الصيغة. القليل من التغيير والتبديل حال دون ساعات من سوء الاستخدام.

أربعة قوالب قابلة للنسخ

1) طلب التحقق متعدد الطبقات:

لقد وجدت: [النتيجة]. تحقق الآن من ذلك بثلاث طرق مختلفة: (1) التجزئة في الاتجاه المعاكس، (2) اختبار قيمة مخصصة بسيطة، (3) بعض التعليمات البرمجية للتحقق من SymPy (سأرى النتيجة). أخبرني إذا كانت الطرق الثلاث متسقة؛ إذا لم يكن الأمر كذلك، قم بإظهار الخطوة التي بها خطأ.

2) اختبار الحس السليم/الرتبة:

لقد وجدت: [النتيجة]. ضعها في اختبار المنطق السليم لمعرفة ما إذا كانت هذه النتيجة معقولة: ما هو الترتيب المتوقع للحجم، هل الإشارة صحيحة، هل هي ضمن الحدود (على سبيل المثال، الاحتمال 0-1)؟ إذا لم يكن الأمر معقولًا، فتحقق من المكان الذي قد يكون فيه خطأ.

3) تأكيد النظرية/الصيغة:

هل [النظرية/الصيغة] التي تستخدمها قياسية وصحيحة حقًا؟ اكتب عباراتها القياسية وشروطها. اعرض الحساب الذي يختبر ذلك باستخدام عينة صغيرة (على سبيل المثال، n=3). إذا كانت صيغة مختلقة أو شيئًا لست متأكدًا منه، فقلها بوضوح.

4) تشخيص وضع الخطأ:

أعلم أن هناك خطأ في الحل أدناه. تحقق من أنواع الأخطاء هذه واحدًا تلو الآخر: الحساب، الإشارة، القاعدة الخاطئة، الشرط الذي تم تخطيه، المجال. أخبرني ما هو نوع الخطأ وفي أي خطوة. الحل: [هنا]

موجه ضعيف / موجه قوي

ضعيف: "هل هذا الاستنتاج صحيح؟" [لصق النتيجة]
النتيجة: غالبًا ما يقول الذكاء الاصطناعي "نعم صحيح" (الميل إلى تأكيد نتائجه الخاصة)؛ لا يمكن الاعتماد عليها لأنه لا يوجد تدقيق مستقل.
Strong: "تحقق من هذه النتيجة بطريقة مستقلة: استخدم حلاً بديلاً مختلفًا أو تحقق من كود SymPy (سأقوم بتشغيل الكود). لا تقل "صحيح/خطأ" فقط؛ بل اعرض الفحص الذي قمت به والنتيجة. إذا فشل المجموع الاختباري، فابحث عن الخطأ."
النتيجة: تم تحدي طريقة التحكم المستقلة؛ يُمنع الذكاء الاصطناعي من الموافقة بشكل أعمى على مخرجاته.

الأخطاء الشائعة

  • الحصول على الذكاء الاصطناعي للتحقق من صحة مخرجاته. "هل هذا صحيح؟" غالبًا ما يؤكد الذكاء الاصطناعي خطأه؛ مطلوب طريقة مستقلة.
  • تخطي اختبار الحس السليم. يمكن اكتشاف الهراء مثل الاحتمال الأكبر من 1 والطول سالب دون النظر إلى التفاصيل.
  • الاعتماد على التحقق واحد. استخدم مسارات مستقلة متعددة (التجزئة + SymPy + القيمة المخصصة) في النتائج الهامة.
  • عدم اختبار الصيغ بعينات صغيرة. تنهار الصيغ المعدة فورًا عند قيم صغيرة مثل n=2، n=3.
  • متناسين أن الخلل منتشر. خطأ في السطر الأول يفسد النتيجة بأكملها؛ إذا وجدت خطأ، فتحقق منه من البداية.
تحذير: لا توجد علاقة بين ثقة الذكاء الاصطناعي ودقته. الجملة التي تبدو الأكثر تحديدًا، والأكثر طلاقة، والأكثر "تأكيدًا" قد تكون خاطئة تمامًا. ثق في التحقق المستقل، وليس في اللهجة. لا تعتبر النتيجة "صحيحة" إلا عندما تؤكدها يدويًا أو باستخدام أداة حتمية، وليس لأن الذكاء الاصطناعي يقول "بالتأكيد".

باختصار

الذكاء الاصطناعي يخطئ في الرياضيات لأنه نموذج لغوي ينتج النص إحصائيا، وليس محركا يتحكم في المنطق. تنقسم الأخطاء إلى سبعة أنواع رئيسية: الحساب، الإشارة، النظرية المختلقة، سوء تطبيق القاعدة، الحالة المحذوفة، فجوة الإثبات، البيانات القديمة. في الرياضيات، ينتشر الخطأ وينمو، والحقيقة ثنائية، لذا يجب التحقق من كل خطوة. الانضباط المنهجي: التحقق من كل أداة رقمية، وكل نتيجة رمزية باستخدام SymPy، وكل نظرية من المصدر، وكل برهان يمر عبر الاستجواب؛ تطبيق الفحص والفحص المضاد واختبار المنطق السليم. إن ثقة الذكاء الاصطناعي ليست دليلاً على الدقة.

مهمة التطبيق

اختر مشكلة ذات حل متوسط ​​الطول (6-8 خطوات على الأقل) واطلب من الذكاء الاصطناعي حلها. ثم قم بإجراء التحقق متعدد الطبقات باستخدام النموذجين 1 و4 من هذه الوحدة: (أ) اختبار المنطق/التصنيف، (ب) التحقق باستخدام SymPy، (ج) الاختبار على قيمة خاصة. ثم انتقل إلى الحل سطرًا تلو الآخر من خلال "مطاردة الأخطاء" المتعمدة وتحقق من أي من أنواع الأخطاء السبعة التي قد تحدث. سجل كل خطأ تجده مع نوعه.

قائمة مرجعية

  • [ ] لقد قمت بتأكيد كل نتيجة عددية باستخدام أداة حتمية.
  • [ ] لقد قمت بفحص كل نتيجة رمزية باستخدام SymPy.
  • [ ] لقد تحققت من النظرية/الصيغة المستخدمة من المصدر أو بمثال صغير.
  • [ ] لقد قمت بتطبيق اختبار المنطق السليم/ترتيب الحجم.
  • [ ] لقد قمت بتدقيقها بطريقة مستقلة (دون الاعتماد على موافقة الذكاء الاصطناعي الخاصة).
  • [ ] عندما وجدت خطأ، قمت بإعادة التحقق من الحل من البداية.