ইউনিট 9 / 11

হ্যালুসিনেশন, সাধারণ গাণিতিক ত্রুটি, এবং যাচাইকরণের শৃঙ্খলা

লাভ:

  • কৃত্রিম বুদ্ধিমত্তা কেন গণিতে ভুল করে (একটি ভাষা মডেল হওয়া, যুক্তি পরীক্ষা না করা) এবং সাতটি প্রধান ধরণের ত্রুটি সনাক্ত করতে সক্ষম হন
  • গণিতে ত্রুটি প্রচারিত এবং নির্ভুলতা বাইনারি বোঝার দ্বারা প্রতিটি ধাপ যাচাই করা কেন অপরিহার্য তা ব্যাখ্যা করার ক্ষমতা।
  • সাধারণ জ্ঞান পরীক্ষা, মাত্রা চেকিং, চেকসাম, ক্রস-চেকিং এবং স্বাধীন পদ্ধতির মাধ্যমে একটি বহু-স্তরীয় যাচাইকরণ শৃঙ্খলা প্রয়োগ করার ক্ষমতা

এই ইউনিটটি মডিউলের কেন্দ্রে ধারণাটিকে গভীর করে: কেন এবং কীভাবে AI গণিতে ভুল করে, এই ভুলগুলির ধরন কী এবং কীভাবে আমরা সেগুলিকে পদ্ধতিগতভাবে ধরতে পারি? পূর্ববর্তী ইউনিটগুলিতে, আমরা প্রতিটি বিষয়ের জন্য যাচাইকরণ পদ্ধতি দেখেছি; এখানে আমরা এক ছাদের নীচে ত্রুটির শারীরস্থান সংগ্রহ করি। মোদ্দা কথা হল, যখন আপনি একটি AI আউটপুট দেখেন আপনি ভাবছেন "এখানে কি ভুল হতে পারে?" এটি একটি বৈধতা মানসিকতা অর্জন করা যা প্রতিফলিতভাবে চিন্তা করে।

অনুস্মারক: একটি হ্যালুসিনেশন হল যখন একটি AI আত্মবিশ্বাসের সাথে এমন তথ্য তৈরি করে যা আসলে সত্য নয়। গণিতে, হ্যালুসিনেশন প্রায়ই "প্ররোচিত কিন্তু মিথ্যা" আকারে দেখা যায়। কেন এআই ভুল করে? কারণ এটি একটি ভাষা মডেল, লজিক ইঞ্জিন নয় - অর্থাৎ, এটি পরিসংখ্যানগত নিদর্শন সহ পাঠ্য তৈরি করে, এটি পদক্ষেপগুলির যৌক্তিক বৈধতা পরীক্ষা করে না। একটি "3-সংখ্যার গুণ" এবং একটি "বৈধ প্রমাণ" তার জন্য একই ধরণের পাঠ্য তৈরি করার কাজ; সঠিকতা নিশ্চিত করার জন্য এটির কোন অভ্যন্তরীণ প্রক্রিয়া নেই।

গাণিতিক ত্রুটির অ্যানাটমি: সাত প্রকার

নিম্নলিখিত প্রকারের তালিকাটি AI আউটপুট এবং প্রতিটির জন্য প্রতিষেধকটিতে আপনি যে সবচেয়ে সাধারণ ত্রুটিগুলির মুখোমুখি হবেন তার সংক্ষিপ্ত বিবরণ দেয়।

ত্রুটির ধরন

দেখতে কেমন লাগে

প্রতিষেধক

গাণিতিক ত্রুটি

সংখ্যা ত্রুটি যেমন 7×8=54

ক্যালকুলেটর/সিমপি

সাইন ত্রুটি

−(a−b)=−a−b

ম্যানুয়ালি আমার নাম খুলুন

তৈরি উপপাদ্য

অস্তিত্বহীন তত্ত্বের নাম

উৎস থেকে নিশ্চিতকরণ

নিয়মের অপপ্রয়োগ

চেইন নিয়ম ভুলবেন না

"কোন নিয়ম?" প্রশ্ন

স্ট্যাটাস এড়িয়ে গেছে

নেতিবাচক মূল উপেক্ষা করুন

সব স্ট্যাটাস তালিকা

প্রমাণের ফাঁক

"অতএব" ন্যায্যতা ছাড়াই

প্রতিটি পাস প্রশ্ন করা

পুরানো/ভুল ডেটা

পুরানো তথ্য

সোর্সিং

কেন গণিত বিশেষ মনোযোগ প্রয়োজন?

বেশিরভাগ ক্ষেত্রে, একটি ছোট ভুল একটি ছোট পরিণতি আছে। গণিতে, ত্রুটি ছড়িয়ে পড়ে এবং বৃদ্ধি পায়। একটি সমীকরণের প্রথম লাইনে একটি চিহ্ন ত্রুটি পরবর্তী দশটি লাইন এবং চূড়ান্ত ফলাফল সম্পূর্ণ ভুল করে তোলে। একটি প্রমাণের মাঝখানে একটি ফাঁক পুরো প্রমাণটিকে অবৈধ করে তোলে। এই "ভঙ্গুরতা" গণিতের প্রতিটি ধাপ যাচাই করার জন্য প্রয়োজনীয় করে তোলে - "সাধারণত বলতে গেলে সত্য বলে মনে হয়" যথেষ্ট নয়।

তদুপরি, গণিতে সত্য বাইনারি: একটি ফলাফল হয় সত্য বা মিথ্যা, এর মধ্যে কোনও নেই। একটি টেক্সট সারাংশে "আশি শতাংশ নির্ভুল" গ্রহণযোগ্য বলে বিবেচিত হতে পারে; একটি অবিচ্ছেদ্য মধ্যে "আশি শতাংশ সঠিক" বলে কিছু নেই - হয় এটি সঠিক ফলাফল বা এটি নয়। এই দ্বৈত প্রকৃতি যাচাইকরণকে আরও জটিল এবং (সৌভাগ্যবশত) আরও সম্ভব করে তোলে: ফলাফল হয় যাচাই পাস করে বা তা হয় না।

ধাপে ধাপে: পদ্ধতিগত যাচাইকরণের শৃঙ্খলা

1. একটি টুল দিয়ে প্রতিটি সংখ্যাসূচক ফলাফল নিশ্চিত করুন। AI এর উপর নির্ভর করার জন্য পাটিগণিতকে কখনই ছেড়ে দেবেন না; SymPy, ক্যালকুলেটর বা হাতে।

2. SymPy দিয়ে প্রতিটি প্রতীকী ফলাফল পরীক্ষা করুন। ইন্টিগ্রাল, ডেরিভেটিভ, সরলীকরণ, সমীকরণ—সবই SymPy দিয়ে যাচাই করা যেতে পারে।

3. উৎস থেকে প্রতিটি উপপাদ্য/সূত্র নিশ্চিত করুন। নাম এবং অভিব্যক্তি সঠিক? তৈরি করা উপপাদ্য হল সবচেয়ে কপট ফাঁদ।

4. প্রতিটি প্রমাণে প্রতিটি ঘটনাকে প্রশ্ন করুন। "এটি কি সত্যিই আগের ধাপ থেকে অনুসরণ করে?" বেস কেস, অন্তর্নিহিত অনুমান, ফাঁক চেক।

5. চেক এবং কাউন্টারচেক. বিপরীত অপারেশন, প্রতিস্থাপন, সীমা অবস্থা, মাত্রিক বিশ্লেষণ।

6. সাধারণ জ্ঞান পরীক্ষায় এটি রাখুন। ফলাফল কি যুক্তিসঙ্গত? সম্ভাব্যতা 1-এর বেশি হলে, দৈর্ঘ্য ঋণাত্মক হলে একটি ত্রুটি আছে।

ইঙ্গিত: দ্রুততম সাধারণ জ্ঞান পরীক্ষা হল "অর্ডার অফ ম্যাগনিচুড" চেক। ফলাফল প্রত্যাশিত সীমার মধ্যে মোটামুটি? যদি একটি ক্লাসের গড় 250 হয় (100টির মধ্যে), বা একটি সম্ভাবনা 3.5 হয়, আপনি বিশদ বিবরণ না দেখেই বুঝতে পারবেন একটি ত্রুটি আছে। এই 5-সেকেন্ডের চেকটি কুঁড়িতে অনেক হাস্যকর ফলাফল দূর করে।

তিনটি মিনি কেস

কেস 1 — চেইন সাইন ত্রুটি। একজন শিক্ষার্থী দেখতে পেয়েছেন যে 8-লাইন বীজগণিতিক সরলীকরণে, লাইন 2 এ তৈরি AI একটি চিহ্ন ত্রুটি পরবর্তী 6 লাইনে প্রচারিত হয়েছে। চূড়ান্ত ফলাফল সম্পূর্ণ ভুল ছিল, কিন্তু AI এটি সম্পূর্ণ আত্মবিশ্বাসের সাথে উপস্থাপন করেছে। যখন ছাত্রটি SymPy দিয়ে স্ক্র্যাচ থেকে এটিকে সরলীকৃত করেছিল, তখন সঠিক ফলাফল পাওয়া গিয়েছিল এবং AI-কে 2য় লাইনে ত্রুটি খুঁজে পেতে অনুমতি দেয়। একটি একক চিহ্ন 6 লাইন খণ্ডন করেছে।

কেস 2 - সাধারণ জ্ঞান পরীক্ষা সংরক্ষণ করেছে। একজন শিক্ষকের একটি AI ছিল একটি সম্ভাব্য সমস্যা সমাধান; ফলাফল ছিল 1.4। বিশদ বিবরণ না দেখে, শিক্ষক বলেছিলেন "সম্ভাব্যতা 1 এর বেশি হতে পারে না" এবং ত্রুটিটি সন্ধান করেছিলেন: এআই অ-বিচ্ছিন্ন ঘটনাগুলি সংগ্রহ করেছিল যেন সেগুলি পৃথক ছিল। একটি সাধারণ জ্ঞান পরীক্ষা সেকেন্ডের মধ্যে ত্রুটি চিহ্নিত করেছে।

কেস 3 — তৈরি ফর্মুলা। একজন প্রকৌশলী এআইকে একটি সিরিজ যোগফলের জন্য একটি "বন্ধ সূত্র" চেয়েছিলেন। AI একটি বিশ্বাসযোগ্য সূত্র দিয়েছে। প্রকৌশলী সূত্র এবং হাত যোগ করে n (n=3) এর একটি ছোট মানের জন্য সূত্র পরীক্ষা করেছেন; ফল মেলেনি। ফর্মুলা তৈরি হয়েছিল। একটি সামান্য tweaking অপব্যবহার ঘন্টার প্রতিরোধ.

চারটি অনুলিপিযোগ্য টেমপ্লেট

1) মাল্টি-লেয়ার যাচাইকরণের অনুরোধ:

আপনি খুঁজে পেয়েছেন: [ফলাফল]। এখন এই তিনটি ভিন্ন উপায়ে যাচাই করুন: (1) এটিকে বিপরীতে হ্যাশ করা, (2) একটি সাধারণ কাস্টম মান পরীক্ষা করা, (3) SymPy দিয়ে চেক করার জন্য কিছু কোড (আমি আউটপুটটি দেখব)। আমাকে বলুন যদি তিনটি উপায়ই সামঞ্জস্যপূর্ণ হয়; যদি না হয়, কোন ধাপে ত্রুটি আছে তা দেখান।

2) সাধারণ জ্ঞান/র্যাঙ্ক পরীক্ষা:

আপনি খুঁজে পেয়েছেন: [ফলাফল]। এই ফলাফলটি যুক্তিসঙ্গত কিনা তা দেখতে সাধারণ জ্ঞানের পরীক্ষায় রাখুন: প্রত্যাশিত মাত্রার ক্রম কী, চিহ্নটি কি সঠিক, এটি কি সীমার মধ্যে (যেমন সম্ভাব্যতা 0-1)? যদি এটি যুক্তিসঙ্গত না হয় তবে কোথায় ভুল হতে পারে তা অনুসন্ধান করুন।

3) উপপাদ্য/সূত্র নিশ্চিতকরণ:

আপনি যে [তত্ত্ব/সূত্র] ব্যবহার করছেন তা কি সত্যিই আদর্শ এবং সঠিক? এর প্রমিত অভিব্যক্তি ও শর্তাবলী লিখ। একটি ছোট নমুনা দিয়ে এটি পরীক্ষা করে এমন একটি অ্যাকাউন্ট দেখান (যেমন n=3)। যদি এটি একটি তৈরি ফর্মুলা বা এমন কিছু যা সম্পর্কে আপনি নিশ্চিত না হন তবে এটি পরিষ্কারভাবে বলুন।

4) ত্রুটি মোড নির্ণয়:

আমি জানি নীচের সমাধানে একটি বাগ আছে। এই ত্রুটির ধরনগুলি একে একে পরীক্ষা করুন: পাটিগণিত, চিহ্ন, ভুল নিয়ম, এড়িয়ে যাওয়া অবস্থা, ডোমেন। এটা কি ধরনের ত্রুটি এবং কোন ধাপে আমাকে বলুন। সমাধান: [এখানে]

দুর্বল প্রম্পট / শক্তিশালী প্রম্পট

দুর্বল: "এই উপসংহারটি কি সঠিক?" [ফলাফল পেস্ট করুন]
ফলাফল: AI প্রায়ই বলে "হ্যাঁ ঠিক" (নিজের আউটপুট নিশ্চিত করার প্রবণতা); অবিশ্বস্ত কারণ কোন স্বাধীন নিরীক্ষা নেই।
শক্তিশালী: "এই ফলাফলটি একটি স্বাধীন উপায়ে পরীক্ষা করুন: একটি ভিন্ন সমাধান ব্যবহার করুন বা SymPy কোডটি দিয়ে পরীক্ষা করুন (আমি কোডটি চালাব)। শুধু 'সত্য/মিথ্যা' বলবেন না; আপনি কোন পরীক্ষাটি করেছেন এবং ফলাফলটি দেখান। চেকসাম ব্যর্থ হলে ত্রুটিটি খুঁজুন।"
ফলাফল: একটি স্বাধীন নিয়ন্ত্রণ পদ্ধতি চ্যালেঞ্জ করা হয়; এআইকে তার নিজস্ব আউটপুট অন্ধভাবে অনুমোদন করা থেকে বাধা দেওয়া হয়।

সাধারণ ভুল

  • AI এর নিজস্ব আউটপুট যাচাই করা। "এটা কি সত্যি?" AI প্রায়ই তার নিজের ভুল নিশ্চিত করে; স্বাধীন পদ্ধতি প্রয়োজন।
  • সাধারণ জ্ঞানের পরীক্ষা এড়িয়ে যাওয়া। 1 এর বেশি সম্ভাব্যতা এবং দৈর্ঘ্য নেতিবাচক হওয়ার মতো আজেবাজে কথাগুলি বিস্তারিত না দেখে ধরা যেতে পারে।
  • একটি একক যাচাইকরণের উপর নির্ভর করা। গুরুত্বপূর্ণ ফলাফলে একাধিক স্বাধীন পাথ (হ্যাশ + SymPy + কাস্টম মান) ব্যবহার করুন।
  • ছোট নমুনা দিয়ে সূত্র পরীক্ষা না. n=2, n=3-এর মতো ছোট মানগুলিতে তৈরি করা সূত্রগুলি অবিলম্বে ভেঙে পড়ে।
  • ভুলে যে বাগ প্রচার করা হয়। প্রথম লাইনে একটি ত্রুটি সমগ্র ফলাফলকে দূষিত করে; আপনি যদি একটি ত্রুটি খুঁজে পান, শুরু থেকে এটি পরীক্ষা করুন.
সতর্কতা: AI এর আত্মবিশ্বাস এবং এর নির্ভুলতার মধ্যে কোনো সম্পর্ক নেই। যে বাক্যটি সবচেয়ে নির্ধারিত, সবচেয়ে সাবলীল, সবচেয়ে "নিশ্চিত" বলে মনে হয় তা সম্পূর্ণ ভুল হতে পারে। টোন নয়, স্বাধীন যাচাইকরণে বিশ্বাস করুন। শুধুমাত্র একটি ফলাফলকে "সত্য" বিবেচনা করুন যখন আপনি এটি হাতে বা একটি নির্ধারক টুল দিয়ে নিশ্চিত করুন - কারণ এআই "নিশ্চিত" বলে নয়।

সংক্ষেপে

AI গণিতে ভুল করে কারণ এটি একটি ভাষা মডেল যা পরিসংখ্যানগতভাবে পাঠ্য তৈরি করে, যুক্তি নিয়ন্ত্রণ করে এমন একটি ইঞ্জিন নয়। ত্রুটিগুলি সাতটি প্রধান প্রকারের মধ্যে পড়ে: পাটিগণিত, চিহ্ন, তৈরি উপপাদ্য, নিয়মের ভুল প্রয়োগ, বাদ দেওয়া কেস, প্রমাণ ফাঁক, বাসি ডেটা। গণিতে, ত্রুটি ছড়িয়ে পড়ে এবং বৃদ্ধি পায়, সত্য বাইনারি - তাই প্রতিটি পদক্ষেপ অবশ্যই যাচাই করা উচিত। পদ্ধতিগত শৃঙ্খলা: প্রতিটি সংখ্যাসূচক সরঞ্জাম, SymPy দিয়ে প্রতিটি প্রতীকী ফলাফল, উত্স থেকে প্রতিটি উপপাদ্য, প্রতিটি প্রমাণ প্রশ্ন করে যাচাই করুন; চেক, পাল্টা-চেক এবং সাধারণ জ্ঞান পরীক্ষা প্রয়োগ করুন। AI এর আত্মবিশ্বাস সঠিকতার প্রমাণ নয়।

আবেদন টাস্ক

মাঝারি দৈর্ঘ্যের (অন্তত 6-8 ধাপ) একটি সমাধান সহ একটি সমস্যা চয়ন করুন এবং AI এর সমাধান করুন৷ তারপর এই ইউনিট থেকে প্যাটার্ন 1 এবং 4 ব্যবহার করে বহু-স্তর যাচাই করুন: (a) সাধারণ জ্ঞান/র্যাঙ্ক পরীক্ষা, (b) SymPy দিয়ে পরীক্ষা করা, (c) একটি বিশেষ মান পরীক্ষা করা। তারপরে একটি ইচ্ছাকৃত "বাগ হান্ট" চোখ দিয়ে সমাধান লাইনের মধ্য দিয়ে যান এবং সাত ধরণের ত্রুটির মধ্যে কোনটি ঘটতে পারে তা পরীক্ষা করুন। আপনি খুঁজে পাওয়া প্রতিটি ত্রুটির ধরন সহ রেকর্ড করুন।

চেকলিস্ট

  • [ ] আমি একটি নির্ধারক টুল দিয়ে প্রতিটি সংখ্যাসূচক ফলাফল নিশ্চিত করেছি।
  • [ ] আমি SymPy দিয়ে প্রতিটি প্রতীকী ফলাফল পরীক্ষা করেছি।
  • [ ] আমি উৎস থেকে বা ছোট উদাহরণ দিয়ে ব্যবহৃত উপপাদ্য/সূত্র যাচাই করেছি।
  • আমি ম্যাগনিচুড পরীক্ষার সাধারণ জ্ঞান/ক্রম প্রয়োগ করেছি।
  • [ ] আমি এটি একটি স্বাধীন পদ্ধতিতে অডিট করেছি (AI এর নিজস্ব অনুমোদনের উপর নির্ভর না করে)।
  • যখন আমি একটি ত্রুটি খুঁজে পেয়েছি, আমি শুরু থেকে সমাধানটি পুনরায় পরীক্ষা করেছি।