ইউনিট
1. ইতিহাস এবং সংরক্ষণাগারে কৃত্রিম বুদ্ধিমত্তার ভূমিকা: ভূমিকা, সীমানা, বৈধতা এবং নীতিশাস্ত্র 2. ডকুমেন্ট ডিজিটাইজেশন এবং ওসিআর: প্রিন্টেড টেক্সটকে মেশিন টেক্সটে কনভার্ট করা 3. প্রতিলিপি: অটোমান তুর্কি এবং পাণ্ডুলিপি 4. মেটাডেটা, ক্যাটালগিং এবং শ্রেণীবিভাগ 5. উৎস স্ক্যানিং, আবিষ্কার এবং সংক্ষিপ্তকরণ 6. ঐতিহাসিক অনুবাদ এবং সরলীকরণ 7. উত্স যাচাইকরণ, অ্যানাক্রোনিজম এবং হ্যালুসিনেশন 8. বিষয়বস্তু বিশ্লেষণ এবং প্যাটার্ন আবিষ্কার 9. সংরক্ষণাগার অ্যাক্সেস, বিবরণ এবং ব্যবহারকারী পরিষেবা 10. সংরক্ষণ, পুনরুদ্ধার এবং ডিজিটাল সংরক্ষণ 11. নীতিশাস্ত্র, কপিরাইট, গোপনীয়তা এবং সাংস্কৃতিক সংবেদনশীলতা 12. এন্ড-টু-এন্ড প্রজেক্ট: আর্টিফিশিয়াল ইন্টেলিজেন্স সহ একটি আর্কাইভ সংগ্রহ প্রক্রিয়াকরণ
ইউনিট 8 / 12

বিষয়বস্তু বিশ্লেষণ এবং প্যাটার্ন আবিষ্কার

লাভ:

  • NER, সম্পর্ক নিষ্কাশন, টাইমলাইন এবং নেটওয়ার্ক বিশ্লেষণের মতো কৌশলগুলি ব্যবহার করে পাঠ্যের বড় সেট থেকে নিদর্শন বের করার ক্ষমতা
  • প্যাটার্নটিকে প্রমাণের পরিবর্তে একটি অনুমান হিসাবে দেখতে সক্ষম হওয়া, সত্তাকে উত্সের সাথে সংযুক্ত করা এবং মানুষের অনুমোদনের সাথে তাদের স্বাভাবিক করা
  • অনুপস্থিত ডেটা এবং স্যাম্পলিং পক্ষপাতের কারণে সংখ্যাগুলি কীভাবে বিভ্রান্তিকর হতে পারে তা বোঝার ক্ষমতা এবং অনুপস্থিত সম্পর্ক এবং কালানুক্রম এড়াতে।

ঐতিহাসিক গবেষণা শুধুমাত্র ব্যক্তিগত দলিল পড়া নয়; প্রায়ই নথির বড় সেটে নিদর্শন খুঁজছেন। কোন প্রেক্ষাপটে একটি নির্দিষ্ট নাম বছরের পর বছর ধরে প্রদর্শিত হয়? কোন জনগণ একটি বন্দোবস্তের সাথে যুক্ত? কিভাবে একটি বিষয় সময়ের সাথে পরিবর্তিত হয়? কে কার সাথে চিঠিপত্র করছে? এই ধরনের প্রশ্নগুলির জন্য একটি একক নথি নয়, শত শত নথি সমষ্টিগতভাবে দেখার প্রয়োজন। এটাকে প্রায়ই ডিজিটাল মানবিক বলা হয়—ইতিহাস এবং সাহিত্যের মতো ক্ষেত্রে গণনামূলক পদ্ধতির প্রয়োগ।

টেক্সটের বড় সেট থেকে কাঠামোগত তথ্য বের করতে AI শক্তিশালী। এই ইউনিটে, আপনি NER (নামকৃত সত্তা স্বীকৃতি), প্যাটার্ন এবং সম্পর্ক নিষ্কাশন, বিষয় মডেলিং যুক্তি এবং সময়রেখা তৈরি শিখবেন; কিন্তু আমরা এই কৌশলগুলির সবচেয়ে বিপজ্জনক ক্ষতি নিয়েও আলোচনা করব—এআই নিজেকে উপস্থাপন করে এমন একটি প্যাটার্ন যেটির অস্তিত্ব নেই।

মৌলিক কৌশল

  • NER (নামযুক্ত সত্তা স্বীকৃতি): পাঠ্য থেকে ব্যক্তি, স্থান, প্রতিষ্ঠান, তারিখের মতো সত্তার স্বয়ংক্রিয় নিষ্কাশন। এটি মিনিটের মধ্যে "এই 500 নথিতে উল্লেখিত সমস্ত স্থানের নাম" এর মতো একটি তালিকা তৈরি করে।
  • সম্পর্কের অনুমান: সত্তার মধ্যে সম্পর্ক চিহ্নিত করা ("Y স্থানে ব্যক্তি X", "A B-এর সাথে মিলে যায়")।
  • বিষয় মডেলিং: পরিসংখ্যানগতভাবে পাঠ্যের একটি বড় সেটে পুনরাবৃত্ত বিষয়গুলির ক্লাস্টারগুলি সন্ধান করা। এটি দেখায় কোন থিমগুলি কোন সময়কালে কেন্দ্রীভূত।
  • টাইমলাইন অনুমান: নথিতে তারিখের ঘটনাগুলিকে একটি কালানুক্রমিক ক্রমে সাজানো।
  • নেটওয়ার্ক বিশ্লেষণ: একটি নেটওয়ার্ক হিসাবে আন্তঃব্যক্তি/প্রাতিষ্ঠানিক সম্পর্ককে ভিজ্যুয়ালাইজ করা (কে কেন্দ্র, কে সংযোগ বিন্দু)।

এই সবগুলির সাধারণ লক্ষ্য হল এমন কাঠামো প্রকাশ করা যা একক নথিতে প্রদর্শিত হয় না কিন্তু সমগ্র সংগ্রহ জুড়ে প্রদর্শিত হয়। এই কৌশলগুলি দৃশ্যমান নিদর্শন তৈরি করে যা একা পড়ার মাধ্যমে কখনই দৃশ্যমান হবে না। কিন্তু তাদের প্রত্যেকটি একটি "চিহ্ন" নয়, একটি "প্রমাণ" নয়; আসল নথিতে কী পাওয়া যায় তা যাচাই করা অপরিহার্য।

এই ক্ষেত্রে প্রায়শই ব্যবহৃত একটি ধারণা হল ঘনিষ্ঠ পাঠ (গভীরভাবে একটি পাঠ্য, লাইন দ্বারা লাইন পড়া) এবং দূরবর্তী পাঠ (সম্মিলিতভাবে, পরিসংখ্যানগতভাবে শত/হাজার পাঠ্যের দিকে তাকানো) এর মধ্যে পার্থক্য। AI দূরবর্তীভাবে পড়া সম্ভব করে: আপনি একটি কার্পাসের মধ্যে নিদর্শন দেখতে পাচ্ছেন যা একজন মানুষের জীবনকাল স্থায়ী হতে পারে। কিন্তু যখন দূরবর্তী পঠন একটি প্যাটার্নের দিকে নির্দেশ করে, তখন এটিকে বোঝার জন্য ক্লোজ রিডিং, অর্থাৎ মূল নথিতে ফিরে আসা প্রয়োজন। দুটি পদ্ধতি বিনিময়যোগ্য নয়; একটি প্যাটার্ন দেখায়, অন্যটি তার অর্থ দেয়। সবচেয়ে শক্তিশালী গবেষণা উভয় একসাথে ব্যবহার করে।

টিপ: একটি হাইপোথিসিস জেনারেটর হিসাবে প্যাটার্ন বিশ্লেষণ ব্যবহার করুন: "এআই এখানে একটি প্যাটার্ন দেখেছে, এটি কি বাস্তব?" তারপর একের পর এক নথিতে সেই প্যাটার্নটি পরীক্ষা করুন। প্যাটার্ন হল আপনার গবেষণার সূচনা বিন্দু, ফলাফল নয়।

কর্মপ্রবাহ: ধাপে ধাপে

1. প্রশ্নটি পরিষ্কার করুন। "এই সংগ্রহে কোন ব্যক্তিরা প্রায়শই একসাথে উপস্থিত হয়?" একটি পরিষ্কার প্যাটার্ন প্রশ্ন মত.

2. ডেটা প্রস্তুত এবং লেবেল করুন। উত্স রেফারেন্স সহ পাঠ্য সংগঠিত করুন যাতে পাওয়া যেকোন সম্পদ নথিতে আবার লিঙ্ক করা যায়।

3. সত্তা/প্যাটার্ন প্রদর্শিত হয়। AI এর সাথে NER, সম্পর্ক বা টাইমলাইন রূপরেখা তৈরি করুন।

4. স্বাভাবিককরণ। একই ব্যক্তি/স্থানের বিভিন্ন বানান একত্রিত করুন (“ইস্তানবুল/ইস্তানবুল/কোস্টান্টিনিয়” একই স্থান?) এই পদক্ষেপ সমালোচনামূলক; যদি এটি বাদ দেওয়া হয়, তাহলে প্যাটার্নটি আলাদা হয়ে যাবে।

5. নথিতে যাচাই করুন। পতাকাঙ্কিত কোনো উল্লেখযোগ্য নিদর্শনগুলির জন্য প্রকৃত নথি পরীক্ষা করুন। নিশ্চিত করুন যে AI একটি তৈরি করা লিঙ্ক যোগ করে না।

6. মন্তব্য। প্যাটার্ন মানে কি ঐতিহাসিকের রায়; AI শুধু প্যাটার্ন চিহ্নিত করে।

সংখ্যা এবং পরিসংখ্যান ফাঁদ

প্যাটার্ন বিশ্লেষণ প্রায়শই সংখ্যা তৈরি করে: "এক্স নামটি 47 বার আসে", "এই থিমটি 30% নথিতে উপস্থিত থাকে"। এই সংখ্যাগুলি উদ্দেশ্যমূলক বলে মনে হয় কিন্তু বিভ্রান্তিকর হতে পারে:

  • অনুপস্থিত ডেটা: সংগ্রহটি ইতিমধ্যেই অসম্পূর্ণ থাকলে (দস্তাবেজগুলি হারিয়ে গেছে, একটি গোষ্ঠী কখনও রেকর্ড করা হয়নি), সংখ্যাটি বেঁচে থাকা নথিগুলিকে প্রতিফলিত করে, বাস্তবতা নয়।
  • স্বাভাবিককরণ ত্রুটি: একই ব্যক্তির বানান ভিন্নভাবে এবং পৃথকভাবে গণনা করা হলে, সংখ্যাটি ভুল হবে।
  • প্রসঙ্গ হারানো: "47 বার ঘটে" কিছু বলে না; এটি কীভাবে পাস করা হয় (ইতিবাচক/নেতিবাচক, বিষয়/বস্তু) তা গুরুত্বপূর্ণ।

প্যাটার্ন আউটপুট

আপাত অর্থ

বাস্তব ঝুঁকি

"X 47 বার ঘটে"

গুরুত্বপূর্ণ ব্যক্তি

অসম্পূর্ণ সংগ্রহ, বানানের ভিন্নতা

"থিম 30%"

প্রভাবশালী বিষয়

স্যাম্পলিং পক্ষপাত

"A-B প্রায়ই একসাথে"

অন্তরঙ্গ সম্পর্ক

কাকতালীয়, অনুপস্থিত প্রসঙ্গ

"টাইমলাইন"

সঠিক কালানুক্রম

তারিখবিহীন নথি, বানোয়াট আদেশ

তিনটি মিনি কেস

কেস 1 — নেটওয়ার্ক বিশ্লেষণ একটি লুকানো মধ্যস্থতাকারীকে প্রকাশ করেছে। একজন গবেষক 800টি চিঠির চিঠিপত্র সংগ্রহ পরীক্ষা করেছেন। AI দিয়ে, কে কাকে লিখবে তা নির্ধারণ করা হয়েছিল এবং একটি নেটওয়ার্ক তৈরি করা হয়েছিল। নেটওয়ার্কটি দেখায় যে প্রথম নজরে একজন আপাতদৃষ্টিতে তুচ্ছ ব্যক্তি আসলে দুটি গ্রুপের মধ্যে যোগাযোগের মূল বিন্দু। গবেষক এই ব্যক্তির চিঠির উপর দৃষ্টি নিবদ্ধ করেছেন এবং একটি নতুন অনুসন্ধানে পৌঁছেছেন। কিন্তু প্রথমে ডকুমেন্টের সমস্ত লিঙ্ক যাচাই করে নিলাম।

কেস 2 - সাধারণীকরণ ত্রুটি নম্বরটিকে দূষিত করেছে। একজন ছাত্র তাদের নথিতে একটি স্থান কতবার উপস্থিত হয়েছে তা গণনা করতে বাধ্য করেছে। যেহেতু AI একই স্থানের তিনটি ভিন্ন বানান আলাদাভাবে গণনা করেছে, তাই সংখ্যাটি আসল সংখ্যার এক তৃতীয়াংশে পরিণত হয়েছে। যখন বানানগুলি একত্রিত হয়েছিল, স্থানটি আসলে তৃতীয় সর্বাধিক ঘন ঘন ঘটতে থাকা অবস্থানে ছিল। পাঠ: স্বাভাবিকীকরণ ছাড়া নম্বরটি বিশ্বাস করা যায় না।

কেস 3 — তৈরি টাইমলাইন। একজন গবেষক অপ্রচলিত নথি থেকে একটি টাইমলাইন তৈরি করেছেন। AI অজানা ঘটনাগুলিকে "যৌক্তিক" ক্রমে সাজিয়েছে এবং একটি সুনির্দিষ্ট কালানুক্রম উপস্থাপন করেছে। যাইহোক, এই ক্রমটি নথিতে ছিল না, AI এটি তৈরি করেছিল। পাঠ: টাইমলাইনটি শুধুমাত্র সেই ইভেন্টগুলি থেকে তৈরি করা হয়েছে যেগুলির নথিতে একটি তারিখ রয়েছে; বাকি "আনডেটেড" থেকে যায়।

চারটি অনুলিপিযোগ্য টেমপ্লেট

1) NER (সত্তা অনুমান):

নীচের নথিতে উল্লিখিত ব্যক্তি, স্থান, প্রতিষ্ঠান এবং তারিখগুলি পৃথক তালিকা হিসাবে প্রদর্শিত হবে। কোন নথিতে (রেফারেন্স) প্রতিটি সত্তা উল্লেখ করা হয়েছে তা নির্দেশ করুন। টেক্সটে স্পষ্টভাবে যা বলা হয়েছে কেবল তা গ্রহণ করুন; অনুমান দ্বারা যোগ করুন। আপনি যদি উচ্চারণ সম্পর্কে নিশ্চিত না হন তাহলে [?] চিহ্নিত করুন। নথি: [এখানে]

2) সত্তা স্বাভাবিককরণ:

নীচের সত্তা তালিকায়, একই ব্যক্তি/স্থান হতে পারে এমন বিভিন্ন বানানকে গোষ্ঠীভুক্ত করুন (যেমন "ইস্তানবুল / কোস্টান্টিনিয়")। প্রতিটি দলের জন্য সম্ভাব্য সাধারণ বিন্যাস প্রস্তাব করুন কিন্তু সঠিক সমন্বয় আরোপ করবেন না; নোট যোগ করুন "সম্ভবত একই, লোকেদের যাচাই করতে দিন"। আপনি নিশ্চিত না হলে একা ছেড়ে দিন। তালিকা: [এখানে]

3) সম্পর্ক/নেটওয়ার্ক রূপরেখা:

নিম্নলিখিত চিঠিপত্র/নথিপত্রের সেট থেকে "কে কার সাথে সম্পর্কিত" লিঙ্কগুলি বের করুন৷ প্রতিটি লিঙ্কের জন্য, এটি কোন নথির (রেফারেন্স) উপর ভিত্তি করে তা নির্দেশ করুন। এমন একটি সম্পর্ক তৈরি করেছে যা নথিতে স্পষ্ট নয়। অস্পষ্ট লিঙ্ক চিহ্নিত করুন [অস্পষ্ট]। ডকুমেন্টেশন: [এখানে]

4) তারিখের সময়রেখা:

শুধুমাত্র নিম্নলিখিত নথিতে স্পষ্টভাবে উল্লেখ করা ঘটনাগুলি কালানুক্রমিক ক্রমে তালিকাভুক্ত করুন; প্রতিটি ইভেন্টকে তার উৎসের সাথে লিঙ্ক করুন। "আনডেটেড" শিরোনামের অধীনে অনিশ্চিত তারিখ সহ ঘটনাগুলি আলাদাভাবে তালিকাভুক্ত করুন, সেগুলিকে ক্রমানুসারে রাখবেন না। আনুমানিক তারিখ আপ করবেন না. ডকুমেন্টেশন: [এখানে]

দুর্বল প্রম্পট / শক্তিশালী প্রম্পট

দুর্বল:

এই নথিগুলি বিশ্লেষণ করুন এবং গুরুত্বপূর্ণ নিদর্শন, সম্পর্ক এবং সময়রেখা বের করুন।

"গুরুত্বপূর্ণ নিদর্শনগুলি নিষ্কাশন করুন" এআইকে অস্তিত্বহীন সংযোগ এবং সুনির্দিষ্ট কালানুক্রম উদ্ভাবনের জন্য চাপ দেয়, স্বাভাবিককরণ ছাড়াই সংখ্যা উপস্থাপন করে।

শক্তিশালী:

প্রত্যেকটি নথির রেফারেন্সের সাথে সংযুক্ত করে নিম্নলিখিত নথিগুলি থেকে ব্যক্তি/স্থান/প্রতিষ্ঠান সত্তাকে বের করে। বিভিন্ন বানান চিহ্নিত করুন যা "একত্রীকরণ হতে পারে" এর মত হতে পারে, কিন্তু একত্রিত করবেন না। যে সম্পর্কগুলি নথিতে স্পষ্টভাবে বলা নেই এবং অনিশ্চিত তারিখের ঘটনাগুলি জাল করবেন না; যাদের তারিখ নেই তাদের আলাদা রাখুন। ডকুমেন্টেশন: [এখানে]

পার্থক্য: উৎসের প্রতি অ্যাট্রিবিউশন, মানুষের কাছে স্বাভাবিককরণ ছেড়ে দেওয়া, কাল্পনিক বন্ধন/ইতিহাসের উপর নিষেধাজ্ঞা, এবং অপ্রচলিত ঘটনাগুলির বিচ্ছেদ প্যাটার্নটিকে প্রতিরক্ষাযোগ্য করে তোলে।

সাধারণ ভুল

  • প্রমাণের জন্য প্যাটার্ন ভুল করা. প্যাটার্ন হল হাইপোথিসিস; নথিতে যাচাই করা হয়।
  • স্বাভাবিকীকরণ এড়িয়ে যাওয়া। একই সত্তার বিভিন্ন বানান সংখ্যা এবং নেটওয়ার্ককে বিকৃত করে।
  • সংখ্যায় অন্ধ বিশ্বাস। অসম্পূর্ণ সংগ্রহ এবং স্যাম্পলিং পক্ষপাত সংখ্যাটিকে বিভ্রান্তিকর করে তোলে।
  • তৈরি টাইমলাইন। তারিখবিহীন ঘটনা কালানুক্রমিক অন্তর্ভুক্ত করা হয় না.
  • প্রসঙ্গ উপেক্ষা করা। এটি "কতবার পাস হয়েছিল" নয়, "কিভাবে পাস হয়েছিল" এটি গুরুত্বপূর্ণ।

সংক্ষেপে

বিষয়বস্তু বিশ্লেষণ এবং প্যাটার্ন আবিষ্কার একটি শক্তিশালী ক্ষেত্র যেখানে AI দৃশ্যমান কাঠামো তৈরি করে যা শুধুমাত্র পড়ার মাধ্যমে দৃশ্যমান হবে না: সত্তা নিষ্কাশন, সম্পর্ক নেটওয়ার্ক, বিষয় ক্লাস্টার, টাইমলাইন। কিন্তু প্রতিটি প্যাটার্ন একটি অনুমান, প্রমাণ নয়। উত্সের সাথে সম্পদ লিঙ্ক করুন, সাবধানে এবং মানুষের বৈধতা সহ স্বাভাবিক করুন, অনুপস্থিত ডেটা এবং পক্ষপাতের জন্য ক্যোয়ারী নম্বর, বিতর্কিত সম্পর্ক এবং কালানুক্রম এড়িয়ে চলুন। AI প্যাটার্ন চিহ্নিত করে; এর অর্থ কী এবং তা সত্য কিনা তা ঐতিহাসিকের রায়।

আবেদন টাস্ক

কমপক্ষে 15 টি ডকুমেন্টেশন সংগ্রহ করুন (রেফারেন্স সহ)। "NER" টেমপ্লেট দিয়ে ব্যক্তি এবং স্থান সত্ত্বা বের করুন। তারপরে "সত্তা স্বাভাবিককরণ" সহ বিভিন্ন বানানকে গোষ্ঠীভুক্ত করুন এবং গ্রুপগুলি নিজেই যাচাই করুন। অবশেষে, "তারিখকৃত টাইমলাইন" টেমপ্লেট চালান এবং দেখুন কতগুলি ইভেন্ট "আনডেটেড" রয়ে গেছে। AI দুর্বল প্রম্পটিংয়ের সাথে কতগুলি বানোয়াট লিঙ্ক বা কালানুক্রম তৈরি করবে তা তুলনা করুন।

চেকলিস্ট

  • [] আমি আমার প্যাটার্ন প্রশ্ন পরিষ্কারভাবে সংজ্ঞায়িত করেছি।
  • [ ] আমি প্রতিটি সত্তা নথির রেফারেন্সের সাথে লিঙ্ক করেছি৷
  • [ ] আমি সত্তা টাইপিং স্বাভাবিক করেছি এবং এটি মানুষের অনুমোদনের সাথে একত্রিত করেছি৷
  • [ ] আমি অনুপস্থিত ডেটা এবং পক্ষপাতের জন্য নম্বরগুলি নিয়ে প্রশ্ন করেছি৷
  • [ ] আমি কালানুক্রমের মধ্যে অপ্রচলিত ঘটনাগুলি রাখিনি, আমি সেগুলি আলাদাভাবে রেখেছি।