লাভ:
- কৃত্রিম বুদ্ধিমত্তা সহ ISAD(G) বা ডাবলিন কোরের মতো মান অনুযায়ী মেটাডেটা ড্রাফ্ট তৈরি করার ক্ষমতা
- হ্যালুসিনেশন প্রতিরোধ করার ক্ষমতা এবং ফাঁকা অনুমতি সহ নিয়ন্ত্রিত শব্দভান্ডারে বিষয়ের শর্তাবলী মানচিত্র
- তারিখ, ব্যক্তির নাম এবং রেফারেন্স কোডের মতো কোন ক্ষেত্রগুলিকে আলাদা করার ক্ষমতার জন্য মানুষের অনুমোদন প্রয়োজন এবং কোনটি শুধুমাত্র প্রতিষ্ঠান দ্বারা বরাদ্দ করা উচিত
একটি আর্কাইভ বা লাইব্রেরি, তা যতই সমৃদ্ধ হোক না কেন, ভালভাবে সংজ্ঞায়িত না হলে খুঁজে পাওয়া যাবে না। যা একটি নথিকে "অনুসন্ধানযোগ্য" করে তোলে তা হল এটি সম্পর্কে বর্ণনামূলক তথ্য: কে এটি লিখেছেন, কখন, কোথায়, এর বিষয় কী, এটি কোন সংগ্রহের অন্তর্গত। এই তথ্যকে মেটাডেটা বলা হয় (মেটাডেটা — একটি নথি সম্পর্কে বর্ণনামূলক ডেটা; "ডেটা সম্পর্কে ডেটা")। ক্যাটালগিং হল এই মেটাডেটা দিয়ে নথি সনাক্ত করার এবং একটি অনুসন্ধানযোগ্য সিস্টেমে সেভ করার প্রক্রিয়া। শ্রেণীবিভাগ হল বিষয়, ধরন বা উত্সের মতো মানদণ্ড অনুযায়ী নথিগুলিকে সংগঠিত করা।
মেটাডেটা তৈরি করা অত্যন্ত সময়সাপেক্ষ; বড় সংগ্রহে হাজার হাজার নথির জন্য পৃথকভাবে তারিখ, বিষয়, ব্যক্তি এবং স্থানের তথ্য লিখতে কয়েক বছর সময় লাগতে পারে। এআই এই ব্যবসায় একটি শক্তিশালী খসড়া জেনারেটর। এই ইউনিটে, আমরা দেখব কীভাবে AI দিয়ে মেটাডেটা তৈরি করা যায়, মান অনুযায়ী ক্যাটালগিং (ISAD(G), ডাবলিন কোর), এবং স্বয়ংক্রিয় শ্রেণীবিভাগের শক্তি এবং ক্ষতি উভয়ই।
সংরক্ষণাগার মান: কেন তাদের প্রয়োজন
মেটাডেটা এলোমেলোভাবে প্রবেশ করা হয় না; আন্তর্জাতিক মান আছে যাতে বিভিন্ন প্রতিষ্ঠানের রেকর্ড একে অপরের সাথে কথা বলতে পারে:
- ISAD(G) (জেনারেল ইন্টারন্যাশনাল স্ট্যান্ডার্ড আর্কাইভাল বর্ণনা): আর্কাইভাল উপাদানকে শ্রেণিবদ্ধভাবে বর্ণনা করার নিয়ম (ফান্ড, সিরিজ, ফাইল, নথি স্তরে)। এতে রেফারেন্স কোড, শিরোনাম, তারিখ, সুযোগ, সৃষ্টিকর্তার মতো ক্ষেত্র রয়েছে।
- ডাবলিন কোর: ডিজিটাল সম্পদ (শিরোনাম, স্রষ্টা, বিষয়, তারিখ, ধরণ, বিন্যাস, উৎস, ভাষা, ইত্যাদি) বর্ণনা করার জন্য 15টি মূল ক্ষেত্র সমন্বিত একটি সাধারণ মান।
- অনুরাগী: একক ব্যক্তি, পরিবার বা প্রতিষ্ঠানের কার্যকলাপের ফলস্বরূপ স্বাভাবিকভাবে গঠিত রেকর্ডের একটি সেট। এটি সংরক্ষণাগারের মৌলিক সংগঠক ইউনিট।
- উত্স (উৎস): একটি নথি কার কাছ থেকে এসেছে এবং এটি কোন হাত দিয়ে গেছে সে সম্পর্কে তথ্য। সংরক্ষণাগারে, নথিগুলি তাদের উত্স অনুসারে একসাথে রাখা হয়।
AI উৎপাদনের মেটাডেটা থাকার সময় স্পষ্টভাবে লক্ষ্য মান নির্দিষ্ট করা নিশ্চিত করে যে আউটপুটটি সরাসরি এন্টারপ্রাইজে প্রবেশযোগ্য।
আরেকটি মূল ধারণা হল অথরিটি রেকর্ড—একটি রেকর্ড যা একজন ব্যক্তি, স্থান বা প্রতিষ্ঠানের নামের একটি একক, মানক, অনুমোদিত রূপকে সংজ্ঞায়িত করে। ঐতিহাসিক নথিতে, একই ব্যক্তি বা স্থান বিভিন্ন বানান সহ প্রদর্শিত হতে পারে; কর্তৃপক্ষের রেকর্ড তাদের সকলকে একটি একক অনুমোদিত বিন্যাসে আবদ্ধ করে যাতে তারা অনুসন্ধানে বিক্ষিপ্ত না হয়। এআই একটি নথি থেকে নাম প্রস্তাব করে; কিন্তু অথরিটি রেকর্ডে এই নামটিকে স্ট্যান্ডার্ড ফর্মে ম্যাপ করা মানুষের কাজ। প্রতিষ্ঠানের অথরিটি রেকর্ডে AI "Ahmed" কে "Ahmed Bey (1840-1912)" বলে তা লিঙ্ক করা ক্যাটালগের ধারাবাহিকতা রক্ষা করে।
কর্মপ্রবাহ: ধাপে ধাপে
1. উৎস প্রস্তুত করুন। নথির একটি প্রতিলিপি বা চিত্র এবং যেকোন প্রসঙ্গ তথ্য সংগ্রহ করুন।
2. মান এবং এলাকা চিহ্নিত করুন। AI কে বলুন কোন স্ট্যান্ডার্ড (ISAD(G), Dublin Core) এবং কোন ফিল্ড অনুযায়ী এটি আউটপুট তৈরি করবে।
3. খসড়া মেটাডেটা তৈরি করুন। AI ক্ষেত্রগুলি পূরণ করে যা নথি থেকে বের করা যেতে পারে (তারিখ, ব্যক্তি, স্থান, বিষয়, ভাষা, রীতি); এটি অপসারণ করতে পারে না এমন অঞ্চলগুলিকে ফাঁকা রাখে৷
4. নিয়ন্ত্রিত শব্দভান্ডারের মানচিত্র। বেশিরভাগ প্রতিষ্ঠানে বিষয় এবং স্থানের নামগুলি বিনামূল্যে নয়, তবে একটি পূর্বনির্ধারিত তালিকা (নিয়ন্ত্রিত শব্দভান্ডার / থিসরাস) এর সাথে আবদ্ধ। এই তালিকায় AI দ্বারা প্রস্তাবিত বিষয়ের শর্তাবলী ম্যাপ করুন।
5. যাচাই করুন এবং নিশ্চিত করুন। প্রতিটি ক্ষেত্র, বিশেষ করে তারিখ, নাম এবং বিষয়, নথি এবং কর্তৃপক্ষের রেকর্ডের সাথে মানুষের দ্বারা তুলনা করা হয়।
টিপ: স্পষ্টভাবে AI-কে "খালি ছেড়ে দেওয়ার" অনুমতি দিন। অন্যথায়, এটি নথিতে নেই এমন একটি তারিখ বা নির্মাতাকে "অনুমান" পূরণ করবে এবং আপনার ক্যাটালগে জাল মেটাডেটা সন্নিবেশ করবে। নির্দেশনা "এই ক্ষেত্রটি খালি রাখুন যদি এটি নথিতে না থাকে" হ্যালুসিনেশনের বিরুদ্ধে সবচেয়ে শক্তিশালী ঢাল।
একটি টেবিলে ক্ষেত্র এবং বিশ্বাসের স্তর
মেটাডেটা ক্ষেত্র
AI কতটা নির্ভরযোগ্য?
যাচাইকরণ
ভাষা
উচ্চ
নমুনা
নথির ধরন
মাঝারি উচ্চ
নিয়ন্ত্রণ
ব্যক্তি/স্থানের নাম
মাঝারি (পড়ার ত্রুটি)
বাধ্যতামূলক
তারিখ
নিম্ন-মাঝারি (বানোয়াট ঝুঁকি)
বাধ্যতামূলক
বিষয় পদ
মাঝারি (ফ্রি জেনারেটিং)
চেকলিস্টে মানচিত্র
সুযোগ/সারাংশ
মাঝারি উচ্চ
উৎসের সাথে তুলনা করুন
রেফারেন্স কোড
কোনটিই নয় (প্রতিষ্ঠান দেয়)
মানুষের নিক্ষেপ
সারাংশ: AI দ্রুত এবং নির্ভরযোগ্য যেমন ভাষা এবং ঘরানার ক্ষেত্রে; তারিখ, নাম এবং বিষয়ের মতো ক্ষেত্রে খসড়া তৈরি করে, তবে মানুষের অনুমোদন প্রয়োজন; এআই কখনই রেফারেন্স কোডের মতো প্রাতিষ্ঠানিক ক্ষেত্র তৈরি করে না।
তিনটি মিনি কেস
কেস 1 — 8,000টি ছবির জন্য খসড়া মেটাডেটা। একটি সিটি আর্কাইভ 8,000 ঐতিহাসিক ফটোগ্রাফ তালিকাভুক্ত করা হয়েছিল। প্রতিটি ছবির পিছনের নোটগুলি প্রতিলিপি করা হয়েছিল এবং এআইকে দেওয়া হয়েছিল; AI তারিখ, অবস্থান এবং বিষয়ের রূপরেখা তৈরি করেছে। মানব দল এটিকে ক্ষেত্র দ্বারা যাচাই করে এবং নিয়ন্ত্রিত তালিকায় ম্যাপ করে। একটি আনুমানিক 10-মাসের চাকরি 3 মাসে হ্রাস করা হয়েছিল; কিন্তু প্রতিটি তারিখ এবং স্থানের নাম দৃশ্যত চেক করা হয়েছিল।
কেস 2 - তৈরি ইতিহাস। একজন আর্কাইভিস্টের কাছে এআই ক্যাটালগ একটি অপ্রচলিত চিঠি ছিল। ওয়াইজেড চিঠির বিষয়বস্তু দেখেছেন এবং সঠিকভাবে "1912" তারিখটি লিখেছেন। তবে নথিতে কোনো তারিখ ছিল না; এআই ভবিষ্যদ্বাণী করেছে। আর্কাইভিস্ট যদি "নথিতে না থাকলে খালি রাখুন" নির্দেশনা যোগ না করে থাকেন, তাহলে ক্যাটালগটি একটি তৈরি তারিখ দিয়ে পূর্ণ হয়ে যেত। পাঠ: ফাঁকা অনুমতি বাধ্যতামূলক।
কেস 3 - বিনামূল্যে বিষয় শর্তাবলী বিভ্রান্তি তৈরি করেছে। AI অনুরূপ নথিতে "অভিবাসন", "অভিবাসন", "সেটেলমেন্ট" এর মতো অনুরূপ কিন্তু বিভিন্ন বিনামূল্যের পদ বরাদ্দ করেছে। যখন এটি নিয়ন্ত্রিত শব্দভান্ডারে ম্যাপ করা হয়নি, তখন একই বিষয় তিনটি ভিন্ন পদের সাথে ট্যাগ করা হয়েছিল এবং অনুসন্ধানে ছড়িয়ে ছিটিয়ে ছিল। একটি একক কর্তৃপক্ষের তালিকায় শর্তাবলী ম্যাপ করে সামঞ্জস্য অর্জন করা হয়েছিল। পাঠ: বিষয় পদ প্রকাশ করা হয় না, তারা তালিকার সাথে লিঙ্ক করা হয়.
চারটি অনুলিপিযোগ্য টেমপ্লেট
1) ডাবলিন কোর রূপরেখা:
নীচের ডকুমেন্ট ট্রান্সক্রিপশন থেকে ডাবলিন কোর মেটাডেটা খসড়া বের করুন। ক্ষেত্র: শিরোনাম, স্রষ্টা, বিষয়, বর্ণনা, তারিখ, ধরন, ভাষা, ব্যাপ্তি (অবস্থান/কাল)। নিয়ম: (1) শুধুমাত্র টেক্সটে স্পষ্টভাবে তথ্য ব্যবহার করুন। (2) যে ক্ষেত্রটি টেক্সটে খালি নেই সেটি ছেড়ে দিন, অনুমান করবেন না। (3) যে মান সম্পর্কে আপনি নিশ্চিত নন সেটিকে [?] দিয়ে চিহ্নিত করুন। প্রতিলিপি: [এখানে]
2) ISAD(G) খসড়া সংজ্ঞা:
ISAD(G) ক্ষেত্রগুলিতে নিম্নলিখিত নথির জন্য খসড়া তৈরি করুন: শিরোনাম, তারিখ(গুলি), বর্ণনা স্তর (নথি/ফাইল), স্কোপ এবং বিষয়বস্তু (সংক্ষিপ্তসার), নির্মাতা, ভাষা। রেফারেন্স কোড খালি রাখুন (প্রতিষ্ঠান এটি প্রদান করবে)। লেখায় নেই এমন কোনো তথ্য যোগ করবেন না; অস্তিত্বহীন ক্ষেত্রটি ফাঁকা রাখুন। নথি: [এখানে]
3) বিষয় শব্দ পরামর্শ (নিয়ন্ত্রিত):
নীচের নথির জন্য উপযুক্ত 3-5টি বিষয়ের শর্তাবলী সাজেস্ট করুন। প্রথমত, নথিতে তথ্যের উপর নির্ভর করুন। নীচে আমাদের প্রতিষ্ঠানের নিয়ন্ত্রিত পরিভাষা তালিকা; প্রথমে, এই তালিকা থেকে এটি বেছে নিন, যদি এটি তালিকায় না থাকে, তাহলে আলাদাভাবে আপনার নতুন শব্দের পরামর্শ চিহ্নিত করুন। তালিকা: [শর্তাবলী]। নথি: [এখানে]
4) বাল্ক ধারাবাহিকতা পরীক্ষা:
নীচে একই সংগ্রহ থেকে নথিগুলির জন্য মেটাডেটা রেকর্ড রয়েছে৷ ফ্ল্যাগ অসঙ্গতি: একই স্থান/ব্যক্তির বানান ভিন্নভাবে, ভিন্ন তারিখের বিন্যাস, একই বিষয়ের জন্য ভিন্ন পদের রেকর্ড। সংশোধন IMPOSITION; মানুষের পর্যালোচনা করার জন্য শুধু অসঙ্গতির একটি তালিকা তৈরি করুন। রেকর্ড: [এখানে]
দুর্বল প্রম্পট / শক্তিশালী প্রম্পট
দুর্বল:
এই নথির জন্য একটি সম্পূর্ণ ক্যাটালগ রেকর্ড তৈরি করুন।
"সম্পূর্ণ" নির্দেশনাটি AI-কে প্রতিটি স্থান পূরণ করতে বাধ্য করে, অর্থাত্, ইতিহাস এবং স্রষ্টাদের উদ্ভাবন করতে যা অস্তিত্বহীন।
শক্তিশালী:
ডাবলিন কোর এই নথির জন্য খসড়া করা হয়. শুধুমাত্র ট্রান্সক্রিপশনে স্পষ্টভাবে অন্তর্ভুক্ত তথ্য ব্যবহার করুন; অস্তিত্বহীন ক্ষেত্রটি ফাঁকা রাখুন, অনুমান করবেন না। এই নিয়ন্ত্রিত তালিকা থেকে বিষয় পদ নির্বাচন করুন: [তালিকা]। তারিখ এবং ব্যক্তির নাম [?] দিয়ে চিহ্নিত করুন যাতে আমি ডকুমেন্টের সাথে এটি যাচাই করতে পারি। প্রতিলিপি: [এখানে]
পার্থক্য: "সম্পূর্ণ" সংস্করণের পরিবর্তে "খালি ছেড়ে দিন" অনুমতি, নিয়ন্ত্রিত তালিকা আনুগত্য এবং যাচাইকরণ চিহ্নগুলি বানোয়াট থেকে ক্যাটালগকে রক্ষা করে৷
সাধারণ ভুল
- এর অর্থ "সম্পূর্ণভাবে পূরণ করুন"। এটি অস্তিত্বহীন ক্ষেত্রগুলিকে ফিট করার দিকে নিয়ে যায়; "খালি ছেড়ে দিন" অনুমতি দেওয়া উচিত।
- বিষয় শর্তাবলী রিলিজ. নিয়ন্ত্রিত শব্দভান্ডারে ম্যাপ না করা শর্তাবলী অনুসন্ধানকে বিভ্রান্ত করবে।
- AI ভবিষ্যদ্বাণীর ইতিহাস থাকা। একটি অবিকৃত নথিতে একটি কাল্পনিক তারিখ প্রবেশ করানো ক্যাটালগকে দূষিত করে।
- AI দ্বারা উত্পন্ন রেফারেন্স কোড থাকা। এটি একটি কর্পোরেট, অনন্য স্থান; মানুষ নিক্ষেপ.
- মান উল্লেখ না. মান উল্লেখ না করা থাকলে, আউটপুট একটি অগোছালো খসড়া হবে যা প্রতিষ্ঠানে প্রবেশ করা যাবে না।
সংক্ষেপে
মেটাডেটা এবং ক্যাটালগিং হল অদৃশ্য অবকাঠামো যা গবেষকের কাছে সংরক্ষণাগার খুলে দেয় এবং এর জন্য অনেক প্রচেষ্টার প্রয়োজন হয়। ট্রান্সক্রিপশন থেকে, AI তারিখ, ব্যক্তি, স্থান, বিষয় এবং রীতির মতো ক্ষেত্রের জন্য একটি দ্রুত রূপরেখা তৈরি করে; এটি আইএসএডি(জি) বা ডাবলিন কোরের মতো মান অনুযায়ী কাজ করতে পারে। কিন্তু "পুরোপুরি পূরণ" করার চাপ এআইকে জিনিসগুলি তৈরি করতে চাপ দেয়; "খালি ছেড়ে দিন" অনুমতি, নিয়ন্ত্রিত শব্দভান্ডারে ম্যাপিং এবং তারিখ/নামের মানবিক নিশ্চিতকরণ ক্যাটালগটিকে বিশ্বাসযোগ্য রাখে। এআই খসড়া প্রস্তুত করে; আপনি ক্যাটালগ নির্ভুলতার জন্য দায়ী.
আবেদন টাস্ক
একটি ডকুমেন্ট ট্রান্সক্রিপশন নিন এবং "ডাবলিন কোর ড্রাফ্ট" টেমপ্লেট সহ AI থেকে মেটাডেটা অনুরোধ করুন; চেক করুন যে এটি ফাঁকা ক্ষেত্রগুলি ছেড়ে দেয় যা বিদ্যমান নেই। তারপর আপনার নিজের (বা নমুনা) চেকলিস্ট সহ "বিষয় পদের পরামর্শ" টেমপ্লেটটি চালান। অবশেষে, একটি "বাল্ক ধারাবাহিকতা পরীক্ষা" দিয়ে কয়েকটি রেকর্ড পরীক্ষা করুন। AI ভবিষ্যদ্বাণী সহ কতগুলি ক্ষেত্র তৈরি করার চেষ্টা করে এবং তালিকায় কতগুলি বিষয়ের পদ ম্যাপ করা দরকার তা নোট করুন৷
চেকলিস্ট
- [ ] আমি স্পষ্টভাবে টার্গেট স্ট্যান্ডার্ড (ISAD(G)/Dublin Core) বলেছি।
- [ ] আমি "খালি ক্ষেত্র ফাঁকা ছেড়ে দিন" অনুমতি দিয়েছি।
- [ ] আমি নিয়ন্ত্রিত তালিকায় বিষয় শর্তাবলী ম্যাপ করেছি৷
- [] আমি নথি/কর্তৃপক্ষের রেকর্ডের সাথে তারিখ এবং ব্যক্তির নাম যাচাই করেছি।
- [ ] আমি রেফারেন্স কোডটি প্রতিষ্ঠানের কাছে রেখেছি, AI এর কাছে নয়।