লাভ:
- ধাপে ধাপে ডিজিটাইজেশন এবং ওসিআর ওয়ার্কফ্লো (স্ক্যানিং, প্রাক-প্রক্রিয়াকরণ, স্বীকৃতি, সংশোধন, যাচাইকরণ) সেট আপ করার ক্ষমতা
- সংশোধন এবং পুনর্লিখন লাইন বজায় রেখে এবং অস্পষ্টতা চিহ্নিত করার সময় প্রসঙ্গের সাথে ওসিআর ত্রুটিগুলি সংশোধন করতে AI ব্যবহার করার ক্ষমতা [?]
- কেন সংখ্যা, তারিখ এবং সঠিক নাম দৃশ্যত যাচাই করা আবশ্যক এবং মান নিয়ন্ত্রণের ভূমিকা বুঝুন।
একটি আর্কাইভ বা লাইব্রেরির ফিজিক্যাল শেল্ফের লক্ষ লক্ষ পৃষ্ঠাগুলি কেবল তখনই গবেষকের জন্য খোলা হয় যখন সেগুলি ডিজিটাইজড এবং অনুসন্ধানযোগ্য হয়৷ ডিজিটাইজেশন হল একটি ফিজিক্যাল ডকুমেন্টকে স্ক্যান বা ছবি তোলার মাধ্যমে ডিজিটাল ইমেজে রূপান্তর করা। কিন্তু একটি পৃষ্ঠার একটি ফটোগ্রাফ এখনও "টেক্সট" নয়; কম্পিউটারে এটি এখনও একটি চিত্র, আপনি এটিতে অনুসন্ধান করতে পারবেন না। এখানেই OCR খেলায় আসে।
OCR (অপটিক্যাল ক্যারেক্টার রিকগনিশন) এমন একটি প্রযুক্তি যা একটি নথির চিত্রের মুদ্রিত অক্ষরগুলিকে চিনতে পারে এবং সেগুলিকে মেশিন-পাঠযোগ্য, অনুসন্ধানযোগ্য পাঠ্যে রূপান্তরিত করে। এই ইউনিটে, আপনি শিখবেন কীভাবে ওসিআর দিয়ে ঐতিহাসিক মুদ্রিত নথিগুলিকে ডিজিটাইজ করতে হয়, কীভাবে এআই এই প্রক্রিয়ায় ওসিআর ত্রুটিগুলি সংশোধন করতে সাহায্য করে এবং যেখানে মানুষের চোখ অপরিহার্য। (হস্তলিখিত পাঠ্যগুলির জন্য একটি ভিন্ন প্রযুক্তির প্রয়োজন; আমরা পরবর্তী ইউনিটে এটি কভার করব।)
ডিজিটাইজেশন ওয়ার্কফ্লো: ধাপে ধাপে
1. প্রস্তুতি এবং স্ক্রীনিং। ডকুমেন্টটি সম্ভাব্য সর্বোচ্চ মানের স্ক্যান করুন। ঐতিহাসিক গবেষণার জন্য একটি সাধারণ নিয়ম হল কমপক্ষে 300-400 ডিপিআই (প্রতি ইঞ্চিতে ডট) একটি রেজোলিউশন। নিম্ন রেজোলিউশন পরবর্তী OCR পর্যায়ে ত্রুটির হারকে বাড়িয়ে দেয়।
2. ইমেজ প্রিপ্রসেসিং। OCR-এর আগে ইমেজ উন্নত করা অনেক বেশি সাফল্য বাড়ায়: স্ক্যান করা পৃষ্ঠাটি ডিস্ক করা, দাগ দূর করা, বৈসাদৃশ্য বাড়ানো, কালো এবং সাদাতে রূপান্তর করা। আধুনিক এআই-ভিত্তিক সরঞ্জামগুলি এই পদক্ষেপটি স্বয়ংক্রিয় করতে পারে।
3. OCR আবেদন। আপনি ছবিটিকে ওসিআর ইঞ্জিনে ফিড করেন; ইঞ্জিন অক্ষর সনাক্ত করে এবং পাঠ্য তৈরি করে। আউটপুট সাধারণত দুটি স্তর নিয়ে গঠিত: দৃশ্যমান নথির চিত্র এবং নীচে একটি "অনুসন্ধানযোগ্য লুকানো পাঠ্য স্তর"।
4. সংশোধন (সংশোধন-পরবর্তী)। কাঁচা ওসিআর আউটপুট কখনই নিখুঁত হয় না। পুরানো ফন্ট, হলুদ কাগজ, কালি দাগ এবং স্ক্যানিং ত্রুটির কারণে অক্ষরগুলি ভুলভাবে পড়া হয়। এখানেই AI একটি শক্তিশালী সাহায্যকারী: এটি প্রসঙ্গ ব্যবহার করে OCR ত্রুটির পরামর্শ দেয় এবং সংশোধন করে।
5. যাচাইকরণ এবং মান নিয়ন্ত্রণ। সংশোধিত পাঠ্যটি নমুনা ভিত্তিতে বা সম্পূর্ণরূপে মানুষের দ্বারা পরীক্ষা করা হয়। বিশেষ করে গুরুত্বপূর্ণ এলাকা যেমন নাম, তারিখ এবং সংখ্যা দৃশ্যত যাচাই করা আবশ্যক।
কেন ওসিআর ভুল করে, কীভাবে এআই সাহায্য করে
সাধারণ সমস্যা যা ঐতিহাসিক নথিতে ওসিআরকে চ্যালেঞ্জ করে: পুরানো এবং অভিনব হরফ, অপ্রচলিত অক্ষর ফর্ম যেমন দীর্ঘ "s" (ſ), দুই-কলামের পৃষ্ঠার বিন্যাস, পাদটীকা, হাতে লেখা সন্নিবেশ, সিল এবং বিবর্ণ কালি। যেহেতু একটি OCR ইঞ্জিন একের পর এক অক্ষর "দেখে", এটি প্রায়শই বাইনারি "rn" কে "m" হিসাবে, অক্ষর "l" কে "1" হিসাবে এবং অক্ষর "O" কে "0" হিসাবে বিভ্রান্ত করে।
এআই ভাষার মডেলগুলি এখানে একটি ভিন্ন শক্তি সরবরাহ করে: তারা প্রসঙ্গ বোঝে। যদি একটি OCR ইঞ্জিন "1stanbu1" লিখে, তাহলে AI প্রসঙ্গ থেকে অনুমান করতে পারে যে এটি "ইস্তানবুল" হওয়া উচিত। তবে এখানে একটি বড় বিপদ রয়েছে: "সংশোধন" করার সময় AI পাঠ্যটিও পরিবর্তন করতে পারে। তিনি একটি অস্তিত্বহীন শব্দ "আমি সংশোধন করেছি" যোগ করতে পারেন বা তার নিজের অনুমান দিয়ে একটি অস্পষ্ট স্থান পূরণ করতে পারেন। এটি প্রতিলিপির বিশ্বস্ততা ব্যাহত করে।
সতর্কতা: OCR সংশোধনের সুবর্ণ নিয়ম হল: AI শুধুমাত্র সুস্পষ্ট স্বীকৃতি ত্রুটি সংশোধন করা উচিত, পাঠ্যের বিষয়বস্তু ব্যাখ্যা বা সম্পূরক নয়। "1stanbu1 → ইস্তাম্বুল" বৈধ; এটি অনুমান দিয়ে একটি অপঠিত শব্দ পূরণ করার বিষয়ে নয়। অনিশ্চিত স্থানগুলি [?] দিয়ে চিহ্নিত করা উচিত এবং তৈরি করা উচিত নয়৷
ওসিআর ত্রুটির ধরন এবং একটি টেবিলের সাথে পদ্ধতি
ত্রুটির ধরন
উদাহরণ
AI এটা ঠিক করতে পারে?
মানুষের নিয়ন্ত্রণ
চরিত্রের মিশ্রণ
rn↔m, l↔1, O↔0
হ্যাঁ, এটা নিরাপদ
নমুনা
পুরানো চিঠি ফর্ম
দীর্ঘ ſ → সে
হ্যাঁ, এটা নিরাপদ
নমুনা
বিবর্ণ/অপাঠ্য শব্দ
"কা___ন"
না, লাগাতে হবে [?]
বাধ্যতামূলক
সঠিক নাম/স্থানের নাম
"কনস্ট্যান্টিনিয়ে"
সতর্ক
বাধ্যতামূলক
নম্বর/তারিখ
"1867" বনাম "1857"
ঝুঁকিপূর্ণ
বাধ্যতামূলক
পৃষ্ঠা বিন্যাস (কলাম/পাদটীকা)
মিশ্র প্রবাহ
আংশিকভাবে
বাধ্যতামূলক
একটি বাক্যে ছবির সংক্ষিপ্তসার: AI নির্ভরযোগ্যভাবে সাধারণ চরিত্রের ত্রুটিগুলি পরিষ্কার করে; কিন্তু বিশেষ নাম, সংখ্যা, তারিখ এবং অপঠিত স্থানের জন্য মানুষের চোখ প্রয়োজন।
তিনটি মিনি কেস
কেস 1 — সংবাদপত্রের সংরক্ষণাগারগুলি অনুসন্ধানযোগ্য হয়ে উঠেছে। একটি বিশ্ববিদ্যালয়ের গ্রন্থাগার 1930 এর দশক থেকে স্থানীয় সংবাদপত্রের 12,000 পৃষ্ঠাগুলিকে ডিজিটাইজ করেছে। কাঁচা ওসিআর নির্ভুলতা ছিল আনুমানিক 82% (প্রতি 100টি অক্ষরের মধ্যে 18টি ভুল ছিল)। সংবাদপত্রের ভাষা-উপযুক্ত অভিধান এবং প্রসঙ্গ সহ AI-ভিত্তিক সংশোধন সঠিকতা বাড়িয়ে 96% এ পৌঁছেছে। অবশিষ্ট ত্রুটির জন্য, সম্পূর্ণ পাঠ্যের পরিবর্তে একটি নমুনা পরীক্ষা করা হয়েছিল; সংগ্রহটি 3 সপ্তাহের মধ্যে অনুসন্ধানযোগ্য হয়ে উঠেছে।
কেস 2 - AI "সংশোধিত" এবং বিকৃত ইতিহাস। একজন আর্কাইভিস্ট ওসিআর প্রিন্টআউটে AI তারিখটি "1863" সংশোধন করেছিলেন। AI প্রেক্ষাপটে অন্য একটি ইভেন্ট দেখে তারিখটিকে "1868" এ "সংশোধন" করেছে - যদিও নথিতে স্পষ্টভাবে বলা হয়েছে 1863৷ আর্কাইভিস্ট যদি আসল চিত্রটি না দেখেন তবে ক্যাটালগটি ভুল তারিখ দিয়ে প্রবেশ করত৷ পাঠ: সংখ্যা এবং তারিখগুলি কখনই AI-তে ছেড়ে দেওয়া হয় না, সেগুলি চিত্রের সাথে যাচাই করা হয়।
কেস 3 — দুই-কলাম পৃষ্ঠা বিভ্রান্ত। 19 শতকের একটি ইয়ারবুকের দুই-কলামের পৃষ্ঠাগুলি ওসিআর-এ একটি একক প্রবাহে মিশ্রিত হয়েছিল এবং বাক্যগুলি একে অপরের সাথে জড়িত ছিল। কাঁচা আউটপুট অপাঠ্য ছিল. যখন আমি প্রথম পৃষ্ঠার বিন্যাসটিকে অঞ্চলে (বিভাজন) ভাগ করেছিলাম এবং প্রতিটি কলাম আলাদাভাবে প্রক্রিয়া করি তখন পাঠ্যটি উন্নত হয়েছিল। পাঠ: জটিল পৃষ্ঠা বিন্যাসে, গঠন প্রথম, পাঠ দ্বিতীয়।
চারটি অনুলিপিযোগ্য টেমপ্লেট
1) নিরাপদ OCR সংশোধন:
নীচে একটি ঐতিহাসিক নথির কাঁচা ওসিআর আউটপুট রয়েছে৷ আপনার কাজ হল শুধুমাত্র সুস্পষ্ট অপটিক্যাল রিকগনিশন ত্রুটি সংশোধন করা (যেমন rn→m,1→l, 0→O, long ſ→s)। নিয়ম: (1) পাঠ্যের অর্থ ব্যাখ্যা করুন। (2) অপঠনযোগ্য/অস্পষ্ট শব্দগুলি সঠিক করুন, যেমন আছে তেমন ছেড়ে দিন এবং [?] দিয়ে চিহ্নিত করুন। (3) কোন বাক্য যোগ করা, অপসারণ করা বা সম্পূর্ণ করা। (4) নম্বর এবং তারিখ পরিবর্তন করুন; সন্দেহ হলে [সংখ্যা?] চিহ্নিত করুন। কাঁচা ওসিআর: [এখানে]
2) OCR মানের রিপোর্ট:
নীচের OCR আউটপুট পরীক্ষা করুন এবং একটি গুণমান প্রতিবেদন তৈরি করুন: (1) সম্ভাব্য স্বীকৃতি ত্রুটি সহ শব্দগুলি তালিকাভুক্ত করুন, (2) অপাঠ্য/অস্পষ্ট দেখায় এমন অঞ্চলগুলি চিহ্নিত করুন, (3) নির্দিষ্ট নাম, তারিখ এবং সংখ্যাগুলি তালিকাভুক্ত করুন যার জন্য মানুষের পরীক্ষা প্রয়োজন৷ সংশোধন করবেন না; শুধুমাত্র চেকলিস্ট তৈরি করুন। পাঠ্য: [এখানে]
3) কলাম/কাঠামো পার্সিং সাহায্য:
কারণ নীচের OCR পাঠ্যটি একটি দুই-কলামের পৃষ্ঠা থেকে এসেছে, প্রবাহটি বিভ্রান্ত হতে পারে। যৌক্তিক অনুচ্ছেদে পাঠ্যটিকে পুনরায় সাজান কিন্তু কোনো শব্দ পরিবর্তন, যোগ বা মুছে ফেলবেন না। শুধু আদেশ সংশোধন করুন. আপনি যে অর্ডার সম্পর্কে নিশ্চিত নন সেটিকে চিহ্নিত করুন [order?]। পাঠ্য: [এখানে]
4) প্রমিত ভাষাতে স্বাভাবিককরণ (ঐচ্ছিক, পৃথক স্তর):
আজকের বানানে একটি সরলীকৃত পঠন সংস্করণ তৈরি করুন, একটি পৃথক কলামে, নীচে সংশোধন করা ঐতিহাসিক পাঠ্যের উপরে। অরিজিনাল টেক্সট পরিবর্তন করবেন না; সরলীকরণ একটি পৃথক স্তর হতে দিন. অর্থ যোগ না করে শুধু বানান/উচ্চারণ আপডেট করুন। মূল: [এখানে]
দুর্বল প্রম্পট / শক্তিশালী প্রম্পট
দুর্বল:
এই OCR টেক্সটটি সঠিক এবং সুন্দর করুন।
"সুন্দর করা" এআইকে পাঠ্যটি পুনরায় লিখতে, বাদ দেওয়া এবং বিষয়বস্তু ব্যাখ্যা করতে দেয়; আনুগত্য ভঙ্গ করে।
শক্তিশালী:
এই কাঁচা OCR আউটপুটে শুধুমাত্র অপটিক্যাল স্বীকৃতি ত্রুটি ঠিক করুন। অর্থ ব্যাখ্যা করবেন না, শব্দ যোগ/মুছুন, [?] দিয়ে অপঠিত অংশগুলি ছেড়ে দিন, সংখ্যা এবং তারিখ পরিবর্তন করুন। আপনার করা প্রতিটি সংশোধনকে "মূল → সংশোধন" বিন্যাসে একটি পৃথক তালিকায় দেখান যাতে আমি এটি যাচাই করতে পারি। পাঠ্য: [এখানে]
পার্থক্য: সীমাবদ্ধ শুল্ক, বানোয়াট নিষেধাজ্ঞা, অস্পষ্টতা চিহ্নিত করা এবং সংশোধনের সন্ধানযোগ্য তালিকা আউটপুটকে নিরীক্ষণযোগ্য করে তোলে।
সাধারণ ভুল
- কম রেজোলিউশনে স্ক্যান করা হচ্ছে। বেশিরভাগ ওসিআর ত্রুটি খারাপ চিত্রের কারণে হয়; গুণমান স্ক্যানিং সবচেয়ে সস্তা বিনিয়োগ.
- এআইকে "সুন্দর করে তুলুন।" এটি বিশ্বস্ততার পরিবর্তে সাবলীলতা তৈরি করে; নথিটি পুনরায় লেখা হয়।
- সংখ্যা এবং তারিখগুলি AI-তে ছেড়ে দেওয়া হচ্ছে৷ প্রসঙ্গ থেকে "সংশোধিত" হলে এগুলি নীরবে দূষিত হয়; ইমেজ দ্বারা যাচাই করা আবশ্যক.
- একটি অনুমান সঙ্গে অপঠনযোগ্য এলাকায় ভরাট. এটা অনিশ্চয়তা দ্বারা সুরক্ষিত করা উচিত [?], গঠিত না.
- নমুনা নেওয়ার পরিবর্তে মোটেও নিয়ন্ত্রণ করছে না। এমনকি 96% নির্ভুলতা মানে 12,000 পৃষ্ঠায় হাজার হাজার ত্রুটি; গুরুত্বপূর্ণ এলাকা স্ক্যান করা হয়।
সংক্ষেপে
OCR মুদ্রিত ঐতিহাসিক নথিগুলিকে অনুসন্ধানযোগ্য পাঠ্যে রূপান্তর করে গবেষকদের জন্য সংরক্ষণাগারগুলি খুলে দেয়। প্রসঙ্গ সহ কাঁচা ওসিআর আউটপুটে অক্ষর ত্রুটিগুলি সংশোধন করতে AI একটি শক্তিশালী সহায়তা; তবে আপনাকে অবশ্যই সম্পাদনা এবং পুনর্লিখনের মধ্যে লাইন আঁকতে হবে। উচ্চ-মানের স্ক্যানিং, নিরাপদ সংশোধন নির্দেশনা, [?] এর সাথে অস্পষ্টতা সংরক্ষণ, এবং নাম/তারিখ/সংখ্যার মানব-চক্ষু যাচাই ডিজিটাইজেশনকে দ্রুত এবং নির্ভরযোগ্য করে তোলে। AI পাঠ্য পরিষ্কার করে; আপনি বিশ্বস্ততার অভিভাবক।
আবেদন টাস্ক
একটি মুদ্রিত ঐতিহাসিক নথি (পুরানো সংবাদপত্র, অফিসিয়াল চিঠি, বইয়ের পৃষ্ঠা) স্ক্যান করুন বা একটি OCR প্রিন্টআউট নিন। "নিরাপদ ওসিআর সংশোধন" টেমপ্লেট দিয়ে পাঠ্যটি সংশোধন করুন এবং "মূল → সংশোধন" তালিকার মাধ্যমে সংশোধনের অনুরোধ করুন। তারপর, "OCR গুণমান প্রতিবেদন" দিয়ে মানুষের নিয়ন্ত্রণের প্রয়োজন হয় এমন ক্ষেত্রগুলি সরিয়ে ফেলুন। প্রকৃত চিত্রের সাথে তালিকার প্রতিটি তারিখ এবং সঠিক নাম তুলনা করুন; নোট করুন কতগুলি ভুলভাবে "সংশোধিত" হয়েছিল।
চেকলিস্ট
- আমি কমপক্ষে 300 ডিপিআই এবং ভাল বৈসাদৃশ্য সহ নথিটি স্ক্যান করেছি।
- [ ] আমি শুধুমাত্র AI কে অপটিক্যাল ত্রুটি সংশোধনের জন্য বলেছি, পুনর্লিখন নয়।
- [ ] আমি অপঠনযোগ্য অংশগুলিকে [?] দিয়ে সুরক্ষিত করেছি।
- [ ] আমি ছবির সাথে সমস্ত নম্বর, তারিখ এবং সঠিক নাম যাচাই করেছি।
- [ ] আমি একটি নমুনা বা পূর্ণ পরীক্ষা করেছি জটিল এলাকায়।