فائدہ:
- ڈیجیٹائزیشن اور OCR ورک فلو (اسکیننگ، پری پروسیسنگ، شناخت، اصلاح، تصدیق) مرحلہ وار ترتیب دینے کی صلاحیت
- سیاق و سباق کے ساتھ OCR کی غلطیوں کو درست کرنے کے لیے AI کا استعمال کرنے کی اہلیت، تصحیح اور دوبارہ لکھنے والی لائن کو برقرار رکھتے ہوئے اور ابہام کو [?]
- سمجھیں کہ نمبروں، تاریخوں اور مناسب ناموں کی بصری طور پر تصدیق کیوں ہونی چاہیے اور کوالٹی کنٹرول کا کردار۔
کسی آرکائیو یا لائبریری کے فزیکل شیلف پر موجود لاکھوں صفحات محقق کے لیے تب ہی کھلتے ہیں جب وہ ڈیجیٹائزڈ اور قابل تلاش ہوجاتے ہیں۔ ڈیجیٹائزیشن ایک فزیکل دستاویز کو اسکین کرکے یا تصویر کھینچ کر ڈیجیٹل امیج میں تبدیل کر رہا ہے۔ لیکن کسی صفحے کی تصویر ابھی "متن" نہیں ہے۔ کمپیوٹر پر یہ اب بھی ایک تصویر ہے، آپ اس میں تلاش نہیں کر سکتے۔ یہیں سے OCR کھیل میں آتا ہے۔
OCR (آپٹیکل کریکٹر ریکگنیشن) ایک ایسی ٹیکنالوجی ہے جو دستاویز کی تصویر میں پرنٹ شدہ حروف کو پہچانتی ہے اور انہیں مشین کے ذریعے پڑھنے کے قابل، تلاش کے قابل متن میں تبدیل کرتی ہے۔ اس یونٹ میں، آپ سیکھیں گے کہ تاریخی طباعت شدہ دستاویزات کو OCR کے ساتھ ڈیجیٹائز کرنے کا طریقہ، AI اس عمل میں OCR کی غلطیوں کو درست کرنے میں کس طرح مدد کرتا ہے، اور انسانی آنکھ کہاں ضروری ہے۔ (ہاتھ سے لکھے ہوئے متن کے لیے ایک مختلف ٹیکنالوجی کی ضرورت ہوتی ہے؛ ہم اسے اگلی اکائی میں بیان کریں گے۔)
ڈیجیٹائزیشن ورک فلو: قدم بہ قدم
1. تیاری اور اسکریننگ۔ دستاویز کو بہترین معیار پر اسکین کریں۔ تاریخی تحقیق کے لیے انگوٹھے کا ایک عمومی اصول کم از کم 300-400 DPI (ڈاٹس فی انچ) کی قرارداد ہے۔ کم ریزولیوشن بعد کے OCR مرحلے میں خرابی کی شرح کو بڑھا دیتا ہے۔
2. امیج پری پروسیسنگ۔ OCR سے پہلے تصویر کو بہتر بنانا کامیابی میں بہت زیادہ اضافہ کرتا ہے: اسکین شدہ صفحہ کو ڈیسک کرنا، داغوں کو دور کرنا، کنٹراسٹ بڑھانا، سیاہ اور سفید میں تبدیل کرنا۔ جدید AI پر مبنی ٹولز اس قدم کو خودکار کر سکتے ہیں۔
3. OCR درخواست۔ آپ تصویر کو OCR انجن کو کھلاتے ہیں۔ انجن حروف کو پہچانتا ہے اور متن تیار کرتا ہے۔ آؤٹ پٹ عام طور پر دو پرتوں پر مشتمل ہوتا ہے: نظر آنے والی دستاویز کی تصویر اور نیچے "تلاش کے قابل پوشیدہ ٹیکسٹ پرت"۔
4. تصحیح (تصحیح کے بعد)۔ خام OCR آؤٹ پٹ کبھی بھی کامل نہیں ہوتا ہے۔ پرانے فونٹس، پیلے رنگ کے کاغذ، سیاہی کی خرابی، اور اسکیننگ کی غلطیوں کی وجہ سے حروف کو غلط پڑھا جاتا ہے۔ یہ وہ جگہ ہے جہاں AI ایک طاقتور مددگار ہے: یہ سیاق و سباق کا استعمال کرتے ہوئے OCR کی غلطیوں کی تجویز اور اصلاح کرتا ہے۔
5. تصدیق اور کوالٹی کنٹرول۔ درست متن کو انسان نمونے کی بنیاد پر یا مکمل طور پر چیک کرتا ہے۔ خاص طور پر اہم علاقوں جیسے نام، تاریخوں اور نمبروں کی بصری طور پر تصدیق ہونی چاہیے۔
OCR غلطیاں کیوں کرتا ہے، AI کیسے مدد کرتا ہے۔
عام مسائل جو تاریخی دستاویزات میں OCR کو چیلنج کرتے ہیں: پرانے اور فینسی فونٹس، متروک خط فارم جیسے لمبے "s" (ſ)، دو کالم صفحہ کی ترتیب، فوٹ نوٹ، ہاتھ سے لکھے ہوئے داخل، مہریں، اور دھندلی سیاہی۔ چونکہ ایک OCR انجن ایک ایک کر کے حروف کو "دیکھتا ہے"، یہ اکثر بائنری "rn" کو "m"، حرف "l" کو نمبر "1" اور حرف "O" کو "0" کے طور پر الجھا دیتا ہے۔
AI زبان کے ماڈل یہاں ایک مختلف طاقت پیش کرتے ہیں: وہ سیاق و سباق کو سمجھتے ہیں۔ اگر ایک OCR انجن نے "1stanbu1" لکھا ہے، تو AI سیاق و سباق سے اندازہ لگا سکتا ہے کہ یہ "استنبول" ہونا چاہیے۔ لیکن یہاں ایک بڑا خطرہ ہے: جب "درست" کرتے ہیں تو AI متن کو بھی بدل سکتا ہے۔ وہ ایک غیر موجود لفظ "میں نے درست کیا" کا اضافہ کر سکتا ہے یا اپنے اندازے سے غیر واضح جگہ پر کر سکتا ہے۔ اس سے نقل کی وفاداری میں خلل پڑتا ہے۔
احتیاط: OCR تصحیح میں سنہری اصول یہ ہے: AI کو صرف واضح شناخت کی غلطیوں کو درست کرنا چاہیے، متن کے مواد کی تشریح یا تکمیل نہیں کرنا چاہیے۔ "1stanbu1 → استنبول" جائز ہے؛ یہ ایک ناقابل پڑھنے والے لفظ کو اندازوں سے بھرنے کے بارے میں نہیں ہے۔ غیر یقینی جگہوں کو [?] کے ساتھ نشان زد کیا جانا چاہئے اور اسے نہیں بنایا جانا چاہئے۔
او سی آر کی خرابی کی اقسام اور ٹیبل کے ساتھ نقطہ نظر
خرابی کی قسم
مثال
کیا AI اسے ٹھیک کر سکتا ہے؟
انسانی کنٹرول
کردار اختلاط
rn↔m, l↔1, O↔0
ہاں، یہ محفوظ ہے۔
نمونہ
پرانا خط فارم
طویل ſ → s
ہاں، یہ محفوظ ہے۔
نمونہ
دھندلا/نا پڑھا ہوا لفظ
"کا___ن"
نہیں، لگانا چاہیے [؟]
لازمی
مناسب نام/جگہ کا نام
"قسطنطنیہ"
محتاط
لازمی
نمبر/تاریخ
"1867" بمقابلہ "1857"
خطرناک
لازمی
صفحہ کی ترتیب (کالم/فٹ نوٹ)
مخلوط بہاؤ
جزوی طور پر
لازمی
ایک جملے میں تصویر کا خلاصہ کرنے کے لیے: AI قابل اعتماد طریقے سے عام کردار کی غلطیوں کو صاف کرتا ہے۔ لیکن خاص ناموں، نمبروں، تاریخوں اور ناقابل پڑھے جانے والے مقامات کے لیے انسانی آنکھیں درکار ہیں۔
تین چھوٹے مقدمات
کیس 1 - اخبارات کے محفوظ شدہ دستاویزات قابل تلاش بن گئے۔ یونیورسٹی کی ایک لائبریری نے 1930 کی دہائی کے مقامی اخبارات کے 12,000 صفحات کو ڈیجیٹل کیا ہے۔ خام OCR درستگی کا تخمینہ 82% تھا (ہر 100 میں سے 18 حروف غلط تھے)۔ اخباری زبان کے لیے موزوں لغت اور سیاق و سباق کے ساتھ AI پر مبنی اصلاح نے درستگی کو 96% تک بڑھا دیا۔ باقی غلطیوں کے لیے، مکمل متن کی بجائے ایک نمونہ چیک کیا گیا تھا۔ مجموعہ 3 ہفتوں میں قابل تلاش ہو گیا۔
کیس 2 - AI "درست" اور مسخ شدہ تاریخ۔ ایک آرکائیوسٹ نے AI کو OCR پرنٹ آؤٹ پر "1863" کی تاریخ درست کر دی تھی۔ AI نے سیاق و سباق میں ایک اور واقعہ کو دیکھ کر تاریخ کو "درست" کر کے "1868" کر دیا - حالانکہ دستاویز میں واضح طور پر 1863 کہا گیا ہے۔ اگر آرکائیوسٹ نے اصل تصویر کو نہ دیکھا ہوتا تو کیٹلاگ غلط تاریخ کے ساتھ داخل ہو جاتا۔ سبق: نمبر اور تاریخیں کبھی بھی AI پر نہیں چھوڑی جاتیں، ان کی تصدیق تصویر سے ہوتی ہے۔
کیس 3 - دو کالم صفحہ الجھا ہوا ہے۔ 19ویں صدی کی سالانہ کتاب کے دو کالم صفحات کو OCR میں ایک ہی سلسلے میں ملایا گیا اور جملے آپس میں جڑے ہوئے تھے۔ خام پیداوار پڑھنے کے قابل نہیں تھی۔ متن میں اس وقت بہتری آئی جب میں نے پہلی بار صفحہ کی ترتیب کو خطوں (سیگمنٹیشن) میں تقسیم کیا اور ہر کالم کو الگ سے پروسیس کیا۔ سبق: پیچیدہ صفحہ کی ترتیب میں، ساخت پہلے، متن دوسرا۔
چار کاپی کرنے کے قابل ٹیمپلیٹس
1) محفوظ OCR اصلاح:
ذیل میں ایک تاریخی دستاویز کا خام OCR آؤٹ پٹ ہے۔ آپ کا کام صرف نظری شناخت کی واضح غلطیوں کو درست کرنا ہے (جیسے rn→m,1→l, 0→O, long ſ→s)۔ قواعد: (1) عبارت کے معنی بیان کریں۔ (2) ناقابل پڑھنے/مبہم الفاظ کو درست کریں، جیسا ہے چھوڑ دیں اور [?] سے نشان زد کریں۔ (3) جملے کو شامل کرنا، ہٹانا یا مکمل کرنا نہیں۔ (4) نمبر اور تاریخیں تبدیل کریں۔ اگر شک ہو تو [نمبر؟] کو نشان زد کریں۔ خام OCR: [یہاں]
2) او سی آر کوالٹی رپورٹ:
ذیل میں OCR آؤٹ پٹ کا جائزہ لیں اور کوالٹی رپورٹ تیار کریں: (1) شناخت کی ممکنہ غلطیوں کے ساتھ الفاظ کی فہرست بنائیں، (2) ایسے علاقوں کو نشان زد کریں جو پڑھے نہیں جا سکتے/غیر واضح نظر آتے ہیں، (3) مخصوص ناموں، تاریخوں اور نمبروں کی فہرست بنائیں جن کی انسانی جانچ کی ضرورت ہوتی ہے۔ درست نہ کریں؛ صرف چیک لسٹ بنائیں۔ متن: [یہاں]
3) کالم/سٹرکچر پارس کرنے میں مدد:
چونکہ نیچے کا OCR متن دو کالم والے صفحہ سے آتا ہے، اس لیے بہاؤ الجھن کا شکار ہو سکتا ہے۔ متن کو منطقی پیراگراف میں دوبارہ ترتیب دیں لیکن کوئی بھی لفظ تبدیل، شامل یا حذف نہ کریں۔ بس ترتیب درست کریں۔ اس آرڈر کو نشان زد کریں جس کے بارے میں آپ کو یقین نہیں ہے [order?]۔ متن: [یہاں]
4) معیاری زبان کو معمول بنانا (اختیاری، علیحدہ پرت):
ذیل میں درست تاریخی متن کے اوپر، ایک الگ کالم میں، آج کے ہجے میں پڑھنے کا ایک آسان ورژن تیار کریں۔ اصل متن کو کبھی تبدیل نہ کریں؛ آسان بنانے کو ایک الگ پرت ہونے دیں۔ معنی شامل کیے بغیر صرف ہجے / تلفظ کو اپ ڈیٹ کریں۔ اصل: [یہاں]
کمزور فوری / مضبوط اشارہ
کمزور:
اس OCR متن کو درست اور خوبصورت بنائیں۔
"خوبصورت" AI کو متن کو دوبارہ لکھنے، بھول چوک کرنے اور مواد کی تشریح کرنے کی اجازت دیتا ہے۔ وفاداری توڑتا ہے.
مضبوط:
اس خام OCR آؤٹ پٹ میں صرف آپٹیکل ریکگنیشن کی خرابیوں کو درست کریں۔ معنی کی تشریح نہ کریں، الفاظ کا اضافہ/حذف کریں، ناقابل پڑھے ہوئے حصوں کو [?] کے ساتھ چھوڑیں، نمبر اور تاریخیں تبدیل کریں۔ آپ جو بھی تصحیح کرتے ہیں اسے الگ فہرست میں "اصل → اصلاح" کی شکل میں دکھائیں تاکہ میں اس کی تصدیق کر سکوں۔ متن: [یہاں]
فرق: پابند ڈیوٹی، من گھڑت پر پابندی، ابہام کو نشان زد کرنا، اور تصحیح کی قابل فہرست فہرست آؤٹ پٹ کو قابل سماعت بناتی ہے۔
عام غلطیاں
- کم ریزولوشن پر اسکیننگ۔ زیادہ تر OCR غلطیاں خراب تصاویر کی وجہ سے ہوتی ہیں۔ کوالٹی اسکیننگ سب سے سستی سرمایہ کاری ہے۔
- AI کو "خوبصورت بنانا" کہتے ہیں۔ اس سے وفاداری کی بجائے روانی پیدا ہوتی ہے۔ دستاویز دوبارہ لکھی جاتی ہے۔
- نمبروں اور تاریخوں کو AI پر چھوڑنا۔ سیاق و سباق سے "درست" ہونے پر یہ خاموشی سے خراب ہو جاتے ہیں۔ تصویر کے ذریعے تصدیق ہونی چاہیے۔
- ایک اندازے کے ساتھ ناقابل پڑھنے والے حصے کو بھرنا۔ اسے غیر یقینی صورتحال سے محفوظ کیا جانا چاہیے، نہ کہ بنا۔
- نمونے لینے کے بجائے بالکل کنٹرول نہیں کر رہے ہیں۔ یہاں تک کہ 96% درستگی کا مطلب ہے 12,000 صفحات میں ہزاروں غلطیاں۔ نازک علاقوں کو اسکین کیا جاتا ہے۔
خلاصہ میں
OCR پرنٹ شدہ تاریخی دستاویزات کو قابل تلاش متن میں تبدیل کرکے محققین کے لیے آرکائیوز کھولتا ہے۔ سیاق و سباق کے ساتھ خام OCR آؤٹ پٹ میں کردار کی غلطیوں کو درست کرنے میں AI ایک طاقتور مدد ہے۔ لیکن آپ کو ترمیم اور دوبارہ لکھنے کے درمیان لائن کھینچنا ہوگی۔ اعلیٰ معیار کی اسکیننگ، محفوظ اصلاحی ہدایات، [?] کے ساتھ ابہام کا تحفظ، اور ناموں/تاریخوں/نمبروں کی انسانی آنکھ سے تصدیق ڈیجیٹائزیشن کو تیز اور قابل اعتماد بناتی ہے۔ AI متن کو صاف کرتا ہے۔ آپ وفاداری کے محافظ ہیں۔
درخواست کا کام
ایک پرنٹ شدہ تاریخی دستاویز (پرانا اخبار، سرکاری خط، کتاب کا صفحہ) اسکین کریں یا OCR پرنٹ آؤٹ لیں۔ متن کو "محفوظ OCR اصلاح" ٹیمپلیٹ کے ساتھ درست کریں اور "اصل → اصلاح" فہرست کے ذریعے اصلاح کی درخواست کریں۔ پھر، "OCR کوالٹی رپورٹ" کے ساتھ ان علاقوں کو ہٹا دیں جن کے لیے انسانی کنٹرول کی ضرورت ہوتی ہے۔ فہرست میں موجود ہر تاریخ اور مناسب نام کا اصل تصویر سے موازنہ کریں۔ نوٹ کریں کہ کتنے کو غلط طریقے سے "درست" کیا گیا تھا۔
چیک لسٹ
- میں نے دستاویز کو کم از کم 300 DPI اور اچھے کنٹراسٹ کے ساتھ اسکین کیا۔
- [ ] میں نے صرف AI سے آپٹیکل غلطی کی اصلاح کے لیے کہا تھا، دوبارہ لکھنے کے لیے نہیں۔
- [ ] میں نے ناقابل پڑھنے والے حصوں کو [؟] کے ساتھ محفوظ کیا۔
- میں نے تصویر کے ساتھ تمام نمبروں، تاریخوں اور مناسب ناموں کی تصدیق کی۔
- میں نے نازک علاقوں میں ایک نمونہ یا مکمل چیک کیا۔