واحد 2 / 12

دیجیتالی کردن اسناد و OCR: تبدیل متن چاپ شده به متن ماشینی

سود:

  • امکان تنظیم گردش کار دیجیتالی و OCR (اسکن، پیش پردازش، تشخیص، تصحیح، تأیید) مرحله به مرحله
  • امکان استفاده از هوش مصنوعی برای تصحیح خطاهای OCR با زمینه با حفظ خط اصلاح و بازنویسی و علامت گذاری ابهام با [?]
  • درک اینکه چرا اعداد، تاریخ ها و نام های مناسب باید به صورت بصری تأیید شوند و نقش کنترل کیفیت.

میلیون‌ها صفحه در قفسه‌های فیزیکی یک آرشیو یا کتابخانه تنها زمانی به روی محقق باز می‌شوند که دیجیتالی و قابل جستجو شوند. دیجیتالی شدن تبدیل یک سند فیزیکی به تصویر دیجیتال با اسکن یا عکاسی از آن است. اما عکس یک صفحه هنوز «متن» نیست. برای رایانه همچنان یک تصویر است، نمی‌توانید در آن جستجو کنید. اینجاست که OCR وارد عمل می شود.

OCR (تشخیص کاراکتر نوری) فناوری است که حروف چاپ شده را در یک تصویر سند تشخیص می دهد و آنها را به متن قابل خواندن توسط ماشین و قابل جستجو تبدیل می کند. در این بخش، یاد خواهید گرفت که چگونه اسناد چاپ شده تاریخی را با OCR دیجیتالی کنید، چگونه هوش مصنوعی به تصحیح خطاهای OCR در این فرآیند کمک می کند، و در کجا چشم انسان ضروری است. (متن های دست نویس به فناوری متفاوتی نیاز دارند؛ در بخش بعدی به آن خواهیم پرداخت.)

گردش کار دیجیتالی: گام به گام

1. آماده سازی و غربالگری. سند را با بالاترین کیفیت ممکن اسکن کنید. یک قانون کلی برای تحقیقات تاریخی، وضوح حداقل 300-400 DPI (نقطه در اینچ) است. وضوح پایین نرخ خطا را در مرحله OCR بعدی افزایش می دهد.

2. پیش پردازش تصویر. بهبود تصویر قبل از OCR موفقیت را تا حد زیادی افزایش می دهد: پاک کردن صفحه اسکن شده، حذف لکه ها، افزایش کنتراست، تبدیل به سیاه و سفید. ابزارهای مبتنی بر هوش مصنوعی مدرن می توانند این مرحله را خودکار کنند.

3. برنامه OCR. شما تصویر را به موتور OCR تغذیه می کنید. موتور حروف را تشخیص می دهد و متن تولید می کند. خروجی معمولاً از دو لایه تشکیل شده است: تصویر سند قابل مشاهده و یک "لایه متن پنهان قابل جستجو" در زیر آن.

4. تصحیح (پس از تصحیح). خروجی OCR خام هرگز کامل نیست. کاراکترها به دلیل فونت های قدیمی، کاغذ زرد، لکه دار شدن جوهر و خطاهای اسکن اشتباه خوانده می شوند. اینجاست که هوش مصنوعی یک کمک کننده قدرتمند است: خطاهای OCR را با استفاده از زمینه پیشنهاد و تصحیح می کند.

5. تأیید و کنترل کیفیت. متن تصحیح شده توسط انسان به صورت نمونه یا به طور کامل بررسی می شود. به خصوص مناطق حیاتی مانند نام، تاریخ و اعداد باید به صورت بصری تأیید شوند.

چرا OCR اشتباه می کند، هوش مصنوعی چگونه کمک می کند

مشکلات معمولی که OCR را در اسناد تاریخی به چالش می‌کشد: فونت‌های قدیمی و فانتزی، حروف منسوخ مانند «s» طولانی (ſ)، صفحه‌آرایی دو ستونی، پاورقی‌ها، درج‌های دست‌نویس، مهرها، و جوهر محو شده. از آنجایی که یک موتور OCR حروف را یکی یکی می بیند، اغلب "rn" باینری را با "m"، حرف "l" را به عنوان عدد "1" و حرف "O" را به عنوان "0" اشتباه می گیرد.

مدل‌های زبان هوش مصنوعی در اینجا قدرت متفاوتی را ارائه می‌دهند: آن‌ها زمینه را درک می‌کنند. اگر یک موتور OCR «1stanbu1» را نوشته باشد، هوش مصنوعی می‌تواند از متن استنباط کند که باید «استانبول» باشد. اما در اینجا یک خطر بزرگ وجود دارد: هنگام "اصلاح" هوش مصنوعی می تواند متن را نیز تغییر دهد. او می تواند کلمه ای را که وجود ندارد اضافه کند یا با حدس خود جای نامشخصی را پر کند. این امر وفاداری رونویسی را مختل می کند.

احتیاط: قانون طلایی در تصحیح OCR این است: هوش مصنوعی فقط باید خطاهای تشخیص آشکار را تصحیح کند، نه اینکه محتوای متن را تفسیر یا تکمیل کند. "1stanbu1 → استانبول" مشروع است. این در مورد پر کردن یک کلمه ناخوانا با حدس و گمان نیست. مکان های نامشخص باید با [؟] مشخص شوند و نباید ساخته شوند.

انواع خطاهای OCR و رویکرد با جدول

نوع خطا

مثال

آیا هوش مصنوعی می تواند آن را برطرف کند؟

کنترل انسان

اختلاط شخصیت ها

rn↔m، l↔1، O↔0

بله، بی خطر است

نمونه

شکل نامه قدیمی

طولانی ſ → s

بله، بی خطر است

نمونه

کلمه محو / ناخوانا

"ka___n"

نه، باید [؟]

اجباری

نام مناسب / نام مکان

"کنستانتینیه"

مراقب باشید

اجباری

شماره/تاریخ

"1867" در مقابل "1857"

مخاطره آمیز

اجباری

طرح بندی صفحه (ستون/پانوشت)

جریان مختلط

تا حدی

اجباری

برای خلاصه کردن تصویر در یک جمله: هوش مصنوعی به طور قابل اعتمادی خطاهای کاراکتر معمولی را پاک می کند. اما چشم انسان برای اسامی خاص، اعداد، تاریخ ها و مکان های ناخوانا مورد نیاز است.

سه کیف کوچک

مورد 1 - آرشیو روزنامه ها قابل جستجو شد. یک کتابخانه دانشگاهی 12000 صفحه از روزنامه های محلی دهه 1930 را دیجیتالی کرده است. دقت OCR خام 82% تخمین زده شد (18 کاراکتر از هر 100 کاراکتر نادرست بود). تصحیح مبتنی بر هوش مصنوعی با فرهنگ لغت و زمینه مناسب زبان روزنامه، دقت را به 96 درصد افزایش داد. برای خطاهای باقی مانده، یک بررسی نمونه به جای متن کامل انجام شد. این مجموعه در 3 هفته قابل جستجو شد.

مورد 2 - هوش مصنوعی تاریخچه را «تصحیح» و تحریف کرد. یک بایگانی از هوش مصنوعی خواست تا تاریخ "1863" را در چاپ OCR تصحیح کند. هوش مصنوعی با نگاه کردن به رویداد دیگری در زمینه، تاریخ را به «1868» «تصحیح» کرد - حتی اگر سند به وضوح 1863 را نوشته بود. اگر آرشیودار به تصویر اصلی نگاه نمی کرد، کاتالوگ با تاریخ اشتباه وارد می شد. درس: اعداد و تاریخ ها هرگز به هوش مصنوعی سپرده نمی شوند، آنها با تصویر تأیید می شوند.

مورد 3 - صفحه دو ستونی اشتباه گرفته است. صفحات دو ستونی یک سالنامه قرن نوزدهم در یک جریان واحد در OCR مخلوط شدند و جملات در هم تنیده شدند. خروجی خام غیرقابل خواندن بود. وقتی برای اولین بار طرح بندی صفحه را به مناطق (بخش بندی) تقسیم کردم و هر ستون را جداگانه پردازش کردم، متن بهبود یافت. درس: در صفحه آرایی پیچیده، اول ساختار، دوم متن.

چهار قالب قابل کپی

1) تصحیح OCR ایمن:

در زیر خروجی OCR خام یک سند تاریخی است. وظیفه شما این است که فقط خطاهای تشخیص نوری آشکار را تصحیح کنید (به عنوان مثال rn→m،1→l، 0→O، طولانی ſ→s). قوانین: (1) معنای متن را تفسیر کنید. (2) کلمات ناخوانا/ابهام را تصحیح کنید، همانطور که هست رها کنید و با [؟] علامت بزنید. (3) بدون افزودن، حذف یا تکمیل جملات. (4) اعداد و تاریخ را تغییر دهید. اگر شک دارید، [شماره؟] را علامت بزنید. OCR خام: [اینجا]

2) گزارش کیفیت OCR:

خروجی OCR را در زیر بررسی کنید و یک گزارش کیفی تهیه کنید: (1) فهرست کلماتی با خطاهای احتمالی تشخیص، (2) مناطقی را که غیرقابل خواندن/نامفهوم به نظر می رسند علامت گذاری کنید، (3) نام ها، تاریخ ها و اعداد خاصی را فهرست کنید که نیاز به بررسی انسانی دارند. تصحیح نکنید؛ فقط چک لیست تولید کنید. متن: [اینجا]

3) کمک تجزیه ستون/ساختار:

از آنجایی که متن OCR زیر از یک صفحه دو ستونی می آید، ممکن است جریان اشتباه گرفته شود. متن را در پاراگراف های منطقی مرتب کنید اما هیچ کلمه ای را تغییر ندهید، اضافه یا حذف نکنید. فقط دستور رو اصلاح کن ترتیبی را که از آن مطمئن نیستید با [ترتیب؟] علامت بزنید. متن: [اینجا]

4) عادی سازی به زبان استاندارد (اختیاری، لایه جداگانه):

یک نسخه خواندنی ساده شده در املای امروز، در یک ستون جداگانه، بالاتر از متن تاریخی تصحیح شده در زیر تولید کنید. هرگز متن اصلی را تغییر ندهید. بگذارید ساده سازی یک لایه جداگانه باشد. فقط املا/تلفظ را بدون اضافه کردن معنی به روز کنید. اصلی: [اینجا]

اعلان ضعیف / اعلان قوی

ضعیف:

این متن OCR را تصحیح و زیبا کنید.

"Beautify" به هوش مصنوعی اجازه می دهد متن را بازنویسی کند، حذفیات را جبران کند و محتوا را تفسیر کند. وفاداری را می شکند

قوی:

فقط خطاهای تشخیص نوری را در این خروجی OCR خام برطرف کنید. معنی را تفسیر نکنید، کلمات را اضافه/حذف نکنید، قسمت های ناخوانا را با [؟] رها نکنید، اعداد و تاریخ ها را تغییر ندهید. هر اصلاحی را که انجام می‌دهید در یک لیست جداگانه با فرمت "اصلی → تصحیح" نشان دهید تا بتوانم آن را تأیید کنم. متن: [اینجا]

تفاوت: وظیفه محدود، ممنوعیت ساخت، ابهام علامت گذاری، و فهرست قابل ردیابی اصلاحات، خروجی را قابل حسابرسی می کند.

اشتباهات رایج

  • اسکن با وضوح پایین بیشتر خطاهای OCR ناشی از تصاویر بد است. اسکن با کیفیت ارزان ترین سرمایه گذاری است.
  • هوش مصنوعی را «زیبا کن» نامید. این باعث روانی به جای وفاداری می شود. سند بازنویسی شده است.
  • اعداد و تاریخ ها را به هوش مصنوعی واگذار کنید. این‌ها وقتی از متن «تصحیح» شوند، بی‌صدا خراب می‌شوند. باید با تصویر تایید شود
  • پر کردن قسمت ناخوانا با حدس. باید با عدم قطعیت [؟] محافظت شود، نه ساخته شده.
  • اصلا به جای نمونه گیری کنترل نکردن. حتی 96% دقت به معنای هزاران خطا در 12000 صفحه است. مناطق بحرانی اسکن می شوند.

به طور خلاصه

OCR با تبدیل اسناد تاریخی چاپ شده به متن قابل جستجو، آرشیوها را به روی محققان باز می کند. هوش مصنوعی یک کمک قدرتمند در تصحیح خطاهای کاراکتر در خروجی OCR خام با زمینه است. اما باید مرز بین ویرایش و بازنویسی را مشخص کنید. اسکن با کیفیت بالا، دستورالعمل های تصحیح ایمن، حفظ ابهام با [?]، و تأیید چشم انسان از نام ها/تاریخ ها/اعداد، دیجیتالی شدن را سریع و قابل اعتماد می کند. هوش مصنوعی متن را پاک می کند. تو نگهبان وفاداری.

وظیفه کاربردی

یک سند تاریخی چاپ شده (روزنامه قدیمی، نامه رسمی، صفحه کتاب) را اسکن کنید یا یک چاپ OCR بگیرید. متن را با الگوی "اصلاح OCR ایمن" تصحیح کنید و از طریق لیست "اصل → اصلاح" درخواست اصلاح کنید. سپس با «گزارش کیفیت OCR» مناطقی را که نیاز به کنترل انسانی دارند حذف کنید. هر تاریخ و نام مناسب در لیست را با تصویر واقعی مقایسه کنید. توجه داشته باشید که چند مورد به اشتباه "تصحیح" شده اند.

چک لیست

  • [ ] من سند را با حداقل 300 DPI و کنتراست خوب اسکن کردم.
  • [ ] من فقط از AI برای تصحیح خطای نوری درخواست کردم، نه بازنویسی.
  • [ ] از قسمت های ناخوانا با [؟] محافظت کردم.
  • [ ] همه اعداد، تاریخ ها و نام های مناسب را با تصویر تأیید کردم.
  • [ ] من یک نمونه یا بررسی کامل در مناطق بحرانی انجام دادم.