Јединица 2 / 12

Дигитализација документа и ОЦР: претварање штампаног текста у машински текст

Добици:

  • Могућност подешавања процеса дигитализације и ОЦР (скенирање, претходна обрада, препознавање, исправка, верификација) корак по корак
  • Могућност коришћења вештачке интелигенције за исправљање ОЦР грешака са контекстом уз одржавање линије за исправку и преписивање и означавање двосмислености са [?]
  • Схватите зашто бројеви, датуми и властита имена морају бити визуелно верификовани и улогу контроле квалитета.

Милиони страница на физичким полицама архива или библиотеке истински се отварају истраживачу тек када се дигитализују и могу претраживати. Дигитализација је претварање физичког документа у дигиталну слику скенирањем или фотографисањем. Али фотографија странице још није „текст“; За рачунар је то и даље слика, у њој не можете да претражујете. Овде у игру улази ОЦР.

ОЦР (Оптицал Цхарацтер Рецогнитион) је технологија која препознаје штампана слова на слици документа и претвара их у машински читљив текст који се може претраживати. У овој јединици ћете научити како да дигитализујете историјске штампане документе помоћу ОЦР-а, како АИ помаже у исправљању ОЦР грешака у овом процесу и где је људско око од суштинског значаја. (Руком писани текстови захтевају другачију технологију; то ћемо покрити у следећој јединици.)

Ток рада дигитализације: корак по корак

1. Припрема и скрининг. Скенирајте документ у највишем могућем квалитету. Опште правило за историјско истраживање је резолуција од најмање 300-400 ДПИ (тачака по инчу). Ниска резолуција вртоглаво повећава стопу грешке у следећој ОЦР фази.

2. Предобрада слике. Побољшање слике пре ОЦР-а увелико повећава успех: уклањање искоса скениране странице, уклањање мрља, повећање контраста, претварање у црно-бело. Модерни алати засновани на вештачкој интелигенцији могу да аутоматизују овај корак.

3. ОЦР апликација. Убаците слику у ОЦР машину; Мотор препознаје слова и производи текст. Излаз се обично састоји од два слоја: видљиве слике документа и „претраживог слоја скривеног текста“ испод.

4. Исправка (пост-исправка). Сирови ОЦР излаз никада није савршен. Знакови се погрешно читају због старих фонтова, пожутелог папира, размазивања мастила и грешака при скенирању. Овде је АИ моћан помоћник: предлаже и исправља ОЦР грешке користећи контекст.

5. Верификација и контрола квалитета. Исправљени текст проверава човек на основу узорка или у потпуности. Посебно критичне области као што су имена, датуми и бројеви морају се визуелно проверити.

Зашто ОЦР прави грешке, како АИ помаже

Типични проблеми који изазивају ОЦР у историјским документима: стари и фенси фонтови, застарели облици слова као што је дугачко „с“ (ſ), изглед странице у две колоне, фусноте, руком писани уметци, печати и избледело мастило. Пошто ОЦР машина "види" слова једно по једно, често збуњује бинарно "рн" као "м", слово "л" као број "1" и слово "О" као "0".

Модели АИ језика овде нуде другачију моћ: разумеју контекст. Ако је ОЦР механизам написао „1станбу1“, АИ би из контекста могао да закључи да би то требало да буде „Истанбул“. Али овде постоји велика опасност: када "исправља" АИ такође може да промени текст. Може да дода „исправио сам“ непостојећу реч или да попуни нејасно место сопственом претпоставком. Ово нарушава верност транскрипције.

Опрез: Златно правило у ОЦР корекцији је следеће: АИ треба да исправља само очигледне грешке у препознавању, а не да тумачи или допуњује садржај текста. „1станбу1 → Истанбул“ је легитиман; Не ради се о попуњавању нечитљиве речи нагађањима. Неизвесна места треба означити са [?] и не треба их измишљати.

Врсте ОЦР грешака и приступ са табелом

Врста грешке

пример

Може ли АИ то поправити?

људска контрола

мешање карактера

рн↔м, л↔1, О↔0

Да, безбедно је

узорак

стари облик писма

дуго ſ → с

Да, безбедно је

узорак

Избледела/нечитка реч

"ка___н"

Не, треба ставити [?]

обавезна

право име/име места

"Константиније"

опрезно

обавезна

Број/датум

„1867“ против „1857“

ризично

обавезна

Изглед странице (колона/фуснота)

мешовити ток

делимично

обавезна

Да резимирамо слику у једној реченици: АИ поуздано чисти обичне грешке карактера; Али људске очи су потребне за посебна имена, бројеве, датуме и нечитљива места.

три мини кофера

Случај 1 — Архиве новина су постале претраживе. Универзитетска библиотека је дигитализовала 12.000 страница локалних новина из 1930-их. Тачност сировог ОЦР-а је процењена на 82% (18 од сваких 100 знакова је било нетачно). Корекција заснована на вештачкој интелигенцији повећала је прецизност на 96% помоћу речника и контекста који је прикладан за новински језик. За преостале грешке, извршена је провера узорка уместо целог текста; Колекција је постала претражива за 3 недеље.

Случај 2 — АИ „исправљена“ и искривљена историја. Архивар је дао АИ да исправи датум „1863“ на ОЦР испису. АИ је „исправио“ датум у „1868“ гледајући други догађај у контексту — иако је у документу јасно писало 1863. Да архивар није погледао оригиналну слику, каталог би ушао са погрешним датумом. Поука: бројеви и датуми се никада не препуштају АИ, они се проверавају сликом.

Случај 3 — Збркана страница са две колоне. Странице од две колоне годишњака из 19. века помешане су у један ток у ОЦР-у и реченице су биле испреплетене. Сирови излаз је био нечитљив. Текст се побољшао када сам први пут поделио изглед странице на регионе (сегментација) и обрадио сваку колону посебно. Лекција: у сложеном изгледу странице, структура прво, текст други.

Четири шаблона за копирање

1) Сигурна ОЦР корекција:

Испод је сирови ОЦР излаз историјског документа. Ваш задатак је да исправите САМО очигледне грешке оптичког препознавања (нпр. рн→м,1→л, 0→О, дуго ſ→с). Правила: (1) Протумачити значење текста. (2) Исправите нечитљиве/двосмислене речи, оставите како јесте и означите са [?]. (3) БЕЗ додавања, уклањања или довршавања реченица. (4) ПРОМЕНИ бројеве и датуме; означите [број?] ако сте у недоумици. Рав ОЦР: [овде]

2) Извештај о квалитету ОЦР:

Прегледајте ОЦР излаз у наставку и направите извештај о квалитету: (1) Наведите речи са могућим грешкама у препознавању, (2) Означите области које се чине нечитљивим/нејасним, (3) Наведите специфична имена, датуме и бројеве који захтевају проверу од стране људи. НЕ исправљајте; генерише само контролну листу. Текст: [овде]

3) Помоћ за рашчлањивање колоне/структуре:

Пошто ОЦР текст у наставку долази са странице са две колоне, ток може бити збуњен. Преуредите текст у логичне пасусе АЛИ немојте мењати, додавати или брисати ниједну реч. Само исправите редослед. Означите редослед у који нисте сигурни са [ред?]. Текст: [овде]

4) Нормализација на стандардни језик (опционо, посебан слој):

Направите поједностављену верзију за читање данашњим правописом, у посебној колони, ИЗНАД исправљеног историјског текста испод. НИКАДА не мењајте ОРИГИНАЛНИ текст; Нека поједностављење буде посебан слој. Само ажурирајте правопис/изговор без додавања значења. Оригинал: [овде]

Слаби промпт / Јаки промпт

слаба:

Исправите и улепшајте овај ОЦР текст.

„Улепшавање“ омогућава вештачкој интелигенцији да препише текст, надокнади пропусте и тумачи садржај; разбија лојалност.

Јака:

Поправи САМО грешке оптичког препознавања у овом сировом ОЦР излазу. Немојте тумачити значење, додавати/брисати речи, остављати нечитљиве делове са [?], мењати бројеве и датуме. Покажите сваку исправку коју направите у посебној листи у формату „оригинал → исправка“ да бих могао да је проверим. Текст: [овде]

Разлика: ограничена обавеза, забрана фабрикације, двосмисленост означавања и листа исправки која се може пратити чине излаз подложним ревизији.

Уобичајене грешке

  • Скенирање у ниској резолуцији. Већина ОЦР грешака је узрокована лошим сликама; Квалитетно скенирање је најјефтинија инвестиција.
  • Позивање АИ „учини лепим“. Ово производи течност пре него верност; Документ је поново написан.
  • Остављајући бројеве и датуме АИ. Они се тихо кваре када се „исправљају“ из контекста; мора бити потврђено сликом.
  • Попуњавање нечитљивог подручја нагађањем. Требало би да буде заштићено неизвесношћу [?], а не измишљено.
  • Уопште не контролише уместо узорковања. Чак 96% тачности значи хиљаде грешака на 12.000 страница; критична подручја се скенирају.

Укратко

ОЦР отвара архиве истраживачима претварањем штампаних историјских докумената у текст који се може претраживати. АИ је моћна помоћ у исправљању грешака карактера у сировом ОЦР излазу са контекстом; Али морате повући границу између уређивања и поновног писања. Висококвалитетно скенирање, инструкције за безбедну корекцију, очување двосмислености са [?] и верификација имена/датума/бројева људским оком чине дигитализацију брзом и поузданом. АИ чисти текст; Ти си чувар верности.

Задатак апликације

Скенирајте штампани историјски документ (старе новине, службено писмо, страницу књиге) или узмите ОЦР испис. Исправите текст помоћу шаблона „Безбедна ОЦР корекција“ и затражите исправке преко листе „оригинал → исправка“. Затим уклоните области које захтевају људску контролу помоћу „ОЦР извештаја о квалитету“. Упоредите сваки датум и право име на листи са стварном сликом; Обратите пажњу колико их је погрешно „исправљено“.

контролна листа

  • [ ] Скенирао сам документ са најмање 300 ДПИ и добрим контрастом.
  • [ ] Тражио сам од АИ само оптичку корекцију грешака, а не поновно писање.
  • [ ] Нечитљиве делове сам заштитио са [?].
  • [ ] Проверио сам све бројеве, датуме и властита имена са сликом.
  • [ ] Направио сам узорак или пуну проверу у критичним областима.