Добици:
- Могућност подешавања процеса дигитализације и ОЦР (скенирање, претходна обрада, препознавање, исправка, верификација) корак по корак
- Могућност коришћења вештачке интелигенције за исправљање ОЦР грешака са контекстом уз одржавање линије за исправку и преписивање и означавање двосмислености са [?]
- Схватите зашто бројеви, датуми и властита имена морају бити визуелно верификовани и улогу контроле квалитета.
Милиони страница на физичким полицама архива или библиотеке истински се отварају истраживачу тек када се дигитализују и могу претраживати. Дигитализација је претварање физичког документа у дигиталну слику скенирањем или фотографисањем. Али фотографија странице још није „текст“; За рачунар је то и даље слика, у њој не можете да претражујете. Овде у игру улази ОЦР.
ОЦР (Оптицал Цхарацтер Рецогнитион) је технологија која препознаје штампана слова на слици документа и претвара их у машински читљив текст који се може претраживати. У овој јединици ћете научити како да дигитализујете историјске штампане документе помоћу ОЦР-а, како АИ помаже у исправљању ОЦР грешака у овом процесу и где је људско око од суштинског значаја. (Руком писани текстови захтевају другачију технологију; то ћемо покрити у следећој јединици.)
Ток рада дигитализације: корак по корак
1. Припрема и скрининг. Скенирајте документ у највишем могућем квалитету. Опште правило за историјско истраживање је резолуција од најмање 300-400 ДПИ (тачака по инчу). Ниска резолуција вртоглаво повећава стопу грешке у следећој ОЦР фази.
2. Предобрада слике. Побољшање слике пре ОЦР-а увелико повећава успех: уклањање искоса скениране странице, уклањање мрља, повећање контраста, претварање у црно-бело. Модерни алати засновани на вештачкој интелигенцији могу да аутоматизују овај корак.
3. ОЦР апликација. Убаците слику у ОЦР машину; Мотор препознаје слова и производи текст. Излаз се обично састоји од два слоја: видљиве слике документа и „претраживог слоја скривеног текста“ испод.
4. Исправка (пост-исправка). Сирови ОЦР излаз никада није савршен. Знакови се погрешно читају због старих фонтова, пожутелог папира, размазивања мастила и грешака при скенирању. Овде је АИ моћан помоћник: предлаже и исправља ОЦР грешке користећи контекст.
5. Верификација и контрола квалитета. Исправљени текст проверава човек на основу узорка или у потпуности. Посебно критичне области као што су имена, датуми и бројеви морају се визуелно проверити.
Зашто ОЦР прави грешке, како АИ помаже
Типични проблеми који изазивају ОЦР у историјским документима: стари и фенси фонтови, застарели облици слова као што је дугачко „с“ (ſ), изглед странице у две колоне, фусноте, руком писани уметци, печати и избледело мастило. Пошто ОЦР машина "види" слова једно по једно, често збуњује бинарно "рн" као "м", слово "л" као број "1" и слово "О" као "0".
Модели АИ језика овде нуде другачију моћ: разумеју контекст. Ако је ОЦР механизам написао „1станбу1“, АИ би из контекста могао да закључи да би то требало да буде „Истанбул“. Али овде постоји велика опасност: када "исправља" АИ такође може да промени текст. Може да дода „исправио сам“ непостојећу реч или да попуни нејасно место сопственом претпоставком. Ово нарушава верност транскрипције.
Опрез: Златно правило у ОЦР корекцији је следеће: АИ треба да исправља само очигледне грешке у препознавању, а не да тумачи или допуњује садржај текста. „1станбу1 → Истанбул“ је легитиман; Не ради се о попуњавању нечитљиве речи нагађањима. Неизвесна места треба означити са [?] и не треба их измишљати.
Врсте ОЦР грешака и приступ са табелом
Врста грешке
пример
Може ли АИ то поправити?
људска контрола
мешање карактера
рн↔м, л↔1, О↔0
Да, безбедно је
узорак
стари облик писма
дуго ſ → с
Да, безбедно је
узорак
Избледела/нечитка реч
"ка___н"
Не, треба ставити [?]
обавезна
право име/име места
"Константиније"
опрезно
обавезна
Број/датум
„1867“ против „1857“
ризично
обавезна
Изглед странице (колона/фуснота)
мешовити ток
делимично
обавезна
Да резимирамо слику у једној реченици: АИ поуздано чисти обичне грешке карактера; Али људске очи су потребне за посебна имена, бројеве, датуме и нечитљива места.
три мини кофера
Случај 1 — Архиве новина су постале претраживе. Универзитетска библиотека је дигитализовала 12.000 страница локалних новина из 1930-их. Тачност сировог ОЦР-а је процењена на 82% (18 од сваких 100 знакова је било нетачно). Корекција заснована на вештачкој интелигенцији повећала је прецизност на 96% помоћу речника и контекста који је прикладан за новински језик. За преостале грешке, извршена је провера узорка уместо целог текста; Колекција је постала претражива за 3 недеље.
Случај 2 — АИ „исправљена“ и искривљена историја. Архивар је дао АИ да исправи датум „1863“ на ОЦР испису. АИ је „исправио“ датум у „1868“ гледајући други догађај у контексту — иако је у документу јасно писало 1863. Да архивар није погледао оригиналну слику, каталог би ушао са погрешним датумом. Поука: бројеви и датуми се никада не препуштају АИ, они се проверавају сликом.
Случај 3 — Збркана страница са две колоне. Странице од две колоне годишњака из 19. века помешане су у један ток у ОЦР-у и реченице су биле испреплетене. Сирови излаз је био нечитљив. Текст се побољшао када сам први пут поделио изглед странице на регионе (сегментација) и обрадио сваку колону посебно. Лекција: у сложеном изгледу странице, структура прво, текст други.
Четири шаблона за копирање
1) Сигурна ОЦР корекција:
Испод је сирови ОЦР излаз историјског документа. Ваш задатак је да исправите САМО очигледне грешке оптичког препознавања (нпр. рн→м,1→л, 0→О, дуго ſ→с). Правила: (1) Протумачити значење текста. (2) Исправите нечитљиве/двосмислене речи, оставите како јесте и означите са [?]. (3) БЕЗ додавања, уклањања или довршавања реченица. (4) ПРОМЕНИ бројеве и датуме; означите [број?] ако сте у недоумици. Рав ОЦР: [овде]
2) Извештај о квалитету ОЦР:
Прегледајте ОЦР излаз у наставку и направите извештај о квалитету: (1) Наведите речи са могућим грешкама у препознавању, (2) Означите области које се чине нечитљивим/нејасним, (3) Наведите специфична имена, датуме и бројеве који захтевају проверу од стране људи. НЕ исправљајте; генерише само контролну листу. Текст: [овде]
3) Помоћ за рашчлањивање колоне/структуре:
Пошто ОЦР текст у наставку долази са странице са две колоне, ток може бити збуњен. Преуредите текст у логичне пасусе АЛИ немојте мењати, додавати или брисати ниједну реч. Само исправите редослед. Означите редослед у који нисте сигурни са [ред?]. Текст: [овде]
4) Нормализација на стандардни језик (опционо, посебан слој):
Направите поједностављену верзију за читање данашњим правописом, у посебној колони, ИЗНАД исправљеног историјског текста испод. НИКАДА не мењајте ОРИГИНАЛНИ текст; Нека поједностављење буде посебан слој. Само ажурирајте правопис/изговор без додавања значења. Оригинал: [овде]
Слаби промпт / Јаки промпт
слаба:
Исправите и улепшајте овај ОЦР текст.
„Улепшавање“ омогућава вештачкој интелигенцији да препише текст, надокнади пропусте и тумачи садржај; разбија лојалност.
Јака:
Поправи САМО грешке оптичког препознавања у овом сировом ОЦР излазу. Немојте тумачити значење, додавати/брисати речи, остављати нечитљиве делове са [?], мењати бројеве и датуме. Покажите сваку исправку коју направите у посебној листи у формату „оригинал → исправка“ да бих могао да је проверим. Текст: [овде]
Разлика: ограничена обавеза, забрана фабрикације, двосмисленост означавања и листа исправки која се може пратити чине излаз подложним ревизији.
Уобичајене грешке
- Скенирање у ниској резолуцији. Већина ОЦР грешака је узрокована лошим сликама; Квалитетно скенирање је најјефтинија инвестиција.
- Позивање АИ „учини лепим“. Ово производи течност пре него верност; Документ је поново написан.
- Остављајући бројеве и датуме АИ. Они се тихо кваре када се „исправљају“ из контекста; мора бити потврђено сликом.
- Попуњавање нечитљивог подручја нагађањем. Требало би да буде заштићено неизвесношћу [?], а не измишљено.
- Уопште не контролише уместо узорковања. Чак 96% тачности значи хиљаде грешака на 12.000 страница; критична подручја се скенирају.
Укратко
ОЦР отвара архиве истраживачима претварањем штампаних историјских докумената у текст који се може претраживати. АИ је моћна помоћ у исправљању грешака карактера у сировом ОЦР излазу са контекстом; Али морате повући границу између уређивања и поновног писања. Висококвалитетно скенирање, инструкције за безбедну корекцију, очување двосмислености са [?] и верификација имена/датума/бројева људским оком чине дигитализацију брзом и поузданом. АИ чисти текст; Ти си чувар верности.
Задатак апликације
Скенирајте штампани историјски документ (старе новине, службено писмо, страницу књиге) или узмите ОЦР испис. Исправите текст помоћу шаблона „Безбедна ОЦР корекција“ и затражите исправке преко листе „оригинал → исправка“. Затим уклоните области које захтевају људску контролу помоћу „ОЦР извештаја о квалитету“. Упоредите сваки датум и право име на листи са стварном сликом; Обратите пажњу колико их је погрешно „исправљено“.
контролна листа
- [ ] Скенирао сам документ са најмање 300 ДПИ и добрим контрастом.
- [ ] Тражио сам од АИ само оптичку корекцију грешака, а не поновно писање.
- [ ] Нечитљиве делове сам заштитио са [?].
- [ ] Проверио сам све бројеве, датуме и властита имена са сликом.
- [ ] Направио сам узорак или пуну проверу у критичним областима.