бирдиги 2 / 12

Документти санариптештирүү жана OCR: Басылган текстти машиналык текстке айландыруу

Пайдалар:

  • Этап-этабы менен санариптештирүү жана OCR иш процессин (сканерлөө, алдын ала иштетүү, таануу, оңдоо, текшерүү) орнотуу мүмкүнчүлүгү
  • Оңдоп-түзөө жана кайра жазуу сызыгын сактап, түшүнүксүздүктү [?] менен белгилөө менен контекст менен OCR каталарын оңдоо үчүн AI колдонуу мүмкүнчүлүгү
  • Эмне үчүн сандар, даталар жана тиешелүү аталыштар визуалдык түрдө текшерилиши керек жана сапатты көзөмөлдөөнүн ролун түшүнүңүз.

Архивдин же китепкананын физикалык текчелериндеги миллиондогон баракчалар санариптештирилип, издөөгө мүмкүн болгондо гана изилдөөчү үчүн чындап ачылат. Санариптештирүү - бул физикалык документти сканерлөө же сүрөткө тартуу аркылуу санариптик сүрөткө айландыруу. Бирок барактын сүрөтү али "текст" эмес; Компьютер үчүн бул дагы эле сүрөт, аны издөөгө болбойт. Бул жерде OCR ойнойт.

OCR (Optical Character Recognition) - документтин сүрөттөлүшүндөгү басылган тамгаларды таанып, аларды машина окуй турган, изделүүчү текстке айландыруучу технология. Бул бөлүмдө сиз OCR менен тарыхый басып чыгарылган документтерди кантип санариптештирүү керектигин, AI бул процессте OCR каталарын оңдоого кантип жардам бергенин жана адамдын көзү кайсы жерде маанилүү экенин билесиз. (Колжазма тексттер башка технологияны талап кылат; биз бул тууралуу кийинки бөлүмдө карайбыз.)

Санариптештирүү процесси: этап-этабы менен

1. Даярдоо жана кароо. Документти эң жогорку сапатта сканерлеңиз. Тарыхый изилдөөнүн жалпы эрежеси - бул эң аз дегенде 300-400 DPI (дюймге чекиттер) чечими. Төмөн токтом, кийинки OCR баскычында ката ылдамдыгын жогорулатат.

2. Сүрөттү алдын ала иштетүү. OCR алдында сүрөттү өркүндөтүү ийгиликти бир топ жогорулатат: сканерленген баракты тегиздөө, тактарды кетирүү, контрастты жогорулатуу, ак-карага өзгөртүү. Заманбап AI негизделген куралдар бул кадамды автоматташтыра алат.

3. OCR колдонмосу. Сиз сүрөттү OCR кыймылдаткычына бересиз; Мотор тамгаларды тааныйт жана текстти чыгарат. Чыгуу адатта эки катмардан турат: көрүнүүчү документтин сүрөтү жана астындагы "изделүүчү жашыруун текст катмары".

4. оңдоо (түзөтүүдөн кийинки). Чийки OCR чыгаруу эч качан идеалдуу болбойт. Символдор эски шрифттерден, саргайган кагаздан, сыя булгангандыктан жана сканерлөө каталарынан улам туура эмес окулат. Бул жерде AI күчтүү жардамчы болуп саналат: контекстти колдонуу менен OCR каталарын сунуштайт жана оңдойт.

5. Текшерүү жана сапатты көзөмөлдөө. Оңдолгон текст адам тарабынан үлгү негизинде же толугу менен текшерилет. Өзгөчө аттары, даталары жана сандары сыяктуу маанилүү жерлер визуалдык түрдө текшерилиши керек.

Эмне үчүн OCR ката кетирет, AI кантип жардам берет

Тарыхый документтерде OCRди талашкан типтүү көйгөйлөр: эски жана кооз шрифттер, узун "s" (ſ) сыяктуу эскирген тамгалар, эки тилкелүү барактын макети, шилтемелер, кол менен жазылган кошумчалар, мөөрлөр жана өчүп калган сыя. OCR кыймылдаткычы тамгаларды бир-бирден "көргөндүктөн" көп учурда бинардык "rn" менен "m", "l" тамгасын "1" жана "O" тамгасын "0" деп чаташтырат.

AI тил моделдери бул жерде башка күчтү сунуш кылат: алар контекстти түшүнүшөт. Эгерде OCR кыймылдаткычы "1stanbu1" деп жазса, AI "Стамбул" болушу керек деген контексттен жыйынтык чыгарышы мүмкүн. Бирок бул жерде чоң коркунуч бар: "түзөтүүдө" AI текстти да өзгөртө алат. Болбогон сөздү "мен оңдодум" деп кошуп же түшүнүксүз жерди өз божомолу менен толтурса болот. Бул транскрипциянын тактыгын бузат.

Абайлаңыз: OCR оңдоодогу алтын эреже бул: AI ачык таануу каталарын гана оңдоп, тексттин мазмунун чечмелеп же толуктабашы керек. "1stanbu1 → Стамбул" мыйзамдуу; Бул окулбаган сөздү божомолдор менен толтуруу жөнүндө эмес. Белгисиз жерлер [?] менен белгилениши керек жана аларды түзбөш керек.

OCR катасынын түрлөрү жана таблица менен мамиле

Ката түрү

мисал

AI аны оңдой алабы?

адам башкаруу

тамга аралаштыруу

rn↔m, l↔1, O↔0

Ооба, коопсуз

үлгү

эски тамга

long ſ → s

Ооба, бул коопсуз

үлгү

Өчүрүлгөн/окулбаган сөз

"ka___n"

Жок, коюу керек [?]

милдеттүү

энчилүү аты/жердин аты

"Константинийе"

сак

милдеттүү

Номер/дата

"1867" vs "1857"

тобокелдүү

милдеттүү

Барактын макети (мамыча/шилтеме)

аралаш агым

жарым-жартылай

милдеттүү

Сүрөттү бир сүйлөм менен кыскача айтсак: AI кадимки каарман каталарын ишенимдүү тазалайт; Бирок адамдын көзү атайын ысымдар, сандар, даталар жана окулбаган жерлер үчүн талап кылынат.

үч мини учурлар

1-жагдай — Гезиттин архивдери издөөгө боло баштады. Университеттин китепканасы 1930-жылдардагы жергиликтүү гезиттердин 12 000 барагын санариптештирди. Чийки OCR тактыгы болжолдуу 82%ды түздү (ар бир 100 белгиден 18и туура эмес болгон). AI негизделген оңдоо гезиттин тилине ылайыктуу сөздүк жана контекст менен тактыкты 96% га чейин жогорулатты. Калган каталар үчүн толук тексттин ордуна үлгү текшерүү жүргүзүлдү; Коллекция 3 жуманын ичинде изделүүчү болуп калды.

2-жагдай - AI "түзөтүлгөн" жана бурмаланган тарых. Архивист AI OCR басып чыгарууда "1863" датасын тууралаган. AI контексттеги башка окуяны карап, датаны "1868" деп "түзөттү" - документте 1863-жылы так жазылган болсо да. Эгерде архивист баштапкы сүрөттү карабаганда, каталог туура эмес дата менен кирип калмак. Сабак: сандар жана даталар эч качан AIга калтырылбайт, алар сүрөт менен текшерилет.

3-жагдай — Эки тилкелүү бет чаташтырылган. 19-кылымдын жыл китебинин эки тилкелүү барактары OCRде бир агымга аралашып, сүйлөмдөр чырмалышкан. Чийки чыгарылыш окулбай калды. Мен биринчи жолу барактын макетін аймактарга (сегменттөө) бөлүп, ар бир тилкени өзүнчө иштеткенде текст жакшырды. Сабак: татаал бет макетинде, биринчи структура, экинчи текст.

Көчүрүү үчүн төрт шаблон

1) Коопсуз OCR оңдоо:

Төмөндө тарыхый документтин чийки OCR чыгаруусу келтирилген. Сиздин милдетиңиз ачык оптикалык таануу каталарын ГАНА оңдоо (мисалы, rn→m,1→l, 0→O, long ſ→s). Эрежелер: (1) Тексттин маанисин чечмеле. (2) Окулбаган/кош маанидеги сөздөрдү оңдоп, ошол бойдон калтырып, [?] менен белгилеңиз. (3) Сүйлөмдөрдү кошуу, алып салуу же толуктоо ЖОК. (4) Номерлерди жана даталарды ӨЗГӨРТҮҮ; шектенсеңиз, [санды?] белгилеңиз. Raw OCR: [бул жерде]

2) OCR сапаты боюнча отчет:

Төмөндөгү OCR натыйжасын карап чыгып, сапаттуу отчет түзүңүз: (1) Мүмкүн болгон таануу каталары бар сөздөрдү тизмектеңиз, (2) Окууга мүмкүн эмес/түшүнүксүз көрүнгөн жерлерди белгилеңиз, (3) Адам текшерүүсүн талап кылган конкреттүү ысымдарды, даталарды жана сандарды тизмектеңиз. ОҢДОБОЙТ; текшерүү тизмесин гана түзүү.Текст: [бул жерде]

3) Мамычаны/структураны талдоо боюнча жардам:

Төмөндөгү OCR тексти эки тилкелүү барактан алынгандыктан, агым чаташтырылышы мүмкүн. Текстти логикалык абзацтарга өзгөртүңүз, бирок эч кандай сөздөрдү өзгөртпөңүз, кошпоңуз же жок кылбаңыз. Жөн гана тартипти оңдоңуз. Сиз ишенбеген тартипти [заказ?] менен белгилеңиз. Текст: [бул жерде]

4) Стандарттык тилге нормалдаштыруу (милдеттүү эмес, өзүнчө катмар):

Төмөндөгү оңдолгон тарыхый тексттин ЖОГОРУНДА өзүнчө тилкеде бүгүнкү орфографиядагы жөнөкөйлөштүрүлгөн окуу версиясын чыгарыңыз. ЭЧ КАЧАН оригиналдуу текстти өзгөртпөө; Жөнөкөйлөтүү өзүнчө катмар болсун. Жөн гана маанисин кошпостон жазылышын/айтылышын жаңыртыңыз. Оригинал: [бул жерде]

Алсыз тездик / Күчтүү тездик

Алсыз:

Бул OCR текстин оңдоп, кооздоңуз.

"Сулуулук" AIга текстти кайра жазууга, кемчиликтерди жоюуга жана мазмунду чечмелөөгө мүмкүндүк берет; берилгендикти бузат.

Күчтүү:

Бул чийки OCR чыгарууда ГАНА оптикалык таануу каталарын оңдоңуз. Маанисин чечмелебеңиз, сөздөрдү кошпоңуз/жок кылбаңыз, окулбаган бөлүктөрүн [?] менен калтырбаңыз, сандарды жана даталарды өзгөртүңүз. Ар бир жасаган оңдооңузду "оригинал → оңдоо" форматында өзүнчө тизмеде көрсөтүңүз, мен аны текшере алам. Текст: [бул жерде]

Айырмасы: чектүү милдет, жасалмалоого тыюу салуу, белгилөөнүн эки ачалыгы жана оңдоп-түзөөлөрдүн тизмеси текшерүүгө ылайыктуу кылат.

Жалпы каталар

  • Төмөн дааналыкта сканерлөө. Көпчүлүк OCR каталары начар сүрөттөр менен шартталган; Сапаттуу сканерлөө эң арзан инвестиция.
  • AI "сулуу кылуу" деп аталат. Бул ишенимдүүлүккө караганда эркиндикти жаратат; Документ кайра жазылат.
  • Сандарды жана даталарды AIга калтыруу. Булар контексттен "түзөтүлгөндө" унчукпай бузулат; сүрөт менен текшерилиши керек.
  • Окууга болбой турган жерди божомол менен толтуруу. Аны ойлоп эмес, белгисиздик [?] менен корголушу керек.
  • Үлгү алуунун ордуна такыр көзөмөлдөбөйт. Жада калса 96% тактык 12 000 барактагы миңдеген каталарды билдирет; критикалык аймактар ​​сканерленет.

Кыскача айтканда

OCR басылып чыккан тарыхый документтерди издөөгө мүмкүн болгон текстке айландыруу аркылуу изилдөөчүлөргө архив ачат. AI контекст менен чийки OCR чыгаруудагы каармандардын каталарын оңдоодо күчтүү жардамчы болуп саналат; Бирок сиз түзөтүү менен кайра жазуунун ортосундагы чекти сызышыңыз керек. Жогорку сапаттагы сканерлөө, коопсуз оңдоо нускамалары, [?] менен түшүнүксүздүктү сактоо жана ысымдарды/даталарды/сандарды адамдын көзү менен текшерүү санариптештирүүнү тез жана ишенимдүү кылат. AI текстти тазалайт; Сен ишенимдүүлүктүн сакчысысың.

Колдонмо тапшырмасы

Басылып чыккан тарыхый документти (эски гезит, расмий кат, китеп барагы) сканерлеңиз же OCR басып чыгарыңыз. Текстти "Коопсуз OCR оңдоо" үлгүсү менен оңдоңуз жана "оригинал → оңдоо" тизмеси аркылуу оңдоолорду сураныңыз. Андан кийин, "OCR сапаты отчету" менен адамдын көзөмөлүн талап кылган аймактарды алып салыңыз. Тизмедеги ар бир датаны жана тиешелүү аталышты чыныгы сүрөт менен салыштырыңыз; Канчасы туура эмес "оңдолгонуна" көңүл буруңуз.

текшерүү тизмеси

  • [ ] Мен документти кеминде 300 DPI жана жакшы контраст менен сканерден өткөрдүм.
  • [ ] Мен AIдан кайра жазууну эмес, оптикалык катаны оңдоону гана сурадым.
  • [ ] Мен окулбаган бөлүктөрүн [?] менен коргогом.
  • [ ] Мен бардык сандарды, даталарды жана тиешелүү ысымдарды сүрөт менен тастыктадым.
  • [ ] Мен сындуу аймактарда үлгү же толук текшерүү жасадым.