Pelnas:
- Galimybė žingsnis po žingsnio nustatyti skaitmeninimo ir OCR darbo eigą (nuskaitymas, išankstinis apdorojimas, atpažinimas, taisymas, tikrinimas)
- Galimybė naudoti dirbtinį intelektą OCR klaidoms ištaisyti atsižvelgiant į kontekstą, išlaikant taisymo ir perrašymo eilutę bei pažymint dviprasmiškumą [?]
- Supraskite, kodėl skaičiai, datos ir tikrieji vardai turi būti vizualiai patikrinti ir koks yra kokybės kontrolės vaidmuo.
Milijonai puslapių archyvo ar bibliotekos fizinėse lentynose iš tikrųjų atveriami tyrėjui tik tada, kai jie tampa skaitmeninami ir juos galima ieškoti. Skaitmeninimas – tai fizinio dokumento pavertimas skaitmeniniu vaizdu jį nuskaitant arba nufotografuojant. Tačiau puslapio nuotrauka dar nėra „tekstas“; Kompiuteryje tai vis dar vaizdas, jame negalite ieškoti. Čia atsiranda OCR.
OCR (Optical Character Recognition) yra technologija, kuri atpažįsta spausdintas raides dokumento vaizde ir paverčia jas mašininiu būdu nuskaitomu tekstu, kuriame galima ieškoti. Šiame skyriuje sužinosite, kaip skaitmeninti istorinius spausdintus dokumentus naudojant OCR, kaip dirbtinis intelektas padeda ištaisyti OCR klaidas šiame procese ir kur žmogaus akis yra būtina. (Rašytiems tekstams reikalinga kita technologija; mes apie tai pakalbėsime kitame skyriuje.)
Skaitmeninimo darbo eiga: žingsnis po žingsnio
1. Paruošimas ir atranka. Nuskaitykite dokumentą aukščiausia įmanoma kokybe. Bendra istorinių tyrimų nykščio taisyklė – bent 300–400 DPI (taškų colyje) skiriamoji geba. Maža skiriamoji geba labai padidina klaidų dažnį vėlesniame OCR etape.
2. Vaizdo išankstinis apdorojimas. Vaizdo patobulinimas prieš OCR labai padidina sėkmę: nuskaityto puslapio iškreipimas, dėmių pašalinimas, kontrasto padidinimas, nespalvotumas. Šiuolaikiniai dirbtinio intelekto įrankiai gali automatizuoti šį veiksmą.
3. OCR programa. Jūs pateikiate vaizdą į OCR variklį; Variklis atpažįsta raides ir sukuria tekstą. Išvestis paprastai susideda iš dviejų sluoksnių: matomo dokumento vaizdo ir „paieškomo paslėpto teksto sluoksnio“ po juo.
4. Korekcija (pokorekcija). Neapdorota OCR išvestis niekada nėra tobula. Simboliai nuskaitomi neteisingai dėl senų šriftų, pageltusio popieriaus, rašalo ištepimo ir nuskaitymo klaidų. Čia AI yra galingas pagalbininkas: jis siūlo ir ištaiso OCR klaidas naudodamas kontekstą.
5. Patikra ir kokybės kontrolė. Pataisytą tekstą žmogus patikrina pavyzdžiu arba visiškai. Ypač svarbios sritys, tokios kaip pavadinimai, datos ir skaičiai, turi būti patikrintos vizualiai.
Kodėl OCR daro klaidas, kaip AI padeda
Tipiškos problemos, keliančios iššūkių OCR istoriniuose dokumentuose: seni ir įmantrūs šriftai, pasenusios raidžių formos, pvz., ilgos „s“ (ſ), dviejų stulpelių puslapio išdėstymas, išnašos, ranka rašyti intarpai, antspaudai ir išblukęs rašalas. Kadangi OCR variklis „mato“ raides po vieną, jis dažnai painioja dvejetainį „rn“ kaip „m“, raidę „l“ kaip skaičių „1“, o raidę „O“ – kaip „0“.
AI kalbos modeliai čia siūlo kitokią galią: jie supranta kontekstą. Jei OCR variklis parašė „1stanbu1“, AI iš konteksto galėjo daryti išvadą, kad tai turėtų būti „Stambulas“. Tačiau čia yra didelis pavojus: „taisydamas“ AI taip pat gali pakeisti tekstą. Jis gali pridėti „pataisiau“ neegzistuojantį žodį arba užpildyti neaiškią vietą savo spėjimu. Tai sutrikdo transkripcijos tikslumą.
Atsargiai: Auksinė OCR taisymo taisyklė yra tokia: AI turėtų taisyti tik akivaizdžias atpažinimo klaidas, o ne interpretuoti ar papildyti teksto turinį. „1stanbu1 → Stambulas“ yra teisėtas; Tai ne apie neįskaitomo žodžio užpildymą spėlionėmis. Neaiškios vietos turi būti pažymėtos [?] ir neturėtų būti sugalvotos.
OCR klaidų tipai ir požiūris su lentele
Klaidos tipas
pavyzdys
Ar AI gali tai ištaisyti?
žmogaus valdymas
simbolių maišymas
rn↔m, l↔1, O↔0
Taip, tai saugu
mėginys
sena laiško forma
ilgas ſ → s
Taip, tai saugu
mėginys
Išblukęs/neįskaitomas žodis
"ka___n"
Ne, reikėtų įdėti [?]
privalomas
tikras vardas/vietovardis
„Konstantinija“
atsargus
privalomas
Numeris/data
„1867“ prieš „1857“
rizikinga
privalomas
Puslapio išdėstymas (stulpelis / išnaša)
mišrus srautas
dalinai
privalomas
Apibendrinant paveikslėlį vienu sakiniu: AI patikimai išvalo įprastas simbolių klaidas; Tačiau žmogaus akys reikalingos ypatingiems vardams, skaičiams, datoms ir neįskaitomoms vietoms.
trys mini dėklai
1 atvejis – tapo galima ieškoti laikraščių archyvuose. Universiteto biblioteka suskaitmenino 12 000 puslapių XX a. 3 dešimtmečio vietinių laikraščių. Neapdoroto OCR tikslumas buvo maždaug 82 % (18 iš 100 simbolių buvo neteisingi). Dirbtinio intelekto taisymas padidino tikslumą iki 96 %, naudojant laikraščio kalbai tinkamą žodyną ir kontekstą. Dėl likusių klaidų buvo atlikta pavyzdinė, o ne viso teksto patikra; Kolekcija tapo ieškoma per 3 savaites.
2 atvejis – AI „pataisyta“ ir iškraipyta istorija. Archyvas turėjo dirbtiniu intelektu pakoreguoti datą „1863“ OCR spaudinyje. AI „pataisė“ datą į „1868“, pažvelgęs į kitą įvykį kontekste – nors dokumente buvo aiškiai nurodyta 1863 m. Jei archyvaras nebūtų pažiūrėjęs į originalų vaizdą, katalogas būtų įvestas neteisinga data. Pamoka: skaičiai ir datos niekada nepaliekami dirbtiniam intelektui, jie tikrinami naudojant vaizdą.
3 atvejis – supainiotas dviejų stulpelių puslapis. Dviejų stulpelių XIX amžiaus metraščio puslapiai OCR buvo sumaišyti į vieną srautą ir sakiniai susipynę. Neapdorota išvestis buvo neįskaitoma. Tekstas pagerėjo, kai pirmą kartą padalinau puslapio maketą į sritis (segmentacija) ir apdorojau kiekvieną stulpelį atskirai. Pamoka: sudėtingas puslapio išdėstymas, pirmiausia struktūra, antras tekstas.
Keturi kopijuojami šablonai
1) Saugus OCR taisymas:
Toliau pateikiama neapdorota istorinio dokumento OCR išvestis. Jūsų užduotis yra ištaisyti TIK akivaizdžias optinio atpažinimo klaidas (pvz., rn→m,1→l, 0→O, long ſ→s). Taisyklės: (1) Išaiškinkite teksto prasmę. (2) Ištaisykite neįskaitomus / dviprasmiškus žodžius, palikite tokius, kokie yra ir pažymėkite [?]. (3) NEGALIMA pridėti, pašalinti ar užbaigti sakinius. (4) PAKEISTI numerius ir datas; pažymėkite [numeris?], jei abejojate. Neapdorotas OCR: [čia]
2) OCR kokybės ataskaita:
Peržiūrėkite toliau pateiktą OCR išvestį ir sukurkite kokybės ataskaitą: (1) Išvardykite žodžius su galimomis atpažinimo klaidomis, (2) pažymėkite sritis, kurios atrodo neįskaitomos / neaiškios, (3) nurodykite konkrečius pavadinimus, datas ir skaičius, kuriuos reikia patikrinti žmogaus. NETAISYKITE; generuoti tik kontrolinį sąrašą. Tekstas: [čia]
3) Stulpelių/struktūrų analizės pagalba:
Kadangi toliau pateiktas OCR tekstas yra iš dviejų stulpelių puslapio, srautas gali būti supainiotas. Pertvarkykite tekstą į logiškas pastraipas, BET nekeiskite, nepridėkite ir neištrinkite jokių žodžių. Tiesiog pataisykite tvarką. Pažymėkite užsakymą, dėl kurio nesate tikri, naudodami [order?]. Tekstas: [čia]
4) Normalizavimas į standartinę kalbą (neprivaloma, atskiras sluoksnis):
Pateikite supaprastintą skaitymo versiją šios dienos rašyba, atskirame stulpelyje, VIRŠ pataisyto istorinio teksto žemiau. NIEKADA nekeisk ORIGINALŲ teksto; Tegul supaprastinimas yra atskiras sluoksnis. Tiesiog atnaujinkite rašybą / tarimą nepridėdami reikšmės. Originalas: [čia]
Silpnas raginimas / Stiprus raginimas
Silpnas:
Pataisykite ir pagražinkite šį OCR tekstą.
„Gražinti“ leidžia dirbtiniam intelektui perrašyti tekstą, ištaisyti praleidimus ir interpretuoti turinį; pažeidžia lojalumą.
Stiprus:
Ištaisykite TIK optinio atpažinimo klaidas šioje neapdorotoje OCR išvestyje. Neinterpretuokite prasmės, nepridėkite / neištrinkite žodžių, nepalikite neįskaitomų dalių su [?], nekeiskite skaičių ir datų. Rodyti kiekvieną atliktą pataisymą atskirame sąraše formatu „originalas → taisymas“, kad galėčiau jį patikrinti. Tekstas: [čia]
Skirtumas: apribota pareiga, draudimas gaminti, ženklinimo dviprasmiškumas ir atsekamas pataisymų sąrašas leidžia atlikti produkcijos auditą.
Dažnos klaidos
- Nuskaitymas žema raiška. Daugumą OCR klaidų sukelia netinkami vaizdai; Kokybiškas skenavimas yra pigiausia investicija.
- AI vadinimas „padaryti gražią“. Tai sukuria sklandumą, o ne ištikimybę; Dokumentas perrašomas.
- Skaičių ir datų palikimas AI. Tai tyliai sugadinama, kai „pataisoma“ iš konteksto; turi būti patvirtinta pagal vaizdą.
- Neįskaitomos srities užpildymas spėjimu. Jis turėtų būti apsaugotas netikrumo [?], o ne išgalvotas.
- Visiškai nekontroliuoja, o ne atranka. Net 96% tikslumas reiškia tūkstančius klaidų 12 000 puslapių; nuskaitomos kritinės sritys.
Apibendrinant
OCR atveria archyvus tyrėjams konvertuodamas spausdintus istorinius dokumentus į tekstą, kuriame galima ieškoti. AI yra galinga pagalba ištaisant simbolių klaidas neapdorotoje OCR išvestyje su kontekstu; Bet jūs turite nubrėžti ribą tarp redagavimo ir perrašymo. Aukštos kokybės nuskaitymas, saugi taisymo instrukcija, dviprasmybių išsaugojimas naudojant [?] ir vardų / datų / skaičių patikrinimas žmogaus akimis leidžia skaitmeniniu formatu atlikti greitą ir patikimą. AI išvalo tekstą; Jūs esate ištikimybės sargas.
Taikymo užduotis
Nuskaitykite spausdintą istorinį dokumentą (seną laikraštį, oficialų laišką, knygos puslapį) arba paimkite OCR spaudinį. Pataisykite tekstą naudodami šabloną „Saugus OCR taisymas“ ir paprašykite pataisyti per sąrašą „originalas → taisymas“. Tada pašalinkite sritis, kurias reikia kontroliuoti su OCR kokybės ataskaita. Palyginkite kiekvieną sąrašo datą ir tikrąjį vardą su tikruoju vaizdu; Atkreipkite dėmesį, kiek buvo „pataisyta“ neteisingai.
kontrolinis sąrašas
- [ ] Nuskenavau dokumentą bent 300 DPI ir geru kontrastu.
- [ ] Aš paprašiau AI tik ištaisyti optines klaidas, o ne perrašyti.
- [ ] Neįskaitomas dalis apsaugojau [?].
- [ ] Patikrinau visus skaičius, datas ir tikrus vardus su vaizdu.
- [ ] Padariau pavyzdį arba visą patikrinimą kritinėse srityse.