Yksikkö 2 / 12

Asiakirjojen digitointi ja tekstintunnistus: painetun tekstin muuntaminen konetekstiksi

Voitot:

  • Mahdollisuus asettaa digitalisoinnin ja OCR:n työnkulku (skannaus, esikäsittely, tunnistus, korjaus, varmennus) askel askeleelta
  • Mahdollisuus käyttää tekoälyä OCR-virheiden korjaamiseen kontekstin kanssa samalla kun säilytetään korjaus- ja uudelleenkirjoitusrivi ja merkitään epäselvyys [?]
  • Ymmärrä, miksi numerot, päivämäärät ja erisnimet on tarkastettava visuaalisesti sekä laadunvalvonnan rooli.

Arkiston tai kirjaston fyysisten hyllyjen miljoonat sivut avautuvat tutkijalle todella vasta, kun ne digitoidaan ja haettavissa. Digitalisointi on fyysisen asiakirjan muuntamista digitaaliseksi kuvaksi skannaamalla tai valokuvaamalla se. Mutta sivun valokuva ei ole vielä "tekstiä"; Tietokoneelle se on edelleen kuva, et voi hakea siitä. Tässä OCR tulee peliin.

OCR (Optical Character Recognition) on tekniikka, joka tunnistaa tulostetut kirjaimet asiakirjan kuvassa ja muuntaa ne koneellisesti luettavaksi, haettavaksi tekstiksi. Tässä osiossa opit digitoimaan historiallisia painettuja asiakirjoja OCR:llä, kuinka tekoäly auttaa korjaamaan tekstintunnistusvirheet tässä prosessissa ja missä ihmissilmä on välttämätön. (Käsin kirjoitetut tekstit vaativat erilaista tekniikkaa; käsittelemme sitä seuraavassa osiossa.)

Digitalisoinnin työnkulku: askel askeleelta

1. Valmistelu ja seulonta. Skannaa asiakirja korkeimmalla mahdollisella laadulla. Historiatutkimuksen yleinen peukalosääntö on vähintään 300-400 DPI (dots per inch) resoluutio. Alhainen resoluutio nostaa virhetasoa myöhemmässä OCR-vaiheessa.

2. Kuvan esikäsittely. Kuvan parantaminen ennen tekstintunnistusta lisää huomattavasti menestystä: skannatun sivun vinouttaminen, epäpuhtauksien poistaminen, kontrastin lisääminen, muuntaminen mustavalkoiseksi. Nykyaikaiset tekoälypohjaiset työkalut voivat automatisoida tämän vaiheen.

3. OCR-sovellus. Syötät kuvan OCR-moottoriin; Moottori tunnistaa kirjaimet ja tuottaa tekstiä. Tuloste koostuu yleensä kahdesta kerroksesta: näkyvästä dokumentin kuvasta ja sen alla olevasta "haettavasta piilotekstikerroksesta".

4. Korjaus (jälkikorjaus). Raaka OCR-tulostus ei ole koskaan täydellinen. Merkit luetaan väärin vanhojen fonttien, kellastuneen paperin, musteen tahriintumisen ja skannausvirheiden vuoksi. Tässä tekoäly on tehokas apulainen: se ehdottaa ja korjaa OCR-virheet kontekstin avulla.

5. Todentaminen ja laadunvalvonta. Ihminen tarkistaa korjatun tekstin otospohjaisesti tai kokonaan. Erityisen tärkeät alueet, kuten nimet, päivämäärät ja numerot, on tarkistettava silmämääräisesti.

Miksi OCR tekee virheitä, miten tekoäly auttaa

Tyypillisiä ongelmia, jotka haastavat OCR:n historiallisissa asiakirjoissa: vanhat ja hienot kirjasimet, vanhentuneet kirjainmuodot, kuten pitkät "s" (ſ), kaksisarakkeinen sivuasettelu, alaviitteet, käsinkirjoitetut lisäykset, sinetit ja haalistunut muste. Koska OCR-moottori "näkee" kirjaimet yksitellen, se sekoittaa usein binaarisen "rn":n "m":ksi, kirjaimen "l" numeroksi "1" ja kirjaimen "O":ksi "0".

AI-kielimallit tarjoavat tässä erilaisen voiman: ne ymmärtävät kontekstin. Jos OCR-moottori kirjoitti "1stanbu1", tekoäly voisi päätellä kontekstista, että sen pitäisi olla "Istanbul". Mutta tässä on suuri vaara: "korjattaessa" AI voi myös muuttaa tekstiä. Hän voi lisätä "korjasin" olemattoman sanan tai täyttää epäselvän paikan omalla arvauksellaan. Tämä häiritsee transkription tarkkuutta.

Varoitus: OCR-korjauksen kultainen sääntö on tämä: tekoälyn tulee korjata vain ilmeiset tunnistusvirheet, ei tulkita tai täydentää tekstin sisältöä. "1stanbu1 → Istanbul" on laillinen; Kyse ei ole lukukelvottoman sanan täyttämisestä arvauksilla. Epävarmat paikat tulee merkitä [?]-merkillä, eikä niitä saa keksiä.

OCR-virhetyypit ja lähestymistapa taulukon avulla

Virhetyyppi

esimerkki

Voiko tekoäly korjata sen?

ihmisen hallinta

hahmojen sekoitus

rn↔m, l↔1, O↔0

Kyllä, se on turvallista

näyte

vanha kirjelomake

pitkä ſ → s

Kyllä, se on turvallista

näyte

Haalistunut / lukukelvoton sana

"ka___n"

Ei, pitäisikö laittaa [?]

pakollinen

oikea nimi/paikannimi

"Constantiniyye"

varovainen

pakollinen

Numero/päivämäärä

"1867" vs "1857"

riskialtista

pakollinen

Sivun asettelu (sarake/alaviite)

sekoitettu virtaus

osittain

pakollinen

Yhteenvetona kuva yhteen lauseeseen: AI puhdistaa luotettavasti tavalliset merkkivirheet; Mutta ihmissilmiä tarvitaan erityisiin nimiin, numeroihin, päivämääriin ja lukukelvottomiin paikkoihin.

kolme minilaukkua

Tapaus 1 – Sanomalehtien arkistoista tuli haettavissa. Yliopiston kirjasto on digitoinut 12 000 sivua paikallisia sanomalehtiä 1930-luvulta. Raaka OCR-tarkkuus oli arviolta 82 % (18 100 merkistä oli virheellisiä). Tekoälypohjainen korjaus lisäsi tarkkuuden 96 prosenttiin sanomalehden kielelle sopivalla sanakirjalla ja kontekstilla. Jäljelle jääneiden virheiden osalta suoritettiin näytetarkistus koko tekstin sijaan. Kokoelma tuli haettavaksi 3 viikossa.

Tapaus 2 – AI "korjattu" ja vääristynyt historia. Arkistonhoitaja korjasi tekoälyn päivämäärän "1863" OCR-tulosteeseen. Tekoäly "korjasi" päivämäärän "1868" tarkastelemalla toista tapahtumaa kontekstissa - vaikka asiakirjassa oli selkeästi vuosi 1863. Jos arkistonhoitaja ei olisi katsonut alkuperäistä kuvaa, luettelo olisi mennyt väärällä päivämäärällä. Oppitunti: numeroita ja päivämääriä ei koskaan jätetä tekoälylle, vaan ne varmistetaan kuvan avulla.

Tapaus 3 – Kaksisarakkeinen sivu sekaisin. 1800-luvun vuosikirjan kaksisarakkeiset sivut sekoitettiin OCR:ssä yhdeksi virraksi ja lauseet kietoutuivat yhteen. Raakatulostus oli lukukelvoton. Teksti parani, kun ensin jaoin sivun asettelun alueisiin (segmentointi) ja käsittelin jokaisen sarakkeen erikseen. Oppitunti: monimutkainen sivuasettelu, rakenne ensin, teksti sitten.

Neljä kopioitavaa mallia

1) Suojattu OCR-korjaus:

Alla on historiallisen asiakirjan raaka OCR-tulostus. Tehtäväsi on korjata VAIN ilmeiset optiset tunnistusvirheet (esim. rn→m,1→l, 0→O, pitkät ſ→s). Säännöt: (1) tulkitse tekstin merkitys. (2) Korjaa lukemattomat/epäselvät sanat, jätä ennalleen ja merkitse [?]. (3) EI lisätä, poistaa tai täydentää lauseita. (4) MUUTA numeroita ja päivämääriä; merkitse [numero?], jos olet epävarma. Raaka OCR: [täällä]

2) OCR-laaturaportti:

Tutki alla olevaa tekstintunnistustulosta ja luo laaturaportti: (1) Luettele sanat, joissa on mahdollisia tunnistusvirheitä, (2) merkitse alueet, jotka vaikuttavat lukukelvottomalta/epäselviltä, (3) luettele nimet, päivämäärät ja numerot, jotka vaativat ihmisen tarkastamisen. ÄLÄ korjaa; luo vain tarkistuslista.Teksti: [täällä]

3) Sarakkeen/rakenteen jäsennysohje:

Koska alla oleva OCR-teksti tulee kaksisarakkeiselta sivulta, kulku voi olla sekava. Järjestä teksti uudelleen loogisiksi kappaleiksi, MUTTA älä muuta, lisää tai poista sanoja. Korjaa vain järjestys. Merkitse tilaus, josta et ole varma, [tilaus?]. Teksti: [täällä]

4) Normalisointi vakiokieleksi (valinnainen, erillinen kerros):

Tuota yksinkertaistettu lukuversio tämän päivän oikeinkirjoituksella erillisessä sarakkeessa alla olevan korjatun historiallisen tekstin YLÄLLE. ÄLÄ KOSKAAN muuta ALKUPERÄISTÄ ​​tekstiä; Olkoon yksinkertaistaminen erillinen kerros. Päivitä vain oikeinkirjoitus/ääntäminen lisäämättä merkitystä.Alkuperäinen: [täällä]

Heikko kehote / Vahva kehote

Heikko:

Korjaa ja kaunista tätä OCR-tekstiä.

"Beautify" antaa tekoälylle mahdollisuuden kirjoittaa tekstiä uudelleen, korjata puutteita ja tulkita sisältöä; rikkoo uskollisuuden.

Vahva:

Korjaa VAIN optiset tunnistusvirheet tässä käsittelemättömässä OCR-lähdössä. Älä tulkitse merkitystä, lisää/poista sanoja, jätä lukukelvottomiin osiin [?], muuta numeroita ja päivämääriä. Näytä jokainen tekemäsi korjaus erillisessä luettelossa muodossa "alkuperäinen → korjaus", jotta voin varmistaa sen. Teksti: [täällä]

Ero: rajoitettu velvollisuus, valmistuskielto, merkintöjen epäselvyys ja jäljitettävä korjauslista tekevät tuotoksen tarkastettavaksi.

Yleisiä virheitä

  • Skannaus alhaisella resoluutiolla. Useimmat OCR-virheet johtuvat huonoista kuvista; Laadukas skannaus on halvin investointi.
  • Tekoälyä kutsuminen "tee kauniiksi". Tämä tuottaa enemmän sujuvuutta kuin uskollisuutta; Asiakirja kirjoitetaan uudelleen.
  • Numerot ja päivämäärät jätetään tekoälylle. Nämä turmeltuvat hiljaa, kun ne "korjataan" kontekstista; on vahvistettava kuvalla.
  • Lukemattoman alueen täyttäminen arvauksella. Sitä pitäisi suojata epävarmuudella [?], ei keksitty.
  • Ei kontrolloi ollenkaan näytteenoton sijaan. Jopa 96 % tarkkuus tarkoittaa tuhansia virheitä 12 000 sivulla; kriittiset alueet skannataan.

Yhteenvetona

OCR avaa arkistot tutkijoille muuntamalla painetut historialliset asiakirjat haettavaksi tekstiksi. AI on tehokas apu merkkivirheiden korjaamiseen raaka-OCR-tulostuksessa kontekstin kanssa; Mutta sinun on vedettävä raja muokkauksen ja uudelleenkirjoituksen välille. Laadukas skannaus, turvallinen korjausohje, epäselvyyden säilyttäminen [?]:lla ja nimien/päivämäärien/numeroiden ihmissilmätarkistus tekevät digitoinnista sekä nopean että luotettavan. AI puhdistaa tekstin; Olet uskollisuuden vartija.

Sovellustehtävä

Skannaa painettu historiallinen dokumentti (vanha sanomalehti, virallinen kirje, kirjan sivu) tai ota OCR-tuloste. Korjaa teksti "Suojattu OCR-korjaus" -mallilla ja pyydä korjauksia "alkuperäinen → korjaus" -luettelon kautta. Poista sitten alueet, jotka vaativat ihmisen hallinnan "OCR-laaturaportilla". Vertaa kutakin luettelon päivämäärää ja oikeaa nimeä todelliseen kuvaan; Huomaa kuinka monta "korjattiin" väärin.

tarkistuslista

  • [ ] Skannatin asiakirjan vähintään 300 DPI:llä ja hyvällä kontrastilla.
  • [ ] Pyysin tekoälyltä vain optista virheenkorjausta, en uudelleenkirjoitusta.
  • [ ] Suojasin lukukelvottomat osat [?]:lla.
  • [ ] Vahvistin kuvan avulla kaikki numerot, päivämäärät ja oikeat nimet.
  • [ ] Tein näytteen tai täyden tarkistuksen kriittisillä alueilla.