Eining 2 / 12

Stafræn skjöl og OCR: Umbreytir prentuðum texta í vélartexta

Hagnaður:

  • Geta til að setja upp stafræna og OCR vinnuflæði (skönnun, forvinnsla, viðurkenning, leiðrétting, sannprófun) skref fyrir skref
  • Geta til að nota gervigreind til að leiðrétta OCR villur með samhengi en viðhalda leiðréttingu og endurskrifa línu og merkja tvíræðni með [?]
  • Skilja hvers vegna númer, dagsetningar og eiginnöfn verða að vera sjónrænt sannreynt og hlutverk gæðaeftirlits.

Milljónir síðna á líkamlegum hillum skjalasafns eða bókasafns eru aðeins raunverulega opnaðar fyrir rannsakanda þegar þær verða stafrænar og leitarhæfar. Stafræn væðing er að breyta efnisskjali í stafræna mynd með því að skanna eða mynda það. En ljósmynd af síðu er ekki enn „texti“; Fyrir tölvuna er þetta enn mynd, þú getur ekki leitað í henni. Þetta er þar sem OCR kemur við sögu.

OCR (Optical Character Recognition) er tækni sem þekkir prentaða stafi í skjalamynd og breytir þeim í véllesanlegan, leitarhæfan texta. Í þessari einingu muntu læra hvernig á að stafræna söguleg prentuð skjöl með OCR, hvernig gervigreind hjálpar til við að leiðrétta OCR villur í þessu ferli og hvar mannsaugað er nauðsynlegt. (Handskrifaðir textar krefjast annarrar tækni; við munum fjalla um það í næstu einingu.)

Stafræn verkflæði: skref fyrir skref

1. Undirbúningur og skimun. Skannaðu skjalið í hæsta gæðaflokki. Almenn þumalputtaregla fyrir sagnfræðirannsóknir er upplausn sem er að minnsta kosti 300-400 DPI (punktar á tommu). Lág upplausn stækkar villuhlutfallið á næsta OCR-stigi.

2. Myndaforvinnsla. Að bæta myndina fyrir OCR eykur árangur til muna: að skekkja skannaða síðu, fjarlægja lýti, auka birtuskil, breyta í svarthvítt. Nútíma gervigreindarverkfæri geta gert þetta skref sjálfvirkt.

3. OCR forrit. Þú færð myndina í OCR vélina; Vélin þekkir stafi og framleiðir texta. Úttakið samanstendur venjulega af tveimur lögum: sýnilegu skjalmyndinni og "leitanlegt falið textalag" undir.

4. Leiðrétting (eftirleiðrétting). Raw OCR framleiðsla er aldrei fullkomin. Stafir eru lesnar rangt vegna gamalla leturgerða, gulnaðs pappírs, blekslits og skannaðarvillna. Þetta er þar sem gervigreind er öflugur hjálpari: það stingur upp á og leiðréttir OCR villur með samhengi.

5. Sannprófun og gæðaeftirlit. Leiðrétta textinn er skoðaður af manneskjunni í sýnishorni eða algjörlega. Sérstaklega mikilvæg svæði eins og nöfn, dagsetningar og númer verður að sannreyna sjónrænt.

Hvers vegna OCR gerir mistök, hvernig AI hjálpar

Dæmigert vandamál sem ögra OCR í sögulegum skjölum: gömul og fín leturgerð, úrelt bókstafsform eins og löng „s“ (ſ), tveggja dálka blaðsíðuútlit, neðanmálsgreinar, handskrifuð innskot, innsigli og dofnað blek. Vegna þess að OCR vél "sér" stafi einn í einu, ruglar hún oft saman tvíundaranum "rn" sem "m", bókstafnum "l" sem tölunni "1" og bókstafnum "O" sem "0".

AI tungumálalíkön bjóða upp á annan kraft hér: þau skilja samhengi. Ef OCR vél skrifaði „1stanbu1“ gæti gervigreindin ályktað af samhenginu að það ætti að vera „Istanbul“. En það er mikil hætta hér: þegar þú „leiðréttir“ getur gervigreind líka breytt textanum. Hann getur bætt við „ég leiðrétti“ orð sem ekki er til eða fyllt inn óljósan stað með eigin ágiskun. Þetta truflar tryggð umritunarinnar.

Varúð: Gullna reglan í OCR leiðréttingu er þessi: AI ætti aðeins að leiðrétta augljósar auðkenningarvillur, ekki túlka eða bæta við innihald textans. „1stanbu1 → Istanbúl“ er lögmætt; Þetta snýst ekki um að fylla ólæsilegt orð af getgátum. Óvissir staðir ættu að vera merktir með [?] og ættu ekki að gera upp.

OCR villugerðir og nálgun með töflu

Villutegund

dæmi

Getur gervigreind lagað það?

manna stjórn

karakter blöndun

rn↔m, l↔1, O↔0

Já, það er öruggt

sýnishorn

gamalt bókstafsform

langur ſ → s

Já, það er öruggt

sýnishorn

Fölnað/ólesanlegt orð

"ka___n"

Nei, ætti að setja [?]

skylda

eiginnafn/örnefni

"Constantiniyye"

varkár

skylda

Númer/dagsetning

"1867" á móti "1857"

áhættusamt

skylda

Síðuútlit (dálkur/neðanmálsgrein)

blandað flæði

að hluta

skylda

Til að draga myndina saman í einni setningu: AI hreinsar á áreiðanlegan hátt upp venjulegar persónuvillur; En mannleg augu eru nauðsynleg fyrir sérstök nöfn, tölur, dagsetningar og ólæsilega staði.

þrjú smámál

Mál 1 - Dagblaðasöfn urðu leitarhæf. Háskólabókasafn hefur stafrænt 12.000 síður af staðbundnum dagblöðum frá 1930. Hrá OCR nákvæmni var áætlað 82% (18 af hverjum 100 stöfum voru rangar). Gervigreindarleiðrétting jók nákvæmni í 96% með orðabók og samhengi sem hæfir tungumálamáli dagblaða. Fyrir villur sem eftir voru var sýnishornsskoðun framkvæmd frekar en heildartextinn; Safnið varð leitanlegt á 3 vikum.

Tilvik 2 - AI „leiðrétt“ og brenglaði sögu. Skjalavörður lét AI leiðrétta dagsetninguna „1863“ á OCR útprentuninni. Gervigreindin „leiðrétti“ dagsetninguna í „1868“ með því að skoða annan atburð í samhenginu - jafnvel þó að skjalið hafi greinilega sagt 1863. Ef skjalavörður hefði ekki skoðað upprunalegu myndina, hefði vörulistinn farið inn með rangri dagsetningu. Lexía: tölur og dagsetningar eru aldrei eftir AI, þær eru staðfestar með myndinni.

Mál 3 — Tveggja dálka blaðsíða ruglað. Tveggja dálka síðum árbókar frá 19. öld var blandað saman í einn straum í OCR og setningarnar fléttaðar saman. Hráframleiðsla var ólæsileg. Textinn batnaði þegar ég skipti uppsetningu síðunnar fyrst í svæði (hlutun) og vann hvern dálk fyrir sig. Lærdómur: í flóknu síðuskipulagi, uppbygging fyrst, texti í öðru lagi.

Fjögur afritanleg sniðmát

1) Örugg OCR leiðrétting:

Hér að neðan er hrá OCR framleiðsla af sögulegu skjali. Verkefni þitt er AÐEINS að leiðrétta augljósar ljósgreiningarvillur (t.d. rn→m,1→l, 0→O, langar ſ→s). Reglur: (1) Túlka merkingu textans. (2) Leiðréttu ólæsileg/óskýr orð, láttu þau vera eins og þau eru og merktu við [?]. (3) EKKI bæta við, fjarlægja eða klára setningar. (4) BREYTA númerum og dagsetningum; merktu við [númer?] ef þú ert í vafa.Raw OCR: [hér]

2) OCR gæðaskýrsla:

Skoðaðu OCR-úttakið hér að neðan og búðu til gæðaskýrslu: (1) Skráðu orð með hugsanlegum auðkenningarvillum, (2) Merktu svæði sem virðast ólæsileg/óljós, (3) Skráðu ákveðin nöfn, dagsetningar og númer sem krefjast mannlegrar skoðunar. EKKI leiðrétta; búa aðeins til gátlista. Texti: [hér]

3) Hjálp við þáttun dálka/byggingar:

Vegna þess að OCR textinn hér að neðan kemur frá tveggja dálka síðu gæti flæðið ruglast. Endurraðaðu textanum í rökréttar efnisgreinar EN ekki breyta, bæta við eða eyða neinum orðum. Bara leiðrétta röðina. Merktu pöntunina sem þú ert ekki viss um með [pöntun?]. Texti: [hér]

4) Stöðlun í staðlað tungumál (valfrjálst, aðskilið lag):

Búðu til einfaldaða lestrarútgáfu í stafsetningu í dag, í sérstökum dálki, OFAN leiðrétta sögutexta hér að neðan. Breyttu ALDREI UPPRUNA textanum; Látum einföldunina vera sérstakt lag. Uppfærðu bara stafsetningu/framburð án þess að bæta við merkingu. Upprunalegt: [hér]

Veik kvaðning / Sterk kvaðning

Veik:

Leiðréttu og fegra þennan OCR texta.

„Beautify“ gerir gervigreindinni kleift að endurskrifa textann, búa til aðgerðaleysi og túlka innihaldið; brýtur tryggð.

Sterkur:

Lagfærðu AÐEINS villur í ljósgreiningu í þessari hráu OCR úttak. Ekki túlka merkingu, bæta við/eyða orðum, skilja ólæsilega hluta eftir með [?], breyta tölum og dagsetningum. Sýndu hverja leiðréttingu sem þú gerir í sérstökum lista á sniðinu „frumlag → leiðrétting“ svo ég geti sannreynt hana. Texti: [hér]

Munurinn: takmörkuð skylda, bann við tilbúningi, óljós merking og rekjanlegur listi yfir leiðréttingar gera úttakið endurskoðanlegt.

Algeng mistök

  • Skannar í lítilli upplausn. Flestar OCR villur stafa af slæmum myndum; Gæðaskönnun er ódýrasta fjárfestingin.
  • Að kalla gervigreind „gera fallegt“. Þetta framleiðir flæði frekar en trúmennsku; Skjalið er endurskrifað.
  • Skilur eftir tölur og dagsetningar til gervigreindar. Þetta skemmist hljóðlega þegar "leiðrétt" úr samhenginu; verður að staðfesta með mynd.
  • Að fylla út ólæsilega svæðið með ágiskun. Það ætti að verja óvissu [?], ekki gert upp.
  • Alls ekki að stjórna í stað sýnatöku. Jafnvel 96% nákvæmni þýðir þúsundir villna á 12.000 síðum; mikilvæg svæði eru skönnuð.

Í stuttu máli

OCR opnar skjalasafn fyrir vísindamenn með því að umbreyta prentuðum sögulegum skjölum í leitarhæfan texta. AI er öflugt hjálpartæki til að leiðrétta villur í stafsetningu í hráu OCR-úttaki með samhengi; En þú verður að draga mörkin á milli klippingar og endurskrifa. Hágæða skönnun, örugg leiðréttingarkennsla, varðveisla tvíræðni með [?] og sannprófun á nöfnum/dagsetningum/númerum með mönnum augum gera stafræna væðingu bæði hraðvirka og áreiðanlega. AI hreinsar upp texta; Þú ert verndari trúmennsku.

Umsóknarverkefni

Skannaðu prentað sögulegt skjal (gamalt dagblað, opinbert bréf, bókasíðu) eða taktu OCR útprentun. Láttu textann leiðrétta með „Secure OCR correction“ sniðmátinu og biðjið um leiðréttingar í gegnum „upprunalega → leiðrétting“ listann. Fjarlægðu síðan svæðin sem krefjast mannastjórnar með „OCR gæðaskýrslu“. Berðu saman hverja dagsetningu og sérnafn á listanum við raunverulega mynd; Athugaðu hversu margir voru "leiðréttir" rangt.

gátlisti

  • [ ] Ég skannaði skjalið með að minnsta kosti 300 DPI og góðri birtuskil.
  • [ ] Ég bað aðeins gervigreindina um leiðréttingu á ljósvillu, ekki umritun.
  • [ ] Ég varði ólæsilegu hlutana með [?].
  • [ ] Ég staðfesti allar tölur, dagsetningar og sérnöfn með myndinni.
  • [ ] Ég gerði sýnishorn eða heildarskoðun á mikilvægum svæðum.