Yunit 2 / 12

Pag-digitize ng Dokumento at OCR: Pag-convert ng Naka-print na Teksto sa Machine Text

Mga nadagdag:

  • Kakayahang i-set up ang digitization at OCR workflow (pag-scan, pre-processing, pagkilala, pagwawasto, pag-verify) hakbang-hakbang
  • Kakayahang gumamit ng AI upang itama ang mga error sa OCR na may konteksto habang pinapanatili ang pagwawasto at muling pagsulat ng linya at pagmamarka ng kalabuan ng [?]
  • Unawain kung bakit ang mga numero, petsa at tamang pangalan ay dapat na makitang ma-verify at ang papel ng kontrol sa kalidad.

Ang milyun-milyong pahina sa mga pisikal na istante ng isang archive o library ay tunay na nabubuksan sa mananaliksik kapag sila ay naging digitized at nahahanap. Ang digitization ay ang pag-convert ng isang pisikal na dokumento sa isang digital na imahe sa pamamagitan ng pag-scan o pagkuha ng litrato dito. Ngunit ang isang larawan ng isang pahina ay hindi pa "teksto"; Para sa computer isa pa rin itong imahe, hindi ka makakapaghanap dito. Dito pumapasok ang OCR.

Ang OCR (Optical Character Recognition) ay isang teknolohiyang kumikilala sa mga naka-print na titik sa isang imahe ng dokumento at ginagawang nababasa ng makina, nahahanap na teksto. Sa unit na ito, matututunan mo kung paano i-digitize ang mga makasaysayang naka-print na dokumento gamit ang OCR, kung paano tinutulungan ng AI na itama ang mga error sa OCR sa prosesong ito, at kung saan mahalaga ang mata ng tao. (Ang mga sulat-kamay na teksto ay nangangailangan ng ibang teknolohiya; tatalakayin natin iyon sa susunod na yunit.)

Digitization workflow: hakbang-hakbang

1. Paghahanda at pagsusuri. I-scan ang dokumento sa pinakamataas na kalidad na posible. Ang pangkalahatang tuntunin para sa makasaysayang pananaliksik ay isang resolusyon na hindi bababa sa 300-400 DPI (mga tuldok bawat pulgada). Ang mababang resolution ay pinapataas ang rate ng error sa kasunod na yugto ng OCR.

2. Preprocessing ng imahe. Ang pagpapabuti ng imahe bago ang OCR ay lubos na nagpapataas ng tagumpay: pag-deskew sa na-scan na pahina, pag-alis ng mga mantsa, pagtaas ng contrast, pag-convert sa itim at puti. Maaaring i-automate ng mga modernong tool na nakabatay sa AI ang hakbang na ito.

3. Aplikasyon ng OCR. I-feed mo ang imahe sa OCR engine; Kinikilala ng makina ang mga titik at gumagawa ng teksto. Ang output ay karaniwang binubuo ng dalawang layer: ang nakikitang larawan ng dokumento at isang "nahahanap na hidden text layer" sa ilalim.

4. Pagwawasto (post-correction). Ang Raw OCR output ay hindi kailanman perpekto. Maling nabasa ang mga character dahil sa mga lumang font, dilaw na papel, pahid ng tinta, at mga error sa pag-scan. Dito ay isang makapangyarihang katulong ang AI: nagmumungkahi at nagwawasto ito ng mga error sa OCR gamit ang konteksto.

5. Pagpapatunay at kontrol sa kalidad. Ang naitama na teksto ay sinuri ng tao sa isang sample na batayan o ganap. Lalo na ang mga kritikal na lugar tulad ng mga pangalan, petsa at numero ay dapat na ma-verify nang biswal.

Bakit nagkakamali ang OCR, kung paano nakakatulong ang AI

Mga karaniwang problema na humahamon sa OCR sa mga makasaysayang dokumento: luma at magarbong mga font, hindi na ginagamit na mga letterform gaya ng mahabang "s" (ſ), dalawang column na layout ng page, footnote, sulat-kamay na pagsingit, seal, at kupas na tinta. Dahil ang isang OCR engine ay "nakikita" ang mga letra nang paisa-isa, madalas nitong nalilito ang binary na "rn" bilang "m", ang letrang "l" bilang ang numerong "1", at ang letrang "O" bilang "0".

Nag-aalok ang mga modelo ng wika ng AI ng ibang kapangyarihan dito: naiintindihan nila ang konteksto. Kung ang isang OCR engine ay sumulat ng "1stanbu1", ang AI ay maaaring magpahiwatig mula sa konteksto na ito ay dapat na "Istanbul". Ngunit mayroong isang malaking panganib dito: kapag "pagwawasto" ang AI ay maaari ring baguhin ang teksto. Maaari niyang idagdag ang "I corrected" ang isang hindi umiiral na salita o punan ang isang hindi malinaw na lugar ng sarili niyang hula. Nakakaabala ito sa katapatan ng transkripsyon.

Babala: Ang ginintuang tuntunin sa pagwawasto ng OCR ay ito: Ang AI ay dapat lamang magtama ng mga halatang error sa pagkilala, hindi bigyang-kahulugan o dagdagan ang nilalaman ng teksto. Ang "1stanbu1 → Istanbul" ay lehitimo; Hindi ito tungkol sa pagpuno ng hindi nababasang salita ng mga hula. Ang mga hindi tiyak na lugar ay dapat markahan ng [?] at hindi dapat gawa-gawa.

Mga uri ng error sa OCR at diskarte na may isang talahanayan

Uri ng error

halimbawa

Maaayos ba ito ng AI?

kontrol ng tao

paghahalo ng karakter

rn↔m, l↔1, O↔0

Oo, ito ay ligtas

sample

lumang letterform

mahaba ſ → s

Oo, ito ay ligtas

sample

Kupas/hindi nababasang salita

"ka___n"

Hindi, dapat ilagay [?]

sapilitan

wastong pangalan/pangalan ng lugar

"Constantiniyye"

ingat

sapilitan

Numero/petsa

"1867" kumpara sa "1857"

delikado

sapilitan

Layout ng pahina (column/footnote)

halo-halong daloy

bahagyang

sapilitan

Upang ibuod ang larawan sa isang pangungusap: Mapagkakatiwalaang nililinis ng AI ang mga karaniwang error sa character; Ngunit ang mga mata ng tao ay kinakailangan para sa mga espesyal na pangalan, numero, petsa at hindi nababasang mga lugar.

tatlong mini case

Case 1 — Naging mahahanap ang mga archive ng pahayagan. Ang isang library ng unibersidad ay nag-digitize ng 12,000 mga pahina ng mga lokal na pahayagan mula noong 1930s. Ang Raw OCR accuracy ay tinatayang 82% (18 sa bawat 100 character ay mali). Ang pagwawasto na batay sa AI ay tumaas ang katumpakan sa 96% gamit ang isang diksyunaryo at konteksto na angkop sa wika sa pahayagan. Para sa natitirang mga error, isang sample check ang ginawa sa halip na ang buong text; Ang koleksyon ay naging mahahanap sa loob ng 3 linggo.

Case 2 — AI "itinama" at baluktot na kasaysayan. Ang isang archivist ay may AI na itama ang petsa na "1863" sa OCR printout. "Itinuwid" ng AI ang petsa sa "1868" sa pamamagitan ng pagtingin sa isa pang kaganapan sa konteksto — kahit na malinaw na sinabi ng dokumento na 1863. Kung hindi tiningnan ng archivist ang orihinal na larawan, maaaring maling petsa ang naipasok ng catalog. Aralin: ang mga numero at petsa ay hindi naiwan sa AI, na-verify ang mga ito gamit ang larawan.

Case 3 — Dalawang hanay na pahina ay nalilito. Ang dalawang hanay na pahina ng isang 19th century yearbook ay pinaghalo sa iisang stream sa OCR at ang mga pangungusap ay magkakaugnay. Ang hilaw na output ay hindi nababasa. Ang teksto ay bumuti noong una kong hinati ang layout ng pahina sa mga rehiyon (segmentation) at pinoproseso ang bawat column nang hiwalay. Aralin: sa kumplikadong layout ng pahina, istraktura muna, teksto pangalawa.

Apat na maaaring kopyahin na mga template

1) Secure na pagwawasto ng OCR:

Nasa ibaba ang hilaw na OCR na output ng isang makasaysayang dokumento. Ang iyong gawain ay upang itama ang mga halatang optical na error sa pagkilala LAMANG (hal. rn→m,1→l, 0→O, long ſ→s). Panuntunan: (1) Bigyang-kahulugan ang kahulugan ng teksto. (2) Iwasto ang hindi nababasa/hindi maliwanag na mga salita, iwanan kung ano at markahan ng [?]. (3) WALANG pagdaragdag, pag-aalis o pagkumpleto ng mga pangungusap. (4) PALITAN ang mga numero at petsa; markahan ang [number?] kung may pagdududa. Raw OCR: [dito]

2) Ulat sa kalidad ng OCR:

Suriin ang output ng OCR sa ibaba at gumawa ng isang ulat ng kalidad: (1) Maglista ng mga salita na may posibleng mga error sa pagkilala, (2) Markahan ang mga lugar na mukhang hindi nababasa/hindi malinaw, (3) Maglista ng mga partikular na pangalan, petsa at numero na nangangailangan ng pagsusuri ng tao. HUWAG itama; bumuo ng checklist lamang. Teksto: [dito]

3) Tulong sa pag-parse ng column/structure:

Dahil ang OCR na teksto sa ibaba ay nagmula sa isang dalawang hanay na pahina, ang daloy ay maaaring malito. Muling ayusin ang teksto sa mga lohikal na talata NGUNIT huwag baguhin, magdagdag o magtanggal ng anumang mga salita. Itama lang ang pagkakasunod-sunod. Markahan ang order na hindi ka sigurado ng [order?]. Teksto: [dito]

4) Normalization sa karaniwang wika (opsyonal, hiwalay na layer):

Gumawa ng pinasimpleng bersyon ng pagbabasa sa spelling ngayon, sa isang hiwalay na column, SA ITAAS ng itinamang makasaysayang teksto sa ibaba. HUWAG baguhin ang ORIHINAL na teksto; Hayaang maging hiwalay na layer ang pagpapasimple. I-update lang ang spelling/pronunciation nang walang dagdag na kahulugan.Original: [dito]

Mahinang prompt / Malakas na prompt

mahina:

Itama at pagandahin itong OCR text.

Ang "Pagandahin" ay nagbibigay-daan sa AI na muling isulat ang teksto, gumawa ng mga pagtanggal, at bigyang-kahulugan ang nilalaman; sinisira ang katapatan.

malakas:

Ayusin LAMANG ang mga optical recognition error sa raw OCR output na ito. Huwag bigyang-kahulugan ang kahulugan, magdagdag/magtanggal ng mga salita, mag-iwan ng hindi nababasang mga bahagi na may [?], magpalit ng mga numero at petsa. Ipakita ang bawat pagwawasto na gagawin mo sa isang hiwalay na listahan sa format na "orihinal → pagwawasto" upang ma-verify ko ito. Teksto: [dito]

Ang pagkakaiba: may hangganan na tungkulin, pagbabawal sa paggawa, pagmamarka ng kalabuan, at nasusubaybayang listahan ng mga pagwawasto ay ginagawang auditable ang output.

Mga karaniwang pagkakamali

  • Pag-scan sa mababang resolution. Karamihan sa mga error sa OCR ay sanhi ng masasamang larawan; Ang kalidad ng pag-scan ay ang pinakamurang pamumuhunan.
  • Ang pagtawag sa AI ay "magpaganda." Nagbubunga ito ng katatasan sa halip na katapatan; Ang dokumento ay muling isinulat.
  • Iniiwan ang mga numero at petsa sa AI. Ang mga ito ay tahimik na napinsala kapag "itinuwid" mula sa konteksto; dapat ma-verify sa pamamagitan ng larawan.
  • Punan ang hindi nababasang lugar ng hula. Dapat itong protektahan ng kawalan ng katiyakan [?], hindi binubuo.
  • Hindi nagkokontrol sa halip na sampling. Kahit na 96% katumpakan ay nangangahulugan ng libu-libong mga error sa 12,000 mga pahina; ang mga kritikal na lugar ay na-scan.

Sa buod

Binubuksan ng OCR ang mga archive sa mga mananaliksik sa pamamagitan ng pag-convert ng mga naka-print na makasaysayang dokumento sa mahahanap na teksto. Ang AI ay isang makapangyarihang tulong sa pagwawasto ng mga error ng character sa hilaw na output ng OCR na may konteksto; Ngunit dapat mong iguhit ang linya sa pagitan ng pag-edit at muling pagsulat. Ang mataas na kalidad na pag-scan, ligtas na pagtuturo sa pagwawasto, pagpapanatili ng kalabuan sa [?], at pag-verify ng mata ng tao ng mga pangalan/petsa/numero ay ginagawang mabilis at maaasahan ang digitization. Nililinis ng AI ang teksto; Ikaw ang tagapag-alaga ng katapatan.

Gawain ng aplikasyon

Mag-scan ng naka-print na makasaysayang dokumento (lumang pahayagan, opisyal na liham, pahina ng libro) o kumuha ng OCR printout. Ipatama ang teksto gamit ang template na “Secure OCR correction” at humiling ng mga pagwawasto sa pamamagitan ng “orihinal → correction” na listahan. Pagkatapos, alisin ang mga lugar na nangangailangan ng kontrol ng tao gamit ang "Ulat sa kalidad ng OCR". Ihambing ang bawat petsa at tamang pangalan sa listahan sa aktwal na larawan; Pansinin kung ilan ang "naitama" nang hindi tama.

checklist

  • [ ] Na-scan ko ang dokumento na may hindi bababa sa 300 DPI at magandang contrast.
  • [ ] Humiling lang ako sa AI ng optical error correction, hindi rewrite.
  • [ ] Pinoprotektahan ko ang hindi nababasang mga bahagi gamit ang [?].
  • [ ] Na-verify ko ang lahat ng numero, petsa at tamang pangalan na may larawan.
  • [ ] Gumawa ako ng sample o buong pagsusuri sa mga kritikal na lugar.