Yunit 6 / 11

Digital Archive, Digitization, OCR at Pangmatagalang Pagpapanatili

Mga nadagdag:

  • Kakayahang iwasto ang mga na-scan na dokumento sa pamamagitan ng pag-convert sa mga ito sa text gamit ang OCR at HTR at paghahambing ng output sa aktwal na larawan
  • Kakayahang mapanatili ang pagka-orihinal at integridad ng dokumento ng archive at maiwasan ang AI na baguhin ang nilalaman at gawa-gawang pagpapanumbalik
  • Kakayahang magplano ng pangmatagalang digital preservation na may impormasyon ng pinagmulan at matibay na mga format

Ang isang archivist ay may tungkuling magdala ng limampung taong gulang na mga volume ng pahayagan, sulat-kamay na mga liham, o lumang mga larawan sa hinaharap. Nawawala ang mga dokumentong ito sa paglipas ng panahon; Upang parehong mapanatili at gawing naa-access ang mga ito, ginagawa ang digitization: ang pagkilos ng pag-scan ng isang pisikal na dokumento at pag-convert nito sa isang digital na kopya. Ngunit ang screening lamang ay hindi sapat; Ang digital na bagay ay dapat na mahahanap, nababasa at napanatili sa mahabang panahon. Sa unit na ito, matututunan mo kung paano gumamit ng artificial intelligence sa digitalization, transcription at digital preservation workflow; ngunit malalaman mo kung bakit hawak mo ang responsibilidad para sa pagka-orihinal at katumpakan.

Ilang mga konsepto. Ang OCR (Optical Character Recognition) ay isang teknolohiyang nagko-convert ng text sa larawan ng isang dokumento sa text na nae-edit ng makina. Ginagawa ng HTR (Handwritten Text Recognition) ang parehong trabaho para sa mga sulat-kamay na dokumento at mas mahirap. Ang digital preservation ay isang nakaplanong pagsisikap upang matiyak na ang mga digital na bagay ay mananatiling nababasa sa loob ng mga dekada, kahit na ang mga format ng file ay nagiging lipas na at nagbabago ang software. Ang AI ay isang makapangyarihan ngunit may depektong katulong sa lahat ng tatlong lugar.

Hakbang-hakbang: mula sa digitalization hanggang sa preserbasyon

1. Unahin. Hindi mo maaaring i-digitize ang lahat nang sabay-sabay. Ang pinaka-marupok, pinaka-hinihiling at pinaka-natatanging mga dokumento ay inuuna. Ito ay isang hudisyal na desisyon; Tumutulong ang AI sa pag-edit ng listahan, ngunit tinutukoy ng institusyon ang priyoridad.

2. I-scan at ilapat ang OCR/HTR. I-scan ang dokumento sa mataas na resolution, pagkatapos ay gamitin ang OCR o HTR para i-extract ang text. Ang mga tool na nakabatay sa AI ay nagiging mas mahusay at mas mahusay dito, kahit na may luma at mahirap na mga teksto.

3. Iwasto at i-verify ang teksto. Ang output ng OCR/HTR ay hindi kailanman perpekto. Karaniwan ang mga pagkakamali, lalo na kung may lumang sulatin, mga pahinang may bahid, o manuskrito. Mahalagang ihambing ang output sa aktwal na imahe at itama ito.

4. Magdagdag ng metadata at impormasyon sa proteksyon. Idagdag sa digital object ang pinagmulan nito, mga kondisyon sa pag-scan, impormasyon ng format, at pinagmulan — kung saan nanggaling ang dokumento at kung paano ito pinoproseso. Ang impormasyong ito ay mahalaga para sa pag-verify at proteksyon sa hinaharap.

5. Magplano para sa pangmatagalang proteksyon. Pumili ng mga format ng file na bukas, karaniwan at matibay; i-back up; Gumawa ng plano sa paglipat kung sakaling luma na ang mga format.

Tip: Huwag tanggapin ang OCR output bilang "clear text". Kung ang isang sistema ng paghahanap ay gagana sa pamamagitan ng tekstong ito, ang mga maling kinikilalang salita ay magiging sanhi ng hindi mahanap ang pinagmulan. Para sa mga kritikal na koleksyon, ang pagwawasto sa output ng OCR sa mata ng tao ay tumutukoy sa kalidad ng lahat ng kasunod na pag-access.

Ang pagiging tunay at integridad ng digital na bagay

Nasa puso ng gawaing archival ang pagiging tunay at integridad: ang katiyakan na ang isang dokumento ay tunay na nagmumula sa inaangkin na pinagmulan at ang mga nilalaman nito ay hindi binago. Sa puntong ito, lumilikha ang AI ng dalawang-pronged na banta. Una, sa panahon ng OCR/HTR correction o “enhancement,” maaaring tahimik na baguhin ng AI ang text; maaaring magdagdag ng isang salita na wala sa ilalim ng pangalang "pagwawasto". Pangalawa, kung ang "pag-aayos" o "pagpapanumbalik" ng imahe ay ginawa gamit ang AI, maaaring gumawa ng mga hindi orihinal na detalye.

Ang panuntunan ng archivist ay malinaw: ang digital preservation copy ay dapat na tapat sa orihinal. Ang bawat pagpapahusay na ginawa gamit ang AI ay dapat na idokumento at ang aktwal na (raw) na pag-scan ay dapat palaging mapangalagaan. Ang "pagpapaganda" ng isang dokumento ay maaaring sirain ang makasaysayang evidentiary value nito.

Mag-ingat: Maaaring nakakaakit na "pagbutihin" ang isang lumang larawan o dokumento na may AI; ngunit pinupunan ng AI ang mga nawawalang bahagi sa pamamagitan ng paggawa ng mga ito. Sa isang dokumento ng archival, nangangahulugan ito ng paglikha ng maling ebidensya sa kasaysayan. Hindi kailanman pinapalitan ng output ng pagpapanumbalik ang orihinal na pinagmulan; ay nakaimbak bilang isang hiwalay, malinaw na may label na variant.

tatlong mini case

Case 1 — Naging mahahanap ang mga archive ng pahayagan. Na-digitize ng isang library ang 30 taong gulang na koleksyon ng mga lokal na pahayagan. Sa OCR, 90,000 mga pahina ang na-transcribe at ginawang mahahanap; Ang isang paghahanap sa paksa na dating tumagal ng mga araw ay nabawasan na ngayon sa mga segundo. Gayunpaman, napansin ng koponan na ang katumpakan ng OCR ay bumaba sa 80% sa mga luma at may mantsa na mga pahina at inuuna ang pagwawasto sa mga nangungunang taon gamit ang mata ng tao.

Case 2 — Binuksan ng HTR ang manuskrito. Inilapat ng isang archive ang HTR sa isang koleksyon ng mahirap basahin na mga liham noong ika-19 na siglo. Ang sistema ay nakakuha ng mahusay na bilis ayon sa mga buwan ng pagbabasa ng mga eksperto; Ngunit ang bawat pahina ng printout ay inihambing sa orihinal ng isang ekspertong paleographer (isang eksperto sa sinaunang pagsulat), dahil may mga pagkakamali sa mga pangalan ng mga tao at lugar.

Kaso 3 — Tinanggihan ang pekeng "pagpapanumbalik". Itinuring ng isang koponan ang "pag-aayos" ng punit na makasaysayang larawan gamit ang AI. Nakumpleto ng AI ang mga nawawalang bahagi ng mukha sa pamamagitan ng pag-aayos sa mga ito. Napagtanto ng archivist na ang mga gawa-gawang detalyeng ito ay magpapaikut-ikot sa makasaysayang ebidensya; Ang naayos na imahe ay naka-imbak nang hiwalay sa tabi ng orihinal, malinaw na may label na "AI derivative".

I-access ang kopya, kopya ng pangangalaga at desisyon sa format

Ang isang magandang kasanayan sa digitization ay ang paghiwalayin ang mga kopya ng parehong bagay para sa iba't ibang layunin. Ang preservation master ay ang aktwal na digital na bagay na dadalhin sa hinaharap, na nakaimbak sa pinakamataas na resolution, hindi naka-compress o lossless na format; bihira itong hawakan. Ang access copy ay isang mas maliit, madaling mabuksan na variant na ipinakita sa user. Ang pagkakaibang ito ay mahalaga dahil ang format na praktikal para sa paggamit (maliit, naka-compress) ay maaaring hindi angkop para sa pangmatagalang pangangalaga; Ang perpektong format para sa pangangalaga (malaki, walang pagkawala) ay mahirap para sa pang-araw-araw na paggamit. Sa workflow na ito, makakatulong ang AI sa pag-imbentaryo ng mga file, pag-detect ng mga nawawalang variant, at pagpapanatiling pare-pareho ang metadata sa pagitan ng dalawang kopya. Gayunpaman, ang pagpili ng format ay isang desisyon sa pag-iingat: ang mga bukas, malawak na dokumentado at matibay na mga format ay dapat na mas gusto (sa halip na pagmamay-ari, saradong mga format), at ang isang plano sa paglilipat ay dapat panatilihing handa kung sakaling ang mga format ay lipas na sa paglipas ng panahon. Kahit na nagmumungkahi ang AI ng isang format, ang pangmatagalang patakaran sa pangangalaga ng institusyon ang may huling desisyon.

Tip: Para sa bawat digital na bagay, magtago ng maikling talaan na sumasagot sa mga tanong na "nasaan ang orihinal na pinagmulan, sa anong format ang kopya ng pag-iingat, sa anong format ang access copy, at alin ang ginawang available sa user?" Ang paghahalo ng tatlong layer na ito ay ginagawang hindi malinaw kung aling file ang pinagkakatiwalaang master sa hinaharap.

Apat na maaaring kopyahin na mga template

1) Tulong sa pagwawasto ng output ng OCR:

Nasa ibaba ang isang OCR na teksto at paglalarawan ng aktwal na pahina. Ayusin lamang ang mga error sa openOCR (masamang character, tambalan/hati na salita). Huwag baguhin ang nilalaman, magdagdag o mag-alis ng mga salita. Kung hindi ka sigurado, markahan ng "[?]". OCR text: [dito]

2) Pagsusuri ng pagkakapare-pareho ng text-image:

Mayroon bang anumang mga karagdagan sa naitama na teksto sa ibaba na hindi inaasahan na nasa orihinal na dokumento (na maaaring ginawa)? Markahan ang bawat kahina-hinalang bahagi at isulat kung bakit ito kahina-hinala. Teksto: [dito]

3) Proteksyon ng metadata draft:

Bumuo ng balangkas ng metadata ng pangangalaga para sa sumusunod na digitized na bagay: pinagmulan, pinagmulan, petsa/resolution ng pag-scan, format ng file, kasaysayan ng transaksyon. Gamitin lamang ang impormasyong ibinigay ko, iwanang blangko ang nawawalang field. Impormasyon: [dito]

4) Tulong sa priyoridad:

Nasa ibaba ang listahan ng mga koleksyon na naghihintay ng digitization; Tumulong sa pagbibigay-priyoridad batay sa pagkasira, pangangailangan, at pagiging natatangi. Magbigay ng maikling katwiran para sa bawat mapagkukunan; Ipaubaya sa akin ang huling desisyon. Listahan: [dito]

Mahinang prompt / Malakas na prompt

Mahinang prompt:

Itama at pagandahin ang na-scan na tekstong ito.

Iniimbitahan ng “Beautify” ang AI na baguhin ang content, bumawi sa mga pagtanggal; Nasira ang originality ng archive document.

Napakahusay na prompt:

Ang iyong tungkulin: digitalization editor assistant. Sa sumusunod na OCR text, ayusin LAMANG ang mga tahasang error sa pagkilala (masamang karakter, hindi wastong nahati ang salita). Huwag magdagdag, mag-alis o magpalit ng anumang salita. Iwanan ang "[?]" kung saan hindi ka sigurado. Ipakita ang bawat pagwawasto na ginawa mo sa isang hiwalay na listahan. Teksto: [dito]

Nililimitahan ng malakas na prompt ang AI sa pagkilala lamang ng mga error, pinagbabawalan itong hawakan ang nilalaman, at ginagawang masusubaybayan ang mga pagwawasto.

Daloy ng trabaho at talahanayan ng panganib

entablado

Kontribusyon ng AI

Pangunahing panganib

panukalang proteksyon

i-scan

mahinang kalidad

mataas na resolution

OCR/HTR

I-convert sa text

Mga error sa pagkilala

pagwawasto ng tao

pagwawasto

Mungkahi ng error

Pagbabago ng nilalaman

Paghahambing sa orihinal

pagpapanumbalik

Imahe derivative

angkop na detalye

Panatilihin ang hilaw na orihinal, lagyan ng label ito

proteksyon

Metadata draft

pagkawala ng pinanggalingan

Talaan ng pinagmulan

Mga karaniwang pagkakamali

  • Pagtanggap ng OCR output nang walang pagwawasto. Ang mga error ay nakakagambala sa paghahanap at pag-access.
  • Ang pagtawag sa AI ay "magpaganda." Binabago nito ang nilalaman at sinisira ang pagka-orihinal.
  • Pinapalitan ang pagpapanumbalik ng AI para sa aktwal na ebidensya. Ang ginawang detalye ay lumilikha ng maling kasaysayan.
  • Hindi iniimbak ang raw scan. Walang pagwawasto ang mabe-verify kung wala ang orihinal.
  • Pag-alis ng impormasyon ng pinagmulan. Ang pagiging maaasahan ng dokumento ay nagiging untraceable.

Sa buod

AI sa mga digital archive at digitization; Ito ay isang mahalagang tulong na nagpapabilis sa transkripsyon ng OCR/HTR, pag-draft ng metadata at pag-prioritize. Ngunit ang kakanyahan ng gawaing pag-archive ay pagiging tunay at integridad: Ang output ng OCR ay dapat na itama ng mata ng tao, hindi dapat tahimik na palitan ng AI ang nilalaman, hindi dapat palitan ng mga derivative ng pagpapanumbalik ang orihinal na ebidensya, at dapat na laging mapangalagaan ang hilaw na pag-scan at impormasyon ng pinagmulan. Gamitin ang AI bilang isang tool na hindi "nagpapabuti" sa dokumento, ngunit ginagawa itong naa-access habang nananatiling tapat dito.

Gawain ng aplikasyon

Kumuha ng maikling sample ng OCR output (alinman sa sarili mong produksyon o mula sa isang aktwal na pag-scan). Itama lamang ang mga error sa pagkilala gamit ang template na "tulong sa pagwawasto ng output ng OCR", pagkatapos ay suriin kung ang AI ​​ay nagdagdag ng nilalaman gamit ang template na "Pagsusuri sa pagkakapare-pareho ng imahe ng teksto." Pagkatapos ay lumikha ng isang talaan na may impormasyon ng pinagmulan at format para sa bagay na may template na "Preservation metadata draft."

checklist

  • [ ] Inihambing ko ang output ng OCR/HTR sa aktwal na imahe at itinama ito.
  • [ ] Nasuri ko na ang AI ay hindi nagdaragdag/nagbabago ng nilalaman.
  • [ ] Iningatan ko ang hilaw (master) scan nang hiwalay at hindi nabago.
  • [ ] Nagdagdag ako ng impormasyon ng pinagmulan at format sa metadata.
  • [ ] Malinaw kong nilagyan ng label ang mga variant ng restoration bilang "AI derivative".