Unità 6 / 11

Archivio Digitale, Digitalizzazione, OCR e Conservazione a Lungo Termine

Guadagni:

  • Possibilità di correggere i documenti scansionati convertendoli in testo con OCR e HTR e confrontando l'output con l'immagine reale
  • Capacità di preservare l'originalità e l'integrità del documento d'archivio e impedire all'intelligenza artificiale di modificare il contenuto e restauri fittizi
  • Capacità di pianificare la conservazione digitale a lungo termine con informazioni sulla provenienza e formati durevoli

Un archivista ha il compito di trasportare nel futuro volumi di giornali vecchi di cinquant'anni, lettere scritte a mano o vecchie fotografie. Questi documenti si consumano nel tempo; Per preservarli e renderli accessibili viene effettuata la digitalizzazione: l'atto di scansionare un documento fisico e convertirlo in una copia digitale. Ma lo screening da solo non basta; L'oggetto digitale deve essere reperibile, leggibile e manutenibile a lungo termine. In questa unità imparerai come utilizzare l'intelligenza artificiale nel flusso di lavoro di digitalizzazione, trascrizione e conservazione digitale; ma imparerai perché avrai la responsabilità dell'originalità e dell'accuratezza.

Alcuni concetti. L'OCR (riconoscimento ottico dei caratteri) è una tecnologia che converte il testo nell'immagine di un documento in testo modificabile dalla macchina. HTR (riconoscimento del testo scritto a mano) fa lo stesso lavoro per i documenti scritti a mano ed è molto più difficile. La conservazione digitale è uno sforzo pianificato per garantire che gli oggetti digitali rimangano leggibili per decenni, anche se i formati dei file diventano obsoleti e il software cambia. L’intelligenza artificiale è un assistente potente ma imperfetto in tutte e tre le aree.

Passo dopo passo: dalla digitalizzazione alla conservazione

1. Dare priorità. Non puoi digitalizzare tutto in una volta. I documenti più fragili, più richiesti e più unici vengono messi al primo posto. Questa è una decisione giudiziaria; L’intelligenza artificiale aiuta nella modifica degli elenchi, ma è l’istituzione a determinare la priorità.

2. Scansionare e applicare OCR/HTR. Scansiona il documento ad alta risoluzione, quindi utilizza OCR o HTR per estrarre il testo. Qui gli strumenti basati sull’intelligenza artificiale stanno migliorando sempre di più, anche con testi vecchi e difficili.

3. Correggi e verifica il testo. L'output OCR/HTR non è mai perfetto. Gli errori sono comuni, soprattutto se sono presenti scritte antiche, pagine macchiate o un manoscritto. È essenziale confrontare l'output con l'immagine reale e correggerla.

4. Aggiungi metadati e informazioni sulla protezione. Aggiungi all'oggetto digitale la sua provenienza, le condizioni di scansione, le informazioni sul formato e la provenienza: da dove proviene il documento e come è stato elaborato. Queste informazioni sono fondamentali per la verifica e la protezione future.

5. Piano per la protezione a lungo termine. Scegli formati di file aperti, comuni e durevoli; backup; Elabora un piano di migrazione nel caso in cui i formati dei casi diventino obsoleti.

Suggerimento: non accettare l'output OCR come "testo non crittografato". Se un sistema di ricerca funzionasse attraverso questo testo, le parole riconosciute in modo errato impedirebbero di trovare la fonte. Per le raccolte critiche, la correzione dell'output OCR all'occhio umano determina la qualità di tutti gli accessi successivi.

Autenticità e integrità dell'oggetto digitale

Al centro del lavoro d'archivio ci sono l'autenticità e l'integrità: la garanzia che un documento provenga veramente dalla fonte dichiarata e che il suo contenuto non sia stato alterato. A questo punto, l’intelligenza artificiale crea una duplice minaccia. Innanzitutto, durante la correzione o il “miglioramento” OCR/HTR, l’intelligenza artificiale può modificare silenziosamente il testo; può aggiungere una parola che non esiste sotto il nome "correzione". In secondo luogo, se la “riparazione” o il “restauro” dell’immagine viene eseguito con l’intelligenza artificiale, potrebbero essere prodotti dettagli non originali.

La regola dell'archivista è chiara: la copia di conservazione digitale deve essere fedele all'originale. Ogni miglioramento apportato con l'intelligenza artificiale dovrebbe essere documentato e la scansione effettiva (grezza) dovrebbe essere sempre preservata. "Abbellire" un documento può distruggerne il valore storico probatorio.

Attenzione: potrebbe essere forte la tentazione di "migliorare" una vecchia foto o un vecchio documento con l'intelligenza artificiale; ma l’intelligenza artificiale riempie le parti mancanti inventandole. In un documento d'archivio, ciò significa creare false prove storiche. Il risultato del restauro non sostituisce mai la fonte originale; è memorizzato come variante separata, chiaramente etichettata.

tre mini custodie

Caso 1: gli archivi dei giornali sono diventati consultabili. Una biblioteca ha digitalizzato la sua raccolta trentennale di giornali locali. Con l'OCR sono state trascritte e rese ricercabili 90.000 pagine; Una ricerca per argomento che in precedenza richiedeva giorni è stata ora ridotta a pochi secondi. Tuttavia, il team ha notato che la precisione dell'OCR scendeva all'80% sulle pagine vecchie e macchiate e ha dato priorità alla correzione degli anni più vecchi con l'occhio umano.

Caso 2: HTR ha aperto il manoscritto. Un archivio ha applicato l'HTR a una raccolta di lettere del XIX secolo di difficile lettura. Il sistema ha guadagnato grande velocità in base a mesi di lettura da parte di esperti; Ma ogni pagina della stampa è stata confrontata con l'originale da un esperto paleografo (esperto di scrittura antica), perché c'erano errori nei nomi delle persone e dei luoghi.

Caso 3 — Falso “restauro” respinto. Un team ha preso in considerazione l'idea di "riparare" una fotografia storica strappata con l'intelligenza artificiale. L'intelligenza artificiale ha completato le parti facciali mancanti adattandole. L'archivista si rese conto che questi dettagli inventati avrebbero distorto le prove storiche; L'immagine riparata è stata archiviata separatamente accanto all'originale, chiaramente etichettata solo come "derivato AI".

Copia di accesso, copia di conservazione e decisione sul formato

Una buona pratica nella digitalizzazione è separare le copie dello stesso oggetto per scopi diversi. Un master di conservazione è l'oggetto digitale vero e proprio da trasportare nel futuro, archiviato nella massima risoluzione, in formato non compresso o senza perdite; viene toccato raramente. La copia di accesso è una variante più piccola e facilmente apribile presentata all'utente. Questa distinzione è importante perché il formato pratico da utilizzare (piccolo, compresso) potrebbe non essere adatto alla conservazione a lungo termine; Il formato ideale per la conservazione (grande, senza perdite) è ingombrante per l'uso quotidiano. In questo flusso di lavoro, l'intelligenza artificiale può aiutare a inventariare i file, rilevare le varianti mancanti e mantenere coerenti i metadati tra due copie. Tuttavia, la scelta del formato è una decisione di conservazione: dovrebbero essere preferiti formati aperti, ampiamente documentati e durevoli (piuttosto che formati proprietari e chiusi), e un piano di migrazione dovrebbe essere pronto nel caso in cui i formati diventino obsoleti nel tempo. Anche se l’intelligenza artificiale suggerisce un formato, la politica di conservazione a lungo termine dell’istituzione ha l’ultima parola.

Suggerimento: per ogni oggetto digitale, tenere un breve record che risponda alle domande "dov'è la fonte originale, in che formato è la copia di conservazione, in che formato è la copia di accesso e quale è resa disponibile all'utente?" La combinazione di questi tre livelli rende poco chiaro quale file sarà il master attendibile in futuro.

Quattro modelli copiabili

1) Aiuto per la correzione dell'output OCR:

Di seguito è riportato un testo OCR e la descrizione della pagina effettiva. Correggi solo gli errori di openOCR (caratteri errati, parole composte/divise). Non modificare il contenuto, aggiungere o rimuovere parole. Se non sei sicuro, contrassegna con "[?]". Testo OCR: [qui]

2) Controllo coerenza testo-immagine:

Ci sono aggiunte nel testo corretto di seguito che non si prevedeva fossero presenti nel documento originale (che potrebbe essere stato inventato)? Contrassegna ogni parte sospetta e scrivi il motivo per cui è sospetta. Testo: [qui]

3) Bozza dei metadati di protezione:

Genera la struttura dei metadati di conservazione per il seguente oggetto digitalizzato: fonte, provenienza, data/risoluzione della scansione, formato file, cronologia delle transazioni. Usa semplicemente le informazioni che ho fornito, lascia vuoto il campo mancante. Informazioni: [qui]

4) Aiuto per la definizione delle priorità:

Di seguito l'elenco delle collezioni in attesa di digitalizzazione; Assistere nella definizione delle priorità in base alla fragilità, alla domanda e all'unicità. Fornire una breve giustificazione per ciascuna risorsa; Lascia a me la decisione finale. Elenco: [qui]

Prompt debole / Prompt forte

Suggerimento debole:

Correggi e abbellisci questo testo scansionato.

"Abbellisci" invita l'IA a modificare il contenuto, a compensare le omissioni; L'originalità del documento d'archivio è danneggiata.

Suggerimento potente:

Il tuo ruolo: assistente redattore per la digitalizzazione. Nel seguente testo OCR, correggi SOLO gli errori di riconoscimento esplicito (carattere errato, parola divisa in modo errato). Non aggiungere, rimuovere o modificare alcuna parola. Lascia "[?]" dove non sei sicuro. Mostra ogni correzione apportata in un elenco separato. Testo: [qui]

Il potente prompt limita l'intelligenza artificiale al solo riconoscimento degli errori, le impedisce di toccare i contenuti e rende tracciabili le correzioni.

Flusso di lavoro e tabella dei rischi

Palcoscenico

Contributo dell'intelligenza artificiale

Rischio principale

misura di protezione

scansione

scarsa qualità

alta risoluzione

OCR/HTR

Converti in testo

Errori di riconoscimento

correzione umana

correzione

Suggerimento di errore

Cambiare contenuto

Confronto con l'originale

restauro

Derivata dell'immagine

dettaglio di raccordo

Conserva l'originale grezzo, etichettalo

protezione

Bozza di metadati

perdita dell'origine

Documento di provenienza

Errori comuni

  • Accettazione dell'output OCR senza correzione. Gli errori interrompono la ricerca e l'accesso.
  • Chiamare l’intelligenza artificiale “rendere bello”. Cambia il contenuto e distrugge l'originalità.
  • Sostituire il ripristino dell'IA con prove reali. I dettagli fabbricati creano una falsa storia.
  • Non memorizzare la scansione grezza. Nessuna correzione può essere verificata senza l'originale.
  • Omissione delle informazioni sulla provenienza. L'attendibilità del documento diventa irrintracciabile.

In sintesi

L’intelligenza artificiale negli archivi digitali e nella digitalizzazione; Si tratta di un valido aiuto che accelera la trascrizione OCR/HTR, la stesura dei metadati e la definizione delle priorità. Ma l’essenza del lavoro d’archivio è l’autenticità e l’integrità: l’output OCR dovrebbe essere corretto dall’occhio umano, l’intelligenza artificiale non dovrebbe mai sostituire silenziosamente il contenuto, i derivati ​​del restauro non dovrebbero sostituire le prove originali e le informazioni grezze sulla scansione e sulla provenienza dovrebbero essere sempre preservate. Usa l'intelligenza artificiale come uno strumento che non "migliora" il documento, ma piuttosto lo rende accessibile rimanendo fedele ad esso.

Compito dell'applicazione

Ottieni un breve campione dell'output OCR (di tua produzione o da una scansione effettiva). Fai correggere solo gli errori di riconoscimento con il modello "Aiuto correzione output OCR", quindi controlla se l'IA ha aggiunto contenuti con il modello "Verifica coerenza testo-immagine". Quindi creare un record con la provenienza e le informazioni sul formato dell'oggetto con il modello "Bozza di metadati di conservazione".

lista di controllo

  • [ ] Ho confrontato l'output OCR/HTR con l'immagine reale e l'ho corretto.
  • [ ] Ho controllato che l'IA non aggiunga/modifichi contenuti.
  • [] Ho mantenuto la scansione grezza (master) separatamente e invariata.
  • [ ] Ho aggiunto informazioni sulla provenienza e sul formato ai metadati.
  • [ ] Ho chiaramente etichettato le varianti di restauro come "derivato AI".