Unità 12 / 12

Progetto end-to-end: elaborazione di una raccolta di archivi con intelligenza artificiale

Guadagni:

  • Capacità di elaborare una raccolta in un flusso di lavoro in 7 fasi, dallo screening etico alla pubblicazione, con un punto di controllo umano in ogni fase
  • Comprendere in che modo i primi checkpoint impediscono che un errore (data/nome errati) si propaghi lungo tutta la catena
  • Capacità di applicare i principi di conservazione del file master, di non risparmiare sulla verifica e di dichiarare l'uso dell'intelligenza artificiale in un progetto olistico

Le unità precedenti hanno coperto competenze individuali: digitalizzazione, trascrizione, metadati, scansione, traduzione, verifica, analisi di modelli, recupero, conservazione ed etica. Questa unità finale combina tutto. Un vero progetto di archivio sperimenta questi passaggi non separatamente ma come un flusso di lavoro interconnesso. Qui vedremo come elaborare una collezione dall'inizio alla fine con un processo supportato dall'intelligenza artificiale ma controllato dall'uomo, passo dopo passo e con una catena di controllo.

L’obiettivo è posizionare l’intelligenza artificiale come un partner che “accelera ogni passo ma non ha l’ultima parola su nessuno”. Al termine di questa unità, ti verrà lasciato un metodo olistico che trasforma una pila disordinata di documenti in una raccolta pronta per la ricerca, verificata ed eticamente pulita.

Scenario: quello che abbiamo

Supponiamo che tu riceva una raccolta di 250 documenti: alcuni stampati (corrispondenza stampata, pubblicità), alcuni manoscritti (lettere, quaderni), di date diverse, alcuni contenenti dati personali sensibili. Obiettivo: digitalizzare, trascrivere, catalogare e rendere questa collezione disponibile ai ricercatori. Suddividiamo il processo in sette fasi.

Flusso di lavoro in sette passaggi

Fase 1 — Valutazione e screening etico. Conosci prima la collezione. Quali documenti contengono dati personali sensibili? Qual è lo stato del diritto d'autore? Esiste una sensibilità culturale? Questa scansione determina quali documenti possono essere forniti a strumenti di intelligenza artificiale basati su cloud e quali verranno elaborati solo in un ambiente chiuso/approvato. Se questa fase viene saltata, l’intero progetto è a rischio etico.

Fase 2: digitalizzazione. Scansiona documenti ad alta risoluzione (almeno 300-400 DPI, buon contrasto). Mantieni intatti i file originali (master); Tutta l'elaborazione verrà eseguita sulle copie.

Fase 3: estrazione del testo. Applica l'OCR per i documenti cartacei e l'HTR per i manoscritti. Chiedi all'intelligenza artificiale di ripulire l'output non elaborato con istruzioni di "correzione di bozze sicura": solo errori ottici/di riconoscimento, nessun commento sul contenuto, luoghi illeggibili [?]. Lettura alternativa e controllo paleografo per il manoscritto ottomano.

Fase 4 – Metadati e catalogazione. Avere redatto metadati standard (Dublin Core/ISAD(G)) per ciascun documento; Con il permesso di "lasciare vuoto il campo inesistente". Mappare i termini dell'argomento nell'elenco controllato. Verificare date e nomi con la documentazione.

Fase 5 – Arricchimento e modellazione. Estrai entità (persona/luogo/organizzazione), normalizza, produci relazioni e contorni della sequenza temporale. Verificare ogni modello nel documento; Non ci sono collegamenti artificiosi né cronologia.

Fase 6: accesso agli strumenti. Produrre uno schema di aiuto per la raccolta; Basa la sezione della cronologia solo su note verificate. Contrassegnare chiaramente le restrizioni di accesso (privacy/copyright).

Fase 7 — Verifica, dichiarazione e pubblicazione. Verifica i campi critici (data, nome, citazione, riferimento) un'ultima volta. Dichiarare l'uso dell'intelligenza artificiale. L'esperto dà l'approvazione finale; La collezione è aperta alla ricerca.

Suggerimento: inserisci un "punto di controllo umano" in ogni fase: un esperto convalida l'output dell'IA prima di passare alla fase successiva. Senza questi punti di controllo, un errore nella prima fase (una data letta erroneamente) si propagherà lungo tutta la catena e alla fine si diffonderà nel catalogo, nel modello e nella guida.

Tabella catena di controllo

Palcoscenico

Il lavoro dell'intelligenza artificiale

posto di controllo umano

1. Screening etico

Marcatura dei dati sensibili

Decisione di installazione

2. Digitalizzazione

(Miglioramento dell'immagine)

Qualità, protezione magistrale

3. Estrazione del testo

OCR/HTR + correzione sicura

Verifica nome/data/lettura

4. Metadati

progetto standard

Conferma del campo, corrispondenza dei termini

5. Modello

entità, relazione, sequenza temporale

Convalida nel documento

6. Strumento di accesso

Trovare una bozza di aiuto

Storia e approvazione dei vincoli

7. Rilascio

Approvazione finale, dichiarazione

tre mini custodie

Caso 1: errore di catena rilevato. In un progetto, nella fase 3, la data di un documento diceva "1868" invece di "1888". Se il checkpoint della fase 3 non avesse rilevato questo errore, la data sarebbe stata distribuita nel catalogo (4), nella sequenza temporale (5) e nella guida (6). Grazie al checkpoint, il bug è stato risolto in un unico posto. Lezione: il controllo anticipato impedisce all'errore di propagarsi lungo la catena.

Caso 2 – Lo screening etico ha salvato il progetto. Dei 250 documenti 18 contenevano dati sensibili di persone viventi. Lo screening etico nella fase 1 li ha segnalati; questi 18 documenti sono stati elaborati in ambiente chiuso, il resto con strumenti standard. Sarebbe stata una grave violazione se la scansione fosse stata saltata e il tutto fosse stato caricato sul cloud. Lezione: lo screening etico è il primo passo, non una soluzione aggiunta in seguito.

Caso 3 — Tempo e impegno. Utilizzando il metodo tradizionale, sarebbero necessari circa 8-10 mesi per elaborare completamente una raccolta di 250 documenti. Con il flusso di lavoro checkpoint supportato dall'intelligenza artificiale, il processo è stato ridotto a circa 3 mesi. Ma i risparmi non derivano dal fatto che “l’intelligenza artificiale ha fatto tutto”, ma da “l’intelligenza artificiale ha fatto il lavoro meccanico, concentrandosi sulla verifica umana”. Il tempo dedicato alla verifica non è diminuito; Il tempo dedicato al lavoro meccanico è diminuito.

Quattro modelli copiabili

1) Piano iniziale del progetto:

Ho una raccolta di [numero] documenti: [mix di stampa/manoscritto], [periodo], alcuni dei quali potrebbero contenere dati sensibili. Crea un piano di flusso di lavoro in 7 fasi per digitalizzare e catalogare questa collezione: specifica il compito dell'IA e il punto di controllo UMANO in ogni fase. Metti al primo posto lo screening etico.

2) Lista di controllo per la transizione di fase:

Ho finito la fase [nome della fase]. Produrre una checklist dei punti critici che devo verificare prima di passare alla fase successiva: quali fatti (data/nome/riferimento) devono essere verificati, quali errori possono propagarsi lungo la catena? Ho l'approvazione finale; Dammi la lista di controllo.

3) Controllo qualità end-to-end:

Di seguito sono riportati tutti gli strati di un documento elaborato: trascrizione, metadati, asset estratti. INCONCETTI DI FIGURA tra strati: una data nella trascrizione corrisponde ai metadati, le entità esistono effettivamente nel testo? Imposizione di correzione; Generare un elenco di incoerenze. Livelli: [qui]

4) Chiusura e dichiarazione del progetto:

In questo progetto di raccolta, ho utilizzato l'intelligenza artificiale nelle seguenti fasi: [elenco]. Per la documentazione del progetto: (1) quale supporto dell'intelligenza artificiale è stato utilizzato e in quale fase, (2) come è stata effettuata la verifica umana, (3) quali limiti/vincoli sono presenti: scrivere una nota di chiusura onesta e una bozza di dichiarazione sull'uso dell'intelligenza artificiale che li includa.

Prompt debole / Prompt forte

Debole:

Elabora accuratamente questa raccolta con l'intelligenza artificiale e rendila pronta per la ricerca.

Una singola istruzione “fai qualsiasi cosa” aggira lo screening etico, i checkpoint e la verifica; gli errori si propagano lungo la catena.

Forte:

Configura un flusso di lavoro in 7 fasi per questa raccolta, con un punto di controllo umano in ogni fase. Lasciamo che la prima fase sia lo screening etico/privacy. Gli output prodotti dall’IA in ogni fase verranno verificati prima di passare alla fase successiva; contrassegnare i fatti critici (data/nome/riferimento). In nessun momento l’IA ha l’ultima parola.

La differenza: la struttura graduale, la priorità etica, i checkpoint e il principio “le persone hanno l’ultima parola” rendono l’intero progetto sicuro e difendibile.

Errori comuni

  • Lasciare alla fine lo screening etico. La scansione della privacy/copyright è il primo passo; Se viene aggiunto successivamente, la violazione si è già verificata.
  • Aggirare i posti di blocco. Un errore non verificato si diffonde lungo tutta la catena.
  • Non proteggere il file principale. Se l'originale non viene mantenuto intatto, la restituzione diventa impossibile.
  • Risparmiare sulla verifica. L’intelligenza artificiale accorcia il lavoro meccanico; Se il tempo di verifica si accorcia, la qualità diminuisce.
  • Non dichiarare l'uso dell'intelligenza artificiale. La trasparenza fa parte della credibilità scientifica della collezione.

In sintesi

Un progetto di archivio end-to-end collega le competenze individuali in una catena di controllo: scansione etica, digitalizzazione, estrazione del testo, metadati, modello, strumento di recupero e pubblicazione. In ogni fase, l’intelligenza artificiale accelera il lavoro meccanico; In ogni fase, un checkpoint umano ha l’ultima parola. Lo screening etico è la prima fase, il file master è protetto, gli errori vengono individuati tempestivamente in modo che non si diffondano nella catena e l’uso dell’intelligenza artificiale è dichiarato onestamente. Il risparmio non deriva dal fatto che l’IA faccia tutto, ma dall’essere umano liberato dal lavoro meccanico e concentrato sulla verifica. L'intelligenza artificiale accelera; L'uomo garantisce l'accuratezza e l'integrità della storia.

Compito dell'applicazione

Seleziona una piccola raccolta (10-20 documenti; il tuo materiale o un set di campioni). Crea un flusso di lavoro in 7 passaggi con il modello "piano di avvio del progetto". Esegui almeno due documenti attraverso questo flusso: scansione etica, estrazione del testo, metadati e un livello di pattern. Verifica ogni fase con una "lista di controllo della transizione di fase". Infine, documenta il tuo utilizzo dell'intelligenza artificiale con il modello "chiusura e dichiarazione del progetto". Nota quali errori sono stati rilevati ai primi checkpoint.

lista di controllo

  • [ ] Nella prima fase ho effettuato lo screening etico/privacy.
  • [ ] Ho mantenuto intatti i file master.
  • [ ] Ho inserito un checkpoint umano in ogni fase.
  • [ ] Ho verificato i fatti critici prima che venissero propagati lungo la catena.
  • [ ] Ho dichiarato l'utilizzo dell'intelligenza artificiale alla chiusura del progetto.

Esame del modulo

1. Qual è il posizionamento più appropriato per l'intelligenza artificiale nella storia e nell'archiviazione?

  • A) L’intelligenza artificiale è uno strumento di sintesi, editing e redazione; Commento, critica alla fonte e responsabilità finale spettano all'esperto ✔
  • B) L'intelligenza artificiale può decidere da sola l'autenticità e il significato del documento, come uno storico
  • C) L'intelligenza artificiale funziona solo per tradurre il testo, non ha nulla a che fare con altre attività di archiviazione
  • D) Poiché l’intelligenza artificiale è sempre più imparziale di quella umana, ad essa bisognerebbe lasciare l’interpretazione storica.

Descrizione: Intelligenza artificiale; È un assistente che modifica, scansiona, traduce e produce bozze di testo. La critica della fonte, l'interpretazione, la determinazione della causa-effetto e la decisione finale spettano all'esperto; Un output non verificato può portare a una fonte fabbricata, a una data falsa o a un anacronismo.

2. Cos'è l'allucinazione prodotta dall'intelligenza artificiale nella ricerca storica?

  • A) L'intelligenza artificiale elabora un documento molto lentamente
  • B) L'intelligenza artificiale fabbrica come reali una fonte, una citazione o un evento inesistente ✔
  • C) Un documento è fisicamente danneggiato
  • D) Un catalogo d'archivio non è aggiornato

Spiegazione: L'allucinazione è quando l'intelligenza artificiale fabbrica con sicurezza informazioni, fonti, citazioni o eventi che in realtà non esistono. Sebbene la sua forma appaia perfetta, il suo contenuto non è reale; Pertanto, in ogni catalogo di riferimento, ogni citazione deve essere verificata alla fonte originale.

3. Qual è l'approccio migliore per far correggere un output OCR dall'intelligenza artificiale?

  • A) Chiedere che il testo sia scorrevole e bello e che completi logicamente le parti mancanti.
  • B) Permettendogli di correggere tutti i numeri e le date in base al contesto
  • C) Chiedendogli di correggere solo gli errori di riconoscimento ottico, di lasciare aree illeggibili [?] e di non modificare numeri/date ✔
  • D) Chiedere allo studente di inserire le parole illeggibili con l'ipotesi più probabile.

Spiegazione: La regola d'oro nella correzione OCR è correggere solo gli errori evidenti di riconoscimento ottico (come rn in m, l in 1); non interpretare o completare il contenuto del testo. Le aree illeggibili sono contrassegnate con [?]; I numeri e le date non vengono modificati, vengono verificati con l'immagine.

4. Cosa si dovrebbe chiedere all'intelligenza artificiale quando si tratta di leggere una parola la cui vocale non è scritta in un testo ottomano?

  • A) Dare una lettura unica e precisa velocizzando così il lavoro
  • B) Selezionare la parola che renderà il significato più fluido e riempire gli spazi vuoti
  • C) Completare le parti illeggibili partendo dalle proprie conoscenze generali.
  • D) Offrire possibili alternative di lettura e segnalare aree ambigue invece di imporre una lettura definitiva ✔

Spiegazione: nel turco ottomano, le vocali brevi per lo più non sono scritte; Una singola differenza vocale/lettera (abul e kabul, wali e vali) cambia completamente il significato. Pertanto, invece di imporre una lettura definitiva, bisognerebbe chiedersi possibili alternative, preservare le zone illeggibili e lasciare la decisione finale al paleografo.

5. Qual è il modo più efficace per prevenire le allucinazioni quando l'IA produce una bozza di metadati (record di catalogo)?

  • A) Concedi esplicitamente il permesso di lasciare vuoto quel campo se non è incluso nel documento ✔
  • B) Richiedere che ogni campo venga compilato e non lasciato incompleto.
  • C) Stima di una data in base al contenuto di documenti non datati
  • D) Consentire all'intelligenza artificiale di generare il codice di riferimento

Descrizione: la pressione di compilazione obbliga l'IA a creare il documento indovinando la data o l'autore che non è presente nel documento. La protezione più forte contro ciò è concedere esplicitamente il permesso di lasciare il campo vuoto se non è nel documento; Inoltre, i termini degli argomenti vengono mappati nel vocabolario controllato.

6. Come dovrebbe posizionarsi nella ricerca storica un documento riassuntivo prodotto dall'intelligenza artificiale?

  • A) Come prova attendibile che può essere citata direttamente
  • B) Come una mappa di scoperta che ti indirizza al documento vero e proprio; Le prove sono tratte dal documento originale ✔
  • C) Come risorsa adeguata che può sostituire il documento stesso
  • D) Come testo utilizzabile nello studio senza mai ritornare al documento

Descrizione: Il riassunto è una mappa di scoperta, non una prova. C'è qualcosa del genere in questo documento, dice vai a vedere; Non dice esattamente quello che dice il documento. Se un evento, una citazione o un dato devono essere inclusi nello studio, devono essere ripresi parola per parola dal documento originale.

7. Qual è il modo corretto per evitare anacronismi quando si traduce un documento storico per la pubblicazione?

  • A) Sostituzione di tutti i termini del periodo con l'equivalente più vicino di oggi
  • B) Trasmettere il testo nel modo più fluido e moderno possibile
  • C) Lasciare unici i titoli dei periodi e i nomi delle istituzioni e aggiungere una spiegazione ✔
  • D) Adattare i nomi propri al loro uso corrente

Spiegazione: L'anacronismo è il trasferimento errato di elementi da un periodo a un altro. Cambiare i titoli dei periodi, i nomi delle istituzioni e i nomi personali con i termini odierni trasporta il lettore in un mondo che non appartiene a quel periodo. Il modo corretto è mantenere il termine del periodo e aggiungere una spiegazione accanto ad esso.

8. Come assicurarsi che un riferimento all'archivio (nome del fondo, numero del file) fornito dall'intelligenza artificiale sia reale?

  • A) Fidarsi del riferimento perché il suo formato sembra corretto
  • B) Chiedendo nuovamente all'AI se il riferimento è corretto
  • C) Accettare il riferimento come vero perché convincente e dettagliato
  • D) Trovando e verificando personalmente il riferimento nel catalogo dell'archivio o in una fonte attendibile ✔

Descrizione: L'intelligenza artificiale può produrre riferimenti perfetti nella forma ma che in realtà non esistono; Un riferimento fittizio ha la stessa forma di un riferimento reale. L'unico modo per dimostrare che un riferimento esiste è trovarlo dove si trova la fonte originale (catalogo dell'archivio, biblioteca).

9. Come dovrebbe essere valutato un modello trovato durante l'esecuzione dell'analisi dei modelli (NER, rete, sequenza temporale) con l'intelligenza artificiale?

  • A) Come ipotesi da verificare nel documento; punto di partenza, non risultato ✔
  • B) Come accertamento definitivo che non necessita di verifica
  • C) È un dato oggettivo indiscusso perché numerico.
  • D) Di conseguenza può essere messo nello studio diretto perché ha trovato l'intelligenza artificiale

Spiegazione: ogni modello è un'ipotesi, non una prova. Le entità dovrebbero essere collegate alla fonte, le diverse ortografie (della stessa persona/luogo) dovrebbero essere normalizzate con l’approvazione umana, i numeri dovrebbero essere interrogati per individuare dati mancanti e errori di campionamento e gli eventi senza data non dovrebbero essere cronologizzati.

10. Perché la sezione storico-biografico/istituzionale di un sussidio di ricerca richiede particolare attenzione?

  • R) Questa sezione non è importante e può essere pubblicata senza verifica
  • B) Poiché l'intelligenza artificiale può aggiungere eventi inventati, date e titoli falsi in questa sezione, dovrebbe basarsi solo su fonti verificate ✔
  • C) L'intelligenza artificiale può essere utilizzata in tutta sicurezza perché non commette errori nella scrittura della storia.
  • D) Questa sezione viene compilata solo dai ricercatori, l'archivista non è interessato

Descrizione: La sezione della storia è il luogo in cui più spesso si insinuano le allucinazioni: l'intelligenza artificiale può inserire eventi inesistenti, date false e titoli inventati mentre scrive un testo fluente con informazioni generali su una persona o un'istituzione. Questa sezione dovrebbe basarsi solo su fonti verificate.

11. In che modo l'intelligenza artificiale dovrebbe rispondere alla domanda sui fatti di un ricercatore in un servizio di riferimento (consultazione)?

  • R) La risposta alla domanda va data in modo diretto e come un fatto certo.
  • B) Deve produrre una data o un nome credibile e trasmetterlo al ricercatore.
  • C) Invece di fornire direttamente i fatti, dovrebbe indirizzare il ricercatore alla raccolta e alla fonte pertinente ✔
  • D) Dovrebbe fornire una risposta completa in modo che il ricercatore non abbia bisogno di andare alla fonte.

Spiegazione: Nel servizio di riferimento, l'intelligenza artificiale non dovrebbe fornire una risposta diretta ai fatti, ma dovrebbe indirizzare il ricercatore alla fonte. Perché la risposta fattuale diretta data dall’intelligenza artificiale potrebbe essere inventata e il ricercatore potrebbe confonderla con la fonte. Invece di dire "La risposta è questa", dovrebbe dire "Guarda questi documenti in questa raccolta".

12. Quali operazioni sono accettabili e discutibili quando si elabora un'immagine di un documento danneggiato con l'intelligenza artificiale?

  • R) Tutte le operazioni sono gratuite, compresa la compilazione delle parti mancanti.
  • B) Non deve essere intrapresa alcuna azione, l'immagine non deve mai essere toccata
  • C) Compilare le sezioni mancanti è l'azione più preziosa perché completa il documento.
  • D) Sono accettabili manipolazioni della leggibilità come contrasto/rumore; È scomodo riempire le parti mancanti con ipotesi ✔

Spiegazione: i processi che migliorano la leggibilità (contrasto, illuminazione, riduzione del rumore) sono accettabili perché non modificano il contenuto; Tuttavia, riempire con congetture le parti mancanti/illeggibili comporta il rischio di produrre ciò che non è presente nel documento, ovvero un falso storico. L'originale viene conservato, le transazioni vengono registrate.

13. Cosa è necessario fare prima di elaborare un documento di archivio contenente dati personali sensibili?

  • A) Scansione della privacy e anonimizzazione se necessario o utilizzando uno strumento chiuso/approvato ✔
  • B) Caricare il documento direttamente su un mezzo pubblico senza nemmeno pensarci
  • C) Ignorare le preoccupazioni sulla privacy per l'efficienza
  • D) Superamento delle restrizioni di accesso per ragioni di efficienza

Divulgazione: il caricamento di documenti contenenti dati sensibili che identificano persone viventi (salute, religione, etnia, indirizzo) su strumenti pubblici basati su cloud può costituire una grave violazione della privacy. Dovrebbe essere effettuato prima lo screening della privacy e, se necessario, dovrebbe essere utilizzata l’anonimizzazione o uno strumento chiuso/approvato.

14. Qual è lo scopo principale di un checkpoint umano in un progetto di archivio end-to-end?

  • A) Rallentare il lavoro dell’intelligenza artificiale e ritardare il progetto
  • B) Per evitare che un errore (data/nome errato) in una fase venga concatenato a tutte le fasi successive ✔
  • C) Aumentare il lavoro umano e abbandonare completamente l’automazione
  • D) Garantire che l’intelligenza artificiale abbia l’ultima parola

Descrizione: un checkpoint umano in ogni fase garantisce che l'output dell'IA venga verificato prima di passare alla fase successiva. Senza questo, un errore nella prima fase (una data letta erroneamente) si propagherebbe lungo la catena attraverso il catalogo, il modello e la guida. Il controllo anticipato garantisce che l'errore venga corretto in un unico posto.

15. Cosa richiedono trasparenza e autenticità nell’uso dell’intelligenza artificiale nelle scienze umanistiche e sociali?

  • A) Mantenere segreto l’uso dell’intelligenza artificiale, garantendo che nessuno lo sappia
  • B) Presentare ogni testo prodotto dall'intelligenza artificiale come una propria idea originale
  • C) Dichiarare onestamente l'uso dell'intelligenza artificiale e non presentare i suoi risultati come opera propria ✔
  • D) Condividere solo i risultati senza spiegare le modalità

Descrizione: la trasparenza include la registrazione che una trascrizione, metadati o traduzione è stata prodotta con l'aiuto dell'intelligenza artificiale; L'originalità richiede di non presentare un commento prodotto dall'intelligenza artificiale come una propria idea originale. Ciò è essenziale per la verifica da parte dei ricercatori successivi e per l'integrità accademica.