Unitate 12 / 12

Proiect end-to-end: procesarea unei colecții de arhivă cu inteligență artificială

Câștiguri:

  • Abilitatea de a procesa o colecție într-un flux de lucru în 7 etape, de la screening etic până la publicare, cu un punct de control uman în fiecare etapă
  • Înțelegeți modul în care punctele de control timpurii împiedică propagarea unei erori (data/nume greșită) în întregul lanț
  • Abilitatea de a aplica principiile de conservare a fișierului principal, de a nu economisi la verificare și de a declara utilizarea AI într-un proiect holistic

Unitățile anterioare au acoperit abilități individuale: digitizare, transcriere, metadate, scanare, traducere, verificare, analiză a modelelor, regăsire, conservare și etică. Această unitate finală combină totul. Un adevărat proiect de arhivă experimentează acești pași nu separat, ci ca un flux de lucru interconectat. Aici, vom vedea cum puteți procesa o colecție de la început până la sfârșit cu un proces susținut de AI, dar controlat de om, pas cu pas și cu un lanț de control.

Scopul este de a poziționa AI ca un partener care „accelerează fiecare pas, dar nu are ultimul cuvânt asupra niciunui pas”. Când terminați această unitate, veți rămâne cu o metodă holistică care transformă un morman dezordonat de documente într-o colecție gata de cercetare, verificată, curată din punct de vedere etic.

Scenariu: ce avem

Să presupunem că primești o colecție de 250 de documente: unele tipărite (corespondență tipărită, reclame), unele manuscrise (scrisori, caiete), de la date diferite, unele conținând date personale sensibile. Scop: digitizarea, transcrierea, catalogarea și punerea la dispoziție a acestei colecții pentru cercetători. Să descompunem procesul în șapte etape.

Flux de lucru în șapte pași

Faza 1 — Evaluare și screening etic. Cunoașteți mai întâi colecția. Ce documente conțin date personale sensibile? Care este statutul dreptului de autor? Există sensibilitate culturală? Această scanare determină ce documente pot fi date instrumentelor AI bazate pe cloud și care vor fi procesate numai într-un mediu închis/aprobat. Dacă se omite această etapă, întregul proiect este expus unui risc etic.

Etapa 2 — Digitalizare. Scanați documente la rezoluție înaltă (cel puțin 300-400 DPI, contrast bun). Păstrați fișierele originale (master) neatinse; Toată prelucrarea se va face pe copii.

Etapa 3 — Extragerea textului. Aplicați OCR pentru documente pe hârtie și HTR pentru manuscris. Rugați AI-ul să curețe rezultatul brut cu instrucțiuni de „corectură sigură” - numai erori optice/de recunoaștere, fără comentarii de conținut, locuri ilizibile [?]. Lectură alternativă și control paleograf pentru otoman/manuscris.

Etapa 4 — Metadate și catalogare. Să aibă metadate standard (Dublin Core/ISAD(G)) elaborate pentru fiecare document; Cu permisiunea de la „lasă câmp neexistent necompletat”. Mapați termenii subiectului în lista controlată. Verificați datele și numele cu documentație.

Etapa 5 — Îmbogățirea și modelarea. Extrageți entități (persoană/loc/organizație), normalizați, produceți contururi de relație și cronologie. Verificați fiecare model din document; Nu există conexiuni artificiale și nici o cronologie.

Etapa 6 — Accesați instrumente. Produceți schița de ajutor de găsire pentru colectare; Bazați secțiunea de istoric numai pe note verificate. Marcați clar restricțiile de acces (confidențialitate/drepturi de autor).

Etapa 7 — Verificare, declarare și publicare. Verificați pentru ultima dată câmpurile critice (data, nume, citat, referință). Declarați utilizarea AI. Expertul acordă aprobarea finală; Colecția este deschisă pentru cercetare.

Sfat: puneți un „punct de control uman” în fiecare etapă: un expert validează rezultatul AI înainte de a trece la următoarea etapă. Fără aceste puncte de control, o eroare la prima etapă (o dată de citire greșită) se va propaga pe tot lanțul și, în cele din urmă, se va scurge în catalog, model și ghid.

Tabelul lanțului de control

Scena

Treaba AI

punct de control uman

1. Screening etic

Marcarea datelor sensibile

Decizia de instalare

2. Digitalizare

(Îmbunătățirea imaginii)

Calitate, protectie maestru

3. Extragerea textului

OCR/HTR + corecție sigură

Verificare nume/data/citire

4. Metadate

proiect standard

Confirmare câmp, potrivire termen

5. Model

entitate, relație, cronologie

Validare în document

6. Instrument de acces

Găsirea ajutorului

Istoricul și aprobarea constrângerii

7. Eliberare

Aprobare finală, declarație

trei mini cutii

Cazul 1 — Eroare de lanț capturată. Într-un proiect, în faza 3, data unui document scria „1868” în loc de „1888”. Dacă punctul de control din etapa 3 nu ar fi detectat această eroare, data ar fi fost răspândită în catalog (4), cronologie (5) și ghid (6). Datorită punctului de control, eroarea a fost remediată într-un singur loc. Lecție: verificarea timpurie previne propagarea erorii în lanț.

Cazul 2 — Screeningul etic a salvat proiectul. 18 din cele 250 de documente conțineau date sensibile ale persoanelor în viață. Screeningul etic în faza 1 le-a semnalat; aceste 18 documente au fost prelucrate într-un mediu închis, restul cu instrumente standard. Ar fi fost o încălcare gravă dacă scanarea ar fi omisă și ar fi fost încărcată totul în cloud. Lecție: examinarea etică este primul pas, nu o remediere adăugată mai târziu.

Cazul 3 – Timp și efort. Folosind metoda tradițională, ar dura aproximativ 8-10 luni pentru a procesa complet o colecție de 250 de documente. Cu fluxul de lucru al punctului de control susținut de AI, procesul a fost redus la aproximativ 3 luni. Dar economiile nu au venit din „AI a făcut totul”, ci din „AI a făcut munca mecanică, concentrată pe verificarea umană”. Timpul dedicat verificării nu a scăzut; Timpul dedicat lucrărilor mecanice a scăzut.

Patru șabloane copiabile

1) Planul inițial al proiectului:

Am o colecție de [număr] documente: [amestec de tipărire/manuscris], [perioadă], dintre care unele pot conține date sensibile. Creați un plan de flux de lucru în 7 pași pentru a digitiza și cataloga această colecție: specificați sarcina AI și punctul de control UMAN în fiecare etapă. Puneți pe primul loc screeningul etic.

2) Lista de verificare a tranziției de etapă:

Am terminat etapa [numele de scenă]. Produceți o listă de verificare a punctelor critice pe care trebuie să le verific înainte de a trece la următoarea etapă: ce fapte (data/nume/referință) trebuie verificate, ce erori se pot propaga în lanț? Am aprobarea finală; Dă-mi lista de verificare.

3) Controlul calității de la capăt la capăt:

Mai jos sunt toate straturile unui document procesat: transcriere, metadate, active extrase. INCONCEPTE DE FIGURĂ între straturi: o dată din transcriere se potrivește cu metadatele, există de fapt entitățile în text? Impunerea de corectare; Generați o listă de inconsecvențe. Straturi: [aici]

4) Închiderea proiectului și declararea:

În acest proiect de colecție, am folosit AI în următoarele etape: [listă]. Pentru documentația proiectului: (1) ce suport AI a fost utilizat în ce etapă, (2) cum a fost efectuată verificarea umană, (3) ce limite/constrângeri există - scrieți o notă de încheiere sinceră și proiectați declarația de utilizare a AI care le include.

Prompt slab / Prompt puternic

slab:

Procesați această colecție în detaliu cu AI și pregătiți-o pentru cercetare.

O singură instrucțiune „fă orice” ocolește screening-ul etic, punctele de control și verificarea; erorile se propagă de-a lungul lanțului.

Puternic:

Configurați un flux de lucru în 7 etape pentru această colecție, cu un punct de control uman în fiecare etapă. Prima etapă să fie verificarea eticii/confidențialității. Ieșirea produsă de AI în fiecare etapă va fi verificată înainte de a trece la următoarea etapă; marcați faptele critice (data/numele/referința). În niciun moment AI nu are ultimul cuvânt.

Diferența: structura în etape, prioritatea etică, punctele de control și principiul „oamenii au ultimul cuvânt” fac ca întregul proiect să fie sigur și defensabil.

Greșeli comune

  • Lăsând screening-ul etic la final. Scanarea de confidențialitate/drepturi de autor este primul pas; Dacă este adăugat mai târziu, încălcarea a avut loc deja.
  • Ocolirea punctelor de control. O eroare care nu este verificată se răspândește pe tot lanțul.
  • Nu se protejează fișierul master. Dacă originalul nu este păstrat neatins, returnarea devine imposibilă.
  • Salvare la verificare. AI scurtează munca mecanică; Dacă timpul de verificare este scurtat, calitatea scade.
  • Nu se declară utilizarea AI. Transparența face parte din credibilitatea științifică a colecției.

În concluzie

Un proiect de arhivă end-to-end conectează abilitățile individuale într-un lanț de control: scanare etică, digitizare, extragerea textului, metadate, model, instrument de recuperare și publicare. În fiecare etapă, AI accelerează munca mecanică; În fiecare etapă, un punct de control uman are ultimul cuvânt. Screeningul etic este prima etapă, fișierul principal este protejat, erorile sunt surprinse devreme, astfel încât să nu se răspândească în lanț, iar utilizarea AI este declarată onest. Economiile nu vin din AI care face totul, ci din ființa umană eliberată de munca mecanică și concentrându-se pe verificare. AI accelerează; Omul asigură acuratețea și integritatea istoriei.

Sarcina de aplicare

Selectați o colecție mică (10-20 de documente; propriul material sau un set de mostre). Creați un flux de lucru în 7 pași cu șablonul „plan de pornire a proiectului”. Rulați cel puțin două documente prin acest flux: scanare etică, extragerea textului, metadate și un strat de model. Verificați fiecare etapă cu o „listă de verificare a tranziției de etapă”. În cele din urmă, documentați utilizarea AI cu șablonul „închidere și declarație de proiect”. Observați ce erori au fost surprinse la punctele de control timpurii.

lista de verificare

  • [ ] Am făcut screening-ul de etică/confidențialitate în prima etapă.
  • [ ] Am păstrat fișierele master neatinse.
  • [ ] Am pus un punct de control uman la fiecare etapă.
  • [ ] Am verificat faptele critice înainte ca acestea să fie propagate în lanț.
  • [ ] Am declarat utilizarea AI la închiderea proiectului.

Examenul modulului

1. Care este poziționarea cea mai potrivită pentru inteligența artificială în istorie și arhivare?

  • A) AI este un instrument de rezumat, editare și redactare; Comentariul, critica sursei și responsabilitatea finală aparțin expertului ✔
  • B) Inteligența artificială poate decide singură autenticitatea și sensul documentului, ca un istoric
  • C) Inteligența artificială funcționează doar pentru traducerea textului, nu are nicio legătură cu alte sarcini de arhivă
  • D) Deoarece inteligența artificială este întotdeauna mai imparțială decât oamenii, interpretarea istorică ar trebui lăsată în seama ei.

Descriere: Inteligență artificială; Este un asistent care editează, scanează, traduce și produce schițe de text. Critica sursei, interpretarea, stabilirea cauză-efect și decizia finală aparțin expertului; O ieșire neverificată poate duce la o sursă fabricată, o dată falsă sau un anacronism.

2. Care este halucinația produsă de inteligența artificială în cercetarea istorică?

  • A) Inteligența artificială procesează un document foarte lent
  • B) Inteligența artificială fabrică o sursă, un citat sau un eveniment inexistent ca fiind real ✔
  • C) Un document este deteriorat fizic
  • D) Un catalog de arhivă nu este actualizat

Explicație: halucinația este atunci când inteligența artificială fabrică cu încredere informații, surse, citate sau evenimente care nu există de fapt. Deși forma sa pare perfectă, conținutul său nu este real; Prin urmare, în fiecare catalog de referință, fiecare citare trebuie verificată la sursa originală.

3. Care este cea mai bună abordare pentru a avea o ieșire OCR corectată de inteligența artificială?

  • A) Cererea textului să fie fluent și frumos și să completeze logic părțile lipsă.
  • B) Permițându-i să corecteze toate numerele și datele în funcție de context
  • C) Cerându-i să corecteze numai erorile de recunoaștere optică, să lase zone de necitit [?] și să nu schimbe numerele/datele ✔
  • D) Cereți elevului să completeze cuvintele care nu pot fi citite cu cea mai probabilă presupunere.

Explicație: regula de aur în corecția OCR este de a corecta numai erorile evidente de recunoaștere optică (cum ar fi rn la m, l la 1); neinterpretarea sau completarea conţinutului textului. Zonele care nu pot fi citite sunt marcate cu [?]; Numerele și datele nu sunt modificate, se verifică cu imaginea.

4. Ce ar trebui să se întrebe de la inteligența artificială când vine vorba de citirea unui cuvânt a cărui vocală nu este scrisă într-un text otoman?

  • A) Oferiți o lectură unică, precisă, accelerând astfel munca
  • B) Selectarea cuvântului care va face sensul cel mai fluent și completarea spațiilor libere
  • C) Completarea părților ilizibile din propriile cunoștințe generale.
  • D) Oferirea de posibile alternative de lectură și marcarea zonelor ambigue în loc să impună o lectură definitivă ✔

Explicație: În limba turcă otomană, vocalele scurte nu sunt scrise în mare parte; O singură diferență de vocală/litera (abul și kabul, wali și vali) schimbă complet sensul. Prin urmare, în loc de a impune o lectură definitivă, ar trebui să se întrebe posibile alternative, să fie păstrate zonele ilizibile, iar decizia finală să fie lăsată la latitudinea paleografului.

5. Care este cel mai eficient mod de a preveni halucinațiile atunci când AI produce o schiță de metadate (înregistrare de catalog)?

  • A) Acordați în mod explicit permisiunea de a lăsa acel câmp necompletat dacă nu este inclus în document ✔
  • B) Solicitarea ca fiecare câmp să fie completat și să nu fie lăsat incomplet.
  • C) Estimarea unei date pe baza conținutului documentelor nedatate
  • D) Permiterea inteligenței artificiale să genereze codul de referință

Descriere: Presiunea de completare obligă AI să alcătuiască documentul ghicind data sau creatorul care nu se află în document. Cel mai puternic scut împotriva acestui lucru este de a acorda în mod explicit permisiunea de a lăsa câmpul necompletat dacă nu este în document; În plus, termenii de subiect sunt mapați la vocabular controlat.

6. Cum ar trebui să fie poziționat în cercetarea istorică un rezumat de document produs de inteligența artificială?

  • A) Ca dovezi de încredere care pot fi invocate direct
  • B) Ca o hartă de descoperire care vă direcționează către documentul propriu-zis; Dovezile sunt preluate din documentul original ✔
  • C) Ca o resursă adecvată care poate înlocui documentul în sine
  • D) Ca text care poate fi folosit în studiu fără a reveni vreodată la document

Descriere: rezumatul este o hartă de descoperire, nu o dovadă. Există așa ceva în acest document, scrie du-te și uită-te; Nu scrie exact ce scrie în document. În cazul în care un eveniment, citat sau date urmează să fie incluse în studiu, acestea trebuie preluate textual din documentul original.

7. Care este modalitatea corectă de a evita anacronismele atunci când traduceți un document istoric pentru publicare?

  • A) Înlocuirea tuturor termenilor perioadei cu cel mai apropiat echivalent de astăzi
  • B) Să transmită textul cât mai fluent și modern
  • C) Lăsați titlurile perioadei și numele instituțiilor unice și adăugați o explicație ✔
  • D) Adaptarea numelor proprii la utilizarea lor curentă

Explicație: Anacronismul este transferul greșit de elemente dintr-o perioadă în alta. Schimbarea titlurilor de perioade, a numelor instituțiilor și a numelor personale la termenii de astăzi transportă cititorul într-o lume care nu aparține perioadei. Modul corect este să păstrați termenul perioadei și să adăugați o explicație lângă el.

8. Cum să vă asigurați că o referință de arhivă (numele fondului, numărul dosarului) dată de inteligența artificială este reală?

  • A) Aveți încredere în referință deoarece formatul acesteia pare corect
  • B) Întrebând din nou AI dacă referința este corectă
  • C) Acceptarea referinței ca fiind adevărată pentru că este convingătoare și detaliată
  • D) Prin găsirea și verificarea personală a referinței în catalogul de arhivă sau sursa de încredere ✔

Descriere: Inteligența artificială poate produce referințe perfecte ca formă, dar care nu există efectiv; O referință fictivă este în aceeași formă cu o referință reală. Singura modalitate de a dovedi că o referință există este să o găsiți acolo unde se află sursa originală (catalog de arhivă, bibliotecă).

9. Cum ar trebui să fie evaluat un model găsit la efectuarea analizei de model (NER, rețea, cronologie) cu inteligență artificială?

  • A) Ca ipoteză care trebuie verificată în document; punctul de plecare, nu rezultatul ✔
  • B) Ca o constatare definitivă care nu necesită verificare
  • C) Este un fapt obiectiv incontestabil deoarece este numeric.
  • D) Ca rezultat care poate fi pus în studiu direct pentru că a găsit inteligență artificială

Explicație: Fiecare model este o ipoteză, nu o dovadă. Entitățile ar trebui să fie legate de sursă, diferite ortografii (ale aceleiași persoane/loc) ar trebui să fie normalizate cu aprobarea umană, numerele ar trebui să fie puse la îndoială pentru datele lipsă și prejudecățile de eșantionare, iar evenimentele nedatate nu trebuie cronologizate.

10. De ce secțiunea de istorie biografică/instituțională dintr-un instrument de găsire necesită o atenție specială?

  • A) Această secțiune nu este importantă și poate fi publicată fără verificare
  • B) Deoarece inteligența artificială poate adăuga evenimente inventate, date false și titluri în această secțiune, ar trebui să se bazeze numai pe surse verificate ✔
  • C) Inteligența artificială poate fi folosită în siguranță deoarece nu face greșeli în scrierea istoriei.
  • D) Numai cercetătorii completează această secțiune, arhivarul nu este interesat

Descriere: Secțiunea de istorie este locul în care halucinațiile se strecoară cel mai adesea: AI poate introduce evenimente inexistente, date false și titluri inventate în timp ce scrie un text fluent din informații generale despre o persoană sau instituție. Această secțiune ar trebui să se bazeze numai pe surse verificate.

11. Cum ar trebui să răspundă inteligența artificială la întrebarea de fapt a unui cercetător într-un serviciu de referință (consultare)?

  • A) Răspunsul la întrebare trebuie dat direct și ca fapt cert.
  • B) Trebuie să prezinte o dată sau un nume credibil și să îl transmită cercetătorului.
  • C) În loc să ofere fapte direct, ar trebui să direcționeze cercetătorul către colecția și sursa relevantă ✔
  • D) Ar trebui să ofere un răspuns complet, astfel încât cercetătorul să nu fie nevoie să meargă la sursă.

Explicație: În serviciul de referință, inteligența artificială nu ar trebui să dea un răspuns direct la fapt, ci ar trebui să direcționeze cercetătorul către sursă. Pentru că răspunsul direct factual dat de inteligența artificială poate fi fabricat și cercetătorul îl poate confunda cu sursa. În loc să spună „Răspunsul este acesta”, ar trebui să spună „Uită-te la aceste documente din această colecție”.

12. Ce operațiuni sunt acceptabile și inacceptabile atunci când procesează o imagine de document deteriorată cu inteligență artificială?

  • A) Toate tipurile de operațiuni sunt gratuite, inclusiv completarea părților lipsă.
  • B) Nu trebuie luată nicio măsură, imaginea nu trebuie atinsă niciodată
  • C) Completarea secțiunilor lipsă este cea mai valoroasă acțiune deoarece completează documentul.
  • D) Sunt acceptabile manipulările de lizibilitate, cum ar fi contrastul/zgomotul; Este incomod să completați părțile lipsă cu presupuneri ✔

Explicație: Procesele care îmbunătățesc lizibilitatea (contrastul, iluminarea, reducerea zgomotului) sunt acceptabile deoarece nu modifică conținutul; Cu toate acestea, completarea părților lipsă/ilizibile cu presupuneri este riscul de a produce ceea ce nu este în document, adică fals istoric. Originalul este păstrat, tranzacțiile sunt înregistrate.

13. Ce trebuie făcut înainte de a procesa un document de arhivă care conține date personale sensibile?

  • A) Scanarea confidențialității și anonimizarea dacă este necesar sau folosind un instrument închis/aprobat ✔
  • B) Încărcarea documentului direct într-un vehicul public fără măcar să se gândească la asta
  • C) Ignorarea preocupărilor legate de confidențialitate pentru eficiență
  • D) Depășirea restricțiilor de acces din motive de eficiență

Dezvăluire: Încărcarea documentelor care conțin date sensibile care identifică persoane în viață (sănătate, religie, etnie, adresă) în instrumente publice, bazate pe cloud, poate fi o încălcare gravă a confidențialității. Verificarea confidențialității trebuie făcută mai întâi, anonimizarea sau un instrument închis/aprobat ar trebui să fie folosit dacă este necesar.

14. Care este scopul principal al unui punct de control uman într-un proiect de arhivă end-to-end?

  • A) Încetinirea activității inteligenței artificiale și întârzierea proiectului
  • B) Pentru a preveni conectarea unei erori (data/nume incorectă) într-o etapă la toate etapele ulterioare ✔
  • C) Creșterea muncii umane și renunțarea completă la automatizare
  • D) Asigurarea că inteligența artificială are ultimul cuvânt

Descriere: un punct de control uman în fiecare etapă asigură verificarea rezultatelor AI înainte de a trece la următoarea etapă. Fără aceasta, o eroare la prima etapă (o dată de citire greșită) s-ar propaga în lanț prin catalog, model și ghid. Verificarea timpurie asigură că eroarea este corectată într-un singur loc.

15. Ce necesită transparența și autenticitatea în utilizarea inteligenței artificiale în științe umaniste și sociale?

  • A) Păstrarea secretă a utilizării inteligenței artificiale, asigurându-se că nimeni nu știe
  • B) Să prezinte fiecare text produs de inteligența artificială ca idee originală proprie
  • C) Să declare cu onestitate utilizarea inteligenței artificiale și să nu prezinte rezultatul acesteia ca fiind o lucrare originală proprie ✔
  • D) Distribuirea numai a rezultatelor fără a explica metodele

Descriere: Transparența include înregistrarea că o transcriere, metadate sau traducere a fost produsă cu ajutorul inteligenței artificiale; Originalitatea presupune a nu prezenta un comentariu produs de inteligența artificială ca idee originală proprie. Acest lucru este esențial pentru verificarea de către cercetătorii ulterioare și pentru integritatea academică.