Enhet 12 / 12

End-to-end-projekt: Bearbeta en arkivsamling med artificiell intelligens

Vinster:

  • Förmåga att bearbeta en samling i ett 7-stegs arbetsflöde, från etisk screening till publicering, med en mänsklig kontrollpunkt i varje steg
  • Förstå hur tidiga kontrollpunkter förhindrar att ett fel (fel datum/namn) sprids genom hela kedjan
  • Förmåga att tillämpa principerna för att bevara huvudfilen, inte spara på verifiering och deklarera användningen av AI i ett holistiskt projekt

Tidigare enheter har täckt individuella färdigheter: digitalisering, transkription, metadata, skanning, översättning, verifiering, mönsteranalys, hämtning, bevarande och etik. Denna sista enhet kombinerar allt. Ett sant arkivprojekt upplever dessa steg inte separat utan som ett sammankopplat arbetsflöde. Här kommer vi att se hur du kan bearbeta en samling från början till slut med en AI-stödd men människostyrd process, steg för steg och med en kontrollkedja.

Målet är att positionera AI som en partner som "accelererar varje steg men inte har något slutgiltigt att säga till om i något steg." När du är klar med den här enheten kommer du att sitta kvar med en holistisk metod som förvandlar en rörig hög med dokument till en forskningsklar, verifierad, etiskt ren samling.

Scenario: vad vi har

Låt oss säga att du får en samling av 250 dokument: några tryckta (tryckt korrespondens, annonser), några manuskript (brev, anteckningsböcker), från olika datum, några innehåller känsliga personuppgifter. Mål: att digitalisera, transkribera, katalogisera och göra denna samling tillgänglig för forskare. Låt oss dela upp processen i sju steg.

Arbetsflöde i sju steg

Fas 1 — Bedömning och etisk screening. Lär känna samlingen först. Vilka dokument innehåller känsliga personuppgifter? Vad är upphovsrättsstatusen? Finns det kulturell känslighet? Denna skanning avgör vilka dokument som kan ges till molnbaserade AI-verktyg och vilka som endast kommer att behandlas i en stängd/godkänd miljö. Om detta skede hoppas över är hela projektet i etisk risk.

Steg 2 — Digitalisering. Skanna dokument med hög upplösning (minst 300-400 DPI, bra kontrast). Behåll originalfilerna orörda; All bearbetning kommer att ske på kopiorna.

Steg 3 — Textextraktion. Använd OCR för papperskopior och HTR för manuskript. Låt AI rensa upp råutdata med instruktionen "säker korrekturläsning" - endast optiska/igenkänningsfel, inga innehållskommentarer, oläsbara platser [?]. Alternativ läsning och paleografkontroll för det osmanska/manuskriptet.

Steg 4 — Metadata och katalogisering. Ha standardmetadata (Dublin Core/ISAD(G)) utarbetade för varje dokument; Med tillstånd från "lämna obefintligt fält tomt". Kartlägg ämnestermer till den kontrollerade listan. Verifiera datum och namn med dokumentation.

Steg 5 — Anrikning och mönstring. Extrahera enheter (person/plats/organisation), normalisera, producera relations- och tidslinjekonturer. Verifiera varje mönster i dokumentet; Det finns inga konstruerade samband och ingen kronologi.

Steg 6 — Tillgång till verktyg. Ta fram en beskrivning av hjälpmedel för insamling; Basera historikavsnittet endast på verifierade anteckningar. Markera tydligt åtkomstbegränsningar (sekretess/upphovsrätt).

Steg 7 — Verifiering, deklaration och publicering. Verifiera kritiska fält (datum, namn, citat, referens) en sista gång. Deklarera användning av AI. Experten ger slutgiltigt godkännande; Samlingen öppnas för forskning.

Tips: Sätt en "mänsklig kontrollpunkt" vid varje steg: En expert validerar AI:s utdata innan han går vidare till nästa steg. Utan dessa kontrollpunkter kommer ett fel i det första steget (ett felläst datum) att spridas genom hela kedjan och så småningom läcka in i katalogen, mönstret och guiden.

Styrkedjebord

Scen

AI:s jobb

mänsklig kontrollpunkt

1. Etisk screening

Märkning av känsliga data

Installationsbeslut

2. Digitalisering

(Bildförbättring)

Kvalitet, mästarskydd

3. Textextraktion

OCR/HTR + säker korrigering

Namn/datum/läsverifiering

4. Metadata

standardutkast

Fältbekräftelse, terminsmatchning

5. Mönster

enhet, relation, tidslinje

Validering i dokument

6. Åtkomstverktyg

Att hitta stödutkast

Historik och begränsningsgodkännande

7. Släpp

Slutligt godkännande, deklaration

tre minifodral

Fall 1 — Kedjefel har upptäckts. I ett projekt, i fas 3, stod datumet för ett dokument "1868" istället för "1888". Om steg 3-kontrollpunkten inte hade fångat detta fel, skulle datumet ha spridits över katalogen (4), tidslinjen (5) och guiden (6). Tack vare checkpointen fixades buggen på ett ställe. Lärdom: tidig kontroll förhindrar att felet sprider sig uppåt i kedjan.

Fall 2 — Etisk screening räddade projektet. 18 av de 250 dokumenten innehöll känsliga uppgifter om levande personer. Etisk screening i fas 1 flaggade för dessa; dessa 18 dokument behandlades i en sluten miljö, resten med standardverktyg. Det skulle ha varit ett allvarligt brott om skanningen hoppades över och allt laddades upp till molnet. Lektion: Etikkontroll är det första steget, inte en fix som läggs till senare.

Fall 3 — Tid och ansträngning. Med den traditionella metoden skulle det ta cirka 8-10 månader att fullständigt bearbeta en samling av 250 dokument. Med det AI-stödda, checkpoint-arbetsflödet reducerades processen till cirka 3 månader. Men besparingarna kom inte från "AI gjorde allt", utan från "AI gjorde det mekaniska arbetet, fokuserat på mänsklig verifiering." Den tid som ägnas åt verifiering har inte minskat; Tiden som ägnas åt mekaniskt arbete har minskat.

Fyra kopierbara mallar

1) Projektets initiala plan:

Jag har en samling av [antal] dokument: [blandning av tryckt/manuskript], [punkt], av vilka några kan innehålla känsliga uppgifter. Skapa en 7-stegs arbetsflödesplan för att digitalisera och katalogisera den här samlingen: specificera AI:s uppgift och HUMAN-kontrollpunkten i varje steg. Sätt etikkontroll först.

2) Checklista för stegövergång:

Jag avslutade scenen [scennamn]. Ta fram en checklista med kritiska punkter jag behöver verifiera innan jag går vidare till nästa steg: vilka fakta (datum/namn/referens) behöver verifieras, vilka fel kan spridas upp i kedjan? Jag har det slutgiltiga godkännandet; Du ger mig checklistan.

3) End-to-end kvalitetskontroll:

Nedan finns alla lager i ett bearbetat dokument: transkription, metadata, extraherade tillgångar. FIGURBEGREP mellan lager: stämmer ett datum i transkriptionen överens med metadata, finns entiteterna verkligen i texten? Påförande av korrigering; Skapa en lista över inkonsekvenser. Lager: [här]

4) Projektavslutning och deklaration:

I det här insamlingsprojektet använde jag AI i följande steg: [lista]. För projektdokumentation: (1) vilket AI-stöd som användes i vilket skede, (2) hur utfördes mänsklig verifiering, (3) vilka gränser/restriktioner finns det – skriv en ärlig slutanteckning och ett utkast till AI-användningsförklaring som inkluderar dessa.

Svag prompt / Stark prompt

Svag:

Bearbeta denna samling grundligt med AI och gör den redo för forskning.

En enda "gör vad som helst"-instruktion förbigår etisk kontroll, kontrollpunkter och verifiering; fel sprider sig längs kedjan.

Stark:

Skapa ett arbetsflöde i sju steg för den här samlingen, med en mänsklig kontrollpunkt i varje steg. Låt 1:a steget vara etik/integritetsscreening. Utdata som produceras av AI i varje steg kommer att verifieras innan du går till nästa steg; markera kritiska fakta (datum/namn/referens). I inget skede har AI det sista ordet.

Skillnaden: stegvis struktur, etikprioritet, checkpoints och principen "folk har sista ordet" gör hela projektet säkert och försvarbart.

Vanliga misstag

  • Lämnar den etiska granskningen till slutet. Sekretess-/upphovsrättsskanning är det första steget; Om det läggs till senare har överträdelsen redan inträffat.
  • Förbi kontrollpunkter. Ett fel som inte är verifierat sprider sig över hela kedjan.
  • Skyddar inte huvudfilen. Om originalet inte hålls orört blir återlämnande omöjligt.
  • Sparar på verifiering. AI förkortar mekaniskt arbete; Om verifieringstiden förkortas sjunker kvaliteten.
  • Deklarerar inte användningen av AI. Transparens är en del av samlingens vetenskapliga trovärdighet.

Sammanfattningsvis

Ett heltäckande arkivprojekt kopplar samman individuella färdigheter i en kontrollkedja: etisk skanning, digitalisering, textextraktion, metadata, mönster, hämtningsverktyg och publicering. I varje steg påskyndar AI det mekaniska arbetet; I varje steg har en mänsklig kontrollpunkt sista ordet. Etisk screening är det första steget, masterfilen är skyddad, fel fångas upp tidigt så att de inte sprids upp i kedjan och användningen av AI deklareras ärligt. Besparingarna kommer inte från att AI gör allt, utan från att människan är fri från mekaniskt arbete och fokuserar på verifiering. AI accelererar; Människan säkerställer historiens riktighet och integritet.

Applikationsuppgift

Välj en liten samling (10-20 dokument; eget material eller en provuppsättning). Skapa ett 7-stegs arbetsflöde med mallen "projektstartplan". Kör minst två dokument genom detta flöde: etisk skanning, textextraktion, metadata och ett mönsterlager. Verifiera varje steg med en "checklista för stegövergång". Slutligen, dokumentera din användning av AI med mallen "projektavslutning och uttalande". Notera vilka fel som upptäcktes vid tidiga kontrollpunkter.

checklista

  • [ ] Jag gjorde undersökningen om etik/integritet i det första skedet.
  • [ ] Jag behöll masterfilerna orörda.
  • [ ] Jag satte en mänsklig kontrollpunkt i varje steg.
  • [ ] Jag verifierade kritiska fakta innan de spreds upp i kedjan.
  • [ ] Jag deklarerade användningen av AI vid projektets avslutande.

Modulexamen

1. Vilken är den lämpligaste positioneringen för artificiell intelligens inom historia och arkivering?

  • A) AI är ett sammanfattnings-, redigerings- och utkastverktyg; Kommentar, källkritik och slutansvar tillhör experten ✔
  • B) Artificiell intelligens kan avgöra dokumentets äkthet och innebörd på egen hand, som en historiker
  • C) Artificiell intelligens fungerar bara för att översätta text, det har inget att göra med andra arkivuppgifter
  • D) Eftersom artificiell intelligens alltid är mer opartisk än människor, bör historisk tolkning överlåtas åt det.

Beskrivning: Artificiell intelligens; Det är en assistent som redigerar, scannar, översätter och producerar textutkast. Källkritik, tolkning, orsak-verkan fastställande och slutligt beslut tillhör experten; En overifierad utdata kan leda till en påhittad källa, ett falskt datum eller en anakronism.

2. Vilken hallucination produceras av artificiell intelligens i historisk forskning?

  • A) Artificiell intelligens bearbetar ett dokument mycket långsamt
  • B) Artificiell intelligens tillverkar en icke-existerande källa, citat eller händelse som verklig ✔
  • C) Ett dokument är fysiskt skadat
  • D) En arkivkatalog är inte uppdaterad

Förklaring: Hallucination är när artificiell intelligens med tillförsikt tillverkar information, källor, citat eller händelser som faktiskt inte existerar. Även om dess form verkar perfekt, är dess innehåll inte verkligt; Därför, i varje referenskatalog, måste varje citat verifieras vid den ursprungliga källan.

3. Vilket är det bästa sättet att få en OCR-utgång korrigerad med artificiell intelligens?

  • A) Att be texten vara flytande och vacker och att logiskt komplettera de saknade delarna.
  • B) Tillåta den att korrigera alla siffror och datum baserat på sammanhang
  • C) Be honom att endast korrigera optiska igenkänningsfel, lämna oläsbara områden [?] och inte ändra siffror/datum ✔
  • D) Be eleven att fylla i de oläsbara orden med den mest sannolika gissningen.

Förklaring: Den gyllene regeln i OCR-korrigering är att endast korrigera uppenbara optiska igenkänningsfel (som rn till m, l till 1); inte tolka eller komplettera innehållet i texten. Oläsbara områden är markerade med [?]; Siffrorna och datumen ändras inte, de verifieras med bilden.

4. Vad bör man fråga om från artificiell intelligens när det gäller att läsa ett ord vars vokal inte är skriven i en osmansk text?

  • A) Ge en enda, exakt avläsning, vilket påskyndar arbetet
  • B) Välj det ord som gör betydelsen mest flytande och fyll i tomrummen
  • C) Att slutföra de oläsbara delarna utifrån sin egen allmänna kunskap.
  • D) Erbjuda möjliga läsalternativ och markera tvetydiga områden istället för att påtvinga en definitiv läsning ✔

Förklaring: På ottomansk turkiska skrivs korta vokaler oftast inte; En enda vokal/bokstavsskillnad (abul och kabul, wali och vali) ändrar helt innebörden. I stället för att påtvinga en definitiv läsning bör därför möjliga alternativ ställas, oläsbara områden bör bevaras och det slutliga beslutet bör överlåtas till paleografen.

5. Vilket är det mest effektiva sättet att förhindra hallucinationer när AI producerar ett utkast till metadata (katalogpost)?

  • A) Ge uttryckligen tillåtelse att lämna fältet tomt om det inte finns med i dokumentet ✔
  • B) Begär att varje fält fylls i och inte lämnas ofullständigt.
  • C) Uppskattning av ett datum baserat på innehållet i odaterade dokument
  • D) Tillåta artificiell intelligens att generera referenskoden

Beskrivning: Fyll i trycket tvingar AI:n att skapa dokumentet genom att gissa datumet eller skaparen som inte finns i dokumentet. Det starkaste skyddet mot detta är att uttryckligen ge tillstånd att lämna fältet tomt om det inte finns i dokumentet; Dessutom mappas ämnestermer till kontrollerat ordförråd.

6. Hur ska en dokumentsammanfattning producerad av artificiell intelligens placeras i historisk forskning?

  • A) Som tillförlitliga bevis som direkt kan citeras
  • B) Som en upptäcktskarta som leder dig till själva dokumentet; Bevis är hämtat från originaldokumentet ✔
  • C) Som en adekvat resurs som kan ersätta själva dokumentet
  • D) Som en text som kan användas i studien utan att någonsin återgå till dokumentet

Beskrivning: Sammanfattningen är en upptäcktskarta, inte ett bevis. Det finns något liknande i det här dokumentet, det står gå och titta; Det står inte exakt vad det står i dokumentet. Om en händelse, citat eller data ska ingå i studien ska den ordagrant hämtas från originalhandlingen.

7. Vad är det rätta sättet att undvika anakronismer när man översätter ett historiskt dokument för publicering?

  • A) Ersätter alla periodvillkor med dagens närmaste motsvarighet
  • B) Att förmedla texten så flytande och modern som möjligt
  • C) Lämna periodtitlarna och institutionsnamnen unika och lägg till en förklaring ✔
  • D) Anpassa egennamn till deras nuvarande användning

Förklaring: Anakronism är fel överföring av element från en period till en annan. Att ändra periodtitlar, institutionsnamn och personnamn till dagens termer transporterar läsaren till en värld som inte tillhör perioden. Det korrekta sättet är att behålla periodtermen och lägga till förklaring bredvid den.

8. Hur säkerställer man att en arkivreferens (fondnamn, filnummer) som ges av artificiell intelligens är verklig?

  • A) Lita på referensen eftersom dess format verkar korrekt
  • B) Genom att fråga AI igen om referensen är korrekt
  • C) Acceptera referensen som sann eftersom den är övertygande och detaljerad
  • D) Genom att personligen hitta och verifiera referensen i arkivkatalogen eller pålitlig källa ✔

Beskrivning: Artificiell intelligens kan producera referenser som är perfekta till formen men som faktiskt inte existerar; En fiktiv referens är i samma form som en riktig referens. Det enda sättet att bevisa att en referens finns är att hitta den där den ursprungliga källan finns (arkivkatalog, bibliotek).

9. Hur ska ett mönster som hittas när man utför mönsteranalys (NER, nätverk, tidslinje) med artificiell intelligens utvärderas?

  • A) Som en hypotes som måste verifieras i dokumentet; utgångspunkt, inte resultat ✔
  • B) Som ett definitivt fynd som inte kräver verifiering
  • C) Det är ett obestridt objektivt faktum eftersom det är numeriskt.
  • D) Som ett resultat som kan sättas i direkt studie eftersom det hittade artificiell intelligens

Förklaring: Varje mönster är en hypotes, inte bevis. Entiteter bör kopplas till källan, olika stavningar (av samma person/plats) bör normaliseras med mänskligt godkännande, siffror bör ifrågasättas för saknade data och provtagningsbias, och odaterade händelser bör inte kronologiseras.

10. Varför kräver avsnittet om biografisk/institutionell historia i ett hjälpmedel särskild uppmärksamhet?

  • A) Detta avsnitt är oviktigt och kan publiceras utan verifiering
  • B) Eftersom artificiell intelligens kan lägga till påhittade händelser, falska datum och titlar i det här avsnittet, bör den endast förlita sig på verifierade källor ✔
  • C) Artificiell intelligens kan användas på ett säkert sätt eftersom det inte gör några misstag i att skriva historia.
  • D) Endast forskare fyller detta avsnitt, arkivarien är inte intresserad

Beskrivning: Historieavsnittet är där hallucinationer oftast smyger sig in: AI:n kan infoga icke-existerande händelser, falska datum och påhittade titlar samtidigt som den skriver en flytande text från allmän information om en person eller institution. Det här avsnittet bör endast baseras på verifierade källor.

11. Hur ska artificiell intelligens svara på en forskares faktafråga i en referens- (konsult)tjänst?

  • A) Svaret på frågan bör ges direkt och som ett definitivt faktum.
  • B) Måste ta fram ett trovärdigt datum eller namn och förmedla det till forskaren.
  • C) Istället för att ge fakta direkt bör den hänvisa forskaren till relevant samling och källa ✔
  • D) Den ska ge ett fullständigt svar så att forskaren inte behöver gå till källan.

Förklaring: I referenstjänsten ska artificiell intelligens inte ge ett direkt faktasvar utan ska styra forskaren till källan. Eftersom det direkta sakliga svaret från artificiell intelligens kan vara påhittat och forskaren kan missta det för källan. Istället för att säga "Svaret är detta" ska det stå "Titta på dessa dokument i den här samlingen".

12. Vilka operationer är acceptabla och stötande vid bearbetning av en skadad dokumentbild med artificiell intelligens?

  • A) Alla typer av operationer är gratis, inklusive att fylla i de saknade delarna.
  • B) Ingen åtgärd ska vidtas, bilden ska aldrig vidröras
  • C) Att fylla i de saknade avsnitten är den mest värdefulla åtgärden eftersom det kompletterar dokumentet.
  • D) Läsbarhetsmanipulationer som kontrast/brus är acceptabla; Det är obekvämt att fylla i de saknade delarna med gissningar ✔

Förklaring: Processer som förbättrar läsbarheten (kontrast, ljus, brusreducering) är acceptabla eftersom de inte ändrar innehållet; Att fylla i saknade/oläsbara delar med gissningar är dock risken att producera det som inte finns i dokumentet, det vill säga historisk förfalskning. Originalet bevaras, transaktioner registreras.

13. Vad behöver göras innan man behandlar ett arkivdokument som innehåller känsliga personuppgifter?

  • A) Sekretessskanning och anonymisering vid behov eller med ett stängt/godkänt verktyg ✔
  • B) Ladda upp dokumentet direkt till ett allmänt fordon utan att ens tänka på det
  • C) Ignorera integritetsproblem för effektivitet
  • D) Att övervinna åtkomstbegränsningar av effektivitetsskäl

Avslöjande: Att ladda upp dokument som innehåller känsliga uppgifter som identifierar levande personer (hälsa, religion, etnicitet, adress) till offentliga, molnbaserade verktyg kan vara en allvarlig kränkning av integriteten. Integritetsscreening bör göras först, anonymisering eller ett stängt/godkänt verktyg ska användas vid behov.

14. Vilket är huvudsyftet med en mänsklig kontrollpunkt i ett helhetsarkivprojekt?

  • A) Att sakta ner arbetet med artificiell intelligens och försena projektet
  • B) För att förhindra att ett fel (felaktigt datum/namn) i ett steg kopplas till alla efterföljande steg ✔
  • C) Att öka mänskligt arbete och ge upp automatiseringen helt
  • D) Se till att artificiell intelligens har sista ordet

Beskrivning: En mänsklig kontrollpunkt i varje steg säkerställer att AI:s utdata verifieras innan du går vidare till nästa steg. Utan detta skulle ett fel i det första steget (ett felläst datum) spridas upp i kedjan genom katalogen, mönstret och guiden. Tidig kontroll säkerställer att felet åtgärdas på ett ställe.

15. Vad kräver transparens och autenticitet vid användning av artificiell intelligens inom humaniora och samhällsvetenskap?

  • A) Att hålla användningen av artificiell intelligens hemlig, se till att ingen vet
  • B) Att presentera varje text som produceras av artificiell intelligens som sin egen ursprungliga idé
  • C) Att ärligt deklarera användningen av artificiell intelligens och att inte presentera dess produktion som ens eget originalverk ✔
  • D) Dela endast resultaten utan att förklara metoderna

Beskrivning: Transparens inkluderar registrering av att en transkription, metadata eller översättning producerats med hjälp av artificiell intelligens; Originalitet kräver att man inte presenterar en kommentar producerad av artificiell intelligens som sin egen ursprungliga idé. Detta är väsentligt för verifiering av efterföljande forskare och för akademisk integritet.