Eenheid 5 / 11

Opgravingsrecord, database en gegevensstandaarden

Winst:

  • Mogelijkheid om de gegevensintegriteit te behouden terwijl opname-eenheden zoals context/locus, stratigrafie en Harris Matrix worden gedigitaliseerd en gestandaardiseerd met kunstmatige intelligentie
  • Mogelijkheid om onbewerkte gegevens te beschermen en elke transformatie traceerbaar te houden tegen het risico dat kunstmatige intelligentie ontbrekende gegevens aanvult en stille wijzigingen aanbrengt
  • Begrijp waarom gecontroleerd woordenboek, metadata en open/FAIR-principes essentieel zijn voor de toekomstige bruikbaarheid van gegevens.

De wetenschappelijke waarde van een opgraving ligt niet in de goudvondsten die eruit voortkomen, maar in de kwaliteit van de archieven. Een vondst die niet goed gedocumenteerd is, is voor de wetenschap vrijwel irrelevant; Omdat het een object is waarvan onbekend is waar, in welke laag en waarmee het zich bevindt, is het gewoon een prachtig object. In deze unit zullen we kijken naar het loggen van opgravingen (de systematische transcriptie en database van elke context, vondst en observatie) en hoe AI de gegevensinvoer, organisatie en standaardisatie kan versnellen, maar waarom de verantwoordelijkheid voor gegevensintegriteit bij de mens blijft liggen.

Basisprincipe: AI helpt verspreide records te ordenen, te standaardiseren en inconsistenties te vinden; Maar welke gegevens juist zijn, of een document de waarheid weerspiegelt, en de integriteit van de gegevens zijn menselijke verantwoordelijkheid. AI corrigeert de vorm van de gegevens, maar garandeert de nauwkeurigheid ervan niet.

Basiseenheden van het archeologische record

Context/plaats. Elke opgraving verdeelt de locatie in contexteenheden (context/locus - een individuele afzetting, laag, put of muur; de kleinste betekeniseenheid van de opgraving). Elke context krijgt een uniek nummer en alle vondsten worden aan dat nummer gekoppeld.

Stratigrafie en Harris-matrix. Stratigrafie (de voor-na-relatie van lagen ten opzichte van elkaar) is de basis van relatieve datering. De Harris Matrix (een diagram dat de volgorde van contexten ten opzichte van elkaar laat zien) visualiseert deze relaties. AI helpt bij het detecteren van inconsistente stratigrafische relaties (bijvoorbeeld een cyclische ‘A is zowel boven als onder B’-fout).

Zoek inventaris. Elke vondst; De context wordt vastgelegd met nummer, type, maat, materiaal, staat en foto.

Gegevensstandaarden. Er worden gemeenschappelijke standaarden gebruikt om documenten deelbaar en vergelijkbaar te maken. CIDOC-CRM (een internationaal conceptueel raamwerk/ontologie ontwikkeld om cultureel-erfgoedgegevens te beschrijven) zorgt ervoor dat gegevens van verschillende instellingen met elkaar kunnen praten. Er wordt gebruik gemaakt van een gecontroleerde termenwoordenlijst (een goedgekeurde lijst die ervoor zorgt dat iedereen dezelfde term voor hetzelfde concept gebruikt).

Tip: Gebruik AI om gegevens te ‘organiseren en te controleren’, en niet om deze te ‘interpreteren’. "Welke contextnummers zijn tegenstrijdig in deze documenten?" Het is een goede vraag; "Tot welke periode behoort deze context?" Het is een deskundige beslissing. Waar AI het sterkst is, is het controleren van de consistentie.

Rollen van AI in registratie en database

  • Digitalisering. Handgeschreven opgravingsnotitieboekjes, inventariskaarten en oude tekeningen worden met AI-aangedreven tekstherkenning in de database geïmporteerd (deze linkt naar HTR in unit 6).
  • Standaardisatie. Verschillende spellingen ("byzantium", "Byzantium", "byz.") worden in kaart gebracht in het gecontroleerde woordenboek; data en metingen worden in uniforme vorm gebracht.
  • Consistentiecontrole. Fouten zoals ontbrekend contextnummer, tegenstrijdige stratigrafie, gebruik van hetzelfde nummer in twee verschillende vondsten worden gemarkeerd.
  • Vraag en samenvatting. Zoekopdrachten zoals “Alle glasvondsten in de volgende context” en samenvattende tabellen worden snel gegenereerd.
Let op: bij het standaardiseren kan de AI in stilte gegevens wijzigen terwijl hij probeert deze te ‘repareren’; Hij kan bijvoorbeeld een meting afronden op een "redelijke" waarde of een onzekere waarde invullen met zijn eigen schatting. Elke automatische wijziging moet traceerbaar zijn en de originele registratie moet bewaard blijven. Ruwe gegevens worden nooit overschreven.

drie minikoffers

Casus 1 — Digitalisering heeft het archief gered. Een museum bewaarde 40 jaar aan handgeschreven inventariskaarten (ongeveer 22.000 kaarten) en dreigde verloren te gaan. Door AI aangedreven tekstherkenning en standaardisatie importeerden de kaarten in een doorzoekbare database; Elke kaart werd steekproefsgewijs gecontroleerd door een menselijke onderzoeker, en onleesbare gebieden werden gemarkeerd als ‘onduidelijk’.

Geval 2 — Inconsistentiecontrole heeft fouten gevonden. Een opgravingsteam liet de AI aan het einde van het seizoen de database auditen; YZ markeerde dat drie vondsten hetzelfde contextnummer hadden, maar conflicterende laaginformatie. Uit de beoordeling bleek dat er sprake was van een fout bij het invoeren van de gegevens; als dit niet werd gecorrigeerd, zou dit de stratigrafische interpretatie hebben verdraaid.

Geval 3 – Stille verandering betrapt. Bij het standaardiseren van de metingen merkte een assistent op dat de AI sommige ‘0’-waarden als ‘nul’ interpreteerde in plaats van als ‘ontbrekend’; hierdoor werden de lengtes van de gebroken stukken vervormd. Het proces is opnieuw opgebouwd om de oorspronkelijke gegevens te behouden, maar de wijzigingen in een aparte kolom te bewaren.

Vier kopieerbare sjablonen

1) Standaardisatie (gecontroleerd woordenboek):

Jouw rol: assistent dataverwerking. Wijs de waarden van [veld:materiaal/periode/type] in de volgende records toe aan het volgende gecontroleerde woordenboek: [woordenboeklijst]. VERANDER waarden die geen equivalenten hebben in het woordenboek; Markeer het als 'geen match'. Rapporteer elke wijziging als een origineel-nieuw paar; het verwijderen van ruwe gegevens.

2) Consistentiecontrole:

Vind inconsistenties in de volgende opgravingsgegevens: repetitieve contextnummers, ontbrekende verplichte velden, conflicterende stratigrafische relaties, lastige datums/metingen. Vermeld elk probleem met registratienummer en laat het aan MIJ over om het op te lossen; verander het niet zelf.

3) Logicabesturing Harris Matrix:

Hieronder vindt u stratigrafische relaties tussen contexten (A boven/onder B). Is er sprake van een logische tegenstrijdigheid (lus, tweerichtingsrelatie)? Laat zien welke contexten er zijn, indien aanwezig. Geef geen commentaar; controleer gewoon op logische consistentie.

4) Vraag- en overzichtstabel:

Het volgende uittreksel uit de onderstaande databasedump: [bijv. zoek typeverdeling per context]. Geef het resultaat in de vorm van een tabel, waarbij u specificeert uit welke records elke rij is afgeleid. VOEG GEEN waarde toe die niet in de gegevens voorkomt; Als het leeg is, schrijf dan "geen gegevens".

Zwakke prompt/sterke prompt

Zwakke prompt:

Corrigeer deze graafgegevens en vul de ontbrekende items in.

“Fill in the gaps” zorgt ervoor dat de AI gegevens kan aanpassen; Het resultaat is een onbetrouwbare database waarin feit en fictie door elkaar lopen.

Krachtige prompt:

Markeer ALLEEN formele inconsistenties (spelling, datumformaat, dubbele ID) in de onderstaande opgravingsgegevens. VOLLEDIGE ontbrekende waarden; Laat het op "onvolledig" staan. Maak een lijst van elke voorgestelde wijziging samen met het origineel; Ik zal de goedkeuring geven. Ruwe gegevens wijzigen.

Verschil: de eerste corrumpeert gegevens in stilte; De tweede controleert en laat de beslissing over aan de mens.

Goed datamodel: velden, relaties en metadata

Een archeologische database is geen willekeurige tabel, maar een doordacht datamodel (een blauwdruk van welke tabellen, welke velden en in welke relaties de gegevens zullen worden georganiseerd). Uitgangspunt is dat alles afhankelijk is van context: vondsten aan context, contexten aan elkaar (stratigrafie) en aan het veld. Elk record heeft een unieke identiteit (ID) en via deze identiteiten worden relaties tot stand gebracht; Een vondst verwijst naar één context, een context kan meerdere vondsten bevatten.

Net zo belangrijk als de opname zijn de metadata (gegevens over de data zelf: wie heeft deze vastgelegd, wanneer, met welke methode, welke versie). Een record dat onbekend is door wie, wanneer en met welk vertrouwen het is ingevoerd, kan in de toekomst niet meer in twijfel worden getrokken. AI is nuttig bij het controleren van de consistente vulling van metadatavelden en het signaleren van ontbrekende metadata.

Een ander cruciaal principe is een open en duurzaam format. In plaats van gegevens op te sluiten in propriëtaire, gesloten software, zorgt het dicht bij open standaarden (op tekst gebaseerde tabellen, gedocumenteerde schema's) ervoor dat gegevens decennia later kunnen worden gelezen. Archeologische gegevens worden niet voor één enkele publicatie geproduceerd, maar voor toekomstige generaties; Daarom zijn de FAIR-principes (Finding, Accessable, Interoperable en Reusable of data) steeds standaarder geworden. AI is nuttig bij het labelen van uw gegevens in overeenstemming met deze principes en het opsporen van tekortkomingen; Maar het is aan u om te beslissen welke gegevens open blijven en welke gevoelig (vertrouwelijk) blijven.

Tip: Wanneer u uw database opzet, vraag uzelf dan af: "Kan iemand die dit niet weet deze binnen tien jaar openen en begrijpen?" vragen. Leg uw afkortingen uit in een verklarende woordenlijst, vul de metadatavelden in en maak een back-up van de onbewerkte gegevens in een open formaat.

Record-/databasetaaktabel

Zoektocht

Rol van AI

menselijke beslissing

beschermingsregel

digitalisering

tekstherkenning

Vage leesbevestiging

Ruwe scan wordt opgeslagen

standaardisatie

Kaart naar woordenboek

Niet-overeenkomende waardebeslissing

Het origineel is bewaard gebleven

Consistentie

Tegenstrijdigheidsmarkering

correctie

Verandering wordt bijgehouden

stratigrafie

Logische controle

Commentaar

Goedkeuring door matrixdeskundigen

Vraag/samenvatting

Tafelproductie

Commentaar, keuze

Trouw aan gegevens

Veel voorkomende fouten

  • Het aanvullen van ontbrekende gegevens. AI maakt het goed; Het ontbrekende moet ‘onvolledig’ blijven.
  • De onbewerkte gegevens overschrijven. Het origineel blijft altijd bewaard; wijzigingen worden gescheiden gehouden.
  • Geen stille veranderingen opmerken. Elke automatische conversie moet worden gerapporteerd en gecontroleerd.
  • De standaard overslaan. Zonder een gecontroleerd woordenboek en een gemeenschappelijk model kunnen gegevens niet worden gedeeld.
  • AI stratigrafische interpretatie laten uitvoeren. AI vindt logische tegenspraak; Commentaar is voor de deskundige.

Samengevat

AI in opgravingsrecord en database; Het biedt grote snelheid bij digitalisering, standaardisatie, consistentiecontrole en querywerkzaamheden. Maar data-integriteit is heilig: er blijven geen ontbrekende onderdelen intact, ruwe data blijven behouden, elke verandering wordt bijgehouden en de stratigrafische interpretatie is het eigendom van de expert. Goede documenten zijn de meest waardevolle erfenis die opgravingen achterlaten voor de toekomst.

Applicatie taak

Bereid een kleine gegevenstabel voor opgravingen voor (10-20 records); heb er opzettelijk een paar inconsistenties in gestopt (dubbele ID, misvormde datum, conflicterende laag). Laat de AI deze vinden met ‘consistentiecontrole’ en ‘Harris Matrix logic check’-patronen; schrijf vervolgens een gecontroleerd woordenboek en wijs het materiaalveld toe aan de sjabloon "Standaardisatie" en zorg ervoor dat de onbewerkte gegevens behouden blijven.

controlelijst

  • [ ] De ruwe data heb ik apart en ongewijzigd opgeslagen.
  • [ ] Ik heb de AI de ontbrekende delen niet laten aanvullen; Ik heb het als "onvolledig" gelaten.
  • [ ] Ik heb elke automatische wijziging gecontroleerd met het origineel.
  • [ ] Ik gebruikte gecontroleerde woordenboeken en datastandaarden.
  • [ ] Ik heb de stratigrafische interpretatie gemaakt op basis van deskundig oordeel.