Nyereség:
- Képes megőrizni az adatok integritását, miközben digitalizálja és szabványosítja a rögzítési egységeket, mint például a kontextus/lókusz, a stratigráfia és a Harris Matrix mesterséges intelligenciával
- Képes megvédeni a nyers adatokat, és nyomon követni minden egyes átalakítást a mesterséges intelligencia által a hiányzó adatok kiegészítése és a csendes módosítások kockázata ellen.
- Értse meg, miért elengedhetetlenek az ellenőrzött szótár, a metaadatok és a nyílt/FAIR elvek az adatok jövőbeni használhatósága szempontjából.
Egy ásatás tudományos értéke nem a belőle előkerülő aranyleletekben, hanem a feljegyzések minőségében rejlik. A nem jól dokumentált lelet szinte irreleváns a tudomány szempontjából; Mert egy olyan tárgyról van szó, amiről nem tudni, hol, melyik rétegben, és mivel található, csak egy gyönyörű tárgy. Ebben az egységben megvizsgáljuk az ásatási naplózást (minden kontextus, lelet és megfigyelés szisztematikus átírása és adatbázisa), valamint azt, hogy a mesterséges intelligencia hogyan gyorsíthatja fel az adatok bevitelét, rendszerezését és szabványosítását, de miért marad az emberek felelőssége az adatok integritásáért.
Alapelv: A mesterséges intelligencia segít a szétszórt rekordok rendszerezésében, szabványosításában és az inkonzisztenciák megtalálásában; De hogy mely adatok pontosak, hogy egy rekord az igazságot tükrözi-e, és az adatok sértetlensége, az emberi felelősség. Az AI korrigálja az adatok alakját, nem garantálja azok pontosságát.
A régészeti lelet alapegységei
Kontextus/hely. Minden ásatás kontextusegységekre osztja a helyszínt (kontextus/locus – egyedi lerakódás, réteg, gödör vagy fal; az ásatás legkisebb jelentési egysége). Minden kontextus egyedi számot kap, és minden lelet ehhez a számhoz kapcsolódik.
Sztratigráfia és Harris Mátrix. A rétegtan (a rétegek egymáshoz viszonyított előtte-utána viszonya) a relatív kormeghatározás alapja. A Harris Mátrix (a kontextusok egymáshoz viszonyított sorrendjét bemutató diagram) ezeket a kapcsolatokat jeleníti meg. A mesterséges intelligencia segít észlelni az inkonzisztens rétegtani kapcsolatokat (pl. ciklikus „A B felett és alatt van” hiba).
Keressen készletet. Minden lelet; A kontextust számmal, típussal, mérettel, anyaggal, állapottal és fényképpel rögzítjük.
Adatszabványok. Közös szabványokat használnak a rekordok megoszthatóvá és összehasonlíthatóvá tételéhez. A CIDOC-CRM (a kulturális örökség adatainak leírására kifejlesztett nemzetközi fogalmi keret/ontológia) lehetővé teszi, hogy a különböző intézmények adatai beszéljenek egymással. A terminusok ellenőrzött szótárát (egy jóváhagyott lista, amely biztosítja, hogy mindenki ugyanazt a kifejezést használja ugyanarra a fogalomra) használjuk.
Tipp: Használja az AI-t az adatok „rendezésére és auditálására”, ne „értelmezésére”. "Milyen kontextusszámok ellentmondanak ezekben a rekordokban?" Jó kérdés; – Melyik időszakhoz tartozik ez a kontextus? Ez szakértői döntés. Ahol az AI a legerősebb, az a konzisztencia-ellenőrzés.
Az AI szerepe a regisztrációban és az adatbázisban
- Digitalizálás. A kézzel írott ásatási jegyzetfüzetek, leltári kártyák és régi rajzok mesterséges intelligencia által támogatott szövegfelismeréssel importálódnak az adatbázisba (ez a 6. egységben található HTR-re hivatkozik).
- Szabványosítás. Különböző írásmódok ("bizánc", "bizánc", "byz.") vannak leképezve az ellenőrzött szótárban; a dátumok és a mérések egységes formába kerülnek.
- Konzisztencia ellenőrzése. Jelölve vannak az olyan hibák, mint a szövegkörnyezetszám hiánya, egymásnak ellentmondó rétegtan, azonos szám használata két különböző leletben.
- Lekérdezés és összefoglaló. Az olyan lekérdezések, mint például az „Összes üveglelet a következő kontextusban” és az összefoglaló táblázatok gyorsan generálódnak.
Figyelem: szabványosításkor az AI csendben módosíthatja az adatokat, miközben megpróbálja "javítani" azokat; például kerekíthet egy mérést "ésszerű" értékre, vagy kitölthet egy bizonytalan értéket saját becslésével. Minden automatikus változásnak nyomon követhetőnek kell lennie, és az eredeti rekordot meg kell őrizni. A nyers adatok soha nem íródnak felül.
három mini tok
1. eset – A digitalizálás mentette az archívumot. Egy múzeumban 40 évnyi, kézzel írt leltári kártyát (körülbelül 22 000 kártyát) tároltak az elveszés veszélyével. Az AI-alapú szövegfelismerés és szabványosítás a kártyákat kereshető adatbázisba importálta; Minden kártyát minta alapján ellenőriztek egy humán vizsgáló, és az olvashatatlan területeket „nem egyértelmű” jelzéssel látták el.
2. eset – Az inkonzisztencia-ellenőrzés hibákat talált. Egy ásatási csapat az AI-val ellenőrizte az adatbázist a szezon végén; YZ megjelölte, hogy három leletnek ugyanaz a környezeti száma, de egymásnak ellentmondó réteginformációi vannak. Az áttekintés adatbeviteli hibát tárt fel; ha nem javítják ki, az eltorzította volna a rétegtani értelmezést.
3. eset – Elkapták a csendes változást. A mérések szabványosítása közben egy asszisztens észrevette, hogy az AI néhány „0” értéket „nullaként” értelmez, nem pedig „hiányzóként”; ez torzította a törött darabhosszakat. A folyamatot átépítettük, hogy az eredeti adatokat megőrizzük, de a változtatásokat külön oszlopban tartsuk.
Négy másolható sablon
1) Szabványosítás (ellenőrzött szótár):
Az Ön szerepe: adatvívó asszisztens. A következő rekordokban lévő [mező:anyag/időszak/típus] értékeit rendelje hozzá a következő ellenőrzött szótárhoz: [szótárlista]. CHANGE értékek, amelyeknek nincs megfelelőjük a szótárban; Jelölje meg "nincs egyezés". Minden változást eredeti-új párként jelentsen; nyers adatok törlése.
2) Konzisztencia ellenőrzése:
Keressen következetlenségeket a következő ásatási rekordokban: ismétlődő kontextusszámok, hiányzó kötelező mezők, egymásnak ellentmondó rétegtani kapcsolatok, kínos dátumok/mérések. Soroljon fel minden problémát a regisztrációs számmal, és bízza rám a megoldást; ne változtasd meg magad.
3) Harris Matrix logikai vezérlés:
Az alábbiakban a kontextusok közötti rétegtani kapcsolatokat mutatjuk be (A fent/ alatt B). Van-e logikai ellentmondás (hurok, kétirányú kapcsolat)? Mutassa meg, mely kontextusokat, ha van ilyen. Ne kommentáljon; csak ellenőrizze a logikai konzisztenciát.
4) Lekérdezés és összefoglaló táblázat:
Az alábbi kivonat az alábbi adatbázis dumpból: [pl. típuseloszlás keresése kontextusonként]. Az eredményt táblázat formájában adja meg, megadva, hogy az egyes sorok mely rekordokból származnak. NE ADJ hozzá olyan értéket, amely nem létezik az adatokban; Ha üres, írja be, hogy "nincs adat".
Gyenge felszólítás / Erős felszólítás
Gyenge felszólítás:
Javítsa ki ezeket az ásatási adatokat, és töltse ki a hiányzó tételeket.
„A hiányosságok kitöltése” lehetővé teszi az AI számára, hogy illeszkedjen az adatokhoz; Az eredmény egy megbízhatatlan adatbázis, amelyben tények és fikciók keverednek.
Erőteljes felszólítás:
Az alábbi ásatási adatokban CSAK formai ellentmondásokat (elírás, dátumformátum, azonosító másolat) jelöljön meg. TELJES hiányzó értékek; Hagyja "hiányosként". Sorolja fel az összes javasolt változtatást az eredetivel együtt; megadom a jóváhagyást. Nyers adatok módosítása.
Különbség: az előbbi csendben rontja az adatokat; A második irányít, és az emberre bízza a döntést.
Jó adatmodell: mezők, kapcsolatok és metaadatok
A régészeti adatbázis nem egy tetszőleges tábla, hanem egy átgondolt adatmodell (tervrajza arról, hogy mely táblákba, mely mezőkbe, milyen kapcsolatokba rendeződnek majd az adatok). Az alapelv az, hogy minden a kontextustól függ: a leletek a kontextusig, a kontextusok egymáshoz (sztratigráfia) és a mezőtől. Minden rekord egyedi azonosítót (ID) hordoz, és a kapcsolatok ezeken az azonosítókon keresztül jönnek létre; A lelet egyetlen kontextusra utal, egy kontextus több leletet is tartalmazhat.
A felvételhez hasonlóan fontos a metaadat is (magáról az adatról szóló adat: ki, mikor, milyen módszerrel, milyen verzióval rögzítette). Egy olyan rekordot, amelyről nem tudni, hogy ki, mikor és milyen bizalommal lépett be, a jövőben nem kérdőjelezhető meg. Az AI segít a metaadatmezők következetes kitöltésének ellenőrzésében és a hiányzó metaadatok megjelölésében.
Egy másik kritikus alapelv a nyitott és fenntartható formátum. Ahelyett, hogy az adatokat zárt, zárt szoftverekbe zárnánk, a nyílt szabványokhoz (szövegalapú táblázatok, dokumentált sémák) közel tartása biztosítja, hogy az adatok évtizedekkel később is olvashatók legyenek. A régészeti adatok nem egyetlen kiadványhoz, hanem a jövő nemzedékeihez készülnek; Ez az oka annak, hogy a FAIR alapelvei (az adatok megtalálása, hozzáférhetősége, átjárhatósága és újrafelhasználása) egyre inkább szabványossá váltak. A mesterséges intelligencia hasznos az adatok ezen elvekkel összhangban történő címkézésében és a hiányosságok feltárásában; De Ön dönti el, hogy mely adatok maradnak nyitva, és melyek maradnak érzékenyek (bizalmasak).
Tipp: Amikor létrehozza az adatbázist, tedd fel magadnak a kérdést: "Valaki, aki nem ismeri ezt, meg tudja nyitni és megérteni 10 év múlva?" kérdez. Magyarázza el a rövidítéseket egy szószedetben, töltse ki a metaadat mezőket, és készítsen biztonsági másolatot a nyers adatokról nyílt formátumban.
Rekord/adatbázis feladattábla
Quest
Az AI szerepe
emberi döntés
védelmi szabály
digitalizálás
szövegfelismerés
Homályos olvasás megerősítése
A nyers szkennelés tárolva van
szabványosítás
Térkép szótárba
Nem megfelelő értékhatározat
Az eredetit megőrzik
Következetesség
Ellentmondás jelölés
korrekció
A változás nyomon követhető
rétegtan
Logikai vezérlés
Megjegyzés
Mátrix szakértői jóváhagyás
Lekérdezés/összefoglaló
Asztalgyártás
Hozzászólás, választás
Adathűség
Gyakori hibák
- A hiányzó adatok kiegészítése. AI alkot; A hiányzónak „hiányosnak” kell maradnia.
- A nyers adatok felülírása. Az eredetit mindig megőrzik; a változtatásokat külön kell tartani.
- Nem veszi észre a csendes változásokat. Minden automatikus konverziót jelenteni és auditálni kell.
- A szabvány kihagyása. Ellenőrzött szótár és közös modell nélkül az adatok nem oszthatók meg.
- A mesterséges intelligencia rétegtani értelmezést végez. Az AI logikai ellentmondást talál; A komment a szakértőnek szól.
Összefoglalva
AI az ásatási nyilvántartásban és adatbázisban; Nagy sebességet biztosít a digitalizálási, szabványosítási, konzisztencia-ellenőrzési és lekérdezési munkákban. De az adatintegritás szent: egyetlen hiányzó rész sem marad érintetlenül, a nyers adatokat megőrzik, minden változást nyomon követnek, a rétegtani értelmezés pedig a szakértő dolga. A jó feljegyzések a legértékesebb örökség, amelyet az ásatás a jövőre hagy.
Pályázati feladat
Készítsen egy kis minta ásatási adattáblázatot (10-20 rekord); szándékosan írjon be néhány következetlenséget (ismétlődő azonosító, hibás dátum, ütköző réteg). A mesterséges intelligencia megtalálja ezeket a „konzisztencia-ellenőrzés” és a „Harris Matrix logikai ellenőrzés” mintákkal; majd írjon egy ellenőrzött szótárt, és képezze le az anyagmezőt a "Szabványosítás" sablonhoz, és ügyeljen a nyers adatok megőrzésére.
ellenőrző lista
- [ ] A nyers adatokat külön, módosítatlanul tároltam.
- [ ] A mesterséges intelligencia nem kiegészítette a hiányzó részeket; "Hiányosként" hagytam.
- [ ] Minden automatikus változtatást ellenőriztem az eredetivel.
- [ ] Ellenőrzött szótárat és adatszabványt használtam.
- [ ] A rétegtani értelmezést szakértői megítélés alapján készítettem.