Mga nadagdag:
- Kakayahang mapanatili ang integridad ng data habang nagdi-digitize at nag-standardize ng mga unit ng pag-record tulad ng context/locus, stratigraphy at Harris Matrix na may artificial intelligence
- Kakayahang protektahan ang hilaw na data at panatilihing masusubaybayan ang bawat pagbabago laban sa panganib ng artipisyal na katalinuhan sa pagkumpleto ng nawawalang data at paggawa ng mga tahimik na pagbabago
- Unawain kung bakit mahalaga ang kinokontrol na diksyunaryo, metadata, at bukas/FAIR na prinsipyo para sa kakayahang magamit ng data sa hinaharap.
Ang pang-agham na halaga ng isang paghuhukay ay hindi nakasalalay sa mga natuklasang ginto na lumabas mula dito, ngunit sa kalidad ng mga talaan nito. Ang isang natuklasan na hindi mahusay na dokumentado ay halos walang kaugnayan sa agham; Dahil ito ay isang bagay na hindi alam kung saan, saang layer, at kung ano ang matatagpuan, ito ay isang magandang bagay lamang. Sa unit na ito, titingnan natin ang excavation logging (ang sistematikong transkripsyon at database ng bawat konteksto, paghahanap, at obserbasyon) at kung paano mapabilis ng AI ang pagpasok ng data, organisasyon, at standardisasyon, ngunit bakit nananatili sa mga tao ang responsibilidad para sa integridad ng data.
Pangunahing prinsipyo: Tinutulungan ng AI na ayusin ang mga nakakalat na tala, gawing pamantayan ang mga ito at makahanap ng mga hindi pagkakapare-pareho; Ngunit aling data ang tumpak, kung ang isang talaan ay nagpapakita ng katotohanan, at ang integridad ng data ay responsibilidad ng tao. Itinutuwid ng AI ang hugis ng data, hindi nito ginagarantiyahan ang katumpakan nito.
Mga pangunahing yunit ng talaang arkeolohiko
Konteksto/lokus. Hinahati ng bawat paghuhukay ang site sa mga unit ng konteksto (konteksto/locus—isang indibidwal na deposito, layer, hukay, o pader; ang pinakamaliit na yunit ng kahulugan ng paghuhukay). Ang bawat konteksto ay tumatanggap ng natatanging numero at ang lahat ng nahanap ay nauugnay sa numerong iyon.
Stratigraphy at Harris Matrix. Stratigraphy (ang bago-pagkatapos na relasyon ng mga layer na may kaugnayan sa isa't isa) ay ang batayan ng kamag-anak na pakikipag-date. Ang Harris Matrix (isang diagram na nagpapakita ng pagkakasunud-sunod ng mga konteksto na nauugnay sa isa't isa) ay nagpapakita ng mga ugnayang ito. Tumutulong ang AI na matukoy ang mga hindi pare-parehong stratigraphic na relasyon (hal. isang cyclic na "A is both above and below B" error).
Maghanap ng imbentaryo. Bawat mahanap; Ang konteksto ay naitala na may numero, uri, sukat, materyal, kondisyon at litrato.
Mga pamantayan ng data. Ang mga karaniwang pamantayan ay ginagamit upang gawing maibabahagi at maihahambing ang mga talaan. Ang CIDOC-CRM (isang internasyonal na konseptong balangkas/ontolohiya na binuo upang ilarawan ang data ng pamana ng kultura) ay nagbibigay-daan sa data mula sa iba't ibang institusyon na makipag-usap sa isa't isa. Ang isang kinokontrol na diksyunaryo ng mga termino (isang inaprubahang listahan na nagsisiguro na ang lahat ay gumagamit ng parehong termino para sa parehong konsepto) ay ginagamit.
Tip: Gamitin ang AI para "ayusin at i-audit" ang data, hindi "i-interpret" ito. "Anong mga numero ng konteksto ang kasalungat sa mga talaang ito?" Ito ay isang magandang tanong; "Sa anong panahon nabibilang ang kontekstong ito?" Isa itong desisyon ng dalubhasa. Kung saan pinakamalakas ang AI ay nasa consistency checking.
Mga tungkulin ng AI sa pagpaparehistro at database
- Pag-digitize. Ang mga hand-written excavation notebook, inventory card at lumang drawing ay ini-import sa database na may AI-powered text recognition (ito ay nagli-link sa HTR sa unit 6).
- Standardisasyon. Ang iba't ibang spelling ("byzantium", "Byzantium", "byz.") ay nakamapa sa kinokontrol na diksyunaryo; ang mga petsa at mga sukat ay dinadala sa magkatulad na anyo.
- Pagsusuri ng pagkakapare-pareho. Ang mga error tulad ng nawawalang numero ng konteksto, magkasalungat na stratigraphy, paggamit ng parehong numero sa dalawang magkaibang paghahanap ay minarkahan.
- Tanong at buod. Mabilis na nabuo ang mga query tulad ng "Lahat ng salamin sa sumusunod na konteksto" at mga talahanayan ng buod.
Pag-iingat: Kapag nag-standardize, maaaring tahimik na baguhin ng AI ang data habang sinusubukang "ayusin" ito; halimbawa, maaari niyang bilugan ang isang sukat sa isang "makatwirang" halaga o punan ang isang hindi tiyak na pagbabasa gamit ang kanyang sariling pagtatantya. Ang bawat awtomatikong pagbabago ay dapat na masubaybayan at ang orihinal na tala ay dapat na mapanatili. Ang raw data ay hindi kailanman na-overwrite.
tatlong mini case
Case 1 — Na-save ng digitization ang archive. Ang isang museo ay nag-iimbak ng 40 taon ng sulat-kamay na mga card ng imbentaryo (mga 22,000 card) na nanganganib na mawala. Na-import ng AI-powered text recognition at standardization ang mga card sa isang mahahanap na database; Ang bawat card ay sinuri sa isang sample na batayan ng isang tagasuri ng tao, at ang mga lugar na hindi nababasa ay minarkahan na "hindi malinaw."
Case 2 — May nakitang mga error ang inconsistency check. Ang isang pangkat ng paghuhukay ay nagkaroon ng pag-audit ng AI sa database sa pagtatapos ng season; Minarkahan ng YZ na tatlong nahanap ang may parehong numero ng konteksto ngunit magkasalungat na impormasyon sa layer. Ang pagsusuri ay nagsiwalat ng isang error sa pagpasok ng data; kung hindi naitama ay nabaluktot ang stratigraphic na interpretasyon.
Kaso 3 — Nahuli ang tahimik na pagbabago. Habang nag-standardize ng mga sukat, napansin ng isang katulong na binibigyang-kahulugan ng AI ang ilang "0" na halaga bilang "zero" sa halip na "nawawala"; binaluktot nito ang haba ng sirang piraso. Ang proseso ay itinayong muli upang mapanatili ang orihinal na data ngunit panatilihin ang mga pagbabago sa isang hiwalay na column.
Apat na maaaring kopyahin na mga template
1) Standardisasyon (kinokontrol na diksyunaryo):
Ang iyong tungkulin: data wrangling assistant. Imapa ang mga halaga ng [field:material/period/type] sa mga sumusunod na tala sa sumusunod na kinokontrol na diksyunaryo: [dictionarylist]. BAGUHIN ang mga halaga na walang katumbas sa diksyunaryo; Markahan ito bilang "walang tugma". Iulat ang bawat pagbabago bilang orihinal-bagong pares; pagtanggal ng raw data.
2) Pagsusuri ng pagkakapare-pareho:
Maghanap ng mga hindi pagkakapare-pareho sa mga sumusunod na talaan ng paghuhukay: paulit-ulit na mga numero ng konteksto, nawawalang mga mandatoryong field, magkasalungat na stratigraphic na relasyon, awkward na petsa/mga sukat. Ilista ang bawat problema sa numero ng pagpaparehistro at iwanan ito sa ME para ayusin ito; wag mong baguhin sarili mo.
3) Harris Matrix logic control:
Nasa ibaba ang mga stratigraphic na ugnayan sa pagitan ng mga konteksto (A sa itaas/sa ibaba B). Mayroon bang lohikal na kontradiksyon (loop, two-way na relasyon)? Ipakita kung aling mga konteksto, kung mayroon man. Huwag magkomento; suriin lamang para sa lohikal na pagkakapare-pareho.
4) Talahanayan ng query at buod:
Ang sumusunod na extract mula sa database dump sa ibaba: [hal. hanapin ang uri ng pamamahagi sa bawat konteksto]. Ibigay ang resulta bilang isang talahanayan, na tumutukoy kung aling mga talaan ang bawat row ay nagmula. HUWAG MAGDAGDAG ng anumang halaga na wala sa data; Kung ito ay walang laman, isulat ang "walang data".
Mahinang prompt / Malakas na prompt
Mahinang prompt:
Itama ang data ng paghuhukay na ito at punan ang mga nawawalang item.
Ang "Punan ang mga puwang" ay nagpapahintulot sa AI na magkasya sa data; Ang resulta ay isang hindi mapagkakatiwalaang database kung saan pinaghalong katotohanan at fiction.
Napakahusay na prompt:
Markahan LAMANG ang mga pormal na hindi pagkakapare-pareho (spelling, format ng petsa, duplicate na ID) sa data ng paghuhukay sa ibaba. KUMPLETO ang mga nawawalang halaga; Iwanan ito bilang "hindi kumpleto". Ilista ang bawat iminungkahing pagbabago kasama ang orihinal; Ibibigay ko ang pag-apruba. Pagbabago ng raw data.
Pagkakaiba: ang dating corrupts data nang tahimik; Ang pangalawa ay kumokontrol at iniiwan ang desisyon sa tao.
Magandang modelo ng data: mga field, relasyon at metadata
Ang isang archaeological database ay hindi isang arbitrary na talahanayan, ngunit isang maalalahanin na modelo ng data (isang blueprint kung saan ang mga talahanayan, kung aling mga patlang, at kung anong mga ugnayan ang pag-aayos ng data). Ang pangunahing prinsipyo ay ang lahat ay nakasalalay sa konteksto: paghahanap sa konteksto, mga konteksto sa isa't isa (stratigraphy) at sa larangan. Ang bawat tala ay may natatanging pagkakakilanlan (ID) at ang mga relasyon ay itinatag sa pamamagitan ng mga pagkakakilanlan na ito; Ang isang paghahanap ay tumutukoy sa isang konteksto, ang isang konteksto ay maaaring maglaman ng maraming mga nahanap.
Kasinghalaga ng pag-record ang metadata (data tungkol sa data mismo: sino ang nagtala nito, kailan, sa anong paraan, anong bersyon). Ang isang rekord na hindi alam kung kanino, kailan at kung anong kumpiyansa ang ipinasok ay hindi maaaring tanungin sa hinaharap. Nakakatulong ang AI sa pagsuri sa pare-parehong pagpuno ng mga field ng metadata at pag-flag ng nawawalang metadata.
Ang isa pang kritikal na prinsipyo ay isang bukas at napapanatiling format. Sa halip na i-lock ang data sa pagmamay-ari, saradong software, ang pagpapanatiling malapit sa mga bukas na pamantayan (mga talahanayan na nakabatay sa teksto, mga nakadokumentong schema) ay tumitiyak na mababasa ang data pagkaraan ng mga dekada. Ang archaeological data ay ginawa hindi para sa isang publikasyon ngunit para sa mga susunod na henerasyon; Iyon ang dahilan kung bakit ang mga FAIR na prinsipyo (Finding, Accessible, Interoperable at Reusable ng data) ay naging mas pamantayan. Ang AI ay kapaki-pakinabang sa pag-label ng iyong data alinsunod sa mga prinsipyong ito at paghahanap ng mga kakulangan; Ngunit nasa sa iyo na magpasya kung aling data ang mananatiling bukas at alin ang mananatiling sensitibo (kumpidensyal).
Tip: Kapag sine-set up mo ang iyong database, tanungin ang iyong sarili, "Maaari ba itong buksan at maunawaan ito ng isang taong hindi nakakaalam sa loob ng 10 taon?" magtanong. Ipaliwanag ang iyong mga pagdadaglat sa isang glossary, punan ang mga field ng metadata, at i-back up ang raw data sa isang bukas na format.
Talaan/talahanayan ng gawain sa database
Paghanap
Papel ng AI
desisyon ng tao
panuntunan sa proteksyon
digitalization
pagkilala sa teksto
Malabong kumpirmasyon sa pagbasa
Naka-imbak ang raw scan
estandardisasyon
Mapa sa diksyunaryo
Hindi tugmang desisyon sa halaga
Ang orihinal ay napanatili
Consistency
Pagmamarka ng kontradiksyon
pagwawasto
Ang pagbabago ay sinusubaybayan
stratigraphy
Kontrol ng lohika
Magkomento
Pag-apruba ng eksperto sa matrix
Tanong/buod
Paggawa ng mesa
Komento, pagpili
Katapatan sa data
Mga karaniwang pagkakamali
- Pagkumpleto ng nawawalang data. Binubuo ng AI; Ang nawawala ay dapat manatiling "hindi kumpleto".
- Pag-overwrite sa raw data. Ang orihinal ay palaging pinapanatili; ang mga pagbabago ay pinananatiling hiwalay.
- Hindi napapansin ang mga tahimik na pagbabago. Dapat iulat at i-audit ang bawat awtomatikong conversion.
- Nilaktawan ang pamantayan. Kung walang kinokontrol na diksyunaryo at karaniwang modelo, hindi maibabahagi ang data.
- Ang pagkakaroon ng AI na magsagawa ng stratigraphic interpretation. Natagpuan ng AI ang lohikal na kontradiksyon; Ang komento ay para sa eksperto.
Sa buod
AI sa excavation record at database; Nagbibigay ito ng mahusay na bilis sa digitization, standardization, consistency checking at query works. Ngunit sagrado ang integridad ng data: walang nawawalang bahagi ang naiwang buo, pinapanatili ang hilaw na data, sinusubaybayan ang bawat pagbabago, at ang stratigraphic na interpretasyon ay pagmamay-ari ng eksperto. Ang magagandang rekord ay ang pinakamahalagang pamana na iniiwan ng paghuhukay sa hinaharap.
Gawain ng aplikasyon
Maghanda ng maliit na sample excavation data table (10-20 records); sadyang maglagay ng ilang inconsistencies doon (duplicate na ID, maling petsa, magkasalungat na layer). Ipahanap sa AI ang mga ito na may mga pattern ng "consistency check" at "Harris Matrix logic check"; pagkatapos ay magsulat ng isang kinokontrol na diksyunaryo at imapa ang materyal na field sa "Standardization" na template at tiyaking panatilihin ang raw data.
checklist
- [ ] Inimbak ko ang hilaw na data nang hiwalay, hindi binago.
- [ ] Hindi ko ginawang kumpletuhin ng AI ang mga nawawalang bahagi; Iniwan ko ito bilang "hindi kumpleto".
- [ ] Sinuri ko ang bawat awtomatikong pagbabago sa orihinal.
- [ ] Gumamit ako ng kinokontrol na diksyunaryo at pamantayan ng data.
- [ ] Ginawa ko ang stratigraphic na interpretasyon batay sa ekspertong paghuhusga.