युनिट्स
1. पुरातत्व आणि सांस्कृतिक वारसामधील कृत्रिम बुद्धिमत्तेचा परिचय: भूमिका, सीमा, प्रमाणीकरण, नैतिकता आणि गोपनीयता 2. वर्गीकरण आणि प्रतिमा विश्लेषण शोधा: सिरॅमिक्स, नाणी, लिथिक्स आणि लहान शोध 3. रिमोट सेन्सिंग आणि साइट डिटेक्शन: सॅटेलाइट, एरियल फोटोग्राफी आणि LiDAR 4. 3D दस्तऐवजीकरण आणि छायाचित्रण: मॉडेल उत्पादन, मापन आणि सर्वेक्षण 5. उत्खनन रेकॉर्ड, डेटाबेस आणि डेटा मानके 6. एपिग्राफी, प्राचीन हस्तलिखिते आणि ग्रंथांचे वाचन आणि भाषांतर 7. साहित्य पुनरावलोकन, स्रोत पडताळणी, आणि फाइटिंग हॅलुसिनेशन 8. डेटिंग, सांख्यिकी आणि वैज्ञानिक विश्लेषण: रेडिओकार्बन, टायपोलॉजी आणि क्रमवारी 9. सांस्कृतिक वारसा व्यवस्थापन, संरक्षण आणि देखरेख 10. सार्वजनिक पुरातत्व, संग्रहालय कथा, आणि डिजिटल पुनर्रचनाचे नीतिशास्त्र 11. नैतिकता, कायदेशीर, अँटी-लूटमार आणि एंड-टू-एंड वर्कफ्लो
युनिट 5 / 11

उत्खनन रेकॉर्ड, डेटाबेस आणि डेटा मानके

नफा:

  • आर्टिफिशियल इंटेलिजेंससह संदर्भ/लोकस, स्ट्रॅटिग्राफी आणि हॅरिस मॅट्रिक्स यासारख्या रेकॉर्डिंग युनिट्सचे डिजिटायझेशन आणि मानकीकरण करताना डेटा अखंडता राखण्याची क्षमता
  • कच्च्या डेटाचे संरक्षण करण्याची क्षमता आणि कृत्रिम बुद्धिमत्ता गहाळ डेटा पूर्ण करण्याच्या आणि मूक बदल करण्याच्या जोखमीपासून प्रत्येक परिवर्तन शोधण्यायोग्य ठेवण्याची क्षमता
  • डेटाच्या भविष्यातील वापरासाठी नियंत्रित शब्दकोश, मेटाडेटा आणि ओपन/एफएआयआर तत्त्वे का आवश्यक आहेत ते समजून घ्या.

उत्खननाचे वैज्ञानिक मूल्य त्यातून निघणाऱ्या सोन्याच्या शोधात नसून त्याच्या नोंदींच्या गुणवत्तेत आहे. नीट दस्तऐवजीकरण नसलेला शोध विज्ञानाशी जवळजवळ अप्रासंगिक आहे; कारण ती कुठे, कोणत्या थरात आणि कशाने सापडते हे माहीत नसलेली वस्तू आहे, ती फक्त एक सुंदर वस्तू आहे. या युनिटमध्ये आम्ही उत्खनन लॉगिंग (प्रत्येक संदर्भ, शोध आणि निरीक्षणाचे पद्धतशीर लिप्यंतरण आणि डेटाबेस) आणि AI डेटा एंट्री, संस्था आणि मानकीकरण कसे गतिमान करू शकते, परंतु डेटा अखंडतेची जबाबदारी मानवांवर का राहते ते पाहू.

मूलभूत तत्त्व: AI विखुरलेल्या नोंदी आयोजित करण्यात, त्यांना प्रमाणित करण्यात आणि विसंगती शोधण्यात मदत करते; परंतु कोणता डेटा अचूक आहे, रेकॉर्ड सत्य प्रतिबिंबित करते की नाही आणि डेटाची अखंडता ही मानवी जबाबदारी आहे. AI डेटाचा आकार दुरुस्त करते, ते त्याच्या अचूकतेची हमी देत ​​नाही.

पुरातत्व रेकॉर्डची मूलभूत एकके

संदर्भ/स्थान. प्रत्येक उत्खनन साइटला संदर्भाच्या एककांमध्ये विभाजित करते (संदर्भ/लोकस—एक वैयक्तिक ठेव, स्तर, खड्डा किंवा भिंत; उत्खननाच्या अर्थाचे सर्वात लहान एकक). प्रत्येक संदर्भाला एक अद्वितीय क्रमांक प्राप्त होतो आणि सर्व शोध त्या संख्येशी संबंधित असतात.

स्ट्रॅटिग्राफी आणि हॅरिस मॅट्रिक्स. स्ट्रॅटिग्राफी (एकमेकांच्या सापेक्ष स्तरांचा आधी-नंतरचा संबंध) हा सापेक्ष डेटिंगचा आधार आहे. हॅरिस मॅट्रिक्स (एकमेकांच्या सापेक्ष संदर्भांचा क्रम दर्शविणारा आकृती) या संबंधांची कल्पना करतो. AI विसंगत स्ट्रॅटिग्राफिक संबंध शोधण्यात मदत करते (उदा. चक्रीय “A दोन्ही वर आणि B खाली आहे” त्रुटी).

इन्व्हेंटरी शोधा. प्रत्येक शोध; संदर्भ क्रमांक, प्रकार, आकार, साहित्य, स्थिती आणि छायाचित्रासह रेकॉर्ड केला जातो.

डेटा मानके. रेकॉर्ड शेअर करण्यायोग्य आणि तुलना करण्यायोग्य बनवण्यासाठी सामान्य मानकांचा वापर केला जातो. CIDOC-CRM (सांस्कृतिक वारसा डेटाचे वर्णन करण्यासाठी विकसित केलेले आंतरराष्ट्रीय वैचारिक फ्रेमवर्क/ऑन्टोलॉजी) विविध संस्थांमधील डेटा एकमेकांशी बोलण्यास सक्षम करते. संज्ञांचा एक नियंत्रित शब्दकोष (एक मंजूर सूची जी प्रत्येकजण समान संकल्पनेसाठी समान संज्ञा वापरते याची खात्री करते) वापरला जातो.

टीप: डेटा "व्यवस्थित आणि ऑडिट" करण्यासाठी AI वापरा, त्याचा "व्याख्या" करण्यासाठी नाही. "या नोंदींमध्ये कोणते संदर्भ क्रमांक परस्परविरोधी आहेत?" हा एक चांगला प्रश्न आहे; "हा संदर्भ कोणत्या कालखंडाचा आहे?" तो एक तज्ज्ञ निर्णय आहे. जिथे AI सर्वात मजबूत आहे ते सातत्य तपासणीमध्ये आहे.

नोंदणी आणि डेटाबेसमध्ये AI ची भूमिका

  • डिजिटायझेशन. हस्तलिखित उत्खनन नोटबुक, इन्व्हेंटरी कार्ड आणि जुनी रेखाचित्रे डेटाबेसमध्ये AI-संचालित मजकूर ओळखीसह आयात केली जातात (हे युनिट 6 मधील HTR ला लिंक करते).
  • मानकीकरण. भिन्न शब्दलेखन ("बायझेंटियम", "बायझेंटियम", "बाईझ.") नियंत्रित शब्दकोशात मॅप केले जातात; तारखा आणि मोजमाप एकसमान स्वरूपात आणले जातात.
  • सुसंगतता तपासा. गहाळ संदर्भ क्रमांक, विरोधाभासी स्ट्रॅटिग्राफी, दोन भिन्न शोधांमध्ये समान संख्येचा वापर यासारख्या त्रुटी चिन्हांकित केल्या आहेत.
  • क्वेरी आणि सारांश. "सर्व ग्लास खालील संदर्भात सापडतात" आणि सारांश सारण्या यांसारख्या क्वेरी त्वरीत व्युत्पन्न केल्या जातात.
खबरदारी: मानकीकरण करताना, एआय डेटा "निश्चित" करण्याचा प्रयत्न करत असताना शांतपणे बदलू शकते; उदाहरणार्थ, तो मोजमाप "वाजवी" मूल्यापर्यंत पूर्ण करू शकतो किंवा त्याच्या स्वत: च्या अंदाजाने अनिश्चित वाचन भरू शकतो. प्रत्येक स्वयंचलित बदल शोधण्यायोग्य असणे आवश्यक आहे आणि मूळ रेकॉर्ड जतन करणे आवश्यक आहे. कच्चा डेटा कधीही ओव्हरराईट केला जात नाही.

तीन लहान प्रकरणे

केस 1 - डिजिटायझेशनने संग्रहण जतन केले. एक संग्रहालय 40 वर्षांच्या हस्तलिखीत इन्व्हेंटरी कार्ड्स (सुमारे 22,000 कार्डे) हरवण्याच्या जोखमीवर साठवत होते. एआय-संचालित मजकूर ओळख आणि मानकीकरणाने कार्ड शोधण्यायोग्य डेटाबेसमध्ये आयात केले; मानवी परीक्षकाद्वारे प्रत्येक कार्ड नमुन्याच्या आधारावर तपासले गेले आणि न वाचता येणारे भाग "अस्पष्ट" म्हणून चिन्हांकित केले गेले.

केस 2 - विसंगती तपासणीमध्ये त्रुटी आढळल्या. एका उत्खनन पथकाने हंगामाच्या शेवटी डेटाबेसचे एआय ऑडिट केले होते; YZ ने चिन्हांकित केले की तीन शोधांमध्ये समान संदर्भ क्रमांक परंतु परस्परविरोधी स्तर माहिती आहे. पुनरावलोकनाने डेटा एंट्री त्रुटी उघड केली; दुरुस्त न केल्यास ते स्ट्रॅटिग्राफिक व्याख्या विकृत केले असते.

केस 3 - मूक बदल पकडला. मोजमाप प्रमाणित करताना, एका सहाय्यकाच्या लक्षात आले की AI काही "0" मूल्यांचा "गहाळ" ऐवजी "शून्य" म्हणून अर्थ लावत आहे; यामुळे तुटलेल्या तुकड्यांची लांबी विकृत झाली. मूळ डेटा जतन करण्यासाठी प्रक्रिया पुन्हा तयार केली गेली परंतु बदल वेगळ्या स्तंभात ठेवा.

चार कॉपी करण्यायोग्य टेम्पलेट्स

1) मानकीकरण (नियंत्रित शब्दकोश):

तुमची भूमिका: डेटा रँगलिंग असिस्टंट. खालील रेकॉर्डमधील [फील्ड:मटेरियल/पीरियड/प्रकार] ची मूल्ये खालील नियंत्रित शब्दकोशामध्ये मॅप करा: [शब्दकोश]. शब्दकोशात समतुल्य नसलेली मूल्ये बदला; "न जुळत नाही" म्हणून चिन्हांकित करा. प्रत्येक बदलाची तक्रार मूळ-नवीन जोडी म्हणून करा; कच्चा डेटा हटवित आहे.

२) सुसंगतता तपासा:

खालील उत्खनन नोंदींमध्ये विसंगती शोधा: पुनरावृत्ती संदर्भ क्रमांक, गहाळ अनिवार्य फील्ड, विवादित स्ट्रॅटिग्राफिक संबंध, अस्ताव्यस्त तारखा/मापे. नोंदणी क्रमांकासह प्रत्येक समस्येची यादी करा आणि त्याचे निराकरण करण्यासाठी ते मला सोडा; ते स्वतः बदलू नका.

3) हॅरिस मॅट्रिक्स लॉजिक कंट्रोल:

खाली संदर्भांमधील स्ट्रॅटिग्राफिक संबंध आहेत (A वर/खाली B). तार्किक विरोधाभास (लूप, द्वि-मार्ग संबंध) आहे का? कोणते संदर्भ, असल्यास दाखवा. टिप्पणी करू नका; फक्त तार्किक सुसंगतता तपासा.

4) क्वेरी आणि सारांश सारणी:

खालील डेटाबेस डंपमधून खालील अर्क: [उदा. संदर्भानुसार वितरण प्रकार शोधा]. प्रत्येक पंक्ती कोणत्या रेकॉर्डमधून घेतली आहे हे निर्दिष्ट करून, सारणी म्हणून निकाल द्या. डेटामध्ये अस्तित्वात नसलेले कोणतेही मूल्य जोडू नका; ते रिकामे असल्यास, "डेटा नाही" लिहा.

कमकुवत प्रॉम्प्ट / मजबूत प्रॉम्प्ट

कमकुवत प्रॉम्प्ट:

हा उत्खनन डेटा दुरुस्त करा आणि गहाळ वस्तू भरा.

"अंतर भरा" एआयला डेटा फिट करण्यास अनुमती देते; परिणाम म्हणजे एक अविश्वसनीय डेटाबेस आहे जिथे तथ्य आणि कल्पनारम्य मिसळले जाते.

शक्तिशाली सूचना:

खालील उत्खनन डेटामध्ये फक्त औपचारिक विसंगती (स्पेलिंग, तारीख स्वरूप, डुप्लिकेट आयडी) चिन्हांकित करा. पूर्ण गहाळ मूल्ये; ते "अपूर्ण" म्हणून सोडा. प्रत्येक प्रस्तावित बदलाची मूळ सोबत यादी करा; मी मंजूरी देईन. कच्चा डेटा बदलत आहे.

फरक: माजी डेटा शांतपणे दूषित करतो; दुसरा नियंत्रित करतो आणि निर्णय माणसावर सोडतो.

चांगले डेटा मॉडेल: फील्ड, संबंध आणि मेटाडेटा

पुरातत्व डेटाबेस हे अनियंत्रित सारणी नसते, परंतु एक विचारशील डेटा मॉडेल (कोणत्या सारण्या, कोणत्या फील्ड आणि डेटा कोणत्या संबंधांमध्ये आयोजित केला जाईल याची ब्लूप्रिंट). मूलभूत तत्त्व असे आहे की सर्वकाही संदर्भावर अवलंबून असते: संदर्भ शोधते, एकमेकांचे संदर्भ (स्ट्रॅटिग्राफी) आणि फील्ड. प्रत्येक रेकॉर्डमध्ये एक अद्वितीय ओळख (आयडी) असते आणि या ओळखींद्वारे संबंध प्रस्थापित केले जातात; एक शोध एका संदर्भाचा संदर्भ देते, एका संदर्भामध्ये अनेक शोध असू शकतात.

रेकॉर्डिंग जितका महत्त्वाचा आहे तितकाच मेटाडेटा (डेटाबद्दलचा डेटा: तो कोणी रेकॉर्ड केला, केव्हा, कोणत्या पद्धतीने, कोणती आवृत्ती). कोणी, केव्हा आणि कोणत्या आत्मविश्वासाने प्रवेश केला हे अज्ञात आहे अशा रेकॉर्डवर भविष्यात प्रश्नचिन्ह उपस्थित केले जाऊ शकत नाही. मेटाडेटा फील्डचे सातत्यपूर्ण भरणे तपासण्यात आणि गहाळ मेटाडेटा फ्लॅग करण्यात AI उपयुक्त आहे.

आणखी एक गंभीर तत्त्व म्हणजे खुले आणि टिकाऊ स्वरूप. प्रोप्रायटरी, क्लोज्ड सॉफ्टवेअरमध्ये डेटा लॉक करण्याऐवजी, त्याला खुल्या मानकांजवळ (मजकूर-आधारित सारण्या, दस्तऐवजीकरण केलेले स्कीमा) जवळ ठेवणे हे सुनिश्चित करते की डेटा दशकांनंतर वाचला जाऊ शकतो. पुरातत्व डेटा एका प्रकाशनासाठी नाही तर भविष्यातील पिढ्यांसाठी तयार केला जातो; म्हणूनच FAIR तत्त्वे (डेटा शोधणे, प्रवेश करण्यायोग्य, इंटरऑपरेबल आणि पुन्हा वापरता येण्याजोगे) अधिकाधिक मानक बनले आहेत. या तत्त्वांनुसार तुमच्या डेटाला लेबल लावण्यासाठी आणि कमतरता शोधण्यासाठी AI उपयुक्त आहे; परंतु कोणता डेटा खुला राहील आणि कोणता संवेदनशील (गोपनीय) राहील हे ठरवायचे आहे.

टीप: जेव्हा तुम्ही तुमचा डेटाबेस सेट करत असाल, तेव्हा स्वतःला विचारा, "ज्याला हे माहित नाही तो 10 वर्षात तो उघडू शकतो आणि समजू शकतो का?" विचारा शब्दकोषात तुमचे संक्षेप स्पष्ट करा, मेटाडेटा फील्ड भरा आणि कच्च्या डेटाचा खुल्या स्वरूपात बॅकअप घ्या.

रेकॉर्ड/डेटाबेस टास्क टेबल

शोध

AI ची भूमिका

मानवी निर्णय

संरक्षण नियम

डिजिटायझेशन

मजकूर ओळख

अस्पष्ट वाचन पुष्टीकरण

रॉ स्कॅन संग्रहित आहे

मानकीकरण

शब्दकोशात नकाशा

विसंगत मूल्य निर्णय

मूळ जतन केले आहे

सुसंगतता

विरोधाभास चिन्हांकन

सुधारणा

बदलाचा मागोवा घेतला जातो

स्ट्रॅटिग्राफी

तर्कशास्त्र नियंत्रण

टिप्पणी द्या

मॅट्रिक्स तज्ञ मान्यता

क्वेरी/सारांश

टेबल उत्पादन

टिप्पणी, निवड

डेटाची निष्ठा

सामान्य चुका

  • गहाळ डेटा पूर्ण करत आहे. एआय बनवते; गहाळ "अपूर्ण" राहिले पाहिजे.
  • कच्चा डेटा ओव्हरराइट करत आहे. मूळ नेहमी जतन केले जाते; बदल वेगळे ठेवले आहेत.
  • मूक बदल लक्षात न घेणे. प्रत्येक स्वयंचलित रूपांतरणाचा अहवाल आणि ऑडिट केले पाहिजे.
  • मानक वगळणे. नियंत्रित शब्दकोश आणि सामान्य मॉडेलशिवाय, डेटा सामायिक केला जाऊ शकत नाही.
  • AI ने स्ट्रॅटिग्राफिक व्याख्या करणे. AI ला तार्किक विरोधाभास सापडला; टिप्पणी तज्ञांसाठी आहे.

सारांशात

उत्खनन रेकॉर्ड आणि डेटाबेसमध्ये एआय; हे डिजिटायझेशन, स्टँडर्डायझेशन, सातत्य तपासणे आणि क्वेरी कार्यांमध्ये उत्कृष्ट गती प्रदान करते. परंतु डेटा अखंडता पवित्र आहे: कोणताही गहाळ भाग अखंड ठेवला जात नाही, कच्चा डेटा जतन केला जातो, प्रत्येक बदलाचा मागोवा घेतला जातो आणि स्ट्रॅटिग्राफिक व्याख्या तज्ञांच्या मालकीची असते. चांगल्या नोंदी हा सर्वात मौल्यवान वारसा आहे जो उत्खनन भविष्यासाठी सोडतो.

अर्ज कार्य

एक लहान नमुना उत्खनन डेटा टेबल तयार करा (10-20 रेकॉर्ड); मुद्दाम तेथे काही विसंगती ठेवा (डुप्लिकेट आयडी, चुकीची तारीख, परस्परविरोधी स्तर). AI ला हे “कन्सिस्टन्सी चेक” आणि “हॅरिस मॅट्रिक्स लॉजिक चेक” पॅटर्नसह शोधू द्या; नंतर एक नियंत्रित शब्दकोष लिहा आणि "मानकीकरण" टेम्पलेटवर सामग्री फील्ड मॅप करा आणि कच्चा डेटा जतन करण्याचे सुनिश्चित करा.

चेकलिस्ट

  • [ ] मी कच्चा डेटा स्वतंत्रपणे संग्रहित केला, बदल न केलेला.
  • [] मी AI ला हरवलेले भाग पूर्ण केले नाहीत; मी ते "अपूर्ण" म्हणून सोडले.
  • [ ] मी प्रत्येक स्वयंचलित बदल मूळसह तपासला आहे.
  • मी नियंत्रित शब्दकोश आणि डेटा मानक वापरले.
  • मी तज्ञांच्या निर्णयावर आधारित स्ट्रॅटिग्राफिक व्याख्या केली आहे.