નફો:
- આર્ટિફિશિયલ ઇન્ટેલિજન્સ સાથે સંદર્ભ/લોકસ, સ્ટ્રેટગ્રાફી અને હેરિસ મેટ્રિક્સ જેવા રેકોર્ડિંગ એકમોનું ડિજિટાઇઝિંગ અને માનકીકરણ કરતી વખતે ડેટાની અખંડિતતા જાળવવાની ક્ષમતા
- કાચા ડેટાને સુરક્ષિત રાખવાની અને કૃત્રિમ બુદ્ધિમત્તાના ખોવાયેલા ડેટાને પૂર્ણ કરવા અને સાયલન્ટ ફેરફારો કરવાના જોખમ સામે દરેક રૂપાંતરને શોધી શકાય તેવી રાખવાની ક્ષમતા
- સમજો કે શા માટે નિયંત્રિત શબ્દકોશ, મેટાડેટા અને ઓપન/FAIR સિદ્ધાંતો ડેટાની ભાવિ ઉપયોગિતા માટે જરૂરી છે.
ખોદકામનું વૈજ્ઞાનિક મૂલ્ય તેમાંથી નીકળતા સોનાની શોધમાં નથી, પરંતુ તેના રેકોર્ડની ગુણવત્તામાં રહેલું છે. એક શોધ જે સારી રીતે દસ્તાવેજીકૃત નથી તે વિજ્ઞાન માટે લગભગ અપ્રસ્તુત છે; કારણ કે તે એક એવી વસ્તુ છે જે અજ્ઞાત છે કે ક્યાં, કયા સ્તરમાં અને તે શું મળી આવે છે, તે માત્ર એક સુંદર વસ્તુ છે. આ એકમમાં આપણે ખોદકામ લોગીંગ (દરેક સંદર્ભ, શોધ અને અવલોકનનું વ્યવસ્થિત ટ્રાન્સક્રિપ્શન અને ડેટાબેઝ) અને કેવી રીતે AI ડેટા એન્ટ્રી, સંસ્થા અને માનકીકરણને ઝડપી બનાવી શકે છે, પરંતુ શા માટે ડેટાની અખંડિતતા માટેની જવાબદારી મનુષ્યની રહે છે તે જોઈશું.
મૂળભૂત સિદ્ધાંત: AI છૂટાછવાયા રેકોર્ડ્સને ગોઠવવામાં, તેમને પ્રમાણિત કરવામાં અને અસંગતતાઓ શોધવામાં મદદ કરે છે; પરંતુ કયો ડેટા સચોટ છે, શું રેકોર્ડ સત્યને પ્રતિબિંબિત કરે છે અને ડેટાની અખંડિતતા એ માનવ જવાબદારી છે. AI ડેટાના આકારને સુધારે છે, તે તેની ચોકસાઈની ખાતરી આપતું નથી.
પુરાતત્વીય રેકોર્ડના મૂળભૂત એકમો
સંદર્ભ/સ્થળ. દરેક ખોદકામ સ્થળને સંદર્ભના એકમોમાં વિભાજિત કરે છે (સંદર્ભ/લોકસ—એક વ્યક્તિગત થાપણ, સ્તર, ખાડો અથવા દિવાલ; ખોદકામના અર્થનું સૌથી નાનું એકમ). દરેક સંદર્ભ એક અનન્ય નંબર મેળવે છે અને તમામ શોધો તે સંખ્યા સાથે સંકળાયેલા છે.
સ્ટ્રેટીગ્રાફી અને હેરિસ મેટ્રિક્સ. સ્ટ્રેટીગ્રાફી (એકબીજાને સંબંધિત સ્તરોના પહેલા-પછીના સંબંધો) એ સંબંધિત ડેટિંગનો આધાર છે. હેરિસ મેટ્રિક્સ (એકબીજાને સંબંધિત સંદર્ભોનો ક્રમ દર્શાવતો આકૃતિ) આ સંબંધોની કલ્પના કરે છે. AI અસંગત સ્ટ્રેટેગ્રાફિક સંબંધોને શોધવામાં મદદ કરે છે (દા.ત. ચક્રીય "A એ B ઉપર અને નીચે બંને છે" ભૂલ).
ઇન્વેન્ટરી શોધો. દરેક શોધ; સંદર્ભ નંબર, પ્રકાર, કદ, સામગ્રી, સ્થિતિ અને ફોટોગ્રાફ સાથે રેકોર્ડ કરવામાં આવે છે.
ડેટા ધોરણો. સામાન્ય ધોરણોનો ઉપયોગ રેકોર્ડને શેર કરવા યોગ્ય અને તુલનાત્મક બનાવવા માટે થાય છે. CIDOC-CRM (સાંસ્કૃતિક વારસાના ડેટાનું વર્ણન કરવા માટે વિકસાવવામાં આવેલ આંતરરાષ્ટ્રીય વૈચારિક માળખું/ઓન્ટોલોજી) વિવિધ સંસ્થાઓના ડેટાને એકબીજા સાથે વાત કરવા સક્ષમ બનાવે છે. શબ્દોનો નિયંત્રિત શબ્દકોશ (એક મંજૂર સૂચિ જે ખાતરી કરે છે કે દરેક વ્યક્તિ સમાન ખ્યાલ માટે સમાન શબ્દનો ઉપયોગ કરે છે) નો ઉપયોગ કરવામાં આવે છે.
ટીપ: ડેટાને "વ્યવસ્થિત કરવા અને ઓડિટ" કરવા માટે AI નો ઉપયોગ કરો, તેનું "અર્થઘટન" કરવા માટે નહીં. "આ રેકોર્ડ્સમાં કયા સંદર્ભ નંબરો વિરોધાભાસી છે?" તે એક સારો પ્રશ્ન છે; "આ સંદર્ભ કયા સમયગાળાનો છે?" તે એક નિષ્ણાત નિર્ણય છે. જ્યાં AI સૌથી મજબૂત છે તે સુસંગતતા તપાસમાં છે.
નોંધણી અને ડેટાબેઝમાં AI ની ભૂમિકા
- ડિજિટાઇઝેશન. હાથથી લખેલી ખોદકામ નોટબુક, ઇન્વેન્ટરી કાર્ડ્સ અને જૂના ડ્રોઇંગ્સને AI-સંચાલિત ટેક્સ્ટ ઓળખ સાથે ડેટાબેઝમાં આયાત કરવામાં આવે છે (આ એકમ 6 માં HTR સાથે લિંક કરે છે).
- માનકીકરણ. વિવિધ જોડણીઓ ("બાયઝેન્ટિયમ", "બાયઝેન્ટિયમ", "બાયઝ.") નિયંત્રિત શબ્દકોશમાં મેપ કરવામાં આવે છે; તારીખો અને માપ સમાન સ્વરૂપમાં લાવવામાં આવે છે.
- સુસંગતતા તપાસો. ગેરરીતિઓ જેમ કે સંદર્ભ નંબર ખૂટે છે, વિરોધાભાસી સ્ટ્રેટેગ્રાફી, બે અલગ-અલગ શોધમાં સમાન સંખ્યાનો ઉપયોગ ચિહ્નિત થયેલ છે.
- પ્રશ્ન અને સારાંશ. "બધા કાચ નીચેના સંદર્ભમાં શોધે છે" અને સારાંશ કોષ્ટકો જેવી ક્વેરી ઝડપથી જનરેટ થાય છે.
સાવચેતી: જ્યારે માનકીકરણ કરવામાં આવે ત્યારે, AI તેને "ફિક્સ" કરવાનો પ્રયાસ કરતી વખતે ચુપચાપ ડેટાને સંશોધિત કરી શકે છે; દા.ત. દરેક સ્વચાલિત ફેરફાર શોધી શકાય તેવા હોવા જોઈએ અને મૂળ રેકોર્ડ સાચવી રાખવા જોઈએ. કાચો ડેટા ક્યારેય ઓવરરાઈટ થતો નથી.
ત્રણ નાના કેસો
કેસ 1 - ડિજિટાઇઝેશનએ આર્કાઇવને સાચવ્યું. એક મ્યુઝિયમ ખોવાઈ જવાના જોખમે 40 વર્ષના હસ્તલિખિત ઈન્વેન્ટરી કાર્ડ્સ (લગભગ 22,000 કાર્ડ્સ) સંગ્રહિત કરી રહ્યું હતું. AI-સંચાલિત ટેક્સ્ટ ઓળખ અને માનકીકરણએ કાર્ડ્સને શોધી શકાય તેવા ડેટાબેઝમાં આયાત કર્યા; માનવ પરીક્ષક દ્વારા દરેક કાર્ડને નમૂનાના આધારે તપાસવામાં આવ્યું હતું, અને વાંચી ન શકાય તેવા વિસ્તારોને "અસ્પષ્ટ" તરીકે ચિહ્નિત કરવામાં આવ્યા હતા.
કેસ 2 - અસંગતતા તપાસમાં ભૂલો મળી. એક ખોદકામ ટીમે સીઝનના અંતે ડેટાબેઝનું AI ઓડિટ કર્યું હતું; YZ એ ચિહ્નિત કર્યું કે ત્રણ શોધમાં સમાન સંદર્ભ નંબર છે પરંતુ વિરોધાભાસી સ્તરની માહિતી છે. સમીક્ષાએ ડેટા એન્ટ્રી ભૂલ જાહેર કરી; જો તેને સુધારવામાં ન આવે તો તે સ્ટ્રેટેગ્રાફિક અર્થઘટનને વિકૃત કરશે.
કેસ 3 - સાયલન્ટ ચેન્જ પકડાયો. માપનનું માનકીકરણ કરતી વખતે, એક સહાયકે નોંધ્યું કે AI કેટલાક "0" મૂલ્યોને "ગુમ થયેલ" ને બદલે "શૂન્ય" તરીકે અર્થઘટન કરી રહ્યું છે; આ તૂટેલા ટુકડાની લંબાઈને વિકૃત કરે છે. પ્રક્રિયા મૂળ ડેટાને સાચવવા માટે ફરીથી બનાવવામાં આવી હતી પરંતુ ફેરફારોને અલગ કૉલમમાં રાખવા માટે.
ચાર નકલ કરી શકાય તેવા નમૂનાઓ
1) માનકીકરણ (નિયંત્રિત શબ્દકોશ):
તમારી ભૂમિકા: ડેટા રેંગલીંગ સહાયક. નીચેના રેકોર્ડ્સમાં [field:material/period/type] ના મૂલ્યોને નીચેના નિયંત્રિત શબ્દકોશમાં મેપ કરો: [dictionarylist]. શબ્દકોષમાં સમકક્ષ ન હોય તેવા મૂલ્યો બદલો; તેને "કોઈ મેચ નથી" તરીકે ચિહ્નિત કરો. દરેક ફેરફારની જાણ મૂળ-નવી જોડી તરીકે કરો; કાચો ડેટા કાઢી નાખવું.
2) સુસંગતતા તપાસો:
નીચેના ખોદકામ રેકોર્ડ્સમાં અસંગતતાઓ શોધો: પુનરાવર્તિત સંદર્ભ નંબરો, ગુમ થયેલ ફરજિયાત ક્ષેત્રો, વિરોધાભાસી સ્તરીય સંબંધો, અણઘડ તારીખો/માપ. નોંધણી નંબર સાથેની દરેક સમસ્યાની યાદી બનાવો અને તેને ઠીક કરવા માટે ME પર છોડી દો; તેને જાતે બદલશો નહીં.
3) હેરિસ મેટ્રિક્સ લોજિક કંટ્રોલ:
નીચે સંદર્ભો વચ્ચેના સ્તરીય સંબંધો છે (A ઉપર/નીચે B). શું કોઈ તાર્કિક વિરોધાભાસ (લૂપ, દ્વિ-માર્ગીય સંબંધ) છે? જો કોઈ હોય તો કયા સંદર્ભો બતાવો. ટિપ્પણી કરશો નહીં; ફક્ત તાર્કિક સુસંગતતા માટે તપાસો.
4) પ્રશ્ન અને સારાંશ કોષ્ટક:
નીચે ડેટાબેઝ ડમ્પમાંથી નીચેનો અર્ક: [દા.ત. સંદર્ભ દીઠ પ્રકાર વિતરણ શોધો]. દરેક પંક્તિ કયા રેકોર્ડમાંથી લેવામાં આવી છે તેનો ઉલ્લેખ કરીને, પરિણામને કોષ્ટક તરીકે આપો. ડેટામાં અસ્તિત્વમાં ન હોય તેવું કોઈપણ મૂલ્ય ઉમેરશો નહીં; જો તે ખાલી હોય, તો "કોઈ ડેટા નથી" લખો.
નબળા પ્રોમ્પ્ટ / મજબૂત પ્રોમ્પ્ટ
નબળા પ્રોમ્પ્ટ:
આ ખોદકામ ડેટાને ઠીક કરો અને ખૂટતી વસ્તુઓ ભરો.
"ખાલીઓ ભરો" એઆઈને ડેટા ફિટ કરવાની મંજૂરી આપે છે; પરિણામ એ અવિશ્વસનીય ડેટાબેઝ છે જ્યાં હકીકત અને કાલ્પનિક મિશ્રણ.
શક્તિશાળી પ્રોમ્પ્ટ:
નીચેના ખોદકામ ડેટામાં ફક્ત ઔપચારિક અસંગતતાઓ (જોડણી, તારીખ ફોર્મેટ, ડુપ્લિકેટ ID) ચિહ્નિત કરો. સંપૂર્ણ ખૂટતા મૂલ્યો; તેને "અપૂર્ણ" તરીકે છોડી દો. મૂળ સાથે દરેક સૂચિત ફેરફારની યાદી બનાવો; હું મંજૂરી આપીશ. કાચો ડેટા બદલવો.
તફાવત: ભૂતપૂર્વ ચુપચાપ ડેટાને દૂષિત કરે છે; બીજો નિયંત્રણ કરે છે અને નિર્ણય માનવ પર છોડી દે છે.
સારું ડેટા મોડેલ: ક્ષેત્રો, સંબંધો અને મેટાડેટા
પુરાતત્વીય ડેટાબેઝ એ મનસ્વી કોષ્ટક નથી, પરંતુ એક વિચારશીલ ડેટા મોડેલ છે (કયા કોષ્ટકો, કયા ક્ષેત્રો અને ડેટાને કયા સંબંધોમાં ગોઠવવામાં આવશે તેની બ્લુપ્રિન્ટ). મૂળભૂત સિદ્ધાંત એ છે કે બધું સંદર્ભ પર આધાર રાખે છે: સંદર્ભને શોધે છે, એકબીજાના સંદર્ભો (સ્ટ્રેટેગ્રાફી) અને ક્ષેત્રને શોધે છે. દરેક રેકોર્ડ અનન્ય ઓળખ (ID) ધરાવે છે અને આ ઓળખ દ્વારા સંબંધો સ્થાપિત થાય છે; શોધ એ એક સંદર્ભનો સંદર્ભ આપે છે, એક સંદર્ભમાં ઘણી શોધો હોઈ શકે છે.
રેકોર્ડિંગ જેટલું જ મહત્ત્વનું છે તેટલું જ મેટાડેટા (ડેટા વિશેનો ડેટા: કોણે, ક્યારે, કઈ પદ્ધતિથી, કયું સંસ્કરણ રેકોર્ડ કર્યું છે). કોના દ્વારા, ક્યારે અને કયા આત્મવિશ્વાસ સાથે દાખલ કરવામાં આવ્યો હતો તે અજ્ઞાત હોય તેવા રેકોર્ડની ભવિષ્યમાં પૂછપરછ કરી શકાતી નથી. AI મેટાડેટા ફીલ્ડના સતત ભરણને તપાસવામાં અને ખૂટતા મેટાડેટાને ફ્લેગ કરવામાં મદદરૂપ છે.
અન્ય નિર્ણાયક સિદ્ધાંત એક ખુલ્લું અને ટકાઉ ફોર્મેટ છે. ડેટાને માલિકીના, બંધ સૉફ્ટવેરમાં લૉક કરવાને બદલે, તેને ખુલ્લા ધોરણો (ટેક્સ્ટ-આધારિત કોષ્ટકો, દસ્તાવેજીકૃત સ્કીમા)ની નજીક રાખવાથી ખાતરી થાય છે કે ડેટા દાયકાઓ પછી વાંચી શકાય છે. પુરાતત્વીય માહિતી એક પ્રકાશન માટે નહીં પરંતુ ભાવિ પેઢીઓ માટે બનાવવામાં આવે છે; તેથી જ FAIR સિદ્ધાંતો (ડેટા શોધવા, ઍક્સેસિબલ, ઇન્ટરઓપરેબલ અને ફરીથી વાપરી શકાય તેવા) વધુને વધુ પ્રમાણભૂત બન્યા છે. AI આ સિદ્ધાંતો અનુસાર તમારા ડેટાને લેબલ કરવા અને ખામીઓ શોધવા માટે ઉપયોગી છે; પરંતુ કયો ડેટા ખુલ્લો રહેશે અને કયો સંવેદનશીલ (ગોપનીય) રહેશે તે નક્કી કરવાનું તમારા પર છે.
ટિપ: જ્યારે તમે તમારો ડેટાબેઝ સેટઅપ કરી રહ્યાં હોવ, ત્યારે તમારી જાતને પૂછો, "જે કોઈ આ જાણતું નથી તે 10 વર્ષમાં તેને ખોલીને સમજી શકે છે?" પૂછો તમારા સંક્ષિપ્ત શબ્દોને શબ્દાવલિમાં સમજાવો, મેટાડેટા ફીલ્ડ્સ ભરો અને ખુલ્લા ફોર્મેટમાં કાચા ડેટાનો બેકઅપ લો.
રેકોર્ડ/ડેટાબેઝ ટાસ્ક ટેબલ
ક્વેસ્ટ
AI ની ભૂમિકા
માનવ નિર્ણય
રક્ષણ નિયમ
ડિજિટાઇઝેશન
ટેક્સ્ટ ઓળખ
અસ્પષ્ટ વાંચન પુષ્ટિ
કાચું સ્કેન સંગ્રહિત છે
માનકીકરણ
શબ્દકોશ માટે નકશો
અસંગત મૂલ્ય નિર્ણય
મૂળ સાચવેલ છે
સુસંગતતા
વિરોધાભાસ માર્કિંગ
કરેક્શન
પરિવર્તન ટ્રેક કરવામાં આવે છે
સ્તરશાસ્ત્ર
તર્કશાસ્ત્ર નિયંત્રણ
ટિપ્પણી
મેટ્રિક્સ નિષ્ણાતની મંજૂરી
ક્વેરી/સારાંશ
ટેબલ ઉત્પાદન
ટિપ્પણી, પસંદગી
ડેટા પ્રત્યે વફાદારી
સામાન્ય ભૂલો
- ખૂટતો ડેટા પૂર્ણ કરી રહ્યાં છીએ. AI બનાવે છે; ગુમ થયેલ "અપૂર્ણ" રહેવું જોઈએ.
- કાચા ડેટાને ઓવરરાઇટ કરી રહ્યું છે. મૂળ હંમેશા સચવાય છે; ફેરફારો અલગ રાખવામાં આવે છે.
- મૌન ફેરફારોની નોંધ લેતા નથી. દરેક સ્વચાલિત રૂપાંતરણની જાણ અને ઓડિટ થવી જોઈએ.
- ધોરણ છોડવું. નિયંત્રિત શબ્દકોશ અને સામાન્ય મોડેલ વિના, ડેટા શેર કરી શકાતો નથી.
- AI પાસે સ્ટ્રેટેગ્રાફિક અર્થઘટન કરવું. AI તાર્કિક વિરોધાભાસ શોધે છે; ટિપ્પણી નિષ્ણાત માટે છે.
સારાંશમાં
ખોદકામ રેકોર્ડ અને ડેટાબેઝમાં AI; તે ડિજિટાઈઝેશન, સ્ટાન્ડર્ડાઈઝેશન, કન્સિસ્ટન્સી ચેકિંગ અને ક્વેરી વર્ક્સમાં ખૂબ જ ઝડપ પૂરી પાડે છે. પરંતુ ડેટાની અખંડિતતા પવિત્ર છે: કોઈ ખૂટતા ભાગોને અકબંધ રાખવામાં આવતા નથી, કાચો ડેટા સાચવવામાં આવે છે, દરેક ફેરફારને ટ્રૅક કરવામાં આવે છે, અને સ્ટ્રેટેગ્રાફિક અર્થઘટન નિષ્ણાતનું છે. સારા રેકોર્ડ્સ એ સૌથી મૂલ્યવાન વારસો છે જે ખોદકામ ભવિષ્ય માટે છોડી દે છે.
એપ્લિકેશન કાર્ય
એક નાનો નમૂના ખોદકામ ડેટા ટેબલ તૈયાર કરો (10-20 રેકોર્ડ્સ); ઇરાદાપૂર્વક ત્યાં થોડી અસંગતતાઓ મૂકો (ડુપ્લિકેટ ID, ખોટી તારીખ, વિરોધાભાસી સ્તર). AI ને આને “સંગતતા તપાસ” અને “હેરિસ મેટ્રિક્સ લોજિક ચેક” પેટર્ન સાથે શોધવા દો; પછી એક નિયંત્રિત શબ્દકોશ લખો અને સામગ્રી ક્ષેત્રને "માનકીકરણ" નમૂના પર નકશા બનાવો અને કાચા ડેટાને સાચવવાની ખાતરી કરો.
ચેકલિસ્ટ
- [ ] મેં કાચા ડેટાને અલગથી સંગ્રહિત કર્યા છે, ફેરફાર કર્યા વિના.
- [ ] મેં AI ને ગુમ થયેલા ભાગોને પૂર્ણ કર્યા નથી; મેં તેને "અપૂર્ણ" તરીકે છોડી દીધું.
- [ ] મેં દરેક સ્વચાલિત ફેરફારને મૂળ સાથે તપાસ્યા છે.
- [ ] મેં નિયંત્રિત શબ્દકોશ અને ડેટા સ્ટાન્ડર્ડનો ઉપયોગ કર્યો.
- [ ] મેં નિષ્ણાતના ચુકાદાના આધારે સ્ટ્રેટેગ્રાફિક અર્થઘટન કર્યું છે.