નફો:
- કૃત્રિમ બુદ્ધિ સાથે ISAD(G) અથવા ડબલિન કોર જેવા ધોરણો અનુસાર મેટાડેટા ડ્રાફ્ટ્સ બનાવવાની ક્ષમતા
- આભાસને રોકવાની ક્ષમતા અને રજા-ખાલી પરવાનગી સાથે નિયંત્રિત શબ્દભંડોળમાં વિષયની શરતોનો નકશો
- તારીખ, વ્યક્તિનું નામ અને સંદર્ભ કોડ જેવા ક્ષેત્રોને અલગ પાડવાની ક્ષમતાને માનવ મંજૂરીની જરૂર છે અને જે ફક્ત સંસ્થા દ્વારા જ સોંપવામાં આવવી જોઈએ
આર્કાઇવ અથવા લાઇબ્રેરી, ભલે તે ગમે તેટલી સમૃદ્ધ હોય, જ્યાં સુધી તે સારી રીતે વ્યાખ્યાયિત ન હોય ત્યાં સુધી શોધી શકાતી નથી. દસ્તાવેજને "શોધી શકાય તેવું" શું બનાવે છે તે તેના વિશેની વર્ણનાત્મક માહિતી છે: તેને કોણે લખ્યું, ક્યારે, ક્યાં, તેનો વિષય શું છે, તે કયા સંગ્રહનો છે. આ માહિતીને મેટાડેટા કહેવામાં આવે છે (મેટાડેટા — દસ્તાવેજ વિશે વર્ણનાત્મક ડેટા; "ડેટા વિશે ડેટા"). સૂચિબદ્ધ કરવું એ આ મેટાડેટા સાથે દસ્તાવેજોને ઓળખવાની અને તેમને શોધી શકાય તેવી સિસ્ટમમાં સાચવવાની પ્રક્રિયા છે. વર્ગીકરણ એ વિષય, પ્રકાર અથવા મૂળ જેવા માપદંડો અનુસાર દસ્તાવેજોને ગોઠવવાનું છે.
મેટાડેટા જનરેટ કરવું અત્યંત સમય માંગી લે તેવું છે; મોટા સંગ્રહમાં હજારો દસ્તાવેજો માટે તારીખ, વિષય, વ્યક્તિ અને સ્થળની માહિતી વ્યક્તિગત રીતે દાખલ કરવામાં વર્ષો લાગી શકે છે. AI આ વ્યવસાયમાં મજબૂત ડ્રાફ્ટ જનરેટર છે. આ એકમમાં, આપણે જોઈશું કે AI સાથે મેટાડેટા કેવી રીતે જનરેટ કરવું, ધોરણો (ISAD(G), ડબલિન કોર) અનુસાર સૂચિબદ્ધ કરવું અને સ્વચાલિત વર્ગીકરણની શક્તિ અને મુશ્કેલીઓ બંને.
આર્કાઇવલ ધોરણો: તેઓ શા માટે જરૂરી છે
મેટાડેટા અવ્યવસ્થિત રીતે દાખલ થયેલ નથી; ત્યાં આંતરરાષ્ટ્રીય ધોરણો છે જેથી વિવિધ સંસ્થાઓના રેકોર્ડ્સ એકબીજા સાથે વાત કરી શકે:
- ISAD(G) (સામાન્ય ઇન્ટરનેશનલ સ્ટાન્ડર્ડ આર્કાઇવલ વર્ણન): આર્કાઇવલ સામગ્રીને અધિક્રમિક રીતે (ફંડ, શ્રેણી, ફાઇલ, દસ્તાવેજ સ્તરે) વર્ણવવા માટેના નિયમો. તે સંદર્ભ કોડ, શીર્ષક, તારીખ, અવકાશ, સર્જક જેવા ક્ષેત્રો ધરાવે છે.
- ડબલિન કોર: ડિજિટલ સંસાધનો (શીર્ષક, સર્જક, વિષય, તારીખ, શૈલી, ફોર્મેટ, સ્રોત, ભાષા, વગેરે) નું વર્ણન કરવા માટે 15 મુખ્ય ક્ષેત્રોનો સમાવેશ કરતું સામાન્ય ધોરણ.
- શોખ: એક વ્યક્તિ, કુટુંબ અથવા સંસ્થાની પ્રવૃત્તિઓના પરિણામે કુદરતી રીતે રચાયેલ રેકોર્ડનો સમૂહ. તે આર્કાઇવિંગનું મૂળભૂત આયોજન એકમ છે.
- ઉત્પત્તિ (મૂળ): દસ્તાવેજ કોની પાસેથી આવે છે અને તે કયા હાથમાંથી પસાર થાય છે તેની માહિતી. આર્કાઇવિંગમાં, દસ્તાવેજો તેમના મૂળ અનુસાર એકસાથે રાખવામાં આવે છે.
જ્યારે AI પ્રોડ્યુસ મેટાડેટા હોય ત્યારે સ્પષ્ટપણે ટાર્ગેટ સ્ટાન્ડર્ડનો ઉલ્લેખ કરવાથી ખાતરી થાય છે કે આઉટપુટ સીધા એન્ટરપ્રાઇઝમાં ઇનપુટેબલ છે.
અન્ય મુખ્ય વિભાવના એ ઓથોરિટી રેકોર્ડ છે - એક રેકોર્ડ જે વ્યક્તિ, સ્થળ અથવા સંસ્થાના નામના એકલ, પ્રમાણભૂત, માન્ય સ્વરૂપને વ્યાખ્યાયિત કરે છે. ઐતિહાસિક દસ્તાવેજોમાં, એક જ વ્યક્તિ અથવા સ્થળ અલગ-અલગ જોડણી સાથે દેખાઈ શકે છે; ઓથોરિટી રેકોર્ડ તે બધાને એક જ માન્ય ફોર્મેટમાં બાંધે છે જેથી તેઓ શોધમાં વિખેરાઈ ન જાય. AI દસ્તાવેજમાંથી નામ સૂચવે છે; પરંતુ આ નામને ઓથોરિટી રેકોર્ડમાં માનક સ્વરૂપમાં મેપ કરવું એ માનવીય કાર્ય છે. સંસ્થાના ઓથોરિટી રેકોર્ડમાં AI જે કહે છે તે "અહમદ" ને "અહમદ બે (1840-1912)" સાથે જોડવાથી સૂચિની સુસંગતતા જળવાઈ રહે છે.
વર્કફ્લો: સ્ટેપ બાય સ્ટેપ
1. સ્ત્રોત તૈયાર કરો. દસ્તાવેજની ટ્રાન્સક્રિપ્ટ અથવા છબી અને કોઈપણ સંદર્ભ માહિતી એકત્રિત કરો.
2. ધોરણો અને વિસ્તારો ઓળખો. એઆઈને કહો કે કયા સ્ટાન્ડર્ડ (ISAD(G), Dublin Core) અને કયા ફીલ્ડ મુજબ તે આઉટપુટ આપશે.
3. ડ્રાફ્ટ મેટાડેટા જનરેટ કરો. AI ફીલ્ડમાં ભરે છે જે દસ્તાવેજમાંથી કાઢી શકાય છે (તારીખ, વ્યક્તિ, સ્થળ, વિષય, ભાષા, શૈલી); તે તે વિસ્તારોને ખાલી છોડી દે છે જે તે દૂર કરી શકતી નથી.
4. નિયંત્રિત શબ્દભંડોળનો નકશો. મોટાભાગની સંસ્થાઓમાં વિષય અને સ્થળના નામ મફત નથી, પરંતુ પૂર્વવ્યાખ્યાયિત સૂચિ (નિયંત્રિત શબ્દભંડોળ/કોષકોષ) સાથે જોડાયેલા છે. આ સૂચિમાં AI દ્વારા સૂચિત વિષયના શબ્દોનો નકશો બનાવો.
5. ચકાસો અને પુષ્ટિ કરો. દરેક ક્ષેત્ર, ખાસ કરીને તારીખ, નામ અને વિષયની સરખામણી માણસો દ્વારા દસ્તાવેજો અને સત્તાના રેકોર્ડ સાથે કરવામાં આવે છે.
ટીપ: સ્પષ્ટપણે AI ને "ખાલી છોડવા" માટે પરવાનગી આપો. નહિંતર, તે દસ્તાવેજમાં ન હોય તેવી તારીખ અથવા સર્જકને "અનુમાન" ભરશે અને તમારા કેટલોગમાં નકલી મેટાડેટા દાખલ કરશે. સૂચના "જો તે દસ્તાવેજમાં ન હોય તો આ ક્ષેત્ર ખાલી છોડો" આભાસ સામે સૌથી મજબૂત કવચ છે.
કોષ્ટકમાં ક્ષેત્રો અને વિશ્વાસ સ્તર
મેટાડેટા ક્ષેત્ર
AI કેટલું વિશ્વસનીય છે?
ચકાસણી
ભાષા
ઉચ્ચ
નમૂના
દસ્તાવેજનો પ્રકાર
મધ્યમ-ઉચ્ચ
નિયંત્રણ
વ્યક્તિ/સ્થળના નામ
માધ્યમ (વાંચવામાં ભૂલ)
ફરજિયાત
તારીખ
નિમ્ન-મધ્યમ (બનાવટનું જોખમ)
ફરજિયાત
વિષયની શરતો
મધ્યમ (મફત જનરેટીંગ)
ચેકલિસ્ટ માટે નકશો
અવકાશ/સારાંશ
મધ્યમ-ઉચ્ચ
સ્ત્રોત સાથે સરખામણી કરો
સંદર્ભ કોડ
કોઈ નહીં (સંસ્થા આપે છે)
માનવ ફેંકે છે
સારાંશ: ભાષા અને શૈલી જેવા ક્ષેત્રોમાં AI ઝડપી અને વિશ્વસનીય છે; તારીખ, નામ અને વિષય જેવા ક્ષેત્રોમાં ડ્રાફ્ટ જનરેટ કરે છે, પરંતુ માનવ મંજૂરી જરૂરી છે; AI ક્યારેય સંસ્થાકીય ક્ષેત્રો જેમ કે સંદર્ભ કોડનું નિર્માણ કરતું નથી.
ત્રણ નાના કેસો
કેસ 1 — 8,000 ફોટા માટેનો ડ્રાફ્ટ મેટાડેટા. એક સિટી આર્કાઇવ 8,000 ઐતિહાસિક ફોટોગ્રાફ્સનું સૂચિબદ્ધ કરતું હતું. દરેક ફોટાની પાછળની નોંધો ટ્રાંસ્ક્રાઇબ કરીને AI ને આપવામાં આવી હતી; AI જનરેટ કરે છે તારીખ, સ્થાન અને વિષયની રૂપરેખા. માનવ ટીમે તેને ફિલ્ડ દ્વારા ચકાસ્યું અને તેને નિયંત્રિત સૂચિમાં મેપ કર્યું. અંદાજિત 10-મહિનાની નોકરી ઘટાડીને 3 મહિના કરવામાં આવી હતી; પરંતુ દરેક તારીખ અને સ્થળનું નામ દૃષ્ટિની રીતે તપાસવામાં આવ્યું હતું.
કેસ 2 - મેડ-અપ ઇતિહાસ. એક આર્કાઇવિસ્ટ પાસે AI કેટેલોગ એક અનડેટેડ પત્ર હતો. YZ એ પત્રની સામગ્રી જોઈ અને તારીખ "1912" ચોક્કસ લખી. જો કે, દસ્તાવેજમાં કોઈ તારીખ ન હતી; એઆઈએ આગાહી કરી હતી. જો આર્કાઇવિસ્ટે "દસ્તાવેજમાં ન હોય તો ખાલી છોડો" સૂચના ઉમેરી ન હોત, તો કેટલોગ મેડ-અપ તારીખથી ભરાઈ ગયો હોત. પાઠ: ખાલી પરવાનગી ફરજિયાત છે.
કેસ 3 - મફત વિષયની શરતો મૂંઝવણ ઊભી કરે છે. AI એ સમાન દસ્તાવેજોને "ઇમિગ્રેશન", "ઇમિગ્રેશન", "પતાવટ" જેવી સમાન પરંતુ અલગ અલગ મફત શરતો સોંપી છે. જ્યારે તેને નિયંત્રિત શબ્દભંડોળમાં મેપ કરવામાં આવ્યો ન હતો, ત્યારે તે જ વિષયને ત્રણ અલગ અલગ શબ્દો સાથે ટેગ કરવામાં આવ્યો હતો અને શોધમાં વેરવિખેર કરવામાં આવ્યો હતો. એક જ સત્તાની યાદીમાં શરતોને મેપ કરીને સુસંગતતા પ્રાપ્ત કરવામાં આવી હતી. પાઠ: વિષયની શરતો બહાર પાડવામાં આવતી નથી, તે સૂચિ સાથે જોડાયેલ છે.
ચાર નકલ કરી શકાય તેવા નમૂનાઓ
1) ડબલિન કોર રૂપરેખા:
નીચે આપેલા દસ્તાવેજ ટ્રાન્સક્રિપ્શનમાંથી ડબલિન કોર મેટાડેટા ડ્રાફ્ટને બહાર કાઢો. ક્ષેત્રો: શીર્ષક, સર્જક, વિષય, વર્ણન, તારીખ, શૈલી, ભાષા, અવકાશ (સ્થાન/કાળ). નિયમો: (1) ફક્ત ટેક્સ્ટમાં સ્પષ્ટપણે માહિતીનો ઉપયોગ કરો. (2) જે ફીલ્ડ ખાલી લખાણમાં નથી તેને છોડી દો, અનુમાન ન કરો. (3) તે મૂલ્યને ચિહ્નિત કરો જેની તમને ખાતરી નથી [?]. ટ્રાન્સક્રિપ્શન: [અહીં]
2) ISAD(G) ડ્રાફ્ટ વ્યાખ્યા:
ISAD(G) ફીલ્ડમાં નીચેના દસ્તાવેજ માટે ડ્રાફ્ટ બનાવો: શીર્ષક, તારીખ(ઓ), વર્ણન સ્તર (દસ્તાવેજ/ફાઈલ), અવકાશ અને સામગ્રી (ટૂંકા સારાંશ), સર્જક, ભાષા. સંદર્ભ કોડ ખાલી છોડો (સંસ્થા તે પ્રદાન કરશે). ટેક્સ્ટમાં ન હોય તેવી કોઈપણ માહિતી ઉમેરશો નહીં; અવિદ્યમાન ક્ષેત્રને ખાલી છોડો. દસ્તાવેજ: [અહીં]
3) વિષય શબ્દ સૂચન (નિયંત્રિત):
નીચેના દસ્તાવેજને અનુરૂપ 3-5 વિષયના શબ્દો સૂચવો. પ્રથમ, દસ્તાવેજમાંના તથ્યો પર આધાર રાખો. નીચે અમારી સંસ્થાની નિયંત્રિત પરિભાષા સૂચિ છે; પ્રથમ, તેને આ સૂચિમાંથી પસંદ કરો, જો તે સૂચિમાં નથી, તો તમારા નવા શબ્દ સૂચનને અલગથી ચિહ્નિત કરો. સૂચિ: [શરતો]. દસ્તાવેજ: [અહીં]
4) બલ્ક સુસંગતતા તપાસો:
નીચે સમાન સંગ્રહમાંથી દસ્તાવેજો માટે મેટાડેટા રેકોર્ડ્સ છે. ધ્વજની અસંગતતાઓ: એક જ સ્થળ/વ્યક્તિની જોડણી અલગ, અલગ તારીખ ફોર્મેટ, સમાન વિષય માટે અલગ-અલગ શબ્દોના રેકોર્ડ. સુધારણા IMPOSITION; માનવ માટે સમીક્ષા કરવા માટે ફક્ત અસંગતતાઓની સૂચિ બનાવો. રેકોર્ડ્સ: [અહીં]
નબળા પ્રોમ્પ્ટ / મજબૂત પ્રોમ્પ્ટ
નબળા:
આ દસ્તાવેજ માટે સંપૂર્ણ કેટલોગ રેકોર્ડ બનાવો.
"સંપૂર્ણ" સૂચના એઆઈને દરેક જગ્યા ભરવા માટે દબાણ કરે છે, એટલે કે, ઇતિહાસ અને સર્જકોની શોધ કરવા જે અસ્તિત્વમાં નથી.
મજબૂત:
આ દસ્તાવેજ માટે ડબલિન કોરનો મુસદ્દો તૈયાર કરવામાં આવ્યો છે. ટ્રાન્સક્રિપ્શનમાં સ્પષ્ટપણે સમાવિષ્ટ માહિતીનો જ ઉપયોગ કરો; અસ્તિત્વમાં ન હોય તેવા ક્ષેત્રને ખાલી છોડો, અનુમાન ન કરો. આ નિયંત્રિત સૂચિમાંથી વિષયના શબ્દો પસંદ કરો: [સૂચિ]. તારીખ અને વ્યક્તિના નામોને [?] વડે ચિહ્નિત કરો જેથી હું તેને દસ્તાવેજ સાથે ચકાસી શકું. ટ્રાન્સક્રિપ્શન: [અહીં]
તફાવત: "સંપૂર્ણ" આવૃત્તિને બદલે "ખાલી છોડો" પરવાનગી, નિયંત્રિત સૂચિ પાલન અને ચકાસણી ચિહ્નો કેટેલોગને બનાવટથી સુરક્ષિત કરે છે.
સામાન્ય ભૂલો
- તેનો અર્થ છે "તેને સંપૂર્ણપણે ભરો". આ અવિદ્યમાન ક્ષેત્રોને ફિટ કરવા તરફ દોરી જાય છે; "ખાલી છોડો" પરવાનગી આપવી જોઈએ.
- વિષયની શરતો બહાર પાડી રહ્યા છીએ. શરતો કે જે નિયંત્રિત શબ્દભંડોળ સાથે નકશામાં નથી આવતી તે શોધને વિચલિત કરશે.
- AI આગાહી ઇતિહાસ ધરાવે છે. અનડેટેડ દસ્તાવેજમાં કાલ્પનિક તારીખ દાખલ કરવાથી સૂચિ પ્રદૂષિત થાય છે.
- AI દ્વારા જનરેટ કરેલ સંદર્ભ કોડ રાખવાથી. આ એક કોર્પોરેટ, અનન્ય જગ્યા છે; લોકો ફેંકે છે.
- ધોરણનો ઉલ્લેખ નથી. જો ધોરણનો ઉલ્લેખ કરવામાં આવ્યો નથી, તો આઉટપુટ અવ્યવસ્થિત ડ્રાફ્ટ હશે જે સંસ્થામાં દાખલ કરી શકાશે નહીં.
સારાંશમાં
મેટાડેટા અને સૂચિ એ અદ્રશ્ય ઇન્ફ્રાસ્ટ્રક્ચર છે જે સંશોધક માટે આર્કાઇવ ખોલે છે, અને તેના માટે ઘણા પ્રયત્નોની જરૂર છે. ટ્રાંસ્ક્રિપ્શનમાંથી, AI તારીખ, વ્યક્તિ, સ્થળ, વિષય અને શૈલી જેવા ક્ષેત્રો માટે ઝડપી રૂપરેખા બનાવે છે; તે ISAD(G) અથવા ડબલિન કોર જેવા ધોરણો અનુસાર કામ કરી શકે છે. પરંતુ "સંપૂર્ણપણે ભરવા" માટેનું દબાણ એઆઈને વસ્તુઓ બનાવવા માટે દબાણ કરે છે; "ખાલી છોડો" પરવાનગી, નિયંત્રિત શબ્દભંડોળમાં મેપિંગ અને તારીખો/નામોની માનવીય પુષ્ટિ સૂચિને વિશ્વાસપાત્ર રાખે છે. AI ડ્રાફ્ટ તૈયાર કરે છે; તમે કેટલોગની ચોકસાઈ માટે જવાબદાર છો.
એપ્લિકેશન કાર્ય
દસ્તાવેજનું ટ્રાંસ્ક્રિપ્શન લો અને “ડબલિન કોર ડ્રાફ્ટ” ટેમ્પલેટ સાથે AI થી મેટાડેટાની વિનંતી કરો; ચકાસો કે તે ખાલી ક્ષેત્રો છોડે છે જે અસ્તિત્વમાં નથી. પછી તમારી પોતાની (અથવા નમૂના) ચેકલિસ્ટ સાથે "વિષય શબ્દ સૂચન" ટેમ્પલેટ ચલાવો. છેલ્લે, "બલ્ક સુસંગતતા તપાસ" સાથે થોડા રેકોર્ડ્સનું પરીક્ષણ કરો. નોંધ કરો કે AI આગાહી સાથે કેટલા ફીલ્ડને પોપ્યુલેટ કરવાનો પ્રયાસ કરે છે અને સૂચિમાં કેટલા વિષયના શબ્દોને મેપ કરવાની જરૂર છે.
ચેકલિસ્ટ
- [ ] મેં સ્પષ્ટપણે લક્ષ્ય ધોરણ (ISAD(G)/Dublin Core) જણાવ્યું છે.
- [ ] મેં "ખાલી જગ્યા ખાલી છોડો" પરવાનગી આપી.
- [ ] મેં વિષયની શરતોને નિયંત્રિત સૂચિમાં મેપ કરી છે.
- [ ] મેં દસ્તાવેજ/ઓથોરિટી રેકોર્ડ સાથે તારીખ અને વ્યક્તિના નામની ચકાસણી કરી છે.
- [ ] મેં સંદર્ભ કોડ સંસ્થાને છોડી દીધો, AI ને નહીં.