એકમો
1. ઇતિહાસ અને આર્કાઇવિંગમાં કૃત્રિમ બુદ્ધિનો પરિચય: ભૂમિકાઓ, સીમાઓ, માન્યતા અને નીતિશાસ્ત્ર 2. દસ્તાવેજ ડિજિટાઇઝેશન અને OCR: પ્રિન્ટેડ ટેક્સ્ટને મશીન ટેક્સ્ટમાં કન્વર્ટ કરવું 3. ટ્રાન્સક્રિપ્શન: ઓટ્ટોમન ટર્કિશ અને હસ્તપ્રતો 4. મેટાડેટા, સૂચિ અને વર્ગીકરણ 5. સ્ત્રોત સ્કેનિંગ, ડિસ્કવરી અને સારાંશ 6. ઐતિહાસિક અનુવાદ અને સરળીકરણ 7. સ્ત્રોત ચકાસણી, એનાક્રોનિઝમ અને આભાસ 8. સામગ્રી વિશ્લેષણ અને પેટર્ન શોધ 9. આર્કાઇવ ઍક્સેસ, વર્ણન અને વપરાશકર્તા સેવાઓ 10. જાળવણી, પુનઃસ્થાપન અને ડિજિટલ સંરક્ષણ 11. નૈતિકતા, કોપીરાઈટ, ગોપનીયતા અને સાંસ્કૃતિક સંવેદનશીલતા 12. એન્ડ-ટુ-એન્ડ પ્રોજેક્ટ: આર્ટિફિશિયલ ઇન્ટેલિજન્સ સાથે આર્કાઇવ કલેક્શનની પ્રક્રિયા કરવી
એકમ 4 / 12

મેટાડેટા, સૂચિ અને વર્ગીકરણ

નફો:

  • કૃત્રિમ બુદ્ધિ સાથે ISAD(G) અથવા ડબલિન કોર જેવા ધોરણો અનુસાર મેટાડેટા ડ્રાફ્ટ્સ બનાવવાની ક્ષમતા
  • આભાસને રોકવાની ક્ષમતા અને રજા-ખાલી પરવાનગી સાથે નિયંત્રિત શબ્દભંડોળમાં વિષયની શરતોનો નકશો
  • તારીખ, વ્યક્તિનું નામ અને સંદર્ભ કોડ જેવા ક્ષેત્રોને અલગ પાડવાની ક્ષમતાને માનવ મંજૂરીની જરૂર છે અને જે ફક્ત સંસ્થા દ્વારા જ સોંપવામાં આવવી જોઈએ

આર્કાઇવ અથવા લાઇબ્રેરી, ભલે તે ગમે તેટલી સમૃદ્ધ હોય, જ્યાં સુધી તે સારી રીતે વ્યાખ્યાયિત ન હોય ત્યાં સુધી શોધી શકાતી નથી. દસ્તાવેજને "શોધી શકાય તેવું" શું બનાવે છે તે તેના વિશેની વર્ણનાત્મક માહિતી છે: તેને કોણે લખ્યું, ક્યારે, ક્યાં, તેનો વિષય શું છે, તે કયા સંગ્રહનો છે. આ માહિતીને મેટાડેટા કહેવામાં આવે છે (મેટાડેટા — દસ્તાવેજ વિશે વર્ણનાત્મક ડેટા; "ડેટા વિશે ડેટા"). સૂચિબદ્ધ કરવું એ આ મેટાડેટા સાથે દસ્તાવેજોને ઓળખવાની અને તેમને શોધી શકાય તેવી સિસ્ટમમાં સાચવવાની પ્રક્રિયા છે. વર્ગીકરણ એ વિષય, પ્રકાર અથવા મૂળ જેવા માપદંડો અનુસાર દસ્તાવેજોને ગોઠવવાનું છે.

મેટાડેટા જનરેટ કરવું અત્યંત સમય માંગી લે તેવું છે; મોટા સંગ્રહમાં હજારો દસ્તાવેજો માટે તારીખ, વિષય, વ્યક્તિ અને સ્થળની માહિતી વ્યક્તિગત રીતે દાખલ કરવામાં વર્ષો લાગી શકે છે. AI આ વ્યવસાયમાં મજબૂત ડ્રાફ્ટ જનરેટર છે. આ એકમમાં, આપણે જોઈશું કે AI સાથે મેટાડેટા કેવી રીતે જનરેટ કરવું, ધોરણો (ISAD(G), ડબલિન કોર) અનુસાર સૂચિબદ્ધ કરવું અને સ્વચાલિત વર્ગીકરણની શક્તિ અને મુશ્કેલીઓ બંને.

આર્કાઇવલ ધોરણો: તેઓ શા માટે જરૂરી છે

મેટાડેટા અવ્યવસ્થિત રીતે દાખલ થયેલ નથી; ત્યાં આંતરરાષ્ટ્રીય ધોરણો છે જેથી વિવિધ સંસ્થાઓના રેકોર્ડ્સ એકબીજા સાથે વાત કરી શકે:

  • ISAD(G) (સામાન્ય ઇન્ટરનેશનલ સ્ટાન્ડર્ડ આર્કાઇવલ વર્ણન): આર્કાઇવલ સામગ્રીને અધિક્રમિક રીતે (ફંડ, શ્રેણી, ફાઇલ, દસ્તાવેજ સ્તરે) વર્ણવવા માટેના નિયમો. તે સંદર્ભ કોડ, શીર્ષક, તારીખ, અવકાશ, સર્જક જેવા ક્ષેત્રો ધરાવે છે.
  • ડબલિન કોર: ડિજિટલ સંસાધનો (શીર્ષક, સર્જક, વિષય, તારીખ, શૈલી, ફોર્મેટ, સ્રોત, ભાષા, વગેરે) નું વર્ણન કરવા માટે 15 મુખ્ય ક્ષેત્રોનો સમાવેશ કરતું સામાન્ય ધોરણ.
  • શોખ: એક વ્યક્તિ, કુટુંબ અથવા સંસ્થાની પ્રવૃત્તિઓના પરિણામે કુદરતી રીતે રચાયેલ રેકોર્ડનો સમૂહ. તે આર્કાઇવિંગનું મૂળભૂત આયોજન એકમ છે.
  • ઉત્પત્તિ (મૂળ): દસ્તાવેજ કોની પાસેથી આવે છે અને તે કયા હાથમાંથી પસાર થાય છે તેની માહિતી. આર્કાઇવિંગમાં, દસ્તાવેજો તેમના મૂળ અનુસાર એકસાથે રાખવામાં આવે છે.

જ્યારે AI પ્રોડ્યુસ મેટાડેટા હોય ત્યારે સ્પષ્ટપણે ટાર્ગેટ સ્ટાન્ડર્ડનો ઉલ્લેખ કરવાથી ખાતરી થાય છે કે આઉટપુટ સીધા એન્ટરપ્રાઇઝમાં ઇનપુટેબલ છે.

અન્ય મુખ્ય વિભાવના એ ઓથોરિટી રેકોર્ડ છે - એક રેકોર્ડ જે વ્યક્તિ, સ્થળ અથવા સંસ્થાના નામના એકલ, પ્રમાણભૂત, માન્ય સ્વરૂપને વ્યાખ્યાયિત કરે છે. ઐતિહાસિક દસ્તાવેજોમાં, એક જ વ્યક્તિ અથવા સ્થળ અલગ-અલગ જોડણી સાથે દેખાઈ શકે છે; ઓથોરિટી રેકોર્ડ તે બધાને એક જ માન્ય ફોર્મેટમાં બાંધે છે જેથી તેઓ શોધમાં વિખેરાઈ ન જાય. AI દસ્તાવેજમાંથી નામ સૂચવે છે; પરંતુ આ નામને ઓથોરિટી રેકોર્ડમાં માનક સ્વરૂપમાં મેપ કરવું એ માનવીય કાર્ય છે. સંસ્થાના ઓથોરિટી રેકોર્ડમાં AI જે કહે છે તે "અહમદ" ને "અહમદ બે (1840-1912)" સાથે જોડવાથી સૂચિની સુસંગતતા જળવાઈ રહે છે.

વર્કફ્લો: સ્ટેપ બાય સ્ટેપ

1. સ્ત્રોત તૈયાર કરો. દસ્તાવેજની ટ્રાન્સક્રિપ્ટ અથવા છબી અને કોઈપણ સંદર્ભ માહિતી એકત્રિત કરો.

2. ધોરણો અને વિસ્તારો ઓળખો. એઆઈને કહો કે કયા સ્ટાન્ડર્ડ (ISAD(G), Dublin Core) અને કયા ફીલ્ડ મુજબ તે આઉટપુટ આપશે.

3. ડ્રાફ્ટ મેટાડેટા જનરેટ કરો. AI ફીલ્ડમાં ભરે છે જે દસ્તાવેજમાંથી કાઢી શકાય છે (તારીખ, વ્યક્તિ, સ્થળ, વિષય, ભાષા, શૈલી); તે તે વિસ્તારોને ખાલી છોડી દે છે જે તે દૂર કરી શકતી નથી.

4. નિયંત્રિત શબ્દભંડોળનો નકશો. મોટાભાગની સંસ્થાઓમાં વિષય અને સ્થળના નામ મફત નથી, પરંતુ પૂર્વવ્યાખ્યાયિત સૂચિ (નિયંત્રિત શબ્દભંડોળ/કોષકોષ) સાથે જોડાયેલા છે. આ સૂચિમાં AI દ્વારા સૂચિત વિષયના શબ્દોનો નકશો બનાવો.

5. ચકાસો અને પુષ્ટિ કરો. દરેક ક્ષેત્ર, ખાસ કરીને તારીખ, નામ અને વિષયની સરખામણી માણસો દ્વારા દસ્તાવેજો અને સત્તાના રેકોર્ડ સાથે કરવામાં આવે છે.

ટીપ: સ્પષ્ટપણે AI ને "ખાલી છોડવા" માટે પરવાનગી આપો. નહિંતર, તે દસ્તાવેજમાં ન હોય તેવી તારીખ અથવા સર્જકને "અનુમાન" ભરશે અને તમારા કેટલોગમાં નકલી મેટાડેટા દાખલ કરશે. સૂચના "જો તે દસ્તાવેજમાં ન હોય તો આ ક્ષેત્ર ખાલી છોડો" આભાસ સામે સૌથી મજબૂત કવચ છે.

કોષ્ટકમાં ક્ષેત્રો અને વિશ્વાસ સ્તર

મેટાડેટા ક્ષેત્ર

AI કેટલું વિશ્વસનીય છે?

ચકાસણી

ભાષા

ઉચ્ચ

નમૂના

દસ્તાવેજનો પ્રકાર

મધ્યમ-ઉચ્ચ

નિયંત્રણ

વ્યક્તિ/સ્થળના નામ

માધ્યમ (વાંચવામાં ભૂલ)

ફરજિયાત

તારીખ

નિમ્ન-મધ્યમ (બનાવટનું જોખમ)

ફરજિયાત

વિષયની શરતો

મધ્યમ (મફત જનરેટીંગ)

ચેકલિસ્ટ માટે નકશો

અવકાશ/સારાંશ

મધ્યમ-ઉચ્ચ

સ્ત્રોત સાથે સરખામણી કરો

સંદર્ભ કોડ

કોઈ નહીં (સંસ્થા આપે છે)

માનવ ફેંકે છે

સારાંશ: ભાષા અને શૈલી જેવા ક્ષેત્રોમાં AI ઝડપી અને વિશ્વસનીય છે; તારીખ, નામ અને વિષય જેવા ક્ષેત્રોમાં ડ્રાફ્ટ જનરેટ કરે છે, પરંતુ માનવ મંજૂરી જરૂરી છે; AI ક્યારેય સંસ્થાકીય ક્ષેત્રો જેમ કે સંદર્ભ કોડનું નિર્માણ કરતું નથી.

ત્રણ નાના કેસો

કેસ 1 — 8,000 ફોટા માટેનો ડ્રાફ્ટ મેટાડેટા. એક સિટી આર્કાઇવ 8,000 ઐતિહાસિક ફોટોગ્રાફ્સનું સૂચિબદ્ધ કરતું હતું. દરેક ફોટાની પાછળની નોંધો ટ્રાંસ્ક્રાઇબ કરીને AI ને આપવામાં આવી હતી; AI જનરેટ કરે છે તારીખ, સ્થાન અને વિષયની રૂપરેખા. માનવ ટીમે તેને ફિલ્ડ દ્વારા ચકાસ્યું અને તેને નિયંત્રિત સૂચિમાં મેપ કર્યું. અંદાજિત 10-મહિનાની નોકરી ઘટાડીને 3 મહિના કરવામાં આવી હતી; પરંતુ દરેક તારીખ અને સ્થળનું નામ દૃષ્ટિની રીતે તપાસવામાં આવ્યું હતું.

કેસ 2 - મેડ-અપ ઇતિહાસ. એક આર્કાઇવિસ્ટ પાસે AI કેટેલોગ એક અનડેટેડ પત્ર હતો. YZ એ પત્રની સામગ્રી જોઈ અને તારીખ "1912" ચોક્કસ લખી. જો કે, દસ્તાવેજમાં કોઈ તારીખ ન હતી; એઆઈએ આગાહી કરી હતી. જો આર્કાઇવિસ્ટે "દસ્તાવેજમાં ન હોય તો ખાલી છોડો" સૂચના ઉમેરી ન હોત, તો કેટલોગ મેડ-અપ તારીખથી ભરાઈ ગયો હોત. પાઠ: ખાલી પરવાનગી ફરજિયાત છે.

કેસ 3 - મફત વિષયની શરતો મૂંઝવણ ઊભી કરે છે. AI એ સમાન દસ્તાવેજોને "ઇમિગ્રેશન", "ઇમિગ્રેશન", "પતાવટ" જેવી સમાન પરંતુ અલગ અલગ મફત શરતો સોંપી છે. જ્યારે તેને નિયંત્રિત શબ્દભંડોળમાં મેપ કરવામાં આવ્યો ન હતો, ત્યારે તે જ વિષયને ત્રણ અલગ અલગ શબ્દો સાથે ટેગ કરવામાં આવ્યો હતો અને શોધમાં વેરવિખેર કરવામાં આવ્યો હતો. એક જ સત્તાની યાદીમાં શરતોને મેપ કરીને સુસંગતતા પ્રાપ્ત કરવામાં આવી હતી. પાઠ: વિષયની શરતો બહાર પાડવામાં આવતી નથી, તે સૂચિ સાથે જોડાયેલ છે.

ચાર નકલ કરી શકાય તેવા નમૂનાઓ

1) ડબલિન કોર રૂપરેખા:

નીચે આપેલા દસ્તાવેજ ટ્રાન્સક્રિપ્શનમાંથી ડબલિન કોર મેટાડેટા ડ્રાફ્ટને બહાર કાઢો. ક્ષેત્રો: શીર્ષક, સર્જક, વિષય, વર્ણન, તારીખ, શૈલી, ભાષા, અવકાશ (સ્થાન/કાળ). નિયમો: (1) ફક્ત ટેક્સ્ટમાં સ્પષ્ટપણે માહિતીનો ઉપયોગ કરો. (2) જે ફીલ્ડ ખાલી લખાણમાં નથી તેને છોડી દો, અનુમાન ન કરો. (3) તે મૂલ્યને ચિહ્નિત કરો જેની તમને ખાતરી નથી [?]. ટ્રાન્સક્રિપ્શન: [અહીં]

2) ISAD(G) ડ્રાફ્ટ વ્યાખ્યા:

ISAD(G) ફીલ્ડમાં નીચેના દસ્તાવેજ માટે ડ્રાફ્ટ બનાવો: શીર્ષક, તારીખ(ઓ), વર્ણન સ્તર (દસ્તાવેજ/ફાઈલ), અવકાશ અને સામગ્રી (ટૂંકા સારાંશ), સર્જક, ભાષા. સંદર્ભ કોડ ખાલી છોડો (સંસ્થા તે પ્રદાન કરશે). ટેક્સ્ટમાં ન હોય તેવી કોઈપણ માહિતી ઉમેરશો નહીં; અવિદ્યમાન ક્ષેત્રને ખાલી છોડો. દસ્તાવેજ: [અહીં]

3) વિષય શબ્દ સૂચન (નિયંત્રિત):

નીચેના દસ્તાવેજને અનુરૂપ 3-5 વિષયના શબ્દો સૂચવો. પ્રથમ, દસ્તાવેજમાંના તથ્યો પર આધાર રાખો. નીચે અમારી સંસ્થાની નિયંત્રિત પરિભાષા સૂચિ છે; પ્રથમ, તેને આ સૂચિમાંથી પસંદ કરો, જો તે સૂચિમાં નથી, તો તમારા નવા શબ્દ સૂચનને અલગથી ચિહ્નિત કરો. સૂચિ: [શરતો]. દસ્તાવેજ: [અહીં]

4) બલ્ક સુસંગતતા તપાસો:

નીચે સમાન સંગ્રહમાંથી દસ્તાવેજો માટે મેટાડેટા રેકોર્ડ્સ છે. ધ્વજની અસંગતતાઓ: એક જ સ્થળ/વ્યક્તિની જોડણી અલગ, અલગ તારીખ ફોર્મેટ, સમાન વિષય માટે અલગ-અલગ શબ્દોના રેકોર્ડ. સુધારણા IMPOSITION; માનવ માટે સમીક્ષા કરવા માટે ફક્ત અસંગતતાઓની સૂચિ બનાવો. રેકોર્ડ્સ: [અહીં]

નબળા પ્રોમ્પ્ટ / મજબૂત પ્રોમ્પ્ટ

નબળા:

આ દસ્તાવેજ માટે સંપૂર્ણ કેટલોગ રેકોર્ડ બનાવો.

"સંપૂર્ણ" સૂચના એઆઈને દરેક જગ્યા ભરવા માટે દબાણ કરે છે, એટલે કે, ઇતિહાસ અને સર્જકોની શોધ કરવા જે અસ્તિત્વમાં નથી.

મજબૂત:

આ દસ્તાવેજ માટે ડબલિન કોરનો મુસદ્દો તૈયાર કરવામાં આવ્યો છે. ટ્રાન્સક્રિપ્શનમાં સ્પષ્ટપણે સમાવિષ્ટ માહિતીનો જ ઉપયોગ કરો; અસ્તિત્વમાં ન હોય તેવા ક્ષેત્રને ખાલી છોડો, અનુમાન ન કરો. આ નિયંત્રિત સૂચિમાંથી વિષયના શબ્દો પસંદ કરો: [સૂચિ]. તારીખ અને વ્યક્તિના નામોને [?] વડે ચિહ્નિત કરો જેથી હું તેને દસ્તાવેજ સાથે ચકાસી શકું. ટ્રાન્સક્રિપ્શન: [અહીં]

તફાવત: "સંપૂર્ણ" આવૃત્તિને બદલે "ખાલી છોડો" પરવાનગી, નિયંત્રિત સૂચિ પાલન અને ચકાસણી ચિહ્નો કેટેલોગને બનાવટથી સુરક્ષિત કરે છે.

સામાન્ય ભૂલો

  • તેનો અર્થ છે "તેને સંપૂર્ણપણે ભરો". આ અવિદ્યમાન ક્ષેત્રોને ફિટ કરવા તરફ દોરી જાય છે; "ખાલી છોડો" પરવાનગી આપવી જોઈએ.
  • વિષયની શરતો બહાર પાડી રહ્યા છીએ. શરતો કે જે નિયંત્રિત શબ્દભંડોળ સાથે નકશામાં નથી આવતી તે શોધને વિચલિત કરશે.
  • AI આગાહી ઇતિહાસ ધરાવે છે. અનડેટેડ દસ્તાવેજમાં કાલ્પનિક તારીખ દાખલ કરવાથી સૂચિ પ્રદૂષિત થાય છે.
  • AI દ્વારા જનરેટ કરેલ સંદર્ભ કોડ રાખવાથી. આ એક કોર્પોરેટ, અનન્ય જગ્યા છે; લોકો ફેંકે છે.
  • ધોરણનો ઉલ્લેખ નથી. જો ધોરણનો ઉલ્લેખ કરવામાં આવ્યો નથી, તો આઉટપુટ અવ્યવસ્થિત ડ્રાફ્ટ હશે જે સંસ્થામાં દાખલ કરી શકાશે નહીં.

સારાંશમાં

મેટાડેટા અને સૂચિ એ અદ્રશ્ય ઇન્ફ્રાસ્ટ્રક્ચર છે જે સંશોધક માટે આર્કાઇવ ખોલે છે, અને તેના માટે ઘણા પ્રયત્નોની જરૂર છે. ટ્રાંસ્ક્રિપ્શનમાંથી, AI તારીખ, વ્યક્તિ, સ્થળ, વિષય અને શૈલી જેવા ક્ષેત્રો માટે ઝડપી રૂપરેખા બનાવે છે; તે ISAD(G) અથવા ડબલિન કોર જેવા ધોરણો અનુસાર કામ કરી શકે છે. પરંતુ "સંપૂર્ણપણે ભરવા" માટેનું દબાણ એઆઈને વસ્તુઓ બનાવવા માટે દબાણ કરે છે; "ખાલી છોડો" પરવાનગી, નિયંત્રિત શબ્દભંડોળમાં મેપિંગ અને તારીખો/નામોની માનવીય પુષ્ટિ સૂચિને વિશ્વાસપાત્ર રાખે છે. AI ડ્રાફ્ટ તૈયાર કરે છે; તમે કેટલોગની ચોકસાઈ માટે જવાબદાર છો.

એપ્લિકેશન કાર્ય

દસ્તાવેજનું ટ્રાંસ્ક્રિપ્શન લો અને “ડબલિન કોર ડ્રાફ્ટ” ટેમ્પલેટ સાથે AI થી મેટાડેટાની વિનંતી કરો; ચકાસો કે તે ખાલી ક્ષેત્રો છોડે છે જે અસ્તિત્વમાં નથી. પછી તમારી પોતાની (અથવા નમૂના) ચેકલિસ્ટ સાથે "વિષય શબ્દ સૂચન" ટેમ્પલેટ ચલાવો. છેલ્લે, "બલ્ક સુસંગતતા તપાસ" સાથે થોડા રેકોર્ડ્સનું પરીક્ષણ કરો. નોંધ કરો કે AI આગાહી સાથે કેટલા ફીલ્ડને પોપ્યુલેટ કરવાનો પ્રયાસ કરે છે અને સૂચિમાં કેટલા વિષયના શબ્દોને મેપ કરવાની જરૂર છે.

ચેકલિસ્ટ

  • [ ] મેં સ્પષ્ટપણે લક્ષ્ય ધોરણ (ISAD(G)/Dublin Core) જણાવ્યું છે.
  • [ ] મેં "ખાલી જગ્યા ખાલી છોડો" પરવાનગી આપી.
  • [ ] મેં વિષયની શરતોને નિયંત્રિત સૂચિમાં મેપ કરી છે.
  • [ ] મેં દસ્તાવેજ/ઓથોરિટી રેકોર્ડ સાથે તારીખ અને વ્યક્તિના નામની ચકાસણી કરી છે.
  • [ ] મેં સંદર્ભ કોડ સંસ્થાને છોડી દીધો, AI ને નહીં.