નફો:
- સ્કેન કરેલા દસ્તાવેજોને OCR અને HTR વડે ટેક્સ્ટમાં કન્વર્ટ કરીને અને આઉટપુટને વાસ્તવિક ઈમેજ સાથે સરખાવીને સુધારવાની ક્ષમતા
- આર્કાઇવ દસ્તાવેજની મૌલિકતા અને અખંડિતતાને જાળવવાની ક્ષમતા અને AI ને સામગ્રી અને બનાવટી પુનઃસંગ્રહને બદલવાથી અટકાવે છે
- પ્રોવેન્સ માહિતી અને ટકાઉ ફોર્મેટ સાથે લાંબા ગાળાના ડિજિટલ સંરક્ષણની યોજના કરવાની ક્ષમતા
એક આર્કાઇવિસ્ટને પચાસ વર્ષ જૂના અખબારના વોલ્યુમો, હસ્તલિખિત પત્રો અથવા જૂના ફોટોગ્રાફ્સ ભવિષ્યમાં લઈ જવાનું કામ સોંપવામાં આવે છે. આ દસ્તાવેજો સમય જતાં ઘસાઈ જાય છે; બંનેને સાચવવા અને સુલભ બનાવવા માટે, ડિજિટાઇઝેશન કરવામાં આવે છે: ભૌતિક દસ્તાવેજને સ્કેન કરવાની અને તેને ડિજિટલ કૉપિમાં રૂપાંતરિત કરવાની ક્રિયા. પરંતુ એકલા સ્ક્રીનીંગ પૂરતું નથી; ડિજિટલ ઑબ્જેક્ટ લાંબા ગાળા માટે શોધી શકાય તેવું, વાંચી શકાય તેવું અને જાળવી શકાય તેવું હોવું જોઈએ. આ એકમમાં, તમે ડિજિટાઇઝેશન, ટ્રાન્સક્રિપ્શન અને ડિજિટલ પ્રિઝર્વેશન વર્કફ્લોમાં આર્ટિફિશિયલ ઇન્ટેલિજન્સનો ઉપયોગ કેવી રીતે કરવો તે શીખી શકશો; પરંતુ તમે શીખી શકશો કે તમે શા માટે મૌલિકતા અને ચોકસાઈની જવાબદારી નિભાવશો.
થોડા ખ્યાલો. OCR (ઓપ્ટિકલ કેરેક્ટર રેકગ્નિશન) એ એક તકનીક છે જે દસ્તાવેજની છબીમાંના ટેક્સ્ટને મશીન-સંપાદનયોગ્ય ટેક્સ્ટમાં રૂપાંતરિત કરે છે. HTR (હસ્તલિખિત ટેક્સ્ટ રેકગ્નિશન) હસ્તલિખિત દસ્તાવેજો માટે સમાન કાર્ય કરે છે અને તે વધુ મુશ્કેલ છે. ડિજિટલ જાળવણી એ સુનિશ્ચિત કરવાનો આયોજિત પ્રયાસ છે કે ડિજિટલ ઑબ્જેક્ટ દાયકાઓ સુધી વાંચવા યોગ્ય રહે, ભલે ફાઇલ ફોર્મેટ્સ અપ્રચલિત થઈ જાય અને સૉફ્ટવેર બદલાય. AI ત્રણેય ક્ષેત્રોમાં શક્તિશાળી પરંતુ ખામીયુક્ત સહાયક છે.
સ્ટેપ બાય સ્ટેપઃ ડિજિટાઈઝેશનથી પ્રિઝર્વેશન સુધી
1. પ્રાધાન્ય આપો. તમે એક જ સમયે બધું ડિજિટાઇઝ કરી શકતા નથી. સૌથી નાજુક, સૌથી વધુ વિનંતી કરાયેલ અને સૌથી અનોખા દસ્તાવેજો પ્રથમ મૂકવામાં આવે છે. આ એક ન્યાયિક નિર્ણય છે; AI યાદી સંપાદન કરવામાં મદદ કરે છે, પરંતુ સંસ્થા પ્રાથમિકતા નક્કી કરે છે.
2. સ્કેન કરો અને OCR/HTR લાગુ કરો. દસ્તાવેજને ઉચ્ચ રીઝોલ્યુશન પર સ્કેન કરો, પછી ટેક્સ્ટ કાઢવા માટે OCR અથવા HTR નો ઉપયોગ કરો. જૂના અને અઘરા લખાણો સાથે પણ AI-આધારિત ટૂલ્સ અહીં વધુને વધુ સારા થઈ રહ્યાં છે.
3. ટેક્સ્ટને ઠીક કરો અને ચકાસો. OCR/HTR આઉટપુટ ક્યારેય સંપૂર્ણ હોતું નથી. ભૂલો સામાન્ય છે, ખાસ કરીને જો ત્યાં જૂનું લખાણ, ડાઘવાળા પૃષ્ઠો અથવા હસ્તપ્રત હોય. વાસ્તવિક ઇમેજ સાથે આઉટપુટની તુલના કરવી અને તેને સુધારવું આવશ્યક છે.
4. મેટાડેટા અને સુરક્ષા માહિતી ઉમેરો. ડિજિટલ ઑબ્જેક્ટમાં તેનો ઉદ્ભવ, સ્કેનિંગ શરતો, ફોર્મેટ માહિતી અને ઉદ્ભવસ્થાન ઉમેરો — દસ્તાવેજ ક્યાંથી આવ્યો અને તેની પ્રક્રિયા કેવી રીતે કરવામાં આવી. આ માહિતી ભવિષ્યની ચકાસણી અને સુરક્ષા માટે મહત્વપૂર્ણ છે.
5. લાંબા ગાળાના રક્ષણ માટેની યોજના. ફાઇલ ફોર્મેટ્સ પસંદ કરો જે ખુલ્લા, સામાન્ય અને ટકાઉ હોય; બેક અપ; જો ફોર્મેટ અપ્રચલિત થઈ જાય તો સ્થળાંતર યોજના બનાવો.
ટીપ: OCR આઉટપુટને "ક્લીયર ટેક્સ્ટ" તરીકે સ્વીકારશો નહીં. જો શોધ પ્રણાલી આ લખાણ દ્વારા કામ કરતી હોય, તો ખોટી રીતે ઓળખાયેલા શબ્દો સ્ત્રોતને શોધી શકશે નહીં. નિર્ણાયક સંગ્રહો માટે, માનવ આંખમાં OCR આઉટપુટને સુધારવું એ તમામ અનુગામી ઍક્સેસની ગુણવત્તા નક્કી કરે છે.
ડિજિટલ ઑબ્જેક્ટની અધિકૃતતા અને અખંડિતતા
આર્કાઇવલ કાર્યના કેન્દ્રમાં અધિકૃતતા અને અખંડિતતા છે: ખાતરી કે દસ્તાવેજ ખરેખર દાવો કરાયેલા સ્ત્રોતમાંથી આવે છે અને તેની સામગ્રીમાં કોઈ ફેરફાર કરવામાં આવ્યો નથી. આ બિંદુએ, AI બે-પાંખીય ખતરો બનાવે છે. પ્રથમ, OCR/HTR સુધારણા અથવા "ઉન્નતીકરણ" દરમિયાન, AI ચુપચાપ ટેક્સ્ટને સંશોધિત કરી શકે છે; "સુધારણા" નામ હેઠળ અસ્તિત્વમાં ન હોય તેવો શબ્દ ઉમેરી શકે છે. બીજું, જો AI સાથે ઈમેજ "રિપેર" અથવા "રિસ્ટોરેશન" કરવામાં આવે, તો બિન-મૂળ વિગતો ઉત્પન્ન થઈ શકે છે.
આર્કાઇવિસ્ટનો નિયમ સ્પષ્ટ છે: ડિજિટલ સંરક્ષણ નકલ મૂળને વફાદાર હોવી જોઈએ. AI સાથે કરવામાં આવેલ દરેક સુધારણા દસ્તાવેજીકૃત હોવી જોઈએ અને વાસ્તવિક (કાચી) સ્કેન હંમેશા સાચવી રાખવી જોઈએ. દસ્તાવેજનું "સુંદરીકરણ" તેના ઐતિહાસિક પુરાવા મૂલ્યને નષ્ટ કરી શકે છે.
સાવધાન: AI સાથે જૂના ફોટો અથવા દસ્તાવેજને "સુધારવા" માટે તે આકર્ષિત થઈ શકે છે; પરંતુ AI ગુમ થયેલા ભાગોને મેકઅપ કરીને ભરે છે. આર્કાઇવલ દસ્તાવેજમાં, આનો અર્થ ખોટા ઐતિહાસિક પુરાવા બનાવવાનો થાય છે. પુનઃસંગ્રહ આઉટપુટ ક્યારેય મૂળ સ્ત્રોતને બદલે નથી; એક અલગ, સ્પષ્ટ રીતે લેબલ કરેલ વેરિઅન્ટ તરીકે સંગ્રહિત છે.
ત્રણ નાના કેસો
કેસ 1 - અખબારોના આર્કાઇવ્સ શોધવા યોગ્ય બન્યા. એક પુસ્તકાલયે સ્થાનિક અખબારોના તેના 30 વર્ષ જૂના સંગ્રહને ડિજિટાઇઝ કર્યું છે. OCR સાથે, 90,000 પૃષ્ઠો ટ્રાન્સક્રાઈબ કરવામાં આવ્યા હતા અને શોધવા યોગ્ય બનાવવામાં આવ્યા હતા; એક વિષય શોધ કે જેમાં પહેલા દિવસો લાગતા હતા તે હવે ઘટાડીને સેકન્ડ કરવામાં આવી છે. જો કે, ટીમે નોંધ્યું કે જૂના અને ડાઘવાળા પૃષ્ઠો પર OCR ચોકસાઈ ઘટીને 80% થઈ ગઈ અને માનવ આંખ સાથે ટોચના વર્ષોને સુધારવાને પ્રાથમિકતા આપી.
કેસ 2 — HTR એ હસ્તપ્રત ખોલી. 19મી સદીના વાંચવામાં અઘરા પત્રોના સંગ્રહ પર એક આર્કાઇવ HTR લાગુ કરે છે. નિષ્ણાતો દ્વારા વાંચનનાં મહિનાઓ અનુસાર સિસ્ટમે મહાન ગતિ પ્રાપ્ત કરી; પરંતુ પ્રિન્ટઆઉટના દરેક પૃષ્ઠની સરખામણી નિષ્ણાત પેલિયોગ્રાફર (પ્રાચીન લેખનના નિષ્ણાત) દ્વારા મૂળ સાથે કરવામાં આવી હતી, કારણ કે લોકો અને સ્થાનોના નામમાં ભૂલો હતી.
કેસ 3 — નકલી "પુનઃસ્થાપન" નકારવામાં આવ્યું. એક ટીમે AI સાથે ફાટેલા ઐતિહાસિક ફોટોગ્રાફને "રિપેરિંગ" કરવાનું વિચાર્યું. AI એ ખોવાયેલા ચહેરાના ભાગોને ફિટ કરીને પૂર્ણ કર્યા. આર્કાઇવિસ્ટને સમજાયું કે આ બનાવટી વિગતો ઐતિહાસિક પુરાવાઓને વિકૃત કરશે; રીપેર કરેલ ઇમેજ મૂળની સાથે અલગથી સંગ્રહિત કરવામાં આવી હતી, ફક્ત સ્પષ્ટપણે "AI ડેરિવેટિવ" લેબલવાળી.
ઍક્સેસ કૉપિ, પ્રિઝર્વેશન કૉપિ અને ફોર્મેટનો નિર્ણય
ડિજિટાઇઝેશનમાં સારી પ્રેક્ટિસ એ છે કે એક જ ઑબ્જેક્ટની નકલોને અલગ-અલગ હેતુઓ માટે અલગ કરવી. પ્રિઝર્વેશન માસ્ટર એ વાસ્તવિક ડિજિટલ ઑબ્જેક્ટ છે જે ભવિષ્યમાં લઈ જવામાં આવે છે, જે સર્વોચ્ચ રિઝોલ્યુશન, અનકમ્પ્રેસ્ડ અથવા લોસલેસ ફોર્મેટમાં સંગ્રહિત થાય છે; તેને ભાગ્યે જ સ્પર્શવામાં આવે છે. એક્સેસ કોપી એ એક નાનું, સહેલાઈથી ખોલવામાં આવતું વેરિઅન્ટ છે જે વપરાશકર્તાને પ્રસ્તુત કરવામાં આવે છે. આ તફાવત મહત્વપૂર્ણ છે કારણ કે ઉપયોગ માટે વ્યવહારુ ફોર્મેટ (નાનું, સંકુચિત) લાંબા ગાળાના સંરક્ષણ માટે યોગ્ય ન હોઈ શકે; જાળવણી માટેનું આદર્શ ફોર્મેટ (મોટા, નુકશાન વિનાનું) દૈનિક ઉપયોગ માટે બોજારૂપ છે. આ વર્કફ્લોમાં, AI ફાઈલોની ઈન્વેન્ટરી કરવામાં, ગુમ થયેલ વેરિઅન્ટ શોધવામાં અને મેટાડેટાને બે નકલો વચ્ચે સુસંગત રાખવામાં મદદ કરી શકે છે. જો કે, ફોર્મેટની પસંદગી એ જાળવણીનો નિર્ણય છે: ખુલ્લા, વ્યાપકપણે દસ્તાવેજીકૃત અને ટકાઉ ફોર્મેટને પ્રાધાન્ય આપવું જોઈએ (માલિકીના, બંધ ફોર્મેટને બદલે), અને જો ફોર્મેટ સમય જતાં અપ્રચલિત થઈ જાય તો સ્થળાંતર યોજના તૈયાર રાખવી જોઈએ. જો AI ફોર્મેટ સૂચવે છે, તો પણ સંસ્થાની લાંબા ગાળાની જાળવણી નીતિ અંતિમ કહે છે.
ટીપ: દરેક ડિજિટલ ઑબ્જેક્ટ માટે, સંક્ષિપ્ત રેકોર્ડ રાખો કે જે પ્રશ્નોના જવાબ આપે છે "મૂળ સ્ત્રોત ક્યાં છે, સાચવણીની નકલ કયા ફોર્મેટમાં છે, એક્સેસ કોપી કયા ફોર્મેટમાં છે અને જે વપરાશકર્તાને ઉપલબ્ધ કરાવવામાં આવે છે?" આ ત્રણ સ્તરોને મિશ્રિત કરવાથી તે અસ્પષ્ટ થાય છે કે કઈ ફાઇલ આગળ જતા વિશ્વસનીય માસ્ટર છે.
ચાર નકલ કરી શકાય તેવા નમૂનાઓ
1) OCR આઉટપુટ કરેક્શન મદદ:
નીચે એક OCR ટેક્સ્ટ અને વાસ્તવિક પૃષ્ઠનું વર્ણન છે. ફક્ત ઓપનઓસીઆર ભૂલો (ખરાબ અક્ષરો, સંયોજન/વિભાજિત શબ્દો) ઠીક કરો. સામગ્રીમાં ફેરફાર કરશો નહીં, શબ્દો ઉમેરો અથવા દૂર કરશો નહીં. જો તમને ખાતરી ન હોય, તો "[?]" વડે ચિહ્નિત કરો. OCR ટેક્સ્ટ: [અહીં]
2) ટેક્સ્ટ-ઇમેજ સુસંગતતા તપાસો:
શું નીચેના સુધારેલા લખાણમાં એવા કોઈ વધારા છે કે જે મૂળ દસ્તાવેજમાં હોવાની અપેક્ષા ન હતી (જે બનેલી હશે)? દરેક શંકાસ્પદ ભાગને ચિહ્નિત કરો અને તે શા માટે શંકાસ્પદ છે તે લખો. ટેક્સ્ટ: [અહીં]
3) પ્રોટેક્શન મેટાડેટા ડ્રાફ્ટ:
નીચેના ડિજિટાઇઝ્ડ ઑબ્જેક્ટ માટે સંરક્ષણ મેટાડેટા રૂપરેખા જનરેટ કરો: સ્ત્રોત, ઉત્પત્તિ, સ્કેન તારીખ/રીઝોલ્યુશન, ફાઇલ ફોર્મેટ, ટ્રાન્ઝેક્શન ઇતિહાસ. ફક્ત મેં આપેલી માહિતીનો ઉપયોગ કરો, ગુમ થયેલ ફીલ્ડને ખાલી છોડી દો. માહિતી: [અહીં]
4) પ્રાથમિકતા સહાય:
નીચે ડિજિટાઇઝેશનની રાહ જોઈ રહેલા સંગ્રહોની સૂચિ છે; નાજુકતા, માંગ અને વિશિષ્ટતાના આધારે પ્રાથમિકતા આપવામાં સહાય કરો. દરેક સંસાધન માટે સંક્ષિપ્ત સમર્થન આપો; અંતિમ નિર્ણય મારા પર છોડો. યાદી: [અહીં]
નબળા પ્રોમ્પ્ટ / મજબૂત પ્રોમ્પ્ટ
નબળા પ્રોમ્પ્ટ:
આ સ્કેન કરેલ ટેક્સ્ટને યોગ્ય અને સુંદર બનાવો.
“સુશોભિત” એ AI ને સામગ્રી બદલવા, ભૂલો ભરવા માટે આમંત્રણ આપે છે; આર્કાઇવ દસ્તાવેજની મૌલિકતાને નુકસાન થયું છે.
શક્તિશાળી પ્રોમ્પ્ટ:
તમારી ભૂમિકા: ડિજિટાઇઝેશન એડિટર સહાયક. નીચેના OCR ટેક્સ્ટમાં, ફક્ત સ્પષ્ટ ઓળખની ભૂલો (ખરાબ અક્ષર, ખોટી રીતે વિભાજિત શબ્દ) ઠીક કરો. કોઈપણ શબ્દો ઉમેરશો નહીં, દૂર કરશો નહીં અથવા બદલશો નહીં. જ્યાં તમને ખાતરી ન હોય ત્યાં "[?]" છોડો. તમે કરેલા દરેક સુધારાને અલગ યાદીમાં બતાવો. ટેક્સ્ટ: [અહીં]
શક્તિશાળી પ્રોમ્પ્ટ એઆઈને માત્ર ભૂલોને ઓળખવા સુધી મર્યાદિત કરે છે, તેને સામગ્રીને સ્પર્શવાથી પ્રતિબંધિત કરે છે અને સુધારાને શોધી શકાય તેવું બનાવે છે.
વર્કફ્લો અને જોખમ ટેબલ
સ્ટેજ
AIનું યોગદાન
મુખ્ય જોખમ
રક્ષણ માપ
સ્કેન
-
નબળી ગુણવત્તા
ઉચ્ચ રીઝોલ્યુશન
OCR/HTR
ટેક્સ્ટમાં કન્વર્ટ કરો
ઓળખની ભૂલો
માનવ સુધારણા
કરેક્શન
ભૂલ સૂચન
સામગ્રી બદલવી
મૂળ સાથે સરખામણી
પુનઃસંગ્રહ
છબી વ્યુત્પન્ન
ફિટિંગ વિગતો
કાચો મૂળ રાખો, તેને લેબલ કરો
રક્ષણ
મેટાડેટા ડ્રાફ્ટ
મૂળની ખોટ
ઉત્પત્તિ રેકોર્ડ
સામાન્ય ભૂલો
- કરેક્શન વિના OCR આઉટપુટ સ્વીકારવું. ભૂલો શોધ અને ઍક્સેસને અવરોધે છે.
- AIને "સુંદર બનાવો" કહે છે. તે સામગ્રીમાં ફેરફાર કરે છે અને મૌલિકતાને નષ્ટ કરે છે.
- વાસ્તવિક પુરાવા માટે AI પુનઃસ્થાપનને બદલીને. બનાવટી વિગતો ખોટો ઇતિહાસ બનાવે છે.
- કાચું સ્કેન સંગ્રહિત કરતું નથી. મૂળ વગર કોઈ સુધારણા ચકાસી શકાતી નથી.
- ઉત્પત્તિ માહિતી અવગણવી. દસ્તાવેજની વિશ્વસનીયતા શોધી શકાતી નથી.
સારાંશમાં
ડિજિટલ આર્કાઇવ્સ અને ડિજિટાઇઝેશનમાં AI; તે એક મૂલ્યવાન સહાય છે જે OCR/HTR ટ્રાન્સક્રિપ્શન, મેટાડેટા ડ્રાફ્ટિંગ અને પ્રાથમિકતાને ઝડપી બનાવે છે. પરંતુ આર્કાઇવલ વર્કનો સાર એ અધિકૃતતા અને અખંડિતતા છે: OCR આઉટપુટ માનવ આંખ દ્વારા સુધારવું જોઈએ, AI એ ક્યારેય ચુપચાપ સામગ્રીને બદલવી જોઈએ નહીં, રિસ્ટોરેશન ડેરિવેટિવ્સે મૂળ પુરાવાને બદલવું જોઈએ નહીં, અને કાચી સ્કેનિંગ અને પ્રોવેન્સ માહિતી હંમેશા સાચવવી જોઈએ. AI નો એક સાધન તરીકે ઉપયોગ કરો કે જે દસ્તાવેજને "સુધારો" કરતું નથી, પરંતુ તેના પર સાચા રહીને તેને ઍક્સેસિબલ બનાવે છે.
એપ્લિકેશન કાર્ય
OCR આઉટપુટનો ટૂંકો નમૂનો મેળવો (કાં તો તમારું પોતાનું ઉત્પાદન અથવા વાસ્તવિક સ્કેનમાંથી). "OCR આઉટપુટ કરેક્શન હેલ્પ" ટેમ્પલેટ વડે માત્ર ઓળખની ભૂલો જ સુધારી લો, પછી તપાસો કે AI એ "ટેક્સ્ટ-ઇમેજ સુસંગતતા તપાસ" ટેમ્પલેટ સાથે સામગ્રી ઉમેર્યું છે કે કેમ. પછી "પ્રિઝર્વેશન મેટાડેટા ડ્રાફ્ટ" ટેમ્પલેટ સાથે ઑબ્જેક્ટ માટે ઉત્પત્તિ અને ફોર્મેટ માહિતી સાથે રેકોર્ડ બનાવો.
ચેકલિસ્ટ
- [ ] મેં OCR/HTR આઉટપુટની વાસ્તવિક છબી સાથે સરખામણી કરી અને તેને સુધારી.
- [ ] મેં તપાસ કરી છે કે AI સામગ્રી ઉમેરતું/બદલતું નથી.
- [ ] મેં કાચું (માસ્ટર) સ્કેન અલગથી અને યથાવત રાખ્યું છે.
- [ ] મેં મેટાડેટામાં ઉત્પત્તિ અને ફોર્મેટ માહિતી ઉમેરી છે.
- [ ] મેં રિસ્ટોરેશન વેરિઅન્ટ્સને સ્પષ્ટપણે "AI ડેરિવેટિવ" તરીકે લેબલ કર્યું છે.