એકમો
1. ઇતિહાસ અને આર્કાઇવિંગમાં કૃત્રિમ બુદ્ધિનો પરિચય: ભૂમિકાઓ, સીમાઓ, માન્યતા અને નીતિશાસ્ત્ર 2. દસ્તાવેજ ડિજિટાઇઝેશન અને OCR: પ્રિન્ટેડ ટેક્સ્ટને મશીન ટેક્સ્ટમાં કન્વર્ટ કરવું 3. ટ્રાન્સક્રિપ્શન: ઓટ્ટોમન ટર્કિશ અને હસ્તપ્રતો 4. મેટાડેટા, સૂચિ અને વર્ગીકરણ 5. સ્ત્રોત સ્કેનિંગ, ડિસ્કવરી અને સારાંશ 6. ઐતિહાસિક અનુવાદ અને સરળીકરણ 7. સ્ત્રોત ચકાસણી, એનાક્રોનિઝમ અને આભાસ 8. સામગ્રી વિશ્લેષણ અને પેટર્ન શોધ 9. આર્કાઇવ ઍક્સેસ, વર્ણન અને વપરાશકર્તા સેવાઓ 10. જાળવણી, પુનઃસ્થાપન અને ડિજિટલ સંરક્ષણ 11. નૈતિકતા, કોપીરાઈટ, ગોપનીયતા અને સાંસ્કૃતિક સંવેદનશીલતા 12. એન્ડ-ટુ-એન્ડ પ્રોજેક્ટ: આર્ટિફિશિયલ ઇન્ટેલિજન્સ સાથે આર્કાઇવ કલેક્શનની પ્રક્રિયા કરવી
એકમ 2 / 12

દસ્તાવેજ ડિજિટાઇઝેશન અને OCR: પ્રિન્ટેડ ટેક્સ્ટને મશીન ટેક્સ્ટમાં કન્વર્ટ કરવું

નફો:

  • ડિજિટાઇઝેશન અને OCR વર્કફ્લો (સ્કેનિંગ, પ્રી-પ્રોસેસિંગ, માન્યતા, કરેક્શન, વેરિફિકેશન) સ્ટેપ બાય સ્ટેપ સેટ કરવાની ક્ષમતા
  • સુધારણા અને પુનઃલેખન લાઇન અને [?] સાથે અસ્પષ્ટતાને ચિહ્નિત કરતી વખતે સંદર્ભ સાથે OCR ભૂલોને સુધારવા માટે AI નો ઉપયોગ કરવાની ક્ષમતા
  • શા માટે નંબરો, તારીખો અને યોગ્ય નામો દૃષ્ટિની રીતે ચકાસવા જોઈએ અને ગુણવત્તા નિયંત્રણની ભૂમિકા સમજો.

આર્કાઇવ અથવા લાઇબ્રેરીના ભૌતિક છાજલીઓ પરના લાખો પૃષ્ઠો સંશોધક માટે માત્ર ત્યારે જ ખોલવામાં આવે છે જ્યારે તેઓ ડિજિટાઇઝ્ડ અને શોધી શકાય તેવું બને છે. ડિજિટાઇઝેશન એ ભૌતિક દસ્તાવેજને સ્કેન કરીને અથવા ફોટોગ્રાફ કરીને તેને ડિજિટલ ઇમેજમાં રૂપાંતરિત કરે છે. પરંતુ પૃષ્ઠનો ફોટોગ્રાફ હજી "ટેક્સ્ટ" નથી; કમ્પ્યુટર પર તે હજી પણ એક છબી છે, તમે તેમાં શોધી શકતા નથી. આ તે છે જ્યાં OCR અમલમાં આવે છે.

OCR (ઓપ્ટિકલ કેરેક્ટર રેકગ્નિશન) એક એવી તકનીક છે જે દસ્તાવેજની છબીમાં છાપેલા અક્ષરોને ઓળખે છે અને તેમને મશીન દ્વારા વાંચી શકાય તેવા, શોધી શકાય તેવા ટેક્સ્ટમાં રૂપાંતરિત કરે છે. આ એકમમાં, તમે શીખી શકશો કે ઐતિહાસિક મુદ્રિત દસ્તાવેજોને OCR સાથે કેવી રીતે ડિજિટાઇઝ કરવું, AI આ પ્રક્રિયામાં OCR ભૂલોને સુધારવામાં કેવી રીતે મદદ કરે છે અને માનવ આંખ ક્યાં જરૂરી છે. (હસ્તલિખિત ગ્રંથોને અલગ તકનીકની જરૂર છે; અમે તેને આગામી એકમમાં આવરી લઈશું.)

ડિજિટાઇઝેશન વર્કફ્લો: સ્ટેપ બાય સ્ટેપ

1. તૈયારી અને સ્ક્રીનીંગ. દસ્તાવેજને શક્ય તેટલી ઉચ્ચ ગુણવત્તા પર સ્કેન કરો. ઐતિહાસિક સંશોધન માટે અંગૂઠાનો સામાન્ય નિયમ ઓછામાં ઓછો 300-400 DPI (ડોટ્સ પ્રતિ ઇંચ)નો રિઝોલ્યુશન છે. નીચું રીઝોલ્યુશન અનુગામી OCR તબક્કામાં ભૂલના દરને વધારે છે.

2. ઇમેજ પ્રીપ્રોસેસિંગ. OCR પહેલા ઇમેજને સુધારવાથી સફળતામાં ઘણો વધારો થાય છે: સ્કેન કરેલા પેજને ડિસ્ક્યુ કરવા, ખામીઓ દૂર કરવી, કોન્ટ્રાસ્ટ વધારવો, બ્લેક એન્ડ વ્હાઇટમાં કન્વર્ટ કરવું. આધુનિક AI-આધારિત સાધનો આ પગલાને સ્વચાલિત કરી શકે છે.

3. OCR એપ્લિકેશન. તમે છબીને OCR એન્જિનમાં ફીડ કરો છો; એન્જિન અક્ષરોને ઓળખે છે અને ટેક્સ્ટનું ઉત્પાદન કરે છે. આઉટપુટમાં સામાન્ય રીતે બે સ્તરો હોય છે: દૃશ્યમાન દસ્તાવેજની છબી અને નીચે "શોધી શકાય તેવું છુપાયેલ લખાણ સ્તર".

4. કરેક્શન (પોસ્ટ કરેક્શન). કાચો OCR આઉટપુટ ક્યારેય સંપૂર્ણ નથી. જૂના ફોન્ટ્સ, પીળા કાગળ, શાહી સ્મીયરિંગ અને સ્કેનિંગ ભૂલોને કારણે અક્ષરો ખોટી રીતે વાંચવામાં આવે છે. આ તે છે જ્યાં AI એક શક્તિશાળી સહાયક છે: તે સંદર્ભનો ઉપયોગ કરીને OCR ભૂલો સૂચવે છે અને સુધારે છે.

5. ચકાસણી અને ગુણવત્તા નિયંત્રણ. સુધારેલ ટેક્સ્ટને માનવ દ્વારા નમૂનાના આધારે અથવા સંપૂર્ણ રીતે તપાસવામાં આવે છે. ખાસ કરીને નિર્ણાયક ક્ષેત્રો જેમ કે નામ, તારીખો અને સંખ્યાઓ દૃષ્ટિની રીતે ચકાસવામાં આવશ્યક છે.

શા માટે OCR ભૂલો કરે છે, AI કેવી રીતે મદદ કરે છે

સામાન્ય સમસ્યાઓ જે ઐતિહાસિક દસ્તાવેજોમાં OCR ને પડકારે છે: જૂના અને ફેન્સી ફોન્ટ્સ, અપ્રચલિત અક્ષર સ્વરૂપો જેમ કે લાંબા "s" (ſ), બે-કૉલમ પૃષ્ઠ લેઆઉટ, ફૂટનોટ્સ, હસ્તલિખિત દાખલ, સીલ અને ઝાંખી શાહી. કારણ કે OCR એન્જિન એક પછી એક અક્ષરો "જુએ છે", તે વારંવાર દ્વિસંગી "rn" ને "m" તરીકે, અક્ષર "l" ને "1" તરીકે અને અક્ષર "O" ને "0" તરીકે મૂંઝવે છે.

AI ભાષાના મોડલ અહીં એક અલગ શક્તિ પ્રદાન કરે છે: તેઓ સંદર્ભ સમજે છે. જો OCR એન્જિન "1stanbu1" લખે છે, તો AI સંદર્ભ પરથી અનુમાન લગાવી શકે છે કે તે "ઇસ્તાંબુલ" હોવું જોઈએ. પરંતુ અહીં એક મોટો ભય છે: જ્યારે "સુધારવું" ત્યારે AI ટેક્સ્ટને પણ બદલી શકે છે. તે અસ્તિત્વમાં ન હોય તેવા શબ્દ "મેં સુધારેલ" ઉમેરી શકે છે અથવા તેના પોતાના અનુમાનથી અસ્પષ્ટ સ્થાન ભરી શકે છે. આ ટ્રાન્સક્રિપ્શનની વફાદારીને ખલેલ પહોંચાડે છે.

સાવધાન: OCR કરેક્શનમાં સુવર્ણ નિયમ આ છે: AI એ માત્ર સ્પષ્ટ ઓળખની ભૂલો સુધારવી જોઈએ, ટેક્સ્ટની સામગ્રીનું અર્થઘટન અથવા પૂરક બનાવવું જોઈએ નહીં. "1stanbu1 → Istanbul" કાયદેસર છે; તે અનુમાન સાથે વાંચી ન શકાય તેવા શબ્દને ભરવા વિશે નથી. અનિશ્ચિત સ્થાનો [?] વડે ચિહ્નિત કરવા જોઈએ અને બનેલા ન હોવા જોઈએ.

OCR ભૂલના પ્રકારો અને કોષ્ટક સાથેનો અભિગમ

ભૂલનો પ્રકાર

ઉદાહરણ

શું AI તેને ઠીક કરી શકે છે?

માનવ નિયંત્રણ

પાત્ર મિશ્રણ

rn↔m, l↔1, O↔0

હા, તે સલામત છે

નમૂના

જૂનું લેટરફોર્મ

લાંબી ſ → સે

હા, તે સલામત છે

નમૂના

ઝાંખો/વાંચી ન શકાય એવો શબ્દ

"કા___ન"

ના, મૂકવો જોઈએ [?]

ફરજિયાત

યોગ્ય નામ/સ્થળનું નામ

"કોન્સ્ટેન્ટિનીયે"

સાવચેત

ફરજિયાત

નંબર/તારીખ

"1867" વિ "1857"

જોખમી

ફરજિયાત

પૃષ્ઠ લેઆઉટ (કૉલમ/ફૂટનોટ)

મિશ્ર પ્રવાહ

આંશિક રીતે

ફરજિયાત

એક વાક્યમાં ચિત્રનો સારાંશ આપવા માટે: AI વિશ્વસનીય રીતે સામાન્ય પાત્રની ભૂલોને સાફ કરે છે; પરંતુ ખાસ નામો, સંખ્યાઓ, તારીખો અને વાંચી ન શકાય તેવા સ્થળો માટે માનવ આંખો જરૂરી છે.

ત્રણ નાના કેસો

કેસ 1 - અખબારોના આર્કાઇવ્સ શોધવા યોગ્ય બન્યા. યુનિવર્સિટીની લાઇબ્રેરીએ 1930ના દાયકાથી સ્થાનિક અખબારોના 12,000 પાનાનું ડિજિટાઇઝેશન કર્યું છે. કાચો OCR ચોકસાઈ અંદાજિત 82% હતી (દર 100 માંથી 18 અક્ષરો ખોટા હતા). AI-આધારિત કરેક્શને અખબારની ભાષા-યોગ્ય શબ્દકોશ અને સંદર્ભ સાથે ચોકસાઈ વધારીને 96% કરી. બાકીની ભૂલો માટે, સંપૂર્ણ લખાણને બદલે નમૂનાની તપાસ કરવામાં આવી હતી; સંગ્રહ 3 અઠવાડિયામાં શોધી શકાય તેવું બન્યું.

કેસ 2 - AI "સુધારેલ" અને વિકૃત ઇતિહાસ. એક આર્કાઇવિસ્ટે OCR પ્રિન્ટઆઉટ પર AIની તારીખ "1863" સુધારી હતી. સંદર્ભમાં બીજી ઘટના જોઈને AI એ તારીખને "સુધારો" કરીને "1868" કરી દીધી — દસ્તાવેજમાં સ્પષ્ટપણે 1863 કહ્યું હોવા છતાં. જો આર્કાઇવિસ્ટે મૂળ છબી ન જોઈ હોત, તો સૂચિ ખોટી તારીખ સાથે દાખલ થઈ હોત. પાઠ: નંબરો અને તારીખો ક્યારેય AI પર છોડવામાં આવતી નથી, તે છબી સાથે ચકાસવામાં આવે છે.

કેસ 3 — બે-કૉલમ પૃષ્ઠ મૂંઝવણમાં છે. 19મી સદીની યરબુકના બે-કૉલમ પૃષ્ઠોને OCRમાં એક જ પ્રવાહમાં મિશ્રિત કરવામાં આવ્યા હતા અને વાક્યો એકબીજા સાથે જોડાયેલા હતા. કાચું આઉટપુટ વાંચી ન શકાય તેવું હતું. જ્યારે મેં પૃષ્ઠ લેઆઉટને પ્રથમ પ્રદેશો (વિભાજન) માં વિભાજિત કર્યું અને દરેક કૉલમ પર અલગથી પ્રક્રિયા કરી ત્યારે ટેક્સ્ટમાં સુધારો થયો. પાઠ: જટિલ પૃષ્ઠ લેઆઉટમાં, રચના પ્રથમ, ટેક્સ્ટ સેકન્ડ.

ચાર નકલ કરી શકાય તેવા નમૂનાઓ

1) સુરક્ષિત OCR કરેક્શન:

નીચે એક ઐતિહાસિક દસ્તાવેજનું કાચું OCR આઉટપુટ છે. તમારું કાર્ય ફક્ત સ્પષ્ટ ઓપ્ટિકલ રેકગ્નિશન ભૂલોને સુધારવાનું છે (દા.ત. rn→m,1→l, 0→O, long ſ→s). નિયમો: (1) લખાણના અર્થનું અર્થઘટન કરો. (2) વાંચી ન શકાય તેવા/અસ્પષ્ટ શબ્દોને ઠીક કરો, જેમ છે તેમ છોડી દો અને [?] વડે ચિહ્નિત કરો. (3) વાક્યો ઉમેરવા, દૂર કરવા અથવા પૂર્ણ કરવા માટે નહીં. (4) નંબરો અને તારીખો બદલો; જો શંકા હોય તો [નંબર?] માર્ક કરો. કાચો OCR: [અહીં]

2) OCR ગુણવત્તા અહેવાલ:

નીચે આપેલા OCR આઉટપુટની તપાસ કરો અને ગુણવત્તા અહેવાલ બનાવો: (1) સંભવિત ઓળખની ભૂલોવાળા શબ્દોની સૂચિ બનાવો, (2) વાંચી ન શકાય તેવા/અસ્પષ્ટ દેખાતા વિસ્તારોને ચિહ્નિત કરો, (3) ચોક્કસ નામો, તારીખો અને સંખ્યાઓની સૂચિ બનાવો કે જેને માનવ તપાસની જરૂર છે. સુધારશો નહીં; ફક્ત ચેકલિસ્ટ જનરેટ કરો. ટેક્સ્ટ: [અહીં]

3) કૉલમ/સ્ટ્રક્ચર પાર્સિંગ મદદ:

કારણ કે નીચે આપેલ OCR ટેક્સ્ટ બે-કૉલમ પૃષ્ઠમાંથી આવે છે, પ્રવાહ મૂંઝવણમાં હોઈ શકે છે. ટેક્સ્ટને લોજિકલ ફકરાઓમાં ફરીથી ગોઠવો પરંતુ કોઈપણ શબ્દો બદલો, ઉમેરો કે કાઢી નાખો નહીં. ફક્ત ક્રમમાં સુધારો. તમને [ઓર્ડર?] સાથે ખાતરી ન હોય તેવા ઓર્ડરને માર્ક કરો. ટેક્સ્ટ: [અહીં]

4) પ્રમાણભૂત ભાષામાં સામાન્યીકરણ (વૈકલ્પિક, અલગ સ્તર):

આજની જોડણીમાં, એક અલગ કૉલમમાં, નીચે સુધારેલ ઐતિહાસિક લખાણની ઉપર, એક સરળ વાંચન સંસ્કરણ બનાવો. મૂળ ટેક્સ્ટને ક્યારેય બદલશો નહીં; સરળીકરણને એક અલગ સ્તર બનવા દો. અર્થ ઉમેર્યા વિના ફક્ત જોડણી/ઉચ્ચાર અપડેટ કરો. મૂળ: [અહીં]

નબળા પ્રોમ્પ્ટ / મજબૂત પ્રોમ્પ્ટ

નબળા:

આ OCR ટેક્સ્ટને ઠીક કરો અને સુંદર બનાવો.

"સુશોભિત કરો" એઆઈને ટેક્સ્ટને ફરીથી લખવા, ભૂલો કરવા અને સામગ્રીનું અર્થઘટન કરવાની મંજૂરી આપે છે; વફાદારી તોડે છે.

મજબૂત:

આ કાચા OCR આઉટપુટમાં ફક્ત ઓપ્ટિકલ ઓળખની ભૂલોને ઠીક કરો. અર્થનું અર્થઘટન ન કરો, શબ્દો ઉમેરો/કાઢી નાખો, [?] સાથે વાંચી ન શકાય તેવા ભાગો છોડો, નંબરો અને તારીખો બદલો. તમે કરો છો તે દરેક કરેક્શનને "મૂળ → કરેક્શન" ફોર્મેટમાં અલગ સૂચિમાં બતાવો જેથી હું તેને ચકાસી શકું. ટેક્સ્ટ: [અહીં]

તફાવત: બાઉન્ડેડ ડ્યુટી, ફેબ્રિકેશન પર પ્રતિબંધ, ચિહ્નિત અસ્પષ્ટતા અને સુધારાઓની શોધી શકાય તેવી સૂચિ આઉટપુટને ઓડિટેબલ બનાવે છે.

સામાન્ય ભૂલો

  • ઓછા રિઝોલ્યુશન પર સ્કેનિંગ. મોટાભાગની OCR ભૂલો ખરાબ છબીઓને કારણે થાય છે; ગુણવત્તાયુક્ત સ્કેનિંગ એ સૌથી સસ્તું રોકાણ છે.
  • AIને "સુંદર બનાવો" કહે છે. આ વફાદારીને બદલે અસ્ખલિતતા પેદા કરે છે; દસ્તાવેજ ફરીથી લખવામાં આવે છે.
  • નંબરો અને તારીખોને AI પર છોડીને. જ્યારે સંદર્ભમાંથી "સુધારો" કરવામાં આવે ત્યારે આ ચૂપચાપ દૂષિત થાય છે; છબી દ્વારા ચકાસાયેલ હોવું જ જોઈએ.
  • અનુમાન સાથે વાંચી ન શકાય તેવી જગ્યા ભરવી. તે અનિશ્ચિતતા [?] દ્વારા સુરક્ષિત હોવું જોઈએ, બનેલું નથી.
  • નમૂના લેવાને બદલે બિલકુલ નિયંત્રણમાં નથી. 96% ચોકસાઈનો પણ અર્થ છે 12,000 પૃષ્ઠોમાં હજારો ભૂલો; જટિલ વિસ્તારો સ્કેન કરવામાં આવે છે.

સારાંશમાં

OCR પ્રિન્ટેડ ઐતિહાસિક દસ્તાવેજોને શોધી શકાય તેવા ટેક્સ્ટમાં રૂપાંતરિત કરીને સંશોધકો માટે આર્કાઇવ્સ ખોલે છે. AI એ સંદર્ભ સાથે કાચા OCR આઉટપુટમાં પાત્રની ભૂલોને સુધારવામાં એક શક્તિશાળી સહાય છે; પરંતુ તમારે સંપાદન અને પુનઃલેખન વચ્ચેની રેખા દોરવી જોઈએ. ઉચ્ચ-ગુણવત્તાવાળી સ્કેનિંગ, સલામત સુધારણા સૂચના, [?] સાથે અસ્પષ્ટતાની જાળવણી, અને નામ/તારીખ/નંબરોની માનવ-આંખની ચકાસણી ડિજિટાઇઝેશનને ઝડપી અને ભરોસાપાત્ર બનાવે છે. AI ટેક્સ્ટને સાફ કરે છે; તમે વફાદારીના રક્ષક છો.

એપ્લિકેશન કાર્ય

મુદ્રિત ઐતિહાસિક દસ્તાવેજ (જૂનું અખબાર, સત્તાવાર પત્ર, પુસ્તક પૃષ્ઠ) સ્કેન કરો અથવા OCR પ્રિન્ટઆઉટ લો. "સિક્યોર OCR કરેક્શન" ટેમ્પલેટ વડે ટેક્સ્ટને ઠીક કરો અને "મૂળ → કરેક્શન" સૂચિ દ્વારા સુધારાની વિનંતી કરો. તે પછી, "OCR ગુણવત્તા અહેવાલ" સાથે માનવ નિયંત્રણની જરૂર હોય તેવા વિસ્તારોને દૂર કરો. સૂચિમાંની દરેક તારીખ અને યોગ્ય નામની વાસ્તવિક છબી સાથે સરખામણી કરો; નોંધ કરો કે કેટલાને ખોટી રીતે "સુધાર્યા" હતા.

ચેકલિસ્ટ

  • [ ] મેં દસ્તાવેજને ઓછામાં ઓછા 300 DPI અને સારા કોન્ટ્રાસ્ટ સાથે સ્કેન કર્યો છે.
  • [ ] મેં ફક્ત AI ને ઓપ્ટિકલ ભૂલ સુધારણા માટે પૂછ્યું હતું, ફરીથી લખવા માટે નહીં.
  • [ ] મેં વાંચી ન શકાય તેવા ભાગોને [?] વડે સુરક્ષિત કર્યા.
  • [ ] મેં ઈમેજ સાથે તમામ નંબરો, તારીખો અને યોગ્ય નામોની ચકાસણી કરી છે.
  • [ ] મેં નિર્ણાયક વિસ્તારોમાં નમૂના અથવા સંપૂર્ણ તપાસ કરી.