નફો:
- ડિજિટાઇઝેશન અને OCR વર્કફ્લો (સ્કેનિંગ, પ્રી-પ્રોસેસિંગ, માન્યતા, કરેક્શન, વેરિફિકેશન) સ્ટેપ બાય સ્ટેપ સેટ કરવાની ક્ષમતા
- સુધારણા અને પુનઃલેખન લાઇન અને [?] સાથે અસ્પષ્ટતાને ચિહ્નિત કરતી વખતે સંદર્ભ સાથે OCR ભૂલોને સુધારવા માટે AI નો ઉપયોગ કરવાની ક્ષમતા
- શા માટે નંબરો, તારીખો અને યોગ્ય નામો દૃષ્ટિની રીતે ચકાસવા જોઈએ અને ગુણવત્તા નિયંત્રણની ભૂમિકા સમજો.
આર્કાઇવ અથવા લાઇબ્રેરીના ભૌતિક છાજલીઓ પરના લાખો પૃષ્ઠો સંશોધક માટે માત્ર ત્યારે જ ખોલવામાં આવે છે જ્યારે તેઓ ડિજિટાઇઝ્ડ અને શોધી શકાય તેવું બને છે. ડિજિટાઇઝેશન એ ભૌતિક દસ્તાવેજને સ્કેન કરીને અથવા ફોટોગ્રાફ કરીને તેને ડિજિટલ ઇમેજમાં રૂપાંતરિત કરે છે. પરંતુ પૃષ્ઠનો ફોટોગ્રાફ હજી "ટેક્સ્ટ" નથી; કમ્પ્યુટર પર તે હજી પણ એક છબી છે, તમે તેમાં શોધી શકતા નથી. આ તે છે જ્યાં OCR અમલમાં આવે છે.
OCR (ઓપ્ટિકલ કેરેક્ટર રેકગ્નિશન) એક એવી તકનીક છે જે દસ્તાવેજની છબીમાં છાપેલા અક્ષરોને ઓળખે છે અને તેમને મશીન દ્વારા વાંચી શકાય તેવા, શોધી શકાય તેવા ટેક્સ્ટમાં રૂપાંતરિત કરે છે. આ એકમમાં, તમે શીખી શકશો કે ઐતિહાસિક મુદ્રિત દસ્તાવેજોને OCR સાથે કેવી રીતે ડિજિટાઇઝ કરવું, AI આ પ્રક્રિયામાં OCR ભૂલોને સુધારવામાં કેવી રીતે મદદ કરે છે અને માનવ આંખ ક્યાં જરૂરી છે. (હસ્તલિખિત ગ્રંથોને અલગ તકનીકની જરૂર છે; અમે તેને આગામી એકમમાં આવરી લઈશું.)
ડિજિટાઇઝેશન વર્કફ્લો: સ્ટેપ બાય સ્ટેપ
1. તૈયારી અને સ્ક્રીનીંગ. દસ્તાવેજને શક્ય તેટલી ઉચ્ચ ગુણવત્તા પર સ્કેન કરો. ઐતિહાસિક સંશોધન માટે અંગૂઠાનો સામાન્ય નિયમ ઓછામાં ઓછો 300-400 DPI (ડોટ્સ પ્રતિ ઇંચ)નો રિઝોલ્યુશન છે. નીચું રીઝોલ્યુશન અનુગામી OCR તબક્કામાં ભૂલના દરને વધારે છે.
2. ઇમેજ પ્રીપ્રોસેસિંગ. OCR પહેલા ઇમેજને સુધારવાથી સફળતામાં ઘણો વધારો થાય છે: સ્કેન કરેલા પેજને ડિસ્ક્યુ કરવા, ખામીઓ દૂર કરવી, કોન્ટ્રાસ્ટ વધારવો, બ્લેક એન્ડ વ્હાઇટમાં કન્વર્ટ કરવું. આધુનિક AI-આધારિત સાધનો આ પગલાને સ્વચાલિત કરી શકે છે.
3. OCR એપ્લિકેશન. તમે છબીને OCR એન્જિનમાં ફીડ કરો છો; એન્જિન અક્ષરોને ઓળખે છે અને ટેક્સ્ટનું ઉત્પાદન કરે છે. આઉટપુટમાં સામાન્ય રીતે બે સ્તરો હોય છે: દૃશ્યમાન દસ્તાવેજની છબી અને નીચે "શોધી શકાય તેવું છુપાયેલ લખાણ સ્તર".
4. કરેક્શન (પોસ્ટ કરેક્શન). કાચો OCR આઉટપુટ ક્યારેય સંપૂર્ણ નથી. જૂના ફોન્ટ્સ, પીળા કાગળ, શાહી સ્મીયરિંગ અને સ્કેનિંગ ભૂલોને કારણે અક્ષરો ખોટી રીતે વાંચવામાં આવે છે. આ તે છે જ્યાં AI એક શક્તિશાળી સહાયક છે: તે સંદર્ભનો ઉપયોગ કરીને OCR ભૂલો સૂચવે છે અને સુધારે છે.
5. ચકાસણી અને ગુણવત્તા નિયંત્રણ. સુધારેલ ટેક્સ્ટને માનવ દ્વારા નમૂનાના આધારે અથવા સંપૂર્ણ રીતે તપાસવામાં આવે છે. ખાસ કરીને નિર્ણાયક ક્ષેત્રો જેમ કે નામ, તારીખો અને સંખ્યાઓ દૃષ્ટિની રીતે ચકાસવામાં આવશ્યક છે.
શા માટે OCR ભૂલો કરે છે, AI કેવી રીતે મદદ કરે છે
સામાન્ય સમસ્યાઓ જે ઐતિહાસિક દસ્તાવેજોમાં OCR ને પડકારે છે: જૂના અને ફેન્સી ફોન્ટ્સ, અપ્રચલિત અક્ષર સ્વરૂપો જેમ કે લાંબા "s" (ſ), બે-કૉલમ પૃષ્ઠ લેઆઉટ, ફૂટનોટ્સ, હસ્તલિખિત દાખલ, સીલ અને ઝાંખી શાહી. કારણ કે OCR એન્જિન એક પછી એક અક્ષરો "જુએ છે", તે વારંવાર દ્વિસંગી "rn" ને "m" તરીકે, અક્ષર "l" ને "1" તરીકે અને અક્ષર "O" ને "0" તરીકે મૂંઝવે છે.
AI ભાષાના મોડલ અહીં એક અલગ શક્તિ પ્રદાન કરે છે: તેઓ સંદર્ભ સમજે છે. જો OCR એન્જિન "1stanbu1" લખે છે, તો AI સંદર્ભ પરથી અનુમાન લગાવી શકે છે કે તે "ઇસ્તાંબુલ" હોવું જોઈએ. પરંતુ અહીં એક મોટો ભય છે: જ્યારે "સુધારવું" ત્યારે AI ટેક્સ્ટને પણ બદલી શકે છે. તે અસ્તિત્વમાં ન હોય તેવા શબ્દ "મેં સુધારેલ" ઉમેરી શકે છે અથવા તેના પોતાના અનુમાનથી અસ્પષ્ટ સ્થાન ભરી શકે છે. આ ટ્રાન્સક્રિપ્શનની વફાદારીને ખલેલ પહોંચાડે છે.
સાવધાન: OCR કરેક્શનમાં સુવર્ણ નિયમ આ છે: AI એ માત્ર સ્પષ્ટ ઓળખની ભૂલો સુધારવી જોઈએ, ટેક્સ્ટની સામગ્રીનું અર્થઘટન અથવા પૂરક બનાવવું જોઈએ નહીં. "1stanbu1 → Istanbul" કાયદેસર છે; તે અનુમાન સાથે વાંચી ન શકાય તેવા શબ્દને ભરવા વિશે નથી. અનિશ્ચિત સ્થાનો [?] વડે ચિહ્નિત કરવા જોઈએ અને બનેલા ન હોવા જોઈએ.
OCR ભૂલના પ્રકારો અને કોષ્ટક સાથેનો અભિગમ
ભૂલનો પ્રકાર
ઉદાહરણ
શું AI તેને ઠીક કરી શકે છે?
માનવ નિયંત્રણ
પાત્ર મિશ્રણ
rn↔m, l↔1, O↔0
હા, તે સલામત છે
નમૂના
જૂનું લેટરફોર્મ
લાંબી ſ → સે
હા, તે સલામત છે
નમૂના
ઝાંખો/વાંચી ન શકાય એવો શબ્દ
"કા___ન"
ના, મૂકવો જોઈએ [?]
ફરજિયાત
યોગ્ય નામ/સ્થળનું નામ
"કોન્સ્ટેન્ટિનીયે"
સાવચેત
ફરજિયાત
નંબર/તારીખ
"1867" વિ "1857"
જોખમી
ફરજિયાત
પૃષ્ઠ લેઆઉટ (કૉલમ/ફૂટનોટ)
મિશ્ર પ્રવાહ
આંશિક રીતે
ફરજિયાત
એક વાક્યમાં ચિત્રનો સારાંશ આપવા માટે: AI વિશ્વસનીય રીતે સામાન્ય પાત્રની ભૂલોને સાફ કરે છે; પરંતુ ખાસ નામો, સંખ્યાઓ, તારીખો અને વાંચી ન શકાય તેવા સ્થળો માટે માનવ આંખો જરૂરી છે.
ત્રણ નાના કેસો
કેસ 1 - અખબારોના આર્કાઇવ્સ શોધવા યોગ્ય બન્યા. યુનિવર્સિટીની લાઇબ્રેરીએ 1930ના દાયકાથી સ્થાનિક અખબારોના 12,000 પાનાનું ડિજિટાઇઝેશન કર્યું છે. કાચો OCR ચોકસાઈ અંદાજિત 82% હતી (દર 100 માંથી 18 અક્ષરો ખોટા હતા). AI-આધારિત કરેક્શને અખબારની ભાષા-યોગ્ય શબ્દકોશ અને સંદર્ભ સાથે ચોકસાઈ વધારીને 96% કરી. બાકીની ભૂલો માટે, સંપૂર્ણ લખાણને બદલે નમૂનાની તપાસ કરવામાં આવી હતી; સંગ્રહ 3 અઠવાડિયામાં શોધી શકાય તેવું બન્યું.
કેસ 2 - AI "સુધારેલ" અને વિકૃત ઇતિહાસ. એક આર્કાઇવિસ્ટે OCR પ્રિન્ટઆઉટ પર AIની તારીખ "1863" સુધારી હતી. સંદર્ભમાં બીજી ઘટના જોઈને AI એ તારીખને "સુધારો" કરીને "1868" કરી દીધી — દસ્તાવેજમાં સ્પષ્ટપણે 1863 કહ્યું હોવા છતાં. જો આર્કાઇવિસ્ટે મૂળ છબી ન જોઈ હોત, તો સૂચિ ખોટી તારીખ સાથે દાખલ થઈ હોત. પાઠ: નંબરો અને તારીખો ક્યારેય AI પર છોડવામાં આવતી નથી, તે છબી સાથે ચકાસવામાં આવે છે.
કેસ 3 — બે-કૉલમ પૃષ્ઠ મૂંઝવણમાં છે. 19મી સદીની યરબુકના બે-કૉલમ પૃષ્ઠોને OCRમાં એક જ પ્રવાહમાં મિશ્રિત કરવામાં આવ્યા હતા અને વાક્યો એકબીજા સાથે જોડાયેલા હતા. કાચું આઉટપુટ વાંચી ન શકાય તેવું હતું. જ્યારે મેં પૃષ્ઠ લેઆઉટને પ્રથમ પ્રદેશો (વિભાજન) માં વિભાજિત કર્યું અને દરેક કૉલમ પર અલગથી પ્રક્રિયા કરી ત્યારે ટેક્સ્ટમાં સુધારો થયો. પાઠ: જટિલ પૃષ્ઠ લેઆઉટમાં, રચના પ્રથમ, ટેક્સ્ટ સેકન્ડ.
ચાર નકલ કરી શકાય તેવા નમૂનાઓ
1) સુરક્ષિત OCR કરેક્શન:
નીચે એક ઐતિહાસિક દસ્તાવેજનું કાચું OCR આઉટપુટ છે. તમારું કાર્ય ફક્ત સ્પષ્ટ ઓપ્ટિકલ રેકગ્નિશન ભૂલોને સુધારવાનું છે (દા.ત. rn→m,1→l, 0→O, long ſ→s). નિયમો: (1) લખાણના અર્થનું અર્થઘટન કરો. (2) વાંચી ન શકાય તેવા/અસ્પષ્ટ શબ્દોને ઠીક કરો, જેમ છે તેમ છોડી દો અને [?] વડે ચિહ્નિત કરો. (3) વાક્યો ઉમેરવા, દૂર કરવા અથવા પૂર્ણ કરવા માટે નહીં. (4) નંબરો અને તારીખો બદલો; જો શંકા હોય તો [નંબર?] માર્ક કરો. કાચો OCR: [અહીં]
2) OCR ગુણવત્તા અહેવાલ:
નીચે આપેલા OCR આઉટપુટની તપાસ કરો અને ગુણવત્તા અહેવાલ બનાવો: (1) સંભવિત ઓળખની ભૂલોવાળા શબ્દોની સૂચિ બનાવો, (2) વાંચી ન શકાય તેવા/અસ્પષ્ટ દેખાતા વિસ્તારોને ચિહ્નિત કરો, (3) ચોક્કસ નામો, તારીખો અને સંખ્યાઓની સૂચિ બનાવો કે જેને માનવ તપાસની જરૂર છે. સુધારશો નહીં; ફક્ત ચેકલિસ્ટ જનરેટ કરો. ટેક્સ્ટ: [અહીં]
3) કૉલમ/સ્ટ્રક્ચર પાર્સિંગ મદદ:
કારણ કે નીચે આપેલ OCR ટેક્સ્ટ બે-કૉલમ પૃષ્ઠમાંથી આવે છે, પ્રવાહ મૂંઝવણમાં હોઈ શકે છે. ટેક્સ્ટને લોજિકલ ફકરાઓમાં ફરીથી ગોઠવો પરંતુ કોઈપણ શબ્દો બદલો, ઉમેરો કે કાઢી નાખો નહીં. ફક્ત ક્રમમાં સુધારો. તમને [ઓર્ડર?] સાથે ખાતરી ન હોય તેવા ઓર્ડરને માર્ક કરો. ટેક્સ્ટ: [અહીં]
4) પ્રમાણભૂત ભાષામાં સામાન્યીકરણ (વૈકલ્પિક, અલગ સ્તર):
આજની જોડણીમાં, એક અલગ કૉલમમાં, નીચે સુધારેલ ઐતિહાસિક લખાણની ઉપર, એક સરળ વાંચન સંસ્કરણ બનાવો. મૂળ ટેક્સ્ટને ક્યારેય બદલશો નહીં; સરળીકરણને એક અલગ સ્તર બનવા દો. અર્થ ઉમેર્યા વિના ફક્ત જોડણી/ઉચ્ચાર અપડેટ કરો. મૂળ: [અહીં]
નબળા પ્રોમ્પ્ટ / મજબૂત પ્રોમ્પ્ટ
નબળા:
આ OCR ટેક્સ્ટને ઠીક કરો અને સુંદર બનાવો.
"સુશોભિત કરો" એઆઈને ટેક્સ્ટને ફરીથી લખવા, ભૂલો કરવા અને સામગ્રીનું અર્થઘટન કરવાની મંજૂરી આપે છે; વફાદારી તોડે છે.
મજબૂત:
આ કાચા OCR આઉટપુટમાં ફક્ત ઓપ્ટિકલ ઓળખની ભૂલોને ઠીક કરો. અર્થનું અર્થઘટન ન કરો, શબ્દો ઉમેરો/કાઢી નાખો, [?] સાથે વાંચી ન શકાય તેવા ભાગો છોડો, નંબરો અને તારીખો બદલો. તમે કરો છો તે દરેક કરેક્શનને "મૂળ → કરેક્શન" ફોર્મેટમાં અલગ સૂચિમાં બતાવો જેથી હું તેને ચકાસી શકું. ટેક્સ્ટ: [અહીં]
તફાવત: બાઉન્ડેડ ડ્યુટી, ફેબ્રિકેશન પર પ્રતિબંધ, ચિહ્નિત અસ્પષ્ટતા અને સુધારાઓની શોધી શકાય તેવી સૂચિ આઉટપુટને ઓડિટેબલ બનાવે છે.
સામાન્ય ભૂલો
- ઓછા રિઝોલ્યુશન પર સ્કેનિંગ. મોટાભાગની OCR ભૂલો ખરાબ છબીઓને કારણે થાય છે; ગુણવત્તાયુક્ત સ્કેનિંગ એ સૌથી સસ્તું રોકાણ છે.
- AIને "સુંદર બનાવો" કહે છે. આ વફાદારીને બદલે અસ્ખલિતતા પેદા કરે છે; દસ્તાવેજ ફરીથી લખવામાં આવે છે.
- નંબરો અને તારીખોને AI પર છોડીને. જ્યારે સંદર્ભમાંથી "સુધારો" કરવામાં આવે ત્યારે આ ચૂપચાપ દૂષિત થાય છે; છબી દ્વારા ચકાસાયેલ હોવું જ જોઈએ.
- અનુમાન સાથે વાંચી ન શકાય તેવી જગ્યા ભરવી. તે અનિશ્ચિતતા [?] દ્વારા સુરક્ષિત હોવું જોઈએ, બનેલું નથી.
- નમૂના લેવાને બદલે બિલકુલ નિયંત્રણમાં નથી. 96% ચોકસાઈનો પણ અર્થ છે 12,000 પૃષ્ઠોમાં હજારો ભૂલો; જટિલ વિસ્તારો સ્કેન કરવામાં આવે છે.
સારાંશમાં
OCR પ્રિન્ટેડ ઐતિહાસિક દસ્તાવેજોને શોધી શકાય તેવા ટેક્સ્ટમાં રૂપાંતરિત કરીને સંશોધકો માટે આર્કાઇવ્સ ખોલે છે. AI એ સંદર્ભ સાથે કાચા OCR આઉટપુટમાં પાત્રની ભૂલોને સુધારવામાં એક શક્તિશાળી સહાય છે; પરંતુ તમારે સંપાદન અને પુનઃલેખન વચ્ચેની રેખા દોરવી જોઈએ. ઉચ્ચ-ગુણવત્તાવાળી સ્કેનિંગ, સલામત સુધારણા સૂચના, [?] સાથે અસ્પષ્ટતાની જાળવણી, અને નામ/તારીખ/નંબરોની માનવ-આંખની ચકાસણી ડિજિટાઇઝેશનને ઝડપી અને ભરોસાપાત્ર બનાવે છે. AI ટેક્સ્ટને સાફ કરે છે; તમે વફાદારીના રક્ષક છો.
એપ્લિકેશન કાર્ય
મુદ્રિત ઐતિહાસિક દસ્તાવેજ (જૂનું અખબાર, સત્તાવાર પત્ર, પુસ્તક પૃષ્ઠ) સ્કેન કરો અથવા OCR પ્રિન્ટઆઉટ લો. "સિક્યોર OCR કરેક્શન" ટેમ્પલેટ વડે ટેક્સ્ટને ઠીક કરો અને "મૂળ → કરેક્શન" સૂચિ દ્વારા સુધારાની વિનંતી કરો. તે પછી, "OCR ગુણવત્તા અહેવાલ" સાથે માનવ નિયંત્રણની જરૂર હોય તેવા વિસ્તારોને દૂર કરો. સૂચિમાંની દરેક તારીખ અને યોગ્ય નામની વાસ્તવિક છબી સાથે સરખામણી કરો; નોંધ કરો કે કેટલાને ખોટી રીતે "સુધાર્યા" હતા.
ચેકલિસ્ટ
- [ ] મેં દસ્તાવેજને ઓછામાં ઓછા 300 DPI અને સારા કોન્ટ્રાસ્ટ સાથે સ્કેન કર્યો છે.
- [ ] મેં ફક્ત AI ને ઓપ્ટિકલ ભૂલ સુધારણા માટે પૂછ્યું હતું, ફરીથી લખવા માટે નહીં.
- [ ] મેં વાંચી ન શકાય તેવા ભાગોને [?] વડે સુરક્ષિત કર્યા.
- [ ] મેં ઈમેજ સાથે તમામ નંબરો, તારીખો અને યોગ્ય નામોની ચકાસણી કરી છે.
- [ ] મેં નિર્ણાયક વિસ્તારોમાં નમૂના અથવા સંપૂર્ણ તપાસ કરી.