નફો:
- એચટીઆર અને લિવ્યંતરણ વર્કફ્લો સેટ કરવાની ક્ષમતા અને શા માટે કાચા ડ્રાફ્ટને લાઇન દ્વારા નિષ્ણાત તપાસની જરૂર છે તે સમજાવવાની ક્ષમતા
- ઓટ્ટોમન ટર્કિશમાં સ્વર/અક્ષર અસ્પષ્ટતાના કિસ્સામાં ચોક્કસ વાંચન લાદવાને બદલે વિકલ્પો માટે પૂછીને વાંચી ન શકાય તેવા વિસ્તારોને સુરક્ષિત કરવાની ક્ષમતા
- મૂળ લિવ્યંતરણને સરળીકરણના અલગ સ્તરથી અલગ કરવાની ક્ષમતા, પેલિયોગ્રાફર સાથે અંતિમ વૈજ્ઞાનિક જવાબદારી રાખીને
કદાચ ઐતિહાસિક સંશોધનનો સૌથી વધુ માગણી કરનાર ભાગ હસ્તપ્રતો અને જૂના લેખિત દસ્તાવેજોને વાંચી શકાય તેવા લખાણમાં ટ્રાન્સક્રિપ્ટ કરવાનો છે. એક પત્ર, નોટબુક, કોર્ટ રેકોર્ડ અથવા ઓટ્ટોમન દસ્તાવેજ ફક્ત તે લખવામાં આવ્યા પછી જ શોધી શકાય છે. ટ્રાંસ્ક્રિપ્શન એ દસ્તાવેજની સામગ્રી (મોટાભાગે હસ્તલિખિત અથવા પ્રાચીન લિપિ) ને લેખિત, વાંચી શકાય તેવા ટેક્સ્ટમાં સ્થાનાંતરિત કરવાની ક્રિયા છે. ઓટ્ટોમનના કિસ્સામાં, આ ઘણીવાર લિવ્યંતરણ સાથે હોય છે: અરબી અક્ષરોમાં લખાણને તેના અક્ષર-દર-અક્ષર સમકક્ષો સાથે લેટિન મૂળાક્ષરોમાં સ્થાનાંતરિત કરવું.
અમે મુદ્રિત ગ્રંથો માટે OCR નો ઉપયોગ કર્યો; હસ્તલેખન માટે એક અલગ તકનીકની જરૂર છે: HTR (હસ્તલેખિત ટેક્સ્ટ ઓળખ). એચટીઆર એ ઓસીઆર જેવી જ ટેક્નોલોજી છે પરંતુ વધુ પડકારજનક છે જે હસ્તલિખિત દસ્તાવેજોને મશીન ટેક્સ્ટમાં રૂપાંતરિત કરે છે. આ એકમમાં આપણે જોઈશું કે ઓટ્ટોમન અને હસ્તપ્રત ટ્રાન્સક્રિપ્શનમાં HTR અને AI નો ઉપયોગ કેવી રીતે કરવો, ભૂલના માર્જિન અને શા માટે ચકાસણી અહીં વધુ મહત્વપૂર્ણ છે.
હસ્તલેખન શા માટે આટલું મુશ્કેલ છે?
હસ્તલેખન મુદ્રિત લખાણ કરતાં વધુ પરિવર્તનશીલ છે: દરેક લેખકનો એક અનન્ય હાથ હોય છે, અક્ષરો એકસાથે જોડાયેલા હોય છે, સંક્ષેપ અને વિશિષ્ટ ચિહ્નોનો ઉપયોગ થાય છે, શાહી નીકળી જાય છે, કાગળ ખરી જાય છે. ઓટ્ટોમન ટર્કિશમાં મુશ્કેલીનો ગુણાકાર થાય છે:
- સંદર્ભિત અક્ષર સ્વરૂપો: એક જ અક્ષર શબ્દની શરૂઆતમાં, મધ્યમાં અને અંતે અલગ રીતે લખવામાં આવે છે.
- સ્વરો લખતા નથી: લઘુ સ્વરો ઘણીવાર લખાતા નથી; વાચક સંદર્ભમાંથી પૂર્ણ કરે છે. આનાથી "સ્વીકૃતિ કે અસ્વીકાર?" જેવી અસ્પષ્ટતા ઊભી થાય છે.
- વિવિધ લેખન શૈલીઓ: હસ્તલેખનની વિવિધ શૈલીઓ છે જેમ કે રિકા, દિવાની, તાલિક; દરેકને અલગ વાંચન કુશળતાની જરૂર છે.
- ઓટ્ટોમન શબ્દભંડોળ: અરબી અને ફારસીમાંથી એવા શબ્દો કે જે આજના ટર્કિશમાં અસ્તિત્વમાં નથી.
તેથી, HTR અને AI પ્રિન્ટ OCR કરતાં ઓટ્ટોમન ટર્કિશમાં ભૂલના વધુ માર્જિન સાથે કામ કરે છે. નિષ્ણાત પેલિયોગ્રાફરની આંખ (પેલિયોગ્રાફી - પ્રાચીન લખાણો વાંચવાનું વિજ્ઞાન) અહીં એક સાધન નથી, પરંતુ એક આવશ્યકતા છે.
વર્કફ્લો: સ્ટેપ બાય સ્ટેપ
1. દસ્તાવેજની ગુણવત્તા તૈયાર કરો. OCR ની જેમ, ઉચ્ચ રીઝોલ્યુશન અને સારા કોન્ટ્રાસ્ટ આવશ્યક છે. હસ્તલેખનમાં આ વધુ જટિલ છે.
2. HTR મોડલ પસંદ કરો. ઓટ્ટોમન, અરબી હસ્તાક્ષર અથવા ચોક્કસ સમયગાળા માટે ખાસ તાલીમ પામેલા HTR મોડલ્સ સામાન્ય મોડલ કરતાં વધુ સફળ છે. પરીક્ષણ કરો કે કયું મોડલ સમયગાળા અને લેખન શૈલી માટે સારું કામ કરે છે.
3. કાચું ટ્રાન્સક્રિપ્શન જનરેટ કરો. HTR મોડલ એક રૂપરેખા બનાવે છે. ઓટ્ટોમન ટર્કિશમાં, આ ડ્રાફ્ટ એ ભૂલોથી ભરેલી શરૂઆત છે જેને અનુભવી આંખે સારી રીતે તપાસવી જોઈએ.
4. AI સાથે સંદર્ભમાં સુધારો. તમારી પાસે કાચા આઉટપુટમાં AI ફ્લેગની અસંગતતાઓ, સંભવિત વાંચન વિકલ્પો અને શંકાસ્પદ સ્થાનો હોઈ શકે છે. પરંતુ AI "સુધારણા" અહીં ખાસ કરીને જોખમી છે: તે કાલ્પનિક વાંચન સૂચવી શકે છે.
5. લિવ્યંતરણ અને સરળીકરણ (સ્તરવાળી). અરબી અક્ષરોમાં લખાણનું લેટિન અક્ષરોમાં લિવ્યંતરણ, ત્યારપછી આજના ટર્કિશમાં તેનું સરળ વાંચન, અલગ સ્તરો તરીકે ઉત્પન્ન થાય છે. મૂળ ક્યારેય તૂટતું નથી.
6. નિષ્ણાત ચકાસણી. અંતિમ ટ્રાંસ્ક્રિપ્શનને પેલિયોગ્રાફી અને પીરિયડ જ્ઞાન ધરાવતા નિષ્ણાત દ્વારા દસ્તાવેજ સાથે સરખામણી કરીને મંજૂર કરવામાં આવે છે.
ધ્યાન આપો: ઓટ્ટોમન ટર્કિશમાં, જ્યારે સંદર્ભમાંથી અલિખિત સ્વર સાથે કોઈ શબ્દનું "અનુમાન" કરવામાં આવે છે, ત્યારે AI સંપૂર્ણપણે ખોટું વાંચન ઉત્પન્ન કરી શકે છે અને તેને આત્મવિશ્વાસપૂર્ણ ભાષામાં રજૂ કરી શકે છે. અક્ષરોમાં તફાવત, જેમ કે "કાબિલ" ને બદલે "કાબુલ" અથવા "અલીમ" ને બદલે "આલેમ", અર્થ સંપૂર્ણપણે બદલી નાખે છે. દરેક અનિશ્ચિત વાંચન વિકલ્પો સાથે રજૂ કરવું જોઈએ, અને કોઈ એક નિશ્ચિત વાંચન લાદવું જોઈએ નહીં.
એક ટેબલ સાથે સ્તરો અને જવાબદારી
સ્તર
સામગ્રી
AI ની ભૂમિકા
નિષ્ણાતની ભૂમિકા
છબી
મૂળ દસ્તાવેજ
-
સ્ત્રોત
HTR ડ્રાફ્ટ
કાચું મશીન વાંચન
પેદા કરે છે
શરૂઆતથી અંત સુધી નિયંત્રણ
લિવ્યંતરણ
લેટિન અક્ષર ટ્રાન્સપોઝિશન
ડ્રાફ્ટ સૂચવે છે
સુધારે છે, સુધારે છે
અનિશ્ચિતતાની નોંધો
[?] અને વિકલ્પો
ચિહ્નો
નક્કી કરે છે
સરળીકરણ
આજનું ટર્કિશ
ડ્રાફ્ટ સૂચવે છે
મંજૂરીઓ
વૈજ્ઞાનિક પ્રકાશન
અંતિમ ટેક્સ્ટ + નોંધો
-
માત્ર નિષ્ણાત
ત્રણ નાના કેસો
કેસ 1 — HTR એ પ્રથમ ડ્રાફ્ટની ઝડપ 5x વધારી છે. ડોક્ટરલ વિદ્યાર્થી 200-પાનાની ઓટ્ટોમન નોટબુકનું ટ્રાન્સક્રિપ્ટ કરશે. સંપૂર્ણ મેન્યુઅલ ટ્રાંસ્ક્રિપ્શન 60 કામકાજી દિવસોમાં અંદાજવામાં આવ્યું હતું. સમયગાળા માટે પ્રશિક્ષિત HTR મોડેલ સાથે, કાચો ડ્રાફ્ટ થોડા કલાકોમાં બહાર આવ્યો; વિદ્યાર્થીએ આ ડ્રાફ્ટમાં સુધારો કર્યો અને કામને 12 કામકાજના દિવસો સુધી ઘટાડ્યું. પરંતુ તેણે દરેક પૃષ્ઠને દસ્તાવેજ સાથે, લાઇન બાય લાઇનની તુલના કરવી પડી હતી; લગભગ 30% ડ્રાફ્ટ ખોટો હતો.
કેસ 2 - એક અક્ષર, એક અર્થ. એક સંશોધકે એઆઈએ "ગવર્નર" તરીકે વાંચેલા શબ્દ પર આધાર રાખ્યો. નિષ્ણાતના નિયંત્રણ હેઠળ, તે સમજી શકાયું હતું કે આ શબ્દ વાસ્તવમાં "વાલી" (બાળક/વ્યક્તિ માટે જવાબદાર) છે, અને સ્વર ચિહ્નિત ન હોવાથી, AI એ ખોટું અનુમાન લગાવ્યું. દસ્તાવેજનો કાનૂની અર્થ સંપૂર્ણપણે બદલાઈ રહ્યો હતો. પાઠ: ઓટ્ટોમન ટર્કિશમાં, એક અક્ષર/સ્વર તફાવતને કારણે દસ્તાવેજને શરૂઆતથી અર્થઘટન કરવામાં આવે છે; નિષ્ણાત જરૂરી છે.
કેસ 3 — કાલ્પનિક પૂર્ણતા. એક લીટીમાં જેની શાહી ખતમ થઈ ગઈ હતી અને જેમાંથી એક શબ્દ વાંચી ન શકાયો હતો, એઆઈ એ "તાર્કિક" શબ્દથી ખાલી જગ્યા ભરી દીધી. નિષ્ણાતને સમજાયું કે તે ગેપ વાસ્તવમાં એક સ્થળનું નામ હતું અને એઆઈએ તેને પૂર્ણ કર્યું છે. [અયોગ્ય] તરીકે જગ્યા છોડી. પાઠ: વાંચી ન શકાય તેવી જગ્યા ભરાઈ નથી, તે ચિહ્નિત થયેલ છે.
ચાર નકલ કરી શકાય તેવા નમૂનાઓ
1) લિવ્યંતરણ જે અસ્પષ્ટતાને જાળવી રાખે છે:
નીચે ઓટ્ટોમન દસ્તાવેજનું HTR કાચું આઉટપુટ/લિવ્યંતરણ છે. તમારું કાર્ય ટેક્સ્ટની સમીક્ષા કરવાનું છે અને સંભવિત વાંચન ભૂલોને ફ્લેગ કરવાનું છે. નિયમો: (1) દરેક શબ્દ માટે 2-3 સંભવિત વાંચન વિકલ્પો ઓફર કરો જેના વિશે તમને ખાતરી ન હોય, એક લાદશો નહીં. (2) અયોગ્ય વિસ્તારોમાં [અયોગ્ય] છોડી દો, તેમને ભરશો નહીં. (3) લખાણમાં અસ્તિત્વમાં ન હોય તેવા શબ્દો ઉમેરવા. (4) અસ્પષ્ટ સ્વરોવાળા શબ્દોમાં વિકલ્પો બતાવો. ટેક્સ્ટ: [અહીં]
2) સ્તરીય વાંચન (મૂળ + સરળીકરણ):
નીચેના ચકાસાયેલ ઓટ્ટોમન લિવ્યંતરણ માટે બે કૉલમ બનાવો: (1) મૂળ લિવ્યંતરણ (સ્પર્શ), (2) આજના ટર્કિશમાં સરળ વાંચન. અર્થ ઉમેરવું, સરળીકરણમાં અર્થઘટન ઉમેરવું; ફક્ત ભાષા અપડેટ કરો. અસ્પષ્ટ અર્થ [અસ્પષ્ટ] સાથે સ્થાનોને ચિહ્નિત કરો. લિવ્યંતરણ: [અહીં]
3) મુદત અને વ્યક્તિ નિષ્કર્ષણ:
નીચે ટ્રાન્સક્રિપ્શનમાં ઉલ્લેખિત વ્યક્તિગત નામો, સ્થળના નામ, શીર્ષકો અને સામયિક શબ્દો અલગ સૂચિમાં દેખાય છે. ટેક્સ્ટમાં સ્પષ્ટપણે ઉલ્લેખિત ફક્ત તે જ લો; અનુમાન લગાવીને ઉમેરશો નહીં. જો તમને ઉચ્ચારની ખાતરી ન હોય તો [?] વડે ચિહ્નિત કરો. ટેક્સ્ટ: [અહીં]
4) શંકાસ્પદ વાંચન નિયંત્રણ:
ભૂમિકામાં અનુભવી પેલિયોગ્રાફી નિયંત્રક. નીચેના ટ્રાંસ્ક્રિપ્શનમાં, એવા શબ્દોને ચિહ્નિત કરો કે જે અર્થમાં અસંગત છે, સમયગાળામાં બંધબેસતા નથી અથવા સંદર્ભમાં બંધબેસતા નથી, અને શા માટે તેઓ શંકાસ્પદ છે તે લખો. નિશ્ચિત કરેક્શન લાદવું; માનવ નિષ્ણાત દસ્તાવેજ સાથે સરખામણી કરશે તેવી શંકાઓની સૂચિ બનાવો. ટેક્સ્ટ: [અહીં]
નબળા પ્રોમ્પ્ટ / મજબૂત પ્રોમ્પ્ટ
નબળા:
આ ઓટ્ટોમન લખાણ વાંચો અને મને તેનો અનુવાદ આપો.
આ AI ને એકલ, નિશ્ચિત વાંચન, અસ્પષ્ટતા છુપાવવા અને ગાબડાંમાં ફિટ કરવા માટે દબાણ કરે છે. ઓટ્ટોમન ટર્કિશમાં, આ લગભગ બાંયધરીકૃત ભૂલ છે.
મજબૂત:
નીચે ઓટ્ટોમન લિવ્યંતરણ તપાસો. ચોક્કસ વાંચન: IMPOSITION. દરેક અસ્પષ્ટ શબ્દ માટે સંભવિત વિકલ્પો પ્રદાન કરો, [અયોગ્ય] ભાગોને છોડી દો, લખાણમાં ન હોય તેવું કંઈપણ ઉમેરશો નહીં. આજના ટર્કિશને એક અલગ કૉલમમાં સરળ વાંચન આપો, પરંતુ મૂળ રાખો. તમે જે કંઈપણ વિશે ચોક્કસ નથી તેને [?] સાથે ચિહ્નિત કરો જેથી નિષ્ણાત તેની તુલના દસ્તાવેજ સાથે કરી શકે. ટેક્સ્ટ: [અહીં]
તફાવત: સખત વાંચન પ્રતિબંધ, વિકલ્પોની વિનંતી કરવી, વ્હાઇટસ્પેસ સાચવવી અને સ્તરવાળી આઉટપુટ નિષ્ણાત ચકાસણીને સક્ષમ કરે છે.
સામાન્ય ભૂલો
- HTR ડ્રાફ્ટને સાચો ગણાવવો. ઓટ્ટોમન ટર્કિશમાં, મોટા ભાગનો કાચો ડ્રાફ્ટ અચોક્કસ હોઈ શકે છે; લાઇન બાય લાઇન નિયંત્રણ આવશ્યક છે.
- માત્ર નિશ્ચિત વાંચન લાદવાનું છે. જો એવા શબ્દોમાં વિકલ્પો છુપાયેલા હોય કે જેના સ્વરો લખાયા ન હોય, તો ખોટો અર્થ નોંધવામાં આવશે.
- વાંચી ન શકાય તેવા વિસ્તારમાં ભરવું. તે સફેદ જગ્યા [અયોગ્ય] દ્વારા સુરક્ષિત હોવું જોઈએ, બનેલું નથી.
- સરળીકરણ સાથે મૂળ મિશ્રણ. સરળીકરણ એક અલગ સ્તર હોવું જોઈએ; મૂળ લિવ્યંતરણ વિકૃત ન હોવું જોઈએ.
- નિષ્ણાતને અક્ષમ કરી રહ્યું છે. પેલેઓગ્રાફી અને પીરિયડના જ્ઞાન વિના, એઆઈનું વાંચન એ કોઈ વૈજ્ઞાનિક મૂલ્ય વિનાનું અનુમાન છે.
સારાંશમાં
એચટીઆર અને એઆઈ સાથે કાચા ડ્રાફ્ટ સ્ટેજ પર ઓટ્ટોમન અને હસ્તપ્રત ટ્રાન્સક્રિપ્શનને મોટા પ્રમાણમાં ઝડપી કરી શકાય છે; તમને પ્રથમ આઉટપુટ મળે છે જે કામના દિવસોને કલાકોમાં ઘટાડી દે છે. પરંતુ તે આ ક્ષેત્રમાં ચોક્કસપણે છે કે એક અક્ષર, એક સ્વર તફાવત અર્થ બદલે છે; AI અનિશ્ચિતતાને છુપાવવા અને ખાલી જગ્યાઓ ભરવાનું વલણ ધરાવે છે. યોગ્ય પદ્ધતિ સ્તરવાળી છે: કાચી રૂપરેખા, અસ્પષ્ટતાની વૈકલ્પિક નોંધ, સરળીકરણનું એક અલગ સ્તર અને સૌથી ઉપર, પેલેઓગ્રાફીથી પરિચિત નિષ્ણાત દ્વારા દસ્તાવેજની લાઇન-બાય-લાઇન ચકાસણી. AI પ્રારંભિક વાંચનને ઝડપી બનાવે છે; વૈજ્ઞાનિક જવાબદારી નિષ્ણાતની છે.
એપ્લિકેશન કાર્ય
ઓટ્ટોમન અથવા હસ્તપ્રત દસ્તાવેજનું લિવ્યંતરણ મેળવો (તમારું પોતાનું ઉત્પાદન અથવા પ્રકાશિત નકલ). AI ને "અસ્પષ્ટતા-સંરક્ષિત લિવ્યંતરણ" ટેમ્પલેટ સાથે વૈકલ્પિક વાંચન માટે પૂછો. પછી "લેયર્ડ રીડિંગ" વડે અલગથી સરળીકરણ સ્તર જનરેટ કરો. નિષ્ણાત સ્ત્રોત અથવા શબ્દકોશ સાથે અસ્પષ્ટ રીતે ચિહ્નિત થયેલ દરેક શબ્દની તુલના કરો; નોંધ કરો કે જો AI એક જ રીડિંગ લાદશે તો તે કેટલી ભૂલો પેદા કરશે.
ચેકલિસ્ટ
- [ ] મેં સમયગાળા અને લેખન શૈલીને અનુરૂપ HTR/મોડલનો ઉપયોગ કર્યો છે.
- [ ] મેં AI ને ચોક્કસ વાંચનના વિકલ્પો માટે પૂછ્યું.
- [ ] મેં વાંચી ન શકાય તેવા ભાગોને [ન વાંચી શકાય તેવા] વડે સુરક્ષિત કર્યા.
- [ ] મેં મૂળ લિવ્યંતરણને સરળીકરણથી અલગ રાખ્યું છે.
- [ ] મારી પાસે પેલેઓગ્રાફી જાણતા નિષ્ણાત/દસ્તાવેજી દ્વારા ચકાસાયેલ અંતિમ લખાણ હતું.