એકમો
1. ઇતિહાસ અને આર્કાઇવિંગમાં કૃત્રિમ બુદ્ધિનો પરિચય: ભૂમિકાઓ, સીમાઓ, માન્યતા અને નીતિશાસ્ત્ર 2. દસ્તાવેજ ડિજિટાઇઝેશન અને OCR: પ્રિન્ટેડ ટેક્સ્ટને મશીન ટેક્સ્ટમાં કન્વર્ટ કરવું 3. ટ્રાન્સક્રિપ્શન: ઓટ્ટોમન ટર્કિશ અને હસ્તપ્રતો 4. મેટાડેટા, સૂચિ અને વર્ગીકરણ 5. સ્ત્રોત સ્કેનિંગ, ડિસ્કવરી અને સારાંશ 6. ઐતિહાસિક અનુવાદ અને સરળીકરણ 7. સ્ત્રોત ચકાસણી, એનાક્રોનિઝમ અને આભાસ 8. સામગ્રી વિશ્લેષણ અને પેટર્ન શોધ 9. આર્કાઇવ ઍક્સેસ, વર્ણન અને વપરાશકર્તા સેવાઓ 10. જાળવણી, પુનઃસ્થાપન અને ડિજિટલ સંરક્ષણ 11. નૈતિકતા, કોપીરાઈટ, ગોપનીયતા અને સાંસ્કૃતિક સંવેદનશીલતા 12. એન્ડ-ટુ-એન્ડ પ્રોજેક્ટ: આર્ટિફિશિયલ ઇન્ટેલિજન્સ સાથે આર્કાઇવ કલેક્શનની પ્રક્રિયા કરવી
એકમ 3 / 12

ટ્રાન્સક્રિપ્શન: ઓટ્ટોમન ટર્કિશ અને હસ્તપ્રતો

નફો:

  • એચટીઆર અને લિવ્યંતરણ વર્કફ્લો સેટ કરવાની ક્ષમતા અને શા માટે કાચા ડ્રાફ્ટને લાઇન દ્વારા નિષ્ણાત તપાસની જરૂર છે તે સમજાવવાની ક્ષમતા
  • ઓટ્ટોમન ટર્કિશમાં સ્વર/અક્ષર અસ્પષ્ટતાના કિસ્સામાં ચોક્કસ વાંચન લાદવાને બદલે વિકલ્પો માટે પૂછીને વાંચી ન શકાય તેવા વિસ્તારોને સુરક્ષિત કરવાની ક્ષમતા
  • મૂળ લિવ્યંતરણને સરળીકરણના અલગ સ્તરથી અલગ કરવાની ક્ષમતા, પેલિયોગ્રાફર સાથે અંતિમ વૈજ્ઞાનિક જવાબદારી રાખીને

કદાચ ઐતિહાસિક સંશોધનનો સૌથી વધુ માગણી કરનાર ભાગ હસ્તપ્રતો અને જૂના લેખિત દસ્તાવેજોને વાંચી શકાય તેવા લખાણમાં ટ્રાન્સક્રિપ્ટ કરવાનો છે. એક પત્ર, નોટબુક, કોર્ટ રેકોર્ડ અથવા ઓટ્ટોમન દસ્તાવેજ ફક્ત તે લખવામાં આવ્યા પછી જ શોધી શકાય છે. ટ્રાંસ્ક્રિપ્શન એ દસ્તાવેજની સામગ્રી (મોટાભાગે હસ્તલિખિત અથવા પ્રાચીન લિપિ) ને લેખિત, વાંચી શકાય તેવા ટેક્સ્ટમાં સ્થાનાંતરિત કરવાની ક્રિયા છે. ઓટ્ટોમનના કિસ્સામાં, આ ઘણીવાર લિવ્યંતરણ સાથે હોય છે: અરબી અક્ષરોમાં લખાણને તેના અક્ષર-દર-અક્ષર સમકક્ષો સાથે લેટિન મૂળાક્ષરોમાં સ્થાનાંતરિત કરવું.

અમે મુદ્રિત ગ્રંથો માટે OCR નો ઉપયોગ કર્યો; હસ્તલેખન માટે એક અલગ તકનીકની જરૂર છે: HTR (હસ્તલેખિત ટેક્સ્ટ ઓળખ). એચટીઆર એ ઓસીઆર જેવી જ ટેક્નોલોજી છે પરંતુ વધુ પડકારજનક છે જે હસ્તલિખિત દસ્તાવેજોને મશીન ટેક્સ્ટમાં રૂપાંતરિત કરે છે. આ એકમમાં આપણે જોઈશું કે ઓટ્ટોમન અને હસ્તપ્રત ટ્રાન્સક્રિપ્શનમાં HTR અને AI નો ઉપયોગ કેવી રીતે કરવો, ભૂલના માર્જિન અને શા માટે ચકાસણી અહીં વધુ મહત્વપૂર્ણ છે.

હસ્તલેખન શા માટે આટલું મુશ્કેલ છે?

હસ્તલેખન મુદ્રિત લખાણ કરતાં વધુ પરિવર્તનશીલ છે: દરેક લેખકનો એક અનન્ય હાથ હોય છે, અક્ષરો એકસાથે જોડાયેલા હોય છે, સંક્ષેપ અને વિશિષ્ટ ચિહ્નોનો ઉપયોગ થાય છે, શાહી નીકળી જાય છે, કાગળ ખરી જાય છે. ઓટ્ટોમન ટર્કિશમાં મુશ્કેલીનો ગુણાકાર થાય છે:

  • સંદર્ભિત અક્ષર સ્વરૂપો: એક જ અક્ષર શબ્દની શરૂઆતમાં, મધ્યમાં અને અંતે અલગ રીતે લખવામાં આવે છે.
  • સ્વરો લખતા નથી: લઘુ સ્વરો ઘણીવાર લખાતા નથી; વાચક સંદર્ભમાંથી પૂર્ણ કરે છે. આનાથી "સ્વીકૃતિ કે અસ્વીકાર?" જેવી અસ્પષ્ટતા ઊભી થાય છે.
  • વિવિધ લેખન શૈલીઓ: હસ્તલેખનની વિવિધ શૈલીઓ છે જેમ કે રિકા, દિવાની, તાલિક; દરેકને અલગ વાંચન કુશળતાની જરૂર છે.
  • ઓટ્ટોમન શબ્દભંડોળ: અરબી અને ફારસીમાંથી એવા શબ્દો કે જે આજના ટર્કિશમાં અસ્તિત્વમાં નથી.

તેથી, HTR અને AI પ્રિન્ટ OCR કરતાં ઓટ્ટોમન ટર્કિશમાં ભૂલના વધુ માર્જિન સાથે કામ કરે છે. નિષ્ણાત પેલિયોગ્રાફરની આંખ (પેલિયોગ્રાફી - પ્રાચીન લખાણો વાંચવાનું વિજ્ઞાન) અહીં એક સાધન નથી, પરંતુ એક આવશ્યકતા છે.

વર્કફ્લો: સ્ટેપ બાય સ્ટેપ

1. દસ્તાવેજની ગુણવત્તા તૈયાર કરો. OCR ની જેમ, ઉચ્ચ રીઝોલ્યુશન અને સારા કોન્ટ્રાસ્ટ આવશ્યક છે. હસ્તલેખનમાં આ વધુ જટિલ છે.

2. HTR મોડલ પસંદ કરો. ઓટ્ટોમન, અરબી હસ્તાક્ષર અથવા ચોક્કસ સમયગાળા માટે ખાસ તાલીમ પામેલા HTR મોડલ્સ સામાન્ય મોડલ કરતાં વધુ સફળ છે. પરીક્ષણ કરો કે કયું મોડલ સમયગાળા અને લેખન શૈલી માટે સારું કામ કરે છે.

3. કાચું ટ્રાન્સક્રિપ્શન જનરેટ કરો. HTR મોડલ એક રૂપરેખા બનાવે છે. ઓટ્ટોમન ટર્કિશમાં, આ ડ્રાફ્ટ એ ભૂલોથી ભરેલી શરૂઆત છે જેને અનુભવી આંખે સારી રીતે તપાસવી જોઈએ.

4. AI સાથે સંદર્ભમાં સુધારો. તમારી પાસે કાચા આઉટપુટમાં AI ફ્લેગની અસંગતતાઓ, સંભવિત વાંચન વિકલ્પો અને શંકાસ્પદ સ્થાનો હોઈ શકે છે. પરંતુ AI "સુધારણા" અહીં ખાસ કરીને જોખમી છે: તે કાલ્પનિક વાંચન સૂચવી શકે છે.

5. લિવ્યંતરણ અને સરળીકરણ (સ્તરવાળી). અરબી અક્ષરોમાં લખાણનું લેટિન અક્ષરોમાં લિવ્યંતરણ, ત્યારપછી આજના ટર્કિશમાં તેનું સરળ વાંચન, અલગ સ્તરો તરીકે ઉત્પન્ન થાય છે. મૂળ ક્યારેય તૂટતું નથી.

6. નિષ્ણાત ચકાસણી. અંતિમ ટ્રાંસ્ક્રિપ્શનને પેલિયોગ્રાફી અને પીરિયડ જ્ઞાન ધરાવતા નિષ્ણાત દ્વારા દસ્તાવેજ સાથે સરખામણી કરીને મંજૂર કરવામાં આવે છે.

ધ્યાન આપો: ઓટ્ટોમન ટર્કિશમાં, જ્યારે સંદર્ભમાંથી અલિખિત સ્વર સાથે કોઈ શબ્દનું "અનુમાન" કરવામાં આવે છે, ત્યારે AI સંપૂર્ણપણે ખોટું વાંચન ઉત્પન્ન કરી શકે છે અને તેને આત્મવિશ્વાસપૂર્ણ ભાષામાં રજૂ કરી શકે છે. અક્ષરોમાં તફાવત, જેમ કે "કાબિલ" ને બદલે "કાબુલ" અથવા "અલીમ" ને બદલે "આલેમ", અર્થ સંપૂર્ણપણે બદલી નાખે છે. દરેક અનિશ્ચિત વાંચન વિકલ્પો સાથે રજૂ કરવું જોઈએ, અને કોઈ એક નિશ્ચિત વાંચન લાદવું જોઈએ નહીં.

એક ટેબલ સાથે સ્તરો અને જવાબદારી

સ્તર

સામગ્રી

AI ની ભૂમિકા

નિષ્ણાતની ભૂમિકા

છબી

મૂળ દસ્તાવેજ

-

સ્ત્રોત

HTR ડ્રાફ્ટ

કાચું મશીન વાંચન

પેદા કરે છે

શરૂઆતથી અંત સુધી નિયંત્રણ

લિવ્યંતરણ

લેટિન અક્ષર ટ્રાન્સપોઝિશન

ડ્રાફ્ટ સૂચવે છે

સુધારે છે, સુધારે છે

અનિશ્ચિતતાની નોંધો

[?] અને વિકલ્પો

ચિહ્નો

નક્કી કરે છે

સરળીકરણ

આજનું ટર્કિશ

ડ્રાફ્ટ સૂચવે છે

મંજૂરીઓ

વૈજ્ઞાનિક પ્રકાશન

અંતિમ ટેક્સ્ટ + નોંધો

-

માત્ર નિષ્ણાત

ત્રણ નાના કેસો

કેસ 1 — HTR એ પ્રથમ ડ્રાફ્ટની ઝડપ 5x વધારી છે. ડોક્ટરલ વિદ્યાર્થી 200-પાનાની ઓટ્ટોમન નોટબુકનું ટ્રાન્સક્રિપ્ટ કરશે. સંપૂર્ણ મેન્યુઅલ ટ્રાંસ્ક્રિપ્શન 60 કામકાજી દિવસોમાં અંદાજવામાં આવ્યું હતું. સમયગાળા માટે પ્રશિક્ષિત HTR મોડેલ સાથે, કાચો ડ્રાફ્ટ થોડા કલાકોમાં બહાર આવ્યો; વિદ્યાર્થીએ આ ડ્રાફ્ટમાં સુધારો કર્યો અને કામને 12 કામકાજના દિવસો સુધી ઘટાડ્યું. પરંતુ તેણે દરેક પૃષ્ઠને દસ્તાવેજ સાથે, લાઇન બાય લાઇનની તુલના કરવી પડી હતી; લગભગ 30% ડ્રાફ્ટ ખોટો હતો.

કેસ 2 - એક અક્ષર, એક અર્થ. એક સંશોધકે એઆઈએ "ગવર્નર" તરીકે વાંચેલા શબ્દ પર આધાર રાખ્યો. નિષ્ણાતના નિયંત્રણ હેઠળ, તે સમજી શકાયું હતું કે આ શબ્દ વાસ્તવમાં "વાલી" (બાળક/વ્યક્તિ માટે જવાબદાર) છે, અને સ્વર ચિહ્નિત ન હોવાથી, AI એ ખોટું અનુમાન લગાવ્યું. દસ્તાવેજનો કાનૂની અર્થ સંપૂર્ણપણે બદલાઈ રહ્યો હતો. પાઠ: ઓટ્ટોમન ટર્કિશમાં, એક અક્ષર/સ્વર તફાવતને કારણે દસ્તાવેજને શરૂઆતથી અર્થઘટન કરવામાં આવે છે; નિષ્ણાત જરૂરી છે.

કેસ 3 — કાલ્પનિક પૂર્ણતા. એક લીટીમાં જેની શાહી ખતમ થઈ ગઈ હતી અને જેમાંથી એક શબ્દ વાંચી ન શકાયો હતો, એઆઈ એ "તાર્કિક" શબ્દથી ખાલી જગ્યા ભરી દીધી. નિષ્ણાતને સમજાયું કે તે ગેપ વાસ્તવમાં એક સ્થળનું નામ હતું અને એઆઈએ તેને પૂર્ણ કર્યું છે. [અયોગ્ય] તરીકે જગ્યા છોડી. પાઠ: વાંચી ન શકાય તેવી જગ્યા ભરાઈ નથી, તે ચિહ્નિત થયેલ છે.

ચાર નકલ કરી શકાય તેવા નમૂનાઓ

1) લિવ્યંતરણ જે અસ્પષ્ટતાને જાળવી રાખે છે:

નીચે ઓટ્ટોમન દસ્તાવેજનું HTR કાચું આઉટપુટ/લિવ્યંતરણ છે. તમારું કાર્ય ટેક્સ્ટની સમીક્ષા કરવાનું છે અને સંભવિત વાંચન ભૂલોને ફ્લેગ કરવાનું છે. નિયમો: (1) દરેક શબ્દ માટે 2-3 સંભવિત વાંચન વિકલ્પો ઓફર કરો જેના વિશે તમને ખાતરી ન હોય, એક લાદશો નહીં. (2) અયોગ્ય વિસ્તારોમાં [અયોગ્ય] છોડી દો, તેમને ભરશો નહીં. (3) લખાણમાં અસ્તિત્વમાં ન હોય તેવા શબ્દો ઉમેરવા. (4) અસ્પષ્ટ સ્વરોવાળા શબ્દોમાં વિકલ્પો બતાવો. ટેક્સ્ટ: [અહીં]

2) સ્તરીય વાંચન (મૂળ + સરળીકરણ):

નીચેના ચકાસાયેલ ઓટ્ટોમન લિવ્યંતરણ માટે બે કૉલમ બનાવો: (1) મૂળ લિવ્યંતરણ (સ્પર્શ), (2) આજના ટર્કિશમાં સરળ વાંચન. અર્થ ઉમેરવું, સરળીકરણમાં અર્થઘટન ઉમેરવું; ફક્ત ભાષા અપડેટ કરો. અસ્પષ્ટ અર્થ [અસ્પષ્ટ] સાથે સ્થાનોને ચિહ્નિત કરો. લિવ્યંતરણ: [અહીં]

3) મુદત અને વ્યક્તિ નિષ્કર્ષણ:

નીચે ટ્રાન્સક્રિપ્શનમાં ઉલ્લેખિત વ્યક્તિગત નામો, સ્થળના નામ, શીર્ષકો અને સામયિક શબ્દો અલગ સૂચિમાં દેખાય છે. ટેક્સ્ટમાં સ્પષ્ટપણે ઉલ્લેખિત ફક્ત તે જ લો; અનુમાન લગાવીને ઉમેરશો નહીં. જો તમને ઉચ્ચારની ખાતરી ન હોય તો [?] વડે ચિહ્નિત કરો. ટેક્સ્ટ: [અહીં]

4) શંકાસ્પદ વાંચન નિયંત્રણ:

ભૂમિકામાં અનુભવી પેલિયોગ્રાફી નિયંત્રક. નીચેના ટ્રાંસ્ક્રિપ્શનમાં, એવા શબ્દોને ચિહ્નિત કરો કે જે અર્થમાં અસંગત છે, સમયગાળામાં બંધબેસતા નથી અથવા સંદર્ભમાં બંધબેસતા નથી, અને શા માટે તેઓ શંકાસ્પદ છે તે લખો. નિશ્ચિત કરેક્શન લાદવું; માનવ નિષ્ણાત દસ્તાવેજ સાથે સરખામણી કરશે તેવી શંકાઓની સૂચિ બનાવો. ટેક્સ્ટ: [અહીં]

નબળા પ્રોમ્પ્ટ / મજબૂત પ્રોમ્પ્ટ

નબળા:

આ ઓટ્ટોમન લખાણ વાંચો અને મને તેનો અનુવાદ આપો.

આ AI ને એકલ, નિશ્ચિત વાંચન, અસ્પષ્ટતા છુપાવવા અને ગાબડાંમાં ફિટ કરવા માટે દબાણ કરે છે. ઓટ્ટોમન ટર્કિશમાં, આ લગભગ બાંયધરીકૃત ભૂલ છે.

મજબૂત:

નીચે ઓટ્ટોમન લિવ્યંતરણ તપાસો. ચોક્કસ વાંચન: IMPOSITION. દરેક અસ્પષ્ટ શબ્દ માટે સંભવિત વિકલ્પો પ્રદાન કરો, [અયોગ્ય] ભાગોને છોડી દો, લખાણમાં ન હોય તેવું કંઈપણ ઉમેરશો નહીં. આજના ટર્કિશને એક અલગ કૉલમમાં સરળ વાંચન આપો, પરંતુ મૂળ રાખો. તમે જે કંઈપણ વિશે ચોક્કસ નથી તેને [?] સાથે ચિહ્નિત કરો જેથી નિષ્ણાત તેની તુલના દસ્તાવેજ સાથે કરી શકે. ટેક્સ્ટ: [અહીં]

તફાવત: સખત વાંચન પ્રતિબંધ, વિકલ્પોની વિનંતી કરવી, વ્હાઇટસ્પેસ સાચવવી અને સ્તરવાળી આઉટપુટ નિષ્ણાત ચકાસણીને સક્ષમ કરે છે.

સામાન્ય ભૂલો

  • HTR ડ્રાફ્ટને સાચો ગણાવવો. ઓટ્ટોમન ટર્કિશમાં, મોટા ભાગનો કાચો ડ્રાફ્ટ અચોક્કસ હોઈ શકે છે; લાઇન બાય લાઇન નિયંત્રણ આવશ્યક છે.
  • માત્ર નિશ્ચિત વાંચન લાદવાનું છે. જો એવા શબ્દોમાં વિકલ્પો છુપાયેલા હોય કે જેના સ્વરો લખાયા ન હોય, તો ખોટો અર્થ નોંધવામાં આવશે.
  • વાંચી ન શકાય તેવા વિસ્તારમાં ભરવું. તે સફેદ જગ્યા [અયોગ્ય] દ્વારા સુરક્ષિત હોવું જોઈએ, બનેલું નથી.
  • સરળીકરણ સાથે મૂળ મિશ્રણ. સરળીકરણ એક અલગ સ્તર હોવું જોઈએ; મૂળ લિવ્યંતરણ વિકૃત ન હોવું જોઈએ.
  • નિષ્ણાતને અક્ષમ કરી રહ્યું છે. પેલેઓગ્રાફી અને પીરિયડના જ્ઞાન વિના, એઆઈનું વાંચન એ કોઈ વૈજ્ઞાનિક મૂલ્ય વિનાનું અનુમાન છે.

સારાંશમાં

એચટીઆર અને એઆઈ સાથે કાચા ડ્રાફ્ટ સ્ટેજ પર ઓટ્ટોમન અને હસ્તપ્રત ટ્રાન્સક્રિપ્શનને મોટા પ્રમાણમાં ઝડપી કરી શકાય છે; તમને પ્રથમ આઉટપુટ મળે છે જે કામના દિવસોને કલાકોમાં ઘટાડી દે છે. પરંતુ તે આ ક્ષેત્રમાં ચોક્કસપણે છે કે એક અક્ષર, એક સ્વર તફાવત અર્થ બદલે છે; AI અનિશ્ચિતતાને છુપાવવા અને ખાલી જગ્યાઓ ભરવાનું વલણ ધરાવે છે. યોગ્ય પદ્ધતિ સ્તરવાળી છે: કાચી રૂપરેખા, અસ્પષ્ટતાની વૈકલ્પિક નોંધ, સરળીકરણનું એક અલગ સ્તર અને સૌથી ઉપર, પેલેઓગ્રાફીથી પરિચિત નિષ્ણાત દ્વારા દસ્તાવેજની લાઇન-બાય-લાઇન ચકાસણી. AI પ્રારંભિક વાંચનને ઝડપી બનાવે છે; વૈજ્ઞાનિક જવાબદારી નિષ્ણાતની છે.

એપ્લિકેશન કાર્ય

ઓટ્ટોમન અથવા હસ્તપ્રત દસ્તાવેજનું લિવ્યંતરણ મેળવો (તમારું પોતાનું ઉત્પાદન અથવા પ્રકાશિત નકલ). AI ને "અસ્પષ્ટતા-સંરક્ષિત લિવ્યંતરણ" ટેમ્પલેટ સાથે વૈકલ્પિક વાંચન માટે પૂછો. પછી "લેયર્ડ રીડિંગ" વડે અલગથી સરળીકરણ સ્તર જનરેટ કરો. નિષ્ણાત સ્ત્રોત અથવા શબ્દકોશ સાથે અસ્પષ્ટ રીતે ચિહ્નિત થયેલ દરેક શબ્દની તુલના કરો; નોંધ કરો કે જો AI એક જ રીડિંગ લાદશે તો તે કેટલી ભૂલો પેદા કરશે.

ચેકલિસ્ટ

  • [ ] મેં સમયગાળા અને લેખન શૈલીને અનુરૂપ HTR/મોડલનો ઉપયોગ કર્યો છે.
  • [ ] મેં AI ને ચોક્કસ વાંચનના વિકલ્પો માટે પૂછ્યું.
  • [ ] મેં વાંચી ન શકાય તેવા ભાગોને [ન વાંચી શકાય તેવા] વડે સુરક્ષિત કર્યા.
  • [ ] મેં મૂળ લિવ્યંતરણને સરળીકરણથી અલગ રાખ્યું છે.
  • [ ] મારી પાસે પેલેઓગ્રાફી જાણતા નિષ્ણાત/દસ્તાવેજી દ્વારા ચકાસાયેલ અંતિમ લખાણ હતું.