નફો:
- OCR/HTR સાથે ડ્રાફ્ટ ટેક્સ્ટમાં શિલાલેખો અને હસ્તપ્રતોનું ટ્રાન્સક્રિપ્ટ કરતી વખતે વાંચેલા અક્ષર અને અંદાજિત પૂર્ણતાને અલગ અને ચિહ્નિત રાખવાની ક્ષમતા
- અસ્પષ્ટ ટેક્સ્ટ પૂર્ણતા, ખોટા અનુવાદ અને બનાવટી એટ્રિબ્યુશન જેવા આભાસના સ્વરૂપોને ઓળખવાની ક્ષમતા, અને સ્રોત અને બેક-ટ્રાન્સલેશન સામે અનુવાદને તપાસવાની ક્ષમતા.
- ભાષા, લેખન અને શૈલીનો સંદર્ભ કેવી રીતે કૃત્રિમ બુદ્ધિની વિશ્વસનીયતા નક્કી કરે છે તે સમજવાની ક્ષમતા અને અંતિમ વાંચન અને અર્થઘટન નિષ્ણાત ફિલોલોજિસ્ટનું છે
ભૂતકાળમાંથી આપણા માટે બાકી રહેલા સૌથી સીધા અવાજોમાંનો એક લેખિત સ્ત્રોત છે: પથ્થર, માટીની ગોળીઓ, પેપાયરી, ચર્મપત્ર હસ્તપ્રતો, કબરના પત્થરો અને સીલ પર કોતરવામાં આવેલા શિલાલેખો. આ એકમમાં, આપણે જોઈશું કે કેવી રીતે એપિગ્રાફી (પથ્થર, ધાતુ, સિરામિક્સ જેવી સખત સપાટી પર કોતરેલા શિલાલેખોનો અભ્યાસ કરવાનું વિજ્ઞાન), પેલેઓગ્રાફી (પ્રાચીન હસ્તલેખન વાંચવાની અને ડેટિંગ કરવાની કુશળતા) અને AI આ ગ્રંથોના વાંચન, અનુવાદ અને સંપાદનને વેગ આપે છે, પરંતુ શા માટે દરેક વાંચનની પુષ્ટિ નિષ્ણાત ફિલોલોજિસ્ટ દ્વારા થવી જોઈએ.
મૂળભૂત સિદ્ધાંત: AI અસ્પષ્ટ ટેક્સ્ટ વાંચવામાં, ભાષાનો અનુવાદ કરવામાં અને સંભવિત પૂરક સૂચનોમાં મદદ કરે છે; પરંતુ શિલાલેખનું અંતિમ વાંચન, ગુમ થયેલ અક્ષરો અને અર્થની સમાપ્તિ એ ભાષા અને સમયગાળો જાણતા નિષ્ણાતનો નિર્ણય છે. તે આ ક્ષેત્રમાં છે કે AI ને આભાસનું સૌથી મોટું જોખમ છે, કારણ કે મોડેલ ગુમ થયેલ અથવા અસ્પષ્ટ ટેક્સ્ટને કંઈક "બુદ્ધિગમ્ય" પરંતુ બનાવેલ સાથે ભરવા માટે ખૂબ જ સંવેદનશીલ છે.
લેખિત સ્ત્રોતો સાથે કામ કરવાનાં પગલાં
1. દસ્તાવેજીકરણ. શિલાલેખ અથવા હસ્તપ્રત ઉચ્ચ રીઝોલ્યુશન, કોન્ટ્રાસ્ટ-ઉન્નત ફોર્મેટમાં પ્રદર્શિત થાય છે. અસ્પષ્ટ સપાટીઓ માટે, ખાસ લાઇટિંગ (સાઇડ લાઇટ) અને RTI જેવી તકનીકોનો ઉપયોગ કરવામાં આવે છે; AI કોન્ટ્રાસ્ટ અને અક્ષરની ધારને શાર્પન કરવામાં મદદ કરે છે.
2. પાત્રની ઓળખ. OCR (ઓપ્ટિકલ કેરેક્ટર રેકગ્નિશન) નો ઉપયોગ મુદ્રિત ટેક્સ્ટ માટે થાય છે, અને HTR (હસ્તલેખિત ટેક્સ્ટ રેકગ્નિશન) નો ઉપયોગ હસ્તલેખન માટે થાય છે. AI-આધારિત HTR જૂની હસ્તપ્રતોને ટ્રાન્સક્રિપ્ટ કરવામાં શક્તિશાળી છે.
3. ટ્રાન્સક્રિપ્શન અને પૂર્ણતા. નિસ્તેજ અથવા તૂટેલા ભાગો માટે, નિષ્ણાત વ્યાકરણ અને સમાંતર પાઠોના આધારે સંભવિત પુનઃસ્થાપન સૂચવે છે. પૂર્ણ થયેલ અક્ષરો હંમેશા ચોરસ કૌંસ જેવા ચિહ્નો દ્વારા સૂચવવામાં આવે છે; શું વાંચવામાં આવે છે અને શું આગાહી કરવામાં આવે છે તે ક્યારેય મૂંઝવણમાં નથી.
4. અનુવાદ. ટેક્સ્ટનો અનુવાદ સ્રોત ભાષા (લેટિન, પ્રાચીન ગ્રીક, ઓટ્ટોમન, ક્યુનિફોર્મ ભાષાઓ, વગેરે) માંથી કરવામાં આવ્યો છે. AI પ્રથમ ડ્રાફ્ટ અનુવાદ આપે છે; નિષ્ણાત સૂક્ષ્મ પરિભાષા અને ઐતિહાસિક સંદર્ભને સુધારે છે.
5. ટિપ્પણી. લખાણ શું કહે છે, કોણે લખ્યું છે અને તે કઈ ઘટનાનો ઉલ્લેખ કરે છે તે ઐતિહાસિક અર્થઘટન છે અને તે નિષ્ણાતની છે.
ટીપ: જો તમે AI ને અસ્પષ્ટ ટેક્સ્ટ "વાંચવા અને પૂર્ણ" કરવાનું કહો, તો તે સુરક્ષિત રીતે ખાલી જગ્યાઓ બનાવશે. તેના બદલે, કહો કે "ફક્ત સ્પષ્ટ રીતે વાંચી શકાય તેવા અક્ષરો આપો, ખાલી છોડી દો અને જ્યાં તમને ખાતરી ન હોય તેવા વિસ્તારોને ચિહ્નિત કરો". વાજબીતા સાથે, એક અલગ પગલામાં પૂર્ણ કરવા માટે કહો, અને નિષ્ણાત દ્વારા તેની પુષ્ટિ કરવાની ખાતરી કરો.
આભાસ: આ વિસ્તારનો સૌથી મોટો ભય
માનવતામાં AI ની સૌથી વિનાશક ભૂલ ફેબ્રિકેશન છે. આ ક્ષેત્રમાં ચાર લાક્ષણિક સ્વરૂપો છે:
- ટેક્સ્ટ ફેબ્રિકેશન: અસ્પષ્ટ શિલાલેખના અસ્તિત્વમાં ન હોય તેવા ભાગને "સંપૂર્ણ" કરે છે, જેમાં અસ્તિત્વમાં નથી એવો શબ્દ ઉમેરીને.
- નકલી ભાષાંતર: તે અસ્ખલિત રીતે ન સમજી શકતો શબ્દનો અનુવાદ કરે છે પરંતુ ખોટી રીતે; વાચક ધ્યાન આપી શકતા નથી કારણ કે તે સ્ત્રોતને જાણતો નથી.
- બનાવટી સંદર્ભ: તે કહે છે કે "આ શિલાલેખ તે પ્રકાશનમાં પ્રકાશિત થયો હતો", પરંતુ તે પ્રકાશન અસ્તિત્વમાં નથી.
- મિસડેટિંગ/એટ્રિબ્યુશન: વિશ્વાસપૂર્વક ખોટા સમયગાળામાં લખવાની શૈલી મૂકે છે.
આ બધાનો ઉપયોગ કોઈ નિષ્ણાત દ્વારા પુષ્ટિ કર્યા વિના કરી શકાતો નથી જે સ્રોત જુએ છે અને ભાષા જાણે છે.
ધ્યાન આપો: ભાષાંતર અસ્ખલિત અને વિશ્વાસપાત્ર હોવાનો અર્થ એ નથી કે તે સાચો છે. AI એક ક્યુનિફોર્મ ચિહ્નને પણ રૂપાંતરિત કરી શકે છે જેને તે આત્મવિશ્વાસપૂર્ણ વાક્યમાં સમજી શકતું નથી. કોઈ વ્યક્તિ જે સ્રોત ટેક્સ્ટને વાંચી શકતું નથી તે ક્યારેય AI અનુવાદની ચોકસાઈ જાતે ચકાસી શકશે નહીં.
ત્રણ નાના કેસો
કેસ 1 — HTR એ આર્કાઇવ ખોલ્યું. એક આર્કાઇવમાં ઓટ્ટોમન હસ્તપ્રતોના હજારો પૃષ્ઠો સંશોધકો માટે બંધ રાખવામાં આવ્યા હતા કારણ કે તેમને વાંચવા માટે કુશળતા અને સમયની જરૂર હતી. AI-આધારિત HTR નોટબુકને શોધી શકાય તેવા ડ્રાફ્ટ ટેક્સ્ટમાં ટ્રાન્સક્રિપ્ટ કરે છે; નિષ્ણાતોએ ડ્રાફ્ટને સુધાર્યો અને વાંચી ન શકાય તેવા વિસ્તારોને ચિહ્નિત કર્યા. તે સંપૂર્ણ ટેક્સ્ટ નથી, પરંતુ એક શક્તિશાળી સ્કેનિંગ સાધન ઉભરી આવ્યું છે.
કેસ 2 - બનાવટી પૂર્ણતા પકડાઈ. એક વિદ્યાર્થીએ એઆઈને તૂટેલા લેટિન કબરનો પથ્થર વાંચ્યો હતો; AI એ અસ્ખલિત વાક્યમાં ખૂટતી રેખા "પૂર્ણ" કરી. એપિગ્રાફરે દર્શાવ્યું હતું કે સૂચિત પૂર્ણ કરવું ભૌતિક રીતે અશક્ય હતું કારણ કે પથ્થરમાં કોઈ જગ્યા બાકી ન હતી. સમાપ્તિનું પુનઃનિર્માણ કરવામાં આવ્યું હતું અને સમાંતર શિલાલેખોના આધારે ચિહ્નિત કરવામાં આવ્યું હતું.
કેસ 3 — નકલી અનુવાદ સુધારેલ. એક ટીમ એઆઈના પ્રાચીન ગ્રીક શિલાલેખના અનુવાદની જાણ કરશે; જ્યારે ફિલોલોજિસ્ટે તપાસ કરી, ત્યારે તેણે જોયું કે AI એ ક્રિયાપદનો ખોટા તંગમાં અનુવાદ કર્યો છે, જે ટેક્સ્ટનો અર્થ ઉલટાવી રહ્યો છે (પછી ભલે તે અર્પણ હોય કે સ્મારક હોય). સ્ત્રોત પર પાછા જઈને ટિપ્પણી સાચવી.
ચાર નકલ કરી શકાય તેવા નમૂનાઓ
1) રૂઢિચુસ્ત ટ્રાન્સક્રિપ્શન:
તમારી ભૂમિકા: ટ્રાન્સક્રિપ્શન સહાયક. આ શિલાલેખ/હસ્તપ્રત ઇમેજમાં, ફક્ત સ્પષ્ટ વાંચી શકાય તેવા અક્ષરો આપો. અસ્પષ્ટ, તૂટેલા અથવા અનિશ્ચિત વિસ્તારો વાંચશો નહીં; તેને "[વાંચી ન શકાય તેવું]" તરીકે ચિહ્નિત કરો. ખૂટતા ભાગોને પૂર્ણ કરો. તમને શંકા હોય તેવા પાત્રોની પણ નોંધ લો.
2) તર્કબદ્ધ પૂર્ણતા દરખાસ્ત:
નીચે ચોક્કસ વાંચન ભાગો અને [જગ્યાઓ] સાથેનો ટેક્સ્ટ છે. અંતર માટે સંભવિત પૂરક સૂચન કરો, પરંતુ દરેક સૂચન માટે: (a) વાજબીપણું (વ્યાકરણ, સમાંતર ટેક્સ્ટ), (b) શું અંતર અક્ષરોની સંખ્યાને બંધબેસે છે કે કેમ, (c) વિકલ્પો. આ સૂચનો છે; ચોક્કસ વાંચન નથી. જણાવો કે નિષ્ણાતની મંજૂરી જરૂરી છે.
3) ડ્રાફ્ટ અનુવાદ (સ્રોત સુરક્ષિત):
નીચેના [ભાષા] ટેક્સ્ટનો અનુવાદ કરો. દરેક વાક્યની બાજુમાં સ્રોત ટેક્સ્ટ રાખો (લાઇન દ્વારા રેખા સંરેખિત કરો). તમને ખાતરી ન હોય તેવા શબ્દોને ચિહ્નિત કરો અને વૈકલ્પિક અનુવાદ આપો. શરતો બનાવશો નહીં; જો તમને ખબર ન હોય, તો "અનિશ્ચિત" લખો. આ એક ડ્રાફ્ટ છે; નિષ્ણાત ફિલોલોજિસ્ટ તપાસ કરશે.
4) અનુવાદની ચકાસણી (પાછળનો અનુવાદ):
આ અનુવાદને BACK સ્ત્રોત ભાષામાં અનુવાદિત કરો અને મૂળ સ્રોત ટેક્સ્ટ સાથે તેની તુલના કરો. તે ભાગોને ચિહ્નિત કરો જ્યાં અર્થ બદલાયો છે, ઉમેરવામાં આવ્યો છે અથવા છોડવામાં આવ્યો છે. ખાસ કરીને સમય, વિષય અને સંખ્યાઓ તપાસો.
નબળા પ્રોમ્પ્ટ / મજબૂત પ્રોમ્પ્ટ
નબળા પ્રોમ્પ્ટ:
આ પ્રાચીન શિલાલેખ વાંચો અને અમને જણાવો કે તે શું કહે છે.
એક અસ્પષ્ટ શિલાલેખમાં, AI અંતર બનાવે છે, ભાષાનો ખોટો અનુવાદ કરી શકે છે, અને જે વ્યક્તિ સ્રોતને જોતો નથી તે આની નોંધ લેશે નહીં.
શક્તિશાળી પ્રોમ્પ્ટ:
આ શિલાલેખની ઈમેજમાં, પહેલા માત્ર સ્પષ્ટ રીતે વાંચી શકાય તેવા અક્ષરો લખો, અસ્પષ્ટ ભાગો "[વાંચી ન શકાય તેવા]" છોડીને. પછી અલગથી, વાજબીપણું સાથેના અંતર માટે સંભવિત પૂરક સૂચન કરો પરંતુ કોઈ ચોક્કસ ઓફર કરશો નહીં. છેલ્લે, ડ્રાફ્ટ અનુવાદ પ્રદાન કરો અને તે શબ્દોને ચિહ્નિત કરો જેના વિશે તમને ખાતરી નથી. બધા નિષ્ણાતની મંજૂરીને આધીન છે.
તફાવત: પ્રથમ એક કાલ્પનિક "વાંચન" આપે છે; બાદમાં વાંચન, અનુમાનિત અને અનુવાદિત સ્તરોને અલગ અને ચકાસી શકાય તેવું રાખે છે.
AI ની ભાષાઓ, સ્ક્રિપ્ટો અને જ્ઞાન સીમા
પુરાતત્વીય ગ્રંથો ભાષાઓ અને સ્ક્રિપ્ટોની વિશાળ શ્રેણીમાં ફેલાયેલા છે: લેટિન અને પ્રાચીન ગ્રીક શિલાલેખો, ઓટ્ટોમન અને અરબી હસ્તપ્રતો, ક્યુનિફોર્મ ટેબ્લેટ્સ, ઇજિપ્તીયન હિયેરોગ્લિફ્સ, રૂનિક શિલાલેખો અને વધુ. આ ભાષાઓ અને સ્ક્રિપ્ટો પર AI પ્રાવીણ્ય ખૂબ અસમાન છે. જ્યારે લેટિન અને પ્રાચીન ગ્રીક જેવી વિપુલ પ્રમાણમાં ડિજિટલ ટેક્સ્ટ ધરાવતી ભાષાઓ માટે ડ્રાફ્ટ અનુવાદ વાજબી હોઈ શકે છે, જે લખાણો ભાગ્યે જ દસ્તાવેજીકૃત, ડિસિફર અથવા માત્ર થોડા નિષ્ણાતો દ્વારા વાંચવામાં આવે છે, AI લગભગ સંપૂર્ણ રીતે અવિશ્વસનીય છે; આ વિસ્તારોમાં વિશ્વાસપાત્ર પરંતુ સંપૂર્ણપણે બનાવટી "અનુવાદ" ઉત્પન્ન કરે છે.
સંદર્ભ અને શૈલીનો મુદ્દો પણ છે. કાનૂની દસ્તાવેજ, પ્રાર્થના લખાણ અને કબરના પત્થરમાં સમાન શબ્દના જુદા જુદા અર્થ હોઈ શકે છે. નિષ્ણાત ફિલોલોજિસ્ટ ટેક્સ્ટનો પ્રકાર (ભક્તિ, સ્મારક, કરાર, પત્ર) ઓળખે છે અને યોગ્ય સંદર્ભમાં શબ્દ વાંચે છે; AI માં આ સામાન્ય સંવેદનશીલતાનો અભાવ છે અને તે સૌથી સામાન્ય અર્થ લાદે છે. સંક્ષેપ, સૂત્રો અને સ્ટોક અભિવ્યક્તિઓ (ખાસ કરીને શિલાલેખોમાં ખૂબ જ સામાન્ય) સરળતાથી AI ને ગેરમાર્ગે દોરે છે.
તેથી સુવર્ણ નિયમ છે: તમે જાણો છો તે ભાષાઓ માટે પ્રવેગક તરીકે AI નો ઉપયોગ કરો, જે ભાષાઓ તમે નિયંત્રિત કરી શકો છો; તમે વાંચી શકતા નથી તે ભાષામાં એકલા AI અનુવાદ પર ક્યારેય આધાર રાખશો નહીં. કોઈ વ્યક્તિ જે સ્ત્રોત વાંચી શકતો નથી તે અનુવાદની ચોકસાઈ ચકાસી શકતો નથી અને તેથી તે અનુવાદને વૈજ્ઞાનિક દાવામાં ફેરવી શકતો નથી.
ટીપ: AI ને ટેક્સ્ટ આપતી વખતે, તેની ભાષા, અંદાજિત સમયગાળો અને પ્રકાર (શિલાલેખ/પત્ર/દસ્તાવેજ) નો ઉલ્લેખ કરો. સંદર્ભ જ્ઞાન સૌથી સામાન્ય પરંતુ ખોટા વાંચન તરફ AI ના પ્રવાહને આંશિક રીતે ઘટાડે છે — પરંતુ પુષ્ટિની જરૂરિયાતને દૂર કરતું નથી.
લેખિત સંસાધન કાર્ય કોષ્ટક
ક્વેસ્ટ
AI ની ભૂમિકા
માનવ નિર્ણય
ચકાસણી
છબી વૃદ્ધિ
કોન્ટ્રાસ્ટ/એજ
માપદંડની પસંદગી
મૂળ સાથે સરખામણી
OCR/HTR
ડ્રાફ્ટ ટેક્સ્ટ
અનિશ્ચિત પાત્ર
નિષ્ણાત પ્રૂફરીડિંગ
પૂર્ણતા
ભલામણ (તર્કબદ્ધ)
સ્વીકારો/નકારો
સમાંતર ટેક્સ્ટ, સ્થાન નિયંત્રણ
અનુવાદ
ડ્રાફ્ટ
સૂક્ષ્મતા, પદ
પાછળનો અનુવાદ, સ્ત્રોત
ટિપ્પણી
સંદર્ભ સારાંશ
ઐતિહાસિક અર્થ
નિષ્ણાત, સાહિત્ય
સામાન્ય ભૂલો
- અસ્પષ્ટ લખાણ પૂર્ણ કરી રહ્યા છીએ. AI અંતરને બંધબેસે છે; વાંચન અને અનુમાનને અલગ અને ચિહ્નિત કરવા જોઈએ.
- સ્ત્રોત જોયા વિના અનુવાદ પર વિશ્વાસ કરવો. અસ્ખલિત અનુવાદ એ સાચો અનુવાદ નથી.
- બનાવેલ એટ્રિબ્યુશન સ્વીકારવું. "તે બ્રોડકાસ્ટ પર છે" કહેવા માટે પુષ્ટિની જરૂર છે.
- પૂર્ણતાનું ભૌતિક સ્થાન તપાસી રહ્યું નથી. દરખાસ્ત તૂટેલી જગ્યામાં ફિટ થવી જોઈએ.
- AI પર અર્થઘટન છોડીને. ટેક્સ્ટનો ઐતિહાસિક અર્થ નિષ્ણાત ફિલોલોજિસ્ટની બાબત છે.
સારાંશમાં
એપિગ્રાફી અને પ્રાચીન ગ્રંથોમાં AI; તે નોંધપાત્ર રીતે ઇમેજ સુધારણા, HTR/OCR ડ્રાફ્ટ, પૂર્ણતા દરખાસ્ત અને ડ્રાફ્ટ અનુવાદને ઝડપી બનાવે છે અને સંશોધન માટે બંધ આર્કાઇવ્સ ખોલે છે. પરંતુ આ તે ક્ષેત્ર છે જ્યાં આભાસનું જોખમ સૌથી વધુ છે: વાંચનને અનુમાનથી અલગ કરવામાં આવે છે, પૂરકને ચિહ્નિત કરવામાં આવે છે, અનુવાદને સ્રોત અને બેક-ટ્રાન્સલેશન સામે તપાસવામાં આવે છે, અને અંતિમ વાંચન અને અર્થઘટન નિષ્ણાત ફિલોલોજિસ્ટનું હોય છે.
એપ્લિકેશન કાર્ય
એક શિલાલેખ અથવા હસ્તપ્રત છબી પસંદ કરો (ખુલ્લા ઍક્સેસ સંગ્રહમાંથી). "કંઝર્વેટિવ ટ્રાંસ્ક્રિપ્શન" ટેમ્પલેટ સાથે માત્ર સ્પષ્ટ અક્ષરો કાઢો, પછી "તર્કપૂર્ણ પૂર્ણતા સૂચન" સાથે જગ્યાઓ માટે સૂચનો મેળવો. ડ્રાફ્ટ અનુવાદ તૈયાર કરો અને તેને "અનુવાદ ચકાસણી" ટેમ્પલેટ સાથે ફરીથી અનુવાદ કરો અને જ્યાં અર્થ બદલાઈ ગયો છે ત્યાં ચિહ્નિત કરો. જો શક્ય હોય તો પ્રકાશિત વાંચન સાથે સરખામણી કરો.
ચેકલિસ્ટ
- [ ] મેં વાંચેલા પાત્રને અને આગાહીની પૂર્ણતાને અલગથી ચિહ્નિત કરી છે.
- [ ] મેં તપાસ્યું કે પૂર્ણતા તૂટેલા વિસ્તારમાં ફિટ છે.
- [ ] મેં સ્રોત ટેક્સ્ટ અને પાછળના અનુવાદ સામે અનુવાદને તપાસ્યો.
- [ ] મેં વાસ્તવિક કેટલોગમાં YZ દ્વારા આપવામાં આવેલા પ્રકાશનો/ઉદ્ધરણોની પુષ્ટિ કરી છે.
- [] મેં અંતિમ વાંચન અને અર્થઘટન નિષ્ણાતની મંજૂરી પર છોડી દીધું.