युनिट्स
1. इतिहास आणि संग्रहणातील कृत्रिम बुद्धिमत्तेचा परिचय: भूमिका, सीमा, प्रमाणीकरण आणि नीतिशास्त्र 2. दस्तऐवज डिजिटायझेशन आणि ओसीआर: मुद्रित मजकूर मशीन टेक्स्टमध्ये रूपांतरित करणे 3. लिप्यंतरण: ऑट्टोमन तुर्की आणि हस्तलिखिते 4. मेटाडेटा, कॅटलॉगिंग आणि वर्गीकरण 5. स्रोत स्कॅनिंग, शोध आणि सारांश 6. ऐतिहासिक भाषांतर आणि सरलीकरण 7. स्त्रोत पडताळणी, अनाक्रोनिझम आणि भ्रम 8. सामग्री विश्लेषण आणि नमुना शोध 9. संग्रहण प्रवेश, वर्णन आणि वापरकर्ता सेवा 10. संरक्षण, जीर्णोद्धार आणि डिजिटल संरक्षण 11. नैतिकता, कॉपीराइट, गोपनीयता आणि सांस्कृतिक संवेदनशीलता 12. एंड-टू-एंड प्रोजेक्ट: आर्टिफिशियल इंटेलिजन्ससह संग्रहण संग्रहावर प्रक्रिया करणे
युनिट 3 / 12

लिप्यंतरण: ऑट्टोमन तुर्की आणि हस्तलिखिते

नफा:

  • एचटीआर आणि लिप्यंतरण वर्कफ्लो सेट करण्याची क्षमता आणि कच्च्या मसुद्यासाठी ओळीनुसार तज्ञ तपासण्याची आवश्यकता का आहे हे स्पष्ट करण्याची क्षमता
  • ऑट्टोमन तुर्कीमध्ये स्वर/अक्षर अस्पष्टतेच्या बाबतीत अचूक वाचन लादण्याऐवजी पर्याय विचारून वाचता न येणाऱ्या भागांचे संरक्षण करण्याची क्षमता
  • पॅलिओग्राफरकडे अंतिम वैज्ञानिक जबाबदारी ठेवून मूळ लिप्यंतरण सरलीकरणाच्या वेगळ्या स्तरापासून वेगळे करण्याची क्षमता

कदाचित ऐतिहासिक संशोधनाचा सर्वात महत्त्वाचा भाग म्हणजे हस्तलिखिते आणि जुन्या लिखित दस्तऐवजांचे वाचनीय मजकुरात लिप्यंतरण करणे. एखादे पत्र, नोटबुक, कोर्ट रेकॉर्ड किंवा ऑट्टोमन दस्तऐवज लिप्यंतरण केल्यावरच शोधण्यायोग्य बनतात. ट्रान्सक्रिप्शन म्हणजे दस्तऐवजातील सामग्री (बहुतेकदा हस्तलिखित किंवा प्राचीन लिपी) लिखित, वाचनीय मजकुरात हस्तांतरित करण्याची क्रिया. ऑट्टोमनच्या बाबतीत, हे सहसा लिप्यंतरणासह असते: अरबी अक्षरांमधील मजकूर त्याच्या अक्षर-दर-अक्षर समतुल्यांसह लॅटिन अक्षरांमध्ये हस्तांतरित करणे.

छापील मजकुरासाठी आम्ही ओसीआर वापरला; हस्तलेखनासाठी वेगळ्या तंत्रज्ञानाची आवश्यकता आहे: HTR (हस्तलिखित मजकूर ओळख). HTR हे OCR सारखेच तंत्रज्ञान आहे परंतु त्याहून अधिक आव्हानात्मक आहे जे हस्तलिखित दस्तऐवजांना मशीन टेक्स्टमध्ये रूपांतरित करते. या युनिटमध्ये आपण ऑट्टोमन आणि हस्तलिखित ट्रान्सक्रिप्शनमध्ये एचटीआर आणि एआय कसे वापरायचे ते पाहू, त्रुटीचे मार्जिन आणि सत्यापन येथे अधिक गंभीर का आहे.

हस्तलेखन इतके अवघड का आहे?

मुद्रित मजकूरापेक्षा हस्तलेखन अधिक परिवर्तनशील आहे: प्रत्येक लेखकाचा एक अद्वितीय हात असतो, अक्षरे एकमेकांशी जोडलेली असतात, संक्षेप आणि विशेष चिन्हे वापरली जातात, शाई निघते, कागद संपतो. ऑट्टोमन तुर्कीमध्ये अडचण गुणाकार आहे:

  • संदर्भित अक्षरे: शब्दाच्या सुरुवातीला, मध्यभागी आणि शेवटी एकच अक्षर वेगळ्या पद्धतीने लिहिले जाते.
  • स्वर न लिहिता : लघु स्वर अनेकदा लिहिल्या जात नाहीत; वाचक संदर्भातून पूर्ण करतो. यामुळे "स्वीकृती की नकार?" यासारख्या संदिग्धता निर्माण होतात.
  • वेगवेगळ्या लेखनशैली: रिका, दिवानी, तालिक यासारख्या हस्तलेखनाच्या वेगवेगळ्या शैली आहेत; प्रत्येकाला वेगळे वाचन कौशल्य आवश्यक आहे.
  • ऑट्टोमन शब्दसंग्रह: अरबी आणि पर्शियन भाषेतील शब्द जे आजच्या तुर्कीमध्ये अस्तित्वात नाहीत.

म्हणून, HTR आणि AI प्रिंट OCR पेक्षा ऑट्टोमन तुर्कीमध्ये त्रुटीच्या खूप जास्त फरकाने कार्य करतात. तज्ञ पॅलिओग्राफरचा डोळा (पॅलिओग्राफी - प्राचीन लेखन वाचण्याचे शास्त्र) हे येथे साधन नाही, तर एक गरज आहे.

कार्यप्रवाह: चरण-दर-चरण

1. दस्तऐवज गुणवत्ता तयार करा. OCR प्रमाणे, उच्च रिझोल्यूशन आणि चांगले कॉन्ट्रास्ट आवश्यक आहे. हस्तलेखनात हे आणखी गंभीर आहे.

2. HTR मॉडेल निवडा. ऑट्टोमन, अरबी हस्तलेखन किंवा विशिष्ट कालावधीसाठी विशेषतः प्रशिक्षित एचटीआर मॉडेल सामान्य मॉडेलपेक्षा अधिक यशस्वी आहेत. कालावधी आणि लेखन शैलीसाठी कोणते मॉडेल चांगले कार्य करते ते तपासा.

3. रॉ ट्रान्सक्रिप्शन व्युत्पन्न करा. HTR मॉडेल बाह्यरेखा तयार करते. ऑट्टोमन तुर्की भाषेत, हा मसुदा त्रुटींनी भरलेली एक सुरुवात आहे जी अनुभवी डोळ्यांनी नीट तपासली पाहिजे.

4. AI सह संदर्भात्मक सुधारणा. तुमच्याकडे AI ध्वजाची विसंगती, संभाव्य वाचन पर्याय आणि कच्च्या आउटपुटमध्ये संशयास्पद स्थाने असू शकतात. परंतु एआय "सुधारणा" येथे विशेषतः धोकादायक आहे: हे एक काल्पनिक वाचन सुचवू शकते.

5. लिप्यंतरण आणि सरलीकरण (स्तरित). अरबी अक्षरांमधील मजकूराचे लॅटिन अक्षरांमध्ये लिप्यंतरण, त्यानंतर आजच्या तुर्कीमध्ये त्याचे सरलीकृत वाचन, स्वतंत्र स्तर म्हणून तयार केले जाते. मूळ कधीच तुटत नाही.

6. तज्ञ पडताळणी. दस्तऐवजाशी तुलना करून पॅलिओग्राफी आणि कालावधीचे ज्ञान असलेल्या तज्ञाद्वारे अंतिम प्रतिलेखन मंजूर केले जाते.

लक्ष द्या: ओटोमन तुर्कीमध्ये, संदर्भातील अलिखित स्वर असलेल्या शब्दाचा "अंदाज" करताना, एआय पूर्णपणे चुकीचे वाचन तयार करू शकते आणि आत्मविश्वासपूर्ण भाषेत सादर करू शकते. अक्षरांमधील फरक, जसे की "काबिल" ऐवजी "काबुल" किंवा "अलिम" ऐवजी "अलेम", अर्थ पूर्णपणे बदलतो. प्रत्येक अनिश्चित वाचन पर्यायांसह सादर केले जावे आणि कोणतेही निश्चित वाचन लादले जाऊ नये.

टेबलसह स्तर आणि जबाबदारी

थर

सामग्री

AI ची भूमिका

तज्ञाची भूमिका

प्रतिमा

मूळ दस्तऐवज

-

स्त्रोत

HTR मसुदा

रॉ मशीन रीडिंग

निर्मिती करते

सुरुवातीपासून शेवटपर्यंत नियंत्रण

लिप्यंतरण

लॅटिन अक्षर बदलणे

मसुदा सुचवतो

दुरुस्त करतो, दुरुस्त करतो

अनिश्चिततेच्या नोट्स

[?] आणि पर्याय

चिन्हे

ठरवते

सरलीकरण

आजचे तुर्की

मसुदा सुचवतो

मंजूरी

वैज्ञानिक प्रकाशन

अंतिम मजकूर + नोट्स

-

फक्त तज्ञ

तीन लहान प्रकरणे

केस 1 — HTR ने पहिल्या मसुद्याचा वेग 5x वाढवला. डॉक्टरेट विद्यार्थ्याने 200 पानांच्या ऑट्टोमन नोटबुकचे लिप्यंतरण केले. पूर्ण मॅन्युअल ट्रान्सक्रिप्शन अंदाजे 60 व्यावसायिक दिवस होते. कालावधीसाठी प्रशिक्षित एचटीआर मॉडेलसह, कच्चा मसुदा काही तासांत बाहेर आला; विद्यार्थ्याने हा मसुदा दुरुस्त केला आणि काम 12 कामकाजाचे दिवस केले. पण त्याला प्रत्येक पानाची तुलना दस्तऐवजाशी, ओळींनुसार करायची होती; सुमारे 30% मसुदा चुकीचा होता.

केस 2 - एक अक्षर, एक अर्थ. एका संशोधकाने एआयने "गव्हर्नर" म्हणून वाचलेल्या शब्दावर विश्वास ठेवला. तज्ञांच्या नियंत्रणाखाली, हे समजले की हा शब्द प्रत्यक्षात "पालक" (मुल/व्यक्तीसाठी जबाबदार) आहे आणि स्वर चिन्हांकित नसल्यामुळे, AI ने चुकीचा अंदाज लावला. कागदपत्राचा कायदेशीर अर्थ पूर्णपणे बदलत होता. धडा: ऑट्टोमन तुर्कीमध्ये, एका अक्षर/स्वराच्या फरकामुळे दस्तऐवजाचा सुरुवातीपासूनच अर्थ लावला जातो; तज्ञ आवश्यक आहे.

केस 3 - काल्पनिक पूर्णता. ज्या ओळीत शाई संपली होती आणि त्यातील एक शब्द वाचता येत नव्हता, एआयने ते अंतर एका “तार्किक” शब्दाने भरून काढले. तज्ञाच्या लक्षात आले की ते अंतर खरोखरच एका ठिकाणाचे नाव आहे आणि ते एआयने तयार केले आहे. जागा [अस्पष्ट] म्हणून सोडली. धडा: न वाचता येणारी जागा भरलेली नाही, ती चिन्हांकित केली आहे.

चार कॉपी करण्यायोग्य टेम्पलेट्स

1) लिप्यंतरण जे संदिग्धता टिकवून ठेवते:

खाली ऑट्टोमन दस्तऐवजाचे HTR रॉ आउटपुट/लिप्यंतरण आहे. तुमचे कार्य मजकूराचे पुनरावलोकन करणे आणि संभाव्य वाचन त्रुटी फ्लॅग करणे हे आहे. नियम: (1) प्रत्येक शब्दासाठी 2-3 संभाव्य वाचन पर्याय ऑफर करा ज्याबद्दल तुम्हाला खात्री नाही, एक लादू नका. (२) अयोग्य ठिकाणी [अस्पष्ट] सोडा, ते भरू नका. (३) मजकुरात अस्तित्वात नसलेले शब्द जोडणे. (4) अस्पष्ट स्वरांसह शब्दांमध्ये पर्याय दाखवा. मजकूर: [येथे]

२) स्तरित वाचन (मूळ + सरलीकरण):

खालील सत्यापित ओटोमन लिप्यंतरणासाठी दोन स्तंभ व्युत्पन्न करा: (1) मूळ लिप्यंतरण (स्पर्श), (2) आजच्या तुर्कीमध्ये सरलीकृत वाचन. ADDING अर्थ, सरलीकरण मध्ये व्याख्या जोडणे; फक्त भाषा अपडेट करा. अस्पष्ट अर्थ [अस्पष्ट] सह ठिकाणे चिन्हांकित करा. लिप्यंतरण: [येथे]

3) मुदत आणि व्यक्ती काढणे:

खाली दिलेल्या लिप्यंतरणात नमूद केलेली वैयक्तिक नावे, ठिकाणांची नावे, शीर्षके आणि नियतकालिक संज्ञा स्वतंत्र सूचीमध्ये दिसतात. मजकूरात स्पष्टपणे नमूद केलेलेच घ्या; अंदाज करून जोडू नका. तुम्हाला उच्चारांची खात्री नसल्यास [?] सह चिन्हांकित करा. मजकूर: [येथे]

4) संशयास्पद वाचन नियंत्रण:

भूमिकेत अनुभवी पॅलेग्राफी नियंत्रक. खालील लिप्यंतरणात, अर्थात विसंगत असलेले, कालावधीत न बसणारे किंवा संदर्भामध्ये न बसणारे शब्द चिन्हांकित करा आणि ते का संशयास्पद आहेत ते लिहा. निश्चित सुधारणा लादणे; मानवी तज्ञ दस्तऐवजाशी तुलना करतील अशा शंकांची सूची तयार करा. मजकूर: [येथे]

कमकुवत प्रॉम्प्ट / मजबूत प्रॉम्प्ट

कमकुवत:

हा ऑट्टोमन मजकूर वाचा आणि मला त्याचे भाषांतर द्या.

हे AI ला एकच, निश्चित वाचन, संदिग्धता लपवून ठेवण्यासाठी आणि अंतरांमध्ये बसवण्यास प्रवृत्त करते. ऑट्टोमन तुर्कीमध्ये, ही जवळजवळ हमी चूक आहे.

मजबूत:

खालील ऑट्टोमन लिप्यंतरण पहा. एक निश्चित वाचन: IMPOSITION. प्रत्येक अस्पष्ट शब्दासाठी संभाव्य पर्याय द्या, [अस्पष्ट] भाग सोडा, मजकुरात नसलेले काहीही जोडू नका. आजच्या तुर्की भाषेला एका वेगळ्या स्तंभात सरलीकृत वाचन द्या, परंतु मूळ ठेवा. तुम्हाला खात्री नसलेली कोणतीही गोष्ट [?] सह चिन्हांकित करा जेणेकरून तज्ञ त्याची तुलना दस्तऐवजाशी करू शकेल. मजकूर: [येथे]

फरक: कठोर वाचन प्रतिबंध, पर्यायांची विनंती करणे, व्हाइटस्पेस संरक्षित करणे आणि स्तरित आउटपुट तज्ञ सत्यापन सक्षम करतात.

सामान्य चुका

  • HTR मसुदा बरोबर असल्याचे चुकीचे आहे. ऑट्टोमन तुर्कीमध्ये, कच्चा मसुदा चुकीचा असू शकतो; लाइन बाय लाइन कंट्रोल आवश्यक आहे.
  • केवळ निश्चित वाचन लादणे आहे. ज्या शब्दांचे स्वर लिहिलेले नसतील अशा शब्दांमध्ये पर्याय लपलेले असतील तर चुकीचा अर्थ नोंदवला जाईल.
  • न वाचता येणारे क्षेत्र भरणे. ते व्हाइटस्पेस [अस्पष्ट] द्वारे संरक्षित केले पाहिजे, बनलेले नाही.
  • सरलीकरणासह मूळ मिसळणे. सरलीकरण एक स्वतंत्र स्तर असावा; मूळ लिप्यंतरण विकृत होऊ नये.
  • तज्ञ अक्षम करणे. पॅलेग्राफी आणि कालावधीच्या ज्ञानाशिवाय, AI चे वाचन हे वैज्ञानिक मूल्य नसलेले अंदाज आहे.

सारांशात

HTR आणि AI सह कच्च्या मसुद्याच्या टप्प्यावर ऑट्टोमन आणि हस्तलिखित प्रतिलेखन मोठ्या प्रमाणात वेगवान केले जाऊ शकते; तुम्हाला पहिले आउटपुट मिळेल जे कामाचे दिवस तासांपर्यंत कमी करते. पण नेमके या भागात एकच अक्षर, एकाच स्वरातील फरकाने अर्थ बदलतो; AI अनिश्चितता लपवून पोकळी भरून काढते. योग्य पद्धत स्तरित आहे: कच्ची बाह्यरेखा, संदिग्धतेच्या पर्यायी नोट्स, सरलीकरणाचा एक वेगळा स्तर आणि सर्वात महत्त्वाचे म्हणजे, पॅलेओग्राफीशी परिचित तज्ञाद्वारे दस्तऐवजाचे ओळ-दर-लाइन सत्यापन. एआय प्रारंभिक वाचन वेगवान करते; वैज्ञानिक जबाबदारी तज्ञांची आहे.

अर्ज कार्य

ऑट्टोमन किंवा हस्तलिखित दस्तऐवजाचे लिप्यंतरण मिळवा (तुमचे स्वतःचे उत्पादन किंवा प्रकाशित प्रत). AI ला “अस्पष्टता-संरक्षण लिप्यंतरण” टेम्पलेटसह पर्यायी वाचनासाठी विचारा. नंतर "स्तरित वाचन" सह सरलीकरण स्तर स्वतंत्रपणे तयार करा. अस्पष्टपणे चिन्हांकित केलेल्या प्रत्येक शब्दाची तज्ञ स्रोत किंवा शब्दकोशासह तुलना करा; एआयने एकच वाचन लादल्यास किती त्रुटी निर्माण होतील ते लक्षात घ्या.

चेकलिस्ट

  • मी कालावधी आणि लेखन शैलीसाठी योग्य HTR/मॉडेल वापरले.
  • मी AI ला अचूक वाचनासाठी पर्याय विचारले.
  • [ ] मी न वाचता येणारे भाग [न वाचता येणारे] सह संरक्षित केले.
  • [ ] मी मूळ लिप्यंतरण सरलीकरणापासून वेगळे ठेवले आहे.
  • [] माझ्याकडे पॅलेओग्राफी जाणणाऱ्या तज्ञ/डॉक्युमेंटरीद्वारे अंतिम मजकूर सत्यापित केला होता.