लाभ:
- एचटीआर और लिप्यंतरण वर्कफ़्लो स्थापित करने और यह समझाने की क्षमता कि कच्चे ड्राफ्ट को लाइन दर लाइन विशेषज्ञ जाँच की आवश्यकता क्यों है
- ओटोमन तुर्की में स्वर/अक्षर की अस्पष्टता के मामले में सटीक रीडिंग लागू करने के बजाय विकल्प मांगकर अपठनीय क्षेत्रों की रक्षा करने की क्षमता
- मूल लिप्यंतरण को सरलीकरण की एक अलग परत से अलग करने की क्षमता, अंतिम वैज्ञानिक जिम्मेदारी पुरालेखक के पास रखते हुए
शायद ऐतिहासिक शोध का सबसे अधिक मांग वाला हिस्सा पांडुलिपियों और पुराने लिखित दस्तावेजों को पठनीय पाठ में बदलना है। एक पत्र, एक नोटबुक, एक अदालती रिकॉर्ड या एक ओटोमन दस्तावेज़ केवल प्रतिलेखित होने के बाद ही खोजने योग्य हो जाता है। प्रतिलेखन किसी दस्तावेज़ की सामग्री (अक्सर हस्तलिखित या प्राचीन लिपि) को लिखित, पठनीय पाठ में स्थानांतरित करने का कार्य है। ओटोमन के मामले में, यह अक्सर लिप्यंतरण के साथ होता है: अरबी अक्षरों में पाठ को उसके अक्षर-दर-अक्षर समकक्षों के साथ लैटिन वर्णमाला में स्थानांतरित करना।
हमने मुद्रित पाठों के लिए ओसीआर का उपयोग किया; हस्तलेखन के लिए एक अलग तकनीक की आवश्यकता होती है: HTR (हस्तलिखित पाठ पहचान)। एचटीआर ओसीआर के समान लेकिन अधिक चुनौतीपूर्ण तकनीक है जो हस्तलिखित दस्तावेजों को मशीन टेक्स्ट में परिवर्तित करती है। इस इकाई में हम देखेंगे कि ओटोमन और पांडुलिपि प्रतिलेखन में एचटीआर और एआई का उपयोग कैसे करें, त्रुटि के मार्जिन और सत्यापन यहां और भी महत्वपूर्ण क्यों है।
लिखावट इतनी कठिन क्यों है?
हस्तलेखन मुद्रित पाठ की तुलना में बहुत अधिक परिवर्तनशील होता है: प्रत्येक लेखक का एक अनोखा हाथ होता है, अक्षर एक-दूसरे से जुड़े होते हैं, संक्षिप्तीकरण और विशेष चिह्नों का उपयोग किया जाता है, स्याही बहती है, कागज घिस जाता है। ओटोमन तुर्की में कठिनाई कई गुना बढ़ गई है:
- प्रासंगिक अक्षर रूप: एक ही अक्षर शब्द के आरंभ, मध्य और अंत में अलग-अलग तरीके से लिखा जाता है।
- स्वर नहीं लिखना: लघु स्वर प्राय: नहीं लिखे जाते; पाठक संदर्भ से पूरा करता है। इससे "स्वीकृति या अस्वीकृति?" जैसी अस्पष्टताएं पैदा होती हैं।
- विभिन्न लेखन शैलियाँ: विभिन्न हस्तलेखन शैलियाँ हैं जैसे रिका, दिवानी, ता'लिक; प्रत्येक को अलग-अलग पढ़ने की विशेषज्ञता की आवश्यकता होती है।
- तुर्क शब्दावली: अरबी और फ़ारसी के शब्द जो आज के तुर्की में मौजूद नहीं हैं।
इसलिए, एचटीआर और एआई प्रिंट ओसीआर की तुलना में ओटोमन तुर्की में त्रुटि के बहुत अधिक मार्जिन के साथ काम करते हैं। एक विशेषज्ञ पुरालेखक (पुरालेख - प्राचीन लेखन को पढ़ने का विज्ञान) की आंख यहां एक उपकरण नहीं, बल्कि एक आवश्यकता है।
वर्कफ़्लो: चरण दर चरण
1. दस्तावेज़ की गुणवत्ता तैयार करें. ओसीआर की तरह, उच्च रिज़ॉल्यूशन और अच्छा कंट्रास्ट आवश्यक है। लिखावट में यह और भी अधिक महत्वपूर्ण है।
2. एचटीआर मॉडल का चयन करें। ओटोमन, अरबी लिखावट, या विशेष अवधि के लिए विशेष रूप से प्रशिक्षित एचटीआर मॉडल सामान्य मॉडल की तुलना में अधिक सफल होते हैं। परीक्षण करें कि कौन सा मॉडल किसी अवधि और लेखन शैली के लिए अच्छा काम करता है।
3. कच्चा प्रतिलेखन उत्पन्न करें। एचटीआर मॉडल एक रूपरेखा तैयार करता है। ओटोमन तुर्की में, यह मसौदा त्रुटियों से भरी एक शुरुआत है जिसे एक अनुभवी आंख को पूरी तरह से जांचना चाहिए।
4. एआई के साथ प्रासंगिक सुधार। आपके पास एआई ध्वज विसंगतियां, संभावित पढ़ने के विकल्प और कच्चे आउटपुट में संदिग्ध स्थान हो सकते हैं। लेकिन एआई "सुधार" यहां विशेष रूप से जोखिम भरा है: यह एक काल्पनिक पढ़ने का सुझाव दे सकता है।
5. लिप्यंतरण और सरलीकरण (स्तरित)। अरबी अक्षरों में पाठ का लैटिन अक्षरों में लिप्यंतरण, उसके बाद आज के तुर्की में इसका सरलीकृत वाचन, अलग-अलग परतों के रूप में तैयार किया जाता है। मूल कभी टूटता नहीं.
6. विशेषज्ञ सत्यापन. अंतिम प्रतिलेखन को दस्तावेज़ के साथ तुलना करके पुरालेख और अवधि ज्ञान वाले विशेषज्ञ द्वारा अनुमोदित किया जाता है।
ध्यान दें: ओटोमन तुर्की में, जब संदर्भ से एक अलिखित स्वर के साथ एक शब्द का "अनुमान" लगाया जाता है, तो एआई पूरी तरह से गलत रीडिंग उत्पन्न कर सकता है और इसे एक आश्वस्त भाषा में प्रस्तुत कर सकता है। अक्षरों में अंतर, जैसे "काबिल" के बजाय "काबुल" या "आलिम" के बजाय "आलिम", अर्थ को पूरी तरह से बदल देता है। प्रत्येक अनिश्चित पाठन को विकल्पों के साथ प्रस्तुत किया जाना चाहिए, और कोई एक निश्चित पाठन थोपा नहीं जाना चाहिए।
एक मेज के साथ परतें और जिम्मेदारी
परत
सामग्री
एआई की भूमिका
विशेषज्ञ की भूमिका
छवि
मूल दस्तावेज़
—
स्रोत
एचटीआर ड्राफ्ट
कच्ची मशीन पढ़ना
पैदा करता है
प्रारंभ से अंत तक नियंत्रण रखें
लिप्यंतरण
लैटिन अक्षर स्थानांतरण
ड्राफ्ट सुझाव देता है
सुधारता है, सुधारता है
अनिश्चितता के नोट्स
[?] और विकल्प
संकेत
निर्णय करता है
सरलीकरण
आज का तुर्की
ड्राफ्ट सुझाव देता है
स्वीकृतियाँ
वैज्ञानिक प्रकाशन
अंतिम पाठ + नोट्स
—
केवल विशेषज्ञ
तीन मिनी मामले
केस 1 - एचटीआर ने पहले ड्राफ्ट की गति 5 गुना बढ़ा दी। एक डॉक्टरेट छात्र 200 पेज की ओटोमन नोटबुक का प्रतिलेखन करेगा। पूर्ण मैन्युअल प्रतिलेखन 60 व्यावसायिक दिनों का अनुमान लगाया गया था। इस अवधि के लिए प्रशिक्षित एचटीआर मॉडल के साथ, कच्चा मसौदा कुछ ही घंटों में सामने आ गया; छात्र ने इस मसौदे को सही किया और काम को घटाकर 12 कार्य दिवस कर दिया। लेकिन उसे दस्तावेज़ के प्रत्येक पृष्ठ की पंक्ति दर पंक्ति तुलना करनी थी; ड्राफ्ट का लगभग 30% गलत था।
केस 2 - एक अक्षर, एक अर्थ। एक शोधकर्ता ने एआई द्वारा पढ़े जाने वाले शब्द "गवर्नर" पर भरोसा किया। विशेषज्ञ नियंत्रण के तहत, यह समझा गया कि शब्द वास्तव में "अभिभावक" (एक बच्चे/व्यक्ति के लिए जिम्मेदार) था, और चूंकि स्वर चिह्नित नहीं था, एआई ने इसका अनुमान गलत लगाया। दस्तावेज़ का कानूनी अर्थ पूरी तरह से बदल रहा था। पाठ: ओटोमन तुर्की में, एक अक्षर/स्वर अंतर के कारण दस्तावेज़ की शुरुआत से ही व्याख्या की जा सकती है; विशेषज्ञ की आवश्यकता है.
केस 3 - जानबूझकर पूरा किया जाना। एक पंक्ति में जिसकी स्याही खत्म हो गई थी और जिसका एक शब्द अपठनीय था, एआई ने उस स्थान को एक "तार्किक" शब्द से भर दिया। विशेषज्ञ को एहसास हुआ कि वह अंतर वास्तव में एक जगह का नाम था और एआई ने इसे बना दिया था। रिक्त स्थान [अस्पष्ट] के रूप में छोड़ा गया। पाठ: अपठनीय स्थान भरा नहीं जाता, चिन्हित किया जाता है।
चार प्रतिलिपि योग्य टेम्पलेट
1) लिप्यंतरण जो अस्पष्टता को बरकरार रखता है:
नीचे एक ओटोमन दस्तावेज़ का एचटीआर कच्चा आउटपुट/लिप्यंतरण है। आपका कार्य पाठ की समीक्षा करना और पढ़ने में संभावित त्रुटियों को चिह्नित करना है। नियम: (1) प्रत्येक शब्द के लिए 2-3 संभावित पढ़ने के विकल्प पेश करें जिनके बारे में आप निश्चित नहीं हैं, एक भी थोपें नहीं। (2) अपठनीय क्षेत्रों में [अपठनीय] छोड़ें, उन्हें भरें नहीं। (3) ऐसे शब्द जोड़ना जो पाठ में मौजूद नहीं हैं। (4) अस्पष्ट स्वर वाले शब्दों में विकल्प दिखाएँ। पाठ: [यहाँ]
2) स्तरित वाचन (मूल+सरलीकरण):
निम्नलिखित सत्यापित ओटोमन लिप्यंतरण के लिए दो कॉलम बनाएं: (1) मूल लिप्यंतरण (स्पर्श), (2) आज के तुर्की में सरलीकृत पढ़ना। अर्थ जोड़ना, सरलीकरण में व्याख्या जोड़ना; बस भाषा अपडेट करें. अस्पष्ट अर्थ वाले स्थानों को चिह्नित करें[अस्पष्ट]। लिप्यंतरण: [यहाँ]
3) पद और व्यक्ति निष्कर्षण:
नीचे प्रतिलेखन में उल्लिखित व्यक्तिगत नाम, स्थान के नाम, शीर्षक और आवधिक शब्द अलग-अलग सूचियों में दिखाई देते हैं। केवल उन्हीं को लें जिनका पाठ में स्पष्ट रूप से उल्लेख किया गया है; अनुमान लगाकर न जोड़ें. यदि आप उच्चारण के बारे में निश्चित नहीं हैं तो [?] से चिह्नित करें। पाठ: [यहाँ]
4) संदिग्ध पठन नियंत्रण:
भूमिका में एक अनुभवी पेलोग्राफी नियंत्रक। नीचे दिए गए प्रतिलेखन में, उन शब्दों को चिह्नित करें जो अर्थ में असंगत हैं, अवधि के अनुरूप नहीं हैं या संदर्भ में फिट नहीं हैं, और लिखें कि वे संदिग्ध क्यों हैं। निश्चित सुधार लागू करना; संदेहों की एक सूची तैयार करें जिसकी तुलना मानव विशेषज्ञ दस्तावेज़ से करेगा। पाठ: [यहाँ]
कमजोर संकेत/मजबूत संकेत
कमज़ोर:
इस तुर्क पाठ को पढ़ें और मुझे इसका अनुवाद दें।
यह एआई को एकल, निश्चित रीडिंग, अस्पष्टताओं को छिपाने और अंतराल में फिट करने के लिए प्रेरित करता है। ओटोमन तुर्की में, यह लगभग एक गारंटीशुदा गलती है।
मज़बूत:
नीचे ओटोमन लिप्यंतरण देखें। एक निश्चित पाठ: थोपना। प्रत्येक अस्पष्ट शब्द के लिए संभावित विकल्प प्रदान करें, [अस्पष्ट] भागों को छोड़ दें, ऐसा कुछ भी न जोड़ें जो पाठ में नहीं है। आज के तुर्की को एक अलग कॉलम में सरलीकृत पाठ दें, लेकिन मूल रखें। जिस चीज़ के बारे में आप निश्चित नहीं हैं उसे [?] से चिह्नित करें ताकि विशेषज्ञ दस्तावेज़ के साथ उसकी तुलना कर सके। पाठ: [यहाँ]
अंतर: सख्त पढ़ने पर रोक, विकल्पों का अनुरोध करना, रिक्त स्थान को संरक्षित करना और स्तरित आउटपुट विशेषज्ञ सत्यापन को सक्षम बनाता है।
सामान्य गलतियाँ
- एचटीआर ड्राफ्ट को सही समझ रहे हैं. ओटोमन तुर्की में, अधिकांश कच्चा मसौदा गलत हो सकता है; लाइन दर लाइन नियंत्रण जरूरी है.
- एकमात्र निश्चित वाचन थोपना है। जिन शब्दों के स्वर नहीं लिखे हैं उनमें यदि विकल्प छिपा दिया जाए तो गलत अर्थ अंकित हो जाएगा।
- अपठनीय क्षेत्र को भरना। इसे रिक्त स्थान [अपाठ्य] द्वारा संरक्षित किया जाना चाहिए, बना हुआ नहीं।
- मूल को सरलीकरण के साथ मिलाना। सरलीकरण एक अलग परत होनी चाहिए; मूल लिप्यंतरण विकृत नहीं होना चाहिए.
- विशेषज्ञ को अक्षम करना. पुरालेख और काल के ज्ञान के बिना, एआई का पढ़ना एक अनुमान है जिसका कोई वैज्ञानिक मूल्य नहीं है।
सारांश
एचटीआर और एआई के साथ कच्चे ड्राफ्ट चरण में ओटोमन और पांडुलिपि प्रतिलेखन को काफी तेज किया जा सकता है; आपको पहला आउटपुट मिलता है जो काम के दिनों को घटाकर घंटों में बदल देता है। लेकिन यह ठीक इसी क्षेत्र में है कि एक अक्षर, एक स्वर का अंतर अर्थ बदल देता है; एआई अनिश्चितता को छुपाता है और अंतरालों को भरता है। सही विधि स्तरित है: कच्ची रूपरेखा, अस्पष्टता के वैकल्पिक नोट्स, सरलीकरण की एक अलग परत और, सबसे ऊपर, पेलोग्राफी से परिचित विशेषज्ञ द्वारा दस्तावेज़ का लाइन-बाय-लाइन सत्यापन। एआई प्रारंभिक पढ़ने की गति बढ़ाता है; वैज्ञानिक उत्तरदायित्व विशेषज्ञ का है।
आवेदन कार्य
एक ओटोमन या पांडुलिपि दस्तावेज़ (आपका स्वयं का उत्पादन या एक प्रकाशित प्रति) का लिप्यंतरण प्राप्त करें। "अस्पष्टता-संरक्षण लिप्यंतरण" टेम्पलेट के साथ वैकल्पिक पढ़ने के लिए एआई से पूछें। फिर "स्तरित पठन" के साथ सरलीकरण परत को अलग से उत्पन्न करें। प्रत्येक अस्पष्ट रूप से चिह्नित शब्द की तुलना किसी विशेषज्ञ स्रोत या शब्दकोश से करें; ध्यान दें कि यदि AI एक भी रीडिंग लगाए तो कितनी त्रुटियाँ उत्पन्न करेगा।
चेकलिस्ट
- [ ] मैंने अवधि और लेखन शैली के लिए उपयुक्त एचटीआर/मॉडल का उपयोग किया।
- [ ] मैंने एआई से सटीक रीडिंग के विकल्प मांगे।
- [ ] मैंने अपठनीय भागों को [अपठनीय] से सुरक्षित किया।
- [ ] मैंने मूल लिप्यंतरण को सरलीकरण से अलग रखा है।
- [ ] मेरे पास अंतिम पाठ एक विशेषज्ञ/वृत्तचित्र द्वारा सत्यापित था जो पुरालेख जानता है।