नफा:
- OCR/HTR सह मसुदा मजकुरात शिलालेख आणि हस्तलिखिते लिप्यंतरित करताना वाचलेले वर्ण आणि अंदाजे पूर्णत्व वेगळे आणि चिन्हांकित ठेवण्याची क्षमता
- अस्पष्ट मजकूर पूर्ण होणे, खोटे भाषांतर आणि बनावट गुणधर्म यांसारख्या भ्रमाचे प्रकार ओळखण्याची क्षमता आणि स्त्रोत आणि पाठांतर भाषांतर तपासण्याची क्षमता.
- भाषा, लेखन आणि शैलीचा संदर्भ कृत्रिम बुद्धिमत्तेची विश्वासार्हता कशी ठरवते आणि अंतिम वाचन आणि व्याख्या तज्ञ फिलॉलॉजिस्टच्या मालकीची आहे हे समजून घेण्याची क्षमता
भूतकाळातील सर्वात थेट ध्वनींपैकी एक म्हणजे लिखित स्त्रोत: दगडात कोरलेले शिलालेख, मातीच्या गोळ्या, पपीरी, चर्मपत्र हस्तलिखिते, थडगे आणि सील. या युनिटमध्ये, एपिग्राफी (दगड, धातू, मातीची भांडी यांसारख्या कठीण पृष्ठभागावर कोरलेल्या शिलालेखांचा अभ्यास करण्याचे शास्त्र), पॅलेग्राफी (प्राचीन हस्तलेखनांचे वाचन आणि डेटिंगचे कौशल्य) आणि AI या ग्रंथांचे वाचन, भाषांतर आणि संपादन कसे गतिमान करतात ते आपण पाहू, परंतु प्रत्येक वाचनाची पुष्टी तज्ञ फिलॉलॉजिस्टने का केली पाहिजे.
मूलभूत तत्त्व: एआय अस्पष्ट मजकूर वाचण्यास, भाषेचे भाषांतर करण्यास आणि संभाव्य पूरक सुचवण्यास मदत करते; परंतु शिलालेखाचे अंतिम वाचन, गहाळ अक्षरे आणि अर्थ पूर्ण करणे हा भाषा आणि कालावधी जाणणाऱ्या तज्ञाचा निर्णय असतो. या भागात AI ला भ्रम होण्याचा सर्वात जास्त धोका आहे, कारण मॉडेलमध्ये काहीतरी "प्रशंसनीय" परंतु तयार केलेला मजकूर गहाळ किंवा अस्पष्ट मजकूर भरण्याची शक्यता असते.
लिखित स्त्रोतांसह कार्य करण्यासाठी चरण
1. दस्तऐवजीकरण. शिलालेख किंवा हस्तलिखित उच्च रिझोल्यूशन, कॉन्ट्रास्ट-वर्धित स्वरूपात प्रदर्शित केले जाते. अस्पष्ट पृष्ठभागांसाठी, विशेष प्रकाश (साइड लाइट) आणि आरटीआय सारखी तंत्रे वापरली जातात; AI कॉन्ट्रास्ट आणि अक्षरांच्या कडांना तीक्ष्ण करण्यास मदत करते.
2. वर्ण ओळख. मुद्रित मजकूरासाठी OCR (ऑप्टिकल कॅरेक्टर रिकग्निशन) वापरला जातो आणि हस्तलेखनासाठी HTR (हस्तलिखित मजकूर ओळख) वापरला जातो. AI-आधारित HTR जुन्या हस्तलिखितांचे लिप्यंतरण करण्यात शक्तिशाली आहे.
3. प्रतिलेखन आणि पूर्णता. फिकट किंवा तुटलेल्या भागांसाठी, तज्ञ व्याकरण आणि समांतर मजकुरावर आधारित संभाव्य पुनर्संचयित करण्याची सूचना देतात. पूर्ण झालेली अक्षरे नेहमी चौरस कंस सारख्या चिन्हांद्वारे दर्शविली जातात; काय वाचले जाते आणि काय वर्तवले जाते याचा कधीच गोंधळ होत नाही.
4. भाषांतर. मजकूर स्त्रोत भाषेतून अनुवादित केला आहे (लॅटिन, प्राचीन ग्रीक, ऑट्टोमन, क्यूनिफॉर्म भाषा इ.). एआयने पहिला मसुदा अनुवाद दिला; तज्ञ nuance शब्दावली आणि ऐतिहासिक संदर्भ दुरुस्त करते.
5. टिप्पणी. मजकूर काय म्हणतो, तो कोणी लिहिला आणि तो कोणत्या घटनेचा संदर्भ देतो हे ऐतिहासिक व्याख्या आहेत आणि तज्ञांच्या मालकीचे आहेत.
टीप: जर तुम्ही AI ला अस्पष्ट मजकूर "वाचा आणि पूर्ण" करण्यास सांगितले, तर ते सुरक्षितपणे रिक्त जागा बनवेल. त्याऐवजी, "फक्त स्पष्टपणे वाचण्यायोग्य वर्ण द्या, रिक्त सोडा आणि तुम्हाला खात्री नसलेली क्षेत्रे चिन्हांकित करा" असे म्हणा. औचित्यसह, वेगळ्या चरणात पूर्ण करण्यासाठी विचारा आणि तज्ञांकडून याची पुष्टी केल्याची खात्री करा.
भ्रम: या क्षेत्राचा सर्वात मोठा धोका
मानवतेमध्ये AI ची सर्वात विनाशकारी चूक म्हणजे फॅब्रिकेशन. या क्षेत्रात चार वैशिष्ट्यपूर्ण फॉर्म आहेत:
- मजकूर तयार करणे: अस्तित्त्वात नसलेला शब्द जोडून, अस्पष्ट शिलालेखाचा अस्तित्वात नसलेला भाग "पूर्ण करतो".
- बनावट भाषांतर: त्याला अस्खलितपणे समजत नसलेल्या शब्दाचा पण चुकीचा अनुवाद करतो; वाचक लक्षात घेऊ शकत नाही कारण त्याला स्त्रोत माहित नाही.
- बनावट संदर्भ: "हा शिलालेख त्या प्रकाशनात प्रकाशित झाला होता" असे म्हटले आहे, परंतु ते प्रकाशन अस्तित्वात नाही.
- चुकीचे/विशेषता: चुकीच्या काळात लेखनाची शैली आत्मविश्वासाने ठेवते.
स्रोत पाहणाऱ्या आणि भाषा जाणणाऱ्या तज्ञाकडून पुष्टी केल्याशिवाय या सर्वांचा वापर केला जाऊ शकत नाही.
लक्ष द्या: केवळ भाषांतर अस्खलित आणि पटण्याजोगे आहे याचा अर्थ ते बरोबर आहे असा होत नाही. एआय अगदी क्यूनिफॉर्म चिन्हाचे रूपांतर करू शकते जे त्याला समजत नाही आत्मविश्वासपूर्ण वाक्यात. जो कोणी स्त्रोत मजकूर वाचू शकत नाही तो स्वतःहून AI भाषांतराची अचूकता कधीही सत्यापित करू शकत नाही.
तीन लहान प्रकरणे
केस 1 - HTR ने संग्रह उघडला. एका संग्रहाने हजारो पृष्ठांची ओटोमन हस्तलिखिते संशोधकांसाठी बंद ठेवली कारण ती वाचण्यासाठी कौशल्य आणि वेळ आवश्यक होता. एआय-आधारित एचटीआर शोधण्यायोग्य मसुदा मजकूरात नोटबुकचे प्रतिलेखन करते; तज्ञांनी मसुदा दुरुस्त केला आणि न वाचता येणारे क्षेत्र चिन्हांकित केले गेले. हा संपूर्ण मजकूर नाही, परंतु एक शक्तिशाली स्कॅनिंग साधन उदयास आले आहे.
केस 2 - बनावट पूर्ण करणे पकडले. एका विद्यार्थ्याने एआयला एक तुटलेला लॅटिन समाधी दगड वाचला होता; AI ने अस्खलित वाक्यात हरवलेली ओळ "पूर्ण" केली. शिलालेखकाने दाखवले की प्रस्तावित पूर्ण करणे भौतिकदृष्ट्या अशक्य आहे कारण दगडात जागा शिल्लक नव्हती. समांतर शिलालेखांच्या आधारे पूर्णता पुनर्रचना आणि चिन्हांकित करण्यात आली.
केस 3 - बनावट भाषांतर दुरुस्त केले. एक संघ प्राचीन ग्रीक शिलालेखाच्या एआयच्या भाषांतराचा अहवाल देईल; जेव्हा फिलोलॉजिस्टने तपासले तेव्हा त्याला आढळले की AI ने चुकीच्या काळात एका क्रियापदाचे भाषांतर केले आहे, मजकूराचा अर्थ उलट केला आहे (मग तो अर्पण असो किंवा स्मारक असो). स्त्रोताकडे परत गेल्याने टिप्पणी जतन केली.
चार कॉपी करण्यायोग्य टेम्पलेट्स
1) पुराणमतवादी प्रतिलेखन:
तुमची भूमिका: प्रतिलेखन सहाय्यक. या शिलालेख/हस्तलिखित प्रतिमेमध्ये, फक्त स्पष्ट वाचनीय अक्षरे द्या. अस्पष्ट, तुटलेली किंवा अनिश्चित क्षेत्रे वाचू नका; "[न वाचण्याजोगे]" म्हणून चिन्हांकित करा. गहाळ भाग पूर्ण करा. आपल्याला संशयित असलेल्या वर्णांची देखील नोंद घ्या.
२) तर्कसंगत पूर्णत्वाचा प्रस्ताव:
खाली अचूक वाचन भाग आणि [स्पेसेस] असलेला मजकूर आहे. अंतरासाठी संभाव्य पूरक सुचवा, परंतु प्रत्येक सूचनेसाठी: (अ) औचित्य (व्याकरण, समांतर मजकूर), (ब) अंतर अक्षरांच्या संख्येला बसते की नाही, (c) पर्याय. या सूचना आहेत; निश्चित वाचन नाही. तज्ञांची मान्यता आवश्यक असल्याचे सांगा.
3) मसुदा अनुवाद (स्रोत संरक्षित):
खालील [भाषा] मजकुराचे भाषांतर करा. प्रत्येक वाक्याच्या पुढे स्त्रोत मजकूर ठेवा (रेषेनुसार रेषा संरेखित करा). तुम्हाला खात्री नसलेले शब्द चिन्हांकित करा आणि पर्यायी भाषांतर द्या. अटी तयार करू नका; तुम्हाला माहीत नसेल तर "अनिश्चित" लिहा. हा मसुदा आहे; तज्ञ फिलॉलॉजिस्ट तपासतील.
4) भाषांतर पडताळणी (परत भाषांतर):
या भाषांतराचे मूळ भाषेत भाषांतर करा आणि मूळ स्त्रोत मजकुराशी त्याची तुलना करा. जेथे अर्थ बदलला, जोडला किंवा टाकला गेला ते भाग चिन्हांकित करा. विशेषतः काल, विषय आणि संख्या तपासा.
कमकुवत प्रॉम्प्ट / मजबूत प्रॉम्प्ट
कमकुवत प्रॉम्प्ट:
हा प्राचीन शिलालेख वाचा आणि त्यात काय लिहिले आहे ते आम्हाला सांगा.
अस्पष्ट शिलालेखात, AI अंतर बनवते, भाषेचे चुकीचे भाषांतर करू शकते आणि ज्याला स्त्रोत दिसत नाही त्याला हे लक्षात येणार नाही.
शक्तिशाली सूचना:
या शिलालेख प्रतिमेमध्ये, अस्पष्ट भाग "[न वाचता येण्याजोगे]" सोडून, फक्त स्पष्टपणे वाचता येण्याजोग्या वर्णांचे प्रथम लिप्यंतरण करा. नंतर स्वतंत्रपणे, औचित्यांसह अंतरासाठी संभाव्य पूरक सुचवा परंतु कोणतेही निश्चित देऊ नका. शेवटी, मसुदा भाषांतर प्रदान करा आणि ज्या शब्दांबद्दल तुम्हाला खात्री नाही ते चिन्हांकित करा. सर्व तज्ञांच्या मान्यतेच्या अधीन आहेत.
फरक: प्रथम एक काल्पनिक "वाचन" देते; नंतरचे वाचन, अंदाज, आणि अनुवादित स्तर वेगळे आणि सत्यापित ठेवते.
भाषा, लिपी आणि AI चे ज्ञान सीमा
पुरातत्व ग्रंथांमध्ये अनेक भाषा आणि लिपींचा समावेश आहे: लॅटिन आणि प्राचीन ग्रीक शिलालेख, ऑट्टोमन आणि अरबी हस्तलिखिते, क्यूनिफॉर्म गोळ्या, इजिप्शियन हायरोग्लिफ्स, रनिक शिलालेख आणि बरेच काही. या भाषा आणि लिपींवर AI प्रवीणता खूप असमान आहे. लॅटिन आणि प्राचीन ग्रीक सारख्या मुबलक डिजिटल मजकूर असलेल्या भाषांसाठी मसुदा अनुवाद वाजवी असू शकतो, तुरळकपणे दस्तऐवजीकरण केलेले, उलगडलेले किंवा फक्त काही तज्ञांनी वाचलेले मजकूर, AI जवळजवळ पूर्णपणे अविश्वसनीय आहे; या भागात खात्रीशीर परंतु पूर्णपणे बनावट "अनुवाद" तयार करते.
संदर्भ आणि शैलीचा मुद्दा देखील आहे. कायदेशीर दस्तऐवज, प्रार्थना मजकूर आणि थडग्यात समान शब्दाचे वेगवेगळे अर्थ असू शकतात. तज्ञ फिलॉलॉजिस्ट मजकूराचा प्रकार (भक्ती, स्मारक, करार, पत्र) ओळखतो आणि योग्य संदर्भात शब्द वाचतो; AI मध्ये या सामान्य संवेदनशीलतेचा अभाव आहे आणि सर्वात सामान्य अर्थ लादतो. संक्षेप, सूत्रे आणि स्टॉक अभिव्यक्ती (विशेषत: शिलालेखांमध्ये खूप सामान्य) AI ची सहज दिशाभूल करतात.
तर सुवर्ण नियम आहे: तुम्हाला माहीत असलेल्या भाषांसाठी, तुम्ही नियंत्रित करू शकता अशा भाषांसाठी AI चा प्रवेगक म्हणून वापर करा; तुम्ही वाचू शकत नसलेल्या भाषेतील एआय भाषांतरावर कधीही विसंबून राहू नका. जो कोणी स्त्रोत वाचू शकत नाही तो भाषांतराची अचूकता सत्यापित करू शकत नाही आणि म्हणून तो अनुवाद वैज्ञानिक दाव्यात बदलू शकत नाही.
टीप: AI ला मजकूर देताना, त्याची भाषा, अंदाजे कालावधी आणि प्रकार (शिलालेख/पत्र/दस्तऐवज) निर्दिष्ट करा. संदर्भ ज्ञान अंशतः सर्वात सामान्य परंतु चुकीच्या वाचनाकडे AI चा प्रवाह कमी करते — परंतु पुष्टीकरणाची आवश्यकता दूर करत नाही.
लिखित संसाधन कार्य सारणी
शोध
AI ची भूमिका
मानवी निर्णय
पडताळणी
प्रतिमा सुधारणा
कॉन्ट्रास्ट/एज
निकष निवड
मूळ सह तुलना
OCR/HTR
मसुदा मजकूर
अनिश्चित वर्ण
तज्ञ प्रूफरीडिंग
पूर्णता
शिफारस (कारण)
स्वीकार/नाकारणे
समांतर मजकूर, स्थान नियंत्रण
भाषांतर
मसुदा
सूक्ष्मता, संज्ञा
परत अनुवाद, स्रोत
टिप्पणी द्या
संदर्भ सारांश
ऐतिहासिक अर्थ
तज्ञ, साहित्यिक
सामान्य चुका
- अस्पष्ट मजकूर पूर्ण करणे. AI अंतर फिट करते; वाचन आणि अंदाज वेगळे आणि चिन्हांकित केले पाहिजे.
- स्त्रोत न पाहता भाषांतरावर विश्वास ठेवणे. अस्खलित भाषांतर म्हणजे योग्य भाषांतर नाही.
- मेड-अप विशेषता स्वीकारणे. "हे त्या ब्रॉडकास्टवर आहे" असे म्हणण्यासाठी पुष्टीकरण आवश्यक आहे.
- पूर्ण होण्याचे भौतिक स्थान तपासत नाही. प्रस्ताव तुटलेल्या जागेत बसणे आवश्यक आहे.
- व्याख्या AI वर सोडत आहे. मजकुराचा ऐतिहासिक अर्थ हा तज्ञ फिलॉलॉजिस्टचा विषय आहे.
सारांशात
एपिग्राफी आणि प्राचीन ग्रंथांमध्ये AI; हे प्रतिमा सुधारणे, HTR/OCR मसुदा, पूर्णत्वाचा प्रस्ताव आणि मसुदा भाषांतराला लक्षणीय गती देते आणि संशोधनासाठी बंद संग्रहण उघडते. परंतु हे असे क्षेत्र आहे जेथे भ्रम होण्याचा धोका सर्वात जास्त आहे: वाचन हे भविष्यवाणीपासून वेगळे केले जाते, पूरक चिन्हांकित केले जातात, भाषांतरे स्त्रोत आणि बॅक-अनुवाद विरुद्ध तपासली जातात आणि अंतिम वाचन आणि व्याख्या तज्ञ फिलोलॉजिस्टचे असते.
अर्ज कार्य
शिलालेख किंवा हस्तलिखित प्रतिमा निवडा (खुल्या प्रवेश संग्रहातून). "कंझर्व्हेटिव्ह ट्रान्सक्रिप्शन" टेम्प्लेटसह फक्त स्पष्ट वर्ण काढा, नंतर "वाजवी पूर्णता सूचना" सह रिक्त स्थानांसाठी सूचना मिळवा. मसुदा भाषांतर तयार करा आणि "अनुवाद पडताळणी" टेम्पलेटसह त्याचे भाषांतर करा आणि अर्थ कुठे बदलला आहे ते चिन्हांकित करा. शक्य असल्यास प्रकाशित वाचनाशी तुलना करा.
चेकलिस्ट
- [ ] मी वाचलेले पात्र आणि अंदाज पूर्ण करणे स्वतंत्रपणे चिन्हांकित केले.
- [ ] मी तपासले की पूर्णता तुटलेल्या भागात बसतात.
- [ ] मी स्त्रोत मजकूर आणि मागील भाषांतर विरुद्ध भाषांतर तपासले.
- मी वास्तविक कॅटलॉगमध्ये YZ ने दिलेल्या प्रकाशने/उद्धरणांची पुष्टी केली आहे.
- [ ] मी अंतिम वाचन आणि व्याख्या तज्ञांच्या मान्यतेवर सोडले आहे.