इकाइयाँ
1. अनुवाद और व्याख्या में कृत्रिम बुद्धिमत्ता का परिचय: भूमिकाएँ, सीमाएँ, प्रमाणीकरण, गोपनीयता और नैतिकता 2. मशीनी अनुवाद के बुनियादी सिद्धांत: एनएमटी, एलएलएम, इंजन चयन और पूर्व-मूल्यांकन 3. मशीनी अनुवाद पोस्ट-संपादन (एमटीपीई): हल्का और पूर्ण पोस्ट-संपादन 4. शब्दावली प्रबंधन और टर्मबेस: संगति और कॉर्पोरेट भाषा 5. कैट टूल्स और ट्रांसलेशन मेमोरी (टीएम) के साथ एआई एकीकरण 6. स्थानीयकरण (L10n): सॉफ्टवेयर, वेब, गेम और सांस्कृतिक अनुकूलन 7. उपशीर्षक, डबिंग और दृश्य-श्रव्य अनुवाद 8. गुणवत्ता नियंत्रण (क्यूए), मूल्यांकन मेट्रिक्स और एलक्यूए 9. व्याख्या तैयारी: लगातार और एक साथ व्याख्या 10. संदर्भ, संस्कृति, स्वर और रचनात्मक अनुवाद (ट्रांसक्रिएशन) 11. गोपनीयता, नैतिकता, कॉपीराइट, प्रामाणिकता और पेशे का भविष्य
इकाई 2 / 11

मशीनी अनुवाद के बुनियादी सिद्धांत: एनएमटी, एलएलएम, इंजन चयन और पूर्व-मूल्यांकन

लाभ:

  • एनएमटी और एलएलएम-आधारित अनुवाद की ताकत और कमजोरियों को अलग करने और व्यवसाय के प्रकार के अनुसार सही इंजन चुनने की क्षमता
  • मशीन के लिए किसी पाठ की उपयुक्तता को पूर्व-वर्गीकृत करने और यथार्थवादी समय और कीमत के लिए इसका पूर्व-मूल्यांकन करने की क्षमता
  • सटीकता के साथ सहजता को भ्रमित किए बिना पांच आयामों और ध्वज जोखिमों में कच्ची मशीन आउटपुट की गुणवत्ता को तुरंत मापने की क्षमता

एक अनुवादक के रूप में आपके पास सबसे शक्तिशाली त्वरक मशीनी अनुवाद (एमटी) है - लेकिन किसी उपकरण का सचेत रूप से उपयोग करने का अर्थ है इसे सही काम में, सही भाषा युग्म में और सही अपेक्षाओं के साथ लागू करना। इस इकाई में, आप एमटी (एनएमटी और एलएलएम-आधारित अनुवाद) के दो प्रमुख परिवारों को जानेंगे, सीखेंगे कि कौन सा काम किस काम के लिए बेहतर है, डिलीवरी से पहले अनुवाद की कच्ची आउटपुट गुणवत्ता को जल्दी से कैसे मापें, और काम के अनुसार इंजन का चयन कैसे करें। उद्देश्य "सभी समान, पेस्ट-अनुवाद" के विचार से दूर जाना और एक विशेषज्ञ बनना है जो यह अनुमान लगा सकता है कि कौन सा पाठ मशीन के लिए उपयुक्त है और जिसके लिए मानव-गहन श्रम की आवश्यकता है।

दो परिवार: एनएमटी और एलएलएम-आधारित अनुवाद

एनएमटी (न्यूरल मशीन ट्रांसलेशन) ऐसी प्रणालियाँ हैं जो लाखों द्विभाषी वाक्यों से सीखती हैं और वाक्य का समग्र रूप से अनुवाद करती हैं; Google Translate, DeepL, Microsoft Translate इनके उदाहरण हैं। ताकत: बहुत तेज, सुसंगत, छोटे वाक्यों में धाराप्रवाह। कमज़ोरी: अक्सर संदर्भ को वाक्य की सीमा से परे नहीं देख पाता (पूरे पाठ से मतलब); पैराग्राफ को देखकर यह तय करना मुश्किल हो सकता है कि "बैंक" शब्द का अर्थ बैंक या नदी तट है और यह प्रदान की गई शर्तों की सूची में फिट नहीं बैठता है।

एलएलएम-आधारित अनुवाद (बड़े भाषा मॉडल) में अनुवाद के लिए चैटजीपीटी, क्लाउड, जेमिनी जैसे निर्देश-संचालित मॉडल का उपयोग किया जाता है। ताकत: निर्देश लेता है - "औपचारिक स्वर का उपयोग करें," "शब्दों की इस सूची का पालन करें," "लक्षित दर्शक बच्चे हैं" जैसे निर्देशों को समझता है; व्यापक संदर्भ देखता है; मुहावरे और स्वर को बेहतर ढंग से पकड़ता है। कमजोरी: कभी-कभी "बहुत रचनात्मक" हो सकती है और स्रोत में जुड़ सकती है (मतिभ्रम का जोखिम), लंबे पाठों में सुसंगतता खो देती है, और लागत/गति कार्य के आधार पर भिन्न होती है।

अंगूठे का नियम: सीधे, दोहराव वाले, तकनीकी पाठों में एनएमटी आमतौर पर तेज़ और पर्याप्त होता है; एलएलएम उन पाठों के मामले में अधिक लचीला है जिनके स्वर, संदर्भ, शब्दावली और निर्देश में अनुशासन की आवश्यकता होती है। अधिकांश पेशेवर आज दोनों का एक साथ उपयोग करते हैं: एनएमटी से त्वरित ड्राफ्ट, एलएलएम से टोन/टर्म सुधार।

युक्ति: किसी भाषा युग्म (जैसे तुर्की→अंग्रेजी) की मशीन गुणवत्ता विपरीत दिशा (अंग्रेजी→तुर्की) से भिन्न हो सकती है। एग्लूटिनेटिव, लचीले वाक्यविन्यास वाली भाषाएँ, जैसे तुर्की, आमतौर पर एमटी के लिए अधिक चुनौतीपूर्ण होती हैं। कुछ नमूना पाठों से स्वयं निर्णय करें कि आपकी अपनी जोड़ी में कौन सा इंजन बेहतर है।

पाठ की मशीन अनुकूलता: पहले यह पूछें

प्रत्येक पाठ मशीन के लिए समान रूप से उपयुक्त नहीं है। अनुवाद शुरू करने से पहले, पाठ को "उपयुक्तता" फ़िल्टर से गुजारें:

  • मशीन के लिए उपयुक्त: तकनीकी मैनुअल, उत्पाद विवरण, दोहराव वाला इंटरफ़ेस टेक्स्ट, मानक पत्राचार, तालिका/सूची। भाषा सरल है, शब्दावली निश्चित है, रचनात्मकता दुर्लभ है।
  • माध्यम उपयुक्त: समाचार, कॉर्पोरेट सामग्री, शैक्षिक सामग्री। मशीन अच्छी रूपरेखा तैयार करती है लेकिन टोन और प्रवाह के लिए गंभीर पोस्ट-संपादन की आवश्यकता होती है।
  • मशीन के लिए उपयुक्त नहीं (उच्च जोखिम): कानूनी अनुबंध, चिकित्सा पाठ, विज्ञापन/नारा, साहित्यिक पाठ, हास्य, कविता। यहां मशीन केवल विचार देती है; नौकरी बड़े पैमाने पर लोगों पर निर्भर करती है।

यदि आप शुरू से ही यह अंतर बनाते हैं, तो आप ग्राहक को सही समय/कीमत देंगे और कच्चे आउटपुट पर आंख मूंदकर भरोसा करने से खुद को बचाएंगे।

कच्चे उत्पादन की गुणवत्ता को तुरंत मापें

जब आप एमटी आउटपुट देखते हैं तो आप आश्चर्य करते हैं "क्या यह अच्छा है या बुरा?" प्रश्न का उत्तर त्वरित जांच सूची से दें, न कि अंतर्ज्ञान से। इन पांच आयामों को देखें: सटीकता (क्या अर्थ स्रोत के प्रति वफादार है?), पूर्णता (क्या वाक्य छोड़ा गया है या जोड़ा गया है?), शब्दावली (क्या यह सही और सुसंगत है?), प्रवाह (क्या यह लक्ष्य भाषा में स्वाभाविक है?), प्रारूप (क्या टैग, संख्याएं, स्वरूपण संरक्षित हैं?)। हम अगली गुणवत्ता इकाई में इन आयामों को और गहरा करेंगे; अभी के लिए, इसे अपना प्री-डिलीवरी रिफ्लेक्स बनने दें।

सावधानी: एमटी आउटपुट की सबसे खतरनाक त्रुटियां "धाराप्रवाह लेकिन गलत" हैं। वाक्य पूर्ण तुर्की में हो सकता है, लेकिन स्रोत में "15% छूट" को "50% छूट" में बदल दिया गया होगा। प्रवाह से निराश न हों; हमेशा संख्या, ऋणात्मक और व्यक्तिवाचक संज्ञा को अलग-अलग देखें।

तीन मिनी मामले

केस 1 - सही इंजन ने समय को आधा कर दिया। एक अनुवादक ने एनएमटी के साथ 12,000 शब्दों के सॉफ़्टवेयर इंटरफ़ेस और एलएलएम के साथ समान मात्रा की एक मार्केटिंग पुस्तिका का अनुवाद करना चुना। इंटरफ़ेस पर एनएमटी की स्थिरता ने काम को तेज़ बना दिया; बुकलेट में एलएलएम के टोनल लचीलेपन ने पुनर्लेखन के बोझ को 40% तक कम कर दिया। एक ही इंजन को दोनों काम देने से समय बर्बाद होगा।

केस 2 - पूर्व-मूल्यांकन ने कीमत बचाई। एक कार्यालय एक कानूनी पाठ पेश करने वाला था क्योंकि "यह मशीनों द्वारा बनाया जा सकता है, यह सस्ता होगा"। पूर्व-मूल्यांकन में, 500 शब्दों के नमूने का अनुवाद किया गया था; मशीन ने गलत सिस्टम के समतुल्य के साथ दो कानूनी शर्तें लौटा दीं। कार्यालय ने काम की कीमत "संपादन के बाद भारी" बताई और एक यथार्थवादी समय सीमा दी; गलत प्रस्ताव के कारण वह पैसे खोने से बच गया।

केस 3 - भाषा युग्म अंतर। एक टीम ने सोचा कि जो इंजन अंग्रेजी→जर्मन में बढ़िया काम करता है, उसकी गुणवत्ता तुर्की→अरबी में भी उतनी ही अच्छी होती है। 300 शब्दों के परीक्षण से पता चला कि अरबी आउटपुट में बहुत अधिक सुधार की आवश्यकता है। टीम ने भाषा युग्म के आधार पर अलग-अलग इंजन और अलग-अलग संपादन-पश्चात बजट आवंटित किए।

चार प्रतिलिपि योग्य टेम्पलेट

1) पाठ उपयुक्तता मूल्यांकन:

आपकी भूमिका: वरिष्ठ एमटीपीई विशेषज्ञ। मशीनी अनुवाद के लिए उपयुक्तता के लिए निम्नलिखित पाठ को रेटिंग दें: शाब्दिक/तकनीकी या रचनात्मक/प्रासंगिक? इसे (1) बहुत मशीन-अनुकूल, (2) मध्यम, (3) उच्च जोखिम के रूप में वर्गीकृत करें और अपना औचित्य लिखें। संपादन के बाद अपेक्षित लोड को हल्के/मध्यम/भारी के रूप में अनुमानित करें। पाठ उदाहरण: [200-300 शब्द चिपकाएँ]

2) निर्देशित एलएलएम अनुवाद (शब्दावली और स्वर नियंत्रण के साथ):

इस पाठ का अनुवाद करें [स्रोत]→[लक्ष्य]। श्रोतागण: [कौन]। स्वर: [उदा. अधिकारी]। फ़ील्ड: [उदा. वित्त]। शब्दों की सूची (उपयोग करना सुनिश्चित करें): [ए→ए, बी→बी]। नियम: जो स्रोत में नहीं है उसे न जोड़ें, संख्याएं/दिनांक/नाम रखें, प्रत्येक वाक्य को एक वाक्य से बदलें। जहां आप निश्चित नहीं हैं वहां [?] से चिह्नित करें। पाठ: [...]

3) दो इंजनों की तुलना:

नीचे एक ही स्रोत वाक्य (ए और बी) के दो अलग-अलग अनुवाद हैं। शुद्धता, शब्दावली और स्वाभाविकता की दृष्टि से प्रत्येक की तुलना करें और औचित्य सहित बताएं कि किसमें कम सुधार की आवश्यकता होगी। स्रोत: [...] | अनुवाद ए: [...] | अनुवाद बी: [...]

4) कच्चा आउटपुट त्वरित निरीक्षण:

नीचे स्रोत और मशीनी अनुवाद है। बस निम्नलिखित को चिह्नित करें: (1) छोड़ी गई/जोड़ी गई जानकारी, (2) गलत संख्या/दिनांक/नाम, (3) निषेध त्रुटि, (4) असंगत शब्द। कोई सुधार न लिखें, केवल जोखिम भरे क्षेत्रों की सूची बनाएं।स्रोत: [...] | अनुवाद: [...]

कमजोर संकेत/मजबूत संकेत

कमज़ोर: "इस पाठ का अनुवाद करें और यह अच्छा होगा।" (इंजन के लिए, "अच्छा" अपरिभाषित है; कोई स्वर नहीं, कोई शब्द नहीं, कोई द्रव्यमान नहीं।)

गुक्लु: "इस उत्पाद विवरण का अंग्रेजी से तुर्की में अनुवाद करें। क्षेत्र: ई-कॉमर्स। दर्शक: युवा उपभोक्ता। स्वर: दोस्ताना लेकिन आश्वस्त करने वाला। 'चेकआउट' → 'चेकआउट चरण', 'इच्छा सूची' → 'इच्छा सूची'। नंबर और ब्रांड नाम बदलें। बिना किसी अनुवाद गंध के धाराप्रवाह तुर्की।"

अंतर: मजबूत प्रॉम्प्ट इंजन को मापने योग्य लक्ष्य देता है; आउटपुट सीधे संपादित किए गए ड्राफ्ट का अनुमान लगाता है।

एनएमटी बनाम एलएलएम तुलना चार्ट

आकार

एनएमटी (गूगल, डीपएल)

एलएलएम (चैटजीपीटी, क्लाउड)

गति

बहुत तेज़

मध्यम

निर्देश/टोन प्राप्त करें

कमजोर

मजबूत

शब्द सूची का अनुपालन करें

सीमित

अच्छा (संकेत के साथ)

व्यापक संदर्भ

कमजोर

अच्छा

मतिभ्रम का खतरा

कम

मध्यम (नियंत्रण आवश्यक)

सबसे उपयुक्त नौकरी

सीधा/तकनीकी/दोहरावदार

स्वर/संदर्भ/रचनात्मक

सामान्य गलतियाँ

  • प्रत्येक कार्य के लिए एक ही इंजन का उपयोग करना। काम के प्रकार के अनुसार इंजन का चयन न करने से समय और गुणवत्ता की हानि होती है।
  • पूर्व-मूल्यांकन के बिना मूल्य/समय देना। 200-300 शब्दों का परीक्षण शुरू से ही आश्चर्य प्रकट करता है।
  • प्रवाह को सटीकता समझने की भूल करना। एक सुंदर वाक्य का मतलब सही वाक्य नहीं होता.
  • भाषा युग्म और दिशा भेद को नजरअंदाज करना। एक जोड़ी में एक अच्छा इंजन दूसरे में कमजोर हो सकता है।
  • एलएलएम के अतिरिक्त पर ध्यान नहीं। एलएलएम कभी-कभी "मदद के लिए" स्रोत में नहीं वाक्य जोड़ता है; इसकी जांच करें।

संदर्भ विंडो और संगति

एलएलएम के साथ लंबे पाठ का अनुवाद करते समय, एक तकनीकी सीमा जानना आवश्यक है: संदर्भ विंडो - मॉडल एक समय में पाठ की मात्रा "देख" सकता है और दिमाग में रख सकता है। यदि पाठ इस विंडो से बड़ा है, तो आपको इसे खंडों में विभाजित करना होगा, और मॉडल अगले खंड में आपके द्वारा पिछले खंडों में किए गए शब्द निर्णय या टोन को "भूल" सकता है। इसलिए, किसी लंबी किताब या दस्तावेज़ का एक टुकड़े में अनुवाद करने के बजाय, प्रत्येक टुकड़े को टर्मबेस और शैली सारांश की याद दिलाने से निरंतरता बनी रहती है। यह समस्या छोटे पाठों में नहीं आती; हालाँकि, उपन्यास और मैनुअल जैसे लंबे कार्यों में, अंशों में निरंतरता की अतिरिक्त जाँच करना आवश्यक है। व्यावहारिक समाधान: एक "प्रोजेक्ट मेमोरी" (शब्द + वर्ण + टोन निर्णय) तैयार करना और इसे प्रत्येक टुकड़े की शुरुआत में जोड़ना और अनुवाद के अंत में टुकड़ों के बीच स्थिरता के लिए स्कैन करना। एनएमटी में, इस समस्या को एक अलग तरीके से अनुभव किया जाता है: चूंकि एनएमटी वाक्य दर वाक्य अनुवाद करता है, पैराग्राफ की लंबाई की स्थिरता पहले से ही कमजोर है, इसलिए टर्मबेस शब्द अनुशासन का कार्य करता है।

सारांश

मशीनी अनुवाद के दो परिवार हैं: एनएमटी, जो तेज़ और सुसंगत है, और एलएलएम, जो निर्देश लेता है और संदर्भ और टोन को बेहतर ढंग से देखता है। मास्टर अनुवादक मशीन के लिए पाठ की उपयुक्तता को पहले से ही ग्रेड करता है, काम के अनुसार इंजन का चयन करता है, डिलीवरी से पहले कच्चे आउटपुट की गुणवत्ता को तुरंत मापता है, और कभी भी सटीकता के साथ प्रवाह को भ्रमित नहीं करता है। यह पूर्व-मूल्यांकन रिफ्लेक्स आपको यथार्थवादी समय/मूल्य देने और खुद को अंध विश्वास से बचाने की अनुमति देता है।

आवेदन कार्य

एनएमटी टूल और एलएलएम दोनों के साथ समान 200 शब्दों के पाठ का अनुवाद करें। पांच आयामों (सटीकता, पूर्णता, शब्दावली, प्रवाह, प्रारूप) पर दो आउटपुट की तुलना करें और उन कारणों को लिखें जिनके लिए इस पाठ के लिए कम पोस्ट-संपादन की आवश्यकता होती है। फिर "रॉ आउटपुट क्विक चेक" टेम्पलेट के साथ दोनों पर समस्या/आकस्मिकता/टर्म जोखिमों को फ़्लैग करें।

चेकलिस्ट

  • [ ] मैंने मशीन के लिए पाठ की उपयुक्तता को वर्गीकृत किया (कम/मध्यम/उच्च जोखिम)।
  • [ ] नौकरी के प्रकार के आधार पर, मैंने तय किया कि एनएमटी या एलएलएम का उपयोग करना है या नहीं।
  • [ ] मैंने एक छोटे नमूने के साथ प्रारंभिक मूल्यांकन किया और तदनुसार अवधि/कीमत निर्धारित की।
  • [ ] मैंने तुरंत पांच आयामों में कच्चे आउटपुट का निरीक्षण किया।
  • [ ] मैंने प्रवाह से मूर्ख हुए बिना संख्या, दिनांक, नाम और नकारात्मक की अलग-अलग जाँच की।