इकाइयाँ
1. अनुवाद और व्याख्या में कृत्रिम बुद्धिमत्ता का परिचय: भूमिकाएँ, सीमाएँ, प्रमाणीकरण, गोपनीयता और नैतिकता 2. मशीनी अनुवाद के बुनियादी सिद्धांत: एनएमटी, एलएलएम, इंजन चयन और पूर्व-मूल्यांकन 3. मशीनी अनुवाद पोस्ट-संपादन (एमटीपीई): हल्का और पूर्ण पोस्ट-संपादन 4. शब्दावली प्रबंधन और टर्मबेस: संगति और कॉर्पोरेट भाषा 5. कैट टूल्स और ट्रांसलेशन मेमोरी (टीएम) के साथ एआई एकीकरण 6. स्थानीयकरण (L10n): सॉफ्टवेयर, वेब, गेम और सांस्कृतिक अनुकूलन 7. उपशीर्षक, डबिंग और दृश्य-श्रव्य अनुवाद 8. गुणवत्ता नियंत्रण (क्यूए), मूल्यांकन मेट्रिक्स और एलक्यूए 9. व्याख्या तैयारी: लगातार और एक साथ व्याख्या 10. संदर्भ, संस्कृति, स्वर और रचनात्मक अनुवाद (ट्रांसक्रिएशन) 11. गोपनीयता, नैतिकता, कॉपीराइट, प्रामाणिकता और पेशे का भविष्य
इकाई 5 / 11

कैट टूल्स और ट्रांसलेशन मेमोरी (टीएम) के साथ एआई एकीकरण

लाभ:

  • ट्रांसलेशन मेमोरी (टीएम), फ़ज़ी मैच और सेगमेंट की अवधारणाओं को समझना, और फ़ज़ी मैच में अंतरों को आँख बंद करके अपनाने के बजाय उनका उपयोग करने में सक्षम होना।
  • टीएम में केवल स्वीकृत अनुवाद लिखने, ग्राहक टीएम को अलग रखने और टीएम रखरखाव करने का अनुशासन लागू करने की क्षमता
  • कैट के भीतर एमटी/एलएलएम एकीकरण में डेटा कहां जाता है, इसे नियंत्रित करके गोपनीयता की रक्षा करने की क्षमता

व्यावसायिक अनुवाद प्रायः CAT टूल में किया जाता है, सादे पाठ संपादक में नहीं। इस इकाई में, आप सीएटी उपकरण, अनुवाद के केंद्र में अनुवाद मेमोरी (टीएम), मशीनी अनुवाद और एलएलएम के साथ मिलकर कैसे काम करते हैं, और इस पारिस्थितिकी तंत्र का कुशलतापूर्वक और सुरक्षित रूप से उपयोग कैसे करें सीखेंगे। लक्ष्य एक अनुवाद प्रौद्योगिकी उपयोगकर्ता बनना है जो एक संपूर्ण परियोजना का प्रबंधन करता है, न कि व्यक्तिगत वाक्यों का, सुसंगत, तेज़ और पता लगाने योग्य तरीके से।

बुनियादी अवधारणाएँ

CAT टूल (कंप्यूटर-असिस्टेड ट्रांसलेशन) एक पेशेवर सॉफ्टवेयर है (जैसे ट्रेडोस, मेमोक्यू, फ़्रेज़, मेटकैट) जो अनुवाद वाक्य को वाक्य (सेगमेंट) द्वारा व्यवस्थित करता है और अनुवाद मेमोरी और टर्मबेस को जोड़ता है। स्रोत और लक्ष्य को साथ-साथ दिखाता है, दोहराव पकड़ता है, फ़ॉर्मेटिंग सुरक्षित रखता है।

टीएम (ट्रांसलेशन मेमोरी) एक डेटाबेस है जो आपके द्वारा पहले अनुवादित स्रोत-लक्ष्य वाक्य जोड़े को संग्रहीत करता है। जब कोई नया वाक्य आता है, यदि टीएम में कोई समान वाक्य है, तो एजेंट आपको इसका सुझाव देता है। यहां मुख्य अवधारणा अस्पष्ट मिलान है: टीएम में एक वाक्य के लिए नए वाक्य की समानता (100% = बिल्कुल वही, 85% = काफी हद तक समान)। उच्च मिलान कार्य को गति देते हैं क्योंकि आप अपने पिछले अनुवाद का पुन: उपयोग करते हैं।

एक खंड अनुवाद की मूल इकाई है - आमतौर पर एक वाक्य। CAT टूल टेक्स्ट को खंडों में विभाजित करता है और प्रत्येक को अलग-अलग संपादित करता है।

टीएम का महत्व: एमटी कच्चे ड्राफ्ट तैयार करता है, लेकिन टीएम आपके अनुमोदित, मानव-गुणवत्ता वाले पिछले अनुवाद लौटाता है। दोनों भिन्न हैं: एमटी एक भविष्यवाणी है, टीएम एक स्मृति है।

युक्ति: टीएम और एमटी को भ्रमित न करें। 100% टीएम मिलान (आपका पूर्व अनुमोदित अनुवाद) आम तौर पर विश्वसनीय होता है; एमटी अनुशंसा को हमेशा सत्यापित किया जाना चाहिए। CAT उपकरण दोनों को अलग-अलग रंगों/लेबलों के साथ दिखाते हैं; यह अंतर हमेशा देखें.

एमटी और एलएलएम का कैट में एकीकरण

आधुनिक सीएटी उपकरण आंतरिक रूप से एमटी इंजन और तेजी से एलएलएम कहते हैं: यदि टीएम में कोई मिलान नहीं है, तो एजेंट स्वचालित रूप से सेगमेंट के लिए एमटी अनुशंसा लौटाता है; आप इसे पोस्ट-एडिट करते हैं (यानी कैट में एमटीपीई प्रवाह)। नवीनतम पीढ़ी के उपकरण एलएलएम को भी एकीकृत करते हैं: आप टूल में "इस सेगमेंट को इस टोन के साथ फिर से लिखें", "इस शब्द को टर्मबेस में सही करें" आदि जैसे ऑपरेशन कर सकते हैं।

इस एकीकरण का लाभ: टीएम, टर्मबेस, एमटी और एलएलएम एक स्क्रीन में संयुक्त हैं; प्रत्येक वाक्य के लिए, प्रवाह "पहले टीएम को देखें, अन्यथा एमटी का सुझाव दें, शब्द क्यूए स्वचालित रूप से" स्थापित है। नकारात्मक पहलू और सावधानी: डेटा कहां जाता है? क्लाउड-आधारित एमटी/एलएलएम एकीकरण बाहरी सर्वर पर टेक्स्ट भेज सकता है; गोपनीय कार्य में, यह अनुबंध का उल्लंघन हो सकता है। यह अवश्य जान लें कि वाहन किस इंजन से और किस डेटा पॉलिसी से जुड़ा है।

अनुवाद स्मृति को फीड करना और साफ़ करना

टीएम का मूल्य उतना ही है जितना इसमें अनुवाद की गुणवत्ता है। कचरा आया कचरा गया। दो अनुशासन:

  1. बस टीएम को प्रमाणित अनुवाद लिखें। यदि आप कच्चे एमटी आउटपुट को सत्यापित किए बिना टीएम में सहेजते हैं, तो यह खराब "मेमोरी" के रूप में आपकी भविष्य की नौकरियों में वापस आ जाएगा।
  2. टीएम रखरखाव करें. समय के साथ, शर्तें बदलती हैं और त्रुटियाँ प्रवेश करती हैं। समय-समय पर टीएम को साफ करें, खराब/गलत जोड़ियों को सही करें। इस कार्य में मैं यह पूछने के लिए एलएलएम का उपयोग कर रहा हूं कि "क्या इन टीएम जोड़ियों में कोई विसंगतियां/शब्द पूर्वाग्रह हैं?" आप इसे ऑडिटर के रूप में उपयोग कर सकते हैं।
सावधानी: एक ग्राहक के टीएम का दूसरे ग्राहक के व्यवसाय में उपयोग करना गोपनीयता का उल्लंघन और शब्द भ्रम का जोखिम दोनों है। टीएम को क्लाइंट/प्रोजेक्ट के आधार पर अलग रखा जाता है। एक मिश्रित "सबकुछ टीएम" गोपनीयता और गुणवत्ता दोनों को नष्ट कर देता है।

तीन मिनी मामले

केस 1 - टीएम ने रिप्ले उड़ाया। एक निर्माता एक उत्पाद परिवार का अनुवाद कर रहा था, जहां उसके मैनुअल का 70% हिस्सा साल-दर-साल वही रहता था। टीएम को धन्यवाद, प्रत्येक नए संस्करण में 100% और उच्च अस्पष्ट मिलान स्वचालित रूप से आए; 30,000 शब्दों के कार्य में से केवल ~9,000 शब्द ही वास्तविक नए अनुवाद थे। समय और लागत एक तिहाई कम हो गई।

केस 2 - डर्टी टीएम ने त्रुटि का प्रचार किया। एक टीम ने बिना सत्यापन के कच्चे एमटी आउटपुट को टीएम में सहेज लिया था। एक साल बाद वही गलत अनुवाद बार-बार सामने आया, जो 100% मिलान के रूप में "विश्वसनीय" प्रतीत हुआ; त्रुटि 14 विभिन्न दस्तावेज़ों में फैली हुई थी। टीम ने "केवल टीएम में प्रमाणित अनुवाद" नियम और एक सफाई दौरे की शुरुआत की।

केस 3 - एकीकरण में गोपनीयता लीक हो गई। एक अनुवादक ने CAT प्रोजेक्ट में गोपनीय कार्य किया जो स्वचालित रूप से क्लाउड MT से जुड़ा था; पाठ एक बाहरी इंजन के पास गया जिसकी डेटा नीति अस्पष्ट है। एक बार ध्यान देने पर, गुप्त परियोजनाओं के लिए एमटी एकीकरण बंद कर दिया गया था और केवल एंटरप्राइज़ इंजन जो "डेटा को संग्रहीत/प्रशिक्षित नहीं करते" का उपयोग किया गया था।

चार प्रतिलिपि योग्य टेम्पलेट

1) फ़ज़ी मैच मूल्यांकन (एलएलएम के लिए):

नीचे नया स्रोत वाक्य, टीएम में समान वाक्य और उसका स्वीकृत अनुवाद है। मुझे बताएं कि टीएम अनुवाद को नए वाक्य में अनुकूलित करने के लिए मुझे वास्तव में क्या बदलने की आवश्यकता है; अनावश्यक परिवर्तन का सुझाव न दें. अर्थ का अंतर स्पष्ट रूप से दिखायें। नया स्रोत: [...] | टीएम स्रोत: [...] | टीएम अनुवाद: [...]

2) टीएम स्थिरता जांच:

टीएम से स्रोत-लक्ष्य जोड़े नीचे दिए गए हैं। उन विसंगतियों और शब्द विचलनों को चिह्नित करें जहां समान या बहुत समान स्रोत वाक्यों का अलग-अलग अनुवाद किया जाता है। बस समस्याएं सूचीबद्ध करें। जोड़े: [...]

3) खंड टोन पुनर्लेखन (कैट में एलएलएम):

अर्थ बदले बिना निम्नलिखित लक्ष्य खंड [वांछित स्वर] बनाएं। शर्तों की सूची का अनुपालन करें: [...]। नंबर और नाम रखें. केवल दोबारा लिखे गए खंड को निर्यात करें। खंड: [...]

4) गोपनीयता/एकीकरण पूर्व जांच:

मैं CAT प्रोजेक्ट में MT/LLM एकीकरण का उपयोग करूंगा। मैं इस प्रोजेक्ट में पाठ के प्रकार का वर्णन करूंगा; मुझे बताएं कि क्या इस पाठ को क्लाउड-आधारित बाहरी इंजन पर भेजना उचित है, मुझे प्रदाता से कौन से प्रश्न (डेटा प्रतिधारण, प्रशिक्षण, स्थान) पूछना चाहिए। पाठ प्रकार/गोपनीयता स्थिति: [...]

कमजोर संकेत/मजबूत संकेत

कमजोर: "टीएम में अनुवाद का प्रयोग करें।" (यह स्पष्ट नहीं है कि मिलान दर क्या है और क्या अनुकूलित किया जाए; अंधी नकल से त्रुटियां उत्पन्न होती हैं।)

सशक्त: "यह नया वाक्य 90% मामलों में टीएम के वाक्य से मेल खाता है। टीएम अनुवाद पर निर्माण करें लेकिन इस अंतर को प्रतिबिंबित करें: स्रोत में 'मासिक' के बजाय 'वार्षिक' है, इसलिए इसे 'मासिक' के बजाय 'वार्षिक' होना चाहिए। और कुछ भी न बदलें।"

अंतर: मजबूत संकेत मैच अंतर को इंगित करता है; यह "पुराने अनुवाद को वैसे ही छोड़ने" से रोकता है, जो अस्पष्ट मिलान की सबसे आम गलती है।

कैट पारिस्थितिकी तंत्र घटक तालिका

घटक

क्या करता है

एआई के साथ संबंध

टीएम (अनुवाद स्मृति)

पिछले अनुवादों को मंजूरी दे दी गई है

विश्वसनीय; एमटी से पहले

टर्मबेस

अवधि की एकरूपता सुनिश्चित करता है

यह एलएलएम के लिए संकेत के रूप में दिया गया है

एमटी अनुशंसा

खाली खंड में कच्चा स्केच

पोस्ट-एडिट किया जाना चाहिए

एलएलएम एकीकरण

स्वर/शब्द/पुनर्लेखन

नियंत्रित, गोपनीयता का ध्यान

क्यूए मॉड्यूल

स्कैन संख्या/शब्द/टैग त्रुटि

स्वचालित नियंत्रण

सामान्य गलतियाँ

  • अस्पष्ट मिलान को आँख मूँद कर स्वीकार करना। 85% मिलान अर्थ में 15% अंतर छिपा सकता है।
  • टीएम को कच्चा एमटी आउटपुट लिखना। डर्टी टीएम त्रुटि को भविष्य में ले जाता है और उसे फैलाता है।
  • ग्राहक/परियोजना टीएम का मिश्रण। गोपनीयता और शब्द भ्रम का जोखिम।
  • यह नहीं पता कि एकीकरण डेटा कहां जाता है। छिपा हुआ पाठ आपको पता चले बिना ही लीक हो सकता है।
  • टीएम/एमटी अंतर को भूल जाना। एमटी एक अनुमान है; टीएम एक स्मृति है. दोनों समान रूप से सुरक्षित नहीं हैं.

पूर्व-अनुवाद और संरेखण

दो उन्नत CAT फ़ंक्शंस AI युग में वर्कफ़्लो को और तेज़ करते हैं। पहला है पूर्व-अनुवाद: परियोजना की शुरुआत में, उपकरण स्वचालित रूप से सभी खंडों को टीएम और एमटी से भर देता है; एक खाली फ़ाइल के बजाय, आप एक ऐसी फ़ाइल से शुरू करते हैं जहां 100% मिलान स्वीकृत हैं, फ़ज़ी मिलान अनुकूलित होने की प्रतीक्षा कर रहे हैं, और खाली वाले एमटी ड्राफ्ट हैं। यह कार्य को "स्क्रैच से लिखना" से "समीक्षा और संपादन" में बदल देता है - लेकिन आपको पूर्व-अनुवाद को आँख बंद करके मंजूरी देने के बजाय प्रत्येक खंड का मूल्यांकन करने की आवश्यकता है।

दूसरा संरेखण है: यदि आपके पास एक स्रोत-लक्ष्य दस्तावेज़ जोड़ी है जिसका पहले अनुवाद किया जा चुका है लेकिन टीएम में प्रवेश नहीं किया है, तो संरेखण उपकरण उन्हें खंड दर खंड मिलाता है और उन्हें टीएम में परिवर्तित करता है। इस प्रकार, आपके पिछले अनुवाद "मेमोरी" में जुड़ जाते हैं। संरेखण में सावधानी: स्वचालित मिलान हमेशा सही नहीं होता है; एक खंड की फिसलन से संपूर्ण संरेखण बाधित हो जाता है। TMing से पहले संरेखित जोड़ियों की समीक्षा करने से सबसे पहले गंदे TM के जोखिम को रोका जा सकता है। ये दो कार्य आपकी वर्तमान संपत्तियों (पिछले अनुवादों) को भविष्य के व्यवसायों में निवेश में बदल देते हैं।

संक्षेप में

कैट उपकरण; यह अनुवाद मेमोरी, टर्मबेस, मशीनी अनुवाद और एलएलएम को एक ही उत्पादन लाइन में जोड़ती है। टीएम एक मेमोरी है जो आपके स्वीकृत पिछले अनुवादों को पुनः प्राप्त करती है और दोहराए जाने वाले कार्यों में शानदार गति प्रदान करती है; एमटी एक भविष्यवाणी है जिसे हमेशा सत्यापित करने की आवश्यकता होती है। समझदार उपयोगकर्ता फ़ज़ी मैचों में अंतर को ध्यान से अपनाता है, टीएम में केवल स्वीकृत अनुवाद लिखता है, ग्राहक टीएम को अलग रखता है, और यह जानकर गोपनीयता की रक्षा करता है कि एकीकरण में डेटा कहाँ जाता है।

आवेदन कार्य

CAT टूल में एक छोटा प्रोजेक्ट सेट करें (एक मुफ़्त ऑनलाइन CAT भी काम करता है): एक टर्मबेस और एक खाली TM जोड़ें। 10-वाक्य वाले पाठ का अनुवाद करें, स्वीकृत अनुवादों को टीएम में सहेजें। फिर पहले पाठ के समान दूसरे पाठ का अनुवाद करें और टीएम द्वारा लौटाए गए अस्पष्ट मिलानों को "फ़ज़ी मैच मूल्यांकन" टेम्पलेट के साथ अनुकूलित करें; ध्यान दें कि यदि आपने आँख बंद करके टीएम को स्वीकार कर लिया तो आप कितने वाक्यों में गलती करेंगे।

चेकलिस्ट

  • [ ] मैंने टीएम और टर्मबेस को प्रोजेक्ट से जोड़ा।
  • [ ] मैंने फ़ज़ी मैचों में अंतर का उपयोग आँख बंद करके करने के बजाय अनुकूल रूप से किया।
  • [ ] मैंने टीएम को केवल वही प्रमाणित अनुवाद लिखा है जिसे मैंने सत्यापित किया है।
  • [ ] मैंने ग्राहक/परियोजना टीएम को अलग रखा।
  • [ ] मैंने जांच की कि एमटी/एलएलएम एकीकरण में डेटा कहां जाता है।