इकाइयाँ
1. अनुवाद और व्याख्या में कृत्रिम बुद्धिमत्ता का परिचय: भूमिकाएँ, सीमाएँ, प्रमाणीकरण, गोपनीयता और नैतिकता 2. मशीनी अनुवाद के बुनियादी सिद्धांत: एनएमटी, एलएलएम, इंजन चयन और पूर्व-मूल्यांकन 3. मशीनी अनुवाद पोस्ट-संपादन (एमटीपीई): हल्का और पूर्ण पोस्ट-संपादन 4. शब्दावली प्रबंधन और टर्मबेस: संगति और कॉर्पोरेट भाषा 5. कैट टूल्स और ट्रांसलेशन मेमोरी (टीएम) के साथ एआई एकीकरण 6. स्थानीयकरण (L10n): सॉफ्टवेयर, वेब, गेम और सांस्कृतिक अनुकूलन 7. उपशीर्षक, डबिंग और दृश्य-श्रव्य अनुवाद 8. गुणवत्ता नियंत्रण (क्यूए), मूल्यांकन मेट्रिक्स और एलक्यूए 9. व्याख्या तैयारी: लगातार और एक साथ व्याख्या 10. संदर्भ, संस्कृति, स्वर और रचनात्मक अनुवाद (ट्रांसक्रिएशन) 11. गोपनीयता, नैतिकता, कॉपीराइट, प्रामाणिकता और पेशे का भविष्य
इकाई 4 / 11

शब्दावली प्रबंधन और टर्मबेस: संगति और कॉर्पोरेट भाषा

लाभ:

  • एक टर्मबेस स्थापित करके और अनुमोदित और निषिद्ध समकक्षों को स्पष्ट रूप से परिभाषित करके शब्दावली स्थिरता सुनिश्चित करने की क्षमता
  • टर्म उम्मीदवारों को तुरंत निकालने और विशेषज्ञ और ग्राहक के साथ अंतिम टर्म निर्णय लेने के लिए कृत्रिम बुद्धिमत्ता का उपयोग करना
  • अनुवाद के दौरान टूल/प्रॉम्प्ट से टर्मबेस को कनेक्ट करने और अनुवाद के बाद के टर्म क्यूए टूर के साथ असंगतताओं का पता लगाने की क्षमता

तकनीकी अनुवाद में, यदि आप "उपयोगकर्ता खाता" शब्द का अनुवाद एक स्थान पर "उपयोगकर्ता खाता", दूसरे स्थान पर "सदस्य खाता", किसी अन्य स्थान पर "उपयोगकर्ता प्रोफ़ाइल" के रूप में करते हैं, तो उपयोगकर्ता खो जाएगा, ब्रांड असंगत दिखाई देगा, और खोज/दस्तावेज़ीकरण टूट जाएगा, भले ही पाठ तकनीकी रूप से "सही" हो। अनुवाद का मूक लेकिन सबसे निर्णायक गुणवत्ता तत्व पारिभाषिक संगति है। इस इकाई में, आप शब्दावली प्रबंधन, टर्मबेस (टर्म डेटाबेस) बनाना, एआई के साथ शब्द निष्कर्षण और अनुवाद के दौरान शब्दावली अनुशासन कैसे बनाए रखना सीखेंगे। इसका उद्देश्य एक ऐसा विशेषज्ञ बनना है जो हर प्रोजेक्ट में हर जगह समान अवधारणा को समान रूप से पूरा करता हो और कॉर्पोरेट भाषा के प्रति वफादार हो।

बुनियादी अवधारणाओं

शब्दावली ऐसे शब्द और अभिव्यक्ति हैं जो किसी क्षेत्र या संस्थान ("चेकआउट", "रिटर्न पॉलिसी", "स्टेम सेल") की विशिष्ट अवधारणाओं के अनुरूप होते हैं। टर्मबेस (टीबी - टर्म डेटाबेस) एक संरचित शब्दकोश है जो इन शब्दों के स्रोत-लक्ष्य समकक्ष, परिभाषा, उपयोग नोट और "निषिद्ध समकक्ष" रखता है; यह CAT टूल से जुड़ता है और स्वचालित रूप से अनुवाद का सुझाव देता है। शब्द निष्कर्षण उन शब्दों को स्वचालित रूप से एकत्रित करने की प्रक्रिया है जिन्हें किसी पाठ से अनुवाद/मानकीकृत करने की आवश्यकता होती है। शब्दावली शब्दों की एक सरल, दो-स्तंभीय सूची है; इसका उपयोग छोटे-छोटे कार्यों में टर्मबेस के स्थान पर किया जाता है।

यह इतना महत्वपूर्ण क्यों है? क्योंकि मशीनी अनुवाद और एलएलएम अपने आप में शब्दावली स्थिरता की गारंटी नहीं देते हैं। एनएमटी प्रत्येक वाक्य का स्वतंत्र रूप से अनुवाद कर सकता है; एलएलएम लंबे पाठ में अपना निर्णय बदल सकता है। टर्म अनुशासन जो प्रदान करता है वह वह टर्मबेस है जिसे आपने तैयार किया है और वाहन से जोड़ा है।

युक्ति: किसी ग्राहक के साथ अपनी पहली नौकरी पर टर्मबेस स्थापित करने में 30 मिनट का समय व्यतीत करें। यह निवेश बाद के सभी कार्यों में गति और गुणवत्ता दोनों बढ़ाता है और "आपके अनुवादों में ब्रांड सुसंगत" की प्रतिष्ठा देता है।

एआई के साथ टर्म निष्कर्षण और टर्मबेस निर्माण

एआई टर्मबेस स्थापित करने के सबसे कठिन हिस्से को गति देता है: उम्मीदवारों को ढूंढना। आप एलएलएम को एक स्रोत पाठ दे सकते हैं और कह सकते हैं, "इस पाठ में डोमेन-विशिष्ट शब्दों को सूचीबद्ध करें, जो दोहराव वाले हैं, और जिनके अनुवाद में निरंतरता की आवश्यकता है।" फिर आप उम्मीदवारों की इस सूची को मंजूरी देते हैं, सही लक्ष्य प्रतिक्रिया निर्धारित करते हैं और आवश्यकता पड़ने पर ग्राहक से पुष्टि करते हैं। महत्वपूर्ण बिंदु: एआई सुझाव देता है कि टर्म उम्मीदवार, विशेषज्ञ और ग्राहक टर्म निर्णय लें। कोई ब्रांड "अपॉइंटमेंट" कहता है या "बुकिंग" यह ग्राहक की पसंद है, एआई की नहीं।

प्रत्येक शब्द के लिए, निम्नलिखित को टर्मबेस में डालें: स्रोत शब्द, स्वीकृत लक्ष्य समकक्ष, संक्षिप्त विवरण/संदर्भ, "उपयोग न करें" (निषिद्ध) समकक्ष, और यदि लागू हो तो डोमेन/प्रोजेक्ट टैग। निषिद्ध समकक्ष लिखना असंगतता से बचने का सबसे प्रभावी तरीका है ("खाता" के लिए, केवल "खाता" का उपयोग न करें; "प्रोफ़ाइल", "सदस्यता")।

अनुवाद के दौरान शब्दावली अनुशासन बनाए रखना

टर्मबेस स्थापित करना पर्याप्त नहीं है; इसे क्रियान्वित करने की जरूरत है. तीन परतें:

  1. अनुवाद के दौरान: एलएलएम में अनुवाद करते समय, प्रॉम्प्ट में टर्मबेस जोड़ें ("इन समकक्षों के साथ इन शब्दों का उपयोग अवश्य करें")। यदि आप CAT टूल का उपयोग कर रहे हैं, तो टर्मबेस कनेक्ट करें; टूल तुरंत मैच दिखाता है.
  2. अनुवाद के बाद QA: तैयार पाठ को टर्मबेस के विरुद्ध स्कैन करें। मैंने एलएलएम से पूछा "क्या इस पाठ में ऐसे स्थान हैं जो टर्मबेस का अनुपालन नहीं करते हैं?" या CAT टूल का टर्म QA फ़ंक्शन चलाएँ।
  3. प्रोजेक्ट का अंत अद्यतन: कार्य समाप्त होने पर टर्मबेस में नए नियम और ग्राहक प्रतिक्रिया जोड़ें; टर्मबेस एक जीवित दस्तावेज़ है.
सावधानी: जब आप एलएलएम को एक दीर्घकालिक टर्मबेस देते हैं तो यह कुछ शर्तों को "भूल" सकता है या संदर्भ के आधार पर उन्हें बदल सकता है। इसलिए अनुवाद के बाद के QA दौर को कभी न छोड़ें; संकेत देना जाँच का विकल्प नहीं है।

तीन मिनी मामले

केस 1 - टर्मबेस ने विसंगति को हटा दिया। एक सॉफ्टवेयर कंपनी द्वारा 5 अलग-अलग फ्रीलांस अनुवादकों के साथ बनाए गए 60,000 शब्दों के दस्तावेज़ में, उन्हीं 40 शब्दों का दर्जनों अलग-अलग तरीकों से अनुवाद किया गया था। एक बार जब एक सामान्य टर्मबेस स्थापित हो गया और सभी अनुवाद इसके साथ संरेखित हो गए, तो उपयोगकर्ता समर्थन के लिए "मुझे यह स्क्रीन नहीं मिल रही" जैसी शिकायतें काफी कम हो गईं।

केस 2 - एआई ने अनुमान को 2 दिन से घटाकर 2 घंटे कर दिया। 200 पेज के डिवाइस दस्तावेज़ से शब्दों की सूची को मैन्युअल रूप से निकालने के बजाय, एक मेडिकल अनुवाद टीम ने एलएलएम का मसौदा तैयार किया था: 2 घंटे में 380 उम्मीदवार शब्द सूचीबद्ध किए गए थे। विशेषज्ञ ने इन्हें 1 दिन में मंजूरी दे दी और उनकी प्रतिक्रियाएँ स्पष्ट कर दीं; यदि इसे मैन्युअल रूप से किया जाता तो इसमें कई सप्ताह लग जाते। निर्णय फिर से लोगों के हाथ में थे।

केस 3 - निषेध नियम से संकट टला। किसी ब्रांड के टर्मबेस में, "ग्राहक" को "ग्राहक" के लिए अनुमोदित किया गया था और "उपयोगकर्ता" को प्रतिबंधित किया गया था (ब्रांड स्थिति के कारण)। जब एक नए अनुवादक ने "उपयोगकर्ता" टाइप किया, तो QA शब्द ने उसे पकड़ लिया और ब्रांड भाषा विकृति को लाइव होने से पहले ही ठीक कर दिया गया।

चार प्रतिलिपि योग्य टेम्पलेट

1) टर्म उम्मीदवार निष्कर्षण:

आपकी भूमिका: शब्दावलीविज्ञानी. निम्नलिखित [डोमेन] पाठ से ऐसे शब्द निकालें जिनके अनुवाद में निरंतरता की आवश्यकता होती है: डोमेन-विशिष्ट अवधारणाएं, दोहराए जाने वाले वाक्यांश, उत्पाद/सुविधा नाम, संक्षिप्ताक्षर। स्रोत भाषा में प्रत्येक शब्द को सूचीबद्ध करें, एक संक्षिप्त संदर्भ नोट जोड़ें। निर्णय मेरा है; आप बस एक उम्मीदवार का सुझाव दें. सामान्य शब्द जोड़ना (और, लेकिन).पाठ: [...]

2) टर्मबेस लाइन बनाना:

निम्नलिखित पदों के लिए टर्मबेस पंक्ति तैयार करें: स्रोत शब्द | सुझाई गई लक्ष्य प्रतिक्रिया | संक्षिप्त वर्णन | गलत उत्तरों से बचना चाहिए। यदि आप निश्चित नहीं हैं, तो उत्तर को [?] से चिह्नित करें; मैं निर्णय लूंगा।एलन: [...] | शर्तें: [...]

3) टर्मबेस संगत अनुवाद:

इस पाठ का अनुवाद करें [स्रोत]→[लक्ष्य]। नीचे दिए गए टर्मबेस को अवश्य लागू करें; निषिद्ध समकक्षों का उपयोग न करें:- [स्रोत1] → [लक्ष्य1] (उपयोग: [निषिद्ध1])- [स्रोत2] → [लक्ष्य2] यदि आपको कोई ऐसा शब्द मिलता है जो टर्मबेस में नहीं है, तो उसे [?] से चिह्नित करें। पाठ: [...]

4) अनुवाद के बाद का शब्द QA:

मेरे द्वारा प्रदान किए गए टर्मबेस के विरुद्ध नीचे दिए गए अनुवाद को स्कैन करें। बस असंगतताओं को सूचीबद्ध करें: कौन सा शब्द इस्तेमाल किया गया था, कहां, किस गलत अर्थ के साथ, सही क्या होना चाहिए। संगत स्थानों की रिपोर्टिंग। टर्मबेस: [...] | अनुवाद: [...]

कमजोर संकेत/मजबूत संकेत

कमज़ोर: "शर्तों से सावधान रहें।" (कौन सा शब्द, कौन सा समकक्ष, कौन सा निषेध - अस्पष्ट है; मशीन स्वयं चुनती है।)

सशक्त: "इस पाठ का अनुवाद करते समय, निम्नलिखित टर्मबेस लागू करें: 'डैशबोर्ड'→'डैशबोर्ड', 'लॉग इन'→'लॉग इन'। यदि आपको कोई गैर-टर्मबेस शब्द मिलता है, तो [?] डालें और इसे स्वयं बनाएं।"

अंतर: मजबूत संकेत स्वीकृत समकक्ष, निषिद्ध समकक्ष और अज्ञात शब्द व्यवहार को निर्दिष्ट करता है; निरंतरता की गारंटी है.

शब्दावली उपकरण/दृष्टिकोण की तालिका

दृष्टिकोण

यह क्या करता है?

सीमा

शब्दावली (दो कॉलम)

छोटा व्यवसाय, तेज़ शुरुआत

कोई परिभाषा/निषेध नहीं

टर्मबेस (सीएटी से जुड़ा)

स्वचालित अनुशंसा, क्यूए

स्थापना के लिए श्रम की आवश्यकता होती है

एलएलएम के साथ टर्म एक्सट्रैक्शन

उम्मीदवार सूची को गति दें

लोग निर्णय लेते हैं

टर्म क्यूए स्कैन

असंगति पकड़ता है

टर्मबेस अद्यतन होना चाहिए

निषिद्ध प्रावधानों की सूची

ब्रांड भाषा को बनाए रखता है

निरंतर रखरखाव की आवश्यकता है

सामान्य गलतियाँ

  • टर्मबेस इंस्टॉल किए बिना एक बड़ा काम शुरू करना। असंगतता बाद में तेजी से बढ़ती है।
  • एआई द्वारा सुझाई गई प्रतिक्रिया को बिना किसी प्रश्न के स्वीकार करना। शब्दावली का निर्णय ग्राहक/विशेषज्ञ पर निर्भर है।
  • निषिद्ध प्रतिक्रियाएँ नहीं लिखना। केवल "सही" लिखने से "गलत" को रोका नहीं जा सकता।
  • अनुवाद के बाद का शब्द QA को छोड़ रहा है। प्रॉम्प्ट में टर्मबेस डालना इसके कार्यान्वयन की गारंटी नहीं देता है।
  • टर्मबेस अपडेट नहीं हो रहा है. एक मृत टर्मबेस समय के साथ गुमराह करेगा।

बहुभाषी टर्मबेस और ग्राहक अनुमोदन

बड़ी परियोजनाओं में, टर्मबेस अक्सर बहुभाषी होता है: एक अवधारणा का एक से अधिक लक्ष्य भाषाओं में समकक्ष होता है (स्रोत → अंग्रेजी, जर्मन, तुर्की, अरबी)। यह सभी भाषाओं में समान अवधारणा का लगातार अनुवाद सुनिश्चित करता है और नई भाषा जुड़ने पर काम में तेजी लाता है। बहुभाषी शब्दावली में ध्यान देने योग्य बात यह है कि प्रत्येक भाषा का अपना सांस्कृतिक और व्याकरणिक समकक्ष होता है; एक भाषा के समकक्ष को दूसरी भाषा में आँख मूँद कर नकल करना ग़लत है।

शब्दावली में अनुमोदन आयाम की भी एक शृंखला होती है। महत्वपूर्ण शब्दों में, अंतिम निर्णय अक्सर ग्राहक के विषय विशेषज्ञ या ब्रांड टीम द्वारा किया जाना चाहिए, न कि अनुवादक द्वारा; क्योंकि वे किसी शब्द के आधिकारिक/कानूनी/ब्रांड समकक्ष को सबसे अच्छी तरह जानते हैं। इसीलिए बड़ी नौकरियों में टर्मबेस को "अनुमोदित", "उम्मीदवार" और "विवादित" के रूप में टैग करना अच्छा अभ्यास है: आप ग्राहक से उम्मीदवार और विवादास्पद शर्तों के बारे में पूछते हैं, उन्हें स्वीकृत कराते हैं, फिर उन्हें लॉक कर देते हैं। यह अनुशासन कार्य के मध्य में "यह शब्द वास्तव में होना चाहिए" आश्चर्य और बड़े पैमाने पर पुनर्अनुवाद को रोकता है।

संक्षेप में

शब्दावली संगति अनुवाद का अदृश्य लेकिन सबसे निर्णायक गुणवत्ता तत्व है। मास्टर अनुवादक कार्य पर एक टर्मबेस स्थापित करता है; यह शीघ्रता से टर्म कैंडिडेट्स निकालने के लिए एआई का उपयोग करता है, लेकिन निर्णय ग्राहक और विशेषज्ञ पर छोड़ देता है; अनुमोदित और निषिद्ध प्रतिक्रियाएँ स्पष्ट रूप से लिखता है; यह अनुवाद के दौरान टर्मबेस को प्रॉम्प्ट/टूल से जोड़ता है और अनुवाद के बाद के टर्म QA राउंड को कभी नहीं छोड़ता है। टर्मबेस एक जीवित दस्तावेज़ है; हर व्यवसाय में वृद्धि करता है और ब्रांड की रक्षा करता है।

आवेदन कार्य

एक फ़ील्ड टेक्स्ट चुनें (तकनीकी, चिकित्सा या विपणन)। "टर्म कैंडिडेट एक्सट्रैक्शन" टेम्पलेट के साथ कम से कम 15 टर्म उम्मीदवारों को निकालें, उनकी पुष्टि करें और "टर्मबेस लाइन" टेम्पलेट के साथ समकक्ष, परिभाषाएँ और निषिद्ध समकक्ष लिखें। फिर इस टर्मबेस के साथ एक संक्षिप्त पाठ का अनुवाद करें, "टर्म क्यूए" टेम्पलेट के साथ असंगतताओं के लिए स्कैन करें और जो भी आपको मिले उसे ठीक करें।

चेकलिस्ट

  • [ ] मैंने कार्यस्थल पर एक टर्मबेस/शब्दावली स्थापित की है।
  • [ ] मैंने एआई के टर्म उम्मीदवारों को मंजूरी दी और निर्णय लिया।
  • [ ] स्वीकृत प्रतिक्रियाओं के अलावा, मैंने निषिद्ध प्रतिक्रियाएं भी लिखीं।
  • [ ] मैंने अनुवाद के दौरान टर्मबेस को प्रॉम्प्ट/टूल से कनेक्ट किया।
  • [ ] मैंने अनुवाद के बाद शब्द क्यूए स्कैन किया और असंगतताओं को ठीक किया।