ইউনিট
1. অনুবাদ এবং ব্যাখ্যায় কৃত্রিম বুদ্ধিমত্তার ভূমিকা: ভূমিকা, সীমানা, প্রমাণীকরণ, গোপনীয়তা এবং নীতিশাস্ত্র 2. মেশিন অনুবাদের মৌলিক বিষয়: NMT, LLM, ইঞ্জিন নির্বাচন এবং প্রাক-মূল্যায়ন 3. মেশিন ট্রান্সলেশন পোস্ট-এডিটিং (MTPE): লাইটওয়েট এবং সম্পূর্ণ পোস্ট-এডিটিং 4. পরিভাষা ব্যবস্থাপনা এবং টার্মবেস: ধারাবাহিকতা এবং কর্পোরেট ভাষা 5. CAT টুলস এবং ট্রান্সলেশন মেমোরি (TM) এর সাথে AI ইন্টিগ্রেশন 6. স্থানীয়করণ (L10n): সফ্টওয়্যার, ওয়েব, গেম এবং সাংস্কৃতিক অভিযোজন 7. সাবটাইটেলিং, ডাবিং এবং অডিওভিজ্যুয়াল অনুবাদ 8. মান নিয়ন্ত্রণ (QA), মূল্যায়ন মেট্রিক্স এবং LQA 9. দোভাষী প্রস্তুতি: ধারাবাহিক এবং যুগপত ব্যাখ্যা 10. প্রসঙ্গ, সংস্কৃতি, স্বর এবং সৃজনশীল অনুবাদ (ট্রান্সক্রিয়েশন) 11. গোপনীয়তা, নীতিশাস্ত্র, কপিরাইট, সত্যতা এবং পেশার ভবিষ্যত
ইউনিট 5 / 11

CAT টুলস এবং ট্রান্সলেশন মেমোরি (TM) এর সাথে AI ইন্টিগ্রেশন

লাভ:

  • অনুবাদ মেমরি (টিএম), অস্পষ্ট ম্যাচ এবং সেগমেন্টের ধারণাগুলি বোঝা এবং অন্ধভাবে না হয়ে অস্পষ্ট ম্যাচগুলির পার্থক্যগুলিকে ব্যবহার করতে সক্ষম হওয়া।
  • TM-এ শুধুমাত্র অনুমোদিত অনুবাদ লেখার শৃঙ্খলা প্রয়োগ করার ক্ষমতা, গ্রাহক TM কে আলাদা রাখা এবং TM রক্ষণাবেক্ষণ সম্পাদন করা
  • CAT-এর মধ্যে MT/LLM ইন্টিগ্রেশনে ডেটা কোথায় যায় তা নিয়ন্ত্রণ করে গোপনীয়তা রক্ষা করার ক্ষমতা

পেশাদার অনুবাদ প্রায়শই একটি CAT টুলে করা হয়, একটি প্লেইন টেক্সট এডিটরে নয়। এই ইউনিটে, আপনি শিখবেন CAT টুলস, অনুবাদের কেন্দ্রস্থলে ট্রান্সলেশন মেমরি (TM), কিভাবে তারা মেশিন ট্রান্সলেশন এবং LLM এর সাথে একত্রে কাজ করে এবং কিভাবে এই ইকোসিস্টেমটিকে দক্ষ ও নিরাপদে ব্যবহার করতে হয়। লক্ষ্য হল একজন অনুবাদ প্রযুক্তি ব্যবহারকারী হওয়া যিনি একটি সম্পূর্ণ প্রকল্প পরিচালনা করেন, পৃথক বাক্য নয়, সামঞ্জস্যপূর্ণ, দ্রুত এবং সনাক্তযোগ্য পদ্ধতিতে।

মৌলিক ধারণা

CAT টুল (কম্পিউটার-অ্যাসিস্টেড ট্রান্সলেশন) হল পেশাদার সফ্টওয়্যার (যেমন Trados, memoQ, Phrase, MateCat) যেটি বাক্য (সেগমেন্ট) দ্বারা অনুবাদ বাক্য সংগঠিত করে এবং অনুবাদ মেমরি এবং টার্মবেসকে সংযুক্ত করে। উত্স এবং লক্ষ্য পাশাপাশি দেখায়, পুনরাবৃত্তি ক্যাচ করে, বিন্যাস সংরক্ষণ করে।

TM (অনুবাদ মেমরি) হল একটি ডাটাবেস যা আপনার পূর্বে অনুবাদ করা উৎস-লক্ষ্য বাক্য জোড়া সংরক্ষণ করে। যখন একটি নতুন বাক্য আসে, যদি টিএম-এ একই ধরনের বাক্য থাকে, এজেন্ট আপনাকে এটির পরামর্শ দেয়। এখানে মূল ধারণাটি হল অস্পষ্ট মিল: টিএম-এর একটি বাক্যের সাথে নতুন বাক্যের মিল (100% = হুবহু একই, 85% = অনেকটা একই রকম)। উচ্চ মিলগুলি কাজের গতি বাড়ায় কারণ আপনি আপনার আগের অনুবাদটি পুনরায় ব্যবহার করেন৷

একটি সেগমেন্ট হল অনুবাদের মৌলিক একক—সাধারণত একটি বাক্য। CAT টুল টেক্সটকে সেগমেন্টে বিভক্ত করে এবং প্রতিটি আলাদাভাবে সম্পাদনা করে।

TM-এর গুরুত্ব: MT কাঁচা খসড়া তৈরি করে, কিন্তু TM আপনার অনুমোদিত, মানব-মানের অতীত অনুবাদগুলি ফেরত দেয়। দুটি ভিন্ন: MT একটি ভবিষ্যদ্বাণী, TM একটি স্মৃতি৷

টিপ: টিএম এবং এমটি বিভ্রান্ত করবেন না। একটি 100% TM মিল (আপনার পূর্বে অনুমোদিত অনুবাদ) সাধারণত নির্ভরযোগ্য; MT সুপারিশ সবসময় যাচাই করা উচিত. CAT টুল দুটিকে বিভিন্ন রং/লেবেল দিয়ে দেখায়; সবসময় এই পার্থক্য দেখতে.

CAT-তে MT এবং LLM-এর ইন্টিগ্রেশন

আধুনিক CAT সরঞ্জামগুলি MT ইঞ্জিন এবং ক্রমবর্ধমান LLMগুলিকে অভ্যন্তরীণভাবে কল করে: যদি TM-এ কোনও মিল না থাকে, তাহলে এজেন্ট স্বয়ংক্রিয়ভাবে সেগমেন্টের জন্য একটি MT সুপারিশ ফেরত দেয়; আপনি এটি পোস্ট-এডিট করেন (যেমন MTPE CAT-তে প্রবাহিত হয়)। সর্বশেষ প্রজন্মের সরঞ্জামগুলিও এলএলএমকে একীভূত করে: আপনি টুলটিতে "এই স্বর দিয়ে এই অংশটি পুনরায় লিখুন", "এই শব্দটিকে টার্মবেসে সংশোধন করুন" ইত্যাদির মতো অপারেশন করতে পারেন।

এই ইন্টিগ্রেশনের সুবিধা: টিএম, টার্মবেস, এমটি এবং এলএলএম একটি স্ক্রিনে একত্রিত হয়; প্রতিটি বাক্যের জন্য, "প্রথমে TM-এর দিকে তাকান, অন্যথায় MT, স্বয়ংক্রিয়ভাবে QA শব্দটি সাজেস্ট করুন" প্রবাহ প্রতিষ্ঠিত হয়েছে। খারাপ দিক এবং সতর্কতা: ডেটা কোথায় যায়? ক্লাউড-ভিত্তিক MT/LLM ইন্টিগ্রেশন বহিরাগত সার্ভারে পাঠ্য পাঠাতে পারে; গোপনীয় কাজে, এটি চুক্তির লঙ্ঘন হতে পারে। গাড়িটি কোন ইঞ্জিনের সাথে সংযুক্ত এবং কোন ডেটা নীতির সাথে তা জেনে নিন।

অনুবাদ মেমরি খাওয়ানো এবং পরিষ্কার করা

TM-এর মান যতটা অনুবাদের গুণমান ততটাই। আবর্জনা ভিতরে, আবর্জনা আউট. দুটি শৃঙ্খলা:

  1. শুধু TM-এ প্রত্যয়িত অনুবাদ লিখুন। আপনি যদি কাঁচা MT আউটপুটটি যাচাই না করে TM-এ সংরক্ষণ করেন, তাহলে এটি আপনার ভবিষ্যতের কাজগুলিতে খারাপ "মেমরি" হিসাবে ফিরে আসবে৷
  2. TM রক্ষণাবেক্ষণ সম্পাদন করুন। সময়ের সাথে সাথে, শর্তাবলী পরিবর্তিত হয় এবং ত্রুটিগুলি প্রবেশ করে। পর্যায়ক্রমে টিএম পরিষ্কার করুন, সঠিক জীর্ণ/ভুল জোড়া। এই কাজে আমি LLM ব্যবহার করছি "এই TM জোড়ায় কোন অসঙ্গতি/টার্ম বায়াস আছে কি?" আপনি এটি একটি অডিটর হিসাবে ব্যবহার করতে পারেন.
সতর্কতা: একজন গ্রাহকের TM অন্য গ্রাহকের ব্যবসায় ব্যবহার করা গোপনীয়তার লঙ্ঘন এবং শব্দ বিভ্রান্তির ঝুঁকি উভয়ই। TMগুলিকে ক্লায়েন্ট/প্রকল্পের ভিত্তিতে আলাদা রাখা হয়। একটি মিশ্র "সবকিছু TM" গোপনীয়তা এবং গুণমান উভয়ই ধ্বংস করে।

তিনটি মিনি কেস

কেস 1 — টিএম রিপ্লে উড়েছে। একটি প্রস্তুতকারকের একটি পণ্য পরিবার অনুবাদ করা হয়েছিল যেখানে এর 70% ম্যানুয়াল বছরের পর বছর একই থাকে। TM-কে ধন্যবাদ, 100% এবং উচ্চ অস্পষ্ট ম্যাচগুলি প্রতিটি নতুন সংস্করণে স্বয়ংক্রিয়ভাবে এসেছে; 30,000 শব্দ কাজের মধ্যে মাত্র ~9,000 শব্দ ছিল প্রকৃত নতুন অনুবাদ। সময় এবং খরচ এক তৃতীয়াংশ হ্রাস করা হয়েছে.

কেস 2 — ডার্টি টিএম ত্রুটিটি প্রচার করেছে। একটি দল যাচাই ছাড়াই কাঁচা এমটি আউটপুট টিএম-এ সংরক্ষণ করেছিল। এক বছর পরে একই ভুল অনুবাদ বারবার ফিরে আসে, 100% মিল হিসাবে "নির্ভরযোগ্য" দেখায়; ত্রুটিটি 14টি ভিন্ন নথিতে ছড়িয়ে পড়েছে। দলটি একটি "শুধুমাত্র টিএম-এ প্রত্যয়িত অনুবাদ" নিয়ম এবং একটি পরিষ্কার-পরিচ্ছন্ন সফর প্রতিষ্ঠা করেছে৷

কেস 3 — ইন্টিগ্রেশনে গোপনীয়তা ফাঁস হয়েছে। একজন অনুবাদক একটি CAT প্রকল্পে গোপনীয় কাজ করেছেন যা স্বয়ংক্রিয়ভাবে ক্লাউড এমটি-তে সংযুক্ত ছিল; পাঠ্যটি একটি বহিরাগত ইঞ্জিনে গেছে যার ডেটা নীতি অস্পষ্ট। একবার লক্ষ্য করা গেলে, গোপন প্রকল্পগুলির জন্য এমটি ইন্টিগ্রেশন বন্ধ করা হয়েছিল এবং শুধুমাত্র এন্টারপ্রাইজ ইঞ্জিনগুলি ব্যবহার করা হয়েছিল যেগুলি "ডেটা সঞ্চয়/ট্রেন করে না" ব্যবহার করা হয়েছিল৷

চারটি অনুলিপিযোগ্য টেমপ্লেট

1) অস্পষ্ট ম্যাচ মূল্যায়ন (LLM-তে):

নীচে নতুন উৎস বাক্য, টিএম-এ অনুরূপ বাক্য এবং এর অনুমোদিত অনুবাদ। TM অনুবাদকে নতুন বাক্যে মানিয়ে নিতে আমাকে ঠিক কী পরিবর্তন করতে হবে তা আমাকে বলুন; অপ্রয়োজনীয় পরিবর্তনের পরামর্শ দেবেন না। স্পষ্টভাবে অর্থের পার্থক্য দেখান। নতুন উত্স: [...] | টিএম উত্স: [...] | টিএম অনুবাদ: [...]

2) TM ধারাবাহিকতা পরীক্ষা:

নীচে TM থেকে উৎস-লক্ষ্য জোড়া আছে। অসঙ্গতি এবং শব্দ বিচ্যুতি চিহ্নিত করুন যেখানে একই বা খুব অনুরূপ উৎস বাক্যগুলি ভিন্নভাবে অনুবাদ করা হয়। শুধু সমস্যার তালিকা করুন। দম্পতি: [...]

3) সেগমেন্ট টোন রিরাইটিং (সিএটিতে এলএলএম):

অর্থ পরিবর্তন না করে নিচের টার্গেট সেগমেন্ট [কাঙ্খিত টোন] করুন। শর্তাবলীর তালিকা মেনে চলুন: [...]। নম্বর এবং নাম রাখুন। শুধুমাত্র পুনর্লিখিত অংশ রপ্তানি করুন. সেগমেন্ট: [...]

4) গোপনীয়তা/একীকরণ পূর্ব-চেক:

আমি একটি CAT প্রকল্পে MT/LLM ইন্টিগ্রেশন ব্যবহার করব। আমি এই প্রকল্পে পাঠ্যের ধরণ বর্ণনা করব; ক্লাউড-ভিত্তিক বাহ্যিক ইঞ্জিনে এই পাঠ্যটি পাঠানো উপযুক্ত কিনা তা আমাকে বলুন, কোন প্রশ্ন (ডেটা ধারণ, প্রশিক্ষণ, অবস্থান) আমি প্রদানকারীকে জিজ্ঞাসা করব। পাঠ্যের ধরন/গোপনীয়তার অবস্থা: [...]

দুর্বল প্রম্পট / শক্তিশালী প্রম্পট

দুর্বল: "টিএম-এ অনুবাদ ব্যবহার করুন।" (এটা স্পষ্ট নয় যে ম্যাচের হার এবং কী মানিয়ে নিতে হবে; অন্ধ অনুলিপি ত্রুটির পরিচয় দেয়।)

শক্তিশালী: "এই নতুন বাক্যটি TM 90% সময়ের বাক্যটির সাথে মেলে। TM অনুবাদে তৈরি করুন তবে এই পার্থক্যটি প্রতিফলিত করুন: উত্সটিতে 'মাসিক'-এর পরিবর্তে 'বার্ষিক' রয়েছে, তাই এটি 'মাসিক'-এর পরিবর্তে 'বার্ষিক' হওয়া উচিত। অন্য কিছু পরিবর্তন করবেন না।"

পার্থক্য: শক্তিশালী প্রম্পট ম্যাচের পার্থক্যকে চিহ্নিত করে; এটি "পুরানো অনুবাদকে যেমন আছে তেমন রেখে যাওয়া" প্রতিরোধ করে, যা অস্পষ্ট মিলের সবচেয়ে সাধারণ ভুল।

CAT ইকোসিস্টেম উপাদান টেবিল

উপাদান

কি করে

এআই এর সাথে সম্পর্ক

TM (অনুবাদ মেমরি)

অনুমোদিত অতীত অনুবাদ ফেরত দেয়

নির্ভরযোগ্য; MT এর আগে

টার্মবেস

মেয়াদের ধারাবাহিকতা নিশ্চিত করে

এটি এলএলএম-এর প্রম্পট হিসাবে দেওয়া হয়

এমটি সুপারিশ

খালি সেগমেন্টে কাঁচা স্কেচ

পোস্ট-সম্পাদিত হতে হবে

এলএলএম ইন্টিগ্রেশন

টোন/টার্ম/পুনরায় লেখা

নিয়ন্ত্রিত, গোপনীয়তার প্রতি মনোযোগ

QA মডিউল

নম্বর/টার্ম/ট্যাগ ত্রুটি স্ক্যান করে

স্বয়ংক্রিয় নিয়ন্ত্রণ

সাধারণ ভুল

  • অন্ধভাবে অস্পষ্ট ম্যাচ গ্রহণ. একটি 85% মিল মানে 15% পার্থক্য লুকাতে পারে।
  • TM-এ কাঁচা MT আউটপুট লেখা। নোংরা টিএম ত্রুটিটিকে ভবিষ্যতে বহন করে এবং এটিকে প্রসারিত করে।
  • গ্রাহক/প্রকল্প টিএম মিশ্রিত করা। গোপনীয়তা এবং শব্দ বিভ্রান্তির ঝুঁকি।
  • ইন্টিগ্রেশন ডেটা কোথায় যায় তা জানা নেই। লুকানো টেক্সট আপনি এটি সম্পর্কে সচেতন না হয়ে ফাঁস হতে পারে.
  • TM/MT পার্থক্য ভুলে যাওয়া। এমটি একটি অনুমান; টিএম একটি স্মৃতি। দুটি সমান নিরাপদ নয়।

পূর্ব-অনুবাদ এবং প্রান্তিককরণ

দুটি উন্নত CAT ফাংশন AI যুগে কর্মপ্রবাহকে আরও ত্বরান্বিত করে। প্রথমটি হল প্রাক-অনুবাদ: প্রকল্পের শুরুতে, টুলটি স্বয়ংক্রিয়ভাবে TM এবং MT দিয়ে সমস্ত অংশ পূরণ করে; একটি খালি ফাইলের পরিবর্তে, আপনি একটি ফাইল দিয়ে শুরু করুন যেখানে 100% মিল অনুমোদিত, অস্পষ্ট ম্যাচগুলি অভিযোজিত হওয়ার জন্য অপেক্ষা করছে এবং খালিগুলি হল MT খসড়া৷ এটি কাজটিকে "শুরু থেকে লেখা" থেকে "পর্যালোচনা এবং সম্পাদনা" এ পরিবর্তন করে — তবে আপনাকে প্রাক-অনুবাদকে অন্ধভাবে অনুমোদন করার পরিবর্তে প্রতিটি বিভাগকে মূল্যায়ন করতে হবে।

দ্বিতীয়টি হল সারিবদ্ধকরণ: যদি আপনার কাছে একটি উৎস-লক্ষ্য নথি জোড়া থাকে যা আগে অনুবাদ করা হয়েছে কিন্তু TM-এ প্রবেশ করেনি, তাহলে প্রান্তিককরণ টুলটি সেগমেন্ট দ্বারা সেগমেন্টের সাথে মেলে এবং সেগুলিকে TM-এ রূপান্তর করে। এইভাবে, আপনার অতীতের অনুবাদগুলি "মেমরিতে" যোগ করা হয়েছে। সারিবদ্ধকরণে সতর্কতা: স্বয়ংক্রিয় মিল সবসময় সঠিক নয়; একটি সেগমেন্ট স্লিপেজ সমগ্র প্রান্তিককরণ ব্যাহত করে। TMing এর আগে সারিবদ্ধ জোড়া পর্যালোচনা করা প্রথম স্থানে নোংরা TM এর ঝুঁকি প্রতিরোধ করে। এই দুটি ফাংশন আপনার বর্তমান সম্পদ (অতীতের অনুবাদ) ভবিষ্যতের ব্যবসায় বিনিয়োগে পরিণত করে।

সংক্ষেপে

CAT টুলস; এটি অনুবাদ মেমরি, টার্মবেস, মেশিন ট্রান্সলেশন এবং এলএলএমকে একটি একক উত্পাদন লাইনে একত্রিত করে। TM একটি মেমরি যা আপনার অনুমোদিত অতীত অনুবাদগুলি পুনরুদ্ধার করে এবং পুনরাবৃত্তিমূলক কাজগুলিতে দুর্দান্ত গতি প্রদান করে; এমটি একটি ভবিষ্যদ্বাণী যা সর্বদা যাচাই করা দরকার। বুদ্ধিমান ব্যবহারকারী অস্পষ্ট ম্যাচের পার্থক্যকে সাবধানে খাপ খায়, TM-এ শুধুমাত্র অনুমোদিত অনুবাদ লেখে, গ্রাহক TM-কে আলাদা রাখে, এবং ডেটা ইন্টিগ্রেশনে কোথায় যায় তা জেনে গোপনীয়তা রক্ষা করে।

আবেদন টাস্ক

একটি CAT টুলে একটি ছোট প্রকল্প সেট আপ করুন (একটি বিনামূল্যের অনলাইন CATও কাজ করে): একটি টার্মবেস এবং একটি খালি TM যোগ করুন। একটি 10-বাক্য পাঠ্য অনুবাদ করুন, অনুমোদিত অনুবাদগুলি TM-এ সংরক্ষণ করুন৷ তারপর প্রথম টেক্সটের অনুরূপ একটি দ্বিতীয় টেক্সট অনুবাদ করুন এবং "ফজি ম্যাচ ইভালুয়েশন" টেমপ্লেটের সাথে TM দ্বারা ফিরে আসা অস্পষ্ট মিলগুলিকে মানিয়ে নিন; আপনি অন্ধভাবে TM গ্রহণ করলে আপনি কতগুলি বাক্য ভুল করবেন তা নোট করুন।

চেকলিস্ট

  • [ ] আমি প্রকল্পের সাথে TM এবং টার্মবেস সংযুক্ত করেছি৷
  • আমি অস্পষ্ট ম্যাচের পার্থক্যটি অন্ধভাবে ব্যবহার না করে অভিযোজিতভাবে ব্যবহার করেছি।
  • [ ] আমি শুধুমাত্র TM-কে লিখেছিলাম প্রত্যয়িত অনুবাদ যা আমি যাচাই করেছি৷
  • [] আমি গ্রাহক/প্রকল্পের টিএম আলাদা রেখেছি।
  • MT/LLM ইন্টিগ্রেশনে ডেটা কোথায় যায় তা আমি পরীক্ষা করে দেখেছি।