ইউনিট
1. অনুবাদ এবং ব্যাখ্যায় কৃত্রিম বুদ্ধিমত্তার ভূমিকা: ভূমিকা, সীমানা, প্রমাণীকরণ, গোপনীয়তা এবং নীতিশাস্ত্র 2. মেশিন অনুবাদের মৌলিক বিষয়: NMT, LLM, ইঞ্জিন নির্বাচন এবং প্রাক-মূল্যায়ন 3. মেশিন ট্রান্সলেশন পোস্ট-এডিটিং (MTPE): লাইটওয়েট এবং সম্পূর্ণ পোস্ট-এডিটিং 4. পরিভাষা ব্যবস্থাপনা এবং টার্মবেস: ধারাবাহিকতা এবং কর্পোরেট ভাষা 5. CAT টুলস এবং ট্রান্সলেশন মেমোরি (TM) এর সাথে AI ইন্টিগ্রেশন 6. স্থানীয়করণ (L10n): সফ্টওয়্যার, ওয়েব, গেম এবং সাংস্কৃতিক অভিযোজন 7. সাবটাইটেলিং, ডাবিং এবং অডিওভিজ্যুয়াল অনুবাদ 8. মান নিয়ন্ত্রণ (QA), মূল্যায়ন মেট্রিক্স এবং LQA 9. দোভাষী প্রস্তুতি: ধারাবাহিক এবং যুগপত ব্যাখ্যা 10. প্রসঙ্গ, সংস্কৃতি, স্বর এবং সৃজনশীল অনুবাদ (ট্রান্সক্রিয়েশন) 11. গোপনীয়তা, নীতিশাস্ত্র, কপিরাইট, সত্যতা এবং পেশার ভবিষ্যত
ইউনিট 2 / 11

মেশিন অনুবাদের মৌলিক বিষয়: NMT, LLM, ইঞ্জিন নির্বাচন এবং প্রাক-মূল্যায়ন

লাভ:

  • এনএমটি এবং এলএলএম-ভিত্তিক অনুবাদের শক্তি এবং দুর্বলতাগুলিকে আলাদা করার ক্ষমতা এবং ব্যবসার ধরন অনুসারে সঠিক ইঞ্জিন বেছে নেওয়ার ক্ষমতা
  • মেশিনের জন্য একটি পাঠ্যের উপযুক্ততা প্রাক-শ্রেণীবদ্ধ করার ক্ষমতা এবং বাস্তবসম্মত সময় এবং মূল্যের জন্য এটি প্রাক-মূল্যায়ন করার ক্ষমতা
  • নির্ভুলতার সাথে মসৃণতাকে বিভ্রান্ত না করে দ্রুত পাঁচ মাত্রায় কাঁচা মেশিনের আউটপুট এবং পতাকা ঝুঁকির গুণমান পরিমাপ করার ক্ষমতা

একজন অনুবাদক হিসেবে আপনার কাছে সবচেয়ে শক্তিশালী অ্যাক্সিলারেটর হল মেশিন ট্রান্সলেশন (MT) — কিন্তু একটি টুল সচেতনভাবে ব্যবহার করার অর্থ হল সঠিক চাকরিতে, সঠিক ভাষার জোড়ায় এবং সঠিক প্রত্যাশার সাথে এটি প্রয়োগ করা। এই ইউনিটে, আপনি এমটি (NMT এবং LLM-ভিত্তিক অনুবাদ) এর দুটি প্রধান পরিবার সম্পর্কে জানতে পারবেন, কোনটি কোন কাজের জন্য ভাল, কীভাবে ডেলিভারির আগে অনুবাদের কাঁচা আউটপুট গুণমান দ্রুত পরিমাপ করা যায় এবং কাজ অনুযায়ী ইঞ্জিন কীভাবে বেছে নেওয়া যায় তা শিখবেন। উদ্দেশ্য হল "সবই একই, পেস্ট-অনুবাদ" ধারণা থেকে দূরে সরে যাওয়া এবং এমন একজন বিশেষজ্ঞ হওয়া যিনি ভবিষ্যদ্বাণী করতে পারেন কোন পাঠ্যটি মেশিনের জন্য উপযুক্ত এবং যার জন্য মানব-নিবিড় শ্রম প্রয়োজন।

দুটি পরিবার: NMT এবং LLM-ভিত্তিক অনুবাদ

এনএমটি (নিউরাল মেশিন ট্রান্সলেশন) এমন সিস্টেম যা লক্ষ লক্ষ দ্বিভাষিক বাক্য থেকে শিখেছে এবং বাক্যটিকে সামগ্রিকভাবে অনুবাদ করে; গুগল ট্রান্সলেট, ডিপএল, মাইক্রোসফট ট্রান্সলেটর এগুলোর উদাহরণ। শক্তি: খুব দ্রুত, সামঞ্জস্যপূর্ণ, ছোট বাক্যে সাবলীল। দুর্বলতা: প্রায়শই বাক্যের সীমানার বাইরে প্রসঙ্গ দেখতে পায় না (সম্পূর্ণ পাঠ্য থেকে অর্থ); অনুচ্ছেদ দেখে "ব্যাঙ্ক" শব্দের অর্থ ব্যাংক বা নদীর তীর কিনা তা নির্ধারণ করা কঠিন হতে পারে এবং এটি প্রদত্ত পদগুলির তালিকার সাথে খাপ খায় না।

এলএলএম-ভিত্তিক অনুবাদ (লার্জ ল্যাঙ্গুয়েজ মডেল) হল অনুবাদের জন্য ChatGPT, Claude, Gemini-এর মতো নির্দেশ-চালিত মডেলের ব্যবহার। শক্তি: নির্দেশনা নেয় — নির্দেশাবলী বোঝে যেমন "আনুষ্ঠানিক টোন ব্যবহার করুন", "এই শর্তাবলীর তালিকা অনুসরণ করুন", "লক্ষ্য শ্রোতা শিশু"; বৃহত্তর প্রেক্ষাপট দেখে; ইডিয়ম এবং টোনকে আরও ভালোভাবে ক্যাপচার করে। দুর্বলতা: কখনও কখনও "খুব সৃজনশীল" হতে পারে এবং উত্সে যোগ করতে পারে (হ্যালুসিনেশনের ঝুঁকি), দীর্ঘ পাঠ্যের মধ্যে সুসংগততা হারায় এবং কাজের উপর নির্ভর করে খরচ/গতি পরিবর্তিত হয়।

অঙ্গুষ্ঠের নিয়ম: সোজা, পুনরাবৃত্তিমূলক, প্রযুক্তিগত পাঠে NMT সাধারণত দ্রুত এবং পর্যাপ্ত হয়; LLM পাঠ্যগুলির সাথে আরও নমনীয় যেগুলির স্বর, প্রসঙ্গ, শব্দভান্ডার এবং নির্দেশে শৃঙ্খলা প্রয়োজন। বেশিরভাগ পেশাদাররা আজ উভয়ই একসাথে ব্যবহার করেন: NMT থেকে দ্রুত খসড়া, LLM থেকে টোন/টার্ম সংশোধন৷

টিপ: একটি ভাষা জোড়ার মেশিনের গুণমান (যেমন তুর্কি→ ইংরেজি) বিপরীত দিক (ইংরেজি→ তুর্কি) থেকে ভিন্ন হতে পারে। সমষ্টিগত, নমনীয় সিনট্যাক্স সহ ভাষা, যেমন তুর্কি, সাধারণত MT-এর জন্য আরও চ্যালেঞ্জিং। কয়েকটি নমুনা পাঠ্যের সাথে আপনার নিজের জুড়িতে কোন ইঞ্জিনটি ভাল তা নিজেই বিচার করুন।

পাঠ্যের মেশিন সামঞ্জস্যতা: প্রথমে এটি জিজ্ঞাসা করুন

প্রতিটি পাঠ্য মেশিনের জন্য সমানভাবে উপযুক্ত নয়। অনুবাদ শুরু করার আগে, একটি "উপযুক্ততা" ফিল্টারের মাধ্যমে পাঠ্যটি পাস করুন:

  • মেশিনের জন্য উপযুক্ত: প্রযুক্তিগত ম্যানুয়াল, পণ্যের বিবরণ, পুনরাবৃত্তিমূলক ইন্টারফেস পাঠ্য, স্ট্যান্ডার্ড চিঠিপত্র, টেবিল/তালিকা। ভাষা সরল, পরিভাষা স্থির, সৃজনশীলতা দুষ্প্রাপ্য।
  • মাধ্যম উপযুক্ত: সংবাদ, কর্পোরেট বিষয়বস্তু, শিক্ষামূলক উপাদান। মেশিনটি ভাল রূপরেখা তৈরি করে তবে স্বন এবং প্রবাহের জন্য গুরুতর পোস্ট-সম্পাদনার প্রয়োজন।
  • মেশিনের জন্য উপযুক্ত নয় (উচ্চ ঝুঁকি): আইনি চুক্তি, চিকিৎসা পাঠ্য, বিজ্ঞাপন/স্লোগান, সাহিত্য পাঠ, হাস্যরস, কবিতা। এখানে যন্ত্র শুধু ধারনা দেয়; কাজটি মূলত মানুষের হাতে পড়ে।

আপনি যদি প্রথম থেকেই এই পার্থক্য করেন, তাহলে আপনি উভয়ই গ্রাহককে সঠিক সময়/মূল্য দেবেন এবং কাঁচা আউটপুটকে অন্ধভাবে বিশ্বাস করা থেকে নিজেকে রক্ষা করবেন।

দ্রুত কাঁচা আউটপুট মান পরিমাপ

আপনি যখন একটি MT আউটপুট দেখেন তখন আপনি অবাক হন "এটি কি ভাল না খারাপ?" একটি দ্রুত চেকলিস্ট দিয়ে প্রশ্নের উত্তর দিন, অন্তর্দৃষ্টি নয়। এই পাঁচটি মাত্রা দেখুন: নির্ভুলতা (উৎসের প্রতি বিশ্বস্ততা মানে কি?), সম্পূর্ণতা (বাক্যটি কি বাদ দেওয়া হয়েছে বা যোগ করা হয়েছে?), পরিভাষা (এটি কি সঠিক এবং সামঞ্জস্যপূর্ণ?), সাবলীলতা (এটা কি লক্ষ্য ভাষায় স্বাভাবিক?), বিন্যাস (ট্যাগ, সংখ্যা, বিন্যাস সংরক্ষিত আছে?)। আমরা পরবর্তী মানের ইউনিটে এই মাত্রাগুলি আরও গভীর করব; আপাতত, এটি আপনার প্রি-ডেলিভারি রিফ্লেক্স হতে দিন।

সতর্কতা: MT আউটপুটের সবচেয়ে বিপজ্জনক ত্রুটিগুলি হল "সাবলীল কিন্তু ভুল"। বাক্যটি নিখুঁত তুর্কি ভাষায় হতে পারে, কিন্তু উৎসে "15% ছাড়" পরিবর্তন করে "50% ছাড়" করা হতে পারে। সাবলীলতা দ্বারা বন্ধ করা হবে না; সর্বদা সংখ্যা, ঋণাত্মক, এবং সঠিক বিশেষ্য আলাদাভাবে দেখুন।

তিনটি মিনি কেস

কেস 1 - সঠিক ইঞ্জিনটি সময়কে অর্ধেক করে দেয়। একজন অনুবাদক NMT-এর সাথে 12,000-শব্দের সফ্টওয়্যার ইন্টারফেস এবং LLM-এর সাথে একই ভলিউমের একটি বিপণন পুস্তিকা অনুবাদ করতে বেছে নিয়েছিলেন। ইন্টারফেসে NMT এর ধারাবাহিকতা কাজটিকে দ্রুততর করেছে; পুস্তিকাটিতে এলএলএম-এর টোনাল নমনীয়তা পুনর্লিখনের বোঝা 40% কমিয়েছে। একই ইঞ্জিনে উভয় কাজ দিলে সময় নষ্ট হবে।

কেস 2 — প্রাক-মূল্যায়ন মূল্য সংরক্ষণ করেছে। একটি অফিস একটি আইনি পাঠ্য অফার করতে চলেছে কারণ "এটি মেশিন দ্বারা তৈরি করা যেতে পারে, এটি সস্তা হবে"। প্রাক-মূল্যায়নে, একটি 500-শব্দের নমুনা অনুবাদ করা হয়েছিল; মেশিনটি ভুল সিস্টেমের সমতুল্য সহ দুটি আইনি পদ ফিরিয়ে দিয়েছে। অফিস "ভারী পোস্ট-সম্পাদনা" হিসাবে কাজের মূল্য নির্ধারণ করেছে এবং একটি বাস্তবসম্মত সময়সীমা দিয়েছে; ভুল প্রস্তাবের কারণে টাকা হারানো এড়িয়ে যান তিনি।

কেস 3 — ভাষার জোড়া পার্থক্য। একটি দল ভেবেছিল যে একটি ইঞ্জিন যা ইংরেজিতে দুর্দান্ত কাজ করে → জার্মান তুর্কি → আরবিতে একই মানের। 300-শব্দের পরীক্ষায় দেখা গেছে যে আরবি আউটপুট অনেক বেশি সংশোধনের প্রয়োজন। ভাষা যুগলের উপর নির্ভর করে দলটি বিভিন্ন ইঞ্জিন এবং বিভিন্ন পোস্ট-এডিটিং বাজেট বরাদ্দ করেছে।

চারটি অনুলিপিযোগ্য টেমপ্লেট

1) পাঠের উপযুক্ততা মূল্যায়ন:

আপনার ভূমিকা: সিনিয়র MTPE বিশেষজ্ঞ। মেশিন অনুবাদের জন্য উপযুক্ততার জন্য নিম্নলিখিত পাঠ্যটিকে রেট দিন: আক্ষরিক/প্রযুক্তিগত বা সৃজনশীল/প্রসঙ্গিক? এটিকে (1) খুব মেশিন-বান্ধব, (2) মাঝারি, (3) উচ্চ ঝুঁকি হিসাবে শ্রেণীবদ্ধ করুন এবং আপনার ন্যায্যতা লিখুন। প্রত্যাশিত পোস্ট-সম্পাদনা লোড হালকা/মাঝারি/ভারী হিসাবে অনুমান করুন। পাঠ্য উদাহরণ: [200-300 শব্দ পেস্ট করুন]

2) নির্দেশিত এলএলএম অনুবাদ (পরিভাষা এবং স্বর নিয়ন্ত্রণ সহ):

এই পাঠ্যটি অনুবাদ করুন [উত্স]→[লক্ষ্য]।শ্রোতা: [কে]। স্বর: [যেমন সরকারী]। ক্ষেত্র: [যেমন ফাইনান্স]. শর্তাবলীর তালিকা (ব্যবহার করতে ভুলবেন না): [A→a, B→b]। নিয়ম: উৎসে যা নেই তা যোগ করবেন না, সংখ্যা/তারিখ/নাম রাখুন, প্রতিটি বাক্যকে একটি বাক্য দিয়ে প্রতিস্থাপন করুন। যেখানে আপনি [?] এর সাথে নিশ্চিত নন সেখানে চিহ্নিত করুন। পাঠ্য: [...]

3) দুটি ইঞ্জিন তুলনা:

নীচে একই উৎস বাক্যের (A এবং B) দুটি ভিন্ন অনুবাদ রয়েছে। যথার্থতা, পরিভাষা এবং স্বাভাবিকতার পরিপ্রেক্ষিতে প্রতিটির তুলনা করুন এবং আমাকে বলুন কোনটির কম সংশোধনের প্রয়োজন হবে, ন্যায্যতা সহ। সূত্র: [...] | অনুবাদ ক: [...] | অনুবাদ বি: [...]

4) কাঁচা আউটপুট দ্রুত পরিদর্শন:

নীচে উত্স এবং মেশিন অনুবাদ আছে. শুধু নিম্নলিখিতগুলি চিহ্নিত করুন: (1) বাদ দেওয়া/সংযোজিত তথ্য, (2) ভুল নম্বর/তারিখ/নাম, (3) নেতিবাচক ত্রুটি, (4) অসামঞ্জস্যপূর্ণ শব্দ৷ কোনো সংশোধন লিখবেন না, শুধু ঝুঁকিপূর্ণ এলাকা তালিকাভুক্ত করুন। সূত্র: [...] | অনুবাদ: [...]

দুর্বল প্রম্পট / শক্তিশালী প্রম্পট

দুর্বল: "এই পাঠ্যটি অনুবাদ করুন এবং এটি ভাল হবে।" (ইঞ্জিনের জন্য, "ভাল" অনির্ধারিত; কোন স্বন, কোন পদ, কোন ভর নেই।)

Güçlü: "এই পণ্যের বিবরণটি ইংরেজি থেকে তুর্কিতে অনুবাদ করুন। এলাকা: ই-কমার্স। শ্রোতা: তরুণ ভোক্তা। স্বর: বন্ধুত্বপূর্ণ কিন্তু আশ্বস্ত। 'চেকআউট' → 'চেকআউট ধাপ', 'ইচ্ছা তালিকা' → 'ইচ্ছা তালিকা'। নম্বর এবং ব্র্যান্ডের নাম পরিবর্তন করুন। কোনো অনুবাদ ছাড়াই সাবলীল তুর্কি।"

পার্থক্য: শক্তিশালী প্রম্পট ইঞ্জিনকে একটি পরিমাপযোগ্য লক্ষ্য দেয়; আউটপুট সরাসরি পোস্ট-সম্পাদিত খসড়া আনুমানিক.

এনএমটি বনাম এলএলএম তুলনা চার্ট

আকার

NMT (গুগল, ডিপএল)

এলএলএম (চ্যাটজিপিটি, ক্লদ)

গতি

খুব দ্রুত

মাঝারি

নির্দেশ/স্বন গ্রহণ করুন

দুর্বল

শক্তিশালী

শব্দ তালিকা মেনে চলুন

সীমিত

ভাল (প্রম্পট সহ)

বিস্তৃত প্রসঙ্গ

দুর্বল

ভাল

হ্যালুসিনেশনের ঝুঁকি

কম

মাঝারি (নিয়ন্ত্রণ প্রয়োজন)

সবচেয়ে উপযুক্ত কাজ

সোজা/প্রযুক্তিগত/পুনরাবৃত্ত

টোন/প্রসঙ্গ/সৃজনশীল

সাধারণ ভুল

  • প্রতিটি কাজের জন্য একই ইঞ্জিন ব্যবহার করা। কাজের ধরন অনুযায়ী ইঞ্জিন নির্বাচন না করায় সময় ও গুণমান নষ্ট হয়।
  • প্রাক-মূল্যায়ন ছাড়াই মূল্য/সময় দেওয়া। একটি 200-300 শব্দ পরীক্ষা শুরু থেকে বিস্ময় প্রকাশ করে।
  • নির্ভুলতার জন্য সাবলীলতা ভুল। একটি সুন্দর বাক্য মানে সঠিক বাক্য নয়।
  • ভাষা যুগল এবং দিক পার্থক্য উপেক্ষা. এক জোড়ায় একটি ভালো ইঞ্জিন অন্য জোড়ায় দুর্বল হতে পারে।
  • এলএলএম-এর সংযোজন লক্ষ্য করা যাচ্ছে না। এলএলএম কখনও কখনও "সাহায্য করতে" উৎসে নয় এমন বাক্য যোগ করে; এই চেক আউট.

প্রসঙ্গ উইন্ডো এবং ধারাবাহিকতা

এলএলএম-এর সাথে দীর্ঘ পাঠ্য অনুবাদ করার সময়, একটি প্রযুক্তিগত সীমা জানা প্রয়োজন: প্রসঙ্গ উইন্ডো — মডেলটি "দেখতে" এবং একটি সময়ে মনে রাখতে পারে এমন পাঠ্যের পরিমাণ। পাঠ্যটি এই উইন্ডোর থেকে বড় হলে, আপনাকে এটিকে খণ্ডে বিভক্ত করতে হবে, এবং মডেলটি পরবর্তী খণ্ডে "ভুলে যেতে পারে" শব্দগত সিদ্ধান্ত বা টোন যা আপনি পূর্ববর্তী খণ্ডগুলিতে করেছেন৷ সুতরাং, একটি দীর্ঘ বই বা নথিকে এক টুকরোতে অনুবাদ করার পরিবর্তে, টার্মবেস এবং শৈলীর সারাংশের প্রতিটি অংশকে স্মরণ করিয়ে দেওয়া ধারাবাহিকতা বজায় রাখে। সংক্ষিপ্ত গ্রন্থে এই সমস্যা দেখা দেয় না; যাইহোক, উপন্যাস এবং ম্যানুয়ালগুলির মতো দীর্ঘ কাজগুলিতে, প্যাসেজের সামঞ্জস্যতা পরীক্ষা করা প্রয়োজন। ব্যবহারিক সমাধান: একটি "প্রকল্প মেমরি" (পদ + অক্ষর + টোন সিদ্ধান্ত) প্রস্তুত করা এবং প্রতিটি অংশের শুরুতে এটি যোগ করুন এবং অনুবাদের শেষে অংশগুলির মধ্যে সামঞ্জস্যের জন্য স্ক্যান করুন। এনএমটি-তে, এই সমস্যাটি অন্যভাবে অনুভব করা হয়: যেহেতু NMT বাক্য দ্বারা বাক্য অনুবাদ করে, অনুচ্ছেদের দৈর্ঘ্যের সামঞ্জস্য ইতিমধ্যে দুর্বল, তাই টার্মবেস শৃঙ্খলা শব্দটি গ্রহণ করে।

সংক্ষেপে

মেশিন অনুবাদের দুটি পরিবার রয়েছে: এনএমটি, যা দ্রুত এবং সামঞ্জস্যপূর্ণ, এবং এলএলএম, যা নির্দেশনা গ্রহণ করে এবং প্রসঙ্গ এবং সুরকে আরও ভালভাবে দেখে। মাস্টার অনুবাদক মেশিনের জন্য পাঠ্যের উপযুক্ততা আগে থেকেই গ্রেড করে, কাজ অনুযায়ী ইঞ্জিন নির্বাচন করে, ডেলিভারির আগে কাঁচা আউটপুটের গুণমান দ্রুত পরিমাপ করে এবং নির্ভুলতার সাথে সাবলীলতাকে কখনই বিভ্রান্ত করে না। এই প্রাক-মূল্যায়ন রিফ্লেক্স আপনাকে বাস্তবসম্মত সময়/মূল্য দিতে এবং অন্ধ বিশ্বাস থেকে নিজেকে রক্ষা করতে দেয়।

আবেদন টাস্ক

একই 200-শব্দের পাঠ্য একটি NMT টুল এবং একটি LLM উভয়ের সাথে অনুবাদ করুন৷ পাঁচটি মাত্রার দুটি আউটপুট তুলনা করুন (নির্ভুলতা, সম্পূর্ণতা, পরিভাষা, সাবলীলতা, বিন্যাস) এবং কারণ লিখুন যার জন্য এই পাঠ্যের জন্য কম পোস্ট-সম্পাদনা প্রয়োজন। তারপর "কাঁচা আউটপুট দ্রুত চেক" টেমপ্লেটের সাথে উভয় ক্ষেত্রেই সমস্যা/আকর্জনতা/মেয়াদী ঝুঁকিগুলি চিহ্নিত করুন৷

চেকলিস্ট

  • [ ] আমি মেশিনের জন্য পাঠ্যের উপযুক্ততা (নিম্ন/মাঝারি/উচ্চ ঝুঁকি) শ্রেণিবদ্ধ করেছি।
  • [ ] কাজের ধরনের উপর নির্ভর করে, আমি NMT বা LLM ব্যবহার করার সিদ্ধান্ত নিয়েছি।
  • [ ] আমি একটি ছোট নমুনা দিয়ে একটি প্রাথমিক মূল্যায়ন করেছি এবং সেই অনুযায়ী সময়কাল/মূল্য নির্ধারণ করেছি৷
  • [ ] আমি দ্রুত পাঁচটি মাত্রায় কাঁচা আউটপুট পরিদর্শন করেছি৷
  • [ ] আমি সাবলীলতার দ্বারা বোকা না হয়ে সংখ্যা, তারিখ, নাম এবং নেতিবাচকগুলি আলাদাভাবে পরীক্ষা করেছি।