ইউনিট
1. অনুবাদ এবং ব্যাখ্যায় কৃত্রিম বুদ্ধিমত্তার ভূমিকা: ভূমিকা, সীমানা, প্রমাণীকরণ, গোপনীয়তা এবং নীতিশাস্ত্র 2. মেশিন অনুবাদের মৌলিক বিষয়: NMT, LLM, ইঞ্জিন নির্বাচন এবং প্রাক-মূল্যায়ন 3. মেশিন ট্রান্সলেশন পোস্ট-এডিটিং (MTPE): লাইটওয়েট এবং সম্পূর্ণ পোস্ট-এডিটিং 4. পরিভাষা ব্যবস্থাপনা এবং টার্মবেস: ধারাবাহিকতা এবং কর্পোরেট ভাষা 5. CAT টুলস এবং ট্রান্সলেশন মেমোরি (TM) এর সাথে AI ইন্টিগ্রেশন 6. স্থানীয়করণ (L10n): সফ্টওয়্যার, ওয়েব, গেম এবং সাংস্কৃতিক অভিযোজন 7. সাবটাইটেলিং, ডাবিং এবং অডিওভিজ্যুয়াল অনুবাদ 8. মান নিয়ন্ত্রণ (QA), মূল্যায়ন মেট্রিক্স এবং LQA 9. দোভাষী প্রস্তুতি: ধারাবাহিক এবং যুগপত ব্যাখ্যা 10. প্রসঙ্গ, সংস্কৃতি, স্বর এবং সৃজনশীল অনুবাদ (ট্রান্সক্রিয়েশন) 11. গোপনীয়তা, নীতিশাস্ত্র, কপিরাইট, সত্যতা এবং পেশার ভবিষ্যত
ইউনিট 8 / 11

মান নিয়ন্ত্রণ (QA), মূল্যায়ন মেট্রিক্স এবং LQA

লাভ:

  • স্বয়ংক্রিয় QA এবং ভাষাগত LQA স্তরগুলির মধ্যে পার্থক্য করার ক্ষমতা এবং উভয়ই সঠিক ক্রমে প্রয়োগ করার ক্ষমতা
  • এমকিউএম-এর মতো ত্রুটি কাঠামো সহ বিভাগ এবং ওজন (গুরুত্বপূর্ণ/প্রধান/অপ্রধান) অনুযায়ী অনুবাদকে উদ্দেশ্যমূলকভাবে মূল্যায়ন করার ক্ষমতা
  • অডিটর হিসাবে AI ব্যবহার করার সময় চূড়ান্ত সিদ্ধান্ত নিতে সক্ষম হওয়া, এর নিজস্ব অনুবাদের অন্ধত্ব, ভুল করার ঝুঁকি এবং স্বয়ংক্রিয় মেট্রিক্সের সীমা সম্পর্কে জানা।

যে মুহুর্তে আপনি একটি অনুবাদ "সম্পন্ন" বলছেন, এটি অর্ধেক কাজ; বাকি অর্ধেকটি প্রমাণ করা যে অনুবাদটি আসলে নির্ভরযোগ্য। এই ইউনিটে, আপনি অনুবাদের গুণমান পরিমাপ করার পদ্ধতিগত উপায়গুলি শিখবেন: স্বয়ংক্রিয় QA চেক, মানব-ভিত্তিক LQA ত্রুটি কাঠামো, গুণমান মেট্রিক্স এবং কীভাবে AI-কে "পরিদর্শক" হিসাবে ব্যবহার করতে হয় — এবং এর সীমা। উদ্দেশ্য হল "আমি মনে করি এটি ভাল" এর বিষয়তা থেকে দূরে সরে যাওয়া এবং এমন একজন বিশেষজ্ঞ হওয়া যিনি গুণমানের সংজ্ঞা, পরিমাপ এবং প্রমাণ করেন।

দুই ধরনের মান নিয়ন্ত্রণ: স্বয়ংক্রিয় এবং ভাষাগত

QA (গুণমানের নিশ্চয়তা) অনুবাদে দুটি স্তরে কাজ করে:

স্বয়ংক্রিয় QA: শৈলীগত ত্রুটি যা CAT সরঞ্জাম এবং স্ক্রিপ্টগুলি ধরতে পারে — সংখ্যার অমিল, অনুপস্থিত/অতিরিক্ত স্থান, অসামঞ্জস্যপূর্ণ শব্দ, অ-অনুবাদিত অংশ, খারাপ স্থানধারক/ট্যাগ, ডবল স্পেস, বিরাম চিহ্ন। এগুলি দ্রুত এবং সম্পূর্ণরূপে মেশিন দ্বারা স্ক্যান করা হয়; এটি মানুষের চোখ এড়িয়ে যায়, কিন্তু যানবাহন এটিকে ধরে ফেলে।

LQA (ভাষাগত গুণমানের নিশ্চয়তা): এটি এমন একটি স্তর যেখানে একজন মানব মূল্যায়নকারী অর্থ, পরিভাষা, শৈলী, ব্যাকরণ এবং স্থানীয় উপযুক্ততা পরীক্ষা করে। স্বয়ংক্রিয় QA "সংখ্যা মেলে?" প্রশ্নের দিকে তাকায়; LQA "অর্থ কি সঠিক, স্বরটি কি উপযুক্ত, এটি কি সাংস্কৃতিকভাবে উপযুক্ত?" সে প্রশ্নের দিকে তাকায়। দুটি একে অপরের পরিপূরক; একটি অন্যটিকে প্রতিস্থাপন করে না।

টিপ: সর্বদা প্রথমে অটো QA চালান; আনুষ্ঠানিক ত্রুটিগুলি পরিষ্কার করা মানব মূল্যায়নকারীকে প্রকৃত ভাষাগত সমস্যাগুলির প্রতি মনোযোগ দেওয়ার অনুমতি দেয়। একজন পর্যালোচক যিনি নম্বর ত্রুটি নিয়ে বিরক্ত হন তিনি টোন ত্রুটি মিস করবেন।

ত্রুটি ফ্রেম: MQM এবং DQF

স্ট্যান্ডার্ড ত্রুটি টাইপোলজিগুলি "ভাল/খারাপ" এর পরিবর্তে গুণমান পরিমাপযোগ্য করতে ব্যবহৃত হয়। সবচেয়ে সাধারণ হল MQM (মাল্টিডাইমেনশনাল কোয়ালিটি মেট্রিক্স): এটি প্রতিটি ত্রুটিকে একটি বিভাগে (নির্ভুলতা, সাবলীলতা, পরিভাষা, শৈলী, স্থানীয়তা, বিন্যাস) এবং একটি ওজন (সমালোচনামূলক, বড়, ছোট) নির্ধারণ করে। আরেকটি ফ্রেমওয়ার্ক হল DQF (ডাইনামিক কোয়ালিটি ফ্রেমওয়ার্ক) এবং MQM এর সাথে একসাথে উল্লেখ করা হয়েছে।

কেন এটা গুরুত্বপূর্ণ? কারণ এই কাঠামোর সাহায্যে, আপনি একটি অনুবাদে একটি ত্রুটির স্কোর দিতে পারেন, বিভিন্ন অনুবাদক/ইঞ্জিনকে উদ্দেশ্যমূলকভাবে তুলনা করতে পারেন এবং "এই পাঠ্যটি কি বিতরণ করা যায়?" আপনি একটি সংখ্যাসূচক থ্রেশহোল্ড সঙ্গে প্রশ্নের উত্তর. উদাহরণস্বরূপ: সমালোচনামূলক ত্রুটি = 10 পয়েন্ট, প্রধান = 5, ছোট = 1; একটি নির্দিষ্ট থ্রেশহোল্ডের নীচে পাঠ্য নির্দিষ্ট শব্দ প্রতি পাস করে।

জটিল ত্রুটি: ত্রুটি যা অর্থকে উল্টে দেয়, নিরাপত্তা/আইনি ঝুঁকি তৈরি করে, ব্র্যান্ডের ক্ষতি করে (ভুল ডোজ, "দায়িত্বশীল" এর পরিবর্তে "দায়িত্বপূর্ণ নয়")। মেজর: বিঘ্নিত কিন্তু ক্ষতিকর। অপ্রাপ্তবয়স্ক: লক্ষণীয় কিন্তু অর্থ থেকে বিঘ্নিত নয় (ছোট শৈলী/বিরামচিহ্ন)।

একটি নিয়ামক হিসাবে AI ব্যবহার করা - এবং এর সীমা

AI দ্রুত এবং ত্রুটির কাঠামোর বিরুদ্ধে একটি অনুবাদ পরীক্ষা করতে সহায়ক: আপনি বলতে পারেন "মার্ক শুদ্ধতা, পরিভাষা, এই অনুবাদে MQM বিভাগগুলির সাথে সাবলীল ত্রুটিগুলি"। এটি আপনার অন্ধ দাগ কমিয়ে দেয় এবং আপনাকে দ্রুত "দ্বিতীয় চোখ" দেয়।

তবে তিনটি সমালোচনামূলক সীমা রয়েছে: (1) AI অন্ধ হতে পারে যখন এটি তৈরি করে অনুবাদ পরীক্ষা করে - একই ভুল করা এবং নিশ্চিত করা উভয়ই; একটি ভিন্ন মডেলের সাথে ক্রস-চেক করুন বা উৎসে ফিরে যান। (2) এআই হ্যালুসিনেটরি "ত্রুটি"ও তৈরি করতে পারে - এমন একটি ত্রুটির প্রতিবেদন করুন যা বিদ্যমান নেই; প্রতিটি সতর্কতা নিশ্চিত করুন। (3) AI একটি গুরুতর ত্রুটির বাস্তব-বিশ্বের তীব্রতা পুরোপুরি উপলব্ধি করতে পারে না (একটি ডোজ ত্রুটি মারাত্মক হতে পারে); বিশেষজ্ঞ ওজন করে। তাই AI QA ত্বরান্বিত করে, কিন্তু চূড়ান্ত মানের সিদ্ধান্ত এবং ডেলিভারির অনুমোদন মানুষের উপর নির্ভর করে।

সতর্কতা: "এআই QA পাস করেছে, এটি পরিষ্কার" বলা একটি মিথ্যা আত্মবিশ্বাস। AI অডিটিং মানব LQA এর প্রতিস্থাপন এবং উৎসের সাথে তুলনা নয়; এটি একটি প্রাক-স্ক্রিনিং স্তর যা তাদের গতিতে নিয়ে যায়।

তিনটি মিনি কেস

কেস 1 — স্বয়ংক্রিয় QA 40 নম্বর ত্রুটি খুঁজে পেয়েছে। একটি আর্থিক প্রতিবেদনের অনুবাদে, স্বয়ংক্রিয় QA 40টি সংখ্যা/ফরম্যাটের উৎস এবং লক্ষ্যের মধ্যে অমিল ধরা দিয়েছে (হাজার বিভাজক, দশমিক, মুদ্রা)। মানুষের চোখ এই সব মিস করবে; সেকেন্ডে তালিকাভুক্ত গাড়ি।

কেস 2 — এমকিউএম স্কোর ইঞ্জিন নির্বাচনের দিকে পরিচালিত করে। একটি ব্যুরো MQM- দুটি ভিন্ন এমটি ইঞ্জিনের আউটপুটকে 2,000 শব্দে রেট দিয়েছে: ইঞ্জিন A 12 ত্রুটি পয়েন্ট, ইঞ্জিন B 31। উদ্দেশ্য পরিমাপ একটি স্কোর দিয়ে "কোনটি ভাল" বিতর্কের নিষ্পত্তি করেছে; ব্যুরো ইঞ্জিন A-কে স্ট্যান্ডার্ড বানিয়েছে এবং সেই অনুযায়ী তার সংশোধন-পরবর্তী বাজেটের পরিকল্পনা করেছে।

কেস 3 - এআই অডিট তার নিজের ভুল মিস করেছে। একজন অনুবাদকের এলএলএম অনুবাদ একই এলএলএম দ্বারা তত্ত্বাবধানে ছিল; মডেলটি বলেছিল "কোন সমস্যা নেই", একটি পরিভাষা ত্রুটি সে নিজেই করেছে। অনুবাদক একটি ভিন্ন মডেল এবং উত্সের সাথে ক্রস-চেক করার সময় ত্রুটিটি প্রকাশিত হয়েছিল; দলটি এই নিয়মটি গ্রহণ করেছে যে "একই মডেল নিজেকে নিয়ন্ত্রণ করা উচিত নয়"।

চারটি অনুলিপিযোগ্য টেমপ্লেট

1) MQM ভিত্তিক ত্রুটি পরীক্ষা:

আপনার ভূমিকা: LQA মূল্যায়নকারী। নীচের উৎস এবং অনুবাদ তুলনা করুন. নিম্নলিখিত বিন্যাসে আপনি যে ত্রুটিগুলি খুঁজে পান তা প্রদান করুন: [বিভাগ: নির্ভুলতা/পরিভাষা/ফ্লুয়েন্সি/স্টাইল/ফরম্যাট][ওজন: সমালোচনামূলক/প্রধান/অপ্রধান] [অবস্থান] [মন্তব্য] [সংশোধন]। "নিশ্চিতকরণ আবশ্যক" হিসাবে আপনি অনিশ্চিত সতর্কতা চিহ্নিত করুন; errorfabrication.Source: [...] | অনুবাদ: [...]

2) গুরুতর ত্রুটি স্ক্যানিং (উচ্চ ঝুঁকি):

শুধুমাত্র নীচের অনুবাদে সমালোচনামূলক ত্রুটিগুলি দেখুন: যার অর্থ বিপরীত, সংখ্যা/ডোজ/তারিখ ত্রুটি, অস্বীকারের ক্ষতি, আইনি বাধ্যবাধকতার প্রতিস্থাপন, নিরাপত্তা সতর্কতা ত্রুটি৷ ছোটখাট স্টাইলিং সমস্যা উপেক্ষা করুন. প্রতিটি সমালোচনামূলক অনুসন্ধানের জন্য উত্সটি উল্লেখ করুন৷ উত্স: [...] | অনুবাদ: [...]

3) স্বয়ংক্রিয় QA সম্পূরক নিয়ন্ত্রণ:

নিম্নলিখিত উত্স-লক্ষ্য জোড়ায় আনুষ্ঠানিক অসঙ্গতিগুলি তালিকাভুক্ত করুন: সংখ্যার অমিল, অনুপস্থিত/অতিরিক্ত স্থানধারক বা ট্যাগ, অসামঞ্জস্যপূর্ণ শব্দ, অ-অনুবাদিত সেগমেন্ট, ইউনিট/মুদ্রার পার্থক্য। শুধু তাদের অবস্থান সঙ্গে সমস্যা দিতে. জোড়া: [...]

4) স্বাধীন দ্বিতীয় চোখ (ক্রস-চেক):

এই অনুবাদের মূল্যায়ন করুন বিনা দ্বিধায়; আপনি এটি লিখেছেন অনুমান করবেন না. বিশ্বস্ততা, পরিভাষা এবং স্বাভাবিকতার জন্য উৎসটিকে একটি গুণমানের রেটিং (1-5) দিন এবং শীর্ষ 3টি সমস্যা তালিকাভুক্ত করুন। এটা আমার সিদ্ধান্ত. সূত্র: [...] | অনুবাদ: [...]

দুর্বল প্রম্পট / শক্তিশালী প্রম্পট

দুর্বল: "এই অনুবাদ কি ভাল?" (কোন মানদণ্ড নেই; এআই একটি অকেজো উত্তর দেয় যেমন "সাধারণত ভাল।")

শক্তিশালী: "উৎসটির বিপরীতে এই অনুবাদটি পরীক্ষা করুন। প্রতিটি ত্রুটিকে বিভাগ (নির্ভুলতা/পরিভাষা/প্রবাহ) এবং তীব্রতা (গুরুত্বপূর্ণ/প্রধান/অপ্রধান) দিয়ে লেবেল করুন। বিশেষ করে সংখ্যা, অস্বীকার এবং পরিভাষা ত্রুটির উপর ফোকাস করুন। ত্রুটিগুলি তৈরি করবেন না; আপনি যদি নিশ্চিত না হন তবে 'নিশ্চিতকরণের প্রয়োজন' চিহ্নিত করুন।"

পার্থক্য: শক্তিশালী প্রম্পট একটি ত্রুটি ফ্রেম এবং ফোকাস দেয়; আউটপুট একটি তুলনামূলক এবং কর্মযোগ্য মানের প্রতিবেদন।

গুণমানের স্তর টেবিল

স্তর

কি ধরা

কে/কী করে

অটো QA

সংখ্যা, লেবেল, ধারাবাহিকতা

টুল/স্ক্রিপ্ট

এআই নিয়ন্ত্রণ

সম্ভাব্য অর্থ/পরিভাষা ত্রুটি

এলএলএম (নিশ্চিতকরণ সহ)

মানুষের LQA

অর্থ, স্বর, সংস্কৃতি, ওজন

বিশেষজ্ঞ মূল্যায়নকারী

MQM/DQF স্কোর

উদ্দেশ্য ত্রুটি স্কোর

ফ্রেম সহ মানুষ

ডেলিভারি নিশ্চিতকরণ

চূড়ান্ত দায়িত্ব

দক্ষ অনুবাদক

সাধারণ ভুল

  • স্বয়ংক্রিয় QA এড়িয়ে যাওয়া এবং সরাসরি পড়া শুরু করা। শৈলীগত ত্রুটি মনোযোগ বিভ্রান্ত করে।
  • মানব LQA দিয়ে AI পরিদর্শন প্রতিস্থাপন করা হচ্ছে। এআই প্রি-স্ক্রিন, অনুমোদন করে না।
  • একই মডেল থাকার তার নিজস্ব অনুবাদ পরীক্ষা করুন. অন্ধ স্থান; ক্রস চেকিং প্রয়োজন।
  • ওজনের ত্রুটি নয়। সমালোচনামূলক এবং গৌণকে একই হিসাবে দেখা অগ্রাধিকার ব্যাহত করে।
  • সেগুলি নিশ্চিত না করেই এআই দ্বারা তৈরি "ত্রুটি" সংশোধন করা। আপনি সঠিক বাক্য বিকৃত করতে পারেন।

স্বয়ংক্রিয় মেট্রিক্স: BLEU, COMET এবং সীমা

মান পরিমাপে স্বয়ংক্রিয় মেট্রিক্সের একটি জগতও রয়েছে। BLEU (দ্বিভাষিক মূল্যায়ন আন্ডারস্টাডি) একটি মেশিন অনুবাদকে একটি মানব রেফারেন্স অনুবাদের সাথে তুলনা করে এবং শব্দ ওভারল্যাপের উপর ভিত্তি করে 0-100 স্কোর দেয়; এটি একটি দীর্ঘ সময়ের জন্য MT সিস্টেমের তুলনা করার মান ছিল। একটি নতুন মেট্রিক, COMET, নিউরাল নেটওয়ার্ক ভিত্তিক এবং এটি BLEU এর চেয়ে ভাল শব্দার্থিক সাদৃশ্য ক্যাপচার করে। বড় ডেটাতে দুটি ইঞ্জিন দ্রুত এবং স্বয়ংক্রিয়ভাবে তুলনা করার জন্য এই মেট্রিকগুলি মূল্যবান।

কিন্তু এর সীমা স্পষ্ট: BLEU-এর মতো মেট্রিকগুলি শব্দের ওভারল্যাপের দিকে তাকায়, আসলে অর্থ বুঝতে পারে না। একটি অনুবাদ যা রেফারেন্স থেকে আলাদা কিন্তু সঠিক সে কম স্কোর পেতে পারে; একটি অনুবাদ যা রেফারেন্সের অনুরূপ কিন্তু ভুল একটি উচ্চ স্কোর পেতে পারে। একটি সমালোচনামূলক নেতিবাচক ত্রুটি একটি একক শব্দ তাই এটি মেট্রিকের উপর সামান্য প্রভাব ফেলে, কিন্তু আসলে এটি সর্বনাশা। এই কারণেই স্বয়ংক্রিয় মেট্রিক্স সিস্টেম স্তরে প্রবণতা পরিমাপ করে, একটি পৃথক পাঠ্যের বিতরণযোগ্যতা নির্ধারণ করে না। MQM-ভিত্তিক মানবিক মূল্যায়ন এবং বিশেষজ্ঞের রায় সিদ্ধান্ত নেয় একটি অনুবাদ ক্লায়েন্টের কাছে যায় কিনা, স্বয়ংক্রিয় স্কোর নয়। কম্পাস হিসাবে মেট্রিক্স ব্যবহার করুন, বিচারক নয়।

সংক্ষেপে

অনুবাদের মান কোন বিষয়গত অনুভূতি নয়, এটি পরিমাপযোগ্য কিছু। স্বয়ংক্রিয় QA আনুষ্ঠানিক ত্রুটিগুলির জন্য পুঙ্খানুপুঙ্খভাবে স্ক্যান করে; মানুষের LQA অর্থ, স্বর এবং সংস্কৃতি মূল্যায়ন করে; এমকিউএম-এর মতো ত্রুটির কাঠামো বিভাগ এবং ওজন দ্বারা গুণমান পরিমাপ করে, উদ্দেশ্য তুলনা সক্ষম করে। AI হল একটি শক্তিশালী দ্বিতীয় চোখ যা এই নিয়ন্ত্রণকে ত্বরান্বিত করে, কিন্তু এটি নিজের অনুবাদে অন্ধ হতে পারে, ভুল করতে পারে এবং বাস্তব-বিশ্বের ওজন সম্পূর্ণরূপে উপলব্ধি করতে ব্যর্থ হতে পারে; অতএব, চূড়ান্ত মানের সিদ্ধান্ত, ওজন নির্ধারণ এবং বিতরণ অনুমোদন দক্ষ অনুবাদকের অন্তর্গত।

আবেদন টাস্ক

একটি মেশিন অনুবাদ আউটপুট পান. প্রথমে "স্বয়ংক্রিয় QA সম্পূরক পরীক্ষা" দিয়ে আনুষ্ঠানিক ত্রুটিগুলি তালিকাভুক্ত করুন, তারপর "MQM-ভিত্তিক ত্রুটি পরীক্ষা" সহ বিভাগ এবং ওজন অনুসারে ভাষাগত ত্রুটিগুলি তালিকাভুক্ত করুন৷ আমি প্রতিটি ত্রুটি (গুরুত্বপূর্ণ 10, প্রধান 5, ছোট 1) প্রতি শব্দে একটি থ্রেশহোল্ড দিয়ে রেট করি এবং জিজ্ঞাসা করি "এটি কি বিতরণ করা যেতে পারে?" প্রশ্নের উত্তর দাও। অবশেষে, উৎসের সাথে নিশ্চিত করুন যে AI দ্বারা পতাকাঙ্কিত ত্রুটিগুলির মধ্যে কতগুলি বাস্তব এবং কতগুলি বানোয়াট।

চেকলিস্ট

  • [ ] আমি স্বয়ংক্রিয় QA চালিয়েছি এবং কোনো আনুষ্ঠানিক ত্রুটি পরিষ্কার করেছি।
  • [ ] আমি একটি বাক্স (বিভাগ + ওজন) দিয়ে ভাষাগত ত্রুটি চিহ্নিত করেছি।
  • [ ] আমি একটি পৃথক, অগ্রাধিকারযুক্ত রাউন্ডে সমালোচনামূলক ত্রুটিগুলি স্ক্যান করেছি৷
  • [ ] আমি AI কন্ট্রোল সোর্স করেছি এবং প্রয়োজনে অন্য মডেল দিয়ে ক্রস-চেক করেছি।
  • [ ] আমি সাংখ্যিক থ্রেশহোল্ড এবং আমার নিজস্ব বিশেষজ্ঞের রায়ের উপর ভিত্তি করে বিতরণের সিদ্ধান্ত নিয়েছি।