واحد 5 / 11

ادغام هوش مصنوعی با ابزارهای CAT و حافظه ترجمه (TM)

سود:

  • درک مفاهیم حافظه ترجمه (TM)، منطبقات فازی و بخش ها، و توانایی استفاده از تفاوت ها در مطابقت های فازی با تطبیق آنها به جای کورکورانه.
  • امکان اعمال انضباط نوشتن فقط ترجمه های تایید شده به TM، جدا نگه داشتن TM مشتریان و انجام تعمیر و نگهداری TM
  • امکان محافظت از حریم خصوصی با کنترل محل رفتن داده ها در ادغام MT/LLM در CAT

ترجمه حرفه ای اغلب در یک ابزار CAT انجام می شود، نه در یک ویرایشگر متن ساده. در این بخش، ابزارهای CAT، حافظه ترجمه (TM) در قلب ترجمه، نحوه کار آنها با ترجمه ماشینی و LLM و نحوه استفاده کارآمد و ایمن از این اکوسیستم را خواهید آموخت. هدف تبدیل شدن به یک کاربر فناوری ترجمه است که کل پروژه را مدیریت می کند، نه جملات فردی را، به شیوه ای سازگار، سریع و قابل ردیابی.

مفاهیم اساسی

ابزار CAT (Computer-Assisted Translation) نرم افزار حرفه ای (مانند Trados، memoQ، Phrase، MateCat) است که جمله به جمله (بخش) ترجمه را سازماندهی می کند و حافظه ترجمه و پایگاه اصطلاح را به هم متصل می کند. منبع و هدف را در کنار هم نشان می دهد، تکرارها را می گیرد، قالب بندی را حفظ می کند.

TM (حافظه ترجمه) پایگاه داده ای است که جفت جملات مبدا-هدف را که قبلا ترجمه کرده اید ذخیره می کند. وقتی جمله جدیدی می رسد، اگر جمله مشابهی در TM وجود داشته باشد، عامل آن را به شما پیشنهاد می کند. مفهوم کلیدی در اینجا تطابق فازی است: شباهت جمله جدید به جمله در TM (100٪ = دقیقاً یکسان، 85٪ = تا حد زیادی مشابه). مطابقت زیاد کار را سرعت می بخشد زیرا از ترجمه قبلی خود مجددا استفاده می کنید.

یک بخش واحد اصلی ترجمه است - معمولاً یک جمله. ابزار CAT متن را به بخش هایی تقسیم می کند و هر کدام را جداگانه ویرایش می کند.

اهمیت TM: MT پیش‌نویس‌های خام تولید می‌کند، اما TM ترجمه‌های قبلی با کیفیت انسانی تأیید شده شما را برمی‌گرداند. این دو متفاوت هستند: MT یک پیش بینی است، TM یک حافظه است.

نکته: TM و MT را با هم اشتباه نگیرید. یک تطابق 100٪ TM (ترجمه قبلاً تأیید شده شما) به طور کلی قابل اعتماد است. توصیه MT همیشه باید تأیید شود. ابزارهای CAT این دو را با رنگ/برچسب های مختلف نشان می دهند. همیشه این تفاوت را ببینید

ادغام MT و LLM در CAT

ابزارهای مدرن CAT موتورهای MT و به طور فزاینده‌ای LLM را به صورت داخلی می‌نامند: اگر مطابقت در TM وجود نداشته باشد، نماینده به طور خودکار یک توصیه MT را برای بخش برمی‌گرداند. شما آن را پس از ویرایش (به عنوان مثال MTPE در CAT جریان می یابد). ابزارهای آخرین نسل همچنین LLM را ادغام می کنند: می توانید عملیاتی مانند "بازنویسی این بخش با این لحن"، "تصحیح این عبارت به termbase" و غیره را در ابزار انجام دهید.

مزیت این ادغام: TM، termbase، MT و LLM در یک صفحه ترکیب شده اند. برای هر جمله، جریان "ابتدا به TM نگاه کنید، در غیر این صورت MT را پیشنهاد دهید، عبارت QA به طور خودکار" برقرار می شود. جنبه منفی و احتیاط: داده ها کجا می روند؟ ادغام MT/LLM مبتنی بر ابر می تواند متن را به سرورهای خارجی ارسال کند. در کارهای محرمانه، این ممکن است نقض قرارداد باشد. مطمئن شوید که می دانید وسیله نقلیه به کدام موتور متصل است و با کدام خط مشی داده.

تغذیه و پاک کردن حافظه ترجمه

ارزش TM به اندازه کیفیت ترجمه های موجود در آن است. زباله داخل، زباله بیرون. دو رشته:

  1. فقط ترجمه تایید شده را به TM بنویسید. اگر خروجی MT خام را بدون تأیید اعتبار در TM ذخیره کنید، به عنوان «حافظه» بد به کارهای آینده شما باز خواهد گشت.
  2. تعمیر و نگهداری TM را انجام دهید. با گذشت زمان، اصطلاحات تغییر می کنند و خطاها وارد می شوند. TM را به صورت دوره ای تمیز کنید، جفت های فرسوده/نادرست را اصلاح کنید. در این کار من از LLM استفاده می کنم تا بپرسم "آیا در این جفت های TM تناقضات/سوگیری اصطلاحی وجود دارد؟" می توانید از آن به عنوان حسابرس استفاده کنید.
احتیاط: استفاده از TM یک مشتری در تجارت مشتری دیگر، هم نقض محرمانگی و هم خطر سردرگمی اصطلاح است. TM ها بر اساس مشتری/پروژه جداگانه نگهداری می شوند. ترکیبی از "همه چیز TM" هم محرمانگی و هم کیفیت را از بین می برد.

سه کیف کوچک

مورد 1 - TM تکرارها را انجام داد. یک تولید کننده یک خانواده محصول را ترجمه می کرد که 70٪ کتابچه راهنمای آن سال به سال یکسان باقی می ماند. با تشکر از TM، 100٪ و مسابقات فازی بالا به طور خودکار در هر نسخه جدید ارائه شد. فقط 9000 کلمه از 30000 کلمه ترجمه واقعی بود. زمان و هزینه یک سوم کاهش یافت.

مورد 2 - Dirty TM خطا را منتشر کرد. یک تیم خروجی MT خام را بدون تأیید در TM ذخیره کرده بود. یک سال بعد، همان ترجمه نادرست بارها و بارها تکرار شد و به عنوان یک تطابق 100% "موثق" ظاهر شد. این خطا در 14 سند مختلف پخش شد. این تیم یک قانون "فقط ترجمه تایید شده به TM" و یک تور پاکسازی را ایجاد کرد.

مورد 3 - محرمانه بودن در یکپارچه سازی به بیرون درز کرد. یک مترجم کار محرمانه ای را در یک پروژه CAT انجام داد که به طور خودکار به ابر MT متصل شد. متن به یک موتور خارجی رفت که خط مشی داده آن نامشخص است. هنگامی که متوجه شدیم، ادغام MT برای پروژه های مخفی خاموش شد و فقط موتورهای سازمانی که "داده ها را ذخیره یا آموزش نمی دهند" استفاده شد.

چهار قالب قابل کپی

1) ارزیابی تطابق فازی (به LLM):

در زیر جمله منبع جدید، جمله مشابه در TM و ترجمه تایید شده آن آمده است. به من بگویید دقیقاً چه چیزی را باید تغییر دهم تا ترجمه TM را با جمله جدید تطبیق دهم. تغییرات غیر ضروری را پیشنهاد نکنید. تفاوت معنا را به وضوح نشان دهید. منبع جدید: [...] | منبع TM: [...] | ترجمه TM: [...]

2) بررسی سازگاری TM:

در زیر جفت منبع-هدف از TM آمده است. ناسازگاری ها و انحرافات اصطلاحی را در جایی که جملات منبع یکسان یا بسیار مشابه به طور متفاوت ترجمه شده اند علامت بزنید. فقط مشکلات را لیست کنید. زوج ها: [...]

3) بازنویسی آهنگ قطعه (LLM در CAT):

بدون تغییر معنی، بخش هدف زیر را بسازید [لحن دلخواه]. مطابق با لیست شرایط: [...]. اعداد و اسامی را حفظ کنید. فقط بخش بازنویسی شده را صادر کنید. بخش: [...]

4) پیش‌بررسی حریم خصوصی/ادغام:

من از ادغام MT/LLM در یک پروژه CAT استفاده خواهم کرد. من نوع متن را در این پروژه شرح خواهم داد. به من بگویید که آیا ارسال این متن به یک موتور خارجی مبتنی بر ابر مناسب است، چه سوالاتی (نگهداری داده، آموزش، مکان) باید از ارائه دهنده بپرسم. نوع متن/وضعیت حریم خصوصی: [...]

اعلان ضعیف / اعلان قوی

ضعیف: "از ترجمه در TM استفاده کنید." (مشخص نیست که چه میزان مطابقت دارد و چه چیزی باید تطبیق داده شود؛ کپی کور باعث ایجاد خطا می شود.)

قوی: "این جمله جدید 90٪ مواقع با جمله در TM مطابقت دارد. بر اساس ترجمه TM بسازید اما این تفاوت را منعکس کنید: منبع به جای "ماهانه" "سالانه" دارد، بنابراین به جای "ماهانه" باید "سالانه" باشد. چیز دیگری را تغییر ندهید."

تفاوت: اعلان قوی تفاوت مسابقه را مشخص می کند. از "ترجمه قدیمی همانطور که هست" که رایج ترین اشتباه تطبیق فازی است جلوگیری می کند.

جدول اجزای اکوسیستم CAT

جزء

چه می کند

رابطه با هوش مصنوعی

TM (حافظه ترجمه)

ترجمه های تایید شده قبلی را برمی گرداند

قابل اعتماد؛ قبل از MT است

ترمباس

ثبات اصطلاح را تضمین می کند

به عنوان یک اعلان به LLM داده می شود

توصیه MT

طرح خام به بخش خالی

باید پس از ویرایش انجام شود

ادغام LLM

لحن / اصطلاح / بازنویسی

کنترل شده، توجه به حریم خصوصی

ماژول QA

خطای شماره/ترم/تگ را اسکن می کند

کنترل خودکار

اشتباهات رایج

  • پذیرش کورکورانه تطابق فازی. یک تطابق 85 درصدی می تواند 15 درصد تفاوت معنا را پنهان کند.
  • نوشتن خروجی خام MT روی TM. Dirty TM خطا را به آینده منتقل می کند و آن را تکثیر می کند.
  • اختلاط TMهای مشتری/پروژه. محرمانه بودن و خطر سردرگمی اصطلاح.
  • نمی‌دانیم داده‌های یکپارچه‌سازی کجا می‌روند. ممکن است متن مخفی بدون اینکه شما از آن آگاه باشید به بیرون درز کند.
  • فراموش کردن تفاوت TM/MT MT یک تخمین است. TM یک حافظه است. این دو به یک اندازه ایمن نیستند.

پیش ترجمه و تراز

دو عملکرد پیشرفته CAT باعث تسریع بیشتر گردش کار در عصر هوش مصنوعی می شود. اولین مورد پیش ترجمه است: در ابتدای پروژه، ابزار به طور خودکار تمام بخش ها را با TM و MT پر می کند. به جای یک فایل خالی، با فایلی شروع می‌کنید که در آن 100% منطبق‌ها تأیید شده‌اند، منطبق‌های فازی در انتظار تطبیق هستند، و موارد خالی پیش‌نویس‌های MT هستند. این کار را از "نوشتن از ابتدا" به "بازبینی و ویرایش" تغییر می دهد - اما شما به جای تایید کورکورانه پیش ترجمه، باید هر بخش را ارزیابی کنید.

مورد دوم تراز است: اگر یک جفت سند منبع-هدف دارید که قبلا ترجمه شده است اما وارد TM نشده است، ابزار تراز آنها را بخش به بخش مطابقت می دهد و آنها را به TM تبدیل می کند. بنابراین، ترجمه های گذشته شما به "حافظه" اضافه می شود. احتیاط در تراز: تطبیق خودکار همیشه صحیح نیست. لغزش یک بخش کل هم ترازی را مختل می کند. بررسی جفت های تراز شده قبل از TMing از خطر کثیف شدن TM در وهله اول جلوگیری می کند. این دو عملکرد دارایی های فعلی شما (ترجمه های گذشته) را به سرمایه گذاری در مشاغل آینده تبدیل می کند.

به طور خلاصه

ابزارهای CAT؛ این حافظه ترجمه، پایگاه اصطلاح، ترجمه ماشینی و LLM را در یک خط تولید ترکیب می کند. TM حافظه ای است که ترجمه های تایید شده قبلی شما را بازیابی می کند و سرعت زیادی در کارهای تکراری فراهم می کند. MT یک پیش بینی است که همیشه نیاز به تأیید دارد. کاربر باهوش با دقت تفاوت را در تطابقات فازی تطبیق می دهد، فقط ترجمه های تایید شده را در TM می نویسد، TM های مشتری را جدا نگه می دارد و با دانستن اینکه داده ها در کجای یکپارچه سازی قرار می گیرند، از حریم خصوصی محافظت می کند.

وظیفه کاربردی

یک پروژه کوچک را در یک ابزار CAT تنظیم کنید (یک CAT آنلاین رایگان نیز کار می کند): یک Termbase و یک TM خالی اضافه کنید. یک متن 10 جمله ای را ترجمه کنید، ترجمه های تایید شده را در TM ذخیره کنید. سپس متن دوم را بسیار شبیه به متن اول ترجمه کنید و مطابقت های فازی را که توسط TM بازگردانده شده است با الگوی "ارزیابی تطابق فازی" تطبیق دهید. توجه داشته باشید که اگر کورکورانه TM را بپذیرید چند جمله اشتباه می کنید.

چک لیست

  • [ ] من TM و termbase را به پروژه وصل کردم.
  • [ ] من از تفاوت در تطابقات فازی به جای کورکورانه استفاده کردم.
  • [ ] من فقط ترجمه تایید شده ای را که تأیید کرده ام به TM نوشتم.
  • [ ] من TM های مشتری/پروژه را جدا نگه داشتم.
  • [ ] من بررسی کردم که داده ها در یکپارچه سازی MT/LLM کجا می روند.