יחידה 5 / 11

שילוב בינה מלאכותית עם כלי CAT וזיכרון תרגום (TM)

רווחים:

  • הבנת המושגים של זיכרון תרגום (TM), התאמות וקטעים מטושטשים, והיכולת להשתמש בהבדלים בהתאמות מעורפלות על ידי התאמתם ולא בצורה עיוורת.
  • יכולת ליישם את הדיסציפלינה של כתיבת תרגומים מאושרים בלבד ל-TM, שמירה על TM לקוחות נפרדים וביצוע תחזוקת TM
  • יכולת להגן על הפרטיות על ידי שליטה לאן עוברים הנתונים באינטגרציה של MT/LLM בתוך CAT

תרגום מקצועי נעשה לרוב בכלי CAT, לא בעורך טקסט רגיל. ביחידה זו תלמדו כלי CAT, זיכרון התרגום (TM) בלב התרגום, כיצד הם עובדים יחד עם תרגום מכונה ו-LLM, וכיצד להשתמש במערכת אקולוגית זו בצורה יעילה ובטוחה. המטרה היא להפוך למשתמש בטכנולוגיית תרגום שמנהל פרויקט שלם, לא משפטים בודדים, בצורה עקבית, מהירה וניתנת למעקב.

מושגי יסוד

כלי CAT (Computer-Assisted Translation) היא תוכנה מקצועית (כגון Trados, memoQ, Phrase, MateCat) המארגנת את התרגום משפט אחר משפט (קטע) ומחברת את זיכרון התרגום ומאגר המונחים. מציג מקור ויעד זה לצד זה, תופס חזרות, שומר על עיצוב.

TM (זיכרון תרגום) הוא מסד נתונים המאחסן את צמדי משפטי המקור-יעד שתרגמתם בעבר. כשמגיע משפט חדש, אם יש משפט דומה ב-TM, הסוכן מציע לך אותו. מושג המפתח כאן הוא התאמה מטושטשת: הדמיון של המשפט החדש למשפט ב-TM (100% = זהה לחלוטין, 85% = דומה במידה רבה). התאמות גבוהות מזרזות את העבודה מכיוון שאתה עושה שימוש חוזר בתרגום הקודם שלך.

קטע הוא יחידת התרגום הבסיסית - בדרך כלל משפט. כלי CAT מחלק את הטקסט למקטעים ועורך כל אחד בנפרד.

חשיבותו של TM: MT מייצרת טיוטות גולמיות, אך TM מחזירה את תרגומי העבר המאושרים, באיכות אנושית. השניים שונים: MT הוא חיזוי, TM הוא זיכרון.

טיפ: אל תבלבל בין TM לבין MT. התאמה של 100% TM (תרגום שאושר קודם לכן) היא בדרך כלל אמינה; המלצת MT צריכה להיות מאומתת תמיד. כלי CAT מציגים את השניים עם צבעים/תוויות שונות; תמיד רואים את ההבדל הזה.

שילוב של MT ו- LLM לתוך CAT

כלי CAT מודרניים קוראים למנועי MT ויותר ויותר LLMs פנימיים: אם אין התאמה ב-TM, הסוכן מחזיר באופן אוטומטי המלצת MT עבור הפלח; אתה עורך אותו לאחר מכן (כלומר, MTPE זורם ב-CAT). הכלים מהדור האחרון משלבים גם את LLM: אתה יכול לעשות פעולות כמו "לכתוב מחדש את הקטע הזה עם הטון הזה", "תקן את המונח הזה ל-termbase" וכו' בכלי.

יתרון של שילוב זה: TM, termbase, MT ו-LLM משולבים במסך אחד; עבור כל משפט, נוצרת הזרימה "תסתכל קודם על TM, אחרת הצע MT, מונח QA באופן אוטומטי". חסרון וזהירות: לאן הולכים הנתונים? שילוב MT/LLM מבוסס ענן יכול לשלוח טקסט לשרתים חיצוניים; בעבודה חסויה, זו עלולה להיות הפרת חוזה. הקפידו לדעת לאיזה מנוע הרכב מחובר ועם איזו מדיניות נתונים.

הזנה וניקוי זיכרון תרגום

הערך של TM הוא כמו איכות התרגומים בו. זבל פנימה, זבל החוצה. שני דיסציפלינות:

  1. פשוט כתוב את התרגום המאושר ל-TM. אם תשמור את פלט ה-MT הגולמי ל-TM מבלי לאמת אותו, הוא יחזור לעבודות העתידיות שלך כ"זיכרון רע".
  2. בצע תחזוקה של TM. עם הזמן, התנאים משתנים ונכנסות שגיאות. נקה מעת לעת TM, תקן זוגות שחוקים/שגויים. בעבודה זו אני משתמש ב-LLM כדי לשאול "האם יש חוסר עקביות/הטיית מונחים בצמדי TM אלה?" אתה יכול להשתמש בו כמבקר.
זהירות: שימוש ב-TM של לקוח אחד בעסק של לקוח אחר מהווה גם הפרה של סודיות וגם סיכון לבלבול במונחים. TMs נשמרים בנפרד על בסיס לקוח/פרויקט. "הכל TM" מעורב הורס גם את הסודיות וגם את האיכות.

שלושה מיני תיקים

מקרה 1 - TM הטסה את השידורים החוזרים. יצרן תורגם משפחת מוצרים שבה 70% מהמדריך שלו נשאר זהה שנה אחר שנה. הודות ל-TM, התאמות 100% ומעורפלות גבוהות הגיעו אוטומטית בכל גרסה חדשה; רק ~9,000 מילים מתוך העבודה של 30,000 מילים היו תרגום חדש בפועל. הזמן והעלות הופחתו בשליש.

מקרה 2 - Dirty TM הפיצה את השגיאה. צוות אחד שמר את פלט ה-MT הגולמי ל-TM ללא אימות. שנה לאחר מכן אותו תרגום שגוי חזר שוב ושוב, ונראה "אמין" כהתאמה של 100%; השגיאה התפרסה על פני 14 מסמכים שונים. הצוות הנהיג כלל "תרגום מוסמך ל-TM בלבד" וסיור ניקיון.

מקרה 3 - סודיות דלף באינטגרציה. מתרגם עשה עבודה סודית בפרויקט CAT שחובר אוטומטית ל-Cloud MT; הטקסט עבר למנוע חיצוני שמדיניות הנתונים שלו לא ברורה. לאחר ששימו לב, אינטגרציית MT עבור פרויקטים סודיים כובתה והשתמשו רק במנועים ארגוניים ש"לא מאחסנים/מכשירים נתונים".

ארבע תבניות הניתנות להעתקה

1) הערכת התאמה מטושטשת (ל-LLM):

להלן משפט המקור החדש, המשפט הדומה ב-TM והתרגום המאושר שלו. אמור לי בדיוק מה אני צריך לשנות כדי להתאים את תרגום ה-TM למשפט החדש; אל תציע שינויים מיותרים. הראה את ההבדל במשמעות בצורה ברורה. מקור חדש: [...] | מקור TM: [...] | תרגום TM: [...]

2) בדיקת עקביות TM:

להלן צמדי המקור-יעד מ-TM. סמן חוסר עקביות וסטיות מונחים כאשר משפטי מקור זהים או דומים מאוד מתורגמים בצורה שונה. רק רשום את הבעיות.זוגות: [...]

3) שכתוב צליל פלחים (LLM ב-CAT):

צור את קטע היעד הבא [טון רצוי] מבלי לשנות את המשמעות. ציית לרשימת התנאים: [...]. שמור מספרים ושמות. ייצא רק את הקטע שנכתב מחדש. פלח: [...]

4) בדיקה מוקדמת של פרטיות/אינטגרציה:

אני אשתמש באינטגרציה של MT/LLM בפרויקט CAT. אתאר את סוג הטקסט בפרויקט זה; אמור לי האם מתאים לשלוח את הטקסט הזה למנוע חיצוני מבוסס ענן, אילו שאלות (שימור נתונים, הדרכה, מיקום) עלי לשאול את הספק.סוג טקסט/סטטוס פרטיות: [...]

הנחיה חלשה / הנחיה חזקה

חלש: "השתמש בתרגום ב-TM." (לא ברור איזה שיעור התאמה ומה להתאים; העתקה עיוורת מציגה שגיאות.)

חזק: "המשפט החדש הזה תואם את המשפט ב-TM ב-90% מהמקרים. בנה על תרגום ה-TM אבל משקף את ההבדל הזה: במקור יש 'שנתי' במקום 'חודשי', אז הוא צריך להיות 'שנתי' במקום 'חודשי'. אל תשנה שום דבר אחר".

הבדל: הנחיה חזקה מציינת את ההבדל בהתאמה; זה מונע "להשאיר את התרגום הישן כפי שהוא", שזו הטעות הנפוצה ביותר של התאמה מטושטשת.

טבלת רכיבי המערכת האקולוגית של CAT

רכיב

מה עושה

מערכת יחסים עם AI

TM (זיכרון תרגום)

מחזיר תרגומים שאושרו בעבר

אמין; לפני MT

בסיס מונחים

מבטיח עקביות מונחים

זה ניתן כהנחיה ל-LLM

המלצת MT

סקיצה גולמית לקטע ריק

יש לערוך לאחר מכן

אינטגרציה של LLM

טון/מונח/כתיבה מחדש

מבוקר, תשומת לב לפרטיות

מודול QA

סורק שגיאת מספר/מונח/תג

שליטה אוטומטית

טעויות נפוצות

  • מקבל בעיוורון את ההתאמה המטושטשת. התאמה של 85% יכולה להסתיר הבדל של 15% במשמעות.
  • כתיבת פלט MT גולמי ל-TM. Dirty TM נושא את השגיאה אל העתיד ומרבה אותה.
  • ערבוב לקוחות/פרויקטים TMs. סודיות וסיכון לבלבול מונחים.
  • לא יודע לאן הולכים נתוני האינטגרציה. טקסט נסתר עלול לדלוף החוצה מבלי שתהיה מודע לכך.
  • שוכחים את ההבדל TM/MT. MT הוא אומדן; TM הוא זיכרון. השניים אינם בטוחים באותה מידה.

תרגום ויישור מראש

שתי פונקציות CAT מתקדמות מאיצות עוד יותר את זרימת העבודה בעידן הבינה המלאכותית. הראשון הוא תרגום מקדים: בתחילת הפרויקט, הכלי ממלא אוטומטית את כל הקטעים ב-TM ו-MT; במקום קובץ ריק, אתה מתחיל עם קובץ שבו 100% התאמות מאושרות, התאמות מטושטשות ממתינות להתאמת, והריקות הן טיוטות MT. זה משנה את העבודה מ"כתיבה מאפס" ל"סקירה ועריכה" - אבל אתה צריך להעריך כל קטע במקום לאשר באופן עיוור את התרגום המקדים.

השני הוא יישור: אם יש לך זוג מסמכי מקור-יעד שתורגם בעבר אך לא נכנס ל-TM, כלי היישור מתאים אותם מקטע אחר מקטע וממיר אותם ל-TM. לפיכך, תרגומי העבר שלך מתווספים ל"זיכרון". זהירות ביישור: התאמה אוטומטית אינה תמיד נכונה; החלקה של קטע אחד משבשת את כל היישור. סקירת זוגות מיושרים לפני TMing מונעת את הסיכון של TM מלוכלך מלכתחילה. שתי הפונקציות הללו הופכות את הנכסים הנוכחיים שלך (תרגומי עבר) להשקעות בעסקים עתידיים.

לסיכום

כלי CAT; הוא משלב זיכרון תרגום, בסיס מונחים, תרגום מכונה ו-LLM לקו ייצור אחד. TM הוא זיכרון המאחזר את תרגומי העבר המאושרים שלך ומספק מהירות רבה במשימות שחוזרות על עצמן; MT היא תחזית שתמיד צריך לאמת. המשתמש המתמצא מתאים בקפידה את ההבדל בהתאמות מעורפלות, כותב רק תרגומים מאושרים ל-TM, שומר על TM לקוחות נפרדים ומגן על הפרטיות על ידי ידיעה לאן הנתונים הולכים באינטגרציה.

משימת יישום

הגדר פרויקט קטן בכלי CAT (גם CAT מקוון חינמי עובד): הוסף בסיס מילים ו-TM ריק. תרגם טקסט בן 10 משפטים, שמור את התרגומים המאושרים ל-TM. לאחר מכן תרגם טקסט שני דומה מאוד לטקסט הראשון והתאם את ההתאמות המטושטשות שהוחזרו על ידי TM עם התבנית "הערכת התאמה מטושטשת"; שימו לב כמה משפטים הייתם עושים טעות אם הייתם מקבלים TM בצורה עיוורת.

רשימת בדיקה

  • [ ] חיברתי את TM ו-termbase לפרויקט.
  • [ ] השתמשתי בהבדל בהתאמות מטושטשות בצורה אדפטיבית ולא בצורה עיוורת.
  • [ ] כתבתי ל-TM רק את התרגום המאושר שאימתתי.
  • [ ] שמרתי את ה-TM של לקוחות/פרויקטים נפרדים.
  • [ ] בדקתי לאן עוברים הנתונים באינטגרציה של MT/LLM.