единица 5 / 11

AI интеграция с CAT инструменти и преводна памет (TM)

Печалби:

  • Разбиране на концепциите за преводна памет (TM), размити съвпадения и сегменти и способност за използване на разликите в размитите съвпадения чрез адаптирането им, а не сляпо.
  • Способност за прилагане на дисциплината за писане само на одобрени преводи в TM, поддържане на отделни TM на клиентите и извършване на поддръжка на TM
  • Възможност за защита на поверителността чрез контролиране къде отиват данните в интеграцията на MT/LLM в CAT

Професионалният превод най-често се извършва в CAT инструмент, а не в редактор на обикновен текст. В този модул ще научите CAT инструментите, преводаческата памет (TM) в основата на превода, как работят заедно с машинния превод и LLM и как да използвате тази екосистема ефективно и безопасно. Целта е да станете потребител на технологии за превод, който управлява цял проект, а не отделни изречения, по последователен, бърз и проследим начин.

Основни понятия

Инструментът CAT (компютърно-подпомогнат превод) е професионален софтуер (като Trados, memoQ, Phrase, MateCat), който организира изречение за превод по изречение (сегмент) и свързва преводаческата памет и терминологичната база. Показва източника и целта един до друг, улавя повторения, запазва форматирането.

TM (Преводна памет) е база данни, която съхранява двойките изречения източник-цель, които сте превели преди това. Когато пристигне ново изречение, ако има подобно изречение в TM, агентът ви го предлага. Ключовата концепция тук е размито съвпадение: сходството на новото изречение с изречение в TM (100% = точно същото, 85% = до голяма степен подобно). Високите съвпадения ускоряват работата, защото използвате повторно предишния си превод.

Сегментът е основната единица за превод - обикновено изречение. Инструментът CAT разделя текста на сегменти и редактира всеки отделно.

Значение на TM: MT създава необработени чернови, но TM връща вашите одобрени предишни преводи с човешко качество. Двете са различни: MT е предсказание, TM е памет.

Съвет: Не бъркайте TM и MT. 100% съвпадение на TM (вашият предварително одобрен превод) обикновено е надеждно; Препоръката на MT винаги трябва да се проверява. CAT инструментите показват двете с различни цветове/етикети; винаги виждайте тази разлика.

Интегриране на MT и LLM в CAT

Съвременните CAT инструменти извикват MT машини и все повече LLM вътрешно: ако няма съвпадение в TM, агентът автоматично връща MT препоръка за сегмента; вие го редактирате след това (т.е. MTPE потоци в CAT). Инструментите от най-ново поколение също интегрират LLM: можете да извършвате операции като „пренапишете този сегмент с този тон“, „коригирайте този термин към терминологична база“ и т.н. в инструмента.

Предимство на тази интеграция: TM, termbase, MT и LLM са комбинирани в един екран; За всяко изречение се установява потокът „първо вижте TM, в противен случай предложете MT, термин QA автоматично“. Недостатък и внимание: къде отиват данните? Базираната в облак MT/LLM интеграция може да изпраща текст към външни сървъри; При поверителна работа това може да е нарушение на договора. Не забравяйте да знаете към кой двигател е свързан автомобилът и с коя политика за данни.

Захранване и изчистване на преводната памет

Стойността на TM е толкова, колкото и качеството на преводите в нея. Боклук вътре, боклук вън. Две дисциплини:

  1. Просто напишете заверения превод в TM. Ако запишете необработения MT изход в TM, без да го валидирате, той ще се върне към бъдещите ви задачи като лоша „памет“.
  2. Извършете поддръжка на TM. С времето термините се променят и навлизат грешки. Периодично почиствайте TM, коригирайте износени/неправилни чифтове. В тази работа използвам LLM, за да попитам "има ли някакви несъответствия/пристрастия към термините в тези двойки TM?" Можете да го използвате като одитор.
Внимание: Използването на TM на един клиент в бизнеса на друг клиент е едновременно нарушение на поверителността и риск от объркване на термините. TM се съхраняват отделно на база клиент/проект. Смесеното „всичко TM“ разрушава както поверителността, така и качеството.

три мини калъфа

Случай 1 — TM прелита на повторенията. Производител е имал превод на фамилия продукти, като 70% от неговото ръководство оставало същото година след година. Благодарение на TM, 100% и високо размити съвпадения идват автоматично във всяка нова версия; Само ~9 000 думи от произведението от 30 000 думи бяха действителен нов превод. Времето и разходите бяха намалени с една трета.

Случай 2 — Dirty TM разпространи грешката. Един екип беше запазил необработения MT изход в TM без проверка. Година по-късно същият грешен превод се връщаше отново и отново, изглеждайки „надежден“ като 100% съвпадение; Грешката беше разпространена в 14 различни документа. Екипът въведе правило за „само сертифициран превод на TM“ и обиколка за почистване.

Случай 3 — Поверителността е изтекла при интеграцията. Преводач извърши поверителна работа в CAT проект, който беше автоматично свързан с облачен MT; Текстът отиде до външен двигател, чиято политика за данни е неясна. Веднъж забелязана, MT интеграцията за секретни проекти беше изключена и бяха използвани само корпоративни двигатели, които „не съхраняват/обучават данни“.

Четири копируеми шаблона

1) Оценка на размито съвпадение (към LLM):

По-долу е новото изречение източник, подобно изречение в TM и одобреният му превод. Кажете ми какво точно трябва да променя, за да адаптирам TM превода към новото изречение; Не предлагайте ненужни промени. Покажете ясно разликата в значението. Нов източник: [...] | TM източник: [...] | TM превод: [...]

2) Проверка на последователността на TM:

По-долу са двойките източник-цел от TM. Маркирайте несъответствия и отклонения в термините, когато едни и същи или много сходни изречения източник са преведени ПО РАЗЛИЧЕН начин. Просто избройте проблемите. Двойки: [...]

3) Пренаписване на сегментен тон (LLM в CAT):

Направете следния целеви сегмент [желан тон] БЕЗ ПРОМЯНА на значението. Спазвайте списъка с термини: [...]. Запазете номера и имена. Експортирайте само пренаписания сегмент. Сегмент: [...]

4) Предварителна проверка за поверителност/интеграция:

Ще използвам MT/LLM интеграция в CAT проект. Ще опиша вида на текста в този проект; Кажете ми дали е уместно да изпратя този текст на облачно базирана външна машина, какви въпроси (запазване на данни, обучение, местоположение) трябва да задам на доставчика. Тип на текста/състояние на поверителност: [...]

Слаба подкана / Силна подкана

Слаб: „Използвайте превода в TM.“ (Не е ясно какъв процент на съвпадение и какво да се адаптира; сляпото копиране въвежда грешки.)

Силно: „Това ново изречение съвпада с изречението в TM в 90% от времето. Надграждайте превода на TM, но отразявайте тази разлика: източникът има „годишен“ вместо „месечен“, така че трябва да бъде „годишен“ вместо „месечен“. Не променяйте нищо друго.“

Разлика: силната подкана определя разликата в съвпадението; Предотвратява „оставянето на стария превод такъв, какъвто е“, което е най-често срещаната грешка при размито съвпадение.

Таблица на компонентите на CAT екосистемата

компонент

Какво прави

връзка с AI

TM (преводна памет)

Връща одобрени минали преводи

надежден; предшества МТ

Терминна база

Осигурява последователност на термините

Дава се като подкана към LLM

MT препоръка

Сурова скица в празен сегмент

Трябва да се редактира след това

LLM интеграция

Тон/термин/пренаписване

Контролиран, внимание към поверителността

QA модул

Сканира номер/термин/таг грешка

автоматично управление

Често срещани грешки

  • Сляпо приемане на размито съвпадение. 85% съвпадение може да скрие 15% разлика в значението.
  • Записване на необработен MT изход в TM. Dirty TM пренася грешката в бъдещето и я разпространява.
  • Смесване на TM на клиент/проект. Поверителност и риск от объркване на термините.
  • Без да се знае къде отиват интегрираните данни. Скритият текст може да изтече, без да знаете за това.
  • Забравяйки разликата TM/MT. MT е приблизителна оценка; TM е памет. Двете не са еднакво безопасни.

Предварителен превод и подравняване

Две усъвършенствани CAT функции допълнително ускоряват работния процес в ерата на AI. Първият е предварителен превод: в началото на проекта инструментът автоматично запълва всички сегменти с TM и MT; Вместо празен файл, започвате с файл, в който 100% съвпадения са одобрени, размитите съвпадения чакат да бъдат адаптирани, а празните са чернови на MT. Това променя работата от „писане от нулата“ на „преглед и редактиране“ — но трябва да оцените всеки сегмент, вместо да одобрявате сляпо предварителния превод.

Второто е подравняване: ако имате двойка документ източник-цель, който е бил преведен преди, но не е влязъл в TM, инструментът за подравняване ги съпоставя сегмент по сегмент и ги преобразува в TM. Така вашите минали преводи се добавят към „паметта“. Внимание при подравняване: автоматичното съвпадение не винаги е правилно; приплъзването на един сегмент нарушава цялото подравняване. Прегледът на подравнени двойки преди TMing предотвратява риска от мръсен TM на първо място. Тези две функции превръщат текущите ви активи (минали преводи) в инвестиции в бъдещи бизнеси.

В обобщение

CAT инструменти; Той съчетава преводаческа памет, терминологична база, машинен превод и LLM в една производствена линия. TM е памет, която извлича вашите одобрени минали преводи и осигурява голяма скорост при повтарящи се задачи; MT е прогноза, която винаги трябва да бъде проверена. Интелигентният потребител внимателно адаптира разликата в размитите съвпадения, записва само одобрени преводи в TM, поддържа отделно TM на клиентите и защитава поверителността, като знае къде отиват данните в интеграцията.

Задача за приложение

Настройте малък проект в CAT инструмент (безплатен онлайн CAT също работи): добавете терминологична база и празна TM. Преведете текст от 10 изречения, запазете одобрените преводи в TM. След това преведете втори текст, много подобен на първия текст, и адаптирайте размитите съвпадения, върнати от TM с шаблона "оценка на размито съвпадение"; Забележете колко изречения бихте направили грешка, ако сляпо приемете TM.

контролен списък

  • [ ] Свързах TM и терминологичната база към проекта.
  • [ ] Използвах разликата в размитите съвпадения адаптивно, а не сляпо.
  • [ ] Написах на TM само заверения превод, който проверих.
  • [ ] Запазих TM на клиента/проекта отделно.
  • [ ] Проверих къде отиват данните в интеграцията на MT/LLM.