Печалби:
- Разбиране на концепциите за преводна памет (TM), размити съвпадения и сегменти и способност за използване на разликите в размитите съвпадения чрез адаптирането им, а не сляпо.
- Способност за прилагане на дисциплината за писане само на одобрени преводи в TM, поддържане на отделни TM на клиентите и извършване на поддръжка на TM
- Възможност за защита на поверителността чрез контролиране къде отиват данните в интеграцията на MT/LLM в CAT
Професионалният превод най-често се извършва в CAT инструмент, а не в редактор на обикновен текст. В този модул ще научите CAT инструментите, преводаческата памет (TM) в основата на превода, как работят заедно с машинния превод и LLM и как да използвате тази екосистема ефективно и безопасно. Целта е да станете потребител на технологии за превод, който управлява цял проект, а не отделни изречения, по последователен, бърз и проследим начин.
Основни понятия
Инструментът CAT (компютърно-подпомогнат превод) е професионален софтуер (като Trados, memoQ, Phrase, MateCat), който организира изречение за превод по изречение (сегмент) и свързва преводаческата памет и терминологичната база. Показва източника и целта един до друг, улавя повторения, запазва форматирането.
TM (Преводна памет) е база данни, която съхранява двойките изречения източник-цель, които сте превели преди това. Когато пристигне ново изречение, ако има подобно изречение в TM, агентът ви го предлага. Ключовата концепция тук е размито съвпадение: сходството на новото изречение с изречение в TM (100% = точно същото, 85% = до голяма степен подобно). Високите съвпадения ускоряват работата, защото използвате повторно предишния си превод.
Сегментът е основната единица за превод - обикновено изречение. Инструментът CAT разделя текста на сегменти и редактира всеки отделно.
Значение на TM: MT създава необработени чернови, но TM връща вашите одобрени предишни преводи с човешко качество. Двете са различни: MT е предсказание, TM е памет.
Съвет: Не бъркайте TM и MT. 100% съвпадение на TM (вашият предварително одобрен превод) обикновено е надеждно; Препоръката на MT винаги трябва да се проверява. CAT инструментите показват двете с различни цветове/етикети; винаги виждайте тази разлика.
Интегриране на MT и LLM в CAT
Съвременните CAT инструменти извикват MT машини и все повече LLM вътрешно: ако няма съвпадение в TM, агентът автоматично връща MT препоръка за сегмента; вие го редактирате след това (т.е. MTPE потоци в CAT). Инструментите от най-ново поколение също интегрират LLM: можете да извършвате операции като „пренапишете този сегмент с този тон“, „коригирайте този термин към терминологична база“ и т.н. в инструмента.
Предимство на тази интеграция: TM, termbase, MT и LLM са комбинирани в един екран; За всяко изречение се установява потокът „първо вижте TM, в противен случай предложете MT, термин QA автоматично“. Недостатък и внимание: къде отиват данните? Базираната в облак MT/LLM интеграция може да изпраща текст към външни сървъри; При поверителна работа това може да е нарушение на договора. Не забравяйте да знаете към кой двигател е свързан автомобилът и с коя политика за данни.
Захранване и изчистване на преводната памет
Стойността на TM е толкова, колкото и качеството на преводите в нея. Боклук вътре, боклук вън. Две дисциплини:
- Просто напишете заверения превод в TM. Ако запишете необработения MT изход в TM, без да го валидирате, той ще се върне към бъдещите ви задачи като лоша „памет“.
- Извършете поддръжка на TM. С времето термините се променят и навлизат грешки. Периодично почиствайте TM, коригирайте износени/неправилни чифтове. В тази работа използвам LLM, за да попитам "има ли някакви несъответствия/пристрастия към термините в тези двойки TM?" Можете да го използвате като одитор.
Внимание: Използването на TM на един клиент в бизнеса на друг клиент е едновременно нарушение на поверителността и риск от объркване на термините. TM се съхраняват отделно на база клиент/проект. Смесеното „всичко TM“ разрушава както поверителността, така и качеството.
три мини калъфа
Случай 1 — TM прелита на повторенията. Производител е имал превод на фамилия продукти, като 70% от неговото ръководство оставало същото година след година. Благодарение на TM, 100% и високо размити съвпадения идват автоматично във всяка нова версия; Само ~9 000 думи от произведението от 30 000 думи бяха действителен нов превод. Времето и разходите бяха намалени с една трета.
Случай 2 — Dirty TM разпространи грешката. Един екип беше запазил необработения MT изход в TM без проверка. Година по-късно същият грешен превод се връщаше отново и отново, изглеждайки „надежден“ като 100% съвпадение; Грешката беше разпространена в 14 различни документа. Екипът въведе правило за „само сертифициран превод на TM“ и обиколка за почистване.
Случай 3 — Поверителността е изтекла при интеграцията. Преводач извърши поверителна работа в CAT проект, който беше автоматично свързан с облачен MT; Текстът отиде до външен двигател, чиято политика за данни е неясна. Веднъж забелязана, MT интеграцията за секретни проекти беше изключена и бяха използвани само корпоративни двигатели, които „не съхраняват/обучават данни“.
Четири копируеми шаблона
1) Оценка на размито съвпадение (към LLM):
По-долу е новото изречение източник, подобно изречение в TM и одобреният му превод. Кажете ми какво точно трябва да променя, за да адаптирам TM превода към новото изречение; Не предлагайте ненужни промени. Покажете ясно разликата в значението. Нов източник: [...] | TM източник: [...] | TM превод: [...]
2) Проверка на последователността на TM:
По-долу са двойките източник-цел от TM. Маркирайте несъответствия и отклонения в термините, когато едни и същи или много сходни изречения източник са преведени ПО РАЗЛИЧЕН начин. Просто избройте проблемите. Двойки: [...]
3) Пренаписване на сегментен тон (LLM в CAT):
Направете следния целеви сегмент [желан тон] БЕЗ ПРОМЯНА на значението. Спазвайте списъка с термини: [...]. Запазете номера и имена. Експортирайте само пренаписания сегмент. Сегмент: [...]
4) Предварителна проверка за поверителност/интеграция:
Ще използвам MT/LLM интеграция в CAT проект. Ще опиша вида на текста в този проект; Кажете ми дали е уместно да изпратя този текст на облачно базирана външна машина, какви въпроси (запазване на данни, обучение, местоположение) трябва да задам на доставчика. Тип на текста/състояние на поверителност: [...]
Слаба подкана / Силна подкана
Слаб: „Използвайте превода в TM.“ (Не е ясно какъв процент на съвпадение и какво да се адаптира; сляпото копиране въвежда грешки.)
Силно: „Това ново изречение съвпада с изречението в TM в 90% от времето. Надграждайте превода на TM, но отразявайте тази разлика: източникът има „годишен“ вместо „месечен“, така че трябва да бъде „годишен“ вместо „месечен“. Не променяйте нищо друго.“
Разлика: силната подкана определя разликата в съвпадението; Предотвратява „оставянето на стария превод такъв, какъвто е“, което е най-често срещаната грешка при размито съвпадение.
Таблица на компонентите на CAT екосистемата
компонент
Какво прави
връзка с AI
TM (преводна памет)
Връща одобрени минали преводи
надежден; предшества МТ
Терминна база
Осигурява последователност на термините
Дава се като подкана към LLM
MT препоръка
Сурова скица в празен сегмент
Трябва да се редактира след това
LLM интеграция
Тон/термин/пренаписване
Контролиран, внимание към поверителността
QA модул
Сканира номер/термин/таг грешка
автоматично управление
Често срещани грешки
- Сляпо приемане на размито съвпадение. 85% съвпадение може да скрие 15% разлика в значението.
- Записване на необработен MT изход в TM. Dirty TM пренася грешката в бъдещето и я разпространява.
- Смесване на TM на клиент/проект. Поверителност и риск от объркване на термините.
- Без да се знае къде отиват интегрираните данни. Скритият текст може да изтече, без да знаете за това.
- Забравяйки разликата TM/MT. MT е приблизителна оценка; TM е памет. Двете не са еднакво безопасни.
Предварителен превод и подравняване
Две усъвършенствани CAT функции допълнително ускоряват работния процес в ерата на AI. Първият е предварителен превод: в началото на проекта инструментът автоматично запълва всички сегменти с TM и MT; Вместо празен файл, започвате с файл, в който 100% съвпадения са одобрени, размитите съвпадения чакат да бъдат адаптирани, а празните са чернови на MT. Това променя работата от „писане от нулата“ на „преглед и редактиране“ — но трябва да оцените всеки сегмент, вместо да одобрявате сляпо предварителния превод.
Второто е подравняване: ако имате двойка документ източник-цель, който е бил преведен преди, но не е влязъл в TM, инструментът за подравняване ги съпоставя сегмент по сегмент и ги преобразува в TM. Така вашите минали преводи се добавят към „паметта“. Внимание при подравняване: автоматичното съвпадение не винаги е правилно; приплъзването на един сегмент нарушава цялото подравняване. Прегледът на подравнени двойки преди TMing предотвратява риска от мръсен TM на първо място. Тези две функции превръщат текущите ви активи (минали преводи) в инвестиции в бъдещи бизнеси.
В обобщение
CAT инструменти; Той съчетава преводаческа памет, терминологична база, машинен превод и LLM в една производствена линия. TM е памет, която извлича вашите одобрени минали преводи и осигурява голяма скорост при повтарящи се задачи; MT е прогноза, която винаги трябва да бъде проверена. Интелигентният потребител внимателно адаптира разликата в размитите съвпадения, записва само одобрени преводи в TM, поддържа отделно TM на клиентите и защитава поверителността, като знае къде отиват данните в интеграцията.
Задача за приложение
Настройте малък проект в CAT инструмент (безплатен онлайн CAT също работи): добавете терминологична база и празна TM. Преведете текст от 10 изречения, запазете одобрените преводи в TM. След това преведете втори текст, много подобен на първия текст, и адаптирайте размитите съвпадения, върнати от TM с шаблона "оценка на размито съвпадение"; Забележете колко изречения бихте направили грешка, ако сляпо приемете TM.
контролен списък
- [ ] Свързах TM и терминологичната база към проекта.
- [ ] Използвах разликата в размитите съвпадения адаптивно, а не сляпо.
- [ ] Написах на TM само заверения превод, който проверих.
- [ ] Запазих TM на клиента/проекта отделно.
- [ ] Проверих къде отиват данните в интеграцията на MT/LLM.