Прибуток:
- Розуміння концепцій пам’яті перекладів (TM), нечітких збігів і сегментів, а також уміння використовувати відмінності в нечітких збігах шляхом їх адаптації, а не наосліп.
- Здатність застосовувати дисципліну написання лише затверджених перекладів до ТМ, зберігати ТМ клієнтів окремо та виконувати технічне обслуговування ТМ
- Можливість захисту конфіденційності, контролюючи, куди надсилаються дані в інтеграції MT/LLM у CAT
Професійний переклад найчастіше виконується в інструменті CAT, а не в текстовому редакторі. У цьому розділі ви дізнаєтесь про інструменти CAT, про пам’ять перекладів (TM) у центрі перекладу, про те, як вони працюють разом із машинним перекладом і LLM, а також про те, як ефективно та безпечно використовувати цю екосистему. Мета полягає в тому, щоб стати користувачем технологій перекладу, який керує цілим проектом, а не окремими реченнями, послідовно, швидко та з можливістю відстеження.
Основні поняття
Інструмент CAT (Computer-Assisted Translation) — це професійне програмне забезпечення (таке як Trados, memoQ, Phrase, MateCat), яке організовує речення перекладу за реченням (сегментом) і з’єднує пам’ять перекладів і базу термінів. Показує джерело та ціль поруч, ловить повтори, зберігає форматування.
TM (Translation Memory) — це база даних, у якій зберігаються пари речень «джерело-ціль», які ви раніше перекладали. Коли надходить нове речення, якщо подібне речення є в ТМ, агент пропонує вам його. Ключовим поняттям тут є нечітка відповідність: подібність нового речення до речення в ТМ (100% = абсолютно те саме, 85% = багато в чому схоже). Високі збіги прискорюють роботу, оскільки ви повторно використовуєте попередній переклад.
Сегмент — це основна одиниця перекладу — зазвичай це речення. Інструмент CAT ділить текст на сегменти та редагує кожен окремо.
Важливість TM: MT створює необроблені чернетки, але TM повертає ваші схвалені попередні переклади людської якості. Вони відрізняються: MT – це передбачення, TM – це пам’ять.
Порада: не плутайте TM і MT. 100% збіг TM (ваш попередньо схвалений переклад) зазвичай надійний; Рекомендацію MT слід завжди перевіряти. Інструменти CAT показують два різними кольорами/мітками; завжди бачу цю різницю.
Інтеграція MT і LLM в CAT
Сучасні інструменти CAT внутрішньо викликають механізми МТ і дедалі частіше LLM: якщо в ТМ немає відповідності, агент автоматично повертає рекомендацію МТ для сегмента; ви його редагуєте (тобто потоки MTPE в CAT). Інструменти останнього покоління також інтегрують LLM: ви можете виконувати такі операції, як «переписати цей сегмент із цим тоном», «виправити цей термін на базу термінів» тощо в інструменті.
Перевага цієї інтеграції: TM, термінологічна база, MT і LLM об’єднані в одному екрані; Для кожного речення встановлюється потік «спочатку перегляньте TM, інакше запропонуйте MT, термін QA автоматично». Мінус і обережність: куди йдуть дані? Хмарна інтеграція MT/LLM може надсилати текст на зовнішні сервери; У конфіденційній роботі це може бути порушенням контракту. Обов’язково знайте, до якого двигуна під’єднано транспортний засіб і з якою політикою даних.
Підживлення та очищення пам’яті перекладів
Цінність ТМ така ж, як і якість перекладів у ній. Сміття входить, сміття виходить. Дві дисципліни:
- Просто напишіть завірений переклад до ТМ. Якщо ви збережете необроблений вихід MT до TM без перевірки, він повернеться до ваших майбутніх завдань як погана «пам’ять».
- Виконайте технічне обслуговування ТМ. З часом терміни змінюються і з’являються помилки. Періодично очищайте TM, виправляйте зношені/невідповідні пари. У цій роботі я використовую LLM, щоб запитати "чи є якісь невідповідності/упередженість термінів у цих парах TM?" Ви можете використовувати його як аудитора.
Застереження: використання ТМ одного клієнта в бізнесі іншого клієнта є одночасно порушенням конфіденційності та ризиком плутанини з термінами. ТМ зберігаються окремо за клієнтом/проектом. Змішане «все ТМ» руйнує і конфіденційність, і якість.
три міні-чохла
Випадок 1 — ТМ вилетів на повтори. Виробник переклав сімейство продуктів, де 70% посібника з року в рік залишалися незмінними. Завдяки ТМ 100% і висока нечіткість збігів з’являлися автоматично в кожній новій версії; Лише ~9 000 слів із 30 000 слів були справжнім новим перекладом. Час і вартість скоротилися на третину.
Випадок 2 — Dirty TM поширила помилку. Одна команда зберегла необроблений вихід MT у TM без перевірки. Через рік той самий неправильний переклад повторювався знову і знову, виглядаючи «надійним» як 100% збіг; Помилка була поширена в 14 різних документах. Команда запровадила правило «тільки сертифікований переклад на ТМ» і тур з очищення.
Випадок 3 — Витік конфіденційності під час інтеграції. Перекладач виконував конфіденційну роботу в проекті CAT, який автоматично підключався до хмарного МП; Текст надійшов до зовнішнього механізму, політика даних якого незрозуміла. Одного разу було помічено, що інтеграція МТ для секретних проектів була вимкнена, і використовувалися лише корпоративні механізми, які «не зберігають/навчають дані».
Чотири шаблони, які можна копіювати
1) Оцінка нечіткої відповідності (до LLM):
Нижче наведено нове вихідне речення, подібне речення в TM та його затверджений переклад. Скажіть мені, що саме мені потрібно змінити, щоб адаптувати переклад ТМ до нового речення; Не пропонуйте непотрібних змін. Чітко покажіть різницю в значенні. Нове джерело: [...] | Джерело TM: [...] | Переклад ТМ: [...]
2) Перевірка узгодженості ТМ:
Нижче наведено пари джерело-ціль від TM. Позначте неузгодженості та відхилення термінів, якщо однакові або дуже схожі вихідні речення перекладаються ПО-ІНШОМУ. Просто перелічіть проблеми. Пари: [...]
3) Перезапис сегментного тону (LLM в CAT):
Зробіть наступний цільовий сегмент [бажаний тон] БЕЗ ЗМІНИ значення. Дотримуватися переліку термінів: [...]. Зберігайте номери та імена. Експортуйте лише переписаний сегмент. Сегмент: [...]
4) Попередня перевірка конфіденційності/інтеграції:
Я буду використовувати інтеграцію MT/LLM у проект CAT. Я опишу тип тексту в цьому проекті; Скажіть мені, чи доцільно надсилати цей текст на хмарний зовнішній механізм, які питання (збереження даних, навчання, місцезнаходження) я маю поставити постачальнику. Тип тексту/статус конфіденційності: [...]
Слабка підказка / Сильна підказка
Слабко: «Використовуйте переклад у ТМ». (Незрозуміло, який коефіцієнт відповідності та що адаптувати; сліпе копіювання створює помилки.)
Сильно: «Це нове речення збігається з реченням у TM у 90% випадків. Спирайтеся на переклад TM, але врахуйте цю різницю: джерело має «щорічне» замість «щомісячне», тому має бути «щорічне» замість «щомісячне». Більше нічого не змінюйте».
Відмінність: сильна підказка точно визначає різницю збігу; Це запобігає «залишенню старого перекладу як є», що є найпоширенішою помилкою нечіткого зіставлення.
Таблиця компонентів екосистеми CAT
компонент
Що робить
відносини з ШІ
TM (пам'ять перекладів)
Повертає схвалені попередні переклади
Надійний; передує МТ
Термінова база
Забезпечує постійність термінів
Це надається як підказка для LLM
Рекомендація МТ
Необроблений ескіз у порожній сегмент
Має бути відредаговано
LLM інтеграція
Тон/термін/рерайт
Контрольований, увага до конфіденційності
QA модуль
Помилка сканування номера/терміну/тегу
автоматичний контроль
Поширені помилки
- Сліпо приймаючи нечіткий збіг. Збіг на 85% може приховати різницю в значенні на 15%.
- Запис необробленого виводу MT до TM. Dirty TM переносить помилку в майбутнє та поширює її.
- Змішування ТМ клієнта/проекту. Конфіденційність і ризик плутанини в термінах.
- Не знаючи, куди йдуть дані інтеграції. Прихований текст може витікати без вашого відома.
- Забувши про різницю TM/MT. MT – оцінка; ТМ - це пам'ять. Обидва вони не однаково безпечні.
Попередній переклад і узгодження
Дві передові функції CAT ще більше прискорюють робочий процес в епоху ШІ. Перший — попередній переклад: на початку проекту інструмент автоматично заповнює всі сегменти TM і MT; Замість порожнього файлу ви починаєте з файлу, де 100% збігів схвалено, нечіткі збіги чекають на адаптацію, а порожні є чернетками МТ. Це змінює роботу з «написання з нуля» на «рецензування та редагування», але вам потрібно оцінити кожен сегмент, а не сліпо схвалювати попередній переклад.
По-друге, це вирівнювання: якщо у вас є пара вихідний-цільовий документ, який був перекладений раніше, але не увійшов до TM, інструмент вирівнювання порівнює їх сегмент за сегментом і перетворює їх у TM. Таким чином, ваші минулі переклади додаються в «пам'ять». Обережно при вирівнюванні: автоматичне зіставлення не завжди є правильним; прослизання одного сегмента порушує все вирівнювання. Перегляд вирівняних пар перед TMing запобігає ризику забруднення TM. Ці дві функції перетворюють ваші поточні активи (попередні переклади) на інвестиції в майбутній бізнес.
Підсумовуючи
інструменти CAT; Він об’єднує пам’ять перекладів, термінологічну базу, машинний переклад і LLM в одну виробничу лінію. TM — це пам’ять, яка отримує ваші схвалені минулі переклади та забезпечує велику швидкість у повторюваних завданнях; МТ – це прогноз, який завжди потрібно перевіряти. Кмітливий користувач ретельно адаптує різницю в нечітких збігах, записує лише затверджені переклади в TM, зберігає TM клієнтів окремо та захищає конфіденційність, знаючи, куди йдуть дані в інтеграції.
Аплікаційне завдання
Налаштуйте невеликий проект у інструменті CAT (безкоштовний онлайн CAT також працює): додайте базу термінів і порожню ТМ. Перекладіть текст з 10 речень, збережіть затверджені переклади в TM. Потім перекладіть другий текст, дуже схожий на перший текст, і адаптуйте нечіткі збіги, які повертає TM, за допомогою шаблону «оцінка нечіткого збігу»; Зверніть увагу, скільки речень ви зробили б помилку, якби сліпо прийняли TM.
контрольний список
- [ ] Я підключив ТМ і термінологічну базу до проекту.
- [ ] Я використовував різницю в нечітких збігах адаптивно, а не наосліп.
- [ ] Я написав до ТМ лише завірений переклад, який перевірив.
- [ ] Я зберіг TM клієнта/проекту окремо.
- [ ] Я перевірив, куди йдуть дані в інтеграції MT/LLM.