Прибыль:
- Понимание концепций памяти переводов (TM), нечетких совпадений и сегментов, а также умение использовать различия в нечетких совпадениях путем их адаптации, а не вслепую.
- Способность применять дисциплину написания только утвержденных переводов для TM, разделения TM клиентов и выполнения обслуживания TM.
- Возможность защитить конфиденциальность, контролируя, куда передаются данные при интеграции MT/LLM с CAT.
Профессиональный перевод чаще всего выполняется с помощью CAT-инструмента, а не в текстовом редакторе. В этом модуле вы изучите инструменты CAT, память переводов (TM), лежащую в основе перевода, как они работают вместе с машинным переводом и LLM, а также как эффективно и безопасно использовать эту экосистему. Цель — стать пользователем технологии перевода, который будет управлять всем проектом, а не отдельными предложениями, последовательно, быстро и отслеживаемо.
Основные понятия
Инструмент CAT (компьютерный перевод) — это профессиональное программное обеспечение (например, Trados, memoQ, Phrase, MateCat), которое организует перевод предложение за предложением (сегментом) и соединяет память переводов и терминологическую базу. Показывает источник и цель рядом, улавливает повторы, сохраняет форматирование.
TM (Память переводов) — это база данных, в которой хранятся пары предложений «исходный-целевой», которые вы ранее перевели. При поступлении нового предложения, если в ТМ есть подобное предложение, агент предлагает его вам. Ключевым понятием здесь является нечеткое совпадение: сходство нового предложения с предложением в TM (100% = точно такое же, 85% = во многом похожее). Высокие совпадения ускоряют работу, поскольку вы повторно используете предыдущий перевод.
Сегмент — это основная единица перевода, обычно это предложение. Инструмент CAT делит текст на сегменты и редактирует каждый отдельно.
Важность TM: MT создает черновики, но TM возвращает ваши утвержденные прошлые переводы человеческого качества. Они разные: МТ — предсказание, ТМ — память.
Совет: Не путайте ТМ и МТ. 100% совпадение TM (вашего ранее одобренного перевода) обычно является надежным; Рекомендации MT всегда следует проверять. Инструменты CAT показывают их разными цветами/метками; всегда видеть эту разницу.
Интеграция MT и LLM в CAT
Современные CAT-инструменты вызывают механизмы MT и все чаще LLM внутри себя: если совпадений в TM нет, агент автоматически возвращает рекомендацию MT для сегмента; вы его постредактируете (т. е. потоки MTPE в CAT). Инструменты последнего поколения также интегрируют LLM: в инструменте вы можете выполнять такие операции, как «переписать этот сегмент этим тоном», «исправить этот термин в терминологическую базу» и т. д.
Преимущество такой интеграции: TM, терминологическая база, MT и LLM объединены на одном экране; Для каждого предложения устанавливается поток «сначала просмотрите TM, в противном случае предложите MT, термин QA автоматически». Недостаток и осторожность: куда идут данные? Облачная интеграция MT/LLM позволяет отправлять текст на внешние серверы; В конфиденциальной работе это может быть нарушением договора. Обязательно узнайте, к какому двигателю подключен автомобиль и с какой политикой данных.
Загрузка и очистка памяти переводов
Ценность ТМ равна качеству переводов в ней. Мусор на входе, мусор на выходе. Две дисциплины:
- Просто напишите заверенный перевод в TM. Если вы сохраните необработанный вывод MT в TM без его проверки, он вернется в ваши будущие задания как плохая «память».
- Выполните обслуживание ТМ. Со временем термины меняются и появляются ошибки. Периодически очищайте ТМ, исправляйте изношенные/неправильные пары. В этой работе я использую LLM, чтобы задать вопрос: «Есть ли какие-либо несоответствия/предвзятость терминов в этих парах ТМ?» Вы можете использовать его в качестве одитора.
Внимание: использование ТМ одного клиента в бизнесе другого клиента является одновременно нарушением конфиденциальности и риском путаницы в терминах. TM хранятся отдельно для каждого клиента/проекта. Смешанное «все ТМ» разрушает и конфиденциальность, и качество.
три мини-кейса
Случай 1 — ТМ запустил повторы. Производитель перевел семейство продуктов, при этом 70% руководства оставалось неизменным из года в год. Благодаря ТМ 100% совпадения и совпадения с высокой степенью нечеткости появлялись автоматически в каждой новой версии; Только около 9 000 слов из 30 000 слов были настоящим новым переводом. Время и стоимость были сокращены на треть.
Случай 2 — Dirty TM распространила ошибку. Одна команда сохранила необработанные результаты MT в TM без проверки. Год спустя тот же неправильный перевод повторялся снова и снова, выглядя «надежным» как 100% совпадение; Ошибка распространилась на 14 различных документов. Команда ввела правило «только заверенный перевод на ТМ» и провела очистку.
Случай 3. Утечка конфиденциальной информации при интеграции. Переводчик выполнял конфиденциальную работу в CAT-проекте, который автоматически подключался к облаку MT; Текст был отправлен на внешний движок, политика данных которого неясна. Как только заметили, интеграция MT для секретных проектов была отключена и использовались только корпоративные механизмы, которые «не хранят/обучают данные».
Четыре копируемых шаблона
1) Оценка нечеткого соответствия (для LLM):
Ниже приведено новое исходное предложение, аналогичное предложение в ТМ и его утвержденный перевод. Скажите мне, что именно мне нужно изменить, чтобы адаптировать перевод ТМ к новому предложению; Не предлагайте ненужных изменений. Четко покажите разницу в значении. Новый источник: [...] | Источник ТМ: [...] | ТМ перевод: [...]
2) Проверка целостности ТМ:
Ниже приведены пары источник-цель из TM. Отметьте несоответствия и отклонения в терминах, когда одни и те же или очень похожие исходные предложения переводятся ПО-РАЗНОМУ. Просто перечислите проблемы. Пары: [...]
3) Перезапись сегментного тона (LLM в CAT):
Сделайте следующий целевой сегмент [желаемый тон] БЕЗ ИЗМЕНЕНИЯ смысла. Соблюдайте перечень условий: [...]. Сохраняйте номера и имена. Экспортируйте только переписанный сегмент. Сегмент: [...]
4) Предварительная проверка конфиденциальности/интеграции:
Я буду использовать интеграцию MT/LLM в CAT-проекте. Я опишу тип текста в этом проекте; Скажите, уместно ли отправлять этот текст во внешний облачный движок, какие вопросы (сохранение данных, обучение, местоположение) мне следует задать провайдеру. Тип текста/статус конфиденциальности: [...]
Слабая подсказка / Сильная подсказка
Слабое: «Используйте перевод в ТМ». (Непонятно, какой коэффициент соответствия и что адаптировать; слепое копирование вносит ошибки.)
Сильный: «Это новое предложение соответствует предложению в TM в 90% случаев. Воспользуйтесь переводом TM, но отразите эту разницу: в источнике указано «ежегодно», а не «ежемесячно», поэтому должно быть «ежегодно», а не «ежемесячно». Больше ничего не меняйте».
Разница: сильная подсказка указывает на разницу в совпадении; Это предотвращает «оставление старого перевода как есть», что является наиболее распространенной ошибкой нечеткого сопоставления.
Таблица компонентов экосистемы CAT
компонент
Что значит
отношения с ИИ
ТМ (память переводов)
Возвращает одобренные прошлые переводы
Надежный; предшествует MT
Терминологическая база
Обеспечивает согласованность сроков
Это дается в качестве подсказки для LLM.
рекомендация МТ
Необработанный эскиз в пустой сегмент
Должно быть отредактировано
LLM-интеграция
Тон/термин/переписывание
Контролируемость, внимание к конфиденциальности
Модуль контроля качества
Ошибка номера/термина/тега сканов
автоматическое управление
Распространенные ошибки
- Слепо принимая нечеткое совпадение. Совпадение на 85 % может скрыть разницу в значении на 15 %.
- Запись необработанного вывода MT в TM. Грязная ТМ переносит ошибку в будущее и распространяет ее.
- Смешение TM клиента/проекта. Конфиденциальность и риск путаницы в терминах.
- Неизвестно, куда идут данные интеграции. Скрытый текст может просочиться без вашего ведома.
- Забывая о разнице TM/MT. MT – оценка; ТМ – это память. Оба не одинаково безопасны.
Предварительный перевод и выравнивание
Две расширенные функции CAT еще больше ускоряют рабочий процесс в эпоху искусственного интеллекта. Первый — предварительный перевод: в начале проекта инструмент автоматически заполняет все сегменты TM и MT; Вместо пустого файла вы начинаете с файла, в котором 100% совпадений одобрены, нечеткие совпадения ожидают адаптации, а пустые — это черновики MT. Это меняет работу с «написания с нуля» на «редактирование и рецензирование», но вам нужно оценивать каждый сегмент, а не слепо одобрять предварительный перевод.
Второй — выравнивание: если у вас есть пара исходных и целевых документов, которая была переведена ранее, но еще не вошла в НП, инструмент выравнивания сопоставляет их сегмент за сегментом и преобразует в НП. Таким образом, ваши прошлые переводы добавляются в «память». Внимание при выравнивании: автоматическое сопоставление не всегда корректно; проскальзывание одного сегмента нарушает всю центровку. Просмотр согласованных пар перед ТМ в первую очередь предотвращает риск грязного ТМ. Эти две функции превращают ваши текущие активы (прошлые переводы) в инвестиции в будущий бизнес.
В заключение
CAT-инструменты; Он объединяет память переводов, терминологическую базу, машинный перевод и LLM в единую производственную линию. TM — это память, которая сохраняет одобренные вами прошлые переводы и обеспечивает высокую скорость выполнения повторяющихся задач; МТ — это прогноз, который всегда необходимо проверять. Опытный пользователь тщательно адаптирует разницу в нечетких совпадениях, записывает в TM только одобренные переводы, хранит TM клиентов отдельно и защищает конфиденциальность, зная, куда идут данные при интеграции.
Задача приложения
Настройте небольшой проект в CAT-инструменте (бесплатный онлайн-CAT также подойдет): добавьте терминологическую базу и пустой TM. Переведите текст из 10 предложений и сохраните утвержденные переводы в TM. Затем переведите второй текст, очень похожий на первый текст, и адаптируйте нечеткие совпадения, возвращаемые TM, с помощью шаблона «оценка нечеткого совпадения»; Обратите внимание, в скольких предложениях вы допустили бы ошибку, если бы слепо приняли ТМ.
контрольный список
- [ ] Я подключил к проекту ТМ и терминологическую базу.
- [ ] Я использовал разницу в нечетких совпадениях адаптивно, а не вслепую.
- [ ] Я отправил TM только заверенный перевод, который я проверил.
- [ ] Я держал TM клиента/проекта отдельно.
- [ ] Я проверил, куда идут данные при интеграции MT/LLM.