Единицы
1. Введение в искусственный интеллект в письменном и устном переводе: роли, границы, аутентификация, конфиденциальность и этика 2. Основы машинного перевода: NMT, LLM, выбор механизма и предварительная оценка 3. Постредактирование машинного перевода (MTPE): упрощенное и полное постредактирование 4. Управление терминологией и терминологической базой: согласованность и корпоративный язык 5. Интеграция искусственного интеллекта с CAT-инструментами и памятью переводов (TM) 6. Локализация (L10n): программное обеспечение, Интернет, игры и культурная адаптация 7. Субтитры, дубляж и аудиовизуальный перевод 8. Контроль качества (QA), метрики оценки и LQA 9. Подготовка к устному переводу: последовательный и синхронный перевод 10. Контекст, культура, тон и творческий перевод (транскреация) 11. Конфиденциальность, этика, авторское право, подлинность и будущее профессии
Единица 2 / 11

Основы машинного перевода: NMT, LLM, выбор механизма и предварительная оценка

Прибыль:

  • Умение различать сильные и слабые стороны перевода на основе NMT и LLM и выбирать правильный механизм в соответствии с типом бизнеса.
  • Возможность предварительно классифицировать пригодность текста для машины и предварительно оценить его по реалистичному времени и цене.
  • Возможность быстро измерить качество исходной продукции машины в пяти измерениях и отметить риски, не путая плавность и точность.

Самый мощный ускоритель, который есть у вас как переводчика, — это машинный перевод (МП), но сознательное использование инструмента означает его применение к нужной работе, в правильной языковой паре и с правильными ожиданиями. В этом модуле вы познакомитесь с двумя основными семействами машинного перевода (переводы на основе NMT и LLM), узнаете, какое из них лучше подходит для какой задачи, как быстро измерить исходное качество перевода перед его отправкой и как выбрать механизм в соответствии с заданием. Цель — отойти от идеи «все равно вставить-перевести» и стать экспертом, способным предвидеть, какой текст подойдет машине, а какой требует трудоемкого человеческого труда.

Два семейства: перевод на основе NMT и LLM.

NMT (нейронный машинный перевод) — это системы, которые обучаются на миллионах двуязычных предложений и переводят предложение целиком; Google Translate, DeepL, Microsoft Translator — примеры таких сервисов. Сильные стороны: очень быстро, последовательно, свободно говорит короткими предложениями. Слабость: часто не видит контекста за пределами предложения (имеется в виду весь текст); Посмотрев на этот абзац, может быть трудно решить, означает ли слово «банк» берег или берег реки, и оно не соответствует приведенному списку терминов.

Перевод на основе LLM (большая языковая модель) — это использование для перевода моделей, управляемых инструкциями, таких как ChatGPT, Claude, Gemini. Сильные стороны: принимает инструкции — понимает такие инструкции, как «используйте формальный тон», «следуйте этому списку терминов», «целевая аудитория — дети»; видит более широкий контекст; лучше передает идиому и тон. Слабость: иногда может быть «слишком креативным» и добавлять к источнику (риск возникновения галлюцинаций), теряет связность в длинных текстах, а стоимость/скорость варьируются в зависимости от задания.

Эмпирическое правило: в прямых, повторяющихся технических текстах NMT обычно работает быстро и адекватно; LLM более гибок в работе с текстами, требующими дисциплины в тоне, контексте, словарном запасе и инструкциях. Большинство профессионалов сегодня используют оба вместе: быстрый черновик из NMT, коррекцию тона/терминов из LLM.

Совет: Качество машины языковой пары (например, турецкий→английский) может отличаться в противоположном направлении (английский→турецкий). Языки с агглютинативным, гибким синтаксисом, такие как турецкий, как правило, более сложны для машинного перевода. Судите сами, какой движок лучше в вашей паре, по нескольким примерам текстов.

Машинная совместимость текста: спросите об этом в первую очередь

Не каждый текст одинаково подходит для машины. Прежде чем приступить к переводу, пропустите текст через фильтр «пригодности»:

  • Хорошо подходит для машины: техническое руководство, описание продукта, повторяющийся текст интерфейса, стандартная переписка, таблица/список. Язык простой, терминология фиксированная, креативности мало.
  • Подходящий носитель: новости, корпоративный контент, образовательные материалы. Машина создает хорошие контуры, но требует серьезной последующей обработки тона и плавности.
  • Не подходит для машины (высокий риск): юридический договор, медицинский текст, реклама/слоган, литературный текст, юмор, поэзия. Здесь машина только дает идеи; Работа в основном ложится на плечи людей.

Если вы сделаете это различие с самого начала, вы не только предоставите клиенту правильное время/цену, но и защитите себя от слепого доверия необработанным результатам.

Быстрое измерение качества исходных результатов

Когда вы видите результат MT, вы задаетесь вопросом: «хорошо это или плохо?» Ответьте на вопрос, используя быстрый контрольный список, а не интуицию. Посмотрите на эти пять измерений: точность (соответствует ли смысл первоисточнику?), полнота (предложение опущено или добавлено?), терминология (правильно ли оно и последовательно?), беглость (естественно ли оно на целевом языке?), формат (сохранены ли теги, числа, форматирование?). Мы углубим эти измерения в следующем блоке качества; А пока пусть это будет вашим предродовым рефлексом.

Внимание: наиболее опасными ошибками вывода МТ являются «беглые, но неправильные». Предложение может быть написано на идеальном турецком языке, но «скидка 15%» в источнике могла быть изменена на «скидка 50%». Пусть вас не смущает беглость речи; Всегда смотрите на число, отрицательное и собственное существительное отдельно.

три мини-кейса

Случай 1 — Правильный двигатель сократил время вдвое. Один переводчик решил перевести программный интерфейс NMT объемом 12 000 слов и маркетинговый буклет такого же объема с помощью LLM. Согласованность интерфейса NMT ускорила работу; Тональная гибкость LLM в буклете снизила нагрузку на переписывание на 40%. Передача обеих задач одному и тому же движку будет пустой тратой времени.

Случай 2 — Предварительная оценка позволила сохранить цену. Офис собирался предложить юридический текст, потому что «его можно изготовить на машинах, и это будет дешево». В ходе предварительной оценки был переведен образец объемом 500 слов; Машина вернула два юридических термина с неверным системным эквивалентом. Офис оценил работу как «тяжелый постредактирование» и установил реалистичные сроки; Он избежал потери денег из-за неправильного предложения.

Случай 3 — Разница в языковых парах. Команда считала, что движок, который отлично работает на английском→немецком языке, будет такого же качества и на турецком→арабском языке. Тест на 300 слов показал, что вывод на арабском языке требует гораздо большей коррекции. Команда выделила разные движки и разные бюджеты на постредактирование в зависимости от языковой пары.

Четыре копируемых шаблона

1) Оценка соответствия текста:

Ваша должность: старший специалист по МТПЭ. Оцените следующий текст на предмет его пригодности для машинного перевода: буквальный/технический или творческий/контекстный? Классифицируйте его как (1) очень удобный для машин, (2) средний, (3) высокий риск и напишите свое обоснование. Оцените ожидаемую нагрузку после редактирования как легкую/среднюю/тяжелую. Пример текста: [вставьте 200–300 слов]

2) Инструктированный перевод LLM (с терминологией и контролем тональности):

Переведите этот текст [источник]→[цель].Аудитория: [кто]. Тон: [напр. официальный]. Поле: [например. финансы].Список терминов (обязательно использовать): [А→а, Б→б].Правила: не добавлять того, чего нет в источнике, сохранять цифры/даты/названия, заменять каждое предложение предложением. Отметьте, где вы не уверены, знаком [?]. Текст: [...]

3) Сравнение двух двигателей:

Ниже приведены два разных перевода одного и того же исходного предложения (А и Б). Сравните каждый с точки зрения корректности, терминологии и естественности и скажите, какой из них потребует меньше исправлений, с обоснованием. Источник: [...] | Перевод А: [...] | Перевод Б: [...]

4) Быстрая проверка исходного результата:

Ниже приведен исходный код и машинный перевод. Просто отметьте следующее: (1) пропущенная/добавленная информация, (2) неправильный номер/дата/имя, (3) ошибка отрицания, (4) противоречивый термин. Не пишите никаких исправлений, просто перечислите рискованные места. Источник: [...] | Перевод: [...]

Слабая подсказка / Сильная подсказка

Слабое: «Переведите этот текст и будет хорошо». (Для двигателя «хорошо» не определено: ни тона, ни термина, ни массы.)

Гючлю: «Переведите описание продукта с английского на турецкий. Область: электронная коммерция. Аудитория: молодой потребитель. Тон: дружелюбный, но обнадеживающий. «Оформление заказа» → «шаг оформления заказа», «список желаний» → «список желаний». Измените цифры и название бренда. Свободно говорит на турецком языке, без запаха перевода».

Отличие: сильная подсказка дает движку измеримую цель; результат напрямую соответствует отредактированному черновику.

Сравнительная таблица NMT и LLM

Размер

НМТ (Google, DeepL)

LLM (ChatGPT, Клод)

скорость

очень быстро

средний

Получить инструкцию/тон

слабый

сильный

Соблюдайте список терминов

ограниченный

Хорошо (с подсказкой)

Широкий контекст

слабый

хорошо

Риск галлюцинаций

низкий

Средний (требуется контроль)

самая подходящая работа

Прямой/технический/повторяющийся

Тон/контекст/креатив

Распространенные ошибки

  • Использование одного и того же двигателя для каждой работы. Неподбор двигателя по типу работ приводит к потере времени и качества.
  • Указание цены/времени без предварительной оценки. Тест на 200–300 слов раскрывает сюрпризы с самого начала.
  • Принимаю беглость за точность. Красивое предложение не означает правильное предложение.
  • Игнорирование языковой пары и разницы направлений. Хороший двигатель в одной паре может оказаться слабым в другой.
  • Не замечая дополнений LLM. LLM иногда добавляет предложения, которых нет в источнике, «чтобы помочь»; проверьте это.

Контекстное окно и согласованность

При переводе длинного текста с помощью LLM необходимо знать одно техническое ограничение: контекстное окно — объем текста, который модель может «видеть» и удерживать в уме одновременно. Если текст больше этого окна, вам придется разделить его на фрагменты, и модель может «забыть» в следующем фрагменте решение по термину или тон, который вы приняли в предыдущих фрагментах. Таким образом, вместо того, чтобы переводить длинную книгу или документ целиком, напоминайте каждому фрагменту терминологическую базу и краткое изложение стилей, чтобы сохранить последовательность. Эта проблема не возникает в коротких текстах; Однако в больших произведениях, таких как романы и пособия, необходимо дополнительно проверять последовательность в отрывках. Практическое решение: подготовить «память проекта» (термины + символы + тональные решения) и добавить ее в начало каждого фрагмента, а в конце перевода сканировать на предмет согласованности между фрагментами. В NMT эта проблема решается по-другому: поскольку NMT переводит предложение за предложением, согласованность длины абзаца уже слабая, поэтому терминологическая база берет на себя дисциплину терминов.

В итоге

Существует два семейства машинного перевода: NMT, который работает быстро и последовательно, и LLM, который принимает инструкции и лучше видит контекст и тон. Мастер-переводчик заранее оценивает пригодность текста для машины, подбирает движок в соответствии с заданием, быстро измеряет качество исходного текста перед сдачей и никогда не путает беглость с точностью. Этот рефлекс предварительной оценки позволяет вам одновременно указать реалистичное время/цену и защитить себя от слепого доверия.

Задача приложения

Переведите один и тот же текст из 200 слов с помощью инструмента NMT и LLM. Сравните два результата по пяти измерениям (точность, полнота, терминология, беглость речи, формат) и напишите причины, по которым требуется меньше постредактирования этого текста. Затем пометьте риски проблем, непредвиденных обстоятельств и сроков в обоих случаях с помощью шаблона «быстрая проверка необработанных результатов».

контрольный список

  • [ ] Я классифицировал пригодность текста для машины (низкий/средний/высокий риск).
  • [ ] В зависимости от типа работы я решал, использовать ли NMT или LLM.
  • [ ] Я провел предварительную оценку на небольшой выборке и соответственно определил продолжительность/цену.
  • [ ] Я быстро просмотрел необработанный результат в пяти измерениях.
  • [ ] Я проверил номер, дату, имя и негативы отдельно, не обманувшись беглостью.