Единицы
1. Введение в искусственный интеллект в письменном и устном переводе: роли, границы, аутентификация, конфиденциальность и этика 2. Основы машинного перевода: NMT, LLM, выбор механизма и предварительная оценка 3. Постредактирование машинного перевода (MTPE): упрощенное и полное постредактирование 4. Управление терминологией и терминологической базой: согласованность и корпоративный язык 5. Интеграция искусственного интеллекта с CAT-инструментами и памятью переводов (TM) 6. Локализация (L10n): программное обеспечение, Интернет, игры и культурная адаптация 7. Субтитры, дубляж и аудиовизуальный перевод 8. Контроль качества (QA), метрики оценки и LQA 9. Подготовка к устному переводу: последовательный и синхронный перевод 10. Контекст, культура, тон и творческий перевод (транскреация) 11. Конфиденциальность, этика, авторское право, подлинность и будущее профессии
Единица 8 / 11

Контроль качества (QA), метрики оценки и LQA

Прибыль:

  • Способность различать уровни автоматического контроля качества и лингвистического LQA и применять их в правильном порядке.
  • Способность объективно оценивать перевод по категории и весу (критический/основной/незначительный) с помощью системы ошибок, такой как MQM.
  • Возможность принять окончательное решение при использовании ИИ в качестве аудитора, зная его слепоту к собственному переводу, риск совершения ошибок и ограничения автоматизированных показателей.

В тот момент, когда вы говорите, что перевод «готов», это половина дела; Другая половина — доказать, что этот перевод действительно надежен. В этом модуле вы изучите систематические способы измерения качества перевода: автоматические проверки качества, системы ошибок LQA, основанные на использовании человека, метрики качества, а также то, как использовать ИИ в качестве «инспектора» — и его пределы. Цель состоит в том, чтобы отойти от субъективности «я думаю, что это хорошо» и стать экспертом, который определяет, измеряет и доказывает качество.

Два типа контроля качества: автоматический и лингвистический.

QA (обеспечение качества) при переводе работает на двух уровнях:

Автоматизированный контроль качества: стилистические ошибки, которые выявляются CAT-инструментами и скриптами — несоответствие номеров, отсутствие/лишний пробел, противоречивый термин, непереведенный сегмент, неправильный заполнитель/тег, двойной пробел, знаки препинания. Они быстро и полностью сканируются машиной; Он ускользает от человеческого глаза, но автомобиль его улавливает.

LQA (Linguistic Quality Assurance): это уровень, на котором оценщик-человек исследует значение, терминологию, стиль, грамматику и соответствие местным условиям. Автоматизированный контроль качества «Совпадает ли число?» смотрит на вопрос; LQA: «Правильно ли значение, уместен ли тон, приемлемо ли это с культурной точки зрения?» Он смотрит на вопрос. Эти двое дополняют друг друга; Одно не заменяет другое.

Совет: Всегда сначала запускайте Auto QA; Устранение формальных ошибок позволяет оценщику сосредоточить внимание на реальных лингвистических проблемах. Рецензент, которого беспокоит ошибка в номере, упустит ошибку тона.

Кадры ошибок: MQM и DQF

Типологии стандартных ошибок используются для того, чтобы сделать качество измеримым, а не «хорошим/плохим». Наиболее распространенным является MQM (многомерный показатель качества): он присваивает каждой ошибке категорию (точность, беглость, терминология, стиль, местоположение, формат) и вес (критическая, значительная, незначительная). Другая структура — DQF (динамическая структура качества) — упоминается вместе с MQM.

Почему это важно? Потому что с помощью этой структуры вы можете дать переводу оценку ошибки, объективно сравнить разные переводчики/движки и спросить: «Можно ли доставить этот текст?» Вы отвечаете на вопрос с числовым порогом. Например: критическая ошибка = 10 баллов, существенная = 5, незначительная = 1; текст ниже определенного порога проходит за определенное слово.

Критическая ошибка: ошибка, которая меняет смысл, создает угрозу безопасности/юридическому риску, наносит ущерб бренду (неправильная доза, «не несет ответственности» вместо «ответственен»). Майор: разрушительный, но безвредный. Незначительный: заметный, но не умаляющий смысла (второстепенный стиль/пунктуация).

Использование ИИ в качестве контроллера — и его ограничения

ИИ быстро и полезно проверяет перевод на соответствие системе ошибок: вы можете сказать: «Отметьте правильность, терминологию, беглость в этом переводе с помощью категорий MQM». Это уменьшает ваши слепые зоны и дает вам быстрый «второй глаз».

Но есть три критических ограничения: (1) ИИ может быть слеп при проверке перевода, который он производит, — как делая, так и подтверждая одну и ту же ошибку; перепроверьте с другой моделью или вернитесь к источнику. (2) ИИ также может выдумывать галлюцинаторные «ошибки» — сообщать об ошибке, которой не существует; Подтвердите каждое предупреждение. (3) ИИ может не полностью осознавать реальную серьезность критической ошибки (ошибка в дозе может оказаться фатальной); Эксперт делает взвешивание. Таким образом, ИИ ускоряет контроль качества, но окончательное решение по качеству и утверждение доставки остается за человеком.

Внимание: утверждение «ИИ прошел контроль качества, он чист» — это ложное чувство уверенности. Аудит ИИ не является заменой человеческого LQA и сравнения с источником; это уровень предварительной проверки, который помогает им вникнуть в суть дела.

три мини-кейса

Случай 1. Автоматизированный контроль качества обнаружил 40 ошибок в числах. При переводе финансового отчета автоматизированный контроль качества обнаружил 40 несоответствий чисел/форматов между источником и целью (разделитель тысяч, десятичная дробь, валюта). Человеческий глаз пропустил бы большинство из них; автомобиль указан в секундах.

Случай 2. Оценка MQM привела к выбору двигателя. Одно бюро MQM оценило производительность двух разных двигателей MT в 2000 слов: двигатель A — 12 баллов, двигатель B — 31. Объективное измерение разрешило спор «что лучше» с помощью баллов; Бюро сделало Engine A стандартом и соответствующим образом спланировало свой бюджет после доработки.

Случай 3. Аудит ИИ упустил собственную ошибку. Переводчик, осуществлявший перевод LLM, контролировал тот же LLM; Модель сказала «нет проблем» — терминологическую ошибку, которую она допустила сама. Ошибка была обнаружена, когда переводчик сверился с другой моделью и источником; Команда приняла правило, что «одна и та же модель не должна контролировать себя».

Четыре копируемых шаблона

1) Проверка ошибок на основе MQM:

Ваша роль: оценщик LQA. Сравните источник и перевод ниже. Укажите каждую обнаруженную ошибку в следующем формате: [категория: точность/терминология/беглость/стиль/формат][вес: критическая/значительная/незначительная] [местоположение] [комментарий] [исправление]. Отметьте предупреждение, в котором вы не уверены, как «Требуется подтверждение»; errorfabrication.Источник: [...] | Перевод: [...]

2) Сканирование критических ошибок (высокий риск):

Критические ошибки ищите ТОЛЬКО в переводе ниже: значение инверсии, ошибка числа/дозы/даты, потеря отрицания, подмена юридического обязательства, ошибка предупреждения о безопасности. Не обращайте внимания на мелкие проблемы со стилем. Укажите источник каждого критического вывода. Источник: [...] | Перевод: [...]

3) Автоматический дополнительный контроль качества:

Перечислите формальные несоответствия в следующих парах источник-цель: несоответствие номеров, отсутствующий/лишний заполнитель или тег, противоречивый термин, непереведенный сегмент, разница в единицах измерения/валюте. Просто дайте проблемы с их расположением. Пары: [...]

4) Независимый второй глаз (перекрестная проверка):

Оцените этот перевод БЕЗ ПРЕДВАРЕНИЙ; Не думайте, что вы это написали. Дайте источнику оценку качества (1-5) за верность, терминологию и естественность и перечислите 3 главные проблемы. Мне решать. Источник: [...] | Перевод: [...]

Слабая подсказка / Сильная подсказка

Слабый: «Хорош ли этот перевод?» (Нет критериев; ИИ возвращает бесполезный ответ, например «в целом хорошо».)

Строгое: «Сверьте этот перевод с исходным текстом. Обозначьте каждую ошибку категорией (точность/терминология/беглость) и степенью серьезности (критическая/серьезная/незначительная). Сосредоточьтесь особенно на количественных, отрицательных и терминологических ошибках. Не выдумывайте ошибки; отметьте «необходимо подтверждение», если вы не уверены».

Разница: сильная подсказка дает рамку ошибки и фокус; Результатом является сопоставимый и действенный отчет о качестве.

Таблица слоев качества

слой

что цепляет

Кто/что делает

Автоматический контроль качества

Номер, этикетка, консистенция

Инструмент/скрипт

AI-управление

Возможные смысловые/терминологические ошибки

LLM (с подтверждением)

LQA человека

Значение, тон, культура, вес

эксперт-оценщик

Оценка MQM/DQF

Объективная оценка ошибок

человек с рамкой

Подтверждение доставки

высшая ответственность

компетентный переводчик

Распространенные ошибки

  • Пропускаем автоматический контроль качества и сразу приступаем к чтению. Стилистические ошибки отвлекают внимание.
  • Замена проверки ИИ на LQA человека. ИИ предварительно проверяет, не одобряет.
  • Имея ту же модель, проверьте собственный перевод. Слепое пятно; требуется перекрестная проверка.
  • Не взвешивание ошибок. Если рассматривать критическое и второстепенное как одно и то же, это нарушает приоритет.
  • Исправление «ошибок», допущенных ИИ, без их подтверждения. Вы можете исказить правильное предложение.

Автоматические метрики: BLEU, COMET и лимиты

Существует также мир автоматизированных показателей измерения качества. BLEU (Подразделение двуязычной оценки) сравнивает машинный перевод с переводом, выполненным человеком, и дает оценку от 0 до 100 на основе совпадения слов; Долгое время это был стандарт сравнения систем МТ. Новый показатель COMET основан на нейронных сетях и лучше отражает семантическое сходство, чем BLEU. Эти метрики полезны для быстрого и автоматического сравнения двух механизмов на основе больших данных.

Но его ограничения очевидны: такие показатели, как BLEU, смотрят на перекрытие слов, не понимая смысла. Перевод, который отличается от эталонного, но является точным, может получить низкую оценку; Перевод, аналогичный эталонному, но неправильный, может получить высокий балл. Критическая отрицательная ошибка — это одно слово, поэтому она мало влияет на метрику, но на самом деле является катастрофической. Вот почему автоматизированные показатели измеряют тенденции на уровне системы, а не определяют доставляемость отдельного текста. Вопрос о том, будет ли перевод передан клиенту, решается на основе человеческой оценки и экспертного заключения на основе MQM, а не на основе автоматической оценки. Используйте показатели в качестве компаса, а не судьи.

В итоге

Качество перевода – это не субъективное ощущение, это нечто измеримое. Автоматический контроль качества тщательно проверяет наличие формальных ошибок; человеческий LQA оценивает смысл, тон и культуру; Системы ошибок, такие как MQM, количественно определяют качество по категориям и весу, обеспечивая объективное сравнение. ИИ — это мощный второй глаз, который ускоряет этот контроль, но он может быть слеп к собственному переводу, совершать ошибки и не в состоянии полностью оценить реальный вес; Поэтому окончательное решение по качеству, взвешиванию и утверждению доставки остается за компетентным переводчиком.

Задача приложения

Получите результат машинного перевода. Сначала перечислите формальные ошибки с помощью «автоматической дополнительной проверки качества», затем перечислите лингвистические ошибки по категориям и весу с помощью «проверки ошибок на основе MQM». Я оцениваю каждую ошибку (критическую 10, серьезную 5, незначительную 1) с пороговым значением для каждого слова и спрашиваю: «Можно ли ее доставить?» Ответьте на вопрос. Наконец, уточните у источника, сколько ошибок, отмеченных ИИ, реальны, а сколько сфабрикованы.

контрольный список

  • [ ] Я запустил автоматический контроль качества и исправил все формальные ошибки.
  • [ ] Я отметил лингвистические ошибки рамкой (категория + вес).
  • [ ] Я сканировал критические ошибки в отдельном приоритетном раунде.
  • [ ] Я получил элемент управления AI и при необходимости сверил его с другой моделью.
  • [ ] Я принял решение о доставке на основании числового порога и собственного экспертного заключения.