Прибыль:
- Способность различать уровни автоматического контроля качества и лингвистического LQA и применять их в правильном порядке.
- Способность объективно оценивать перевод по категории и весу (критический/основной/незначительный) с помощью системы ошибок, такой как MQM.
- Возможность принять окончательное решение при использовании ИИ в качестве аудитора, зная его слепоту к собственному переводу, риск совершения ошибок и ограничения автоматизированных показателей.
В тот момент, когда вы говорите, что перевод «готов», это половина дела; Другая половина — доказать, что этот перевод действительно надежен. В этом модуле вы изучите систематические способы измерения качества перевода: автоматические проверки качества, системы ошибок LQA, основанные на использовании человека, метрики качества, а также то, как использовать ИИ в качестве «инспектора» — и его пределы. Цель состоит в том, чтобы отойти от субъективности «я думаю, что это хорошо» и стать экспертом, который определяет, измеряет и доказывает качество.
Два типа контроля качества: автоматический и лингвистический.
QA (обеспечение качества) при переводе работает на двух уровнях:
Автоматизированный контроль качества: стилистические ошибки, которые выявляются CAT-инструментами и скриптами — несоответствие номеров, отсутствие/лишний пробел, противоречивый термин, непереведенный сегмент, неправильный заполнитель/тег, двойной пробел, знаки препинания. Они быстро и полностью сканируются машиной; Он ускользает от человеческого глаза, но автомобиль его улавливает.
LQA (Linguistic Quality Assurance): это уровень, на котором оценщик-человек исследует значение, терминологию, стиль, грамматику и соответствие местным условиям. Автоматизированный контроль качества «Совпадает ли число?» смотрит на вопрос; LQA: «Правильно ли значение, уместен ли тон, приемлемо ли это с культурной точки зрения?» Он смотрит на вопрос. Эти двое дополняют друг друга; Одно не заменяет другое.
Совет: Всегда сначала запускайте Auto QA; Устранение формальных ошибок позволяет оценщику сосредоточить внимание на реальных лингвистических проблемах. Рецензент, которого беспокоит ошибка в номере, упустит ошибку тона.
Кадры ошибок: MQM и DQF
Типологии стандартных ошибок используются для того, чтобы сделать качество измеримым, а не «хорошим/плохим». Наиболее распространенным является MQM (многомерный показатель качества): он присваивает каждой ошибке категорию (точность, беглость, терминология, стиль, местоположение, формат) и вес (критическая, значительная, незначительная). Другая структура — DQF (динамическая структура качества) — упоминается вместе с MQM.
Почему это важно? Потому что с помощью этой структуры вы можете дать переводу оценку ошибки, объективно сравнить разные переводчики/движки и спросить: «Можно ли доставить этот текст?» Вы отвечаете на вопрос с числовым порогом. Например: критическая ошибка = 10 баллов, существенная = 5, незначительная = 1; текст ниже определенного порога проходит за определенное слово.
Критическая ошибка: ошибка, которая меняет смысл, создает угрозу безопасности/юридическому риску, наносит ущерб бренду (неправильная доза, «не несет ответственности» вместо «ответственен»). Майор: разрушительный, но безвредный. Незначительный: заметный, но не умаляющий смысла (второстепенный стиль/пунктуация).
Использование ИИ в качестве контроллера — и его ограничения
ИИ быстро и полезно проверяет перевод на соответствие системе ошибок: вы можете сказать: «Отметьте правильность, терминологию, беглость в этом переводе с помощью категорий MQM». Это уменьшает ваши слепые зоны и дает вам быстрый «второй глаз».
Но есть три критических ограничения: (1) ИИ может быть слеп при проверке перевода, который он производит, — как делая, так и подтверждая одну и ту же ошибку; перепроверьте с другой моделью или вернитесь к источнику. (2) ИИ также может выдумывать галлюцинаторные «ошибки» — сообщать об ошибке, которой не существует; Подтвердите каждое предупреждение. (3) ИИ может не полностью осознавать реальную серьезность критической ошибки (ошибка в дозе может оказаться фатальной); Эксперт делает взвешивание. Таким образом, ИИ ускоряет контроль качества, но окончательное решение по качеству и утверждение доставки остается за человеком.
Внимание: утверждение «ИИ прошел контроль качества, он чист» — это ложное чувство уверенности. Аудит ИИ не является заменой человеческого LQA и сравнения с источником; это уровень предварительной проверки, который помогает им вникнуть в суть дела.
три мини-кейса
Случай 1. Автоматизированный контроль качества обнаружил 40 ошибок в числах. При переводе финансового отчета автоматизированный контроль качества обнаружил 40 несоответствий чисел/форматов между источником и целью (разделитель тысяч, десятичная дробь, валюта). Человеческий глаз пропустил бы большинство из них; автомобиль указан в секундах.
Случай 2. Оценка MQM привела к выбору двигателя. Одно бюро MQM оценило производительность двух разных двигателей MT в 2000 слов: двигатель A — 12 баллов, двигатель B — 31. Объективное измерение разрешило спор «что лучше» с помощью баллов; Бюро сделало Engine A стандартом и соответствующим образом спланировало свой бюджет после доработки.
Случай 3. Аудит ИИ упустил собственную ошибку. Переводчик, осуществлявший перевод LLM, контролировал тот же LLM; Модель сказала «нет проблем» — терминологическую ошибку, которую она допустила сама. Ошибка была обнаружена, когда переводчик сверился с другой моделью и источником; Команда приняла правило, что «одна и та же модель не должна контролировать себя».
Четыре копируемых шаблона
1) Проверка ошибок на основе MQM:
Ваша роль: оценщик LQA. Сравните источник и перевод ниже. Укажите каждую обнаруженную ошибку в следующем формате: [категория: точность/терминология/беглость/стиль/формат][вес: критическая/значительная/незначительная] [местоположение] [комментарий] [исправление]. Отметьте предупреждение, в котором вы не уверены, как «Требуется подтверждение»; errorfabrication.Источник: [...] | Перевод: [...]
2) Сканирование критических ошибок (высокий риск):
Критические ошибки ищите ТОЛЬКО в переводе ниже: значение инверсии, ошибка числа/дозы/даты, потеря отрицания, подмена юридического обязательства, ошибка предупреждения о безопасности. Не обращайте внимания на мелкие проблемы со стилем. Укажите источник каждого критического вывода. Источник: [...] | Перевод: [...]
3) Автоматический дополнительный контроль качества:
Перечислите формальные несоответствия в следующих парах источник-цель: несоответствие номеров, отсутствующий/лишний заполнитель или тег, противоречивый термин, непереведенный сегмент, разница в единицах измерения/валюте. Просто дайте проблемы с их расположением. Пары: [...]
4) Независимый второй глаз (перекрестная проверка):
Оцените этот перевод БЕЗ ПРЕДВАРЕНИЙ; Не думайте, что вы это написали. Дайте источнику оценку качества (1-5) за верность, терминологию и естественность и перечислите 3 главные проблемы. Мне решать. Источник: [...] | Перевод: [...]
Слабая подсказка / Сильная подсказка
Слабый: «Хорош ли этот перевод?» (Нет критериев; ИИ возвращает бесполезный ответ, например «в целом хорошо».)
Строгое: «Сверьте этот перевод с исходным текстом. Обозначьте каждую ошибку категорией (точность/терминология/беглость) и степенью серьезности (критическая/серьезная/незначительная). Сосредоточьтесь особенно на количественных, отрицательных и терминологических ошибках. Не выдумывайте ошибки; отметьте «необходимо подтверждение», если вы не уверены».
Разница: сильная подсказка дает рамку ошибки и фокус; Результатом является сопоставимый и действенный отчет о качестве.
Таблица слоев качества
слой
что цепляет
Кто/что делает
Автоматический контроль качества
Номер, этикетка, консистенция
Инструмент/скрипт
AI-управление
Возможные смысловые/терминологические ошибки
LLM (с подтверждением)
LQA человека
Значение, тон, культура, вес
эксперт-оценщик
Оценка MQM/DQF
Объективная оценка ошибок
человек с рамкой
Подтверждение доставки
высшая ответственность
компетентный переводчик
Распространенные ошибки
- Пропускаем автоматический контроль качества и сразу приступаем к чтению. Стилистические ошибки отвлекают внимание.
- Замена проверки ИИ на LQA человека. ИИ предварительно проверяет, не одобряет.
- Имея ту же модель, проверьте собственный перевод. Слепое пятно; требуется перекрестная проверка.
- Не взвешивание ошибок. Если рассматривать критическое и второстепенное как одно и то же, это нарушает приоритет.
- Исправление «ошибок», допущенных ИИ, без их подтверждения. Вы можете исказить правильное предложение.
Автоматические метрики: BLEU, COMET и лимиты
Существует также мир автоматизированных показателей измерения качества. BLEU (Подразделение двуязычной оценки) сравнивает машинный перевод с переводом, выполненным человеком, и дает оценку от 0 до 100 на основе совпадения слов; Долгое время это был стандарт сравнения систем МТ. Новый показатель COMET основан на нейронных сетях и лучше отражает семантическое сходство, чем BLEU. Эти метрики полезны для быстрого и автоматического сравнения двух механизмов на основе больших данных.
Но его ограничения очевидны: такие показатели, как BLEU, смотрят на перекрытие слов, не понимая смысла. Перевод, который отличается от эталонного, но является точным, может получить низкую оценку; Перевод, аналогичный эталонному, но неправильный, может получить высокий балл. Критическая отрицательная ошибка — это одно слово, поэтому она мало влияет на метрику, но на самом деле является катастрофической. Вот почему автоматизированные показатели измеряют тенденции на уровне системы, а не определяют доставляемость отдельного текста. Вопрос о том, будет ли перевод передан клиенту, решается на основе человеческой оценки и экспертного заключения на основе MQM, а не на основе автоматической оценки. Используйте показатели в качестве компаса, а не судьи.
В итоге
Качество перевода – это не субъективное ощущение, это нечто измеримое. Автоматический контроль качества тщательно проверяет наличие формальных ошибок; человеческий LQA оценивает смысл, тон и культуру; Системы ошибок, такие как MQM, количественно определяют качество по категориям и весу, обеспечивая объективное сравнение. ИИ — это мощный второй глаз, который ускоряет этот контроль, но он может быть слеп к собственному переводу, совершать ошибки и не в состоянии полностью оценить реальный вес; Поэтому окончательное решение по качеству, взвешиванию и утверждению доставки остается за компетентным переводчиком.
Задача приложения
Получите результат машинного перевода. Сначала перечислите формальные ошибки с помощью «автоматической дополнительной проверки качества», затем перечислите лингвистические ошибки по категориям и весу с помощью «проверки ошибок на основе MQM». Я оцениваю каждую ошибку (критическую 10, серьезную 5, незначительную 1) с пороговым значением для каждого слова и спрашиваю: «Можно ли ее доставить?» Ответьте на вопрос. Наконец, уточните у источника, сколько ошибок, отмеченных ИИ, реальны, а сколько сфабрикованы.
контрольный список
- [ ] Я запустил автоматический контроль качества и исправил все формальные ошибки.
- [ ] Я отметил лингвистические ошибки рамкой (категория + вес).
- [ ] Я сканировал критические ошибки в отдельном приоритетном раунде.
- [ ] Я получил элемент управления AI и при необходимости сверил его с другой моделью.
- [ ] Я принял решение о доставке на основании числового порога и собственного экспертного заключения.