Прибуток:
- Можливість розрізняти автоматичний рівень контролю якості та лінгвістичний рівень рівня якості та застосовувати обидва в правильному порядку
- Можливість об’єктивно оцінити переклад за категорією та вагомістю (критичні/важливі/незначні) із системою помилок, такою як MQM
- Можливість прийняти остаточне рішення при використанні ШІ як аудитора, знаючи його сліпоту щодо власного перекладу, ризик помилок і обмеження автоматизованих показників
У той момент, коли ви скажете, що переклад «зроблено», це половина справи; Інша половина — довести, що цей переклад насправді надійний. У цьому розділі ви дізнаєтеся про систематичні способи вимірювання якості перекладу: автоматичні перевірки якості, людські системи помилок LQA, показники якості та те, як використовувати ШІ як «інспектора» — і його обмеження. Мета полягає в тому, щоб відійти від суб’єктивності «я думаю, що це добре» і стати експертом, який визначає, вимірює та доводить якість.
Два види контролю якості: автоматичний і лінгвістичний
QA (Quality Assurance) працює на двох рівнях перекладу:
Автоматична перевірка якості: стилістичні помилки, які виловлюють інструменти та сценарії CAT — невідповідність чисел, відсутність/зайвий простір, непослідовний термін, неперекладений сегмент, неправильний заповнювач/тег, подвійний пробіл, пунктуація. Вони швидко та повністю скануються машиною; Він вислизає від людського ока, але транспортний засіб його ловить.
LQA (Linguistic Quality Assurance): це рівень, на якому людина-оцінювач перевіряє значення, термінологію, стиль, граматику та місцеву відповідність. Автоматизований контроль якості "чи збігається число?" дивиться на питання; LQA «чи правильне значення, чи відповідний тон, чи це відповідає культурі?» Він дивиться на питання. Обидва доповнюють один одного; Одне іншого не замінює.
Порада: завжди спочатку запускайте Auto QA; Виправлення формальних помилок дозволяє людині-оцінювачу приділити увагу реальним лінгвістичним проблемам. Рецензент, який турбується про помилку в номері, пропустить помилку тону.
Кадри помилок: MQM і DQF
Стандартні типології помилок використовуються, щоб зробити якість вимірюваною, а не «добре/погано». Найпоширенішим є MQM (багатовимірна метрика якості): вона присвоює кожній помилці категорію (точність, плавність, термінологія, стиль, місцевість, формат) і вагу (критична, велика, незначна). Інша структура DQF (Dynamic Quality Framework) згадується разом із MQM.
Чому це важливо? Тому що за допомогою цього фреймворку ви можете надати оцінку помилки перекладу, об’єктивно порівняти різні перекладачі/модулі та запитати: «Чи можна доставити цей текст?» Ви відповідаєте на запитання числовим порогом. Наприклад: критична помилка = 10 балів, велика = 5, другорядна = 1; текст нижче певного порогу проходить за певне слово.
Критична помилка: помилка, яка перевертає значення, створює безпеку/юридичний ризик, шкодить бренду (неправильна доза, «не відповідає» замість «відповідає»). Основний: руйнівний, але нешкідливий. Другорядний: помітний, але не применшує значення (мінорний стиль/пунктуація).
Використання ШІ як контролера — і його межі
AI є швидким і корисним у перевірці перекладу на відповідність системі помилок: ви можете сказати «позначити правильність, термінологію, помилки вільного мовлення в цьому перекладі категоріями MQM». Це зменшує ваші сліпі плями та дає вам швидке «друге око».
Але є три критичні обмеження: (1) штучний інтелект може бути сліпим під час перевірки перекладу, який він виробляє — і робити, і підтверджувати ту саму помилку; перехресна перевірка з іншою моделлю або повернення до джерела. (2) ШІ також може створювати галюцинаторні «помилки» — повідомляти про помилку, якої не існує; Підтверджуйте кожне попередження. (3) ШІ може не повністю зрозуміти серйозність критичної помилки в реальному світі (помилка дози може бути фатальною); Експерт проводить зважування. Таким чином, штучний інтелект прискорює перевірку якості, але остаточне рішення щодо якості та затвердження доставки залишається за людиною.
Застереження: говорити «ШІ пройшов перевірку якості, він чистий» — це помилкове почуття впевненості. Аудит штучного інтелекту не є заміною людського LQA та порівняння з джерелом; це шар попереднього відбору, який пришвидшує їх.
три міні-чохла
Випадок 1. Автоматична перевірка якості виявила 40 помилок із числом. Під час перекладу фінансового звіту автоматизована перевірка якості виявила 40 невідповідностей чисел/форматів між джерелом і цільовим кодом (роздільник тисяч, десятковий дроб, валюта). Людське око пропустить більшість із них; транспортний засіб у списку за секунди.
Випадок 2 — Оцінка MQM призвела до вибору двигуна. Одне бюро MQM оцінило продуктивність двох різних механізмів МП у 2000 слів: механізм A 12 точок помилки, механізм B 31. Об’єктивне вимірювання вирішило дискусію «який кращий» з балом; Бюро зробило двигун А стандартом і відповідно спланувало його бюджет після перегляду.
Випадок 3 — ШІ-аудит пропустив власну помилку. Перекладач мав нагляд за перекладом LLM під наглядом того самого LLM; Модель сказала «без проблем», термінологічну помилку, яку вона припустила сама. Помилка була виявлена, коли перекладач перехресно перевірив іншу модель і джерело; Команда прийняла правило, що «одна і та сама модель не повинна контролювати себе».
Чотири шаблони, які можна копіювати
1) Перевірка помилок на основі MQM:
Ваша роль: оцінювач LQA. Порівняйте джерело та переклад нижче. Надайте кожну помилку, яку ви знайдете, у такому форматі: [категорія: точність/термінологія/плавність/стиль/формат][вагомість: критична/значна/незначна] [розташування] [коментар] [виправлення]. Позначте попередження, у якому ви не впевнені, як «потрібне підтвердження»; errorfabrication.Джерело: [...] | Переклад: [...]
2) Сканування критичних помилок (високий ризик):
Шукайте критичні помилки ЛИШЕ в перекладі нижче: інверсія значення, помилка номера/дози/дати, втрата заперечення, заміна правового зобов’язання, помилка попередження про безпеку. Ігноруйте дрібні проблеми зі стилем. Цитуйте джерело для кожного критичного висновку. Джерело: [...] | Переклад: [...]
3) Автоматичний додатковий контроль якості:
Перелічіть формальні невідповідності в наступних парах джерело-ціль: невідповідність числа, відсутній/зайвий заповнювач або тег, неузгоджений термін, неперекладений сегмент, різниця одиниці/валюти. Просто дайте проблеми з їх розташуванням. Пари: [...]
4) Самостійне друге око (взаємоперевірка):
Оцініть цей переклад БЕЗ УПЕРЕДЖЕНЬ; Не думайте, що ви це написали. Поставте джерелу оцінку якості (1-5) за точність, термінологію та природність і перерахуйте 3 головні проблеми. Це мені вирішувати. Джерело: [...] | Переклад: [...]
Слабка підказка / Сильна підказка
Слабко: "Чи хороший цей переклад?" (Немає критеріїв; штучний інтелект повертає марну відповідь, як-от «загалом добре».)
Сильно: «Перевірте цей переклад із джерелом. Позначте кожну помилку категорією (точність/термінологія/вільність) і серйозністю (критична/велика/незначна). Зосередьтеся особливо на помилках у числі, запереченні та термінології. Не вигадуйте помилки; позначте «потрібне підтвердження», якщо ви не впевнені».
Відмінність: сильна підказка дає кадр помилки та фокус; Результатом є порівняльний звіт про якість.
Таблиця шарів якості
шар
що ловить
Хто/що робить
Автоматичний контроль якості
Номер, етикетка, консистенція
Інструмент/скрипт
ШІ управління
Можливі помилки значення/термінології
LLM (з підтвердженням)
LQA людини
Значення, тон, культура, вага
експерт-оцінювач
Оцінка MQM/DQF
Об'єктивна оцінка помилки
людини з рамою
Підтвердження доставки
остаточна відповідальність
грамотний перекладач
Поширені помилки
- Пропустіть автоматизовану перевірку якості та перейдіть безпосередньо до читання. Стилістичні помилки відволікають увагу.
- Заміна ШІ інспекції LQA людиною. AI попередньо перевіряє, не затверджує.
- Маючи ту саму модель, перевірте її власний переклад. Сліпа пляма; потрібна перехресна перевірка.
- Без зважування помилок. Розглядання критичного та другорядного як одного й того ж порушує пріоритет.
- Виправлення «помилок», допущених ШІ, без їх підтвердження. Ви можете спотворити правильне речення.
Автоматичні показники: BLEU, COMET і ліміти
Існує також світ автоматизованих показників вимірювання якості. BLEU (Bilingual Evaluation Understudy) порівнює машинний переклад з довідковим перекладом людини та дає оцінку 0-100 на основі накладання слів; Довгий час це був стандарт для порівняння систем МП. Новіша метрика COMET базується на нейронній мережі та фіксує семантичну подібність краще, ніж BLEU. Ці показники є цінними для швидкого й автоматичного порівняння двох механізмів на великих даних.
Але його межі зрозумілі: такі показники, як BLEU, дивляться на накладення слів, насправді не розуміючи значення. Переклад, який відрізняється від посилання, але є точним, може отримати низький бал; Переклад, схожий на посилання, але неправильний, може отримати високий бал. Критична негативна помилка – це одне слово, тому воно мало впливає на показник, але насправді є катастрофічним. Ось чому автоматичні показники вимірюють тенденції на системному рівні, а не визначають доступність окремого тексту. Оцінка персоналом на основі MQM та експертне судження вирішують, чи підійде переклад клієнту, а не автоматична оцінка. Використовуйте показники як компас, а не суддю.
Підсумовуючи
Якість перекладу – це не суб’єктивне відчуття, це щось вимірюване. Автоматична перевірка якості ретельно сканує на наявність формальних помилок; LQA людини оцінює значення, тон і культуру; Платформи помилок, такі як MQM, кількісно оцінюють якість за категоріями та вагою, уможливлюючи об’єктивне порівняння. ШІ — це потужне друге око, яке прискорює цей контроль, але він може бути сліпим до власного перекладу, робити помилки та не в змозі повністю зрозуміти вагу реального світу; Таким чином, остаточне рішення щодо якості, зважування та затвердження доставки належить компетентному перекладачу.
Аплікаційне завдання
Отримайте результат машинного перекладу. Спочатку перерахуйте формальні помилки за допомогою «автоматичної додаткової перевірки якості», а потім перерахуйте лінгвістичні помилки за категорією та вагою за допомогою «перевірки помилок на основі MQM». Я оцінюю кожну помилку (критична 10, велика 5, другорядна 1) за допомогою порогового значення для кожного слова та запитую: "чи можна це зробити?" Дайте відповідь на запитання. Нарешті, підтвердьте в джерела, скільки помилок, позначених штучним інтелектом, є справжніми, а скільки сфабрикованими.
контрольний список
- [ ] Я запустив автоматичну перевірку якості та усунув усі формальні помилки.
- [ ] Я позначив мовні помилки квадратиком (категорія + вага).
- [ ] Я сканував критичні помилки в окремому, пріоритетному раунді.
- [ ] Я знайшов елемент керування штучним інтелектом і за потреби перевірив його на іншій моделі.
- [ ] Я прийняв рішення про доставку на основі числового порогу та власної експертної оцінки.