единица 8 / 11

Контрол на качеството (QA), показатели за оценка и LQA

Печалби:

  • Възможност за разграничаване между автоматичния QA и езиковия LQA слоеве и прилагане и на двата в правилния ред
  • Възможност за обективна оценка на превода според категория и тежест (критични/големи/незначителни) с рамка за грешки като MQM
  • Да можеш да вземеш окончателното решение, когато използваш AI като одитор, знаейки неговата слепота за собствения си превод, риска от допускане на грешки и ограниченията на автоматизираните показатели

В момента, в който кажете, че преводът е „свършен“, това е половината работа; Другата половина е да се докаже, че този превод наистина е надежден. В този модул ще научите систематични начини за измерване на качеството на превода: автоматизирани проверки на качеството, базирани на хора рамки за грешки на LQA, показатели за качество и как да използвате AI като „инспектор“ — и неговите ограничения. Целта е да се отдалечите от субективизма „аз мисля, че е добре“ и да станете експерт, който определя, измерва и доказва качеството.

Два вида контрол на качеството: автоматичен и езиков

QA (Осигуряване на качеството) работи на два слоя в превода:

Автоматизирана проверка на качеството: Стилистични грешки, които CAT инструментите и скриптовете улавят — несъответствие на числата, липсващо/излишно пространство, непоследователен термин, непреведен сегмент, лош заместител/етикет, двоен интервал, пунктуация. Те се сканират бързо и напълно машинно; Убягва на човешкото око, но превозното средство го улавя.

LQA (Осигуряване на езиково качество): Това е нивото, където човешкият оценител изследва значението, терминологията, стила, граматиката и местната уместност. Автоматизирано QA "съвпада ли числото?" разглежда въпроса; LQA „вярно ли е значението, подходящ ли е тонът, културно подходящ ли е?“ Той поглежда въпроса. Двете се допълват; Едното не замества другото.

Съвет: Винаги първо стартирайте Auto QA; Изчистването на формалните грешки позволява на човешкия оценител да обърне внимание на реални езикови проблеми. Рецензент, който се занимава с грешката в номера, ще пропусне грешката в тона.

Рамки за грешки: MQM и DQF

Стандартните типологии за грешки се използват, за да направят качеството измеримо, а не „добро/лошо“. Най-разпространеният е MQM (Многоизмерна метрика на качеството): той присвоява всяка грешка на категория (точност, плавност, терминология, стил, местоположение, формат) и тежест (критична, голяма, второстепенна). Друга рамка е DQF (Dynamic Quality Framework) и се споменава заедно с MQM.

Защо е важно? Тъй като с тази рамка можете да дадете резултат за грешка на превод, обективно да сравните различни преводачи/машини и да попитате „може ли този текст да бъде доставен?“ Отговаряте на въпроса с цифров праг. Например: критична грешка = 10 точки, голяма = 5, малка = 1; текст под определен праг преминава за определена дума.

Критична грешка: грешка, която преобръща смисъла, създава риск за сигурността/правен, уврежда марката (грешна доза, „не е отговорен“ вместо „отговорен“). Основен: разрушителен, но безвреден. Минорен: забележимо, но не омаловажаващо значението (минорен стил/пунктуация).

Използване на AI като контролер — и неговите ограничения

AI е бърз и полезен при проверка на превод спрямо рамката за грешки: можете да кажете „отбележете коректност, терминология, грешки в плавността в този превод с категории MQM“. Намалява вашите слепи петна и ви дава бързо „второ око“.

Но има три критични ограничения: (1) AI може да бъде сляп, когато проверява превода, който произвежда - както прави, така и потвърждава една и съща грешка; кръстосана проверка с различен модел или връщане към източника. (2) ИИ може също така да измисля халюцинаторни „грешки“ — докладва за грешка, която не съществува; Потвърдете всяко предупреждение. (3) изкуственият интелект може да не разбере напълно сериозността на критична грешка в реалния свят (грешка в дозата може да бъде фатална); Експертът извършва претеглянето. Така че AI ускорява QA, но окончателното решение за качество и одобрението за доставка е на човека.

Внимание: Казването „ИИ е преминал QA, чист е“ е фалшиво чувство на увереност. AI одитът не е заместител на човешкия LQA и сравнение с източника; това е слой за предварителна проверка, който ги ускорява.

три мини калъфа

Случай 1 — Автоматизираната проверка на качеството откри 40 грешки в числата. При превод на финансов отчет автоматизираната проверка на качеството улови 40 несъответствия на число/формат между източник и цел (разделител за хиляди, десетичен знак, валута). Човешкото око би пропуснало повечето от тях; превозно средство, изброено за секунди.

Случай 2 — Резултатът от MQM доведе до избор на двигател. Едно бюро MQM оцени изхода на две различни MT машини на 2000 думи: Engine A 12 грешки, Engine B 31. Обективното измерване разреши дебата „кое е по-добро“ с резултат; Бюрото направи Engine A стандарт и планира бюджета си след ревизията съответно.

Случай 3 — AI одитът пропусна собствената си грешка. Преводач е имал превода на LLM, наблюдаван от същия LLM; Моделът каза „няма проблем“, терминологична грешка, която тя направи. Грешката беше разкрита, когато преводачът направи кръстосана проверка с различен модел и източник; Екипът възприе правилото, че "един и същ модел не трябва да се контролира".

Четири копируеми шаблона

1) MQM базирана проверка на грешки:

Вашата роля: LQA оценител. Сравнете източника и превода по-долу. Предоставете всяка открита грешка в следния формат: [категория: точност/терминология/плавност/стил/формат][тежест: критична/голяма/незначителна] [местоположение] [коментар] [корекция]. Маркирайте предупреждението, за което не сте сигурни, като „изисква се потвърждение“; errorfabrication.Източник: [...] | Превод: [...]

2) Сканиране за критични грешки (висок риск):

Търсете критични грешки САМО в превода по-долу: означаваща инверсия, грешка номер/доза/дата, загуба на отрицание, заместване на правно задължение, грешка в предупреждението за безопасност. Игнорирайте дребните проблеми със стила. Цитирайте източника за всяко критично откритие. Източник: [...] | Превод: [...]

3) Автоматичен QA допълнителен контрол:

Избройте формалните несъответствия в следните двойки източник-цель: несъответствие на числото, липсващ/допълнителен контейнер или етикет, непоследователен термин, непреведен сегмент, разлика в единица/валута. Просто дайте проблемите с местоположението им. Двойки: [...]

4) Независимо второ око (кръстосана проверка):

Оценявайте този превод БЕЗ ПРЕДРАЗУДНОСТИ; Не предполагайте, че вие ​​сте го написали. Дайте на източника оценка за качество (1-5) за вярност, терминология и естественост и избройте първите 3 проблема. От мен зависи да реша. Източник: [...] | Превод: [...]

Слаба подкана / Силна подкана

Слаб: „Този превод добър ли е?“ (Няма критерии; AI връща безполезен отговор като „като цяло добър.“)

Силно: „Проверете този превод спрямо източника. Етикетирайте всяка грешка с категория (точност/терминология/плавност) и сериозност (критична/голяма/малка). Фокусирайте се особено върху числови, отрицателни и терминологични грешки. Не измисляйте грешки; маркирайте „необходимо е потвърждение“, ако не сте сигурни.“

Разлика: силната подкана дава рамка за грешка и фокус; Резултатът е сравним и приложим отчет за качеството.

Таблица с качествени слоеве

слой

какво хваща

Кой/какво прави

Автоматична проверка на качеството

Брой, етикет, консистенция

Инструмент/скрипт

AI контрол

Възможни грешки в значението/терминологията

LLM (с потвърждение)

Човешки LQA

Значение, тон, култура, тежест

експерт-оценител

MQM/DQF оценка

Обективна оценка за грешка

човек с рамка

Потвърждение за доставка

крайната отговорност

компетентен преводач

Често срещани грешки

  • Пропускане на автоматизираната проверка на качеството и преминаване направо към четене. Стилистичните грешки отвличат вниманието.
  • Замяна на AI инспекция с човешки LQA. AI проверява предварително, не одобрява.
  • Имайки същия модел, проверете собствения си превод. Сляпо място; необходима е кръстосана проверка.
  • Без грешки при претегляне. Виждането на критично и второстепенно като едно и също нарушава приоритета.
  • Коригиране на „грешки“, създадени от AI, без да ги потвърждавате. Можете да изкривите правилното изречение.

Автоматични показатели: BLEU, COMET и лимити

Съществува и свят на автоматизирани показатели в измерването на качеството. BLEU (Bilingual Evaluation Understudy) сравнява машинен превод с човешки превод и дава резултат от 0-100 въз основа на припокриване на думи; Това беше стандарт за сравняване на MT системи за дълго време. По-нова метрика, COMET, е базирана на невронна мрежа и улавя семантичното сходство по-добре от BLEU. Тези показатели са ценни за бързо и автоматично сравняване на две машини за големи данни.

Но границите му са ясни: Метрики като BLEU разглеждат припокриването на думи, без да разбират наистина значението. Превод, който се различава от препратката, но е точен, може да получи ниска оценка; Превод, който е подобен на препратката, но е неправилен, може да получи висока оценка. Критичната отрицателна грешка е една дума, така че има малко влияние върху показателя, но всъщност е катастрофална. Ето защо автоматизираните показатели измерват тенденциите на системно ниво, а не решават възможността за доставяне на отделен текст. Базираната на MQM човешка оценка и експертна преценка решават дали даден превод отива на клиента, а не автоматична оценка. Използвайте показателите като компас, а не съдник.

В обобщение

Качеството на превода не е субективно усещане, то е нещо измеримо. Автоматичното QA щателно сканира за формални грешки; човешкият LQA оценява значението, тона и културата; Рамките за грешки като MQM количествено определят качеството по категория и тежест, позволявайки обективно сравнение. AI е мощно второ око, което ускорява този контрол, но може да бъде сляп за собствения си превод, да прави грешки и да не успее да разбере напълно тежестта на реалния свят; Следователно окончателното решение за качество, теглото и одобрението за доставка принадлежат на компетентния преводач.

Задача за приложение

Получете изход за машинен превод. Първо избройте формалните грешки с „автоматична допълнителна проверка на QA“, след това избройте езиковите грешки по категория и тежест с „проверка на грешки, базирана на MQM“. Оценявам всяка грешка (критична 10, голяма 5, малка 1) с праг на дума и питам „може ли да бъде доставена?“ Отговорете на въпроса. И накрая, потвърдете с източника колко от грешките, отбелязани от AI, са реални и колко са измислени.

контролен списък

  • [ ] Пуснах автоматична проверка на качеството и изчистих всякакви формални грешки.
  • [ ] Маркирах езиковите грешки с кутийка (категория + тегло).
  • [ ] Сканирах критични грешки в отделен кръг с приоритет.
  • [ ] Намерих AI контрола и го проверих кръстосано с различен модел, ако е необходимо.
  • [ ] Взех решението за доставка въз основа на числения праг и моята собствена експертна преценка.