Печалби:
- Възможност за разграничаване между автоматичния QA и езиковия LQA слоеве и прилагане и на двата в правилния ред
- Възможност за обективна оценка на превода според категория и тежест (критични/големи/незначителни) с рамка за грешки като MQM
- Да можеш да вземеш окончателното решение, когато използваш AI като одитор, знаейки неговата слепота за собствения си превод, риска от допускане на грешки и ограниченията на автоматизираните показатели
В момента, в който кажете, че преводът е „свършен“, това е половината работа; Другата половина е да се докаже, че този превод наистина е надежден. В този модул ще научите систематични начини за измерване на качеството на превода: автоматизирани проверки на качеството, базирани на хора рамки за грешки на LQA, показатели за качество и как да използвате AI като „инспектор“ — и неговите ограничения. Целта е да се отдалечите от субективизма „аз мисля, че е добре“ и да станете експерт, който определя, измерва и доказва качеството.
Два вида контрол на качеството: автоматичен и езиков
QA (Осигуряване на качеството) работи на два слоя в превода:
Автоматизирана проверка на качеството: Стилистични грешки, които CAT инструментите и скриптовете улавят — несъответствие на числата, липсващо/излишно пространство, непоследователен термин, непреведен сегмент, лош заместител/етикет, двоен интервал, пунктуация. Те се сканират бързо и напълно машинно; Убягва на човешкото око, но превозното средство го улавя.
LQA (Осигуряване на езиково качество): Това е нивото, където човешкият оценител изследва значението, терминологията, стила, граматиката и местната уместност. Автоматизирано QA "съвпада ли числото?" разглежда въпроса; LQA „вярно ли е значението, подходящ ли е тонът, културно подходящ ли е?“ Той поглежда въпроса. Двете се допълват; Едното не замества другото.
Съвет: Винаги първо стартирайте Auto QA; Изчистването на формалните грешки позволява на човешкия оценител да обърне внимание на реални езикови проблеми. Рецензент, който се занимава с грешката в номера, ще пропусне грешката в тона.
Рамки за грешки: MQM и DQF
Стандартните типологии за грешки се използват, за да направят качеството измеримо, а не „добро/лошо“. Най-разпространеният е MQM (Многоизмерна метрика на качеството): той присвоява всяка грешка на категория (точност, плавност, терминология, стил, местоположение, формат) и тежест (критична, голяма, второстепенна). Друга рамка е DQF (Dynamic Quality Framework) и се споменава заедно с MQM.
Защо е важно? Тъй като с тази рамка можете да дадете резултат за грешка на превод, обективно да сравните различни преводачи/машини и да попитате „може ли този текст да бъде доставен?“ Отговаряте на въпроса с цифров праг. Например: критична грешка = 10 точки, голяма = 5, малка = 1; текст под определен праг преминава за определена дума.
Критична грешка: грешка, която преобръща смисъла, създава риск за сигурността/правен, уврежда марката (грешна доза, „не е отговорен“ вместо „отговорен“). Основен: разрушителен, но безвреден. Минорен: забележимо, но не омаловажаващо значението (минорен стил/пунктуация).
Използване на AI като контролер — и неговите ограничения
AI е бърз и полезен при проверка на превод спрямо рамката за грешки: можете да кажете „отбележете коректност, терминология, грешки в плавността в този превод с категории MQM“. Намалява вашите слепи петна и ви дава бързо „второ око“.
Но има три критични ограничения: (1) AI може да бъде сляп, когато проверява превода, който произвежда - както прави, така и потвърждава една и съща грешка; кръстосана проверка с различен модел или връщане към източника. (2) ИИ може също така да измисля халюцинаторни „грешки“ — докладва за грешка, която не съществува; Потвърдете всяко предупреждение. (3) изкуственият интелект може да не разбере напълно сериозността на критична грешка в реалния свят (грешка в дозата може да бъде фатална); Експертът извършва претеглянето. Така че AI ускорява QA, но окончателното решение за качество и одобрението за доставка е на човека.
Внимание: Казването „ИИ е преминал QA, чист е“ е фалшиво чувство на увереност. AI одитът не е заместител на човешкия LQA и сравнение с източника; това е слой за предварителна проверка, който ги ускорява.
три мини калъфа
Случай 1 — Автоматизираната проверка на качеството откри 40 грешки в числата. При превод на финансов отчет автоматизираната проверка на качеството улови 40 несъответствия на число/формат между източник и цел (разделител за хиляди, десетичен знак, валута). Човешкото око би пропуснало повечето от тях; превозно средство, изброено за секунди.
Случай 2 — Резултатът от MQM доведе до избор на двигател. Едно бюро MQM оцени изхода на две различни MT машини на 2000 думи: Engine A 12 грешки, Engine B 31. Обективното измерване разреши дебата „кое е по-добро“ с резултат; Бюрото направи Engine A стандарт и планира бюджета си след ревизията съответно.
Случай 3 — AI одитът пропусна собствената си грешка. Преводач е имал превода на LLM, наблюдаван от същия LLM; Моделът каза „няма проблем“, терминологична грешка, която тя направи. Грешката беше разкрита, когато преводачът направи кръстосана проверка с различен модел и източник; Екипът възприе правилото, че "един и същ модел не трябва да се контролира".
Четири копируеми шаблона
1) MQM базирана проверка на грешки:
Вашата роля: LQA оценител. Сравнете източника и превода по-долу. Предоставете всяка открита грешка в следния формат: [категория: точност/терминология/плавност/стил/формат][тежест: критична/голяма/незначителна] [местоположение] [коментар] [корекция]. Маркирайте предупреждението, за което не сте сигурни, като „изисква се потвърждение“; errorfabrication.Източник: [...] | Превод: [...]
2) Сканиране за критични грешки (висок риск):
Търсете критични грешки САМО в превода по-долу: означаваща инверсия, грешка номер/доза/дата, загуба на отрицание, заместване на правно задължение, грешка в предупреждението за безопасност. Игнорирайте дребните проблеми със стила. Цитирайте източника за всяко критично откритие. Източник: [...] | Превод: [...]
3) Автоматичен QA допълнителен контрол:
Избройте формалните несъответствия в следните двойки източник-цель: несъответствие на числото, липсващ/допълнителен контейнер или етикет, непоследователен термин, непреведен сегмент, разлика в единица/валута. Просто дайте проблемите с местоположението им. Двойки: [...]
4) Независимо второ око (кръстосана проверка):
Оценявайте този превод БЕЗ ПРЕДРАЗУДНОСТИ; Не предполагайте, че вие сте го написали. Дайте на източника оценка за качество (1-5) за вярност, терминология и естественост и избройте първите 3 проблема. От мен зависи да реша. Източник: [...] | Превод: [...]
Слаба подкана / Силна подкана
Слаб: „Този превод добър ли е?“ (Няма критерии; AI връща безполезен отговор като „като цяло добър.“)
Силно: „Проверете този превод спрямо източника. Етикетирайте всяка грешка с категория (точност/терминология/плавност) и сериозност (критична/голяма/малка). Фокусирайте се особено върху числови, отрицателни и терминологични грешки. Не измисляйте грешки; маркирайте „необходимо е потвърждение“, ако не сте сигурни.“
Разлика: силната подкана дава рамка за грешка и фокус; Резултатът е сравним и приложим отчет за качеството.
Таблица с качествени слоеве
слой
какво хваща
Кой/какво прави
Автоматична проверка на качеството
Брой, етикет, консистенция
Инструмент/скрипт
AI контрол
Възможни грешки в значението/терминологията
LLM (с потвърждение)
Човешки LQA
Значение, тон, култура, тежест
експерт-оценител
MQM/DQF оценка
Обективна оценка за грешка
човек с рамка
Потвърждение за доставка
крайната отговорност
компетентен преводач
Често срещани грешки
- Пропускане на автоматизираната проверка на качеството и преминаване направо към четене. Стилистичните грешки отвличат вниманието.
- Замяна на AI инспекция с човешки LQA. AI проверява предварително, не одобрява.
- Имайки същия модел, проверете собствения си превод. Сляпо място; необходима е кръстосана проверка.
- Без грешки при претегляне. Виждането на критично и второстепенно като едно и също нарушава приоритета.
- Коригиране на „грешки“, създадени от AI, без да ги потвърждавате. Можете да изкривите правилното изречение.
Автоматични показатели: BLEU, COMET и лимити
Съществува и свят на автоматизирани показатели в измерването на качеството. BLEU (Bilingual Evaluation Understudy) сравнява машинен превод с човешки превод и дава резултат от 0-100 въз основа на припокриване на думи; Това беше стандарт за сравняване на MT системи за дълго време. По-нова метрика, COMET, е базирана на невронна мрежа и улавя семантичното сходство по-добре от BLEU. Тези показатели са ценни за бързо и автоматично сравняване на две машини за големи данни.
Но границите му са ясни: Метрики като BLEU разглеждат припокриването на думи, без да разбират наистина значението. Превод, който се различава от препратката, но е точен, може да получи ниска оценка; Превод, който е подобен на препратката, но е неправилен, може да получи висока оценка. Критичната отрицателна грешка е една дума, така че има малко влияние върху показателя, но всъщност е катастрофална. Ето защо автоматизираните показатели измерват тенденциите на системно ниво, а не решават възможността за доставяне на отделен текст. Базираната на MQM човешка оценка и експертна преценка решават дали даден превод отива на клиента, а не автоматична оценка. Използвайте показателите като компас, а не съдник.
В обобщение
Качеството на превода не е субективно усещане, то е нещо измеримо. Автоматичното QA щателно сканира за формални грешки; човешкият LQA оценява значението, тона и културата; Рамките за грешки като MQM количествено определят качеството по категория и тежест, позволявайки обективно сравнение. AI е мощно второ око, което ускорява този контрол, но може да бъде сляп за собствения си превод, да прави грешки и да не успее да разбере напълно тежестта на реалния свят; Следователно окончателното решение за качество, теглото и одобрението за доставка принадлежат на компетентния преводач.
Задача за приложение
Получете изход за машинен превод. Първо избройте формалните грешки с „автоматична допълнителна проверка на QA“, след това избройте езиковите грешки по категория и тежест с „проверка на грешки, базирана на MQM“. Оценявам всяка грешка (критична 10, голяма 5, малка 1) с праг на дума и питам „може ли да бъде доставена?“ Отговорете на въпроса. И накрая, потвърдете с източника колко от грешките, отбелязани от AI, са реални и колко са измислени.
контролен списък
- [ ] Пуснах автоматична проверка на качеството и изчистих всякакви формални грешки.
- [ ] Маркирах езиковите грешки с кутийка (категория + тегло).
- [ ] Сканирах критични грешки в отделен кръг с приоритет.
- [ ] Намерих AI контрола и го проверих кръстосано с различен модел, ако е необходимо.
- [ ] Взех решението за доставка въз основа на числения праг и моята собствена експертна преценка.