Добивки:
- Способност да се направи разлика помеѓу автоматските QA и лингвистичките слоеви LQA и да се применат и двете во правилен редослед
- Способност за објективно оценување на преводот според категоријата и тежината (критична/голема/мала) со рамка за грешка како што е MQM
- Способност да се донесе конечната одлука кога се користи вештачката интелигенција како ревизор, знаејќи ја нејзината слепило за сопствениот превод, ризикот од правење грешки и границите на автоматизираната метрика
Во моментот кога ќе кажете дека преводот е „завршен“, тоа е половина од работата; Другата половина е да докаже дека тој превод е всушност сигурен. Во оваа единица, ќе научите систематски начини за мерење на квалитетот на преводот: автоматизирани проверки на QA, рамки за грешки за LQA базирани на луѓе, метрика за квалитет и како да се користи вештачката интелигенција како „инспектор“ - и нејзините граници. Целта е да се тргнеме од субјективноста на „Мислам дека е добро“ и да станеме експерт кој дефинира, мери и докажува квалитет.
Два типа на контрола на квалитетот: автоматска и лингвистичка
QA (Обезбедување на квалитет) работи во два слоја во преводот:
Автоматски QA: Стилски грешки што ги фаќаат алатките и скриптите CAT - неусогласеност со броеви, недостижен/вишок простор, неконзистентен термин, непреведен сегмент, лоша местенка/ознака, двоен простор, интерпункција. Тие се скенираат брзо и целосно со машина; Избега од човечкото око, но возилото го фаќа.
LQA (јазично осигурување на квалитет): Ова е слој каде што човечкиот оценувач го испитува значењето, терминологијата, стилот, граматиката и локалната соодветност. Автоматизирана ОК "дали бројот се совпаѓа?" го гледа прашањето; LQA „дали значењето е точно, дали тонот е соодветен, дали е културно соодветен? Тој го гледа прашањето. Двете се надополнуваат еден со друг; Едното не го заменува другото.
Совет: Секогаш прво активирајте Auto QA; Чистењето на формалните грешки му овозможува на човечкиот оценувач да посвети внимание на вистински јазични проблеми. Рецензентот кој се мачи со грешката со бројот ќе ја пропушти грешката во тонот.
Рамки за грешки: MQM и DQF
Стандардните типологии на грешки се користат за да се направи квалитетот мерлив наместо „добар/лош“. Најчеста е MQM (Мултидимензионална метрика за квалитет): ја доделува секоја грешка на категорија (точност, флуентност, терминологија, стил, локација, формат) и тежина (критична, голема, помала). Друга рамка е DQF (Dynamic Quality Framework) и се споменува заедно со MQM.
Зошто е важно? Бидејќи со оваа рамка, можете да дадете оценка за грешка на преводот, објективно да споредувате различни преведувачи/мотори и да прашате „дали може овој текст да се испорача?“ На прашањето одговарате со нумерички праг. На пример: критична грешка = 10 поени, голема = 5, мала = 1; текст под одреден праг поминува по одреден збор.
Критична грешка: грешка што го превртува значењето, создава безбедносен/правен ризик, го оштетува брендот (погрешна доза, „не одговорен“ наместо „одговорен“). Главни: нарушувачки, но безопасен. Мало: забележливо, но не го одзема значењето (ситен стил/ интерпункција).
Користење на вештачката интелигенција како контролер - и нејзините граници
Вештачката интелигенција е брза и корисна за проверка на преводот во однос на рамката за грешки: можете да кажете „означете ја исправноста, терминологијата, флуентните грешки во овој превод со категориите MQM“. Ги намалува вашите слепи точки и ви дава брзо „второ око“.
Но, постојат три критични граници: (1) вештачката интелигенција може да биде слепа кога го проверува преводот што го произведува - и правејќи и потврдувајќи ја истата грешка; вкрстена проверка со различен модел или вратете се на изворот. (2) ВИ може да направи и халуцинаторни „грешки“ - пријави грешка што не постои; Потврдете го секое предупредување. (3) вештачката интелигенција може да не ја сфати целосно сериозноста на критичната грешка во реалниот свет (грешка во дозата може да биде фатална); Експертот го прави мерењето. Така, вештачката интелигенција го забрзува QA, но конечната одлука за квалитет и одобрување за испорака лежи кај човекот.
Внимание: да се каже „Ви го положи QA, чист е“ е лажно чувство на доверба. Ревизијата на вештачката интелигенција не е замена за човечката LQA и споредба со изворот; тоа е слој од пред-скрининг што ги доведува до брзина.
три мини футроли
Случај 1 - Автоматизираниот QA пронајде 40 грешки со броеви. Во преводот на финансискиот извештај, автоматизираниот QA фати 40 несовпаѓања на броеви/формати помеѓу изворот и целта (илјада одвојувач, децимален, валута). Човечкото око би ги пропуштило повеќето од овие; возилото наведено во секунди.
Случај 2 - резултатот MQM доведе до избор на мотор. Едно биро MQM го оцени излезот на два различни MT мотори со 2.000 зборови: Мотор А 12 поени за грешка, Мотор Б 31. Објективното мерење ја реши дебатата „што е подобро“ со резултат; Бирото го направи моторот А стандард и соодветно го планираше неговиот буџет по ревизијата.
Случај 3 - Ревизијата на вештачката интелигенција ја пропушти сопствената грешка. Преведувач имал превод на LLM надгледуван од истиот LLM; Манекенката рече „нема проблем“, терминолошка грешка што самата ја направи. Грешката беше откриена кога преведувачот вкрстено проверуваше со различен модел и извор; Тимот го усвои правилото дека „истиот модел не треба да се контролира себеси“.
Четири шаблони за копирање
1) Проверка на грешки базирана на MQM:
Вашата улога: оценувач на LQA. Споредете го изворот и преводот подолу. Секоја грешка што ќе ја најдете наведете ја во следниот формат: [категорија: точност/терминологија/флуентност/стил/формат][тежина: критична/главна/мала] [локација] [коментар] [корекција]. Обележете го предупредувањето за кое не сте сигурни како „потребна е потврда“; errorfabrication.Извор: [...] | Превод: [...]
2) Скенирање на критична грешка (висок ризик):
Побарајте критични грешки САМО во преводот подолу: што значи инверзија, грешка број/доза/датум, губење на негација, замена на законска обврска, грешка во предупредувањето за безбедност. Игнорирајте ситни проблеми со стилот. Наведете го изворот за секој критичен наод.Извор: [...] | Превод: [...]
3) Автоматска дополнителна контрола за ОК:
Наведете ги формалните недоследности во следните парови извор-цел: несовпаѓање на броеви, недостасува/дополнително место за место или ознака, неконзистентен термин, непреведен сегмент, разлика единица/валута. Само дајте ги проблемите со нивната локација. Парови: [...]
4) Независно второ око (вкрстена проверка):
Оценете го овој превод БЕЗ ПРЕДРАСУДИ; Не претпоставувајте дека сте го напишале. Дајте му на изворот оцена за квалитет (1-5) за верност, терминологија и природност и наведете ги првите 3 проблеми. На мене е да одлучам. Извор: [...] | Превод: [...]
Слаб промпт / Силен промпт
Слаб: "Дали е овој превод добар?" (Без критериуми; вештачката интелигенција враќа бескорисен одговор како „генерално добро“.)
Силно: "Проверете го овој превод во однос на изворот. Обележете ја секоја грешка со категорија (точност/терминологија/флуентност) и сериозност (критична/голема/ситна). Фокусирајте се особено на грешките во број, негација и терминологија. Не фабрикувајте грешки; означете „потребна е потврда“ ако не сте сигурни."
Разлика: силната порака дава рамка за грешка и фокус; Резултатот е споредлив и остварлив извештај за квалитет.
Табела со слоеви за квалитет
слој
што фаќа
Кој/што прави
Автоматски ОК
Број, етикета, конзистентност
Алатка/скрипта
Контрола на вештачка интелигенција
Можни грешки во значењето/терминологијата
LLM (со потврда)
Човечка LQA
Значење, тон, култура, тежина
стручен оценувач
Резултат на MQM/DQF
Оценка за објективна грешка
човек со рамка
Потврда за испорака
крајна одговорност
компетентен преведувач
Вообичаени грешки
- Прескокнување на автоматизираниот QA и директно влегување во читање. Стилските грешки го одвлекуваат вниманието.
- Замена на инспекцијата со вештачка интелигенција со човечки LQA. AI пред-екран, не одобрува.
- Имајќи го истиот модел, проверете го неговиот сопствен превод. Слепа точка; потребна е вкрстена проверка.
- Не грешки при мерење. Гледањето на критичното и малолетното како исто го нарушува приоритетот.
- Исправување на „грешките“ направени од вештачката интелигенција без нивно потврдување. Можете да ја искривувате точната реченица.
Автоматска метрика: BLEU, COMET и ограничувања
Исто така, постои свет на автоматизирани метрики во мерењето на квалитетот. BLEU (Двојазично Евалуациско Подучување) споредува машински превод со човечки референтен превод и дава оценка од 0-100 врз основа на преклопување на зборовите; Тоа беше стандард за споредување на МТ системите долго време. Поновата метрика, COMET, е базирана на невронска мрежа и ја доловува семантичката сличност подобро од BLEU. Овие метрики се вредни за брзо и автоматско споредување на два мотори на големи податоци.
Но, нејзините граници се јасни: метриката како BLEU го гледа преклопувањето на зборовите, не разбирајќи го навистина значењето. Преводот што се разликува од референцата, но е точен може да добие низок резултат; Преводот што е сличен на референцата, но неточен може да добие висока оценка. Критична грешка во негативноста е само еден збор, така што има мало влијание врз метриката, но всушност е катастрофална. Затоа, автоматизираната метрика ги мери трендовите на системско ниво, а не одлучува за достапноста на поединечен текст. Човечката евалуација и стручното расудување заснована на MQM одлучуваат дали преводот оди кај клиентот, а не автоматскиот резултат. Користете ја метриката како компас, а не како судија.
Сумирано
Квалитетот на преводот не е субјективно чувство, тоа е нешто мерливо. Автоматскиот QA темелно скенира за формални грешки; човечката LQA го проценува значењето, тонот и културата; Рамките за грешки како што е MQM го квантифицираат квалитетот по категорија и тежина, овозможувајќи објективна споредба. Вештачката интелигенција е моќно второ око што ја забрзува оваа контрола, но може да биде слепа за сопствениот превод, да прави грешки и да не успее целосно да ја сфати тежината на реалниот свет; Затоа, конечната одлука за квалитет, пондерирање и одобрение за испорака припаѓа на надлежниот преведувач.
Задача за апликација
Добијте излез за машински превод. Наведете ги формалните грешки прво со „автоматска дополнителна проверка на QA“, потоа наведете ги јазичните грешки по категорија и тежина со „проверка на грешки базирана на MQM“. Ја оценувам секоја грешка (критична 10, голема 5, помала 1) со праг по збор и прашувам „дали може да се испорача?“ Одговорете на прашањето. Конечно, потврдете со изворот колку од грешките означени од вештачката интелигенција се реални и колку се измислени.
листа за проверка
- [ ] Истрчав автоматски QA и ги исчистив сите формални грешки.
- [ ] Ги означив јазичните грешки со квадрат (категорија + тежина).
- [ ] Ги скенирав критичните грешки во посебен круг со приоритет.
- [ ] Ја набавив контролата на вештачката интелигенција и ја проверив со различен модел доколку е потребно.
- [ ] Одлуката за испорака ја донесов врз основа на нумеричкиот праг и моето стручно мислење.