Јединица 8 / 11

Контрола квалитета (КА), метрика евалуације и ЛКА

Добици:

  • Способност да се направи разлика између аутоматских КА и језичких ЛКА слојева и примени оба у исправном редоследу
  • Способност објективне процене превода према категорији и тежини (критични/већи/мањи) са оквиром грешака као што је МКМ
  • Бити у стању да донесе коначну одлуку када се АИ користи као ревизор, зна да је слепило за сопствени превод, ризик од грешака и ограничења аутоматизованих метрика

Оног тренутка када кажете да је превод "готов", то је пола посла; Друга половина је да докаже да је тај превод заправо поуздан. У овој јединици ћете научити систематске начине за мерење квалитета превода: аутоматизоване провере квалитета, оквире грешака ЛКА засноване на људима, метрику квалитета и како да користите АИ као „инспектора“ – и његове границе. Циљ је да се одмакнемо од субјективности „мислим да је добро“ и постане стручњак који дефинише, мери и доказује квалитет.

Две врсте контроле квалитета: аутоматска и лингвистичка

КА (Куалити Ассуранце) ради у два слоја у преводу:

Аутоматизовани КА: Стилске грешке које ЦАТ алати и скрипте хватају — неподударање бројева, недостатак/вишак размака, недоследан термин, непреведени сегмент, лош чувар места/ознака, двоструки размак, интерпункција. Они се скенирају брзо и потпуно машински; Измиче људском оку, али га возило ухвати.

ЛКА (Лингуистиц Куалити Ассуранце): Ово је слој на којем људски евалуатор испитује значење, терминологију, стил, граматику и локалну прикладност. Аутоматски КА "да ли се број подудара?" гледа на питање; ЛКА „да ли је значење исправно, да ли је тон одговарајући, да ли је културолошки примерен?“ Он гледа на питање. То двоје се допуњују; Једно не замењује друго.

Савет: Увек прво покрените Ауто КА; Чишћење формалних грешака омогућава људском евалуатору да посвети пажњу стварним лингвистичким проблемима. Рецензент који се мучи са грешком у броју пропустиће грешку у тону.

Оквири грешака: МКМ и ДКФ

Стандардне типологије грешака се користе да би квалитет био мерљив, а не „добар/лош“. Најчешћи је МКМ (Мултидименсионал Куалити Метрицс): он свакој грешци додељује категорију (тачност, течност, терминологија, стил, локалитет, формат) и тежину (критична, главна, мања). Други оквир је ДКФ (Динамички оквир квалитета) и помиње се заједно са МКМ.

Зашто је то важно? Зато што са овим оквиром можете дати оцену грешке преводу, објективно упоредити различите преводиоце/машине и питати „може ли овај текст бити испоручен?“ На питање одговарате нумеричким прагом. На пример: критична грешка = 10 поена, велика = 5, мања = 1; текст испод одређеног прага пролази по одређеној речи.

Критична грешка: грешка која изокреће значење, ствара безбедносни/правни ризик, штети бренду (погрешна доза, „није одговоран“ уместо „одговоран“). Главни: ометајући, али безопасан. Мањи: приметан, али не умањује значење (мањи стил/интерпункција).

Коришћење вештачке интелигенције као контролора — и њена ограничења

АИ је брз и од помоћи у провери превода у односу на оквир грешака: можете рећи „означите исправност, терминологију, грешке у течности у овом преводу са МКМ категоријама“. Смањује ваше слепе углове и даје вам брзо "друго око".

Али постоје три критична ограничења: (1) АИ може бити слеп када проверава превод који производи — и да направи и потврди исту грешку; унакрсно проверите са другим моделом или се вратите извору. (2) АИ такође може да измисли халуцинантне „грешке“ — пријави грешку која не постоји; Потврдите свако упозорење. (3) АИ можда неће у потпуности схватити озбиљност критичне грешке у стварном свету (грешка дозе може бити фатална); Експерт врши мерење тежине. Дакле, АИ убрзава КА, али коначна одлука о квалитету и одобрење испоруке лежи на човеку.

Опрез: Рећи „АИ је прошао КА, чист је“ је лажни осећај самопоуздања. АИ ревизија није замена за људски ЛКА и поређење са извором; то је слој пре скрининга који их доводи до брзине.

три мини кофера

Случај 1 — Аутоматизовани КА је пронашао 40 грешака у броју. У преводу финансијског извештаја, аутоматизовани КА је ухватио 40 неподударања броја/формата између извора и циља (разделник хиљада, децимала, валута). Људско око би пропустило већину ових; возило наведено у секундама.

Случај 2 — МКМ резултат је довео до избора мотора. Један биро МКМ је оценио излаз два различита МТ мотора на 2.000 речи: мотор А 12 поена грешке, мотор Б 31. Објективно мерење је решило дебату „шта је боље“ резултатом; Биро је направио мотор А као стандард и у складу са тим планирао свој буџет након ревизије.

Случај 3 — АИ ревизија је пропустила сопствену грешку. Преводилац је имао превод ЛЛМ који је надгледао исти ЛЛМ; Манекенка је рекла "нема проблема", што је терминолошка грешка коју је сама направила. Грешка је откривена када је преводилац унакрсно проверио са другим моделом и извором; Тим је усвојио правило да "исти модел не треба да контролише сам себе".

Четири шаблона за копирање

1) Провера грешака заснована на МКМ:

Ваша улога: ЛКА проценитељ. Упоредите извор и превод испод. Наведите сваку грешку коју нађете у следећем формату: [категорија: тачност/терминологија/течност/стил/формат][тежина: критична/већа/мања] [локација] [коментар] [исправка]. Означите упозорење у које нисте сигурни као „потребна је потврда“; еррорфабрицатион.Извор: [...] | Превод: [...]

2) Скенирање критичне грешке (висок ризик):

Потражите критичне грешке САМО у преводу испод: инверзија значења, грешка у броју/дози/датуму, губитак негације, замена законске обавезе, грешка безбедносног упозорења. Занемарите мање проблеме са стилом. За сваки критички налаз наведите извор.Извор: [...] | Превод: [...]

3) Аутоматска додатна контрола квалитета:

Наведите формалне недоследности у следећим паровима извор-циљ: неподударање броја, недостајући/додатни чувар места или ознака, недоследан термин, непреведени сегмент, разлика у јединици/валути. Само наведите проблеме са њиховом локацијом. Парови: [...]

4) Независно друго око (унакрсна провера):

Оцените овај превод БЕЗ ПРЕДРАСУДА; Немојте претпостављати да сте то написали. Дајте извору оцену квалитета (1-5) за верност, терминологију и природност и наведите 3 највећа проблема. На мени је да одлучим. Извор: [...] | Превод: [...]

Слаби промпт / Јаки промпт

Слабо: "Да ли је овај превод добар?" (Нема критеријума; АИ враћа бескорисни одговор попут „генерално добро.“)

Јака: „Проверите овај превод у односу на извор. Означите сваку грешку категоријом (тачност/терминологија/течност) и озбиљношћу (критична/већа/мања). Фокусирајте се посебно на грешке у броју, негацији и терминологији. Не измишљајте грешке; означите „потребна је потврда“ ако нисте сигурни.“

Разлика: јак промпт даје оквир грешке и фокус; Резултат је упоредив извештај о квалитету који се може применити.

Табела слојева квалитета

слој

шта хвата

Ко/шта ради

Ауто КА

Број, ознака, конзистентност

Алат/скрипта

АИ контрола

Могуће грешке у значењу/терминологији

ЛЛМ (са потврдом)

ЛКА за људе

Значење, тон, култура, тежина

стручни евалуатор

МКМ/ДКФ резултат

Резултат објективне грешке

човек са оквиром

Потврда испоруке

крајња одговорност

компетентан преводилац

Уобичајене грешке

  • Прескакање аутоматизованог КА и прелазак директно на читање. Стилске грешке одвлаче пажњу.
  • Замена АИ инспекције људским ЛКА. АИ унапред прегледа, не одобрава.
  • Имајући исти модел, проверите сопствени превод. Блинд спот; потребна унакрсна провера.
  • Не пондерисане грешке. Гледање на критичне и минорне као на исто нарушава приоритет.
  • Исправљање "грешака" које је направила АИ без њиховог потврђивања. Можете искривити тачну реченицу.

Аутоматска метрика: БЛЕУ, ЦОМЕТ и границе

Постоји и свет аутоматизованих метрика у мерењу квалитета. БЛЕУ (Билингуал Евалуатион Ундерстуди) упоређује машински превод са људским референтним преводом и даје резултат од 0-100 на основу преклапања речи; То је био стандард за поређење МТ система дуго времена. Новија метрика, ЦОМЕТ, заснована је на неуронској мрежи и хвата семантичку сличност боље од БЛЕУ. Ове метрике су вредне за брзо и аутоматско поређење два механизма на великим подацима.

Али његове границе су јасне: метрике као што је БЛЕУ гледају на преклапање речи, не схватајући стварно значење. Превод који се разликује од референце, али је тачан, може добити ниску оцену; Превод који је сличан референци, али нетачан може добити високу оцену. Грешка критичне негативности је једна реч, тако да има мали утицај на метрику, али је заправо катастрофална. Зато аутоматизоване метрике мере трендове на нивоу система, а не одлучују о испоручивости појединачног текста. МКМ заснована људска евалуација и стручна процена одлучују да ли превод иде клијенту, а не аутоматски резултат. Користите метрику као компас, а не као судију.

Укратко

Квалитет превода није субјективан осећај, то је нешто мерљиво. Аутоматски КА темељно скенира формалне грешке; људски ЛКА процењује значење, тон и културу; Оквири грешака као што је МКМ квантификују квалитет по категорији и тежини, омогућавајући објективно поређење. АИ је моћно друго око које убрзава ову контролу, али може бити слепо за сопствени превод, правити грешке и не успети да у потпуности схвати тежину у стварном свету; Дакле, коначна одлука о квалитету, пондерисање и одобрење испоруке припада надлежном преводиоцу.

Задатак апликације

Добијте излаз машинског превода. Наведите формалне грешке прво са „аутоматском додатном провером квалитета“, а затим наведите језичке грешке по категорији и тежини са „провером грешака заснованом на МКМ“. Сваку грешку (критичних 10, великих 5, мање 1) оцењујем прагом по речи и питам „да ли се може испоручити?“ Одговори на питање. Коначно, потврдите са извором колико је грешака које је означила АИ стварне, а колико измишљене.

контролна листа

  • [ ] Покренуо сам аутоматску контролу квалитета и исправио све формалне грешке.
  • [ ] Језичке грешке сам означио квадратићем (категорија + тежина).
  • [ ] Скенирао сам критичне грешке у посебном кругу са приоритетом.
  • [ ] Добио сам АИ контролу и проверио је са другим моделом ако је потребно.
  • [ ] Одлуку о испоруци донео сам на основу нумеричког прага и сопственог стручног мишљења.