Бірлік 8 / 11

Сапаны бақылау (QA), бағалау метрикасы және LQA

Табыстар:

  • Автоматты QA және лингвистикалық LQA деңгейлерін ажырату және екеуін де дұрыс тәртіпте қолдану мүмкіндігі
  • MQM сияқты қателік құрылымымен санат пен салмаққа (сыни/негізгі/кіші) сәйкес аударманы объективті бағалау мүмкіндігі
  • AI-ны аудитор ретінде пайдалану кезінде түпкілікті шешім қабылдау, оның өз аудармасына соқырлығын, қате жасау қаупін және автоматтандырылған көрсеткіштердің шектеулерін білу

Аударма «орындалды» деген сәтте бұл жұмыстың жартысы; Екінші жартысы - бұл аударманың шын мәнінде сенімді екенін дәлелдеу. Бұл бөлімде сіз аударма сапасын өлшеудің жүйелі тәсілдерін үйренесіз: автоматтандырылған QA тексерулері, адамға негізделген LQA қателік құрылымдары, сапа көрсеткіштері және AI-ны «тексеруші» ретінде қалай пайдалану керек — және оның шектері. Мұндағы мақсат – «жақсы деп ойлаймын» деген субъективтіліктен алыстап, сапаны анықтайтын, өлшейтін, дәлелдейтін сарапшы болу.

Сапаны бақылаудың екі түрі: автоматты және лингвистикалық

QA (Сапа кепілдігі) аудармада екі деңгейде жұмыс істейді:

Автоматтандырылған QA: CAT құралдары мен сценарийлері ұстайтын стильдік қателер — сан сәйкессіздігі, жетіспейтін/артық бос орын, сәйкес келмейтін термин, аударылмаған сегмент, нашар толтырғыш/тег, қос бос орын, тыныс белгілері. Олар машинамен жылдам және толық сканерленеді; Ол адамның көзінен қашады, бірақ көлік оны ұстап алады.

LQA (лингвистикалық сапаны қамтамасыз ету): Бұл адам бағалаушы мағынаны, терминологияны, стильді, грамматиканы және жергілікті орындылықты зерттейтін деңгей. Автоматтандырылған QA "сан сәйкес пе?" сұраққа қарайды; LQA «мағынасы дұрыс па, үні сәйкес пе, мәдениетке сәйкес пе?» Ол сұраққа қарайды. Екеуі бірін-бірі толықтырады; Біреуі екіншісін алмастырмайды.

Кеңес: әрқашан алдымен Auto QA іске қосыңыз; Формальды қателерді жою адам бағалаушысына нақты лингвистикалық мәселелерге назар аударуға мүмкіндік береді. Сан қатесіне алаңдаған шолушы дыбыс қатесін жіберіп алады.

Қате кадрлары: MQM және DQF

Қателердің стандартты типологиялары сапаны «жақсы/жаман» емес, өлшенетін ету үшін пайдаланылады. Ең кең таралғаны MQM (көпөлшемді сапа көрсеткіштері): ол әрбір қатені санатқа (дәлдік, еркіндік, терминология, стиль, жергілікті жер, пішім) және салмаққа (критикалық, негізгі, кішігірім) тағайындайды. Басқа құрылым - DQF (Динамикалық сапа шеңбері) және MQM-мен бірге айтылады.

Неліктен маңызды? Өйткені бұл құрылым арқылы сіз аудармаға қателік ұпай бере аласыз, әртүрлі аудармашыларды/қозғалтқыштарды объективті түрде салыстырып, «бұл мәтінді жеткізуге бола ма?» Деп сұрай аласыз. Сұраққа сандық шекпен жауап бересіз. Мысалы: сыни қате = 10 ұпай, негізгі = 5, кіші = 1; белгілі бір шектен төмен мәтін белгілі бір сөзге өтеді.

Сыни қате: мағынаны өзгертетін, қауіпсіздік/заңды тәуекелді тудыратын, брендке зиян келтіретін қате (дұрыс емес доза, «жауапты» орнына «жауапты емес»). Негізгі: бұзушы, бірақ зиянсыз. Минор: байқалады, бірақ мағынасын бұзбайды (минор стилі/тыныс белгілері).

AI контроллер ретінде пайдалану — және оның шектері

AI жылдам және қателік шеңберіне қарсы аударманы тексеруге көмектеседі: сіз «MQM санаттарымен осы аудармадағы дұрыстығын, терминологиясын, еркін сөйлеу қателерін белгілеңіз» деп айта аласыз. Ол соқыр дақтарды азайтады және жылдам «екінші көзді» береді.

Бірақ үш маңызды шектеулер бар: (1) AI өзі шығарған аударманы тексеру кезінде соқыр болуы мүмкін — бірдей қатені жасау және растау; басқа үлгімен салыстырыңыз немесе көзге оралыңыз. (2) AI сонымен қатар галлюцинаторлық «қателерді» жасай алады — жоқ қате туралы хабарлау; Әрбір ескертуді растаңыз. (3) AI сыни қатенің нақты ауырлығын толық түсінбеуі мүмкін (доза қатесі өлімге әкелуі мүмкін); Салмақты маман жасайды. Осылайша, AI QA жылдамдығын арттырады, бірақ соңғы сапа шешімі мен жеткізуді мақұлдау адамға байланысты.

Абайлаңыз: «AI QA-дан өтті, ол таза» деп айту жалған сенім сезімі болып табылады. AI аудиті адамның LQA-сын алмастыру және дереккөзбен салыстыру емес; бұл олардың жылдамдығын арттыратын алдын ала скринингтік қабат.

үш шағын іс

1-жағдай — Автоматтандырылған QA 40 сан қатесін тапты. Қаржылық есепті аудару кезінде автоматтандырылған QA бастапқы және мақсат (мыңдық бөлгіш, ондық, валюта) арасындағы 40 сан/пішім сәйкессіздігін анықтады. Адамның көзі бұлардың көпшілігін сағынады; секундтарда көрсетілген көлік.

2-жағдай — MQM ұпайы қозғалтқышты таңдауға әкелді. Бір бюро MQM екі түрлі MT қозғалтқышының шығысын 2000 сөзбен бағалады: A қозғалтқышы 12 қателік ұпай, B қозғалтқышы 31. Объективті өлшеу «қайсысы жақсы» дебатын ұпаймен шешті; Бюро A қозғалтқышын стандартқа айналдырды және соған сәйкес қайта қараудан кейінгі бюджетті жоспарлады.

3-жағдай – AI аудиті өз қатесін жіберіп алды. Аудармашы LLM аудармасын сол LLM қадағалап отырды; Модель "проблема жоқ" деді, ол өзі жасаған терминологиялық қате. Аудармашы басқа үлгі мен дереккөзді салыстырып тексергенде қате анықталды; Команда «бір үлгі өзін-өзі басқаруға болмайды» деген ережені қабылдады.

Көшірілетін төрт үлгі

1) MQM негізіндегі қателерді тексеру:

Сіздің рөліңіз: LQA бағалаушысы. Төмендегі дереккөз бен аударманы салыстырыңыз. Сіз тапқан әрбір қатені келесі пішімде көрсетіңіз: [санат: дәлдік/терминология/ еркіндік/стиль/пішім][салмақ: маңызды/негізгі/кіші] [орын] [түсініктеме] [түзету]. Өзіңізге сенімді емес ескертуді «растау қажет» деп белгілеңіз; қате жасау.Дереккөз: [...] | Аударма: [...]

2) Критикалық қателерді сканерлеу (жоғары тәуекел):

ТЕК маңызды қателерді төмендегі аудармадан іздеңіз: мағынаның инверсиясы, сан/доза/күн қатесі, теріске шығаруды жоғалту, заңды міндеттемені ауыстыру, қауіпсіздік туралы ескерту қатесі. Кішігірім сәндеу мәселелерін елемеңіз. Әрбір сыни қорытынды үшін дереккөзді келтіріңіз.Дереккөз: [...] | Аударма: [...]

3) Автоматты QA қосымша бақылауы:

Келесі көз-мақсат жұптарындағы формальды сәйкессіздіктерді тізімдеңіз: сан сәйкессіздігі, жоқ/қосымша толтырғыш немесе тег, сәйкес келмейтін термин, аударылмаған сегмент, бірлік/валюта айырмашылығы. Тек олардың орналасуына қатысты мәселелерді беріңіз. Жұптар: [...]

4) Тәуелсіз екінші көз (кросс-тексеру):

Бұл аударманы ПАРТИЯСЫЗ бағалаңыз; Сіз жазды деп ойламаңыз. Дереккөзге шынайылық, терминология және табиғилық үшін сапа бағасын (1-5) беріңіз және ең басты 3 мәселені тізіп қойыңыз. Шешім менің қолымда. Дереккөз: [...] | Аударма: [...]

Әлсіз шақыру / Күшті шақыру

Әлсіз: «Бұл аударма жақсы ма?» (Ешқандай критерий жоқ; AI «жалпы жақсы» сияқты пайдасыз жауапты қайтарады.)

Күшті: "Бұл аударманы дереккөзге қарсы тексеріңіз. Әрбір қатені санатпен (дәлдік/терминология/еркіндік) және ауырлықпен (өте маңызды/маңызды/болмашы) белгілеңіз. Әсіресе сан, теріске шығару және терминологиялық қателерге назар аударыңыз. Қателерді ойлап шығармаңыз; сенімсіз болсаңыз, "растау қажет" деп белгілеңіз."

Айырмашылық: күшті шақыру қате кадры мен фокус береді; Шығару - салыстырмалы және әрекет етуге болатын сапа есебі.

Сапа қабаттары кестесі

қабат

не ұстайды

Кім/не істейді

Автоматты QA

Сан, белгі, консистенциясы

Құрал/скрипт

AI басқару

Мүмкін мағына/терминологиялық қателер

LLM (растаумен)

Адамның LQA

Мағынасы, үні, мәдениеті, салмағы

сарапшы бағалаушы

MQM/DQF ұпайы

Объективті қателік балл

жақтауы бар адам

Жеткізуді растау

түпкілікті жауапкершілік

сауатты аудармашы

Жалпы қателер

  • Автоматтандырылған QA өткізіп жіберіп, бірден оқуға кірісіңіз. Стильдік қателер назарды аударады.
  • AI инспекциясын адамның LQA-мен ауыстыру. AI алдын ала экранға шығарады, мақұлдамайды.
  • Бір үлгіге ие бола отырып, өз аудармасын тексеріңіз. Соқыр нүкте; айқас тексеру қажет.
  • Салмақ қателері емес. Сыни және кішігірім нәрсені бірдей көру басымдылықты бұзады.
  • AI жасаған «қателерді» оларды растамай түзету. Дұрыс сөйлемді бұрмалауға болады.

Автоматты көрсеткіштер: BLEU, COMET және шектеулер

Сапаны өлшеуде автоматтандырылған метрика әлемі де бар. BLEU (Bilingual Evaluation Understudy) машиналық аударманы адамның анықтамалық аудармасымен салыстырады және сөздердің қабаттасуына негізделген 0-100 ұпай береді; Бұл ұзақ уақыт бойы МТ жүйелерін салыстыру үшін стандарт болды. Жаңа метрика, COMET, нейрондық желіге негізделген және BLEU-ге қарағанда семантикалық ұқсастықты жақсырақ түсіреді. Бұл көрсеткіштер үлкен деректердегі екі қозғалтқышты жылдам және автоматты түрде салыстыру үшін құнды.

Бірақ оның шектері анық: BLEU сияқты көрсеткіштер сөздің қабаттасуына қарайды, мағынасын түсінбейді. Анықтамадан өзгеше, бірақ дәл аударма төмен балл алуы мүмкін; Анықтамаға ұқсас, бірақ қате аударма жоғары балл алуы мүмкін. Критикалық теріс қате - бұл бір сөз, сондықтан ол метрикаға аз әсер етеді, бірақ шын мәнінде апатты. Сондықтан автоматтандырылған көрсеткіштер жеке мәтіннің жеткізілу мүмкіндігін емес, жүйе деңгейіндегі үрдістерді өлшейді. MQM негізіндегі адамның бағалауы және сарапшылық пікірі автоматты баға емес, аударманың клиентке өтуін шешеді. Көрсеткіштерді судья емес, компас ретінде пайдаланыңыз.

Қысқаша

Аударма сапасы субъективті сезім емес, ол өлшенетін нәрсе. Автоматты QA ресми қателерді мұқият сканерлейді; адамның LQA мағынасын, үнін және мәдениетін бағалайды; MQM сияқты қателік құрылымдар объективті салыстыруға мүмкіндік беретін санат пен салмақ бойынша сапаны анықтайды. AI - бұл басқаруды тездететін қуатты екінші көз, бірақ ол өз аудармасына соқыр болуы, қателесуі және нақты әлемдегі салмақты толық түсінбеуі мүмкін; Сондықтан соңғы сапа шешімі, салмақтау және жеткізуді бекіту құзыретті аудармашыға тиесілі.

Қолданбалы тапсырма

Машиналық аударманың нәтижесін алыңыз. Формальды қателерді алдымен «автоматты QA қосымша тексеру» арқылы тізімдеңіз, содан кейін «MQM негізіндегі қателерді тексеру» арқылы санат пен салмақ бойынша лингвистикалық қателерді тізімдеңіз. Мен әрбір қатені (сыни 10, негізгі 5, кіші 1) сөзге шекті мәнмен бағалаймын және «оны жеткізуге бола ма?» деп сұраймын. Сұраққа жауап беріңіз. Соңында, AI белгілеген қателердің қаншасы нақты және қаншасы ойдан шығарылғанын дереккөзбен растаңыз.

бақылау парағы

  • [ ] Мен автоматты QA іске қостым және кез келген ресми қателерді тазаладым.
  • [ ] Тілдік қателерді қораппен белгіледім (санат + салмақ).
  • [ ] Мен маңызды қателерді бөлек, басымдық берілген раундта сканерледім.
  • [ ] Мен AI басқару құралын алдым және қажет болса, оны басқа үлгімен тексердім.
  • [ ] Жеткізу туралы шешімді сандық шек пен өзімнің сараптамалық пікірім негізінде қабылдадым.