бирдиги 8 / 11

Сапатты көзөмөлдөө (QA), Баалоо метрикасы жана LQA

Пайдалар:

  • Автоматтык QA жана лингвистикалык LQA катмарларын айырмалоо жана экөөнү тең туура тартипте колдонуу мүмкүнчүлүгү
  • Категорияга жана салмакка (критикалык/негизги/кичинекей) жараша котормого объективдүү баа берүү мүмкүнчүлүгү, мисалы MQM сыяктуу ката алкагында
  • AIны аудитор катары колдонууда акыркы чечимди кабыл алуу, анын өзүнүн котормосуна сокур экенин, ката кетирүү коркунучун жана автоматташтырылган көрсөткүчтөрдүн чегин билүү

Котормо "бүттү" деп айткан учуруңуз иштин жарымы болот; Калган жарымы котормо чындыгында ишенимдүү экенин далилдейт. Бул бөлүмдө сиз котормонун сапатын өлчөөнүн системалуу жолдорун үйрөнөсүз: автоматташтырылган QA текшерүүлөрү, адамга негизделген LQA катасынын алкактары, сапаттын көрсөткүчтөрү жана AIны "инспектор" катары кантип колдонууну жана анын чектерин. «Менимче, бул жакшы» деген субъективдүүлүктөн алыстап, сапатты аныктап, өлчөп, далилдеген адис болуу максатын көздөйт.

Сапатты башкаруунун эки түрү: автоматтык жана лингвистикалык

QA (Сапаттын кепилдиги) котормодо эки катмарда иштейт:

Автоматташтырылган QA: CAT куралдары жана скрипттери байкаган стилистикалык каталар — сандын дал келбегендиги, жетишпеген/ашыкча мейкиндик, дал келбеген термин, которулбаган сегмент, начар толтургуч/тег, кош боштук, пунктуация. Булар машина менен тез жана толугу менен сканерленет; Ал адамдын көзүнөн качат, бирок унаа аны кармап калат.

LQA (Лингвистикалык сапатты камсыздоо): Бул адам баалоочу маанисин, терминологиясын, стилин, грамматикасын жана жергиликтүү ылайыктуулугун текшерген катмар. Автоматташтырылган QA "сан дал келеби?" суроого карайт; LQA "мааниси туурабы, обон туурабы, маданиятка ылайыктуубу?" Ал суроого карайт. Экөө бири-бирин толуктап турат; Бири экинчисин алмаштырбайт.

Кеңеш: Ар дайым биринчи Auto QA иштетиңиз; Формалдуу каталарды тазалоо адам баалоочуга чыныгы лингвистикалык көйгөйлөргө көңүл бурууга мүмкүндүк берет. Сан катасы менен убара болгон серепчи үн катасын өткөрүп жиберет.

Ката алкактары: MQM жана DQF

Каталардын стандарттык типологиялары сапатты "жакшы/жаман" эмес, өлчөө үчүн колдонулат. Эң кеңири таралганы MQM (көп өлчөмдүү сапат метрикасы): ал ар бир катаны категорияга (тактык, эркин, терминология, стиль, локалдуулук, формат) жана салмакка (критикалык, негизги, кичине) ыйгарат. Дагы бир негиз - DQF (Динамикалык сапат алкактары) жана MQM менен бирге айтылган.

Бул эмне үчүн маанилүү? Анткени бул алкак менен сиз котормого ката упай берип, ар кандай котормочуларды/кыймылдаткычтарды объективдүү салыштырып, "бул текстти жеткирүүгө болобу?" Сиз суроого сандык босого менен жооп бересиз. Мисалы: критикалык ката = 10 упай, негизги = 5, кичи = 1; Белгилүү бир босогодон төмөн текст белгилүү бир сөзгө өтөт.

Критикалык ката: маанисин өзгөрткөн, коопсуздук/укуктук тобокелдикти жараткан, брендге зыян келтирген ката (туура эмес доза, "жооптуу" дегендин ордуна "жооптуу эмес"). Негизги: бузуку, бирок зыянсыз. Кичинекей: байкалат, бирок маанисин кетирбейт (кичи стили/пунктуация).

AI башкаруучу катары колдонуу - жана анын чектери

AI ката алкагында котормону текшерүүдө тез жана пайдалуу: сиз "MQM категориялары менен бул котормонун тууралыгын, терминологиясын, эркин каталарын белгилеңиз" деп айта аласыз. Бул сиздин сокур тактарыңызды азайтат жана сизге тез "экинчи көздү" берет.

Бирок үч маанилүү чек бар: (1) AI өзү чыгарган котормону текшерүүдө сокур болушу мүмкүн — бир эле катаны жасап да, ырастап да; башка модель менен кайчылаш текшерүү же булакка кайтуу. (2) AI дагы галлюцинатордук "каталарды" түзө алат — жок ката жөнүндө кабарлайт; Ар бир эскертүүнү ырастаңыз. (3) AI критикалык катанын чыныгы дүйнөдөгү олуттуулугун толук түшүнө албашы мүмкүн (доза катасы өлүмгө алып келиши мүмкүн); Эксперт салмакты түзөт. Ошентип, AI QAны тездетет, бирок сапаттын акыркы чечими жана жеткирүү жактырылышы адам тарабынан болот.

Абайлаңыз: "AI QAдан өттү, таза" деп айтуу жалган ишеним сезими. AI аудити адамдын LQAсын алмаштыруу жана булак менен салыштыруу эмес; бул аларды ылдамдыкка жеткире турган алдын-ала кароо катмары.

үч мини учурлар

1-жагдай — Автоматташтырылган QA 40 сан катасын тапты. Финансылык отчеттун котормосунда автоматташтырылган QA булак менен максаттын ортосунда 40 сан/формат дал келбегендигин аныктады (миң бөлгүч, ондук, валюта). Адамдын көзү булардын көбүн сагынмак; секунданын ичинде тизмеленген унаа.

2-жагдай — MQM баллы кыймылдаткычты тандоого алып келди. Бир бюро MQM эки башка MT кыймылдаткычынын чыгышын 2000 сөз менен баалады: А кыймылдаткычы 12 ката баллы, В кыймылдаткычы 31. Объективдүү өлчөө "кайсысы жакшы" деген талашты упай менен чечти; Бюро А кыймылдаткычын стандарт кылып, кайра карап чыгуудан кийинки бюджетин ошого жараша пландаштырган.

3-жагдай - AI аудити өз катасын өткөрүп жиберди. Котормочу LLM котормосун ошол эле LLM көзөмөлдөгөн; Модель "проблема жок" деди, ал өзү кетирген терминологиялык ката. Котормочу башка модель жана булак менен кайчылаш текшергенде ката аныкталган; Команда "бир эле модель өзүн башкарбашы керек" деген эрежени кабыл алган.

Көчүрүү үчүн төрт шаблон

1) MQM негизинде ката текшерүү:

Сиздин ролуңуз: LQA баалоочусу. Төмөнкү булакты жана котормосун салыштырыңыз. Тапкан ар бир катаңызды төмөнкү форматта бериңиз: [категория: тактык/терминология/эркиндүүлүк/стиль/формат][салмак: критикалык/негизги/кичи] [жайгашкан жер] [комментарий] [түзөтүү]. Сиз ишенбеген эскертүүнү "тастыктоо талап кылынат" деп белгилеңиз; errorfabrication.Булак: [...] | Котормо: [...]

2) Критикалык каталарды сканерлөө (жогорку тобокелдик):

Критикалык каталарды Төмөндөгү котормодон ГАНА издеңиз: инверсия, сан/доза/дата катасы, жокко чыгаруу, юридикалык милдетти алмаштыруу, коопсуздук эскертүү катасы. Майда стилдеги көйгөйлөргө көңүл бурбаңыз. Ар бир критикалык табылга үчүн булакты келтириңиз.Булак: [...] | Котормо: [...]

3) Автоматтык QA кошумча контролу:

Төмөнкү булак-максат жуптарындагы формалдуу карама-каршылыктарды тизмектеңиз: сандын дал келбегендиги, жетишпеген/кошумча толтургуч же тег, дал келбеген термин, которулбаган сегмент, бирдик/валюта айырмасы. Жөн гана алардын жайгашкан жери менен көйгөйлөрдү бер. Жуптар: [...]

4) Көз карандысыз экинчи көз (кайчылаш текшерүү):

Бул котормого ПАРАМСЫЗ баа бериңиз; Сиз жазган деп ойлобоңуз. Булакка ишенимдүүлүгү, терминологиясы жана табигыйлыгы үчүн сапат рейтингин (1-5) бериңиз жана эң негизги 3 көйгөйдү тизмектеңиз. Муну мен чечишим керек. Булак: [...] | Котормо: [...]

Алсыз тездик / Күчтүү тездик

Алсыз: "Бул котормо жакшыбы?" (Критерийлер жок; AI "жалпысынан жакшы" сыяктуу пайдасыз жооп кайтарат.)

Күчтүү: "Бул котормонун булагына каршы текшериңиз. Ар бир катаны категория (тактык/терминология/эркиндик) жана катаалдыгы (критикалык/негизги/кичи) менен белгилеңиз. Өзгөчө сан, жокко чыгаруу жана терминология каталарына көңүл буруңуз. Каталарды ойлоп чыгарбаңыз; эгер ишенбесеңиз, "тастыктоо керек" деп белгилеңиз."

Айырмачылыгы: күчтүү тездик ката кадр жана фокус берет; Чыгуу - бул салыштырууга жана иш-аракет кылууга мүмкүн болгон сапат отчету.

Сапаттуу катмарлар таблицасы

катмар

эмне кармайт

Ким/эмне кылат

Auto QA

Сан, белги, ырааттуулук

Курал/скрипт

AI башкаруу

Мүмкүн болгон маани/терминологиялык каталар

LLM (тастыктоо менен)

Адамдын LQA

Мааниси, обону, маданияты, салмагы

эксперт баалоочу

MQM/DQF упай

Объективдүү ката баллы

кадр менен адам

Жеткирүү ырастоо

акыркы жоопкерчилик

компетенттүү котормочу

Жалпы каталар

  • Автоматташтырылган QA өткөрүп жиберүү жана түз окууга өтүү. Стилдик каталар көңүлдү алаксытат.
  • AI текшерүүнү адамдын LQA менен алмаштыруу. AI алдын ала экранга чыгарат, бекитпейт.
  • Ошол эле модель өзүнүн котормосун текшерет. Сокур жер; кайчылаш текшерүү талап кылынат.
  • Салмактык каталар эмес. Сын менен кичинени бирдей көрүү артыкчылыкты бузат.
  • AI тарабынан түзүлгөн "каталарды" аларды ырастабастан оңдоо. Сиз туура сүйлөмдү бурмалай аласыз.

Автоматтык көрсөткүчтөр: BLEU, COMET жана чектөөлөр

Сапатты өлчөөдө автоматташтырылган метрика дүйнөсү да бар. BLEU (Bilingual Evaluation Understudy) машина котормосун адамдын маалымдама котормосу менен салыштырат жана сөздөрдүн кайталанышына жараша 0-100 балл берет; Бул узак убакыт бою МТ системаларын салыштыруу үчүн стандарт болгон. Жаңыраак метрика, COMET, нейрондук тармакка негизделген жана BLEUге караганда семантикалык окшоштуктарды жакшыраак чагылдырат. Бул көрсөткүчтөр чоң маалыматтар боюнча эки кыймылдаткычты тез жана автоматтык түрдө салыштыруу үчүн баалуу.

Бирок анын чектери айкын: BLEU сыяктуу метрикалар сөздүн дал келишин карап, маанисин түшүнбөйт. Шилтемеден айырмаланган, бирок так котормо төмөн балл алышы мүмкүн; Шилтемеге окшош, бирок туура эмес котормо жогорку балл алышы мүмкүн. Критикалык терс ката - бул бир сөз, андыктан ал метрикага анча деле таасир этпейт, бирок чындыгында катастрофалык. Ошондуктан автоматташтырылган метрикалар жеке тексттин жеткирилишин эмес, система деңгээлинде тенденцияларды өлчөйт. MQMге негизделген адамдык баа жана эксперттик баа котормо автоматтык баа эмес, кардарга бараарын чечет. Метриканы сот эмес, компас катары колдонуңуз.

Кыскача айтканда

Котормо сапаты субъективдүү сезим эмес, ал өлчөнө турган нерсе. Автоматтык QA формалдуу каталарды кылдат текшерет; адамдын LQA маанисин, обонун жана маданиятын баалайт; MQM сыяктуу ката алкактары сапатты категория жана салмак боюнча сандык жактан аныктап, объективдүү салыштырууга мүмкүндүк берет. AI бул башкарууну тездетүүчү күчтүү экинчи көз, бирок ал өзүнүн котормосуна сокур болуп, ката кетирип, реалдуу дүйнө салмагын толук түшүнө албай калышы мүмкүн; Ошондуктан, акыркы сапат чечими, салмактуулук жана жеткирүү бекитүү компетенттүү котормочуга таандык.

Колдонмо тапшырмасы

Машина котормосун алыңыз. Формалдуу каталарды адегенде "автоматтык QA кошумча текшерүү" менен тизмектеңиз, андан кийин "MQMге негизделген каталарды текшерүү" менен лингвистикалык каталарды категория жана салмак боюнча тизмектеңиз. Мен ар бир катаны (критикалык 10, негизги 5, кичине 1) ар бир сөзгө босого менен баалайм жана "аны жеткире алабы?" Суроого жооп бер. Акырында, AI белгилеген каталардын канчасы реалдуу жана канчасы жасалма экенин булак менен ырастаңыз.

текшерүү тизмеси

  • [ ] Мен автоматтык QA иштетип, бардык расмий каталарды тазаладым.
  • [ ] Мен тилдик каталарды кутуча менен белгиледим (категория + салмак).
  • [ ] Мен маанилүү каталарды өзүнчө, артыкчылыктуу раундда сканерден өткөрдүм.
  • [ ] Мен AI башкаруусун булактан алдым жана керек болсо, аны башка модель менен кайчылаш текшердим.
  • [ ] Мен сандык босогого жана өзүмдүн эксперттик пикиримдин негизинде жеткирүү чечимин кабыл алдым.