Jednostka 8 / 11

Kontrola jakości (QA), wskaźniki oceny i LQA

Zyski:

  • Umiejętność rozróżnienia warstw automatycznej kontroli jakości od warstwy językowej LQA i zastosowania obu warstw w odpowiedniej kolejności
  • Możliwość obiektywnej oceny tłumaczenia według kategorii i wagi (krytyczne/główne/drobne) z wykorzystaniem ram błędów, takich jak MQM
  • Możliwość podjęcia ostatecznej decyzji podczas korzystania ze sztucznej inteligencji jako audytora, wiedząc, że jest ona ślepa na własne tłumaczenie, ryzyko popełnienia błędów i ograniczenia zautomatyzowanych wskaźników

W momencie, gdy powiesz, że tłumaczenie jest „ukończone”, to połowa pracy; Druga połowa polega na udowodnieniu, że to tłumaczenie jest rzeczywiście wiarygodne. W tej części poznasz systematyczne sposoby pomiaru jakości tłumaczeń: automatyczne kontrole jakości, ramy błędów LQA oparte na ludziach, metryki jakości oraz to, jak wykorzystywać sztuczną inteligencję jako „inspektora” – i jej ograniczenia. Celem jest odejście od subiektywizmu „myślę, że to dobrze” i stanie się ekspertem, który definiuje, mierzy i potwierdza jakość.

Dwa rodzaje kontroli jakości: automatyczna i językowa

QA (Quality Assurance) działa w tłumaczeniu dwuwarstwowo:

Zautomatyzowana kontrola jakości: błędy stylistyczne wychwytywane przez narzędzia CAT i skrypty — niedopasowanie liczb, brakująca/nadmiar spacji, niespójny termin, nieprzetłumaczony segment, nieprawidłowy symbol zastępczy/znacznik, podwójna spacja, interpunkcja. Są one skanowane szybko i całkowicie maszynowo; Umyka ludzkiemu oku, ale pojazd go łapie.

LQA (Linguistic Quality Assurance): Jest to warstwa, w której osoba oceniająca bada znaczenie, terminologię, styl, gramatykę i lokalną stosowność. Zautomatyzowana kontrola jakości „czy numer pasuje?” patrzy na pytanie; LQA „czy znaczenie jest prawidłowe, czy ton jest odpowiedni, czy jest on odpowiedni kulturowo?” Patrzy na pytanie. Oba się uzupełniają; Jedno nie zastępuje drugiego.

Wskazówka: zawsze najpierw uruchamiaj funkcję Auto QA; Usunięcie błędów formalnych pozwala osobie oceniającej poświęcić uwagę rzeczywistym problemom językowym. Recenzent, który zawraca sobie głowę błędem numerycznym, nie zauważy błędu tonowego.

Ramki błędów: MQM i DQF

Aby jakość była mierzalna, a nie „dobra/zła”, stosuje się standardowe typologie błędów. Najbardziej popularną jest metoda MQM (wielowymiarowa metryka jakości): przypisuje ona każdemu błędowi kategorię (dokładność, płynność, terminologia, styl, lokalizacja, format) i wagę (krytyczny, poważny, drugorzędny). Innym frameworkiem jest DQF (Dynamic Quality Framework), wymieniany razem z MQM.

Dlaczego to jest ważne? Ponieważ dzięki temu frameworkowi możesz ocenić błąd tłumaczenia, obiektywnie porównać różnych tłumaczy/silników i zapytać „czy ten tekst może zostać dostarczony?” Odpowiadasz na pytanie za pomocą progu liczbowego. Na przykład: błąd krytyczny = 10 punktów, duży = 5, mniejszy = 1; tekst poniżej określonego progu przechodzi przez określone słowo.

Błąd krytyczny: błąd, który odwraca znaczenie, stwarza ryzyko bezpieczeństwa/prawne, szkodzi marce (niewłaściwa dawka, „nie odpowiada” zamiast „odpowiedzialny”). Major: destrukcyjny, ale nieszkodliwy. Drobne: zauważalne, ale nie umniejszające znaczenia (drobny styl/interpunkcja).

Używanie sztucznej inteligencji jako kontrolera – i jego ograniczenia

Sztuczna inteligencja jest szybka i pomocna w sprawdzaniu tłumaczenia pod kątem ram błędów: możesz powiedzieć „oznacz poprawność, terminologię, błędy płynności w tym tłumaczeniu kategoriami MQM”. Redukuje martwe punkty i zapewnia szybkie „drugie oko”.

Istnieją jednak trzy krytyczne ograniczenia: (1) sztuczna inteligencja może być ślepa, sprawdzając wytwarzane przez siebie tłumaczenie – zarówno popełniając, jak i potwierdzając ten sam błąd; sprawdź krzyżowo z innym modelem lub wróć do źródła. (2) AI może również wymyślać halucynacyjne „błędy” — zgłoś błąd, który nie istnieje; Potwierdź każde ostrzeżenie. (3) sztuczna inteligencja może nie w pełni zrozumieć powagę błędu krytycznego w świecie rzeczywistym (błąd w dawce może być śmiertelny); Ekspert dokonuje ważenia. Zatem sztuczna inteligencja przyspiesza kontrolę jakości, ale ostateczna decyzja dotycząca jakości i zatwierdzenie dostawy leży w gestii człowieka.

Uwaga: twierdzenie „AI przeszła kontrolę jakości, jest czysta” jest fałszywym poczuciem pewności. Audyt AI nie zastępuje ludzkiej LQA i porównania ze źródłem; jest to warstwa wstępnego przesiewania, która przyspiesza ich pracę.

trzy mini etui

Przypadek 1 — Automatyczna kontrola jakości wykryła 40 błędów. Podczas tłumaczenia raportu finansowego automatyczna kontrola jakości wykryła 40 niezgodności liczb/formatów między źródłem a celem (separator tysięcy, dziesiętny, waluta). Ludzkie oko przeoczyłoby większość z nich; pojazd wymieniony w sekundach.

Przypadek 2 — Wynik MQM doprowadził do wyboru silnika. Jedno z biur MQM oceniło moc dwóch różnych silników MT na 2000 słów: silnik A 12 punktów błędów, silnik B 31. Obiektywny pomiar rozstrzygnął debatę „który jest lepszy” wynikiem; Biuro uczyniło Silnik A standardem i odpowiednio zaplanowało swój budżet po rewizji.

Przypadek 3 – Audyt sztucznej inteligencji nie zauważył własnego błędu. Tłumacz zlecił tłumaczenie LLM nadzorowane przez tę samą LLM; Modelka powiedziała „nie ma problemu” – to błąd terminologiczny, który sama popełniła. Błąd został ujawniony, gdy tłumacz sprawdził inny model i źródło; Zespół przyjął zasadę, że „ten sam model nie powinien się kontrolować”.

Cztery szablony do kopiowania

1) Sprawdzanie błędów w oparciu o MQM:

Twoja rola: asesor LQA. Porównaj źródło i tłumaczenie poniżej. Podaj każdy znaleziony błąd w następującym formacie: [kategoria: dokładność/terminologia/płynność/styl/format] [waga: krytyczny/główny/drobny] [lokalizacja] [komentarz] [korekta]. Oznacz ostrzeżenie, którego nie jesteś pewien, jako „wymagane potwierdzenie”; errorfabrication.Źródło: [...] | Tłumaczenie: [...]

2) Skanowanie błędów krytycznych (wysokie ryzyko):

Szukaj TYLKO błędów krytycznych w poniższym tłumaczeniu: inwersja znaczenia, błąd liczby/dawki/daty, utrata negacji, zastąpienie zobowiązania prawnego, błąd ostrzeżenia dotyczącego bezpieczeństwa. Ignoruj ​​drobne problemy stylistyczne. Podaj źródło każdego krytycznego ustalenia.Źródło: [...] | Tłumaczenie: [...]

3) Automatyczna dodatkowa kontrola jakości:

Wymień formalne niespójności w następujących parach źródło-cel: niedopasowanie liczb, brakujący/dodatkowy element zastępczy lub znacznik, niespójny termin, nieprzetłumaczony segment, różnica w jednostce/walucie. Podajcie tylko problemy z ich lokalizacją. Pary: [...]

4) Niezależne drugie oko (kontrola krzyżowa):

Oceń to tłumaczenie BEZ URZĄDZEŃ; Nie zakładaj, że to ty to napisałeś. Nadaj źródłu ocenę jakości (1-5) pod względem wierności, terminologii i naturalności oraz wymień 3 najważniejsze problemy. Decyzja należy do mnie. Źródło: [...] | Tłumaczenie: [...]

Słaba zachęta/silna zachęta

Słabe: „Czy to tłumaczenie jest dobre?” (Brak kryteriów; sztuczna inteligencja zwraca bezużyteczną odpowiedź, np. „ogólnie dobrze”).

Mocne: „Sprawdź tłumaczenie w odniesieniu do źródła. Oznacz każdy błąd kategorią (dokładność/terminologia/płynność) i wagą (krytyczny/główny/drobny). Skoncentruj się szczególnie na błędach liczbowych, negacji i terminologicznych. Nie fabrykuj błędów; zaznacz „wymagane potwierdzenie”, jeśli nie masz pewności.

Różnica: silny monit wyświetla ramkę błędu i fokus; Wynikiem jest porównywalny i praktyczny raport dotyczący jakości.

Tabela warstw jakości

warstwa

co łapie

Kto/co robi

Automatyczna kontrola jakości

Numer, etykieta, konsystencja

Narzędzie/skrypt

Kontrola AI

Możliwe błędy w znaczeniu/terminologii

LLM (z potwierdzeniem)

Ludzkie LQA

Znaczenie, ton, kultura, waga

ekspert oceniający

Wynik MQM/DQF

Obiektywny wynik błędu

człowiek z ramą

Potwierdzenie dostawy

ostateczna odpowiedzialność

kompetentny tłumacz

Typowe błędy

  • Pomiń automatyczną kontrolę jakości i od razu przejdź do czytania. Błędy stylistyczne odwracają uwagę.
  • Zastąpienie inspekcji AI ludzką LQA. AI dokonuje wstępnej selekcji, nie zatwierdza.
  • Mając ten sam model, sprawdź własne tłumaczenie. Martwy punkt; wymagane sprawdzenie krzyżowe.
  • Nie błędy ważenia. Postrzeganie krytycznego i drobnego jako tego samego zakłóca priorytet.
  • Poprawianie „błędów” popełnionych przez sztuczną inteligencję bez ich potwierdzania. Możesz zniekształcić poprawne zdanie.

Metryki automatyczne: BLEU, COMET i limity

Istnieje również świat zautomatyzowanych metryk w pomiarze jakości. BLEU (Bilingual Evaluation Understudy) porównuje tłumaczenie maszynowe z tłumaczeniem referencyjnym wykonywanym przez człowieka i przyznaje ocenę od 0 do 100 w oparciu o nakładanie się słów; Przez długi czas był to standard porównywania systemów MT. Nowsza metryka, COMET, opiera się na sieci neuronowej i lepiej oddaje podobieństwo semantyczne niż BLEU. Metryki te są przydatne do szybkiego i automatycznego porównywania dwóch silników na dużych zbiorach danych.

Ale jego ograniczenia są jasne: wskaźniki takie jak BLEU uwzględniają nakładanie się słów, ale nie rozumieją tak naprawdę ich znaczenia. Tłumaczenie, które różni się od referencyjnego, ale jest dokładne, może otrzymać niską ocenę; Tłumaczenie podobne do referencji, ale nieprawidłowe, może otrzymać wysoką ocenę. Krytyczny błąd negatywności to pojedyncze słowo, więc ma niewielki wpływ na metrykę, ale w rzeczywistości jest katastrofalny. Dlatego automatyczne metryki mierzą trendy na poziomie systemu, a nie decydują o dostarczalności pojedynczego tekstu. O tym, czy tłumaczenie trafi do klienta, decyduje ludzka ocena oparta na MQM i ocena ekspercka, a nie automatyczna ocena. Używaj wskaźników jako kompasu, a nie sędziego.

Podsumowując

Jakość tłumaczenia nie jest odczuciem subiektywnym, jest czymś mierzalnym. Automatyczna kontrola jakości dokładnie skanuje pod kątem błędów formalnych; ludzka LQA ocenia znaczenie, ton i kulturę; Ramy błędów, takie jak MQM, określają jakość według kategorii i wagi, umożliwiając obiektywne porównanie. Sztuczna inteligencja to potężne drugie oko, które przyspiesza tę kontrolę, ale może być ślepa na własne tłumaczenie, popełniać błędy i nie w pełni uchwycić wagę rzeczywistego świata; Dlatego ostateczna decyzja dotycząca jakości, ważenia i zatwierdzenia dostawy należy do kompetentnego tłumacza.

Zadanie aplikacji

Uzyskaj wynik tłumaczenia maszynowego. Najpierw wypisz błędy formalne za pomocą „automatycznego sprawdzania uzupełniającego QA”, a następnie wypisz błędy językowe według kategorii i wagi za pomocą „sprawdzania błędów w oparciu o MQM”. Oceniam każdy błąd (krytyczny 10, poważny 5, drobny 1) przy pomocy progu na słowo i pytam „czy można go dostarczyć?” Odpowiedz na pytanie. Na koniec potwierdź u źródła, ile błędów sygnalizowanych przez sztuczną inteligencję jest prawdziwych, a ile sfabrykowanych.

lista kontrolna

  • [ ] Przeprowadziłem automatyczną kontrolę jakości i usunąłem wszelkie błędy formalne.
  • [ ] Błędy językowe zaznaczyłem ramką (kategoria + waga).
  • [ ] Przeskanowałem błędy krytyczne w osobnej rundzie o ustalonym priorytecie.
  • [ ] Pozyskałem sterowanie AI i w razie potrzeby sprawdziłem je z innym modelem.
  • [ ] Podjąłem decyzję o dostawie w oparciu o próg liczbowy i własną ocenę ekspercką.