Yunit 8 / 11

Quality Control (QA), Evaluation Sukatan at LQA

Mga nadagdag:

  • Kakayahang makilala sa pagitan ng awtomatikong QA at linguistic na mga layer ng LQA at ilapat pareho sa tamang pagkakasunud-sunod
  • Kakayahang obhetibong suriin ang pagsasalin ayon sa kategorya at timbang (kritikal/major/menor) na may error framework gaya ng MQM
  • Kakayahang gumawa ng pangwakas na desisyon kapag gumagamit ng AI bilang isang auditor, alam ang pagkabulag nito sa sarili nitong pagsasalin, ang panganib na magkamali, at ang mga limitasyon ng mga automated na sukatan

Sa sandaling sabihin mong "tapos na" ang isang pagsasalin, kalahati na iyon ng gawain; Ang isa pang kalahati ay upang patunayan na ang pagsasalin ay talagang maaasahan. Sa unit na ito, matututo ka ng mga sistematikong paraan upang sukatin ang kalidad ng pagsasalin: mga awtomatikong pagsusuri sa QA, mga framework ng error sa LQA na nakabatay sa tao, mga sukatan ng kalidad, at kung paano gamitin ang AI bilang isang "inspektor" — at ang mga limitasyon nito. Ang layunin ay lumayo sa subjectivity ng "Sa tingin ko ito ay mabuti" at maging isang dalubhasa na tumutukoy, sumusukat at nagpapatunay ng kalidad.

Dalawang uri ng kontrol sa kalidad: awtomatiko at linguistic

Gumagana ang QA (Quality Assurance) sa dalawang layer sa pagsasalin:

Naka-automate na QA: Mga naka-istilong error na nahuhuli ng mga tool at script ng CAT — hindi pagkakatugma ng numero, nawawala/sobrang espasyo, hindi tugmang termino, hindi na-translate na segment, masamang placeholder/tag, double space, bantas. Ang mga ito ay mabilis at ganap na na-scan ng makina; Nakatakas ito sa mata ng tao, ngunit nahuhuli ito ng sasakyan.

LQA (Linguistic Quality Assurance): Ito ang layer kung saan sinusuri ng isang human evaluator ang kahulugan, terminolohiya, istilo, gramatika at lokal na kaangkupan. Automated QA "nagtutugma ba ang numero?" tumitingin sa tanong; LQA "tama ba ang kahulugan, angkop ba ang tono, angkop ba ito sa kultura?" Tumingin siya sa tanong. Ang dalawa ay nagpupuno sa isa't isa; Hindi pinapalitan ng isa ang isa.

Tip: Palaging patakbuhin muna ang Auto QA; Ang paglilinis ng mga pormal na pagkakamali ay nagbibigay-daan sa tagasuri ng tao na maglaan ng pansin sa mga tunay na problema sa lingguwistika. Ang isang tagasuri na nag-abala sa error sa numero ay makaligtaan ang error sa tono.

Mga frame ng error: MQM at DQF

Ang mga karaniwang tipolohiya ng error ay ginagamit upang gawing nasusukat ang kalidad sa halip na "mabuti/masama." Ang pinakakaraniwan ay MQM (Multidimensional Quality Metrics): itinatalaga nito ang bawat error sa isang kategorya (katumpakan, katatasan, terminolohiya, istilo, lokalidad, format) at isang timbang (kritikal, mayor, menor). Ang isa pang balangkas ay ang DQF (Dynamic Quality Framework) at binanggit kasama ng MQM.

Bakit ito mahalaga? Dahil sa balangkas na ito, maaari kang magbigay ng marka ng error sa isang pagsasalin, ihambing ang iba't ibang mga tagapagsalin/engine at magtanong "maaari bang maihatid ang tekstong ito?" Sinasagot mo ang tanong gamit ang numerical threshold. Halimbawa: kritikal na error = 10 puntos, major = 5, minor = 1; text sa ibaba ng isang tiyak na threshold pass sa bawat partikular na salita.

Kritikal na error: error na binabaligtad ang kahulugan, lumilikha ng seguridad/legal na panganib, nakakasira ng tatak (maling dosis, "hindi responsable" sa halip na "responsable"). Major: nakakagambala ngunit hindi nakakapinsala. Minor: kapansin-pansin ngunit hindi nakakabawas sa kahulugan (minor style/punctuation).

Paggamit ng AI bilang controller — at ang mga limitasyon nito

Ang AI ay mabilis at nakakatulong sa pagsuri ng pagsasalin sa framework ng error: masasabi mong "markahan ang tama, terminolohiya, mga error sa fluency sa pagsasaling ito gamit ang mga kategorya ng MQM." Binabawasan nito ang iyong mga blind spot at binibigyan ka ng mabilis na "pangalawang mata".

Ngunit may tatlong kritikal na limitasyon: (1) Maaaring maging bulag ang AI kapag sinusuri ang pagsasalin na ginagawa nito — parehong gumagawa at nagkukumpirma sa parehong pagkakamali; cross-check sa ibang modelo o bumalik sa pinagmulan. (2) Ang AI ay maaari ding gumawa ng mga hallucinatory na "error" — mag-ulat ng error na hindi umiiral; Kumpirmahin ang bawat babala. (3) ang AI ay maaaring hindi ganap na maunawaan ang totoong kalubhaan ng isang kritikal na error (ang isang error sa dosis ay maaaring nakamamatay); Ang dalubhasa ang gumagawa ng pagtimbang. Kaya pinapabilis ng AI ang QA, ngunit ang panghuling desisyon sa kalidad at pag-apruba sa paghahatid ay nakasalalay sa tao.

Babala: Ang pagsasabi na "Ang AI ay pumasa sa QA, ito ay malinis" ay isang maling pakiramdam ng kumpiyansa. Ang pag-audit ng AI ay hindi kapalit para sa LQA ng tao at paghahambing sa pinagmulan; isa itong pre-screening layer na nagpapabilis sa kanila.

tatlong mini case

Case 1 — Nakahanap ang Automated QA ng 40 error sa numero. Sa pagsasalin ng ulat sa pananalapi, nakahuli ang automated QA ng 40 numero/format na hindi pagkakatugma sa pagitan ng pinagmulan at target (thousand separator, decimal, currency). Ang mata ng tao ay makaligtaan ang karamihan sa mga ito; sasakyan na nakalista sa mga segundo.

Case 2 — Ang marka ng MQM ay humantong sa pagpili ng engine. Isang bureau MQM-rate ang output ng dalawang magkaibang MT engine sa 2,000 salita: Engine A 12 error point, Engine B 31. Layunin pagsukat naayos ang "alin ang mas mahusay" debate na may marka; Ginawa ng bureau ang Engine A na pamantayan at binalak ang badyet nito pagkatapos ng rebisyon nang naaayon.

Kaso 3 — Hindi nakuha ng audit ng AI ang sarili nitong pagkakamali. Ang isang tagasalin ay nagkaroon ng pagsasalin ng LLM na pinangangasiwaan ng parehong LLM; Sinabi ng modelo na "walang problema", isang error sa terminolohiya na ginawa niya mismo. Nahayag ang error nang mag-cross-check ang tagasalin sa ibang modelo at pinagmulan; Pinagtibay ng team ang panuntunan na "hindi dapat kontrolin ng parehong modelo ang sarili nito".

Apat na maaaring kopyahin na mga template

1) Pagsusuri ng error batay sa MQM:

Ang iyong tungkulin: LQA assessor. Ihambing ang pinagmulan at pagsasalin sa ibaba. Ibigay ang bawat error na makikita mo sa sumusunod na format: [category: accuracy/terminology/fluency/style/format][weight: critical/major/minor] [location] [comment] [correction]. Markahan ang babala na hindi ka sigurado bilang "kailangan ng kumpirmasyon"; errorfabrication.Source: [...] | Pagsasalin: [...]

2) Kritikal na error sa pag-scan (mataas ang panganib):

Maghanap ng mga kritikal na error LAMANG sa pagsasalin sa ibaba: ibig sabihin ay inversion, error sa numero/dosis/petsa, pagkawala ng negation, pagpapalit ng legal na obligasyon, error sa babala sa kaligtasan. Huwag pansinin ang maliliit na isyu sa pag-istilo. Sipiin ang pinagmulan para sa bawat kritikal na paghahanap.Source: [...] | Pagsasalin: [...]

3) Awtomatikong QA supplementary control:

Ilista ang mga pormal na hindi pagkakapare-pareho sa mga sumusunod na pares ng source-target: hindi pagkakatugma ng numero, nawawala/dagdag na placeholder o tag, hindi pare-parehong termino, hindi naisaling segment, pagkakaiba sa unit/currency. Ibigay lamang ang mga problema sa kanilang lokasyon. Pares: [...]

4) Malayang pangalawang mata (cross-check):

Suriin ang pagsasaling ito nang WALANG PAGKAKATAO; Huwag ipagpalagay na isinulat mo ito. Bigyan ang source ng kalidad na rating (1-5) para sa katapatan, terminolohiya at pagiging natural, at ilista ang nangungunang 3 problema. Ako na ang bahalang magdesisyon. Pinagmulan: [...] | Pagsasalin: [...]

Mahinang prompt / Malakas na prompt

Mahina: "Maganda ba ang pagsasaling ito?" (Walang pamantayan; ang AI ay nagbabalik ng walang kwentang sagot tulad ng "pangkalahatan ay mabuti.")

Strong: "Suriin ang pagsasaling ito laban sa pinagmulan. Lagyan ng label ang bawat error ng kategorya (katumpakan/terminolohiya/katatasan) at kalubhaan (kritikal/major/minor). Tumutok lalo na sa mga error sa numero, negasyon, at terminolohiya. Huwag gumawa ng mga error; markahan ang 'kinakailangan ang kumpirmasyon' kung hindi ka sigurado."

Pagkakaiba: ang malakas na prompt ay nagbibigay ng error frame at focus; Ang output ay isang maihahambing at naaaksyunan na kalidad ng ulat.

Talahanayan ng mga layer ng kalidad

layer

kung ano ang nakakahuli

Sino/ano ang ginagawa

Auto QA

Numero, label, pagkakapare-pareho

Tool/script

Kontrol ng AI

Mga posibleng pagkakamali sa kahulugan/terminolohiya

LLM (may kumpirmasyon)

LQA ng tao

Kahulugan, tono, kultura, timbang

ekspertong tagasuri

Marka ng MQM/DQF

Layunin na marka ng error

tao na may frame

Pagkumpirma ng paghahatid

pangwakas na responsibilidad

karampatang tagasalin

Mga karaniwang pagkakamali

  • Nilaktawan ang automated QA at diretso sa pagbabasa. Ang mga error sa istilo ay nakakagambala sa atensyon.
  • Pinapalitan ang AI inspection ng human LQA. AI pre-screens, ay hindi aprubahan.
  • Ang pagkakaroon ng parehong modelo ay suriin ang sarili nitong pagsasalin. Blind spot; kailangan ng cross checking.
  • Hindi mga error sa pagtimbang. Ang pagtingin sa kritikal at menor de edad bilang pareho ay nakakagambala sa priyoridad.
  • Ang pagwawasto ng mga "error" na ginawa ng AI nang hindi kinukumpirma ang mga ito. Maaari mong baluktutin ang tamang pangungusap.

Mga awtomatikong sukatan: BLEU, COMET at mga limitasyon

Mayroon ding mundo ng mga automated na sukatan sa pagsukat ng kalidad. Inihahambing ng BLEU (Bilingual Evaluation Understudy) ang isang machine translation sa isang human reference translation at nagbibigay ng markang 0-100 batay sa overlap ng salita; Ito ang pamantayan para sa paghahambing ng mga MT system sa mahabang panahon. Ang isang mas bagong sukatan, ang COMET, ay nakabatay sa neural network at mas nakakakuha ng pagkakatulad ng semantiko kaysa sa BLEU. Ang mga sukatang ito ay mahalaga para sa mabilis at awtomatikong paghahambing ng dalawang engine sa malaking data.

Ngunit malinaw ang mga limitasyon nito: Ang mga sukatan tulad ng BLEU ay tumitingin sa mga salitang magkakapatong, hindi talaga nakakaunawa ng kahulugan. Ang pagsasalin na naiiba sa sanggunian ngunit tumpak ay maaaring makatanggap ng mababang marka; Ang isang pagsasalin na katulad ng sanggunian ngunit hindi tama ay maaaring makatanggap ng mataas na marka. Ang isang kritikal na negatibiti error ay isang salita kaya ito ay may maliit na epekto sa sukatan, ngunit ito ay talagang sakuna. Iyon ang dahilan kung bakit sinusukat ng mga automated na sukatan ang mga trend sa antas ng system, hindi nagpapasya sa pagiging maihahatid ng isang indibidwal na text. Ang pagsusuri ng tao na nakabatay sa MQM at paghuhusga ng dalubhasa ay magpapasya kung ang isang pagsasalin ay mapupunta sa kliyente, hindi isang awtomatikong marka. Gamitin ang mga sukatan bilang isang compass, hindi isang hukom.

Sa buod

Ang kalidad ng pagsasalin ay hindi isang pansariling pakiramdam, ito ay isang bagay na masusukat. Ang Awtomatikong QA ay lubusang nag-scan para sa mga pormal na error; sinusuri ng LQA ng tao ang kahulugan, tono, at kultura; Ang mga framework ng error tulad ng MQM ay binibilang ang kalidad ayon sa kategorya at timbang, na nagbibigay-daan sa paghahambing ng layunin. Ang AI ay isang makapangyarihang pangalawang mata na nagpapabilis sa kontrol na ito, ngunit maaari itong maging bulag sa sarili nitong pagsasalin, magkamali, at mabigong ganap na maunawaan ang totoong timbang; Samakatuwid, ang panghuling desisyon sa kalidad, pagtimbang at pag-apruba sa paghahatid ay pagmamay-ari ng karampatang tagasalin.

Gawain ng aplikasyon

Kumuha ng machine translation output. Ilista muna ang mga pormal na error gamit ang "awtomatikong QA supplementary checking", pagkatapos ay ilista ang mga linguistic na error ayon sa kategorya at timbang gamit ang "MQM-based error checking." Nire-rate ko ang bawat error (kritikal 10, major 5, minor 1) na may threshold bawat salita at nagtatanong "maaari ba itong maihatid?" Sagutin ang tanong. Sa wakas, kumpirmahin sa pinagmulan kung ilan sa mga error na na-flag ng AI ang totoo at ilan ang gawa-gawa.

checklist

  • [ ] Nagpatakbo ako ng awtomatikong QA at nilinis ko ang anumang mga pormal na error.
  • [ ] Minarkahan ko ng isang kahon ang mga error sa wika (kategorya + timbang).
  • [ ] Nag-scan ako ng mga kritikal na error sa isang hiwalay, priyoridad na round.
  • [ ] Kinuha ko ang kontrol ng AI at sinuri ko ito sa ibang modelo kung kinakailangan.
  • [ ] Ginawa ko ang desisyon sa paghahatid batay sa numerical threshold at sarili kong ekspertong paghuhusga.