Yunit 5 / 11

AI Integration sa CAT Tools at Translation Memory (TM)

Mga nadagdag:

  • Pag-unawa sa mga konsepto ng translation memory (TM), fuzzy na mga tugma at mga segment, at kakayahang magamit ang mga pagkakaiba sa mga fuzzy na tugma sa pamamagitan ng pag-angkop sa mga ito sa halip na bulag.
  • Kakayahang ilapat ang disiplina sa pagsulat lamang ng mga inaprubahang pagsasalin sa TM, pagpapanatiling hiwalay ang mga TM ng customer, at pagsasagawa ng pagpapanatili ng TM
  • Kakayahang protektahan ang privacy sa pamamagitan ng pagkontrol kung saan napupunta ang data sa pagsasama ng MT/LLM sa loob ng CAT

Ang propesyonal na pagsasalin ay kadalasang ginagawa sa isang CAT tool, hindi sa isang plain text editor. Sa unit na ito, matututunan mo ang mga tool ng CAT, ang translation memory (TM) sa puso ng pagsasalin, kung paano gumagana ang mga ito kasama ng machine translation at LLM, at kung paano gamitin ang ecosystem na ito nang mahusay at ligtas. Ang layunin ay maging isang gumagamit ng teknolohiya ng pagsasalin na namamahala sa isang buong proyekto, hindi mga indibidwal na pangungusap, sa pare-pareho, mabilis at masusubaybayang paraan.

Pangunahing konsepto

Ang CAT tool (Computer-Assisted Translation) ay propesyonal na software (gaya ng Trados, memoQ, Parirala, MateCat) na nag-aayos ng pagsasalin ng pangungusap ayon sa pangungusap (segment) at nagkokonekta sa translation memory at termbase. Ipinapakita ang pinagmulan at target na magkatabi, nakakakuha ng mga pag-uulit, pinapanatili ang pag-format.

Ang TM (Translation Memory) ay isang database na nag-iimbak ng source-target na mga pares ng pangungusap na dati mong isinalin. Kapag may dumating na bagong pangungusap, kung may katulad na pangungusap sa TM, iminumungkahi ito sa iyo ng ahente. Ang pangunahing konsepto dito ay malabo na tugma: ang pagkakapareho ng bagong pangungusap sa isang pangungusap sa TM (100% = eksaktong pareho, 85% = halos magkapareho). Ang matataas na tugma ay nagpapabilis sa trabaho dahil muli mong ginagamit ang iyong nakaraang pagsasalin.

Ang isang segment ay ang pangunahing yunit ng pagsasalin—karaniwan ay isang pangungusap. Hinahati ng CAT tool ang teksto sa mga segment at ine-edit ang bawat isa nang hiwalay.

Kahalagahan ng TM: Gumagawa ang MT ng mga raw draft, ngunit ibinabalik ng TM ang iyong naaprubahan, kalidad ng tao na mga nakaraang pagsasalin. Magkaiba ang dalawa: Ang MT ay isang hula, ang TM ay isang alaala.

Tip: Huwag malito ang TM at MT. Ang isang 100% TM match (iyong dating naaprubahang pagsasalin) ay karaniwang maaasahan; Dapat palaging i-verify ang rekomendasyon ng MT. Ipinapakita ng mga tool ng CAT ang dalawa na may magkaibang kulay/label; laging nakikita ang pagkakaibang ito.

Pagsasama ng MT at LLM sa CAT

Ang mga modernong CAT tool ay tumatawag sa mga MT engine at dumaraming LLM sa loob: kung walang tugma sa TM, awtomatikong magbabalik ang ahente ng MT na rekomendasyon para sa segment; post-edit mo ito (i.e. MTPE flows in CAT). Ang mga pinakabagong henerasyong tool ay nagsasama rin ng LLM: maaari kang gumawa ng mga operasyon tulad ng "muling isulat ang segment na ito gamit ang tono na ito", "iwasto ang terminong ito sa termbase" atbp. sa tool.

Bentahe ng integration na ito: Ang TM, termbase, MT at LLM ay pinagsama sa isang screen; Para sa bawat pangungusap, ang daloy na "tingnan muna ang TM, kung hindi, iminumungkahi ang MT, awtomatikong QA ang termino" ay itinatag. Downside at pag-iingat: saan napupunta ang data? Ang cloud-based na MT/LLM integration ay maaaring magpadala ng text sa mga external na server; Sa kumpidensyal na trabaho, maaaring ito ay isang paglabag sa kontrata. Tiyaking alam mo kung saang makina nakakonekta ang sasakyan at kung saang patakaran ng data.

Pagpapakain at pag-clear ng translation memory

Ang halaga ng TM ay kasing dami ng kalidad ng mga pagsasalin dito. Basura pasok, basura palabas. Dalawang disiplina:

  1. Isulat lamang ang sertipikadong pagsasalin sa TM. Kung i-save mo ang hilaw na output ng MT sa TM nang hindi ito pinapatunayan, babalik ito sa iyong mga trabaho sa hinaharap bilang masamang "memorya".
  2. Magsagawa ng pagpapanatili ng TM. Sa paglipas ng panahon, nagbabago ang mga termino at pumapasok ang mga error. Pana-panahong linisin ang TM, wastong suot/maling mga pares. Sa gawaing ito, ginagamit ko ang LLM para magtanong "may mga hindi pagkakapare-pareho/term bias sa mga pares ng TM na ito?" Maaari mo itong gamitin bilang isang auditor.
Babala: Ang paggamit ng TM ng isang customer sa negosyo ng isa pang customer ay parehong paglabag sa pagiging kumpidensyal at panganib ng pagkalito sa termino. Ang mga TM ay pinananatiling hiwalay sa batayan ng kliyente/proyekto. Ang pinaghalong "lahat ng TM" ay sumisira sa pagiging kumpidensyal at kalidad.

tatlong mini case

Case 1 — Pinalipad ng TM ang mga replay. Ang isang tagagawa ay nagsasagawa ng isang pamilya ng produkto na isinalin kung saan 70% ng manwal nito ay nanatiling pareho taon-taon. Salamat sa TM, awtomatikong dumating ang 100% at mataas na malabo na mga tugma sa bawat bagong bersyon; Tanging ~9,000 salita ng 30,000 salita na gawa ang aktwal na bagong pagsasalin. Ang oras at gastos ay nabawasan ng isang ikatlo.

Case 2 — Pinalaganap ng Dirty TM ang error. Nai-save ng isang koponan ang hilaw na output ng MT sa TM nang walang pag-verify. Makalipas ang isang taon, paulit-ulit na bumalik ang parehong maling pagsasalin, na lumalabas na "maaasahan" bilang isang 100% na tugma; Ang error ay kumalat sa 14 na magkakaibang dokumento. Nagsimula ang team ng panuntunang "certified translation to TM only" at clean-up tour.

Kaso 3 — Na-leak ang pagiging kompidensyal sa pagsasama. Isang tagapagsalin ang gumawa ng kumpidensyal na gawain sa isang proyekto ng CAT na awtomatikong nakakonekta sa cloud MT; Napunta ang text sa isang external na makina na ang patakaran sa data ay hindi malinaw. Sa sandaling napansin, ang pagsasama ng MT para sa mga lihim na proyekto ay naka-off at tanging mga enterprise engine na "hindi nag-iimbak/nagsasanay ng data" ang ginamit.

Apat na maaaring kopyahin na mga template

1) Fuzzy match evaluation (sa LLM):

Nasa ibaba ang bagong pinagmulang pangungusap, ang katulad na pangungusap sa TM at ang inaprubahang pagsasalin nito. Sabihin sa akin nang eksakto kung ano ang kailangan kong baguhin upang maiangkop ang pagsasalin ng TM sa bagong pangungusap; Huwag magmungkahi ng mga hindi kinakailangang pagbabago. Ipakita nang malinaw ang pagkakaiba ng kahulugan. Bagong pinagmulan: [...] | Pinagmulan ng TM: [...] | Pagsasalin ng TM: [...]

2) TM consistency check:

Nasa ibaba ang source-target na mga pares mula sa TM. Markahan ang mga inconsistencies at term deviations kung saan magkaiba o halos magkatulad na pinagmulang mga pangungusap ang isinalin nang IBA. Ilista lang ang mga problema.Couples: [...]

3) Pagsusulat muli ng tono ng segment (LLM sa CAT):

Gawin ang sumusunod na target na segment [nais na tono] NA HINDI NAGBABAGO ng kahulugan. Sumunod sa listahan ng mga tuntunin: [...]. Panatilihin ang mga numero at pangalan. I-export lamang ang muling isinulat na segment. Segment: [...]

4) Paunang pagsusuri sa privacy/integrasyon:

Gagamit ako ng MT/LLM integration sa isang CAT project. Ilalarawan ko ang uri ng teksto sa proyektong ito; Sabihin sa akin kung naaangkop na ipadala ang text na ito sa isang cloud-based na external na engine, anong mga tanong (pagpapanatili ng data, pagsasanay, lokasyon) ang dapat kong itanong sa provider. Uri ng text/status ng privacy: [...]

Mahinang prompt / Malakas na prompt

Mahina: "Gamitin ang pagsasalin sa TM." (Hindi malinaw kung anong rate ng pagtutugma at kung ano ang iaangkop; ang blind copying ay nagpapakilala ng mga error.)

Strong: "Ang bagong pangungusap na ito ay tumutugma sa pangungusap sa TM 90% ng oras. Bumuo sa pagsasalin ng TM ngunit ipakita ang pagkakaibang ito: ang pinagmulan ay may 'taunang' sa halip na 'buwan-buwan', kaya dapat itong maging 'taunang' sa halip na 'buwanang'. Huwag baguhin ang anumang bagay."

Pagkakaiba: malakas na prompt pinpoints ang pagkakaiba ng tugma; Pinipigilan nito ang "pag-iiwan sa lumang pagsasalin bilang ay", na siyang pinakakaraniwang pagkakamali ng malabo na pagtutugma.

Talahanayan ng mga bahagi ng CAT ecosystem

sangkap

Ano ang ginagawa

relasyon sa AI

TM (translation memory)

Ibinabalik ang mga naaprubahang dating pagsasalin

Maaasahan; nauuna sa MT

Termbase

Tinitiyak ang pagkakapare-pareho ng termino

Ito ay ibinigay bilang isang prompt sa LLM

Rekomendasyon ng MT

Raw sketch sa walang laman na segment

Dapat i-post-edit

Pagsasama ng LLM

Tone/term/rewriting

Kinokontrol, pansin sa privacy

QA module

Ini-scan ang numero/term/tag error

awtomatikong kontrol

Mga karaniwang pagkakamali

  • Blindly accepting the fuzzy match. Ang isang 85% na tugma ay maaaring magtago ng 15% na pagkakaiba sa kahulugan.
  • Pagsusulat ng hilaw na output ng MT sa TM. Dinadala ng dirty TM ang error sa hinaharap at pinalaganap ito.
  • Paghahalo ng mga TM ng customer/proyekto. Pagiging kompidensyal at panganib ng pagkalito sa termino.
  • Hindi alam kung saan napupunta ang data ng pagsasama. Maaaring tumagas ang nakatagong text nang hindi mo namamalayan.
  • Nakakalimutan ang pagkakaiba ng TM/MT. Ang MT ay isang pagtatantya; Ang TM ay isang alaala. Ang dalawa ay hindi pantay na ligtas.

Pre-translation at alignment

Dalawang advanced na function ng CAT ang higit pang nagpapabilis ng daloy ng trabaho sa panahon ng AI. Ang una ay ang pre-translation: sa simula ng proyekto, awtomatikong pinupuno ng tool ang lahat ng mga segment ng TM at MT; Sa halip na isang walang laman na file, magsisimula ka sa isang file kung saan 100% ang mga tugma ay naaprubahan, ang mga malabo na tugma ay naghihintay na iakma, at ang mga walang laman ay mga MT draft. Binabago nito ang trabaho mula sa "pagsusulat mula sa simula" patungo sa "pagsusuri at pag-edit" — ngunit kailangan mong suriin ang bawat segment sa halip na bulag na aprubahan ang paunang pagsasalin.

Ang pangalawa ay ang alignment: kung mayroon kang source-target na pares ng dokumento na naisalin na dati ngunit hindi pa nakapasok sa TM, ang alignment tool ay tumutugma sa mga ito ng segment ayon sa segment at kino-convert ang mga ito sa TM. Kaya, ang iyong mga nakaraang pagsasalin ay idinagdag sa "memorya". Mag-ingat sa pagkakahanay: ang awtomatikong pagtutugma ay hindi palaging tama; ang isang segment slippage ay nakakagambala sa buong pagkakahanay. Ang pagrepaso sa mga nakahanay na pares bago ang TMing ay humahadlang sa panganib ng maruming TM sa unang lugar. Ginagawa ng dalawang function na ito ang iyong kasalukuyang mga asset (mga nakaraang pagsasalin) sa mga pamumuhunan sa mga hinaharap na negosyo.

Sa buod

Mga tool ng CAT; Pinagsasama nito ang translation memory, termbase, machine translation at LLM sa isang linya ng produksyon. Ang TM ay isang memorya na kumukuha ng iyong mga naaprubahang nakaraang pagsasalin at nagbibigay ng mahusay na bilis sa mga paulit-ulit na gawain; Ang MT ay isang hula na palaging kailangang ma-verify. Ang savvy user ay maingat na inaangkop ang pagkakaiba sa mga fuzzy na tugma, nagsusulat lamang ng mga inaprubahang pagsasalin sa TM, pinananatiling hiwalay ang mga TM ng customer, at pinoprotektahan ang privacy sa pamamagitan ng pag-alam kung saan napupunta ang data sa pagsasama.

Gawain ng aplikasyon

Mag-set up ng isang maliit na proyekto sa isang CAT tool (isang libreng online na CAT ay gumagana din): magdagdag ng termbase at isang walang laman na TM. Magsalin ng 10-pangungusap na teksto, i-save ang mga naaprubahang pagsasalin sa TM. Pagkatapos ay isalin ang pangalawang teksto na halos kapareho sa unang teksto at iakma ang malabo na mga tugma na ibinalik ng TM gamit ang template na "fuzzy match evaluation"; Tandaan kung gaano karaming mga pangungusap ang magkakamali kung bulag mong tinanggap ang TM.

checklist

  • [ ] Ikinonekta ko ang TM at termbase sa proyekto.
  • [ ] Ginamit ko ang pagkakaiba sa mga fuzzy na tugma sa adaptively sa halip na bulag.
  • [ ] Isinulat ko lang sa TM ang certified translation na na-verify ko.
  • [ ] Pinaghiwalay ko ang mga customer/project na TM.
  • [ ] Sinuri ko kung saan napupunta ang data sa pagsasama ng MT/LLM.