Yksikkö 5 / 11

AI-integraatio CAT-työkalujen ja käännösmuistin (TM) kanssa

Voitot:

  • Käännösmuistin (TM), sumeiden osumien ja segmenttien käsitteiden ymmärtäminen ja sumeiden osumien erojen hyödyntäminen mukauttamalla niitä sokean sijaan.
  • Kyky soveltaa kurinalaisuutta kirjoittaa vain hyväksyttyjä käännöksiä TM:iin, pitää asiakkaan käännökset erillään ja suorittaa TM-huoltoa
  • Kyky suojata yksityisyyttä hallitsemalla tietojen menemistä CAT:n MT/LLM-integraatiossa

Ammattimainen käännös tehdään useimmiten CAT-työkalulla, ei pelkällä tekstieditorilla. Tässä osiossa opit CAT-työkalut, käännösmuistin (TM) käännöksen ytimessä, kuinka ne toimivat yhdessä konekääntämisen ja LLM:n kanssa ja kuinka tätä ekosysteemiä käytetään tehokkaasti ja turvallisesti. Tavoitteena on tulla käännösteknologian käyttäjäksi, joka hallitsee kokonaista projektia, ei yksittäisiä lauseita, johdonmukaisesti, nopeasti ja jäljitettävästi.

Peruskäsitteet

CAT-työkalu (Computer-Assisted Translation) on ammattimainen ohjelmisto (kuten Trados, memoQ, Phrase, MateCat), joka järjestää käännöksen lause kerrallaan (segmentti) ja yhdistää käännösmuistin ja termikannan. Näyttää lähteen ja kohteen vierekkäin, sieppaa toistot, säilyttää muotoilun.

TM (Translation Memory) on tietokanta, joka tallentaa aiemmin kääntämäsi lähde-kohde-lauseparit. Kun uusi lause saapuu, jos TM:ssä on samanlainen lause, agentti ehdottaa sitä sinulle. Avainkäsite tässä on sumea vastaavuus: uuden lauseen samankaltaisuus TM:n lauseen kanssa (100% = täsmälleen sama, 85% = suurelta osin samanlainen). Korkeat osumat nopeuttavat työtä, koska käytät uudelleen edellistä käännöstäsi.

Segmentti on käännöksen perusyksikkö – yleensä lause. CAT-työkalu jakaa tekstin osiin ja muokkaa niitä erikseen.

TM:n tärkeys: MT tuottaa raakaluonnoksia, mutta TM palauttaa hyväksytyt, ihmislaatuiset aiemmat käännökset. Nämä kaksi ovat erilaisia: MT on ennuste, TM on muisti.

Vinkki: Älä sekoita TM:ää ja MT:tä. 100-prosenttinen TM-osuma (aiemmin hyväksytty käännös) on yleensä luotettava; MT-suositus tulee aina tarkistaa. CAT-työkalut näyttävät nämä kaksi eri väreillä/tarroilla; huomaa aina tämän eron.

MT:n ja LLM:n integrointi CAT:hen

Nykyaikaiset CAT-työkalut kutsuvat sisäisesti MT-moottoreita ja yhä useammin LLM:itä: jos TM:ssä ei löydy vastaavuutta, agentti palauttaa automaattisesti segmentille MT-suosituksen; muokkaat sitä jälkikäteen (eli MTPE virtaa CAT:ssa). Uusimman sukupolven työkalut integroivat myös LLM:n: voit tehdä työkalussa toimintoja, kuten "kirjoita tämä segmentti uudelleen tällä sävyllä", "korjaa tämä termi termikantaan" jne.

Tämän integroinnin etu: TM, termikanta, MT ja LLM yhdistetään samassa näytössä; Jokaiselle lauseelle muodostetaan vuo "katso ensin TM, muuten ehdota MT:tä, termi QA automaattisesti". Huono puoli ja varoitus: mihin tiedot menevät? Pilvipohjainen MT/LLM-integraatio voi lähettää tekstiä ulkoisille palvelimille; Luottamuksellisessa työssä tämä voi olla sopimusrikkomus. Varmista, että tiedät mihin moottoriin ajoneuvo on kytketty ja millä tietokäytännöllä.

Käännösmuistin syöttäminen ja tyhjennys

TM:n arvo on yhtä suuri kuin siinä olevien käännösten laatu. Roskaa sisään, roskat ulos. Kaksi tieteenalaa:

  1. Kirjoita vain oikeaksi todistettu käännös TM:ään. Jos tallennat raaka-MT-tulosteen TM:ään vahvistamatta sitä, se palaa tuleviin töihisi huonona "muistina".
  2. Suorita TM-huolto. Ajan myötä termit muuttuvat ja virheitä tulee. Ajoittain puhdas TM, oikea kuluneet/väärät parit. Tässä työssä käytän LLM:ää kysyäkseni "onko näissä TM-pareissa epäjohdonmukaisuuksia/termiharhaa?" Voit käyttää sitä tilintarkastajana.
Varoitus: Yhden asiakkaan TM:n käyttö toisen asiakkaan liiketoiminnassa loukkaa sekä luottamuksellisuutta että termien sekaannusta. TM:t pidetään erillään asiakas-/projektikohtaisesti. Sekoitettu "kaikki TM" tuhoaa sekä luottamuksellisuuden että laadun.

kolme minilaukkua

Tapaus 1 – TM lensi toistoja. Eräs valmistaja käänsi tuoteperheen, jossa 70 % sen ohjekirjasta pysyi samana vuodesta toiseen. TM:n ansiosta 100 % ja korkea sumea vastaavuus tuli automaattisesti jokaisessa uudessa versiossa; Vain ~9 000 sanaa 30 000 sanan teoksesta oli varsinaista uutta käännöstä. Aika ja kustannukset vähenivät kolmanneksen.

Tapaus 2 – Dirty TM levitti virheen. Yksi tiimi oli tallentanut raaka-MT-tulosteen TM:ään ilman vahvistusta. Vuotta myöhemmin sama käännösvirhe palasi uudestaan ​​ja uudestaan, näyttäen "luotettavalta" 100-prosenttisesti vastaavana; Virhe levisi 14 eri asiakirjaan. Tiimi otti käyttöön "varmennettu käännös vain TM:ään" -säännön ja siivouskierroksen.

Tapaus 3 – Luottamuksellisuus vuotanut integraatiossa. Kääntäjä teki luottamuksellista työtä CAT-projektissa, joka yhdistettiin automaattisesti pilvi MT:hen; Teksti meni ulkoiseen moottoriin, jonka tietokäytäntö on epäselvä. Kun se huomattiin, salaisten projektien MT-integrointi sammutettiin ja käytettiin vain yritysmoottoreita, jotka "ei tallenna/opeta tietoja".

Neljä kopioitavaa mallia

1) Sumea ottelun arviointi (LLM:lle):

Alla on uusi lähdelause, vastaava lause TM:ssä ja sen hyväksytty käännös. Kerro minulle tarkalleen, mitä minun on muutettava mukauttaakseni TM-käännöksen uuteen lauseeseen; Älä ehdota tarpeettomia muutoksia. Näytä merkityksen ero selkeästi. Uusi lähde: [...] | TM-lähde: [...] | TM-käännös: [...]

2) TM-yhteensopivuuden tarkistus:

Alla on lähde-kohde-parit TM:stä. Merkitse epäjohdonmukaisuudet ja termien poikkeamat, joissa samat tai hyvin samankaltaiset lähdelauseet käännetään ERILAIN. Luettele vain ongelmat. Pariskunnat: [...]

3) Segmentin sävyn uudelleenkirjoitus (LLM CAT:ssa):

Tee seuraava kohdesegmentti [haluttu ääni] MUUTTAMATTA merkitystä. Noudata termiluetteloa: [...]. Säilytä numerot ja nimet. Vie vain uudelleenkirjoitettu segmentti. Segmentti: [...]

4) Yksityisyyden/integraation esitarkastus:

Käytän MT/LLM-integraatiota CAT-projektissa. Kuvailen tekstin tyyppiä tässä projektissa; Kerro, onko asianmukaista lähettää tämä teksti pilvipohjaiseen ulkoiseen moottoriin, mitä kysymyksiä (tietojen säilyttäminen, koulutus, sijainti) minun tulee kysyä palveluntarjoajalta.Tekstin tyyppi/tietosuojatila: [...]

Heikko kehote / Vahva kehote

Heikko: "Käytä käännöstä TM:ssä." (On epäselvää, mikä vastaavuussuhde ja mitä mukauttaa; sokea kopiointi aiheuttaa virheitä.)

Vahva: "Tämä uusi lause vastaa TM:n lausetta 90 % ajasta. Rakenna TM-käännökseen, mutta heijasta tätä eroa: lähteessä on "vuosittainen" sanan "kuukausien" sijaan, joten sen tulisi olla "vuosittain" eikä "kuukausittainen". Älä muuta mitään muuta."

Ero: vahva kehote osoittaa ottelueron; Se estää "vanhan käännöksen jättämisen sellaisenaan", mikä on yleisin sumean sovituksen virhe.

CAT-ekosysteemikomponenttien taulukko

komponentti

Mitä tekee

suhde tekoälyyn

TM (käännösmuisti)

Palauttaa hyväksytyt aiemmat käännökset

Luotettava; edeltää MT:tä

Termbase

Varmistaa termin johdonmukaisuuden

Se annetaan kehotteena LLM:lle

MT suositus

Raaka luonnos tyhjäksi segmentiksi

On muokattava jälkikäteen

LLM-integraatio

Sävy/termi/uudelleenkirjoitus

Hallittu, huomiota yksityisyyteen

QA moduuli

Skannaa numeron/termin/tunnisteen virheen

automaattinen ohjaus

Yleisiä virheitä

  • Hyväksyminen sokeasti sumean ottelun. 85 % vastaavuus voi piilottaa 15 % eron merkityksessä.
  • Raaka-MT-tulosteen kirjoittaminen TM:ään. Dirty TM kantaa virheen tulevaisuuteen ja lisää sitä.
  • Asiakkaan/projektin TM:ien sekoittaminen. Luottamuksellisuus ja termien sekaannusvaara.
  • Ei tiedetä minne integrointitiedot menevät. Piiloteksti voi vuotaa ulos ilman, että olet tietoinen siitä.
  • TM/MT-eron unohtaminen. MT on arvio; TM on muisto. Nämä kaksi eivät ole yhtä turvallisia.

Esikäännös ja tasaus

Kaksi edistynyttä CAT-toimintoa nopeuttavat entisestään työnkulkua tekoälyn aikakaudella. Ensimmäinen on esikäännös: projektin alussa työkalu täyttää automaattisesti kaikki segmentit TM:llä ja MT:llä; Tyhjän tiedoston sijaan aloitat tiedostolla, jossa 100 % vastaavuuksista on hyväksytty, sumeat osumat odottavat mukauttamista ja tyhjät ovat MT-luonnoksia. Tämä muuttaa työn "kirjoittamisesta tyhjästä" "tarkistamiseen ja muokkaamiseen", mutta sinun on arvioitava jokainen segmentti sen sijaan, että hyväksyt sokeasti esikäännöksen.

Toinen on tasaus: jos sinulla on lähde-kohdeasiakirjapari, joka on käännetty aiemmin, mutta joka ei ole tullut TM:ään, kohdistustyökalu sovittaa ne segmentti segmentiltä ja muuntaa ne TM:ksi. Siten aiemmat käännökset lisätään "muistiin". Varoitus kohdistuksesta: automaattinen sovitus ei aina ole oikein; yksi segmentin lipsahdus häiritsee koko kohdistusta. Kohdistettujen parien tarkistaminen ennen TM-käsittelyä estää likaisen TM:n riskin. Nämä kaksi toimintoa muuttavat nykyiset varat (aiemmat käännökset) sijoituksiksi tuleviin yrityksiin.

Yhteenvetona

CAT työkalut; Se yhdistää käännösmuistin, termikannan, konekäännöksen ja LLM:n yhdeksi tuotantolinjaksi. TM on muisti, joka hakee hyväksytyt aiemmat käännökset ja tarjoaa suuren nopeuden toistuvissa tehtävissä; MT on ennuste, joka on aina tarkistettava. Taitava käyttäjä mukauttaa tarkasti erot sumeissa osumissa, kirjoittaa vain hyväksytyt käännökset TM:iin, pitää asiakkaiden TM:t erillään ja suojaa yksityisyyttä tietäen, mihin data menee integraatiossa.

Sovellustehtävä

Luo pieni projekti CAT-työkalulla (ilmainen online-CAT toimii myös): lisää termikanta ja tyhjä TM. Käännä 10 lauseen teksti, tallenna hyväksytyt käännökset TM:ään. Käännä sitten toinen teksti, joka on hyvin samanlainen kuin ensimmäinen teksti ja muokkaa TM:n palauttamia sumeita osumia "fuzzy match assessment" -mallilla; Huomaa, kuinka monta lausetta tekisit virheen, jos hyväksyisit sokeasti TM:n.

tarkistuslista

  • [ ] Yhdistin projektiin TM:n ja termikannan.
  • [ ] Käytin eroa sumeissa osumissa adaptiivisesti eikä sokeasti.
  • [ ] Kirjoitin TM:lle vain vahvistamani käännöksen.
  • [ ] Pidin asiakas-/projektiautomaatit erillään.
  • [ ] Tarkistin minne tiedot menevät MT/LLM-integraatiossa.