Voitot:
- Käännösmuistin (TM), sumeiden osumien ja segmenttien käsitteiden ymmärtäminen ja sumeiden osumien erojen hyödyntäminen mukauttamalla niitä sokean sijaan.
- Kyky soveltaa kurinalaisuutta kirjoittaa vain hyväksyttyjä käännöksiä TM:iin, pitää asiakkaan käännökset erillään ja suorittaa TM-huoltoa
- Kyky suojata yksityisyyttä hallitsemalla tietojen menemistä CAT:n MT/LLM-integraatiossa
Ammattimainen käännös tehdään useimmiten CAT-työkalulla, ei pelkällä tekstieditorilla. Tässä osiossa opit CAT-työkalut, käännösmuistin (TM) käännöksen ytimessä, kuinka ne toimivat yhdessä konekääntämisen ja LLM:n kanssa ja kuinka tätä ekosysteemiä käytetään tehokkaasti ja turvallisesti. Tavoitteena on tulla käännösteknologian käyttäjäksi, joka hallitsee kokonaista projektia, ei yksittäisiä lauseita, johdonmukaisesti, nopeasti ja jäljitettävästi.
Peruskäsitteet
CAT-työkalu (Computer-Assisted Translation) on ammattimainen ohjelmisto (kuten Trados, memoQ, Phrase, MateCat), joka järjestää käännöksen lause kerrallaan (segmentti) ja yhdistää käännösmuistin ja termikannan. Näyttää lähteen ja kohteen vierekkäin, sieppaa toistot, säilyttää muotoilun.
TM (Translation Memory) on tietokanta, joka tallentaa aiemmin kääntämäsi lähde-kohde-lauseparit. Kun uusi lause saapuu, jos TM:ssä on samanlainen lause, agentti ehdottaa sitä sinulle. Avainkäsite tässä on sumea vastaavuus: uuden lauseen samankaltaisuus TM:n lauseen kanssa (100% = täsmälleen sama, 85% = suurelta osin samanlainen). Korkeat osumat nopeuttavat työtä, koska käytät uudelleen edellistä käännöstäsi.
Segmentti on käännöksen perusyksikkö – yleensä lause. CAT-työkalu jakaa tekstin osiin ja muokkaa niitä erikseen.
TM:n tärkeys: MT tuottaa raakaluonnoksia, mutta TM palauttaa hyväksytyt, ihmislaatuiset aiemmat käännökset. Nämä kaksi ovat erilaisia: MT on ennuste, TM on muisti.
Vinkki: Älä sekoita TM:ää ja MT:tä. 100-prosenttinen TM-osuma (aiemmin hyväksytty käännös) on yleensä luotettava; MT-suositus tulee aina tarkistaa. CAT-työkalut näyttävät nämä kaksi eri väreillä/tarroilla; huomaa aina tämän eron.
MT:n ja LLM:n integrointi CAT:hen
Nykyaikaiset CAT-työkalut kutsuvat sisäisesti MT-moottoreita ja yhä useammin LLM:itä: jos TM:ssä ei löydy vastaavuutta, agentti palauttaa automaattisesti segmentille MT-suosituksen; muokkaat sitä jälkikäteen (eli MTPE virtaa CAT:ssa). Uusimman sukupolven työkalut integroivat myös LLM:n: voit tehdä työkalussa toimintoja, kuten "kirjoita tämä segmentti uudelleen tällä sävyllä", "korjaa tämä termi termikantaan" jne.
Tämän integroinnin etu: TM, termikanta, MT ja LLM yhdistetään samassa näytössä; Jokaiselle lauseelle muodostetaan vuo "katso ensin TM, muuten ehdota MT:tä, termi QA automaattisesti". Huono puoli ja varoitus: mihin tiedot menevät? Pilvipohjainen MT/LLM-integraatio voi lähettää tekstiä ulkoisille palvelimille; Luottamuksellisessa työssä tämä voi olla sopimusrikkomus. Varmista, että tiedät mihin moottoriin ajoneuvo on kytketty ja millä tietokäytännöllä.
Käännösmuistin syöttäminen ja tyhjennys
TM:n arvo on yhtä suuri kuin siinä olevien käännösten laatu. Roskaa sisään, roskat ulos. Kaksi tieteenalaa:
- Kirjoita vain oikeaksi todistettu käännös TM:ään. Jos tallennat raaka-MT-tulosteen TM:ään vahvistamatta sitä, se palaa tuleviin töihisi huonona "muistina".
- Suorita TM-huolto. Ajan myötä termit muuttuvat ja virheitä tulee. Ajoittain puhdas TM, oikea kuluneet/väärät parit. Tässä työssä käytän LLM:ää kysyäkseni "onko näissä TM-pareissa epäjohdonmukaisuuksia/termiharhaa?" Voit käyttää sitä tilintarkastajana.
Varoitus: Yhden asiakkaan TM:n käyttö toisen asiakkaan liiketoiminnassa loukkaa sekä luottamuksellisuutta että termien sekaannusta. TM:t pidetään erillään asiakas-/projektikohtaisesti. Sekoitettu "kaikki TM" tuhoaa sekä luottamuksellisuuden että laadun.
kolme minilaukkua
Tapaus 1 – TM lensi toistoja. Eräs valmistaja käänsi tuoteperheen, jossa 70 % sen ohjekirjasta pysyi samana vuodesta toiseen. TM:n ansiosta 100 % ja korkea sumea vastaavuus tuli automaattisesti jokaisessa uudessa versiossa; Vain ~9 000 sanaa 30 000 sanan teoksesta oli varsinaista uutta käännöstä. Aika ja kustannukset vähenivät kolmanneksen.
Tapaus 2 – Dirty TM levitti virheen. Yksi tiimi oli tallentanut raaka-MT-tulosteen TM:ään ilman vahvistusta. Vuotta myöhemmin sama käännösvirhe palasi uudestaan ja uudestaan, näyttäen "luotettavalta" 100-prosenttisesti vastaavana; Virhe levisi 14 eri asiakirjaan. Tiimi otti käyttöön "varmennettu käännös vain TM:ään" -säännön ja siivouskierroksen.
Tapaus 3 – Luottamuksellisuus vuotanut integraatiossa. Kääntäjä teki luottamuksellista työtä CAT-projektissa, joka yhdistettiin automaattisesti pilvi MT:hen; Teksti meni ulkoiseen moottoriin, jonka tietokäytäntö on epäselvä. Kun se huomattiin, salaisten projektien MT-integrointi sammutettiin ja käytettiin vain yritysmoottoreita, jotka "ei tallenna/opeta tietoja".
Neljä kopioitavaa mallia
1) Sumea ottelun arviointi (LLM:lle):
Alla on uusi lähdelause, vastaava lause TM:ssä ja sen hyväksytty käännös. Kerro minulle tarkalleen, mitä minun on muutettava mukauttaakseni TM-käännöksen uuteen lauseeseen; Älä ehdota tarpeettomia muutoksia. Näytä merkityksen ero selkeästi. Uusi lähde: [...] | TM-lähde: [...] | TM-käännös: [...]
2) TM-yhteensopivuuden tarkistus:
Alla on lähde-kohde-parit TM:stä. Merkitse epäjohdonmukaisuudet ja termien poikkeamat, joissa samat tai hyvin samankaltaiset lähdelauseet käännetään ERILAIN. Luettele vain ongelmat. Pariskunnat: [...]
3) Segmentin sävyn uudelleenkirjoitus (LLM CAT:ssa):
Tee seuraava kohdesegmentti [haluttu ääni] MUUTTAMATTA merkitystä. Noudata termiluetteloa: [...]. Säilytä numerot ja nimet. Vie vain uudelleenkirjoitettu segmentti. Segmentti: [...]
4) Yksityisyyden/integraation esitarkastus:
Käytän MT/LLM-integraatiota CAT-projektissa. Kuvailen tekstin tyyppiä tässä projektissa; Kerro, onko asianmukaista lähettää tämä teksti pilvipohjaiseen ulkoiseen moottoriin, mitä kysymyksiä (tietojen säilyttäminen, koulutus, sijainti) minun tulee kysyä palveluntarjoajalta.Tekstin tyyppi/tietosuojatila: [...]
Heikko kehote / Vahva kehote
Heikko: "Käytä käännöstä TM:ssä." (On epäselvää, mikä vastaavuussuhde ja mitä mukauttaa; sokea kopiointi aiheuttaa virheitä.)
Vahva: "Tämä uusi lause vastaa TM:n lausetta 90 % ajasta. Rakenna TM-käännökseen, mutta heijasta tätä eroa: lähteessä on "vuosittainen" sanan "kuukausien" sijaan, joten sen tulisi olla "vuosittain" eikä "kuukausittainen". Älä muuta mitään muuta."
Ero: vahva kehote osoittaa ottelueron; Se estää "vanhan käännöksen jättämisen sellaisenaan", mikä on yleisin sumean sovituksen virhe.
CAT-ekosysteemikomponenttien taulukko
komponentti
Mitä tekee
suhde tekoälyyn
TM (käännösmuisti)
Palauttaa hyväksytyt aiemmat käännökset
Luotettava; edeltää MT:tä
Termbase
Varmistaa termin johdonmukaisuuden
Se annetaan kehotteena LLM:lle
MT suositus
Raaka luonnos tyhjäksi segmentiksi
On muokattava jälkikäteen
LLM-integraatio
Sävy/termi/uudelleenkirjoitus
Hallittu, huomiota yksityisyyteen
QA moduuli
Skannaa numeron/termin/tunnisteen virheen
automaattinen ohjaus
Yleisiä virheitä
- Hyväksyminen sokeasti sumean ottelun. 85 % vastaavuus voi piilottaa 15 % eron merkityksessä.
- Raaka-MT-tulosteen kirjoittaminen TM:ään. Dirty TM kantaa virheen tulevaisuuteen ja lisää sitä.
- Asiakkaan/projektin TM:ien sekoittaminen. Luottamuksellisuus ja termien sekaannusvaara.
- Ei tiedetä minne integrointitiedot menevät. Piiloteksti voi vuotaa ulos ilman, että olet tietoinen siitä.
- TM/MT-eron unohtaminen. MT on arvio; TM on muisto. Nämä kaksi eivät ole yhtä turvallisia.
Esikäännös ja tasaus
Kaksi edistynyttä CAT-toimintoa nopeuttavat entisestään työnkulkua tekoälyn aikakaudella. Ensimmäinen on esikäännös: projektin alussa työkalu täyttää automaattisesti kaikki segmentit TM:llä ja MT:llä; Tyhjän tiedoston sijaan aloitat tiedostolla, jossa 100 % vastaavuuksista on hyväksytty, sumeat osumat odottavat mukauttamista ja tyhjät ovat MT-luonnoksia. Tämä muuttaa työn "kirjoittamisesta tyhjästä" "tarkistamiseen ja muokkaamiseen", mutta sinun on arvioitava jokainen segmentti sen sijaan, että hyväksyt sokeasti esikäännöksen.
Toinen on tasaus: jos sinulla on lähde-kohdeasiakirjapari, joka on käännetty aiemmin, mutta joka ei ole tullut TM:ään, kohdistustyökalu sovittaa ne segmentti segmentiltä ja muuntaa ne TM:ksi. Siten aiemmat käännökset lisätään "muistiin". Varoitus kohdistuksesta: automaattinen sovitus ei aina ole oikein; yksi segmentin lipsahdus häiritsee koko kohdistusta. Kohdistettujen parien tarkistaminen ennen TM-käsittelyä estää likaisen TM:n riskin. Nämä kaksi toimintoa muuttavat nykyiset varat (aiemmat käännökset) sijoituksiksi tuleviin yrityksiin.
Yhteenvetona
CAT työkalut; Se yhdistää käännösmuistin, termikannan, konekäännöksen ja LLM:n yhdeksi tuotantolinjaksi. TM on muisti, joka hakee hyväksytyt aiemmat käännökset ja tarjoaa suuren nopeuden toistuvissa tehtävissä; MT on ennuste, joka on aina tarkistettava. Taitava käyttäjä mukauttaa tarkasti erot sumeissa osumissa, kirjoittaa vain hyväksytyt käännökset TM:iin, pitää asiakkaiden TM:t erillään ja suojaa yksityisyyttä tietäen, mihin data menee integraatiossa.
Sovellustehtävä
Luo pieni projekti CAT-työkalulla (ilmainen online-CAT toimii myös): lisää termikanta ja tyhjä TM. Käännä 10 lauseen teksti, tallenna hyväksytyt käännökset TM:ään. Käännä sitten toinen teksti, joka on hyvin samanlainen kuin ensimmäinen teksti ja muokkaa TM:n palauttamia sumeita osumia "fuzzy match assessment" -mallilla; Huomaa, kuinka monta lausetta tekisit virheen, jos hyväksyisit sokeasti TM:n.
tarkistuslista
- [ ] Yhdistin projektiin TM:n ja termikannan.
- [ ] Käytin eroa sumeissa osumissa adaptiivisesti eikä sokeasti.
- [ ] Kirjoitin TM:lle vain vahvistamani käännöksen.
- [ ] Pidin asiakas-/projektiautomaatit erillään.
- [ ] Tarkistin minne tiedot menevät MT/LLM-integraatiossa.