Jednotka 5 / 11

Integrace umělé inteligence s nástroji CAT a překladovou pamětí (TM)

zisky:

  • Pochopení pojmů překladové paměti (TM), fuzzy shody a segmentů a schopnost používat rozdíly ve fuzzy shodách jejich přizpůsobením spíše než slepým.
  • Schopnost uplatnit disciplínu psaní pouze schválených překladů do PP, udržování zákaznických PP odděleně a provádění údržby PP
  • Schopnost chránit soukromí řízením toho, kam jdou data v integraci MT/LLM v rámci CAT

Profesionální překlad se nejčastěji provádí v nástroji CAT, nikoli v editoru prostého textu. V této lekci se naučíte nástroje CAT, překladovou paměť (TM), která je jádrem překladu, jak spolupracují se strojovým překladem a LLM a jak efektivně a bezpečně využívat tento ekosystém. Cílem je stát se uživatelem překladatelské technologie, který spravuje celý projekt, nikoli jednotlivé věty, konzistentně, rychle a sledovatelně.

Základní pojmy

CAT nástroj (Computer-Assisted Translation) je profesionální software (např. Trados, memoQ, Phrase, MateCat), který organizuje překlad větu po větě (segmentu) a propojuje překladovou paměť a termbázi. Zobrazuje zdroj a cíl vedle sebe, zachycuje opakování, zachovává formátování.

TM (Translation Memory) je databáze, která uchovává dvojice vět zdroj-cíl, které jste dříve přeložili. Když přijde nová věta, pokud je v TM podobná věta, agent vám ji navrhne. Klíčovým konceptem je zde fuzzy shoda: podobnost nové věty s větou v PP (100 % = přesně stejná, 85 % = do značné míry podobná). Vysoké shody urychlují práci, protože znovu použijete svůj předchozí překlad.

Segment je základní jednotkou překladu — obvykle věta. Nástroj CAT rozděluje text na segmenty a upravuje každý zvlášť.

Význam TM: MT vytváří hrubé návrhy, ale TM vrací vaše schválené minulé překlady v lidské kvalitě. Oba se liší: MT je předpověď, TM je paměť.

Tip: Nezaměňujte TM a MT. 100% shoda TM (váš dříve schválený překlad) je obecně spolehlivá; Doporučení MT by mělo být vždy ověřeno. Nástroje CAT zobrazují dva s různými barvami/štítky; vždy vidět tento rozdíl.

Integrace MT a LLM do CAT

Moderní nástroje CAT interně volají motory MT a stále častěji LLM: pokud v PP není žádná shoda, agent automaticky vrátí doporučení MT pro segment; to posteditujete (tj. MTPE toky v CAT). Nástroje poslední generace také integrují LLM: v nástroji můžete provádět operace jako „přepsat tento segment tímto tónem“, „opravit tento termín na termbázi“ atd.

Výhoda této integrace: TM, termbase, MT a LLM jsou kombinovány na jedné obrazovce; Pro každou větu je stanoven postup „nejprve se podívejte na TM, jinak navrhněte MT, termín QA automaticky“. Nevýhoda a opatrnost: kam jdou data? Cloudová integrace MT/LLM může odesílat text na externí servery; Při důvěrné práci se může jednat o porušení smlouvy. Ujistěte se, že víte, ke kterému motoru je vozidlo připojeno a s jakou datovou politikou.

Napájení a čištění překladové paměti

Hodnota TM je stejně vysoká jako kvalita překladů v ní. Odpadky dovnitř, odpadky ven. Dvě disciplíny:

  1. Stačí napsat ověřený překlad do TM. Pokud uložíte nezpracovaný výstup MT do TM bez jeho ověření, vrátí se do vašich budoucích úloh jako špatná „paměť“.
  2. Proveďte údržbu TM. Postupem času se termíny mění a vstupují chyby. Pravidelně čistěte TM, opravte opotřebované/nesprávné páry. V této práci používám LLM, abych se zeptal: "Existují nějaké nesrovnalosti/předpojatost v těchto párech TM?" Můžete jej použít jako auditora.
Upozornění: Používání TM jednoho zákazníka v podniku jiného zákazníka je porušením důvěrnosti a rizikem záměny termínů. Překladatelské paměti jsou vedeny odděleně na bázi klienta/projektu. Smíšené „vše TM“ ničí důvěrnost i kvalitu.

tři mini pouzdra

Případ 1 – TM letěla záznamy. Výrobce si nechal přeložit produktovou řadu, kde 70 % jeho návodu zůstalo rok co rok stejných. Díky TM se v každé nové verzi automaticky objevily 100% a vysoce fuzzy shody; Pouze ~ 9 000 slov z 30 000 slov bylo skutečným novým překladem. Čas a náklady byly sníženy o jednu třetinu.

Případ 2 — Dirty TM rozšířil chybu. Jeden tým uložil nezpracovaný výstup MT do TM bez ověření. O rok později se stejný chybný překlad vracel znovu a znovu a vypadal jako „spolehlivý“ jako 100% shoda; Chyba se rozšířila do 14 různých dokumentů. Tým zavedl pravidlo „pouze ověřený překlad do TM“ a úklidovou prohlídku.

Případ 3 – Při integraci unikla důvěrnost. Překladatel vykonával důvěrnou práci v projektu CAT, který byl automaticky připojen ke cloudovému MT; Text byl odeslán externímu modulu, jehož datová politika je nejasná. Jakmile bylo zaznamenáno, integrace MT pro tajné projekty byla vypnuta a byly použity pouze podnikové nástroje, které „neukládají/trénují data“.

Čtyři kopírovatelné šablony

1) Vyhodnocení fuzzy shody (do LLM):

Níže je uvedena nová zdrojová věta, podobná věta v TM a její schválený překlad. Řekněte mi přesně, co musím změnit, abych přizpůsobil překlad PP nové větě; Nenavrhujte zbytečné změny. Ukažte jasně rozdíl ve významu. Nový zdroj: [...] | Zdroj TM: [...] | Překlad TM: [...]

2) Kontrola konzistence TM:

Níže jsou uvedeny páry zdroj-cíl z TM. Označte nekonzistence a termínové odchylky tam, kde jsou stejné nebo velmi podobné zdrojové věty přeloženy JINAK. Stačí uvést problémy. Páry: [...]

3) Přepis tónu segmentu (LLM v CAT):

Vytvořte následující cílový segment [požadovaný tón] BEZ ZMĚNY významu. Dodržujte seznam termínů: [...]. Udržujte čísla a jména. Exportujte pouze přepsaný segment. Segment: [...]

4) Předběžná kontrola soukromí/integrace:

Využiji integraci MT/LLM v projektu CAT. Popíšu typ textu v tomto projektu; Řekněte mi, zda je vhodné odeslat tento text do cloudového externího enginu, jaké otázky (uchovávání dat, školení, umístění) mám poskytovateli položit. Typ textu/stav ochrany soukromí: [...]

Slabá výzva / Silná výzva

Slabé: "Použijte překlad v TM." (Není jasné, jakou míru shody a co přizpůsobit; slepé kopírování přináší chyby.)

Strong: "Tato nová věta se v 90 % případů shoduje s větou v PP. Vycházejte z překladu PP, ale zohledněte tento rozdíl: zdroj má 'roční' místo 'měsíční', takže by to mělo být 'roční' místo 'měsíční'. Nic jiného neměňte."

Rozdíl: silná výzva přesně určí rozdíl v zápase; Zabraňuje „nechat starý překlad tak, jak je“, což je nejčastější chyba fuzzy párování.

Tabulka komponent ekosystému CAT

komponenta

Co dělá

vztah s AI

TM (překladová paměť)

Vrátí schválené minulé překlady

Spolehlivý; předchází MT

Termbáze

Zajišťuje konzistenci termínů

Poskytuje se jako výzva LLM

Doporučení MT

Syrová skica do prázdného segmentu

Musí být dodatečně upraveno

Integrace LLM

Tón/termín/přepis

Kontrolováno, dbát na soukromí

Modul QA

Naskenuje chybu čísla/výrazu/značky

automatické ovládání

Časté chyby

  • Slepě přijímáte fuzzy shodu. 85% shoda může skrývat 15% rozdíl ve významu.
  • Zápis surového výstupu MT do TM. Dirty TM přenáší chybu do budoucnosti a rozšiřuje ji.
  • Míchání zákaznických/projektových TM. Důvěrnost a riziko záměny termínů.
  • Nevědět, kam jdou integrační data. Skrytý text může uniknout, aniž byste si toho byli vědomi.
  • Zapomínání na rozdíl TM/MT. MT je odhad; TM je paměť. Ty dva nejsou stejně bezpečné.

Předpřeklad a zarovnání

Dvě pokročilé funkce CAT dále urychlují pracovní tok v éře AI. První je předpřeklad: na začátku projektu nástroj automaticky vyplní všechny segmenty TM a MT; Místo prázdného souboru začnete se souborem, kde jsou schváleny 100% shody, fuzzy shody čekají na přizpůsobení a prázdné jsou návrhy MT. Tím se úloha změní z „psaní od nuly“ na „kontrolu a úpravy“ – ale musíte spíše hodnotit každý segment, než slepě schvalovat předpřeklad.

Druhým je zarovnání: pokud máte pár zdrojového a cílového dokumentu, který byl již dříve přeložen, ale nevstoupil do PP, nástroj pro zarovnání je porovná segment po segmentu a převede je na PP. Vaše minulé překlady se tak přidají do „paměti“. Pozor při zarovnání: automatické párování není vždy správné; posunutí jednoho segmentu naruší celé zarovnání. Kontrola zarovnaných párů před TMingem v první řadě zabraňuje riziku znečištění TM. Tyto dvě funkce promění vaše současná aktiva (minulé překlady) na investice do budoucích podniků.

V souhrnu

CAT nástroje; Spojuje překladovou paměť, terminologickou databázi, strojový překlad a LLM do jediné výrobní linky. TM je paměť, která načítá vaše schválené minulé překlady a poskytuje velkou rychlost v opakujících se úlohách; MT je předpověď, kterou je vždy potřeba ověřit. Důvtipný uživatel pečlivě přizpůsobuje rozdíl v fuzzy shodách, zapisuje do PP pouze schválené překlady, udržuje zákaznické PP oddělené a chrání soukromí tím, že ví, kam data v integraci jdou.

Aplikační úkol

Založte si malý projekt v nástroji CAT (funguje také bezplatný online CAT): přidejte termbázi a prázdnou PP. Přeložte text o 10 větách, uložte schválené překlady do TM. Poté přeložte druhý text velmi podobný prvnímu textu a přizpůsobte fuzzy shody vrácené TM pomocí šablony "vyhodnocení fuzzy shody"; Všimněte si, v kolika větách byste udělali chybu, kdybyste slepě přijali TM.

kontrolní seznam

  • [ ] K projektu jsem připojil TM a termbase.
  • [ ] Rozdíl ve fuzzy shodách jsem použil spíše adaptivně než slepě.
  • [ ] Napsal jsem do TM pouze ověřený překlad.
  • [ ] Nechal jsem zákaznické/projektové TM oddělené.
  • [ ] Zkontroloval jsem, kam jdou data v integraci MT/LLM.