Единица 5 / 11

Интеграција на вештачка интелигенција со CAT алатки и преведувачка меморија (TM)

Добивки:

  • Разбирање на концептите на преводна меморија (TM), нејасни совпаѓања и сегменти и можност за користење на разликите во нејасните совпаѓања со нивно прилагодување наместо слепо.
  • Способност да се примени дисциплината за пишување само одобрени преводи на ТМ, одржување на одделни ТМ на клиентите и одржување на ТМ
  • Способност да се заштити приватноста со контролирање каде одат податоците во интеграцијата MT/LLM во CAT

Професионалниот превод најчесто се прави во CAT алатка, а не во обичен уредувач на текст. Во оваа единица, ќе ги научите алатките CAT, преведувачката меморија (TM) во срцето на преводот, како тие работат заедно со машинскиот превод и LLM, и како да го користите овој екосистем ефикасно и безбедно. Целта е да станете корисник на технологија за превод кој управува со цел проект, а не поединечни реченици, на конзистентен, брз и следен начин.

Основни концепти

Алатката CAT (превод со помош на компјутер) е професионален софтвер (како Trados, memoQ, Phrase, MateCat) кој го организира преводот реченица по реченица (сегмент) и ги поврзува преведувачката меморија и терминалната база. Ги прикажува изворот и целта рамо до рамо, фаќа повторувања, го зачувува форматирањето.

TM (Преведувачка меморија) е база на податоци што ги чува паровите на реченици извор-целна што претходно сте ги превеле. Кога ќе пристигне нова реченица, доколку има слична реченица во ТМ, агентот ви ја предлага. Клучниот концепт овде е нејасно совпаѓање: сличноста на новата реченица со реченицата во ТМ (100% = сосема иста, 85% = во голема мера слична). Високите совпаѓања ја забрзуваат работата затоа што повторно го користите вашиот претходен превод.

Сегмент е основната единица на преводот - обично реченица. Алатката CAT го дели текстот на сегменти и го уредува секој одделно.

Важноста на TM: MT произведува необработени нацрти, но TM ги враќа вашите одобрени претходни преводи со човечки квалитет. Двете се различни: МТ е предвидување, ТМ е меморија.

Совет: Не мешајте ТМ и МТ. 100% совпаѓање со TM (вашиот претходно одобрен превод) е генерално доверлив; Препораката на МТ секогаш треба да се проверува. Алатките CAT ги прикажуваат двете со различни бои/етикети; секогаш гледајте ја оваа разлика.

Интеграција на MT и LLM во CAT

Современите алатки CAT ги нарекуваат MT мотори и сè повеќе LLM внатрешно: ако нема совпаѓање во TM, агентот автоматски враќа MT препорака за сегментот; го пост-уредите (т.е. MTPE тече во CAT). Алатките од најновата генерација го интегрираат и LLM: можете да правите операции како „препишете го овој сегмент со овој тон“, „поправете го овој термин во терминска база“ итн. во алатката.

Предност на оваа интеграција: TM, termbase, MT и LLM се комбинирани во еден екран; За секоја реченица, се воспоставува протокот „прво погледнете го ТМ, инаку предложи MT, терминот QA автоматски“. Негативна страна и претпазливост: каде одат податоците? Интеграцијата MT/LLM базирана на облак може да испраќа текст до надворешни сервери; Во доверлива работа, ова може да биде прекршување на договорот. Погрижете се да знаете на кој мотор е поврзано возилото и со која политика за податоци.

Напојување и чистење на меморијата за превод

Вредноста на ТМ е колку и квалитетот на преводите во него. Ѓубре внатре, ѓубре надвор. Две дисциплини:

  1. Само напишете го заверениот превод на ТМ. Ако го зачувате сировиот MT излез во TM без да го потврдите, тој ќе се врати на вашите идни работни места како лоша „меморија“.
  2. Изведете одржување на ТМ. Со текот на времето, термините се менуваат и влегуваат грешки. Периодично чистете го TM, исправете ги истрошените/неправилните парови. Во оваа работа го користам LLM за да прашам „дали има некакви недоследности/пристрасност на терминот во овие парови на ТМ?“ Можете да го користите како ревизор.
Внимание: Користењето на TM на еден клиент во бизнисот на друг клиент е истовремено нарушување на доверливоста и ризик од конфузија на терминот. ТМ се чуваат одделно на база на клиент/проект. Мешаниот „сè TM“ ја уништува и доверливоста и квалитетот.

три мини футроли

Случај 1 - ТМ ги прелета репризите. Еден производител преведуваше семејство на производи каде што 70% од неговото упатство остана ист од година во година. Благодарение на TM, 100% и високите нејасни совпаѓања доаѓаа автоматски во секоја нова верзија; Само ~ 9.000 зборови од работата од 30.000 зборови беа вистински нов превод. Времето и трошоците беа намалени за една третина.

Случај 2 - Dirty TM ја пропагира грешката. Еден тим го зачувал сировиот MT излез во TM без потврда. Една година подоцна истиот погрешен превод се враќаше повторно и повторно, изгледајќи како „сигурен“ како 100% совпаѓање; Грешката се прошири на 14 различни документи. Тимот воведе правило „заверен превод само на ТМ“ и тура за чистење.

Случај 3 - Доверливост протече во интеграцијата. Преведувач вршеше доверлива работа во проект CAT што беше автоматски поврзан со облак MT; Текстот отиде до надворешен мотор чија политика за податоци е нејасна. Откако беше забележано, MT интеграцијата за тајни проекти беше исклучена и се користеа само мотори на претпријатијата кои „не складираат/обучуваат податоци“.

Четири шаблони за копирање

1) Евалуација на нејасни натпревари (до LLM):

Подолу е новата изворна реченица, сличната реченица во ТМ и нејзиниот одобрен превод. Кажи ми што точно треба да сменам за да го прилагодам преводот на ТМ на новата реченица; Не предлагајте непотребни промени. Покажете ја разликата во значењето јасно. Нов извор: [...] | Извор на ТМ: [...] | ТМ превод: [...]

2) Проверка на конзистентноста на ТМ:

Подолу се дадени паровите извор-цел од ТМ. Обележете ги недоследностите и отстапувањата на термините каде што истите или многу слични изворни реченици се преведени РАЗЛИЧНО. Само наведете ги проблемите.Парови: [...]

3) Препишување на тон на сегменти (LLM во CAT):

Направете го следниот целен сегмент [посакуван тон] БЕЗ ПРОМЕНА на значењето. Усогласете се со списокот на термини: [...]. Чувајте ги броевите и имињата. Извезете го само препишаниот сегмент. Сегмент: [...]

4) Претходна проверка на приватност/интеграција:

Ќе користам интеграција MT/LLM во проект на CAT. Ќе го опишам типот на текст во овој проект; Кажете ми дали е соодветно да го испратам овој текст до надворешен мотор базиран на облак, кои прашања (задржување податоци, обука, локација) треба да му ги поставам на давателот. Тип на текст/ статус на приватност: [...]

Слаб промпт / Силен промпт

Слабо: „Користете го преводот во ТМ“. (Не е јасно која стапка на совпаѓање и што да се приспособи; слепото копирање воведува грешки.)

Силно: „Оваа нова реченица се совпаѓа со реченицата во ТМ 90% од времето. Надоградете го преводот на ТМ, но одразете ја оваа разлика: изворот има „годишно“ наместо „месечно“, затоа треба да биде „годишно“ наместо „месечно“. Не менувајте ништо друго“.

Разлика: силната порака ја означува разликата во натпреварот; Спречува „да се остави стариот превод како што е“, што е најчеста грешка на нејасно совпаѓање.

Табела со компоненти на екосистемот CAT

компонента

Што прави

однос со ВИ

TM (меморија за превод)

Ги враќа одобрените претходни преводи

Сигурен; му претходи на МТ

Термбаза

Обезбедува конзистентност на терминот

Тоа е дадено како барање за LLM

Препорака на МТ

Необработена скица во празен сегмент

Мора да биде пост-уреден

LLM интеграција

Тон/поим/препишување

Контролирано, внимание на приватноста

Модул за ОК

Скенира грешка со број/поим/ознака

автоматска контрола

Вообичаени грешки

  • Слепо прифаќање на нејасниот натпревар. Поклопување од 85% може да скрие 15% разлика во значењето.
  • Пишување необработен MT излез во TM. Dirty TM ја носи грешката во иднината и ја размножува.
  • Мешање TM на клиент/проект. Доверливост и ризик од конфузија на терминот.
  • Не знаејќи каде одат податоците за интеграција. Скриениот текст може да протече без да бидете свесни за тоа.
  • Заборавајќи ја разликата TM/MT. МТ е проценка; ТМ е меморија. Двајцата не се подеднакво безбедни.

Пред-превод и усогласување

Две напредни функции CAT дополнително го забрзуваат работниот тек во ерата на вештачка интелигенција. Првиот е пред-преведување: на почетокот на проектот, алатката автоматски ги пополнува сите сегменти со TM и MT; Наместо празна датотека, започнувате со датотека каде што се одобрени 100% совпаѓања, нејасните совпаѓања чекаат да се адаптираат, а празните се MT нацрти. Ова ја менува работата од „пишување од нула“ во „прегледување и уредување“ - но треба да го оценувате секој сегмент наместо слепо да го одобрувате преводот.

Вториот е порамнување: ако имате пар документи извор-цел кој е преведен претходно, но не е влезен во ТМ, алатката за порамнување ги совпаѓа сегмент по сегмент и ги претвора во ТМ. Така, вашите минати преводи се додаваат во „меморијата“. Внимание при порамнувањето: автоматското совпаѓање не е секогаш точно; лизгањето на еден сегмент го нарушува целото порамнување. Прегледот на порамнетите парови пред TMing го спречува ризикот од валкани TM на прво место. Овие две функции ги претвораат вашите тековни средства (минатите преводи) во инвестиции во идни бизниси.

Сумирано

CAT алатки; Комбинира меморија за превод, терминска база, машински превод и LLM во една производна линија. TM е меморија што ги враќа вашите одобрени минати преводи и обезбедува голема брзина во повторувачките задачи; МТ е предвидување кое секогаш треба да се потврди. Разумниот корисник внимателно ја прилагодува разликата во нејасните совпаѓања, пишува само одобрени преводи во TM, ги одржува одделни TM-и на клиентите и ја штити приватноста знаејќи каде одат податоците во интеграцијата.

Задача за апликација

Поставете мал проект во алатката CAT (работа и бесплатна онлајн CAT): додадете терминска база и празен TM. Преведете текст од 10 реченици, зачувајте ги одобрените преводи во TM. Потоа преведете втор текст многу сличен на првиот текст и приспособете ги нејасните совпаѓања вратени од ТМ со шаблонот „евалуација на нејасни совпаѓања“; Забележете колку реченици би згрешиле доколку слепо го прифатите ТМ.

листа за проверка

  • [ ] Ги поврзав TM и терминалната база со проектот.
  • [ ] Ја користев разликата во нејасните совпаѓања адаптивно наместо слепо.
  • [ ] На ТМ му го напишав само заверениот превод што го заверив.
  • [ ] Ги чував одделни ТМ на клиенти/проекти.
  • [ ] Проверив каде одат податоците во интеграцијата MT/LLM.