Јединица 5 / 11

Интеграција АИ са ЦАТ алатима и преводилачком меморијом (ТМ)

Добици:

  • Разумевање концепата преводилачке меморије (ТМ), нејасних подударања и сегмената, и способност да се користе разлике у нејасним подударањима прилагођавајући их, а не слепо.
  • Способност примене дисциплине писања само одобрених превода на ТМ, држања ТМ-ова клијената одвојених и одржавања ТМ-а
  • Способност заштите приватности контролисањем где подаци иду у МТ/ЛЛМ интеграцији унутар ЦАТ-а

Професионални превод се најчешће ради у ЦАТ алату, а не у уређивачу обичног текста. У овој јединици ћете научити ЦАТ алате, преводилачку меморију (ТМ) у срцу превођења, како они функционишу заједно са машинским превођењем и ЛЛМ, и како да користите овај екосистем ефикасно и безбедно. Циљ је постати корисник преводилачке технологије који управља целим пројектом, а не појединачним реченицама, на доследан, брз и следљив начин.

Основни појмови

ЦАТ алат (Цомпутер-Ассистед Транслатион) је професионални софтвер (као што су Традос, мемоК, Пхрасе, МатеЦат) који организује превод реченицу по реченицу (сегмент) и повезује преводилачку меморију и терминску базу. Приказује извор и циљ један поред другог, хвата понављања, чува форматирање.

ТМ (Транслатион Мемори) је база података која чува парове реченица извор-циљ које сте претходно превели. Када стигне нова реченица, ако постоји слична реченица у ТМ, агент вам је предлаже. Кључни концепт овде је нејасно подударање: сличност нове реченице са реченицом у ТМ (100% = потпуно иста, 85% = у великој мери слична). Висока подударања убрзавају рад јер поново користите претходни превод.

Сегмент је основна јединица превода — обично реченица. ЦАТ алатка дели текст на сегменте и уређује сваки посебно.

Важност ТМ-а: МТ производи необрађене нацрте, али ТМ враћа ваше одобрене претходне преводе људског квалитета. То двоје је различито: МТ је предвиђање, ТМ је сећање.

Савет: Немојте мешати ТМ и МТ. 100% ТМ подударање (ваш претходно одобрени превод) је генерално поуздано; Препоруку МТ увек треба верифицирати. ЦАТ алати приказују то двоје са различитим бојама/ознакама; увек види ову разлику.

Интеграција МТ и ЛЛМ у ЦАТ

Савремени ЦАТ алати позивају МТ машине и све више интерно ЛЛМ: ако нема подударања у ТМ, агент аутоматски враћа МТ препоруку за сегмент; ви га накнадно уређујете (тј. МТПЕ тече у ЦАТ). Алати најновије генерације такође интегришу ЛЛМ: у алату можете да урадите операције као што су „препишите овај сегмент овим тоном“, „исправите овај термин у базу термина“ итд.

Предност ове интеграције: ТМ, терминска база, МТ и ЛЛМ су комбиновани на једном екрану; За сваку реченицу успоставља се ток „прво погледај ТМ, иначе предложи МТ, термин КА аутоматски“. Лоша страна и опрез: где иду подаци? МТ/ЛЛМ интеграција заснована на облаку може слати текст на спољне сервере; У поверљивом раду, ово може бити кршење уговора. Будите сигурни да знате на који мотор је возило повезано и са којом политиком података.

Напајање и чишћење преводилачке меморије

Вредност ТМ је исто колико и квалитет превода у њему. Смеће унутра, смеће напоље. Две дисциплине:

  1. Само напишите оверени превод у ТМ. Ако сачувате необрађени МТ излаз у ТМ без провере ваљаности, он ће се вратити вашим будућим пословима као лоша „меморија“.
  2. Извршите одржавање ТМ. Временом се термини мењају и грешке улазе. Периодично чисти ТМ, исправне истрошене/нетачне парове. У овом раду користим ЛЛМ да питам „да ли постоје неке недоследности/пристрасност термина у овим ТМ паровима?“ Можете га користити као ревизор.
Опрез: Коришћење ТМ једног клијента у пословању другог клијента представља и кршење поверљивости и ризик од забуне термина. ТМ се чувају одвојено на основу клијента/пројекта. Мешани "све ТМ" уништава и поверљивост и квалитет.

три мини кофера

Случај 1 — ТМ је провео репризе. Произвођач је имао преведену породицу производа при чему је 70% његовог приручника остало исто из године у годину. Захваљујући ТМ, 100% и високо нејасно подударање долази аутоматски у свакој новој верзији; Само ~9.000 речи од 30.000 речи су били стварни нови превод. Време и трошкови су смањени за једну трећину.

Случај 2 — Прљави ТМ је пропагирао грешку. Један тим је сачувао сирови МТ излаз у ТМ без верификације. Годину дана касније исти погрешан превод се враћао изнова и изнова, изгледајући „поуздано“ као 100% подударање; Грешка се проширила на 14 различитих докумената. Тим је успоставио правило „сертификовани превод само за ТМ“ и обилазак чишћења.

Случај 3 — Поверљивост је процурила у интеграцији. Преводилац је радио поверљиве послове у ЦАТ пројекту који је аутоматски био повезан са цлоуд МТ; Текст је отишао на спољни механизам чија политика података није јасна. Једном примећено, МТ интеграција за тајне пројекте је искључена и коришћени су само погони предузећа који „не чувају/објављују податке“.

Четири шаблона за копирање

1) Процена нејасног подударања (за ЛЛМ):

Испод је нова изворна реченица, слична реченица у ТМ и њен одобрени превод. Реците ми шта тачно треба да променим да бих прилагодио превод ТМ новој реченици; Не предлажите непотребне промене. Јасно покажите разлику у значењу. Нови извор: [...] | ТМ извор: [...] | ТМ превод: [...]

2) ТМ провера доследности:

Испод су парови извор-циљ из ТМ. Означите недоследности и одступања термина где се исте или веома сличне изворне реченице РАЗЛИЧИТО преводе. Само наведите проблеме. Парови: [...]

3) Преписивање тона сегмента (ЛЛМ у ЦАТ):

Направите следећи циљни сегмент [жељени тон] БЕЗ ПРОМЕНЕ значења. Придржавајте се листе услова: [...]. Чувајте бројеве и имена. Извезите само преписани сегмент. Сегмент: [...]

4) Претходна провера приватности/интеграције:

Користићу МТ/ЛЛМ интеграцију у ЦАТ пројекту. Описаћу врсту текста у овом пројекту; Реците ми да ли је прикладно да пошаљем овај текст на екстерни механизам заснован на облаку, која питања (задржавање података, обука, локација) треба да поставим провајдеру. Тип текста/статус приватности: [...]

Слаби промпт / Јаки промпт

Слабо: „Користите превод у ТМ-у“. (Нејасно је која стопа подударања и шта да се прилагоди; слепо копирање доноси грешке.)

Јака: „Ова нова реченица се поклапа са реченицом у ТМ-у у 90% времена. Надоградите превод ТМ-а, али одражавајте ову разлику: извор има „годишњи“ уместо „месечни“, тако да би требало да буде „годишњи“ уместо „месечни“. Не мењајте ништа друго.“

Разлика: јак промпт показује разлику у подударању; Спречава „остављање старог превода какав јесте“, што је најчешћа грешка нејасног подударања.

Табела компоненти ЦАТ екосистема

компонента

Шта ради

однос са АИ

ТМ (меморија превода)

Враћа одобрене претходне преводе

Поуздан; претходи МТ

Термбасе

Обезбеђује доследност термина

Даје се као подсетник ЛЛМ

МТ препорука

Сирова скица у празан сегмент

Мора бити накнадно уређен

ЛЛМ интеграција

Тон/термин/преписивање

Контролисано, пажња на приватност

КА модул

Грешка скенирања броја/термина/ознаке

аутоматска контрола

Уобичајене грешке

  • Слепо прихватање нејасног подударања. Подударање од 85% може сакрити 15% разлике у значењу.
  • Писање сировог МТ излаза у ТМ. Дирти ТМ преноси грешку у будућност и шири је.
  • Мешање ТМ корисника/пројеката. Поверљивост и ризик од забуне термина.
  • Не знајући где иду подаци о интеграцији. Скривени текст може да процури, а да ви тога нисте свесни.
  • Заборављајући разлику ТМ/МТ. МТ је процена; ТМ је успомена. Њих двоје нису подједнако безбедни.

Претходно превођење и усклађивање

Две напредне ЦАТ функције додатно убрзавају радни ток у ери вештачке интелигенције. Први је превођење: на почетку пројекта, алат аутоматски попуњава све сегменте са ТМ и МТ; Уместо празног фајла, почињете са датотеком у којој је одобрено 100% подударања, нејасна подударања чекају да се прилагоде, а празна су МТ нацрти. Ово мења посао са „писања од нуле“ на „преглед и уређивање“ — али морате да процените сваки сегмент уместо да слепо одобравате претходни превод.

Друго је поравнање: ако имате пар изворно-циљни документ који је преведен раније, али није ушао у ТМ, алатка за поравнање их подудара сегмент по сегмент и конвертује их у ТМ. Тако се ваши прошли преводи додају у „сећање“. Опрез при поравнању: аутоматско подударање није увек исправно; клизање једног сегмента ремети цело поравнање. Прегледање поређаних парова пре ТМинга спречава ризик од прљавог ТМ-а на првом месту. Ове две функције претварају вашу тренутну имовину (преводе у прошлости) у улагања у будуће послове.

Укратко

ЦАТ алати; Комбинује преводилачку меморију, терминску базу, машинско превођење и ЛЛМ у једну производну линију. ТМ је меморија која преузима ваше одобрене претходне преводе и пружа велику брзину у задацима који се понављају; МТ је предвиђање које увек треба проверити. Паметан корисник пажљиво прилагођава разлику у нејасним подударањима, пише само одобрене преводе у ТМ, држи ТМ клијента одвојеним и штити приватност знајући где подаци иду у интеграцији.

Задатак апликације

Подесите мали пројекат у ЦАТ алату (бесплатни онлајн ЦАТ такође ради): додајте базу термина и празан ТМ. Преведите текст од 10 реченица, сачувајте одобрене преводе у ТМ. Затим преведите други текст веома сличан првом тексту и прилагодите нејасна подударања која је вратио ТМ са шаблоном „процена нејасног подударања“; Обратите пажњу на колико реченица бисте погрешили ако бисте слепо прихватили ТМ.

контролна листа

  • [ ] Повезао сам ТМ и термалну базу са пројектом.
  • [ ] Користио сам разлику у нејасним подударањима адаптивно, а не слепо.
  • [ ] Написао сам ТМ-у само оверени превод који сам оверио.
  • [ ] Држао сам одвојене ТМ купца/пројекта.
  • [ ] Проверио сам где иду подаци у МТ/ЛЛМ интеграцији.