Единица 2 / 11

Основи на машински превод: NMT, LLM, избор на мотор и претходна евалуација

Добивки:

  • Способност да се разликуваат силните и слабите страни на преводот базиран на NMT и LLM и да се избере вистинскиот мотор според видот на бизнисот
  • Способност да се прекласифицира соодветноста на текстот за машината и претходно да се оцени за реално време и цена
  • Способност за брзо мерење на квалитетот на сировото производство на машината во пет димензии и ризиците за знаме без да се мешаат мазноста со точноста

Најмоќниот акцелератор што го имате како преведувач е машинскиот превод (MT) - но користењето алатка свесно значи да се примени на вистинската работа, во вистинскиот јазичен пар и со вистинските очекувања. Во оваа единица, ќе ги запознаете двете главни семејства на MT (превод базиран на NMT и LLM), ќе научите која е подобра за која работа, како брзо да го измерите необработениот квалитет на преводот пред испораката и како да го изберете моторот според работата. Целта е да се оддалечиме од идејата „сеедно, залепете-преведете“ и да станете експерт кој може да предвиди кој текст е погоден за машината и кој бара човечко интензивна работа.

Две семејства: NMT и LLM-базиран превод

NMT (Neural Machine Translation) се системи кои научиле од милиони двојазични реченици и ја преведуваат реченицата како целина; Google Translate, DeepL, Microsoft Translator се примери за нив. Јаки страни: многу брз, конзистентен, течен во кратки реченици. Слабост: често не гледа контекст надвор од границата на реченицата (што значи од целиот текст); Можеби е тешко да се одлучи дали зборот „банка“ значи брег или брег на река со гледање на параграфот и тој не одговара на списокот на дадени термини.

Преводот базиран на LLM (Large Language Model) е употреба на модели управувани од инструкции како што се ChatGPT, Claude, Gemini за превод. Сила: зема инструкции - разбира инструкции како што се „користете формален тон“, „следете ја оваа листа на термини“, „целната публика се децата“; го гледа поширокиот контекст; подобро ги доловува идиомот и тонот. Слабост: понекогаш може да биде „премногу креативна“ и да го додаде изворот (ризик од халуцинации), ја губи кохерентноста во долгите текстови, а трошоците/брзината варира во зависност од работата.

Правило на палецот: во прави, повторувачки, технички текстови NMT е обично брз и адекватен; LLM е пофлексибилен со текстови кои бараат дисциплина во тонот, контекстот, вокабуларот и наставата. Повеќето професионалци денес ги користат двете заедно: брз нацрт од NMT, корекција на тон/ термин од LLM.

Совет: Квалитетот на машината на јазичниот пар (на пр. турски→англиски) може да се разликува од спротивната насока (англиски→турски). Јазиците со аглутинативна, флексибилна синтакса, како што е турскиот, генерално се попредизвикувачки за МТ. Проценете сами кој мотор е подобар во вашиот пар со неколку примероци на текстови.

Машинска компатибилност на текстот: прво прашајте го ова

Не секој текст е подеднакво погоден за машината. Пред да започнете со преводот, поминете го текстот низ филтерот „соодветност“:

  • Добро прилагоден на машината: технички прирачник, опис на производот, повторлив текст на интерфејсот, стандардна кореспонденција, табела/список. Јазикот е обичен, терминологијата е фиксна, креативноста е оскудна.
  • Погоден медиум: вести, корпоративна содржина, едукативен материјал. Машината создава добри контури, но бара сериозно пост-уредување за тон и проток.
  • Не е погоден за машина (висок ризик): правен договор, медицински текст, реклама/слоган, литературен текст, хумор, поезија. Овде машината дава само идеи; Работата во голема мера им паѓа на луѓето.

Ако ја правите оваа разлика од самиот почеток, и двајцата ќе му го дадете на клиентот вистинското време/цена и ќе се заштитите од слепо верување на сировиот производ.

Брзо измерете го квалитетот на суровиот излез

Кога ќе видите MT излез се прашувате „дали е добро или лошо?“ Одговорете на прашањето со брза листа за проверка, а не со интуиција. Погледнете ги овие пет димензии: точност (дали значењето е верно на изворот?), комплетност (дали реченицата е испуштена или додадена?), терминологија (дали е точна и конзистентна?), флуентност (дали е природно во целниот јазик?), формат (дали се зачувани ознаките, бројките, форматирањето?). Овие димензии ќе ги продлабочиме во следната единица за квалитет; Засега, нека биде вашиот рефлекс пред породувањето.

Внимание: Најопасните грешки на MT излезот се „течните, но неточните“ грешки. Можеби реченицата е на перфектен турски јазик, но „15% попуст“ во изворот можеби е сменета во „50% попуст“. Не се одложувајте од флуентноста; Секогаш гледајте го бројот, негативата и соодветната именка одделно.

три мини футроли

Случај 1 - Вистинскиот мотор го намали времето на половина. Еден преведувач избра да преведе софтверски интерфејс од 12.000 зборови со NMT и маркетинг брошура со ист волумен со LLM. Конзистентноста на NMT на интерфејсот ја направи работата побрза; Тонската флексибилност на LLM во брошурата го намали товарот за препишување за 40%. Давањето на двете работи на ист мотор би изгубило време.

Случај 2 - Претходната проценка ја спаси цената. Една канцеларија требаше да понуди правен текст затоа што „може да се направи од машини, ќе биде евтино“. Во предевалуацијата беше преведен примерок од 500 зборови; Машината врати два законски термини со еквивалент на погрешен систем. Канцеларијата ја оцени работата како „тешка пост-уредување“ и даде реален рок; Избегнал да загуби пари поради погрешна понуда.

Случај 3 — Разлика во јазичниот пар. Еден тим мислеше дека моторот што одлично функционира на англиски → германски е со ист квалитет на турски → арапски. Тестот од 300 зборови покажа дека арапскиот излез бара многу поголема корекција. Тимот одвои различни мотори и различни буџети по уредувањето во зависност од јазичниот пар.

Четири шаблони за копирање

1) Проценка на соодветноста на текстот:

Вашата улога: виш специјалист за МТПЕ. Оценете го следниов текст за соодветност за машински превод: буквално/технички или креативен/контекстуален? Класифицирајте го како (1) многу машински, (2) среден, (3) висок ризик и напишете го вашето оправдување. Проценете го очекуваното оптоварување по уредувањето како лесно/средно/тешко. Пример за текст: [залепете 200-300 зборови]

2) Упатен превод на LLM (со терминологија и контрола на тон):

Преведи го овој текст [извор]→[целна]. Публика: [кој]. Тон: [на пр. официјално]. Поле: [на пр. финансии].Список на термини (задолжително користете): [A→a, B→b].Правила: не додавајте што не е во изворот, чувајте броеви/датуми/имиња, заменете ја секоја реченица со реченица. Означете каде не сте сигурни со [?]. Текст: [...]

3) Споредба на два мотори:

Подолу се дадени два различни преводи на иста изворна реченица (А и Б). Спореди го секој по исправност, терминологија и природност и кажи ми на кој ќе му треба помала корекција, со оправдување. Извор: [...] | Превод А: [...] | Превод Б: [...]

4) Брза инспекција на суров излез:

Подолу е изворот и машинскиот превод. Само означете го следново: (1) испуштени/додадени информации, (2) неточен број/датум/име, (3) грешка при негација, (4) неконзистентен термин. Не пишувајте никакви корекции, само наведете ги ризичните области. Извор: [...] | Превод: [...]

Слаб промпт / Силен промпт

Слаб: „Преведи го овој текст и ќе биде добро“. (За моторот, „доброто“ е недефинирано; без тон, без термин, без маса.)

Güçlü: "Преведи го овој опис на производот од англиски на турски. Област: е-трговија. Публика: млад потрошувач. Тон: пријателски, но смирувачки. 'checkout' → 'checkout step', 'wishlist' → 'wish list'. Променете ги броевите и името на брендот. Течно турски без никаков мирис на превод."

Разлика: силната порака му дава на моторот мерлива цел; излезот директно се приближува на пост-уредениот нацрт.

Табела за споредба NMT наспроти LLM

Големина

NMT (Google, DeepL)

LLM (ChatGPT, Клод)

брзина

многу брзо

средно

Примајте инструкции/тон

слаб

силна

Усогласете се со списокот со термини

ограничен

Добро (со брза)

Широк контекст

слаб

добро

Ризик од халуцинации

низок

Средно (потребна е контрола)

најпогодна работа

Директно/технички/повторувачки

Тон/контекст/креативен

Вообичаени грешки

  • Користење на истиот мотор за секоја работа. Неизборот на мотор според видот на работата предизвикува губење на време и квалитет.
  • Давање цена/време без предевалуација. Тест од 200-300 зборови ги открива изненадувањата од самиот почеток.
  • Погрешно флуентност со точност. Убава реченица не значи правилна реченица.
  • Игнорирање на јазичниот пар и разликата во насоката. Добар мотор во еден пар може да биде слаб во друг.
  • Не забележувајќи ги додатоците на LLM. LLM понекогаш додава реченици кои не се во изворот „за да помогнат“; проверете го ова.

Контекстен прозорец и конзистентност

Кога се преведува долг текст со LLM, неопходно е да се знае една техничка граница: контекстниот прозорец - количината на текст што моделот може да го „види“ и да го задржи на ум во исто време. Ако текстот е поголем од овој прозорец, ќе мора да го поделите на парчиња, а моделот може да го „заборави“ во следниот дел терминот одлука или тон што сте го донеле во претходните делови. Значи, наместо да се преведува долга книга или документ во едно парче, потсетувањето на секое парче од резимето на базата на термини и стилови одржува конзистентност. Овој проблем не се јавува во кратки текстови; Меѓутоа, во долгите дела како што се романите и прирачниците, потребно е дополнително да се провери доследноста во пасуси. Практично решение: да се подготви „проектна меморија“ (поими + знаци + одлуки за тонови) и да се додаде на почетокот на секој дел и да се скенира за конзистентност помеѓу парчињата на крајот од преводот. Во NMT, овој проблем се доживува на поинаков начин: бидејќи NMT преведува реченица по реченица, конзистентноста на должината на параграфот е веќе слаба, така што termbase го презема терминот дисциплина.

Сумирано

Постојат две фамилии на машински превод: NMT, кој е брз и конзистентен, и LLM, кој зема инструкции и подобро го гледа контекстот и тонот. Главниот преведувач однапред ја оценува соодветноста на текстот за машината, го избира моторот според работата, брзо го мери квалитетот на сировиот излез пред испораката и никогаш не ја меша флуентноста со точноста. Овој рефлекс на предевалуација ви овозможува и да дадете реално време/цена и да се заштитите од слепата доверба.

Задача за апликација

Преведете го истиот текст од 200 зборови и со алатка NMT и со LLM. Споредете ги двата излеза за пет димензии (точност, комплетност, терминологија, флуентност, формат) и напишете ги причините поради кои е потребно помалку пост-уредување за овој текст. Потоа означете ги ризиците за проблем/непредвидени/рок на двете со шаблонот „брза проверка на сиров излез“.

листа за проверка

  • [ ] Ја класифицирав соодветноста на текстот за машината (низок/среден/висок ризик).
  • [ ] Во зависност од видот на работата, решив дали да користам NMT или LLM.
  • [ ] Направив прелиминарна евалуација со мал примерок и соодветно го одредив времетраењето/цената.
  • [ ] Брзо го прегледав сировиот излез во пет димензии.
  • [ ] Посебно ги проверував бројот, датумот, името и негативите без да ме измами флуентноста.