единица 2 / 11

Основи на машинния превод: NMT, LLM, избор на машина и предварителна оценка

Печалби:

  • Възможност за разграничаване на силните и слабите страни на базирания на NMT и LLM превод и избор на правилната машина според типа бизнес
  • Възможност за предварително класифициране на пригодността на даден текст за машината и предварителна оценка за реалистично време и цена
  • Възможност за бързо измерване на качеството на суровия машинен изход в пет измерения и отбелязване на рискове, без да се бърка плавността с точността

Най-мощният ускорител, който имате като преводач, е машинният превод (MT) — но съзнателното използване на инструмент означава прилагането му към правилната работа, в правилната езикова двойка и с правилните очаквания. В този урок ще се запознаете с двете основни семейства на MT (превод, базиран на NMT и LLM), ще научите кой е по-добър за коя работа, как бързо да измерите качеството на суровия изход на превод преди доставка и как да изберете машината според работата. Целта е да се отдалечите от идеята „все едно, поставете-преведете“ и да станете експерт, който може да предвиди кой текст е подходящ за машината и кой изисква интензивна човешка работа.

Две семейства: NMT и LLM-базиран превод

NMT (Neural Machine Translation) са системи, които са научили от милиони двуезични изречения и превеждат изречението като цяло; Google Translate, DeepL, Microsoft Translator са примери за това. Силни страни: много бърз, последователен, владеещ кратки изречения. Слабо място: често не вижда контекст отвъд границата на изречението (което означава от целия текст); Може да е трудно да решите дали думата "банка" означава бряг или речен бряг, като погледнете параграфа и не отговаря на предоставения списък с термини.

Базиран на LLM превод (Large Language Model) е използването на управлявани от инструкции модели като ChatGPT, Claude, Gemini за превод. Сила: приема инструкции — разбира инструкции като „използвайте официален тон“, „следвайте този списък с термини“, „целевата аудитория са деца“; вижда по-широкия контекст; улавя по-добре идиомите и тона. Слабост: понякога може да бъде „твърде креативен“ и да добавя към източника (риск от халюцинации), губи кохерентност в дълги текстове и разходите/скоростта варират в зависимост от работата.

Основно правило: в прави, повтарящи се технически текстове NMT обикновено е бърз и адекватен; LLM е по-гъвкав с текстове, които изискват дисциплина в тона, контекста, речника и инструкциите. Повечето професионалисти днес използват и двете заедно: бърза чернова от NMT, корекция на тон/термин от LLM.

Съвет: Машинното качество на езикова двойка (напр. турски→английски) може да се различава от обратната посока (английски→турски). Езици с аглутинативен, гъвкав синтаксис, като турски, обикновено са по-предизвикателни за MT. Преценете сами кой двигател е по-добър във вашата двойка с няколко примерни текста.

Машинна съвместимост на текст: първо попитайте това

Не всеки текст е еднакво подходящ за машината. Преди да започнете превода, прекарайте текста през филтър за „пригодност“:

  • Подходящ за машината: техническо ръководство, описание на продукта, повтарящ се текст на интерфейса, стандартна кореспонденция, таблица/списък. Езикът е ясен, терминологията е фиксирана, креативността е оскъдна.
  • Средно подходящ: новини, корпоративно съдържание, образователни материали. Машината създава добри контури, но изисква сериозно последващо редактиране за тон и поток.
  • Не е подходящ за машина (висок риск): юридически договор, медицински текст, реклама/слоган, литературен текст, хумор, поезия. Тук машината само дава идеи; Работата до голяма степен се пада на хората.

Ако направите това разграничение от самото начало, едновременно ще дадете на клиента точното време/цена и ще се предпазите от сляпо доверие на суровия резултат.

Бързо измерване на суровото изходно качество

Когато видите MT резултат, се чудите "добре ли е или лошо?" Отговорете на въпроса с бърз списък, а не с интуиция. Погледнете тези пет измерения: точност (вярно ли е значението на източника?), пълнота (изречението пропуснато ли е или добавено?), терминология (правилна и последователна ли е?), плавност (естествено ли е на целевия език?), формат (запазени ли са тагове, числа, форматиране?). Ние ще задълбочим тези измерения в следващата качествена единица; Засега нека това бъде вашият рефлекс преди раждането.

Внимание: Най-опасните грешки на MT изхода са „плавните, но неправилни“ грешки. Изречението може да е на перфектен турски, но "15% отстъпка" в източника може да е променено на "50% отстъпка". Не се отчайвайте от плавността; Винаги разглеждайте отделно числото, отрицателното и собственото име.

три мини калъфа

Случай 1 — Десният двигател намали времето наполовина. Един преводач избра да преведе софтуерен интерфейс от 12 000 думи с NMT и маркетингова брошура със същия обем с LLM. Последователността на NMT в интерфейса направи работата по-бърза; Тоналната гъвкавост на LLM в брошурата намали натоварването при пренаписване с 40%. Даването на двете задачи на един и същи двигател би загубило време.

Случай 2 — Предварителната оценка спести цената. Един офис се канеше да предложи законов текст, защото "може да се прави на машини, ще е евтино". При предварителната оценка беше преведена извадка от 500 думи; Машината върна два правни термина с грешен еквивалент на системата. Службата определи цената на работата като „тежка последваща редакция“ и даде реалистичен краен срок; Той избягва да загуби пари поради грешна оферта.

Случай 3 — Разлика в езиковата двойка. Екип смята, че двигател, който работи отлично на английски→немски, е със същото качество на турски→арабски. Тестът от 300 думи показа, че изходът на арабски изисква много повече корекции. Екипът разпредели различни двигатели и различни бюджети за последващо редактиране в зависимост от езиковата двойка.

Четири копируеми шаблона

1) Оценка на пригодността на текста:

Вашата роля: старши специалист MTPE. Оценете следния текст за пригодност за машинен превод: буквален/технически или творчески/контекстуален? Класифицирайте го като (1) много удобен за машината, (2) среден, (3) висок риск и напишете своята обосновка. Оценете очакваното натоварване след редактиране като леко/средно/тежко. Пример за текст: [поставете 200-300 думи]

2) Инструктиран LLM превод (с терминология и контрол на тона):

Преведете този текст [източник]→[цел]. Аудитория: [кой]. Тон: [напр. официален]. Поле: [напр. финанси].Списък с термини (не забравяйте да използвате): [A→a, B→b].Правила: не добавяйте това, което не е в източника, запазете номера/дати/имена, заменете всяко изречение с изречение. Маркирайте там, където не сте сигурни с [?]. Текст: [...]

3) Сравнение на два двигателя:

По-долу има два различни превода на едно и също изречение източник (A и B). Сравнете всеки по отношение на коректност, терминология и естественост и ми кажете кое ще изисква по-малко корекция, с обосновката. Източник: [...] | Превод A: [...] | Превод B: [...]

4) Бърза проверка на суровия изход:

По-долу е източникът и машинният превод. Просто маркирайте следното: (1) пропусната/добавена информация, (2) неправилен номер/дата/име, (3) грешка при отрицание, (4) непоследователен термин. Не пишете корекции, просто избройте рисковите области. Източник: [...] | Превод: [...]

Слаба подкана / Силна подкана

Слаб: "Преведете този текст и ще бъде добре." (За двигателя „добър“ е недефиниран; няма тон, няма термин, няма маса.)

Güçlü: „Преведете това описание на продукта от английски на турски. Област: електронна търговия. Аудитория: млади потребители. Тон: приятелски, но успокояващ. „чекиране“ → „стъпка на плащане“, „списък с желания“ → „списък с желания“. Променете номерата и името на марката. Свободен турски без миризма на превод.“

Разлика: силната подкана дава на двигателя измерима цел; резултатът директно се доближава до пост-редактираната чернова.

Сравнителна диаграма на NMT срещу LLM

Размер

NMT (Google, DeepL)

LLM (ChatGPT, Клод)

скорост

много бързо

среден

Получаване на инструкция/тон

слаб

силен

Спазвайте списъка със срокове

ограничен

Добре (с подкана)

Широк контекст

слаб

добре

Риск от халюцинации

ниско

Среден (изисква се контрол)

най-подходящата работа

Прави/технически/повтарящи се

Тон/контекст/творчество

Често срещани грешки

  • Използване на един и същ двигател за всяка работа. Неизборът на двигател според вида работа води до загуба на време и качество.
  • Давам цена/време без предварителна оценка. Тест от 200-300 думи разкрива изненадите от самото начало.
  • Грешка за плавност с точност. Красивото изречение не означава правилно изречение.
  • Игнориране на езиковата двойка и разликата в посоката. Добрият двигател в една двойка може да е слаб в друга.
  • Не забелязвам допълненията на LLM. LLM понякога добавя изречения, които не са в източника „за да помогнат“; провери това.

Прозорец на контекста и последователност

Когато превеждате дълъг текст с LLM, е необходимо да знаете едно техническо ограничение: контекстният прозорец — количеството текст, което моделът може да „види“ и да запази в ума си в даден момент. Ако текстът е по-голям от този прозорец, ще трябва да го разделите на части и моделът може да „забрави“ в следващата част решението или тона, които сте направили в предишните части. Така че, вместо да превеждате дълга книга или документ в едно парче, напомнянето на всяко парче от терминологичната база и резюмето на стила поддържа последователност. Този проблем не възниква в кратки текстове; Въпреки това, в дълги произведения като романи и ръководства, е необходимо допълнително да се провери последователността в пасажите. Практично решение: да подготвите „памет на проекта“ (термини + знаци + решения за тонове) и да я добавите в началото на всяка част и да сканирате за последователност между частите в края на превода. В NMT този проблем се преживява по различен начин: Тъй като NMT превежда изречение по изречение, последователността на дължината на абзаца вече е слаба, така че базата с термини поема термина дисциплина.

В обобщение

Има две семейства машинен превод: NMT, който е бърз и последователен, и LLM, който приема инструкции и вижда контекста и тона по-добре. Главният преводач оценява предварително пригодността на текста за машината, избира машината според работата, бързо измерва качеството на необработения изход преди доставката и никога не бърка плавността с точността. Този рефлекс за предварителна оценка ви позволява едновременно да дадете реалистично време/цена и да се предпазите от сляпо доверие.

Задача за приложение

Превеждайте един и същ текст от 200 думи както с NMT инструмент, така и с LLM. Сравнете двата резултата по пет измерения (точност, пълнота, терминология, плавност, формат) и напишете причините, поради които се изисква по-малко последващо редактиране за този текст. След това маркирайте проблеми/непредвидени/срочни рискове и на двете с шаблона „бърза проверка на необработен изход“.

контролен списък

  • [ ] Класифицирах пригодността на текста за машината (нисък/среден/висок риск).
  • [ ] В зависимост от типа работа реших дали да използвам NMT или LLM.
  • [ ] Направих предварителна оценка с малка извадка и съответно определих продължителността/цената.
  • [ ] Бързо инспектирах необработения изход в пет измерения.
  • [ ] Проверих номера, датата, името и негативите поотделно, без да се заблудя от плавността.