Печалби:
- Възможност за разграничаване на силните и слабите страни на базирания на NMT и LLM превод и избор на правилната машина според типа бизнес
- Възможност за предварително класифициране на пригодността на даден текст за машината и предварителна оценка за реалистично време и цена
- Възможност за бързо измерване на качеството на суровия машинен изход в пет измерения и отбелязване на рискове, без да се бърка плавността с точността
Най-мощният ускорител, който имате като преводач, е машинният превод (MT) — но съзнателното използване на инструмент означава прилагането му към правилната работа, в правилната езикова двойка и с правилните очаквания. В този урок ще се запознаете с двете основни семейства на MT (превод, базиран на NMT и LLM), ще научите кой е по-добър за коя работа, как бързо да измерите качеството на суровия изход на превод преди доставка и как да изберете машината според работата. Целта е да се отдалечите от идеята „все едно, поставете-преведете“ и да станете експерт, който може да предвиди кой текст е подходящ за машината и кой изисква интензивна човешка работа.
Две семейства: NMT и LLM-базиран превод
NMT (Neural Machine Translation) са системи, които са научили от милиони двуезични изречения и превеждат изречението като цяло; Google Translate, DeepL, Microsoft Translator са примери за това. Силни страни: много бърз, последователен, владеещ кратки изречения. Слабо място: често не вижда контекст отвъд границата на изречението (което означава от целия текст); Може да е трудно да решите дали думата "банка" означава бряг или речен бряг, като погледнете параграфа и не отговаря на предоставения списък с термини.
Базиран на LLM превод (Large Language Model) е използването на управлявани от инструкции модели като ChatGPT, Claude, Gemini за превод. Сила: приема инструкции — разбира инструкции като „използвайте официален тон“, „следвайте този списък с термини“, „целевата аудитория са деца“; вижда по-широкия контекст; улавя по-добре идиомите и тона. Слабост: понякога може да бъде „твърде креативен“ и да добавя към източника (риск от халюцинации), губи кохерентност в дълги текстове и разходите/скоростта варират в зависимост от работата.
Основно правило: в прави, повтарящи се технически текстове NMT обикновено е бърз и адекватен; LLM е по-гъвкав с текстове, които изискват дисциплина в тона, контекста, речника и инструкциите. Повечето професионалисти днес използват и двете заедно: бърза чернова от NMT, корекция на тон/термин от LLM.
Съвет: Машинното качество на езикова двойка (напр. турски→английски) може да се различава от обратната посока (английски→турски). Езици с аглутинативен, гъвкав синтаксис, като турски, обикновено са по-предизвикателни за MT. Преценете сами кой двигател е по-добър във вашата двойка с няколко примерни текста.
Машинна съвместимост на текст: първо попитайте това
Не всеки текст е еднакво подходящ за машината. Преди да започнете превода, прекарайте текста през филтър за „пригодност“:
- Подходящ за машината: техническо ръководство, описание на продукта, повтарящ се текст на интерфейса, стандартна кореспонденция, таблица/списък. Езикът е ясен, терминологията е фиксирана, креативността е оскъдна.
- Средно подходящ: новини, корпоративно съдържание, образователни материали. Машината създава добри контури, но изисква сериозно последващо редактиране за тон и поток.
- Не е подходящ за машина (висок риск): юридически договор, медицински текст, реклама/слоган, литературен текст, хумор, поезия. Тук машината само дава идеи; Работата до голяма степен се пада на хората.
Ако направите това разграничение от самото начало, едновременно ще дадете на клиента точното време/цена и ще се предпазите от сляпо доверие на суровия резултат.
Бързо измерване на суровото изходно качество
Когато видите MT резултат, се чудите "добре ли е или лошо?" Отговорете на въпроса с бърз списък, а не с интуиция. Погледнете тези пет измерения: точност (вярно ли е значението на източника?), пълнота (изречението пропуснато ли е или добавено?), терминология (правилна и последователна ли е?), плавност (естествено ли е на целевия език?), формат (запазени ли са тагове, числа, форматиране?). Ние ще задълбочим тези измерения в следващата качествена единица; Засега нека това бъде вашият рефлекс преди раждането.
Внимание: Най-опасните грешки на MT изхода са „плавните, но неправилни“ грешки. Изречението може да е на перфектен турски, но "15% отстъпка" в източника може да е променено на "50% отстъпка". Не се отчайвайте от плавността; Винаги разглеждайте отделно числото, отрицателното и собственото име.
три мини калъфа
Случай 1 — Десният двигател намали времето наполовина. Един преводач избра да преведе софтуерен интерфейс от 12 000 думи с NMT и маркетингова брошура със същия обем с LLM. Последователността на NMT в интерфейса направи работата по-бърза; Тоналната гъвкавост на LLM в брошурата намали натоварването при пренаписване с 40%. Даването на двете задачи на един и същи двигател би загубило време.
Случай 2 — Предварителната оценка спести цената. Един офис се канеше да предложи законов текст, защото "може да се прави на машини, ще е евтино". При предварителната оценка беше преведена извадка от 500 думи; Машината върна два правни термина с грешен еквивалент на системата. Службата определи цената на работата като „тежка последваща редакция“ и даде реалистичен краен срок; Той избягва да загуби пари поради грешна оферта.
Случай 3 — Разлика в езиковата двойка. Екип смята, че двигател, който работи отлично на английски→немски, е със същото качество на турски→арабски. Тестът от 300 думи показа, че изходът на арабски изисква много повече корекции. Екипът разпредели различни двигатели и различни бюджети за последващо редактиране в зависимост от езиковата двойка.
Четири копируеми шаблона
1) Оценка на пригодността на текста:
Вашата роля: старши специалист MTPE. Оценете следния текст за пригодност за машинен превод: буквален/технически или творчески/контекстуален? Класифицирайте го като (1) много удобен за машината, (2) среден, (3) висок риск и напишете своята обосновка. Оценете очакваното натоварване след редактиране като леко/средно/тежко. Пример за текст: [поставете 200-300 думи]
2) Инструктиран LLM превод (с терминология и контрол на тона):
Преведете този текст [източник]→[цел]. Аудитория: [кой]. Тон: [напр. официален]. Поле: [напр. финанси].Списък с термини (не забравяйте да използвате): [A→a, B→b].Правила: не добавяйте това, което не е в източника, запазете номера/дати/имена, заменете всяко изречение с изречение. Маркирайте там, където не сте сигурни с [?]. Текст: [...]
3) Сравнение на два двигателя:
По-долу има два различни превода на едно и също изречение източник (A и B). Сравнете всеки по отношение на коректност, терминология и естественост и ми кажете кое ще изисква по-малко корекция, с обосновката. Източник: [...] | Превод A: [...] | Превод B: [...]
4) Бърза проверка на суровия изход:
По-долу е източникът и машинният превод. Просто маркирайте следното: (1) пропусната/добавена информация, (2) неправилен номер/дата/име, (3) грешка при отрицание, (4) непоследователен термин. Не пишете корекции, просто избройте рисковите области. Източник: [...] | Превод: [...]
Слаба подкана / Силна подкана
Слаб: "Преведете този текст и ще бъде добре." (За двигателя „добър“ е недефиниран; няма тон, няма термин, няма маса.)
Güçlü: „Преведете това описание на продукта от английски на турски. Област: електронна търговия. Аудитория: млади потребители. Тон: приятелски, но успокояващ. „чекиране“ → „стъпка на плащане“, „списък с желания“ → „списък с желания“. Променете номерата и името на марката. Свободен турски без миризма на превод.“
Разлика: силната подкана дава на двигателя измерима цел; резултатът директно се доближава до пост-редактираната чернова.
Сравнителна диаграма на NMT срещу LLM
Размер
NMT (Google, DeepL)
LLM (ChatGPT, Клод)
скорост
много бързо
среден
Получаване на инструкция/тон
слаб
силен
Спазвайте списъка със срокове
ограничен
Добре (с подкана)
Широк контекст
слаб
добре
Риск от халюцинации
ниско
Среден (изисква се контрол)
най-подходящата работа
Прави/технически/повтарящи се
Тон/контекст/творчество
Често срещани грешки
- Използване на един и същ двигател за всяка работа. Неизборът на двигател според вида работа води до загуба на време и качество.
- Давам цена/време без предварителна оценка. Тест от 200-300 думи разкрива изненадите от самото начало.
- Грешка за плавност с точност. Красивото изречение не означава правилно изречение.
- Игнориране на езиковата двойка и разликата в посоката. Добрият двигател в една двойка може да е слаб в друга.
- Не забелязвам допълненията на LLM. LLM понякога добавя изречения, които не са в източника „за да помогнат“; провери това.
Прозорец на контекста и последователност
Когато превеждате дълъг текст с LLM, е необходимо да знаете едно техническо ограничение: контекстният прозорец — количеството текст, което моделът може да „види“ и да запази в ума си в даден момент. Ако текстът е по-голям от този прозорец, ще трябва да го разделите на части и моделът може да „забрави“ в следващата част решението или тона, които сте направили в предишните части. Така че, вместо да превеждате дълга книга или документ в едно парче, напомнянето на всяко парче от терминологичната база и резюмето на стила поддържа последователност. Този проблем не възниква в кратки текстове; Въпреки това, в дълги произведения като романи и ръководства, е необходимо допълнително да се провери последователността в пасажите. Практично решение: да подготвите „памет на проекта“ (термини + знаци + решения за тонове) и да я добавите в началото на всяка част и да сканирате за последователност между частите в края на превода. В NMT този проблем се преживява по различен начин: Тъй като NMT превежда изречение по изречение, последователността на дължината на абзаца вече е слаба, така че базата с термини поема термина дисциплина.
В обобщение
Има две семейства машинен превод: NMT, който е бърз и последователен, и LLM, който приема инструкции и вижда контекста и тона по-добре. Главният преводач оценява предварително пригодността на текста за машината, избира машината според работата, бързо измерва качеството на необработения изход преди доставката и никога не бърка плавността с точността. Този рефлекс за предварителна оценка ви позволява едновременно да дадете реалистично време/цена и да се предпазите от сляпо доверие.
Задача за приложение
Превеждайте един и същ текст от 200 думи както с NMT инструмент, така и с LLM. Сравнете двата резултата по пет измерения (точност, пълнота, терминология, плавност, формат) и напишете причините, поради които се изисква по-малко последващо редактиране за този текст. След това маркирайте проблеми/непредвидени/срочни рискове и на двете с шаблона „бърза проверка на необработен изход“.
контролен списък
- [ ] Класифицирах пригодността на текста за машината (нисък/среден/висок риск).
- [ ] В зависимост от типа работа реших дали да използвам NMT или LLM.
- [ ] Направих предварителна оценка с малка извадка и съответно определих продължителността/цената.
- [ ] Бързо инспектирах необработения изход в пет измерения.
- [ ] Проверих номера, датата, името и негативите поотделно, без да се заблудя от плавността.