Единицы
1. Введение в искусственный интеллект в письменном и устном переводе: роли, границы, аутентификация, конфиденциальность и этика 2. Основы машинного перевода: NMT, LLM, выбор механизма и предварительная оценка 3. Постредактирование машинного перевода (MTPE): упрощенное и полное постредактирование 4. Управление терминологией и терминологической базой: согласованность и корпоративный язык 5. Интеграция искусственного интеллекта с CAT-инструментами и памятью переводов (TM) 6. Локализация (L10n): программное обеспечение, Интернет, игры и культурная адаптация 7. Субтитры, дубляж и аудиовизуальный перевод 8. Контроль качества (QA), метрики оценки и LQA 9. Подготовка к устному переводу: последовательный и синхронный перевод 10. Контекст, культура, тон и творческий перевод (транскреация) 11. Конфиденциальность, этика, авторское право, подлинность и будущее профессии
Единица 7 / 11

Субтитры, дубляж и аудиовизуальный перевод

Прибыль:

  • Возможность уместиться с сохранением смысла за счет применения технических правил субтитров (строка, символ, CPS)
  • Возможность голосовой проверки ошибок в имени и номере, а также ускорение транскрипции и автоматического таймкодирования с помощью ASR.
  • Возможность управлять пределами искусственного интеллекта, принимая во внимание визуальный контекст, тональную разницу и синхронизацию губ при дубляже.

Перевод фильма, сериала, корпоративного видео или онлайн-курса кардинально отличается от перевода обычного текста: ограничениями также являются время, скорость чтения, изображение на экране, голос и движение губ персонажей. В этом модуле вы изучите аудиовизуальный перевод (субтитры, дубляж, закадровый голос), технические правила субтитров, транскрипцию и тайм-кодирование с поддержкой искусственного интеллекта, а также проблемы качества в этой области. Цель состоит в том, чтобы работать как эксперт по аудиовизуальному переводу, который «подстраивается под глаза и уши аудитории», а не «переводит текст».

Основные понятия

Аудиовизуальный перевод (АВТ) — это перевод контента, содержащего аудио и видео; Основными формами являются субтитры, дубляж и аудиоописание. Субтитры – это отражение речи в письменной форме на экране. Дубляж – это перезапись оригинального голоса на целевой язык. Закадровый голос — это когда исходный звук приглушается и поверх него зачитывается перевод (обычно в документальных фильмах).

Два важнейших технических термина субтитров: CPS (символов в секунду) ограничивает скорость субтитров, чтобы зритель мог их комфортно читать; Общепринятый верхний предел — около 17 символов в секунду (нижний для детского контента). Тайм-код — это время начала и окончания, которое указывает, когда субтитры появятся и исчезнут на экране (например, 00:01:23,400).

Почему это сложно? Потому что это значит вписать перевод в субтитры. Две строки, ~42 символа в строке, минимум ~1 секунда и максимум ~6 секунд экранного времени и лимит CPS — всё это нужно соблюдать, сохраняя смысл и тональность. Вот почему перевод субтитров часто представляет собой сжатие и перефразирование, а не дословный перевод.

Совет: избегайте рефлекса «переводить каждое слово» в субтитрах. Зритель одновременно смотрит и читает изображение; Слишком длинные субтитры невозможно прочитать. Найти кратчайшее естественное выражение, сохраняющее смысл, — это настоящее мастерство автора субтитров.

Роль ИИ в аудиовизуальном переводе

ИИ существенно ускоряет несколько шагов в этой области:

  1. Транскрипция: благодаря ASR (автоматическому распознаванию речи) голос автоматически транскрибируется. Это извлекает необработанный источник субтитров за считанные минуты.
  2. Автоматическое временное кодирование. Инструменты делят разговор на сегменты и создают черновые временные коды.
  3. Черновой вариант перевода: Текст стенограммы переводится.
  4. Контроль CPS/длины: ИИ может отмечать, какой субтитр превышает скорость чтения, и предлагать сократить его.

Но будьте осторожны: ASR ошибается в отношении шума, акцента, наложения речи, имен собственных и технических терминов; не может предоставить «аудиоописание»; Говорящий может запутаться. Перевод AI не видит изображения — он не может знать, когда объект, показанный на экране, называется «то». Таким образом, человек проверяет визуальный контекст и точность расшифровки.

Внимание: Самая распространенная ошибка — думать, что вывод ASR «декодирован». ASR допускает частые ошибки, особенно в именах собственных, цифрах, названиях брендов и технических терминах; неправильная транскрипция переносится на перевод и субтитры. Обязательно проверьте критические области, прослушивая звук.

Правила формата субтитров

Общие правила (зависят от платформы):

  • ~37-42 символа в строке, максимум 2 строки.
  • Продолжительность: ~1-6 секунд; Избегайте очень коротких «мгновенных» субтитров.
  • CPS не должен превышать ~17 (контент для взрослых).
  • Разорвите предложение там, где это имеет смысл (не оставляйте «и» или «но» в конце строки).
  • По возможности не пропускайте кат-сцену (смену кадров).
  • Следуйте правилам платформы в отношении таких предметов, как ругательства, песни, текстовые сообщения.

три мини-кейса

Случай 1 — ASR + постредактирование ускорено на 60%. Команда сначала расшифровала и закодировала 45-минутный документальный фильм с помощью ASR, затем перевела и отредактировала его. Время сокращено на 60% по сравнению с расшифровкой + кодированием с нуля. Но все имена собственные и числа исправлялись звуковым сравнением.

Случай 2 — проверка CPS сохранила читаемость. Первый перевод обучающего видео с субтитрами был точным, но CPS в среднем составил 24 — аудитория не успевала. В результате сокращения субтитров с помощью искусственного интеллекта субтитры сократились на 30%, в результате чего CPS снизился до 16; смысл сохранился, пришла читабельность.

Случай 3 — Ошибка визуального контекста. В переводе на основе ASR персонаж указал на знак на экране и сказал: «Прочитай это»; ИИ перевел это как «прочитай», но текст на вывеске не был переведен, поэтому зритель не мог видеть, что читать. Автор субтитров добавил отдельную подпись для подписи на экране; Все дело в том, что человек, увидевший изображение, решил проблему.

Четыре копируемых шаблона

1) Список проверки транскрипции (ASR):

Ниже представлена автоматическая транскрипция видео. Отметьте возможные ошибки в транскрипции: имена собственные, торговые марки, цифры, технические термины, двусмысленные/неполные предложения. Укажите их как «подтвердить голосом». Не переводите. Расшифруйте: [...]

2) Перевод субтитров (ограничение по CPS/длине):

Переведите следующую транскрипцию на субтитры [целевой язык]. ОГРАНИЧЕНИЕ: каждый субтитр должен состоять максимум из 2 строк, строка ~42 символа, CPS не должен превышать ~17. СОКРАТИТЕ и натурализуйте, сохраняя при этом смысл; не переводите слово в слово. Сохраняйте временные коды. Транскрипция + тайм-коды: [...]

3) Проверка CPS/читаемости:

Рассчитайте приблизительную цену в секунду на основе продолжительности и количества символов для каждого из следующих субтитров. Отметьте те, которые превышают 17, и предложите более короткий вариант, сохраняющий смысл. Субтитры (текст | длительность в секундах): [...]

4) Проверка текста на экране/визуального контекста:

В следующем диалоге отметьте места, которые могут относиться к изображению (экранный текст, указанный предмет, знак). Скажите, нужны ли для них дополнительные субтитры/пояснения, предполагая, что зритель не может видеть изображение. Диалог: [...]

Слабая подсказка / Сильная подсказка

Слабое: «Переведите эти субтитры». (Нет длины, CPS, правил линии; вывод не помещается на экране, не читается.)

Гючлю: «Переведите эту расшифровку диалога на турецкие субтитры. Каждый субтитр должен состоять максимум из 2 строк по 42 символа в строке; сокращайте его, сохраняя смысл, когда это необходимо для скорости чтения. Разговорный язык дайте на естественном турецком языке, смягчите сленг. Не трогайте тайм-коды».

Отличие: сильная подсказка указывает на технические ограничения субтитров (строка, символ, частота кадров, тон); результат фактически приближается к пригодным для использования субтитрам.

Сравнительная таблица форматов AVT

формат

Что значит

Вклад ИИ

критическая точка человека

субтитры

Транскрибирует речь

ASR, перевод, CPS

Подходит, визуальный контекст

дубляж

Озвучка на целевом языке

Черновой вариант перевода

синхронизация губ, актерское мастерство

закадровый голос

Читай перевод выше

Перевод, тайминг

Естественный поток, тонус

Аудио описание

Описывает изображение со звуком

проект текста

Визуальная интерпретация (человек)

Распространенные ошибки

  • Перевод расшифровки ASR без ее проверки. Ошибки в имени/номере переносятся в подзаголовок.
  • Переводим слово за словом и обходим CPS. Аудитория не может читать; должна быть сделана подгонка.
  • Игнорирование визуального контекста. Текст на экране и указанные объекты остаются непереведенными.
  • Делаем разделение строк бессмысленным. Это портит читабельность.
  • Выравнивание тона/регистра. Диалекты и сленг персонажей исчезают.

Дубляж и синхронизация губ

В то время как ограничением субтитров является скорость чтения, ограничением дублирования является время и губы. При переводе закадрового голоса существует три различных типа синхронизации: синхронизация губ — когда перевод соответствует движению рта персонажа, особенно открытым гласным на крупных планах; изохронность — строка перевода имеет ту же длину, что и исходная строка, не слишком короткая и не слишком длинная; синхронность жестов — совпадение сказанного с движениями рук и рук персонажа. Поэтому переводчик дубляжа часто пишет «цепляющую» строчку, сохраняющую смысл, но совершенно другими словами; Верность слова здесь даже меньше, чем субтитров.

ИИ может предоставить необработанный черновик перевода и предупреждение о времени дубляжа («эта строка на 40% длиннее оригинала, сократите ее»). Новые технологии позволяют даже клонировать звук и производить автоматическое дублирование; но игра, эмоции, точная настройка дыхания персонажа и синхронизация губ по-прежнему остаются работой человека-переводчика и актера озвучивания. Автоматическое дублирование обеспечивает контур; Художественное и синхронное решение принадлежит человеку. Кроме того, согласие человека, чей голос клонируется, является важным этическим и юридическим вопросом.

В заключение

Аудиовизуальный перевод – это искусство подгонки текста под ограничения глаза и слуха зрителя: границы строк/символов/CPS в субтитрах, синхронизация губ в дубляже, визуальный контекст является определяющим фактором во всех них. ИИ ускоряет транскрипцию, таймкодирование, составление перевода и проверку CPS с помощью ASR; Но ASR ошибается в именах собственных и шумах, не видит изображения и решения о подборе тона принимает человек. Главный субтитр не переводит слово в слово; находит самое короткое, самое естественное выражение, сохраняющее смысл.

Задача приложения

Выберите короткий (2–3 минуты) видеоролик. Расшифруйте с помощью инструмента ASR, сравните и исправьте рискованные области аудио с помощью шаблона «проверки транскрипции». Затем переведите с ограничением CPS ~17 с помощью шаблона «перевод субтитров» и сократите субтитры, превышающие лимит, с помощью «управления CPS». Если на экране есть текст или знак, примените «проверку визуального контекста».

контрольный список

  • [ ] Я проверил расшифровку ASR голосом для конкретного имени/номера.
  • [ ] Я привел субтитры в соответствие с правилами строки/символа/CPS.
  • [ ] Я сократил и натурализовал его, не слово в слово, сохранив смысл.
  • [ ] Я учитывал визуальный контекст (текст на экране, знак).
  • [ ] Я перевел его, чтобы сохранить различия в тоне и характере.