Единицы
1. Введение в искусственный интеллект в видеопроизводстве: роли, границы, аутентификация, авторские права и конфиденциальность 2. От идеи к сценарию: разработка концепции, сценария и плана съемок 3. Раскадровка и визуальная подготовка: превиз, референс и дизайн съемки 4. Транскрипция и субтитры: речь в текст и многоязычные субтитры 5. Помощник по монтажу: черновой монтаж, выбор сцены, ритм и монтаж. 6. Дубляж, клонирование голоса и многоязычный дубляж 7. Короткий клип и продуктивное видео: видео с преобразованием текста в текст, ролики и клипы для социальных сетей 8. Визуальные эффекты, цвет, очистка и улучшение звука 9. Заголовок, миниатюра, метаданные и оптимизация распространения 10. Авторское право, безопасность бренда, этика и согласие Deepfake 11. Комплексный рабочий процесс: набор инструментов, команда, контроль качества и доставка
Единица 4 / 11

Транскрипция и субтитры: речь в текст и многоязычные субтитры

Прибыль:

  • Способность понимать концепции автоматической транскрипции и разделения говорящих, а также преобразовывать необработанную запись в текст с временным кодированием.
  • Способность понимать форматы субтитров (SRT/VTT), скорость чтения и правила строк, а также создавать и редактировать проекты многоязычных субтитров.
  • Понимая, что ответственность за проверку терминологии, имен собственных, пунктуационных ошибок и ошибок перевода в автоматической расшифровке перед публикацией лежит на редакторе.

Самой утомительной и трудоемкой задачей постобработки традиционно была транскрипция: редактор часами слушал записи интервью, печатая каждое предложение вручную. На расшифровку одночасовой записи легко уйдет четыре-пять часов. Искусственный интеллект радикально изменил этот бизнес: сегодня часовую запись можно превратить в текст с временным кодированием за считанные минуты. Это ускоряет процесс редактирования и обеспечивает доступность (субтитры для зрителей с нарушениями слуха и просмотр без звука). Но автоматический вывод никогда не пригоден для публикации в необработанном виде; В этом блоке мы увидим и мощь, и подводные камни.

Начнем с условий. Транскрипция – это перевод речи в письменную форму. Автоматическое распознавание речи (ASR) — это технология, которая преобразует голос в текст. Таймкод — это знак, показывающий, какой секунде соответствует текст в видео. Диаризация спикера — это различение того, кто говорил, и разделение текста на говорящих. Субтитр (subtitle/caption) — это текст с временным кодированием, который появляется на экране. SRT и VTT — наиболее распространенные форматы файлов субтитров; Они содержат порядок, время начала и окончания и текст каждой строки. Скорость чтения (CPS: символов в секунду) определяет, как долго строка должна оставаться на экране, чтобы зрителю было комфортно читать субтитры.

Мощь и пределы автоматической транскрипции

Транскрипция с помощью искусственного интеллекта расшифровывает чистый голос одного говорящего, записанный на правильном турецком языке, с очень высокой точностью. Но он допускает ошибки в следующих ситуациях, и знание их позволяет целенаправленно проверять: имена собственные (названия людей, брендов, мест часто пишутся с ошибками), технические термины и сокращения, схожие по звучанию слова («кар/кар», «все еще/все еще»), перекрывающаяся речь (два человека одновременно), фоновый шум и музыка, различия в диалекте/акценте и пунктуация (конец вопроса или предложения). Кроме того, модель может «услышать» и расшифровать слово, которое никогда не произносилось в шумный момент — это галлюцинация транскрипции.

В следующей таблице суммированы сильные и слабые условия автоматической транскрипции:

состояние

точность

В центре внимания редактора

Один динамик, чистый звук, тихая обстановка

очень высокий

Имена собственные, пунктуация

Панель с несколькими динамиками

средний

Разделение говорящих, наложение речи

Шумная/запись на открытом воздухе

низкий-средний

Выдуманное слово, прыжок

Техническое/жаргонное содержание

средний

Написание терминов и сокращений

акцентированная речь

Переменная

Ошибки в словах, смысл

Формат субтитров и правила читаемости

Хороший подзаголовок – это не просто «правильный текст»; должен быть читаемым. В международной практике существует несколько практических правил: строка субтитров обычно не должна превышать двух строк; каждая строка должна иметь разумную длину (примерно 37–42 символа); Субтитры должны оставаться на экране достаточно долго, чтобы их можно было прочитать (обычно 1–6 секунд); Скорость чтения не должна быть слишком высокой (большинство гидов считают пределом ~15-17 символов в секунду). Инструменты искусственного интеллекта автоматически разделяют подзаголовок, но такое разделение иногда обрезает предложение в неудачных местах (строка заканчивается на «и», разрыв, разделяющий смысл). Задача редактора — сделать текст точным и беглым.

Ваша роль: помощник редактора субтитров. Ниже приведена автоматическая расшифровка. Задача: 1) Разбить текст на блоки субтитров по логике SRT. 2) Каждый блок должен состоять максимум из 2 строк, каждая строка не должна превышать ~40 символов. 3) Разделить предложение на значимые места; Строка, заканчивающаяся на «и», «но», «то». 4) Отметьте имена собственные и термины тегом [ПРОВЕРИТЬ], чтобы я мог проверить их вручную. 5) Не меняйте текст, просто разделите и отметьте.

Идея «тега [CONTROL]» в этой подсказке ценна: наличие ИИ, отмечающего области, где он неуверен или рискован (имя собственное, термин), направляет взгляд редактора в нужные точки и предотвращает слепое доверие.

Многоязычные субтитры и перевод

Открытие видео на нескольких языках увеличивает аудиторию. ИИ может взять стенограмму, перевести ее на целевой язык и создать файл субтитров. Это мощная возможность, но она наиболее уязвима: машинный перевод может искажать идиомы, культурные отсылки, юмор и каламбур, термины и контекст. Переводить предложение «Идет дождь из кошек и собак» дословно — катастрофа. При переводе субтитров также существует ограничение по объему: предложение на целевом языке может быть длиннее и превышать скорость чтения. Вот почему для многоязычных субтитров важно, чтобы человек, знающий целевой язык, проверял перевод — особенно для конфиденциального контента, такого как брендинг, юридический или медицинский контент, неправильный перевод может иметь серьезные последствия.

Переведите следующие блоки субтитров с турецкого языка на английский. Правила: - Передавайте фразеологизм и шутку не дословно, но сохраняя их СМЫСЛ. - Название бренда и название продукта оставьте как есть, не переводите. - Пусть каждый блок сохраняет свою скорость чтения; При необходимости сокращайте, но не искажайте смысл. - Укажите культурную отсылку или термин, в отношении которого вы не уверены, с помощью [ПРИМЕЧАНИЯ ПЕРЕВОДЧИКА].

три мини-кейса

Случай 1 — Ускоряющаяся линия. Съемочная группа провела три недели, вручную расшифровывая 12-часовой архив интервью. При автоматической транскрипции необработанный текст выводился за день; Путем поиска по тексту (слово за словом) команда нашла нужные моменты за считанные секунды. Затем они тщательно отредактировали и снабдили субтитрами только тот 40-минутный эпизод, который использовали. Три недели превратились в четыре дня; усилия по проверке сосредоточены на используемом разделе.

Случай 2 — Выдуманное слово. Новостной канал транслировал шумное уличное интервью с автоматическими субтитрами без проверки. Модель «услышала» невысказанное слово на фоне фонового гула, а подпись приписывала невысказанное слово интервьюируемому. В социальных сетях последовала реакция, и исправление было опубликовано. Урок: в зашумленных записях автоматические субтитры необходимо сравнивать с оригинальным звуком.

Случай 3 — Катастрофа перевода. Бренд опубликовал английские субтитры своего рекламного ролика с машинным переводом и без контроля. Когда турецкая идиома («береги глаза») была переведена слово в слово, английской аудитории она показалась бессмысленной и даже смешной, а серьезность бренда была подорвана. Правильный путь: заверить перевод человеком, знающим целевой язык.

Слабая подсказка / Сильная подсказка

Слабая подсказка:

Подпишите это видео субтитрами и переведите его на английский язык.

Здесь нет ни форматирования, ни правил читаемости, ни меток проверки. Выход будет грубым и рискованным.

Мощная подсказка:

Ваша роль: редактор двуязычных субтитров. Входные данные: стенограмма с временным кодом на турецком языке. Задача: 1) Отредактировать турецкий субтитр на 2 строки / ~ 40 символов / правила правильного разделения. 2) Отметьте имена собственные и термины с помощью [CONTROL]. 3) Отдельно выполните перевод на английский язык; Передавайте фразу дословно, сохраняйте название бренда. 4) Отмечайте блоки, превышающие скорость чтения, [ДЛИННЫМ]. 5) Не придумывайте никаких слов; Напишите неопределенный звук [НЕУКАЗАНО].

Распространенные ошибки

  • Публикация автоматических стенограмм без контроля. Сохраняются ошибки в именах собственных, терминах, пунктуации и выдуманных словах.
  • Плохое разделение строк. Строки, заканчивающиеся на «и/но/ки», затрудняют чтение.
  • Превышение скорости чтения. Длинные субтитры, которые слишком коротки на экране, не читаются.
  • Не проверяю машинный перевод. Если идиома, шутка или термин идут не так, как надо, страдает бренд.
  • Обход различия говорящих. Если на панели возникнет путаница в отношении того, «кто что сказал», подзаголовок будет вводить в заблуждение.
Совет: При редактировании расшифровки смотрите видео на скорости 1,25-1,5 и проверяйте синхронизацию с субтитрами. Таким образом, вы быстро уловите как отклонение временного кода, так и придуманные/пропущенные слова.
Внимание: в таких областях, как здравоохранение, право, финансы, одно неправильно записанное слово (например, доза, номер ингредиента) может иметь серьезные последствия. В этом содержании каждое число и термин должны быть проверены отдельно.

В заключение

Автоматическая транскрипция и субтитры позволяют экономить время и обеспечить доступность. ИИ сокращает часы транскрипции до минут и позволяет выполнять поиск по тексту. Но в необработанном виде вывод не пригоден для публикации: необходимо исправлять имена собственные, термины, пунктуацию, придуманные слова и неправильные переносы строк. Правила читаемости (длина строки, продолжительность, скорость чтения) делают текст понятным для зрителя. В многоязычных субтитрах машинный перевод должен быть проверен человеком, знающим целевой язык. ИИ наливает и предлагает; За точность, читабельность и смысл отвечает редактор.

Задача приложения

Сделайте короткую запись разговора (возможно, вашего собственного голоса, 2–3 минуты) и автоматически расшифровайте ее. Сравните вывод с исходным аудио и отметьте имена собственные, термины и пунктуационные ошибки; Найдите не менее пяти ошибок. Затем разбейте текст на блоки субтитров по указанным выше правилам, переведите на один язык и исправьте в переводе как минимум два рискованных момента (идиомы/термины). Сообщайте о процессе и любых обнаруженных ошибках.

контрольный список

  • [ ] Сравнил ли я расшифровку с исходным аудио и исправил ли ошибки в именах собственных, терминах или пунктуационных ошибках?
  • [ ] Проверил ли я выдуманные или пропущенные слова?
  • [ ] Отредактировал ли я подзаголовок в соответствии с правилами длины строки, продолжительности и скорости чтения?
  • [ ] Что касается многоязычных субтитров, тщательно ли я проверил перевод с кем-то, кто знает целевой язык?
  • [ ] Проверил ли я отдельно каждую цифру и термин в конфиденциальном контенте?