Прибыль:
- Возможность создавать необработанные расшифровки с автоматическим распознаванием речи (ASR) и использовать их для проверки временных меток и распознавания говорящего.
- Способность применять дисциплину проверки каждой цитаты, которая будет дословно включена в новости, и определять приоритетность областей с высоким уровнем ошибок, таких как имена собственные, числа и жаргон.
- Способность понимать, что стенограмма представляет собой черновой вариант, что цитата должна быть сохранена дословно без исправлений и что конфиденциальность должна учитываться с самого начала в конфиденциальных записях.
Одним из самых ценных, но и самых утомительных материалов для репортера является аудио: записи интервью, пресс-конференций, телефонных разговоров, парламентских слушаний, архивы прямых трансляций. Опытному человеку требуется от четырех до шести часов, чтобы вручную расшифровать часовой разговор — транскрипцию, выражаясь отраслевым языком. Технология автоматического распознавания речи (ASR) на основе искусственного интеллекта, которая автоматически преобразует голос в текст, сокращает это время до минут. Но стенограмма — это черновой вариант: имена, технические термины, накладывающаяся речь и шумные отрывки — все может оказаться неправильным. Таким образом, правило не меняется: ИИ создает необработанную расшифровку; Именно журналист проверяет, соответствует ли цитата записи, кто что сказал и контекст. Каждое перевернутое предложение, попадающее в эфир, не может стать новостью без сравнения с голосом.
Шаг за шагом: от голоса к достоверной цитате
Шаг 1. Подготовьте запись и позаботьтесь о конфиденциальности. Если аудиофайл содержит имена, указывающие на источник, или источник должен быть защищен, обратите внимание на то, в какой инструмент он загружен. Для конфиденциальных записей предпочтительны автономные или корпоративные решения с защитой данных. Убедитесь, что запись разрешена (некоторые записи имеют юридические ограничения).
Шаг 2 — Получите необработанную расшифровку. Преобразуйте аудио в текст с помощью инструмента ASR. Если есть возможность, включите временную метку — количество минут, в течение которых было произнесено каждое предложение, — и дневникизацию — различая, кто какое предложение сказал. Это делает проверку очень быстрой.
Шаг 3 — Отметьте области с высоким уровнем ошибок. Имена собственные, названия учреждений, цифры, иностранные термины и места, где два человека говорят одновременно, — это области, где происходит больше всего ошибок. Включите их в свой контрольный список приоритетов.
Шаг 4 — Сравните цитату с записью. Дословно проверьте каждое предложение, которое вы включаете в новость, перейдя к временной метке и прослушав аудиозапись. Изменение даже одного слова может изменить смысл и юридическую ответственность.
Шаг 5 — Извлечение резюме и тем с помощью ИИ (отдельная работа). После того, как стенограмма будет очищена, вы можете попросить ИИ предоставить черновые результаты, такие как «основные темы», «информационные отрывки», «противоречия» — но они задают направление, а не заменяют цитату.
Внимание: автоматическая декодировка легко заменяет слово: «мы не сделали» на «мы сделали», одно существительное на другое. Не транслируйте предложения, заключенные в кавычки, без прослушивания звука. Ложная цитата является одновременно нарушением этики и поводом для отказа от ответственности/судебного разбирательства.
Факторы, влияющие на точность
Качество транскрипции; зависит от качества записи (микрофон, шум, эхо), количества говорящих, акцента, диалекта, технического жаргона и наложения звуков. Записи телефонных разговоров и многолюдные места вызывают наибольшее количество ошибок. Поэтому не утешайтесь утверждениями типа «точность инструмента составляет 95%»: оставшиеся 5% могут находиться в наиболее критичных для новости местах, таких как имена и цифры.
три мини-кейса
Случай 1 — Единственное слово, которое меняется. Репортер автоматически переписал заявление чиновника: «Мы не можем проверить это утверждение». В стенограмме говорилось: «Мы можем проверить» — смысл был противоположным. Репортер прослушал временную метку и исправил ее. Если бы ошибка в одно слово не была исправлена, эта новость заставила бы чиновника сказать то, чего он не говорил.
Случай 2 — Выигрыш во времени, парламентская сессия. Чтобы вручную декодировать 5-часовую запись сеанса, потребуется около 25 часов. ASR извлек необработанный текст за 40 минут; Благодаря разделению докладчиков и временным меткам репортер прослушал и проверил только 20-минутные отрывки трех важных докладчиков. Общее время сократилось до ~4 часов.
Случай 3 — жаргонная ошибка. Репортер здравоохранения заметил, что название препарата, упомянутое в интервью с экспертом, в стенограмме написано с ошибкой; Его смешали с другим препаратом с похожим звучанием. Он попросил эксперта подтвердить это коротким сообщением. Если бы было опубликовано неправильное название препарата, это было бы как ложной информацией, так и опасной для здоровья.
Копируемые шаблоны
1) Извлечение контрольного списка из необработанного стенограммы:
Ниже приведена автоматическая расшифровка. Отметьте: (1) имена собственные и названия учреждений, (2) числа и даты, (3) иностранные/технические термины, (4) места, где смысл предложения неясен. Они будут проверены перед записью. Исправьте текст; просто создайте контрольный список. Транскрипция: [здесь]
2) Докладчик и краткое изложение темы (из очищенной стенограммы):
Используйте проверенную расшифровку ниже. (1) Обобщите анатезу каждого говорящего в одном предложении. (2) Отметьте 5 заслуживающих внимания отрывков с отметкой времени. (3) Перечислите противоречия между выступающими. Составление котировок; просто покажите их местоположение. Транскрипция: [здесь]
3) Извлечение кандидатов на цитирование (подлежит проверке):
Выберите из этой расшифровки 8 коротких цитат-кандидатов, которые подойдут для новости. Напишите для каждого отметку времени [12:04] и говорящего. Сократить или отредактировать цитаты; Скопируйте это дословно, чтобы я мог подтвердить это по протоколу. Транскрипция: [здесь]
4) Шумная/нечеткая разметка проезда:
Перечислите места в следующей расшифровке, где есть «[двусмысленно]», «...» или отсутствие смысла. Запишите временную метку каждого из них, чтобы я мог прослушать эту часть еще раз. Заполните пропуск, высказав предположение. Транскрипция: [здесь]
Слабая подсказка / Сильная подсказка
Слабая подсказка: «Подведите итоги этого интервью и выделите лучшие цитаты».
Результат: ИИ считает ошибки в транскрипции правильными и «украшает» цитаты, сокращает и меняет предложения; В какой момент оно было сказано утеряно, проверить невозможно.
Сильная подсказка: «Из этой расшифровки ТОЧНО (дословно) извлеките 8 кандидатов на цитаты, добавьте к каждой временную метку и говорящего, не исправляйте и не сокращайте ни одну из них. Составьте отдельный список неясных цитат, чтобы я мог прослушать их в записи».
Отличие: строгая подсказка запрещает изменение цитаты, делает ее проверяемой по временной метке и изолирует двусмысленность; Журналист может проверить каждую цитату голосом.
сравнительная таблица
особенность
Что он делает?
эффект проверки
Автоматическое дешифрование (ASR)
Преобразует аудио в текст
Сырой черновой вариант; всем нужно подтверждение
временная метка
Возвращает минуту предложения
Быстро найдите и прослушайте цитату
Разделение динамиков
Разделяет, кто это говорит
Предотвращает ложную атрибуцию (требуется подтверждение)
автоматическое резюме
Темы черновиков
Оно дает направление; цитата не заменяет
Автоматический перевод (чрезмерная транскрипция)
Переводит зарубежную запись
Риск двойной ошибки; двойная проверка
Распространенные ошибки
- Опубликовать цитату, не прослушав ее. Думая, что предложение в транскрипции правильное, и заключая его в кавычки; Ошибка в одном слове может изменить смысл.
- Доверчивое имя и номер. Забывая, что имена собственные, учреждения и числа — это места, где больше всего ошибок.
- Наличие ИИ «исправляет» цитату. Изменение предложения, чтобы сделать его более плавным; Цитата должна быть дословной, исправления указываются в квадратных скобках.
- Случайная загрузка конфиденциальной записи. Отправка записи в неконтролируемое транспортное средство, выдающее источник или без разрешения.
- Слепое доверие к дискриминации говорящих. ИИ может сбить с толку двух человек; Проверьте критическую атрибуцию по аудио.
Практические советы по улучшению качества транскрипции
Точность транскрипции определяется в самом начале работы, во время записи. Репортер, который выходит на поле, может облегчить работу ИИ и уменьшить бремя проверки с помощью нескольких простых привычек. Перемещение микрофона ближе к динамику и уменьшение фонового шума, например ветра или дорожного движения, значительно снижают частоту ошибок. Если вы попросите говорящих по очереди, это предотвратит дублирование речи (самое слабое место транскрипции). Если говорящий назовет свое имя и должность в начале интервью, это облегчит как идентификацию говорящего, так и последующую атрибуцию. Если предстоит обсуждение технической темы, составление списка общих названий и терминов, которые будут часто использоваться, позволит вам заранее узнать наиболее вероятные ошибки в транскрипции; Когда вы слышите эти термины в записи, вы сначала проверяете их.
Второй способ: заархивируйте стенограмму в ее необработанном виде и храните исправленную версию отдельно. В случае возражения или судебного процесса возможность показать, какое слово было исправлено, когда и как защищает журналиста. Кроме того, отметив временную метку рядом с каждой проверяемой цитатой, вы сэкономите часы поиска, когда вам понадобится вернуться к этой цитате несколько месяцев спустя. После того как стенограмма очищена и упорядочена с помощью временных меток, вы можете безопасно использовать одну и ту же запись снова и снова как для новостной статьи, так и для колонки, а также для следующей последующей статьи.
В заключение
Автоматическая транскрипция — мощный ускоритель, который сокращает аудиоматериал с часов до минут; временная метка и разделение динамиков упрощают проверку. Но транскрипция — это план: имена, цифры, жаргон и перекрывающаяся речь часто идут не так. Каждая цитата, включенная в новость, проверяется путем дословного прослушивания записи; Котировки не могут быть исправлены ИИ. Резюме и извлечение темы — это отдельные задачи, которые лишь определяют направление. В конфиденциальных записях конфиденциальность и согласие учитываются с самого начала.
Задача приложения
Автоматически расшифровывайте аудиозапись (собственное интервью или публичное выступление). Получите 8 кандидатов с помощью подсказки «удаление кандидата в цитате»; Прослушайте каждое из них по временной метке и отметьте, правильно оно или нет. Обратите внимание, сколько кавычек содержат ошибки (особенно имена/цифры) и сколько времени требуется на их исправление.
контрольный список
- [ ] Я считаю стенограмму черновым вариантом; Я не публикую цитаты, не прослушав их.
- [ ] Сначала я подтверждаю личные имена, учреждения и номера из записи.
- [ ] Не исправляет цитату; Изменения обозначаю квадратными скобками.
- [ ] Для проверки я использую временную метку и различие говорящих.
- [ ] Я проверяю охраняемый автомобиль и статус разрешения в записях, которые должны быть конфиденциальными или авторизованными.