Печалби:
- Възможност за създаване на необработени преписи с автоматично разпознаване на реч (ASR) и използването им за проверка на клеймо за време и дискриминация на говорещия
- Възможност за прилагане на дисциплината за проверка на всеки цитат, който ще бъде включен в новините дословно и приоритизиране на области с големи грешки като собствени имена, числа и жаргон.
- Способност да се разбере, че преписът е сурова чернова, че цитатът трябва да бъде запазен дословно без корекции и че поверителността трябва да се има предвид от самото начало в чувствителни записи.
Една от най-ценните, но и най-изтощителните суровини за репортера е аудиото: записи на интервюта, пресконференции, телефонни разговори, парламентарни изслушвания, архиви на живи предавания. На опитен човек са му необходими четири до шест часа, за да препише на ръка едночасов разговор — транскрипция, на езика на индустрията. Базираната на изкуствен интелект технология за автоматично разпознаване на реч (ASR), която автоматично преобразува гласа в текст, намалява това време до минути. Но преписът е груба чернова: имена, технически термини, припокриваща се реч и шумни пасажи могат да излязат грешни. Така че правилото не се променя: AI произвежда необработения препис; Журналистът е този, който проверява дали цитатът съвпада точно със записа, кой какво е казал и контекста. Всяко обърнато изречение, което влезе в ефир, не може да стане новина, без да бъде сравнено с гласа.
Стъпка по стъпка: от глас до надеждна оферта
Стъпка 1 — Подгответе записа и помислете за поверителността. Ако аудиофайлът съдържа имена, които разкриват източника или източникът трябва да бъде защитен, обърнете внимание на кой инструмент е качен. За чувствителни записи се предпочитат офлайн или корпоративни решения със сигурност на данните. Уверете се, че записът е разрешен (някои записи имат законови ограничения).
Стъпка 2 — Вземете необработения препис. Преобразувайте аудио в текст с инструмента ASR. Ако е възможно, включете клеймото за време - броят минути, в които е изречено всяко изречение - и дневника - разграничавайки кой какво изречение е казал. Те правят проверката много бърза.
Стъпка 3 — Маркирайте области с висока грешка. Собствени имена, имена на институции, числа, чужди термини и места, където двама души говорят едновременно, са областите, в които възникват най-много грешки. Поставете ги в списъка си с приоритети.
Стъпка 4 — Сравнете цитата със записа. Проверете дословно всяко изречение, което включвате в новините, като отидете на клеймото за време и слушате аудиото. Промяната дори на една дума може да промени смисъла и правната отговорност.
Стъпка 5 — Извличане на резюме и теми с AI (отделна работа). След като стенограмата бъде изчистена, можете да поискате от AI чернови на изходни данни като „основни теми“, „заслужаващи новини пасажи“, „противоречия“ — но те дават насока, а не заместител на цитата.
Внимание: Автоматичното декодиране лесно заменя думата: „ние не го направихме“ с „ние го направихме“, едно съществително с друго. Не излъчвайте нито едно изречение, което сте поставили в кавички, без да слушате звука. Фалшивият цитат е както етично нарушение, така и причина за отказ от отговорност/съдебен иск.
Фактори, влияещи върху точността
Качество на транскрипция; зависи от качеството на записа (микрофон, шум, ехо), броя на високоговорителите, акцента, диалекта, техническия жаргон и аудио припокриването. Записите по телефона и пренаселената среда водят до най-много грешки. Затова не се утешавайте от изявления като „точността на инструмента е 95%“: останалите 5% може да са на най-критичните места за новините, като имена и номера.
три мини калъфа
Случай 1 — Единствената дума, която се променя. Репортер автоматично транскрибира изявлението на служител: „Не можем да проверим това твърдение“. В стенограмата пишеше „можем да проверим“ — значението беше обратното. Репортерът изслуша клеймото за време и го коригира. Ако грешката от една дума не беше поправена, новината щеше да накара длъжностното лице да каже нещо, което не каза.
Казус 2 — Печелене на време, парламентарна сесия. Ръчното декодиране на 5-часов запис на сесия ще отнеме ~25 часа. ASR извлече необработения текст за 40 минути; Благодарение на разделянето на говорителите и маркирането на времето, репортерът изслуша и провери само 20-минутни пасажи от трима критични говорители. Общото време падна до ~4 часа.
Случай 3 — Грешка в жаргона. Здравен репортер забеляза, че името на лекарство, споменато в интервюто с експерта, е изписано неправилно в стенограмата; Беше смесено с друго подобно звучащо лекарство. Той накара експерта да го потвърди с кратко съобщение. Ако бъде публикувано грешно наименование на лекарството, това би било както невярна информация, така и опасно за здравето.
Копируеми шаблони
1) Извличане на контролен списък от необработения препис:
По-долу е даден автоматичен препис. Отбележете следното: (1) собствени имена и имена на институции, (2) числа и дати, (3) чужди/технически термини, (4) места, където смисълът на изречението е неясен. Те ще бъдат проверени преди записа. Коригирайте текста; просто създайте контролен списък. Транскрипция: [тук]
2) Резюме на лектора и темата (от изчистения препис):
Използвайте проверения препис по-долу. (1) Обобщете анатезата на всеки говорещ в едно изречение. (2) Маркирайте 5 пасажа, заслужаващи новини, с клеймо за време. (3) Избройте противоречията между говорещите. Изготвяне на котировки; просто покажете тяхното местоположение. Транскрипция: [тук]
3) Извличане на кандидат за цитиране (подлежи на проверка):
Изберете 8 кандидат-кратки цитата от този препис, които биха били подходящи за новините. Напишете клеймото за време [12:04] и говорителя за всеки. Съкращаване или редактиране на цитати; Копирайте го дословно, за да мога да го потвърдя от протокола. Транскрипция: [тук]
4) Шумна/неясна маркировка на прохода:
Избройте местата в следния препис, където има "[двусмислено]", "..." или липса на смисъл. Запишете клеймото за време за всяка от тях, за да мога да слушам тази част отново. Попълнете празното поле с предположение. Транскрипция: [тук]
Слаба подкана / Силна подкана
Слаба подкана: „Обобщете това интервю и извадете най-добрите цитати.“
Резултат: AI счита грешките в транскрипцията за правилни и "разкрасява" кавичките, съкращава и променя изреченията; В кой момент е казано, че е загубено, не може да се провери.
Силна подкана: „Извлечете 8 кандидата за цитати от този препис ТОЧНО (дума по дума), добавете клеймо за време и говорител към всеки от тях, не коригирайте или съкращавайте нито един от тях. Направете отделен списък с неясните, за да мога да ги слушам от записа.“
Разлика: Силната подкана забранява промяната на цитата, прави го проверяем чрез клеймо за време и изолира двусмисленото; Журналистът може да провери гласово всеки цитат.
сравнителна диаграма
функция
Какво прави?
ефект на проверка
Автоматично дешифриране (ASR)
Преобразува аудио в текст
Сурова чернова; всички се нуждаят от потвърждение
клеймо за време
Връща минутата на изречението
Намерете и чуйте бързо цитата
Разделяне на високоговорителя
Разделя кой го казва
Предотвратява фалшиво приписване (изисква се потвърждение)
автоматично обобщение
Чернови теми
Дава посока; цитат не замества
Автоматичен превод (прекомерна транскрипция)
Превежда чужди записи
Риск от двойна грешка; двойна проверка
Често срещани грешки
- Публикуване на цитата, без да го слушате. Смятайки, че изречението в транскрипцията е правилно и го поставя в кавички; Една грешка в думата може да преобърне смисъла.
- Доверчиви име и номер. Забравяйки, че собствените имена, институциите и числата са местата, където най-често се допускат грешки.
- Като AI "коригира" цитата. Промяна на изречението, за да стане по-плавно; Цитатът трябва да бъде дословен, корекциите се отбелязват в квадратни скоби.
- Случайно зареждане на чувствителен запис. Изпращане на записа до неконтролирано превозно средство, което разкрива източника или без разрешение.
- Сляпо доверие в дискриминацията на говорещите. AI може да обърка двама души; Проверете критичното приписване от аудио.
Практически съвети за подобряване на качеството на транскрипция
Точността на транскрипцията се определя в самото начало на произведението, в момента на записа. Репортерът, който излиза на терен, може да улесни работата на ИИ и да намали тежестта на проверката с няколко прости навика. Преместването на микрофона по-близо до високоговорителя и намаляването на фоновия шум като вятър/трафик значително намалява процента на грешки. Искането на говорещите да се редуват предотвратява припокриването на речта (най-слабото място на транскрипцията). Накарайте говорещия да каже името и заглавието си в началото на интервюто, което улеснява както идентифицирането на говорещия, така и по-късното приписване. Ако трябва да се обсъжда техническа тема, съставянето на списък с общи имена и термини, които ще се използват често, ще ви позволи да знаете предварително най-вероятните грешки в транскрипцията; Когато чуете тези термини в записа, първо ги проверявате.
Втора практика: архивирайте преписа в необработен вид и запазете коригираната версия отделно. В случай на възражение или съдебен процес възможността да се покаже коя дума е коригирана, кога и как защитава журналиста. Освен това отбелязването на клеймото за време до всяка оферта, която проверявате, ще ви спести часове търсене, когато трябва да се върнете към тази оферта месеци по-късно. След като стенограмата бъде почистена и организирана с времеви клейма, можете безопасно да използвате един и същ запис отново и отново както за новината, колоната, така и за следващата последваща история.
В обобщение
Автоматичната транскрипция е мощен ускорител, който намалява суровия аудио материал от часове до минути; клеймото за време и отделянето на високоговорителите улесняват проверката. Но транскрипцията е план: имена, числа, жаргон и припокриваща се реч често се объркват. Всеки цитат, включен в новините, се проверява чрез дословно прослушване на записа; Офертите не могат да бъдат коригирани от AI. Обобщението и извличането на тема са отделни задачи и само дават насока. В чувствителните записи поверителността и съгласието се вземат предвид от самото начало.
Задача за приложение
Автоматично преписване на аудиозапис (собствено интервю или публична реч). Извличане на 8 кандидата с подканата „премахване на кандидат за цитат“; Чуйте всеки един от времевия печат и маркирайте дали е точно правилен или не. Обърнете внимание колко цитати съдържат грешки (особено имена/числа) и колко време отнема коригирането.
контролен списък
- [ ] Считам преписа за необработена чернова; Не публикувам никакви цитати, без да ги изслушам.
- [ ] Първо потвърждавам лични имена, институции и номера от записа.
- [ ] Не коригира цитата; Посочвам промените с квадратни скоби.
- [ ] Използвам клеймо за време и разграничение на говорителя за проверка.
- [ ] Проверявам състоянието на защитеното превозно средство и разрешението в записи, които трябва да бъдат чувствителни или разрешени.