Eenheid 3 / 11

Transcriptie en audio-/videoanalyse: interviews naar tekst, tekst naar nieuws

Winst:

  • Mogelijkheid om onbewerkte transcripties te produceren met automatische spraakherkenning (ASR) en deze te gebruiken voor verificatie van tijdstempel en sprekerdiscriminatie
  • Mogelijkheid om de discipline toe te passen om elk citaat dat woordelijk in het nieuws wordt opgenomen te verifiëren en prioriteit te geven aan gebieden met veel fouten, zoals eigennamen, cijfers en jargon.
  • Vermogen om te begrijpen dat het transcript een ruwe versie is, dat het citaat letterlijk en zonder correctie moet worden bewaard en dat vertrouwelijkheid vanaf het begin in overweging moet worden genomen in gevoelige documenten.

Een van de waardevolste maar meest uitputtende grondstoffen van een verslaggever is audio: opnames van interviews, persconferenties, telefoongesprekken, parlementaire hoorzittingen, archieven van live-uitzendingen. Het kost een ervaren persoon vier tot zes uur om een ​​gesprek van een uur met de hand uit te schrijven – transcriptie, in vaktaal. Op kunstmatige intelligentie gebaseerde automatische spraakherkenningstechnologie (ASR), die spraak automatisch omzet in tekst, verkort deze tijd tot minuten. Maar een transcriptie is een ruwe schets: namen, technische termen, overlappende spraak en luidruchtige passages kunnen er allemaal verkeerd uitzien. De regel verandert dus niet: AI produceert het ruwe transcript; Het is de journalist die verifieert dat het citaat exact overeenkomt met de opname, wie wat heeft gezegd en de context. Elke omgekeerde zin die de lucht in gaat, kan geen nieuws worden zonder te worden vergeleken met de stem.

Stap voor stap: van stem naar betrouwbare offerte

Stap 1 — Bereid de opname voor en houd rekening met privacy. Als het audiobestand namen bevat die de bron verraden of de bron moet worden beschermd, let dan op naar welke tool het wordt geüpload. Voor gevoelige documenten wordt de voorkeur gegeven aan offline of bedrijfsoplossingen met gegevensbeveiliging. Zorg ervoor dat de opname geautoriseerd is (voor sommige opnames gelden wettelijke limieten).

Stap 2 — Verkrijg het onbewerkte transcript. Converteer audio naar tekst met de ASR-tool. Schakel indien mogelijk de tijdstempel in – het aantal minuten dat elke zin is uitgesproken – en het dagboek – waarmee u kunt onderscheiden wie welke zin heeft gezegd. Deze maken de verificatie zeer snel.

Stap 3 — Markeer gebieden met hoge fouten. Eigennamen, institutionele namen, cijfers, buitenlandse termen en plaatsen waar twee mensen tegelijkertijd spreken zijn de gebieden waar de meeste fouten voorkomen. Zet deze op uw prioriteitenchecklist.

Stap 4 — Vergelijk de offerte met de opname. Controleer elke zin die u in het nieuws opneemt woordelijk door naar de tijdstempel te gaan en naar de audio te luisteren. Het veranderen van zelfs maar één woord kan de betekenis en de juridische verantwoordelijkheid veranderen.

Stap 5 — Extraheer samenvatting en thema's met AI (afzonderlijke taak). Zodra het transcript is opgeschoond, kun je de AI om conceptresultaten vragen, zoals ‘belangrijke thema’s’, ‘nieuwswaardige passages’, ‘tegenstrijdigheden’ – maar deze bieden richting en geen vervanging voor het citaat.

Let op: Automatische decodering vervangt gemakkelijk een woord: "we deden niet" door "we deden", het ene zelfstandig naamwoord door het andere. Zend geen zin uit die tussen aanhalingstekens staat zonder naar de audio te luisteren. Een vals citaat is zowel een ethische overtreding als een reden voor een disclaimer/rechtszaak.

Factoren die de nauwkeurigheid beïnvloeden

Transcriptiekwaliteit; hangt af van de opnamekwaliteit (microfoon, ruis, echo), aantal sprekers, accent, dialect, technisch jargon en audio-overlapping. Telefoonopnamen en drukke omgevingen veroorzaken de meeste fouten. Laat u daarom niet troosten door uitspraken als "de nauwkeurigheid van de tool is 95%": de resterende 5% bevindt zich mogelijk op de meest kritieke plaatsen voor het nieuws, zoals namen en nummers.

drie minikoffers

Geval 1 – Het enige woord dat verandert. Een verslaggever heeft automatisch de verklaring van een functionaris getranscribeerd: "We kunnen deze bewering niet verifiëren." Op het transcript stond "we kunnen verifiëren" - de betekenis was het tegenovergestelde. De verslaggever luisterde naar de tijdstempel en corrigeerde deze. Als de fout van één woord niet was gecorrigeerd, zou het nieuws de functionaris iets hebben laten zeggen wat hij niet heeft gezegd.

Geval 2 — Tijdwinst, parlementaire zitting. Het zou ongeveer 25 uur duren om een ​​sessieopname van 5 uur handmatig te decoderen. ASR haalde de ruwe tekst in 40 minuten eruit; Dankzij sprekerscheiding en tijdstempels luisterde en verifieerde de verslaggever slechts 20 minuten durende passages van drie kritische sprekers. De totale tijd kwam neer op ~ 4 uur.

Geval 3 — Jargonfout. Een gezondheidsverslaggever merkte op dat de naam van een medicijn dat in het interview met de deskundige werd genoemd, verkeerd was gespeld in het transcript; Het werd gemengd met een ander soortgelijk klinkend medicijn. Hij liet de deskundige het bevestigen met een kort bericht. Als de verkeerde medicijnnaam zou worden gepubliceerd, zou dit zowel valse informatie zijn als gevaarlijk voor de gezondheid.

Kopieerbare sjablonen

1) Een checklist uit het onbewerkte transcript halen:

Hieronder vindt u een automatische transcriptie. Markeer het volgende: (1) eigennamen en namen van instellingen, (2) cijfers en data, (3) buitenlandse/technische termen, (4) plaatsen waar de betekenis van de zin onduidelijk is. Deze zullen vóór de registratie worden geverifieerd. Corrigeer de tekst; maak gewoon een checklist. Transcriptie: [hier]

2) Spreker en themasamenvatting (uit het opgeschoonde transcript):

Gebruik het geverifieerde transcript hieronder. (1) Vat de anathesis van elke spreker in één zin samen. (2) Markeer 5 nieuwswaardige passages met tijdstempel. (3) Noem de tegenstrijdigheden tussen de sprekers. Het maken van offertes; laat gewoon hun locatie zien. Transcriptie: [hier]

3) Extractie van citatiekandidaten (te verifiëren):

Selecteer uit dit transcript 8 kandidaat-korte citaten die geschikt zijn voor het nieuws. Schrijf voor elk het tijdstempel [12:04] en de spreker. Offertes inkorten of bewerken; Kopieer het woordelijk, zodat ik het uit het dossier kan bevestigen. Transcriptie: [hier]

4) Lawaaierige/onduidelijke doorgangsmarkering:

Noem de plaatsen in het volgende transcript waar sprake is van "[dubbelzinnig]", "..." of een gebrek aan betekenis. Schrijf voor elk fragment de tijdstempel op, zodat ik dat deel nog eens kan beluisteren. Vul het lege veld in met een gok. Transcriptie: [hier]

Zwakke prompt/sterke prompt

Zwakke prompt: "Vat dit interview samen en haal de beste citaten eruit."

Resultaat: AI beschouwt de fouten in de transcriptie als correct en "verfraait" de aanhalingstekens, verkort en verandert de zinnen; Op welk moment er werd gezegd, is verloren gegaan, het kan niet worden geverifieerd.

Sterke prompt: "Haal PRECIES 8 citaten uit dit transcript (woord voor woord), voeg tijdstempel en spreker toe aan elk citaat, corrigeer of verkort geen van hen. Maak een aparte lijst van de onduidelijke citaten, zodat ik ze vanaf de opname kan beluisteren."

Verschil: sterke prompt verbiedt het wijzigen van het citaat, maakt het verifieerbaar aan de hand van een tijdstempel en isoleert het dubbelzinnige; De journalist kan ieder citaat met zijn stem verifiëren.

vergelijkingstabel

functie

Wat doet het?

verificatie-effect

Automatische decodering (ASR)

Converteert audio naar tekst

Ruw ontwerp; hebben allemaal bevestiging nodig

tijdstempel

Retourneert de minuut van de zin

Vind en beluister snel de quote

Luidsprekerscheiding

Scheidt wie het zegt

Voorkomt valse attributie (bevestiging vereist)

automatische samenvatting

Ontwerpt thema's

Het geeft richting; citaat vervangt niet

Automatische vertaling (overtranscriptie)

Vertaalt buitenlands record

Risico op dubbele schuld; dubbele verificatie

Veel voorkomende fouten

  • De quote plaatsen zonder ernaar te luisteren. Denken dat de zin in de transcriptie correct is en deze tussen aanhalingstekens gebruiken; Een enkele woordfout kan de betekenis omkeren.
  • Betrouwbare naam en nummer. Vergeten dat eigennamen, instituties en cijfers de plaatsen zijn waar fouten het meest voorkomen.
  • De AI de quote laten ‘corrigeren’. De zin veranderen om hem vloeiender te maken; Het citaat moet woordelijk zijn; correcties worden tussen vierkante haakjes aangegeven.
  • Gevoelige record wordt lukraak geladen. Het verzenden van de opname naar een ongecontroleerd voertuig dat de bron prijsgeeft of zonder toestemming.
  • Blind vertrouwen in sprekersdiscriminatie. AI kan twee mensen in verwarring brengen; Controleer de kritische attributie van audio.

Praktische tips om de transcriptiekwaliteit te verbeteren

De nauwkeurigheid van de transcriptie wordt bepaald aan het begin van het werk, op het moment van opname. De verslaggever die het veld in gaat, kan het werk van de AI gemakkelijker maken en de verificatielast verminderen met een paar eenvoudige gewoonten. Door de microfoon dichter bij de spreker te plaatsen en achtergrondgeluiden zoals wind/verkeer te verminderen, wordt het foutenpercentage aanzienlijk verminderd. Door sprekers om beurten te vragen, wordt overlappende spraak voorkomen (het zwakste punt van transcriptie). Als de spreker aan het begin van het interview zijn naam en titel zegt, wordt het gemakkelijker voor zowel de identificatie van de spreker als de latere toeschrijving. Als er een technisch onderwerp moet worden besproken, kunt u door een lijst op te stellen van algemene namen en termen die vaak zullen worden gebruikt, vooraf weten wat de meest waarschijnlijke fouten bij de transcriptie zijn; Wanneer je deze termen in de opname hoort, controleer je ze eerst.

Een tweede oefening: archiveer het transcript in zijn ruwe vorm en bewaar de gecorrigeerde versie apart. In geval van bezwaar of juridische procedure beschermt het kunnen aantonen welk woord wanneer en hoe is gecorrigeerd de journalist. Bovendien bespaart het noteren van de tijdstempel naast elke offerte die u verifieert u urenlang zoeken wanneer u maanden later terug moet naar die offerte. Zodra het transcript is opgeschoond en geordend met tijdstempels, kunt u dezelfde opname veilig keer op keer gebruiken voor zowel het nieuwsverhaal, de column als het volgende vervolgverhaal.

Samengevat

Automatische transcriptie is een krachtige versneller die het ruwe audiomateriaal van uren naar minuten reduceert; tijdstempel en luidsprekerscheiding maken verificatie eenvoudiger. Maar transcriptie is een blauwdruk: namen, cijfers, jargon en overlappende spraak gaan vaak fout. Elk citaat in het nieuws wordt geverifieerd door woordelijk naar de opname te luisteren; Offertes kunnen niet door AI worden gecorrigeerd. Samenvatting en thema-extractie zijn afzonderlijke taken en geven alleen richting. Bij gevoelige dossiers wordt vanaf het begin rekening gehouden met privacy en toestemming.

Applicatie taak

Automatisch een audio-opname transcriberen (uw eigen interview of een openbare toespraak). Haal 8 kandidaten op met de prompt "quote candidate Removal"; Luister naar elk van de tijdstempels en markeer of het precies correct is of niet. Merk op hoeveel citaten fouten bevatten (vooral namen/nummers) en hoe lang het duurt om te corrigeren.

controlelijst

  • [ ] Ik beschouw het transcript als een ruwe versie; Ik publiceer geen citaten zonder ernaar te luisteren.
  • [ ] Ik bevestig eerst persoonsnamen, instellingen en nummers uit het record.
  • [ ] Corrigeert het citaat niet; Ik geef de wijzigingen aan met vierkante haken.
  • [ ] Ik gebruik tijdstempel en sprekeronderscheid voor verificatie.
  • [ ] Ik controleer het beveiligde voertuig en de toestemmingsstatus in documenten die gevoelig of geautoriseerd moeten zijn.