Winst:
- Mogelijkheid om de concepten van automatische transcriptie en sprekerscheiding te begrijpen en onbewerkte opnames om te zetten in tijdgecodeerde tekst
- Mogelijkheid om ondertitelformaten (SRT/VTT), leessnelheid en regelregels te begrijpen, en meertalige ondertitelconcepten te produceren en te bewerken
- Begrijpen dat het de verantwoordelijkheid van de redacteur is om terminologie, eigennamen, interpunctiefouten en vertaalfouten in het automatische transcript te verifiëren vóór publicatie.
De meest vervelende en tijdrovende taak van de postproductie was traditioneel transcriptie: een redacteur luisterde eindeloos naar uren aan interviewbeelden, waarbij hij elke zin met de hand typte. Het transcriberen van een opname van een uur zou gemakkelijk vier tot vijf uur duren. Kunstmatige intelligentie heeft deze sector radicaal veranderd: tegenwoordig kan een opname van een uur binnen enkele minuten worden omgezet in tijdgecodeerde tekst. Dit versnelt zowel de bewerkingspijplijn als de toegankelijkheid (ondertiteling voor slechthorende kijkers en stil kijken). Maar automatische uitvoer is nooit geschikt voor publicatie in zijn ruwe vorm; In deze unit zullen we zowel de kracht als de valkuilen zien.
Laten we beginnen met de voorwaarden. Transcriptie is het omzetten van spraak in schrift. Automatische spraakherkenning (ASR) is technologie die stem naar tekst vertaalt. Tijdcode is het teken dat aangeeft met welke seconde de tekst in de video overeenkomt. Sprekersdiarisatie is het onderscheiden van "wie sprak" en het verdelen van de tekst in sprekers. Ondertitel (ondertitel/bijschrift) is de tijdgecodeerde tekst die op het scherm verschijnt. SRT en VTT zijn de meest voorkomende ondertitelbestandsformaten; Ze bevatten de volgorde, begin-eindtijd en tekst van elke regel. De leessnelheid (CPS: tekens per seconde) bepaalt hoe lang de regel op het scherm moet blijven staan zodat de kijker de ondertitel comfortabel kan lezen.
De kracht en limiet van automatische transcriptie
AI-transcriptie transcribeert een heldere stem uit één spreker, opgenomen in correct Turks met zeer hoge nauwkeurigheid. Maar het maakt fouten in de volgende situaties, en als u deze kent, kunt u doelgerichte verificatie uitvoeren: eigennamen (namen van mensen, merken, plaatsen worden vaak verkeerd gespeld), technische termen en afkortingen, gelijk klinkende woorden (“kar/kar”, “still/still”), overlappende spraak (twee mensen tegelijk), achtergrondgeluid en muziek, dialect-/accentverschillen en interpunctie (vraag- of zineinde). Bovendien kan het model een woord ‘horen’ en transcriberen dat nog nooit op een luidruchtig moment is gesproken – dit is de hallucinatie van de transcriptie.
De volgende tabel vat de sterke en zwakke voorwaarden voor automatische transcriptie samen:
conditie
nauwkeurigheid
De focus van de redactie
Enkele luidspreker, helder geluid, rustige omgeving
zeer hoog
Eigennamen, leestekens
Paneel met meerdere luidsprekers
middelmatig
Sprekerscheiding, overlappende spraak
Lawaaierige/buitenopname
laag-medium
Verzonnen woord, spring
Technische/jargoninhoud
middelmatig
Term en afkorting schrijven
geaccentueerde spraak
Variabel
Woordfouten, betekenis
Ondertitelformaat en leesbaarheidsregels
Een goede ondertitel is niet alleen maar “juiste tekst”; moet leesbaar zijn. Er zijn in de internationale praktijk enkele vuistregels: een ondertitelregel mag doorgaans niet langer zijn dan twee regels; elke regel moet een redelijke lengte hebben (ongeveer 37-42 tekens); De ondertitel moet lang genoeg op het scherm blijven om gelezen te kunnen worden (meestal 1-6 seconden); De leessnelheid mag niet te hoog zijn (de meeste handleidingen beschouwen ~15-17 tekens/seconde als de limiet). AI-tools splitsen de ondertitel automatisch, maar deze splitsingen snijden de zin soms op slechte plaatsen af (regel die eindigt met "en", onderbreking die de betekenis verdeelt). Het is de taak van de redacteur om de tekst accuraat en vloeiend te maken.
Jouw rol: assistent ondertiteleditor. Hieronder vindt u een automatische transcriptie. Taak:1) Verdeel de tekst in ondertitelblokken volgens SRT-logica.2) Elk blok mag maximaal 2 regels bevatten, elke regel mag niet meer dan ~40 tekens bevatten.3) Verdeel de zin op betekenisvolle plaatsen; Regel die eindigt met "en", "maar", "dat".4) Markeer eigennamen en termen met de tag [CHECK] zodat ik ze handmatig kan verifiëren.5) Wijzig de tekst niet, splits en markeer gewoon.
Het idee van de "[CONTROL]-tag" in deze prompt is waardevol: door de AI gebieden te laten markeren waar het onzeker of riskant is (eigennaam, term), wordt het oog van de redacteur naar de juiste plekken geleid en wordt blind vertrouwen voorkomen.
Meertalige ondertitels en vertaling
Door een video in meerdere talen te openen, vergroot je het publiek. De AI kan het transcript nemen, het in de doeltaal vertalen en een ondertitelbestand maken. Dit is een krachtig vermogen, maar ook het meest kwetsbaar: automatische vertalingen kunnen idiomen, culturele verwijzingen, humor en woordspelingen, termen en context verkeerd voorstellen. Het woord voor woord vertalen van de zin "Het regent katten en honden" is een ramp. Er is ook een ruimtebeperking bij het vertalen van ondertitels: de zin in de doeltaal kan langer zijn en de leessnelheid overschrijden. Daarom is het bij meertalige ondertiteling van essentieel belang dat iemand die de doeltaal kent de vertaling verifieert. Vooral bij gevoelige inhoud, zoals branding, juridische of gezondheidsinhoud, kan een onjuiste vertaling ernstige gevolgen hebben.
Vertaal de volgende Turkse ondertitelblokken naar het Engels. Regels: - Breng het idioom en de grap over, niet woordelijk, maar behoud hun BETEKENIS. - Laat de merknaam en productnaam zoals ze zijn, niet vertalen. - Laat elk blok zijn leessnelheid behouden; Kort indien nodig in, maar verdraai de betekenis niet. - Specificeer de culturele referentie of term waar u niet zeker van bent met [TRANSLATOR'S NOTE].
drie minikoffers
Geval 1 — Versnelde lijn. Een documentaireploeg heeft drie weken lang een twaalf uur durend archief met interviews met de hand getranscribeerd. Met automatische transcriptie werd de onbewerkte tekst binnen een dag uitgevoerd; Door te zoeken via tekst (woord voor woord) vond het team binnen enkele seconden de gewenste momenten. Vervolgens hebben ze alleen de aflevering van 40 minuten die ze zouden gebruiken nauwgezet gemonteerd en ondertiteld. Drie weken werden vier dagen; verificatie-inspanningen waren gericht op de gebruikte sectie.
Geval 2 — Verzonnen woord. Een nieuwszender zond het rauwe straatinterview uit met automatische ondertiteling, zonder controle. Het model 'hoorde' een onuitgesproken woord op de achtergrond, en het onderschrift schreef een onuitgesproken woord toe aan de geïnterviewde. Er volgde een reactie op sociale media en de correctie werd gepubliceerd. Les: bij opnames met veel ruis moeten automatische ondertitels worden vergeleken met de originele audio.
Geval 3 — Vertaalramp. Een merk publiceerde de Engelse ondertitels van zijn promotievideo met automatische vertaling en zonder controle. Toen een Turks idioom ("let op") woord voor woord werd vertaald, leek het betekenisloos en zelfs grappig voor het Engelse publiek, en werd de ernst van het merk geschaad. De juiste manier: de vertaling laten verifiëren door iemand die de doeltaal kent.
Zwakke prompt/sterke prompt
Zwakke prompt:
Ondertitel deze video en vertaal hem naar het Engels.
Er is geen opmaak, geen leesbaarheidsregels, geen validatiemarkeringen. De uitkomst zal grof en riskant zijn.
Krachtige prompt:
Jouw rol: tweetalige ondertiteleditor. Invoer: Turkse tijdgecodeerde transcriptie. Taak: 1) Bewerk de Turkse ondertitel met 2 regels / ~ 40 tekens / goede scheidingsregels. 2) Markeer eigennamen en termen met [CONTROL]. 3) Produceer een Engelse vertaling afzonderlijk; Breng de zin letterlijk over, behoud de merknaam.4) Markeer blokken die de leessnelheid overschrijden met [LONG].5) Verzin geen woorden; Schrijf het onbepaalde geluid [UNINDICATED].
Veel voorkomende fouten
- Automatische transcripties publiceren zonder controle. Fouten in eigennamen, termen, interpunctie en verzonnen woorden blijven bestaan.
- Slechte lijnsplitsing. Regels die eindigen op "en/maar/ki" maken het lezen moeilijk.
- Overschrijding van de leessnelheid. Lange ondertitels die te kort op het scherm staan, kunnen niet worden gelezen.
- Machinevertaling wordt niet geverifieerd. Als een idioom, grap of term fout gaat, lijdt het merk daaronder.
- Luidsprekeronderscheid omzeilen. Als er verwarring bestaat over "wie wat zei" in het paneel, zal de ondertitel misleidend zijn.
Tip: Bekijk tijdens het bewerken van het transcript de video op 1,25-1,5 snelheid en controleer of deze gesynchroniseerd is met de ondertitels. Op deze manier vangt u snel zowel tijdcodeafwijking als verzonnen/gemiste woorden op.
Let op: Op gebieden als gezondheidszorg, recht en financiën kan één verkeerd getranscribeerd woord (bijvoorbeeld een dosis, een ingrediëntnummer) ernstige gevolgen hebben. In deze inhoud moet elk nummer en elke term afzonderlijk worden geverifieerd.
Samengevat
Geautomatiseerde transcriptie en ondertiteling zorgen voor de grootste tijdbesparing bij postproductie en maken toegankelijkheid mogelijk. AI reduceert uren transcriptie tot minuten en maakt zoeken via tekst mogelijk. Maar de output is niet geschikt voor publicatie in zijn ruwe vorm: eigennamen, termen, interpunctie, verzonnen woorden en slechte regeleinden moeten worden gecorrigeerd. Leesbaarheidsregels (regellengte, duur, leessnelheid) maken de tekst vloeiend voor de kijker. Bij meertalige ondertitels moet de automatische vertaling worden geverifieerd door iemand die de doeltaal kent. AI giet en suggereert; Nauwkeurigheid, leesbaarheid en betekenis vallen onder de verantwoordelijkheid van de redactie.
Applicatie taak
Maak een korte gespreksopname (misschien uw eigen stem, 2-3 minuten) en laat deze automatisch uitschrijven. Vergelijk de uitvoer met de originele audio en markeer eigennamen, termen en interpunctiefouten; Zoek minstens vijf fouten. Laat de tekst vervolgens opdelen in ondertitelblokken volgens de bovenstaande regels, vertalen in één taal en corrigeer minimaal twee riskante punten (idiomen/termen) in de vertaling. Rapporteer het proces en eventuele fouten die u tegenkomt.
controlelijst
- [ ] Heb ik het transcript vergeleken met de originele audio en eventuele fouten in de eigennaam/term/interpunctie gecorrigeerd?
- [ ] Heb ik gecontroleerd op verzonnen of weggelaten woorden?
- [ ] Heb ik de ondertiteling aangepast op basis van regellengte, duur en leessnelheid?
- [ ] Heb ik voor meertalige ondertitels de vertaling zorgvuldig geverifieerd bij iemand die de doeltaal kent?
- [ ] Heb ik elk nummer en elke term in gevoelige inhoud afzonderlijk geverifieerd?