Vinster:
- Förmåga att passa samtidigt som innebörden bevaras genom att tillämpa de tekniska reglerna för undertexten (rad, tecken, CPS)
- Möjlighet att verifiera korrekt namn och nummerfel med röst samtidigt som transkription och automatisk tidskodning påskyndas med ASR
- Förmåga att hantera gränserna för artificiell intelligens genom att ta hänsyn till visuell kontext, tonal skillnad och läppsynk vid dubbning
Att översätta en film, tv-serier, företagsvideo eller onlinekurs skiljer sig radikalt från att översätta vanlig text: tid, läshastighet, skärmbild, röst och karaktärernas läpprörelser är också begränsningar. I den här enheten kommer du att lära dig audiovisuell översättning (textning, dubbning, voice-over), de tekniska reglerna för undertextning, AI-stödd transkription och tidskodning, och kvalitetsfallgroparna i detta område. Syftet är att arbeta som en audiovisuell översättningsexpert som "passar publikens ögon och öron" snarare än att "översätta texten".
Grundläggande begrepp
Audiovisuell översättning (AVT) är översättning av innehåll som innehåller ljud och video; Huvudformerna är textning, dubbning och ljudbeskrivning. Undertextning är reflektionen av talet i skriftlig form på skärmen. Dubbning är omdubbningen av den ursprungliga rösten på målspråket. Voice-over är när originalljudet stängs av och en översättning läses över det (vanligt i dokumentärer).
Två kritiska tekniska termer för undertextning: CPS (Characters Per Second) begränsar textningshastigheten så att tittaren kan läsa den bekvämt; Den allmänt accepterade övre gränsen är cirka 17 tecken per sekund (lägre för barninnehåll). Tidskod är start-sluttiden som anger när undertexten kommer att visas och försvinna på skärmen (som 00:01:23,400).
Varför är det svårt? För det innebär att anpassa översättning till undertexter. Två rader, ~42 tecken per rad, minst ~1 sekund och högst ~6 sekunders skärmtid och CPS-gränsen - du måste följa alla dessa samtidigt som du behåller mening och ton. Det är därför som översättning av undertexter ofta handlar om komprimering och omformulering, inte ord-för-ord-översättning.
Tips: Undvik reflexen att "översätta varje ord" i undertexter. Betraktaren både tittar på och läser bilden; För långa undertexter kan inte läsas. Att hitta det kortaste naturliga uttrycket som bevarar mening är bildtextarens verkliga behärskning.
AI:s roll i audiovisuell översättning
AI påskyndar avsevärt flera steg inom detta område:
- Transkription: Med ASR (Automatic Speech Recognition) transkriberas rösten automatiskt. Detta extraherar undertextens råkälla på några minuter.
- Automatisk tidskodning: Verktyg delar upp konversationen i segment och producerar utkast till tidskoder.
- Översättningsutkast: Utskriftstexten är översatt.
- CPS/längdkontroll: AI:n kan markera vilken undertext som överstiger läshastigheten och föreslå förkortning.
Men se upp: ASR gör fel när det gäller brus, accent, överlappande tal, egennamn och tekniska termer; kan inte tillhandahålla "ljudbeskrivning"; Vem som pratar kan bli förvirrad. AI-översättningen ser inte bilden - den kan inte veta när ett objekt som visas på skärmen kallas "det". Därför verifierar människan det visuella sammanhanget och dechiffreringsnoggrannheten.
Varning: Det vanligaste misstaget är att tro att ASR-utgången är "avkodad". ASR gör ofta misstag, särskilt i egennamn, nummer, varumärken och tekniska termer; en felaktig transkription överförs till översättning och undertextning. Se till att verifiera kritiska områden genom att lyssna på ljudet.
Regler för undertextformat
Vanliga regler (varierar beroende på plattform):
- ~37-42 tecken per rad, max 2 rader.
- Varaktighet: ~1-6 sekunder; Undvik mycket korta "flash" undertexter.
- CPS får inte överstiga ~17 (vuxet innehåll).
- Bryt meningen där det är vettigt (lämna inte "och" eller "men" i slutet av raden).
- Om möjligt, hoppa inte över scenklippet (bildbyte).
- Följ plattformsreglerna för saker som svordomar, sånger, skärmskrivning.
tre minifodral
Fall 1 – ASR + efterredigering påskyndas med 60 %. Ett team transkriberade och tidskodade först en 45-minuters dokumentär med ASR, översatte sedan och efterredigerade den. Tid reducerad med 60 % jämfört med transkribering + tidskodning från början. Men alla egennamn och siffror korrigerades genom ljudjämförelse.
Fall 2 — CPS kontrollera sparad läsbarhet. Den första översättningen av en instruktionsvideo med undertexter var korrekt, men CPS var i genomsnitt 24 — publiken kunde inte hänga med. En omgång av AI-driven förkortning förkortade undertexter med 30 %, vilket minskade CPS till 16; meningen bevarades, läsbarheten kom.
Fall 3 — Visuellt kontextfel. I den ASR-baserade översättningen pekade en karaktär på en skylt på skärmen och sa "läs det"; AI:n översatte det som "läs det", men texten på skylten översattes inte, så tittaren kunde inte se vad den skulle läsa. Bildtexten lade till en separat bildtext för skärmtexten; Personen som såg bilden gjorde skillnaden.
Fyra kopierbara mallar
1) Verifieringslista för transkription (ASR):
Nedan är en automatisk transkription av en video. Markera eventuella fel i transkriptionen: egennamn, märkesnamn, siffror, tekniska termer, tvetydiga/ofullständiga meningar. Lista dessa som "verifiera med röst." Översätt inte. Transkribera: [...]
2) Undertextöversättning (CPS/längd begränsad):
Översätt följande transkription till [målspråk] undertexter. BEGRÄNSNING: varje undertext får vara högst 2 rader, rad ~42 tecken, CPS får inte överstiga ~17. FÖRKORTA och naturalisera samtidigt som innebörden bevaras; översätt inte ord för ord. Spara tidskoder. Transkription + tidskoder: [...]
3) CPS/läsbarhetskontroll:
Beräkna ungefärlig CPS baserat på varaktighet och teckenantal för var och en av följande undertexter. Markera alla som överstiger 17 och föreslå ett kortare alternativ som bevarar innebörden. Undertexter (text | varaktighet sekunder): [...]
4) Skärmtext/visuell kontextkontroll:
Markera i följande dialog de platser som kan referera till bilden (skärmtext, spetsigt föremål, skylt). Säg om ytterligare undertexter/förklaringar krävs för dessa, förutsatt att tittaren inte kan se bilden. Dialog: [...]
Svag prompt / Stark prompt
Svag: "Översätt dessa undertexter." (Ingen längd, CPS, linjeregler, utdata får inte plats på skärmen, oläsbar.)
Güçlü: "Översätt denna dialogtranskription till turkiska undertexter. Varje undertext får vara högst 2 rader, 42 tecken per rad; förkorta den samtidigt som betydelsen bevaras när det behövs för läshastigheten. Ge det talade språket på naturlig turkiska, mjuka upp slangen. Rör inte vid tidskoderna."
Skillnad: stark prompt ger de tekniska begränsningarna för undertexten (rad, tecken, CPS, ton); utgången närmar sig faktiskt användbara undertexter.
Jämförelsetabell för AVT-format
format
Vad gör
AI-bidrag
mänsklig kritisk punkt
undertext
Transkriberar talet
ASR, översättning, CPS
Passform, visuell kontext
dubbning
Voiceover på målspråk
Översättningsutkast
läppsynk, skådespeleri
voice-over
Läs översättningen ovan
Översättning, timing
Naturligt flöde, ton
Ljudbeskrivning
Beskriver bilden med ljud
utkast till text
Visuell tolkning (mänsklig)
Vanliga misstag
- Översätta ASR-transkriptet utan att verifiera det. Egennamn/nummerfel överförs till undertexten.
- Översätta ord för ord och komma runt CPS. Publiken kan inte läsa; passform måste göras.
- Ignorera visuella sammanhang. Skärmtext och spetsiga föremål förblir oöversatta.
- Att göra linjedelning meningslös. Det förstör läsbarheten.
- Platta ut tonen/registret. Karaktärernas dialekter och slang försvinner.
Dubbning och läppsynk
Medan begränsningen för undertextning är läshastighet, är begränsningen för dubbning tid och läppar. Det finns tre distinkta typer av synkronisering i voice-over-översättning: lip-sync — där översättningen matchar karaktärens munrörelse, särskilt öppna vokaler i närbilder; isokroni — översättningslinjen är lika lång som den ursprungliga raden, varken för kort eller för lång; gestsynkroni — matcha det som sägs med karaktärens hand- och armrörelser. Det är därför dubbningsöversättaren ofta skriver en "catchy" rad som bevarar innebörden men med helt andra ord; Ordtrohet är ännu mindre än undertext här.
AI kan ge ett råöversättningsutkast och en tidsvarning för dubbning ("den här raden är 40 % längre än originalet, förkorta den"). Ny teknik kan till och med klona ljud och producera automatisk dubbning; men skådespeleri, känslor, finjustering av karaktärens andning och läppsynkronisering är fortfarande den mänskliga översättarens och röstskådespelarens uppgift. Automatisk dubbning ger en kontur; Det konstnärliga och synkrona beslutet är mänskligt. Dessutom är samtycke från den person vars röst är klonad en viktig etisk och juridisk fråga.
Sammanfattningsvis
Audiovisuell översättning är konsten att anpassa text inom betraktarens öga och öra: linje/karaktär/CPS-gränser vid undertextning, läppsynkronisering vid dubbning, visuell kontext är den avgörande faktorn i dem alla. AI påskyndar transkription, tidskodning, översättningsutkast och CPS-kontroll med ASR; Men ASR har fel i egennamn och brus, den kan inte se bilden och besluten i passformen fattas av människan. Huvudtextaren översätter inte ord för ord; finner det kortaste, mest naturliga uttrycket som bevarar meningen.
Applikationsuppgift
Välj ett kort (2-3 minuter) videoklipp. Transkribera med ett ASR-verktyg och jämför och korrigera riskområden med ljudet med en mall för "transkriptionsverifiering". Översätt sedan med CPS ~17-begränsningen med mallen "undertextöversättning" och förkorta undertexterna som överskrider gränsen med "CPS-kontrollen". Om det finns en skärmtext eller skylt, tillämpa en "visuell kontextkontroll".
checklista
- [ ] Jag verifierade ASR-dekrypteringen med rösten för det specifika namnet/numret.
- [ ] Jag fick undertexterna att passa inom linje/karaktär/CPS-reglerna.
- [ ] Jag förkortade och naturaliserade det, inte ord för ord, för att bevara innebörden.
- [ ] Jag tog hänsyn till det visuella sammanhanget (text på skärmen, tecken).
- [ ] Jag översatte den för att bevara skillnaderna i ton och karaktär.