Enhed 7 / 11

Undertekstning, dubbing og audiovisuel oversættelse

Gevinster:

  • Evne til at passe og samtidig bevare betydningen ved at anvende undertekstens tekniske regler (linje, karakter, CPS)
  • Evne til at bekræfte korrekte navne- og nummerfejl med stemmen, mens transskription og automatisk tidskodning fremskyndes med ASR
  • Evne til at styre grænserne for kunstig intelligens ved at tage hensyn til visuel kontekst, tonal forskel og læbesynkronisering i dubbing

At oversætte en film, tv-serie, virksomhedsvideo eller onlinekursus er radikalt anderledes end at oversætte almindelig tekst: tid, læsehastighed, billede på skærmen, stemme og karakterernes læbebevægelse er også begrænsninger. I denne enhed lærer du audiovisuel oversættelse (undertekstning, dubbing, voice-over), de tekniske regler for undertekstning, AI-understøttet transskription og tidskodning og kvalitetsfaldgruberne i dette felt. Målet er at arbejde som en audiovisuel oversættelsesekspert, der "passer til publikums øjne og ører" frem for at "oversætte teksten".

Grundlæggende begreber

Audiovisuel oversættelse (AVT) er oversættelse af indhold, der indeholder lyd og video; De vigtigste former er undertekstning, dubbing og lydbeskrivelse. Undertekstning er en afspejling af talen i skriftlig form på skærmen. Dubbing er re-dubbing af den originale stemme på målsproget. Voice-over er, når den originale lyd er dæmpet, og en oversættelse læses over den (almindeligt i dokumentarer).

To kritiske tekniske termer for undertekstning: CPS (Characters Per Second) begrænser hastigheden af ​​undertekstning, så seeren kan læse den komfortabelt; Den generelt accepterede øvre grænse er omkring 17 tegn i sekundet (nedre for børns indhold). Tidskode er start-sluttidspunktet, der angiver, hvornår underteksten vises og forsvinder på skærmen (såsom 00:01:23.400).

Hvorfor er det svært? Fordi det betyder at tilpasse oversættelse til undertekster. To linjer, ~42 tegn pr. linje, minimum ~1 sekund og maksimalt ~6 sekunders skærmtid og CPS-grænsen - du skal overholde alle disse og samtidig bevare mening og tone. Derfor er oversættelse af undertekster ofte et spørgsmål om komprimering og omformulering, ikke ord-til-ord-oversættelse.

Tip: Undgå refleksen med at "oversætte hvert ord" i undertekster. Beskueren både ser og læser billedet; For lange undertekster kan ikke læses. At finde det korteste naturlige udtryk, der bevarer betydningen, er billedteksterens sande beherskelse.

AI's rolle i audiovisuel oversættelse

AI fremskynder betydeligt flere trin på dette område:

  1. Transskription: Med ASR (Automatic Speech Recognition) transskriberes stemmen automatisk. Dette udtrækker råkilden til underteksten på få minutter.
  2. Automatisk tidskodning: Værktøjer opdeler samtalen i segmenter og producerer udkast til tidskoder.
  3. Oversættelsesudkast: Udskriftsteksten er oversat.
  4. CPS/længdekontrol: AI'en kan markere, hvilken undertekst der overstiger læsehastigheden og foreslå afkortning.

Men pas på: ASR tager fejl på støj, accent, overlappende tale, egennavne og tekniske termer; kan ikke give "lydbeskrivelse"; Hvem der taler kan blive forvirret. AI-oversættelsen ser ikke billedet - den kan ikke vide, hvornår et objekt, der vises på skærmen, kaldes "det". Derfor verificerer mennesket den visuelle kontekst og dechiffreringsnøjagtighed.

Forsigtig: Den mest almindelige fejl er at tro, at ASR-outputtet er "afkodet". ASR laver hyppige fejl, især i egennavne, numre, mærkenavne og tekniske termer; en forkert transskription overføres til oversættelse og undertekstning. Sørg for at verificere kritiske områder ved at lytte til lyden.

Regler for undertekstformat

Fælles regler (varierer efter platform):

  • ~37-42 tegn pr. linje, maks. 2 linjer.
  • Varighed: ~1-6 sekunder; Undgå meget korte "flash" undertekster.
  • CPS må ikke overstige ~17 (voksenindhold).
  • Bryd sætningen, hvor det giver mening (lad ikke "og" eller "men" stå i slutningen af ​​linjen).
  • Hvis det er muligt, så spring ikke sceneklippet over (skudskift).
  • Følg platformsreglerne for ting som bandeord, sange, skærmskrivning.

tre minisager

Case 1 — ASR + post-edit fremskyndet med 60 %. Et hold transskriberede og tidskodede først en 45-minutters dokumentar med ASR, og oversatte den og efterredigerede den. Tid reduceret med 60 % sammenlignet med transskribering + tidskodning fra bunden. Men alle egennavne og numre blev rettet ved lydlig sammenligning.

Case 2 — CPS-tjek gemt læsbarhed. Den første oversættelse af en instruktionsvideo med undertekster var nøjagtig, men CPS var i gennemsnit 24 — publikum kunne ikke følge med. En omgang AI-drevet forkortning forkortede undertekster med 30 %, hvilket reducerede CPS til 16; mening blev bevaret, læsbarheden kom.

Tilfælde 3 — Visuel kontekstfejl. I den ASR-baserede oversættelse pegede en karakter på et skilt på skærmen og sagde "læs det"; AI’en oversatte det som "læs det", men teksten på skiltet blev ikke oversat, så seeren kunne ikke se, hvad han skulle læse. Billedteksteren tilføjede en separat billedtekst til skærmteksten; Den person, der så billedet, udgjorde forskellen.

Fire kopierbare skabeloner

1) Transkriptionsverifikationsliste (ASR):

Nedenfor er en automatisk transskription af en video. Markér mulige fejl i transskriptionen: egennavne, mærkenavne, tal, fagudtryk, tvetydige/ufuldstændige sætninger. Angiv disse som "bekræft med stemme." Oversæt ikke. Transskriber: [...]

2) Undertekstoversættelse (CPS/længde begrænset):

Oversæt følgende transskription til [målsprog] undertekster. BEGRÆNSNING: hver undertekst må maksimalt være på 2 linjer, linje ~42 tegn, CPS må ikke overstige ~17. FORKORT og naturaliser samtidig med at betydningen bevares; oversæt ikke ord for ord. Bevar tidskoder. Transskription + tidskoder: [...]

3) CPS/læsbarhedskontrol:

Beregn omtrentlig CPS baseret på varighed og tegnantal for hver af de følgende undertekster. Marker enhver, der overstiger 17, og foreslå et kortere alternativ, der bevarer betydningen. Undertekster (tekst | varighed sekunder): [...]

4) Skærmtekst / visuel konteksttjek:

Marker i den følgende dialog de steder, der kan henvise til billedet (skærmtekst, spids genstand, tegn). Sig, om der kræves yderligere undertekster/forklaringer til disse, forudsat at seeren ikke kan se billedet. Dialog: [...]

Svag prompt / Stærk prompt

Svag: "Oversæt disse undertekster." (Ingen længde, CPS, linjeregler; output passer ikke på skærmen, ulæselig.)

Güçlü: "Oversæt denne dialogudskrift til tyrkiske undertekster. Hver undertekst må maksimalt være på 2 linjer, 42 tegn pr. linje; forkort den, mens du bevarer betydningen, når det er nødvendigt for læsehastigheden. Giv det talte sprog på naturligt tyrkisk, blød slangen op. Rør ikke ved tidskoderne."

Forskel: stærk prompt giver undertekstens tekniske begrænsninger (linje, tegn, CPS, tone); outputtet nærmer sig faktisk brugbare undertekster.

AVT-formater sammenligningsdiagram

format

Hvad gør

AI-bidrag

menneskeligt kritisk punkt

undertekst

Transskriberer talen

ASR, oversættelse, CPS

Fit, visuel kontekst

eftersynkronisering

Voiceover på målsproget

Oversættelsesudkast

lip sync, skuespil

voice-over

Læs oversættelsen ovenfor

Oversættelse, timing

Naturligt flow, tone

Lydbeskrivelse

Beskriver billedet med lyd

udkast til tekst

Visuel tolkning (menneskelig)

Almindelige fejl

  • Oversættelse af ASR-transkriptet uden at verificere det. Egennavn/nummerfejl overføres til underteksten.
  • Oversætte ord for ord og komme rundt i CPS. Publikum kan ikke læse; pasform skal laves.
  • Ignorer visuel kontekst. Skærmtekst og spidse objekter forbliver uoversatte.
  • Gør linjeopdeling meningsløs. Det ødelægger læsbarheden.
  • Udjævning af tonen/registeret. Karakterernes dialekter og slang forsvinder.

Dubbing og lip sync

Mens begrænsningen af undertekster er læsehastighed, er begrænsningen ved dubbing tid og læber. Der er tre forskellige typer synkronisering i voice-over-oversættelse: lip-sync — hvor oversættelsen matcher karakterens mundbevægelse, især åbne vokaler i nærbilleder; isochrony — oversættelseslinjen har samme længde som den oprindelige linje, hverken for kort eller for lang; gestus-synkroni — matcher det, der bliver sagt, med karakterens hånd- og armbevægelser. Derfor skriver dubbing-oversætteren ofte en "fængende" linje, der bevarer betydningen men med helt andre ord; Ordtroskab er endnu mindre end undertekster her.

AI kan give et rå oversættelsesudkast og en tidsadvarsel for dubbing ("denne linje er 40 % længere end originalen, forkort den"). Nye teknologier kan endda klone lyd og producere automatisk dubbing; men skuespil, følelser, finjustering af karakterens vejrtrækning og læbesynkronisering er stadig den menneskelige oversætters og stemmeskuespillers opgave. Automatisk dubbing giver en oversigt; Den kunstneriske og synkrone beslutning er menneskets. Derudover er samtykke fra den person, hvis stemme er klonet, et vigtigt etisk og juridisk spørgsmål.

Sammenfattende

Audiovisuel oversættelse er kunsten at tilpasse tekst inden for begrænsningerne af seerens øje og øre: linje/karakter/CPS-grænser i undertekstning, læbesynkronisering i eftersynkronisering, visuel kontekst er den afgørende faktor i dem alle. AI fremskynder transkription, tidskodning, oversættelsesudkast og CPS-kontrol med ASR; Men ASR tager fejl i egennavne og støj, den kan ikke se billedet, og beslutningerne i pasformen træffes af mennesket. Master underteksteren oversætter ikke ord for ord; finder det korteste, mest naturlige udtryk, der bevarer meningen.

Ansøgningsopgave

Vælg et kort (2-3 minutter) videoklip. Transskriber med et ASR-værktøj og sammenlign og ret risikoområder med lyden med en "transskriptionsbekræftelse"-skabelon. Oversæt derefter med CPS ~17-begrænsningen med "undertekstoversættelse"-skabelonen og forkort de undertekster, der overskrider grænsen med "CPS-kontrollen". Hvis der er en skærmtekst eller et tegn, skal du anvende et "visuelt konteksttjek".

tjekliste

  • [ ] Jeg bekræftede ASR-dekrypteringen med stemmen for det specifikke navn/nummer.
  • [ ] Jeg fik underteksterne til at passe inden for linje/karakter/CPS reglerne.
  • [ ] Jeg forkortede og naturaliserede det, ikke ord for ord, og bevarede betydningen.
  • [ ] Jeg tog den visuelle kontekst (tekst på skærmen, tegn) i betragtning.
  • [ ] Jeg oversatte den for at bevare forskellene i tone og karakter.