Enhet 7 / 11

Teksting, dubbing og audiovisuell oversettelse

Gevinster:

  • Evne til å passe samtidig som meningen bevares ved å bruke de tekniske reglene for underteksten (linje, tegn, CPS)
  • Evne til å verifisere riktig navn og nummerfeil med stemmen mens du øker hastigheten på transkripsjon og automatisk tidskoding med ASR
  • Evne til å håndtere grensene for kunstig intelligens ved å ta hensyn til visuell kontekst, tonal forskjell og leppesynkronisering i dubbing

Å oversette en film, TV-serier, bedriftsvideo eller nettkurs er radikalt forskjellig fra å oversette ren tekst: tid, lesehastighet, skjermbilde, stemme og leppebevegelsen til karakterene er også begrensninger. I denne enheten vil du lære audiovisuell oversettelse (teksting, dubbing, voice-over), de tekniske reglene for teksting, AI-støttet transkripsjon og tidskoding, og kvalitetsfellene i dette feltet. Målet er å jobbe som en audiovisuell oversettelsesekspert som «passer publikums øyne og ører» i stedet for å «oversette teksten».

Grunnleggende konsepter

Audiovisuell oversettelse (AVT) er oversettelsen av innhold som inneholder lyd og video; Hovedformene er teksting, dubbing og lydbeskrivelse. Teksting er refleksjonen av talen i skriftlig form på skjermen. Dubbing er re-dubbing av den originale stemmen på målspråket. Voice-over er når den originale lyden er dempet og en oversettelse leses over den (vanlig i dokumentarer).

To kritiske tekniske termer for teksting: CPS (Characters Per Second) begrenser hastigheten på tekstingen slik at seeren kan lese den komfortabelt; Den generelt aksepterte øvre grensen er rundt 17 tegn per sekund (nedre for barneinnhold). Tidskode er start-slutttiden som indikerer når underteksten vises og forsvinner på skjermen (som 00:01:23,400).

Hvorfor er det vanskelig? Fordi det betyr å tilpasse oversettelsen til undertekster. To linjer, ~42 tegn per linje, minimum ~1 sekund og maksimum ~6 sekunder skjermtid, og CPS-grensen - du må overholde alle disse samtidig som du opprettholder mening og tone. Det er derfor undertekstoversettelse ofte er et spørsmål om komprimering og omformulering, ikke ord-for-ord-oversettelse.

Tips: Unngå refleksen med å "oversette hvert ord" i undertekster. Betrakteren både ser og leser bildet; For lange undertekster kan ikke leses. Å finne det korteste naturlige uttrykket som bevarer mening er den sanne mestringen av billedteksten.

Rollen til AI i audiovisuell oversettelse

AI fremskynder flere trinn betydelig på dette området:

  1. Transkripsjon: Med ASR (Automatic Speech Recognition) blir stemmen automatisk transkribert. Dette trekker ut råkilden til undertittelen på minutter.
  2. Automatisk tidskoding: Verktøy deler opp samtalen i segmenter og produserer utkast til tidskoder.
  3. Oversettelsesutkast: Transkripsjonsteksten er oversatt.
  4. CPS/lengdekontroll: AI kan merke hvilken undertekst som overstiger lesehastigheten og foreslå forkorting.

Men pass på: ASR feiler på støy, aksent, overlappende tale, egennavn og tekniske termer; kan ikke gi "lydbeskrivelse"; Hvem som snakker kan bli forvirret. AI-oversettelsen ser ikke bildet - den kan ikke vite når et objekt som vises på skjermen kalles "det". Derfor verifiserer mennesket den visuelle konteksten og dechiffreringsnøyaktigheten.

Forsiktig: Den vanligste feilen er å tro at ASR-utgangen er "dekodet". ASR gjør hyppige feil, spesielt når det gjelder egennavn, tall, merkenavn og tekniske termer; en feil transkripsjon overføres til oversettelse og teksting. Sørg for å verifisere kritiske områder ved å lytte til lyden.

Regler for undertekstformat

Vanlige regler (varierer etter plattform):

  • ~37-42 tegn per linje, maksimalt 2 linjer.
  • Varighet: ~1-6 sekunder; Unngå veldig korte "flash" undertekster.
  • CPS må ikke overstige ~17 (vokseninnhold).
  • Bryt setningen der det gir mening (ikke la "og" eller "men" stå på slutten av linjen).
  • Hvis mulig, ikke hopp over sceneklippet (bildebytte).
  • Følg plattformreglene for ting som banning, sanger, skjermskriving.

tre minisaker

Tilfelle 1 – ASR + etterredigering øket med 60 %. Et team transkriberte og tidskodede først en 45-minutters dokumentar med ASR, deretter oversatte og etterredigerte den. Tid redusert med 60 % sammenlignet med transkribering + tidskoding fra bunnen av. Men alle egennavn og tall ble korrigert ved lydsammenlikning.

Tilfelle 2 — CPS-sjekk lagret lesbarhet. Den første oversettelsen av en instruksjonsvideo med undertekster var nøyaktig, men CPS var i gjennomsnitt 24 — publikum kunne ikke følge med. En runde med AI-drevet forkorting forkortet undertekster med 30 %, og reduserte CPS til 16; mening ble bevart, lesbarheten kom.

Tilfelle 3 — Visuell kontekstfeil. I den ASR-baserte oversettelsen pekte en karakter på et skilt på skjermen og sa «les det»; AI oversatte det som "les det", men teksten på skiltet ble ikke oversatt, så seeren kunne ikke se hva han skulle lese. Bildeteksten la til en egen bildetekst for skjermteksten; Personen som så bildet utgjorde forskjellen.

Fire kopierbare maler

1) Verifiseringsliste for transkripsjon (ASR):

Nedenfor er en automatisk transkripsjon av en video. Merk mulige feil i transkripsjonen: egennavn, merkenavn, tall, faguttrykk, tvetydige/ufullstendige setninger. Oppgi disse som «bekreft med stemme». Ikke oversett. Transkribere: [...]

2) Oversettelse av undertekst (CPS/lengde begrenset):

Oversett følgende transkripsjon til [målspråk] undertekster. BEGRENSNING: hver undertekst må være på maksimalt 2 linjer, linje ~42 tegn, CPS må ikke overstige ~17. FORKORT og naturaliser samtidig som meningen bevares; ikke oversett ord for ord. Ta vare på tidskoder. Transkripsjon + tidskoder: [...]

3) CPS/lesbarhetssjekk:

Beregn omtrentlig CPS basert på varighet og antall tegn for hver av de følgende undertekstene. Merk alle som overstiger 17 og foreslå et kortere alternativ som bevarer betydningen. Undertekster (tekst | varighet sekunder): [...]

4) Skjermtekst / visuell kontekstsjekk:

I den følgende dialogen markerer du stedene som kan referere til bildet (skjermtekst, spiss gjenstand, skilt). Si om det kreves ytterligere undertekster/forklaringer for disse, forutsatt at seeren ikke kan se bildet. Dialog: [...]

Svak forespørsel / Sterk forespørsel

Svak: "Oversett disse undertekstene." (Ingen lengde, CPS, linjeregler; utdata passer ikke på skjermen, uleselig.)

Güçlü: "Oversett denne dialogutskriften til tyrkisk undertekst. Hver undertekst må være på maksimalt 2 linjer, 42 tegn per linje; forkort den samtidig som du beholder betydningen når det er nødvendig for lesehastighet. Gi talespråket på naturlig tyrkisk, myk opp slangen. Ikke berør tidskodene."

Forskjell: sterk melding gir de tekniske begrensningene til underteksten (linje, tegn, CPS, tone); utgangen nærmer seg faktisk brukbare undertekster.

Sammenligningsdiagram for AVT-formater

format

Hva gjør

AI-bidrag

menneskelig kritisk punkt

undertekst

Transkriberer talen

ASR, oversettelse, CPS

Fit, visuell kontekst

dubbing

Voiceover på målspråket

Oversettelsesutkast

leppesynkronisering, skuespill

voice-over

Les oversettelsen ovenfor

Oversettelse, timing

Naturlig flyt, tone

Lydbeskrivelse

Beskriver bildet med lyd

utkast til tekst

Visuell tolkning (menneskelig)

Vanlige feil

  • Oversettelse av ASR-utskrift uten å verifisere det. Egennavn/nummerfeil overføres til underteksten.
  • Oversette ord for ord og komme rundt CPS. Publikum kan ikke lese; passform må gjøres.
  • Ignorerer visuell kontekst. Skjermtekst og spisse objekter forblir uoversatt.
  • Gjør linjedeling meningsløst. Det ødelegger lesbarheten.
  • Flate ut tonen/registeret. Karakterenes dialekter og slang forsvinner.

Dubbing og leppesynkronisering

Mens begrensningen med teksting er lesehastighet, er begrensningen med dubbing tid og lepper. Det er tre forskjellige typer synkronisering i voice-over-oversettelse: lip-sync — der oversettelsen samsvarer med karakterens munnbevegelse, spesielt åpne vokaler i nærbilder; isochrony — oversettelseslinjen har samme lengde som den opprinnelige linjen, verken for kort eller for lang; synkronisering av gester — samsvarer med det som blir sagt med karakterens hånd- og armbevegelser. Derfor skriver dubbing-oversetteren ofte en «fengende» replikk som bevarer betydningen men med helt andre ord; Ordtroskap er enda mindre enn undertekst her.

AI kan gi et rå oversettelsesutkast og en tidsvarsel for dubbing ("denne linjen er 40 % lengre enn originalen, forkort den"). Nye teknologier kan til og med klone lyd og produsere automatisk dubbing; men skuespill, følelser, finjustering av karakterens pust og leppesynkronisering er fortsatt jobben til den menneskelige oversetteren og stemmeskuespilleren. Automatisk dubbing gir en oversikt; Den kunstneriske og synkrone avgjørelsen er menneskelig. I tillegg er samtykke fra personen hvis stemme er klonet et viktig etisk og juridisk spørsmål.

Oppsummert

Audiovisuell oversettelse er kunsten å tilpasse tekst innenfor begrensningene til betrakterens øye og øre: linje/karakter/CPS-grenser i teksting, leppesynkronisering i dubbing, visuell kontekst er den avgjørende faktoren i dem alle. AI øker hastigheten på transkripsjon, tidskoding, oversettelsesutkast og CPS-sjekking med ASR; Men ASR tar feil i egennavn og støy, den kan ikke se bildet og avgjørelsene om passform blir tatt av mennesket. Hovedteksteren oversetter ikke ord for ord; finner det korteste, mest naturlige uttrykket som bevarer meningen.

Søknadsoppgave

Velg et kort (2-3 minutter) videoklipp. Transkriber med et ASR-verktøy og sammenlign og korriger risikoområder med lyden med en "transkripsjonsverifisering"-mal. Oversett deretter med CPS ~17-begrensningen med "undertekstoversettelse"-malen og forkort undertekstene som overskrider grensen med "CPS-kontrollen". Hvis det er en skjermtekst eller skilt, bruk en "visuell kontekstsjekk".

sjekkliste

  • [ ] Jeg bekreftet ASR-dekrypteringen med stemmen for det spesifikke navnet/nummeret.
  • [ ] Jeg fikk undertekstene til å passe innenfor linje/karakter/CPS-reglene.
  • [ ] Jeg forkortet og naturaliserte det, ikke ord for ord, og bevarte meningen.
  • [ ] Jeg tok hensyn til den visuelle konteksten (tekst på skjermen, tegn).
  • [ ] Jeg oversatte den for å bevare forskjellene i tone og karakter.