Gevinster:
- Evne til å passe samtidig som meningen bevares ved å bruke de tekniske reglene for underteksten (linje, tegn, CPS)
- Evne til å verifisere riktig navn og nummerfeil med stemmen mens du øker hastigheten på transkripsjon og automatisk tidskoding med ASR
- Evne til å håndtere grensene for kunstig intelligens ved å ta hensyn til visuell kontekst, tonal forskjell og leppesynkronisering i dubbing
Å oversette en film, TV-serier, bedriftsvideo eller nettkurs er radikalt forskjellig fra å oversette ren tekst: tid, lesehastighet, skjermbilde, stemme og leppebevegelsen til karakterene er også begrensninger. I denne enheten vil du lære audiovisuell oversettelse (teksting, dubbing, voice-over), de tekniske reglene for teksting, AI-støttet transkripsjon og tidskoding, og kvalitetsfellene i dette feltet. Målet er å jobbe som en audiovisuell oversettelsesekspert som «passer publikums øyne og ører» i stedet for å «oversette teksten».
Grunnleggende konsepter
Audiovisuell oversettelse (AVT) er oversettelsen av innhold som inneholder lyd og video; Hovedformene er teksting, dubbing og lydbeskrivelse. Teksting er refleksjonen av talen i skriftlig form på skjermen. Dubbing er re-dubbing av den originale stemmen på målspråket. Voice-over er når den originale lyden er dempet og en oversettelse leses over den (vanlig i dokumentarer).
To kritiske tekniske termer for teksting: CPS (Characters Per Second) begrenser hastigheten på tekstingen slik at seeren kan lese den komfortabelt; Den generelt aksepterte øvre grensen er rundt 17 tegn per sekund (nedre for barneinnhold). Tidskode er start-slutttiden som indikerer når underteksten vises og forsvinner på skjermen (som 00:01:23,400).
Hvorfor er det vanskelig? Fordi det betyr å tilpasse oversettelsen til undertekster. To linjer, ~42 tegn per linje, minimum ~1 sekund og maksimum ~6 sekunder skjermtid, og CPS-grensen - du må overholde alle disse samtidig som du opprettholder mening og tone. Det er derfor undertekstoversettelse ofte er et spørsmål om komprimering og omformulering, ikke ord-for-ord-oversettelse.
Tips: Unngå refleksen med å "oversette hvert ord" i undertekster. Betrakteren både ser og leser bildet; For lange undertekster kan ikke leses. Å finne det korteste naturlige uttrykket som bevarer mening er den sanne mestringen av billedteksten.
Rollen til AI i audiovisuell oversettelse
AI fremskynder flere trinn betydelig på dette området:
- Transkripsjon: Med ASR (Automatic Speech Recognition) blir stemmen automatisk transkribert. Dette trekker ut råkilden til undertittelen på minutter.
- Automatisk tidskoding: Verktøy deler opp samtalen i segmenter og produserer utkast til tidskoder.
- Oversettelsesutkast: Transkripsjonsteksten er oversatt.
- CPS/lengdekontroll: AI kan merke hvilken undertekst som overstiger lesehastigheten og foreslå forkorting.
Men pass på: ASR feiler på støy, aksent, overlappende tale, egennavn og tekniske termer; kan ikke gi "lydbeskrivelse"; Hvem som snakker kan bli forvirret. AI-oversettelsen ser ikke bildet - den kan ikke vite når et objekt som vises på skjermen kalles "det". Derfor verifiserer mennesket den visuelle konteksten og dechiffreringsnøyaktigheten.
Forsiktig: Den vanligste feilen er å tro at ASR-utgangen er "dekodet". ASR gjør hyppige feil, spesielt når det gjelder egennavn, tall, merkenavn og tekniske termer; en feil transkripsjon overføres til oversettelse og teksting. Sørg for å verifisere kritiske områder ved å lytte til lyden.
Regler for undertekstformat
Vanlige regler (varierer etter plattform):
- ~37-42 tegn per linje, maksimalt 2 linjer.
- Varighet: ~1-6 sekunder; Unngå veldig korte "flash" undertekster.
- CPS må ikke overstige ~17 (vokseninnhold).
- Bryt setningen der det gir mening (ikke la "og" eller "men" stå på slutten av linjen).
- Hvis mulig, ikke hopp over sceneklippet (bildebytte).
- Følg plattformreglene for ting som banning, sanger, skjermskriving.
tre minisaker
Tilfelle 1 – ASR + etterredigering øket med 60 %. Et team transkriberte og tidskodede først en 45-minutters dokumentar med ASR, deretter oversatte og etterredigerte den. Tid redusert med 60 % sammenlignet med transkribering + tidskoding fra bunnen av. Men alle egennavn og tall ble korrigert ved lydsammenlikning.
Tilfelle 2 — CPS-sjekk lagret lesbarhet. Den første oversettelsen av en instruksjonsvideo med undertekster var nøyaktig, men CPS var i gjennomsnitt 24 — publikum kunne ikke følge med. En runde med AI-drevet forkorting forkortet undertekster med 30 %, og reduserte CPS til 16; mening ble bevart, lesbarheten kom.
Tilfelle 3 — Visuell kontekstfeil. I den ASR-baserte oversettelsen pekte en karakter på et skilt på skjermen og sa «les det»; AI oversatte det som "les det", men teksten på skiltet ble ikke oversatt, så seeren kunne ikke se hva han skulle lese. Bildeteksten la til en egen bildetekst for skjermteksten; Personen som så bildet utgjorde forskjellen.
Fire kopierbare maler
1) Verifiseringsliste for transkripsjon (ASR):
Nedenfor er en automatisk transkripsjon av en video. Merk mulige feil i transkripsjonen: egennavn, merkenavn, tall, faguttrykk, tvetydige/ufullstendige setninger. Oppgi disse som «bekreft med stemme». Ikke oversett. Transkribere: [...]
2) Oversettelse av undertekst (CPS/lengde begrenset):
Oversett følgende transkripsjon til [målspråk] undertekster. BEGRENSNING: hver undertekst må være på maksimalt 2 linjer, linje ~42 tegn, CPS må ikke overstige ~17. FORKORT og naturaliser samtidig som meningen bevares; ikke oversett ord for ord. Ta vare på tidskoder. Transkripsjon + tidskoder: [...]
3) CPS/lesbarhetssjekk:
Beregn omtrentlig CPS basert på varighet og antall tegn for hver av de følgende undertekstene. Merk alle som overstiger 17 og foreslå et kortere alternativ som bevarer betydningen. Undertekster (tekst | varighet sekunder): [...]
4) Skjermtekst / visuell kontekstsjekk:
I den følgende dialogen markerer du stedene som kan referere til bildet (skjermtekst, spiss gjenstand, skilt). Si om det kreves ytterligere undertekster/forklaringer for disse, forutsatt at seeren ikke kan se bildet. Dialog: [...]
Svak forespørsel / Sterk forespørsel
Svak: "Oversett disse undertekstene." (Ingen lengde, CPS, linjeregler; utdata passer ikke på skjermen, uleselig.)
Güçlü: "Oversett denne dialogutskriften til tyrkisk undertekst. Hver undertekst må være på maksimalt 2 linjer, 42 tegn per linje; forkort den samtidig som du beholder betydningen når det er nødvendig for lesehastighet. Gi talespråket på naturlig tyrkisk, myk opp slangen. Ikke berør tidskodene."
Forskjell: sterk melding gir de tekniske begrensningene til underteksten (linje, tegn, CPS, tone); utgangen nærmer seg faktisk brukbare undertekster.
Sammenligningsdiagram for AVT-formater
format
Hva gjør
AI-bidrag
menneskelig kritisk punkt
undertekst
Transkriberer talen
ASR, oversettelse, CPS
Fit, visuell kontekst
dubbing
Voiceover på målspråket
Oversettelsesutkast
leppesynkronisering, skuespill
voice-over
Les oversettelsen ovenfor
Oversettelse, timing
Naturlig flyt, tone
Lydbeskrivelse
Beskriver bildet med lyd
utkast til tekst
Visuell tolkning (menneskelig)
Vanlige feil
- Oversettelse av ASR-utskrift uten å verifisere det. Egennavn/nummerfeil overføres til underteksten.
- Oversette ord for ord og komme rundt CPS. Publikum kan ikke lese; passform må gjøres.
- Ignorerer visuell kontekst. Skjermtekst og spisse objekter forblir uoversatt.
- Gjør linjedeling meningsløst. Det ødelegger lesbarheten.
- Flate ut tonen/registeret. Karakterenes dialekter og slang forsvinner.
Dubbing og leppesynkronisering
Mens begrensningen med teksting er lesehastighet, er begrensningen med dubbing tid og lepper. Det er tre forskjellige typer synkronisering i voice-over-oversettelse: lip-sync — der oversettelsen samsvarer med karakterens munnbevegelse, spesielt åpne vokaler i nærbilder; isochrony — oversettelseslinjen har samme lengde som den opprinnelige linjen, verken for kort eller for lang; synkronisering av gester — samsvarer med det som blir sagt med karakterens hånd- og armbevegelser. Derfor skriver dubbing-oversetteren ofte en «fengende» replikk som bevarer betydningen men med helt andre ord; Ordtroskap er enda mindre enn undertekst her.
AI kan gi et rå oversettelsesutkast og en tidsvarsel for dubbing ("denne linjen er 40 % lengre enn originalen, forkort den"). Nye teknologier kan til og med klone lyd og produsere automatisk dubbing; men skuespill, følelser, finjustering av karakterens pust og leppesynkronisering er fortsatt jobben til den menneskelige oversetteren og stemmeskuespilleren. Automatisk dubbing gir en oversikt; Den kunstneriske og synkrone avgjørelsen er menneskelig. I tillegg er samtykke fra personen hvis stemme er klonet et viktig etisk og juridisk spørsmål.
Oppsummert
Audiovisuell oversettelse er kunsten å tilpasse tekst innenfor begrensningene til betrakterens øye og øre: linje/karakter/CPS-grenser i teksting, leppesynkronisering i dubbing, visuell kontekst er den avgjørende faktoren i dem alle. AI øker hastigheten på transkripsjon, tidskoding, oversettelsesutkast og CPS-sjekking med ASR; Men ASR tar feil i egennavn og støy, den kan ikke se bildet og avgjørelsene om passform blir tatt av mennesket. Hovedteksteren oversetter ikke ord for ord; finner det korteste, mest naturlige uttrykket som bevarer meningen.
Søknadsoppgave
Velg et kort (2-3 minutter) videoklipp. Transkriber med et ASR-verktøy og sammenlign og korriger risikoområder med lyden med en "transkripsjonsverifisering"-mal. Oversett deretter med CPS ~17-begrensningen med "undertekstoversettelse"-malen og forkort undertekstene som overskrider grensen med "CPS-kontrollen". Hvis det er en skjermtekst eller skilt, bruk en "visuell kontekstsjekk".
sjekkliste
- [ ] Jeg bekreftet ASR-dekrypteringen med stemmen for det spesifikke navnet/nummeret.
- [ ] Jeg fikk undertekstene til å passe innenfor linje/karakter/CPS-reglene.
- [ ] Jeg forkortet og naturaliserte det, ikke ord for ord, og bevarte meningen.
- [ ] Jeg tok hensyn til den visuelle konteksten (tekst på skjermen, tegn).
- [ ] Jeg oversatte den for å bevare forskjellene i tone og karakter.