Unità 7 / 11

Sottotitolazione, doppiaggio e traduzione audiovisiva

Guadagni:

  • Capacità di adattarsi preservando il significato applicando le regole tecniche del sottotitolo (riga, carattere, CPS)
  • Possibilità di verificare gli errori di nome e numero corretti tramite voce accelerando al tempo stesso la trascrizione e la codifica temporale automatica con ASR
  • Capacità di gestire i limiti dell'intelligenza artificiale tenendo conto del contesto visivo, della differenza tonale e della sincronizzazione labiale nel doppiaggio

Tradurre un film, una serie TV, un video aziendale o un corso online è radicalmente diverso dalla traduzione di un testo semplice: anche il tempo, la velocità di lettura, l'immagine sullo schermo, la voce e il movimento delle labbra dei personaggi sono vincoli. In questa unità imparerai la traduzione audiovisiva (sottotitolazione, doppiaggio, voce fuori campo), le regole tecniche del sottotitolaggio, la trascrizione e la codifica temporale supportate dall'intelligenza artificiale e le insidie ​​​​della qualità di questo campo. L'obiettivo è quello di lavorare come un esperto di traduzione audiovisiva che "si adatta agli occhi e alle orecchie del pubblico" piuttosto che "tradurre il testo".

Concetti di base

La traduzione audiovisiva (AVT) è la traduzione di contenuti contenenti audio e video; Le forme principali sono il sottotitolaggio, il doppiaggio e la descrizione audio. Il sottotitolaggio è la riproduzione del discorso in forma scritta sullo schermo. Il doppiaggio è il ridoppiaggio della voce originale nella lingua di destinazione. La voce fuori campo avviene quando l'audio originale viene disattivato e sopra viene letta una traduzione (comune nei documentari).

Due termini tecnici critici della sottotitolazione: CPS (Caratteri al secondo) limita la velocità della sottotitolazione in modo che lo spettatore possa leggerla comodamente; Il limite superiore generalmente accettato è di circa 17 caratteri al secondo (inferiore per i contenuti per bambini). Il timecode è l'ora di inizio e fine che indica quando il sottotitolo apparirà e scomparirà sullo schermo (ad esempio 00:01:23.400).

Perché è difficile? Perché significa adattare la traduzione ai sottotitoli. Due righe, ~42 caratteri per riga, un minimo di ~1 secondo e un massimo di ~6 secondi di tempo sullo schermo e il limite CPS: devi rispettare tutti questi requisiti mantenendo significato e tono. Ecco perché la traduzione dei sottotitoli è spesso una questione di compressione e riformulazione, non di traduzione parola per parola.

Suggerimento: evita il riflesso di "tradurre ogni parola" nei sottotitoli. Lo spettatore guarda e legge l'immagine; I sottotitoli troppo lunghi non possono essere letti. Trovare l'espressione naturale più breve che conservi il significato è la vera maestria del sottotitolatore.

Il ruolo dell’intelligenza artificiale nella traduzione audiovisiva

L’intelligenza artificiale accelera notevolmente diversi passaggi in quest’area:

  1. Trascrizione: Con l'ASR (riconoscimento vocale automatico), la voce viene trascritta automaticamente. Questo estrae la fonte grezza del sottotitolo in pochi minuti.
  2. Codifica temporale automatica: gli strumenti dividono la conversazione in segmenti e producono bozze di codici temporali.
  3. Bozza di traduzione: il testo della trascrizione è tradotto.
  4. Controllo CPS/lunghezza: l'intelligenza artificiale può contrassegnare quale sottotitolo supera la velocità di lettura e suggerire un accorciamento.

Ma attenzione: l'ASR sbaglia su rumore, accento, parole sovrapposte, nomi propri e termini tecnici; non può fornire "descrizione audio"; Chi sta parlando potrebbe confondersi. La traduzione AI non vede l'immagine: non può sapere quando un oggetto mostrato sullo schermo si chiama "quello". Pertanto, l'essere umano verifica il contesto visivo e l'accuratezza della decifrazione.

Attenzione: l'errore più comune è pensare che l'output ASR sia "decodificato". ASR commette frequenti errori, soprattutto nei nomi propri, nei numeri, nei marchi e nei termini tecnici; una trascrizione errata si ripercuote sulla traduzione e sulla sottotitolazione. Assicurati di verificare le aree critiche ascoltando l'audio.

Regole sul formato dei sottotitoli

Regole comuni (varia in base alla piattaforma):

  • ~37-42 caratteri per riga, massimo 2 righe.
  • Durata: ~1-6 secondi; Evita sottotitoli "flash" molto brevi.
  • Il CPS non deve superare ~17 (contenuti per adulti).
  • Rompi la frase dove ha senso (non lasciare "e" o "ma" alla fine della riga).
  • Se possibile, non saltare il taglio della scena (cambio inquadratura).
  • Segui le regole della piattaforma per elementi quali parolacce, canzoni, sceneggiature.

tre mini custodie

Caso 1: ASR + post-editing accelerati del 60%. Un team ha prima trascritto e codificato nel tempo un documentario di 45 minuti con ASR, quindi lo ha tradotto e post-montato. Tempo ridotto del 60% rispetto alla trascrizione + time coding da zero. Ma tutti i nomi propri e i numeri furono corretti mediante un sano confronto.

Caso 2: CPS controlla la leggibilità salvata. La prima traduzione di un video didattico con sottotitoli era accurata, ma il CPS era in media 24: il pubblico non riusciva a tenere il passo. Un ciclo di accorciamento basato sull'intelligenza artificiale ha accorciato i sottotitoli del 30%, riducendo il CPS a 16; il significato è stato preservato, è arrivata la leggibilità.

Caso 3: errore del contesto visivo. Nella traduzione basata su ASR, un personaggio indicò un segno sullo schermo e disse "leggilo"; L'intelligenza artificiale lo ha tradotto come "leggilo", ma il testo sul cartello non è stato tradotto, quindi lo spettatore non poteva vedere cosa leggere. Il sottotitolo ha aggiunto una didascalia separata per la didascalia dello schermo; La persona che ha visto l'immagine ha fatto la differenza.

Quattro modelli copiabili

1) Elenco di verifica della trascrizione (ASR):

Di seguito è riportata la trascrizione automatica di un video. Segna eventuali errori nella trascrizione: nomi propri, marchi, numeri, termini tecnici, frasi ambigue/incomplete. Elencali come "verifica vocale". Non tradurre. Trascrivi: [...]

2) Traduzione dei sottotitoli (CPS/lunghezza limitata):

Traduci la seguente trascrizione nei sottotitoli in [lingua di destinazione]. VINCOLI: ogni sottotitolo deve essere al massimo di 2 righe, riga ~42 caratteri, CPS non deve superare ~17. ACCORCIARE e naturalizzare preservandone il significato; non tradurre parola per parola. Conserva i codici temporali. Trascrizione + codici temporali: [...]

3) CPS/controllo leggibilità:

Calcola il CPS approssimativo in base alla durata e al conteggio dei caratteri per ciascuno dei seguenti sottotitoli. Segna quelli che superano i 17 e suggerisci un'alternativa più breve che ne preservi il significato. Sottotitoli (testo | durata secondi): [...]

4) Controllo del testo sullo schermo/contesto visivo:

Nella finestra di dialogo successiva contrassegnare i punti che possono fare riferimento all'immagine (testo sullo schermo, oggetto appuntito, segnale). Dire se sono necessari sottotitoli/spiegazioni aggiuntivi, partendo dal presupposto che lo spettatore non possa vedere l'immagine. Dialogo: [...]

Prompt debole / Prompt forte

Debole: "Traduci questi sottotitoli". (Nessuna lunghezza, CPS, regole di linea; l'output non si adatta allo schermo, illeggibile.)

Güçlü: "Traduci la trascrizione di questo dialogo in sottotitoli turchi. Ogni sottotitolo deve essere al massimo di 2 righe, 42 caratteri per riga; accorcialo preservando il significato quando necessario per la velocità di lettura. Fornisci la lingua parlata in turco naturale, ammorbidisci lo slang. Non toccare i codici temporali."

Differenza: un forte suggerimento fornisce i vincoli tecnici del sottotitolo (riga, carattere, CPS, tono); l'output si avvicina effettivamente ai sottotitoli utilizzabili.

Tabella comparativa dei formati AVT

formato

Cosa fa

Contributo dell'IA

punto critico umano

sottotitolo

Trascrive il discorso

ASR, traduzione, CPS

Adattamento, contesto visivo

doppiaggio

Voiceover nella lingua di destinazione

Bozza di traduzione

sincronizzazione labiale, recitazione

voce fuori campo

Leggi la traduzione sopra

Traduzione, tempistica

Flusso naturale, tono

Descrizione audio

Descrive l'immagine con il suono

bozza di testo

Interpretazione visiva (umana)

Errori comuni

  • Tradurre la trascrizione ASR senza verificarla. Gli errori relativi al nome/numero corretto vengono riportati al sottotitolo.
  • Tradurre parola per parola e spostarsi in CPS. Il pubblico non può leggere; è necessario effettuare l'adattamento.
  • Ignorare il contesto visivo. Il testo sullo schermo e gli oggetti puntati rimangono non tradotti.
  • Rendere inutile la divisione delle linee. Rovina la leggibilità.
  • Appiattimento del tono/registro. I dialetti e lo slang dei personaggi scompaiono.

Doppiaggio e sincronizzazione labiale

Mentre il vincolo del sottotitolaggio è la velocità di lettura, il vincolo del doppiaggio sono il tempo e le labbra. Esistono tre tipi distinti di sincronizzazione nella traduzione della voce fuori campo: sincronizzazione labiale - dove la traduzione corrisponde al movimento della bocca del personaggio, in particolare alle vocali aperte nei primi piani; isocronia: la linea di traduzione ha la stessa lunghezza della linea originale, né troppo corta né troppo lunga; sincronia dei gesti: corrispondere a ciò che viene detto con i movimenti della mano e del braccio del personaggio. Ecco perché spesso il traduttore di doppiaggio scrive una frase "orecchiabile" che ne conserva il significato ma con parole completamente diverse; La fedeltà delle parole qui è addirittura inferiore a quella dei sottotitoli.

L'IA può fornire una bozza grezza della traduzione e un avviso di tempo per il doppiaggio ("questa riga è più lunga del 40% rispetto all'originale, accorciatela"). Le nuove tecnologie possono addirittura clonare il suono e produrre doppiaggi automatici; ma la recitazione, l'emozione, la messa a punto del respiro del personaggio e la sincronizzazione labiale sono ancora compito del traduttore umano e del doppiatore. Il doppiaggio automatico fornisce uno schema; La decisione artistica e sincrona è umana. Inoltre, il consenso della persona la cui voce viene clonata è un'importante questione etica e legale.

In sintesi

La traduzione audiovisiva è l'arte di adattare il testo entro i limiti dell'occhio e dell'orecchio dello spettatore: i confini di linea/carattere/CPS nei sottotitoli, la sincronizzazione labiale nel doppiaggio, il contesto visivo è il fattore determinante in tutti questi casi. L'intelligenza artificiale accelera la trascrizione, la codifica temporale, la stesura della traduzione e il controllo CPS con ASR; Ma ASR si sbaglia sui nomi propri e sul rumore, non può vedere l'immagine e le decisioni sul tono adatto sono prese dall'uomo. Il sottotitolatore principale non traduce parola per parola; trova l'espressione più breve e naturale che ne conservi il significato.

Compito dell'applicazione

Scegli un breve video clip (2-3 minuti). Trascrivi con uno strumento ASR e confronta e correggi le aree rischiose dell'audio con un modello di "verifica della trascrizione". Quindi traduci con il vincolo CPS ~17 con il modello "traduzione sottotitoli" e accorcia i sottotitoli che superano il limite con il "controllo CPS". Se è presente un testo o un segno sullo schermo, applicare un "controllo del contesto visivo".

lista di controllo

  • [ ] Ho verificato la decrittografia ASR tramite voce per il nome/numero specifico.
  • [ ] Ho adattato i sottotitoli alle regole di linea/personaggio/CPS.
  • [ ] L'ho abbreviato e naturalizzato, non parola per parola, preservandone il significato.
  • [ ] Ho preso in considerazione il contesto visivo (testo sullo schermo, segno).
  • [ ] L'ho tradotto per preservare le differenze di tono e carattere.