Jednostka 7 / 11

Napisy, dubbing i tłumaczenia audiowizualne

Zyski:

  • Możliwość dopasowania przy zachowaniu znaczenia poprzez zastosowanie zasad technicznych napisów (linia, znak, CPS)
  • Możliwość głosowej weryfikacji błędów w prawidłowych nazwach i numerach przy jednoczesnym przyspieszeniu transkrypcji i automatycznym kodowaniu czasowym za pomocą ASR
  • Umiejętność zarządzania ograniczeniami sztucznej inteligencji poprzez uwzględnienie kontekstu wizualnego, różnicy tonalnej i synchronizacji ruchu warg w dubbingu

Tłumaczenie filmu, serialu telewizyjnego, filmu korporacyjnego czy kursu online radykalnie różni się od tłumaczenia zwykłego tekstu: ograniczeniami są także czas, szybkość czytania, obraz na ekranie, głos i ruch warg bohaterów. W tym module nauczysz się tłumaczeń audiowizualnych (napisy, dubbing, lektor), technicznych zasad tworzenia napisów, transkrypcji i kodowania czasowego wspieranego przez sztuczną inteligencję oraz pułapek jakościowych w tej dziedzinie. Celem jest praca jak ekspert w dziedzinie tłumaczeń audiowizualnych, który „pasuje do oczu i uszu odbiorców”, a nie „tłumaczy tekst”.

Podstawowe pojęcia

Tłumaczenie audiowizualne (AVT) to tłumaczenie treści zawierających dźwięk i wideo; Główne formy to napisy, dubbing i audiodeskrypcja. Napisy to odzwierciedlenie wypowiedzi w formie pisemnej na ekranie. Dubbing to ponowne dubbingowanie oryginalnego głosu w języku docelowym. Voice-over ma miejsce wtedy, gdy oryginalny dźwięk jest wyciszony i nad nim czytane jest tłumaczenie (co jest powszechne w filmach dokumentalnych).

Dwa krytyczne terminy techniczne dotyczące napisów: CPS (liczba znaków na sekundę) ogranicza prędkość tworzenia napisów, aby widz mógł je wygodnie przeczytać; Ogólnie przyjęty górny limit wynosi około 17 znaków na sekundę (niższy w przypadku treści dla dzieci). Kod czasowy to czas rozpoczęcia i zakończenia wskazujący, kiedy napisy pojawią się i znikną na ekranie (np. 00:01:23,400).

Dlaczego jest to trudne? Ponieważ oznacza to dopasowanie tłumaczenia do napisów. Dwie linie, ~42 znaki w linii, co najmniej ~1 sekunda i maksymalnie ~6 sekund czasu wyświetlania oraz limit CPS — musisz przestrzegać tego wszystkiego, zachowując znaczenie i ton. Dlatego tłumaczenie napisów często polega na kompresji i ponownym sformułowaniu, a nie na tłumaczeniu słowo w słowo.

Wskazówka: Unikaj odruchu „tłumaczenia każdego słowa” w napisach. Widz zarówno ogląda, jak i czyta obraz; Nie można odczytać zbyt długich napisów. Znalezienie najkrótszego naturalnego wyrażenia, które zachowa znaczenie, jest prawdziwym mistrzostwem autora napisu.

Rola AI w tłumaczeniach audiowizualnych

AI znacząco przyspiesza kilka etapów w tym obszarze:

  1. Transkrypcja: Dzięki ASR (automatycznemu rozpoznawaniu mowy) głos jest transkrybowany automatycznie. To wyodrębnia surowe źródło napisów w ciągu kilku minut.
  2. Automatyczne kodowanie czasu: Narzędzia dzielą rozmowę na segmenty i tworzą wersję roboczą kodów czasu.
  3. Wersja robocza tłumaczenia: Tekst transkrypcji został przetłumaczony.
  4. Kontrola CPS/długości: AI może zaznaczyć, które napisy przekraczają prędkość czytania i zasugerować skrócenie.

Ale uwaga: ASR myli się co do hałasu, akcentu, nakładającej się mowy, nazw własnych i terminów technicznych; nie można udostępnić „audiodeskrypcji”; Kto mówi, może się zdezorientować. Tłumaczenie AI nie widzi obrazu — nie może wiedzieć, kiedy obiekt pokazany na ekranie nazywa się „tam”. Człowiek weryfikuje zatem kontekst wizualny i dokładność rozszyfrowania.

Uwaga: najczęstszym błędem jest myślenie, że wyjście ASR jest „dekodowane”. ASR często popełnia błędy, zwłaszcza w nazwach własnych, numerach, nazwach marek i terminach technicznych; niepoprawna transkrypcja wpływa na tłumaczenie i napisy. Pamiętaj, aby sprawdzić krytyczne obszary, słuchając dźwięku.

Zasady formatu napisów

Typowe zasady (różnią się w zależności od platformy):

  • ~37-42 znaków w wierszu, maksymalnie 2 wiersze.
  • Czas trwania: ~1-6 sekund; Unikaj bardzo krótkich napisów „flash”.
  • CPS nie przekracza ~17 (treści dla dorosłych).
  • Przerwij zdanie tam, gdzie ma to sens (nie zostawiaj „i” ani „ale” na końcu wiersza).
  • Jeśli to możliwe, nie pomijaj wycięcia sceny (zmiany ujęcia).
  • Postępuj zgodnie z zasadami platformy dotyczącymi takich elementów jak przekleństwa, piosenki, pisanie scenariuszy.

trzy mini etui

Przypadek 1 — ASR + postedycja przyspieszona o 60%. Zespół najpierw dokonał transkrypcji i zakodowania czasowego 45-minutowego filmu dokumentalnego za pomocą ASR, a następnie przetłumaczył go i zredagował. Czas skrócony o 60% w porównaniu z transkrypcją + kodowaniem czasowym od zera. Ale wszystkie nazwy własne i liczby zostały poprawione przez porównanie dźwiękowe.

Przypadek 2 – CPS sprawdza zapisaną czytelność. Pierwsze tłumaczenie filmu instruktażowego z napisami było dokładne, ale CPS wyniósł średnio 24 – publiczność nie nadążała. Runda skracania oparta na sztucznej inteligencji skróciła napisy o 30%, zmniejszając CPS do 16; znaczenie zostało zachowane, przyszła czytelność.

Przypadek 3 — Błąd kontekstu wizualnego. W tłumaczeniu opartym na ASR postać wskazała znak na ekranie i powiedziała „przeczytaj to”; Sztuczna inteligencja przetłumaczyła to jako „przeczytaj”, ale tekst na znaku nie został przetłumaczony, więc widz nie mógł zobaczyć, co czytać. Autor napisów dodał oddzielny podpis do podpisu ekranowego; Osoba, która widziała obraz, nadrobiła różnicę.

Cztery szablony do kopiowania

1) Lista weryfikacyjna transkrypcji (ASR):

Poniżej znajduje się automatyczna transkrypcja filmu. Zaznacz możliwe błędy w transkrypcji: nazwy własne, marki, liczby, terminy techniczne, zdania niejednoznaczne/niekompletne. Wymień je jako „weryfikuj głosowo”. Nie tłumacz. Transkrypcja: [...]

2) Tłumaczenie napisów (CPS/ograniczona długość):

Przetłumacz poniższą transkrypcję na napisy [język docelowy]. OGRANICZENIE: każdy podtytuł musi mieć maksymalnie 2 linie, linia ~42 znaków, CPS nie może przekraczać ~17. SKRÓĆ i naturalizuj, zachowując znaczenie; nie tłumacz słowo po słowie. Zachowaj kody czasowe. Transkrypcja + kody czasowe: [...]

3) Kontrola CPS/czytelności:

Oblicz przybliżony CPS na podstawie czasu trwania i liczby znaków dla każdego z poniższych napisów. Zaznacz te, które przekraczają 17 i zaproponuj krótszą alternatywę, która zachowuje znaczenie. Napisy (tekst | czas trwania sekundy): [...]

4) Sprawdzenie tekstu ekranowego/kontekstu wizualnego:

W poniższym dialogu zaznacz miejsca, które mogą nawiązywać do obrazu (tekst ekranowy, zaostrzony przedmiot, znak). Powiedz, czy potrzebne są do nich dodatkowe napisy/objaśnienia, zakładając, że widz nie widzi obrazu. Dialog: [...]

Słaba zachęta/silna zachęta

Słabe: „Przetłumacz te napisy”. (Brak długości, CPS, zasad linii; wydruk nie mieści się na ekranie, jest nieczytelny.)

Güçlü: „Przetłumacz transkrypcję tego dialogu na napisy tureckie. Każdy podtytuł musi mieć maksymalnie 2 linie po 42 znaki w linii; skróć go, zachowując znaczenie, jeśli jest to konieczne dla szybkości czytania. Przekaż język mówiony naturalnemu tureckiemu, złagodź slang. Nie dotykaj kodów czasowych.

Różnica: silny zachęta zapewnia ograniczenia techniczne napisów (linia, znak, CPS, ton); wynik faktycznie zbliża się do użytecznych napisów.

Tabela porównawcza formatów AVT

formatować

Co robi

Wkład AI

ludzki punkt krytyczny

podtytuł

Transkrypcja przemówienia

ASR, tłumaczenia, CPS

Dopasowanie, kontekst wizualny

kopiowanie

Lektor w języku docelowym

Projekt tłumaczenia

synchronizacja warg, aktorstwo

głos

Przeczytaj tłumaczenie powyżej

Tłumaczenie, czas

Naturalny przepływ, ton

Opis dźwiękowy

Opisuje obraz dźwiękiem

projekt tekstu

Interpretacja wizualna (ludzka)

Typowe błędy

  • Tłumaczenie transkryptu ASR bez jego weryfikacji. Błędy w nazwie właściwej/numerze przenoszone są do napisów.
  • Tłumaczenie słowo po słowie i poruszanie się po CPS. Publiczność nie potrafi czytać; należy dopasować.
  • Ignorowanie kontekstu wizualnego. Tekst ekranowy i wskazane obiekty pozostają nieprzetłumaczone.
  • Sprawienie, że dzielenie linii stanie się bezcelowe. Psuje to czytelność.
  • Spłaszczenie tonu/rejestru. Znikają dialekty i slang bohaterów.

Dubbing i synchronizacja ruchu warg

Podczas gdy ograniczeniem w przypadku napisów jest szybkość czytania, w przypadku dubbingu ograniczeniem jest czas i usta. Istnieją trzy różne typy synchronizacji w tłumaczeniu lektora: synchronizacja warg — gdy tłumaczenie dopasowuje się do ruchu ust postaci, zwłaszcza otwartych samogłosek w zbliżeniach; izochrona — linia tłumaczenia ma taką samą długość jak linia pierwotna, nie jest ani za krótka, ani za długa; synchronizacja gestów — dopasowanie wypowiedzi do ruchów dłoni i ramion postaci. Dlatego tłumacz dubbingowy często pisze „chwytliwy” wers, który zachowuje znaczenie, ale przy użyciu zupełnie innych słów; Wierność słowa jest tutaj nawet mniejsza niż podtytułu.

Sztuczna inteligencja może dostarczyć surowy projekt tłumaczenia i ostrzeżenie o czasie dubbingu („ta linia jest o 40% dłuższa od oryginału, skróć ją”). Nowe technologie mogą nawet klonować dźwięk i tworzyć automatyczny dubbing; ale gra aktorska, emocje, dostrojenie oddechu postaci i synchronizacja ruchu warg to wciąż zadanie ludzkiego tłumacza i aktora głosowego. Automatyczne kopiowanie zapewnia zarys; Decyzja artystyczna i synchroniczna należy do człowieka. Dodatkowo zgoda osoby, której głos jest klonowany, jest ważną kwestią etyczną i prawną.

Podsumowując

Tłumaczenie audiowizualne to sztuka dopasowania tekstu do ograniczeń oka i ucha widza: granice linii/znaku/CPS w napisach, synchronizacja ruchu warg w dubbingu, a kontekst wizualny jest czynnikiem decydującym w każdym z nich. Sztuczna inteligencja przyspiesza transkrypcję, kodowanie czasowe, sporządzanie tłumaczeń i sprawdzanie CPS za pomocą ASR; Ale ASR myli się w nazwach własnych i hałasie, nie widzi obrazu, a decyzje dotyczące dopasowania tonu podejmuje człowiek. Główny napis nie tłumaczy słowo w słowo; znajduje najkrótsze, najbardziej naturalne wyrażenie, które zachowuje znaczenie.

Zadanie aplikacji

Wybierz krótki (2-3 minutowy) klip wideo. Dokonuj transkrypcji za pomocą narzędzia ASR oraz porównuj i poprawiaj ryzykowne obszary dźwięku za pomocą szablonu „weryfikacji transkrypcji”. Następnie przetłumacz z ograniczeniem CPS ~17 za pomocą szablonu „tłumaczenie napisów” i skróć napisy przekraczające limit za pomocą „kontroli CPS”. Jeśli na ekranie znajduje się tekst lub znak, zastosuj „sprawdzenie kontekstu wizualnego”.

lista kontrolna

  • [ ] Zweryfikowałem głosowo deszyfrację ASR dla konkretnej nazwy/numeru.
  • [ ] Dostosowałem napisy do zasad linii/znaku/CPS.
  • [ ] Skróciłem i naturalizowałem, a nie słowo w słowo, zachowując znaczenie.
  • [ ] Wziąłem pod uwagę kontekst wizualny (tekst na ekranie, znak).
  • [ ] Przetłumaczyłem to, aby zachować różnice w tonie i charakterze.