Zyski:
- Możliwość dopasowania przy zachowaniu znaczenia poprzez zastosowanie zasad technicznych napisów (linia, znak, CPS)
- Możliwość głosowej weryfikacji błędów w prawidłowych nazwach i numerach przy jednoczesnym przyspieszeniu transkrypcji i automatycznym kodowaniu czasowym za pomocą ASR
- Umiejętność zarządzania ograniczeniami sztucznej inteligencji poprzez uwzględnienie kontekstu wizualnego, różnicy tonalnej i synchronizacji ruchu warg w dubbingu
Tłumaczenie filmu, serialu telewizyjnego, filmu korporacyjnego czy kursu online radykalnie różni się od tłumaczenia zwykłego tekstu: ograniczeniami są także czas, szybkość czytania, obraz na ekranie, głos i ruch warg bohaterów. W tym module nauczysz się tłumaczeń audiowizualnych (napisy, dubbing, lektor), technicznych zasad tworzenia napisów, transkrypcji i kodowania czasowego wspieranego przez sztuczną inteligencję oraz pułapek jakościowych w tej dziedzinie. Celem jest praca jak ekspert w dziedzinie tłumaczeń audiowizualnych, który „pasuje do oczu i uszu odbiorców”, a nie „tłumaczy tekst”.
Podstawowe pojęcia
Tłumaczenie audiowizualne (AVT) to tłumaczenie treści zawierających dźwięk i wideo; Główne formy to napisy, dubbing i audiodeskrypcja. Napisy to odzwierciedlenie wypowiedzi w formie pisemnej na ekranie. Dubbing to ponowne dubbingowanie oryginalnego głosu w języku docelowym. Voice-over ma miejsce wtedy, gdy oryginalny dźwięk jest wyciszony i nad nim czytane jest tłumaczenie (co jest powszechne w filmach dokumentalnych).
Dwa krytyczne terminy techniczne dotyczące napisów: CPS (liczba znaków na sekundę) ogranicza prędkość tworzenia napisów, aby widz mógł je wygodnie przeczytać; Ogólnie przyjęty górny limit wynosi około 17 znaków na sekundę (niższy w przypadku treści dla dzieci). Kod czasowy to czas rozpoczęcia i zakończenia wskazujący, kiedy napisy pojawią się i znikną na ekranie (np. 00:01:23,400).
Dlaczego jest to trudne? Ponieważ oznacza to dopasowanie tłumaczenia do napisów. Dwie linie, ~42 znaki w linii, co najmniej ~1 sekunda i maksymalnie ~6 sekund czasu wyświetlania oraz limit CPS — musisz przestrzegać tego wszystkiego, zachowując znaczenie i ton. Dlatego tłumaczenie napisów często polega na kompresji i ponownym sformułowaniu, a nie na tłumaczeniu słowo w słowo.
Wskazówka: Unikaj odruchu „tłumaczenia każdego słowa” w napisach. Widz zarówno ogląda, jak i czyta obraz; Nie można odczytać zbyt długich napisów. Znalezienie najkrótszego naturalnego wyrażenia, które zachowa znaczenie, jest prawdziwym mistrzostwem autora napisu.
Rola AI w tłumaczeniach audiowizualnych
AI znacząco przyspiesza kilka etapów w tym obszarze:
- Transkrypcja: Dzięki ASR (automatycznemu rozpoznawaniu mowy) głos jest transkrybowany automatycznie. To wyodrębnia surowe źródło napisów w ciągu kilku minut.
- Automatyczne kodowanie czasu: Narzędzia dzielą rozmowę na segmenty i tworzą wersję roboczą kodów czasu.
- Wersja robocza tłumaczenia: Tekst transkrypcji został przetłumaczony.
- Kontrola CPS/długości: AI może zaznaczyć, które napisy przekraczają prędkość czytania i zasugerować skrócenie.
Ale uwaga: ASR myli się co do hałasu, akcentu, nakładającej się mowy, nazw własnych i terminów technicznych; nie można udostępnić „audiodeskrypcji”; Kto mówi, może się zdezorientować. Tłumaczenie AI nie widzi obrazu — nie może wiedzieć, kiedy obiekt pokazany na ekranie nazywa się „tam”. Człowiek weryfikuje zatem kontekst wizualny i dokładność rozszyfrowania.
Uwaga: najczęstszym błędem jest myślenie, że wyjście ASR jest „dekodowane”. ASR często popełnia błędy, zwłaszcza w nazwach własnych, numerach, nazwach marek i terminach technicznych; niepoprawna transkrypcja wpływa na tłumaczenie i napisy. Pamiętaj, aby sprawdzić krytyczne obszary, słuchając dźwięku.
Zasady formatu napisów
Typowe zasady (różnią się w zależności od platformy):
- ~37-42 znaków w wierszu, maksymalnie 2 wiersze.
- Czas trwania: ~1-6 sekund; Unikaj bardzo krótkich napisów „flash”.
- CPS nie przekracza ~17 (treści dla dorosłych).
- Przerwij zdanie tam, gdzie ma to sens (nie zostawiaj „i” ani „ale” na końcu wiersza).
- Jeśli to możliwe, nie pomijaj wycięcia sceny (zmiany ujęcia).
- Postępuj zgodnie z zasadami platformy dotyczącymi takich elementów jak przekleństwa, piosenki, pisanie scenariuszy.
trzy mini etui
Przypadek 1 — ASR + postedycja przyspieszona o 60%. Zespół najpierw dokonał transkrypcji i zakodowania czasowego 45-minutowego filmu dokumentalnego za pomocą ASR, a następnie przetłumaczył go i zredagował. Czas skrócony o 60% w porównaniu z transkrypcją + kodowaniem czasowym od zera. Ale wszystkie nazwy własne i liczby zostały poprawione przez porównanie dźwiękowe.
Przypadek 2 – CPS sprawdza zapisaną czytelność. Pierwsze tłumaczenie filmu instruktażowego z napisami było dokładne, ale CPS wyniósł średnio 24 – publiczność nie nadążała. Runda skracania oparta na sztucznej inteligencji skróciła napisy o 30%, zmniejszając CPS do 16; znaczenie zostało zachowane, przyszła czytelność.
Przypadek 3 — Błąd kontekstu wizualnego. W tłumaczeniu opartym na ASR postać wskazała znak na ekranie i powiedziała „przeczytaj to”; Sztuczna inteligencja przetłumaczyła to jako „przeczytaj”, ale tekst na znaku nie został przetłumaczony, więc widz nie mógł zobaczyć, co czytać. Autor napisów dodał oddzielny podpis do podpisu ekranowego; Osoba, która widziała obraz, nadrobiła różnicę.
Cztery szablony do kopiowania
1) Lista weryfikacyjna transkrypcji (ASR):
Poniżej znajduje się automatyczna transkrypcja filmu. Zaznacz możliwe błędy w transkrypcji: nazwy własne, marki, liczby, terminy techniczne, zdania niejednoznaczne/niekompletne. Wymień je jako „weryfikuj głosowo”. Nie tłumacz. Transkrypcja: [...]
2) Tłumaczenie napisów (CPS/ograniczona długość):
Przetłumacz poniższą transkrypcję na napisy [język docelowy]. OGRANICZENIE: każdy podtytuł musi mieć maksymalnie 2 linie, linia ~42 znaków, CPS nie może przekraczać ~17. SKRÓĆ i naturalizuj, zachowując znaczenie; nie tłumacz słowo po słowie. Zachowaj kody czasowe. Transkrypcja + kody czasowe: [...]
3) Kontrola CPS/czytelności:
Oblicz przybliżony CPS na podstawie czasu trwania i liczby znaków dla każdego z poniższych napisów. Zaznacz te, które przekraczają 17 i zaproponuj krótszą alternatywę, która zachowuje znaczenie. Napisy (tekst | czas trwania sekundy): [...]
4) Sprawdzenie tekstu ekranowego/kontekstu wizualnego:
W poniższym dialogu zaznacz miejsca, które mogą nawiązywać do obrazu (tekst ekranowy, zaostrzony przedmiot, znak). Powiedz, czy potrzebne są do nich dodatkowe napisy/objaśnienia, zakładając, że widz nie widzi obrazu. Dialog: [...]
Słaba zachęta/silna zachęta
Słabe: „Przetłumacz te napisy”. (Brak długości, CPS, zasad linii; wydruk nie mieści się na ekranie, jest nieczytelny.)
Güçlü: „Przetłumacz transkrypcję tego dialogu na napisy tureckie. Każdy podtytuł musi mieć maksymalnie 2 linie po 42 znaki w linii; skróć go, zachowując znaczenie, jeśli jest to konieczne dla szybkości czytania. Przekaż język mówiony naturalnemu tureckiemu, złagodź slang. Nie dotykaj kodów czasowych.
Różnica: silny zachęta zapewnia ograniczenia techniczne napisów (linia, znak, CPS, ton); wynik faktycznie zbliża się do użytecznych napisów.
Tabela porównawcza formatów AVT
formatować
Co robi
Wkład AI
ludzki punkt krytyczny
podtytuł
Transkrypcja przemówienia
ASR, tłumaczenia, CPS
Dopasowanie, kontekst wizualny
kopiowanie
Lektor w języku docelowym
Projekt tłumaczenia
synchronizacja warg, aktorstwo
głos
Przeczytaj tłumaczenie powyżej
Tłumaczenie, czas
Naturalny przepływ, ton
Opis dźwiękowy
Opisuje obraz dźwiękiem
projekt tekstu
Interpretacja wizualna (ludzka)
Typowe błędy
- Tłumaczenie transkryptu ASR bez jego weryfikacji. Błędy w nazwie właściwej/numerze przenoszone są do napisów.
- Tłumaczenie słowo po słowie i poruszanie się po CPS. Publiczność nie potrafi czytać; należy dopasować.
- Ignorowanie kontekstu wizualnego. Tekst ekranowy i wskazane obiekty pozostają nieprzetłumaczone.
- Sprawienie, że dzielenie linii stanie się bezcelowe. Psuje to czytelność.
- Spłaszczenie tonu/rejestru. Znikają dialekty i slang bohaterów.
Dubbing i synchronizacja ruchu warg
Podczas gdy ograniczeniem w przypadku napisów jest szybkość czytania, w przypadku dubbingu ograniczeniem jest czas i usta. Istnieją trzy różne typy synchronizacji w tłumaczeniu lektora: synchronizacja warg — gdy tłumaczenie dopasowuje się do ruchu ust postaci, zwłaszcza otwartych samogłosek w zbliżeniach; izochrona — linia tłumaczenia ma taką samą długość jak linia pierwotna, nie jest ani za krótka, ani za długa; synchronizacja gestów — dopasowanie wypowiedzi do ruchów dłoni i ramion postaci. Dlatego tłumacz dubbingowy często pisze „chwytliwy” wers, który zachowuje znaczenie, ale przy użyciu zupełnie innych słów; Wierność słowa jest tutaj nawet mniejsza niż podtytułu.
Sztuczna inteligencja może dostarczyć surowy projekt tłumaczenia i ostrzeżenie o czasie dubbingu („ta linia jest o 40% dłuższa od oryginału, skróć ją”). Nowe technologie mogą nawet klonować dźwięk i tworzyć automatyczny dubbing; ale gra aktorska, emocje, dostrojenie oddechu postaci i synchronizacja ruchu warg to wciąż zadanie ludzkiego tłumacza i aktora głosowego. Automatyczne kopiowanie zapewnia zarys; Decyzja artystyczna i synchroniczna należy do człowieka. Dodatkowo zgoda osoby, której głos jest klonowany, jest ważną kwestią etyczną i prawną.
Podsumowując
Tłumaczenie audiowizualne to sztuka dopasowania tekstu do ograniczeń oka i ucha widza: granice linii/znaku/CPS w napisach, synchronizacja ruchu warg w dubbingu, a kontekst wizualny jest czynnikiem decydującym w każdym z nich. Sztuczna inteligencja przyspiesza transkrypcję, kodowanie czasowe, sporządzanie tłumaczeń i sprawdzanie CPS za pomocą ASR; Ale ASR myli się w nazwach własnych i hałasie, nie widzi obrazu, a decyzje dotyczące dopasowania tonu podejmuje człowiek. Główny napis nie tłumaczy słowo w słowo; znajduje najkrótsze, najbardziej naturalne wyrażenie, które zachowuje znaczenie.
Zadanie aplikacji
Wybierz krótki (2-3 minutowy) klip wideo. Dokonuj transkrypcji za pomocą narzędzia ASR oraz porównuj i poprawiaj ryzykowne obszary dźwięku za pomocą szablonu „weryfikacji transkrypcji”. Następnie przetłumacz z ograniczeniem CPS ~17 za pomocą szablonu „tłumaczenie napisów” i skróć napisy przekraczające limit za pomocą „kontroli CPS”. Jeśli na ekranie znajduje się tekst lub znak, zastosuj „sprawdzenie kontekstu wizualnego”.
lista kontrolna
- [ ] Zweryfikowałem głosowo deszyfrację ASR dla konkretnej nazwy/numeru.
- [ ] Dostosowałem napisy do zasad linii/znaku/CPS.
- [ ] Skróciłem i naturalizowałem, a nie słowo w słowo, zachowując znaczenie.
- [ ] Wziąłem pod uwagę kontekst wizualny (tekst na ekranie, znak).
- [ ] Przetłumaczyłem to, aby zachować różnice w tonie i charakterze.