이득:
- 자막의 기술적 규칙(선, 문자, CPS)을 적용하여 의미를 유지하면서 맞추는 능력
- ASR을 통한 전사 및 자동 타임코딩 속도를 높이면서 고유명 및 번호 오류를 음성으로 확인하는 기능
- 더빙 시 시각적 맥락, 톤 차이, 립싱크 등을 고려하여 인공지능의 한계를 관리하는 능력
영화, TV 시리즈, 기업 비디오 또는 온라인 강좌를 번역하는 것은 일반 텍스트를 번역하는 것과 근본적으로 다릅니다. 시간, 읽기 속도, 화면 이미지, 음성 및 등장인물의 입술 움직임도 제약 사항입니다. 이 단원에서는 시청각 번역(자막, 더빙, 보이스오버), 자막의 기술 규칙, AI 지원 전사 및 타임 코딩, 이 분야의 품질 문제에 대해 배웁니다. '텍스트를 번역하는 것'이 아닌 '청중의 눈과 귀에 맞는' 시청각 번역 전문가처럼 일하는 것이 목표다.
기본 개념
AVT(시청각 번역)는 오디오와 비디오가 포함된 콘텐츠를 번역하는 것입니다. 주요 형태로는 자막, 더빙, 오디오 설명 등이 있습니다. 자막은 음성을 화면에 글로 반영하는 것입니다. 더빙은 원래 음성을 대상 언어로 다시 더빙하는 것입니다. 음성 해설은 원본 사운드를 음소거하고 그 위에 번역을 읽어주는 것입니다(다큐멘터리에서 흔히 볼 수 있음).
자막에 대한 두 가지 중요한 기술 용어: CPS(초당 문자 수)는 시청자가 편안하게 읽을 수 있도록 자막 속도를 제한합니다. 일반적으로 허용되는 상한은 초당 약 17자입니다(어린이 콘텐츠의 경우 더 낮음). 타임코드는 자막이 화면에 나타나고 사라지는 시간을 나타내는 시작-종료 시간입니다(예: 00:01:23,400).
왜 어려운가요? 번역을 자막에 맞추는 것을 의미하기 때문입니다. 두 줄, 한 줄에 최대 42자, 화면 시간 최소 1초~6초, CPS 제한 등 의미와 어조를 유지하면서 이 모든 사항을 준수해야 합니다. 그렇기 때문에 자막 번역은 단어 대 단어 번역이 아닌 압축 및 재구성의 문제인 경우가 많습니다.
팁: 자막에 '모든 단어를 번역'하는 방식을 피하세요. 시청자는 이미지를 보고 읽는다. 자막이 너무 길면 읽을 수 없습니다. 의미를 보존하는 가장 짧고 자연스러운 표현을 찾는 것이 캡션 작성자의 진정한 숙달입니다.
시청각 번역에서 AI의 역할
AI는 이 영역에서 여러 단계의 속도를 크게 향상시킵니다.
- 전사: ASR(자동 음성 인식)을 사용하면 음성이 자동으로 전사됩니다. 이는 몇 분 안에 자막의 원본 소스를 추출합니다.
- 자동 시간 코딩: 도구는 대화를 세그먼트로 나누고 초안 시간 코드를 생성합니다.
- 번역 초안: 성적표 텍스트가 번역됩니다.
- CPS/길이 제어: AI는 어떤 자막이 읽기 속도를 초과하는지 표시하고 단축을 제안할 수 있습니다.
하지만 주의하세요. ASR은 소음, 억양, 중복되는 말, 고유명사 및 기술 용어에 오류가 있습니다. "오디오 설명"을 제공할 수 없습니다. 말하는 사람이 혼란스러울 수 있습니다. AI 번역은 이미지를 보지 않고, 화면에 보이는 물체가 언제 '그것'이라고 불리는지 알 수 없다. 그러므로 인간은 시각적 맥락과 해독의 정확성을 검증합니다.
주의: 가장 흔한 실수는 ASR 출력이 "디코딩"되었다고 생각하는 것입니다. ASR은 특히 고유명사, 숫자, 브랜드 이름 및 기술 용어에서 실수를 자주 범합니다. 잘못된 표기는 번역 및 자막으로 이어집니다. 오디오를 듣고 중요한 부분을 확인하십시오.
자막 형식 규칙
일반적인 규칙(플랫폼에 따라 다름):
- 한 줄에 최대 37-42자, 최대 2줄입니다.
- 지속 시간: ~1-6초; 매우 짧은 "플래시" 자막은 피하세요.
- CPS는 ~17(성인 콘텐츠)을 초과하지 않습니다.
- 의미가 있는 문장을 끊습니다(줄 끝에 "and" 또는 "but"를 남기지 마십시오).
- 가능하다면 장면 컷(샷 체인지)을 건너뛰지 마세요.
- 욕설, 노래, 화면 작성 등의 항목에 대해서는 플랫폼 규칙을 따르십시오.
세 개의 미니 케이스
사례 1 - ASR + 사후 편집 속도가 60% 향상되었습니다. 팀은 먼저 ASR을 사용하여 45분짜리 다큐멘터리를 복사하고 타임코드를 지정한 다음 번역하고 사후 편집했습니다. 전사 + 처음부터 코딩하는 시간에 비해 시간이 60% 단축되었습니다. 그러나 모든 고유명사와 숫자는 소리비교를 통해 수정되었습니다.
사례 2 - CPS 검사에 의해 가독성이 저장되었습니다. 자막이 있는 교육용 비디오의 첫 번째 번역은 정확했지만 CPS는 평균 24로 청중이 따라잡을 수 없었습니다. AI 기반 단축 작업을 통해 자막이 30% 단축되어 CPS가 16으로 줄었습니다. 의미가 보존되고 가독성이 향상되었습니다.
사례 3 — 시각적 컨텍스트 오류. ASR 기반 번역에서는 캐릭터가 화면의 표시를 가리키며 "읽어보세요"라고 말했습니다. AI가 '읽어라'라고 번역했지만 표지판에 적힌 글은 번역되지 않아 시청자는 무엇을 읽어야 할지 알 수 없었다. 캡션 작성자는 화면 캡션에 별도의 캡션을 추가했습니다. 이미지를 본 사람이 차이를 만들어냈습니다.
복사 가능한 템플릿 4개
1) 전사(ASR) 검증 목록:
아래는 동영상의 자동 전사입니다. 고유명사, 브랜드 이름, 숫자, 기술 용어, 모호하거나 불완전한 문장 등 전사에서 발생할 수 있는 오류를 표시하십시오. 이를 "음성으로 확인"이라고 기재하세요. 번역하지 마세요. 전사: [...]
2) 자막 번역(CPS/길이 제한):
다음 스크립트를 [대상 언어] 자막으로 번역하세요. 제약: 각 자막은 최대 2줄, 줄은 최대 42자, CPS는 최대 17을 초과할 수 없습니다. 의미를 보존하면서 단축하고 자연화합니다. 단어별로 번역하지 마세요. 시간 코드를 보존합니다. 전사 + 시간 코드: [...]
3) CPS/가독성 확인:
다음 각 자막의 길이와 문자 수를 기준으로 대략적인 CPS를 계산합니다. 17을 초과하는 항목을 표시하고 의미를 유지하는 더 짧은 대안을 제안합니다. 자막(텍스트 | 지속 시간 초): [...]
4) 화면 텍스트/시각적 맥락 확인:
다음 대화에서 이미지를 참조할 수 있는 위치(화면 텍스트, 뾰족한 물체, 기호)를 표시하세요. 시청자가 이미지를 볼 수 없다는 가정 하에 이에 대한 추가 자막/설명이 필요한지 여부를 말합니다. 대화: [...]
약한 프롬프트 / 강한 프롬프트
약함: "이 자막을 번역하세요." (길이, CPS, 선 규칙이 없습니다. 출력이 화면에 맞지 않아 읽을 수 없습니다.)
Güçlü: "이 대화 내용을 터키어 자막으로 번역하세요. 각 자막은 최대 2줄, 한 줄에 42자여야 합니다. 읽기 속도를 위해 필요한 경우 의미를 유지하면서 줄이세요. 음성 언어를 자연스러운 터키어로 제공하고 속어를 부드럽게 만드세요. 시간 코드를 건드리지 마세요."
차이점: 강한 프롬프트는 자막의 기술적 제약(라인, 문자, CPS, 톤)을 제공합니다. 출력은 실제로 사용 가능한 자막에 접근합니다.
AVT 형식 비교 차트
형식
무엇을
AI 기여
인간의 임계점
자막
연설 내용을 복사합니다.
ASR, 번역, CPS
핏, 시각적 맥락
더빙
대상 언어로 된 음성 해설
번역 초안
립싱크, 연기
음성 해설
위의 번역을 읽어보세요
번역, 타이밍
자연스러운 흐름, 톤
오디오 설명
소리와 함께 이미지를 설명합니다.
초안 텍스트
시각적 해석(인간)
일반적인 실수
- ASR 성적표를 확인하지 않고 번역합니다. 고유명/번호 오류는 자막으로 넘어갑니다.
- 단어별로 번역하고 CPS를 살펴봅니다. 청중은 읽을 수 없습니다. 핏이 만들어져야 합니다.
- 시각적 맥락을 무시합니다. 화면 텍스트와 뾰족한 개체는 번역되지 않은 상태로 유지됩니다.
- 라인 분할을 무의미하게 만듭니다. 가독성을 떨어뜨립니다.
- 톤/음역을 평탄화합니다. 캐릭터의 사투리와 속어가 사라집니다.
더빙과 립싱크
자막의 제약은 읽는 속도라면, 더빙의 제약은 시간과 입술입니다. 보이스오버 번역에는 세 가지 유형의 동기화가 있습니다. 립싱크 — 번역이 캐릭터의 입 움직임, 특히 클로즈업에서 열린 모음과 일치합니다. 등시성(isochrony) — 너무 짧지도 길지도 않은 원본 줄과 동일한 길이의 번역 줄입니다. 제스처 동기화 - 말하는 내용을 캐릭터의 손과 팔 움직임과 일치시킵니다. 그렇기 때문에 더빙 번역가는 의미는 유지하지만 완전히 다른 단어를 사용하는 "눈에 띄는" 대사를 자주 작성합니다. 여기서 단어 충실도는 자막보다 훨씬 낮습니다.
AI는 원본 번역 초안과 더빙 시간 경고("이 줄은 원본보다 40% 더 깁니다. 줄이세요")를 제공할 수 있습니다. 새로운 기술은 사운드를 복제하고 자동 더빙을 생성할 수도 있습니다. 하지만 연기, 감정, 캐릭터의 호흡과 립싱크의 미세 조정은 여전히 인간 번역가와 성우의 몫입니다. 자동 더빙은 개요를 제공합니다. 예술적이고 동시적인 결정은 인간의 몫입니다. 또한, 음성 복제자의 동의 여부는 중요한 윤리적, 법적 문제입니다.
요약하면
시청각 번역은 시청자의 눈과 귀의 제약 내에서 텍스트를 맞추는 기술입니다. 자막의 라인/문자/CPS 경계, 더빙의 립싱크, 시각적 맥락이 모두 결정적인 요소입니다. AI는 ASR을 통해 전사, 타임코딩, 번역 초안 작성 및 CPS 확인 속도를 높입니다. 그러나 ASR은 고유명사와 노이즈로 인해 이미지를 볼 수 없으며, 톤에 맞는 결정은 사람이 합니다. 마스터 자막러는 단어를 단어별로 번역하지 않습니다. 의미를 보존하는 가장 짧고 자연스러운 표현을 찾습니다.
응용과제
짧은(2~3분) 비디오 클립을 선택하세요. ASR 도구로 녹음하고 "녹음 확인" 템플릿을 사용하여 오디오와 함께 위험한 영역을 비교하고 수정합니다. 그런 다음 "자막 번역" 템플릿을 사용하여 CPS ~17 제약 조건으로 번역하고 "CPS 제어"를 사용하여 제한을 초과하는 자막을 줄입니다. 화면 텍스트나 기호가 있는 경우 "시각적 맥락 확인"을 적용합니다.
체크리스트
- [ ] 특정 이름/번호에 대한 ASR 복호화를 음성으로 확인했습니다.
- [ ] 줄/문자/CPS 규칙에 맞게 자막을 만들었습니다.
- [ ] 단어 하나하나가 아닌 의미를 살려서 줄여서 자연화했습니다.
- [ ] 시각적 맥락(화면 텍스트, 기호)을 고려했습니다.
- [ ] 어조와 성격의 차이를 보존하기 위해 번역했습니다.