단위 4 / 11

전사 및 자막: 음성을 텍스트로 변환 및 다국어 자막

이득:

  • 자동 전사 및 화자 분리의 개념을 이해하고 원시 녹음을 타임코드 텍스트로 변환하는 능력
  • 자막 형식(SRT/VTT), 읽기 속도 및 줄 규칙을 이해하고 다국어 자막 초안을 제작 및 편집할 수 있는 능력
  • 출판 전 자동 원고의 용어, 고유명사, 구두점 오류, 번역 오류를 확인하는 것은 편집자의 책임임을 이해합니다.

포스트 프로덕션에서 가장 지루하고 시간이 많이 걸리는 작업은 전통적으로 전사였습니다. 편집자는 몇 시간 동안 인터뷰 영상을 끝없이 듣고 각 문장을 손으로 입력했습니다. 1시간짜리 녹음을 복사하는 데는 쉽게 4~5시간이 걸립니다. 인공 지능은 이 비즈니스를 근본적으로 변화시켰습니다. 오늘날에는 한 시간 길이의 녹음을 몇 분 만에 타임코드 텍스트로 바꿀 수 있습니다. 이를 통해 편집 파이프라인 속도가 빨라지고 접근성(청각 장애가 있는 시청자를 위한 자막 및 무음 시청)이 가능해집니다. 그러나 자동 출력은 원시 형식으로 출판하는 데 결코 적합하지 않습니다. 이번 단원에서 우리는 힘과 함정을 모두 보게 될 것입니다.

용어부터 시작하겠습니다. 전사는 말을 글로 옮기는 것입니다. ASR(자동 음성 인식)은 음성을 텍스트로 변환하는 기술입니다. 타임코드는 비디오에서 텍스트가 몇 초에 해당하는지를 나타내는 기호입니다. 화자 분할은 "누가 말했는지"를 구별하고 텍스트를 화자로 나누는 것입니다. 자막(자막/캡션)은 화면에 표시되는 타임코드 텍스트입니다. SRT 및 VTT는 가장 일반적인 자막 파일 형식입니다. 여기에는 각 줄의 순서, 시작-종료 시간 및 텍스트가 포함됩니다. 읽기 속도(CPS: 초당 문자 수)는 시청자가 자막을 편안하게 읽을 수 있도록 화면에 줄이 얼마나 오래 남아 있어야 하는지를 결정합니다.

자동 전사의 위력과 한계

AI 전사는 적절한 터키어로 녹음된 명확한 단일 화자 음성을 매우 높은 정확도로 전사합니다. 그러나 다음과 같은 상황에서는 실수가 발생하며 이를 알면 고유명사(사람 이름, 브랜드, 장소의 철자가 종종 틀리는 경우가 있음), 기술 용어 및 약어, 유사한 소리가 나는 단어(“kar/kar”, “still/still”), 중복되는 음성(동시에 두 사람이 있음), 배경 소음 및 음악, 사투리/액센트 차이 및 구두점(질문 또는 문장 끝) 등을 대상으로 검증할 수 있습니다. 또한 모델은 시끄러운 순간에 한 번도 말한 적이 없는 단어를 "듣고" 전사할 수 있습니다. 이것이 전사의 환각입니다.

다음 표에는 자동 전사의 강한 조건과 약한 조건이 요약되어 있습니다.

상태

정확성

편집자의 초점

단일 스피커, 선명한 사운드, 조용한 환경

매우 높다

고유명사, 구두점

다중 스피커 패널

중간

화자 분리, 중첩 음성

시끄러운/야외 녹음

낮음-중간

꾸며낸 말, 점프

기술/전문 용어 콘텐츠

중간

용어 및 약어 표기

악센트가 있는 연설

변수

단어 오류, 의미

자막 형식 및 가독성 규칙

좋은 자막은 단순히 "올바른 텍스트"가 아닙니다. 읽을 수 있어야 합니다. 국제 관행에는 몇 가지 경험 법칙이 있습니다. 자막 한 줄은 일반적으로 두 줄을 넘지 않아야 합니다. 각 줄은 적당한 길이(약 37-42자)로 유지되어야 합니다. 자막은 읽을 수 있을 만큼 오랫동안 화면에 표시되어야 합니다(보통 1~6초). 읽기 속도는 너무 높지 않아야 합니다(대부분의 가이드에서는 최대 15-17자/초를 제한으로 간주합니다). AI 도구가 자막을 자동으로 분할하지만 이러한 분할로 인해 문장이 잘못된 위치("and"로 끝나는 줄, 의미를 나누는 줄바꿈)가 잘리는 경우가 있습니다. 편집자의 임무는 텍스트를 정확하고 유창하게 만드는 것입니다.

귀하의 역할: 자막 편집 보조. 아래는 자동 대본입니다. 작업:1) SRT 논리에 따라 텍스트를 자막 블록으로 나눕니다.2) 각 블록은 최대 2줄이어야 하며 각 줄은 최대 40자를 초과할 수 없습니다.3) 의미 있는 위치에서 문장을 나눕니다. "and", "but", "that"으로 끝나는 줄입니다.4) 고유명사와 용어를 [CHECK] 태그로 표시하면 수동으로 확인할 수 있습니다.5) 텍스트를 변경하지 말고 분할하여 표시하면 됩니다.

이 프롬프트의 "[제어] 태그" 아이디어는 가치가 있습니다. AI가 확실하지 않거나 위험한 영역(고유 이름, 용어)을 표시하면 편집자의 시선이 올바른 위치로 향하고 맹목적인 신뢰를 방지할 수 있습니다.

다국어 자막 및 번역

여러 언어로 비디오를 열면 시청자가 늘어납니다. AI는 대본을 받아 대상 언어로 번역하고 자막 파일을 제작할 수 있습니다. 이는 강력한 기능이지만 가장 취약합니다. 기계 번역은 관용구, 문화적 참조, 유머와 말장난, 용어 및 맥락을 잘못 표현할 수 있습니다. "고양이와 개 비가 내린다"라는 문장을 단어 그대로 번역하면 재앙이 됩니다. 자막 번역에도 공간 제약이 있습니다. 대상 언어의 문장이 길어지고 읽기 속도를 초과할 수 있습니다. 그렇기 때문에 다국어 자막에서는 대상 언어를 아는 사람이 번역을 확인하도록 하는 것이 필수적입니다. 특히 브랜딩, 법률 또는 건강과 같은 민감한 콘텐츠의 경우 잘못된 번역은 심각한 결과를 초래할 수 있습니다.

다음 터키어 자막 블록을 영어로 번역하세요. 규칙: - 관용구와 농담을 그대로 전달하지 않고 의미를 보존합니다. - 브랜드명, 제품명은 그대로 두고, 번역하지 마세요. - 각 블록이 읽기 속도를 유지하도록 하세요. 필요한 경우 단축하되 의미를 왜곡하지 마십시오. - 잘 모르는 문화적 언급이나 용어는 [번역가 노트]로 명시하세요.

세 개의 미니 케이스

사례 1 — 가속 라인. 다큐멘터리 제작진은 12시간 분량의 인터뷰 아카이브를 직접 복사하는 데 3주를 보냈습니다. 자동 전사를 사용하면 원시 텍스트가 하루 만에 출력되었습니다. 팀은 텍스트(단어 단위)를 통해 검색하여 원하는 순간을 몇 초 만에 찾았습니다. 그런 다음 사용할 40분 분량의 에피소드만 꼼꼼하게 편집하고 자막을 달았습니다. 3주가 4일이 되었습니다. 검증 노력은 사용된 섹션에 집중되었습니다.

사례 2 — 지어낸 단어. 한 뉴스 채널은 시끌벅적한 거리 인터뷰를 자동 자막으로 확인도 없이 방송했다. 모델은 배경에서 윙윙거리는 소리를 들었고, 캡션은 인터뷰 대상자가 말하지 않은 단어를 전가했습니다. 소셜 미디어에서 반응이 있었고 정정 내용이 게시되었습니다. 교훈: 시끄러운 녹음에서는 자동 자막을 원본 오디오와 비교해야 합니다.

사례 3 — 번역 재앙. 한 브랜드가 홍보 영상의 영어 자막을 기계 번역을 통해 통제 없이 게시했습니다. 터키어 관용어("눈을 떼지 말라")를 한 단어씩 번역했을 때, 영국 청중에게는 의미가 없고 심지어 재미있어 보이기까지 했으며, 브랜드의 심각성은 손상되었습니다. 올바른 방법: 대상 언어를 아는 사람에게 번역을 검증받는 것입니다.

약한 프롬프트 / 강한 프롬프트

약한 프롬프트:

이 영상에 자막을 넣고 영어로 번역하세요.

서식도 없고, 가독성 규칙도 없고, 유효성 검사 표시도 없습니다. 결과는 조악하고 위험할 것입니다.

강력한 프롬프트:

귀하의 역할: 이중 언어 자막 편집자.입력: 터키어 시간 코드 사본.작업:1) 터키어 자막을 2줄/최대 40자/올바른 구분 규칙으로 편집합니다.2) 적절한 이름과 용어를 [컨트롤]로 표시합니다.3) 영어 번역을 별도로 제작합니다. 문구를 문자 그대로 옮기고 브랜드 이름은 그대로 유지합니다.4) 읽기 속도를 초과하는 블록은 [LONG]으로 표시합니다.5) 단어를 만들어 내지 마십시오. 부정확한 소리 [UNINDICATED]를 씁니다.

일반적인 실수

  • 통제 없이 자동 성적표를 게시합니다. 고유명사, 용어, 구두점 및 꾸며낸 단어에는 오류가 남아 있습니다.
  • 라인 분할이 잘못되었습니다. "and/but/ki"로 끝나는 줄은 읽기가 어렵습니다.
  • 읽기 속도를 초과합니다. 화면에서 너무 짧은 긴 자막은 읽을 수 없습니다.
  • 기계 번역을 확인하지 않습니다. 관용구, 농담 또는 용어가 잘못되면 브랜드에 타격이 가해집니다.
  • 스피커 구별을 우회합니다. 패널에서 "누가 무엇을 말했는지"에 대한 혼동이 있으면 자막이 오해의 소지가 있습니다.
팁: 대본을 편집하는 동안 1.25~1.5 속도로 비디오를 시청하고 자막과 동기화되는지 확인하세요. 이렇게 하면 타임코드 드리프트와 구성/누락된 단어를 모두 빠르게 포착할 수 있습니다.
주의: 의료, 법률, 금융과 같은 분야에서는 잘못 표기된 단일 단어(예: 복용량, 성분 번호)가 심각한 결과를 초래할 수 있습니다. 본 내용에서는 각 번호와 용어를 별도로 검증해야 합니다.

요약하면

자동화된 전사 및 자막은 후반 작업에서 가장 큰 시간을 절약해 주고 접근성을 높여줍니다. AI는 전사 시간을 몇 분으로 단축하고 텍스트를 통한 검색을 가능하게 합니다. 그러나 출력은 원시 형식으로 출판하기에 적합하지 않습니다. 고유명사, 용어, 구두점, 꾸며낸 단어 및 잘못된 줄 바꿈을 수정해야 합니다. 가독성 규칙(줄 길이, 지속 시간, 읽기 속도)은 텍스트를 보는 사람에게 유창하게 만듭니다. 다국어 자막의 경우, 기계 번역은 대상 언어를 아는 사람의 검증을 받아야 합니다. AI가 쏟아내고 제안한다. 정확성, 가독성 및 의미는 편집자의 책임입니다.

응용과제

짧은 대화(본인의 목소리, 2~3분 정도)를 녹음하고 자동으로 녹음해 보세요. 출력을 원본 오디오와 비교하고 고유 명사, 용어 및 구두점 오류를 표시합니다. 5개 이상의 오류를 찾으세요. 그런 다음 위의 규칙에 따라 텍스트를 자막 블록으로 나누어 하나의 언어로 번역하고 번역에서 위험한 부분(숙어/용어)을 2개 이상 수정합니다. 발견한 프로세스와 오류를 보고하세요.

체크리스트

  • [ ] 스크립트를 원본 오디오와 비교하고 고유 명사/용어/구두점 오류를 수정했습니까?
  • [ ] 꾸며낸 단어나 생략된 단어가 있는지 확인했나요?
  • [ ] 줄 길이, 지속 시간, 읽기 속도 규칙에 따라 자막을 편집했습니까?
  • [ ] 다국어 자막의 경우 대상 언어를 아는 사람과 번역을 신중하게 확인했습니까?
  • [ ] 민감한 콘텐츠의 각 숫자와 용어를 별도로 확인했나요?