이득:
- 자동 음성 인식(ASR)을 사용하여 원시 대본을 생성하고 이를 타임스탬프 및 화자 식별 확인에 사용하는 기능
- 뉴스에 포함될 모든 인용문을 그대로 검증하고 고유명사, 숫자, 전문 용어 등 오류가 높은 영역에 우선순위를 두는 규율을 적용할 수 있는 능력.
- 성적 증명서가 원본 초안이고, 인용문이 수정 없이 그대로 보존되어야 하며, 민감한 기록에서는 처음부터 기밀 유지가 고려되어야 한다는 점을 이해하는 능력.
기자에게 가장 귀중하지만 가장 지치는 원재료 중 하나는 인터뷰 녹음, 기자회견, 전화 대화, 의회 청문회, 생방송 아카이브 등 오디오입니다. 숙련된 사람이 한 시간 동안의 대화를 손으로 전사하는 데는 4~6시간이 걸립니다. 업계 용어로는 전사입니다. 음성을 자동으로 텍스트로 변환하는 인공지능 기반 자동음성인식(ASR) 기술은 이 시간을 몇 분으로 단축한다. 그러나 녹취록은 조잡한 초안입니다. 이름, 기술 용어, 중복되는 말, 시끄러운 구절이 모두 잘못 나올 수 있습니다. 따라서 규칙은 변경되지 않습니다. AI는 원본 사본을 생성합니다. 인용문이 녹음 내용과 정확히 일치하는지, 누가 무슨 말을 했는지, 맥락이 맞는지 검증하는 것은 기자다. 허공에 떠도는 모든 거꾸로 된 문장은 목소리와 비교되지 않고는 뉴스가 될 수 없습니다.
단계별: 음성부터 신뢰할 수 있는 견적까지
1단계 - 녹음을 준비하고 개인 정보 보호를 고려합니다. 오디오 파일에 소스를 공개하는 이름이 포함되어 있거나 소스를 보호해야 하는 경우 업로드되는 도구에 주의하세요. 민감한 기록의 경우 데이터 보안을 갖춘 오프라인 또는 기업 솔루션이 선호됩니다. 녹음이 승인되었는지 확인하십시오(일부 녹음에는 법적 제한이 있음).
2단계 - 원본 성적표를 가져옵니다. ASR 도구를 사용하여 오디오를 텍스트로 변환합니다. 가능하다면 타임스탬프(각 문장을 말한 시간(분))와 누가 어떤 문장을 말했는지 구별하는 분할 기능을 켜세요. 이를 통해 확인이 매우 빨라집니다.
3단계 - 오류가 높은 영역을 표시합니다. 고유명사, 기관명, 숫자, 외래어, 두 사람이 동시에 말하는 장소 등은 오류가 가장 많이 발생하는 영역이다. 이를 우선순위 체크리스트에 추가하세요.
4단계 - 견적과 녹음 내용을 비교합니다. 타임스탬프로 이동하여 오디오를 들어 뉴스에 포함된 각 문장을 그대로 확인하세요. 단어 하나만 바꿔도 의미와 법적 책임이 바뀔 수 있습니다.
5단계 — AI로 요약 및 주제 추출(별도 작업) 녹취록이 정리되면 AI에 "주요 주제", "뉴스 가치가 있는 구절", "모순"과 같은 초안 출력을 요청할 수 있습니다. 그러나 이는 인용문을 대체하는 것이 아니라 방향을 제공합니다.
주의: 자동 디코딩은 "we did't"라는 단어를 "we did"로, 한 명사를 다른 명사로 쉽게 대체합니다. 오디오를 듣지 않고 따옴표 안에 넣은 문장을 방송하지 마세요. 허위 견적은 윤리적 위반이자 고지 사항/소송의 원인이 됩니다.
정확도에 영향을 미치는 요인
전사 품질; 녹음 품질(마이크, 소음, 에코), 화자 수, 악센트, 방언, 기술 전문 용어 및 오디오 중복에 따라 달라집니다. 전화 녹음과 혼잡한 환경에서 가장 많은 오류가 발생합니다. 따라서 "도구의 정확도는 95%입니다"라는 말에 안심하지 마십시오. 나머지 5%는 이름, 숫자 등 뉴스에 가장 중요한 위치에 있을 수 있습니다.
세 개의 미니 케이스
사례 1 - 변경되는 유일한 단어입니다. 한 기자는 "이 주장을 확인할 수 없다"는 관계자의 진술을 자동으로 전사했다. 녹취록에는 "확인할 수 있습니다"라고 적혀 있었는데, 그 의미는 반대였습니다. 기자는 타임스탬프를 듣고 수정했습니다. 만약 한 단어의 오류를 바로잡지 않았다면 그 소식을 듣고 그 관계자는 자신이 말하지 않은 말을 하게 되었을 것이다.
사례 2 — 시간 이득, 의회 회의. 5시간 세션 녹음을 수동으로 디코딩하는 데 최대 25시간이 걸립니다. ASR은 40분 만에 원시 텍스트를 추출했습니다. 화자 분리 및 타임스탬프 덕분에 기자는 세 명의 주요 화자의 20분 분량의 구절만 듣고 검증할 수 있었습니다. 총 시간은 4시간으로 줄었습니다.
사례 3 - 전문 용어 오류. 한 보건 기자는 전문가와의 인터뷰에서 언급된 약물 이름이 녹취록에서 철자가 틀린 것을 발견했습니다. 비슷한 소리를 내는 다른 약물과 혼합되었습니다. 그는 짧은 메시지로 전문가에게 확인을 요청했다. 잘못된 약명이 공개되면 허위 정보일 뿐 아니라 건강에 위험할 수 있습니다.
복사 가능한 템플릿
1) 원본 성적표에서 체크리스트 추출:
아래는 자동 대본입니다. (1) 기관의 고유 명칭 및 명칭, (2) 숫자 및 날짜, (3) 외국/기술 용어, (4) 문장의 의미가 불분명한 장소를 표시하십시오. 이는 기록 전에 확인됩니다. 텍스트를 수정하세요. 그냥 체크리스트를 만들어 보세요. 전사: [여기]
2) 발표자 및 주제 요약(정리된 성적표에서):
아래의 확인된 성적표를 사용하세요. (1) 각 화자의 해석을 한 문장으로 요약합니다. (2) 뉴스 가치가 있는 5개의 구절에 타임스탬프를 표시하세요. (3) 화자들 사이의 모순을 나열하십시오. 견적 제작; 그냥 위치를 보여주세요. 전사: [여기]
3) 인용 후보 추출(검증 예정):
이 녹취록에서 뉴스에 적합한 짧은 인용문 후보 8개를 선택하세요. 타임스탬프[12:04]와 각각의 화자를 쓰세요. 따옴표를 줄이거나 편집하세요. 기록에서 확인할 수 있도록 그대로 복사합니다. 전사: [여기]
4) 시끄럽고 불분명한 통로 표시:
다음 사본에서 "[모호함]", "..."이 있거나 의미가 부족한 부분을 나열하십시오. 그 부분을 다시 들을 수 있도록 각 부분의 타임스탬프를 적어 두세요. 추측으로 빈칸을 채워보세요. 전사: [여기]
약한 프롬프트 / 강한 프롬프트
약한 프롬프트: "이 인터뷰를 요약하고 가장 좋은 인용문을 뽑아보세요."
결과: AI는 전사의 실수가 올바른 것으로 간주하고 인용문을 "아름답게" 만들고 문장을 단축하고 변경합니다. 어느 순간 분실됐다고 했는지는 확인할 수 없다.
강력한 프롬프트: "이 녹취록에서 정확하게(단어 대 단어) 8개의 인용 후보를 추출하고 각각에 타임스탬프와 화자를 추가하고 그 중 어떤 것도 수정하거나 줄이지 마십시오. 녹음에서 들을 수 있도록 불분명한 항목에 대한 별도의 목록을 만드십시오."
차이점: 강력한 프롬프트는 견적 변경을 금지하고 타임스탬프로 확인할 수 있도록 하며 모호한 부분을 격리합니다. 기자는 음성으로 모든 인용문을 확인할 수 있습니다.
비교 차트
특징
그것은 무엇을 합니까?
검증효과
자동 복호화(ASR)
오디오를 텍스트로 변환합니다.
원시 초안; 모두 확인이 필요합니다
타임스탬프
문장의 분을 반환합니다.
명언을 빠르게 찾아 들어보세요
스피커 분리
말하는 사람을 구분한다
허위 귀속 방지(확인 필요)
자동 요약
임시 보관함 테마
방향을 제시합니다. 견적은 대체되지 않습니다
자동 번역(과잉 전사)
외국 기록을 번역하다
이중 결함 위험 이중 검증
일반적인 실수
- 듣지 않고 인용문을 게시합니다. 전사문에 있는 문장이 맞다고 생각하여 인용부호로 사용하는 것 한 단어의 실수로 의미가 바뀔 수 있습니다.
- 이름과 번호를 신뢰합니다. 고유명사, 기관, 숫자가 실수가 가장 많이 발생하는 곳이라는 사실을 망각합니다.
- AI가 견적을 "수정"하도록 합니다. 문장을 좀 더 유동적으로 만들기 위해 문장을 변경합니다. 인용문은 그대로 작성해야 하며 수정 사항은 대괄호 안에 표시됩니다.
- 민감한 기록을 우연히 로드하는 중입니다. 소스를 제공하거나 허가 없이 통제되지 않는 차량에 녹음물을 보내는 행위.
- 화자 차별에 대한 맹목적인 신뢰. AI는 두 사람을 혼란스럽게 할 수 있습니다. 오디오에서 중요한 속성을 확인합니다.
전사 품질을 향상하기 위한 실용적인 팁
필사본의 정확성은 작업 초기, 녹음 시점에 결정됩니다. 현장에 나가는 기자는 몇 가지 간단한 습관만으로도 AI의 업무를 더 쉽게 만들고, 검증 부담을 줄일 수 있다. 마이크를 스피커에 더 가깝게 이동하고 바람/교통 등 배경 소음을 줄이면 오류율이 크게 줄어듭니다. 화자에게 차례대로 돌아가도록 요청하면 말이 겹치는 것을 방지할 수 있습니다(기록의 가장 약한 점). 인터뷰 시작 시 화자가 그의 이름과 직위를 말하게 하면 화자를 식별하고 나중에 귀속시키는 것이 더 쉬워집니다. 기술적인 주제를 논의할 경우 자주 사용되는 일반적인 이름과 용어 목록을 작성하면 전사에서 발생할 가능성이 가장 높은 오류를 미리 알 수 있습니다. 녹음에서 이러한 용어를 들으면 먼저 확인하십시오.
두 번째 방법: 사본을 원본 형식으로 보관하고 수정된 버전을 별도로 보관합니다. 이의제기나 법적 절차가 진행되는 경우 어떤 단어가 수정되었는지, 언제, 어떻게 수정되었는지 보여줄 수 있으면 기자를 보호할 수 있습니다. 또한 확인하는 각 견적 옆에 있는 타임스탬프를 기록해 두면 몇 달 후에 해당 견적으로 다시 돌아가야 할 때 검색하는 시간을 절약할 수 있습니다. 녹취록을 정리하고 타임스탬프로 정리하면 뉴스 기사, 칼럼, 다음 후속 기사에 동일한 녹음을 반복해서 안전하게 사용할 수 있습니다.
요약하면
자동 전사는 오디오 원본 자료를 몇 시간에서 몇 분으로 줄이는 강력한 가속기입니다. 타임스탬프와 화자 분리로 확인이 더 쉬워집니다. 하지만 전사는 청사진입니다. 이름, 숫자, 전문 용어, 중복되는 말이 잘못되는 경우가 많습니다. 뉴스에 포함된 모든 인용문은 녹음 내용을 그대로 청취하여 확인됩니다. 인용문은 AI로 수정할 수 없습니다. 요약과 주제 추출은 별도의 작업으로 방향만 제시합니다. 민감한 기록에서는 처음부터 개인정보 보호와 동의가 고려됩니다.
응용과제
오디오 녹음(본인 인터뷰 또는 공개 연설)을 자동으로 복사합니다. "인용 후보 제거" 프롬프트를 사용하여 8개의 후보를 검색합니다. 타임스탬프에서 각 항목을 듣고 그것이 정확히 맞는지 아닌지 표시하세요. 오류(특히 이름/번호)가 포함된 인용문 수와 수정하는 데 걸리는 시간을 확인하세요.
체크리스트
- [ ] 나는 그 성적표를 원시 초안으로 간주합니다. 나는 인용문을 듣지 않고 출판하지 않습니다.
- [ ] 나는 기록에 있는 개인의 성명, 기관, 번호를 먼저 확인합니다.
- [ ] 인용문을 수정하지 않습니다. 변경 사항을 대괄호로 표시합니다.
- [ ] 검증을 위해 타임스탬프와 화자 구분을 사용합니다.
- [ ] 민감하거나 승인이 필요한 기록에서 보안차량과 허가현황을 확인합니다.