단위 5 / 11

CAT 도구 및 번역 메모리(TM)와 AI 통합

이득:

  • 번역 메모리(TM), 퍼지 일치 및 세그먼트의 개념을 이해하고, 맹목적으로 적용하기보다는 퍼지 일치의 차이점을 적용하여 사용할 수 있습니다.
  • 승인된 번역만 TM에 작성하고 고객 TM을 별도로 유지하며 TM 유지 관리를 수행하는 규율을 적용하는 능력
  • CAT 내 MT/LLM 통합에서 데이터가 이동하는 위치를 제어하여 개인 정보를 보호하는 기능

전문적인 번역은 일반 텍스트 편집기가 아닌 CAT 도구에서 수행되는 경우가 가장 많습니다. 본 단원에서는 번역의 핵심인 번역 ​​메모리(TM)인 CAT 도구, 이들이 기계 번역 및 LLM과 어떻게 연동되는지, 이 생태계를 효율적이고 안전하게 사용하는 방법을 학습합니다. 개별 문장이 아닌 전체 프로젝트를 일관되고 빠르며 추적 가능한 방식으로 관리하는 번역 기술 사용자가 되는 것이 목표입니다.

기본 개념

CAT 툴(Computer-Assisted Translation)은 번역 문장을 문장(세그먼트)별로 정리하고 번역 메모리와 텀베이스를 연결하는 전문 소프트웨어(예: Trados, memoQ, Phrase, MateCat)입니다. 소스와 대상을 나란히 표시하고, 반복을 포착하고, 서식을 유지합니다.

TM(Translation Memory)은 이전에 번역한 원문-대상 문장 쌍을 저장하는 데이터베이스입니다. 새로운 문장이 도착하면 TM에 비슷한 문장이 있으면 에이전트가 이를 제안해 줍니다. 여기서 핵심 개념은 퍼지 일치입니다. 즉, 새 문장과 TM의 문장의 유사성(100% = 정확히 동일, 85% = 대체로 유사)입니다. 일치율이 높으면 이전 번역을 재사용하므로 작업 속도가 빨라집니다.

세그먼트는 번역의 기본 단위로, 일반적으로 문장입니다. CAT 도구는 텍스트를 세그먼트로 나누고 각각을 개별적으로 편집합니다.

TM의 중요성: MT는 원시 초안을 생성하지만 TM은 승인된 인간 품질의 과거 번역을 반환합니다. 둘은 다릅니다. MT는 예측이고 TM은 기억입니다.

팁: TM과 MT를 혼동하지 마세요. 100% TM 일치(이전에 승인된 번역)는 일반적으로 신뢰할 수 있습니다. MT 추천은 항상 검증되어야 합니다. CAT 도구는 서로 다른 색상/레이블을 사용하여 두 가지를 표시합니다. 항상 이 차이를 보세요.

MT와 LLM을 CAT에 통합

최신 CAT 도구는 내부적으로 MT 엔진과 점점 더 많은 LLM을 호출합니다. TM에 일치하는 항목이 없으면 에이전트는 자동으로 세그먼트에 대한 MT 권장 사항을 반환합니다. 사후 편집합니다(예: CAT의 MTPE 흐름). 최신 세대 도구에는 LLM도 통합되어 있습니다. 도구에서 "이 세그먼트를 이 톤으로 다시 작성", "이 용어를 텀베이스로 수정" 등과 같은 작업을 수행할 수 있습니다.

통합의 장점: TM, 텀베이스, MT 및 LLM이 하나의 화면에 결합됩니다. 각 문장에 대해 "TM을 먼저 보고 그렇지 않으면 MT, QA라는 용어를 자동으로 제안"하는 흐름이 설정됩니다. 단점 및 주의 사항: 데이터는 어디로 가나요? 클라우드 기반 MT/LLM 통합으로 외부 서버에 텍스트를 보낼 수 있습니다. 기밀 업무의 경우 이는 계약 위반이 될 수 있습니다. 차량이 어떤 엔진에 연결되어 있는지, 어떤 데이터 정책으로 연결되어 있는지 꼭 알아두세요.

번역 메모리 공급 및 삭제

TM의 가치는 번역의 질만큼이나 중요합니다. 쓰레기는 들어가고, 쓰레기는 나온다. 두 가지 분야:

  1. 인증된 번역문을 TM에 작성하시면 됩니다. 원시 MT 출력을 검증하지 않고 TM에 저장하면 불량 "메모리"로 향후 작업에 반환됩니다.
  2. TM 유지관리를 수행합니다. 시간이 지남에 따라 용어가 변경되고 오류가 발생합니다. TM을 주기적으로 청소하고 마모/잘못된 쌍을 수정하십시오. 이 작업에서 저는 LLM을 사용하여 "이 TM 쌍에 불일치/용어 편향이 있습니까?"라고 묻고 있습니다. 감사자로 사용할 수 있습니다.
주의: 한 고객의 TM을 다른 고객의 비즈니스에 사용하는 것은 기밀 유지 위반이자 용어 혼동의 위험이 있습니다. TM은 클라이언트/프로젝트별로 별도로 유지됩니다. 혼합된 "모든 TM"은 기밀성과 품질을 모두 파괴합니다.

세 개의 미니 케이스

사례 1 - TM이 리플레이를 날렸습니다. 한 제조업체는 설명서의 70%가 해마다 동일하게 유지되는 제품군을 번역하고 있었습니다. TM 덕분에 새 버전마다 100% 퍼지 일치가 자동으로 이루어졌습니다. 3만 단어의 작업 중 ~9,000 단어만이 실제 새로운 번역이었습니다. 시간과 비용이 3분의 1로 줄어들었습니다.

사례 2 - Dirty TM이 오류를 전파했습니다. 한 팀은 검증 없이 원시 MT 출력을 TM에 저장했습니다. 1년 후, 동일한 오역이 계속해서 발생하여 100% 일치하는 "신뢰할 수 있는" 것처럼 보였습니다. 오류는 14개의 서로 다른 문서에 퍼져 있었습니다. 팀은 "TM으로만 인증된 번역" 규칙과 정리 투어를 시작했습니다.

사례 3 - 통합 시 기밀성이 유출되었습니다. 클라우드 MT에 자동으로 연결되는 CAT 프로젝트에서 번역가가 기밀 작업을 수행했습니다. 해당 텍스트는 데이터 정책이 불분명한 외부 엔진으로 전달되었습니다. 일단 발견되면 비밀 프로젝트에 대한 MT 통합이 꺼지고 "데이터를 저장/훈련하지 않는" 엔터프라이즈 엔진만 사용되었습니다.

복사 가능한 템플릿 4개

1) 퍼지 일치 평가(LLM에 대한):

아래는 새로운 원본 문장, TM의 유사한 문장 및 승인된 번역입니다. TM 번역을 새로운 문장에 적용하기 위해 무엇을 변경해야 하는지 정확히 알려주십시오. 불필요한 변경을 제안하지 마세요. 의미의 차이를 명확하게 보여주세요. 새 소스: [...] | TM 소스: [...] | TM 번역: [...]

2) TM 일관성 확인:

다음은 TM의 소스-타겟 쌍입니다. 동일하거나 매우 유사한 원본 문장이 다르게 번역되는 경우 불일치 및 용어 편차를 표시합니다. 문제를 나열하면 됩니다.커플: [...]

3) 세그먼트 톤 재작성(CAT의 LLM):

의미를 바꾸지 않고 다음 대상 세그먼트를 [원하는 톤]으로 만듭니다. 다음 용어 목록을 준수하십시오: [...]. 번호와 이름을 유지하세요. 다시 작성된 세그먼트만 내보냅니다. 세그먼트: [...]

4) 개인정보 보호/통합 사전 확인:

CAT 프로젝트에서 MT/LLM 통합을 사용하겠습니다. 이 프로젝트의 텍스트 유형을 설명하겠습니다. 이 텍스트를 클라우드 기반 외부 엔진으로 보내는 것이 적절한지, 공급자에게 어떤 질문(데이터 보존, 교육, 위치)을 물어봐야 하는지 알려주세요.텍스트 유형/개인 정보 보호 상태: [...]

약한 프롬프트 / 강한 프롬프트

약함: "TM의 번역을 사용합니다." (일치율과 적응 방법이 불분명합니다. 블라인드 카피로 인해 오류가 발생합니다.)

Strong: "이 새로운 문장은 TM의 문장과 90% 일치합니다. TM 번역을 기반으로 작성하되 이 차이점을 반영하세요. 소스에는 '월별' 대신 '연간'이 있으므로 '월별' 대신 '연간'이어야 합니다. 다른 내용은 변경하지 마세요."

차이점: 강력한 프롬프트는 일치 차이를 정확히 나타냅니다. 이는 퍼지 매칭에서 가장 흔히 발생하는 실수인 "이전 번역을 그대로 두는 것"을 방지합니다.

CAT 생태계 구성요소 표

구성 요소

무엇을

AI와의 관계

TM(번역 메모리)

승인된 과거 번역을 반환합니다.

신뢰할 수 있는; MT보다 앞선다

텀베이스

용어 일관성 보장

LLM에 대한 프롬프트로 제공됩니다.

MT 추천

빈 세그먼트로의 원시 스케치

사후 편집해야 함

LLM 통합

어조/용어/재작성

통제되고 개인정보 보호에 주의

QA 모듈

번호/용어/태그 오류를 스캔합니다.

자동 제어

일반적인 실수

  • 퍼지 일치를 맹목적으로 받아들입니다. 85% 일치하면 15%의 의미 차이가 숨겨질 수 있습니다.
  • 원시 MT 출력을 TM에 작성합니다. Dirty TM은 오류를 미래로 전달하고 확산시킵니다.
  • 고객/프로젝트 TM을 혼합합니다. 기밀성 및 용어 혼동의 위험.
  • 통합 데이터가 어디로 가는지 알 수 없습니다. 숨겨진 텍스트가 자신도 모르게 유출될 수 있습니다.
  • TM/MT 차이를 잊어버리세요. MT는 추정치입니다. TM은 추억이다. 둘은 똑같이 안전하지 않습니다.

사전 번역 및 정렬

두 가지 고급 CAT 기능은 AI 시대의 워크플로우를 더욱 가속화합니다. 첫 번째는 사전 번역입니다. 프로젝트 시작 시 도구는 자동으로 모든 세그먼트를 TM 및 MT로 채웁니다. 빈 파일 대신 100% 일치가 승인되고 퍼지 일치가 조정 대기 중이며 빈 파일은 MT 초안인 파일로 시작합니다. 이렇게 하면 작업이 "처음부터 작성"에서 "검토 및 편집"으로 변경됩니다. 하지만 사전 번역을 맹목적으로 승인하기보다는 각 부분을 평가해야 합니다.

두 번째는 정렬입니다. 이전에 번역되었지만 TM에 입력되지 않은 원본-대상 문서 쌍이 있는 경우 정렬 도구는 이를 세그먼트별로 일치시켜 TM으로 변환합니다. 따라서 귀하의 과거 번역이 "메모리"에 추가됩니다. 정렬 시 주의 사항: 자동 일치가 항상 올바른 것은 아닙니다. 하나의 세그먼트 미끄러짐으로 인해 전체 정렬이 중단됩니다. TMing 전에 정렬된 쌍을 검토하면 애초에 더러운 TM의 위험을 예방할 수 있습니다. 이 두 가지 기능은 현재 자산(과거 번역)을 미래 비즈니스에 대한 투자로 전환합니다.

요약하면

CAT 도구; 번역 메모리, 텀베이스, 기계 번역 및 LLM을 단일 생산 라인으로 결합합니다. TM은 승인된 과거 번역을 검색하고 반복 작업에 빠른 속도를 제공하는 메모리입니다. MT는 항상 검증이 필요한 예측입니다. 능숙한 사용자는 퍼지 일치의 차이를 신중하게 조정하고, 승인된 번역만 TM에 기록하고, 고객 TM을 별도로 유지하고, 통합에서 데이터가 어디로 가는지 파악하여 개인정보를 보호합니다.

응용과제

CAT 도구에서 소규모 프로젝트를 설정합니다(무료 온라인 CAT도 작동함). 텀베이스와 빈 TM을 추가합니다. 10문장 텍스트를 번역하고 승인된 번역을 TM에 저장합니다. 그런 다음 첫 번째 텍스트와 매우 유사한 두 번째 텍스트를 번역하고 "퍼지 일치 평가" 템플릿을 사용하여 TM에서 반환된 퍼지 일치를 조정합니다. 맹목적으로 초월명상(TM)을 받아들인다면 얼마나 많은 문장을 실수하게 될지 주목해 보세요.

체크리스트

  • [ ] 프로젝트에 TM과 텀베이스를 연결했습니다.
  • [ ] 나는 퍼지 일치의 차이를 맹목적으로 사용하기보다는 적응적으로 사용했습니다.
  • [ ] 나는 내가 확인한 인증 번역만을 TM에 썼습니다.
  • [ ] 고객/프로젝트 TM을 별도로 유지했습니다.
  • [ ] MT/LLM 통합에서 데이터가 어디로 가는지 확인했습니다.