이득:
- EDRM 워크플로 및 TAR/예측 코딩 개념을 이해하고 인공 지능을 통해 검토 단계를 가속화하는 능력
- 재현율과 정밀도의 균형을 이해하고 포렌식 맥락에서 높은 재현율을 우선시하여 관련 문서를 놓치지 않도록 보장하는 능력
- 특권 및 개인 데이터 결정에 대한 법적 책임은 인간 변호사에게 있으며 방법론의 투명성이 필요하다는 점을 이해합니다.
민사 소송이나 규제 조사에서 한쪽 당사자는 상대방이 보유한 전자 문서(이메일, 계약서, 채팅 로그, 파일)를 요청합니다. 이러한 문서를 법에 따라 수집하고, 이를 검토하고, 관련 내용을 분류하여 상대방/법원에 전달하는 과정을 전자증거개시(e-Discovery)라고 합니다. 즉, 법적 분쟁 범위 내에서 전자 증거를 찾아 검토하고 제시하는 것입니다. 전자 증거개시(E-Discovery)는 컴퓨터 법의학이 법과 가장 밀접하게 얽혀 있는 분야이며 아마도 AI가 가장 성숙하고 널리 사용되는 분야일 것입니다. 이 단원에서는 EDRM 워크플로, TAR/예측 코딩의 개념, AI가 이 프로세스를 어떻게 변환하는지 알아봅니다.
EDRM: e-Discovery의 표준 워크플로우
전 세계의 전자 증거개시는 주로 EDRM(전자 증거개시 참조 모델 - 전자 증거개시 프로세스의 표준 단계를 정의하는 참조 모델) 프레임워크 내에서 운영됩니다. 주요 단계:
- 정보 관리 및 식별: 어떤 데이터가 어디에 있는지 결정합니다.
- 보존 및 수집: 관련 데이터의 삭제(법적 보존 - 소송이 예상되는 경우 데이터 삭제를 중지해야 하는 의무)를 방지하고 무결성을 유지하여 수집합니다.
- 처리: 데이터를 검색 가능하게 만들고, 중복 항목을 제거하고, 형식을 변환합니다.
- 검토: 문서가 민감한 문서인지 특권이 있는 문서인지 결정합니다. 변호사-고객 특권이 적용되며 양도되지 않습니다.
- 제작 : 관련 서류를 상대방/법원에 전달합니다.
가장 비용이 많이 들고 인력이 필요한 단계는 검토 단계입니다. 변호사가 수십만 개의 문서를 하나씩 읽도록 하는 것은 비용이 많이 들고 속도도 매우 느립니다. 이것이 바로 AI가 혁명을 일으키는 곳입니다.
TAR 및 예측 코딩
검토 속도를 높이는 핵심 기술은 TAR(Technology Assisted Review)입니다. 가장 일반적인 형태는 예측 코딩입니다. 전문 변호사가 샘플 문서에 "관련성/비관련성" 레이블을 지정합니다. 시스템은 이러한 예를 통해 학습하고 나머지 수십만 개의 문서를 자동으로 분류합니다. 따라서 관련성이 가장 높은 문서만 읽고 나머지는 샘플링을 통해 확인합니다.
최신 AI(대규모 언어 모델)는 이를 한 단계 더 발전시킵니다. 단순히 "관련성/비관련성"이 아닌 문서가 왜 관련성이 있는지, 주제 요약, 권한 플래그를 설명할 수 있습니다. 그러나 기본 원칙은 변하지 않습니다. AI는 관련성 및 특권 결정에 대한 법적 책임이 변호사에게 있다고 제안합니다.
TAR의 방어 가능성은 감사 가능한 프로세스에 따라 달라집니다. 전문 변호사가 라벨링한 훈련 사례, 이러한 사례를 통해 학습하고 나머지 문서를 분류하는 시스템이 한 주기로 반복됩니다. 정확도는 각 라운드의 샘플링을 통해 측정됩니다. 이 주기는 "기계가 무엇을 보았고, 무엇을 학습했으며, 얼마나 정확했습니까?"라는 질문에 대한 문서화 가능한 답변을 제공합니다. 상대방은 종종 이 방법론에 의문을 제기합니다. 따라서 훈련 세트 크기, 결정 임계값 및 검증 샘플 속도가 처음부터 기록됩니다. 프로세스가 더욱 투명하고 반복 가능할수록 법원에서 결과가 받아들여질 가능성이 높아집니다.
팁: TAR 프로세스를 방어 가능하게 만들려면 "훈련" 샘플, 검증 지표(재현율/정밀도) 및 결정 임계값을 문서화하십시오. 상대방은 "기계가 무엇을 놓쳤나요?"라고 묻습니다. 그는 물을 수도 있다; 투명한 방법론으로 신뢰를 보장합니다.
두 가지 지표: 재현율과 정밀도
e-Discovery에서는 두 가지 개념이 중요합니다. 회상(민감도 - 실제로 찾을 수 있었던 모든 관련 문서의 양)은 누락 위험을 측정합니다. 관련 서류를 제출하지 않으면 제재를 받을 수 있어 법적으로 매우 중요합니다. 정밀도(찾은 내용 중 실제로 관련성이 있는 정도)는 불필요한 읽기 부하를 측정합니다. 비용에 영향을 미칩니다. 둘 사이에는 균형이 있습니다. 임계값을 완화하면 재현율이 증가하지만 불필요한 문서도 증가합니다. 법의학/법률적 맥락에서는 높은 회상률이 우선시되는 경우가 많습니다. 누락되지 않는 것이 과도하게 읽는 것보다 더 중요합니다.
특권과 프라이버시: 빨간 선
e-Discovery에서 가장 위험한 실수는 실수로 권한 있는 문서를 상대방에게 넘겨주는 것입니다(권한 포기). 변호사-고객 서신이 전달되면 이를 검색하기가 매우 어렵습니다. AI는 특권을 표시하는 데 도움을 주지만 모든 특권 결정은 인간 변호사의 확인을 받아야 합니다. 또한 개인 데이터(KVKK/GDPR 범위)가 포함된 문서에는 수정이 필요할 수 있습니다. AI는 후보자를 마스킹하고 최종 제어는 인간에게 있습니다.
주의: 원시 기업 데이터를 AI에 로드할 때 데이터 개인 정보 보호 및 관할권(어느 국가의 데이터, 어디로 가는지) 규칙을 준수하십시오. 특권 및 개인 데이터는 계약에 따라 해당 관할권에서 데이터가 모델 교육으로 이동하지 않는 차량에서 처리되어야 합니다.
세 개의 미니 케이스
사례 1 — TAR 비용 절감. 130만 개의 문서로 이루어진 상업적 사례에서 전통적인 선형 검토 추정 기간은 14개월이었습니다. 예측 코딩을 사용하여 변호사는 8,000개의 문서에 태그를 지정했습니다. 시스템은 나머지 문서를 분류했고 사람의 검토는 90,000개 문서로 줄었습니다. 프로세스는 6주로 단축되었으며, 리콜 샘플링을 통해 92%가 확인되었습니다.
사례 2 - 권한이 저장되었습니다. 사전 제작 AI는 배송 세트의 240개 문서에 "권한이 있을 수 있음"으로 플래그를 지정했습니다. 변호사 팀이 조사했습니다. 210통은 실제로 변호사-고객 간의 서신이었지만 전달되지 않았습니다. AI가 없었다면 이러한 문서가 실수로 상대방에게 전달되었을 수도 있습니다.
사례 3 — 과신의 위험. 한 팀은 높은 정밀도를 위해 TAR 임계값을 엄격하게 설정했습니다. 시스템은 샘플링 없이 "관련이 없는" 것으로 간주되는 항목을 제거했습니다. 후속 감사에서는 엄격한 기준으로 인해 몇 가지 중요한 이메일이 누락된 것으로 나타났습니다. 통화 샘플링이 이루어지지 않아 오류가 늦게 발견되었습니다.
복사 가능한 템플릿 4개
1) 초안 검토 프로토콜:
귀하의 역할: 전자증거개시 컨설턴트. 사건 제목: [계약 위반]. 응답 기준, 권한 플래그, 개인 데이터 마스킹 규칙 및 TAR 확인 단계(리콜/정밀 샘플링) 등 검토 프로토콜 초안을 작성합니다. 모든 결정은 변호사의 확인을 거쳐야 함을 명시합니다.
2) 관련성 예비분류:
주제 및 관련성 기준: [여기]. 서류 요약을 알려드리겠습니다. 각 문서에 대해 관련성/부적절성/불확실성을 선택하고 간략한 근거를 제시하세요. "불명확한" 항목을 강조 표시합니다. 이것들은 변호사 검토를 거치게 됩니다. 귀하가 관련이 없다고 생각하는 것들은 샘플링을 통해 확인될 것이며, 이는 최종적인 제거가 아닙니다.
3) 권한 검색:
변호사-의뢰인 특권을 부여할 수 있는 다음 문서를 선택하십시오: 변호사 이름, "기밀/특권" 언어, 법적 의견 내용. 이는 최종 결정이 아니며 변호사의 확인을 받아야 하는 후보입니다. 각 기호에 대한 정당성과 관련 라인을 제공하십시오.
4) 개인정보 마스킹 대상자:
TR, IBAN, 건강, 제3자 개인 데이터 등 생산 전에 전달될 문서에서 마스킹되어야 하는 개인 데이터 후보를 나열합니다. 후보자로만 표시합니다. 최종 마스킹 결정은 제가 하겠습니다. 텍스트를 변경합니다.
약한 프롬프트 / 강한 프롬프트
약한 프롬프트:
이 문서 중에서 사건과 관련된 문서를 선택하십시오.
관련성 기준도 없고, 독점성도 없고, 검증도 없습니다. AI는 주관적인 결정을 내리며, 중요한 문서를 놓치거나 특권을 유출할 수 있습니다.
강력한 프롬프트:
귀하의 역할: 전자증거개시 검토 보조원. 사례: X사가 Y사와의 공급 계약을 위반했다는 주장. 관련성 기준: 납기일, 가격 변경, 품질 불만, 해지 협상. 서류 요약을 알려드리겠습니다. 각 문서에 대해 관련성/비관련성/불확실함 + 정당성을 부여하세요. 또한 변호사의 이름이나 법적 견해가 포함된 항목은 "특권이 있을 수 있음"으로 표시하십시오. 어떤 결정도 최종 결정으로 간주하지 마십시오. 모두 변호사 확인을 거쳐야 합니다.
실질적인 기준, 특권 심사 및 "변호사 검증" 제약으로 인해 프로세스가 방어 가능해집니다.
EDRM 단계 및 AI 테이블
무대
AI 기여
인간의 책임
컬렉션
템플릿, 계획
법적 보존, 무결성
처리
중복 제거, 형식, 디렉터리
품질 관리
검토
TAR, 관련성 권장사항
관련성 결정
특권
마킹 후보
최종 결정, 확인
생산
마스킹 후보
최종 확인, 배송
일반적인 실수
- TAR를 무인으로 두는 것. 통화 샘플을 수행하지 않고 "기기가 관심이 없다고 말했습니다"라고 말하면 하이재킹이 발생합니다.
- 특권 결정을 AI에 맡깁니다. 잘못된 배송으로 인해 취소할 수 없는 권리 포기가 발생할 수 있습니다.
- 재현율 대신 정밀도에만 집중합니다. 엄격한 임계값이 관련 문서를 놓칩니다. 법적으로는 리콜이 우선이다.
- 방법론을 문서화하지 않았습니다. 상대방은 TAR 프로세스에 의문을 제기할 수 있습니다. 투명성은 필수입니다.
- 개인/특권 데이터를 부적절한 도구에 업로드합니다. 관할권 및 기밀 유지 규칙을 준수하십시오.
요약하면
E-Discovery는 기업 전자 데이터에서 합법적인 방식으로 관련 증거를 찾아 전달하는 프로세스이며 EDRM 프레임워크 내에서 작동합니다. AI는 TAR/예측 코딩을 통해 가장 비용이 많이 드는 검토 단계를 전환합니다. 인간은 가장 관련성이 높고 모호한 문서만 읽습니다. 그러나 관련성, 특히 특권 결정에 대한 법적 책임은 변호사에게 있습니다. 리콜 샘플링, 방법론의 투명성 및 개인 데이터 보호는 인간의 규율을 통해 보장됩니다.
응용과제
가상의 사례와 관련성 기준 4~5개 항목을 정의합니다. 20~25개의 문서 요약을 준비합니다(몇몇 권한 있는 문서, 일부는 모호한 문서). "관련성 사전 분류" 및 "권한 심사" 템플릿을 적용합니다. 그런 다음 "관련 없는" 세트에서 샘플링하여 리콜을 수동으로 확인하고 AI가 표시한 권한 후보를 확인합니다.
체크리스트
- [ ] EDRM 단계와 법적 보유 의무를 준수했습니다.
- [ ] 회상 샘플링을 통해 TAR/사전 분류 결과를 확인했습니다.
- [ ] 저는 모든 특권 결정을 인간 변호사 확인과 연결했습니다.
- [ ] 개인정보 마스킹 대상자를 최종 확인하여 승인하였습니다.
- [ ] 나는 내가 사용한 방법론과 한계점을 문서화했습니다.