단위 2 / 11

증거 수집 및 조사 지원: 이미징, 분류 및 분석 가속화

이득:

  • 변동성 순서, 이미지 획득, 해시 및 관리 체인과 같은 수집 단계는 인간의 책임이며 인공 지능은 여기서 계획과 템플릿만 생성한다는 것을 이해합니다.
  • 이미지 촬영 후 파일 분류, OCR, 요약 및 자산 추출을 통해 검토를 가속화하기 위해 인공 지능을 안전하게 사용하는 기능
  • 분류는 제거가 아니라 우선순위화라는 점과 위음성(false negatives)의 위험을 피하기 위해 우선순위가 낮은 그룹에서 샘플링이 필요하다는 점을 구별할 수 있습니다.

당신은 범죄 현장에 도착했습니다. 탁자 위에 열려 있는 컴퓨터, 외장 드라이브, 전화기 두 대, 서버실이 있습니다. 모든 장치는 잠재적인 증거 소스입니다. 모든 잘못된 행동은 법정에서 기각될 증거입니다. 증거 수집은 디지털 증거를 온전하고 검증 가능하며 법에 따라 캡처하고 복사하는 프로세스입니다. 이 단원에서는 AI가 이 프로세스의 어떤 단계를 안전하게 지원할 수 있는지, 그리고 어떤 단계를 확실히 뒤쳐야 하는지 알아봅니다. 처음부터 중요한 규칙은 다음과 같습니다. AI는 증거를 수집하지 않으며 이미지도 찍지 않습니다. 이는 수집되고 검증된 증거의 도출을 검토하고 신속하게 처리하는 데 도움이 됩니다.

수집 순서 및 휘발성 데이터

증거 수집에는 우선순위 원칙이 있습니다. 변동성 순서 - 가장 빨리 사라지는 데이터부터 가장 영구적인 데이터까지 수집합니다. 맨 위에는 휘발성 데이터가 있습니다. 즉, 장치가 종료될 때 RAM 내용이 손실되고, 네트워크 연결이 열려 있고, 프로세스가 실행되고 있습니다. 그런 다음 디스크가 나오고 그 다음에는 외부 녹음이 나옵니다. 한번 손실된 휘발성 데이터는 다시 돌아오지 않습니다. 따라서 실행 중인 시스템에서는 RAM이 디스크보다 먼저 덤프됩니다.

AI는 이 단계에서 결정을 내리지는 않지만 체크리스트와 절차 개요를 작성하는 데 유용합니다. "이 시나리오에서 무엇을 수집해야 하며, 어떤 순서로, 어떤 도구를 사용하여 무엇을 문서화해야 합니까?" 수집 프로세스 자체(쓰기 차단 바인딩, 이미지 획득, 해시 확인, 봉인)가 사람의 손에 이루어지며 모든 단계가 문서화됩니다.

팁: 선택을 시작하기 전에 AI에게 시나리오를 설명하고 "변동성 순차적 선택 계획" 초안을 작성하세요. 그런 다음 이 초안을 기관의 표준 절차(예: 현지 법률 및 실험실 SOP)와 비교하십시오. AI는 권위가 아니라 알림이다.

이미징 및 해싱: 불가침의 체인

수집된 각 장치에서 정확한 이미지가 촬영됩니다. 이미지를 가져오는 동안 소스는 쓰기 차단기로 보호됩니다. 이미지가 완료되면 해시(SHA-256이 선호되며 MD5만 약한 것으로 간주됨)가 계산됩니다. 이 해시는 이미지의 지문입니다. 검사 전반에 걸쳐 모든 해시 검사에서 동일해야 합니다. 그렇지 않으면 이미지가 손상됩니다. 보관 연속성 양식(증거를 누가, 언제, 어디서 가져왔는지, 어디에 보관했는지, 누구에게 전달했는지)은 주인이 바뀔 때마다 업데이트됩니다.

AI는 여기서 두 가지 보안 작업을 수행합니다. (1) 수집 중에 작성될 관리 연속성과 증거 태그 템플릿을 생성합니다. (2) 일관성 확인을 위해 수집한 해시와 타임스탬프를 구성합니다("이 세 가지 해시가 동일합니까? 어떤 이미지가 어떤 장치에 속합니까?"). AI는 해시 자체를 계산하지 않습니다. 이를 법의학 도구로 만듭니다. AI는 기록만 편집한다.

검토 가속화: AI의 진정한 힘

증거가 확인되고 이미지가 캡처되면 AI는 정말 빛을 발합니다. 일반적인 가속 영역:

  • 파일 분류: 수만 개의 파일을 유형, 콘텐츠, 관련성별로 그룹화하고 우선순위를 권장합니다.
  • 텍스트 및 문서 요약: 장기 계약, 이메일, 채팅 내용에 대한 제목 및 당사자 추출.
  • OCR 및 시각적 콘텐츠: 스캔한 문서에서 텍스트를 추출하고(OCR - 광학 문자 인식, 이미지의 텍스트 변환) 이미지의 개체/텍스트에 태그를 지정합니다.
  • 엔터티 추출(NER — 명명된 엔터티 인식, 텍스트에서 사람, 기관, 계정, IP와 같은 명명된 엔터티 찾기): 수천 개의 문서에서 사람, IBAN, 전화, 이메일, 암호화폐 지갑 주소를 나열합니다.
  • 코드 및 명령 설명: 발견된 스크립트 또는 명령 기록이 수행하는 작업을 일반 언어로 설명합니다(검증 예정).

각각에서 출력은 시작점입니다. 관련성과 증거 가치에 대한 결정은 전문가에게 있습니다.

주의: AI가 "이 파일은 관련이 없습니다"라고 말하는 것만으로는 해당 파일을 검사하지 않고 제거하기에 충분하지 않습니다. 분류는 우선순위를 낮추지만 중요한 경우에는 우선순위가 낮은 클러스터에서도 샘플링이 수행됩니다. 거짓 부정(실제 증거를 "관련이 없는" 것으로 생략)은 컴퓨터 포렌식에서 가장 비용이 많이 드는 실수입니다.

세 개의 미니 케이스

사례 1 - OCR이 포함된 기밀 문서. 한 부패 조사에서는 14,000페이지를 스캔했습니다. 그 중 어느 것도 검색 가능한 텍스트가 아니었습니다. AI 기반 OCR을 통해 모든 페이지를 전사하고 '해외', 특정 회사 이름, IBAN과 같은 패턴을 검색했습니다. 40분 안에 중요한 페이지 9개 발견; 손으로 읽으면 몇 주가 걸릴 것입니다. 그런 다음 각 페이지를 전문적으로 검증했습니다.

사례 2 - 엔터티 추론 관계 네트워크. 하나의 사기 파일에는 6,200개의 이메일이 포함되어 있었습니다. NER를 사용하면 모든 연락처, 계정 및 전화가 추출되고 관계 목록이 생성되었습니다. 따라서 이전에 눈에 띄지 않았던 두 개의 중개 계정이 나타났습니다. AI가 연결을 표시했습니다. 검찰은 이메일 자체에서 증거를 확인했다.

사례 3 - 거짓 부정의 위험. 한 팀은 AI가 '관심도 낮음'이라고 부르는 30,000개의 파일 집합을 완전히 제거하고 싶었습니다. 선임 전문가는 이 클러스터에서 2%를 무작위로 샘플링하여 그 안에서 중요한 기록을 발견했습니다. AI가 비정상적인 확장자로 인해 파일을 잘못 분류했다는 것입니다. 샘플링 규율로 사건이 해결되었습니다.

복사 가능한 템플릿 4개

1) 초안 수집 계획:

귀하의 역할: 범죄 현장 법의학 수집 전문가. 시나리오: [PC, 휴대폰 2대, NAS 1대, 실행 중인 서버]. 변동성 순으로 수집 계획을 대략적으로 설명합니다. 즉, 각 장치에 대해 수집할 항목, 권장되는 도구, 문서화할 내용을 설명합니다. 이는 초안이므로 현지 법률에 따라 확인이 필요합니다.

2) 관리 연속성 템플릿:

증거 번호, 장치 설명, 일련 번호, 수집기, 날짜/시간, 수집 방법, 해시(SHA-256), 수신자, 전달자, 저장 위치 및 각 핸드오프에 대한 라인을 포함하여 보관 연속성 양식 템플릿을 생성합니다.

3) 대량 파일 분류 요청:

파일 목록(이름, 크기, 날짜, 확장자)을 알려드리겠습니다. 법의학적 관심 가능성이 높음/중간/낮음으로 그룹화하고 근거를 작성합니다. 참고: "낮음"은 제거되지 않고 우선순위만 지정됩니다. 확장 내용이 일치하지 않는 항목은 별도로 표시하세요.

4) 발견된 스크립트를 설명하십시오.

포렌식 맥락에서 이 스크립트/명령 기록을 설명하십시오. 이 스크립트가 수행하는 작업, 어떤 파일/네트워크 액세스 권한이 있는지, 지속성 또는 데이터 유출 흔적이 있습니까? 각 어설션을 스크립트의 한 줄에 연결합니다. 확실하지 않은 경우 "확인해야 함"으로 표시하세요.

약한 프롬프트 / 강한 프롬프트

약한 프롬프트:

중요한 파일에 따라 파일을 분리하세요.

"상당한"은 정의되지 않았습니다. AI는 자체 가정을 조사하여 중요한 증거를 놓칠 수 있습니다.

강력한 프롬프트:

귀하의 역할: 법의학 분류 분석가. 맥락: 우리는 랜섬웨어 사건, 암호화 및 데이터 유출을 조사하고 있습니다. 이름, 크기, 생성/수정 날짜, 확장자가 포함된 파일 목록을 알려드리겠습니다. 작업: 암호화 도구, 압축/보관, 비정상적인 확장자, 지난 72시간 동안 변경, 대용량 내보내기 파일을 높은 우선순위로 표시 각 결정에 대한 근거를 작성합니다. 확장자가 예상한 내용과 일치하지 않으면 경고도 표시됩니다. 어떤 파일도 "삭제/삭제"라고 말하지 마세요. 그냥 우선순위로 두세요.

컨텍스트, 대상 및 "삭제하지 않음" 제약 조건은 출력을 유용하고 안전하게 만듭니다.

수집 vs. 검토: AI 역할 차트

무대

AI는 안전한가요?

AI의 직업

사람의 일

휘발성 데이터 수집

아니오 (결정)

계획 초안

수집, 문서화

이미지 획득

아니

템플릿

쓰기 차단기, 해시

해시 검증

아니

기록 주문

차량을 통한 계산 및 확인

파일 심사

우선순위

결정, 샘플링

OCR/텍스트 추출

전환

정확성 검증

엔터티 추론

목록 생성

관련성 결정

일반적인 실수

  • AI가 선택을 "실행"하도록 하려고 합니다. AI는 추가하지 않습니다. 계획과 템플릿만 생성합니다. 이미지와 해시는 인간의 작품입니다.
  • 분류 결과를 최종 제거로 착각함. "낮은 관심도" 클러스터에서 샘플링을 건너뛰지 마십시오.
  • OCR 출력을 확인하지 않고 인용합니다. OCR은 문자(0/0, 1/l)를 혼합할 수 있습니다. 소스를 통해 중요한 값을 확인하세요.
  • 확장 프로그램을 맹목적으로 신뢰합니다. 확장자가 변경되었을 수 있습니다. 콘텐츠 유형을 확인하세요.
  • 마스크 없이 차량에 개인정보 업로드. TC/IBAN/건강 데이터는 대량 추론으로 유출될 수 있습니다.

요약하면

증거 수집은 인간의 책임입니다. 변동성 순서, 이미지, 해시 및 관리 체인은 인간의 손에 있습니다. 여기서 AI는 계획과 템플릿만 생성합니다. 증거가 확인되고 이미지가 캡처되면 AI는 검토 속도를 높이는 데 실질적인 가치를 더합니다(분류, OCR, 요약, 엔터티 추출, 코드 주석). 그러나 모든 출력은 확인해야 할 신호입니다. 관련성과 증거 가치에 대한 결정은 전문가에게 있으며 전문가는 거짓 부정의 위험도 고려합니다.

응용과제

가상의 사건 시나리오를 설명합니다(예: 직원이 데이터를 유출한 것으로 의심됨). 먼저 "수집 계획 초안" 템플릿을 사용하여 계획을 작성하고 이를 현지 절차와 비교합니다. 그런 다음 20줄의 샘플 파일 목록을 준비하고 "대량 파일 분류" 템플릿을 사용하여 우선순위를 지정합니다. 최소 10%를 직접 샘플링하고 AI의 분류를 확인합니다.

체크리스트

  • [ ] 변동성 순으로 수집계획을 설정하고 절차와 비교하였습니다.
  • [ ] 인간/도구를 통해 이미지와 해시를 얻었습니다. 내가 AI에게 시킨 게 아니다.
  • [ ] 나는 주인이 바뀔 때마다 양육권 연속성 양식을 업데이트했습니다.
  • [ ] 분류 결과의 "낮음" 클러스터에서 샘플링했습니다.
  • [ ] 소스를 통해 OCR 및 자산 출력을 확인했습니다. 개인정보를 가렸어요.