단위 2 / 11

탐사 저널리즘의 데이터 분석: 수많은 문서를 뉴스로 전환

이득:

  • 인공 지능으로 데이터 세트를 탐색하고, 뉴스 가치가 있는 질문을 생성하고, 민감한 데이터를 추출하는 능력
  • 인공 지능이 계산을 수행하는 대신 감사 가능한 도구에서 방법을 설명하고 실행하며 원시 데이터에서 각 결과를 확인하는 습관을 들이십시오.
  • 이상치 초안을 작성하고 아카이브 관계를 문서화하고 이를 원본 소스에서 확인하는 것이 저널리스트의 책임임을 이해합니다.

탐사 저널리즘은 수천 줄의 스프레드시트, 수백 페이지의 대차대조표, 유출된 이메일 아카이브, 오픈 소스 공공 지출 세트 등 무더기로 시작하는 경우가 많습니다. 데이터 저널리즘(수치적 데이터와 다큐멘터리 데이터에서 패턴, 변칙, 관계를 찾아 뉴스로 바꾸는 관행)은 바로 이 대량의 데이터를 이해하는 작업입니다. 인간이 수동으로 살펴보려면 평생이 걸리는 이러한 더미에서 인공 지능(AI)은 강력한 첫 번째 선별 및 아이디어 생성 도구입니다. 인공 지능(AI)은 테이블을 요약하고, 텍스트 아카이브에서 중복된 이름을 추출하고, 분석을 위해 요청할 질문을 제안하고, 데이터 정리 단계를 설명할 수도 있습니다. 하지만 처음부터 한 문장을 넣어보자. AI는 데이터 분석의 파트너다. 결과의 정확성과 뉴스 가치를 결정하고 원시 데이터에서 수치를 재검토하는 것은 언론인입니다. 환각의 위험은 숫자로 볼 때 가장 위험합니다.

단계별: AI를 사용하여 데이터 세트 탐색

1단계 - 데이터에 대해 알아보세요. 먼저 열, 행 수, 날짜 범위, 단위를 이해하세요. 원시 파일을 AI에 로드하기 전에 그것이 무엇인지 스스로 알아보세요. 그렇지 않으면 AI의 "발견"은 그대로 유지됩니다.

2단계 - 민감한 데이터를 추출합니다. 개인 데이터(이름, TR ID, 주소, 건강)가 포함된 경우 공용 AI 도구에 제공하지 않고 익명화하거나 분석할 열만 보냅니다. 출처가 드러나는 유출 문서의 흔적도 지워집니다(1, 10부).

3단계 — AI를 사용하여 탐색 질문을 생성합니다. “이 데이터 세트에는 어떤 뉴스가 숨겨져 있을까요?” 말하는 것부터 시작하세요. AI는 상위 10개 품목, 반복 공급업체, 비정상적인 점프, 공백으로 남겨진 영역 등 물어볼 질문 목록을 제시합니다.

4단계 - AI에게 분석을 맡기지 말고 설명하세요. 이것이 중요한 포인트입니다. AI가 머리 속으로 계산하는 평균이나 백분율이 틀린 경우가 많다. 대신 신뢰할 수 있는 도구(스프레드시트 수식, 쿼리, 스크립트)에서 실행할 단계를 AI에 요청하세요. 따라서 미적분학을 감사 가능한 도구로 만드는 AI는 단지 방법을 제공할 뿐입니다.

5단계 - 결과를 확인합니다. 원시 라인으로 돌아가서 AI가 지적하는 모든 이상 현상을 확인하세요. 테이블을 필터링하고 "이 회사가 40개 입찰 중 31개에서 승리했습니다"라는 주장을 계산합니다. 확인되지 않은 숫자는 뉴스에 나오지 않습니다.

6단계 - 컨텍스트를 설정합니다. 숫자만으로는 뉴스가 아닙니다. 비교(지난해, 유사기관, 인구 대비 비율), 맥락, 전문가 의견은 언론인의 몫이다.

주의: AI가 "이 테이블의 평균을 계산하세요"라고 말하고 그 결과를 뉴스에 직접 게재하는 것은 데이터 저널리즘의 가장 흔한 면책 조항 생성 실수입니다. AI는 계산기가 아닌 언어 모델입니다. 도구가 수학을 수행하게 하고 AI에게 방법과 해석을 요청하면 됩니다.

메타데이터 및 문서 분석

숫자표 외에도 탐사 저널리즘은 이메일, 회의록, 계약서 등 대규모 텍스트 아카이브도 다룹니다. 여기에 AI는 '누가 언제 누구와 대화했는지', '어떤 주제가 반복되는지', '어떤 이름이 함께 언급되는지' 등 관계 맵을 작성할 수 있다. 다시 한 번 규칙은 동일합니다. AI가 초기 지도를 제공합니다. AI가 존재하지 않는 링크를 설득력 있게 설명할 수 있기 때문에 모든 링크는 원본 문서에서 확인됩니다.

세 개의 미니 케이스

사례 1 — 숨겨진 응축. 한 기자가 2,400행의 공공 조달 스프레드시트를 가지고 있었습니다. 그는 AI가 탐구적인 질문을 생성하도록 했습니다. "동일한 공급업체가 얼마나 많은 입찰을 받았습니까?"라는 질문이 있습니다. 전면에 나왔습니다. 기자는 AI가 이를 계산하도록 하지 않았습니다. 그는 YZ가 직접 제안한 스프레드시트 공식을 실행한 결과 단일 회사가 2,400개 항목 중 380개(15.8%)를 받았다는 사실을 발견했습니다. 그는 수동으로 확인했고 번호가 정확했습니다. AI의 초기 '추정치'는 22%로 나타났습니다. 따라서 AI를 신뢰할 수 있다면 뉴스는 잘못된 것입니다.

사례 2 - 시간 절약, 이메일 보관. 6,000개의 이메일 아카이브에서 "어떤 주제가 진행되고 있는지"를 수동으로 검색하려면 며칠이 걸릴 것입니다. AI는 15분 만에 주제 클러스터의 개요를 생성했습니다. 이 중 유망 클러스터 3개를 선정해 이메일 원본을 읽어봤다. 총 검색 시간은 최대 3일로 단축되었지만 게시된 모든 견적은 원본 이메일에서 그대로 확인되었습니다.

사례 3 — 환각이 포착되었습니다. 한 경제부 기자는 YZ로부터 대차대조표를 통해 “인건비가 1년 만에 60% 증가했다”는 요약을 받았다. 원시 테이블로 돌아왔을 때 증가율이 6%이고 AI가 한 자리를 잘못 읽은 것을 확인했습니다. 한 번의 사실 확인으로 "60% 폭발"과 같은 거짓되고 허식적인 헤드라인이 차단되었습니다.

복사 가능한 템플릿

1) 데이터 세트 인식 및 검색 질문:

열 제목과 데이터 세트의 처음 20개 행을 알려 드리겠습니다. 이 데이터를 사용하여 수행할 수 있는 10가지 저널리즘 질문(집중도, 이상값, 시간 점프, 누락/빈 영역, 반복 행위자 측면)을 생성합니다. 숫자 계산 없음; 물어볼 가치가 있는 질문과 그 질문이 왜 뉴스가 될 수 있는지 적어 보세요.데이터: [헤드라인 + 샘플 라인]

2) 계산을 하지 않고 다음을 설명하도록 합니다.

나는 다음과 같은 분석을 하고 싶습니다. 각 공급업체의 총 입찰 금액과 지분 비율을 확인하세요]. 스프레드시트에서 직접 실행하고 싶습니다. 설치할 수식/피벗 설정을 단계별로 적어주세요. SEN 계산 결과; 방법만 알려주세요.내 열: [열 이름]

3) 이상치 찾기:

아래에 요약 통계(최소, 최대, 평균, 중앙값)를 제공하겠습니다. 비정상적이거나 의심스러운 값과 뉴스를 확인해야 하는 이유를 설명합니다. 최종 판단을 내리지 마십시오. 체크리스트는 "다음 줄을 수동으로 확인해야 합니다"라는 형식으로 나타납니다. 요약: [여기]

4) 문서 보관 관계도(초안):

문서 텍스트 세트를 드립니다. 자주 함께 나타나는 이름, 반복되는 주제, 주목할만한 날짜 등을 DRAFT로 출력합니다. [B12]와 같이 각 링크가 나오는 문서를 표시하세요. 문서에 명시적으로 기록되지 않은 관계는 추가하지 마세요. 문서: [여기]

약한 프롬프트 / 강한 프롬프트

약한 프롬프트: "이 차트를 분석하고 중요한 결과를 기술하세요."

결과: AI는 백분율과 평균을 정면으로 계산하고 이상 현상을 상상하지만 어느 선을 기반으로 하는지 불분명합니다. 확인할 수 없습니다.

강력한 프롬프트: "이 표의 열과 처음 20개 행을 제공합니다. (1) 뉴스 가치가 있을 수 있는 분석 목록. (2) 실행할 수 있도록 각 분석에 대한 스프레드시트 공식을 제안합니다. (3) 결과를 계산하지 않습니다. (4) [S45]와 같이 확인할 행을 표시합니다."

차이점: 강력한 프롬프트는 계산을 제어 가능한 도구에 맡기고 AI를 방법과 방향의 역할로 축소합니다. 환각이 숫자에 새어나오는 것을 방지합니다.

비교 차트

무대

AI는

기자는

확인

데이터 인식

열/패턴 요약

단위와 맥락을 안다.

소스 데이터 사전

발견 질문

질문 목록을 생성합니다.

뉴스 가치를 선택합니다

계산

방법을 설명합니다.

차량에서 수식을 실행합니다.

수동 프로비저닝

특이치

후보를 표시하다

원시 라인을 본다

필터링 및 개수

댓글/컨텍스트

초안 프레임

비교, 전문가

두 번째 소스

일반적인 실수

  • AI가 계산하게 만듭니다. AI가 평균, 백분율, 합계 등을 계산하고 그 결과를 사용하도록 합니다. AI는 실수를 자주 저지릅니다. 차량이 계산을 하게 하세요.
  • 결과를 원시 라인에 연결하지 않습니다. 테이블을 필터링하고 계산하지 않고 "이 회사가 대부분의 입찰에서 승리했습니다"라는 주장을 작성합니다.
  • 맥락 없이 번호를 게시합니다. 비교나 비율 없이 단순한 숫자만 보고하는 것은 오해의 소지가 있습니다.
  • 민감한 데이터를 있는 그대로 업로드합니다. 차량을 청소하지 않고 개인정보나 출처가 드러나는 문서를 차량에 제공하는 행위.
  • 가짜 관계가 사실이라고 생각하는 것. AI가 아카이브에서 '보는' 링크를 원본 문서에서 확인하지 않고 지도로 처리하는 것입니다.

요약하면

데이터 저널리즘에서 AI는 발견 및 통찰력 파트너입니다. AI는 더미를 스캔하고, 물어볼 질문을 생성하고, 분석 방법을 설명하고, 이상값 후보를 표시합니다. 그러나 AI가 숫자 자체를 계산하도록 하는 것은 가장 위험한 실수입니다. 계산을 감사 가능한 도구에 아웃소싱하고, 원시 데이터로 돌아가서 각 결과를 확인하고, 수치에 컨텍스트와 비교를 추가합니다. 문서 아카이브에서 AI는 시작 지도를 제공합니다. 각 링크는 원본 문서에서 확인됩니다.

응용과제

가지고 있는(또는 공개적으로 사용 가능한) 데이터 세트를 가져옵니다. 먼저, "탐색 질문" 프롬프트를 통해 질문 10개를 생성하게 하세요. 질문을 선택하고 "계산 설명" 프롬프트를 통해 AI로부터 수식을 받아 직접 실행해 보세요. 그런 다음 AI에게 직접 동일한 계산을 요청하고 두 결과를 비교합니다. 차이점과 교훈을 살펴보세요.

체크리스트

  • [ ] 도구에 데이터를 제공하기 전에 열, 단위 및 민감한 필드를 이해했습니다.
  • [ ] AI에게 계산을 맡기지 않습니다. 메서드를 설명하고 감사 가능한 도구에서 실행합니다.
  • [ ] 원시 행으로 돌아가서 각 결과를 수동으로 확인합니다.
  • [ ] 숫자에 비교와 맥락을 추가합니다. 나는 맨손으로 숫자를보고하지 않습니다.
  • [ ] 보관소에 있는 모든 관계를 원본 문서에서 확인합니다.