Yunit 2 / 11

Pagsusuri ng Data sa Investigative Journalism: Ginagawang Balita ang Mga Salansan ng mga Dokumento

Mga nadagdag:

  • Kakayahang mag-explore ng set ng data gamit ang artificial intelligence, bumuo ng mga tanong na karapat-dapat sa balita at kumuha ng sensitibong data
  • Sa halip na magkaroon ng artificial intelligence gawin ang mga kalkulasyon, pagkakaroon ng paraan na inilarawan at patakbuhin sa isang auditable na tool at pagkakaroon ng ugali ng pag-verify ng bawat paghahanap mula sa raw data.
  • Pag-unawa na responsibilidad ng mamamahayag na mag-draft ng mga outlier at idokumento ang mga relasyon sa archive at kumpirmahin ang mga ito sa orihinal na pinagmulan.

Ang investigative journalism ay madalas na nagsisimula sa isang pile: isang malambot na spreadsheet ng libu-libong linya, isang balanseng sheet ng daan-daang mga pahina, isang leaked na archive ng email, isang open-source na hanay ng pampublikong paggasta. Data journalism — ang pagsasagawa ng paghahanap ng mga pattern, anomalya, at relasyon sa numerical at documentary na data at gawing balita ang mga ito — ang eksaktong trabaho ng pagbibigay kahulugan sa misa na ito. Sa mga tambak na ito, na mangangailangan ng mahabang buhay ng tao upang masuri nang manu-mano, ang artificial intelligence (AI) ay isang mahusay na tool sa first-screening at pagbuo ng ideya: maaari itong mag-summarize ng isang talahanayan, mag-extract ng mga duplicate na pangalan sa isang text archive, magmungkahi kung anong mga tanong ang hihilingin para sa pagsusuri, kahit na ilarawan ang mga hakbang sa paglilinis ng data. Ngunit maglagay tayo ng isang pangungusap mula sa simula: AI ay isang kasosyo sa pagsusuri ng data; Ang mamamahayag ang nagpapasya sa katumpakan at halaga ng balita ng resulta at muling susuriin ang numero mula sa raw data. Ang panganib ng guni-guni ay ang pinaka-mapanganib dito, sa mga numero.

Hakbang-hakbang: pag-explore ng set ng data gamit ang AI

Hakbang 1 — Kilalanin ang data. Unawain muna ang mga column, bilang ng mga row, hanay ng petsa, mga unit. Alamin sa iyong sarili kung ano ito bago mo i-load ang raw file sa AI; Kung hindi, ang "mga natuklasan" ng AI ay nananatili sa hangin.

Hakbang 2 — I-extract ang sensitibong data. Kung naglalaman ito ng personal na data (pangalan, TR ID, address, kalusugan), i-anonymize ito nang hindi ibinibigay sa pampublikong AI tool o ipadala lamang ang mga column na susuriin. Ang mga bakas ng mga leaked na dokumento na nagpapakita ng pinagmulan ay na-clear din (Mga Yunit 1 at 10).

Hakbang 3 — Bumuo ng mga tanong sa pagtuklas gamit ang AI. "Anong balita ang maaaring itago ng data set na ito?" Magsimula sa pagsasabi. Ang AI ay naglalabas ng isang listahan ng mga tanong na itatanong: nangungunang 10 item, umuulit na mga supplier, hindi pangkaraniwang pagtalon, mga lugar na naiwang blangko.

Hakbang 4 — HUWAG MAY AI GAWIN ANG PAGSUSURI, ILARAWAN ITO. Ito ang kritikal na punto. Ang average o porsyento na kinakalkula ng AI sa ulo ay kadalasang mali. Sa halip, magtanong sa AI ng mga hakbang na tatakbo sa isang maaasahang tool (spreadsheet formula, query, script). Kaya ginagawang auditable tool ang calculus, binibigyan lang ng AI ang pamamaraan.

Hakbang 5 — I-verify ang paghahanap. Tingnan ang bawat anomalya na itinuturo ng AI sa pamamagitan ng pagbabalik sa hilaw na linya. I-filter ang talahanayan at bilangin ang claim na "Ang kumpanyang ito ay nanalo ng 31 sa 40 na mga tender". Anumang mga hindi na-verify na numero ay hindi lalabas sa balita.

Hakbang 6 — Itatag ang konteksto. Ang bilang lamang ay hindi balita. Ang paghahambing (noong nakaraang taon, mga katulad na institusyon, ratio sa populasyon), konteksto at opinyon ng eksperto ay trabaho ng mamamahayag.

Pansin: Ang pagkakaroon ng AI ​​sasabihin na "kalkulahin ang average ng talahanayang ito" at direktang inilalagay ang resulta sa balita ay ang pinakakaraniwang pagkakamali na gumagawa ng disclaimer ng data journalism. Ang AI ay isang modelo ng wika, hindi isang calculator. Ipagawa sa tool ang matematika, tanungin lamang ang AI para sa pamamaraan at interpretasyon.

Metadata at pagsusuri ng dokumento

Bukod sa mga numerical table, ang investigative journalism ay tumatalakay din sa malalaking text archive: mga email, minuto, kontrata. Dito, maaaring i-draft ng AI ang mga mapa ng relasyon gaya ng "sino ang nakipag-usap kung kanino kailan", "aling paksa ang inuulit", "aling mga pangalan ang sabay na binanggit." Muli, ang panuntunan ay pareho: AI ay nagbibigay ng isang paunang mapa; Ang bawat link ay nakumpirma sa orihinal na dokumento, dahil ang AI ay nakakakumbinsi na ipaliwanag ang isang link na wala.

tatlong mini case

Kaso 1 — Nakatagong condensation. Ang isang reporter ay may isang public procurement spreadsheet na may 2,400 row. Nagkaroon siya ng AI na gumawa ng mga katanungan sa paggalugad; Ang tanong na "ilang tender ang natanggap ng parehong supplier?" napunta sa unahan. Ang reporter ay walang AI na kalkulahin ito; Pinatakbo niya ang formula ng spreadsheet na iminungkahi mismo ni YZ at nalaman na ang isang kumpanya ay nakatanggap ng 380 (15.8%) ng 2,400 item. Sinuri niya ito ng mano-mano at tama ang numero. Ang paunang "estimate" ng AI ay nagsabing 22% — kaya kung ang AI ay mapagkakatiwalaan, ang balita ay mali.

Case 2 — Time saver, email archive. Aabutin ng mga araw upang manual na maghanap "kung anong mga paksa ang nangyayari" sa isang archive ng 6,000 email. Ang AI ay gumawa ng outline ng mga kumpol ng paksa sa loob ng 15 minuto; Mula sa mga ito, pumili ang reporter ng 3 promising cluster at binasa ang orihinal na mga email. Ang kabuuang oras ng pagtuklas ay nabawasan sa ~3 araw, ngunit ang bawat quote na naging live ay na-verify na verbatim mula sa orihinal na email.

Case 3 — Nahuli ang hallucination. Nakatanggap ang isang economic reporter ng buod mula sa YZ na "nadagdagan ng 60% ang mga gastos sa tauhan sa isang taon" mula sa isang balanse. Nang bumalik siya sa hilaw na mesa, nakita niya na ang pagtaas ay 6% at ang AI ay nagkamali sa pagkabasa ng isang digit. Na-block ng isang fact check ang isang mali at mapagpanggap na headline tulad ng "60% explosion."

Mga nakopyang template

1) Mga tanong sa pagkilala at pagtuklas ng data set:

Ibibigay ko sa iyo ang mga heading ng column at ang unang 20 row ng isang data set. Bumuo ng 10 tanong sa pamamahayag na MAAARING gawin sa data na ito: sa mga tuntunin ng konsentrasyon, outlier, tumalon sa oras, nawawala/walang laman na mga lugar, umuulit na aktor. Walang pagkalkula ng numero; isulat lang kung aling mga tanong ang nararapat itanong at kung bakit sila maaaring gumawa ng balita. Data: [headlines + sample lines]

2) Hindi gumagawa ng mga kalkulasyon, ngunit ginagawa silang ilarawan:

Gusto kong gawin ang sumusunod na pagsusuri: [hal. hanapin ang kabuuang halaga ng tender at porsyento ng bahagi ng bawat supplier]. Gusto kong patakbuhin ito sa aking sarili sa isang spreadsheet. Isulat sa akin ang hakbang-hakbang kung aling mga formula/pivot na setting ang ii-install. Resulta ng pagkalkula ng SEN; ibigay lang ang paraan.My columns: [column names]

3) Outlier na pangangaso:

Magbibigay ako ng buod na istatistika (min, max, average, median) sa ibaba. Ipaliwanag kung aling mga halaga ang hindi pangkaraniwan/kahina-hinala at kung bakit ko dapat suriin ang mga ito para sa mga balita. Huwag gumawa ng panghuling paghatol; Lumilitaw ang isang checklist sa format na "dapat suriin nang manu-mano ang mga sumusunod na linya". Mga buod: [dito]

4) Mapa ng relasyon sa archive ng dokumento (draft):

Bibigyan kita ng isang set ng text ng dokumento. I-output ang sumusunod bilang isang DRAFT: mga pangalan na madalas na magkasama, umuulit na paksa, mga kilalang petsa. Markahan ang dokumento kung saan nagmumula ang bawat link, tulad ng [B12]. Huwag magdagdag ng anumang mga relasyon na hindi tahasang nakasulat sa dokumento. Dokumentasyon: [dito]

Mahinang prompt / Malakas na prompt

Mahinang prompt: "Suriin ang chart na ito at sabihin ang anumang mahahalagang natuklasan."

Resulta: Binubuo ng AI ang mga porsyento at nangunguna sa average, nag-iisip ng mga anomalya, hindi malinaw kung saang linya ito batay. Hindi ito ma-verify.

Napakahusay na prompt: "Ibinibigay ko ang mga column at unang 20 row ng table na ito. (1) Ilista kung aling mga pagsusuri ang maaaring maging newsworthy. (2) Magmungkahi ng formula ng spreadsheet para sa bawat pagsusuri upang maipatakbo ko ito. (3) Huwag kalkulahin ang anumang mga resulta. (4) Markahan ang mga row na susuriin, tulad ng [S45]."

Pagkakaiba: Iniiwan ng malakas na prompt ang pagkalkula sa nakokontrol na tool, na binabawasan ang AI sa papel ng paraan at direksyon; pinipigilan ang hallucination mula sa pagtulo sa numero.

tsart ng paghahambing

entablado

Ginagawa ng AI

Ginagawa ng mamamahayag

pagpapatunay

Pagkilala sa datos

Buod ng column/pattern

Alam ang yunit at konteksto

Diksyunaryo ng pinagmumulan ng data

mga tanong sa pagtuklas

Bumubuo ng listahan ng mga tanong

Pinipili ang halaga ng balita

pagkalkula

Inilalarawan ang pamamaraan

Pinapatakbo ang formula sa sasakyan

Manu-manong provisioning

outlier

nagmamarka sa mga kandidato

Nakatingin sa hilaw na linya

Salain at bilangin

Komento/konteksto

draft na frame

Paghahambing, eksperto

pangalawang pinagmulan

Mga karaniwang pagkakamali

  • Pagkalkula ng AI. Ang pagkakaroon ng AI na kalkulahin ang average, porsyento, kabuuang atbp. at gamitin ang resulta; Ang AI ay madalas na nagkakamali, hayaan ang sasakyan ang gumawa ng matematika.
  • Hindi pagkonekta sa paghahanap sa hilaw na linya. Pagsusulat ng claim na "Napanalo ng kumpanyang ito ang karamihan sa mga tender" nang hindi sinasala ang talahanayan at binibilang.
  • Pag-publish ng mga numero nang walang konteksto. Ang pag-uulat ng mga walang laman na numero nang walang paghahambing at ratio ay nakaliligaw.
  • Nag-a-upload ng sensitibong data gaya ng dati. Pagbibigay ng personal na data o dokumentong naghahayag ng pinagmulan sa sasakyan nang hindi ito nililinis.
  • Iniisip na totoo ang pekeng relasyon. Pinoproseso ang link na "nakikita" ng AI sa archive sa mapa nang hindi kinukumpirma ito sa orihinal na dokumento.

Sa buod

Sa data journalism, ang AI ay isang kasosyo sa pagtuklas at pananaw: sinusuri nito ang pile, bumubuo ng mga tanong na itatanong, inilalarawan ang paraan ng pagsusuri, nagba-flag ng mga kandidato para sa mga outlier. Ngunit ang pagkakaroon ng AI na kalkulahin ang numero mismo ay ang pinakamapanganib na pagkakamali; I-outsource ang pagkalkula sa isang auditable na tool, i-verify ang bawat paghahanap sa pamamagitan ng pagbabalik sa raw data, at magdagdag ng konteksto at paghahambing sa numero. Sa mga archive ng dokumento, nagbibigay ang AI ng panimulang mapa; Ang bawat link ay nakumpirma sa orihinal na dokumento.

Gawain ng aplikasyon

Kumuha ng data set na mayroon ka (o available sa publiko). Una, hayaan silang bumuo ng 10 tanong gamit ang prompt na "Mga tanong sa paggalugad." Pumili ng tanong, kunin ang formula mula sa AI na may prompt na "Ilarawan ang pagkalkula", at patakbuhin ito nang mag-isa. Pagkatapos ay direktang tanungin ang AI para sa parehong pagkalkula at ihambing ang dalawang resulta; Pansinin ang pagkakaiba at ang aral nito.

checklist

  • [ ] Naunawaan ko ang mga column, unit at sensitibong field bago ibigay ang data sa tool.
  • [ ] Hindi ko hinahayaan ang AI na gumawa ng mga kalkulasyon; Inilalarawan ko ang pamamaraan at pinapatakbo ito sa auditable na tool.
  • [ ] Manu-mano kong bine-verify ang bawat paghahanap sa pamamagitan ng pagbabalik sa raw row.
  • [ ] Nagdaragdag ako ng paghahambing at konteksto sa numero; Hindi ako nag-uulat ng mga walang laman na numero.
  • [ ] Kinukumpirma ko ang bawat relasyon sa archive sa orihinal na dokumento.