Прибуток:
- Можливість досліджувати набір даних за допомогою штучного інтелекту, генерувати важливі питання та витягувати конфіденційні дані
- Замість того, щоб штучний інтелект проводив обчислення, опис методу та його виконання в інструменті, який можна перевірити, і набути звички перевіряти кожне відкриття на основі необроблених даних.
- Розуміння того, що журналісти є обов’язком складати викиди та документувати архівні зв’язки та підтверджувати їх у першоджерелі.
Журналістські розслідування часто починаються з купи: тендерної електронної таблиці на тисячі рядків, балансу на сотні сторінок, витоку електронного архіву, набору державних витрат у відкритому коді. Журналістика даних — практика пошуку закономірностей, аномалій і взаємозв’язків у числових і документальних даних і перетворення їх на новини — саме така робота, щоб зрозуміти цю масу. У цих купах, на перегляд яких вручну знадобилося б ціле людське життя, штучний інтелект (ШІ) є потужним інструментом для першого перегляду та генерування ідей: він може узагальнити таблицю, витягти повторювані імена в текстовому архіві, запропонувати, які запитання поставити для аналізу, навіть описати кроки очищення даних. Але давайте скажемо одне речення з самого початку: ШІ є партнером в аналізі даних; Саме журналіст вирішує точність і новинну цінність результату та повторно перевіряє число на основі необроблених даних. Ризик галюцинацій найбільш небезпечний тут, у цифрах.
Крок за кроком: дослідження набору даних за допомогою ШІ
Крок 1 — Ознайомтеся з даними. Спочатку розберіться зі стовпцями, кількістю рядків, діапазоном дат, одиницями вимірювання. Дізнайтеся самі, що це таке, перш ніж завантажити необроблений файл у AI; В іншому випадку «знахідки» ШІ залишаються в повітрі.
Крок 2. Витягніть конфіденційні дані. Якщо він містить особисті дані (ім’я, TR ID, адреса, стан здоров’я), зробіть його анонімним, не передаючи загальнодоступному інструменту ШІ, або надішліть лише стовпці для аналізу. Також очищаються сліди витоку документів, які розкривають джерело (блоки 1 і 10).
Крок 3. Створіть запитання для відкриття за допомогою ШІ. «Які новини може приховувати цей набір даних?» Почніть зі слів. ШІ пропонує список запитань: 10 найпопулярніших товарів, постійні постачальники, незвичайні стрибки, незаповнені області.
Крок 4 — НЕМАЄ ШІ. ЗРОБІТЬ АНАЛІЗ, ОПИСІТЬ ЙОГО. Це критична точка. Середнє або відсоткове значення, яке штучний інтелект обчислює в голові, часто буває неправильним. Замість цього попросіть ШІ кроки, які ви б виконали в надійному інструменті (формула електронної таблиці, запит, сценарій). Таким чином, роблячи обчислення інструментом, який можна перевірити, ШІ просто надає метод.
Крок 5 — Перевірте знахідку. Перегляньте кожну аномалію, на яку вказує AI, повернувшись до вихідної лінії. Відфільтруйте таблицю та порахуйте заяву «Це підприємство виграло 31 із 40 тендерів». Будь-які неперевірені цифри не потраплять у новини.
Крок 6 — Встановіть контекст. Одна лише цифра – не новина. Порівняння (минулий рік, подібні заклади, співвідношення до чисельності населення), контекст і експертна думка – справа журналіста.
Увага: змусити штучний інтелект сказати «обчислити середнє значення цієї таблиці» та помістити результат безпосередньо в новини — це найпоширеніша помилка журналістики даних, яка створює застереження. ШІ – це модель мови, а не калькулятор. Нехай інструмент обчислить, просто попросіть ШІ про метод і інтерпретацію.
Аналіз метаданих і документів
Окрім числових таблиць, журналістське розслідування також має справу з великими текстовими архівами: електронними листами, протоколами, договорами. Тут штучний інтелект може створювати карти стосунків, наприклад «хто з ким коли говорив», «яка тема повторюється», «які імена згадуються разом». Знову ж таки, правило те саме: ШІ дає початкову карту; Кожне посилання підтверджується в оригінальному документі, тому що AI може переконливо пояснити посилання, якого не існує.
три міні-чохла
Випадок 1 — Прихований конденсат. У журналіста була таблиця державних закупівель із 2400 рядками. Він змусив ШІ виробляти дослідницькі запитання; Питання "скільки тендерів отримав один і той же постачальник?" came to the fore. Репортер не мав ШІ обчислити це; Він провів формулу електронної таблиці, запропоновану самим YZ, і виявив, що одна фірма отримала 380 (15,8%) із 2400 позицій. Він перевірив це вручну, і номер був правильним. Початкова «оцінка» штучного інтелекту означала 22% — отже, якби ШІ довіряли, новини були б неправильними.
Випадок 2 — Економія часу, архів електронної пошти. Знадобилися б дні, щоб вручну шукати «які теми відбуваються» в архіві з 6000 електронних листів. ШІ створив план тематичних кластерів за 15 хвилин; З них журналіст вибрав 3 перспективні кластери та прочитав оригінальні електронні листи. Загальний час виявлення скорочено до ~3 днів, але кожна опублікована цитата була дослівно перевірена з оригінального електронного листа.
Випадок 3 — спіймана галюцинація. Економічний репортер отримав від YZ резюме про те, що «витрати на персонал зросли на 60% за один рік» із балансу. Коли він повернувся до таблиці вихідних даних, він побачив, що збільшення склало 6% і що ШІ неправильно прочитав одну цифру. Одна перевірка фактів заблокувала брехливий і претензійний заголовок на зразок «60% вибуху».
Copiable templates
1) Питання щодо розпізнавання та відкриття набору даних:
Я дам вам заголовки стовпців і перші 20 рядків набору даних. Згенеруйте 10 журналістських запитань, які МОЖНА зробити з цими даними: щодо концентрації, викиду, стрибків у часі, відсутніх/порожніх областей, повторюваних акторів. No number calculation; просто напишіть, які запитання варто поставити та чому вони можуть стати новинами. Дані: [заголовки + приклади рядків]
2) Не робити розрахунків, а описувати:
Я хочу зробити такий аналіз: [напр. знайти загальну суму тендеру та відсоток частки кожного постачальника]. Я хочу запустити це самостійно в електронній таблиці. Напишіть мені крок за кроком, які формули/параметри зведення встановити. Результат розрахунку SEN; просто вкажіть метод. Мої стовпці: [імена стовпців]
3) Outlier hunting:
Нижче я наведу зведену статистику (мінімальна, максимальна, середня, медіана). Поясніть, які значення є незвичайними/підозрілими та чому я повинен перевіряти їх на наявність новин. Не робити остаточних суджень; З’явиться контрольний список у форматі «наступні рядки потрібно перевірити вручну». Summaries: [here]
4) Карта зв'язку архіву документів (чернетка):
Я дам вам набір тексту документа. Виведіть наступне як ЧЕРНЕТКУ: імена, які часто зустрічаються разом, теми, що повторюються, значні дати. Позначте документ, з якого походить кожне посилання, наприклад [B12]. Не додавайте жодних зв’язків, які явно не прописані в документі. Documentation: [here]
Слабка підказка / Сильна підказка
Слабка підказка: «Проаналізуйте цю діаграму та вкажіть будь-які важливі висновки».
Результат: штучний інтелект безпосередньо складає відсотки та середні значення, уявляє аномалії, незрозуміло, на якій лінії він базується. It cannot be verified.
Потужна підказка: «Я надаю стовпці та перші 20 рядків цієї таблиці. (1) Перелік аналізів, які можуть бути цікавими. (2) Запропонуйте формулу електронної таблиці для кожного аналізу, щоб я міг його запустити. (3) Не обчислюйте жодних результатів. (4) Позначте рядки, які потрібно перевірити, наприклад [S45]».
Відмінність: сильна підказка залишає обчислення керованому інструменту, зводячи ШІ до ролі методу та напряму; запобігає витоку галюцинацій у число.
порівняльна таблиця
етап
AI робить
Журналіст робить
перевірка
Розпізнавання даних
Підсумок стовпців/шаблонів
Знає одиницю та контекст
Словник вихідних даних
питання відкриття
Формує список питань
Вибирає значення новини
—
розрахунок
Описує метод
Запускає формулу в транспортному засобі
Ініціалізація вручну
викид
відзначає кандидатів
Дивиться на сиру лінію
Відфільтруйте та порахуйте
Коментар/контекст
чорновий каркас
Порівняння, експерт
друге джерело
Поширені помилки
- Змусити AI обчислювати. Наявність штучного інтелекту обчислює середнє, відсоткове, загальне тощо та використовує результат; ШІ часто помиляється, дозвольте автомобілю порахувати.
- Не з’єднуючи знахідку з необробленою лінією. Написання претензії «Ця компанія виграла більшість тендерів» без фільтрації таблиці та підрахунку.
- Публікація цифр без контексту. Повідомлення голих цифр без порівняння та співвідношення вводить в оману.
- Завантаження конфіденційних даних як є. Надання транспортному засобу особистих даних або документа, що розкриває джерело, без його очищення.
- Думаючи, що фальшиві стосунки - це правда. Обробка посилання, яке AI «бачить» в архіві, на карту без підтвердження в оригінальному документі.
Підсумовуючи
У журналістиці даних ШІ є партнером у відкритті та аналізі: він сканує купу, генерує запитання, описує метод аналізу, позначає кандидатів як викиди. Але найризикованішою помилкою є те, що штучний інтелект сам обчислює число; Передайте обчислення інструменту, який можна перевірити, перевірте кожен результат, повернувшись до необроблених даних, і додайте контекст і порівняння до числа. В архівах документів AI дає стартову карту; Кожне посилання підтверджується в оригінальному документі.
Аплікаційне завдання
Візьміть набір даних, який у вас є (або є загальнодоступним). Спочатку попросіть їх створити 10 запитань за допомогою підказки «Дослідницькі запитання». Виберіть питання, отримайте формулу від ШІ за допомогою підказки «Описати розрахунок» і запустіть її самостійно. Потім попросіть ШІ зробити той самий розрахунок і порівняйте два результати; Зверніть увагу на різницю та її урок.
контрольний список
- [ ] Я розумів стовпці, одиниці вимірювання та конфіденційні поля, перш ніж надати дані інструменту.
- [ ] Я не дозволяю штучному інтелекту робити обчислення; Я описую метод і запускаю його в інструменті аудиту.
- [ ] Я вручну перевіряю кожен результат, повертаючись до необробленого рядка.
- [ ] Я додаю порівняння та контекст до числа; Я не повідомляю голих цифр.
- [ ] Я підтверджую всі зв’язки в архіві в оригінальному документі.