Единицы
1. Новый партнер журналистики: роли, границы и рефлекс проверки 2. Анализ данных в журналистских расследованиях: превращаем стопки документов в новости 3. Транскрипция и анализ аудио/видео: интервью в текст, текст в новости 4. Проверка и подтверждение источника (факт-чек): от утверждения к доказательствам 5. Дезинформация и синтетический контент: журналистика в эпоху дипфейков 6. Написание новостей: от черновика к публикации, от перевернутой пирамиды к заголовку 7. Подведение итогов, брифинг и переупаковка контента 8. Многоязычная журналистика: перевод, локализация и ее ограничения 9. Этика, честность и прозрачность: политика искусственного интеллекта в редакции новостей 10. Защита ресурсов, конфиденциальность и цифровая безопасность 11. Комплексный рабочий процесс: полное путешествие новостей с помощью искусственного интеллекта
Единица 2 / 11

Анализ данных в журналистских расследованиях: превращаем стопки документов в новости

Прибыль:

  • Возможность исследовать набор данных с помощью искусственного интеллекта, генерировать важные вопросы и извлекать конфиденциальные данные.
  • Вместо того, чтобы искусственный интеллект выполнял расчеты, опишите и запустите метод в проверяемом инструменте и выработайте привычку проверять каждый вывод на основе необработанных данных.
  • Понимая, что ответственность журналиста — составлять выбросы, документировать архивные связи и подтверждать их в первоисточнике.

Журналистские расследования часто начинаются с кучи: тендерной таблицы из тысяч строк, балансового отчета из сотен страниц, утекшего архива электронной почты, набора данных о государственных расходах в открытом доступе. Журналистика данных — практика поиска закономерностей, аномалий и взаимосвязей в числовых и документальных данных и превращения их в новости — как раз и есть задача осмысления этой массы. Искусственный интеллект (ИИ) является мощным инструментом первичной проверки и генерации идей в этих грудах, на просмотр которых вручную может потребоваться целая жизнь человека: он может суммировать таблицу, извлекать повторяющиеся имена в текстовом архиве, подсказывать, какие вопросы задать для анализа, даже описывать этапы очистки данных. Но давайте с самого начала сформулируем одно предложение: ИИ — партнер в анализе данных; Именно журналист решает точность и новостную ценность результата и повторно анализирует цифры на основе необработанных данных. Риск галлюцинаций здесь наиболее опасен в цифрах.

Шаг за шагом: исследование набора данных с помощью ИИ

Шаг 1 — Ознакомьтесь с данными. Сначала разберитесь со столбцами, количеством строк, диапазоном дат и единицами измерения. Узнайте сами, что это такое, прежде чем загружать необработанный файл в AI; В противном случае «выводы» ИИ останутся в подвешенном состоянии.

Шаг 2. Извлеките конфиденциальные данные. Если он содержит персональные данные (имя, TR ID, адрес, состояние здоровья), анонимизируйте его, не передавая общедоступному инструменту искусственного интеллекта, или отправьте на анализ только столбцы. Следы утекших документов, раскрывающих источник, также зачищены (блоки 1 и 10).

Шаг 3. Создавайте открывающие вопросы с помощью ИИ. «Какие новости может скрывать этот набор данных?» Начни с того, что скажи. ИИ составляет список вопросов, которые следует задать: 10 самых популярных товаров, повторяющиеся поставщики, необычные прыжки, пустые области.

Шаг 4. НЕ ПОЗВОЛЯЙТЕ ИИ ПРОВОДИТЬ АНАЛИЗ, ОПИСАЙТЕ ЕГО. Это критический момент. Среднее значение или процент, который ИИ рассчитывает в уме, часто оказывается неправильным. Вместо этого попросите ИИ выполнить действия, которые вы бы выполнили с помощью надежного инструмента (формулы электронной таблицы, запроса, сценария). Таким образом, делая исчисление инструментом, поддающимся проверке, ИИ просто дает метод.

Шаг 5 — Проверьте выводы. Увидите каждую аномалию, на которую указывает ИИ, вернувшись к исходной строке. Отфильтруйте таблицу и посчитайте утверждение «Эта компания выиграла 31 тендер из 40». Любые непроверенные цифры не попадут в новости.

Шаг 6 — Установите контекст. Сама по себе цифра не является новостью. Сравнение (прошлый год, схожие институты, соотношение к населению), контекст и экспертное мнение – дело журналиста.

Внимание: когда ИИ говорит «вычислить среднее значение этой таблицы» и помещает результат непосредственно в новости, это самая распространенная ошибка в журналистике данных, приводящая к отказу от ответственности. ИИ — это языковая модель, а не калькулятор. Пусть инструмент выполнит математические расчеты, просто спросите у ИИ метод и интерпретацию.

Метаданные и анализ документов

Помимо числовых таблиц, журналистские расследования также имеют дело с большими текстовыми архивами: электронной почтой, протоколами, контрактами. Здесь ИИ может составлять карты взаимоотношений, такие как «кто с кем разговаривал, когда», «какая тема повторяется», «какие имена упоминаются вместе». Опять же, правило то же: ИИ дает исходную карту; Каждая ссылка подтверждается в исходном документе, поскольку ИИ может убедительно объяснить несуществующую ссылку.

три мини-кейса

Случай 1 — Скрытая конденсация. У репортера была таблица государственных закупок с 2400 строками. Он поручил ИИ задать исследовательские вопросы; Вопрос «сколько тендеров получил один и тот же поставщик?» вышел на первый план. Репортер не заставил ИИ это рассчитать; Он воспользовался формулой электронной таблицы, предложенной самим YZ, и обнаружил, что одна фирма получила 380 (15,8%) из 2400 товаров. Он проверил его вручную, и номер оказался верным. Первоначальная «оценка» ИИ говорила о 22% — так что, если бы ИИ можно было доверять, новости были бы неверными.

Случай 2 — Экономия времени, архив электронной почты. Чтобы вручную найти «какие темы обсуждаются» в архиве из 6000 электронных писем, потребовались бы дни. ИИ составил схему тематических кластеров за 15 минут; Из них репортер выбрал три многообещающих кластера и прочитал оригинальные электронные письма. Общее время поиска сократилось примерно до 3 дней, но каждое опубликованное предложение было дословно проверено на основе исходного электронного письма.

Случай 3 — Пойманная галлюцинация. Экономический репортер получил от YZ сводку о том, что «расходы на персонал увеличились на 60% за год» из балансового отчета. Когда он вернулся к исходной таблице, он увидел, что увеличение составило 6% и что ИИ неправильно прочитал одну цифру. Единственная проверка фактов заблокировала ложный и претенциозный заголовок типа «взрыв на 60%».

Копируемые шаблоны

1) Вопросы распознавания и обнаружения наборов данных:

Я дам вам заголовки столбцов и первые 20 строк набора данных. Создайте 10 журналистских вопросов, которые МОЖНО задать с помощью этих данных: с точки зрения концентрации, выбросов, скачка во времени, пропущенных/пустых областей, повторяющихся действующих лиц. Нет расчета чисел; просто напишите, какие вопросы стоит задать и почему они могут стать новостью. Данные: [заголовки + примеры строк]

2) Не производить расчеты, а заставлять их описывать:

Я хочу провести следующий анализ: [например. найдите общую сумму тендера и процентную долю каждого поставщика]. Я хочу запустить это сам в электронной таблице. Напишите мне пошагово, какие формулы/настройки поворотов установить. Результат расчета SEN; просто дайте метод. Мои столбцы: [имена столбцов]

3) Охота за выбросами:

Ниже я приведу сводную статистику (мин, максимум, среднее, медиана). Объясните, какие значения являются необычными/подозрительными и почему мне следует проверять их на наличие новостей. Не делайте окончательных суждений; Появится контрольный список в формате «следующие строки следует проверить вручную». Резюме: [здесь]

4) Карта взаимоотношений архива документов (черновик):

Я дам вам набор текста документа. Выведите следующее в виде ЧЕРНОВИКА: имена, которые часто встречаются вместе, повторяющиеся темы, примечательные даты. Отметьте документ, из которого взята каждая ссылка, например [B12]. Не добавляйте никаких отношений, которые явно не указаны в документе. Документация: [здесь]

Слабая подсказка / Сильная подсказка

Слабая подсказка: «Проанализируйте эту диаграмму и укажите все существенные выводы».

Результат: ИИ в лоб составляет проценты и средние значения, представляет себе аномалии, непонятно, на какой линии это основано. Это невозможно проверить.

Мощная подсказка: «Я даю столбцы и первые 20 строк этой таблицы. (1) Перечислите анализы, которые могут быть достойны освещения в печати. ​​(2) Предложите формулу электронной таблицы для каждого анализа, чтобы я мог ее запустить. (3) Не рассчитывайте никаких результатов. (4) Отметьте строки, которые нужно проверить, например [S45]».

Отличие: сильная подсказка оставляет вычисления контролируемому инструменту, сводя ИИ к роли метода и направления; предотвращает попадание галлюцинаций в число.

сравнительная таблица

Этап

ИИ делает

Журналист делает

проверка

Распознавание данных

Сводка по столбцу/шаблону

Знает единицу измерения и контекст

Словарь исходных данных

вопросы открытия

Формирует список вопросов

Выбирает ценность новости

расчет

Описывает метод

Запускает формулу в автомобиле

Ручная подготовка

выброс

отмечает кандидатов

Смотрит на необработанную строку

Фильтровать и считать

Комментарий/контекст

черновой кадр

Сравнение, эксперт

второй источник

Распространенные ошибки

  • Заставить ИИ рассчитывать. Искусственный интеллект рассчитывает среднее значение, процент, сумму и т. д. и использует результат; ИИ часто допускает ошибки, пусть машина сама делает расчеты.
  • Не соединяя находку с необработанной линией. Написание претензии «Данная компания выиграла большинство тендеров» без фильтрации таблицы и подсчета.
  • Публикация цифр без контекста. Сообщения о голых цифрах без сравнения и соотношения вводят в заблуждение.
  • Загрузка конфиденциальных данных как есть. Передача личных данных или документа, раскрывающего источник, на транспортное средство без его очистки.
  • Думая, что фальшивые отношения — правда. Обработка ссылки, которую ИИ «видит» в архиве, в карту без подтверждения ее в исходном документе.

В итоге

В журналистике данных ИИ является партнером по открытиям и познанию: он сканирует кучу, генерирует вопросы, которые нужно задать, описывает метод анализа, отмечает кандидатов на наличие отклонений. Но самая рискованная ошибка — заставить ИИ вычислить число самостоятельно; Передайте расчет проверяемому инструменту, проверяйте каждый результат, возвращаясь к необработанным данным, и добавляйте контекст и сравнение к числу. В архивах документов ИИ дает стартовую карту; Каждая ссылка подтверждена в оригинальном документе.

Задача приложения

Возьмите набор данных, который у вас есть (или общедоступен). Сначала попросите их сформулировать 10 вопросов с помощью подсказки «Исследовательские вопросы». Выберите вопрос, получите от ИИ формулу с подсказкой «Описать расчет» и запустите ее самостоятельно. Затем напрямую попросите ИИ выполнить тот же расчет и сравните два результата; Обратите внимание на разницу и ее урок.

контрольный список

  • [ ] Я понял столбцы, единицы измерения и конфиденциальные поля, прежде чем передать данные в инструмент.
  • [ ] Я не позволяю ИИ выполнять вычисления; Я описываю метод и запускаю его в проверяемом инструменте.
  • [ ] Я вручную проверяю каждый результат, возвращаясь к исходной строке.
  • [ ] Я добавляю к числу сравнение и контекст; Я не сообщаю голые цифры.
  • [ ] Я подтверждаю каждое родство в архиве в оригинальном документе.