Единицы
1. Искусственный интеллект в эконометрике и статистике: роли, границы, аутентификация и конфиденциальность 2. Очистка и подготовка данных: недостающие данные, выбросы и кодирование 3. Исследовательский анализ и визуализация данных: построение графиков и интерпретация с помощью искусственного интеллекта 4. Линейная регрессия: построение модели, интерпретация коэффициентов и предположения 5. Регрессионная диагностика и нарушения: коллинеарность, гетероскедастичность, автокорреляция 6. Проверка гипотез и значение p: значимость, мощность и множественные сравнения 7. p-хакинг, HARKing и статистическая достоверность: подводные камни в эпоху искусственного интеллекта 8. Анализ временных рядов: стационарность, ARIMA и прогнозирование 9. Причинно-следственная связь и анализ политики: DiD, IV, RDD и искусственный интеллект 10. Генерация кода и воспроизводимость: R/Python, управление версиями и воспроизводимость 11. Написание отчета, общение и этика: представление результатов и границы сообщения
Единица 1 / 11

Искусственный интеллект в эконометрике и статистике: роли, границы, аутентификация и конфиденциальность

Прибыль:

  • Способность различать, где в эмпирическом рабочем процессе (очистка данных, код, визуализация, черновая интерпретация) искусственный интеллект экономит время в реальном времени, а где такие решения, как выбор модели, утверждение о причинно-следственной связи и решение о публикации, оставляются на усмотрение эксперта, в зависимости от уровня риска задачи.
  • Возможность применять дисциплину, которая проверяет каждый вывод искусственного интеллекта (число, коэффициент, код, комментарий) посредством этапов пересчета, привязки к источнику и статистической фильтрации.
  • Способность безопасно обрабатывать микроданные и конфиденциальные/лицензионные наборы данных в рамках KVKK/GDPR и соглашений об использовании данных, а также приобретать привычку выбирать подходящие инструменты.

Одни и те же вопросы возникают каждый день на столе специалиста по эконометрике или прикладной статистике: надежен ли этот набор данных; Что делать с этими недостающими значениями? О чем на самом деле говорит коэффициент этой регрессии? Является ли эта связь причинно-следственной или просто корреляционной? Поскольку это значение p значимо, могу ли я указать его в статье или аналитическом обзоре? Некоторые из этих вопросов повторяются, требуют большого количества кода и отнимают много времени: очистка данных, построение одного и того же графика десять раз, отладка кода R или Python, объединение результатов в таблицу. Другие напрямую определяют достоверность результатов, честность публикации или точность политического решения.

Искусственный интеллект (сокращенно ИИ, ИИ — компьютерные системы, которые могут генерировать текст и код, как люди, распознавать закономерности, суммировать данные и писать комментарии; наиболее используемой формой сегодня являются большие языковые модели, то есть системы, которые обучаются на огромном тексте и строят предложения, предсказывая следующее слово) находится прямо в середине этой таблицы. При правильном использовании он сокращает часы работы кода очистки данных до минут, напоминает синтаксис сложного статистического теста или дает возможность интерпретировать коэффициент. При неправильном использовании он представляет собой, казалось бы, достоверное, но полностью сфабрикованное число, ложное значение или непричинную связь как «находку».

Этот первый раздел не является введением в программное обеспечение. Его цель — прояснить, где использовать ИИ в вашем эмпирическом рабочем процессе, а где его никогда не использовать. Эконометрика является одновременно «методически-критической» и косвенно «критичной к принятию решений» областью: коэффициент модели, которую вы строите, может быть исходной информацией для решения центрального банка по процентной ставке, изменения политики регулятора или инвестиций фирмы в миллион долларов. Давайте с самого начала изложим основной принцип: искусственный интеллект — помощник в анализе, а не исследователь. Ответственность за и окончательное утверждение выбора модели, стратегии идентификации, установления причинно-следственной связи, публикации и политических решений лежит на компетентном эксперте.

Слои эмпирического рабочего процесса и место ИИ

Полезно разделить эмпирическое исследование на три слоя. Уровень исполнения — это ежедневная техническая работа: очистка кода данных, построение графиков, форматирование таблиц, отладка синтаксиса. Слой метода — это аналитическое решение: какая модель, какая стратегия идентификации, какой тест, какая проверка предположений. Уровень интерпретации и принятия решений – это смысл выводов: о чем говорит коэффициент, является ли он причинно-следственным, какое значение он имеет для политики, если он будет опубликован. ИИ затрагивает все три уровня, но на каждом из них он имеет разную власть. На уровне исполнения ИИ быстро разрабатывает и генерирует код; На уровне интерпретации и принятия решений подаются только входные данные, и решение принимает эксперт.

Давайте для начала определим несколько основных терминов. Эконометрика — это отрасль, которая анализирует экономические и социальные данные с помощью статистических методов и измеряет взаимосвязи. Регрессия — это метод, который численно моделирует взаимосвязь результирующей переменной (зависимой переменной) с одной или несколькими объясняющими переменными (независимыми переменными). Коэффициент — это число, которое показывает, с каким количеством единиц изменения в среднем связано изменение на одну единицу объясняющей переменной в выходной переменной. Значение p — это вероятность того, что наблюдаемый результат (или более экстремальный результат) возникнет случайно, когда на самом деле никакого эффекта не существует. Мы объясним эти концепции одно за другим в следующих разделах; А пока знайте следующее: во всех этих случаях ИИ дает вам план, код и объяснения, но не принимает научных решений.

В следующей таблице суммированы роль и уровень риска ИИ по миссиям:

Квест

Роль ИИ

Уровень риска

Кто одобряет

Написание кода очистки данных

генератор кода

низкий

Сам аналитик (с тестированием кода)

Проект диаграммы/таблицы

генератор эскизов

низкий

аналитик

Напоминание о синтаксисе теста/модели

Справочный помощник

низкий-средний

аналитик

Интерпретация проекта коэффициента

автор черновика

средний

эконометрик

Выбор модели/стратегии идентификации

вспомогательный вход

высокий

эксперт-исследователь

Причинно-следственная связь

Просто черновик, а не последнее слово

очень высокий

Эксперт + экспертная оценка

Публикация/политическое решение

только ввод

очень высокий

Ответственный исследователь/учреждение

Имейте в виду одну строку в этой таблице: по мере роста риска роль ИИ уменьшается, а одобрение экспертов растет.

Почему «верификация» является сердцем этого бизнеса

Языковые модели кажутся уверенными в своем ответе, но они могут и не быть в этом уверены. На техническом языке это называется галлюцинацией: это фабрикация модели несуществующей информации в беглом предложении, как если бы она была правдой. Для специалиста по эконометрике это смертельная ловушка. Модель может дать вам точное число, например: «Корреляция между безработицей и инфляцией в Турции в период 2015-2020 годов составляет 0,62»; Однако он никогда не видел ваших данных и эта цифра полностью выдумана. Или там может быть написано: «Р-значение теста Уайта составило 0,03»; тогда как он не проводил никаких тестов. Он может вызвать функцию R с аргументом, которого на самом деле не существует. Он поет все три с одинаковой беглостью; Единственное, что отличает правильное от неправильного, — это ваши знания и привычка проверять.

Проверочная дисциплина состоит из трех этапов:

  1. Пересчитать/запустить в своей собственной среде: Рассчитайте каждое число, соотношение, результат теста и коэффициент, заданные ИИ в R/Python, с помощью собственных данных, а не из памяти ИИ. Используйте ИИ для написания кода, а не для запоминания результата. Запустите код, вы получите результат.
  2. Ссылка на источник: правила, формулы и определения методов можно найти в учебниках, статьях о методах и официальных документах. Подтвердите заявление ИИ «предположением этого теста» с помощью надежного источника.
  3. Статистический фильтр: экспертным взглядом проверьте, противоречат ли выходные данные статистической логике (предположения, выборка, размер эффекта, неопределенность). Отклонить «значимый, но абсурдный» результат.
Внимание: размещение коэффициента, теста или интерпретации, созданного ИИ, в статье, диссертации или аналитической записке без их проверки равносильно публикации непроверенных результатов. Тот факт, что вывод является плавным, не соответствует действительности; Просто потому, что число кажется определенным, оно нереально.

Конфиденциальность: микроданные и лицензионные данные защищены конфиденциально.

Микроданные (отдельные записи на уровне отдельного человека, домохозяйства, фирмы или пациента) часто используются в эконометрике. Большая часть этих данных является личными данными и защищена KVKK (Законом о защите персональных данных) в Турции и GDPR в Европе. Кроме того, Туркстат, центральные банки, поставщики панельных данных и коммерческие источники часто предоставляют данные на основании соглашения об использовании данных; Эти соглашения запрещают передачу данных третьим лицам. Вставка таблицы, содержащей информацию о личности, доходах, здоровье или секретах компании, в общедоступный инструмент чата с искусственным интеллектом является одновременно нарушением KVKK/GDPR и нарушением договора; потому что данные поступают на внешний сервер и могут использоваться при обучении модели в некоторых инструментах.

Правило простое: храните данные в собственной безопасной среде, запрашивайте у ИИ только код и методы. Идеальный рабочий процесс таков: запросите у ИИ код анализа, вы запускаете код с реальными данными на своем собственном компьютере/сервере предприятия. Если вам действительно необходимо делиться данными, анонимизируйте (удаляйте поля идентификатора), агрегируйте (среднее/количество, а не индивидуальное) и выбирайте институциональные инструменты, имеющие соглашение об обработке данных и не используйте свои данные в образовании.

три мини-кейса

Случай 1. Безопасное и эффективное использование. Один исследователь сначала потратил 6 часов на очистку вручную 40 000 строк данных о семейном бюджете. Вообще не делясь данными, он просто описал ИИ имена и структуру переменных и попросил код очистки. ИИ сгенерировал R-скрипт; Исследователь запустил код в своей среде, проверил количество строк и сводную статистику каждого шага и исправил две логические ошибки. Продолжительность: 70 минут вместо 6 часов. Данные так и не исчезли; Ответственность осталась за исследователем.

Случай 2 — Ловушка непроверенного номера. «Какова эластичность между ростом ВВП и прямыми иностранными инвестициями?» — спросил у AI аспирант. ИИ уверенно выдал цифру «около 0,34», хотя доступа к каким-либо данным у него не было. Студент написал это в конспекте литературы; Когда его советник спросил об источнике, оказалось, что эта цифра не имеет под собой никаких оснований и полностью сфабрикована. Ошибка: ожидать от ИИ конкретной статистики, не предоставляя ему данных и ресурсов.

Случай 3 — Конфиденциальность и нарушение договора. Аналитик загрузил Excel, полученный им от лицензированной панели компании, содержащий название компании и оборот, в общедоступный инструмент искусственного интеллекта и сказал: «Сделайте регрессию панели». Контракт поставщика данных запрещает передачу данных в сторонние системы; Инцидент повлек за собой проверку соответствия. Правильным способом было заменить названия компаний анонимными кодами или не делиться данными, а только запросить код регрессии панели и запустить его в собственной среде.

Слабая подсказка / Сильная подсказка

Слабая подсказка:

Проанализируйте связь между инфляцией и безработицей и укажите коэффициент.

Это утверждение неверно: никаких данных об ИИ предоставлено не было, непонятно, какая страна, какой период, какая модель. ИИ может ответить только выдуманным коэффициентом.

Мощная подсказка:

Ваша роль: вы — ассистент по анализу, помогающий исследователю-эконометрике. Я НЕ передаю вам данные; Мне просто нужен код RUNNABLE R. У меня есть годовая панель: переменные страна, год, безработица, инфляция (все числовые). Задача: 1) написать код регрессии панели с фиксированными эффектами для безработицы ~ инфляции (пакет plm), 2) объяснить каждый шаг кода строкой комментария, 3) отметить, что коэффициент следует интерпретировать как реляционный, а не ПРИЧИННЫЙ, 4) составить аргумент функции, в отношении которого вы не уверены; Я запущу и проверю результат в своей среде.

В этом запросе никакие данные не передаются, понятна роль, пакеты, ожидание комментариев и запрет на «фабрикацию». Вы все равно запускаете и проверяете вывод самостоятельно.

В следующей таблице приведены правила использования одного предложения в этом уроке:

принцип

Что это значит

ИИ — помощник

Научное решение и ответственность принадлежат эксперту

Запросите код, получите результат

ИИ не запоминает номер; ты запускаешь его и вычисляешь

хранить данные

Микро/лицензионные данные не покидают безопасную среду

проверить

Проверяется каждая проблема, код, комментарий; изготовление отклонено

Распространенные ошибки

  • Ожидание конкретной статистики от ИИ без предоставления данных. Модель не может получить доступ к данным; Коэффициент, корреляция и значение p, которые он дает, являются поддельными. Всегда запрашивайте код и получайте результат самостоятельно.
  • Опираясь на галлюцинаторные функции. ИИ может предложить несуществующую функцию или аргумент R/Python. Не принимайте код, не запустив и не проверив его.
  • Загрузка микроданных в общедоступный инструмент. Это нарушение KVKK/GDPR и соглашения об использовании данных. Анонимизируйте данные или не делитесь ими вообще.
  • Принимаю беглость за точность. Хорошо написанный отзыв может быть неточным. Красота предложения не является доказательством.
  • Принятие причинного языка без контроля. YZ часто говорит: «X увеличивает Y»; тогда как большинство регрессий показывают только отношения. Защитите причинно-следственную связь с помощью дизайна.
Совет: Работая с ИИ, задайте себе такой вопрос: «Если рецензент или аудитор попросит этот результат, могу ли я показать источник и учетную запись?» Если ответ отрицательный, выходные данные еще не готовы к использованию.

В итоге

ИИ обеспечивает реальное и значительное ускорение на уровне выполнения (код, очистка, график, черновик) рабочего процесса эконометрики и статистики; однако выбор модели, причинно-следственная связь, интерпретация, публикация и политические решения принадлежат эксперту. Три основных дисциплины: не напоминайте ИИ номер, запрашивайте код и самостоятельно генерируйте и проверяйте результат; не удаляйте микро/лицензионные данные из безопасной среды; статистический фильтр каждого выхода. Непроверенные результаты ИИ так же опасны, как и непроверенные выводы.

Задача приложения

Рассмотрим ваш собственный (или примерный) набор данных. Запросите у ИИ код R или Python, который создает описательную статистику и простой график, просто описывая структуру переменной, не передавая данные. Запустите входящий код в своей среде. Затем сохраните контрольный список: (1) выполнился ли код без ошибок, (2) сколько строк/наблюдений соответствует вашим ожиданиям, (3) какое из предложений комментариев ИИ использует каузальный язык и должно быть исправлено. В одном абзаце напишите о том, как вас спас ИИ, и хотя бы об одной обнаруженной вами ошибке.

контрольный список

  • [ ] Я не заставлял ИИ запрашивать конкретную статистику; Я запросил код и сам выдал результат.
  • [ ] Я пересчитал каждое число и результат теста, который он дал в моей собственной среде.
  • [ ] Я проверил, что используемые им функции/аргументы действительно существуют.
  • [ ] Я не загружал микро/личные/лицензионные данные в общедоступный инструмент.
  • [ ] Я пометил комментарии, содержащие причинный язык, и перенес их на реляционный язык.
  • [ ] Я могу показать источник и учет результатов аудитору.