единици
1. Изкуствен интелект в иконометрията и статистиката: роли, граници, автентификация и поверителност 2. Почистване и подготовка на данни: липсващи данни, отклонения и кодиране 3. Проучвателен анализ на данни и визуализация: Графика и интерпретация с изкуствен интелект 4. Линейна регресия: Изграждане на модел, тълкуване на коефициенти и предположения 5. Регресионна диагностика и нарушения: колинеарност, хетероскедастичност, автокорелация 6. Тестване на хипотеза и p-стойност: значимост, сила и множество сравнения 7. p-hacking, HARKing и статистическа цялост: Клопки в епохата на изкуствения интелект 8. Анализ на времеви редове: стационарност, ARIMA и прогнозиране 9. Причинно-следствена връзка и анализ на политиката: DiD, IV, RDD и изкуствен интелект 10. Генериране на код и възпроизводимост: R/Python, създаване на версии и възпроизводимост 11. Писане на доклади, комуникация и етика: Представяне на резултати и съобщаване на граници
единица 1 / 11

Изкуствен интелект в иконометрията и статистиката: роли, граници, автентификация и поверителност

Печалби:

  • Да можеш да разграничиш къде в емпиричния работен процес (почистване на данни, код, визуализация, интерпретация на чернова) изкуственият интелект спестява реално време и къде решения като избор на модел, твърдение за причинно-следствена връзка и решение за публикуване са оставени на експерта, според нивото на риска на задачата
  • Възможност за прилагане на дисциплина, която проверява всеки изход от изкуствен интелект (число, коефициент, код, коментар) чрез стъпките на преизчисляване, свързване с източника и статистическо филтриране.
  • Способност за безопасно обработване на микроданни и поверителни/лицензирани набори от данни в обхвата на KVKK/GDPR и споразумения за използване на данни и придобиване на навик за избор на подходящи инструменти.

Същите въпроси се повтарят всеки ден на бюрото на иконометрик или приложен статистик: надежден ли е този набор от данни; Какво да правим с тези липсващи стойности? Какво всъщност казва коефициентът на тази регресия? Дали тази връзка е причинно-следствена или просто корелационна? Тъй като тази p-стойност е значителна, мога ли да я напиша в статията или в краткото описание на политиката? Някои от тези въпроси се повтарят, изискват много код и отнемат време: почистване на данни, изчертаване на една и съща графика десет пъти, отстраняване на грешки в R или Python код, нанизване на резултатите в таблица. Други директно определят валидността на констатацията, честността на публикацията или точността на политическо решение.

Изкуственият интелект (AI накратко, AI - компютърни системи, които могат да създават текст и код като хората, да разпознават модели, да обобщават данни и да пишат коментари; най-използваната форма днес са големи езикови модели, тоест системи, които се обучават върху огромен текст и изграждат изречения, като предвиждат следващата дума) се намира точно в средата на тази таблица. Когато се използва правилно, той намалява часовете код за почистване на данни до минути, напомня ви за синтаксиса на сложен статистически тест или чертае интерпретацията на коефициент. Когато се използва неправилно, той представя привидно сигурно, но напълно изфабрикувано число, фалшиво значение или непричинно-следствена връзка като „констатация“.

Тази първа част не е въведение в софтуера. Целта му е да изясни къде да поставите AI във вашия емпиричен работен процес и къде никога да не го поставяте. Иконометрията е както „критична за метода“, така и косвено „критична за вземане на решение“ област: коефициентът на модел, който изграждате, може да бъде входяща информация за решението на централната банка за лихвения процент, промяна на политиката на регулатора или инвестиция от милиони долари на фирма. Нека изложим основния принцип от самото начало: Изкуственият интелект е асистент за анализ, а не изследовател. Отговорността за и окончателното одобрение на избора на модел, стратегията за идентификация, утвърждаването на причинно-следствената връзка, публикуването и политическите решения се носят от компетентния експерт.

Слоеве на емпиричния работен процес и мястото на AI

Полезно е емпиричното изследване да се раздели на три слоя. Слоят за изпълнение е ежедневната техническа работа: код за почистване на данни, чертане на графика, форматиране на таблица, отстраняване на грешки в синтаксиса. Слоят на метода е аналитичното решение: кой модел, коя стратегия за идентификация, кой тест, коя проверка на предположенията. Слоят на интерпретацията и вземането на решения е значението на констатациите: какво казва коефициентът, причинно-следствена връзка ли е, какво означава за политиката, трябва ли да бъде публикуван. AI докосва и трите слоя, но с различен авторитет във всеки. На изпълнителния слой AI бързо чертае и генерира код; На нивото на интерпретация и вземане на решения се дава само вход и експертът взема решение.

Нека дефинираме няколко основни термина от самото начало. Иконометрията е клонът, който анализира икономически и социални данни със статистически методи и измерва връзките. Регресията е метод, който числено моделира връзката на променлива на резултата (зависима променлива) с една или повече обяснителни променливи (независими променливи). Коефициентът е числото, което показва с колко единици промяна средно е свързана една единица промяна в обяснителна променлива в променливата на резултата. P-стойността е вероятността наблюдаваният резултат (или по-краен резултат) да възникне случайно, когато действително няма ефект. Ще обясним тези понятия едно по едно в следващите раздели; Засега знайте това: Във всички тези AI ви дава план, код и обяснение, но не взема научни решения.

Следната таблица обобщава ролята и нивото на риск на AI по мисии:

Мисия

Роля на AI

Ниво на риск

Кой одобрява

Писане на код за дезинфекция на данни

генератор на кодове

ниско

Самият анализатор (с тестване на код)

Чернова на диаграма/таблица

генератор на скици

ниско

анализатор

Напомняне за синтаксис на тест/модел

Помощник справка

ниско-средно

анализатор

Тълкуване на проектния коефициент

писател на чернови

среден

иконометрист

Избор на стратегия за модел/идентификация

спомагателен вход

високо

експерт изследовател

Причинно-следствена връзка

Само чернова, никога последната дума

много високо

Експерт + партньорска проверка

Публикация/политическо решение

само вход

много високо

Отговорен изследовател/институция

Имайте предвид един ред в тази таблица: с нарастването на риска ролята на AI се свива и одобрението на експертите нараства.

Защо "проверката" е сърцето на този бизнес

Езиковите модели изглеждат уверени в отговора си, но може и да не са сигурни. На технически език това се нарича халюцинация: това е измислянето от модела на несъществуваща информация в плавно изречение, точно както ако е истина. За един иконометрист това е смъртоносен капан. Моделът може да ви даде точно число, като например „Корелацията между безработицата и инфлацията в Турция между 2015-2020 г. е 0,62“; Той обаче никога не е виждал вашите данни и това число е напълно измислено. Или може да пише: „p-стойността на белия тест е 0,03“; като има предвид, че не е провеждал никакви тестове. Може да извика R функция с аргумент, който всъщност не съществува. Той пее и трите с еднаква плавност; Единственото нещо, което разделя правилното от грешното, е вашето знание и вашият навик да проверявате.

Дисциплината за проверка се състои от три стъпки:

  1. Преизчислете/изпълнете във вашата собствена среда: Изчислете всяко число, съотношение, резултат от теста и коефициент, дадени от AI ​​в R/Python с вашите собствени данни, а не от паметта на AI. Използвайте AI, за да напишете кода, а не да запомните резултата. Стартирайте кода, произвеждате изхода.
  2. Връзка към източника: Разчитайте на учебници, статии за методи и официални документи за правила, формули и дефиниции на методите. Потвърдете изявлението на AI „предположението на този тест е“ с надежден източник.
  3. Статистически филтър: Тествайте с експертни очи дали резултатът противоречи на статистическата логика (предположения, извадка, размер на ефекта, несигурност). Отхвърлете „смислен, но абсурден“ резултат.
Внимание: Поставянето на генериран от AI коефициент, тест или интерпретация в статия, теза или бележка за политиката, без да го валидирате, е като публикуване на непрегледана констатация. Само защото изходът е плавен, не е вярно; Просто защото числото изглежда сигурно, то не е реално.

Поверителност: микро данните и лицензираните данни са защитени частно

Микроданните (единични записи на ниво индивид, домакинство, фирма или пациент) често се използват в иконометрията. Повечето от тези данни са лични данни и са защитени от KVKK (Закон за защита на личните данни) в Турция и GDPR в Европа. Освен това TurkStat, централните банки, доставчиците на панелни данни и търговски източници често предоставят данни със споразумение за използване на данни; Тези споразумения забраняват прехвърлянето на данни към трети страни. Поставянето на таблица, съдържаща информация за самоличност, доходи, здраве или фирмени тайни в публичен AI чат инструмент е както нарушение на KVKK/GDPR, така и нарушение на договора; тъй като данните отиват на външен сървър и могат да се използват при обучение на модели в някои инструменти.

Правилото е просто: съхранявайте данните в тяхната собствена безопасна среда, питайте AI само за код и методи. Идеалният работен процес е следният: попитайте AI за кода за анализ, стартирайте кода с реалните данни на вашия собствен компютър/корпоративен сървър. Ако наистина трябва да споделяте данни, анонимизирайте (премахнете ID полетата), агрегирайте (средно/преброяване, а не индивидуално) и изберете инструменти, които са институционални, имате споразумение за обработка на данни и не използвайте вашите данни в образованието.

три мини калъфа

Случай 1 — Безопасна и ефективна употреба. Един изследовател първо прекара 6 часа ръчно в почистване на 40 000 реда с данни за домакинския бюджет. Без изобщо да споделя данните, той просто описа имената и структурата на променливите на AI и поиска код за почистване. AI генерира R скрипт; Изследователят пусна кода в собствената си среда, провери броя на редовете и обобщената статистика на всяка стъпка и поправи две логически грешки. Продължителност: 70 минути вместо 6 часа. Данните никога не са излезли; Отговорността оставаше на изследователя.

Случай 2 — Прихващане на непроверени номера. „Каква е еластичността между растежа на БВП и преките чуждестранни инвестиции“, попита AI студент. AI уверено даде число от "около 0,34", въпреки че нямаше достъп до никакви данни. Студентът е написал това в резюмето по литература; Когато съветникът му попитал за източника, се оказало, че числото няма основание и е напълно измислено. Грешка: Очаквайте конкретна статистика от AI, без да му предоставяте данни и ресурси.

Случай 3 — Поверителност и нарушаване на договора. Анализатор качи Excel, който получи от лицензирана компания, панел, съдържащ името на компанията и оборота, в публично достъпен AI инструмент и каза „направете регресия на панела“. Договорът на доставчика на данни забранява прехвърлянето на данни към системи на трети страни; Инцидентът предизвика преглед на съответствието. Правилният начин беше да се заменят имената на компаниите с анонимни кодове или да не се споделят данни, а само да се поиска регресионният код на панела и да се стартира в собствена среда.

Слаба подкана / Силна подкана

Слаба подкана:

Анализирайте връзката между инфлацията и безработицата и посочете коефициента.

Това твърдение е погрешно: Не са дадени данни на AI, не е ясно коя държава, кой период, кой модел. AI може да отговори само с измислен коефициент.

Мощна подкана:

Вашата роля: вие сте асистент в анализа, който помага на изследователя по иконометрия. НЕ споделям данните с вас; Просто искам RUNNABLE R код. Имам годишен панел: променливи държава, година, безработица, инфлация (всички цифрови). Задача: 1) напишете регресионен код на панел с фиксирани ефекти за безработица ~ инфлация (пакет plm), 2) обяснете всяка стъпка в кода с ред за коментар, 3) отбележете, че коефициентът трябва да се интерпретира като релационен, а не ПРИЧИННО-СЛЕДСТВЕН, 4) съставете аргумента на функцията, за който не сте сигурни; Ще стартирам и ще проверя резултата в собствената си среда.

В тази заявка не се споделят данни, ролята, пакетите, очакването на коментари и забраната за „измисляне“ са ясни. Все още изпълнявате и проверявате изхода сами.

Следната таблица обобщава правилата за едно изречение в този урок:

принцип

Какво значи

AI е асистент

Научното решение и отговорност принадлежат на експерта

Поискайте кода, изведете резултата

AI не помни номера; пускаш го и изчисляваш

пазете данни

Микро/лицензираните данни не напускат защитената среда

проверявам

Всеки проблем, код, коментар се проверяват; измислицата се отхвърля

Често срещани грешки

  • Очаквайте конкретна статистика от AI, без да давате данни. Моделът няма достъп до данните; Коефициентът, корелацията и p-стойността, които дава, са фалшиви. Винаги изисквайте кода и получете резултата сами.
  • Разчитане на халюцинаторни функции. AI може да предложи R/Python функция или аргумент, който не съществува. Не приемайте кода, без да го стартирате и проверите.
  • Качване на микроданни в публичен инструмент. Това е нарушение на KVKK/GDPR и споразумението за използване на данни. Анонимизирайте данните или изобщо не ги споделяйте.
  • Грешка за плавност с точност. Една добре написана рецензия може да е неточна. Красотата на изречението не е доказателство.
  • Приемане на каузален език без контрол. YZ често казва „X увеличава Y“; докато повечето регресии показват само връзки. Защитете каузалното твърдение с дизайн.
Съвет: Когато работите с AI, задайте си следния въпрос: „Ако съдия или одитор поиска този изход, мога ли да покажа източника и сметката?“ Ако отговорът е не, изходът все още не е готов за използване.

В обобщение

AI осигурява истинско и масивно ускорение в слоя за изпълнение (код, почистване, графика, чернова) на работния поток на иконометрията и статистиката; обаче изборът на модел, причинно-следствената връзка, тълкуването, публикуването и политическите решения принадлежат на експерта. Три основни дисциплини: не напомняйте на AI за номера, поискайте кода и сами генерирайте и проверете резултата; не премахвайте микро/лицензирани данни от защитената среда; статистически филтър за всеки изход. Непровереният резултат от AI е също толкова рискован, колкото и непрегледаното откритие.

Задача за приложение

Помислете за свой собствен (или примерен) набор от данни. Помолете AI за R или Python код, който произвежда описателна статистика и проста графика, като просто описва променливата структура, без да споделя данните. Стартирайте входящия код във вашата собствена среда. След това запазете контролен списък: (1) дали кодът работи без грешки, (2) е броят на редовете/наблюденията, както очаквахте, (3) кое от коментарните изречения на AI използва причинно-следствен език и трябва да бъде коригирано. В един параграф напишете за времето, когато AI ви е спасил и поне една грешка, която сте хванали.

контролен списък

  • [ ] Не накарах AI да иска конкретна статистика; Поисках кода и сам създадох резултата.
  • [ ] Преизчислих всяко число и резултат от тест, който даде в моята собствена среда.
  • [ ] Проверих, че функциите/аргументите, които използва, действително съществуват.
  • [ ] Не съм качил микро/лични/лицензирани данни в публичен инструмент.
  • [ ] Маркирах коментарите, съдържащи причинно-следствен език, и ги преместих на релационен език.
  • [ ] Мога да покажа източника и отчитането на изхода на одитор.