Бірліктер
1. Эконометрика және статистикадағы жасанды интеллект: рөлдер, шекаралар, аутентификация және құпиялылық 2. Деректерді тазалау және дайындау: жетіспейтін деректер, ауытқулар және кодтау 3. Зерттеу деректерін талдау және визуализация: жасанды интеллект көмегімен графикалық және интерпретация 4. Сызықтық регрессия: модель құру, коэффициентті түсіндіру және болжамдар 5. Регрессиялық диагностика және бұзушылықтар: коллинеарлық, гетероскедастық, автокорреляция 6. Гипотезаны тексеру және p-мәні: маңыздылық, қуат және бірнеше салыстыру 7. p-hacking, HARKing және статистикалық тұтастық: жасанды интеллект дәуіріндегі қателіктер 8. Уақыт сериясын талдау: стационарлық, ARIMA және болжау 9. Себептер мен саясатты талдау: DiD, IV, RDD және жасанды интеллект 10. Кодты жасау және қайта шығару: R/Python, нұсқалау және қайта шығару 11. Есепті жазу, коммуникация және этика: нәтижелерді ұсыну және шекараларды жеткізу
Бірлік 1 / 11

Эконометрика және статистикадағы жасанды интеллект: рөлдер, шекаралар, аутентификация және құпиялылық

Табыстар:

  • Жасанды интеллект эмпирикалық жұмыс процесінде қай жерде (деректерді тазалау, код, визуализация, жобалық интерпретация) нақты уақытты үнемдейтінін және тапсырманың тәуекел деңгейіне сәйкес модель таңдау, себеп-салдарлық шағым және жариялау шешімі сияқты шешімдерді сарапшыға қалдыратынын ажырата білу.
  • Қайта есептеу, дереккөзге байланыстыру және статистикалық сүзгілеу қадамдары арқылы жасанды интеллекттің әрбір нәтижесін (сан, коэффициент, код, түсініктеме) тексеретін пәнді қолдану мүмкіндігі.
  • KVKK/GDPR және деректерді пайдалану келісімдері аясында микро деректерді және құпия/лицензияланған деректер жиынын қауіпсіз өңдеу мүмкіндігі және сәйкес құралдарды таңдау әдетіне ие болу.

Эконометрик немесе қолданбалы статистик үстелінде сол сұрақтар күн сайын қайталанады: Бұл деректер жинағы сенімді ме? Бұл жетіспейтін құндылықтармен не істеу керек? Бұл регрессия коэффициенті шын мәнінде не айтады? Бұл қарым-қатынас себепті ме, әлде жай корреляциялық па? Бұл p-мәні маңызды болғандықтан, оны мақалада немесе саясаттың қысқаша мазмұнында жаза аламын ба? Бұл сұрақтардың кейбірі қайталанатын, кодты қажет етеді және уақытты қажет етеді: деректерді тазалау, бір графикті он рет салу, R немесе Python кодын жөндеу, нәтижелерді кестеге енгізу. Басқалары тұжырымның дұрыстығын, жарияланымның шынайылығын немесе саяси шешімнің дәлдігін тікелей анықтайды.

Жасанды интеллект (қысқаша айтқанда, AI - адамдар сияқты мәтін мен кодты шығара алатын, үлгілерді танитын, деректерді жинақтайтын және түсініктеме жаза алатын компьютерлік жүйелер; бүгінгі таңда ең көп қолданылатын түрі - үлкен тілдік модельдер, яғни үлкен мәтін бойынша оқытылатын және келесі сөзді болжау арқылы сөйлем құрайтын жүйелер) осы кестенің дәл ортасында орналасқан. Дұрыс пайдаланған кезде ол деректерді тазалау кодының сағаттарын минуттарға дейін қысқартады, күрделі статистикалық сынақтың синтаксисін еске салады немесе коэффициенттің түсіндірме жобасын жасайды. Қате қолданылғанда ол сенімді болып көрінетін, бірақ толығымен ойдан шығарылған санды, жалған мәнді немесе себеп-салдарлық емес байланысты «табу» ретінде көрсетеді.

Бұл бірінші блок бағдарламалық құралға кіріспе емес. Оның мақсаты - эмпирикалық жұмыс процесінде AI-ны қайда қою керектігін және оны ешқашан қайда қою керектігін түсіндіру. Эконометрика «әдіс-сыни» және жанама түрде «шешім қабылдау үшін маңызды» өріс болып табылады: сіз құрастырған модельдің коэффициенті орталық банктің пайыздық мөлшерлеме туралы шешіміне, реттеушінің саясатын өзгертуге немесе фирманың миллион долларлық инвестициясына кіріс болуы мүмкін. Негізгі қағиданы басынан бастап көрсетейік: Жасанды интеллект - зерттеуші емес, талдаушы көмекшісі. Модельді таңдау, сәйкестендіру стратегиясы, себеп-салдарлық байланыстарды бекіту, жариялау және саяси шешімдер үшін жауапкершілік және түпкілікті бекіту құзыретті сарапшыға жүктеледі.

Эмпирикалық жұмыс үрдісінің қабаттары және АИ орны

Эмпирикалық зерттеуді үш қабатқа бөлу пайдалы. Орындау деңгейі күнделікті техникалық жұмыс болып табылады: деректерді тазалау коды, графикті сызу, кестені пішімдеу, синтаксисті жөндеу. Әдіс деңгейі аналитикалық шешім болып табылады: қандай модель, қандай сәйкестендіру стратегиясы, қандай тест, қандай болжамды тексеру. Түсіндіру және шешім қабаты қорытындылардың мәні болып табылады: коэффициент не дейді, ол себептілік пе, саясат үшін нені білдіреді, оны жариялау керек. AI барлық үш қабатқа да әсер етеді, бірақ әрқайсысында әртүрлі өкілеттіктер бар. Орындау деңгейінде AI тез жобаны жасайды және кодты жасайды; Түсіндіру және шешім деңгейінде тек кіріс беріледі және сарапшы шешім қабылдайды.

Басынан бастап бірнеше негізгі терминдерді анықтайық. Эконометрика – экономикалық және әлеуметтік деректерді статистикалық әдістермен талдайтын және өзара байланыстарды өлшейтін сала. Регрессия - нәтиже айнымалысының (тәуелді айнымалының) бір немесе бірнеше түсіндірмелі айнымалылармен (тәуелсіз айнымалылар) байланысын сандық түрде модельдейтін әдіс. Коэффицент – түсіндірмелі айнымалыдағы бір бірлік өзгерістің нәтиже айнымалысында орташа қанша өзгеріс бірлігімен байланысты екенін көрсететін сан. p-мәні - байқалған нәтиженің (немесе одан да экстремалды нәтиженің) ешқандай әсер болмаған кезде кездейсоқ пайда болу ықтималдығы. Бұл ұғымдарды келесі бірліктерде бір-бірлеп түсіндіреміз; Әзірге мынаны біліңіз: Бұлардың барлығында AI сізге жобаны, кодты және түсініктеме береді, бірақ ол ғылыми шешімдер қабылдамайды.

Төмендегі кесте миссия бойынша AI рөлі мен тәуекел деңгейін жинақтайды:

Квест

АИ рөлі

Тәуекел деңгейі

Кім мақұлдайды

Деректерді зарарсыздандыру кодын жазу

код генераторы

төмен

Аналитиктің өзі (кодты тестілеу арқылы)

Диаграмма/кесте жобасы

эскиз генераторы

төмен

талдаушы

Сынақ/үлгі синтаксисін еске салғыш

Анықтамалық көмекші

төмен-орта

талдаушы

Коэффицент жобасының интерпретациясы

жоба авторы

орташа

эконометрик

Модель/сәйкестендіру стратегиясын таңдау

көмекші кіріс

жоғары

сарапшы зерттеуші

Себеп-салдарлық шағым

Тек жоба, ешқашан соңғы сөз емес

өте жоғары

Сарапшы + әріптестік шолу

Жарияланым/саясат шешімі

тек енгізу

өте жоғары

Жауапты тергеуші/мекеме

Осы кестедегі бір жолды есте сақтаңыз: тәуекел өскен сайын AI рөлі қысқарады және сарапшылардың мақұлдауы өседі.

Неліктен «тексеру» бұл бизнестің жүрегі болып табылады

Тілдік модельдер өз жауабына сенімді болып көрінеді, бірақ олар сенімді болмауы мүмкін. Техникалық тілде бұл галлюцинация деп аталады: бұл модельдің жоқ ақпаратты еркін сөйлемде, дәл солай шындық сияқты ойлап табуы. Эконометрик үшін бұл өлімге әкелетін тұзақ. Модель сізге нақты санды бере алады, мысалы, «Түркиядағы жұмыссыздық пен инфляция арасындағы 2015-2020 жылдар арасындағы корреляция 0,62»; Дегенмен, ол сіздің деректеріңізді ешқашан көрмеген және бұл нөмір толығымен жасалған. Немесе «Ақ тест p-мәні 0,03 болды» деп айтуы мүмкін; бірақ ол ешқандай сынақ жүргізбеді. Ол шын мәнінде жоқ аргументпен R функциясын шақыра алады. Үшеуін де бір ырғақпен айтады; Жақсы мен бұрысты ажырататын жалғыз нәрсе - сіздің біліміңіз бен тексеру әдетіңіз.

Тексеру пәні үш кезеңнен тұрады:

  1. Өз ортаңызда қайта есептеңіз / іске қосыңыз: R/Python-да AI берген әрбір санды, қатынасты, сынақ нәтижесін және коэффициентті AI жадынан емес, өз деректеріңізбен есептеңіз. Нәтижені есте сақтау үшін емес, кодты жазу үшін AI пайдаланыңыз. Кодты іске қосыңыз, сіз нәтиже шығарасыз.
  2. Дереккөзге сілтеме: Әдіс ережелері, формулалар және анықтамалар үшін оқулықтарға, әдістер мақалаларына және ресми құжаттарға сүйеніңіз. AI-ның «бұл сынақтың болжамы» деген мәлімдемесін сенімді көзбен растаңыз.
  3. Статистикалық сүзгі: Шығарылымның статистикалық логикаға қайшы келетін-келмейтінін сарапшы көзімен тексеріңіз (болжамдар, үлгі, әсер мөлшері, белгісіздік). «Мағыналы, бірақ абсурдты» нәтижеден бас тартыңыз.
Абайлаңыз: AI жасаған коэффициентті, сынақты немесе интерпретацияны мақалаға, тезиске немесе саясат жазбасына растамай қою қаралмаған нәтижені жариялаумен бірдей. Шығару еркін болғандықтан ғана дұрыс емес; Сан белгілі болып көрінгендіктен, ол нақты емес.

Құпиялық: микродеректер мен лицензияланған деректер жеке қорғалады

Микродеректер (жеке, үй шаруашылығы, фирма немесе пациент деңгейіндегі бір жазбалар) эконометрикада жиі пайдаланылады. Бұл деректердің көпшілігі жеке деректер болып табылады және Түркияда KVKK (Жеке деректерді қорғау заңы) және Еуропадағы GDPR бойынша қорғалған. Бұған қоса, ТүркСтат, орталық банктер, панельдік деректер жеткізушілері және коммерциялық көздер деректерді пайдалану келісімімен деректерді жиі қамтамасыз етеді; Бұл келісімдер деректерді үшінші тұлғаларға беруге тыйым салады. Жеке басын куәландыратын ақпарат, кіріс, денсаулық немесе компания құпиялары бар кестені жалпыға ортақ AI чат құралына қою KVKK/GDPR және келісім-шартты бұзу болып табылады; себебі деректер сыртқы серверге өтеді және кейбір құралдарда модельді оқытуда пайдаланылуы мүмкін.

Ереже қарапайым: деректерді өзінің қауіпсіз ортасында сақтаңыз, AI-дан код пен әдістерді ғана сұраңыз. Идеал жұмыс процесі мынада: AI-дан талдау кодын сұраңыз, сіз өзіңіздің компьютеріңізде/кәсіпорын серверіңізде нақты деректермен кодты іске қосасыз. Деректерді шынымен бөлісу керек болса, анонимизациялаңыз (идентификатор өрістерін алып тастаңыз), жинақтаңыз (жеке емес орташа/санақ) және институционалдық құралдарды таңдаңыз, деректерді өңдеу келісімі бар және деректеріңізді білім беруде пайдаланбаңыз.

үш шағын іс

1-жағдай – Қауіпсіз және тиімді пайдалану. Бір зерттеуші алдымен үй шаруашылығының бюджеті деректерінің 40 000 жолын қолмен тазалауға 6 сағат жұмсады. Деректерді мүлдем бөліспестен, ол жай ғана айнымалы атаулары мен құрылымын AI-ға сипаттап, тазалау кодын сұрады. AI R сценарийін жасады; Зерттеуші кодты өз ортасында іске қосты, жолдар санын және әрбір қадамның жиынтық статистикасын тексерді және екі логикалық қатені түзетті. Ұзақтығы: 6 сағаттың орнына 70 минут. Деректер ешқашан жоғалмайды; Жауапкершілік зерттеушіде қалды.

2-жағдай - Тексерілмеген сандық тұзақ. «ЖІӨ өсімі мен тікелей шетелдік инвестициялар арасындағы икемділік қандай», - деп сұрады магистрант AI. AI ешқандай деректерге қол жеткізе алмаса да, «шамамен 0,34» санын сенімді түрде берді. Студент мұны әдебиеттік конспектінде жазды; Оның кеңесшісі дереккөзді сұрағанда, бұл санның негізі жоқ және толығымен ойдан шығарылғаны белгілі болды. Қате: AI-дан деректер мен ресурстарды бермей-ақ нақты статистиканы күту.

3-жағдай — Құпиялылық және келісім-шартты бұзу. Сарапшы компанияның атауы мен айналымын қамтитын лицензияланған компания панелінен алған Excel бағдарламасын жалпыға қолжетімді AI құралына жүктеп салып, «панель регрессиясын жасаңыз» деді. Деректер жеткізушісінің келісімшарты деректерді үшінші тарап жүйелеріне беруге тыйым салды; Бұл оқиға сәйкестікті тексеруге себеп болды. Дұрыс жол компания атауларын анонимді кодтармен ауыстыру немесе ешқандай деректерді бөліспеу және тек панельдің регрессия кодын сұрау және оны өз ортасында іске қосу болды.

Әлсіз шақыру / Күшті шақыру

Әлсіз шақыру:

Инфляция мен жұмыссыздық арасындағы байланысты талдап, коэффициентті көрсетіңіз.

Бұл талап қате: AI-ға ешқандай деректер берілмеді, қай ел, қай кезең, қай модель екені белгісіз. AI тек құрастырылған коэффициентпен жауап бере алады.

Күшті шақыру:

Сіздің рөліңіз: сіз эконометрика зерттеушісіне көмектесетін талдау көмекшісісіз. МЕН сізбен деректерді БӨЛІМЕЙМІН; Мен жай ғана RUNNABLE R кодын алғым келеді. Менде жылдық панель бар: айнымалылар ел, жыл, жұмыссыздық, инфляция (барлық сандық). Тапсырма: 1) жұмыссыздық ~ инфляция (plm пакеті) үшін тіркелген әсерлер панелінің регрессия кодын жазыңыз, 2) кодтың әрбір қадамын түсініктеме жолымен түсіндіріңіз, 3) коэффициентті СЕБЕП-СЕБЕП емес, реляциялық деп түсіндіру керек екенін ескеріңіз, 4) сенімді емес функция аргументін құрастырыңыз; Мен өз ортамда жұмыс істеп, нәтижені тексеремін.

Бұл сұрауда ешқандай деректер бөлісілмейді, рөл, пакеттер, түсініктемелерді күту және «ойдан шығаруға» тыйым салу анық. Сіз әлі де жұмыс істеп, нәтижені өзіңіз тексересіз.

Келесі кестеде осы сабақтағы бір сөйлем ережелері жинақталған:

принципі

Бұл нені білдіреді

AI - көмекші

Ғылыми шешім мен жауапкершілік сарапшыға тиесілі

Кодты сұраңыз, нәтижені шығарыңыз

AI нөмірді есіне түсірмейді; сіз оны іске қосып, есептейсіз

деректерді сақтау

Микро/лицензияланған деректер қауіпсіз ортадан шықпайды

тексеру

Әрбір мәселе, код, түсініктеме тексеріледі; ойдан шығару қабылданбайды

Жалпы қателер

  • Деректерді бермей, AI-дан нақты статистиканы күту. Модель деректерге қол жеткізе алмайды; Ол беретін коэффициент, корреляция және p-мәні жалған. Әрқашан кодты сұраңыз және нәтижені өзіңіз жасаңыз.
  • Галлюцинаторлық функцияларға сүйену. AI R/Python функциясын немесе жоқ аргументті ұсынуы мүмкін. Кодты іске қоспай және оны тексермей қабылдамаңыз.
  • Микродеректерді жалпыға ортақ құралға жүктеп салу. Бұл KVKK/GDPR және деректерді пайдалану келісімін бұзу болып табылады. Деректерді анонимизациялаңыз немесе оны мүлдем бөліспеңіз.
  • Еркін сөйлеуді дәлдікпен қателесу. Жақсы жазылған шолу қате болуы мүмкін. Сөйлемнің әдемілігі дәлел емес.
  • Себеп-салдарлық тілді бақылаусыз қабылдау. YZ жиі «X У-ды арттырады» дейді; ал регрессиялардың көпшілігі тек қатынастарды көрсетеді. Себеп-салдарлық шағымды дизайнмен қорғаңыз.
Кеңес: AI-мен жұмыс істегенде, өзіңізге мына сұрақты қойыңыз: «Егер төреші немесе аудитор бұл нәтижені сұраса, мен дереккөзді және есептік жазбаны көрсете аламын ба?» Жауап жоқ болса, нәтиже әлі пайдалануға дайын емес.

Қысқаша

AI эконометрика мен статистиканың жұмыс процесінің орындалу деңгейінде (код, тазалау, график, жоба) нақты және жаппай жеделдетуді қамтамасыз етеді; дегенмен, үлгіні таңдау, себептілік, түсіндіру, жариялау және саяси шешімдер сарапшыға тиесілі. Үш негізгі пән: AI-ға нөмірді еске түсірмеңіз, кодты сұраңыз және нәтижені өзіңіз жасаңыз және тексеріңіз; микро/лицензияланған деректерді қауіпсіз ортадан жоймаңыз; әрбір шығысқа статистикалық сүзгі. Тексерілмеген AI нәтижесі тексерілмеген нәтиже сияқты қауіпті.

Қолданбалы тапсырма

Өзіңіздің (немесе мысал) деректер жинағын қарастырыңыз. Деректерді бөліспей, айнымалы құрылымды жай сипаттау арқылы сипаттамалық статистика мен қарапайым графикті шығаратын R немесе Python кодын сұраңыз. Кіріс кодты өз ортаңызда іске қосыңыз. Содан кейін тексеру парағын сақтаңыз: (1) код қатесіз орындалды ма, (2) сіз күткендей жолдар/бақылаулар саны, (3) AI түсініктеме сөйлемдерінің қайсысы себептік тілді пайдаланады және түзетілуі керек. Бір абзацта AI сізді құтқарған уақыт және сіз ұстаған кем дегенде бір қате туралы жазыңыз.

бақылау парағы

  • [ ] Мен AI нақты статистиканы сұрауға мәжбүрлеген жоқпын; Мен кодты сұрадым және нәтижені өзім шығардым.
  • [ ] Мен өз ортамда берген әрбір сан мен сынақ нәтижесін қайта есептедім.
  • [ ] Мен ол қолданатын функциялар/аргументтер шынымен бар екенін тексердім.
  • [ ] Мен жалпыға ортақ құралға микро/жеке/лицензияланған деректерді жүктеп салған жоқпын.
  • [ ] Мен себеп-салдар тілі бар пікірлерді белгілеп, оларды қатынас тіліне жылжыттым.
  • [ ] Мен аудиторға нәтиженің көзі мен есебін көрсете аламын.