Единици
1. Вештачка интелигенција во економетријата и статистиката: улоги, граници, автентикација и приватност 2. Чистење и подготовка на податоци: Недостасуваат податоци, оддалечени и кодирање 3. Истражувачка анализа и визуелизација на податоци: графика и интерпретација со вештачка интелигенција 4. Линеарна регресија: Изградба на модел, толкување на коефициентот и претпоставки 5. Регресиска дијагностика и прекршувања: колинеарност, хетероскедастичност, автокорелација 6. Тестирање на хипотези и p-вредност: Значење, моќ и повеќекратни споредби 7. p-хакирање, HARKing и статистички интегритет: стапици во ерата на вештачката интелигенција 8. Анализа на временски серии: стационарност, ARIMA и предвидување 9. Причина и анализа на политики: DiD, IV, RDD и вештачка интелигенција 10. Генерирање и репродуктивност на кодови: R/Python, верзии и репродуктивност 11. Пишување извештаи, комуникација и етика: презентирање резултати и граници на комуникација
Единица 11 / 11

Пишување извештаи, комуникација и етика: презентирање резултати и граници на комуникација

Добивки:

  • Способност за известување емпириски наоди до целната публика (академски, политички, менаџмент) со поддршка на вештачка интелигенција, на искрен и недвосмислен јазик
  • Способност за целосно пишување заклучоци, ограничувања и етички изјави (доверливост на податоците, конфликт на интереси, откривање на употреба на вештачка интелигенција) и избегнување на погрешно презентирање
  • Способноста на вештачката интелигенција да препознава нацрти на извештаи кои произведуваат претеран, едностран или каузален јазик и да ја одржува таа одговорност за конечниот текст и тврдењата е на истражувачот.

Модул испит

1. Истражувач прашува „Колкав е коефициентот на корелација помеѓу невработеноста и инфлацијата во Турција помеѓу 2015 и 2020 година? без да даде никакви податоци за вештачката интелигенција. прашува и директно го запишува бројот 0,62 во својата статија. Која е основната грешка во овој пристап?

  • А) Очекување конкретни статистички податоци од вештачката интелигенција без давање проверени податоци; ✔ Користење на број што можеби е направен без да се потврди
  • Б) Коефициентот на корелација никогаш не треба да се користи во статија.
  • В) Не може да се пресмета корелација помеѓу невработеноста и инфлацијата
  • Г) Вештачката интелигенција може да пристапи до податоци само по 2020 година

Објаснување: Јазичниот модел на вештачка интелигенција не може да произведе статистика без пристап до базата на податоци; Бројката што ја дава најверојатно е халуцинација (измислена). Коефициентите, соодносите и резултатите од тестот треба да се пресметаат од проверените податоци на самиот истражувач, а не од меморијата на моделот.

2. Што значи податоците што недостасуваат да „не недостасуваат по случаен избор“ (MNAR) и зошто е тоа важно?

  • А) Недостатокот се должи на самата незабележана вредност; Затоа едноставната задача може да создаде пристрасност ✔
  • Б) Податоците исчезнуваат сосема случајно и не создаваат пристрасност.
  • В) Податоците што недостасуваат секогаш треба да се решат со бришење на редот.
  • Г) Недостатокот на податоци не влијае на анализата на кој било начин.

Објаснување: Во случајот на MNAR (Недостасува не по случаен избор), самото недостиг зависи од големината на ненабљудуваната вредност (на пр., високите заработувачки не го пријавуваат својот приход). Во овој случај, едноставното бришење или просечната задача дава пристрасни резултати; Механизмот на недостаток мора да се моделира. Методот на доделување предложен од вештачката интелигенција не треба да се применува слепо без да се знае овој механизам.

3. Аналитичарот бара AI да направи столбест дијаграм, а AI ја започнува y-оската на 40 наместо нула. Вистинската разлика од 2% помеѓу двете групи изгледа огромна на графиконот. Кој е вистинскиот пристап?

  • А) Започнување на оската од нула или менување на типот на графиконот; ✔ да се прикаже вистинската големина на разликата без да се доведе во заблуда
  • Б) Користење на табелата како што е затоа што вештачката интелигенција го прави најдобриот избор
  • В) Започнување на оската на 45 за да се направи разликата уште поголема
  • Г) Никогаш не користете визуелни слики наместо столбест дијаграми

Објаснување: Во столбест дијаграм, испрекинатата оска (y-оската која не започнува од нула) доведува во заблуда со преувеличување на малите разлики. Во искрената визуелизација, оската на столбест дијаграмите треба да започне од нула или разликата треба свесно да се наведе јасно. Одговорност на аналитичарот е да ја потврди сликата и да ја исправи доколку е потребно.

4. Како фактот дека коефициентот е „значаен“ (p<0,05) во линеарната регресија често погрешно се прикажува во толкувањето на вештачката интелигенција?

  • А) Претерано прикажување на значење бидејќи ефектот е голем и важен или е утврдена каузалност ✔
  • Б) Значењето секогаш покажува дека ефектот е мал
  • В) p<0,05 докажува дека коефициентот е апсолутно точен
  • Г) Никогаш не треба да се пријавуваат значајни коефициенти.

Објаснување: Статистичката значајност се однесува на силата на доказите дека ефектот е различен од нула; Тоа не значи дека ефектот е голем, важен или причински. ВИ често го претставува зборот „значајно“ како „значајно/силно влијание“. Истражувачот исто така треба да ја процени големината на ефектот, интервалот на доверба и контекстот.

5. На што се однесува терминот „p-hacking“ и зошто вештачката интелигенција може да го олесни?

  • А) Обидувајќи се со повеќе анализи додека не добие смисла; ВИ го прави тоа многу брзо, зголемувајќи го ризикот ✔
  • Б) Анализирање на податоците еднаш и со однапред утврден план
  • В) проширување на примерокот за да се зголеми p-вредноста
  • Г) Известување само описна статистика

Објаснување: p-хакирањето е обид за различни променливи, подпримероци, трансформации или модели додека не се појави значаен резултат; ова произведува лажни наоди засновани на случајност. Со оглед на тоа што вештачката интелигенција може да испроба десетици варијанти на модели за неколку секунди, може да го забрза хакирањето на p без искрен план. Одбрана; предрегистрација, план за фиксна анализа и корекција на повеќекратна споредба.

6. Зошто наоѓањето регресија со висок R-квадрат помеѓу две нестационарни (единичен корен) временски серии може да биде погрешно?

  • А) Може да се појави лажна регресија поради заеднички тренд; ✔ Излез со висок R-квадрат без вистинска врска
  • Б) Високиот R-квадрат секогаш докажува силна причинска врска.
  • В) Нестационарните серии воопшто не можат да се внесат во регресија.
  • Г) R-квадратот не може да се пресмета во временски серии

Објаснување: Ако не постои заедничка коинтеграциска врска помеѓу нестационарни серии, лажната регресија може да произведе висок R-квадрат и значаен коефициент само поради заеднички тренд; додека не постои вистинска врска. Затоа, прво треба да се направат тестови за стационарност и единичен корен, а доколку е потребно, да се преземат разлики или да се тестира коинтеграцијата.

7. Која основна претпоставка се заснова на валидноста на дизајнот Difference-in-Differences?

  • А) Претпоставка за паралелни трендови: групите би ја следеле истата насока доколку немало интервенција ✔
  • Б) Групите за третман и контрола се сосема исти на почетокот
  • В) Нормална дистрибуција на примерокот
  • Г) Променливите не содржат податоци што недостасуваат

Објаснување: DiD претпоставува дека во отсуство на интервенција, променливата на исходот за групите за третман и контрола би се одвивала паралелно со текот на времето (претпоставка за паралелни трендови). Доколку оваа претпоставка не се исполни, проценката е пристрасна. Вештачката интелигенција може да го произведе DiD кодот, но задача на истражувачот е да ги брани и тестира паралелните трендови.

8. Што од наведеното е задолжителна практика за репродуктивна анализа?

  • А) Поправање на семето во случајни чекори, снимање на верзии на пакетот и код ✔
  • Б) Рачно копирајте ги резултатите во табелата и избришете го кодот
  • В) Нормално е да се видат различни резултати во секое трчање.
  • Г) Чување само конечна графика, не споделување податоци и код

Опис: Репродуктивност; Истиот резултат може повторно да се добие со истите податоци и код. Поправање на семето во случајни чекори, зачувување на верзии на пакети и извршување на кодот во документот (писмено програмирање) се темелите на ова. Рачно копирање резултати или чекори кои не се евидентираат базирани на кликнувања, ја нарушуваат репродуктивноста.

9. Што ја искривува хетероскедастичноста линеарна регресија и кое е нејзиното заедничко решение?

  • А) Ги искривува стандардните грешки; решението е робусни стандардни грешки или соодветна трансформација ✔
  • Б) Целосно ги поништува проценките на коефициентите и нема решение
  • В) Секогаш го намалува R-квадратот на нула
  • Г) Се јавува само ако примерокот е многу мал и може да се игнорира

Објаснување: Хетероскедастичноста ги остава непристрасни проценките на коефициентите, но погрешно ги пресметува стандардните грешки; Ова ги прави p-вредностите и интервалите на доверба несигурни. Вообичаено решение е да се користат робусни/HC стандардни грешки или соодветна конверзија. Мора да се потврди дека решението предложено од вештачката интелигенција всушност го поправа проблемот наместо да го крие.

10. Истражувач поставува микроподатоци кои содржат информации за идентификација на ниво на пациент и приходи во јавна алатка за разговор со вештачка интелигенција и вели „направи регресија“. Кој е главниот проблем со ова однесување?

  • А) Поставувањето лични/лиценцирани податоци на надворешна алатка претставува повреда на доверливоста и договорот ✔
  • Б) Регресија воопшто не може да се направи со вештачка интелигенција
  • В) Микроподатоците воопшто не се погодни за регресија
  • Г) ВИ секогаш погрешно ја пресметува регресијата

Објаснување: Личните/посебните податоци како што се идентитетот и приходот се заштитени според KVKK/GDPR и повеќето договори за користење податоци; Нивното поставување на надворешен уред што може да складира податоци е прекршување. Вистинскиот начин; Анонимизирање податоци, користење локални/институционални безбедни алатки или едноставно барање код од вештачката интелигенција и извршување на кодот во сопствената околина.

11. Што се забележува кога мултиколинеарноста е висока?

  • А) Коефициентите стануваат нестабилни и стандардните грешки се надувуваат; Индивидуалните коефициенти може да испаднат бесмислени ✔
  • Б) R-квадрат секогаш се намалува на нула
  • В) Проценките на коефициентот стануваат попрецизни цело време
  • Г) Скалата на зависната променлива се менува

Објаснување: При висока мултиколинеарност, независните променливи се силно корелирани една со друга; Проценките на коефициентите стануваат нестабилни, стандардните грешки се надувуваат, а поединечните коефициенти може да се покажат како незначителни, додека целокупниот модел може да биде значаен. Се дијагностицира со критериуми како што е VIF. Вештачката интелигенција може да сугерира елиминација на променливата, но на истражувачот е да одлучи која променлива треба да остане теоретска.

12. Што е статистичка моќ и каков е ризикот од студија со ниска моќност?

  • А) Можност за откривање на постоечкиот ефект; ниската моќност ги пропушта вистинските ефекти и ги прави наодите несигурни ✔
  • Б) веројатност за намалување на p-вредноста; помалата моќност секогаш дава посигурни резултати
  • В) Константна вредност независна од големината на примерокот
  • Г) Концепт кој важи само кога се користи вештачка интелигенција

Објаснување: Моќта е веројатноста да се открие ефект што навистина постои (1 минус грешка од типот II). Студиите со ниска моќност може да ги пропуштат вистинските ефекти; Дополнително, неколкуте значајни резултати може да носат претерана големина на ефектот („проклетство на победникот“) и стапката на лажно позитивна се зголемува. Затоа, пресметката на моќност/примерок е важна пред анализата.

13. Зошто е етички неопходно да се открие употребата на вештачка интелигенција во статија?

  • А) За транспарентност и отчетност; ✔ читателите и судиите можат да го оценат процесот и одговорноста останува на авторот
  • Б) Употребата на вештачка интелигенција автоматски ги поништува резултатите
  • В) Се бара од списанија само за рекламни цели
  • Г) Пренесување на авторското право на објаснувањето на вештачка интелигенција

Обелоденување: Транспарентноста е неопходна за читателот и рецензентите да можат да оценат како се произведени резултатите; Многу списанија и институции сега бараат обелоденување на употребата на вештачка интелигенција. Дополнително, бидејќи вештачката интелигенција може да произведе грешки/халуцинации, искрено е да се каже дека одговорноста останува на авторот и кои чекори биле ревидирани.

14. Што бара „ограничувањето на исклучувањето“ во методот на променливата на инструментот (IV)?

  • А) Алатката влијае на резултатот само преку внатрешната променлива, нема друг директен начин ✔
  • Б) Инструментот нема врска со променливата на исходот.
  • В) Инструментот не е поврзан со ендогената променлива.
  • Г) Средството е секогаш бинарна (0/1) променлива

Објаснување: Ограничувањето за исклучување бара инструментот да влијае на променливата на исходот само преку ендогената објаснувачка променлива, а не преку какви било други директни средства или незабележани фактори. Оваа претпоставка не може целосно да се тестира од податоците; Се брани на теоретска и институционална основа. ВИ може да го напише кодот IV, но задача на истражувачот е да ја брани валидноста на алатката.

15. Што значи проблемот „Градина на патеки за раздвојување“ во флексибилните анализи без претходна регистрација?

  • А) Премногу разумни избори за анализа направени врз основа на податоците ја зголемуваат стапката на лажно позитивна, дури и ненамерно ✔
  • Б) Методите на анализа мора да бидат единечни и задолжителни
  • В) Проблем што се јавува само кога се случува намерно мамење.
  • Г) Ситуација која спонтано исчезнува како што примерокот расте

Објаснување: По прегледувањето на податоците, истражувачот може да направи многу разумни избори за тоа која променлива, подгрупа, трансформација или праг да ја користи. Дури и ако не постои единствено „намерно p-хакирање“, оваа флексибилност ја зголемува стапката на лажно позитивна стапка бидејќи значајната е ефективно избрана од голем број анализи. Претходната регистрација и фиксниот план за анализа ја ограничуваат оваа флексибилност.