Јединице
1. Вештачка интелигенција у економетрији и статистици: улоге, границе, аутентификација и приватност 2. Чишћење и припрема података: подаци који недостају, недостаци и кодирање 3. Истраживачка анализа и визуелизација података: цртање и тумачење помоћу вештачке интелигенције 4. Линеарна регресија: изградња модела, интерпретација коефицијената и претпоставке 5. Дијагностика регресије и кршења: колинеарност, хетероскедастичност, аутокорелација 6. Тестирање хипотеза и п-вредност: значајност, моћ и вишеструка поређења 7. п-хаковање, ХАРКинг и статистички интегритет: Замке у доба вештачке интелигенције 8. Анализа временских серија: стационарност, АРИМА и предвиђање 9. Узрочна веза и анализа политике: ДиД, ИВ, РДД и вештачка интелигенција 10. Генерисање кода и репродуктивност: Р/Питхон, верзија и репродуктивност 11. Писање извештаја, комуникација и етика: представљање резултата и комуницирање граница
Јединица 11 / 11

Писање извештаја, комуникација и етика: представљање резултата и комуницирање граница

Добици:

  • Способност извештавања о емпиријским налазима циљној публици (академској, политици, менаџменту) уз подршку вештачке интелигенције, на искреном и недвосмисленом језику
  • Способност потпуног писања закључака, ограничења и етичких изјава (поверљивост података, сукоб интереса, откривање употребе вештачке интелигенције) и избегавање обмањујуће презентације
  • Способност вештачке интелигенције да препозна нацрте извештаја који производе преувеличан, једностран или узрочно-последичан језик и задржи ту одговорност за коначни текст и тврдње лежи на истраживачу.

Модул Екам

1. Истраживач се пита „Који је коефицијент корелације између незапослености и инфлације у Турској између 2015. и 2020. године?“ не дајући никакве податке вештачкој интелигенцији. пита и уписује број 0,62 директно у свој чланак. Шта је суштинска грешка у овом приступу?

  • А) Очекивати конкретне статистике од вештачке интелигенције без давања проверених података; ✔ Коришћење броја који је можда измишљен без провере
  • Б) Коефицијент корелације никада не треба користити у чланку.
  • Ц) Не може се израчунати корелација између незапослености и инфлације
  • Д) Вештачка интелигенција може да приступи подацима тек после 2020

Објашњење: АИ језички модел не може произвести статистику без приступа скупу података; Број који даје највероватније је халуцинација (измишљена). Коефицијенти, односи и резултати теста треба да се израчунају из сопствених верификованих података истраживача, а не узети из меморије модела.

2. Шта значи да подаци који недостају 'не недостају насумично' (МНАР) и зашто је то важно?

  • А) Недостатак је због саме неуочене вредности; Зато једноставно задавање може да створи пристрасност ✔
  • Б) Подаци нестају потпуно насумично и не стварају никакву пристрасност.
  • Ц) Недостајуће податке увек треба решити брисањем реда.
  • Д) Подаци који недостају ни на који начин не утичу на анализу.

Објашњење: У случају МНАР-а (недостаје не насумично), сам недостатак зависи од величине неопажене вредности (нпр. људи са високим приходима не пријављују своје приходе). У овом случају, једноставно брисање или просечно додељивање даје пристрасне резултате; Механизам недостатка се мора моделирати. Метода додељивања коју предлаже вештачка интелигенција не би требало да се примењује слепо без познавања овог механизма.

3. Аналитичар има АИ да направи тракасти графикон, а АИ почиње и-осу на 40 уместо од нуле. Стварна разлика од 2% између ове две групе изгледа огромна на графикону. Шта је прави приступ?

  • А) Покретање осе од нуле или промена типа графикона; ✔ да покаже праву величину разлике без обмањивања
  • Б) Коришћење графикона какав јесте јер АИ чини најбољи избор
  • Ц) Покретање осе на 45 да би разлика била још већа
  • Д) Никада немојте користити визуелне елементе уместо тракастих дијаграма

Објашњење: На тракастом графикону, испрекидана оса (и-оса која не почиње од нуле) доводи у заблуду преувеличавањем малих разлика. У искреној визуализацији, оса тракастих дијаграма треба да почне од нуле или разлика треба да буде свесно јасно наведена. Одговорност аналитичара је да провери слику и да је исправи ако је потребно.

4. Како се чињеница да је коефицијент „значајан“ (п<0,05) у линеарној регресији често погрешно представља у тумачењу вештачке интелигенције?

  • А) Преувеличано представљање значаја јер је ефекат велик и важан или је утврђена узрочност ✔
  • Б) Значај увек указује да је ефекат мали
  • Ц) п<0,05 доказује да је коефицијент апсолутно тачан
  • Д) Значајни коефицијенти никада не би требали бити пријављени.

Објашњење: Статистичка значајност се односи на снагу доказа да је ефекат различит од нуле; То не значи да је ефекат велики, важан или узрочан. АИ често представља реч „значајан“ као „значајан/снажан утицај“. Истраживач такође треба да процени величину ефекта, интервал поверења и контекст.

5. На шта се односи појам 'п-хаковање' и зашто АИ то може олакшати?

  • А) Покушај више анализа док не добије смисла; АИ то ради веома брзо, повећавајући ризик ✔
  • Б) Једнократна анализа података и са унапред одређеним планом
  • Ц) проширење узорка ради повећања п-вредности
  • Д) Извјештавање само о дескриптивној статистици

Објашњење: п-хаковање покушава различите варијабле, подузорке, трансформације или моделе док се не појави значајан резултат; ово производи лажне налазе засноване на случају. Пошто АИ може испробати десетине варијанти модела у секунди, може убрзати п-хаковање без поштеног плана. одбрана; предрегистрација, фиксни план анализе и вишеструка корекција поређења.

6. Зашто би проналажење високе регресије Р-квадрата између две нестационарне (јединични корен) временске серије могло бити погрешно?

  • А) Лажна регресија може настати због уобичајеног тренда; ✔ Висок Р-квадрат излаз без стварне везе
  • Б) Висок Р-квадрат увек доказује јаку узрочну везу.
  • В) Нестационарни низови се уопште не могу ући у регресију.
  • Д) Р-квадрат се не може израчунати у временским серијама

Објашњење: Ако не постоји заједнички коинтеграциони однос између нестационарних серија, лажна регресија може произвести висок Р-квадрат и значајан коефицијент само због заједничког тренда; док не постоји прави однос. Стога, прво треба урадити тестове стационарности и јединичног корена, а ако је потребно, треба узети разлике или тестирати коинтеграцију.

7. Која је основна претпоставка заснована на валидности дизајна разлика у разликама?

  • А) Претпоставка паралелних трендова: групе би ишле у истом правцу да није било интервенције ✔
  • Б) Третман и контролна група су потпуно исте на почетку
  • Ц) Нормална дистрибуција узорка
  • Д) Променљиве не садрже податке који недостају

Објашњење: ДиД претпоставља да би, у одсуству интервенције, варијабла исхода за третман и контролну групу текла паралелно током времена (претпоставка паралелних трендова). Ако ова претпоставка није испуњена, процена је пристрасна. АИ може произвести ДиД код, али је посао истраживача да брани и тестира паралелне трендове.

8. Шта од следећег је обавезна пракса за поновљиву анализу?

  • А) Фиксирање семена у насумичним корацима, снимање верзија пакета и кода ✔
  • Б) Ручно копирајте резултате у табелу и избришите код
  • Ц) Нормално је видети различите резултате у свакој вожњи.
  • Д) Чување само финалне графике, не дељење података и кода

Опис: Репродуцибилност; Исти резултат се може поново добити са истим подацима и кодом. Поправљање семена у насумичне кораке, чување верзија пакета и извршавање кода унутар документа (писмено програмирање) су камен темељац овога. Ручно копирање резултата или кораке који се не евидентирају на основу клика нарушава поновљивост.

9. Шта хетероскедастичност искривљује линеарну регресију и које је њено заједничко решење?

  • А) Искривљује стандардне грешке; решење су робусне стандардне грешке или одговарајућа трансформација ✔
  • Б) Потпуно поништава процене коефицијената и нема решење
  • Ц) Увек смањује Р-квадрат на нулу
  • Д) Јавља се само ако је узорак веома мали и може се занемарити

Објашњење: Хетеросцедастичност оставља процене коефицијената непристрасним, али погрешно израчунава стандардне грешке; Ово чини п-вредности и интервале поверења непоузданим. Уобичајено решење је коришћење робусних/ХЦ стандардних грешака или одговарајућа конверзија. Мора се потврдити да решење које је предложила АИ заправо решава проблем, а не да га скрива.

10. Истраживач поставља микроподатке који садрже идентификационе информације и приходе на нивоу пацијента у јавни АИ алат за ћаскање и каже „уради регресију“. Шта је главни проблем оваквог понашања?

  • А) Отпремање личних/лиценцираних података на екстерни алат представља кршење поверљивости и уговора ✔
  • Б) Регресију уопште не може урадити вештачка интелигенција
  • Ц) Микро подаци уопште нису погодни за регресију
  • Д) АИ увек погрешно израчунава регресију

Објашњење: Лични/посебни подаци као што су идентитет и приход су заштићени према КВКК/ГДПР и већини уговора о коришћењу података; Њихово отпремање на спољни уређај који може да чува податке представља кршење. Прави пут; Анонимизација података, коришћење локалних/институционалних безбедних алата или једноставно захтевање кода од вештачке интелигенције и покретање кода у сопственом окружењу.

11. Шта се примећује када је мултиколинеарност висока?

  • А) Коефицијенти постају нестабилни и стандардне грешке постају надуване; Појединачни коефицијенти могу бити бесмислени ✔
  • Б) Р-квадрат се увек смањује на нулу
  • Ц) Процене коефицијената све време постају прецизније
  • Д) Мења се размера зависне варијабле

Објашњење: У високој мултиколинеарности, независне варијабле су у снажној корелацији једна са другом; Процене коефицијената постају нестабилне, стандардне грешке постају надуване, а појединачни коефицијенти се могу показати безначајним, док укупни модел може бити значајан. Дијагностикује се критеријумима као што је ВИФ. Вештачка интелигенција може предложити елиминацију варијабли, али на истраживачу је да одлучи која варијабла треба да остане теоретска.

12. Шта је статистичка моћ и који је ризик студије мале снаге?

  • А) Могућност детекције постојећег ефекта; мала снага пропушта праве ефекте и чини налазе непоузданим ✔
  • Б) вероватноћа смањења п-вредности; мања снага увек даје поузданије резултате
  • Ц) Константна вредност независна од величине узорка
  • Г) Концепт који важи само када се користи вештачка интелигенција

Објашњење: Снага је вероватноћа откривања ефекта који стварно постоји (1 минус грешка типа ИИ). Студије мале снаге могу пропустити праве ефекте; Поред тога, неколико значајних резултата може имати преувеличану величину ефекта („проклетство победника“) и повећава се стопа лажних позитивних резултата. Стога је прорачун снаге/узорка важан пре анализе.

13. Зашто је етички неопходно открити употребу вештачке интелигенције у чланку?

  • А) За транспарентност и одговорност; ✔ Читаоци и рецензенти могу проценити процес и одговорност остаје на аутору
  • Б) Употреба вештачке интелигенције аутоматски поништава резултате
  • Ц) Захтевано од стране часописа само у рекламне сврхе
  • Д) Преношење ауторских права на објашњење на вештачку интелигенцију

Откривање: Транспарентност је неопходна како би читаоци и рецензенти могли да процене како су резултати произведени; Многи часописи и институције сада захтевају откривање употребе вештачке интелигенције. Поред тога, пошто вештачка интелигенција може да произведе грешке/халуцинације, поштено је рећи да одговорност остаје на аутору и који кораци су ревидирани.

14. Шта захтева 'ограничење искључења' у методи променљиве инструмента (ИВ)?

  • А) Алат утиче на резултат само преко интерне променљиве, не постоји други директан начин ✔
  • Б) Инструмент нема везу са варијаблом исхода.
  • Ц) Инструмент није повезан са ендогеном променљивом.
  • Д) Средња вредност је увек бинарна (0/1) променљива

Објашњење: Ограничење искључења захтева да инструмент утиче на варијаблу исхода само преко ендогене експланаторне варијабле, а не преко било којих других директних средстава или незапажених фактора. Ова претпоставка се не може у потпуности тестирати на основу података; Брани се на теоријским и институционалним основама. АИ може написати ИВ код, али посао је истраживача да брани валидност алата.

15. Шта проблем 'Башта рачваних стаза' значи у флексибилним анализама без предрегистрације?

  • А) Превише разумних избора анализе направљених на основу података повећава стопу лажних позитивних резултата, чак и ненамерно ✔
  • Б) Методе анализе морају бити јединствене и обавезне
  • Ц) Проблем који се јавља само када дође до намерног варања.
  • Д) Ситуација која спонтано нестаје како узорак расте

Објашњење: Након прегледа података, истраживач може направити много разумних избора о томе коју променљиву, подгрупу, трансформацију или праг да користи. Чак и ако не постоји једно 'намерно п-хаковање', ова флексибилност повећава стопу лажних позитивних резултата јер се значајна ефективно бира из великог броја анализа. Предрегистрација и фиксни план анализе ограничавају ову флексибилност.