единици
1. Изкуствен интелект в иконометрията и статистиката: роли, граници, автентификация и поверителност 2. Почистване и подготовка на данни: липсващи данни, отклонения и кодиране 3. Проучвателен анализ на данни и визуализация: Графика и интерпретация с изкуствен интелект 4. Линейна регресия: Изграждане на модел, тълкуване на коефициенти и предположения 5. Регресионна диагностика и нарушения: колинеарност, хетероскедастичност, автокорелация 6. Тестване на хипотеза и p-стойност: значимост, сила и множество сравнения 7. p-hacking, HARKing и статистическа цялост: Клопки в епохата на изкуствения интелект 8. Анализ на времеви редове: стационарност, ARIMA и прогнозиране 9. Причинно-следствена връзка и анализ на политиката: DiD, IV, RDD и изкуствен интелект 10. Генериране на код и възпроизводимост: R/Python, създаване на версии и възпроизводимост 11. Писане на доклади, комуникация и етика: Представяне на резултати и съобщаване на граници
единица 11 / 11

Писане на доклади, комуникация и етика: Представяне на резултати и съобщаване на граници

Печалби:

  • Способност за докладване на емпирични открития на целевата аудитория (академична, политическа, управленска) с подкрепата на изкуствения интелект на честен и недвусмислен език
  • Способност за пълно писане на заключения, ограничения и етични декларации (поверителност на данните, конфликт на интереси, разкриване на използване на изкуствен интелект) и избягване на подвеждащо представяне
  • Способността на изкуствения интелект да разпознава чернови на доклади, които произвеждат преувеличен, едностранен или причинно-следствен език, и поддържа, че отговорността за крайния текст и твърдения е на изследователя.

Изпит по модул

1. Изследовател пита „Какъв е коефициентът на корелация между безработицата и инфлацията в Турция между 2015 г. и 2020 г.?“ без да предоставя никакви данни на изкуствения интелект. пита той и пише числото 0,62 директно в статията си. Каква е основната грешка в този подход?

  • А) Очакване на конкретна статистика от изкуствения интелект, без да се дават проверени данни; ✔ Използване на номер, който може да е измислен без проверка
  • B) Коефициентът на корелация никога не трябва да се използва в статия.
  • В) Не може да се изчисли корелация между безработицата и инфлацията
  • Г) Изкуственият интелект може да има достъп до данни само след 2020 г

Обяснение: Езиковият модел на AI не може да произвежда статистика без достъп до набора от данни; Числото, което дава, най-вероятно е халюцинация (измислена). Коефициентите, съотношенията и резултатите от теста трябва да се изчисляват от собствените проверени данни на изследователя, а не да се вземат от паметта на модела.

2. Какво означава липсващите данни да не бъдат „произволни“ (MNAR) и защо е важно?

  • А) Дефицитът се дължи на самата ненаблюдавана стойност; Ето защо простото присвояване може да създаде пристрастие ✔
  • B) Данните изчезват напълно произволно и не създават пристрастия.
  • В) Липсващите данни трябва винаги да се решават чрез изтриване на реда.
  • Г) Липсващите данни не влияят по никакъв начин на анализа.

Обяснение: В случая на MNAR (Липса не случайно), самата липса зависи от големината на ненаблюдаваната стойност (напр. хората с високи доходи не отчитат доходите си). В този случай простото изтриване или средно присвояване дава предубедени резултати; Трябва да се моделира механизмът на дефицита. Методът на присвояване, предложен от изкуствения интелект, не трябва да се прилага сляпо, без да се познава този механизъм.

3. Анализаторът кара изкуствения интелект да направи лентова диаграма и изкуственият интелект започва у-оста при 40 вместо нула. Действителната разлика от 2% между двете групи изглежда огромна на графиката. Какъв е правилният подход?

  • A) Стартиране на оста от нулата или промяна на типа на диаграмата; ✔ да покаже истинския размер на разликата, без да подвежда
  • B) Използване на диаграмата такава, каквато е, защото AI прави най-добрия избор
  • C) Стартиране на оста от 45, за да направите разликата още по-голяма
  • Г) Никога не използвайте визуални елементи вместо лентови диаграми

Обяснение: В стълбовидна диаграма пунктираната ос (оста y, която не започва от нула) подвежда, като преувеличава малките разлики. При честна визуализация оста на лентовите диаграми трябва да започва от нула или разликата трябва съзнателно да се посочи ясно. Отговорност на анализатора е да провери изображението и да го коригира, ако е необходимо.

4. Как фактът, че даден коефициент е „значителен“ (p<0,05) при линейна регресия, често се представя погрешно в интерпретацията на изкуствения интелект?

  • A) Преувеличено представяне на значимостта, тъй като ефектът е голям и важен или причинно-следствената връзка е установена ✔
  • Б) Значимостта винаги показва, че ефектът е малък
  • В) p<0,05 доказва, че коефициентът е абсолютно правилен
  • Г) Никога не трябва да се докладват значими коефициенти.

Обяснение: Статистическата значимост е свързана със силата на доказателствата, че ефектът е различен от нула; Това не означава, че ефектът е голям, важен или причинен. AI често представя думата „значително“ като „значително/силно въздействие“. Изследователят трябва също така да оцени размера на ефекта, доверителния интервал и контекста.

5. Какво означава терминът „p-hacking“ и защо AI може да го улесни?

  • A) Опитване на множество анализи, докато има смисъл; AI прави това много бързо, увеличавайки риска ✔
  • Б) Еднократно анализиране на данни и с предварително определен план
  • C) разширяване на извадката за увеличаване на p-стойността
  • Г) Отчитане само на описателни статистики

Обяснение: p-хакингът изпробва различни променливи, подизвадки, трансформации или модели, докато се появи смислен резултат; това води до фалшиви открития, основани на случайност. Тъй като AI може да изпробва десетки варианти на модели за секунди, той може да ускори p-хакването без честен план. защита; предварителна регистрация, фиксиран план за анализ и корекция на множество сравнения.

6. Защо намирането на висока R-квадратна регресия между два нестационарни (единичен корен) времеви реда може да бъде подвеждащо?

  • A) Може да възникне фалшива регресия поради обща тенденция; ✔ Висок резултат на R-квадрат без реална връзка
  • B) Високият R-квадрат винаги доказва силна причинно-следствена връзка.
  • В) Нестационарните редове изобщо не могат да бъдат въведени в регресия.
  • D) R-квадрат не може да се изчисли във времеви редове

Обяснение: Ако няма обща коинтеграционна връзка между нестационарни серии, фалшивата регресия може да доведе до висок R-квадрат и значим коефициент само поради обща тенденция; като има предвид, че няма истинска връзка. Следователно първо трябва да се направят тестове за стационарност и единичен корен и, ако е необходимо, да се вземат разлики или да се тества коинтеграцията.

7. Какво основно предположение се основава на валидността на дизайна Разлика в разликите?

  • A) Предположение за паралелни тенденции: групите биха следвали една и съща посока, ако нямаше намеса ✔
  • Б) Лекуваните и контролните групи са абсолютно еднакви в началото
  • В) Нормално разпределение на извадката
  • Г) Променливите не съдържат липсващи данни

Обяснение: DiD приема, че при отсъствието на интервенция, променливата на резултата за лекуваните и контролните групи би протичала паралелно във времето (предположение за паралелни тенденции). Ако това предположение не е изпълнено, оценката е пристрастна. AI може да създаде DiD кода, но работата на изследователя е да защитава и тества паралелни тенденции.

8. Кое от следните е задължителна практика за възпроизводим анализ?

  • A) Коригиране на семената в произволни стъпки, записване на версии на пакети и код ✔
  • B) Копирайте ръчно резултатите в електронната таблица и изтрийте кода
  • В) Нормално е да виждате различни резултати при всяко изпълнение.
  • D) Запазване само на окончателни графики, без споделяне на данни и код

Описание: Възпроизводимост; Същият резултат може да се получи отново със същите данни и код. Поправянето на семената на произволни стъпки, запазването на версиите на пакета и изпълнението на кода в документа (грамотно програмиране) са крайъгълните камъни на това. Ръчното копиране на резултати или базирани на щракване стъпки без регистриране влошава възпроизводимостта.

9. Какво хетероскедастичността изкривява линейната регресия и какво е нейното общо решение?

  • A) Изкривява стандартните грешки; решението е надеждни стандартни грешки или подходяща трансформация ✔
  • B) То обезсилва оценките на коефициента и няма решение
  • C) Винаги намалява R-квадрат до нула
  • D) Възниква само ако извадката е много малка и може да бъде игнорирана

Обяснение: Хетероскедастичността оставя оценките на коефициента безпристрастни, но неправилно изчислява стандартните грешки; Това прави p-стойностите и доверителните интервали ненадеждни. Често срещано решение е да се използват устойчиви/HC стандартни грешки или подходящо преобразуване. Трябва да се провери дали решението, предложено от AI, действително решава проблема, вместо да го крие.

10. Изследовател качва микроданни, съдържащи идентификационна информация на ниво пациент и доходи в публичен инструмент за чат с изкуствен интелект и казва „направете регресия“. Какъв е основният проблем с това поведение?

  • A) Качването на лични/лицензирани данни във външен инструмент представлява нарушение на поверителността и договора ✔
  • Б) Регресията изобщо не може да бъде направена от изкуствен интелект
  • В) Микро данните изобщо не са подходящи за регресия
  • Г) AI винаги изчислява погрешно регресията

Обяснение: Лични/специални данни като самоличност и доход са защитени съгласно KVKK/GDPR и повечето споразумения за използване на данни; Качването им на външно устройство, което може да съхранява данни, е нарушение. Правилният начин; Анонимизиране на данни, използване на местни/институционални сигурни инструменти или просто изискване на код от изкуствен интелект и стартиране на кода в собствена среда.

11. Какво се наблюдава, когато мултиколинеарността е висока?

  • A) Коефициентите стават нестабилни и стандартните грешки се увеличават; Индивидуалните коефициенти може да се окажат безсмислени ✔
  • B) R-квадрат винаги намалява до нула
  • C) Оценките на коефициента стават все по-точни през цялото време
  • Г) Мащабът на зависимата променлива се променя

Обяснение: При висока мултиколинеарност независимите променливи са силно свързани една с друга; Оценките на коефициента стават нестабилни, стандартните грешки се завишават и отделните коефициенти може да се окажат незначителни, докато общият модел може да е значителен. Диагностицира се по критерии като VIF. Изкуственият интелект може да предложи елиминиране на променлива, но зависи от изследователя да реши коя променлива да остане теоретична.

12. Какво е статистическа мощност и какъв е рискът от изследване с ниска мощност?

  • А) Възможност за откриване на съществуващия ефект; ниската мощност пропуска истинските ефекти и прави констатациите ненадеждни ✔
  • B) вероятност за намаляване на p-стойността; по-ниската мощност винаги дава по-надеждни резултати
  • C) Постоянна стойност, независима от размера на извадката
  • Г) Концепция, която е валидна само когато се използва изкуствен интелект

Обяснение: Мощността е вероятността за откриване на ефект, който действително съществува (1 минус грешка тип II). Изследванията с ниска мощност може да пропуснат истинските ефекти; Освен това, малкото значими резултати може да носят преувеличен размер на ефекта („проклятието на победителя“) и процентът на фалшивите положителни резултати се увеличава. Следователно изчислението на мощност/проба е важно преди анализа.

13. Защо е етично необходимо да се разкрие използването на изкуствен интелект в статия?

  • А) За прозрачност и отчетност; ✔ читателите и рецензентите могат да оценят процеса и отговорността остава на автора
  • Б) Използването на изкуствен интелект автоматично обезсилва резултатите
  • C) Изисква се от списания само за рекламни цели
  • Г) Прехвърляне на авторските права върху обяснението на изкуствения интелект

Разкриване: Необходима е прозрачност, така че читателят и рецензентите да могат да оценят как са получени резултатите; Много списания и институции сега изискват разкриване на използването на AI. Освен това, тъй като изкуственият интелект може да произведе грешки/халюцинации, въпрос на честност е да заявите, че отговорността остава на автора и кои стъпки са проверени.

14. Какво изисква „ограничението за изключване“ в метода на инструменталната променлива (IV)?

  • A) Инструментът влияе върху резултата само чрез вътрешната променлива, няма друг пряк начин ✔
  • B) Инструментът няма връзка с променливата на резултата.
  • C) Инструментът не е свързан с ендогенната променлива.
  • Г) Средното винаги е двоична (0/1) променлива

Обяснение: Ограничението за изключване изисква инструментът да повлияе на променливата на резултата само чрез ендогенната обяснителна променлива, а не чрез други преки средства или ненаблюдавани фактори. Това предположение не може да бъде напълно тествано от данни; Защитава се на теоретични и институционални основи. AI може да напише IV кода, но работата на изследователя е да защити валидността на инструмента.

15. Какво означава проблемът „Градина от разклоняващи се пътеки“ при гъвкави анализи без предварителна регистрация?

  • A) Твърде много разумни избори за анализ, направени въз основа на данните, увеличават честотата на фалшивите положителни резултати, дори неволно ✔
  • Б) Методите за анализ трябва да бъдат единични и задължителни
  • В) Проблем, който възниква само когато се появи умишлена измама.
  • Г) Ситуация, която изчезва спонтанно с нарастването на извадката

Обяснение: След преглед на данните, изследователят може да направи много разумни избори за това коя променлива, подгрупа, трансформация или праг да използва. Дори и да няма нито едно „умишлено p-хакване“, тази гъвкавост увеличава честотата на фалшивите положителни резултати, тъй като значимият е ефективно избран от голям брой анализи. Предварителната регистрация и фиксираният план за анализ ограничават тази гъвкавост.