Единици
1. Вештачка интелигенција во економетријата и статистиката: улоги, граници, автентикација и приватност 2. Чистење и подготовка на податоци: Недостасуваат податоци, оддалечени и кодирање 3. Истражувачка анализа и визуелизација на податоци: графика и интерпретација со вештачка интелигенција 4. Линеарна регресија: Изградба на модел, толкување на коефициентот и претпоставки 5. Регресиска дијагностика и прекршувања: колинеарност, хетероскедастичност, автокорелација 6. Тестирање на хипотези и p-вредност: Значење, моќ и повеќекратни споредби 7. p-хакирање, HARKing и статистички интегритет: стапици во ерата на вештачката интелигенција 8. Анализа на временски серии: стационарност, ARIMA и предвидување 9. Причина и анализа на политики: DiD, IV, RDD и вештачка интелигенција 10. Генерирање и репродуктивност на кодови: R/Python, верзии и репродуктивност 11. Пишување извештаи, комуникација и етика: презентирање резултати и граници на комуникација
Единица 3 / 11

Истражувачка анализа и визуелизација на податоци: графика и интерпретација со вештачка интелигенција

Добивки:

  • Способност да се произведуваат описни статистики и графикони за дистрибуција/врска со поддршка за вештачка интелигенција и да се избере вистинскиот тип на графикон според податоците и прашањето
  • Способност да се препознаат погрешните избори (испрекината оска, несоодветна скала, прекумерно измазнување) на сликите произведени од вештачката интелигенција и да се применат искрени принципи за визуелизација
  • Да се биде способен да се разликува дека истражувачката анализа е за генерирање хипотези и замка за откривање и потврда со истите податоци (што ја отвора вратата за p-хакирање).

По чистењето на податоците, првата работа на емпирискиот истражувач е да ги запознае. Оваа фаза се нарекува истражувачка анализа на податоци (EDA - Exploratory Data Analysis): тоа е процес на испитување на податоците со графикони и збирни статистики и согледување на нивната структура, обрасци и изненадувања. Целта не е сè уште да се тестира хипотеза, туку да се запознаете со податоците, да генерирате прашања и да поставите основа за моделот што ќе го изградите во иднина. Во оваа единица, ќе видиме како вештачката интелигенција (AI) ги забрзува EDA и визуелизацијата, но зошто графиката што ја произведува мора внимателно да се ревидира.

Ајде прво да направиме две основни дистинкции. Прво, описната статистика (броеви кои ги сумираат податоците како што се средна вредност, медијана, стандардна девијација, квартили) и визуелизација (ги прикажуваат истите информации графички) се надополнуваат една со друга; Заедно ги опишуваат податоците. Второ, и најкритично: откритието и потврдата мора да се разликуваат. Истражувачката анализа е за генерирање хипотези; Истражувањето на хипотезата со истите податоци и кажувањето „Јас го тестирав и го најдов значајно“ ја отвора вратата за p-хакирање, што ќе го видиме во следната единица. Слободно е да се погледнат податоците и да се види шема; Но, прогласувањето на таа шема за „докажано откритие“ во истите податоци е погрешно.

Чекор по чекор истражувачка анализа

1. Униваријантен приказ. Испитајте ја секоја променлива поединечно: дали нејзината дистрибуција е симетрична или искривена; колку ридови има; Каде се надворешноста? За нумерички променливи, хистограм (парцела што покажува фреквенција со делење на вредностите во опсези) и кутија (boxplot - графикон што покажува медијални, квартални и екстремни вредности); За категорични променливи, користете табели за фреквенции и столбест дијаграми.

2. Биваријантен поглед. Видете ја врската помеѓу две променливи: заплет на расејување за две нумерички променливи (го прикажува секое набљудување како точка на x-y рамнината), групирана рамка за графика за нумеричко-категорични, вкрстено јазиче за две категорични. Пред да го погледнете коефициентот на корелација, задолжително погледнете го графикот на расејување: истата корелација може да покаже многу различни обрасци (познатиот квартет Анскомб го демонстрира тоа; четири множества податоци имаат речиси идентична статистика, но кога се исцртуваат тие излегуваат дека се сосема различни).

3. Изберете го точниот тип на графикон. Типот на графиконот зависи од вашето прашање и типот на податоци. Хистограм за дистрибуција; расфрлање за врска; линиски графикон за промена со текот на времето; столбест дијаграм за споредба на категории; (внимателно) наредена шипка за односот на деловите со целината. ВИ брзо генерира код за вас, но одлуката „кој графикон за кое прашање“ е ваша.

4. Забележете ја шемата, не објавувајте резултати. Снимете ја секоја интересна шема што ја гледате како „белешка за откривање“, но не сметајте ја за потврдено откритие. Потврдата се врши во посебен чекор, по можност со посебни податоци или однапред одреден распоред.

Искрени принципи на визуелизација

Графиката убедува; Затоа, неговата погрешна моќ е исто така висока. ВИ може да направи естетски, но понекогаш и погрешни избори. Проверете ги овие политики:

  • Во столбест дијаграмите, y-оската мора да започне на нула. Испрекинатата оска покажува мали разлики како големи.
  • Скалата треба да биде конзистентна. Ако се споредуваат два графикони, користете го истиот опсег на оски.
  • Прекумерното измазнување може да ја скрие вистинската шема. Тренд линијата изгледа убаво, но ако премногу ги „измазнува“ податоците, може да доведе до заблуда.
  • Бојата и 3D декорацијата го искривуваат вниманието, а не податоците. Изберете едноставност.
  • Податоците што недостасуваат и големината на примерокот треба да бидат видливи. „n=12“ и „n=12.000“ не треба да изгледаат исто.
Внимание: Само затоа што графиките произведени од вештачката интелигенција се убави, тие не се вистинити. Најчеста грешка што ја прави е тоа што не ја започнува оската од нула на столбестиот графикон и ја преувеличува разликата помеѓу двете групи. Секогаш проверувајте ја оската.

Табела за споредување: прашање → графикон

Прашај

правилна табела

Вообичаена грешка

Како се дистрибуира оваа променлива?

Хистограм/кутија заплет

користете пита шема

Дали две нумерички променливи се поврзани?

Растера парцела

Само гледајќи го бројот на корелации

Како се промени со текот на времето?

линиски графикон

Кажување тренд со столбест дијаграм

Која е разликата помеѓу групите?

Групирана кутија/лента (од нула)

Скратена оска прачка

Сооднос дел спрема целина?

Наредена лента (со претпазливост)

Табела со пити со повеќе парчиња

Четири потсетници за копирање

1. Код за автоматско откривање:

Вашата улога: ЕДА асистент. Не ги споделувам податоците, сакам R (ggplot2) код. Постојат нумерички (приходи, возраст, расходи) и категорични (регион, образование) променливи во data.frame 'податоци'. Задача: напишете код кој произведува хистограм за секоја нумеричка бројка, столбест дијаграм за секоја категорија и графика за расејување за приход~ возраст. Во столбести графикони, нека y-оската започнува од НУЛА. Додадете линија за коментари.

2. Преглед на корелација (корелација + визуелен заедно):

Напишете код кој ја пресметува корелацијата на Пирсон за приходот и трошењето и исцртува график за расеј + линеарен тренд. Додајте линија за коментари што ќе ме потсети да ја испитам табелата пред да ДА МУ ДОВЕРУВАМ на бројот на корелации (предупредување од Анскомб). Не претерано измазнувајте ја линијата на трендови.

3. Ревизија на интегритет:

Проверете го следниов код ggplot за искрена визуелизација:[code]. Проверете и поправете го следново: дали y-оската започнува од нула, дали скалата е конзистентна, дали големината на примерокот е видлива, дали има прекумерно измазнување? Објаснете го оправдувањето за секоја корекција што сте ја направиле.

4. Изработка на белешка за откритие (не наод):

Врз основа на графиконите што ги изработувам, наведете НАБЛЕДУВАЊА како „белешка за откривање“; напишете ја секоја ставка на јазикот на „хипотезата што треба да се тестира“, а не на „убедливиот наод“. Пример: „Приходот во високото образование ИЗГЛЕДА пораспространет; треба да се тестира со посебни податоци.' Избегнувајте каузални и дефинитивни изјави.

Слаб промпт / Силен промпт

Слаба навестување:

Направете убави графикони од приносот и кажете ми што значат.

Овој поттик поканува погрешен резултат: „убавото“ се фокусира на естетиката, додека „што значи“ ја турка вештачката интелигенција да скокне од откритие до конечен заклучок. Следат каузални, претерани коментари.

Моќен потсетник:

Вашата улога: искрен асистент на EDA. Задача: (1) изберете го типот на графиконот што одговара на моето прашање и напишете го оправдувањето, (2) започнете ја оската од нула во столбест дијаграм, (3) интерпретирате го излезот на јазикот ЗАБЕЛЕШКА ОТКРИВАЊЕ: нема дефинитивно/каузално тврдење сугерира хипотеза на јазикот „мора да се тестира“, (4) предупреди дека е мал примерокот во мојата околина и ќе ме предупреди<3 ако го имам дијаграмот. тоа.

Разлика: силната волја го оправдува типот на графиконот, наметнува правила на искреност и не го меша откривањето со потврдата.

три мини футроли

Случај 1 - Дискретно претерување на оската. Аналитичарот ги покажа оценките за задоволство на две гранки (7,8 и 8,0; од 10) во столбест дијаграм. При стартување на оската YZ од 7,5, втората гранка се појави речиси двојно повисока од првата; додека разликата беше само 2,5%. Менаџментот требаше да награди гранка под погрешен впечаток. Кога ја започнав оската од нула разликата беше речиси невидлива. Лекција: само изборот на оската ја менува перцепцијата.

Случај 2 - Доверба на корелацијата и прескокнување на табелата. Еден истражувач видел r = 0,81 помеѓу две променливи и напишал „силна линеарна врска“. Кога неговиот консултант ја побарал заплетот за расејување, се видело дека врската всушност се должи на едно екстремно набљудување, а кога таа точка била отстранета, корелацијата паднала на 0,12. Лекција: броењето на корелација не е замена за графикот; секогаш гледај во расфрлањето.

Случај 3 - Збунувачки откритие со потврда. Еден студент ги разгледа сите корелации во пар во збир на податоци од 40 променливи, ја избра највисоката (r=0,52) и напиша: „најдовме значајна врска помеѓу образованието и заштедите (p=0,004). Сепак, имаше стотици парови во 40 променливи; изборот на највисокиот бил лажен наод поради случајност. Поука: откриената шема не може да биде „тестирана и прогласена за значајна“ во истите податоци; Потребна е посебна потврда.

Вообичаени грешки

  • Не започнување на оската од нула во столбестиот графикон. Ја преувеличува малата разлика; Најчеста визуелна лага. Секогаш проверувајте.
  • Гледајќи ја корелацијата и прескокнување на табелата. Истата корелација доаѓа од многу различни модели; може да одговара на надворешен однос. Прво, расејување.
  • Сметајќи ја шемата пронајдена во откритието како „доказ“ во истите податоци. Ова е портата за p-хакирање; Потврдата се врши одделно.
  • Погрешен тип на графикон. Натпреварите како што се бар за тренд и пита за дистрибуција се погрешни. Изберете жанр врз основа на прашањето.
  • Сокривање на големината на примерокот. n=8 и n=8.000 не треба да изгледаат исто на истиот график; мора да се покаже неизвесност.
Совет: Пред да објавите графикон, запрашајте се: „Дали приказната би се променила ако ја сменам оската? Ако одговорот е да, веројатно сте го започнале стожерот од нечесно место.

Сумирано

Истражувачка анализа на податоци е фаза на исполнување на податоците, гледање шеми и генерирање хипотези; Тоа не е потврда. Вештачката интелигенција брзо генерира описна статистика и код на графиконот, но вие го избирате типот на графикот врз основа на вашето прашање и ги контролирате принципите на правичност (нулта оска, конзистентна скала, привидна несигурност). Погледнете го расејувањето пред да му верувате на корелацискиот број; Не ја декларирајте шемата што ја најдовте при откривањето како „доказ“ во истите податоци. Прекрасен графикон на вештачка интелигенција не значи правилен график.

Задача за апликација

Изберете најмалку три променливи во збир на податоци. Побарајте од вештачката интелигенција и стартувајте го кодот што произведува истражувачки графикони (хистограм, расфрлање, кутии) со барање што ги спроведува правилата за искреност. За секој графикон: проверете (1) соодветноста на типот на графиконот за прашањето, (2) искреноста на оската, (3) видливоста на големината на примерокот. Напишете барем една „белешка за откривање“ на јазикот на хипотезата („...се чини дека се тестира посебно“). Испитајте ја корелацијата и со броењето и со расфрлањето и пријавете дали има несовпаѓање меѓу нив.

листа за проверка

  • [ ] Го избрав типот на графиконот врз основа на моето прашање и типот на податоци.
  • [ ] Во столбести графикони, ја започнувам y-оската од нула; Ја проверив искреноста на оската.
  • [ ] Гледав во растурање пред да верувам во корелацијата.
  • [ ] Ја рефлектирав големината на примерокот и неизвесноста на графикот.
  • [ ] Моделите што ги најдов во истражувањето ги напишав како „хипотеза што треба да се тестира“ наместо „доказ“.
  • [ ] Забележав дека нема да ги користам истите податоци за потврда и дека е потребен посебен чекор.