Јединице
1. Вештачка интелигенција у економетрији и статистици: улоге, границе, аутентификација и приватност 2. Чишћење и припрема података: подаци који недостају, недостаци и кодирање 3. Истраживачка анализа и визуелизација података: цртање и тумачење помоћу вештачке интелигенције 4. Линеарна регресија: изградња модела, интерпретација коефицијената и претпоставке 5. Дијагностика регресије и кршења: колинеарност, хетероскедастичност, аутокорелација 6. Тестирање хипотеза и п-вредност: значајност, моћ и вишеструка поређења 7. п-хаковање, ХАРКинг и статистички интегритет: Замке у доба вештачке интелигенције 8. Анализа временских серија: стационарност, АРИМА и предвиђање 9. Узрочна веза и анализа политике: ДиД, ИВ, РДД и вештачка интелигенција 10. Генерисање кода и репродуктивност: Р/Питхон, верзија и репродуктивност 11. Писање извештаја, комуникација и етика: представљање резултата и комуницирање граница
Јединица 2 / 11

Чишћење и припрема података: подаци који недостају, недостаци и кодирање

Добици:

  • Способност препознавања недостајућих типова података (МЦАР/МАР/МНАР), одступања и грешака кодирања и коришћење АИ са тачним подацима за производњу кода за чишћење и дијагностику
  • Способност да видите како ће сваки корак чишћења (брисање, додељивање, трансформација) који предлаже вештачка интелигенција утицати на резултат анализе и успоставити реверзибилан и документован ток посла
  • Одржавање да су одлуке о чишћењу засноване на познавању процеса који генерише податке и да је вештачка интелигенција надгледани помоћник, а не слепи аутомат

Сваки искусни аналитичар зна једну истину: већину времена емпиријског пројекта није моделирање, већ чишћење података (рад исправљања грешака, пропуста и недоследности у подацима и припремања података за анализу). Као грубо правило, око 70-80% времена иде на разумевање, чишћење и трансформацију података; само 20-30% остаје за стварну анализу. У овој јединици ћемо видети корак по корак како вештачка интелигенција (АИ) олакшава ово тешко бреме, али које одлуке би ипак требало да остану код вас и зашто.

Хајде да прво ставимо две основне чињенице. Прво, одлуке о чишћењу се заснивају на вашем знању о процесу који производи податке: само ви знате зашто недостаје вредност, зашто је број превелик. АИ не види податке, не зна контекст; Пише код, не доноси одлуке. Друго, сваки корак чишћења може променити резултат анализе. Брисање оутлиер-а може инвертовати коефицијент; Попуњавање недостајућих вредности средњом вредношћу може вештачки смањити варијансу. Дакле, чишћење треба да буде реверзибилно и документовано: никада не додирујте необрађене податке, урадите сваки корак у коду, забележите утицај сваког корака.

Процес чишћења корак по корак

1. Упознајте податке. Прво погледајте структуру: број редова (запажања) и колона (варијабле), тип сваке променљиве (нумеричка, категоричка, датумска), збирну статистику, број недостајућих. Можете затражити од АИ за овај код „профила података“; Али читате излаз и постављате питања попут "зашто је ова променљива дошла као текст?"

2. Разумети и класификовати податке који недостају. Подаци који недостају су подељени у три типа. МЦАР (Недостаје потпуно насумично): недостатак није због ничега, на пример, сензор је случајно отказао. МАР (Недостаје насумично): недостатак зависи од других посматраних варијабли, на пример, старији људи чешће остављају питање празним, али знате старост. МНАР (Миссинг Нот Ат Рандом): недостатак зависи од саме неопажене вредности, на пример људи са високим зарадама не пријављују своје приходе. Ова разлика је критична јер одређује метод решења и АИ не може да одлучи о томе уместо вас.

3. Позабавите се недостатком. Опције: брисање по листи, импутација средње/средње вредности, вишеструка импутација заснована на моделу. Брисање у МЦАР-у је релативно безбедно, али смањује величину узорка. Вишеструки задатак је прикладнији у МАР-у. Ниједан једноставан метод не гарантује непристрасност у МНАР; Механизам недостатка треба моделовати или барем извршити анализу осетљивости. Попуњавање средње вредности је лако, али опасно: смањује варијансу, слаби односе и скрива неизвесност.

4. Испитајте изузетке. Изузетно је запажање које стоји веома далеко од осталих. Раздвојите два питања: Да ли је ово грешка (999 година је написано у уносу података) или је стварна, али изванредна вредност (приход милијардера)? Поправи грешке; Немојте брисати праве ванредне вредности јер представљају податке. Брисање одступања „јер смета“ искривљује податке ка исходу.

5. Кодирање и доследност. Стандардизујте категорије ("мушки", "мушки", "Е" све у један код), доведите датуме у један формат, јединице у једну скалу, откријте дупле редове. Ово је најмање ризична фаза у којој АИ најбоље помаже.

6. Документујте и замрзните. Запишите сваки корак са кодом и линијом за коментаре, држећи необрађене и очишћене податке одвојено. Дакле, када судија пита "зашто су ова запажања одбачена?" имате спреман одговор.

Опрез: Немојте доносити одлуке о чишћењу на основу резултата. Брисање реда са натписом „Када избришете ову линију, коефицијент постаје значајан“ је најподмуклији облик п-хаковања, који ћемо видети у следећој јединици.

Табела поређења: недостајуће методе података

Метод

Када је то прикладно?

ризик

Улога АИ

Избришите ред

МЦАР, ниска стопа пропуштања

Узорак постаје мањи, пристрасност у МАР/МНАР

Пише код; ти одлучујеш

Средња/средња задаћа

Брза прелиминарна анализа

Смањује варијансу, скрива везу

Лако је, али не препоручује се; треба упозорити

Вишеструки задаци (МИ)

МАР, важне варијабле

Ако није правилно инсталиран, то ће бити погрешно

Препоручује код и пакет (мишеви)

Моделирање механизама

МНАР

Комплексно, претпоставка интензивно

Само нацрт; потребан је стручњак

Четири упита за копирање

1. Профилисање података:

Ваша улога: помоћник за чишћење података. Не делим податке, желим Р код. Имам дата.фраме под називом 'дигит'; варијабле: ид, старост (бројчано), приход (бројчано), образовање (категорично), регион (категорички), датум (датум). Задатак: написати код који производи тип, број који недостаје и стопу за сваку променљиву, збирну статистику за нумеричке и табелу учесталости за категоријске. Додајте ред за коментаре.

2. Дијагноза недостајућих података:

Напишите код који испитује образац који недостаје за горње 'цифрене' податке: - стопу недостајања сваке променљиве, - једноставну табелу/графикон који показује однос недостатка са другим варијаблама. Погледаћу излаз кода и направити разлику МЦАР/МАР/МНАР; Ви само производите дијагностички алат, НЕМОЈТЕ одлучивати о методи додељивања.

3. Ванредни преглед (не брисање):

Напишите код за променљиву 'приход' која испитује одступања БЕЗ БРИСАЊА: дијаграм оквира, границе засноване на ИКР-у и табела са списком запажања изванредних вредности + вредности. Видећу да ли су ово грешке или стварне. Додајте аутоматско брисање.

4. Стандардизација кодирања:

У варијабли 'образовање' вредности се пишу мешано: "Основна школа","основна школа","ПРИМАРНО","Гимназија","средња школа","Универзитет","унив". Напишите Р код који их поново кодира у конзистентне категорије; Јасно прикажи табелу мапирања како бих могао да потврдим сваку конверзију. Подесите вредност коју не препознајете на „УНКНОВН“.

Слаби промпт / Јаки промпт

Слабо обавештење:

Очистите податке, попуните празнине, одбаците недостатке.

Овај захтев је опасан: даје слепи ауторитет АИ. Каква врста недостајања, какво пуњење, каква контрадикторна истина – ништа од тога није јасно. Резултат може бити тајно пристрасан скуп података.

Снажан упит:

Ваша улога: помоћник за чишћење, ви нисте доносилац одлука. Идите корак по корак и напишите код који извештава о утицају СВАКОГ корака: 1) покажите образац који недостаје (НЕ бришите/попуните), 2) наведите кандидате који су ван граница (НЕ бришите), 3) поправите недоследности категорије са табелом мапирања. Одштампајте број редова и збирну статистику након сваког корака како бих могао да видим и потврдим промену. Аутоматско додељивање/уметање брисања.

Разлика је јасна: снажна воља позиционира АИ као надгледаног помоћника, који производи реверзибилне и документоване кораке.

три мини кофера

Случај 1 — Замка просечног задатка. Подаци о приходима једног аналитичара за 5.000 људи недостајали су 18%. Рекао је АИ да "попуни празнине"; АИ их је све упросечио. Резултат: варијанса прихода је смањена за 22%, а коефицијент односа образовање-приход се показао слабији него што је био. Тачан начин: недостатак је био МАР (због образовања), морао се попунити вишеструким задатком (мишеви). Лекција: начин пуњења зависи од механизма.

Случај 2 — Чишћење ванредног стања поништава налаз. У подацима о једној фирми биле су 3 веома велике фирме (0,6% укупног посматрања). Они су избрисани предлогом АИ за "чишћење"; Коефицијент економије обима се претворио из позитивне у негативну. Међутим, те 3 компаније су биле стварне и важан део индустрије. Исправан начин је био да се извештава са потпуном и поузданом проценом уместо брисања. Поука: стварни одступници су подаци, а не бука.

Случај 3 — Тиха грешка кодирања. На једном панелу, варијабла датума је дошла у два различита формата („2020-03-01“ и „01/03/2020“). Када их је комбиновани код произведен од стране вештачке интелигенције заменио за различите вредности, 1.400 запажања је било неусклађено и стопе раста су постале смешне. Не би било важно да аналитичар не провери број редова. Лекција: бројање посматрања и провера здраве памети након сваког корака су обавезни.

Уобичајене грешке

  • Слепо попуњавајући празнину просеком. Смањује варијансу, сакрива неизвесност и ствара пристрасност у МАР/МНАР. Прво класификујте механизам.
  • Брисање одступања "јер смета". Прави оутлиерс представљају податке; брисање је савијање резултата. Исправи оно што није у реду, задржи оно што је стварно.
  • Додиривање необрађених података. Никада не мењајте необрађене податке; Урадите све чишћење са кодом у посебној копији како би се могао вратити.
  • Не мерење утицаја корака. Ако се број редова и збирна статистика не провере након сваког корака, тихе грешке ће се акумулирати.
  • Чишћење као резултат. Логика "Када додате ову линију, резултат постаје бољи" је п-хаковање; Чишћење треба планирати пре и независно од резултата анализе.
Савет: Имајте табелу „пре/после“ која ставља исту основну статистику (средња вредност, медијана, број запажања, неколико корелација) једну поред друге пре и после чишћења. Неочекивани скок је најбољи предзнак скривене грешке.

Укратко

Чишћење података је фаза емпиријског рада која највише одузима време и захтева одлуке. АИ је моћан генератор кода у овоме, али не може да постигне најбоље резултате: класификујете тип података који недостаје (МЦАР/МАР/МНАР), одређујете да ли је одступање грешка или стваран, одржавате сваки корак реверзибилним и документованим. Уместо да АИ слепом дате „јасно” овлашћење, успоставите корак по корак ток посла чији се утицај мери и потврђује. Провера броја запажања и збирне статистике након сваког корака је најбољи лек за тихе грешке.

Задатак апликације

Изаберите најмање две променљиве које садрже недостајуће и одступнике у скупу података (ваши подаци или скуп узорака). Затражите дијагностички код од АИ преко горњег одзива „корак по корак, не бришите/попуните“ и покрените га. Класификујте недостатак као МЦАР/МАР/МНАР и напишите своје оправдање у једној реченици. Испитајте контрадикторне кандидате једног по једног и одлучите који је погрешан, а који прави. Коначно, направите табелу „пре-после“ пре/после чишћења и пријавите ако има било каквих неочекиваних промена.

контролна листа

  • [ ] Очистио сам необрађене податке у засебној копији без промене.
  • [ ] Класификовао сам недостатак као МЦАР/МАР/МНАР и у складу са тим одабрао метод.
  • [ ] Испитивао сам одлике један по један да ли су грешке или стварне; Нисам га слепо избрисао.
  • [ ] Проверио сам број запажања и збирне статистике након сваког корака чишћења.
  • [ ] Документовао сам све кораке са кодом и линијом за коментаре; реверзибилан.
  • [ ] Чишћење сам базирао на познавању процеса који производи податке, а не на резултату анализе.