Единици
1. Вештачка интелигенција во економетријата и статистиката: улоги, граници, автентикација и приватност 2. Чистење и подготовка на податоци: Недостасуваат податоци, оддалечени и кодирање 3. Истражувачка анализа и визуелизација на податоци: графика и интерпретација со вештачка интелигенција 4. Линеарна регресија: Изградба на модел, толкување на коефициентот и претпоставки 5. Регресиска дијагностика и прекршувања: колинеарност, хетероскедастичност, автокорелација 6. Тестирање на хипотези и p-вредност: Значење, моќ и повеќекратни споредби 7. p-хакирање, HARKing и статистички интегритет: стапици во ерата на вештачката интелигенција 8. Анализа на временски серии: стационарност, ARIMA и предвидување 9. Причина и анализа на политики: DiD, IV, RDD и вештачка интелигенција 10. Генерирање и репродуктивност на кодови: R/Python, верзии и репродуктивност 11. Пишување извештаи, комуникација и етика: презентирање резултати и граници на комуникација
Единица 2 / 11

Чистење и подготовка на податоци: Недостасуваат податоци, оддалечени и кодирање

Добивки:

  • Способност да се препознаат исчезнатите типови податоци (MCAR/MAR/MNAR), оддалечени и грешки во кодирањето и да се користи вештачка интелигенција со точни податоци за да се произведе код за чистење и дијагностика
  • Способност да се види како секој чекор на чистење (бришење, доделување, трансформација) предложен од вештачката интелигенција ќе влијае на резултатот од анализата и ќе воспостави реверзибилен и документиран работен тек
  • Одржување дека одлуките за расчистување се засноваат на знаење за процесот што генерира податоци и дека вештачката интелигенција е надгледуван асистент, а не слеп автомат

Секој искусен аналитичар знае една вистина: поголемиот дел од времето на емпирискиот проект не е моделирање, туку чистење на податоци (работа на поправање на грешки, пропусти и недоследности во податоците и подготвување за анализа). Како грубо правило, околу 70-80% од времето оди во разбирање, чистење и трансформирање на податоците; само 20-30% остануваат за вистинската анализа. Во оваа единица, ќе видиме чекор по чекор како вештачката интелигенција (ВИ) го олеснува овој тежок товар, но кои одлуки сепак треба да останат со вас и зошто.

Прво да ставиме два основни факти. Прво, одлуките за чистење се засноваат на вашето знаење за процесот што ги произведува податоците: само вие знаете зошто недостасува вредност, зошто некој број е преголем. ВИ не ги гледа податоците, не го знае контекстот; Пишува код, не донесува одлуки. Второ, секој чекор на чистење може да го промени резултатот од анализата. Бришењето на оддалеченост може да го инвертира коефициентот; Пополнувањето на пропуштеното со средната вредност може вештачки да ја намали варијансата. Значи, чистењето треба да биде реверзибилно и документирано: никогаш не допирајте необработени податоци, правете го секој чекор во кодот, снимајте го влијанието на секој чекор.

Работен тек на чистење чекор-по-чекор

1. Знајте ги податоците. Прво видете ја структурата: број на редови (набљудувања) и колони (променливи), тип на секоја променлива (нумеричка, категорична, датум), сумарна статистика, број на исчезнати. Можете да побарате од вештачката интелигенција за овој код за „профил на податоци“; Но, вие го читате излезот и поставувате прашања како "зошто оваа променлива дојде како текст?"

2. Разбирање и класифицирање на податоците што недостасуваат. Податоците што недостасуваат се поделени на три вида. MCAR (Недостасува целосно по случаен избор): тоа што недостасува не се должи на ништо, на пример, сензорот не успеал случајно. MAR (Недостасува по случаен избор): недостигот зависи од другите набљудувани променливи, на пример постарите луѓе почесто оставаат празно прашање, но ја знаете возраста. MNAR (Недостига не по случаен избор): недостигот зависи од самата ненабљудувана вредност, на пример, оние со високи заработувачки не го пријавуваат својот приход. Оваа разлика е критична бидејќи го одредува методот на решение и вештачката интелигенција не може да одлучи за тоа наместо вас.

3. Справете се со недостатокот. Опции: листано бришење, средна/средна импутација, повеќекратна импутација базирана на модел. Бришењето во MCAR е релативно безбедно, но ја намалува големината на примерокот. Повеќекратната задача е посоодветна во МАР. Ниту еден едноставен метод не гарантира непристрасност во MNAR; Механизмот на недостаток треба да се моделира или барем да се направи анализа на сензитивноста. Пополнувањето на средната вредност е лесно, но опасно: ја намалува варијансата, ги ослабува односите и ја крие неизвесноста.

4. Испитајте ги оддалечените. Оддалеченост е набљудување што стои многу далеку од другите. Одделете ги двете прашања: Дали е ова грешка (возраст од 999 е напишана во внесот на податоците) или е реална, но необичната вредност (приход на милијардер)? Поправете грешки; Не бришете вистински оддалечени, бидејќи тие претставуваат податоци. Бришењето на оддалеченото „затоа што пречи“ ги искривувате податоците кон исходот.

5. Кодирање и конзистентност. Стандардизирајте ги категориите („Машко“, „машко“, „Е“ сите во еден код), внесете ги датумите во еден формат, единиците во една скала, откривајте дупликат редови. Ова е најмалку ризичната фаза каде што вештачката интелигенција најдобро помага.

6. Документирајте и замрзнете. Запишете го секој чекор со код и линија за коментари, чувајќи ги необработените и исчистените податоци одделно. Значи, кога судијата ќе праша "зошто овие набљудувања беа отфрлени?" го имате вашиот одговор подготвен.

Внимание: Не донесувајте одлуки за чистење врз основа на резултатите. Бришењето на линијата која вели „Кога ќе ја избришете оваа линија, коефициентот станува значаен“ е најподмолната форма на p-хакирање, што ќе го видиме во следната единица.

Споредбена табела: методи на податоци што недостасуваат

Метод

Кога е соодветно?

ризик

Улогата на вештачката интелигенција

Избришете ред

MCAR, ниска стапка на недостиг

Примерокот станува помал, пристрасност во MAR/MNAR

Ја пишува шифрата; вие одлучувате

Средна/средна задача

Брза прелиминарна анализа

Ја намалува варијансата, ја крие врската

Лесно е, но не го препорачуваме; треба да предупреди

Повеќекратна задача (MI)

МАР, важни променливи

Ако не се инсталира правилно, тоа ќе биде погрешно

Препорачува код и пакет (глувци)

Моделирање на механизмот

МНАР

Комплексна, интензивна со претпоставки

Само нацрт; се бара експерт

Четири потсетници за копирање

1. Профилирање на податоци:

Вашата улога: асистент за чистење податоци. Не ги споделувам податоците, сакам Р код. Имам податочна рамка наречена „цифра“; променливи: ид, возраст (нумерички), приход (нумерички), образование (категорично), регион (категоричен), датум (датум). Задача: напишете код кој произведува тип, број што недостасува и стапка за секоја променлива, сумарна статистика за нумерички и табела за фреквенција за категорични. Додадете линија за коментари.

2. Дијагноза на податоци што недостасуваат:

Напишете код кој го испитува образецот што недостасува за горенаведените „цифри“ податоци: - стапката што недостасува на секоја променлива, - едноставна табела/граф што ја прикажува врската на недостигот со другите променливи. Ќе го погледнам излезот од кодот и ќе ја направам разликата MCAR/MAR/MNAR; Вие само ја произведувате дијагностичката алатка, НЕ одлучувајте за методот на доделување.

3. Исклучителна инспекција (не бришење):

Напишете го кодот за променливата „приход“ што ги испитува оддалечените вредности БЕЗ БРИШЕЊЕ: кутии, граници засновани на IQR и табела со листа на оддалечени набљудувања + вредности. Ќе видам дали се тоа грешки или реално. Додадете автоматско бришење.

4. Стандардизација на кодирање:

Во променливата „образование“, вредностите се напишани мешано: „Основно училиште“, „Основно училиште“, „ОСНОВНО“, „Гимназија“, „гимназија“, „Универзитет“, „унив“. Напишете R код кој ги прекодира во конзистентни категории; Прикажи ја јасно табелата за мапирање за да можам да ја потврдам секоја конверзија. Поставете ја вредноста што не ја препознавате на „НЕПОЗНАТ“.

Слаб промпт / Силен промпт

Слаба навестување:

Исчистете ги податоците, пополнете ги празнините, отфрлете ги оддалечените.

Ова барање е опасно: ѝ дава слеп авторитет на вештачката интелигенција. Каков тип недостасува, какво пополнување, каква контрадикторна вистина - ништо од тоа не е јасно. Резултатот може да биде тајно пристрасен збир на податоци.

Моќен потсетник:

Вашата улога: асистент за чистење, вие не сте одлучувачот. Одете чекор по чекор и напишете код што го известува влијанието на СЕКОЈ чекор: 1) прикажете ја шаблонот што недостасува (НЕ бришете/пополнете), 2) наведете ги поважните кандидати (НЕ бришете), 3) поправете ги недоследностите на категориите со табелата за мапирање. Отпечатете го бројот на редови и резимената статистика по секој чекор за да можам да ја видам и потврдам промената. Автоматско вметнување доделување/бришење.

Разликата е јасна: силната волја ја позиционира ВИ како надгледуван асистент, произведувајќи реверзибилни и документирани чекори.

три мини футроли

Случај 1 - Просечна стапица за доделување. Податоците за приходите на еден аналитичар за 5.000 луѓе недостасуваа 18%. Тој и рекол на вештачката интелигенција да ги „пополни празнините“; Вештачката интелигенција ги просекуваше сите. Резултат: варијансата на приходите се намали за 22%, а коефициентот на односот образование-приход се покажа послаб отколку што беше. Точен начин: недостатокот беше МАР (поради образование), мораше да се пополни со повеќекратна задача (глувци). Поука: методот на полнење зависи од механизмот.

Случај 2 - Чистењето на надворешноста го менува наодот. Во податоците на една фирма имаше 3 многу големи фирми (0,6% од вкупното набљудување). Овие беа избришани со предлогот за „чистење“ на вештачката интелигенција; Коефициентот на економии на обем се претвори од позитивен во негативен. Сепак, тие 3 компании беа реални и важен дел од индустријата. Точниот начин беше да се пријави и со целосна и со силна проценка наместо со бришење. Поука: вистинските оддалечени се податоците, а не бучавата.

Случај 3 - Грешка во тивко кодирање. Во еден панел, променливата датум дојде во два различни формати („2020-03-01“ и „01/03/2020“). Кога комбинираниот код произведен од вештачката интелигенција ги помешал за различни вредности, 1.400 набљудувања биле неусогласени и стапките на раст станале смешни. Не би било важно ако аналитичарот не го провери бројот на редови. Лекција: броењето на набљудувањата и проверките на разум после секој чекор се задолжителни.

Вообичаени грешки

  • Слепо пополнување на празнината со просекот. Ја намалува варијансата, ја крие несигурноста и создава пристрасност во MAR/MNAR. Прво класифицирајте го механизмот.
  • Бришење на оддалеченоста „затоа што пречи“. Вистинските оддалечени ги претставуваат податоците; бришењето е свиткување на резултатот. Поправете го она што не е во ред, чувајте го она што е реално.
  • Допирање на необработени податоци. Никогаш не менувајте необработени податоци; Направете го целото чистење со кодот во посебна копија за да може да се врати.
  • Не мерење на влијанието на чекорите. Ако по секој чекор не се проверат броењето на редови и статистиката за резиме, ќе се акумулираат тивки грешки.
  • Чистење како резултат. Логиката на „Кога ќе ја додадете оваа линија, резултатот станува подобар“ е p-hacking; Чистењето треба да се планира пред и независно од резултатот од анализата.
Совет: Чувајте табела „пред/после“ која ги става истите основни статистики (средна вредност, средна вредност, број на набљудувања, неколку корелации) една до друга пред и по чистењето. Неочекуван скок е најдобар предвесник на скриена грешка.

Сумирано

Чистењето на податоците е фазата на емпириска работа која одзема многу време и бара одлучување. AI е моќен генератор на код во ова, но не може да ги повика снимките: го класифицирате типот на податоци што недостасуваат (MCAR/MAR/MNAR), одредувате дали оддалеченоста е грешка или реална, одржувајте го секој чекор реверзибилен и документиран. Наместо да му дадете „јасна“ овластување на слепата вештачка интелигенција, воспоставете чекор-по-чекор работен тек чие влијание се мери и потврдува. Проверката на бројот на набљудувања и збирната статистика по секој чекор е најдобриот противотров за тивките грешки.

Задача за апликација

Изберете најмалку две променливи што содржат исчезнати и оддалечени во множеството податоци (ваши сопствени податоци или множество примерок). Побарајте дијагностичка шифра од вештачката интелигенција преку горното известување „чекор по чекор, не бришете/полнете“ и стартувајте го. Класифицирајте го недостатокот како MCAR/MAR/MNAR и напишете го вашето оправдување во една реченица. Испитајте ги контрадикторните кандидати еден по еден и одлучете кој е грешка, а кој е реален. Конечно, направете табела „пред-после“ пред/по чистењето и пријавете дали има некакви неочекувани промени.

листа за проверка

  • [ ] Ги исчистив необработените податоци во посебна копија без да ги менувам.
  • [ ] Го класифицирав недостатокот како MCAR/MAR/MNAR и соодветно го избрав методот.
  • [ ] Ги испитував надворешноста еден по еден дали се грешки или реални; Не го избришав слепо.
  • [ ] Го проверував бројот на набљудувања и сумирани статистики по секој чекор на чистење.
  • [ ] Ги документирав сите чекори со код и линија за коментари; реверзибилна.
  • [ ] Чистењето го засновав на знаење за процесот што ги произведува податоците, а не на резултатот од анализата.