Јединице
1. Увод у вештачку интелигенцију у науци о подацима и аналитици: ток посла, улоге, границе, валидација и етика 2. Прикупљање података и разумевање извора: шема, узорковање, квалитет и свест о цурењу 3. Чишћење података и претходна обрада: Недостајућа вредност, Оутлиер и конверзија типа 4. Истраживачка анализа података (ЕДА): дистрибуције, односи и почетни увиди 5. Инжењеринг карактеристика: генерисање варијанти, кодирање, скалирање и избегавање цурења 6. Изградња модела: дефиниција проблема, избор алгоритма и подела обуке/тестирања 7. Евалуација модела: метрика, унакрсна валидација и екстремно учење 8. Визуелизација и приповедање: тачна графика, искрена графика 9. Генерисање кода: Анализа уз помоћ вештачке интелигенције са Питхон-ом (панде) и СКЛ-ом 10. Цурење података и репродуктивност: тихе катастрофе и дисциплина 11. МЛОпс фондација, етика, приватност и одговорна аналитика
Јединица 3 / 11

Чишћење података и претходна обрада: Недостајућа вредност, Оутлиер и конверзија типа

Добици:

  • Способност разликовања узрока недостајућих вредности (случајних, систематичних, смислених) и одабира одговарајуће стратегије и израчунавања вредности попуњавања само из тренинга
  • Способност да се испитају одступања пре него што их избришу и да се направи разлика између грешке у подацима и истинског ретког догађаја
  • Способност да се спречи тихи губитак праћењем утицаја сваког корака на број редова/празних места уз довођење недоследности типа и формата на стандард

Отприлике 60-80 процената времена научника података одлази на чишћење; У индустрији, ово се у полушали назива „дата вранглинг“ (дата вранглинг или дата цлеанинг). Зато што подаци из стварног света скоро никада нису спремни за анализу: датуми су у мешовитим форматима, бројеви се чувају као текст, неке ћелије су празне, купац се појављује три пута у истој табели са два различита правописа. У овој јединици ћемо покрити три основна аспекта чишћења: недостајуће вредности, одступања и конверзију типа/формата. Вештачка интелигенција је изузетно брз помоћник у овом послу; Али ви одлучујете шта и како чистити, јер сваки избор чишћења мења анализу.

Златно правило чишћења: свака промена је одлука

Брисање ћелије, попуњавање недостајуће вредности средњом вредношћу, одсецање одступања — ниједна од ових операција није „неутрална“. Сваки мења податке и утиче на резултат. Дакле, златно правило чишћења: упишите сваку промену у код, обратите пажњу на образложење, никада не замењујте оригиналне податке. АИ вам даје брзи код за чишћење, али ваша је одговорност да разумете шта тај код ради; Немојте га покретати а да не видите колико је редова нестало када кажете „избриши празне редове“.

Опрез: Никада не мењајте оригиналне необрађене податке. Напишите очишћену верзију у посебну датотеку/табелу. На овај начин, ако уочите грешку, можете се вратити на почетак и одржати поновљивост.

Недостају вредности: зашто је празан, шта да се ради

Вредност која недостаје (обично се појављује као НаН — „Није број“ у пандама) је када је ћелија празна. Али узрок јаза одређује решење. Постоје три типичне ситуације. Насумично недостаје: сензор није радио на тренутак; Можда би било разумно да га попуните. Систематски недостаје: поље обрасца се тражи само за одређене купце; Празнина овде је заправо информација. Недостаје значајно: ако је „датум повратка“ празан, купац се није вратио; Овај простор значи 0 или "ништа", није попуњен.

Главне стратегије:

Стратегија

Када је то прикладно?

ризик

Избриши ред

Стопа пропуштања је веома ниска (<5%) и насумична

Губитак података и репрезентације

Избришите колону

Већина колоне је празна (>60%)

губитак информација

Просечна/средња попуњеност

Нумерички, недостаје насумично

Смањује варијансу и искривљује дистрибуцију

Категорија "непознато"

Категоричан, систематски недостаје

Генерише додатне категорије

Предвиђање са моделом

Сложена, драгоцена колона

Ризик од цурења, сложеност

Критична тачка: вредност импутације треба да се израчуна само из података о обуци и иста вредност треба да се примени на податке теста. Ако укључите просек тестних података, стварате цурење (Јединица 10). Медијана (средња вредност редних података) је често преферирана у односу на средњу вредност зато што је робустнија за ванредне вредности од средње вредности.

Оутлиерс: грешка или стварна?

Изузетак може бити једна од две ствари: грешка у подацима (999 у колони узраста) или стваран, али редак догађај (поруџбина клијента од 2 милиона долара). Збркати ово двоје је погубно: избришите истински изузетак и одбацићете важне информације; Ако пустите грешку, ваши просеци ће патити. Због тога је неопходно прво испитати оутлиер, а не да га аутоматски обришете.

Уобичајене методе детекције: ИКР метода (интерквартилни опсег; вредности које су више од 1,5 пута веће од разлике између 25% и 75% квинтила података сматрају се изванредним вредностима) и з-сцоре (број стандардних девијација удаљених од средње вредности која је; обично одступница ако је већа од 3). АИ пише код за ове прорачуне у секунди; Али пре него што кажете „избриши“, проверите које су то вредности.

Конверзија типа и формата: тихи извор грешке

Једна од највећих главобоља је конфузија типа података. Ако је колона „износ“ сачувана као текст, не можете додати; Програм погрешно чита број у турском формату као што је „1.250,50“ уместо „хиљаду двеста педесет“. Датуми („01/03/2024“ дан-месец или месец-дан?), категорије („мушки“/„мушки“/„М“ су иста ствар?) и јединице (ТЛ или курус?) нечујно дају нетачне резултате. Велики део чишћења је увлачење ових недоследности у стандард: датуми у један формат, категорије у један правопис, бројеви у једну целину.

три мини кофера

Случај 1 — Просечна замка. Тим је попунио 320 недостајућих вредности у колони прихода са просеком (48.500 долара). Али недостаци су били систематски: то је био сегмент са ниским примањима који никада није пријавио приход. Просечно попуњавање учинило је ову групу вештачки богатом и кредитни модел је био погрешан. Лекција: питајте „зашто је празан“ пре него што га попуните.

Случај 2 — Изузетак који не треба брисати. Малопродајни аналитичар је избрисао 4 огромне поруџбине (1,8 милиона ТЛ свака) у подацима о продаји, мислећи да су то „грешке“. Међутим, то су биле стварне корпоративне поруџбине и чиниле су 22% укупног промета. Модел предвиђања након брисања потпуно је промашио институционалну потражњу. Поука: испитајте излаз пре него што га обришете.

Случај 3 — Катастрофа у формату датума. У ЦСВ-у, датуми су помешани у „2024-03-01“ и „01.03.2024“. Када је код који је написао ИЗ рашчлањен према првом формату, 6.400 редова је постало НаТ као „неважећи датум“ и тихо је искључено из анализе. Аналитичар је то приметио тек када се смањио број редова. Лекција: увек проверите број редова и празнина након конверзије.

Четири шаблона за копирање

1) Недостаје мапа вредности:

Имам панде дф. Напишите код који производи табелу која приказује број и проценат недостајућих (НаН) за сваку колону. Затим посебно наведите колоне са стопом мањка која прелази 40% и колоне са стопом мањка од 5%. Само генеришите овај дијагностички код, а не стратегију коју предлажете; Ја ћу донети одлуку.

2) Ванредни преглед (не брисање):

Напишите код који ДЕТЕКТУЈЕ (не брише!) одступања за моју колону „износ“ користећи ИКР метод. Ставите ванредне редове у посебан дф тако да могу ручно да их прегледам. Такође одштампајте број одступања и њихов удео у укупном износу.

3) Стандардизација типа/формата:

Напишите код који стандардизује следеће колоне:- "датум": могу бити мешовити формати ("2024-03-01" и "01.03.2024"); претворите их све у датум и време, пребројите непреводиве и пријавите (тихо баците). - "пол": "мушко"/"мушко"/"М" -> "М", "женско"/"женско"/"Ф" -> "К". - "износ": текст у турском формату ("1.250,50") -> децимални број. Одштампајте на колико редова утиче свака конверзија.

4) Проверите пре/после чишћења:

Напишите код који упоређује дф.схапе, недостајући број и збирну статистику (средња вредност, медијана, мин, максимум) изабраних колона пре и после корака чишћења. Сврха: видети шта се мења чишћењем.

Слаби промпт / Јаки промпт

Слабо обавештење:

Обришите ове податке.

„Јасно“ је двосмислено; АИ не зна које делове који недостају треба избрисати, шта попунити, коју колону да обради и како. Резултат: слепе, неповратне промене.

Снажан упит:

Ваша улога: помоћник за чишћење података. дф колоне: цустомер_ид (инт), регистер_дате (текст у мешовитом формату), ревенуе_тл (текст, „1.200,00“), град (текст, недоследан правопис). Правила:- Промена оригиналног дф-а; Радите на копији под називом дф_цлеан.- Претворите приход_тл у број, пребројите оно што се не може превести.- Промените рецорд_дате у датетиме, пријавите грешку.- Немојте брисати ниједан ред без мог одобрења; Покажите кандидате одвојено. После сваког корака, одштампајте дф_темиз.схапе и број који недостаје.

Овде је извор заштићен, свака трансформација се рачуна, брисање је препуштено човеку.

Уобичајене грешке

  • Попуњавање празнина без питања "зашто је празан?" Попуњавање систематског/значајног недостатка средњем вредности искривљује податке.
  • Брисање одступања без испитивања. Одбацивање стварних, али ретких догађаја уништава важне информације.
  • Израчунавање вредности допуна из свих података. Укључивање тестних података ствара цурење; само израчунај из тренинга.
  • Не проверава се број редова/празних места након конверзије. Редови који су тихо НаТ/НаН су искључени из анализе.
  • Преписивање оригиналних података. Повратак и репродуктивност су изгубљени.
Савет: Покрените чишћење са поређењем „пре-после“. Одштампајте дф.схапе, недостајући број и збирну статистику критичних колона након сваког корака. Тако да одмах видите да један корак неочекивано уништава 6.000 редова.

Укратко

Чишћење је фаза науке о подацима која одузима највише времена и захтева одлуке. Свака промена мења податке, тако да је свака свесна одлука. За вредности које недостају, питајте "зашто је празан?" Прегледајте све одлике пре него што их избришете; Доведите тип и формат на стандард. Израчунајте вредност пуњења само из података о обуци, задржите оригинал и пратите утицај сваког корака тако што ћете га бројати. АИ је огроман акцелератор у овом послу, али људи одлучују шта чистите и зашто.

Задатак апликације

Узмите (или креирајте) малу табелу и намерно убаците три проблема у њу: торбу вредности која недостаје, одбацивање, мешовити формат датума. Затражите код за дијагнозу и стандардизацију од АИ са горњим шаблонима; упореди број редова и празнина пре/после сваког корака. Покушајте да ухватите бар један „тихи губитак“ и забележите како сте га приметили.

контролна листа

  • [ ] Да ли сам задржао оригиналне необрађене податке и радио на копији?
  • [ ] Да ли сам поставио питање "зашто је празан" за сваку колону која недостаје?
  • [ ] Да ли сам прегледао недостатке пре него што сам их избрисао?
  • [ ] Да ли сам израчунао вредност допуне само из података о обуци?
  • [ ] Да ли проверавам број редова/празнина после сваког корака и елиминишем тихи губитак?