Јединице
1. Увод у вештачку интелигенцију у науци о подацима и аналитици: ток посла, улоге, границе, валидација и етика 2. Прикупљање података и разумевање извора: шема, узорковање, квалитет и свест о цурењу 3. Чишћење података и претходна обрада: Недостајућа вредност, Оутлиер и конверзија типа 4. Истраживачка анализа података (ЕДА): дистрибуције, односи и почетни увиди 5. Инжењеринг карактеристика: генерисање варијанти, кодирање, скалирање и избегавање цурења 6. Изградња модела: дефиниција проблема, избор алгоритма и подела обуке/тестирања 7. Евалуација модела: метрика, унакрсна валидација и екстремно учење 8. Визуелизација и приповедање: тачна графика, искрена графика 9. Генерисање кода: Анализа уз помоћ вештачке интелигенције са Питхон-ом (панде) и СКЛ-ом 10. Цурење података и репродуктивност: тихе катастрофе и дисциплина 11. МЛОпс фондација, етика, приватност и одговорна аналитика
Јединица 2 / 11

Прикупљање података и разумевање извора: шема, узорковање, квалитет и свест о цурењу

Добици:

  • Способност препознавања различитих извора података (база података, АПИ, датотека, веб скрапинг) и замке сваког од њих и правилно разумевање шеме
  • Способност да се изврши поновљиво узорковање проценом да ли узорак представља популацију и пристрасност селекције
  • Способност да се елиминише цурење података у фази прикупљања и да се поштују законске/етичке границе постављањем питања „Да ли ћу их имати у време предвиђања“ у свакој колони?

Свака анализа је добра колико и квалитет података које прикупљате. Чак и најнапреднији модел на свету ће произвести непоуздане резултате ако ради са подацима који су погрешно прикупљени, узорковани пристрасно или садрже информације о будућности. У информатици, овај принцип је сажет као „ђубре унутра, смеће напоље“ (ђубре унутра, смеће напоље). У овој јединици ћемо покрити фазу прикупљања података: разумевање извора, узорковање, постављање питања о квалитету и будност на ризик од цурења података од првог дана. Вештачка интелигенција је моћна помоћ у овој фази; Пише СКЛ упит, сумира АПИ документ, саставља уговор о подацима. Али људско биће је оно које одлучује које податке прикупљате и да ли ти подаци представљају вас.

Упознавање извора података

Подаци долазе са различитих места, а сваки извор има своје замке. База података (структурирани подаци ускладиштени у табелама, обично упитани помоћу СКЛ-а) је најчешћи извор; Поуздан је, али је потребно добро разумети његову шему. АПИ (Апликацијски програмски интерфејс) пружа податке уживо, али носи ризик од ограничења брзине и промене формата. Датотеке (ЦСВ, Екцел, ЈСОН) су флексибилне, али склоне недоследности формата. Скрапинг на вебу је моћан, али има законска и етичка ограничења; Не може се сваки сајт обрисати.

Пажња: За веб сцрапинг и аутоматско прикупљање података, придржавајте се услова коришћења сајта, датотеке роботс.ткт и КВКК/ГДПР. Неовлашћено прикупљање података ствара правну одговорност. У контексту безбедности информација, користите алате за прикупљање података само на системима за које сте овлашћени иу сврхе одбране/анализе; Неовлашћени приступ или стругање су забрањени.

Разумевање шеме: упознавање са подацима

Пре прикупљања скупа података, морате разумети његову шему (називе колона, њихове типове података, њихова значења и међусобне односе). АИ је овде веома корисна у креирању „речника података“ — табеле која објашњава шта свака колона значи. Али објашњења која АИ производи су предвиђања; Потврдите право значење сваке колоне са тимом који је произвео податке. На пример, колона под називом „статус“ може да садржи 0/1/2; Само првобитни тим зна да ли су „на чекању/одобрен/отказан“ или нешто друго.

Следећа табела сумира основне типове ресурса и упозорења:

Извор

јака тачка

трап

Како АИ помаже

СКЛ база података

Структурно, поуздано

Цомплек ЈОИНс

Пише нацрт упита

АПИ

живи подаци

Ограничење брзине, промена облика

Резиме докумената, повлачење кода

ЦСВ/Екцел

Флексибилан, брз

Недоследност формата

Читање/рашчлањивање кода

веб стругање

Широк досег

Правна/етичка граница

Рашчлањивање нацрта (у оквиру овлашћења)

Подаци евиденције/догађаја

детаљан

огроман волумен

Упит за филтрирање

Илустрација: да ли део представља целину?

Већину времена радите са узорком (подскупом одабраним из популације), а не са целим подацима. Критично питање је: да ли овај узорак представља популацију? Пристрасност избора је најчешћа замка. На пример, ако узоркујете само кориснике из мобилне апликације, нећете видети кориснике веба и ваши резултати ће бити погрешни. Случајно узорковање (сваки запис има једнаке шансе да буде изабран) је у већини случајева најбезбедније; али у подацима временске серије, подела се врши хронолошки, а не насумично (ово ћемо видети у јединицама 7 и 10).

Цурење свести од првог дана

Цурење података је извор већине катастрофа и обично настаје током фазе прикупљања података. Пример: када се предвиђа „да ли је отказан“, ако додате колону „датум отказивања“ подацима, модел гледа у будућност. Током фазе прикупљања, поставите једно питање за сваку колону: „Да ли ћу заиста имати ове информације у тренутку када будем предвиђао?“ Ако је одговор не, та колона цури. Ову тему ћемо детаљно обрадити у јединици 10; Али свест треба да почне од првог дана.

три мини кофера

Случај 1 — Проблем репрезентације. Једна банка је за свој модел кредитног ризика прикупљала податке само о одобреним кредитима (18.500 записа). Одбијања нису била у подацима. Модел је погрешио у стварном свету јер никада није видео како ће се одбачени понашати. Поука: узорак треба да буде репрезентативан за целу популацију из које доносите одлуку.

Случај 2 — Тиха промена облика. Тим је сваки дан извлачио податке о ценама из АПИ-ја. Једног дана, АПИ провајдер је променио валуту из УСД у ЕУР, али је име домена остало исто. Подаци су прикупљани у погрешној јединици 12 дана; 3.200 линија је оштећено. Лекција: Редовно проверавајте конзистентност обима и формата у подацима АПИ-ја.

Случај 3 — Рано цурење. Аналитичар је укључио колону „разлог затварања налога“ када је прикупљао податке за процену „одлива“. Ова колона је попуњена тек након што је купац отишао. Модел је дао 97% тачности на тест сету; Није функционисало у производњи јер је та колона била празна у време предвиђања. Лекција: поставите свакој колони питање "да ли га имам у време предвиђања?"

Четири шаблона за копирање

1) Екстракција речника података:

Ваша улога: помоћник научника података. Испод су имена колона и узорци (анонимних) вредности табеле. За сваку колону наведите њено процењено значење, тип података и потенцијалне ризике квалитета у табели. Означите колоне у које нисте сигурни као „потребна је потврда“; значење прављење. Колоне: [налепите овде]

2) Код узорка (насумичан, поновљив):

Имам панде дф. Напишите код који издваја репрезентативни 5% случајног узорка из 200.000 редова. Користите рандом_стате=42 (за поновљивост). Додајте код да бисте проверили да ли је дистрибуција по класама узорка слична популацији.

3) Питање скенирања цурења:

Даћу вам ову листу колона. Мој циљ је да предвидим „да ли је отказано“ (0/1). За сваку колону процените да ли ћу је заиста имати у тренутку предвиђања и означите је као „безбедно/сумњиво/цурење“. Напишите своје образложење у једној реченици. Колоне: [лист]

4) Нацрт СКЛ пулл упита:

Имам табеле „поруџбине“ и „купци“ у ПостгреСКЛ-у. Напишите ЈОИН упит који комбинује поруџбине у последњих 90 дана са градом корисника и враћа укупан износ и број поруџбина по граду. Објасните филтер датума и како се рукује НУЛЛ градовима. Покренућу упит и проверићу га.

Слаби промпт / Јаки промпт

Слабо обавештење:

Извуците ми добар узорак података из ове базе података.

„Добро“ је двосмислено; Која слика, који период, која величина, која намена није јасно. АИ ће произвести само генерички, можда погрешан упит.

Снажан упит:

Ваша улога: СКЛ асистент. Имам табелу „трансакције“: колоне ид, цустомер_ид, датум (временска ознака), износ (нумерички), канал (текст: 'веб'/'мобиле'). Задатак: Написати поновљив (детерминистички са ОРДЕР БИ) упит који враћа 10.000 репрезентативних редова из сваког канала за 2024. годину. Сврха: компаративна анализа канала. Наведите претпоставке вашег упита.

Овде су табела, намена, величина и поновљивост јасни.

Уобичајене грешке

  • Не доводећи у питање репрезентативност узорка. Лако доступни подаци нису тачни подаци; пристрасност селекције искривљује резултат.
  • Прилагођавање значења колона АИ. Изворни тим зна значење; Немојте користити АИ предвиђање без потврде.
  • Не прати промену формата/јединице АПИ-ја. Тиха промена прикупља корумпиране податке данима.
  • Игнорисање цурења у фази прикупљања. Ако се питање "Да ли га имам у време предвиђања" не постави рано, модел ће дати лажан успех.
  • Прикупљање неовлашћених или незаконитих података. Кршење роботс.ткт, услова коришћења и КВКК-а представља озбиљан ризик.
Савет: Сачувајте „картицу са подацима“ на једној страници за сваки нови извор података: извор, датум повлачења, број редова, познате границе и колоне са ризиком од цурења. Ова картица чува питање „шта су то подаци“ и могућност поновљивости месецима касније.

Укратко

Квалитет анализе је ограничен квалитетом прикупљених података. Добро познајте извор (базу података, АПИ, фајл, сцрапе) и шему; побрините се да узорак буде репрезентативан за популацију; Елиминишите цурење од првог дана тако што ћете сваку колону питати „да ли га имам у време предвиђања?“ АИ је одличан акцелератор за упите и рад са документима, али људи одлучују које податке ће прикупити и њихову репрезентативност. Ограничења овлашћења, закона и поверљивости увек су на првом месту.

Задатак апликације

Изаберите извор података (из сопственог бизниса или хипотетички). Набавите нацрт речника података од АИ са шаблоном „вађење речника података“ изнад; Затим ручно процените сваку колону да видите да ли је процурила. Покушајте да пронађете бар једну сумњиву/цурењу колону и у једној реченици напишите зашто је ризично.

контролна листа

  • [ ] Да ли сам потврдио извор података и шему са изворним тимом?
  • [ ] Да ли сам проверио да ли је узорак репрезентативан за популацију?
  • [ ] Да ли сам свакој колони поставио питање „хоћу ли га имати у време процене?“
  • [ ] Да ли сам направио узорковање поновљивим (фиксно семе)?
  • [ ] Да ли сам проверио законска/етичка (ауторитет, роботс.ткт, КВКК) ограничења прикупљања?