Добици:
- Способност препознавања различитих извора података (база података, АПИ, датотека, веб скрапинг) и замке сваког од њих и правилно разумевање шеме
- Способност да се изврши поновљиво узорковање проценом да ли узорак представља популацију и пристрасност селекције
- Способност да се елиминише цурење података у фази прикупљања и да се поштују законске/етичке границе постављањем питања „Да ли ћу их имати у време предвиђања“ у свакој колони?
Свака анализа је добра колико и квалитет података које прикупљате. Чак и најнапреднији модел на свету ће произвести непоуздане резултате ако ради са подацима који су погрешно прикупљени, узорковани пристрасно или садрже информације о будућности. У информатици, овај принцип је сажет као „ђубре унутра, смеће напоље“ (ђубре унутра, смеће напоље). У овој јединици ћемо покрити фазу прикупљања података: разумевање извора, узорковање, постављање питања о квалитету и будност на ризик од цурења података од првог дана. Вештачка интелигенција је моћна помоћ у овој фази; Пише СКЛ упит, сумира АПИ документ, саставља уговор о подацима. Али људско биће је оно које одлучује које податке прикупљате и да ли ти подаци представљају вас.
Упознавање извора података
Подаци долазе са различитих места, а сваки извор има своје замке. База података (структурирани подаци ускладиштени у табелама, обично упитани помоћу СКЛ-а) је најчешћи извор; Поуздан је, али је потребно добро разумети његову шему. АПИ (Апликацијски програмски интерфејс) пружа податке уживо, али носи ризик од ограничења брзине и промене формата. Датотеке (ЦСВ, Екцел, ЈСОН) су флексибилне, али склоне недоследности формата. Скрапинг на вебу је моћан, али има законска и етичка ограничења; Не може се сваки сајт обрисати.
Пажња: За веб сцрапинг и аутоматско прикупљање података, придржавајте се услова коришћења сајта, датотеке роботс.ткт и КВКК/ГДПР. Неовлашћено прикупљање података ствара правну одговорност. У контексту безбедности информација, користите алате за прикупљање података само на системима за које сте овлашћени иу сврхе одбране/анализе; Неовлашћени приступ или стругање су забрањени.
Разумевање шеме: упознавање са подацима
Пре прикупљања скупа података, морате разумети његову шему (називе колона, њихове типове података, њихова значења и међусобне односе). АИ је овде веома корисна у креирању „речника података“ — табеле која објашњава шта свака колона значи. Али објашњења која АИ производи су предвиђања; Потврдите право значење сваке колоне са тимом који је произвео податке. На пример, колона под називом „статус“ може да садржи 0/1/2; Само првобитни тим зна да ли су „на чекању/одобрен/отказан“ или нешто друго.
Следећа табела сумира основне типове ресурса и упозорења:
Извор
јака тачка
трап
Како АИ помаже
СКЛ база података
Структурно, поуздано
Цомплек ЈОИНс
Пише нацрт упита
АПИ
живи подаци
Ограничење брзине, промена облика
Резиме докумената, повлачење кода
ЦСВ/Екцел
Флексибилан, брз
Недоследност формата
Читање/рашчлањивање кода
веб стругање
Широк досег
Правна/етичка граница
Рашчлањивање нацрта (у оквиру овлашћења)
Подаци евиденције/догађаја
детаљан
огроман волумен
Упит за филтрирање
Илустрација: да ли део представља целину?
Већину времена радите са узорком (подскупом одабраним из популације), а не са целим подацима. Критично питање је: да ли овај узорак представља популацију? Пристрасност избора је најчешћа замка. На пример, ако узоркујете само кориснике из мобилне апликације, нећете видети кориснике веба и ваши резултати ће бити погрешни. Случајно узорковање (сваки запис има једнаке шансе да буде изабран) је у већини случајева најбезбедније; али у подацима временске серије, подела се врши хронолошки, а не насумично (ово ћемо видети у јединицама 7 и 10).
Цурење свести од првог дана
Цурење података је извор већине катастрофа и обично настаје током фазе прикупљања података. Пример: када се предвиђа „да ли је отказан“, ако додате колону „датум отказивања“ подацима, модел гледа у будућност. Током фазе прикупљања, поставите једно питање за сваку колону: „Да ли ћу заиста имати ове информације у тренутку када будем предвиђао?“ Ако је одговор не, та колона цури. Ову тему ћемо детаљно обрадити у јединици 10; Али свест треба да почне од првог дана.
три мини кофера
Случај 1 — Проблем репрезентације. Једна банка је за свој модел кредитног ризика прикупљала податке само о одобреним кредитима (18.500 записа). Одбијања нису била у подацима. Модел је погрешио у стварном свету јер никада није видео како ће се одбачени понашати. Поука: узорак треба да буде репрезентативан за целу популацију из које доносите одлуку.
Случај 2 — Тиха промена облика. Тим је сваки дан извлачио податке о ценама из АПИ-ја. Једног дана, АПИ провајдер је променио валуту из УСД у ЕУР, али је име домена остало исто. Подаци су прикупљани у погрешној јединици 12 дана; 3.200 линија је оштећено. Лекција: Редовно проверавајте конзистентност обима и формата у подацима АПИ-ја.
Случај 3 — Рано цурење. Аналитичар је укључио колону „разлог затварања налога“ када је прикупљао податке за процену „одлива“. Ова колона је попуњена тек након што је купац отишао. Модел је дао 97% тачности на тест сету; Није функционисало у производњи јер је та колона била празна у време предвиђања. Лекција: поставите свакој колони питање "да ли га имам у време предвиђања?"
Четири шаблона за копирање
1) Екстракција речника података:
Ваша улога: помоћник научника података. Испод су имена колона и узорци (анонимних) вредности табеле. За сваку колону наведите њено процењено значење, тип података и потенцијалне ризике квалитета у табели. Означите колоне у које нисте сигурни као „потребна је потврда“; значење прављење. Колоне: [налепите овде]
2) Код узорка (насумичан, поновљив):
Имам панде дф. Напишите код који издваја репрезентативни 5% случајног узорка из 200.000 редова. Користите рандом_стате=42 (за поновљивост). Додајте код да бисте проверили да ли је дистрибуција по класама узорка слична популацији.
3) Питање скенирања цурења:
Даћу вам ову листу колона. Мој циљ је да предвидим „да ли је отказано“ (0/1). За сваку колону процените да ли ћу је заиста имати у тренутку предвиђања и означите је као „безбедно/сумњиво/цурење“. Напишите своје образложење у једној реченици. Колоне: [лист]
4) Нацрт СКЛ пулл упита:
Имам табеле „поруџбине“ и „купци“ у ПостгреСКЛ-у. Напишите ЈОИН упит који комбинује поруџбине у последњих 90 дана са градом корисника и враћа укупан износ и број поруџбина по граду. Објасните филтер датума и како се рукује НУЛЛ градовима. Покренућу упит и проверићу га.
Слаби промпт / Јаки промпт
Слабо обавештење:
Извуците ми добар узорак података из ове базе података.
„Добро“ је двосмислено; Која слика, који период, која величина, која намена није јасно. АИ ће произвести само генерички, можда погрешан упит.
Снажан упит:
Ваша улога: СКЛ асистент. Имам табелу „трансакције“: колоне ид, цустомер_ид, датум (временска ознака), износ (нумерички), канал (текст: 'веб'/'мобиле'). Задатак: Написати поновљив (детерминистички са ОРДЕР БИ) упит који враћа 10.000 репрезентативних редова из сваког канала за 2024. годину. Сврха: компаративна анализа канала. Наведите претпоставке вашег упита.
Овде су табела, намена, величина и поновљивост јасни.
Уобичајене грешке
- Не доводећи у питање репрезентативност узорка. Лако доступни подаци нису тачни подаци; пристрасност селекције искривљује резултат.
- Прилагођавање значења колона АИ. Изворни тим зна значење; Немојте користити АИ предвиђање без потврде.
- Не прати промену формата/јединице АПИ-ја. Тиха промена прикупља корумпиране податке данима.
- Игнорисање цурења у фази прикупљања. Ако се питање "Да ли га имам у време предвиђања" не постави рано, модел ће дати лажан успех.
- Прикупљање неовлашћених или незаконитих података. Кршење роботс.ткт, услова коришћења и КВКК-а представља озбиљан ризик.
Савет: Сачувајте „картицу са подацима“ на једној страници за сваки нови извор података: извор, датум повлачења, број редова, познате границе и колоне са ризиком од цурења. Ова картица чува питање „шта су то подаци“ и могућност поновљивости месецима касније.
Укратко
Квалитет анализе је ограничен квалитетом прикупљених података. Добро познајте извор (базу података, АПИ, фајл, сцрапе) и шему; побрините се да узорак буде репрезентативан за популацију; Елиминишите цурење од првог дана тако што ћете сваку колону питати „да ли га имам у време предвиђања?“ АИ је одличан акцелератор за упите и рад са документима, али људи одлучују које податке ће прикупити и њихову репрезентативност. Ограничења овлашћења, закона и поверљивости увек су на првом месту.
Задатак апликације
Изаберите извор података (из сопственог бизниса или хипотетички). Набавите нацрт речника података од АИ са шаблоном „вађење речника података“ изнад; Затим ручно процените сваку колону да видите да ли је процурила. Покушајте да пронађете бар једну сумњиву/цурењу колону и у једној реченици напишите зашто је ризично.
контролна листа
- [ ] Да ли сам потврдио извор података и шему са изворним тимом?
- [ ] Да ли сам проверио да ли је узорак репрезентативан за популацију?
- [ ] Да ли сам свакој колони поставио питање „хоћу ли га имати у време процене?“
- [ ] Да ли сам направио узорковање поновљивим (фиксно семе)?
- [ ] Да ли сам проверио законска/етичка (ауторитет, роботс.ткт, КВКК) ограничења прикупљања?