Јединице
1. Увод у вештачку интелигенцију у науци о подацима и аналитици: ток посла, улоге, границе, валидација и етика 2. Прикупљање података и разумевање извора: шема, узорковање, квалитет и свест о цурењу 3. Чишћење података и претходна обрада: Недостајућа вредност, Оутлиер и конверзија типа 4. Истраживачка анализа података (ЕДА): дистрибуције, односи и почетни увиди 5. Инжењеринг карактеристика: генерисање варијанти, кодирање, скалирање и избегавање цурења 6. Изградња модела: дефиниција проблема, избор алгоритма и подела обуке/тестирања 7. Евалуација модела: метрика, унакрсна валидација и екстремно учење 8. Визуелизација и приповедање: тачна графика, искрена графика 9. Генерисање кода: Анализа уз помоћ вештачке интелигенције са Питхон-ом (панде) и СКЛ-ом 10. Цурење података и репродуктивност: тихе катастрофе и дисциплина 11. МЛОпс фондација, етика, приватност и одговорна аналитика
Јединица 1 / 11

Увод у вештачку интелигенцију у науци о подацима и аналитици: ток посла, улоге, границе, валидација и етика

Добици:

  • Способност да се разликује шестостепени ток рада науке о подацима (дефинисање проблема, прикупљање, чишћење, откривање, моделирање, комуникација) и ауторитет под којим вештачка интелигенција ради у свакој фази, према нивоу ризика задатка
  • Способност примене дисциплине која верификује сваки излаз вештачке интелигенције тако што га повезује са извором, покреће га и упоређује и пропушта кроз стручно филтрирање.
  • Способност претварања принципа поновљивости и приватности (писање у код, анонимизација) у навике анализе од првог дана

Необрађени, неуредни и често „лажљиви“ подаци сваки дан падају на сто научника за податке. У табели продаје, колона датума је уписана у три различита формата; бројеви купаца су празни у неким редовима; Назив колоне је „приход“, али садржи и ТЛ и УСД вредности. Посао науке о подацима је да донесе поуздану одлуку из овог хаоса: прикупи податке, очисти их, истражи их, направи модел, потврди резултат и претвори га у причу. Вештачка интелигенција (АИ или скраћено АИ — компјутерски системи који могу да генеришу текст и код, препознају обрасце, сумирају и предвиђају) може да дотакне сваку карику у овом ланцу: писање кода за чишћење за неколико минута, препоручивање графикона за истраживачку анализу, тумачење метрике модела, исправљање СКЛ упита. Али иста вештачка интелигенција вам такође може дати поуздану измишљотину као што је „корелација 0,72“ за податке које никада није видео.

Ова прва јединица није увод у библиотеку. Његова сврха је да разјасни где да се АИ стави у ток рада науке о подацима, а где да се никада не стави. Хајде да изложимо основни принцип од почетка: АИ је помоћник, а не научник података. Одлука о томе које податке прикупити, за коју метрику одлучити, да ли ће модел ставити у производњу и где повући етичке границе остаје на компетентном стручњаку. Непроверени излаз вештачке интелигенције је ризичан, као и непотписани извештај о анализи.

Ток рада науке о подацима: мапа од краја до краја

Да бисте разумели пројекат података, корисно је поделити га на шест фаза. Цео овај модул прати ову мапу.

1. Дефиниција проблема: Шта меримо, зашто, да подржимо коју одлуку? Ова фаза није делегирана АИ; Особа је та која дефинише посао.

2. Прикупљање података: Идентификација извора, издвајање података, узорковање. (2. јединица)

3. Чишћење података и претходна обрада: Недостаје вредност, излаз, конверзија типа. (Јединица 3)

4. Експлоративна анализа података (ЕДА - Екплоратори Дата Аналисис, фаза препознавања дистрибуције и односа података "на око"): (4. јединица)

5. Инжењеринг и моделовање карактеристика: генерисање варијабле, избор алгоритама, обука, евалуација. (Јединица 5, 6, 7)

6. Комуникација и продукција: Визуелизација, прича, МЛОпс (дисциплина преузимања модела уживо и праћење). (Јединица 8, 11)

АИ ради са различитим овлашћењима у свакој од ових шест фаза. Табела испод резимира ову расподелу овлашћења; Ово је најважнија табела модула.

Стаге

Улога АИ

Ниво ризика

Ко одобрава

Дефиниција проблема

партнер за размишљање

ниско

Научник података + заинтересована страна

Напишите код за чишћење

Генератор скице кода

средње

Научник за податке (чита код)

Коментар ЕДА

предлагач шаблона

средње

научник података

Генерисање карактеристика

Генератор идеја и кодова

средње висок

Контрола цурења је неопходна

Избор модела/метрика

консултант

висока

научник података

Одлука о пуштању у производњу

помоћни улаз

веома високо

Тим + власник предузећа

Одобрење етике/приватности

стимуланс

веома високо

људски, увек

Имајте на уму једну реченицу са овог графикона: како се улози повећавају, улога вештачке интелигенције се смањује, а људско одобравање расте.

Зашто је верификација срце овог посла

Модели АИ језика изгледају сигурно, али можда нису сигурни. Техничким језиком, ово се зове халуцинација: то је моделово измишљање непостојећих информација у течној реченици као да су истините. У науци о подацима, ово долази у три облика. Први је лажни број: ако питате модел „који је просечан износ поруџбине“ без давања података, он ће вам са сигурношћу рећи број, иако никада није видео ваше податке. Друга је функција која не постоји: модел може предложити функцију која уопште не постоји, као што је пандас.реад_екцел_фаст(). Треће, нетачна статистичка интерпретација: модел може глатко да понови класичну статистичку грешку као што је „п-вредност је 0,04, тако да је хипотеза 96% тачна“.

Дисциплина верификације се састоји од три корака:

  1. Линк до извора: Сваки број, стопа и тренд треба да потичу из ваших података, а не из меморије АИ. Користите вештачку интелигенцију за код који ради на подацима, а не за памћење података.
  2. Покрените и упоредите: Покрените сваки део кода који вам је дала АИ; Упоредите сваку метрику коју производи са независном основном линијом.
  3. Експертски филтер: Тестирајте сами да ли је резултат у супротности са статистиком и знањем о домену.
Опрез: Стављање анализе коју је написала АИ у презентацију без покретања и читања је као представљање непотписаног извештаја. Само зато што код ради не значи да је исправан; Код који сумира погрешну колону такође ради без грешака.

Репродуцибилност: могућност да двапут произведе исти резултат

Тихи, али критични принцип науке о подацима је поновљивост: када поново покренете анализу шест месеци касније или на другом рачунару, добијате исти резултат. Овај ризик се повећава када радите са АИ, јер када кажете АИ да „направи овај графикон“ и репродукује га ручно, кораци нестају. Правило: сваки корак мора бити регистрован у контроли кода и верзија (као Гит); У корацима који укључују случајност, насумично семе (почетна вредност генератора случајних бројева; ако је фиксирано, резултат ће бити поновљив) треба да буде фиксиран. Ову тему ћемо продубити у 10. јединици; За сада, пређите на ову навику: „Не кликајте руком, пишите у коду“.

три мини кофера

Случај 1 — Безбедно убрзање. Аналитичар е-трговине би обично провео пола дана чистећи табелу поруџбина од 240 хиљада редова. Дао је називе колона и првих 5 редова (без личних података) АИ и затражио код за чишћење панди. АИ је направио нацрт за 8 секунди; Аналитичар је прочитао код ред по ред, поправио грешку у рашчлањивању датума и покренуо га. Трајање: 35 минута уместо 4 сата. АИ је обезбедио код, верификација је остала код човека.

Случај 2 — Измишљена метричка замка. Један приправник је питао АИ: "Колико је насумична шума тачна на овим подацима?" без икакве обуке модела. „Око 89%“, рекао је АИ. Стажиста је ово ставила у презентацију; Када је прави модел био обучен, тачност је била 71%. Грешка: Чекање на метрику без давања података и модела АИ.

Случај 3 — Тихо цурење. Један тим је имплементирао идеју коју је предложила АИ о „додавању средње вредности циљне варијабле као карактеристике“ без довођења у питање. Модел је постигао 98% на тестном сету, али је пао у производњи јер је функција пропуштала будуће информације (цурење података, јединица 10). Грешка: Препорука вештачке интелигенције није статистички филтрирана.

Слаби промпт / Јаки промпт

Слабо обавештење:

Анализирајте ове податке о продаји и реците ми просечни приход.

Ова тврдња је погрешна: АИ нису добили податке, тако да се „просечан приход“ може само надокнадити. Нису јасне ни колоне, ни период, ни валута.

Снажан упит:

Ваша улога: помоћник који помаже научнику за податке. Имам пандас ДатаФраме: дф. Колоне:- ордер_дате (текст, у формату "2024-03-01")- амоунт_тл (децимални, НаН у неким редовима)- цустомер_ид (цео број) Задатак: (1) напишите пандас код који израчунава просечан износ, (2) објасните како рукује НаН вредностима, (3) наведите претпоставке које код чини. Не измишљајте садржај података; само генеришите код и ја ћу покренути и проверити резултат.

У овом захтеву је јасна шема, очекивање и „забрана измишљотина“. И даље покрећете и сами верификујете излаз.

Почеци етике и приватности

Наука о подацима често ради са личним подацима: евиденција купаца, пацијената, запослених. КВКК (Закон о заштити личних података) у Турској и ГДПР у Европи штите ове податке. Лепљење вашег правог имена, ИД-а, е-поште или адресе у јавни алат за вештачку интелигенцију представља кршење. Правило: анонимизирајте податке пре дељења, наведите само шему (називе колона, типове) и лажни пример реда ако је потребно. Тему етике ћемо продубити у 11. јединици; Поставимо принцип од почетка: за разумевање података често је довољно дељење њихове структуре, а не садржаја.

Уобичајене грешке

  • Чекање на бројеве/метрику без давања података АИ. Модел не може приступити подацима; Број који даје је лажан. Увек израчунајте и покрените резултат.
  • Сматрајући да је радни код исправан. Код који манипулише погрешном колоном такође ради без грешака; Не верујте без читања логике.
  • Лепљење стварних личних података у отворени алат. Име, ИД број, е-маил се никада не деле; Дијаграм је довољан.
  • Радите кораке ручно и не уписујете их у код. Анализа која није поновљива је непоуздана.
  • Прихватање АИ тумачења статистике без сумње. АИ може поновити класичне грешке у концептима као што су п-вредност и корелација.
Савет: Укључите кратку „линију правила“ у сваку од својих АИ сесија: „Не измишљајте садржај података; само генеришете код/анализу и ја ћу покренути и проверити резултат; назначите „нисам сигуран“ где нисте сигурни.“ Ова појединачна реченица значајно смањује ризик од халуцинација.

Укратко

АИ је моћан асистент у науци о подацима: убрзава чишћење кода, ЕДА интерпретацију, препоруку модела и визуелизацију. Али дефиниција проблема, избор метрике, одлука о производњи и етичке границе припадају људима. Ток посла има шест фаза, а улога АИ постаје све мања како се ризик повећава. Три навике су основа свега: повезивање извора (валидација), репродуктивност (кодирање) и анонимизација (поверљивост). Када усвојите ова три, сваки алат у остатку модула постаје сигуран акцелератор за вас.

Задатак апликације

Само направите шему мале табеле коју имате (или хипотетичку): имена колона, типови и 2-3 лажна примера реда (без стварних личних података). Затражите од АИ сажетак кода статистике користећи горњи шаблон „Моћни упит“. Покрените код, упоредите излаз са ручном вредношћу, проверите да ли постоје лажне претпоставке и забележите своје налазе у 5 тачака.

контролна листа

  • [ ] Да ли сам управо дао АИ шему и лажни узорак уместо правих личних података?
  • [ ] Да ли сам прочитао и покренуо код који је произвео ред по ред?
  • [ ] Да ли сам независно проверио сваки број у излазу?
  • [ ] Да ли сам сваки корак анализе написао у коду и учинио га поновљивим?
  • [ ] Да ли сам одредио ниво ризика мисије и коначну одлуку доделио човеку?