Бірліктер
1. Деректер ғылымы мен аналитикадағы жасанды интеллектке кіріспе: жұмыс процесі, рөлдер, шекаралар, тексеру және этика 2. Деректерді жинау және дереккөзді түсіну: схема, сынама алу, сапа және ағып кету туралы хабардар болу 3. Деректерді тазалау және алдын ала өңдеу: жоқ мән, шектен тыс мән және түр түрлендіру 4. Зерттеу деректерін талдау (EDA): таратулар, қарым-қатынастар және бастапқы түсініктер 5. Инженерлік мүмкіндіктер: нұсқаларды жасау, кодтау, масштабтау және ағып кетуді болдырмау 6. Модель құру: мәселені анықтау, алгоритмді таңдау және оқыту/тест бөлу 7. Модельді бағалау: метрика, кросс-валидация және экстремалды оқыту 8. Көрнекілік және әңгімелеу: дәл графика, адал графика 9. Код жасау: Python (pandas) және SQL көмегімен AI көмегімен талдау 10. Деректердің ағып кетуі және қайталануы: үнсіз апаттар және тәртіп 11. MLOps Foundation, этика, құпиялылық және жауапты аналитика
Бірлік 1 / 11

Деректер ғылымы мен аналитикадағы жасанды интеллектке кіріспе: жұмыс процесі, рөлдер, шекаралар, тексеру және этика

Табыстар:

  • Деректер ғылымының алты сатылы жұмыс процесін (мәселелерді анықтау, жинау, тазалау, ашу, модельдеу, байланыс) және тапсырманың тәуекел деңгейіне сәйкес жасанды интеллект әр кезеңде жұмыс істейтін өкілеттікті ажырата білу
  • Жасанды интеллекттің әрбір нәтижесін көзге қосу, іске қосу және салыстыру және сарапшылық сүзгіден өткізу арқылы тексеретін пәнді қолдану мүмкіндігі.
  • Бірінші күннен бастап қайталану және құпиялылық принциптерін (кодқа жазу, анонимдеу) талдау әдеттеріне айналдыру мүмкіндігі

Шикі, ретсіз және жиі «өтірік» деректер күн сайын деректер зерттеушісінің үстеліне түседі. Сатылымдар кестесінде күн бағаны үш түрлі пішімде жазылған; тұтынушылардың нөмірлері кейбір жолдарда бос; Бағанның атауы "кіріс" болып табылады, бірақ онда TL және АҚШ доллары мәндерінің екеуі де бар. Деректер ғылымының міндеті осы хаостан сенімді шешім қабылдау болып табылады: деректерді жинау, тазалау, оны зерттеу, үлгі құру, нәтижені растау және оны оқиғаға айналдыру. Жасанды интеллект (мәтін мен кодты жасай алатын, үлгілерді тани алатын, қорытындылайтын және болжам жасай алатын компьютерлік жүйелер үшін AI немесе қысқаша AI) осы тізбектегі әрбір сілтемені қозғай алады: тазалау кодын минуттарда жазу, барлау талдауы үшін графиктерді ұсыну, үлгі метрикасын түсіндіру, SQL сұрауын түзету. Бірақ дәл сол AI сізге ешқашан көрмеген деректер үшін «корреляция 0,72» сияқты сенімді ойдан шығара алады.

Бұл бірінші бөлім кітапханаға кіріспе емес. Оның мақсаты - AI-ны деректер ғылымының жұмыс процесінде қайда қою керектігін және оны ешқашан қайда қою керектігін түсіндіру. Басынан бастап негізгі принципті келтірейік: AI - бұл деректер зерттеушісі емес, көмекші. Қандай деректерді жинау, қандай метрика бойынша шешім қабылдау, модельді өндіріске енгізу және этикалық шекараларды қай жерде салу туралы шешім құзыретті сарапшыға жүктеледі. Тексерілмеген AI шығысы қол қойылмаған талдау есебі сияқты қауіпті.

Деректер туралы ғылымның жұмыс процесі: түпкілікті карта

Деректер жобасын түсіну үшін оны алты кезеңге бөлу пайдалы. Бұл бүкіл модуль осы картаға сәйкес келеді.

1. Мәселенің анықтамасы: Біз нені өлшейміз, неліктен, қандай шешімді қолдау үшін? Бұл кезең АИ-ге берілмейді; Жұмысты анықтайтын адам.

2. Мәліметтерді жинау: Дереккөздерді анықтау, мәліметтерді алу, іріктеу. (2-бірлік)

3. Деректерді тазалау және алдын ала өңдеу: жоқ мән, шектен тыс мән, түр түрлендіру. (3-бірлік)

4. Барлау деректерін талдау (EDA - Exploratory Data Analysis, деректердің таралуы мен байланысын «көзбен» тану кезеңі): (4-бөлім)

5. Функцияларды құрастыру және модельдеу: Айнымалыларды генерациялау, алгоритмді таңдау, оқыту, бағалау. (5, 6, 7 бірлік)

6. Коммуникация және өндіріс: Көрнекілік, әңгіме, MLOps (модельді тікелей қабылдау және оны бақылау тәртібі). (8, 11 бірлік)

AI осы алты кезеңнің әрқайсысында басқа өкілеттікпен жұмыс істейді. Төмендегі кесте өкілеттіктерді бөлуді қорытындылайды; Бұл модульдің жалғыз ең маңызды кестесі.

Сахна

АИ рөлі

Тәуекел деңгейі

Кім мақұлдайды

Мәселенің анықтамасы

миға шабуыл серіктесі

төмен

Деректер ғалымы + мүдделі тарап

Тазалау кодын жазыңыз

Код эскизінің генераторы

орташа

Деректер ғалымы (кодты оқиды)

EDA түсініктемесі

үлгі ұсынысшысы

орташа

деректер ғалымы

Ерекшелік генерациясы

Идея және код генераторы

орташа-жоғары

Ағып кетуді бақылау міндетті болып табылады

Үлгі таңдау/метрика

кеңесші

жоғары

деректер ғалымы

Өндіріске енгізу туралы шешім

көмекші кіріс

өте жоғары

Команда + бизнес иесі

Этика/құпиялылықты мақұлдау

стимулятор

өте жоғары

адам, әрқашан

Осы диаграммадағы бір сөйлемді есте сақтаңыз: ставкалар көтерілген сайын, AI рөлі азаяды және адамның мақұлдауы артады.

Неліктен тексеру бұл бизнестің жүрегі болып табылады?

AI тіл үлгілері сенімді болып көрінеді, бірақ олар сенімді болмауы мүмкін. Техникалық тілде бұл галлюцинация деп аталады: бұл модельдің жоқ ақпаратты еркін сөйлемде шындық сияқты ойлап шығаруы. Деректер ғылымында бұл үш түрде келеді. Біріншісі - жалған нөмір: егер сіз модельден ешқандай деректер бермей «орташа тапсырыс сомасы қанша» деп сұрасаңыз, ол сіздің деректеріңізді ешқашан көрмесе де, сізге сенімді түрде санды айтады. Екіншісі - жоқ функция: модель pandas.read_excel_fast() сияқты мүлде жоқ функцияны ұсынуы мүмкін. Үшіншіден, дұрыс емес статистикалық интерпретация: модель «p-мәні 0,04, сондықтан гипотеза 96% дұрыс» сияқты классикалық статистикалық қатені тегіс қайталай алады.

Тексеру пәні үш кезеңнен тұрады:

  1. Дереккөзге сілтеме: Әрбір сан, жылдамдық және тренд AI жадынан емес, сіздің деректеріңізден болуы керек. Деректерді есте сақтау үшін емес, деректермен жұмыс істейтін код үшін AI пайдаланыңыз.
  2. Іске қосу және салыстыру: AI берген кодтың әрбір бөлігін өзіңіз іске қосыңыз; Ол шығарған әрбір көрсеткішті тәуелсіз негізгі көрсеткішпен салыстырыңыз.
  3. Сараптама сүзгісі: Шығарылымның статистикаға және домен біліміне қайшы келетін-келмейтінін өзіңіз тексеріңіз.
Абайлаңыз: AI жазған талдауды іске қоспай және оқымай презентацияға енгізу қол қойылмаған есепті ұсынумен бірдей. Кодтың жұмыс істеуі оның дұрыс екенін білдірмейді; Қате бағанды ​​қосатын код қатесіз жұмыс істейді.

Қайталанғыштық: бір нәтижені екі рет шығару мүмкіндігі

Деректер туралы ғылымның үнсіз, бірақ маңызды принципі қайталану болып табылады: талдауды алты айдан кейін немесе басқа компьютерде қайта іске қосқанда, сіз бірдей нәтиже аласыз. Бұл қауіп AI-мен жұмыс істегенде артады, өйткені AI-ға «осы графикті жасаңыз» деп айтып, оны қолмен ойнатсаңыз, қадамдар жоғалады. Ереже: әрбір қадам кодта және нұсқаны басқаруда (Git сияқты) тіркелуі керек; Кездейсоқтықты қамтитын қадамдарда кездейсоқ тұқым (кездейсоқ сандар генераторының бастапқы мәні; егер бекітілген болса, нәтиже қайталанатын болады) бекітілген болуы керек. Бұл тақырыпты 10-бөлімде тереңдетеміз; Әзірге «Қолмен баспа, кодпен жаз» деген әдетке ие болыңыз.

үш шағын іс

1-жағдай — Қауіпсіз үдеу. Электрондық коммерция талдаушысы әдетте 240 мың жолдан тұратын тапсырыс кестесін тазалауға жарты күн жұмсайды. Ол AI-ге баған атаулары мен алғашқы 5 жолды (жеке деректерсіз) берді және пандаларды тазалау кодын сұрады. AI жобаны 8 секундта жасады; Аналитик кодты жол бойынша оқып, күнді талдау кезінде қатені түзетіп, оны іске қосты. Ұзақтығы: 4 сағаттың орнына 35 минут. AI код берді, тексеру адамда қалды.

2-жағдай — құрастырылған метрикалық тұзақ. Интерн AI-дан: «Бұл деректерде кездейсоқ орман қаншалықты дәл?» деп сұрады. үлгіні мүлдем жаттықтырмай. «Шамамен 89%», - деді AI. Интерн мұны презентацияға енгізді; Нағыз модельді үйреткенде, дәлдік 71% құрады. Қате: AI-ға деректер мен үлгілерді бермей, көрсеткіштерді күту.

3-жағдай - Үнсіз ағып кету. Бір команда AI ұсынған «мақсатты айнымалының орташа мәнін мүмкіндік ретінде қосу» идеясын оған күмән келтірместен жүзеге асырды. Модель сынақ жиынында 98% орындады, бірақ өндірісте істен шықты, себебі бұл мүмкіндік болашақ ақпараттың ағып кетуіне себеп болды (деректер ағып кетуі, 10 блок). Қате: AI ұсынысын статистикалық сүзгілеу емес.

Әлсіз шақыру / Күшті шақыру

Әлсіз шақыру:

Осы сату деректерін талдаңыз және маған орташа кірісті айтыңыз.

Бұл шағым қате: AI-ға деректер берілмеді, сондықтан «орташа кірісті» тек толтыруға болады. Бағандар да, кезең де, валюта да анық емес.

Күшті шақыру:

Сіздің рөліңіз: деректер зерттеушісіне көмектесетін көмекші. Менде pandas DataFrame бар: df. Бағандар:- тапсырыс_күні (мәтін, "2024-03-01" пішімінде)- summa_tl (ондық, кейбір жолдарда NaN)- customer_id (бүтін)Тапсырма: (1) орташа соманы есептейтін панда кодын жазыңыз,(2) оның NaN мәндерін қалай өңдейтінін түсіндіріңіз,(3) код жасайтын болжамдарды тізімдеңіз. Деректер мазмұнын жасамаңыз; жай ғана кодты жасаңыз, мен нәтижені іске қосып, тексеремін.

Бұл өтініште схема, күту және «ойдан шығаруға тыйым салу» анық. Сіз әлі де жұмыс істеп, нәтижені өзіңіз тексересіз.

Этика мен жеке өмірдің бастаулары

Деректер туралы ғылым көбінесе жеке деректермен жұмыс істейді: тұтынушы, пациент, қызметкер жазбалары. Түркиядағы KVKK (Жеке деректерді қорғау заңы) және Еуропадағы GDPR бұл деректерді қорғайды. Нақты атыңызды, идентификаторыңызды, электрондық поштаңызды немесе мекенжайыңызды жалпыға қолжетімді AI құралына қою бұзушылық болып табылады. Ереже: ортақ пайдалану алдында деректерді анонимизациялаңыз, қажет болса схеманы (баған атаулары, түрлері) және жалған мысал жолын ғана қамтамасыз етіңіз. 11-бөлімде этика тақырыбын тереңдетеміз; Басынан принципті қояйық: Деректерді түсіну үшін оның мазмұнымен емес, құрылымымен бөлісу жиі жеткілікті.

Жалпы қателер

  • AI-ға деректерді берместен сандарды/метрикаларды күту. Модель деректерге қол жеткізе алмайды; Оның берген нөмірі жалған. Әрқашан нәтижені есептеп, іске қосыңыз.
  • Жұмыс коды дұрыс деп ойлаймын. Қате бағанды ​​басқаратын код қатесіз жұмыс істейді; Логиканы оқымай сенбе.
  • Ашық құралға нақты жеке деректерді қою. Аты-жөні, жеке куәлігінің нөмірі, электрондық поштасы ешқашан бөлісілмейді; Диаграмма жеткілікті.
  • Қадамдарды қолмен орындау және оларды кодқа жазбау. Қайталанбайтын талдау сенімсіз.
  • AI-ның статистиканы түсіндіруін күмәнсіз қабылдау. AI p-мәні және корреляция сияқты ұғымдардағы классикалық қателерді қайталай алады.
Кеңес: AI сеанстарының әрқайсысына қысқаша «ережелер сызығын» қосыңыз: «Деректердің мазмұнын жасамаңыз; жай ғана кодты/талдауды жасаңыз, мен нәтижені іске қосып, тексеремін; сенімді емес жерде «сенімсіз» дегенді көрсетіңіз. Бұл жалғыз сөйлем галлюцинация қаупін айтарлықтай төмендетеді.

Қысқаша

AI деректер ғылымындағы қуатты көмекші болып табылады: ол тазалау кодын, EDA интерпретациясын, үлгі ұсынысын және визуализацияны жылдамдатады. Бірақ мәселені анықтау, метрикалық таңдау, өндірістік шешім және этикалық шекаралар адамдарға тиесілі. Жұмыс процесі алты кезеңнен тұрады және тәуекел артқан сайын AI рөлі азаяды. Үш әдет барлық нәрсенің негізі болып табылады: дереккөзді байланыстыру (валидация), қайталану (кодтау) және анонимизация (құпиялылық). Осы үшеуін игергеннен кейін, қалған модульдегі әрбір құрал сіз үшін қауіпсіз үдеткіш болады.

Қолданбалы тапсырма

Сізде бар (немесе гипотетикалық) шағын кестенің схемасын жасаңыз: баған атаулары, түрлері және 2-3 жалған мысал жолдары (нақты жеке деректерсіз). Жоғарыдағы «Күшті шақыру» үлгісін пайдаланып, AI-дан жиынтық статистика кодын сұраңыз. Кодты іске қосыңыз, нәтижені қолмен берілген мәнмен салыстырыңыз, кез келген жалған болжамдардың бар-жоғын тексеріңіз және нәтижелеріңізді 5 таңбалау нүктесінде белгілеңіз.

бақылау парағы

  • [ ] Мен AI-ға нақты жеке деректердің орнына схема мен жалған үлгі бердім бе?
  • [ ] Мен ол шығарған кодты жол бойынша оқып, іске қостым ба?
  • [ ] Шығарылымдағы әрбір санды өз бетінше тексердім бе?
  • [ ] Мен талдаудың әрбір қадамын кодқа жазып, оны қайталанатын етіп жасадым ба?
  • [ ] Мен миссияның тәуекел деңгейін анықтап, соңғы шешімді адамға тағайындадым ба?