Daromadlar:
- Ma'lumotlar fanining olti bosqichli ish oqimini (muammolarni aniqlash, to'plash, tozalash, kashf qilish, modellashtirish, aloqa) va har bir bosqichda sun'iy intellekt ishlaydigan vakolatni vazifa xavf darajasiga ko'ra farqlash qobiliyati
- Sun'iy intellektning har bir chiqishini manbaga ulash, ishga tushirish va taqqoslash va ekspert filtridan o'tkazish orqali tekshiradigan intizomni qo'llash qobiliyati.
- Qayta ishlab chiqarish va maxfiylik tamoyillarini (kodga yozish, anonimlashtirish) birinchi kundan boshlab tahlil qilish odatlariga aylantirish qobiliyati
Xom, tartibsiz va ko'pincha "yolg'on" ma'lumotlar har kuni ma'lumot olimi stoliga tushadi. Savdo jadvalida sana ustuni uch xil formatda yozilgan; mijozlar raqamlari ba'zi qatorlarda bo'sh; Ustun nomi "daromad" bo'lib, u TL va USD qiymatlarini o'z ichiga oladi. Ma'lumotlar fanining vazifasi bu tartibsizlikdan ishonchli qaror qabul qilishdir: ma'lumotlarni to'plash, tozalash, o'rganish, model yaratish, natijani tasdiqlash va uni hikoyaga aylantirish. Sun'iy intellekt (matn va kod yaratish, naqshlarni tan olish, umumlashtirish va bashorat qilish mumkin bo'lgan qisqa kompyuter tizimlari uchun AI yoki AI) ushbu zanjirdagi har bir havolaga tegishi mumkin: bir necha daqiqada tozalash kodini yozish, tadqiqot tahlili uchun grafiklarni tavsiya qilish, model ko'rsatkichini sharhlash, SQL so'rovini tuzatish. Ammo o'sha sun'iy intellekt sizga hech qachon ko'rmagan ma'lumotlar uchun "korrelyatsiya 0,72" kabi ishonchli uydirma ham berishi mumkin.
Bu birinchi bo'lim kutubxonaga kirish emas. Uning maqsadi AIni ma'lumotlar fanining ish jarayoniga qaerga qo'yish kerakligini va uni hech qachon qaerga qo'ymaslik kerakligini aniqlashdir. Keling, asosiy tamoyilni boshidan aytib o'tamiz: AI - bu ma'lumot olimi emas, balki yordamchi. Qaysi ma'lumotlarni to'plash, qanday ko'rsatkichni tanlash, modelni ishlab chiqarishga kiritish va qayerda axloqiy chegaralarni belgilash vakolatli mutaxassisga tegishli. Tasdiqlanmagan AI chiqishi, imzolanmagan tahlil hisoboti kabi xavfli.
Ma'lumotlar fanining ish jarayoni: oxirigacha xarita
Ma'lumotlar loyihasini tushunish uchun uni olti bosqichga bo'lish foydali bo'ladi. Bu butun modul ushbu xaritaga amal qiladi.
1. Muammoni aniqlash: Biz nimani o'lchaymiz, nima uchun, qaysi qarorni qo'llab-quvvatlash uchun? Bu bosqich AIga topshirilmagan; Bu ishni belgilaydigan shaxs.
2. Ma'lumotlarni yig'ish: manbalarni aniqlash, ma'lumotlarni olish, namuna olish. (2-birlik)
3. Ma'lumotni tozalash va oldindan qayta ishlash: etishmayotgan qiymat, chegara, tur konvertatsiyasi. (3-birlik)
4. Exploratory ma'lumotlarni tahlil qilish (EDA - Exploratory Data Analysis, "ko'z bilan" ma'lumotlarning taqsimlanishi va munosabatlarini tan olish bosqichi): (4-bo'lim)
5. Xususiyatlarni muhandislik va modellashtirish: o'zgaruvchan generatsiya, algoritm tanlash, o'qitish, baholash. (5, 6, 7 birlik)
6. Aloqa va ishlab chiqarish: Vizualizatsiya, hikoya, MLOps (modelni jonli qabul qilish va uni kuzatish intizomi). (8, 11 birlik)
AI ushbu olti bosqichning har birida boshqa vakolatlar bilan ishlaydi. Quyidagi jadvalda vakolatlarning ushbu taqsimoti jamlangan; Bu modulning yagona eng muhim jadvalidir.
Bosqich
AIning roli
Xavf darajasi
Kim tasdiqlaydi
Muammoni aniqlash
aqliy hujum hamkori
past
Ma'lumot olimi + manfaatdor tomon
Tozalash kodini yozing
Kod sketch generatori
o'rta
Ma'lumot olimi (kodni o'qiydi)
EDA sharhi
naqsh taklifchisi
o'rta
ma'lumotlar olimi
Xususiyatlarni yaratish
Fikr va kod generatori
o'rta-yuqori
Oqish nazorati majburiydir
Model tanlash/metrik
maslahatchi
yuqori
ma'lumotlar olimi
Ishlab chiqarishni yo'lga qo'yish to'g'risida qaror
yordamchi kirish
juda yuqori
Jamoa + biznes egasi
Etika/maxfiylikni tasdiqlash
ogohlantiruvchi
juda yuqori
inson, har doim
Ushbu jadvaldagi bitta jumlani yodda tuting: qoziqlar oshgani sayin, AIning roli qisqaradi va odamlarning roziligi oshadi.
Nega tekshirish bu biznesning yuragi hisoblanadi
AI tili modellari ishonchli ko'rinadi, ammo ular ishonchsiz bo'lishi mumkin. Texnik tilda bu gallyutsinatsiya deb ataladi: bu modelning mavjud bo'lmagan ma'lumotni ravon jumlada xuddi haqiqat kabi uydirishi. Ma'lumotlar fanida bu uch shaklda bo'ladi. Birinchisi, soxta raqam: agar siz modeldan hech qanday ma'lumot bermasdan "o'rtacha buyurtma miqdori qancha" deb so'rasangiz, u sizning ma'lumotlaringizni hech qachon ko'rmagan bo'lsa ham, sizga ishonch bilan raqamni aytib beradi. Ikkinchisi mavjud bo'lmagan funksiya: model umuman mavjud bo'lmagan funksiyani taklif qilishi mumkin, masalan, pandas.read_excel_fast(). Uchinchidan, noto'g'ri statistik talqin: model klassik statistik xatoni muammosiz takrorlashi mumkin, masalan, "p-qiymati 0,04, shuning uchun gipoteza 96% to'g'ri".
Tekshirish intizomi uch bosqichdan iborat:
- Manbaga havola: Har bir raqam, stavka va tendentsiya AI xotirasidan emas, balki sizning ma'lumotlaringizdan kelib chiqishi kerak. Ma'lumotni eslab qolish uchun emas, balki ma'lumotlarda ishlaydigan kod uchun AIdan foydalaning.
- Ishga tushiring va taqqoslang: AI tomonidan berilgan har bir kod qismini o'zingiz ishga tushiring; U ishlab chiqaradigan har bir ko'rsatkichni mustaqil bazaviy chiziq bilan solishtiring.
- Mutaxassis filtri: Chiqish statistika va domen bilimlariga zid keladimi yoki yo'qligini o'zingiz sinab ko'ring.
Diqqat: AI tomonidan yozilgan tahlilni ishga tushirmasdan va o'qimasdan taqdimotga qo'yish imzosiz hisobotni taqdim etishga o'xshaydi. Kodning ishlashi uning to'g'ri ekanligini anglatmaydi; Noto'g'ri ustunni jamlagan kod ham xatosiz ishlaydi.
Reproduktivlik: bir xil natijani ikki marta ishlab chiqarish imkoniyati
Ma'lumotlar fanining jim, ammo tanqidiy printsipi - takrorlanuvchanlik: tahlilni olti oydan keyin yoki boshqa kompyuterda qayta ishga tushirganingizda, siz bir xil natijaga erishasiz. AI bilan ishlashda bu xavf ortadi, chunki siz AIga "bu grafikni yarating" va uni qo'lda o'ynang deb aytsangiz, qadamlar yo'qoladi. Qoida: har bir qadam kod va versiya boshqaruvida ro'yxatdan o'tgan bo'lishi kerak (masalan, Git); Tasodifiylik bilan bog'liq bosqichlarda tasodifiy urug' (tasodifiy sonlar generatorining boshlang'ich qiymati; agar sobit bo'lsa, natija takrorlanadigan bo'ladi) o'rnatilishi kerak. Bu mavzuni 10-qismda chuqurlashtiramiz; Hozircha shunday odatga aylang: “Qo‘l bilan bosmang, kod bilan yozing”.
uchta mini holat
1-holat - Xavfsiz tezlashtirish. Elektron tijorat tahlilchisi odatda 240 ming qatordan iborat buyurtma jadvalini tozalash uchun yarim kun sarflaydi. U AIga ustun nomlari va birinchi 5 qatorni (shaxsiy ma'lumotlarsiz) berdi va pandalarni tozalash kodini so'radi. AI 8 soniyada qoralama ishlab chiqardi; Tahlilchi kodni satr bo'yicha o'qib chiqdi, sanani tahlil qilishda xatolikni tuzatdi va uni ishga tushirdi. Davomiyligi: 4 soat o'rniga 35 daqiqa. AI kodni taqdim etdi, tekshirish odamda qoldi.
2-holat - O'ylab topilgan metrik tuzoq. Stajyor AIdan so'radi: "Bu ma'lumotlarda tasodifiy o'rmon qanchalik to'g'ri?" modelni umuman o'rgatmasdan. "Taxminan 89%", dedi AI. Stajyor buni taqdimotga qo'ydi; Haqiqiy model o'qitilganda, aniqlik 71% ni tashkil etdi. Xato: AIga ma'lumotlar va modellarni bermasdan o'lchovlarni kutish.
3-holat - Ovozsiz oqma. Bir jamoa AI tomonidan taklif qilingan "maqsadli o'zgaruvchining o'rtacha qiymatini xususiyat sifatida qo'shish" g'oyasini shubhasiz amalga oshirdi. Model sinov majmuasida 98% ishladi, lekin ishlab chiqarishda ishlamay qoldi, chunki bu xususiyat kelajakdagi ma'lumotlarni sizdirib yubordi (ma'lumotlarning sizib chiqishi, 10-birlik). Xato: AI tavsiyasini statistik filtrlash emas.
Zaif taklif / Kuchli taklif
Zaif taklif:
Ushbu savdo ma'lumotlarini tahlil qiling va menga o'rtacha daromadni ayting.
Ushbu da'vo noto'g'ri: AIga ma'lumotlar berilmagan, shuning uchun "o'rtacha daromad" faqat to'ldirilishi mumkin. Ustunlar ham, davr ham, valyuta ham aniq emas.
Kuchli so'rov:
Sizning rolingiz: ma'lumot olimiga yordam beradigan yordamchi. Menda panda DataFrame bor: df. Ustunlar:- order_date (matn, “2024-03-01” formatida)- summa_tl (oʻnlik, baʼzi qatorlarda NaN)- customer_id (butun)Vazifa: (1) oʻrtacha miqdorni hisoblaydigan pandas kodini yozing,(2) uning NaN qiymatlarini qanday ishlashini tushuntiring,(3) kod qilgan taxminlarni sanab oʻting. Ma'lumotlar tarkibini tuzmang; shunchaki kod yarating va men ishga tushaman va natijani tekshiraman.
Bu so'rovda sxema, kutish va "to'qib chiqarishni taqiqlash" aniq. Siz hali ham ishga tushasiz va chiqishni o'zingiz tekshirasiz.
Etika va shaxsiy hayotning boshlanishi
Ma'lumotlar fani ko'pincha shaxsiy ma'lumotlar bilan ishlaydi: mijoz, bemor, xodimlar yozuvlari. Turkiyadagi KVKK (Shaxsiy ma'lumotlarni himoya qilish qonuni) va Evropada GDPR bu ma'lumotlarni himoya qiladi. Ommaviy AI vositasiga haqiqiy ismingizni, identifikatoringizni, elektron pochta manzilingizni yoki manzilingizni kiritish qoidabuzarlik hisoblanadi. Qoida: baham ko'rishdan oldin ma'lumotlarni anonimlashtiring, kerak bo'lsa faqat sxema (ustun nomlari, turlari) va soxta misol qatorini taqdim eting. 11-qismda axloq mavzusini chuqurlashtiramiz; Keling, boshidan printsipni qo'yaylik: Ma'lumotni tushunish uchun uning mazmunini emas, balki tuzilishini almashish ko'pincha etarli.
Umumiy xatolar
- AIga ma'lumot bermasdan raqamlar/ko'rsatkichlarni kutish. Model ma'lumotlarga kira olmaydi; U bergan raqam soxta. Har doim natijani hisoblab chiqing va ishga tushiring.
- Ish kodi to'g'ri deb o'ylash. Noto'g'ri ustunni boshqaradigan kod ham xatosiz ishlaydi; Mantiqni o'qimasdan ishonmang.
- Haqiqiy shaxsiy ma'lumotlarni ochiq vositaga joylashtirish. Ism, identifikator raqami, elektron pochta manzili hech qachon baham ko'rilmaydi; Diagramma etarli.
- Qadamlarni qo'lda bajarish va ularni kodga yozmaslik. Qayta tiklanmaydigan tahlil ishonchsizdir.
- AIning statistika talqinini so'roqsiz qabul qilish. AI p-qiymati va korrelyatsiya kabi tushunchalardagi klassik xatolarni takrorlashi mumkin.
Maslahat: Har bir sun’iy intellekt seansiga qisqa “qoidalar qatori” qo‘shing: “Ma’lumotlar tarkibini tuzmang; shunchaki kod/tahlil yarating, men ishga tushaman va natijani tekshiraman; ishonchingiz komil emasligini ko‘rsating.” Bu bitta jumla gallyutsinatsiyalar xavfini sezilarli darajada kamaytiradi.
qisqa bayoni; yakunida
AI ma'lumotlar fanida kuchli yordamchidir: u tozalash kodini, EDA talqinini, model tavsiyalarini va vizualizatsiyani tezlashtiradi. Ammo muammoni aniqlash, metrik tanlash, ishlab chiqarish qarori va axloqiy chegaralar odamlarga tegishli. Ish jarayoni olti bosqichdan iborat va xavf ortishi bilan AIning roli kichikroq bo'ladi. Uchta odat hamma narsaning asosidir: manbalarni bog'lash (tasdiqlash), takrorlanuvchanlik (kodlash) va anonimlashtirish (maxfiylik). Ushbu uchta narsani o'zlashtirganingizdan so'ng, modulning qolgan qismidagi har bir vosita siz uchun xavfsiz tezlatgichga aylanadi.
Ilova vazifasi
Sizda mavjud bo'lgan kichik jadvalning (yoki faraziy) sxemasini tuzing: ustun nomlari, turlari va 2-3 ta qo'g'irchoq misol qatorlari (haqiqiy shaxsiy ma'lumotlarsiz). Yuqoridagi "Kuchli so'rov" shablonidan foydalanib, AIdan qisqacha statistika kodini so'rang. Kodni ishga tushiring, chiqishni qo'lda berilgan qiymat bilan solishtiring, har qanday soxta taxminlarni tekshiring va topilmalaringizni 5 nuqtada qayd qiling.
nazorat ro'yxati
- [ ] Men AIga haqiqiy shaxsiy maʼlumotlar oʻrniga sxema va soxta namunani berdimmi?
- [ ] Men u ishlab chiqargan kodni satr satr o'qib chiqdimmi?
- [ ] Chiqishdagi har bir raqamni mustaqil ravishda tekshirdimmi?
- [ ] Tahlilning har bir bosqichini kodga yozib, uni takrorlanishi mumkin qildimmi?
- [ ] Men missiyaning xavf darajasini aniqladimmi va yakuniy qarorni odamga topshirdimmi?