ክፍሎች
1. በመረጃ ሳይንስ እና ትንታኔ ውስጥ ወደ አርቲፊሻል ኢንተለጀንስ መግቢያ፡ የስራ ፍሰት፣ ሚናዎች፣ ወሰኖች፣ ማረጋገጫ እና ስነምግባር 2. የመረጃ አሰባሰብ እና የምንጭ ግንዛቤ፡- እቅድ፣ ናሙና፣ ጥራት እና የልቅሶ ግንዛቤ 3. የውሂብ ማጽዳት እና ቅድመ ማቀናበር፡ የጠፋ እሴት፣ ውጫዊ እና አይነት ልወጣ 4. ኤክስፕሎራቶሪ ውሂብ ትንተና (EDA)፡ ስርጭቶች፣ ግንኙነቶች እና የመጀመሪያ ግንዛቤዎች 5. የባህሪ ምህንድስና፡ ተለዋጮችን ማመንጨት፣ ኮድ መስጠት፣ ማመጣጠን እና መፍሰስን ማስወገድ 6. የሞዴል ግንባታ፡ የችግር ፍቺ፣ የአልጎሪዝም ምርጫ እና የስልጠና/የሙከራ ክፍፍል 7. የሞዴል ግምገማ፡ ሜትሪክስ፣ ተሻጋሪ ማረጋገጫ እና ከፍተኛ ትምህርት 8. የእይታ እና የታሪክ አተገባበር፡ ትክክለኛ ግራፊክስ፣ ሐቀኛ ግራፊክስ 9. ኮድ ማመንጨት፡- AI-የታገዘ ትንተና ከፓይዘን (ፓንዳስ) እና ከኤስኪኤል ጋር 10. የውሂብ መፍሰስ እና መራባት፡ ጸጥ ያሉ አደጋዎች እና ተግሣጽ 11. MLOps ፋውንዴሽን፣ ስነምግባር፣ ግላዊነት እና ኃላፊነት የሚሰማው ትንታኔ
ክፍል 2 / 11

የመረጃ አሰባሰብ እና የምንጭ ግንዛቤ፡- እቅድ፣ ናሙና፣ ጥራት እና የልቅሶ ግንዛቤ

ትርፍ፡

  • የተለያዩ የመረጃ ምንጮችን (ዳታ ቤዝ፣ ኤፒአይ፣ ፋይል፣ ድር መቧጨር) እና የእያንዳንዳቸውን ወጥመዶች የማወቅ ችሎታ እና ንድፉን በትክክል የመረዳት ችሎታ።
  • ናሙናው የህዝብ ብዛት እና የምርጫ አድልዎ የሚወክል መሆኑን በመገምገም ሊደገም የሚችል ናሙና የማከናወን ችሎታ
  • በእያንዳንዱ ዓምድ ውስጥ 'በግምት ጊዜ ይኖረኛል' የሚለውን ጥያቄ በመጠየቅ በስብስብ ደረጃ ላይ የመረጃ ፍሰትን የማስወገድ እና ህጋዊ/ሥነ ምግባራዊ ድንበሮችን የማክበር ችሎታ?

እያንዳንዱ ትንታኔ እርስዎ የሰበሰቡት የውሂብ ጥራት ያህል ጥሩ ነው። በአለም ላይ በጣም የላቀ ሞዴል እንኳን በተሳሳተ መንገድ ከተሰበሰበ መረጃ ጋር አብሮ የሚሰራ ከሆነ, በአድሎአዊነት ናሙና, ወይም ስለወደፊቱ መረጃ የያዘ ከሆነ, የማይታመን ውጤት ያስገኛል. በኮምፒዩተር ሳይንስ፣ ይህ መርህ “ቆሻሻ ውስጥ፣ ቆሻሻ መጣያ” (ቆሻሻ ወደ ውስጥ፣ ከቆሻሻ ውጭ) በሚል ተጠቃልሏል። በዚህ ክፍል ውስጥ፣ የመረጃ መሰብሰቢያውን ደረጃ እንሸፍናለን፡ ምንጩን መረዳት፣ ናሙና ማድረግ፣ ጥራት ያላቸው ጥያቄዎችን መጠየቅ እና ከመጀመሪያው ቀን ጀምሮ የውሂብ መፍሰስ አደጋን በንቃት መከታተል። በዚህ ደረጃ ላይ አርቲፊሻል ኢንተለጀንስ ኃይለኛ እርዳታ ነው; የ SQL መጠይቅን ይጽፋል፣ የኤፒአይ ሰነድን ያጠቃልላል፣ የውሂብ ውልን ያዘጋጃል። ነገር ግን የትኛውን ውሂብ እንደምትሰበስብ እና ያ መረጃ እርስዎን እንደሚወክል የሚወስነው የሰው ልጅ ነው።

የውሂብ ምንጮችን ማወቅ

መረጃ የሚመጣው ከተለያዩ ቦታዎች ነው, እና እያንዳንዱ ምንጭ የራሱ ችግሮች አሉት. የመረጃ ቋት (በሠንጠረዦች ውስጥ የተከማቸ የተዋቀረ መረጃ, ብዙውን ጊዜ ከ SQL ጋር የሚጠየቅ) በጣም የተለመደው ምንጭ ነው; አስተማማኝ ነው, ግን የእሱን እቅድ በደንብ መረዳት ያስፈልጋል. ኤፒአይ (የመተግበሪያ ፕሮግራሚንግ በይነገጽ) የቀጥታ ውሂብ ያቀርባል ነገር ግን የፍጥነት ገደቦችን እና የቅርጸት ለውጦችን አደጋን ይይዛል። ፋይሎች (CSV፣ Excel፣ JSON) ተለዋዋጭ ናቸው ነገር ግን ለቅርጸት አለመጣጣም የተጋለጡ ናቸው። የድረ-ገጽ መቧጨር ኃይለኛ ነው, ነገር ግን ህጋዊ እና ስነምግባር ገደቦች አሉት; እያንዳንዱ ጣቢያ ሊፈርስ አይችልም።

ትኩረት፡ ለድር መቧጨር እና አውቶማቲክ መረጃ መሰብሰብ፣ የጣቢያውን የአጠቃቀም ውል፣ robots.txt ፋይል እና KVKK/GDPRን ያክብሩ። ያልተፈቀደ መረጃ መሰብሰብ ህጋዊ ተጠያቂነትን ይፈጥራል። በመረጃ ደህንነት አውድ ውስጥ የውሂብ መሰብሰቢያ መሳሪያዎችን በተፈቀደልዎ ስርዓቶች ላይ እና ለመከላከያ/ትንተና ዓላማዎች ብቻ ይጠቀሙ። ያልተፈቀደ መድረስ ወይም መቧጨር የተከለከለ ነው።

ንድፉን መረዳት፡ ከውሂቡ ጋር መተዋወቅ

የውሂብ ስብስብን ከመሰብሰብዎ በፊት, የእሱን እቅድ (የአምዶች ስሞች, የውሂብ ዓይነቶች, ትርጉሞቻቸው እና አንዳቸው ከሌላው ጋር ያላቸውን ግንኙነት) መረዳት አለብዎት. AI እዚህ "የውሂብ መዝገበ ቃላት" ለመፍጠር በጣም ጠቃሚ ነው - እያንዳንዱ አምድ ምን ማለት እንደሆነ የሚያብራራ ሠንጠረዥ። ነገር ግን AI የሚያወጣው ማብራሪያ ትንበያዎች ናቸው; የእያንዳንዱን አምድ ትክክለኛ ትርጉም መረጃውን ባዘጋጀው ቡድን ያረጋግጡ። ለምሳሌ፣ "ሁኔታ" የሚባል አምድ 0/1/2 ሊይዝ ይችላል። እነዚህ "በመጠባበቅ ላይ ያሉ/የጸደቁ/የተሰረዙ" መሆናቸውን ወይም ሌላ ነገር የሚያውቀው መነሻው ቡድን ብቻ ​​ነው።

የሚከተለው ሠንጠረዥ መሰረታዊ የመርጃ ዓይነቶችን እና ጥንቃቄዎችን ያጠቃልላል።

ምንጭ

ጠንካራ ነጥብ

ወጥመድ

AI እንዴት እንደሚረዳ

SQL የውሂብ ጎታ

መዋቅራዊ, አስተማማኝ

ውስብስብ መቀላቀል

የመጠይቅ ረቂቅ ይጽፋል

ኤፒአይ

የቀጥታ ውሂብ

የፍጥነት ገደብ, የቅርጽ ለውጥ

የሰነድ ማጠቃለያዎች፣ ኮድ ይጎትቱ

CSV/Excel

ተለዋዋጭ ፣ ፈጣን

የቅርጸት አለመመጣጠን

ኮድ አንብብ/ተነተን

የድረ-ገጽ መቧጨር

ሰፊ ተደራሽነት

የሕግ/የሥነምግባር ገደብ

ረቂቅን መተንተን (በስልጣን ውስጥ)

የምዝግብ ማስታወሻ / የክስተት ውሂብ

ዝርዝር

ትልቅ መጠን

የማጣሪያ ጥያቄ

ምሳሌ፡ ክፍሉ ሙሉውን ይወክላል?

አብዛኛውን ጊዜ ከጠቅላላው መረጃ ይልቅ በናሙና (ከህዝቡ የተመረጠ ንዑስ ስብስብ) ጋር ይሰራሉ. ዋናው ጥያቄ፡- ይህ ናሙና ህዝቡን ይወክላል? ምርጫ አድልዎ በጣም የተለመደው ወጥመድ ነው። ለምሳሌ ተጠቃሚዎችን ከሞባይል መተግበሪያ ብቻ ናሙና ካደረግክ የድር ተጠቃሚዎችን አታይም እና ውጤቶችህ አሳሳች ይሆናሉ። የዘፈቀደ ናሙና (እያንዳንዱ መዝገብ የመመረጥ እኩል እድል አለው) በአብዛኛዎቹ ጉዳዮች ደህንነቱ የተጠበቀ ነው። ነገር ግን በጊዜ ተከታታይ መረጃ፣ መከፋፈል በዘፈቀደ ሳይሆን በጊዜ ቅደም ተከተል ይከናወናል (ይህን በክፍል 7 እና 10 ውስጥ እንመለከታለን)።

ከመጀመሪያው ቀን ጀምሮ ግንዛቤን መልቀቅ

የመረጃ መፍሰስ የአብዛኞቹ አደጋዎች ምንጭ ሲሆን አብዛኛውን ጊዜ የሚነሳው በመረጃ አሰባሰብ ወቅት ነው። ምሳሌ፡- “ተሰርዟል”ን ሲተነብይ፣ “የተሰረዘ ቀን” የሚለውን አምድ በመረጃው ላይ ካከሉ፣ ሞዴሉ የወደፊቱን ይመለከታል። በመሰብሰቢያው ወቅት፣ ለእያንዳንዱ አምድ አንድ ጥያቄ ይጠይቁ፡- “ትንበያውን በምሰጥበት ጊዜ ይህ መረጃ ይኖረኛል?” መልሱ የለም ከሆነ ያ አምድ እየፈሰሰ ነው። ይህንን ርዕስ በክፍል 10 ውስጥ በጥልቀት እንሸፍናለን ። ግን ግንዛቤ ከመጀመሪያው ቀን መጀመር አለበት።

ሶስት ጥቃቅን ጉዳዮች

ጉዳይ 1 - የውክልና ችግር. አንድ ባንክ ለክሬዲት ስጋት ሞዴል (18,500 መዛግብት) በተፈቀደላቸው ብድሮች ላይ መረጃ የሰበሰበው። ውድቅ የተደረገው በመረጃው ውስጥ አልነበረም። ሞዴሉ በገሃዱ አለም የተሳሳተ ነበር ምክንያቱም እምቢተኞች እንዴት እንደሚሆኑ አላየም። ትምህርት፡ ናሙናው እርስዎ ውሳኔ የሚያደርጉበትን ህዝብ በሙሉ የሚወክል መሆን አለበት።

ጉዳይ 2 - ጸጥ ያለ ቅፅ ለውጥ. አንድ ቡድን በየቀኑ የዋጋ መረጃን ከአንድ ኤፒአይ እየጎተተ ነበር። አንድ ቀን የኤፒአይ አቅራቢው ምንዛሪውን ከUSD ወደ EUR ለውጦታል፣ነገር ግን የጎራ ስሙ ተመሳሳይ ነው። መረጃ ለ 12 ቀናት በተሳሳተ ክፍል ውስጥ ተሰብስቧል; 3,200 መስመሮች ተበላሽተዋል. ትምህርት፡ በመደበኛነት የድምጽ መጠን እና የቅርጸት ወጥነት በኤፒአይ ውሂብ ውስጥ ያረጋግጡ።

ጉዳይ 3 - ቀደምት መፍሰስ. አንድ ተንታኝ ለ"churn" ግምት መረጃ በሚሰበስብበት ጊዜ "የመለያ መዘጋት ምክንያት" የሚለውን አምድ አካቷል። ይህ አምድ የተሞላው ደንበኛው ከሄደ በኋላ ብቻ ነው። ሞዴሉ በሙከራው ስብስብ ላይ 97% ትክክለኛነትን ሰጥቷል; በምርት ላይ አልሰራም ምክንያቱም ያ አምድ በግምታዊ ጊዜ ባዶ ነበር። ትምህርት: እያንዳንዱን አምድ "በትንበያው ጊዜ አለኝ?" የሚለውን ጥያቄ ይጠይቁ.

አራት ሊገለበጡ የሚችሉ አብነቶች

1) የውሂብ መዝገበ ቃላት ማውጣት;

የእርስዎ ሚና፡ የውሂብ ሳይንቲስት ረዳት። ከታች ያሉት የሠንጠረዥ አምድ ስሞች እና ናሙና (ስም-አልባ) እሴቶች አሉ። ለእያንዳንዱ አምድ፣ የሚገመተውን ትርጉሙን፣ የውሂብ አይነት እና ሊሆኑ የሚችሉ የጥራት ስጋቶችን በሰንጠረዥ ይዘርዝሩ። እርግጠኛ ያልሆኑትን አምዶች እንደ "ማረጋገጫ ያስፈልጋል" ብለው ምልክት ያድርጉባቸው; ትርጉም መስራት። አምዶች፡ [እዚህ ለጥፍ]

2) የናሙና ኮድ (በዘፈቀደ ፣ ሊደገም የሚችል)

ፓንዳስ አለኝ df. ከ200,000 ረድፎች 5% የዘፈቀደ ናሙና የሚያወጣ ኮድ ይጻፉ። random_state=42 (ለመድገም) ተጠቀም። የናሙና ክፍል ስርጭት ከህዝቡ ጋር ተመሳሳይ መሆኑን ለማረጋገጥ ኮድ ያክሉ።

3) የፍተሻ ቅኝት ጥያቄ፡-

ይህን የአምዶች ዝርዝር እሰጥሃለሁ። ግቤ "ተሰርዟል" (0/1) መተንበይ ነው። ለእያንዳንዱ አምድ በትንበያው ጊዜ በትክክል ይኖረኝ እንደሆነ ገምግመው "ደህና / አጠራጣሪ / መፍሰስ" ብለው ምልክት ያድርጉበት። ምክንያትህን በአንድ ዓረፍተ ነገር ጻፍ። አምዶች: [ዝርዝር]

4) የ SQL መጠይቅ ረቂቅ፡-

በ PostgreSQL ውስጥ "ትዕዛዞች" እና "ደንበኞች" ጠረጴዛዎች አሉኝ. ያለፉትን 90 ቀናት ትዕዛዞች ከደንበኛ ከተማ ጋር በማጣመር የ JOIN መጠይቅ ፃፉ እና አጠቃላይ የትእዛዙን ብዛት እና በአንድ ከተማ ይመልሳል። የቀን ማጣሪያውን እና NULL ከተማዎችን እንዴት እንደሚይዙ ያብራሩ። መጠይቁን አስሮቼ አረጋግጣለሁ።

ደካማ ጥያቄ / ጠንካራ ጥያቄ

ደካማ ጥያቄ፡

ጥሩ ናሙና ዳታ ከዚህ ዳታቤዝ ውሰዱኝ።

"ጥሩ" አሻሚ ነው; የትኛው ስእል, የትኛው ጊዜ, የትኛው መጠን, የትኛው ዓላማ ግልጽ አይደለም. AI የሚያወጣው አጠቃላይ፣ ምናልባትም የተሳሳተ መጠይቅ ብቻ ነው።

ኃይለኛ ጥያቄ፡-

የእርስዎ ሚና፡ SQL ረዳት። የ"ግብይቶች" ሠንጠረዥ አለኝ፡ የአምዶች መታወቂያ፣ ደንበኛ_መታወቂያ፣ ቀን (የጊዜ ማህተም)፣ መጠን (ቁጥር)፣ ሰርጥ (ጽሑፍ፡ 'ድር'/'ሞባይል')። ተግባር፡ ለ2024 ከእያንዳንዱ ቻናል 10,000 ወካይ ረድፎችን የሚመልስ ሊደገም የሚችል (በ ORDER BY) መጠይቅ ይፃፉ። ዓላማ፡ የሰርጥ ንጽጽር ትንተና። የጥያቄህን ግምቶች ይዘርዝሩ።

እዚህ ጠረጴዛው, ዓላማው, መጠኑ እና ተደጋጋሚነቱ ግልጽ ነው.

የተለመዱ ስህተቶች

  • የናሙናውን ተወካይነት አለመጠራጠር። በቀላሉ የሚገኝ ውሂብ ትክክለኛ ውሂብ አይደለም; ምርጫ አድልዎ ውጤቱን ያዛባል።
  • የአምድ ትርጉሞችን ከ AI ጋር ማላመድ። ምንጩ ቡድን ትርጉሙን ያውቃል; የ AI ትንበያውን ሳያረጋግጡ አይጠቀሙ.
  • የኤፒአይ ቅርጸት/የአሃድ ለውጥን አለመከታተል። የዝምታው ለውጥ ለቀናት የተበላሸ መረጃ ይሰበስባል።
  • በመሰብሰብ ደረጃ ላይ ያለውን ፍሳሽ ችላ ማለት. "በግምት ጊዜ አለኝ" የሚለው ጥያቄ ቀደም ብሎ ካልተጠየቀ, ሞዴሉ የውሸት ስኬት ይሰጣል.
  • ያልተፈቀደ ወይም ህገወጥ ውሂብ መሰብሰብ። የRobots.txt, የአጠቃቀም ውል እና KVKK መጣስ ከባድ አደጋ ነው.
ጠቃሚ ምክር፡ ለእያንዳንዱ አዲስ የውሂብ ምንጭ ባለ አንድ ገጽ "የውሂብ ካርድ" አቆይ፡ ምንጭ፣ መጎተት ቀን፣ የረድፎች ብዛት፣ የሚታወቁ ድንበሮች እና አምዶች የመፍሳት አደጋ ላይ ናቸው። ይህ ካርድ ከወራት በኋላ "ይህ ውሂብ ምን ነበር" የሚለውን ጥያቄ እና እንደገና መባዛትን ያስቀምጣል።

በማጠቃለያው

የትንታኔው ጥራት በተሰበሰበው መረጃ ጥራት የተገደበ ነው። ምንጩን (ዳታቤዝ፣ ኤፒአይ፣ ፋይል፣ ቧጨራ) እና እቅድ በደንብ እወቅ፤ ናሙናው የህዝብ ተወካይ መሆኑን ያረጋግጡ; እያንዳንዱን አምድ "በግምት ጊዜ አለኝ?" በማለት በመጠየቅ ከመጀመሪያው ቀን መፍሰስን ያስወግዱ. AI ለጥያቄ እና ለሰነድ ስራ ታላቅ አፋጣኝ ነው፣ ነገር ግን ሰዎች ምን አይነት መረጃ መሰብሰብ እንዳለበት እና ውክልናውን ይወስናሉ። የስልጣን፣ የህግ እና የምስጢርነት ገደቦች ሁል ጊዜ ይቀድማሉ።

የመተግበሪያ ተግባር

የውሂብ ምንጭ ይምረጡ (ከራስዎ ንግድ ወይም መላምታዊ)። ከላይ ካለው "የውሂብ መዝገበ ቃላት ማውጣት" አብነት ያለው የውሂብ መዝገበ ቃላት ረቂቅ አግኝ; ከዚያም እያንዳንዱን አምድ የፈሰሰ መሆኑን ለማየት እራስዎ ይገምግሙ። ቢያንስ አንድ አጠራጣሪ/የሚፈስ አምድ ለማግኘት ይሞክሩ እና ለምን አደገኛ እንደሆነ በአንድ ዓረፍተ ነገር ይጻፉ።

የማረጋገጫ ዝርዝር

  • [ ] የመረጃ ምንጩን እና መርሃ ግብሩን ከምንጩ ቡድኑ ጋር አረጋግጫለሁ?
  • [ ] ናሙናው የህዝብ ተወካይ መሆኑን አረጋግጫለሁ?
  • [ ] እያንዳንዱን ዓምድ "በግምቱ ጊዜ ይኖረኛል?" የሚለውን ጥያቄ ጠይቄያለሁ?
  • [] ናሙናውን ሊደገም የሚችል (ቋሚ ዘር) አድርጌዋለሁ?
  • [ ] የሕግ/ሥነ ምግባራዊ (ባለሥልጣኑ፣ robots.txt፣ KVKK) የመሰብሰቢያ ገደቦችን አረጋግጫለሁ?