ትርፍ፡
- እንደ የሥራ ስጋት ደረጃ የመረጃ ሳይንስ ስድስት-ደረጃ የስራ ፍሰት (ችግር ፍቺ ፣ ስብስብ ፣ ጽዳት ፣ ግኝት ፣ ሞዴሊንግ ፣ ግንኙነት) እና አርቴፊሻል ኢንተለጀንስ የሚሰራበትን ባለስልጣን የመለየት ችሎታ።
- እያንዳንዱን አርቴፊሻል ኢንተለጀንስ ውጤት ከምንጩ ጋር በማገናኘት፣ በመሮጥ እና በማነፃፀር እና በባለሙያ ማጣሪያ ውስጥ በማለፍ የሚያረጋግጥ ዲሲፕሊን የመተግበር ችሎታ።
- የመባዛት እና የግላዊነት መርሆዎችን (ወደ ኮድ መጻፍ ፣ ስም-አልባነት) ከመጀመሪያው ቀን ወደ ትንተና ልምዶች የመቀየር ችሎታ።
ጥሬ፣ የተዘበራረቀ እና ብዙ ጊዜ “ውሸታም” መረጃ በየእለቱ በዳታ ሳይንቲስት ዴስክ ላይ ያርፋል። በሽያጭ ሠንጠረዥ ውስጥ የቀን ዓምድ በሦስት የተለያዩ ቅርጸቶች ተጽፏል; በአንዳንድ መስመሮች ውስጥ የደንበኞች ቁጥሮች ባዶ ናቸው; የአንድ አምድ ስም “ገቢ” ነው፣ ግን ሁለቱንም TL እና USD እሴቶችን ይዟል። የዳታ ሳይንስ ስራ ከዚህ ትርምስ ወጥቶ አስተማማኝ ውሳኔ ማድረግ ነው፡ መረጃውን መሰብሰብ፣ ማጽዳት፣ ማሰስ፣ ሞዴል መስራት፣ ውጤቱን ማረጋገጥ እና ወደ ታሪክ መቀየር። አርቴፊሻል ኢንተለጀንስ (AI፣ ወይም AI ለአጭር - የኮምፒዩተር ሲስተሞች ጽሑፍ እና ኮድ ማመንጨት፣ ቅጦችን መለየት፣ ማጠቃለል እና ትንበያ ማድረግ) በዚህ ሰንሰለት ውስጥ ያሉትን ሁሉንም ማገናኛዎች መንካት ይችላሉ፡ የማጽዳት ኮድ በደቂቃ ውስጥ መፃፍ፣ ግራፎችን ለዳሰሳ ትንተና መምከር፣ የሞዴሉን መለኪያ መተርጎም፣ የSQL ጥያቄን ማስተካከል። ነገር ግን ያው AI አይቶት የማያውቀውን መረጃ እንደ "correlation 0.72" ያለ በራስ የመተማመን ፈጠራን ይሰጥዎታል።
ይህ የመጀመሪያ ክፍል የቤተ-መጽሐፍት መግቢያ አይደለም። ዓላማው AI በመረጃ ሳይንስ የስራ ሂደት ውስጥ የት እንደሚቀመጥ እና የት እንደማያስቀምጠው ግልጽ ማድረግ ነው። ከመጀመሪያው መሰረታዊ መርሆችን እናስቀምጥ፡ AI ረዳት እንጂ የውሂብ ሳይንቲስት አይደለም። ምን ዓይነት መረጃ እንደሚሰበስብ፣ በምን መለኪያ እንደሚወሰን፣ ሞዴልን ወደ ምርት ማስገባቱ እና የት ላይ የሥነ ምግባር ድንበሮችን መዘርጋት እንዳለበት የሚወስነው ብቃት ባለው ባለሙያ ነው። ያልተረጋገጠ የ AI ውፅዓት አደገኛ ነው፣ ልክ ያልተፈረመ የትንታኔ ዘገባ።
የውሂብ ሳይንስ የስራ ፍሰት፡ ከጫፍ እስከ ጫፍ ካርታ
የውሂብ ፕሮጀክትን ለመረዳት በስድስት ደረጃዎች መከፋፈል ጠቃሚ ነው። ይህ ሞጁል በሙሉ ይህንን ካርታ ይከተላል።
1. የችግር ፍቺ: ምን እንለካለን, ለምን, የትኛውን ውሳኔ ለመደገፍ? ይህ ደረጃ ለ AI አልተሰጠም; ሥራውን የሚገልጸው ሰው ነው.
2. መረጃ መሰብሰብ፡- ምንጮችን መለየት፣ መረጃ ማውጣት፣ ናሙና ማድረግ። (ክፍል 2)
3. ውሂብን ማፅዳት እና ማቀናበር፡- እሴት ይጎድላል፣ ወጣ ያለ፣ የመቀየር አይነት። (ክፍል 3)
4. የዳሰሳ መረጃ ትንተና (EDA - ኤክስፕሎራቶሪ መረጃ ትንተና, የመረጃ ስርጭትን እና ግንኙነቶችን "በዓይን" የማወቅ ደረጃ: (ክፍል 4)
5. የባህሪ ምህንድስና እና ሞዴሊንግ: ተለዋዋጭ ትውልድ, አልጎሪዝም ምርጫ, ስልጠና, ግምገማ. (ክፍል 5፣6፣7)
6. ኮሙኒኬሽን እና ምርት፡ ምስላዊነት፣ ታሪክ፣ MLOps (ሞዴሉን በቀጥታ የመውሰድ እና የመከታተል ተግሣጽ)። ( ክፍል 8፣ 11 )
AI በእያንዳንዱ በእነዚህ ስድስት ደረጃዎች ውስጥ በተለየ ስልጣን ይሰራል. ከዚህ በታች ያለው ሰንጠረዥ ይህንን የስልጣን ስርጭትን ያጠቃልላል; ይህ የሞጁሉ ብቸኛው በጣም አስፈላጊ ሰንጠረዥ ነው።
ደረጃ
የ AI ሚና
የአደጋ ደረጃ
ማን ያጸድቃል
የችግር ፍቺ
ሃሳባዊ ባልደረባ
ዝቅተኛ
የውሂብ ሳይንቲስት + ባለድርሻ
የጽዳት ኮድ ይጻፉ
ኮድ ንድፍ ጄኔሬተር
መካከለኛ
የውሂብ ሳይንቲስት (ኮዱን ያነባል)
EDA አስተያየት
ስርዓተ-ጥለት ጥቆማ
መካከለኛ
የውሂብ ሳይንቲስት
የባህሪ ማመንጨት
ሃሳብ እና ኮድ ጄኔሬተር
መካከለኛ-ከፍተኛ
የፍሳሽ ቁጥጥር ግዴታ ነው።
የሞዴል ምርጫ/ሜትሪክ
አማካሪ
ከፍተኛ
የውሂብ ሳይንቲስት
ወደ ምርት ለመግባት ውሳኔ
ረዳት ግቤት
በጣም ከፍተኛ
የቡድን + የንግድ ድርጅት ባለቤት
የስነምግባር/የግላዊነት ማረጋገጫ
ቀስቃሽ
በጣም ከፍተኛ
ሰው ፣ ሁል ጊዜ
ከዚህ ገበታ ላይ ያለውን አንድ ዓረፍተ ነገር አስታውስ፡ ችሮታው ሲጨምር፣ የ AI ሚና እየቀነሰ እና የሰው ፈቃድ እያደገ ነው።
ለምን ማረጋገጫ የዚህ ንግድ ልብ ነው።
የ AI ቋንቋ ሞዴሎች እርግጠኛ ይመስላሉ፣ ግን እርግጠኛ ላይሆኑ ይችላሉ። በቴክኒካል ቋንቋ፣ ይህ ቅዠት ተብሎ ይጠራል፡- ሞዴሉ ያልተገኙ መረጃዎችን በቅጥፈት አረፍተ ነገር ውስጥ እንደ እውነት መፈጠሩ ነው። በዳታ ሳይንስ፣ ይህ በሦስት ቅጾች ይመጣል። የመጀመሪያው የውሸት ቁጥር ነው፡ ምንም አይነት መረጃ ሳይሰጡ ሞዴሉን "አማካይ የትዕዛዝ መጠን ምን ያህል ነው" ብለው ከጠየቁ፣ ምንም እንኳን የእርስዎን ውሂብ አይቶት ባያውቅም በእርግጠኝነት ቁጥር ይነግርዎታል። ሁለተኛው የማይገኝ ተግባር ነው፡ ሞዴሉ እንደ pandas.read_excel_fast() ያለ ምንም የማይገኝ ተግባር ሊጠቁም ይችላል። ሦስተኛ፣ የተሳሳተ የስታቲስቲክስ ትርጉም፡ ሞዴሉ እንደ “p-value is 0.04 ነው፣ ስለዚህ መላምቱ 96% ትክክል ነው” የሚለውን የጥንታዊ ስታትስቲክስ ስህተት ያለችግር መድገም ይችላል።
የማረጋገጫ ዲሲፕሊን ሶስት ደረጃዎችን ያቀፈ ነው-
- ከምንጩ ጋር የሚገናኝ፡ እያንዳንዱ ቁጥር፣ ደረጃ እና አዝማሚያ የሚመጣው ከአይአይ ማህደረ ትውስታ ሳይሆን ከውሂብዎ ነው። ውሂብን ለማስታወስ ሳይሆን በመረጃ ላይ ለሚሰራ ኮድ AI ይጠቀሙ።
- ያሂዱ እና ያወዳድሩ: በ AI የተሰጠውን እያንዳንዱን ኮድ ያሂዱ; የሚያመነጨውን እያንዳንዱን መለኪያ ከገለልተኛ መነሻ መስመር ጋር ያወዳድሩ።
- የባለሙያ ማጣሪያ፡ ውጤቱ ከስታቲስቲክስ እና ከጎራ እውቀት ጋር የሚቃረን መሆኑን ለራስዎ ይሞክሩ።
ይጠንቀቁ፡- በ AI የተጻፈ ትንታኔን ሳይሮጡ እና ሳያነቡ ወደ አቀራረብ ማስገባት ያልተፈረመ ሪፖርት እንደማቅረብ ነው። ኮድ ስለሰራ ብቻ ትክክል ነው ማለት አይደለም; የተሳሳተ ዓምድ የሚያጠቃልለው ኮድ እንዲሁ ያለ ስህተቶች ይሰራል።
እንደገና መራባት፡ ሁለት ጊዜ ተመሳሳይ ውጤት ማምጣት መቻል
ዝምታው ግን ወሳኝ የመረጃ ሳይንስ መርህ እንደገና መባዛት ነው፡ ከስድስት ወር በኋላ እንደገና ትንታኔን ሲያካሂዱ ወይም በሌላ ኮምፒውተር ላይ ተመሳሳይ ውጤት ያገኛሉ። ከ AI ጋር ሲሰራ ይህ አደጋ ይጨምራል, ምክንያቱም AI "ይህን ግራፍ እንዲሰራ" ሲነግሩት እና እራስዎ ሲጫወቱ, ደረጃዎቹ ይጠፋሉ. ደንብ: እያንዳንዱ እርምጃ በኮዱ እና በስሪት ቁጥጥር ውስጥ መመዝገብ አለበት (እንደ Git); የዘፈቀደነትን በሚያካትቱ እርምጃዎች፣ የዘፈቀደ ዘር (የነሲብ ቁጥር ጀነሬተር የመጀመሪያ ዋጋ፣ ከተስተካከለ ውጤቱ ሊደገም የሚችል ይሆናል) መስተካከል አለበት። ይህንን ርዕስ በክፍል 10 ውስጥ እናጠናዋለን. ለአሁን፣ ወደዚህ ልማድ ይግቡ፡ "በእጅ አይጫኑ፣ በኮድ ይፃፉ።"
ሶስት ጥቃቅን ጉዳዮች
ጉዳይ 1 - አስተማማኝ ማጣደፍ. የኢ-ኮሜርስ ተንታኝ በተለምዶ የ240 ሺህ ረድፎችን የትዕዛዝ ሠንጠረዥ በማጽዳት ግማሽ ቀን ያሳልፋል። የአምዱ ስሞችን እና የመጀመሪያዎቹን 5 ረድፎች (ያለ የግል መረጃ) ለ AI ሰጠ እና የፓንዳስ ማጽጃ ኮድ ጠየቀ። AI በ 8 ሰከንድ ውስጥ ረቂቅ አወጣ; ተንታኙ የኮዱን መስመር በመስመር አንብቦ በቀን መተንተን ላይ ስህተት አስተካክሎ አስሮታል። የሚፈጀው ጊዜ: ከ 4 ሰዓታት ይልቅ 35 ደቂቃዎች. AI ኮድ አቅርቧል፣ ማረጋገጫ በሰው ዘንድ ቀርቷል።
ጉዳይ 2 - የተሰራው የሜትሪክ ወጥመድ. አንድ ተለማማጅ AIን "በዚህ መረጃ ላይ የዘፈቀደ ደን ምን ያህል ትክክል ነው?" ሞዴሉን ጨርሶ ሳያሠለጥኑ. "ወደ 89% ገደማ," AI አለ. ተለማማጅ ይህንን በዝግጅት አቀራረብ ውስጥ አስቀመጠው; እውነተኛው ሞዴል ሲሰለጥን ትክክለኝነት 71% ነበር. ስህተት፡ ውሂብ እና ሞዴሎችን ለ AI ሳይሰጡ መለኪያዎችን በመጠበቅ ላይ።
ጉዳይ 3 - ጸጥ ያለ መፍሰስ. አንድ ቡድን “የተለዋዋጮችን አማካኝ እንደ ባህሪ ጨምር” የሚለውን AI-የተጠቆመውን ሀሳብ ሳይጠራጠር ተግባራዊ አድርጓል። ሞዴሉ በሙከራ ስብስቡ ላይ 98% ፈጽሟል ነገር ግን ባህሪው የወደፊቱን መረጃ ስለሚያፈስ በምርት ላይ ወድቋል (የውሂብ መልቀቅ፣ ክፍል 10)። ስህተት፡ የ AI ምክሮችን በስታቲስቲክስ አለማጣራት።
ደካማ ጥያቄ / ጠንካራ ጥያቄ
ደካማ ጥያቄ፡
ይህንን የሽያጭ መረጃ ተንትነው እና አማካዩን ገቢ ንገረኝ።
ይህ የይገባኛል ጥያቄ ስህተት ነው: AI ውሂብ አልተሰጠም, ስለዚህ "አማካይ ገቢ" ብቻ ነው ሊሰራ የሚችለው. ዓምዶቹ፣ ወቅቱ፣ ወይም ምንዛሪው ግልጽ አይደሉም።
ኃይለኛ ጥያቄ፡-
የእርስዎ ሚና፡ የውሂብ ሳይንቲስትን የሚረዳ ረዳት። እኔ ፓንዳስ DataFrame አለኝ: df. ዓምዶች፡- የትዕዛዝ_ቀን (ጽሑፍ፣ በቅርጸት "2024-03-01") - amount_tl (አስርዮሽ፣ ናኤን በአንዳንድ ረድፎች) - ደንበኛ_መታወቂያ (ኢንቲጀር) ተግባር፡ (1) አማካዩን መጠን የሚያሰላ የፓንዳስ ኮድ ይፃፉ፣ (2) የናኤን እሴቶችን እንዴት እንደሚይዝ ያብራሩ፣(3) ኮዱ የሚወስዳቸውን ግምቶች ይዘርዝሩ። የውሂብ ይዘቱን አታካሂድ; ኮድ ብቻ አምጣ እና አሂድ እና ውጤቱን አረጋግጣለሁ።
በዚህ ጥያቄ ውስጥ, መርሃግብሩ, የሚጠበቀው እና "የመፍጠር ክልከላ" ግልጽ ናቸው. አሁንም አሂድ እና ውጤቱን ራስህ አረጋግጥ።
የስነምግባር እና የግላዊነት ጅምር
የውሂብ ሳይንስ ብዙውን ጊዜ ከግል መረጃ ጋር ይሰራል: ደንበኛ, ታካሚ, የሰራተኛ መዝገቦች. KVKK (የግል ውሂብ ጥበቃ ህግ) በቱርክዬ እና በአውሮፓ ውስጥ GDPR ይህንን ውሂብ ይከላከላሉ. የእርስዎን ትክክለኛ ስም፣ መታወቂያ፣ ኢሜይል ወይም አድራሻ ወደ ይፋዊ AI መሳሪያ መለጠፍ ጥሰት ነው። ደንብ፡ ከማጋራትዎ በፊት ውሂቡን ስም-አልባ ያድርጉ፣ አስፈላጊ ከሆነ ንድፍ (የአምድ ስሞች፣ አይነቶች) ብቻ ያቅርቡ። በክፍል 11 ውስጥ የስነምግባር ርዕሰ ጉዳይን እናጠናቅቃለን። መርሆውን ከመጀመሪያው እናስቀምጠው-መረጃውን ለመረዳት, ይዘቱን ሳይሆን አወቃቀሩን ማካፈል ብዙ ጊዜ በቂ ነው.
የተለመዱ ስህተቶች
- ለ AI ውሂብ ሳይሰጡ ቁጥሮች/ሜትሪክቶችን በመጠበቅ ላይ። ሞዴሉ ውሂቡን መድረስ አይችልም; እሱ የሚሰጠው ቁጥር የውሸት ነው። ሁልጊዜ ውጤቱን አስልተው ያሂዱ።
- የሥራው ኮድ ትክክል እንደሆነ በማሰብ. የተሳሳተውን አምድ የሚያንቀሳቅሰው ኮድም ያለ ስህተቶች ይሰራል; አመክንዮውን ሳያነቡ አትመኑ.
- እውነተኛ የግል ውሂብን ወደ ክፍት መሣሪያ በመለጠፍ ላይ። ስም ፣ መታወቂያ ቁጥር ፣ ኢ-ሜል በጭራሽ አይጋራም ። ሥዕላዊ መግለጫው በቂ ነው።
- ደረጃዎቹን በእጅ ማድረግ እና ወደ ኮድ አለመጻፍ. ሊባዛ የማይችል ትንታኔ አስተማማኝ አይደለም.
- የ AI የስታቲስቲክስን ትርጓሜ ያለምንም ጥያቄ መቀበል። AI እንደ p-value እና correlation ባሉ ጽንሰ-ሀሳቦች ውስጥ የተለመዱ ስህተቶችን መድገም ይችላል።
ጠቃሚ ምክር፡ በእያንዳንዱ የ AI ክፍለ-ጊዜዎችዎ ውስጥ አጭር "የደንብ መስመር" ያካትቱ፡ "የመረጃ ይዘቱን አያካሂዱ፤ ኮድ/ትንተና ብቻ ፍጠር እና እኔ ሮጬ ውጤቱን አረጋግጣለሁ፤ እርግጠኛ ካልሆንክበት ቦታ 'እርግጠኛ አይደለሁም' የሚለውን አመልክት።" ይህ ነጠላ ዓረፍተ ነገር የቅዠት ስጋትን በእጅጉ ይቀንሳል።
በማጠቃለያው
AI በውሂብ ሳይንስ ውስጥ ኃይለኛ ረዳት ነው፡ የጽዳት ኮድን፣ የኢዲኤ አተረጓጎምን፣ የሞዴል ምክርን እና እይታን ያፋጥናል። ነገር ግን የችግር ፍቺ፣ የሜትሪክ ምርጫ፣ የምርት ውሳኔ እና የስነምግባር ወሰኖች የሰው ልጆች ናቸው። የስራ ሂደቱ ስድስት ደረጃዎች አሉት, እና አደጋው እየጨመረ በሄደ መጠን የ AI ሚና አነስተኛ ይሆናል. ሶስት ልማዶች የሁሉም ነገር መሰረት ናቸው፡ የምንጭ ማገናኘት (ማረጋገጫ)፣ መባዛት (ኮዲንግ) እና ማንነትን መደበቅ (ምስጢራዊነት)። አንዴ እነዚህን ሶስቱን ከውስጥ ካስገቡ፣ በተቀረው ሞጁል ውስጥ ያለው እያንዳንዱ መሳሪያ ለእርስዎ ደህንነቱ የተጠበቀ ማፍጠኛ ይሆናል።
የመተግበሪያ ተግባር
ያለዎትን ትንሽ ሠንጠረዥ ንድፍ (ወይም መላምታዊ) ብቻ ያዘጋጁ፡ የአምድ ስሞች፣ አይነቶች እና 2-3 ዱሚ ምሳሌ ረድፎች (ያለ እውነተኛ የግል መረጃ)። ከላይ ያለውን "ኃይለኛ መጠየቂያ" አብነት ተጠቅመው AI ለማጠቃለያ የስታቲስቲክስ ኮድ ይጠይቁ። ኮዱን ያሂዱ፣ ውጤቱን በእጅ ከሚሰራ እሴት ጋር ያወዳድሩ፣ ማንኛውንም አስመሳይ ግምቶችን ይፈትሹ እና ግኝቶቻችሁን በ5 ነጥብ ነጥቦች ላይ ያስተውሉ።
የማረጋገጫ ዝርዝር
- [] ከእውነተኛ የግል መረጃ ይልቅ ለ AI ንድፍ እና የውሸት ናሙና ሰጠሁት?
- [ ] ያዘጋጀውን ኮድ በመስመር መስመር አንብቤ አሄድኩት?
- [ ] በውጤቱ ውስጥ ያለውን እያንዳንዱን ቁጥር በግል አረጋግጫለሁ?
- [ ] እያንዳንዱን የትንታኔ እርምጃ በኮዱ ላይ ጻፍኩኝ እና እንዲደገም አድርጌዋለሁ?
- [ ] የተልእኮውን ስጋት ደረጃ ወስኜ የመጨረሻውን ውሳኔ ለሰው ሰጥቻለሁ?