ትርፍ፡
- የMLOps ደረጃዎችን የመረዳት ችሎታ (መልቀቅ፣ ማሰማራት፣ መከታተል፣ እንደገና ማሰልጠን፣ መመለስ) እና የሞዴል መንሸራተትን እና ክትትል የሚደረግበትን ማሰማራት ማቀድ።
- የሞዴል ፍትሃዊነት ፣ ግልፅነት እና ተጠያቂነት መርሆዎችን የመተግበር እና የስታቲስቲክስ ትክክለኛነትን ከሥነ ምግባራዊ ተቀባይነት የመለየት ችሎታ።
- የግል መረጃን በ KVKK/GDPR መርሆዎች የመጠበቅ እና ከፍተኛ ተጽዕኖ በሚያሳድሩ ውሳኔዎች ለሰው ልጅ የመጨረሻ ሃላፊነት የመመደብ ችሎታ
ሞዴልን ማሰልጠን እና ከፍተኛ ነጥብ ማግኘት መጨረሻው ሳይሆን መሃሉ ነው። እውነተኛው ዋጋ የሚመጣው አምሳያው ወደ ምርት ሲገባ እና በአስተማማኝ ሁኔታ ሲሰራ, በጊዜ ሂደት ቁጥጥር ሳይደረግበት እና አጠቃላይ ሂደቱ በሥነ-ምግባር እና ህጋዊ ድንበሮች ውስጥ ነው. ይህ የመዝጊያ ክፍል ሶስት ርዕሶችን ያጣምራል፡ MLOps (በቀጥታ የቀጥታ ስርጭት፣ ሞዴሎችን የመከታተል እና የመንከባከብ ዲሲፕሊን)፣ ስነ-ምግባር (ፍትሃዊነት፣ ግልጽነት፣ ብልግና ያልሆነ) እና ግላዊነት (የግል መረጃን መጠበቅ)። AI በእነዚህ ቦታዎች ላይ ኮድ፣ የማረጋገጫ ዝርዝሮች እና ሰማያዊ ንድፎችን ያወጣል። ነገር ግን ሰዎች ሞዴሉ በቀጥታ እንደሚቀጥል፣ ማን እንደሚጎዳ እና ምን አይነት መረጃ መጠቀም እንደሚቻል ይወስናሉ። እነዚህ ውሳኔዎች ቴክኒካዊ አይደሉም, ነገር ግን የኃላፊነት ውሳኔዎች.
MLOps: ሞዴሉ እንደ ምርት ይኖራል
MLOps (የማሽን መማሪያ ኦፕሬሽንስ - የማሽን መማሪያ ሞዴሎችን በምርት ላይ የማሄድ፣ የመቆጣጠር እና የማዘመን ልምድ) የሶፍትዌር ልማት ዴቭኦፕስ ከመረጃ ሳይንስ ጋር መላመድ ነው። መሠረታዊው ሀሳብ፡ ሞዴል አንድ ጊዜ የሰለጠነ እና የተረሳ ፋይል ሳይሆን የማያቋርጥ ጥገና የሚያስፈልገው ህያው ምርት ነው። ዋና ደረጃዎች:
1. ሥሪት፡ ኮድ (ጂት)፣ ዳታ እና ሞዴል አንድ ላይ ተቀምጠዋል። የትኛው ሞዴል በየትኛው መረጃ እና ኮድ እንደተሰራ ተመዝግቧል.
2. ማሰማራት፡ ሞዴሉ በቀጥታ እንደ ኤፒአይ ወይም ባች ስራ ተቀምጧል። ብዙውን ጊዜ ለትንሽ ታዳሚዎች በቅድሚያ ይሰጣል (ጥላ / ካናሪ ስርጭት).
3. ክትትል፡ የአምሳያው እና የግብአት መረጃ አፈጻጸም በየጊዜው ቁጥጥር ይደረግበታል።
4. እንደገና ማሠልጠን፡ አፈፃፀሙ ሲቀንስ ሞዴሉ በተዘመነው መረጃ የሰለጠነ ነው።
የስርዓተ-ጥለት ለውጥ፡ ጸጥ ያለ ማዛባት
በምርት ውስጥ ትልቁ አደጋ የሞዴል ተንሸራታች (ሞዴል ተንሸራታች / የውሂብ ተንሸራታች) ነው። ዓለም ይለወጣል; ሞዴልዎን ያሰለጠኑበት ሁኔታ (የደንበኛ ባህሪ፣ ዋጋ፣ ወቅት፣ ህግ) በጊዜ ሂደት ይለዋወጣሉ እና ሞዴሉ ጊዜ ያለፈበት መሆን ይጀምራል። ለምሳሌ፣ ወረርሽኙ ከመከሰቱ በፊት የሰለጠነ የፍላጎት ሞዴል በወረርሽኙ ወቅት ሙሉ በሙሉ የተሳሳተ ነው። መንሳፈፍ በሁለት መልኩ ይከሰታል፡ የውሂብ ተንሸራታች (የግብአት ውሂብ ስርጭት ለውጦች) እና የፅንሰ-ሀሳብ ተንሸራታች (በግብአት እና በዒላማ ለውጦች መካከል ያለው ግንኙነት)። እነዚህን የሚይዙበት መንገድ ክትትል ነው፡ የግብአት ስርጭቱን፣ የትንበያ ስርጭቱን እና (ከተቻለ) አፈፃፀሙን በተከታታይ መከታተል ነው።
ጥንቃቄ: ወደ ምርት ውስጥ የገባው ሞዴል በራሱ ይበላሻል; የ“መቼ” እንጂ “የሆነ” ጉዳይ አይደለም። ሞኒተሪን ሳያዘጋጁ ሞዴሎችን ማሰማራት ሞተሩን ሳይቆጣጠሩ መኪና መንዳት ነው; አንድ ቀን በጸጥታ ተቀምጧል እና እርስዎ አያስተውሉም.
MLOps አባል
ዓላማ
ችላ ከተባለ
ስሪት ማውጣት
የሚመረተውን ማወቅ
የማይባዛ፣ የማይፈለግ
ክትትል
ሸርተቴውን ቀደም ብሎ ማየት
ሞዴሉ በፀጥታ ይሰበራል
እንደገና ማሰልጠን
እንደተዘመኑ ይቆዩ
ትንበያዎች ያረጃሉ
ወደ ኋላ መመለስ
ወደ መጥፎ ሞዴል ይመለሱ
የተሳሳተ ሞዴል በቀጥታ እንደቀጠለ ነው።
ሰነድ
ግልጽነት, ማዞር
መረጃ በአንድ ሰው ላይ ይጣበቃል
ስነምግባር፡ የአብነት ውሳኔዎች በሰዎች ላይ ተጽእኖ ያሳድራሉ
የውሂብ ሞዴሎች በሰዎች ሕይወት ላይ ተጽዕኖ በሚያሳድሩ ውሳኔዎች ውስጥ እየጨመሩ ይሄዳሉ፡ ብድር፣ ቅጥር፣ ኢንሹራንስ፣ ፍትህ። በዚህ ኃይል ተጠያቂነት ይመጣል. ዋና ዋና የስነምግባር አደጋዎች:
አድልዎ እና አድልዎ፡ ሞዴሉ በታሪካዊ መረጃ ላይ ኢፍትሃዊነትን መማር እና ማስቀጠል ይችላል። አንድ የተወሰነ ቡድን ከዚህ ቀደም ያነሰ ብድር ከተሰጠ፣ ሞዴሉ ይህ "ደንብ" ነው ብሎ ይገምታል እና አድልዎ በራስ-ሰር ያደርጋል። ለዚህም ነው የፍትሃዊነት ትንተና - ሞዴሉ ለተለያዩ ቡድኖች (ጾታ፣ እድሜ፣ ክልል) በተመሳሳይ መልኩ እንደሚሰራ ማረጋገጥ አስፈላጊ የሆነው።
ግልጽነት እና ገላጭነት፡ አንድን ሞዴል ለምን እንዳልተቀበለው ማስረዳት መቻል አለቦት። "ጥቁር ሳጥኑ እንዲህ አለ" በሥነ ምግባር እና ብዙውን ጊዜ በህግ ተቀባይነት የለውም. ለዚህም ነው የማብራሪያ መሳሪያዎች (የባህሪ አስፈላጊነት፣ SHAP እሴቶች) ዋጋ ያላቸው።
ተጠያቂነት፡ አምሳያው የተሳሳተ ውሳኔ ካደረገ ተጠያቂው ማን ነው? መልሱ ሁሌም ሰው/ተቋም እንጂ ሞዴል አይደለም። የሰዎች ቁጥጥር (ሰው-በ-ሉፕ - የመጨረሻውን ውሳኔ የሚያፀድቅ ሰው) ከፍተኛ ተጽዕኖ በሚያሳድሩ ውሳኔዎች ውስጥ መቀመጥ አለበት.
ማስጠንቀቂያ፡ አንድ ሞዴል በስታቲስቲክስ "ትክክል" ሊሆን ይችላል ነገር ግን ከሥነ ምግባር አኳያ ተቀባይነት የለውም። አንድን ቡድን ስልታዊ በሆነ መንገድ የሚጎዳ በጣም ትክክለኛ ሞዴል ጥሩ ሞዴል አይደለም። ታማኝነት ፍትህን አይተካም።
ግላዊነት፡ የግል መረጃ በጥንቃቄ የተጠበቀ ነው።
የውሂብ ሳይንስ ጥሬ ዕቃው ብዙውን ጊዜ የግል መረጃ ነው, እና ይህ መረጃ በህግ የተጠበቀ ነው-KVKK በቱርኪ, በአውሮፓ GDPR. መሰረታዊ መርሆቹ፡- የዓላማ መገደብ (መረጃው ከተሰበሰበበት ዓላማ ውጪ ለሌላ ዓላማዎች ጥቅም ላይ አይውልም)፣ መረጃን መቀነስ (ከአስፈላጊው በላይ መረጃ አይሰበሰብም/ይቆየዋል)፣ ማንነትን መደበቅ (መረጃን መለየት ተወግዷል) እና ደህንነት (መረጃው ኢንክሪፕት ተደርጎ የሚቀመጥ እና ተደራሽነቱ የተገደበ) ናቸው። ከ AI መሳሪያዎች ጋር በሚሰሩበት ጊዜ ወሳኝ ህግ፡ እውነተኛ የግል ውሂብን ወደ ይፋዊ AI መሳሪያ በጭራሽ አይለጥፉ። ብዙ ጊዜ, ዲያግራም እና ስም-አልባ / ሰው ሠራሽ ናሙና ለመተንተን በቂ ነው.
በመረጃ ደህንነት አውድ ውስጥ ተጨማሪ ትኩረት፡ ለመከላከያ እና ህጋዊ ትንተና ዓላማዎች የውሂብ ሳይንስ መሳሪያዎችን እና ቴክኒኮችን እርስዎ ስልጣን ባለዎት መረጃ እና ስርዓቶች ላይ ብቻ ይጠቀሙ። ያለፈቃድ የሌላ ሰውን መረጃ ማግኘት፣ የግለሰቦችን እንደገና መለየት (ማንነት ከማይታወቅ መረጃ ማውጣት) ወይም ያልተፈቀደ መገለጫ ሕገወጥ እና ሥነ ምግባር የጎደለው ነው።
ሶስት ጥቃቅን ጉዳዮች
ጉዳይ 1 - ክትትል ያልተደረገበት ውድቀት. አንድ የኢ-ኮሜርስ ኩባንያ በአስተያየቱ ሞዴሉ በቀጥታ ስርጭት ሄደ እና ክትትልን አላዘጋጀም። ከ 4 ወራት በኋላ የምርት ካታሎግ በጣም ተለውጧል; ሞዴሉ ጊዜ ያለፈባቸውን ምርቶች መምከሩን ቀጠለ እና የልወጣ መጠኑ በጸጥታ በ 30% ቀንሷል። ለወራት ማንም አላስተዋለም። ትምህርት፡ ያለ ክትትል ማሰማራት ዓይነ ስውር እየሆነ ነው።
ጉዳይ 2 - ድብቅ መድልዎ. የቅጥር ማጣሪያ ሞዴል በታሪካዊ መረጃ የሥርዓተ-ፆታ አለመመጣጠን እና ስልታዊ በሆነ መልኩ ዝቅተኛ ደረጃ ላይ ስለደረሱ ሴት እጩዎች ተማረ። የፍትሃዊነት ትንተና ስላልነበረ አልተስተዋለም; በኦዲት የተገለጸ ሲሆን ተቋሙ ከፍተኛ ስምና የህግ ስጋት ገጥሞታል። ትምህርት፡ በቡድን ላይ የተመሰረተ የፍትሃዊነት ቁጥጥር ከፍተኛ ተጽዕኖ በሚያሳድሩ ሞዴሎች ውስጥ አስፈላጊ ነው።
ጉዳይ 3 - ሚስጥራዊነትን መጣስ. አንድ ተንታኝ እውነተኛ የደንበኛ ኢሜይሎችን እና የግዢ ታሪክን የያዘ ፋይል ወደ ይፋዊ AI መሳሪያ ከጫነ በኋላ “ክፍሎችን ማጠቃለል” አለ። የግል መረጃ ተቋሙን ለቋል; የ KVKK ሂደት ተጀምሯል። ትክክለኛው መንገድ የማንነት ቦታዎችን ማስወገድ እና ማንነታቸው ያልታወቁ ንብረቶችን ብቻ ማጋራት ነበር። ትምህርት፡ እውነተኛ የግል መረጃ ወደ ክፍት መሳሪያው ውስጥ አይገባም።
አራት ሊገለበጡ የሚችሉ አብነቶች
1) የቅድመ-ቅጥር ማረጋገጫ ዝርዝር፡-
የእርስዎ ሚና፡ MLOps አማካሪ። ሞዴልን ወደ ምርት ከማስገባቴ በፊት ማጣራት ያለብኝን ነገሮች ይዘርዝሩ፡ ስሪት ማውጣት፣ የክትትል መለኪያዎች፣ የመመለሻ እቅድ፣ የአፈጻጸም ገደብ፣ የውሂብ ተንሸራታች ማንቂያ፣ ኃላፊነት የሚሰማው ሰው። ለእያንዳንዱ ንጥል አንድ-አረፍተ ነገር "ለምን አስፈላጊ ነው" ማብራሪያ ያክሉ። እኔ እወስናለሁ.
2) የሞዴል ፈረቃ መከታተያ ንድፍ;
በምርት ውስጥ ለምድብ ሞዴል ተንሸራታች የክትትል እቅድ ይጠቁሙ፡ (1) ምን አይነት የግብአት ስርጭቶችን መከታተል አለብኝ፣ (2) የትንበያ ስርጭቱ ምን አይነት ደወል፣ (3) እውነተኛው ውጤት ሲመጣ አፈፃፀሙን እንዴት ማነፃፀር እንደሚቻል፣ (4) በምን ደረጃ ላይ እንደገና ስልጠና መጀመር እንዳለበት። እንዲሁም የኮድ አጽም ያቅርቡ።
3) የፍትሃዊነት ቁጥጥር;
የእኔን ሞዴል አፈጻጸም ለተለያዩ ቡድኖች (ለምሳሌ የዕድሜ ባንድ፣ ክልል) የሚያነጻጽር ኮድ ፃፉ፡ ለእያንዳንዱ ቡድን የማስታወስ/ትክክለኛነት እና አወንታዊ ውሳኔ። በቡድኖች መካከል ከፍተኛ ልዩነት ካለ አስጠንቅቅ. የምክንያት/የፖለቲካ ትርጓሜዎችን ማድረግ; ልዩነቶቹን ብቻ አሳዩኝ እና ውሳኔውን እቆጥረዋለሁ።
4) የግላዊነት ቅድመ ምርመራ፡
ለ AI መሳሪያ መረጃ ከመስጠትዎ በፊት ያረጋግጡ፡ ከዚህ በታች ባለው አምድ ዝርዝር ውስጥ የግል/ማንነት (ስም፣ ኢሜል፣ መታወቂያ፣ ስልክ፣ አድራሻ፣ አይፒ) አለ? ከሆነ፣ የትኞቹ መወገድ ወይም ማንነታቸው መታወቅ እንዳለባቸው ይዘርዝሩ። አምዶች: [ዝርዝር]. ዓላማው፡- ስም-አልባ ንድፍ ለማጋራት ብቻ።
ደካማ ጥያቄ / ጠንካራ ጥያቄ
ደካማ ጥያቄ፡
የእኔ ሞዴል ዝግጁ ነው, በቀጥታ ስርጭት ይሂዱ.
ማሰማራት አንድ እርምጃ አይደለም; ያለ ክትትል፣ መልሶ መመለስ፣ ፍትሃዊነት እና የግላዊነት ቁጥጥር በቀጥታ መሄድ ለአደጋ ጸጥ ያለ ግብዣ ነው።
ኃይለኛ ጥያቄ፡-
የእርስዎ ሚና፡ ኃላፊነት የሚሰማው የMLOps አማካሪ። የእኔ ሞዴል ሰልጥኗል, በቀጥታ ከመውጣቴ በፊት ሙሉ ዝግጅት እፈልጋለሁ. አመንጪ፡ (1) የቅድመ-ስምረት ማረጋገጫ ዝርዝር፣ (2) ተንሸራታች ክትትል እቅድ፣ (3) በቡድን ላይ የተመሰረተ የፍትሃዊነት ማረጋገጫ ኮድ፣ (4) የግላዊነት ማረጋገጫ (የግል መረጃ አለ)። ከፍተኛ ተጽዕኖ በሚያሳድሩ ውሳኔዎች የሰውን ፈቃድ እንዴት መጠበቅ እንደሚቻልም ይጠቁሙ። የመጨረሻዎቹ ውሳኔዎች የእኔ ናቸው።
እዚህ ስርጭት፣ ክትትል፣ ፍትሃዊነት እና ግላዊነት እንደ አንድ ኃላፊነት የሚሰማው ሂደት ተደርገው ይወሰዳሉ።
የተለመዱ ስህተቶች
- ክትትል ሳያዘጋጁ ሞዴል መዘርጋት. ሞዴሉ በፀጥታ ይንሸራተታል እና ይጣመማል; ለማስተዋል ወራት ሊወስድ ይችላል።
- የፍትህ ፍተሻን ማለፍ. ከፍተኛ ታማኝነት ያለው ሞዴል ቡድንን በዘዴ ሊጎዳ ይችላል።
- ግልጽ ያልሆነ የጥቁር ሳጥን ውሳኔ ማድረግ. ከፍተኛ ተጽዕኖ የሚያሳድሩ ውሳኔዎች ሊገለጹ የሚችሉ መሆን አለባቸው; "ሞዴሉ እንዲህ አለ" በቂ አይደለም.
- የ AI መሣሪያን ለመክፈት እውነተኛ የግል መረጃ መስጠት. የ KVKK/GDPR ጥሰት; ሥዕላዊ መግለጫው እና የማይታወቅ ምሳሌው በቂ ነው።
- ውሳኔውን ለአምሳያው መስጠት. ሃላፊነት ሁል ጊዜ ከአንድ ሰው ጋር ነው; ከፍተኛ ተጽዕኖ ያለው የሰዎች ክትትል ይጠበቃል.
ጠቃሚ ምክር፡ በእያንዳንዱ ሞዴል በቀጥታ ከመሄድህ በፊት አንድ ጥያቄ ጮክ ብለህ ጠይቅ፡- “ይህ ሞዴል ነገ በጸጥታ ቢሰበር ወይም ቡድንን ኢፍትሃዊ በሆነ መንገድ ከቀጣ፣ እንዴት አስተውዬ መልሼ ልመልሰው?” ለዚህ ጥያቄ ግልጽ መልስ ከሌልዎት, ሞዴሉ ገና ለማምረት ዝግጁ አይደለም.
በማጠቃለያው
የሞዴል ስራ በከፍተኛ ነጥብ አያበቃም ነገር ግን በአስተማማኝ እና በኃላፊነት በምርት ላይ በመስራት ነው። MLOps በቀጥታ የመሄድ፣ ተንሳፋፊነትን የመከታተል፣ እንደገና የማሰልጠን እና ሞዴሉን ወደ ኋላ የመመለስ ተግሣጽ ነው። ክትትል ሳይደረግ መሰማራት ጸጥ ያለ ውድቀት ነው። ስነምግባር የአምሳያው ፍትሃዊነት፣ ግልፅነትና ተጠያቂነት ይጠይቃል። የስታቲስቲክስ ትክክለኛነት ለሥነ-ምግባራዊ ተቀባይነት አይተካም. ግላዊነት ማለት የግል መረጃን በKVKK/GDPR መርሆዎች መጠበቅ እና እውነተኛ መረጃን ከክፍት መሳሪያዎች ማራቅ ማለት ነው። እነዚህ ሁሉ ውሳኔዎች ቴክኒካዊ ሳይሆን የኃላፊነት ውሳኔዎች ናቸው እና ሁልጊዜም የሰው ልጅ ናቸው።
የመተግበሪያ ተግባር
የገነባኸውን ሞዴል (ወይም መላምታዊ) ወደ ምርት እንደምታስቀምጥ አድርገህ አስብ እና አራት ዝርዝሮችን ሙላ፡ (1) የቅድመ-ስምረት ማረጋገጫ ዝርዝር፣ (2) የምትከታተለው ተንሸራታች መለኪያዎች፣ (3) በቡድን ላይ የተመሰረተ የፍትሃዊነት ቁጥጥር እቅድ፣ (4) የግላዊነት ቁጥጥር። ከዚያም "ነገ በፀጥታ ቢሰበር እና ቢመልሰው እንዴት አስተውያለሁ?" ለሚለው ጥያቄ ተጨባጭ መልስ ይጻፉ.
የማረጋገጫ ዝርዝር
- [ ] ሞዴሉን በክትትል (የማንሸራተት ማንቂያ) እና የመመለሻ እቅድ እያሰማራሁ ነው?
- [ ] ለተለያዩ ቡድኖች የፍትሃዊነት/የአፈጻጸም ክፍተቱን አረጋግጫለሁ?
- [] ከፍተኛ ተጽዕኖ በሚያሳድሩ ውሳኔዎች ላይ የሰውን-ውስጥ-ውስጥ ጠብቄአለሁ?
- [ ] የግል መረጃን በKVKK/GDPR መርሆዎች ጠብቄአለሁ እና ከተከፈቱ መሳሪያዎች አርቄያለሁ?
- [ ] በአርአያነት ሳይሆን በሰው ላይ የመጨረሻውን ሃላፊነት አስቀምጫለሁ?
የሞዱል ፈተና
1. የዳታ ሳይንቲስት አርቴፊሻል ኢንተለጀንስ "በዚህ መረጃ ላይ የዘፈቀደ ደን ምን ያህል ትክክል ነው?" ሞዴሉን ጨርሶ ሳያሠለጥኑ እና የ "89%" ምላሹን በቀጥታ ወደ አቀራረብ ያስቀምጣል. በዚህ አቀራረብ ውስጥ ዋናው ስህተት ምንድን ነው?
- ሀ) መረጃዎችን እና ሞዴሎችን ለአርቴፊሻል ኢንተለጀንስ ሳይሰጡ መለኪያዎችን መጠበቅ; የሚያወጣው ቁጥር የውሸት መሆኑን እና ትክክለኛው መለኪያ በስልጠና እና በመሞከር ብቻ ሊገኝ እንደሚችል ችላ በማለት ✔
- ለ) በዘፈቀደ ደን ፈንታ የሎጂስቲክ ሪግሬሽን መጠቀም አለበት።
- ሐ) የትክክለኛነት መጠኑ ሁልጊዜ ከ 90% በላይ መሆን አለበት.
- መ) በዝግጅት አቀራረብ ውስጥ መለኪያዎችን ማካተት በጥብቅ የተከለከለ ነው
ማብራሪያ፡ አርቲፊሻል ኢንተለጀንስ ሞዴሉን እና ውሂቡን ሳይደርሱበት ሜትሪክ መስራት አይችልም፤ እሱ የሚሰጠው ቁጥር ቅዠት (የተሰራ) ነው። መለኪያው የሚገኘው በዳታ ሳይንቲስቱ በራሱ ስሌት ሞዴሉ በትክክል ከሰለጠነ እና ከተፈተነ በኋላ ነው። ያልተረጋገጠ ውፅዓት ልክ ያልተፈረመ ሪፖርት ነው።
2. የመለያ መዘጋት ምክንያት' ዓምድ ለክብር ትንበያ መረጃ በሚሰበስብበት ጊዜ ተካትቷል። ይህ አምድ ደንበኛው ከሄደ በኋላ ብቻ ይሞላል. ሞዴሉ በሙከራው ስብስብ ላይ 97% ይሰጣል, ነገር ግን በምርት ውስጥ አይሰራም. የዚህ ሁኔታ ስም እና መንስኤ ምንድነው?
- ሀ) ከመጠን በላይ መማር; ሞዴሉ በጣም ውስብስብ ነው
- ለ) የውሂብ መፍሰስ; ✔ በተገመተው ጊዜ የማይገኝ ነገር ግን የዒላማው ውጤት የሆነውን መረጃ እንደ ባህሪ መጠቀም
- ሐ) በቂ ያልሆነ ትምህርት; ሞዴሉ በጣም ቀላል ነው
- መ) ምርጫ አድልዎ; ትንሽ ናሙና መጠን
ማብራሪያ፡ ይህ ክላሲክ የውሂብ መፍሰስ ነው፡ 'የመዘጋቱ ምክንያት' የዒላማው ውጤት ነው እና አሁንም ትንበያ በሚደረግበት ጊዜ ባዶ ነው። ሞዴሉ በዚህ የወደፊት እውቀት ዘዴውን ይሠራል, በሙከራው ስብስብ ላይ በጣም ጥሩ ይመስላል ነገር ግን ይህ አምድ ባዶ ስለሆነ በምርት ላይ ይወድቃል. 'በግምት ጊዜ አለኝ' የሚለው ጥያቄ ለእያንዳንዱ አምድ መቅረብ አለበት።
3. አንድ ተንታኝ በገቢ አምድ ውስጥ የጎደሉትን እሴቶች ከአማካይ ጋር ይሞላል። ነገር ግን የጎደሉት ሰዎች ገቢውን ፈጽሞ ያላወጀው ዝቅተኛ ገቢ ያለው ክፍል ናቸው (ስልታዊ ጠፍቷል)። ለምንድነው ይህ መሙላት ትክክል ያልሆነው?
- ሀ) አማካዩ ሁል ጊዜ ከሜዲያን ይበልጣል፣ ስለዚህ ትክክል አይደለም።
- ለ) የጎደሉ እሴቶች በጭራሽ መሞላት የለባቸውም ፣ ሁል ጊዜ መሰረዝ አለባቸው
- ሐ) ስልታዊ ክፍተቱን በአማካኝ መሙላት ያንን ቡድን ሰው ሰራሽ በሆነ መንገድ በመወከል መረጃውን ያዛባል፤ መሙላት የተደረገው 'ለምን ባዶ ነው?' የሚለውን ጥያቄ ሳይጠይቅ ነው። ✔
- መ) አማካዩን ማስላት በጣም ቀርፋፋ ስለሆነ የአፈጻጸም ችግር ይፈጥራል
ማብራሪያ፡ የጉድለቱ መንስኤ መፍትሄውን ይወስናል። ስልታዊ የጎደለው (በተወሰነ ቡድን ውስጥ የተከማቸ ክፍተት) በአማካይ ሲሞላ፣ ያ ቡድን ሰው ሰራሽ በሆነ መንገድ 'አማካይ ገቢ' ይሆናል እና መረጃው ይዛባል። ከመሙላቱ በፊት 'ለምን ባዶ ሆነ' የሚለው ጥያቄ መነሳት አለበት; ስልታዊ/ጉልህ የጎደለ አማካኝ መሞላት የለበትም።
4. አንድ ቡድን 'በማስታወቂያ ወጪ' እና 'ሽያጭ' መካከል 0.78 ግኑኝነት አግኝቶ በጀቱን በእጥፍ ይጨምራል። ነገር ግን፣ ሁለቱንም የሚያነቃቁት ወቅታዊ ዘመቻዎች ናቸው። በስታቲስቲክስ ውስጥ ይህንን ስህተት የሚያብራራው የትኛው መርህ ነው?
- ሀ) ትስስር መንስኤ አይደለም; የተደበቀ ሶስተኛ ተለዋዋጭ ሁለቱንም ተለዋዋጮች ✔ ሊነካ ይችላል።
- ለ) የ 0.78 ትስስር በጣም ዝቅተኛ ስለሆነ ግንኙነቱ ችላ ሊባል ይገባዋል
- ሐ) ማዛመድ ሁል ጊዜ መንስኤውን ያረጋግጣል ፣ ቡድኑ በትክክል አግኝቷል
- መ) በማስታወቂያ እና በሽያጭ መካከል ያለው ትስስር በሂሳብ ሊሰላ አይችልም።
ማብራሪያ፡- ቁርኝት መንስኤ አይደለም። ሁለቱ ተለዋዋጮች አንድ ላይ ሊሰሩ ይችላሉ ምክንያቱም የተደበቀ ሶስተኛ ተለዋዋጭ (እዚህ ወቅታዊ ዘመቻዎች) ሁለቱንም ስለሚነካቸው። አንዱ ሌላውን ያስከትላል የሚለው መደምደሚያ በሙከራ እና በመስክ እውቀት ብቻ ሊመሰረት ይችላል; የግንኙነቶች ብዛት ብቻውን የምክንያት ማስረጃ አይደለም።
5. የማጭበርበር ማወቂያ ሞዴል 99.2% ትክክለኛነት ያሳያል እና ቡድኑ ያከብራል; ሆኖም በመረጃው ውስጥ ያለው የውሸት የግብይት መጠን 0.8% ብቻ ሲሆን የአምሳያው ማስታወሻ 6% ነው። ይህ ሰንጠረዥ ምን ያሳያል?
- ሀ) ሞዴሉ ፍጹም ነው ምክንያቱም ትክክለኝነት ከ 99% በላይ ነው.
- ለ) ትክክለኛነት ሚዛናዊ ባልሆነ መረጃ አሳሳች ነው; ሞዴሉ ከሞላ ጎደል ሁሉንም የውሸት (ዝቅተኛ ማስታወስ) ያመልጣል, ተገቢውን መለኪያ ✔ መታየት አለበት
- ሐ) የአምሳያው ማስታወስ ከፍተኛ ስለሆነ ምንም ችግር የለም
- መ) የውሸት መጠኑ ዝቅተኛ ስለሆነ ሞዴል መገንባት አያስፈልግም
ማብራሪያ፡- 'ትክክለኝነት' ሚዛናዊ ባልሆነ መረጃ ላይ አሳሳች ነው። ሞዴሉ እያንዳንዱን ግብይት 'ንፁህ' ብሎ ሲጠራው ከፍተኛ ትክክለኝነት ያገኛል ምክንያቱም ሐሰተኞች በጣም ጥቂት ናቸው ነገር ግን ዋናው ዓላማው (6% አስታውስ) የውሸት መያዝ አልቻለም። ስለዚህ, ሚዛናዊ ባልሆኑ ችግሮች ውስጥ, ትኩረቱ ትክክለኛነት ላይ አይደለም, ነገር ግን ግራ መጋባት ማትሪክስ እና ለሥራው ዓላማ ተስማሚ የሆኑ መለኪያዎች, ለምሳሌ ማስታወስ / ትክክለኛነት.
6. በፍላጎት ትንበያ ፕሮጀክት፣ በጊዜ ላይ የተመሰረተ መረጃ በዘፈቀደ ወደ ስልጠና/ሙከራ ይከፋፈላል። ሞዴሉ 93% ትክክለኛነትን ይሰጣል ነገር ግን በምርት ላይ ብልሽቶች። ትክክለኛው የመከፋፈል አካሄድ ምን መሆን አለበት?
- ሀ) የፈተናውን ስብስብ ማስፋፋት, ለምሳሌ. መከፋፈል 50%/50%
- ለ) ይበልጥ ውስብስብ የሆነ ሞዴል በመጠቀም
- ሐ) ክፋዩን ሙሉ በሙሉ ያስወግዱ እና በሁሉም መረጃዎች ያሠለጥኑ
- መ) የዘመን መለያየት፡- ከአሮጌው ዘመን ጋር ማሰልጠን እና ከአዲሱ ጊዜ ጋር መፈተሽ፣ በዚህም ሞዴሉ የወደፊቱን እንዳያይ መከላከል ✔
ማብራሪያ: በዘፈቀደ ክፍፍል በጊዜ ተከታታይ መረጃ ከተሰራ, ሞዴሉ የወደፊቱን አይቶ በስልጠና ውስጥ ያለፈውን ይተነብያል; እሱ መፍሰስ ነው እና በእውነቱ የማይገኝ ስኬት ያስገኛል ። ትክክለኛው አቀራረብ በጊዜ ቅደም ተከተል መከፋፈል ነው-ከአሮጌው ጊዜ ጋር ማሰልጠን እና ከአዲሱ ጊዜ ጋር መሞከር, በምርት ውስጥ ያለውን ተጨባጭ ሁኔታ መኮረጅ (ከቀድሞው ወደ ፊት መተንበይ).
7. በባህሪ ምህንድስና ውስጥ ስኬል (StandardScaler) መለኪያዎች ከየትኛው መረጃ ሊሰሉ ይገባል እና እንዴት ተግባራዊ ይሆናሉ?
- ሀ) ከሁሉም መረጃዎች (ስልጠና + ሙከራ አንድ ላይ) የበለጠ ትክክለኛ እንዲሆን መቁጠር አለበት
- ለ) ለእያንዳንዱ ረድፍ በተናጠል ሊሰላ ይገባል, ከዚያ ረድፍ የራሱ ዋጋ
- ሐ) ከሙከራ መረጃ ብቻ መቆጠር አለበት።
- መ) ከስልጠናው መረጃ ብቻ ሊሰላ ይገባል, ከዚያም ተመሳሳይ መለኪያዎች ለሙከራው መረጃ መተግበር አለባቸው; አለበለዚያ ያፈስሳል ✔
ማብራሪያ፡ የሁሉም ትራንስፎርሜሽን መለኪያዎች (አማካይ፣ ስታንዳርድ ዲቪኤሽን ወዘተ) እንደ ስኬልንግ፣ ኢንኮዲንግ እና ፓዲዲንግ ያሉ መለኪያዎች ከስልጠናው መረጃ ብቻ መማር አለባቸው፣ ከዚያም ለሙከራ መረጃው ተመሳሳይ መሆን አለባቸው። የፈተና መረጃዎችን ግምት ውስጥ ማስገባትም የፈተና መረጃን በስልጠና ላይ ጣልቃ እንዲገባ ያደርጋል፣ ይህም ማለት መፍሰስ፣ እና ሞዴሉን ከእሱ የተሻለ እንዲመስል ያደርገዋል። የቧንቧ መስመር መጠቀም ይህንን ያረጋግጣል.
8. አንድ ሞዴል በስልጠና ስብስብ ላይ 98% ትክክለኛነት እና በፈተና ስብስብ ላይ 72% ትክክለኛነትን ይሰጣል. ይህ ምልክት ምን ያሳያል እና ምን መደረግ አለበት?
- ሀ) በቂ ያልሆነ ትምህርት; ሞዴሉ የበለጠ ውስብስብ መሆን አለበት
- ለ) የውሂብ መፍሰስ; የሙከራ ስብስብ መለወጥ አለበት።
- ሐ) ከመጠን በላይ መገጣጠም; ሞዴሉ ቀለል ያለ መሆን አለበት ፣ መደበኛነት እና ማረጋገጫ መተግበር አለበት ✔
- መ) መደበኛ ሁኔታ; ለማንኛውም የትምህርት ውጤቱ ሁልጊዜ ከፍ ያለ ነው፣ ቅድመ ጥንቃቄዎች አያስፈልጉም።
ማብራሪያ፡ በስልጠና ውስጥ በጣም ከፍተኛ ነጥብ እና በፈተና ውስጥ ጉልህ የሆነ ዝቅተኛ ነጥብ ከመጠን በላይ የመገጣጠም የተለመደ ምልክት ነው፡ ሞዴሉ ከእውነተኛው ስርዓተ-ጥለት ይልቅ የስልጠናውን መረጃ ጫጫታ አስታውሷል። መፍትሔዎች ሞዴሉን ማቃለል፣ ተጨማሪ መረጃ፣ መደበኛ ማድረግ እና ግዛቱን በመስቀል ማረጋገጫ ማረጋገጥን ያካትታሉ። በትምህርት ውጤት ላይ ብቻ መታመን ይህንን ችግር ይደብቃል።
9. በማኔጅመንት ገለጻ፣ ሽያጩ ከ1,000 ወደ 1,020 የሚያድግበት የባር ገበታ y-ዘንግ በ980 ተጀምሯል። ትክክለኛው ጭማሪ 2% ነው። ለምንድነው ይህ የስነምግባር ጉዳይ የሆነው?
- ሀ) የተቆረጠ y-ዘንግ በእይታ ትንሽ ልዩነትን አጋንኖ ተመልካቹን ያሳታል፤ ለፍትሃዊነት ፣ በንፅፅር አሞሌዎች ውስጥ ያለው ዘንግ ከ 0 ✔ መጀመር አለበት።
- ለ) የአሞሌ ገበታዎች ለሽያጭ መረጃ በፍፁም ጥቅም ላይ ሊውሉ አይችሉም
- ሐ) ምንም ችግር የለም; ሰንጠረዡን አስደናቂ እንዲመስል ማድረግ ሁልጊዜ ጥሩ ነው።
- መ) Y-ዘንግ ሁልጊዜ ከመረጃው ትልቁ ዋጋ መጀመር አለበት።
ማብራሪያ፡- በባር ገበታዎች ለንፅፅር ዓላማ፣ y-ዘንግ በአጠቃላይ ከ 0 መጀመር አለበት። የውሂብ ባለሙያው የስነ-ምግባር ሃላፊነት መረጃውን ከመጠን በላይ የማይገልጹ ወይም የማይገመቱ ሃቀኛ ግራፎችን ማውጣት ነው.
10. አንድ ተንታኝ ትእዛዞቹን ከምርቱ ሠንጠረዥ ጋር ከተቀላቀሉ በኋላ ጠቅላላውን ልውውጥ 3 ጊዜ ያገኛል; የመስመሮች ቁጥር ከ 240 ሺህ ወደ 690 ሺህ ጨምሯል. ይህንን የዝምታ ስህተት ለመከላከል ምን መደረግ ነበረበት?
- ሀ) አጠቃላይ ትርፉን በ 3 ይከፋፍሉ
- ለ) ሁል ጊዜ ከመቀላቀል ይልቅ የተለያዩ መጠይቆችን ይጠቀሙ
- ሐ) የምርት ሠንጠረዥን ሙሉ በሙሉ መሰረዝ
- መ) ከተዋሃዱ / ከተቀላቀሉ በኋላ የረድፎችን ብዛት መፈተሽ እና በትክክለኛው ቁልፍ መገናኘታቸውን ማረጋገጥ; ማባዛትን ቀደም ብሎ መያዝ ✔
ማብራሪያ፡- በምርት ሠንጠረዥ ውስጥ ለእያንዳንዱ ምርት ብዙ ረድፎች (የተለያየ ቀለም፣ ለምሳሌ) ሲኖሩ፣ በተሳሳተ ቁልፍ መቀላቀል እያንዳንዱን ቅደም ተከተል በማባዛት ድምርን ይጨምራል። ኮዱ ያለ ስህተቶች ይሰራል ነገር ግን ውጤቱ የተሳሳተ ነው. ይህንን ለማስቀረት መንገዱ ከእያንዳንዱ ውህደት/ተቀላቀሉ በኋላ የረድፎችን ብዛት መፈተሽ እና ከትክክለኛው ቁልፍ ጋር መቀላቀል ነው።
11. የቅጥር ማጣሪያ ሞዴል በታሪካዊ መረጃ የሥርዓተ-ፆታ አለመመጣጠን እና በተመረጡ ሴት እጩዎች ስር ስልታዊ በሆነ መልኩ ይማራል፣ ነገር ግን አጠቃላይ ትክክለኛነት ከፍተኛ ነው። ይህ ምን ማለት ነው?
- ሀ) ሞዴሉ ከፍተኛ ትክክለኛነት ስላለው ምንም ችግር የለበትም
- ለ) የስታቲስቲክስ ትክክለኛነት ለሥነምግባር ተቀባይነት አይተካም; ሞዴል ያለፈውን አድልዎ ተምሯል፣ በቡድን ላይ የተመሰረተ የፍትሃዊነት ማረጋገጫ ያስፈልጋል ✔
- ሐ) የአምሳያው ትክክለኛነት የበለጠ መጨመር ችግሩን ይፈታል
- መ) ፍትሃዊነት ከዳታ ሳይንስ ወሰን ውጭ ነው።
ማብራሪያ፡ አንድ ሞዴል በስታቲስቲክስ ትክክል ቢሆንም፣ ከሥነ ምግባር አኳያ ተቀባይነት የሌለው ሊሆን ይችላል። ሞዴሉ ያለፈውን መረጃ ኢፍትሃዊነትን ይማራል እና አድልዎ በራስ-ሰር ያደርጋል። ከፍተኛ ታማኝነት ፍትህን አይተካም; ከፍተኛ ተጽዕኖ በሚያሳድሩ ሞዴሎች ውስጥ ለተለያዩ ቡድኖች የአፈፃፀም/የውሳኔ ልዩነት የሚለካው የፍትሃዊነት ቁጥጥር አስፈላጊ ነው እና የመጨረሻው ሃላፊነት በሰው ላይ ነው።
12. አንድ ሰራተኛ እውነተኛ የደንበኛ ኢሜይሎችን እና የግዢ ታሪክን የያዘ ፋይል ወደ ይፋዊ AI መሳሪያ ይሰቀላል እና 'ክፍልን ማጠቃለል' ይላል። ይህ ለምን ከባድ ስህተት ነው እና ትክክለኛው መንገድ ምንድን ነው?
- ሀ) ምንም ችግር የለም; AI መሳሪያዎች በጭራሽ ውሂብ አያከማቹም።
- ለ) ስህተቱ ፋይሉ በጣም ትልቅ ነው; መቀነስ ነበረበት
- ሐ) ትክክለኛ የግል መረጃን ለክፍት መሣሪያ መስጠት የKVKK/GDPR ጥሰት ነው። የመታወቂያ ቦታዎች መወገድ አለባቸው እና ማንነታቸው ያልታወቀ ንድፍ/ንብረት ብቻ ነው የተጋሩት።
- መ) ከኤክሴል ይልቅ CSV ጥቅም ላይ መዋል ነበረበት
ማብራሪያ፡- እውነተኛ የግል መረጃዎች (እንደ ኢ-ሜይል፣ ስም፣ ወዘተ የመሳሰሉት) በይፋ ለሚገኝ ሰው ሰራሽ መረጃ መሣሪያ ሲሰጥ በ KVKK/GDPR ወሰን ውስጥ የግላዊነት ጥሰት ይኖራል። መረጃ ከድርጅቱ ይወጣል. ብዙ ጊዜ, ዲያግራም እና ስም-አልባ / ሰው ሠራሽ ናሙና ለመተንተን በቂ ነው. ትክክለኛው መንገድ የማንነት ቦታዎችን ማስወገድ እና የማይታወቁ ንብረቶችን ብቻ ማጋራት ነው።
13. የምክር ሞዴል ወደ ምርት ውስጥ ገብቷል ነገር ግን ክትትል አልተመሠረተም; የምርት ካታሎግ ከ 4 ወራት በኋላ ሲቀየር, ሞዴሉ የቆዩ ምርቶችን መምከሩን ይቀጥላል እና የልወጣ መጠኑ በፀጥታ በ 30% ይቀንሳል. የዚህ ክስተት ስም ማን ይባላል?
- ሀ) ከመጠን በላይ መማር; ሞዴሉ የስልጠናውን ስብስብ ያስታውሳል
- ለ) ሞዴል ተንሳፋፊ; አለም ሲቀየር ሞዴሉ በፀጥታ ጊዜ ያለፈበት ይሆናል፣ ሳይስተዋል አይቀርም ምክንያቱም ክትትል ስላልተቋቋመ ✔
- ሐ) ምርጫ አድልዎ; ናሙና አድልዎ
- መ) የውሂብ መቀነስ ጥሰት
ማብራሪያ፡ ይህ የሞዴል ተንሸራታች (ሞዴል/ዳታ ተንሸራታች) ነው፡ አለም ሲቀየር (ካታሎግ፣ ባህሪ፣ ወቅት) ሞዴሉ የሰለጠነበት ሁኔታ ሲቀየር እና ሞዴሉ በፀጥታ ይሰበራል። ወደ ምርት የገባው ሞዴል በራሱ እየተበላሸ ይሄዳል; ‘መቼ’ የሚለው ጉዳይ ነው። ያለ ክትትል (የክትትል ግብዓት እና አፈጻጸም) መሰማራት መበላሸትን ለመለየት የማይቻል ያደርገዋል።
14. በአንድ የሥልጠና/የፈተና ክፍፍል 88% ትክክለኛነትን የሚያገኝ ሞዴል 5 እጥፍ የማረጋገጫ ነጥብ 88%፣ 71%፣ 83%፣ 64%፣ 79% ነው። ይህ ምን ያሳያል እና ለምን ተሻጋሪ ማረጋገጫ አስፈላጊ ነው?
- ሀ) ሞዴሉ የተረጋጋ ነው; 88% እውነተኛ አፈፃፀም ነው።
- ለ) መስቀል-ማረጋገጫ አስፈላጊ አይደለም; አንድ ክፍል በቂ ነው
- ሐ) የውጤቶች ትልቅ ተለዋዋጭነት ሞዴሉ ያልተረጋጋ መሆኑን ያሳያል; ክሮስ-ማረጋገጫ አፈጻጸምን በአማካይ እና በበርካታ ማጠራቀሚያዎች ስርጭት ላይ የተመሰረተ ነው እንጂ አንድ እድለኛ ቢን ✔ አይደለም።
- መ) ከፍተኛውን ነጥብ (88%) ሪፖርት ማድረግ የተሻለ ነው.
ማብራሪያ: አንድ ነጠላ ክፍል እድለኛ ወይም እድለኛ ሊሆን ይችላል; 88% የዚያ ቀላል ክፍፍል ውጤት ብቻ ነበር። ተሻጋሪ ማረጋገጫ ውሂቡን ብዙ ጊዜ ይከፋፍላል፣ አፈፃፀሙን በአማካይ (እዚህ ~77%) ላይ በመመስረት እና የውጤቶቹን ተለዋዋጭነት ያሳያል። እዚህ ከፍተኛ ተለዋዋጭነት ሞዴሉ ያልተረጋጋ መሆኑን ይጠቁማል; በአንድ ክፍል ላይ መተማመን አሳሳች ነው.