ክፍሎች
1. በመረጃ ሳይንስ እና ትንታኔ ውስጥ ወደ አርቲፊሻል ኢንተለጀንስ መግቢያ፡ የስራ ፍሰት፣ ሚናዎች፣ ወሰኖች፣ ማረጋገጫ እና ስነምግባር 2. የመረጃ አሰባሰብ እና የምንጭ ግንዛቤ፡- እቅድ፣ ናሙና፣ ጥራት እና የልቅሶ ግንዛቤ 3. የውሂብ ማጽዳት እና ቅድመ ማቀናበር፡ የጠፋ እሴት፣ ውጫዊ እና አይነት ልወጣ 4. ኤክስፕሎራቶሪ ውሂብ ትንተና (EDA)፡ ስርጭቶች፣ ግንኙነቶች እና የመጀመሪያ ግንዛቤዎች 5. የባህሪ ምህንድስና፡ ተለዋጮችን ማመንጨት፣ ኮድ መስጠት፣ ማመጣጠን እና መፍሰስን ማስወገድ 6. የሞዴል ግንባታ፡ የችግር ፍቺ፣ የአልጎሪዝም ምርጫ እና የስልጠና/የሙከራ ክፍፍል 7. የሞዴል ግምገማ፡ ሜትሪክስ፣ ተሻጋሪ ማረጋገጫ እና ከፍተኛ ትምህርት 8. የእይታ እና የታሪክ አተገባበር፡ ትክክለኛ ግራፊክስ፣ ሐቀኛ ግራፊክስ 9. ኮድ ማመንጨት፡- AI-የታገዘ ትንተና ከፓይዘን (ፓንዳስ) እና ከኤስኪኤል ጋር 10. የውሂብ መፍሰስ እና መራባት፡ ጸጥ ያሉ አደጋዎች እና ተግሣጽ 11. MLOps ፋውንዴሽን፣ ስነምግባር፣ ግላዊነት እና ኃላፊነት የሚሰማው ትንታኔ
ክፍል 7 / 11

የሞዴል ግምገማ፡ ሜትሪክስ፣ ተሻጋሪ ማረጋገጫ እና ከፍተኛ ትምህርት

ትርፍ፡

  • እንደ ሥራው ዓላማ ምደባን እና የመመለሻ መለኪያዎችን (ግራ መጋባት፣ ትክክለኛነት/ማስታወስ/F1፣ MAE/RMSE/R²) የመምረጥ እና የመተርጎም ችሎታ።
  • የሥልጠና እና የፈተና ውጤቶችን በማነፃፀር የከፍተኛ ትምህርትን የመለየት እና አስተማማኝ አፈፃፀም ከማረጋገጫ ጋር የማግኘት ችሎታ
  • እያንዳንዱ ሞዴል ከመነሻ መስመር ጋር በማነፃፀር እውነተኛ እሴት ይጨምር እንደሆነ የመገምገም ችሎታ

ሞዴል ማዘጋጀት ቀላል ነው; በትክክል እንደሚሰራ በትክክል ለመለካት አስቸጋሪ ነው. የዚህ ክፍል ርዕሰ ጉዳይ የውሂብ ሳይንቲስት በጣም ወሳኝ ክህሎት ነው፡ ሞዴሉን በትክክለኛ መለኪያዎች መገምገም፣ አስተማማኝ የመተንበይ አፈጻጸምን ማሳካት እና በጣም ተንኮለኛውን ወጥመድ መያዝ፡- ትምህርትን (በማስታወስ)። AI መለኪያዎችን ያሰላል, መተርጎም እና ማወዳደር; ነገር ግን የትኛው መለኪያ ለንግድዎ ትክክል እንደሆነ እና ሞዴል "በቂ" መሆን አለመሆኑን ለመወሰን የሰው ልጅ ብቻ ነው። የተሳሳተ መለኪያን የሚመለከት ቡድን ለወራት መጥፎ ሞዴል እንደ "ስኬት" ሊሳሳት ይችላል።

ለምን ትክክለኛነት በቂ አይደለም: ግራ መጋባት ማትሪክስ

በምድብ ውስጥ ወደ አእምሮ የሚመጣው የመጀመሪያው መለኪያ ትክክለኛነት (ትክክለኝነት - አጠቃላይ የትክክለኛ ትንበያዎች ጥምርታ) ነው. ነገር ግን በክፍል 6 ላይ እንደተመለከትነው፣ ሚዛናዊ ባልሆነ መረጃ ትክክለኛነት አሳሳች ነው። የተሻለው ጅምር ግራ መጋባት ማትሪክስ ነው - ትንበያዎችን በአራት ሳጥኖች የሚከፍል ሰንጠረዥ።

  • እውነት አወንታዊ (TP): የውሸት የእውነት የውሸት ብለን ጠርተናል። (ጥሩ)
  • እውነት አሉታዊ (TN)፡ በእውነት ንጹህ ነው ያልነው። (ጥሩ)
  • የውሸት አወንታዊ (ኤፍፒ)፡- ንፁህ የውሸት ነው ብለን በስህተት ተናግረናል። (የውሸት ደወል)
  • የውሸት ኔጌቲቭ (ኤፍ.ኤን)፡- ሀሰተኛውን አጥተን ንጹህ ብለን ጠራን። (ያመለጡ ማስፈራሪያ)

ከእነዚህ አራት ሳጥኖች ውስጥ ሁለት ቁልፍ መለኪያዎች ይገኛሉ። ትክክለኛነት፡ "ሐሰተኛ የምለው ምን ያህሉ እውነት ነው?" - የሐሰት ማንቂያ ወጪዎች ከፍተኛ ከሆነ አስፈላጊ። ስሜታዊነት (በእንግሊዘኛ አስታውስ): "ምን ያህል እውነተኛ ውሸቶች ያዝኩ?" - ስጋት ሲጠፋ አስፈላጊ ነው። ሁለቱ ብዙውን ጊዜ እርስ በርሳቸው ይጋጫሉ፡ ጣራውን ዝቅ ካደረጉ እና የበለጠ “ሐሰት” ካሉ፣ አስታውሱ ይጨምራል ነገር ግን ትክክለኛነት ይቀንሳል። የF1 ነጥብ የእነዚህ ሁለቱ የተመጣጠነ አማካይ (ሃርሞኒክ አማካይ) ነው።

ትኩረት: "የትኛው መለኪያ አስፈላጊ ነው" ለሚለው ጥያቄ መልሱ የንግድ ውሳኔ እንጂ ቴክኒካዊ አይደለም. በካንሰር ምርመራ ውስጥ አንድ ጉዳይ ማጣት (ዝቅተኛ ማስታወስ) አስከፊ ነው; በአይፈለጌ መልዕክት ማጣሪያ ውስጥ አስፈላጊ ኢሜል ወደ አይፈለጌ መልእክት (ዝቅተኛ ትክክለኛነት) መላክ ያበሳጫል። ወጪ መለኪያውን ይወስናል።

የመመለሻ መለኪያዎች

ውጤቱ ቁጥሮች ከሆነ, የተለያዩ መለኪያዎች ጥቅም ላይ ይውላሉ. MAE (ፍፁም ስህተት)፡ ግምቶቹ ከትክክለኛው አማካኝ ምን ያህል ይለያያሉ፣ በተመሳሳይ አሃድ (ለምሳሌ "በአማካኝ በ4,200 TL ተሳስተናል")። RMSE (Root Mean Squared Error)፡ ዋና ዋና ስህተቶችን በከፋ ሁኔታ ያስቀጣል እና ለውጫዊ አካላት ስሜታዊ ነው። R² (R-squared — Coefficient of determination)፡ በአምሳያው ውስጥ ያለው ተለዋዋጭነት ምን ያህል ያብራራል (ወደ 1 የቀረበ ጥሩ ነው፣ 0 አማካኙን የመተንበይ ያህል መጥፎ ነው፣ አሉታዊ ደግሞ የከፋ ነው)።

በጣም ተንኮለኛው ወጥመድ፡ ከመጠን በላይ መማር

ከመጠን በላይ መገጣጠም - ሞዴሉ የስልጠና መረጃን የሚያስታውስበት ነገር ግን በአዲስ መረጃ ላይ የማይሳካበት - በመረጃ ሳይንስ ውስጥ በጣም የተለመደ ስህተት ነው። ምልክቱ ግልጽ ነው-ሞዴሉ በስልጠና ስብስብ (98%) ላይ በጣም ጥሩ ነው, በፈተና ስብስብ ላይ መጥፎ (72%). ሞዴሉ በመረጃው ውስጥ ያለውን ትክክለኛ ንድፍ ሳይሆን የዚያን የተወሰነ ናሙና ጫጫታ ያስታውሰዋል። በተጨማሪም ተቃራኒው አለ: መገጣጠም - ሞዴሉ በስልጠናም ሆነ በሙከራ ላይ መጥፎ ነው, ምክንያቱም ንድፉን ለመያዝ በጣም ቀላል ነው.

ከመጠን በላይ መማርን ለመዋጋት መንገዶች፡ ሞዴሉን ማቃለል፣ ተጨማሪ መረጃ፣ መደበኛ ማድረግ - ሞዴሉ በጣም ውስብስብ እንዳይሆን የሚከለክለው የሂሳብ ብሬክ - እና ከሁሉም በላይ ደግሞ የመስቀል ማረጋገጫ።

ተሻጋሪ ማረጋገጫ፡ ነጠላ ፓነልን አትመኑ

አንድ ነጠላ የሥልጠና/የፈተና ፖድ እድለኛ ወይም እድለኛ ሊሆን ይችላል; ያ ናሙና ቀላል ስለሆነ ብቻ ለሙከራ ስብስብ ከፍተኛ ነጥብ ልታገኝ ትችላለህ። ክሮስ-ማረጋገጫ (CV በአጭሩ) ይህንን ይፈታል። በጣም የተለመደው ቅጽ k-fold CV ነው: መረጃ ወደ k ክፍሎች ይከፈላል (ለምሳሌ 5); በእያንዳንዱ ዙር አንድ ክፍል እየሞከረ እና የተቀረው ስልጠና ነው; ይህ 5 ጊዜ ያንከባልልልናል እና 5ቱ ውጤቶች አማካይ ናቸው። ስለዚህ አፈፃፀሙ በበርካታ ክፍፍሎች አማካኝ ላይ የተመሰረተ እንጂ አንድ የዕድል ክፍፍል አለመሆኑን ታያለህ። የውጤቶች ስርጭትም መረጃ ሰጭ ነው፡ በጣም ተለዋዋጭ ውጤቶች (በአንድ ፎቅ 85%፣ በሌላኛው 62%) ሞዴሉ ያልተረጋጋ መሆኑን ያመለክታሉ።

መደበኛ k-fold በጊዜ ተከታታይ ውስጥ ጥቅም ላይ አይውልም (የወደፊቱን መፍሰስ); በምትኩ፣ “ወደ ፊት ሰንሰለቶች” (የጊዜ ተከታታይ ክፍፍል) ትሰራለህ፡ ሁል ጊዜ ካለፈው ጋር በማሰልጠን እና የወደፊቱን መሞከር።

መለኪያ

የችግር አይነት

ጉዳዩ መቼ ነው?

ትክክለኛነት

ምደባ

ክፍሎች ሚዛናዊ ከሆኑ

ትክክለኛነት

ምደባ

የውሸት ደወል ውድ ነው።

ትብነት (ማስታወስ)

ምደባ

ማጣት ውድ ከሆነ

F1

ምደባ

ሚዛን ካስፈለገ

MAE

መመለሻ

ሊተረጎም የሚችል ስህተት

አርኤምኤስኢ

መመለሻ

ትላልቅ ስህተቶች ወሳኝ ከሆኑ

አር²

መመለሻ

የማብራሪያ ኃይል

ሶስት ጥቃቅን ጉዳዮች

ጉዳይ 1 - የከፍተኛ ትክክለኛነት ቅዠት. አንድ የማጭበርበር ሞዴል 99.2% ትክክለኛነት አሳይቷል እና ቡድኑ አክብሯል. ግራ መጋባት ማትሪክስ ሲመለከቱ, እውነተኛው: በውሂቡ ውስጥ ያለው የውሸት መጠን 0.8% ነበር; ሞዴሉ "ሁሉም ግልጽ" እያለ ብቻ ምንም የውሸት አልያዘም ማለት ይቻላል። ማስታወሱ 6% ነበር። ትምህርት፡ ትክክለኝነትን ሳይሆን መለኪያዎችን ተመልከት።

ጉዳይ 2 - ድብቅ ከመጠን በላይ መማር። አንድ ቡድን በስልጠናው ስብስብ ላይ XGBoostን ወደ 97% አቅርቧል። የሙከራው ስብስብ 69% ነበር, ነገር ግን ማንም አልተመለከተም. አምሳያው በምርት ላይ ወድቋል. ተሻጋሪ ማረጋገጫ የተደረገ ከሆነ፣ በታጠፈ (በላይ መማር) መካከል ያለው ትልቅ ልዩነት ከመጀመሪያው ጀምሮ ይታይ ነበር። ትምህርት፡- CV እና የፈተና ውጤትን እንጂ የትምህርት ውጤትን አትመኑ።

ጉዳይ 3 - እድለኛ ክፍፍል. አንድ ተንታኝ በአንድ ክፍፍል 88% በማግኘቱ ተደስቷል። የሥራ ባልደረባው ባለ 5 እጥፍ CV ሲሰራ፣ ውጤቶቹ 88%፣ 71%፣ 83%፣ 64%፣ 79% ነበሩ - አማካይ 77% ነው፣ ግን በጣም ተለዋዋጭ ነው። ሞዴሉ ያልተረጋጋ ነበር; ነጠላ ክፍሉ አሳሳች ነበር። ትምህርት፡- የግለሰቦችን ቢን ሳይሆን የሲቪ ትርጉም እና ስርጭትን ተመልከት።

አራት ሊገለበጡ የሚችሉ አብነቶች

1) ሙሉ ምደባ ሪፖርት;

ሞዴል እና የሙከራ ስብስብ ሰልጥኛለሁ. አመንጭ፡ ግራ መጋባት ማትሪክስ፣ ትክክለኛነት፣ አስታውስ፣ F1 (ለእያንዳንዱ ክፍል) እና የድጋፍ ቆጠራዎች። እያሰብኩ ነው፣ ነገር ግን የእኔ ጉዳይ ነው፡ የትኛው መለኪያ አስፈላጊ እንደሆነ እነግራችኋለሁ። ሚዛናዊ ባልሆነ መረጃ ትክክለኛነት ሊሳሳት እንደሚችል ልብ ይበሉ።

2) የመማሪያ ቁጥጥር;

በሁለቱም የስልጠና እና የTEST ስብስቦች ውስጥ የኔን ሞዴል ውጤቶች ያትሙ። በመካከላቸው ያለውን ልዩነት አስላ እና ትልቅ ልዩነት ከመጠን በላይ የመማር ምልክት ስለሆነ አስጠንቅቅ። ልዩነቱ ትልቅ ከሆነ መደበኛ ማድረግ ወይም ማቅለል ይጠቁሙ.

3) ማቋረጫ ማረጋገጫ;

ባለ 5 እጥፍ የመስቀል ማረጋገጫን ያከናውኑ (ለስትራቲፋይድ፣ ምደባ)። የእያንዳንዱን ማጠፊያ ነጥብ፣ አማካኝ እና መደበኛ መዛባት ያትሙ። ውጤቶቹ በጣም ተለዋዋጭ ከሆኑ (ከፍተኛ std) ከሆነ ሞዴሉ ያልተረጋጋ መሆኑን ያመልክቱ። ለውጦች በእያንዳንዱ ንብርብር ላይ ካለው የስልጠና ክፍል ብቻ እንዲማሩ የቧንቧ መስመሮችን ይጠቀሙ.

4) የመነሻ መስመር ንጽጽር፡-

የእኔን ሞዴል ሜትሪክ ከ DummyClassifier መነሻ መስመር ጋር ጎን ለጎን አስቀምጠው። ሞዴሉ የመነሻ መስመሩን በከፍተኛ ሁኔታ ያሸንፋል? ካላለፈ, ሞዴሉ ምንም እውነተኛ እሴት እንደማይጨምር ግልጽ ያድርጉ.

ደካማ ጥያቄ / ጠንካራ ጥያቄ

ደካማ ጥያቄ፡

የእኔ ሞዴል ጥሩ ነው?

"ጥሩ" ያልተገለጸ ነው; የትኛው መለኪያ፣ የትኛው ገደብ፣ የትኛው መነሻ መስመር እንደሆነ ግልጽ አይደለም። AI አንድ ትክክለኛ ቁጥር ሊሰጥ እና ሊያሳስት ይችላል።

ኃይለኛ ጥያቄ፡-

የእርስዎ ሚና፡ የግምገማ ረዳት። ምደባ፣ ሚዛናዊ ያልሆነ መረጃ (12% አዎንታዊ)። ቅድሚያ: አስታውስ (አዎንታዊ ጎኖቹን አያመልጥም). ተግባር፡ (1) ግራ መጋባት ማትሪክስ፣ (2) ትክክለኛነት/ማስታወስ/F1፣ (3) ባለ 5-fold stratified CV mean እና std፣ (4) DummyClassifier የመነሻ መስመር ንፅፅር። በማስታወስ እና በመነሻ ልዩነት ላይ ያተኩሩ, ትክክለኛነት ላይ አይደለም. አስተያየት ይስጡ, ግን የመጨረሻውን ውሳኔ አደርጋለሁ.

እዚህ፣ የልኬት ቅድሚያ፣ CV እና የመነሻ ሁኔታ ግልጽ ናቸው።

የተለመዱ ስህተቶች

  • ሚዛናዊ ባልሆነ ውሂብ ላይ ትክክለኛነትን ማመን። 99% ትክክለኛነት አናሳውን ክፍል በጭራሽ ላይይዝ ይችላል; ግራ መጋባትን ይመልከቱ.
  • የትምህርት ውጤትዎን ብቻ ይመልከቱ። ከፍተኛ ትምህርት, ዝቅተኛ የፈተና ነጥብ ከመጠን በላይ መማር ነው; ሁል ጊዜ ሁለት ነጥቦችን ያወዳድሩ።
  • በአንድ ክፍል ላይ መታመን. ዕድለኛ ክፍፍል አሳሳች ነው; በመስቀል-ማረጋገጫ አማካኙን እና ስርጭትን ይመልከቱ።
  • ከመነሻ መስመር ጋር አለመወዳደር። ሞዴሉ የሞኝ ትንበያ መምታቱን ሳታውቅ "ጥሩ" ማለት አትችልም.
  • በጊዜ ተከታታይ ላይ መደበኛ k-fold መጠቀም. የወደፊቱን ያፈስሳል; የጊዜ ተከታታይ ክፍፍል ያስፈልጋል.
ጠቃሚ ምክር፡ ከእያንዳንዱ ሞዴል ቀጥሎ ሶስት ቁጥሮችን ይፃፉ፡ የስልጠና ነጥብ፣ የማረጋገጫ አማካይ እና የመነሻ ነጥብ። ይህ ትሪዮ በጨረፍታ የሚገለጠው አጠቃላይ ትምህርት (ስልጠና >> ሲቪ) እና ዝቅተኛ ዋጋ (CV ≈ መነሻ) ነው።

በማጠቃለያው

ሞዴል መገንባት ቀላል ነው, ነገር ግን በታማኝነት መገምገም አስቸጋሪ ነው. በምደባ፣ ግራ መጋባት ማትሪክስ፣ ትክክለኛነት እና ማስታወስ ከትክክለኛነት የበለጠ መረጃ ሰጭ ናቸው። የሥራው ዋጋ የትኛው አስፈላጊ እንደሆነ ይወስናል. MAE፣ RMSE እና R² በድግግሞሽ ጊዜ ጥቅም ላይ ይውላሉ። በጣም ተንኮለኛው ወጥመድ ከመጠን በላይ መማር ነው፡ ሁልጊዜ የስልጠና እና የፈተና ነጥብ ያወዳድሩ። በመስቀል-ማረጋገጫ አማካኝ እና ስርጭት ላይ ተመርኩዞ እንጂ አንድ ስንጥቅ አይደለም፤ ሁሉንም ነገር ከመነሻ መስመር ጋር ያወዳድሩ። AI እነዚህን ሁሉ ያሰላል፣ ግን የትኛውን መለኪያ መጠቀም እንዳለበት የሚወስነው የሰው ልጅ ነው።

የመተግበሪያ ተግባር

ግራ መጋባት ማትሪክስ, ትክክለኛነት, ማስታወስ እና F1 ለምድብ ሞዴል ማውጣት; ከዚያ ባለ 5 ጊዜ ማቋረጫ ማረጋገጫ ያድርጉ እና የውጤት ስርጭትን በእጥፋቶች ላይ ይመልከቱ። በመጨረሻም የስልጠና ውጤቱን፣ የሲቪ አማካይ እና የመነሻ ነጥብ ጎን ለጎን ይፃፉ። ሞዴልዎ እየተማረ እና መሰረቱን እያሳለፈ እንደሆነ በአንድ ዓረፍተ ነገር አስተያየት ይስጡ።

የማረጋገጫ ዝርዝር

  • [ ] ከትክክለኛነት ይልቅ የሥራውን ትክክለኛ መለኪያ (ትክክለኛነት/ማስታወስ/F1 ወዘተ) ተመልክቻለሁ?
  • [] ግራ መጋባትን መርምሬያለሁ?
  • [ ] የሥልጠና እና የፈተና ነጥብ አወዳድሬ ለከፍተኛ ትምህርት አረጋግጫለሁ?
  • [ ] አማካኙን እና ስርጭቱን በተሻጋሪ ማረጋገጫ አይቻለሁ?
  • [] ሞዴሉን ከመነሻ መስመር ጋር አነጻጽሬዋለሁ?