లాభాలు:
- ఉద్యోగం యొక్క ఉద్దేశ్యం ప్రకారం వర్గీకరణ మరియు రిగ్రెషన్ మెట్రిక్లను (గందరగోళం మాతృక, ఖచ్చితత్వం/రీకాల్/F1, MAE/RMSE/R²) ఎంచుకోగల మరియు అర్థం చేసుకునే సామర్థ్యం
- శిక్షణ మరియు పరీక్ష స్కోర్లను పోల్చడం ద్వారా ఓవర్లెర్నింగ్ను గుర్తించగల సామర్థ్యం మరియు క్రాస్ ధ్రువీకరణతో నమ్మకమైన పనితీరును పొందడం
- ప్రతి మోడల్ను బేస్లైన్తో పోల్చడం ద్వారా వాస్తవ విలువను జోడిస్తుందో లేదో అంచనా వేయగల సామర్థ్యం
మోడల్ను సెటప్ చేయడం సులభం; ఇది నిజంగా పనిచేస్తుందో లేదో నిజాయితీగా కొలవడం కష్టం. ఈ యూనిట్ యొక్క అంశం డేటా సైంటిస్ట్ యొక్క అత్యంత క్లిష్టమైన నైపుణ్యం: సరైన కొలమానాలతో మోడల్ను మూల్యాంకనం చేయడం, నమ్మదగిన అంచనా పనితీరును సాధించడం మరియు అత్యంత కృత్రిమమైన ఉచ్చును పట్టుకోవడం: ఓవర్లెర్నింగ్ (జ్ఞాపకం). AI కొలమానాలను గణిస్తుంది, అర్థం చేసుకుంటుంది మరియు సరిపోల్చుతుంది; కానీ మీ వ్యాపారానికి ఏ మెట్రిక్ సరైనదో మరియు మోడల్ "తగినంతగా" ఉందో లేదో నిర్ణయించడం మానవుల ఇష్టం. తప్పు మెట్రిక్ని చూసే బృందం నెలల తరబడి చెడు మోడల్ను "విజయం"గా పొరపాటు చేయవచ్చు.
ఖచ్చితత్వం ఎందుకు సరిపోదు: గందరగోళ మాతృక
వర్గీకరణలో గుర్తుకు వచ్చే మొదటి మెట్రిక్ ఖచ్చితత్వం (ఖచ్చితత్వం — సరైన అంచనాల మొత్తం నిష్పత్తి). కానీ మేము యూనిట్ 6లో చూసినట్లుగా, అసమతుల్య డేటాతో ఖచ్చితత్వం తప్పుదారి పట్టిస్తుంది. మెరుగైన ప్రారంభం గందరగోళ మాతృక - అంచనాలను నాలుగు డబ్బాలుగా విభజించే పట్టిక:
- ట్రూ పాజిటివ్ (TP): మేము నకిలీని నిజంగా నకిలీ అని పిలుస్తాము. (మంచిది)
- నిజమైన ప్రతికూల (TN): మేము నిజంగా శుభ్రంగా చెప్పాము. (మంచిది)
- ఫాల్స్ పాజిటివ్ (FP): మేము క్లీన్ ఫేక్ అని పొరపాటుగా చెప్పాము. (తప్పుడు అలారం)
- తప్పుడు ప్రతికూల (FN): మేము నకిలీని కోల్పోయాము మరియు దానిని క్లీన్ అని పిలిచాము. (ముప్పు తప్పింది)
ఈ నాలుగు పెట్టెల నుండి రెండు కీలక కొలమానాలు వచ్చాయి. ఖచ్చితత్వం: "నేను నకిలీ అని పిలిచే వాటిలో వాస్తవంగా నకిలీ ఎంత?" - తప్పుడు అలారం ఖర్చులు ఎక్కువగా ఉంటే ముఖ్యం. సున్నితత్వం (ఇంగ్లీష్లో రీకాల్): "నేను ఎన్ని నిజమైన నకిలీలను పట్టుకున్నాను?" - ముప్పు తప్పిపోయినప్పుడు ముఖ్యమైనది ఖరీదైనది. ఈ రెండూ తరచుగా పరస్పర విరుద్ధంగా ఉంటాయి: మీరు థ్రెషోల్డ్ని తగ్గించి, "నకిలీ" అని ఎక్కువ చెబితే, రీకాల్ పెరుగుతుంది కానీ ఖచ్చితత్వం తగ్గుతుంది. F1 స్కోర్ అనేది ఈ రెండింటిలో సమతుల్య సగటు (హార్మోనిక్ మీన్).
శ్రద్ధ: "ఏ మెట్రిక్ ముఖ్యం" అనే ప్రశ్నకు సమాధానం వ్యాపార నిర్ణయం, సాంకేతికమైనది కాదు. క్యాన్సర్ స్క్రీనింగ్లో కేసును కోల్పోవడం (తక్కువ రీకాల్) వినాశకరమైనది; స్పామ్ ఫిల్టర్లో స్పామ్ (తక్కువ ఖచ్చితత్వం)కు ముఖ్యమైన ఇమెయిల్ను పంపడం బాధించేది. ఖర్చు మెట్రిక్ని నిర్ణయిస్తుంది.
రిగ్రెషన్ కొలమానాలు
అవుట్పుట్ సంఖ్యలు అయితే, వివిధ కొలమానాలు ఉపయోగించబడతాయి. MAE (సగటు సంపూర్ణ లోపం): అదే యూనిట్లో వాస్తవ సగటు నుండి అంచనాలు ఎంత భిన్నంగా ఉంటాయి (ఉదా. "మనం సగటున 4,200 TL తప్పుగా ఉన్నాము"). RMSE (రూట్ మీన్ స్క్వేర్డ్ ఎర్రర్): ప్రధాన లోపాలను మరింత తీవ్రంగా శిక్షిస్తుంది మరియు బయటి వ్యక్తులకు సున్నితంగా ఉంటుంది. R² (R-స్క్వేర్డ్ — కోఎఫీషియంట్ ఆఫ్ డిటర్మినేషన్): మోడల్ వివరిస్తున్న లక్ష్యంలో ఎంత వైవిధ్యం ఉంది (1కి దగ్గరగా ఉండటం మంచిది, 0 సగటును అంచనా వేసినంత చెడ్డది, ప్రతికూలం మరింత చెడ్డది).
అత్యంత కృత్రిమ ఉచ్చు: అతిగా నేర్చుకోవడం
ఓవర్ఫిట్టింగ్ - మోడల్ శిక్షణ డేటాను గుర్తుపెట్టుకుంటుంది కానీ కొత్త డేటాలో విఫలమవుతుంది - డేటా సైన్స్లో అత్యంత సాధారణ తప్పు. లక్షణం స్పష్టంగా ఉంది: శిక్షణా సెట్లో మోడల్ చాలా బాగుంది (98%), పరీక్ష సెట్లో చెడు (72%). మోడల్ ఆ నిర్దిష్ట నమూనా యొక్క శబ్దాన్ని గుర్తుపెట్టుకుంది, డేటాలోని వాస్తవ నమూనా కాదు. దీనికి విరుద్ధంగా కూడా ఉంది: అండర్ఫిట్టింగ్- మోడల్ శిక్షణ మరియు టెస్టింగ్ రెండింటిలోనూ చెడ్డది ఎందుకంటే ఇది నమూనాను సంగ్రహించడం చాలా సులభం.
ఓవర్లెర్నింగ్ను ఎదుర్కోవడానికి మార్గాలు: మోడల్ను సరళీకృతం చేయడం, మరింత డేటా, రెగ్యులరైజేషన్ — మోడల్ను చాలా క్లిష్టంగా ఉంచే గణిత బ్రేక్ — మరియు ముఖ్యంగా క్రాస్ ధ్రువీకరణ.
క్రాస్ ధ్రువీకరణ: సింగిల్ పేన్ను విశ్వసించవద్దు
ఒకే శిక్షణ/పరీక్ష పాడ్ అదృష్టం లేదా దురదృష్టకరం కావచ్చు; ఆ నమూనా సులభంగా ఉన్నందున మీరు పరీక్ష సెట్కు అధిక మార్కులు పొందవచ్చు. క్రాస్ ధ్రువీకరణ (సంక్షిప్తంగా CV) దీనిని పరిష్కరిస్తుంది. అత్యంత సాధారణ రూపం k-ఫోల్డ్ CV: డేటా k భాగాలుగా విభజించబడింది (ఉదా. 5); ప్రతి రౌండ్లో, ఒక భాగం పరీక్ష మరియు మిగిలినది శిక్షణ; ఇది 5 సార్లు రోల్ అవుతుంది మరియు 5 స్కోర్లు సగటున ఉంటాయి. కాబట్టి మీరు పనితీరు బహుళ విభజనల సగటుపై ఆధారపడి ఉంటుందని మీరు చూస్తారు, ఒక్క అదృష్ట స్ప్లిట్ కాదు. స్కోర్ల పంపిణీ కూడా సమాచారంగా ఉంటుంది: చాలా అస్థిర స్కోర్లు (ఒక అంతస్తులో 85%, మరొకటి 62%) మోడల్ అస్థిరంగా ఉందని సూచిస్తున్నాయి.
సమయ శ్రేణిలో సాధారణ k-ఫోల్డ్ ఉపయోగించబడదు (భవిష్యత్తును లీక్ చేస్తుంది); బదులుగా, మీరు "ఫార్వర్డ్ చైనింగ్" (సమయ శ్రేణి విభజన) చేస్తారు: ఎల్లప్పుడూ గతంతో శిక్షణ మరియు భవిష్యత్తును పరీక్షిస్తారు.
మెట్రిక్
సమస్య రకం
ఇది ఎప్పుడు ముఖ్యం?
ఖచ్చితత్వం
వర్గీకరణ
తరగతులు సమతుల్యంగా ఉంటే
ఖచ్చితత్వం
వర్గీకరణ
తప్పుడు అలారం ఖరీదైనది
సున్నితత్వం (రీకాల్)
వర్గీకరణ
మిస్ అవ్వడం ఖరీదైనది అయితే
F1
వర్గీకరణ
సంతులనం అవసరమైతే
MAE
తిరోగమనం
వివరించదగిన లోపం
RMSE
తిరోగమనం
పెద్ద తప్పులు క్లిష్టమైనవి అయితే
R²
తిరోగమనం
వివరణాత్మక శక్తి
మూడు చిన్న కేసులు
కేసు 1 - అధిక ఖచ్చితత్వం యొక్క భ్రాంతి. ఒక మోసం మోడల్ 99.2% ఖచ్చితత్వాన్ని చూపించింది మరియు బృందం జరుపుకుంది. గందరగోళ మాతృకను పరిశీలిస్తే, నిజమైనది: డేటాలో నకిలీ రేటు 0.8%; మోడల్ దాదాపు నకిలీలను పట్టుకోలేదు, కేవలం "అన్నీ క్లియర్" అని చెప్పింది. రీకాల్ 6%. పాఠం: కొలమానాలను చూడండి, ఖచ్చితత్వం కాదు.
కేస్ 2 - గుప్త అవగాహన. ఒక బృందం శిక్షణ సెట్లో XGBoostని 97%కి డెలివరీ చేసి పెంచింది. పరీక్ష సెట్ 69%, కానీ ఎవరూ చూడలేదు. ఉత్పత్తిలో మోడల్ కుప్పకూలింది. క్రాస్-వాలిడేషన్ జరిగి ఉంటే, ఫోల్డ్స్ (ఓవర్ లెర్నింగ్) మధ్య పెద్ద వ్యత్యాసం మొదటి నుండి కనిపించేది. పాఠం: విద్యా స్కోర్ కాకుండా CV మరియు టెస్ట్ స్కోర్ను విశ్వసించండి.
కేస్ 3 - లక్కీ స్ప్లిట్. ఒకే స్ప్లిట్లో 88% పొందడం పట్ల ఒక విశ్లేషకుడు సంతోషించారు. అతని సహోద్యోగి 5 రెట్లు CV చేసినప్పుడు, స్కోర్లు 88%, 71%, 83%, 64%, 79% - సగటు 77%, కానీ ఇది చాలా అస్థిరంగా ఉంది. మోడల్ అస్థిరంగా ఉంది; సింగిల్ కంపార్ట్మెంట్ తప్పుదారి పట్టించింది. పాఠం: వ్యక్తిగత బిన్ కాకుండా CV సగటు మరియు పంపిణీని చూడండి.
నాలుగు కాపీ చేయగల టెంప్లేట్లు
1) పూర్తి వర్గీకరణ నివేదిక:
నేను మోడల్ మరియు టెస్ట్ సెట్లో శిక్షణ పొందాను. రూపొందించండి: గందరగోళ మాతృక, ఖచ్చితత్వం, రీకాల్, F1 (ప్రతి తరగతికి) మరియు మద్దతు గణనలు. నేను అంచనా వేస్తున్నాను, కానీ అది నా ఇష్టం: ఏ మెట్రిక్ ముఖ్యమైనదో నేను మీకు చెప్తాను. అసమతుల్య డేటాతో ఖచ్చితత్వం తప్పుదారి పట్టించవచ్చని గమనించండి.
2) ఓవర్ లెర్నింగ్ నియంత్రణ:
ట్రైనింగ్ మరియు టెస్ట్ సెట్లు రెండింటిలోనూ నా మోడల్ స్కోర్లను పక్కపక్కనే ప్రింట్ చేయండి. వాటి మధ్య వ్యత్యాసాన్ని లెక్కించండి మరియు పెద్ద వ్యత్యాసం ఓవర్లెర్నింగ్కు సంకేతంగా హెచ్చరిస్తుంది. వ్యత్యాసం పెద్దగా ఉంటే, క్రమబద్ధీకరణ లేదా సరళీకరణను సూచించండి.
3) క్రాస్ ధ్రువీకరణ:
5 రెట్లు క్రాస్ ధ్రువీకరణ (స్తరీకరణ, వర్గీకరణ కోసం) జరుపుము. ప్రతి మడత యొక్క స్కోర్, సగటు మరియు ప్రామాణిక విచలనాన్ని ముద్రించండి. స్కోర్లు చాలా అస్థిరంగా ఉంటే (అధిక std), మోడల్ అస్థిరంగా ఉందని సూచించండి. పైప్లైన్లను ఉపయోగించండి, తద్వారా ప్రతి లేయర్లోని శిక్షణ భాగం నుండి మాత్రమే పరివర్తనలు నేర్చుకోబడతాయి.
4) బేస్లైన్ పోలిక:
డమ్మీక్లాసిఫైయర్ బేస్లైన్తో నా మోడల్ మెట్రిక్ను పక్కపక్కనే ఉంచండి. మోడల్ బేస్లైన్ను గణనీయంగా ఓడించిందా? అది పాస్ కాకపోతే, మోడల్ అసలు విలువను జోడించదని స్పష్టం చేయండి.
బలహీనమైన ప్రాంప్ట్ / బలమైన ప్రాంప్ట్
బలహీనమైన ప్రాంప్ట్:
నా మోడల్ బాగుందా?
"గుడ్" అనేది నిర్వచించబడలేదు; ఏ మెట్రిక్, ఏ థ్రెషోల్డ్, ఏ బేస్లైన్ అనేది స్పష్టంగా లేదు. AI ఒకే ఖచ్చితత్వ సంఖ్యను అందించగలదు మరియు తప్పుదారి పట్టించగలదు.
శక్తివంతమైన ప్రాంప్ట్:
మీ పాత్ర: అసెస్మెంట్ అసిస్టెంట్. వర్గీకరణ, అసమతుల్య డేటా (12% పాజిటివ్). ప్రాధాన్యత: రీకాల్ (పాజిటివ్లను కోల్పోలేదు). టాస్క్: (1) కన్ఫ్యూజన్ మ్యాట్రిక్స్,(2) ఖచ్చితత్వం/రీకాల్/F1, (3) 5-రెట్లు స్ట్రాటిఫైడ్ CV మీన్ మరియు std,(4) డమ్మీక్లాసిఫైయర్ బేస్లైన్ పోలిక. రీకాల్ మరియు బేస్లైన్ తేడాపై దృష్టి పెట్టండి, ఖచ్చితత్వం కాదు. వ్యాఖ్యానించండి, కానీ నేను తుది నిర్ణయం తీసుకుంటాను.
ఇక్కడ, మెట్రిక్ ప్రాధాన్యత, CV మరియు బేస్లైన్ పరిస్థితి స్పష్టంగా ఉన్నాయి.
సాధారణ తప్పులు
- అసమతుల్య డేటాలో ఖచ్చితత్వాన్ని విశ్వసించడం. 99% ఖచ్చితత్వం మైనారిటీ తరగతిని అస్సలు పట్టుకోకపోవచ్చు; గందరగోళ మాతృక చూడండి.
- మీ విద్యార్హత స్కోర్ను మాత్రమే చూస్తున్నారు. ఉన్నత విద్య, తక్కువ పరీక్ష స్కోర్ ఎక్కువగా నేర్చుకోవడం; ఎల్లప్పుడూ రెండు స్కోర్లను సరిపోల్చండి.
- ఒకే కంపార్ట్మెంట్పై ఆధారపడుతున్నారు. లక్కీ డివిజన్ తప్పుదారి పట్టించేది; క్రాస్ ధ్రువీకరణతో సగటు మరియు పంపిణీని చూడండి.
- బేస్లైన్తో పోల్చడం లేదు. మోడల్ స్టుపిడ్ ప్రిడిక్టర్ను ఓడించిందో లేదో తెలియకుండా మీరు "మంచిది" అని చెప్పలేరు.
- సమయ శ్రేణిలో సాధారణ k-ఫోల్డ్ని ఉపయోగించడం. ఇది భవిష్యత్తును లీక్ చేస్తుంది; సమయ శ్రేణి విభజన అవసరం.
చిట్కా: ప్రతి మోడల్ పక్కన మూడు సంఖ్యలను వ్రాయండి: శిక్షణ స్కోర్, క్రాస్ ధ్రువీకరణ సగటు మరియు బేస్లైన్ స్కోర్. ఈ త్రయం ఓవర్ లెర్నింగ్ (శిక్షణ >> CV) మరియు తక్కువ విలువ (CV ≈ బేస్లైన్) ఒక చూపులో వెల్లడిస్తుంది.
సారాంశంలో
మోడల్ను రూపొందించడం చాలా సులభం, కానీ దానిని నిజాయితీగా అంచనా వేయడం కష్టం. వర్గీకరణలో, గందరగోళ మాతృక, ఖచ్చితత్వం మరియు రీకాల్ ఖచ్చితత్వం కంటే చాలా ఎక్కువ సమాచారం; ఉద్యోగం యొక్క ధర ఏది ముఖ్యమైనదో నిర్ణయిస్తుంది. రిగ్రెషన్లో MAE, RMSE మరియు R² ఉపయోగించబడతాయి. అత్యంత కృత్రిమమైన ఉచ్చు ఓవర్లెర్నింగ్: ఎల్లప్పుడూ శిక్షణ మరియు పరీక్ష స్కోర్ను సరిపోల్చండి. క్రాస్ ధ్రువీకరణ యొక్క సగటు మరియు పంపిణీపై ఆధారపడండి, ఒక్క స్ప్లిట్ కాదు; ప్రతిదీ బేస్లైన్తో పోల్చండి. AI వీటన్నింటిని గణిస్తుంది, అయితే ఏ మెట్రిక్ని ఉపయోగించాలో నిర్ణయించుకోవడం మానవుని ఇష్టం.
అప్లికేషన్ టాస్క్
వర్గీకరణ నమూనా కోసం గందరగోళ మాతృక, ఖచ్చితత్వం, రీకాల్ మరియు F1 సంగ్రహించండి; తర్వాత 5 రెట్లు క్రాస్ ధ్రువీకరణ చేయండి మరియు ఫోల్డ్స్ అంతటా స్కోర్ పంపిణీని చూడండి. చివరగా, శిక్షణ స్కోర్, CV సగటు మరియు బేస్లైన్ స్కోర్ను పక్కపక్కనే రాయండి. మీ మోడల్ బాగా నేర్చుకుంటోందా మరియు బేస్లైన్లో ఉత్తీర్ణత సాధిస్తుందో లేదో ఒక్క వాక్యంలో వ్యాఖ్యానించండి.
చెక్లిస్ట్
- [ ] నేను ఖచ్చితత్వానికి బదులుగా ఉద్యోగం యొక్క వాస్తవ మెట్రిక్ను (ఖచ్చితమైన/రీకాల్/F1 మొదలైనవి) చూశానా?
- [ ] నేను గందరగోళ మాతృకను పరిశీలించానా?
- [ ] నేను శిక్షణ మరియు పరీక్ష స్కోర్లను పోల్చి, ఓవర్లెర్నింగ్ కోసం తనిఖీ చేశానా?
- [ ] నేను క్రాస్ ధ్రువీకరణతో సగటు మరియు పంపిణీని చూశానా?
- [ ] నేను మోడల్ను బేస్లైన్తో పోల్చానా?