లాభాలు:
- MLOps దశలు (విడుదల, విస్తరణ, పర్యవేక్షణ, తిరిగి శిక్షణ, రోల్బ్యాక్) మరియు మోడల్ డ్రిఫ్ట్ను అర్థం చేసుకోగల సామర్థ్యం మరియు పర్యవేక్షించబడిన విస్తరణను ప్లాన్ చేయడం
- మోడల్ ఫెయిర్నెస్, పారదర్శకత మరియు జవాబుదారీతనం యొక్క సూత్రాలను వర్తింపజేయగల సామర్థ్యం మరియు నైతిక ఆమోదయోగ్యం నుండి గణాంక ఖచ్చితత్వాన్ని వేరు చేయడం
- KVKK/GDPR సూత్రాలతో వ్యక్తిగత డేటాను రక్షించగల సామర్థ్యం మరియు అధిక-ప్రభావ నిర్ణయాలలో మానవునికి తుది బాధ్యతను అప్పగించడం
మోడల్కు శిక్షణ ఇవ్వడం మరియు అధిక స్కోర్ పొందడం ముగింపు కాదు, మధ్యలో. మోడల్ను ఉత్పత్తిలో ఉంచి విశ్వసనీయంగా పనిచేసినప్పుడు నిజమైన విలువ వస్తుంది, కాలక్రమేణా క్షీణించకుండా పర్యవేక్షించబడుతుంది మరియు మొత్తం ప్రక్రియ నైతిక మరియు చట్టపరమైన సరిహద్దులలో నిర్వహించబడుతుంది. ఈ ముగింపు యూనిట్ మూడు అంశాలను మిళితం చేస్తుంది: MLOps (ప్రత్యక్షంగా వెళ్లే క్రమశిక్షణ, మోడల్లను పర్యవేక్షించడం మరియు నిర్వహించడం), నీతి (న్యాయం, పారదర్శకత, దుర్మార్గం లేనిది) మరియు గోప్యత (వ్యక్తిగత డేటాను రక్షించడం). AI ఈ ప్రాంతాల్లో కోడ్, చెక్లిస్ట్లు మరియు బ్లూప్రింట్లను ఉత్పత్తి చేస్తుంది; కానీ మోడల్ ప్రత్యక్ష ప్రసారం అవుతుందా, ఎవరు ప్రభావితం అవుతారు మరియు ఏ డేటాను ఉపయోగించవచ్చో మానవులు నిర్ణయిస్తారు. ఈ నిర్ణయాలు సాంకేతికమైనవి కావు, బాధ్యత నిర్ణయాలు.
MLOps: మోడల్ ఒక ఉత్పత్తి వలె జీవిస్తుంది
MLOps (మెషిన్ లెర్నింగ్ ఆపరేషన్స్ - ఉత్పత్తిలో మెషిన్ లెర్నింగ్ మోడల్లను అమలు చేయడం, పర్యవేక్షించడం మరియు నవీకరించడం) అనేది సాఫ్ట్వేర్ డెవలప్మెంట్లో డేటా సైన్స్కు DevOps యొక్క అనుసరణ. ప్రాథమిక ఆలోచన: మోడల్ అనేది ఒకసారి శిక్షణ పొందిన మరియు మరచిపోయిన ఫైల్ కాదు, కానీ స్థిరమైన నిర్వహణ అవసరమయ్యే జీవన ఉత్పత్తి. ప్రధాన దశలు:
1. సంస్కరణ: కోడ్ (Git), డేటా మరియు మోడల్ కలిసి వెర్షన్ చేయబడ్డాయి; ఏ డేటా మరియు కోడ్తో ఏ మోడల్ ఉత్పత్తి చేయబడిందో నమోదు చేయబడుతుంది.
2. విస్తరణ: మోడల్ API లేదా బ్యాచ్ జాబ్గా ప్రత్యక్ష ప్రసారం చేయబడుతుంది. ఇది సాధారణంగా చిన్న ప్రేక్షకులకు ముందుగా ఇవ్వబడుతుంది (నీడ/కానరీ పంపిణీ).
3. మానిటరింగ్: మోడల్ పనితీరు మరియు ఇన్పుట్ డేటా నిరంతరం పర్యవేక్షించబడతాయి.
4. రీట్రైనింగ్: పనితీరు తగ్గినప్పుడు, మోడల్ అప్డేట్ చేయబడిన డేటాతో మళ్లీ శిక్షణ పొందుతుంది.
నమూనా మార్పు: నిశ్శబ్ద వక్రీకరణ
ఉత్పత్తిలో అతిపెద్ద ప్రమాదం మోడల్ డ్రిఫ్ట్ (మోడల్ డ్రిఫ్ట్ / డేటా డ్రిఫ్ట్). ప్రపంచం మారుతుంది; మీరు మీ మోడల్కు శిక్షణనిచ్చిన పరిస్థితులు (కస్టమర్ ప్రవర్తన, ధరలు, సీజన్, చట్టం) కాలక్రమేణా మారతాయి మరియు మోడల్ కాలం చెల్లినదిగా మారడం ప్రారంభమవుతుంది. ఉదాహరణకు, మహమ్మారికి ముందు శిక్షణ పొందిన డిమాండ్ మోడల్ మహమ్మారి సమయంలో పూర్తిగా తప్పు. డ్రిఫ్ట్ రెండు రూపాల్లో జరుగుతుంది: డేటా డ్రిఫ్ట్ (ఇన్పుట్ డేటా మార్పుల పంపిణీ) మరియు కాన్సెప్ట్ డ్రిఫ్ట్ (ఇన్పుట్ మరియు టార్గెట్ మార్పుల మధ్య సంబంధం). వీటిని సంగ్రహించే మార్గం పర్యవేక్షణ: ఇన్పుట్ పంపిణీ, అంచనా పంపిణీ మరియు (వీలైతే) వాస్తవ ఫలితంతో పోలిస్తే పనితీరును నిరంతరం ట్రాక్ చేయండి.
హెచ్చరిక: ఉత్పత్తిలో ఉంచబడిన మోడల్ దాని స్వంతదానిపై చెడిపోతుంది; ఇది "ఉంటే" అనే విషయం కాదు, "ఎప్పుడు." పర్యవేక్షణను ఏర్పాటు చేయకుండా మోడళ్లను అమర్చడం అనేది కారును దాని ఇంజిన్ను ఎప్పుడూ నియంత్రించకుండా నడపడం లాంటిది; ఒక రోజు అది నిశ్శబ్దంగా కూర్చుంది మరియు మీరు గమనించలేరు.
MLOps మూలకం
ప్రయోజనం
నిర్లక్ష్యం చేస్తే
సంస్కరణ
ఏది ఉత్పత్తి అవుతుందో తెలుసుకోవడం
పునరుత్పత్తి చేయలేనిది, గుర్తించలేనిది
మానిటరింగ్
పొద్దున్నే స్లిప్ చూడడం
మోడల్ నిశ్శబ్దంగా విరిగిపోతుంది
తిరిగి శిక్షణ
తాజాగా ఉండండి
అంచనాలు పాతబడతాయి
రోల్బ్యాక్
చెడ్డ మోడల్కి తిరిగి వెళ్ళు
తప్పు మోడల్ ప్రత్యక్షంగా ఉంది
డాక్యుమెంటేషన్
పారదర్శకత, టర్నోవర్
సమాచారం ఒక వ్యక్తిలో చిక్కుకుపోతుంది
నీతి: మోడల్ నిర్ణయాలు ప్రజలను ప్రభావితం చేస్తాయి
ప్రజల జీవితాలను ప్రభావితం చేసే నిర్ణయాలలో డేటా నమూనాలు ఎక్కువగా ఉపయోగించబడుతున్నాయి: క్రెడిట్, నియామకం, బీమా, న్యాయం. ఈ శక్తితో బాధ్యత వస్తుంది. ప్రధాన నైతిక ప్రమాదాలు:
పక్షపాతం మరియు వివక్ష: మోడల్ చారిత్రక డేటాలో అన్యాయాలను నేర్చుకోగలదు మరియు శాశ్వతం చేయగలదు. ఒక నిర్దిష్ట సమూహానికి గతంలో తక్కువ క్రెడిట్ ఇవ్వబడి ఉంటే, మోడల్ ఇది "నియమం" అని ఊహిస్తుంది మరియు వివక్షను ఆటోమేట్ చేస్తుంది. అందుకే ఫెయిర్నెస్ అనాలిసిస్ — మోడల్ వివిధ సమూహాలకు (లింగం, వయస్సు, ప్రాంతం) ఒకే విధంగా పనిచేస్తుందో లేదో తనిఖీ చేయడం చాలా అవసరం.
పారదర్శకత మరియు వివరణ: మోడల్ ఒక వ్యక్తిని ఎందుకు తిరస్కరించిందో మీరు వివరించగలగాలి. "బ్లాక్ బాక్స్ అలా చెప్పింది" అనేది నైతికంగా మరియు తరచుగా చట్టపరంగా ఆమోదయోగ్యం కాదు. అందుకే వివరణాత్మక సాధనాలు (ఫీచర్ ప్రాముఖ్యత, SHAP విలువలు) విలువైనవి.
జవాబుదారీతనం: మోడల్ తప్పు నిర్ణయం తీసుకుంటే ఎవరు బాధ్యత వహిస్తారు? సమాధానం ఎల్లప్పుడూ ఒక వ్యక్తి/సంస్థ, మోడల్ కాదు. మానవ పర్యవేక్షణ (హ్యూమన్-ఇన్-ది-లూప్ — తుది నిర్ణయాన్ని ఆమోదించే మానవుడు) అధిక-ప్రభావ నిర్ణయాలలో భద్రపరచబడాలి.
హెచ్చరిక: మోడల్ గణాంకపరంగా "సరైనది" కావచ్చు కానీ నైతికంగా ఆమోదయోగ్యం కాదు. ఒక సమూహానికి క్రమపద్ధతిలో ప్రతికూలతలు కలిగించే అత్యంత ఖచ్చితమైన మోడల్ మంచి మోడల్ కాదు. నిజాయితీ న్యాయానికి ప్రత్యామ్నాయం కాదు.
గోప్యత: వ్యక్తిగత డేటా జాగ్రత్తగా రక్షించబడింది
డేటా సైన్స్ యొక్క ముడి పదార్థం తరచుగా వ్యక్తిగత డేటా, మరియు ఈ డేటా చట్టం ద్వారా రక్షించబడుతుంది: Türkiye లో KVKK, ఐరోపాలో GDPR. ప్రాథమిక సూత్రాలు: ప్రయోజన పరిమితి (డేటా సేకరించిన ప్రయోజనం కోసం కాకుండా ఇతర ప్రయోజనాల కోసం ఉపయోగించబడదు), డేటా కనిష్టీకరణ (అవసరం కంటే ఎక్కువ డేటా సేకరించబడదు/నిలుపుకోలేదు), అనామకీకరణ (సమాచారం గుర్తించడం తీసివేయబడుతుంది) మరియు భద్రత (డేటా గుప్తీకరించబడింది మరియు యాక్సెస్ పరిమితం చేయబడింది). AI సాధనాలతో పని చేస్తున్నప్పుడు క్లిష్టమైన నియమం: నిజమైన వ్యక్తిగత డేటాను పబ్లిక్ AI సాధనంలో అతికించవద్దు. చాలా సమయం, విశ్లేషణ కోసం రేఖాచిత్రం మరియు అనామక/సింథటిక్ నమూనా సరిపోతాయి.
సమాచార భద్రత విషయంలో అదనపు ప్రాధాన్యత: రక్షణాత్మక మరియు చట్టబద్ధమైన విశ్లేషణ ప్రయోజనాల కోసం మీకు అధికారం ఉన్న డేటా మరియు సిస్టమ్లపై మాత్రమే డేటా సైన్స్ సాధనాలు మరియు సాంకేతికతలను ఉపయోగించండి. వేరొకరి డేటాకు అనధికారిక యాక్సెస్, వ్యక్తులను తిరిగి గుర్తించడం (అనామక డేటా నుండి గుర్తింపును సంగ్రహించడం) లేదా అనధికార ప్రొఫైలింగ్ చట్టవిరుద్ధం మరియు అనైతికం.
మూడు చిన్న కేసులు
కేసు 1 - ట్రాక్ చేయని పతనం. ఒక ఇ-కామర్స్ కంపెనీ దాని సిఫార్సు మోడల్తో ప్రత్యక్ష ప్రసారం చేయబడింది మరియు ట్రాకింగ్ను సెటప్ చేయలేదు. 4 నెలల తర్వాత ఉత్పత్తి కేటలాగ్ బాగా మారిపోయింది; మోడల్ పాత ఉత్పత్తులను సిఫార్సు చేస్తూనే ఉంది మరియు మార్పిడి రేటు నిశ్శబ్దంగా 30% తగ్గింది. నెలల తరబడి ఎవరూ గమనించలేదు. పాఠం: పర్యవేక్షణ లేకుండా విస్తరణ గుడ్డిగా జరుగుతోంది.
కేసు 2 - దాచిన వివక్ష. ఒక నియామక స్క్రీనింగ్ మోడల్ చారిత్రక డేటాలో లింగ అసమతుల్యత గురించి మరియు క్రమపద్ధతిలో తక్కువ అంచనా వేసిన మహిళా అభ్యర్థుల గురించి తెలుసుకుంది. న్యాయమైన విశ్లేషణ లేనందున ఇది గుర్తించబడలేదు; ఇది ఒక ఆడిట్లో వెల్లడైంది మరియు సంస్థ తీవ్రమైన కీర్తి/చట్టపరమైన ప్రమాదాన్ని ఎదుర్కొంది. పాఠం: అధిక-ప్రభావ నమూనాలలో సమూహ-ఆధారిత సరసమైన నియంత్రణ అవసరం.
కేసు 3 - గోప్యత ఉల్లంఘన. ఒక విశ్లేషకుడు నిజమైన కస్టమర్ ఇమెయిల్లు మరియు కొనుగోలు చరిత్రను కలిగి ఉన్న ఫైల్ను పబ్లిక్ AI సాధనంలోకి లోడ్ చేసి, "విభాగాలను సంగ్రహించండి" అని అన్నారు. వ్యక్తిగత డేటా సంస్థ నుండి నిష్క్రమించింది; KVKK ప్రక్రియ ప్రారంభమైంది. గుర్తింపు ఫీల్డ్లను తీసివేయడం మరియు అనామక ఆస్తులను మాత్రమే భాగస్వామ్యం చేయడం సరైన మార్గం. పాఠం: నిజమైన వ్యక్తిగత డేటా ఓపెన్ టూల్లోకి ప్రవేశించదు.
నాలుగు కాపీ చేయగల టెంప్లేట్లు
1) ముందస్తు విస్తరణ చెక్లిస్ట్:
మీ పాత్ర: MLOps కన్సల్టెంట్. మోడల్ను ఉత్పత్తిలో ఉంచడానికి ముందు నేను తనిఖీ చేయవలసిన అంశాలను జాబితా చేయండి: సంస్కరణ, పర్యవేక్షణ కొలమానాలు, రోల్బ్యాక్ ప్లాన్, పనితీరు థ్రెషోల్డ్, డేటా డ్రిఫ్ట్ హెచ్చరిక, బాధ్యతాయుతమైన వ్యక్తి. ప్రతి అంశానికి ఒక వాక్యం "ఎందుకు ముఖ్యమైనది" అనే వివరణను జోడించండి. నేను నిర్ణయిస్తాను.
2) మోడల్ షిఫ్ట్ ట్రాకింగ్ డిజైన్:
ఉత్పత్తిలో వర్గీకరణ నమూనా కోసం డ్రిఫ్ట్ మానిటరింగ్ ప్లాన్ను సూచించండి: (1) నేను ఏ ఇన్పుట్ డిస్ట్రిబ్యూషన్లను పర్యవేక్షించాలి, (2) ప్రిడిక్షన్ డిస్ట్రిబ్యూషన్ కోసం ఏ అలారం, (3) నిజమైన ఫలితం వచ్చినప్పుడు పనితీరును ఎలా పోల్చాలి, (4) ఏ థ్రెషోల్డ్ రీట్రైనింగ్ ప్రారంభించబడాలి. కోడ్ అస్థిపంజరాన్ని కూడా అందించండి.
3) న్యాయమైన నియంత్రణ:
విభిన్న సమూహాలకు (ఉదా. వయస్సు బ్యాండ్, ప్రాంతం) నా మోడల్ పనితీరును సరిపోల్చే కోడ్ను వ్రాయండి: ప్రతి సమూహానికి రీకాల్/ఖచ్చితమైన మరియు సానుకూల నిర్ణయం రేటు. సమూహాల మధ్య గణనీయమైన వ్యత్యాసం ఉంటే హెచ్చరిస్తుంది. కారణ/రాజకీయ వివరణలు చేయడం; నాకు తేడాలు చూపించండి మరియు నేను నిర్ణయాన్ని పరిశీలిస్తాను.
4) గోప్యత ముందస్తు తనిఖీ:
AI సాధనానికి డేటాను అందించే ముందు, తనిఖీ చేయండి: దిగువ కాలమ్ జాబితాలో వ్యక్తిగత/గుర్తింపు డేటా (పేరు, ఇమెయిల్, ID, ఫోన్, చిరునామా, IP) ఉందా? అలా అయితే, ఏవి తీసివేయబడాలి లేదా అజ్ఞాతం చేయాలి అని జాబితా చేయండి. నిలువు వరుసలు: [జాబితా]. ఉద్దేశ్యం: అనామక స్కీమాను మాత్రమే భాగస్వామ్యం చేయడం.
బలహీనమైన ప్రాంప్ట్ / బలమైన ప్రాంప్ట్
బలహీనమైన ప్రాంప్ట్:
నా మోడల్ సిద్ధంగా ఉంది, ప్రత్యక్ష ప్రసారం చేయి.
విస్తరణ ఒక్క అడుగు కాదు; పర్యవేక్షణ, రోల్బ్యాక్, ఫెయిర్నెస్ మరియు గోప్యతా నియంత్రణ లేకుండా ప్రత్యక్ష ప్రసారం చేయడం విపత్తు కోసం నిశ్శబ్ద ఆహ్వానం.
శక్తివంతమైన ప్రాంప్ట్:
మీ పాత్ర: బాధ్యతగల MLOps కన్సల్టెంట్. నా మోడల్ శిక్షణ పొందింది, ప్రత్యక్ష ప్రసారం చేయడానికి ముందు నాకు పూర్తి తయారీ కావాలి. రూపొందించండి: (1) ప్రీ-డిప్లాయ్మెంట్ చెక్లిస్ట్, (2) డ్రిఫ్ట్ మానిటరింగ్ ప్లాన్, (3) గ్రూప్ ఆధారిత ఫెయిర్నెస్ చెక్ కోడ్, (4) గోప్యతా తనిఖీ (వ్యక్తిగత డేటా ఉందా). అధిక-ప్రభావ నిర్ణయాలలో మానవ సమ్మతిని ఎలా రక్షించాలో కూడా సూచించండి. తుది నిర్ణయాలు నావే.
ఇక్కడ పంపిణీ, పర్యవేక్షణ, సరసత మరియు గోప్యత ఒకే బాధ్యతాయుతమైన ప్రక్రియగా పరిగణించబడతాయి.
సాధారణ తప్పులు
- పర్యవేక్షణను సెటప్ చేయకుండా మోడల్ని అమలు చేయడం. మోడల్ నిశ్శబ్దంగా జారిపోతుంది మరియు వక్రీకరిస్తుంది; ఇది గమనించడానికి నెలలు పట్టవచ్చు.
- న్యాయ తనిఖీని దాటవేయడం. అధిక-విశ్వసనీయ నమూనా సమూహానికి క్రమపద్ధతిలో ప్రతికూలతను కలిగిస్తుంది.
- వివరించలేని బ్లాక్ బాక్స్ నిర్ణయం తీసుకోవడం. అధిక-ప్రభావ నిర్ణయాలు తప్పనిసరిగా వివరించదగినవిగా ఉండాలి; "మోడల్ చెప్పింది" సరిపోదు.
- AI సాధనాన్ని తెరవడానికి నిజమైన వ్యక్తిగత డేటాను అందించడం. KVKK/GDPR ఉల్లంఘన; రేఖాచిత్రం మరియు అనామక ఉదాహరణ సరిపోతుంది.
- నిర్ణయాన్ని మోడల్కు అప్పగించడం. బాధ్యత ఎల్లప్పుడూ ఒక వ్యక్తిపై ఉంటుంది; అధిక ప్రభావ మానవ నిఘా నిర్వహించబడుతుంది.
చిట్కా: మీరు ప్రతి మోడల్తో ప్రత్యక్ష ప్రసారం చేయడానికి ముందు, బిగ్గరగా ఒక ప్రశ్న అడగండి: "ఈ మోడల్ రేపు నిశ్శబ్దంగా విచ్ఛిన్నమైతే లేదా సమూహానికి అన్యాయంగా జరిమానా విధించినట్లయితే, నేను దానిని ఎలా గమనించి వెనక్కి తిప్పగలను?" ఈ ప్రశ్నకు మీకు స్పష్టమైన సమాధానం లేకుంటే, మోడల్ ఇంకా ఉత్పత్తికి సిద్ధంగా లేదు.
సారాంశంలో
మోడల్ యొక్క ఉద్యోగం అధిక స్కోర్తో ముగియదు, కానీ ఉత్పత్తిలో విశ్వసనీయంగా మరియు బాధ్యతాయుతంగా పని చేయడంతో. MLOps అనేది ప్రత్యక్ష ప్రసారానికి వెళ్లడం, డ్రిఫ్ట్ కోసం పర్యవేక్షించడం, తిరిగి శిక్షణ ఇవ్వడం మరియు మోడల్ను వెనక్కి తిప్పడం వంటి క్రమశిక్షణ; ట్రాకింగ్ లేకుండా విస్తరణ నిశ్శబ్దంగా కుప్పకూలింది. నైతికతకు నమూనా యొక్క సరసత, పారదర్శకత మరియు జవాబుదారీతనం అవసరం; గణాంక ఖచ్చితత్వం నైతిక ఆమోదయోగ్యతకు ప్రత్యామ్నాయం కాదు. గోప్యత అంటే KVKK/GDPR సూత్రాలతో వ్యక్తిగత డేటాను రక్షించడం మరియు ఓపెన్ టూల్స్ నుండి నిజమైన డేటాను దూరంగా ఉంచడం. ఈ నిర్ణయాలన్నీ సాంకేతికమైనవి కావు కానీ బాధ్యత నిర్ణయాలు మరియు ఎల్లప్పుడూ మానవునికి చెందినవి.
అప్లికేషన్ టాస్క్
మీరు రూపొందించిన (లేదా ఊహాజనిత) మోడల్ను ఉత్పత్తిలో ఉంచబోతున్నట్లుగా ఆలోచించండి మరియు నాలుగు జాబితాలను పూరించండి: (1) ముందస్తు విస్తరణ చెక్లిస్ట్, (2) మీరు ట్రాక్ చేసే డ్రిఫ్ట్ మెట్రిక్లు, (3) గ్రూప్ ఆధారిత ఫెయిర్నెస్ కంట్రోల్ ప్లాన్, (4) గోప్యతా నియంత్రణ. అప్పుడు ప్రశ్నకు ఖచ్చితమైన సమాధానం రాయండి "ఇది రేపు నిశ్శబ్దంగా విచ్ఛిన్నమైతే మరియు దానిని తిరిగి పొందినట్లయితే నేను ఎలా గమనించగలను?"
చెక్లిస్ట్
- [ ] నేను మానిటరింగ్ (స్లిప్ అలర్ట్) మరియు రోల్బ్యాక్ ప్లాన్తో మోడల్ని అమలు చేస్తున్నానా?
- [ ] నేను వివిధ సమూహాల కోసం సరసత/పనితీరు అంతరాన్ని తనిఖీ చేశానా?
- [ ] నేను అధిక-ప్రభావ నిర్ణయాలపై హ్యూమన్-ఇన్-ది-లూప్ని నిర్వహించానా?
- [ ] నేను KVKK/GDPR సూత్రాలతో వ్యక్తిగత డేటాను రక్షించాను మరియు వాటిని ఓపెన్ టూల్స్ నుండి దూరంగా ఉంచానా?
- [ ] నేను మోడల్పై కాకుండా మానవుడిపై అంతిమ బాధ్యతను ఉంచానా?
మాడ్యూల్ పరీక్ష
1. ఒక డేటా సైంటిస్ట్ ఆర్టిఫిషియల్ ఇంటెలిజెన్స్ని అడిగాడు, "ఈ డేటాపై యాదృచ్ఛిక అటవీ ఎంత ఖచ్చితమైనది?" మోడల్కు అస్సలు శిక్షణ ఇవ్వకుండా, నేరుగా "89%" సమాధానాన్ని ప్రెజెంటేషన్లో ఉంచుతుంది. ఈ విధానంలో ప్రాథమిక తప్పు ఏమిటి?
- ఎ) ఆర్టిఫిషియల్ ఇంటెలిజెన్స్కు డేటా మరియు మోడల్స్ ఇవ్వకుండా కొలమానాల కోసం వేచి ఉండటం; అది ఉత్పత్తి చేసే సంఖ్య నకిలీదని మరియు నిజమైన మెట్రిక్ శిక్షణ మరియు పరీక్ష ద్వారా మాత్రమే కనుగొనబడుతుందని విస్మరించడం ✔
- బి) యాదృచ్ఛిక అటవీ బదులు తప్పనిసరిగా లాజిస్టిక్ రిగ్రెషన్ను ఉపయోగించాలి
- సి) ఖచ్చితత్వం ఎల్లప్పుడూ 90% కంటే ఎక్కువగా ఉండాలి.
- D) ప్రదర్శనలో కొలమానాలను చేర్చడం ఖచ్చితంగా నిషేధించబడింది
వివరణ: మోడల్ మరియు డేటాను యాక్సెస్ చేయకుండా కృత్రిమ మేధస్సు మెట్రిక్ను ఉత్పత్తి చేయదు; అతను ఇచ్చే సంఖ్య భ్రాంతి (కల్పితమైనది). మోడల్ వాస్తవానికి శిక్షణ పొందిన మరియు పరీక్షించబడిన తర్వాత మాత్రమే డేటా సైంటిస్ట్ యొక్క స్వంత గణన ద్వారా మెట్రిక్ పొందబడుతుంది. ధృవీకరించని అవుట్పుట్ సంతకం చేయని నివేదిక లాంటిది.
2. చర్న్ సూచన కోసం డేటాను సేకరిస్తున్నప్పుడు 'ఖాతా మూసివేతకు కారణం' కాలమ్ చేర్చబడుతుంది; కస్టమర్ వెళ్లిన తర్వాత మాత్రమే ఈ కాలమ్ నింపబడుతుంది. మోడల్ టెస్ట్ సెట్లో 97% ఇస్తుంది, కానీ ఉత్పత్తిలో పని చేయదు. ఈ పరిస్థితికి పేరు మరియు కారణం ఏమిటి?
- ఎ) ఓవర్ లెర్నింగ్; మోడల్ చాలా క్లిష్టమైనది
- బి) డేటా లీక్; ✔ అంచనా సమయంలో అందుబాటులో లేని సమాచారాన్ని ఉపయోగించడం, కానీ లక్ష్యం యొక్క ఫలితం, లక్షణంగా
- సి) తగినంత అభ్యాసం లేదు; మోడల్ చాలా సులభం
- డి) ఎంపిక పక్షపాతం; చిన్న నమూనా పరిమాణం
వివరణ: ఇది క్లాసిక్ డేటా లీక్: 'క్లోజింగ్ రీజన్' అనేది లక్ష్యం యొక్క ఫలితం మరియు అంచనా సమయంలో ఇప్పటికీ ఖాళీగా ఉంది. మోడల్ ఈ భవిష్యత్ పరిజ్ఞానంతో ట్రిక్ చేస్తుంది, ఇది టెస్ట్ సెట్లో అద్భుతంగా కనిపిస్తుంది కానీ ఆ నిలువు వరుస ఖాళీగా ఉన్నందున ఉత్పత్తిలో క్రాష్ అవుతుంది. ప్రతి కాలమ్కి 'ప్రిడిక్షన్ సమయంలో నా దగ్గర అది ఉందా' అనే ప్రశ్న అడగాలి.
3. ఒక విశ్లేషకుడు రాబడి కాలమ్లో తప్పిపోయిన విలువలను సగటుతో పూరిస్తాడు; కానీ తప్పిపోయిన వ్యక్తులు వాస్తవానికి ఆదాయాన్ని ప్రకటించని తక్కువ-ఆదాయ విభాగానికి చెందినవారు (సిస్టమాటిక్ మిస్సింగ్). ఈ పూరకం ఎందుకు తప్పు?
- ఎ) మధ్యస్థం కంటే సగటు ఎల్లప్పుడూ ఎక్కువగా ఉంటుంది, కనుక ఇది తప్పు
- బి) తప్పిపోయిన విలువలను ఎప్పుడూ పూరించకూడదు, అవి ఎల్లప్పుడూ తొలగించబడాలి
- సి) క్రమబద్ధమైన అంతరాన్ని సగటుతో పూరించడం ఆ సమూహాన్ని కృత్రిమంగా సూచించడం ద్వారా డేటాను వక్రీకరిస్తుంది; ‘ఎందుకు ఖాళీగా ఉంది?’ అనే ప్రశ్న అడగకుండానే ఫిల్లింగ్ చేశారు. ✔
- D) సగటును గణించడం పనితీరు సమస్యను సృష్టిస్తుంది ఎందుకంటే ఇది చాలా నెమ్మదిగా ఉంటుంది
వివరణ: లోపం యొక్క కారణం పరిష్కారాన్ని నిర్ణయిస్తుంది. సిస్టమాటిక్ మిస్సింగ్ (ఒక నిర్దిష్ట సమూహంలో కేంద్రీకృతమై ఉన్న ఖాళీ) సగటుతో నిండినప్పుడు, ఆ సమూహం కృత్రిమంగా 'సగటు ఆదాయం'గా మారుతుంది మరియు డేటా వక్రీకరించబడుతుంది. పూరించడానికి ముందు, 'ఎందుకు ఖాళీగా ఉంది' అనే ప్రశ్న అడగాలి; క్రమబద్ధమైన/ముఖ్యమైన తప్పిపోయిన సగటును పూరించకూడదు.
4. ఒక బృందం 'యాడ్ స్పెండ్' మరియు 'సేల్స్' మధ్య 0.78 సహసంబంధాన్ని కనుగొంటుంది మరియు బడ్జెట్ను రెట్టింపు చేస్తుంది; అయితే, వాస్తవానికి రెండింటిని ప్రేరేపించేది కాలానుగుణ ప్రచారాలు. గణాంకాలలోని ఏ సూత్రం ఈ లోపాన్ని వివరిస్తుంది?
- ఎ) సహసంబంధం కారణం కాదు; దాచిన మూడవ వేరియబుల్ రెండు వేరియబుల్లను ప్రభావితం చేయవచ్చు ✔
- బి) 0.78 యొక్క సహసంబంధం చాలా తక్కువగా ఉన్నందున, సంబంధాన్ని విస్మరించాలి
- సి) సహసంబంధం ఎల్లప్పుడూ కారణాన్ని రుజువు చేస్తుంది, జట్టు దానిని సరిగ్గా అర్థం చేసుకుంది
- D) ప్రకటనలు మరియు విక్రయాల మధ్య సహసంబంధాన్ని గణితశాస్త్రంగా లెక్కించలేము.
వివరణ: సహసంబంధం కారణం కాదు. దాచిన మూడవ వేరియబుల్ (ఇక్కడ కాలానుగుణ ప్రచారాలు) రెండింటినీ ప్రభావితం చేసే కారణంగా రెండు వేరియబుల్స్ కలిసి పని చేయవచ్చు. ఒకదానికొకటి కారణమవుతుందనే నిర్ధారణ ప్రయోగం మరియు క్షేత్ర పరిజ్ఞానం ద్వారా మాత్రమే స్థాపించబడుతుంది; సహసంబంధాల సంఖ్య మాత్రమే కారణానికి రుజువు కాదు.
5. మోసాన్ని గుర్తించే మోడల్ 99.2% ఖచ్చితత్వాన్ని చూపుతుంది మరియు బృందం జరుపుకుంటుంది; అయితే, డేటాలో నకిలీ లావాదేవీ రేటు 0.8% మాత్రమే మరియు మోడల్ రీకాల్ 6%. ఈ పట్టిక ఏమి చూపుతుంది?
- ఎ) ఖచ్చితత్వం 99% కంటే ఎక్కువ ఉన్నందున మోడల్ ఖచ్చితంగా ఉంది
- బి) అసమతుల్య డేటాతో ఖచ్చితత్వం తప్పుదారి పట్టిస్తుంది; మోడల్ దాదాపు అన్ని నకిలీలను మిస్ చేస్తుంది (తక్కువ రీకాల్), తగిన మెట్రిక్ చూడాలి ✔
- సి) మోడల్ రీకాల్ ఎక్కువగా ఉన్నందున ఎటువంటి సమస్య లేదు
- డి) నకిలీ రేటు తక్కువగా ఉన్నందున మోడల్ను నిర్మించాల్సిన అవసరం లేదు
వివరణ: అసమతుల్య డేటాలో 'ఖచ్చితత్వం' తప్పుదారి పట్టిస్తోంది. మోడల్ దాదాపు ప్రతి లావాదేవీని 'క్లీన్' అని పిలిచినప్పుడు, అది అధిక ఖచ్చితత్వాన్ని పొందుతుంది ఎందుకంటే నకిలీలు చాలా తక్కువగా ఉంటాయి, అయితే ఇది నకిలీలను పట్టుకోవడంలో విఫలమవుతుంది, ఇది దాని ప్రధాన ఉద్దేశ్యం (రీకాల్ 6%). అందువల్ల, అసమతుల్య సమస్యలలో, దృష్టి ఖచ్చితత్వంపై కాదు, రీకాల్/ఖచ్చితత్వం వంటి ఉద్యోగ ప్రయోజనం కోసం సరిపోయే గందరగోళ మాతృక మరియు కొలమానాలపై దృష్టి పెడుతుంది.
6. డిమాండ్ అంచనా ప్రాజెక్ట్లో, సమయం-ఆధారిత డేటా యాదృచ్ఛికంగా శిక్షణ/పరీక్షగా విభజించబడింది. మోడల్ 93% ఖచ్చితత్వాన్ని ఇస్తుంది కానీ ఉత్పత్తిలో క్రాష్ అవుతుంది. సరైన విభజన విధానం ఎలా ఉండాలి?
- ఎ) పరీక్ష సెట్ను విస్తరించడం, ఉదా. విభజన 50%/50%
- బి) మరింత క్లిష్టమైన నమూనాను ఉపయోగించడం
- సి) విభజనను పూర్తిగా తీసివేసి, మొత్తం డేటాతో శిక్షణ ఇవ్వండి
- D) కాలక్రమానుసార విభజన: పాత కాలంతో శిక్షణ మరియు కొత్త కాలంతో పరీక్షించడం, తద్వారా మోడల్ భవిష్యత్తును చూడకుండా నిరోధించడం ✔
వివరణ: సమయ శ్రేణి డేటాలో యాదృచ్ఛిక విభజన జరిగితే, మోడల్ భవిష్యత్తును చూస్తుంది మరియు శిక్షణలో గతాన్ని అంచనా వేస్తుంది; ఇది ఒక లీక్ మరియు వాస్తవానికి లేని విజయాన్ని ఉత్పత్తి చేస్తుంది. సరైన విధానం కాలక్రమానుసార విభజన: పాత కాలంతో శిక్షణ మరియు కొత్త కాలంతో పరీక్షించడం, ఉత్పత్తిలో వాస్తవ పరిస్థితిని అనుకరించడం (గతం నుండి భవిష్యత్తు వరకు అంచనా వేయడం).
7. ఫీచర్ ఇంజనీరింగ్లో స్కేలింగ్ (స్టాండర్డ్స్కేలర్) పారామితులను ఏ డేటా నుండి లెక్కించాలి మరియు వాటిని ఎలా వర్తింపజేయాలి?
- ఎ) ఇది మరింత ఖచ్చితమైనదిగా ఉండేలా మొత్తం డేటా (శిక్షణ + పరీక్ష కలిపి) నుండి లెక్కించబడాలి
- బి) ఇది ప్రతి అడ్డు వరుసకు, ఆ అడ్డు వరుస యొక్క స్వంత విలువ నుండి విడిగా లెక్కించబడాలి
- సి) పరీక్ష డేటా నుండి మాత్రమే లెక్కించబడాలి
- D) ఇది శిక్షణ డేటా నుండి మాత్రమే లెక్కించబడాలి, అప్పుడు అదే పారామితులను పరీక్ష డేటాకు వర్తింపజేయాలి; లేకుంటే అది లీక్ అవుతుంది ✔
వివరణ: స్కేలింగ్, ఎన్కోడింగ్ మరియు పాడింగ్ వంటి అన్ని పరివర్తనల (సగటు, ప్రామాణిక విచలనం మొదలైనవి) పారామితులు శిక్షణ డేటా నుండి మాత్రమే నేర్చుకోవాలి, ఆపై అదే పరీక్ష డేటాకు వర్తింపజేయాలి. పరీక్ష డేటాను పరిగణనలోకి తీసుకోవడం వల్ల పరీక్ష సమాచారం శిక్షణకు ఆటంకం కలిగిస్తుంది, అంటే లీకేజీ, మరియు మోడల్ దాని కంటే మెరుగ్గా కనిపించేలా చేస్తుంది. పైప్లైన్ ఉపయోగించడం దీన్ని నిర్ధారిస్తుంది.
8. ఒక మోడల్ శిక్షణ సెట్పై 98% ఖచ్చితత్వాన్ని మరియు పరీక్ష సెట్లో 72% ఖచ్చితత్వాన్ని ఇస్తుంది. ఈ లక్షణం ఏమి సూచిస్తుంది మరియు ఏమి చేయాలి?
- ఎ) తగినంత అభ్యాసం లేదు; మోడల్ మరింత క్లిష్టంగా ఉండాలి
- బి) డేటా లీక్; పరీక్ష సెట్ మార్చాలి
- సి) ఓవర్ ఫిట్టింగ్; మోడల్ను సరళీకృతం చేయాలి, క్రమబద్ధీకరణ మరియు క్రాస్ ధ్రువీకరణ వర్తింపజేయాలి ✔
- డి) సాధారణ పరిస్థితి; ఎడ్యుకేషన్ స్కోర్ ఎల్లప్పుడూ ఎక్కువగానే ఉంటుంది, జాగ్రత్తలు అనవసరం
వివరణ: శిక్షణలో చాలా ఎక్కువ స్కోర్ మరియు టెస్టింగ్లో గణనీయంగా తక్కువ స్కోర్ అనేది ఓవర్ ఫిట్టింగ్ యొక్క క్లాసిక్ లక్షణం: మోడల్ నిజమైన నమూనా కంటే శిక్షణ డేటా యొక్క శబ్దాన్ని గుర్తుపెట్టుకుంది. పరిష్కారాలలో మోడల్ను సరళీకృతం చేయడం, మరింత డేటా, క్రమబద్ధీకరణ మరియు క్రాస్ ధ్రువీకరణతో రాష్ట్రాన్ని ధృవీకరించడం వంటివి ఉన్నాయి. విద్య స్కోర్పై మాత్రమే ఆధారపడటం ఈ ఆపదను దాచిపెడుతుంది.
9. నిర్వహణ ప్రదర్శనలో, 1,000 నుండి 1,020 వరకు అమ్మకాలు పెరిగే బార్ చార్ట్ యొక్క y-యాక్సిస్ పెరుగుదల భారీగా కనిపించేలా చేయడానికి 980 వద్ద ప్రారంభించబడింది. వాస్తవ పెరుగుదల 2%. ఇది నైతిక సమస్య ఎందుకు?
- A) కత్తిరించబడిన y-అక్షం దృశ్యమానంగా ఒక చిన్న వ్యత్యాసాన్ని అతిశయోక్తి చేస్తుంది మరియు వీక్షకుడిని తప్పుదారి పట్టిస్తుంది; సరసత కోసం, కంపారిజన్ బార్లలోని అక్షం 0 ✔ నుండి ప్రారంభం కావాలి
- బి) బార్ చార్ట్లు అమ్మకాల డేటా కోసం ఎప్పటికీ ఉపయోగించబడవు
- సి) సమస్య లేదు; చార్ట్ను ఆకట్టుకునేలా చేయడం ఎల్లప్పుడూ మంచిది
- D) Y-యాక్సిస్ ఎల్లప్పుడూ డేటా యొక్క అతిపెద్ద విలువ నుండి ప్రారంభం కావాలి
వివరణ: తులనాత్మక ప్రయోజనాల కోసం బార్ చార్ట్లలో, y-యాక్సిస్ సాధారణంగా 0 వద్ద ప్రారంభం కావాలి. అక్షాన్ని కత్తిరించడం మరియు 980తో ప్రారంభించడం వలన చిన్న 2% వ్యత్యాసం దృశ్యమానంగా భారీగా అనిపించేలా చేస్తుంది మరియు వీక్షకులను తప్పుదారి పట్టిస్తుంది. డేటా నిపుణుడి యొక్క నైతిక బాధ్యత ఏమిటంటే డేటాను అతిగా అంచనా వేయని లేదా తక్కువ అంచనా వేయని నిజాయితీ గ్రాఫ్లను గీయడం.
10. ఉత్పత్తి పట్టికతో ఆర్డర్లను చేరిన తర్వాత విశ్లేషకుడు మొత్తం టర్నోవర్ను 3 సార్లు కనుగొంటారు; లైన్ల సంఖ్య 240 వేల నుండి 690 వేలకు పెరిగింది. ఈ నిశ్శబ్ద దోషాన్ని నివారించడానికి ఏమి చేయాలి?
- ఎ) మొత్తం టర్నోవర్ను 3తో భాగించండి
- B) ఎల్లప్పుడూ JOINకి బదులుగా ప్రత్యేక ప్రశ్నలను ఉపయోగించండి
- సి) ఉత్పత్తి పట్టికను పూర్తిగా తొలగించడం
- D) విలీనం/JOIN తర్వాత వరుసల సంఖ్యను తనిఖీ చేయడం మరియు అవి సరైన కీ ద్వారా చేరాయని ధృవీకరించడం; ప్రతిరూపణను ముందుగానే పట్టుకోవడం ✔
వివరణ: ఉత్పత్తి పట్టికలో ప్రతి ఉత్పత్తికి బహుళ వరుసలు (ఉదాహరణకు వేర్వేరు రంగులు) ఉన్నప్పుడు, తప్పు కీ ద్వారా JOIN చేయడం వలన ప్రతి ఆర్డర్ డూప్లికేట్ అవుతుంది మరియు మొత్తాలను పెంచుతుంది. కోడ్ లోపాలు లేకుండా నడుస్తుంది కానీ ఫలితం తప్పు. దీన్ని నివారించడానికి మార్గం ప్రతి విలీనం/JOIN తర్వాత వరుసల సంఖ్యను తనిఖీ చేయడం మరియు సరైన కీతో విలీనం చేయడం.
11. హైరింగ్ స్క్రీనింగ్ మోడల్ చారిత్రక డేటాలో లింగ అసమతుల్యత గురించి మరియు క్రమపద్ధతిలో మహిళా అభ్యర్థుల స్కోర్ల క్రింద నేర్చుకుంటుంది, అయితే దాని మొత్తం ఖచ్చితత్వం ఎక్కువగా ఉంటుంది. దీని అర్థం ఏమిటి?
- ఎ) మోడల్ అధిక ఖచ్చితత్వాన్ని కలిగి ఉన్నందున ఎటువంటి సమస్య లేదు
- B) గణాంక ఖచ్చితత్వం నైతిక ఆమోదానికి ప్రత్యామ్నాయం కాదు; మోడల్ గత వివక్ష గురించి నేర్చుకుంది, సమూహం ఆధారిత న్యాయమైన తనిఖీ అవసరం ✔
- సి) మోడల్ యొక్క ఖచ్చితత్వాన్ని మరింత పెంచడం సమస్యను పరిష్కరిస్తుంది
- డి) ఫెయిర్నెస్ అనేది డేటా సైన్స్ పరిధికి వెలుపల ఉంది
వివరణ: ఒక మోడల్ గణాంకపరంగా సరైనది అయినప్పటికీ, అది నైతికంగా ఆమోదయోగ్యం కాదు. మోడల్ గత డేటాలోని అన్యాయాన్ని తెలుసుకుంటుంది మరియు వివక్షను ఆటోమేట్ చేస్తుంది. అధిక సమగ్రత న్యాయానికి ప్రత్యామ్నాయం కాదు; అధిక-ప్రభావ నమూనాలలో, వివిధ సమూహాల పనితీరు/నిర్ణయ వ్యత్యాసాన్ని కొలిచే ఫెయిర్నెస్ నియంత్రణ చాలా అవసరం మరియు అంతిమ బాధ్యత మానవునిపై ఉంటుంది.
12. ఒక ఉద్యోగి నిజమైన కస్టమర్ ఇమెయిల్లు మరియు కొనుగోలు చరిత్రను కలిగి ఉన్న ఫైల్ను పబ్లిక్ AI సాధనంలోకి అప్లోడ్ చేస్తాడు మరియు 'విభాగాలను సంగ్రహించండి' అని చెప్పాడు. ఇది ఎందుకు తీవ్రమైన తప్పు మరియు సరైన మార్గం ఏమిటి?
- ఎ) సమస్య లేదు; AI సాధనాలు డేటాను ఎప్పుడూ నిల్వ చేయవు
- బి) ఫైల్ చాలా పెద్దదిగా ఉండటం లోపం; తగ్గించి వుండాలి
- సి) ఓపెన్ టూల్కు నిజమైన వ్యక్తిగత డేటాను అందించడం KVKK/GDPR ఉల్లంఘన; గుర్తింపు ఫీల్డ్లు తీసివేయబడి ఉండాలి మరియు అనామక స్కీమా/ఆస్తి మాత్రమే భాగస్వామ్యం చేయబడాలి ✔
- డి) కేవలం Excelకు బదులుగా CSVని ఉపయోగించాలి
వివరణ: పబ్లిక్గా అందుబాటులో ఉన్న కృత్రిమ మేధస్సు సాధనానికి నిజమైన వ్యక్తిగత డేటా (ఇ-మెయిల్, పేరు మొదలైనవి) ఇచ్చినప్పుడు, KVKK / GDPR పరిధిలో గోప్యతా ఉల్లంఘన జరుగుతుంది; డేటా సంస్థను వదిలివేస్తుంది. చాలా సమయం, విశ్లేషణ కోసం రేఖాచిత్రం మరియు అనామక/సింథటిక్ నమూనా సరిపోతాయి. గుర్తింపు ఫీల్డ్లను తీసివేయడం మరియు అనామక లక్షణాలను మాత్రమే భాగస్వామ్యం చేయడం సరైన మార్గం.
13. ఒక సిఫార్సు మోడల్ ఉత్పత్తిలో ఉంచబడింది కానీ ట్రాకింగ్ స్థాపించబడలేదు; 4 నెలల తర్వాత ఉత్పత్తి కేటలాగ్ మారినప్పుడు, మోడల్ పాత ఉత్పత్తులను సిఫార్సు చేస్తూనే ఉంటుంది మరియు మార్పిడి రేటు నిశ్శబ్దంగా 30% తగ్గుతుంది. ఈ దృగ్విషయం పేరు ఏమిటి?
- ఎ) ఓవర్ లెర్నింగ్; మోడల్ శిక్షణ సెట్ను గుర్తుంచుకుంటుంది
- బి) మోడల్ డ్రిఫ్ట్; ప్రపంచం మారుతున్నప్పుడు, మోడల్ నిశ్శబ్దంగా వాడుకలో లేదు, పర్యవేక్షణ ఏర్పాటు చేయనందున గుర్తించబడదు ✔
- సి) ఎంపిక పక్షపాతం; నమూనా పక్షపాతం
- D) డేటా కనిష్టీకరణ ఉల్లంఘన
వివరణ: ఇది మోడల్ డ్రిఫ్ట్ (మోడల్/డేటా డ్రిఫ్ట్): ప్రపంచం మారినప్పుడు (కేటలాగ్, ప్రవర్తన, సీజన్) మోడల్ శిక్షణ పొందిన పరిస్థితులు మారినప్పుడు మరియు మోడల్ నిశ్శబ్దంగా విచ్ఛిన్నమవుతుంది. ఉత్పత్తిలో పెట్టబడిన మోడల్ దానికదే చెడిపోతుంది; ఇది 'ఎప్పుడు' అనే విషయం. పర్యవేక్షణ లేకుండా విస్తరణ (ట్రాకింగ్ ఇన్పుట్ మరియు పనితీరు) క్షీణతను గుర్తించడం అసాధ్యం.
14. ఒక సింగిల్ ట్రైనింగ్/టెస్ట్ స్ప్లిట్లో 88% ఖచ్చితత్వాన్ని పొందే మోడల్ 88%, 71%, 83%, 64%, 79% యొక్క 5 రెట్లు క్రాస్ ధ్రువీకరణ స్కోర్లను కలిగి ఉంటుంది. ఇది ఏమి సూచిస్తుంది మరియు క్రాస్ ధ్రువీకరణ ఎందుకు ముఖ్యమైనది?
- ఎ) మోడల్ స్థిరంగా ఉంటుంది; 88% నిజమైన పనితీరు
- బి) క్రాస్ ధ్రువీకరణ అనవసరం; ఒక కంపార్ట్మెంట్ సరిపోతుంది
- సి) స్కోర్ల యొక్క పెద్ద అస్థిరత మోడల్ అస్థిరంగా ఉందని సూచిస్తుంది; బహుళ బిన్ల సగటు మరియు పంపిణీపై క్రాస్-వాలిడేషన్ బేస్ పనితీరు, ఒక్క లక్కీ బిన్ కాదు ✔
- డి) అత్యధిక స్కోర్ (88%)ని నివేదించడం ఉత్తమం
వివరణ: ఒకే కంపార్ట్మెంట్ అదృష్టం లేదా దురదృష్టకరం; 88% ఆ సులభమైన విభజన ఫలితం. క్రాస్-ధృవీకరణ డేటాను అనేకసార్లు విభజిస్తుంది, సగటు (ఇక్కడ ~77%) పనితీరుపై ఆధారపడి ఉంటుంది మరియు స్కోర్ల అస్థిరతను చూపుతుంది. ఇక్కడ అధిక అస్థిరత మోడల్ అస్థిరంగా ఉందని సూచిస్తుంది; ఒకే కంపార్ట్మెంట్పై ఆధారపడటం తప్పుదారి పట్టించేది.