యూనిట్లు
1. డేటా సైన్స్ మరియు అనలిటిక్స్‌లో ఆర్టిఫిషియల్ ఇంటెలిజెన్స్ పరిచయం: వర్క్‌ఫ్లో, పాత్రలు, సరిహద్దులు, ధ్రువీకరణ మరియు నీతి 2. డేటా సేకరణ మరియు మూల అవగాహన: స్కీమా, నమూనా, నాణ్యత మరియు లీక్ అవేర్‌నెస్ 3. డేటా క్లీనింగ్ మరియు ప్రీప్రాసెసింగ్: మిస్సింగ్ వాల్యూ, అవుట్‌లియర్ మరియు టైప్ కన్వర్షన్ 4. అన్వేషణాత్మక డేటా విశ్లేషణ (EDA): పంపిణీలు, సంబంధాలు మరియు ప్రారంభ అంతర్దృష్టులు 5. ఫీచర్ ఇంజనీరింగ్: వేరియంట్‌లను రూపొందించడం, కోడింగ్, స్కేలింగ్ మరియు లీకేజీని నివారించడం 6. మోడల్ బిల్డింగ్: సమస్య నిర్వచనం, అల్గోరిథం ఎంపిక మరియు శిక్షణ/టెస్ట్ స్ప్లిట్ 7. మోడల్ మూల్యాంకనం: కొలమానాలు, క్రాస్ ధ్రువీకరణ మరియు విపరీతమైన అభ్యాసం 8. విజువలైజేషన్ మరియు స్టోరీ టెల్లింగ్: ఖచ్చితమైన గ్రాఫిక్స్, హానెస్ట్ గ్రాఫిక్స్ 9. కోడ్ జనరేషన్: పైథాన్ (పాండాలు) మరియు SQLతో AI-సహాయక విశ్లేషణ 10. డేటా లీకేజ్ మరియు పునరుత్పత్తి: నిశ్శబ్ద విపత్తులు మరియు క్రమశిక్షణ 11. MLOps ఫౌండేషన్, ఎథిక్స్, గోప్యత మరియు బాధ్యతాయుతమైన విశ్లేషణలు
యూనిట్ 11 / 11

MLOps ఫౌండేషన్, ఎథిక్స్, గోప్యత మరియు బాధ్యతాయుతమైన విశ్లేషణలు

లాభాలు:

  • MLOps దశలు (విడుదల, విస్తరణ, పర్యవేక్షణ, తిరిగి శిక్షణ, రోల్‌బ్యాక్) మరియు మోడల్ డ్రిఫ్ట్‌ను అర్థం చేసుకోగల సామర్థ్యం మరియు పర్యవేక్షించబడిన విస్తరణను ప్లాన్ చేయడం
  • మోడల్ ఫెయిర్‌నెస్, పారదర్శకత మరియు జవాబుదారీతనం యొక్క సూత్రాలను వర్తింపజేయగల సామర్థ్యం మరియు నైతిక ఆమోదయోగ్యం నుండి గణాంక ఖచ్చితత్వాన్ని వేరు చేయడం
  • KVKK/GDPR సూత్రాలతో వ్యక్తిగత డేటాను రక్షించగల సామర్థ్యం మరియు అధిక-ప్రభావ నిర్ణయాలలో మానవునికి తుది బాధ్యతను అప్పగించడం

మోడల్‌కు శిక్షణ ఇవ్వడం మరియు అధిక స్కోర్ పొందడం ముగింపు కాదు, మధ్యలో. మోడల్‌ను ఉత్పత్తిలో ఉంచి విశ్వసనీయంగా పనిచేసినప్పుడు నిజమైన విలువ వస్తుంది, కాలక్రమేణా క్షీణించకుండా పర్యవేక్షించబడుతుంది మరియు మొత్తం ప్రక్రియ నైతిక మరియు చట్టపరమైన సరిహద్దులలో నిర్వహించబడుతుంది. ఈ ముగింపు యూనిట్ మూడు అంశాలను మిళితం చేస్తుంది: MLOps (ప్రత్యక్షంగా వెళ్లే క్రమశిక్షణ, మోడల్‌లను పర్యవేక్షించడం మరియు నిర్వహించడం), నీతి (న్యాయం, పారదర్శకత, దుర్మార్గం లేనిది) మరియు గోప్యత (వ్యక్తిగత డేటాను రక్షించడం). AI ఈ ప్రాంతాల్లో కోడ్, చెక్‌లిస్ట్‌లు మరియు బ్లూప్రింట్‌లను ఉత్పత్తి చేస్తుంది; కానీ మోడల్ ప్రత్యక్ష ప్రసారం అవుతుందా, ఎవరు ప్రభావితం అవుతారు మరియు ఏ డేటాను ఉపయోగించవచ్చో మానవులు నిర్ణయిస్తారు. ఈ నిర్ణయాలు సాంకేతికమైనవి కావు, బాధ్యత నిర్ణయాలు.

MLOps: మోడల్ ఒక ఉత్పత్తి వలె జీవిస్తుంది

MLOps (మెషిన్ లెర్నింగ్ ఆపరేషన్స్ - ఉత్పత్తిలో మెషిన్ లెర్నింగ్ మోడల్‌లను అమలు చేయడం, పర్యవేక్షించడం మరియు నవీకరించడం) అనేది సాఫ్ట్‌వేర్ డెవలప్‌మెంట్‌లో డేటా సైన్స్‌కు DevOps యొక్క అనుసరణ. ప్రాథమిక ఆలోచన: మోడల్ అనేది ఒకసారి శిక్షణ పొందిన మరియు మరచిపోయిన ఫైల్ కాదు, కానీ స్థిరమైన నిర్వహణ అవసరమయ్యే జీవన ఉత్పత్తి. ప్రధాన దశలు:

1. సంస్కరణ: కోడ్ (Git), డేటా మరియు మోడల్ కలిసి వెర్షన్ చేయబడ్డాయి; ఏ డేటా మరియు కోడ్‌తో ఏ మోడల్ ఉత్పత్తి చేయబడిందో నమోదు చేయబడుతుంది.

2. విస్తరణ: మోడల్ API లేదా బ్యాచ్ జాబ్‌గా ప్రత్యక్ష ప్రసారం చేయబడుతుంది. ఇది సాధారణంగా చిన్న ప్రేక్షకులకు ముందుగా ఇవ్వబడుతుంది (నీడ/కానరీ పంపిణీ).

3. మానిటరింగ్: మోడల్ పనితీరు మరియు ఇన్‌పుట్ డేటా నిరంతరం పర్యవేక్షించబడతాయి.

4. రీట్రైనింగ్: పనితీరు తగ్గినప్పుడు, మోడల్ అప్‌డేట్ చేయబడిన డేటాతో మళ్లీ శిక్షణ పొందుతుంది.

నమూనా మార్పు: నిశ్శబ్ద వక్రీకరణ

ఉత్పత్తిలో అతిపెద్ద ప్రమాదం మోడల్ డ్రిఫ్ట్ (మోడల్ డ్రిఫ్ట్ / డేటా డ్రిఫ్ట్). ప్రపంచం మారుతుంది; మీరు మీ మోడల్‌కు శిక్షణనిచ్చిన పరిస్థితులు (కస్టమర్ ప్రవర్తన, ధరలు, సీజన్, చట్టం) కాలక్రమేణా మారతాయి మరియు మోడల్ కాలం చెల్లినదిగా మారడం ప్రారంభమవుతుంది. ఉదాహరణకు, మహమ్మారికి ముందు శిక్షణ పొందిన డిమాండ్ మోడల్ మహమ్మారి సమయంలో పూర్తిగా తప్పు. డ్రిఫ్ట్ రెండు రూపాల్లో జరుగుతుంది: డేటా డ్రిఫ్ట్ (ఇన్‌పుట్ డేటా మార్పుల పంపిణీ) మరియు కాన్సెప్ట్ డ్రిఫ్ట్ (ఇన్‌పుట్ మరియు టార్గెట్ మార్పుల మధ్య సంబంధం). వీటిని సంగ్రహించే మార్గం పర్యవేక్షణ: ఇన్‌పుట్ పంపిణీ, అంచనా పంపిణీ మరియు (వీలైతే) వాస్తవ ఫలితంతో పోలిస్తే పనితీరును నిరంతరం ట్రాక్ చేయండి.

హెచ్చరిక: ఉత్పత్తిలో ఉంచబడిన మోడల్ దాని స్వంతదానిపై చెడిపోతుంది; ఇది "ఉంటే" అనే విషయం కాదు, "ఎప్పుడు." పర్యవేక్షణను ఏర్పాటు చేయకుండా మోడళ్లను అమర్చడం అనేది కారును దాని ఇంజిన్‌ను ఎప్పుడూ నియంత్రించకుండా నడపడం లాంటిది; ఒక రోజు అది నిశ్శబ్దంగా కూర్చుంది మరియు మీరు గమనించలేరు.

MLOps మూలకం

ప్రయోజనం

నిర్లక్ష్యం చేస్తే

సంస్కరణ

ఏది ఉత్పత్తి అవుతుందో తెలుసుకోవడం

పునరుత్పత్తి చేయలేనిది, గుర్తించలేనిది

మానిటరింగ్

పొద్దున్నే స్లిప్ చూడడం

మోడల్ నిశ్శబ్దంగా విరిగిపోతుంది

తిరిగి శిక్షణ

తాజాగా ఉండండి

అంచనాలు పాతబడతాయి

రోల్‌బ్యాక్

చెడ్డ మోడల్‌కి తిరిగి వెళ్ళు

తప్పు మోడల్ ప్రత్యక్షంగా ఉంది

డాక్యుమెంటేషన్

పారదర్శకత, టర్నోవర్

సమాచారం ఒక వ్యక్తిలో చిక్కుకుపోతుంది

నీతి: మోడల్ నిర్ణయాలు ప్రజలను ప్రభావితం చేస్తాయి

ప్రజల జీవితాలను ప్రభావితం చేసే నిర్ణయాలలో డేటా నమూనాలు ఎక్కువగా ఉపయోగించబడుతున్నాయి: క్రెడిట్, నియామకం, బీమా, న్యాయం. ఈ శక్తితో బాధ్యత వస్తుంది. ప్రధాన నైతిక ప్రమాదాలు:

పక్షపాతం మరియు వివక్ష: మోడల్ చారిత్రక డేటాలో అన్యాయాలను నేర్చుకోగలదు మరియు శాశ్వతం చేయగలదు. ఒక నిర్దిష్ట సమూహానికి గతంలో తక్కువ క్రెడిట్ ఇవ్వబడి ఉంటే, మోడల్ ఇది "నియమం" అని ఊహిస్తుంది మరియు వివక్షను ఆటోమేట్ చేస్తుంది. అందుకే ఫెయిర్‌నెస్ అనాలిసిస్ — మోడల్ వివిధ సమూహాలకు (లింగం, వయస్సు, ప్రాంతం) ఒకే విధంగా పనిచేస్తుందో లేదో తనిఖీ చేయడం చాలా అవసరం.

పారదర్శకత మరియు వివరణ: మోడల్ ఒక వ్యక్తిని ఎందుకు తిరస్కరించిందో మీరు వివరించగలగాలి. "బ్లాక్ బాక్స్ అలా చెప్పింది" అనేది నైతికంగా మరియు తరచుగా చట్టపరంగా ఆమోదయోగ్యం కాదు. అందుకే వివరణాత్మక సాధనాలు (ఫీచర్ ప్రాముఖ్యత, SHAP విలువలు) విలువైనవి.

జవాబుదారీతనం: మోడల్ తప్పు నిర్ణయం తీసుకుంటే ఎవరు బాధ్యత వహిస్తారు? సమాధానం ఎల్లప్పుడూ ఒక వ్యక్తి/సంస్థ, మోడల్ కాదు. మానవ పర్యవేక్షణ (హ్యూమన్-ఇన్-ది-లూప్ — తుది నిర్ణయాన్ని ఆమోదించే మానవుడు) అధిక-ప్రభావ నిర్ణయాలలో భద్రపరచబడాలి.

హెచ్చరిక: మోడల్ గణాంకపరంగా "సరైనది" కావచ్చు కానీ నైతికంగా ఆమోదయోగ్యం కాదు. ఒక సమూహానికి క్రమపద్ధతిలో ప్రతికూలతలు కలిగించే అత్యంత ఖచ్చితమైన మోడల్ మంచి మోడల్ కాదు. నిజాయితీ న్యాయానికి ప్రత్యామ్నాయం కాదు.

గోప్యత: వ్యక్తిగత డేటా జాగ్రత్తగా రక్షించబడింది

డేటా సైన్స్ యొక్క ముడి పదార్థం తరచుగా వ్యక్తిగత డేటా, మరియు ఈ డేటా చట్టం ద్వారా రక్షించబడుతుంది: Türkiye లో KVKK, ఐరోపాలో GDPR. ప్రాథమిక సూత్రాలు: ప్రయోజన పరిమితి (డేటా సేకరించిన ప్రయోజనం కోసం కాకుండా ఇతర ప్రయోజనాల కోసం ఉపయోగించబడదు), డేటా కనిష్టీకరణ (అవసరం కంటే ఎక్కువ డేటా సేకరించబడదు/నిలుపుకోలేదు), అనామకీకరణ (సమాచారం గుర్తించడం తీసివేయబడుతుంది) మరియు భద్రత (డేటా గుప్తీకరించబడింది మరియు యాక్సెస్ పరిమితం చేయబడింది). AI సాధనాలతో పని చేస్తున్నప్పుడు క్లిష్టమైన నియమం: నిజమైన వ్యక్తిగత డేటాను పబ్లిక్ AI సాధనంలో అతికించవద్దు. చాలా సమయం, విశ్లేషణ కోసం రేఖాచిత్రం మరియు అనామక/సింథటిక్ నమూనా సరిపోతాయి.

సమాచార భద్రత విషయంలో అదనపు ప్రాధాన్యత: రక్షణాత్మక మరియు చట్టబద్ధమైన విశ్లేషణ ప్రయోజనాల కోసం మీకు అధికారం ఉన్న డేటా మరియు సిస్టమ్‌లపై మాత్రమే డేటా సైన్స్ సాధనాలు మరియు సాంకేతికతలను ఉపయోగించండి. వేరొకరి డేటాకు అనధికారిక యాక్సెస్, వ్యక్తులను తిరిగి గుర్తించడం (అనామక డేటా నుండి గుర్తింపును సంగ్రహించడం) లేదా అనధికార ప్రొఫైలింగ్ చట్టవిరుద్ధం మరియు అనైతికం.

మూడు చిన్న కేసులు

కేసు 1 - ట్రాక్ చేయని పతనం. ఒక ఇ-కామర్స్ కంపెనీ దాని సిఫార్సు మోడల్‌తో ప్రత్యక్ష ప్రసారం చేయబడింది మరియు ట్రాకింగ్‌ను సెటప్ చేయలేదు. 4 నెలల తర్వాత ఉత్పత్తి కేటలాగ్ బాగా మారిపోయింది; మోడల్ పాత ఉత్పత్తులను సిఫార్సు చేస్తూనే ఉంది మరియు మార్పిడి రేటు నిశ్శబ్దంగా 30% తగ్గింది. నెలల తరబడి ఎవరూ గమనించలేదు. పాఠం: పర్యవేక్షణ లేకుండా విస్తరణ గుడ్డిగా జరుగుతోంది.

కేసు 2 - దాచిన వివక్ష. ఒక నియామక స్క్రీనింగ్ మోడల్ చారిత్రక డేటాలో లింగ అసమతుల్యత గురించి మరియు క్రమపద్ధతిలో తక్కువ అంచనా వేసిన మహిళా అభ్యర్థుల గురించి తెలుసుకుంది. న్యాయమైన విశ్లేషణ లేనందున ఇది గుర్తించబడలేదు; ఇది ఒక ఆడిట్‌లో వెల్లడైంది మరియు సంస్థ తీవ్రమైన కీర్తి/చట్టపరమైన ప్రమాదాన్ని ఎదుర్కొంది. పాఠం: అధిక-ప్రభావ నమూనాలలో సమూహ-ఆధారిత సరసమైన నియంత్రణ అవసరం.

కేసు 3 - గోప్యత ఉల్లంఘన. ఒక విశ్లేషకుడు నిజమైన కస్టమర్ ఇమెయిల్‌లు మరియు కొనుగోలు చరిత్రను కలిగి ఉన్న ఫైల్‌ను పబ్లిక్ AI సాధనంలోకి లోడ్ చేసి, "విభాగాలను సంగ్రహించండి" అని అన్నారు. వ్యక్తిగత డేటా సంస్థ నుండి నిష్క్రమించింది; KVKK ప్రక్రియ ప్రారంభమైంది. గుర్తింపు ఫీల్డ్‌లను తీసివేయడం మరియు అనామక ఆస్తులను మాత్రమే భాగస్వామ్యం చేయడం సరైన మార్గం. పాఠం: నిజమైన వ్యక్తిగత డేటా ఓపెన్ టూల్‌లోకి ప్రవేశించదు.

నాలుగు కాపీ చేయగల టెంప్లేట్‌లు

1) ముందస్తు విస్తరణ చెక్‌లిస్ట్:

మీ పాత్ర: MLOps కన్సల్టెంట్. మోడల్‌ను ఉత్పత్తిలో ఉంచడానికి ముందు నేను తనిఖీ చేయవలసిన అంశాలను జాబితా చేయండి: సంస్కరణ, పర్యవేక్షణ కొలమానాలు, రోల్‌బ్యాక్ ప్లాన్, పనితీరు థ్రెషోల్డ్, డేటా డ్రిఫ్ట్ హెచ్చరిక, బాధ్యతాయుతమైన వ్యక్తి. ప్రతి అంశానికి ఒక వాక్యం "ఎందుకు ముఖ్యమైనది" అనే వివరణను జోడించండి. నేను నిర్ణయిస్తాను.

2) మోడల్ షిఫ్ట్ ట్రాకింగ్ డిజైన్:

ఉత్పత్తిలో వర్గీకరణ నమూనా కోసం డ్రిఫ్ట్ మానిటరింగ్ ప్లాన్‌ను సూచించండి: (1) నేను ఏ ఇన్‌పుట్ డిస్ట్రిబ్యూషన్‌లను పర్యవేక్షించాలి, (2) ప్రిడిక్షన్ డిస్ట్రిబ్యూషన్ కోసం ఏ అలారం, (3) నిజమైన ఫలితం వచ్చినప్పుడు పనితీరును ఎలా పోల్చాలి, (4) ఏ థ్రెషోల్డ్ రీట్రైనింగ్ ప్రారంభించబడాలి. కోడ్ అస్థిపంజరాన్ని కూడా అందించండి.

3) న్యాయమైన నియంత్రణ:

విభిన్న సమూహాలకు (ఉదా. వయస్సు బ్యాండ్, ప్రాంతం) నా మోడల్ పనితీరును సరిపోల్చే కోడ్‌ను వ్రాయండి: ప్రతి సమూహానికి రీకాల్/ఖచ్చితమైన మరియు సానుకూల నిర్ణయం రేటు. సమూహాల మధ్య గణనీయమైన వ్యత్యాసం ఉంటే హెచ్చరిస్తుంది. కారణ/రాజకీయ వివరణలు చేయడం; నాకు తేడాలు చూపించండి మరియు నేను నిర్ణయాన్ని పరిశీలిస్తాను.

4) గోప్యత ముందస్తు తనిఖీ:

AI సాధనానికి డేటాను అందించే ముందు, తనిఖీ చేయండి: దిగువ కాలమ్ జాబితాలో వ్యక్తిగత/గుర్తింపు డేటా (పేరు, ఇమెయిల్, ID, ఫోన్, చిరునామా, IP) ఉందా? అలా అయితే, ఏవి తీసివేయబడాలి లేదా అజ్ఞాతం చేయాలి అని జాబితా చేయండి. నిలువు వరుసలు: [జాబితా]. ఉద్దేశ్యం: అనామక స్కీమాను మాత్రమే భాగస్వామ్యం చేయడం.

బలహీనమైన ప్రాంప్ట్ / బలమైన ప్రాంప్ట్

బలహీనమైన ప్రాంప్ట్:

నా మోడల్ సిద్ధంగా ఉంది, ప్రత్యక్ష ప్రసారం చేయి.

విస్తరణ ఒక్క అడుగు కాదు; పర్యవేక్షణ, రోల్‌బ్యాక్, ఫెయిర్‌నెస్ మరియు గోప్యతా నియంత్రణ లేకుండా ప్రత్యక్ష ప్రసారం చేయడం విపత్తు కోసం నిశ్శబ్ద ఆహ్వానం.

శక్తివంతమైన ప్రాంప్ట్:

మీ పాత్ర: బాధ్యతగల MLOps కన్సల్టెంట్. నా మోడల్ శిక్షణ పొందింది, ప్రత్యక్ష ప్రసారం చేయడానికి ముందు నాకు పూర్తి తయారీ కావాలి. రూపొందించండి: (1) ప్రీ-డిప్లాయ్‌మెంట్ చెక్‌లిస్ట్, (2) డ్రిఫ్ట్ మానిటరింగ్ ప్లాన్, (3) గ్రూప్ ఆధారిత ఫెయిర్‌నెస్ చెక్ కోడ్, (4) గోప్యతా తనిఖీ (వ్యక్తిగత డేటా ఉందా). అధిక-ప్రభావ నిర్ణయాలలో మానవ సమ్మతిని ఎలా రక్షించాలో కూడా సూచించండి. తుది నిర్ణయాలు నావే.

ఇక్కడ పంపిణీ, పర్యవేక్షణ, సరసత మరియు గోప్యత ఒకే బాధ్యతాయుతమైన ప్రక్రియగా పరిగణించబడతాయి.

సాధారణ తప్పులు

  • పర్యవేక్షణను సెటప్ చేయకుండా మోడల్‌ని అమలు చేయడం. మోడల్ నిశ్శబ్దంగా జారిపోతుంది మరియు వక్రీకరిస్తుంది; ఇది గమనించడానికి నెలలు పట్టవచ్చు.
  • న్యాయ తనిఖీని దాటవేయడం. అధిక-విశ్వసనీయ నమూనా సమూహానికి క్రమపద్ధతిలో ప్రతికూలతను కలిగిస్తుంది.
  • వివరించలేని బ్లాక్ బాక్స్ నిర్ణయం తీసుకోవడం. అధిక-ప్రభావ నిర్ణయాలు తప్పనిసరిగా వివరించదగినవిగా ఉండాలి; "మోడల్ చెప్పింది" సరిపోదు.
  • AI సాధనాన్ని తెరవడానికి నిజమైన వ్యక్తిగత డేటాను అందించడం. KVKK/GDPR ఉల్లంఘన; రేఖాచిత్రం మరియు అనామక ఉదాహరణ సరిపోతుంది.
  • నిర్ణయాన్ని మోడల్‌కు అప్పగించడం. బాధ్యత ఎల్లప్పుడూ ఒక వ్యక్తిపై ఉంటుంది; అధిక ప్రభావ మానవ నిఘా నిర్వహించబడుతుంది.
చిట్కా: మీరు ప్రతి మోడల్‌తో ప్రత్యక్ష ప్రసారం చేయడానికి ముందు, బిగ్గరగా ఒక ప్రశ్న అడగండి: "ఈ మోడల్ రేపు నిశ్శబ్దంగా విచ్ఛిన్నమైతే లేదా సమూహానికి అన్యాయంగా జరిమానా విధించినట్లయితే, నేను దానిని ఎలా గమనించి వెనక్కి తిప్పగలను?" ఈ ప్రశ్నకు మీకు స్పష్టమైన సమాధానం లేకుంటే, మోడల్ ఇంకా ఉత్పత్తికి సిద్ధంగా లేదు.

సారాంశంలో

మోడల్ యొక్క ఉద్యోగం అధిక స్కోర్‌తో ముగియదు, కానీ ఉత్పత్తిలో విశ్వసనీయంగా మరియు బాధ్యతాయుతంగా పని చేయడంతో. MLOps అనేది ప్రత్యక్ష ప్రసారానికి వెళ్లడం, డ్రిఫ్ట్ కోసం పర్యవేక్షించడం, తిరిగి శిక్షణ ఇవ్వడం మరియు మోడల్‌ను వెనక్కి తిప్పడం వంటి క్రమశిక్షణ; ట్రాకింగ్ లేకుండా విస్తరణ నిశ్శబ్దంగా కుప్పకూలింది. నైతికతకు నమూనా యొక్క సరసత, పారదర్శకత మరియు జవాబుదారీతనం అవసరం; గణాంక ఖచ్చితత్వం నైతిక ఆమోదయోగ్యతకు ప్రత్యామ్నాయం కాదు. గోప్యత అంటే KVKK/GDPR సూత్రాలతో వ్యక్తిగత డేటాను రక్షించడం మరియు ఓపెన్ టూల్స్ నుండి నిజమైన డేటాను దూరంగా ఉంచడం. ఈ నిర్ణయాలన్నీ సాంకేతికమైనవి కావు కానీ బాధ్యత నిర్ణయాలు మరియు ఎల్లప్పుడూ మానవునికి చెందినవి.

అప్లికేషన్ టాస్క్

మీరు రూపొందించిన (లేదా ఊహాజనిత) మోడల్‌ను ఉత్పత్తిలో ఉంచబోతున్నట్లుగా ఆలోచించండి మరియు నాలుగు జాబితాలను పూరించండి: (1) ముందస్తు విస్తరణ చెక్‌లిస్ట్, (2) మీరు ట్రాక్ చేసే డ్రిఫ్ట్ మెట్రిక్‌లు, (3) గ్రూప్ ఆధారిత ఫెయిర్‌నెస్ కంట్రోల్ ప్లాన్, (4) గోప్యతా నియంత్రణ. అప్పుడు ప్రశ్నకు ఖచ్చితమైన సమాధానం రాయండి "ఇది రేపు నిశ్శబ్దంగా విచ్ఛిన్నమైతే మరియు దానిని తిరిగి పొందినట్లయితే నేను ఎలా గమనించగలను?"

చెక్లిస్ట్

  • [ ] నేను మానిటరింగ్ (స్లిప్ అలర్ట్) మరియు రోల్‌బ్యాక్ ప్లాన్‌తో మోడల్‌ని అమలు చేస్తున్నానా?
  • [ ] నేను వివిధ సమూహాల కోసం సరసత/పనితీరు అంతరాన్ని తనిఖీ చేశానా?
  • [ ] నేను అధిక-ప్రభావ నిర్ణయాలపై హ్యూమన్-ఇన్-ది-లూప్‌ని నిర్వహించానా?
  • [ ] నేను KVKK/GDPR సూత్రాలతో వ్యక్తిగత డేటాను రక్షించాను మరియు వాటిని ఓపెన్ టూల్స్ నుండి దూరంగా ఉంచానా?
  • [ ] నేను మోడల్‌పై కాకుండా మానవుడిపై అంతిమ బాధ్యతను ఉంచానా?

మాడ్యూల్ పరీక్ష

1. ఒక డేటా సైంటిస్ట్ ఆర్టిఫిషియల్ ఇంటెలిజెన్స్‌ని అడిగాడు, "ఈ డేటాపై యాదృచ్ఛిక అటవీ ఎంత ఖచ్చితమైనది?" మోడల్‌కు అస్సలు శిక్షణ ఇవ్వకుండా, నేరుగా "89%" సమాధానాన్ని ప్రెజెంటేషన్‌లో ఉంచుతుంది. ఈ విధానంలో ప్రాథమిక తప్పు ఏమిటి?

  • ఎ) ఆర్టిఫిషియల్ ఇంటెలిజెన్స్‌కు డేటా మరియు మోడల్స్ ఇవ్వకుండా కొలమానాల కోసం వేచి ఉండటం; అది ఉత్పత్తి చేసే సంఖ్య నకిలీదని మరియు నిజమైన మెట్రిక్ శిక్షణ మరియు పరీక్ష ద్వారా మాత్రమే కనుగొనబడుతుందని విస్మరించడం ✔
  • బి) యాదృచ్ఛిక అటవీ బదులు తప్పనిసరిగా లాజిస్టిక్ రిగ్రెషన్‌ను ఉపయోగించాలి
  • సి) ఖచ్చితత్వం ఎల్లప్పుడూ 90% కంటే ఎక్కువగా ఉండాలి.
  • D) ప్రదర్శనలో కొలమానాలను చేర్చడం ఖచ్చితంగా నిషేధించబడింది

వివరణ: మోడల్ మరియు డేటాను యాక్సెస్ చేయకుండా కృత్రిమ మేధస్సు మెట్రిక్‌ను ఉత్పత్తి చేయదు; అతను ఇచ్చే సంఖ్య భ్రాంతి (కల్పితమైనది). మోడల్ వాస్తవానికి శిక్షణ పొందిన మరియు పరీక్షించబడిన తర్వాత మాత్రమే డేటా సైంటిస్ట్ యొక్క స్వంత గణన ద్వారా మెట్రిక్ పొందబడుతుంది. ధృవీకరించని అవుట్‌పుట్ సంతకం చేయని నివేదిక లాంటిది.

2. చర్న్ సూచన కోసం డేటాను సేకరిస్తున్నప్పుడు 'ఖాతా మూసివేతకు కారణం' కాలమ్ చేర్చబడుతుంది; కస్టమర్ వెళ్లిన తర్వాత మాత్రమే ఈ కాలమ్ నింపబడుతుంది. మోడల్ టెస్ట్ సెట్‌లో 97% ఇస్తుంది, కానీ ఉత్పత్తిలో పని చేయదు. ఈ పరిస్థితికి పేరు మరియు కారణం ఏమిటి?

  • ఎ) ఓవర్ లెర్నింగ్; మోడల్ చాలా క్లిష్టమైనది
  • బి) డేటా లీక్; ✔ అంచనా సమయంలో అందుబాటులో లేని సమాచారాన్ని ఉపయోగించడం, కానీ లక్ష్యం యొక్క ఫలితం, లక్షణంగా
  • సి) తగినంత అభ్యాసం లేదు; మోడల్ చాలా సులభం
  • డి) ఎంపిక పక్షపాతం; చిన్న నమూనా పరిమాణం

వివరణ: ఇది క్లాసిక్ డేటా లీక్: 'క్లోజింగ్ రీజన్' అనేది లక్ష్యం యొక్క ఫలితం మరియు అంచనా సమయంలో ఇప్పటికీ ఖాళీగా ఉంది. మోడల్ ఈ భవిష్యత్ పరిజ్ఞానంతో ట్రిక్ చేస్తుంది, ఇది టెస్ట్ సెట్‌లో అద్భుతంగా కనిపిస్తుంది కానీ ఆ నిలువు వరుస ఖాళీగా ఉన్నందున ఉత్పత్తిలో క్రాష్ అవుతుంది. ప్రతి కాలమ్‌కి 'ప్రిడిక్షన్ సమయంలో నా దగ్గర అది ఉందా' అనే ప్రశ్న అడగాలి.

3. ఒక విశ్లేషకుడు రాబడి కాలమ్‌లో తప్పిపోయిన విలువలను సగటుతో పూరిస్తాడు; కానీ తప్పిపోయిన వ్యక్తులు వాస్తవానికి ఆదాయాన్ని ప్రకటించని తక్కువ-ఆదాయ విభాగానికి చెందినవారు (సిస్టమాటిక్ మిస్సింగ్). ఈ పూరకం ఎందుకు తప్పు?

  • ఎ) మధ్యస్థం కంటే సగటు ఎల్లప్పుడూ ఎక్కువగా ఉంటుంది, కనుక ఇది తప్పు
  • బి) తప్పిపోయిన విలువలను ఎప్పుడూ పూరించకూడదు, అవి ఎల్లప్పుడూ తొలగించబడాలి
  • సి) క్రమబద్ధమైన అంతరాన్ని సగటుతో పూరించడం ఆ సమూహాన్ని కృత్రిమంగా సూచించడం ద్వారా డేటాను వక్రీకరిస్తుంది; ‘ఎందుకు ఖాళీగా ఉంది?’ అనే ప్రశ్న అడగకుండానే ఫిల్లింగ్ చేశారు. ✔
  • D) సగటును గణించడం పనితీరు సమస్యను సృష్టిస్తుంది ఎందుకంటే ఇది చాలా నెమ్మదిగా ఉంటుంది

వివరణ: లోపం యొక్క కారణం పరిష్కారాన్ని నిర్ణయిస్తుంది. సిస్టమాటిక్ మిస్సింగ్ (ఒక నిర్దిష్ట సమూహంలో కేంద్రీకృతమై ఉన్న ఖాళీ) సగటుతో నిండినప్పుడు, ఆ సమూహం కృత్రిమంగా 'సగటు ఆదాయం'గా మారుతుంది మరియు డేటా వక్రీకరించబడుతుంది. పూరించడానికి ముందు, 'ఎందుకు ఖాళీగా ఉంది' అనే ప్రశ్న అడగాలి; క్రమబద్ధమైన/ముఖ్యమైన తప్పిపోయిన సగటును పూరించకూడదు.

4. ఒక బృందం 'యాడ్ స్పెండ్' మరియు 'సేల్స్' మధ్య 0.78 సహసంబంధాన్ని కనుగొంటుంది మరియు బడ్జెట్‌ను రెట్టింపు చేస్తుంది; అయితే, వాస్తవానికి రెండింటిని ప్రేరేపించేది కాలానుగుణ ప్రచారాలు. గణాంకాలలోని ఏ సూత్రం ఈ లోపాన్ని వివరిస్తుంది?

  • ఎ) సహసంబంధం కారణం కాదు; దాచిన మూడవ వేరియబుల్ రెండు వేరియబుల్‌లను ప్రభావితం చేయవచ్చు ✔
  • బి) 0.78 యొక్క సహసంబంధం చాలా తక్కువగా ఉన్నందున, సంబంధాన్ని విస్మరించాలి
  • సి) సహసంబంధం ఎల్లప్పుడూ కారణాన్ని రుజువు చేస్తుంది, జట్టు దానిని సరిగ్గా అర్థం చేసుకుంది
  • D) ప్రకటనలు మరియు విక్రయాల మధ్య సహసంబంధాన్ని గణితశాస్త్రంగా లెక్కించలేము.

వివరణ: సహసంబంధం కారణం కాదు. దాచిన మూడవ వేరియబుల్ (ఇక్కడ కాలానుగుణ ప్రచారాలు) రెండింటినీ ప్రభావితం చేసే కారణంగా రెండు వేరియబుల్స్ కలిసి పని చేయవచ్చు. ఒకదానికొకటి కారణమవుతుందనే నిర్ధారణ ప్రయోగం మరియు క్షేత్ర పరిజ్ఞానం ద్వారా మాత్రమే స్థాపించబడుతుంది; సహసంబంధాల సంఖ్య మాత్రమే కారణానికి రుజువు కాదు.

5. మోసాన్ని గుర్తించే మోడల్ 99.2% ఖచ్చితత్వాన్ని చూపుతుంది మరియు బృందం జరుపుకుంటుంది; అయితే, డేటాలో నకిలీ లావాదేవీ రేటు 0.8% మాత్రమే మరియు మోడల్ రీకాల్ 6%. ఈ పట్టిక ఏమి చూపుతుంది?

  • ఎ) ఖచ్చితత్వం 99% కంటే ఎక్కువ ఉన్నందున మోడల్ ఖచ్చితంగా ఉంది
  • బి) అసమతుల్య డేటాతో ఖచ్చితత్వం తప్పుదారి పట్టిస్తుంది; మోడల్ దాదాపు అన్ని నకిలీలను మిస్ చేస్తుంది (తక్కువ రీకాల్), తగిన మెట్రిక్ చూడాలి ✔
  • సి) మోడల్ రీకాల్ ఎక్కువగా ఉన్నందున ఎటువంటి సమస్య లేదు
  • డి) నకిలీ రేటు తక్కువగా ఉన్నందున మోడల్‌ను నిర్మించాల్సిన అవసరం లేదు

వివరణ: అసమతుల్య డేటాలో 'ఖచ్చితత్వం' తప్పుదారి పట్టిస్తోంది. మోడల్ దాదాపు ప్రతి లావాదేవీని 'క్లీన్' అని పిలిచినప్పుడు, అది అధిక ఖచ్చితత్వాన్ని పొందుతుంది ఎందుకంటే నకిలీలు చాలా తక్కువగా ఉంటాయి, అయితే ఇది నకిలీలను పట్టుకోవడంలో విఫలమవుతుంది, ఇది దాని ప్రధాన ఉద్దేశ్యం (రీకాల్ 6%). అందువల్ల, అసమతుల్య సమస్యలలో, దృష్టి ఖచ్చితత్వంపై కాదు, రీకాల్/ఖచ్చితత్వం వంటి ఉద్యోగ ప్రయోజనం కోసం సరిపోయే గందరగోళ మాతృక మరియు కొలమానాలపై దృష్టి పెడుతుంది.

6. డిమాండ్ అంచనా ప్రాజెక్ట్‌లో, సమయం-ఆధారిత డేటా యాదృచ్ఛికంగా శిక్షణ/పరీక్షగా విభజించబడింది. మోడల్ 93% ఖచ్చితత్వాన్ని ఇస్తుంది కానీ ఉత్పత్తిలో క్రాష్ అవుతుంది. సరైన విభజన విధానం ఎలా ఉండాలి?

  • ఎ) పరీక్ష సెట్‌ను విస్తరించడం, ఉదా. విభజన 50%/50%
  • బి) మరింత క్లిష్టమైన నమూనాను ఉపయోగించడం
  • సి) విభజనను పూర్తిగా తీసివేసి, మొత్తం డేటాతో శిక్షణ ఇవ్వండి
  • D) కాలక్రమానుసార విభజన: పాత కాలంతో శిక్షణ మరియు కొత్త కాలంతో పరీక్షించడం, తద్వారా మోడల్ భవిష్యత్తును చూడకుండా నిరోధించడం ✔

వివరణ: సమయ శ్రేణి డేటాలో యాదృచ్ఛిక విభజన జరిగితే, మోడల్ భవిష్యత్తును చూస్తుంది మరియు శిక్షణలో గతాన్ని అంచనా వేస్తుంది; ఇది ఒక లీక్ మరియు వాస్తవానికి లేని విజయాన్ని ఉత్పత్తి చేస్తుంది. సరైన విధానం కాలక్రమానుసార విభజన: పాత కాలంతో శిక్షణ మరియు కొత్త కాలంతో పరీక్షించడం, ఉత్పత్తిలో వాస్తవ పరిస్థితిని అనుకరించడం (గతం నుండి భవిష్యత్తు వరకు అంచనా వేయడం).

7. ఫీచర్ ఇంజనీరింగ్‌లో స్కేలింగ్ (స్టాండర్డ్‌స్కేలర్) పారామితులను ఏ డేటా నుండి లెక్కించాలి మరియు వాటిని ఎలా వర్తింపజేయాలి?

  • ఎ) ఇది మరింత ఖచ్చితమైనదిగా ఉండేలా మొత్తం డేటా (శిక్షణ + పరీక్ష కలిపి) నుండి లెక్కించబడాలి
  • బి) ఇది ప్రతి అడ్డు వరుసకు, ఆ అడ్డు వరుస యొక్క స్వంత విలువ నుండి విడిగా లెక్కించబడాలి
  • సి) పరీక్ష డేటా నుండి మాత్రమే లెక్కించబడాలి
  • D) ఇది శిక్షణ డేటా నుండి మాత్రమే లెక్కించబడాలి, అప్పుడు అదే పారామితులను పరీక్ష డేటాకు వర్తింపజేయాలి; లేకుంటే అది లీక్ అవుతుంది ✔

వివరణ: స్కేలింగ్, ఎన్‌కోడింగ్ మరియు పాడింగ్ వంటి అన్ని పరివర్తనల (సగటు, ప్రామాణిక విచలనం మొదలైనవి) పారామితులు శిక్షణ డేటా నుండి మాత్రమే నేర్చుకోవాలి, ఆపై అదే పరీక్ష డేటాకు వర్తింపజేయాలి. పరీక్ష డేటాను పరిగణనలోకి తీసుకోవడం వల్ల పరీక్ష సమాచారం శిక్షణకు ఆటంకం కలిగిస్తుంది, అంటే లీకేజీ, మరియు మోడల్ దాని కంటే మెరుగ్గా కనిపించేలా చేస్తుంది. పైప్‌లైన్ ఉపయోగించడం దీన్ని నిర్ధారిస్తుంది.

8. ఒక మోడల్ శిక్షణ సెట్‌పై 98% ఖచ్చితత్వాన్ని మరియు పరీక్ష సెట్‌లో 72% ఖచ్చితత్వాన్ని ఇస్తుంది. ఈ లక్షణం ఏమి సూచిస్తుంది మరియు ఏమి చేయాలి?

  • ఎ) తగినంత అభ్యాసం లేదు; మోడల్ మరింత క్లిష్టంగా ఉండాలి
  • బి) డేటా లీక్; పరీక్ష సెట్ మార్చాలి
  • సి) ఓవర్ ఫిట్టింగ్; మోడల్‌ను సరళీకృతం చేయాలి, క్రమబద్ధీకరణ మరియు క్రాస్ ధ్రువీకరణ వర్తింపజేయాలి ✔
  • డి) సాధారణ పరిస్థితి; ఎడ్యుకేషన్ స్కోర్ ఎల్లప్పుడూ ఎక్కువగానే ఉంటుంది, జాగ్రత్తలు అనవసరం

వివరణ: శిక్షణలో చాలా ఎక్కువ స్కోర్ మరియు టెస్టింగ్‌లో గణనీయంగా తక్కువ స్కోర్ అనేది ఓవర్ ఫిట్టింగ్ యొక్క క్లాసిక్ లక్షణం: మోడల్ నిజమైన నమూనా కంటే శిక్షణ డేటా యొక్క శబ్దాన్ని గుర్తుపెట్టుకుంది. పరిష్కారాలలో మోడల్‌ను సరళీకృతం చేయడం, మరింత డేటా, క్రమబద్ధీకరణ మరియు క్రాస్ ధ్రువీకరణతో రాష్ట్రాన్ని ధృవీకరించడం వంటివి ఉన్నాయి. విద్య స్కోర్‌పై మాత్రమే ఆధారపడటం ఈ ఆపదను దాచిపెడుతుంది.

9. నిర్వహణ ప్రదర్శనలో, 1,000 నుండి 1,020 వరకు అమ్మకాలు పెరిగే బార్ చార్ట్ యొక్క y-యాక్సిస్ పెరుగుదల భారీగా కనిపించేలా చేయడానికి 980 వద్ద ప్రారంభించబడింది. వాస్తవ పెరుగుదల 2%. ఇది నైతిక సమస్య ఎందుకు?

  • A) కత్తిరించబడిన y-అక్షం దృశ్యమానంగా ఒక చిన్న వ్యత్యాసాన్ని అతిశయోక్తి చేస్తుంది మరియు వీక్షకుడిని తప్పుదారి పట్టిస్తుంది; సరసత కోసం, కంపారిజన్ బార్‌లలోని అక్షం 0 ✔ నుండి ప్రారంభం కావాలి
  • బి) బార్ చార్ట్‌లు అమ్మకాల డేటా కోసం ఎప్పటికీ ఉపయోగించబడవు
  • సి) సమస్య లేదు; చార్ట్‌ను ఆకట్టుకునేలా చేయడం ఎల్లప్పుడూ మంచిది
  • D) Y-యాక్సిస్ ఎల్లప్పుడూ డేటా యొక్క అతిపెద్ద విలువ నుండి ప్రారంభం కావాలి

వివరణ: తులనాత్మక ప్రయోజనాల కోసం బార్ చార్ట్‌లలో, y-యాక్సిస్ సాధారణంగా 0 వద్ద ప్రారంభం కావాలి. అక్షాన్ని కత్తిరించడం మరియు 980తో ప్రారంభించడం వలన చిన్న 2% వ్యత్యాసం దృశ్యమానంగా భారీగా అనిపించేలా చేస్తుంది మరియు వీక్షకులను తప్పుదారి పట్టిస్తుంది. డేటా నిపుణుడి యొక్క నైతిక బాధ్యత ఏమిటంటే డేటాను అతిగా అంచనా వేయని లేదా తక్కువ అంచనా వేయని నిజాయితీ గ్రాఫ్‌లను గీయడం.

10. ఉత్పత్తి పట్టికతో ఆర్డర్‌లను చేరిన తర్వాత విశ్లేషకుడు మొత్తం టర్నోవర్‌ను 3 సార్లు కనుగొంటారు; లైన్ల సంఖ్య 240 వేల నుండి 690 వేలకు పెరిగింది. ఈ నిశ్శబ్ద దోషాన్ని నివారించడానికి ఏమి చేయాలి?

  • ఎ) మొత్తం టర్నోవర్‌ను 3తో భాగించండి
  • B) ఎల్లప్పుడూ JOINకి బదులుగా ప్రత్యేక ప్రశ్నలను ఉపయోగించండి
  • సి) ఉత్పత్తి పట్టికను పూర్తిగా తొలగించడం
  • D) విలీనం/JOIN తర్వాత వరుసల సంఖ్యను తనిఖీ చేయడం మరియు అవి సరైన కీ ద్వారా చేరాయని ధృవీకరించడం; ప్రతిరూపణను ముందుగానే పట్టుకోవడం ✔

వివరణ: ఉత్పత్తి పట్టికలో ప్రతి ఉత్పత్తికి బహుళ వరుసలు (ఉదాహరణకు వేర్వేరు రంగులు) ఉన్నప్పుడు, తప్పు కీ ద్వారా JOIN చేయడం వలన ప్రతి ఆర్డర్ డూప్లికేట్ అవుతుంది మరియు మొత్తాలను పెంచుతుంది. కోడ్ లోపాలు లేకుండా నడుస్తుంది కానీ ఫలితం తప్పు. దీన్ని నివారించడానికి మార్గం ప్రతి విలీనం/JOIN తర్వాత వరుసల సంఖ్యను తనిఖీ చేయడం మరియు సరైన కీతో విలీనం చేయడం.

11. హైరింగ్ స్క్రీనింగ్ మోడల్ చారిత్రక డేటాలో లింగ అసమతుల్యత గురించి మరియు క్రమపద్ధతిలో మహిళా అభ్యర్థుల స్కోర్‌ల క్రింద నేర్చుకుంటుంది, అయితే దాని మొత్తం ఖచ్చితత్వం ఎక్కువగా ఉంటుంది. దీని అర్థం ఏమిటి?

  • ఎ) మోడల్ అధిక ఖచ్చితత్వాన్ని కలిగి ఉన్నందున ఎటువంటి సమస్య లేదు
  • B) గణాంక ఖచ్చితత్వం నైతిక ఆమోదానికి ప్రత్యామ్నాయం కాదు; మోడల్ గత వివక్ష గురించి నేర్చుకుంది, సమూహం ఆధారిత న్యాయమైన తనిఖీ అవసరం ✔
  • సి) మోడల్ యొక్క ఖచ్చితత్వాన్ని మరింత పెంచడం సమస్యను పరిష్కరిస్తుంది
  • డి) ఫెయిర్‌నెస్ అనేది డేటా సైన్స్ పరిధికి వెలుపల ఉంది

వివరణ: ఒక మోడల్ గణాంకపరంగా సరైనది అయినప్పటికీ, అది నైతికంగా ఆమోదయోగ్యం కాదు. మోడల్ గత డేటాలోని అన్యాయాన్ని తెలుసుకుంటుంది మరియు వివక్షను ఆటోమేట్ చేస్తుంది. అధిక సమగ్రత న్యాయానికి ప్రత్యామ్నాయం కాదు; అధిక-ప్రభావ నమూనాలలో, వివిధ సమూహాల పనితీరు/నిర్ణయ వ్యత్యాసాన్ని కొలిచే ఫెయిర్‌నెస్ నియంత్రణ చాలా అవసరం మరియు అంతిమ బాధ్యత మానవునిపై ఉంటుంది.

12. ఒక ఉద్యోగి నిజమైన కస్టమర్ ఇమెయిల్‌లు మరియు కొనుగోలు చరిత్రను కలిగి ఉన్న ఫైల్‌ను పబ్లిక్ AI సాధనంలోకి అప్‌లోడ్ చేస్తాడు మరియు 'విభాగాలను సంగ్రహించండి' అని చెప్పాడు. ఇది ఎందుకు తీవ్రమైన తప్పు మరియు సరైన మార్గం ఏమిటి?

  • ఎ) సమస్య లేదు; AI సాధనాలు డేటాను ఎప్పుడూ నిల్వ చేయవు
  • బి) ఫైల్ చాలా పెద్దదిగా ఉండటం లోపం; తగ్గించి వుండాలి
  • సి) ఓపెన్ టూల్‌కు నిజమైన వ్యక్తిగత డేటాను అందించడం KVKK/GDPR ఉల్లంఘన; గుర్తింపు ఫీల్డ్‌లు తీసివేయబడి ఉండాలి మరియు అనామక స్కీమా/ఆస్తి మాత్రమే భాగస్వామ్యం చేయబడాలి ✔
  • డి) కేవలం Excelకు బదులుగా CSVని ఉపయోగించాలి

వివరణ: పబ్లిక్‌గా అందుబాటులో ఉన్న కృత్రిమ మేధస్సు సాధనానికి నిజమైన వ్యక్తిగత డేటా (ఇ-మెయిల్, పేరు మొదలైనవి) ఇచ్చినప్పుడు, KVKK / GDPR పరిధిలో గోప్యతా ఉల్లంఘన జరుగుతుంది; డేటా సంస్థను వదిలివేస్తుంది. చాలా సమయం, విశ్లేషణ కోసం రేఖాచిత్రం మరియు అనామక/సింథటిక్ నమూనా సరిపోతాయి. గుర్తింపు ఫీల్డ్‌లను తీసివేయడం మరియు అనామక లక్షణాలను మాత్రమే భాగస్వామ్యం చేయడం సరైన మార్గం.

13. ఒక సిఫార్సు మోడల్ ఉత్పత్తిలో ఉంచబడింది కానీ ట్రాకింగ్ స్థాపించబడలేదు; 4 నెలల తర్వాత ఉత్పత్తి కేటలాగ్ మారినప్పుడు, మోడల్ పాత ఉత్పత్తులను సిఫార్సు చేస్తూనే ఉంటుంది మరియు మార్పిడి రేటు నిశ్శబ్దంగా 30% తగ్గుతుంది. ఈ దృగ్విషయం పేరు ఏమిటి?

  • ఎ) ఓవర్ లెర్నింగ్; మోడల్ శిక్షణ సెట్‌ను గుర్తుంచుకుంటుంది
  • బి) మోడల్ డ్రిఫ్ట్; ప్రపంచం మారుతున్నప్పుడు, మోడల్ నిశ్శబ్దంగా వాడుకలో లేదు, పర్యవేక్షణ ఏర్పాటు చేయనందున గుర్తించబడదు ✔
  • సి) ఎంపిక పక్షపాతం; నమూనా పక్షపాతం
  • D) డేటా కనిష్టీకరణ ఉల్లంఘన

వివరణ: ఇది మోడల్ డ్రిఫ్ట్ (మోడల్/డేటా డ్రిఫ్ట్): ప్రపంచం మారినప్పుడు (కేటలాగ్, ప్రవర్తన, సీజన్) మోడల్ శిక్షణ పొందిన పరిస్థితులు మారినప్పుడు మరియు మోడల్ నిశ్శబ్దంగా విచ్ఛిన్నమవుతుంది. ఉత్పత్తిలో పెట్టబడిన మోడల్ దానికదే చెడిపోతుంది; ఇది 'ఎప్పుడు' అనే విషయం. పర్యవేక్షణ లేకుండా విస్తరణ (ట్రాకింగ్ ఇన్‌పుట్ మరియు పనితీరు) క్షీణతను గుర్తించడం అసాధ్యం.

14. ఒక సింగిల్ ట్రైనింగ్/టెస్ట్ స్ప్లిట్‌లో 88% ఖచ్చితత్వాన్ని పొందే మోడల్ 88%, 71%, 83%, 64%, 79% యొక్క 5 రెట్లు క్రాస్ ధ్రువీకరణ స్కోర్‌లను కలిగి ఉంటుంది. ఇది ఏమి సూచిస్తుంది మరియు క్రాస్ ధ్రువీకరణ ఎందుకు ముఖ్యమైనది?

  • ఎ) మోడల్ స్థిరంగా ఉంటుంది; 88% నిజమైన పనితీరు
  • బి) క్రాస్ ధ్రువీకరణ అనవసరం; ఒక కంపార్ట్మెంట్ సరిపోతుంది
  • సి) స్కోర్‌ల యొక్క పెద్ద అస్థిరత మోడల్ అస్థిరంగా ఉందని సూచిస్తుంది; బహుళ బిన్‌ల సగటు మరియు పంపిణీపై క్రాస్-వాలిడేషన్ బేస్ పనితీరు, ఒక్క లక్కీ బిన్ కాదు ✔
  • డి) అత్యధిక స్కోర్ (88%)ని నివేదించడం ఉత్తమం

వివరణ: ఒకే కంపార్ట్‌మెంట్ అదృష్టం లేదా దురదృష్టకరం; 88% ఆ సులభమైన విభజన ఫలితం. క్రాస్-ధృవీకరణ డేటాను అనేకసార్లు విభజిస్తుంది, సగటు (ఇక్కడ ~77%) పనితీరుపై ఆధారపడి ఉంటుంది మరియు స్కోర్‌ల అస్థిరతను చూపుతుంది. ఇక్కడ అధిక అస్థిరత మోడల్ అస్థిరంగా ఉందని సూచిస్తుంది; ఒకే కంపార్ట్‌మెంట్‌పై ఆధారపడటం తప్పుదారి పట్టించేది.