యూనిట్లు
1. ఎకనామెట్రిక్స్ మరియు స్టాటిస్టిక్స్‌లో ఆర్టిఫిషియల్ ఇంటెలిజెన్స్: పాత్రలు, సరిహద్దులు, ప్రమాణీకరణ మరియు గోప్యత 2. డేటా క్లీనింగ్ మరియు ప్రిపరేషన్: మిస్సింగ్ డేటా, అవుట్‌లియర్స్ మరియు కోడింగ్ 3. అన్వేషణాత్మక డేటా విశ్లేషణ మరియు విజువలైజేషన్: కృత్రిమ మేధస్సుతో గ్రాఫింగ్ మరియు వివరణ 4. లీనియర్ రిగ్రెషన్: మోడల్ బిల్డింగ్, కోఎఫీషియంట్ ఇంటర్‌ప్రిటేషన్ మరియు అస్ప్షన్స్ 5. రిగ్రెషన్ డయాగ్నోస్టిక్స్ మరియు ఉల్లంఘనలు: కోలినియారిటీ, హెటెరోస్కేడాస్టిసిటీ, ఆటోకోరిలేషన్ 6. పరికల్పన పరీక్ష మరియు p-విలువ: ప్రాముఖ్యత, శక్తి మరియు బహుళ పోలికలు 7. p-హ్యాకింగ్, హార్కింగ్ మరియు గణాంక సమగ్రత: ఆర్టిఫిషియల్ ఇంటెలిజెన్స్ యుగంలో ఆపదలు 8. సమయ శ్రేణి విశ్లేషణ: స్థిరత్వం, ARIMA మరియు అంచనా 9. కారణం మరియు విధాన విశ్లేషణ: డిఐడి, IV, RDD మరియు ఆర్టిఫిషియల్ ఇంటెలిజెన్స్ 10. కోడ్ ఉత్పత్తి మరియు పునరుత్పత్తి: R/Python, సంస్కరణ మరియు పునరుత్పత్తి 11. రిపోర్ట్ రైటింగ్, కమ్యూనికేషన్ మరియు ఎథిక్స్: ఫలితాలను ప్రదర్శించడం మరియు సరిహద్దులను కమ్యూనికేట్ చేయడం
యూనిట్ 2 / 11

డేటా క్లీనింగ్ మరియు ప్రిపరేషన్: మిస్సింగ్ డేటా, అవుట్‌లియర్స్ మరియు కోడింగ్

లాభాలు:

  • తప్పిపోయిన డేటా రకాలు (MCAR/MAR/MNAR), అవుట్‌లయర్‌లు మరియు కోడింగ్ ఎర్రర్‌లను గుర్తించగల సామర్థ్యం మరియు క్లీనప్ కోడ్ మరియు డయాగ్నస్టిక్‌లను రూపొందించడానికి సరైన డేటాతో AIని ఉపయోగించడం
  • కృత్రిమ మేధస్సు ద్వారా సూచించబడిన ప్రతి శుభ్రపరిచే దశ (తొలగింపు, అసైన్‌మెంట్, రూపాంతరం) విశ్లేషణ ఫలితాన్ని ఎలా ప్రభావితం చేస్తుందో మరియు రివర్సిబుల్ మరియు డాక్యుమెంట్ చేయబడిన వర్క్‌ఫ్లోను ఎలా ఏర్పాటు చేస్తుందో చూడగల సామర్థ్యం
  • క్లీనప్ నిర్ణయాలు డేటాను ఉత్పత్తి చేసే ప్రక్రియకు సంబంధించిన పరిజ్ఞానంపై ఆధారపడి ఉన్నాయని మరియు కృత్రిమ మేధస్సు అనేది ఒక బ్లైండ్ ఆటోమేటన్ కాదు, పర్యవేక్షించబడే సహాయకుడు అని నిర్వహించడం

ప్రతి అనుభవజ్ఞుడైన విశ్లేషకుడికి ఒక నిజం తెలుసు: చాలా వరకు అనుభావిక ప్రాజెక్ట్ మోడలింగ్ కాదు, కానీ డేటా క్లీనింగ్ (డేటాలోని లోపాలు, లోపాలను మరియు అసమానతలను సరిదిద్దడం మరియు దానిని విశ్లేషణకు సిద్ధం చేయడం). బొటనవేలు యొక్క కఠినమైన నియమం ప్రకారం, దాదాపు 70-80% సమయం డేటాను అర్థం చేసుకోవడం, శుభ్రపరచడం మరియు మార్చడం జరుగుతుంది; వాస్తవ విశ్లేషణకు 20-30% మాత్రమే మిగిలి ఉంది. ఈ యూనిట్‌లో, ఆర్టిఫిషియల్ ఇంటెలిజెన్స్ (AI) ఈ భారీ భారాన్ని ఎలా తగ్గించగలదో మనం దశలవారీగా చూస్తాము, అయితే ఏ నిర్ణయాలు ఇప్పటికీ మీతో ఉండాలి మరియు ఎందుకు ఉండాలి.

రెండు ప్రాథమిక వాస్తవాలను ముందు ఉంచుదాం. ముందుగా, శుభ్రపరిచే నిర్ణయాలు డేటాను ఉత్పత్తి చేసే ప్రక్రియ గురించి మీకున్న జ్ఞానంపై ఆధారపడి ఉంటాయి: విలువ ఎందుకు లేదు, ఒక సంఖ్య ఎందుకు ఎక్కువగా ఉందో మీకు మాత్రమే తెలుసు. AI డేటాను చూడదు, సందర్భం తెలియదు; కోడ్ వ్రాస్తుంది, నిర్ణయాలు తీసుకోదు. రెండవది, ప్రతి శుభ్రపరిచే దశ విశ్లేషణ ఫలితాన్ని మార్చవచ్చు. అవుట్‌లియర్‌ను తొలగించడం వలన గుణకం విలోమం చేయవచ్చు; తప్పిపోయిన వాటిని సగటుతో పూరించడం ద్వారా వ్యత్యాసాన్ని కృత్రిమంగా తగ్గించవచ్చు. కాబట్టి క్లీనప్ రివర్సిబుల్ మరియు డాక్యుమెంట్ చేయబడాలి: ముడి డేటాను ఎప్పుడూ తాకవద్దు, కోడ్‌లో ప్రతి దశను చేయండి, ప్రతి దశ ప్రభావాన్ని రికార్డ్ చేయండి.

దశల వారీ శుభ్రపరిచే వర్క్‌ఫ్లో

1. డేటాను తెలుసుకోండి. మొదట నిర్మాణాన్ని చూడండి: అడ్డు వరుసల సంఖ్య (పరిశీలనలు) మరియు నిలువు వరుసలు (వేరియబుల్స్), ప్రతి వేరియబుల్ రకం (సంఖ్యా, వర్గీకరణ, తేదీ), సారాంశ గణాంకాలు, తప్పిపోయిన సంఖ్య. మీరు ఈ "డేటా ప్రొఫైల్" కోడ్ కోసం AIని అడగవచ్చు; కానీ మీరు అవుట్‌పుట్‌ని చదివి "ఈ వేరియబుల్ టెక్స్ట్‌గా ఎందుకు వచ్చింది?" వంటి ప్రశ్నలను అడగండి.

2. తప్పిపోయిన డేటాను అర్థం చేసుకోండి మరియు వర్గీకరించండి. మిస్సింగ్ డేటా మూడు రకాలుగా విభజించబడింది. MCAR (యాదృచ్ఛికంగా పూర్తిగా తప్పిపోయింది): తప్పిపోయినది ఏదైనా కారణం కాదు, ఉదాహరణకు సెన్సార్ యాదృచ్ఛికంగా విఫలమైంది. MAR (యాదృచ్ఛికంగా తప్పిపోయింది): తప్పిపోవడం ఇతర గమనించిన వేరియబుల్స్‌పై ఆధారపడి ఉంటుంది, ఉదాహరణకు పెద్దలు తరచుగా ప్రశ్నను ఖాళీగా ఉంచుతారు, కానీ మీకు వయస్సు తెలుసు. MNAR (యాదృచ్ఛికంగా లేదు): తప్పిపోవడం అనేది గమనించని విలువపై ఆధారపడి ఉంటుంది, ఉదాహరణకు అధిక సంపాదన కలిగిన వారు తమ ఆదాయాన్ని నివేదించరు. ఈ వ్యత్యాసం చాలా ముఖ్యమైనది ఎందుకంటే ఇది పరిష్కార పద్ధతిని నిర్ణయిస్తుంది మరియు AI మీ కోసం దీన్ని నిర్ణయించదు.

3. లోపంతో వ్యవహరించండి. ఎంపికలు: జాబితావారీగా తొలగింపు, సగటు/మధ్యస్థ ఇంప్యుటేషన్, మోడల్-ఆధారిత బహుళ ఇంప్యుటేషన్. MCARలో తొలగింపు సాపేక్షంగా సురక్షితమైనది కానీ నమూనా పరిమాణాన్ని తగ్గిస్తుంది. MARలో బహుళ అసైన్‌మెంట్ మరింత సముచితమైనది. MNARలో నిష్పాక్షికతకు ఎలాంటి సాధారణ పద్ధతి హామీ ఇవ్వదు; లోపం మెకానిజం మోడల్ చేయబడాలి లేదా కనీసం సున్నితత్వ విశ్లేషణ చేయాలి. మీన్-ఫిల్లింగ్ సులభం కానీ ప్రమాదకరమైనది: ఇది వ్యత్యాసాన్ని తగ్గిస్తుంది, సంబంధాలను బలహీనపరుస్తుంది మరియు అనిశ్చితిని దాచిపెడుతుంది.

4. అవుట్‌లయర్‌లను పరిశీలించండి. అవుట్‌లియర్ అనేది ఇతరులకు చాలా దూరంగా ఉండే పరిశీలన. రెండు ప్రశ్నలను వేరు చేయండి: ఇది ఒక లోపమా (డేటా ఎంట్రీలో వయస్సు 999 అని వ్రాయబడింది) లేదా ఇది నిజమైన విలువేనా (బిలియనీర్ యొక్క ఆదాయం)? దోషాలను పరిష్కరించండి; నిజమైన అవుట్‌లయర్‌లను తొలగించవద్దు ఎందుకంటే అవి డేటాను సూచిస్తాయి. అవుట్‌లియర్‌ను తొలగించడం వలన "అది ఇబ్బంది పెడుతుంది" మీరు డేటాను ఫలితం వైపు తిప్పుతున్నారు.

5. కోడింగ్ మరియు స్థిరత్వం. వర్గాలను ప్రామాణీకరించండి ("పురుషుడు", "పురుషుడు", "E" అన్నీ ఒకే కోడ్‌లోకి వస్తాయి), తేదీలను ఒక ఫార్మాట్‌లోకి, యూనిట్‌లను ఒక స్కేల్‌లోకి తీసుకురండి, నకిలీ అడ్డు వరుసలను గుర్తించండి. AI ఉత్తమంగా సహాయపడే అతి తక్కువ ప్రమాదకర దశ ఇది.

6. డాక్యుమెంట్ మరియు ఫ్రీజ్. ప్రతి దశను కోడ్ మరియు వ్యాఖ్య లైన్‌తో రికార్డ్ చేయండి, ముడి మరియు శుభ్రపరచిన డేటాను వేరుగా ఉంచండి. కాబట్టి ఒక రిఫరీ "ఈ పరిశీలనలు ఎందుకు తొలగించబడ్డాయి?" అని అడిగినప్పుడు మీ సమాధానం సిద్ధంగా ఉంది.

హెచ్చరిక: ఫలితాల ఆధారంగా శుభ్రపరిచే నిర్ణయాలు తీసుకోకండి. "మీరు ఈ పంక్తిని తొలగించినప్పుడు, గుణకం ముఖ్యమైనదిగా మారుతుంది" అనే పంక్తిని తొలగించడం అనేది p-హ్యాకింగ్ యొక్క అత్యంత కృత్రిమ రూపం, దీనిని మనం తదుపరి యూనిట్‌లో చూస్తాము.

పోలిక పట్టిక: డేటా పద్ధతులు లేవు

పద్ధతి

ఇది ఎప్పుడు తగినది?

ప్రమాదం

AI పాత్ర

అడ్డు వరుసను తొలగించండి

MCAR, తక్కువ తప్పిపోయిన రేటు

MAR/MNARలో నమూనా చిన్నదిగా మారుతుంది

కోడ్ వ్రాస్తుంది; మీరు నిర్ణయించుకోండి

సగటు/మధ్యస్థ అసైన్‌మెంట్

త్వరిత ప్రాథమిక విశ్లేషణ

వ్యత్యాసాన్ని తగ్గిస్తుంది, సంబంధాన్ని దాచిపెడుతుంది

ఇది సులభం కానీ దీన్ని సిఫార్సు చేయదు; హెచ్చరించాలి

బహుళ అసైన్‌మెంట్ (MI)

MAR, ముఖ్యమైన వేరియబుల్స్

సరిగ్గా ఇన్‌స్టాల్ చేయకపోతే అది తప్పుదారి పట్టిస్తుంది

కోడ్ మరియు ప్యాకేజీని సిఫార్సు చేస్తుంది (ఎలుకలు)

మెకానిజం మోడలింగ్

MNAR

కాంప్లెక్స్, ఊహ-ఇంటెన్సివ్

డ్రాఫ్ట్ మాత్రమే; నిపుణుడు అవసరం

నాలుగు కాపీ చేయదగిన ప్రాంప్ట్‌లు

1. డేటా ప్రొఫైలింగ్:

మీ పాత్ర: డేటా క్లెన్సింగ్ అసిస్టెంట్. నేను డేటాను షేర్ చేయను, నాకు R కోడ్ కావాలి. నా దగ్గర 'డిజిట్' అనే డేటా.ఫ్రేమ్ ఉంది; వేరియబుల్స్: id, వయస్సు (సంఖ్యా), ఆదాయం (సంఖ్యా), విద్య (వర్గీకరణ), ప్రాంతం (వర్గం), తేదీ (తేదీ). టాస్క్: ప్రతి వేరియబుల్ కోసం రకం, తప్పిపోయిన సంఖ్య మరియు రేటు, సంఖ్యా వాటి కోసం సారాంశ గణాంకాలు మరియు వర్గీకరణ కోసం ఫ్రీక్వెన్సీ పట్టికను ఉత్పత్తి చేసే కోడ్‌ను వ్రాయండి. వ్యాఖ్య లైన్ జోడించండి.

2. డేటా నిర్ధారణ లేదు:

ఎగువన ఉన్న 'అంకె' డేటా కోసం తప్పిపోయిన నమూనాను పరిశీలించే కోడ్‌ను వ్రాయండి: - ప్రతి వేరియబుల్ యొక్క తప్పిపోయిన రేటు, - ఇతర వేరియబుల్‌లకు తప్పిపోయిన సంబంధాన్ని చూపే సాధారణ పట్టిక/గ్రాఫ్. నేను కోడ్ అవుట్‌పుట్‌ని పరిశీలిస్తాను మరియు MCAR/MAR/MNAR వ్యత్యాసాన్ని చేస్తాను; మీరు డయాగ్నస్టిక్ టూల్‌ను మాత్రమే ఉత్పత్తి చేస్తారు, అసైన్‌మెంట్ పద్ధతిని నిర్ణయించవద్దు.

3. అవుట్‌లియర్ తనిఖీ (తొలగింపు కాదు):

వేరియబుల్ 'ఆదాయం' కోసం కోడ్‌ను వ్రాయండి, అది తొలగించకుండా అవుట్‌లయర్‌లను పరిశీలిస్తుంది: బాక్స్‌ప్లాట్, IQR-ఆధారిత హద్దులు మరియు పట్టిక జాబితా అవుట్‌లియర్ పరిశీలనలు + విలువలు. ఇవి తప్పా నిజమా అని చూస్తాను. స్వయంచాలక తొలగింపును జోడించండి.

4. కోడింగ్ ప్రమాణీకరణ:

'ఎడ్యుకేషన్' వేరియబుల్‌లో, విలువలు మిశ్రమంగా వ్రాయబడ్డాయి: "ప్రాథమిక పాఠశాల", "ప్రాథమిక పాఠశాల", "ప్రాథమిక", "ఉన్నత పాఠశాల", "ఉన్నత పాఠశాల", "విశ్వవిద్యాలయం", "విశ్వవిద్యాలయం". వీటిని స్థిరమైన వర్గాలుగా రీకోడ్ చేసే R కోడ్‌ని వ్రాయండి; మ్యాపింగ్ పట్టికను స్పష్టంగా చూపండి, తద్వారా నేను ప్రతి మార్పిడిని నిర్ధారించగలను. మీరు గుర్తించని విలువను "తెలియని"కి సెట్ చేయండి.

బలహీనమైన ప్రాంప్ట్ / బలమైన ప్రాంప్ట్

బలహీనమైన ప్రాంప్ట్:

డేటాను క్లీన్ అప్ చేయండి, ఖాళీలను పూరించండి, అవుట్‌లయర్‌లను విస్మరించండి.

ఈ డిమాండ్ ప్రమాదకరమైనది: ఇది AIకి గుడ్డి అధికారాన్ని ఇస్తుంది. ఏ రకం తప్పిపోయింది, ఎలాంటి పూరకం, ఏ విరుద్ధమైన నిజం - ఏదీ స్పష్టంగా లేదు. ఫలితంగా రహస్యంగా పక్షపాత డేటా సెట్ కావచ్చు.

శక్తివంతమైన ప్రాంప్ట్:

మీ పాత్ర: క్లీనింగ్ అసిస్టెంట్, మీరు నిర్ణయాధికారం కాదు. దశల వారీగా వెళ్లి, ప్రతి దశ ప్రభావాన్ని నివేదించే కోడ్‌ను వ్రాయండి: 1) తప్పిపోయిన నమూనాను చూపండి (తొలగించవద్దు/పూరించవద్దు), 2) జాబితా అవుట్‌లియర్ అభ్యర్థులు (తొలగించవద్దు), 3) మ్యాపింగ్ పట్టికతో వర్గ అసమానతలను పరిష్కరించండి. ప్రతి దశ తర్వాత అడ్డు వరుసల సంఖ్య మరియు సారాంశం గణాంకాలను ముద్రించండి, తద్వారా నేను మార్పును చూడగలను మరియు నిర్ధారించగలను. స్వయంచాలక కేటాయింపు/తొలగింపు చొప్పించడం.

తేడా స్పష్టంగా ఉంది: బలమైన సంకల్పం AIని పర్యవేక్షించబడిన సహాయకుడిగా ఉంచుతుంది, రివర్సిబుల్ మరియు డాక్యుమెంట్ చేయబడిన దశలను ఉత్పత్తి చేస్తుంది.

మూడు చిన్న కేసులు

కేసు 1 — సగటు అసైన్‌మెంట్ ట్రాప్. 5,000 మంది వ్యక్తుల కోసం ఒక విశ్లేషకుడి ఆదాయ డేటా 18% లేదు. అతను AIకి "ఖాళీలను పూరించమని" చెప్పాడు; AI వాటన్నింటినీ సగటున అంచనా వేసింది. ఫలితం: ఆదాయం యొక్క వ్యత్యాసం 22% తగ్గింది మరియు విద్య-ఆదాయ సంబంధం యొక్క గుణకం దాని కంటే బలహీనంగా మారింది. సరైన మార్గం: లోపం MAR (విద్య కారణంగా), బహుళ అసైన్‌మెంట్ (ఎలుకలు) ద్వారా పూరించాల్సి ఉంటుంది. పాఠం: నింపే పద్ధతి యంత్రాంగంపై ఆధారపడి ఉంటుంది.

కేస్ 2 - అవుట్‌లియర్ క్లీనింగ్ అన్వేషణను రివర్స్ చేస్తుంది. ఒక సంస్థ డేటాలో 3 చాలా పెద్ద సంస్థలు (మొత్తం పరిశీలనలో 0.6%) ఉన్నాయి. AI యొక్క "క్లీనింగ్" సూచన ద్వారా ఇవి తొలగించబడ్డాయి; స్కేల్ కోఎఫీషియంట్ యొక్క ఆర్థిక వ్యవస్థలు సానుకూల నుండి ప్రతికూలంగా మారాయి. అయితే, ఆ 3 కంపెనీలు నిజమైనవి మరియు పరిశ్రమలో ముఖ్యమైన భాగం. తొలగించడానికి బదులుగా పూర్తి మరియు బలమైన అంచనాతో నివేదించడం సరైన మార్గం. పాఠం: నిజమైన అవుట్‌లియర్‌లు డేటా, శబ్దం కాదు.

కేస్ 3 - సైలెంట్ కోడింగ్ లోపం. ఒక ప్యానెల్‌లో, తేదీ వేరియబుల్ రెండు వేర్వేరు ఫార్మాట్‌లలో వచ్చింది ("2020-03-01" మరియు "01/03/2020"). AI రూపొందించిన కాంబినేషన్ కోడ్ వాటిని వేర్వేరు విలువల కోసం తప్పుగా భావించినప్పుడు, 1,400 పరిశీలనలు సరిపోలలేదు మరియు వృద్ధి రేట్లు హాస్యాస్పదంగా మారాయి. విశ్లేషకుడు వరుసల సంఖ్యను తనిఖీ చేయకపోయినా పర్వాలేదు. పాఠం: ప్రతి దశ తర్వాత పరిశీలన గణనలు మరియు చిత్తశుద్ధి తనిఖీలు తప్పనిసరి.

సాధారణ తప్పులు

  • గుడ్డిగా సగటుతో ఖాళీని పూరించడం. ఇది వ్యత్యాసాన్ని తగ్గిస్తుంది, అనిశ్చితిని దాచిపెడుతుంది మరియు MAR/MNARలో పక్షపాతాన్ని సృష్టిస్తుంది. మొదట యంత్రాంగాన్ని వర్గీకరించండి.
  • అవుట్‌లియర్‌ను తొలగిస్తోంది "ఎందుకంటే ఇది ఇబ్బంది పెడుతుంది". నిజమైన అవుట్‌లైయర్‌లు డేటాను సూచిస్తాయి; తొలగించడం ఫలితాన్ని వంచుతోంది. తప్పును సరిదిద్దండి, వాస్తవమైనదాన్ని ఉంచండి.
  • ముడి డేటాను నొక్కడం. ముడి డేటాను ఎప్పుడూ సవరించవద్దు; కోడ్‌తో అన్ని క్లీనప్‌లను ప్రత్యేక కాపీలో చేయండి, తద్వారా దాన్ని తిరిగి మార్చవచ్చు.
  • దశల ప్రభావాన్ని కొలవడం లేదు. ప్రతి దశ తర్వాత అడ్డు వరుసల సంఖ్య మరియు సారాంశం గణాంకాలను తనిఖీ చేయకపోతే, నిశ్శబ్ద లోపాలు పేరుకుపోతాయి.
  • ఫలితంగా శుభ్రపరచడం. "మీరు ఈ పంక్తిని జోడించినప్పుడు, ఫలితం మెరుగ్గా మారుతుంది" యొక్క తర్కం p-హ్యాకింగ్; విశ్లేషణ ఫలితానికి ముందు మరియు స్వతంత్రంగా క్లీనింగ్ ప్లాన్ చేయాలి.
చిట్కా: క్లీనప్‌కు ముందు మరియు తర్వాత అదే ప్రాథమిక గణాంకాలను (సగటు, మధ్యస్థ, పరిశీలనల సంఖ్య, కొన్ని సహసంబంధాలు) పక్కపక్కనే ఉంచే "ముందు/తర్వాత" పట్టికను ఉంచండి. ఊహించని జంప్ అనేది దాచిన లోపానికి ఉత్తమమైన సూచన.

సారాంశంలో

డేటా క్లీనింగ్ అనేది అనుభావిక పనిలో ఎక్కువ సమయం తీసుకునే మరియు నిర్ణయం తీసుకోవాల్సిన దశ. AI అనేది ఇందులో శక్తివంతమైన కోడ్ జెనరేటర్, కానీ అది షాట్‌లను పిలవదు: మీరు తప్పిపోయిన డేటా రకాన్ని (MCAR/MAR/MNAR) వర్గీకరిస్తారు, అవుట్‌లియర్ లోపం లేదా వాస్తవమా అని నిర్ణయించండి, ప్రతి దశను తిప్పికొట్టేలా మరియు డాక్యుమెంట్‌గా ఉంచండి. AI బ్లైండ్ "స్పష్టమైన" అధికారాన్ని ఇవ్వడానికి బదులుగా, దాని ప్రభావం కొలవబడిన మరియు ధృవీకరించబడిన దశల వారీ వర్క్‌ఫ్లోను ఏర్పాటు చేయండి. ప్రతి దశ తర్వాత పరిశీలనల సంఖ్య మరియు సారాంశం గణాంకాలను తనిఖీ చేయడం నిశ్శబ్ద లోపాలకు ఉత్తమ విరుగుడు.

అప్లికేషన్ టాస్క్

డేటా సెట్‌లో (మీ స్వంత డేటా లేదా నమూనా సెట్) తప్పిపోయిన మరియు అవుట్‌లయర్‌లను కలిగి ఉన్న కనీసం రెండు వేరియబుల్‌లను ఎంచుకోండి. పైన ఉన్న "దశల వారీగా, తొలగించవద్దు/పూరించవద్దు" ప్రాంప్ట్ ద్వారా AI నుండి డయాగ్నస్టిక్ కోడ్‌ను అభ్యర్థించండి మరియు దాన్ని అమలు చేయండి. లోపాన్ని MCAR/MAR/MNARగా వర్గీకరించండి మరియు మీ సమర్థనను ఒక వాక్యంలో వ్రాయండి. పరస్పర విరుద్ధమైన అభ్యర్థులను ఒక్కొక్కటిగా పరిశీలించి, ఏది తప్పు, ఏది వాస్తవమో నిర్ణయించండి. చివరగా, శుభ్రపరిచే ముందు/తర్వాత "ముందు-తర్వాత" పట్టికను రూపొందించండి మరియు ఏవైనా ఊహించని మార్పులు ఉంటే నివేదించండి.

చెక్లిస్ట్

  • [ ] నేను ముడి డేటాను మార్చకుండా ప్రత్యేక కాపీలో శుభ్రం చేసాను.
  • [ ] నేను లోపాన్ని MCAR/MAR/MNARగా వర్గీకరించాను మరియు తదనుగుణంగా పద్ధతిని ఎంచుకున్నాను.
  • [ ] నేను అవుట్‌లయర్‌లను ఒక్కొక్కటిగా పరిశీలించాను, అవి లోపాలు ఉన్నాయా లేదా నిజమా అని; నేను దానిని గుడ్డిగా తొలగించలేదు.
  • [ ] నేను ప్రతి శుభ్రపరిచే దశ తర్వాత పరిశీలనల సంఖ్య మరియు సారాంశ గణాంకాలను తనిఖీ చేసాను.
  • [ ] నేను అన్ని దశలను కోడ్ మరియు వ్యాఖ్య లైన్‌తో డాక్యుమెంట్ చేసాను; తిప్పికొట్టే.
  • [ ] నేను డేటాను ఉత్పత్తి చేసే ప్రక్రియ యొక్క పరిజ్ఞానంపై క్లీనింగ్ ఆధారంగా, విశ్లేషణ ఫలితంపై కాదు.