లాభాలు:
- తప్పిపోయిన డేటా రకాలు (MCAR/MAR/MNAR), అవుట్లయర్లు మరియు కోడింగ్ ఎర్రర్లను గుర్తించగల సామర్థ్యం మరియు క్లీనప్ కోడ్ మరియు డయాగ్నస్టిక్లను రూపొందించడానికి సరైన డేటాతో AIని ఉపయోగించడం
- కృత్రిమ మేధస్సు ద్వారా సూచించబడిన ప్రతి శుభ్రపరిచే దశ (తొలగింపు, అసైన్మెంట్, రూపాంతరం) విశ్లేషణ ఫలితాన్ని ఎలా ప్రభావితం చేస్తుందో మరియు రివర్సిబుల్ మరియు డాక్యుమెంట్ చేయబడిన వర్క్ఫ్లోను ఎలా ఏర్పాటు చేస్తుందో చూడగల సామర్థ్యం
- క్లీనప్ నిర్ణయాలు డేటాను ఉత్పత్తి చేసే ప్రక్రియకు సంబంధించిన పరిజ్ఞానంపై ఆధారపడి ఉన్నాయని మరియు కృత్రిమ మేధస్సు అనేది ఒక బ్లైండ్ ఆటోమేటన్ కాదు, పర్యవేక్షించబడే సహాయకుడు అని నిర్వహించడం
ప్రతి అనుభవజ్ఞుడైన విశ్లేషకుడికి ఒక నిజం తెలుసు: చాలా వరకు అనుభావిక ప్రాజెక్ట్ మోడలింగ్ కాదు, కానీ డేటా క్లీనింగ్ (డేటాలోని లోపాలు, లోపాలను మరియు అసమానతలను సరిదిద్దడం మరియు దానిని విశ్లేషణకు సిద్ధం చేయడం). బొటనవేలు యొక్క కఠినమైన నియమం ప్రకారం, దాదాపు 70-80% సమయం డేటాను అర్థం చేసుకోవడం, శుభ్రపరచడం మరియు మార్చడం జరుగుతుంది; వాస్తవ విశ్లేషణకు 20-30% మాత్రమే మిగిలి ఉంది. ఈ యూనిట్లో, ఆర్టిఫిషియల్ ఇంటెలిజెన్స్ (AI) ఈ భారీ భారాన్ని ఎలా తగ్గించగలదో మనం దశలవారీగా చూస్తాము, అయితే ఏ నిర్ణయాలు ఇప్పటికీ మీతో ఉండాలి మరియు ఎందుకు ఉండాలి.
రెండు ప్రాథమిక వాస్తవాలను ముందు ఉంచుదాం. ముందుగా, శుభ్రపరిచే నిర్ణయాలు డేటాను ఉత్పత్తి చేసే ప్రక్రియ గురించి మీకున్న జ్ఞానంపై ఆధారపడి ఉంటాయి: విలువ ఎందుకు లేదు, ఒక సంఖ్య ఎందుకు ఎక్కువగా ఉందో మీకు మాత్రమే తెలుసు. AI డేటాను చూడదు, సందర్భం తెలియదు; కోడ్ వ్రాస్తుంది, నిర్ణయాలు తీసుకోదు. రెండవది, ప్రతి శుభ్రపరిచే దశ విశ్లేషణ ఫలితాన్ని మార్చవచ్చు. అవుట్లియర్ను తొలగించడం వలన గుణకం విలోమం చేయవచ్చు; తప్పిపోయిన వాటిని సగటుతో పూరించడం ద్వారా వ్యత్యాసాన్ని కృత్రిమంగా తగ్గించవచ్చు. కాబట్టి క్లీనప్ రివర్సిబుల్ మరియు డాక్యుమెంట్ చేయబడాలి: ముడి డేటాను ఎప్పుడూ తాకవద్దు, కోడ్లో ప్రతి దశను చేయండి, ప్రతి దశ ప్రభావాన్ని రికార్డ్ చేయండి.
దశల వారీ శుభ్రపరిచే వర్క్ఫ్లో
1. డేటాను తెలుసుకోండి. మొదట నిర్మాణాన్ని చూడండి: అడ్డు వరుసల సంఖ్య (పరిశీలనలు) మరియు నిలువు వరుసలు (వేరియబుల్స్), ప్రతి వేరియబుల్ రకం (సంఖ్యా, వర్గీకరణ, తేదీ), సారాంశ గణాంకాలు, తప్పిపోయిన సంఖ్య. మీరు ఈ "డేటా ప్రొఫైల్" కోడ్ కోసం AIని అడగవచ్చు; కానీ మీరు అవుట్పుట్ని చదివి "ఈ వేరియబుల్ టెక్స్ట్గా ఎందుకు వచ్చింది?" వంటి ప్రశ్నలను అడగండి.
2. తప్పిపోయిన డేటాను అర్థం చేసుకోండి మరియు వర్గీకరించండి. మిస్సింగ్ డేటా మూడు రకాలుగా విభజించబడింది. MCAR (యాదృచ్ఛికంగా పూర్తిగా తప్పిపోయింది): తప్పిపోయినది ఏదైనా కారణం కాదు, ఉదాహరణకు సెన్సార్ యాదృచ్ఛికంగా విఫలమైంది. MAR (యాదృచ్ఛికంగా తప్పిపోయింది): తప్పిపోవడం ఇతర గమనించిన వేరియబుల్స్పై ఆధారపడి ఉంటుంది, ఉదాహరణకు పెద్దలు తరచుగా ప్రశ్నను ఖాళీగా ఉంచుతారు, కానీ మీకు వయస్సు తెలుసు. MNAR (యాదృచ్ఛికంగా లేదు): తప్పిపోవడం అనేది గమనించని విలువపై ఆధారపడి ఉంటుంది, ఉదాహరణకు అధిక సంపాదన కలిగిన వారు తమ ఆదాయాన్ని నివేదించరు. ఈ వ్యత్యాసం చాలా ముఖ్యమైనది ఎందుకంటే ఇది పరిష్కార పద్ధతిని నిర్ణయిస్తుంది మరియు AI మీ కోసం దీన్ని నిర్ణయించదు.
3. లోపంతో వ్యవహరించండి. ఎంపికలు: జాబితావారీగా తొలగింపు, సగటు/మధ్యస్థ ఇంప్యుటేషన్, మోడల్-ఆధారిత బహుళ ఇంప్యుటేషన్. MCARలో తొలగింపు సాపేక్షంగా సురక్షితమైనది కానీ నమూనా పరిమాణాన్ని తగ్గిస్తుంది. MARలో బహుళ అసైన్మెంట్ మరింత సముచితమైనది. MNARలో నిష్పాక్షికతకు ఎలాంటి సాధారణ పద్ధతి హామీ ఇవ్వదు; లోపం మెకానిజం మోడల్ చేయబడాలి లేదా కనీసం సున్నితత్వ విశ్లేషణ చేయాలి. మీన్-ఫిల్లింగ్ సులభం కానీ ప్రమాదకరమైనది: ఇది వ్యత్యాసాన్ని తగ్గిస్తుంది, సంబంధాలను బలహీనపరుస్తుంది మరియు అనిశ్చితిని దాచిపెడుతుంది.
4. అవుట్లయర్లను పరిశీలించండి. అవుట్లియర్ అనేది ఇతరులకు చాలా దూరంగా ఉండే పరిశీలన. రెండు ప్రశ్నలను వేరు చేయండి: ఇది ఒక లోపమా (డేటా ఎంట్రీలో వయస్సు 999 అని వ్రాయబడింది) లేదా ఇది నిజమైన విలువేనా (బిలియనీర్ యొక్క ఆదాయం)? దోషాలను పరిష్కరించండి; నిజమైన అవుట్లయర్లను తొలగించవద్దు ఎందుకంటే అవి డేటాను సూచిస్తాయి. అవుట్లియర్ను తొలగించడం వలన "అది ఇబ్బంది పెడుతుంది" మీరు డేటాను ఫలితం వైపు తిప్పుతున్నారు.
5. కోడింగ్ మరియు స్థిరత్వం. వర్గాలను ప్రామాణీకరించండి ("పురుషుడు", "పురుషుడు", "E" అన్నీ ఒకే కోడ్లోకి వస్తాయి), తేదీలను ఒక ఫార్మాట్లోకి, యూనిట్లను ఒక స్కేల్లోకి తీసుకురండి, నకిలీ అడ్డు వరుసలను గుర్తించండి. AI ఉత్తమంగా సహాయపడే అతి తక్కువ ప్రమాదకర దశ ఇది.
6. డాక్యుమెంట్ మరియు ఫ్రీజ్. ప్రతి దశను కోడ్ మరియు వ్యాఖ్య లైన్తో రికార్డ్ చేయండి, ముడి మరియు శుభ్రపరచిన డేటాను వేరుగా ఉంచండి. కాబట్టి ఒక రిఫరీ "ఈ పరిశీలనలు ఎందుకు తొలగించబడ్డాయి?" అని అడిగినప్పుడు మీ సమాధానం సిద్ధంగా ఉంది.
హెచ్చరిక: ఫలితాల ఆధారంగా శుభ్రపరిచే నిర్ణయాలు తీసుకోకండి. "మీరు ఈ పంక్తిని తొలగించినప్పుడు, గుణకం ముఖ్యమైనదిగా మారుతుంది" అనే పంక్తిని తొలగించడం అనేది p-హ్యాకింగ్ యొక్క అత్యంత కృత్రిమ రూపం, దీనిని మనం తదుపరి యూనిట్లో చూస్తాము.
పోలిక పట్టిక: డేటా పద్ధతులు లేవు
పద్ధతి
ఇది ఎప్పుడు తగినది?
ప్రమాదం
AI పాత్ర
అడ్డు వరుసను తొలగించండి
MCAR, తక్కువ తప్పిపోయిన రేటు
MAR/MNARలో నమూనా చిన్నదిగా మారుతుంది
కోడ్ వ్రాస్తుంది; మీరు నిర్ణయించుకోండి
సగటు/మధ్యస్థ అసైన్మెంట్
త్వరిత ప్రాథమిక విశ్లేషణ
వ్యత్యాసాన్ని తగ్గిస్తుంది, సంబంధాన్ని దాచిపెడుతుంది
ఇది సులభం కానీ దీన్ని సిఫార్సు చేయదు; హెచ్చరించాలి
బహుళ అసైన్మెంట్ (MI)
MAR, ముఖ్యమైన వేరియబుల్స్
సరిగ్గా ఇన్స్టాల్ చేయకపోతే అది తప్పుదారి పట్టిస్తుంది
కోడ్ మరియు ప్యాకేజీని సిఫార్సు చేస్తుంది (ఎలుకలు)
మెకానిజం మోడలింగ్
MNAR
కాంప్లెక్స్, ఊహ-ఇంటెన్సివ్
డ్రాఫ్ట్ మాత్రమే; నిపుణుడు అవసరం
నాలుగు కాపీ చేయదగిన ప్రాంప్ట్లు
1. డేటా ప్రొఫైలింగ్:
మీ పాత్ర: డేటా క్లెన్సింగ్ అసిస్టెంట్. నేను డేటాను షేర్ చేయను, నాకు R కోడ్ కావాలి. నా దగ్గర 'డిజిట్' అనే డేటా.ఫ్రేమ్ ఉంది; వేరియబుల్స్: id, వయస్సు (సంఖ్యా), ఆదాయం (సంఖ్యా), విద్య (వర్గీకరణ), ప్రాంతం (వర్గం), తేదీ (తేదీ). టాస్క్: ప్రతి వేరియబుల్ కోసం రకం, తప్పిపోయిన సంఖ్య మరియు రేటు, సంఖ్యా వాటి కోసం సారాంశ గణాంకాలు మరియు వర్గీకరణ కోసం ఫ్రీక్వెన్సీ పట్టికను ఉత్పత్తి చేసే కోడ్ను వ్రాయండి. వ్యాఖ్య లైన్ జోడించండి.
2. డేటా నిర్ధారణ లేదు:
ఎగువన ఉన్న 'అంకె' డేటా కోసం తప్పిపోయిన నమూనాను పరిశీలించే కోడ్ను వ్రాయండి: - ప్రతి వేరియబుల్ యొక్క తప్పిపోయిన రేటు, - ఇతర వేరియబుల్లకు తప్పిపోయిన సంబంధాన్ని చూపే సాధారణ పట్టిక/గ్రాఫ్. నేను కోడ్ అవుట్పుట్ని పరిశీలిస్తాను మరియు MCAR/MAR/MNAR వ్యత్యాసాన్ని చేస్తాను; మీరు డయాగ్నస్టిక్ టూల్ను మాత్రమే ఉత్పత్తి చేస్తారు, అసైన్మెంట్ పద్ధతిని నిర్ణయించవద్దు.
3. అవుట్లియర్ తనిఖీ (తొలగింపు కాదు):
వేరియబుల్ 'ఆదాయం' కోసం కోడ్ను వ్రాయండి, అది తొలగించకుండా అవుట్లయర్లను పరిశీలిస్తుంది: బాక్స్ప్లాట్, IQR-ఆధారిత హద్దులు మరియు పట్టిక జాబితా అవుట్లియర్ పరిశీలనలు + విలువలు. ఇవి తప్పా నిజమా అని చూస్తాను. స్వయంచాలక తొలగింపును జోడించండి.
4. కోడింగ్ ప్రమాణీకరణ:
'ఎడ్యుకేషన్' వేరియబుల్లో, విలువలు మిశ్రమంగా వ్రాయబడ్డాయి: "ప్రాథమిక పాఠశాల", "ప్రాథమిక పాఠశాల", "ప్రాథమిక", "ఉన్నత పాఠశాల", "ఉన్నత పాఠశాల", "విశ్వవిద్యాలయం", "విశ్వవిద్యాలయం". వీటిని స్థిరమైన వర్గాలుగా రీకోడ్ చేసే R కోడ్ని వ్రాయండి; మ్యాపింగ్ పట్టికను స్పష్టంగా చూపండి, తద్వారా నేను ప్రతి మార్పిడిని నిర్ధారించగలను. మీరు గుర్తించని విలువను "తెలియని"కి సెట్ చేయండి.
బలహీనమైన ప్రాంప్ట్ / బలమైన ప్రాంప్ట్
బలహీనమైన ప్రాంప్ట్:
డేటాను క్లీన్ అప్ చేయండి, ఖాళీలను పూరించండి, అవుట్లయర్లను విస్మరించండి.
ఈ డిమాండ్ ప్రమాదకరమైనది: ఇది AIకి గుడ్డి అధికారాన్ని ఇస్తుంది. ఏ రకం తప్పిపోయింది, ఎలాంటి పూరకం, ఏ విరుద్ధమైన నిజం - ఏదీ స్పష్టంగా లేదు. ఫలితంగా రహస్యంగా పక్షపాత డేటా సెట్ కావచ్చు.
శక్తివంతమైన ప్రాంప్ట్:
మీ పాత్ర: క్లీనింగ్ అసిస్టెంట్, మీరు నిర్ణయాధికారం కాదు. దశల వారీగా వెళ్లి, ప్రతి దశ ప్రభావాన్ని నివేదించే కోడ్ను వ్రాయండి: 1) తప్పిపోయిన నమూనాను చూపండి (తొలగించవద్దు/పూరించవద్దు), 2) జాబితా అవుట్లియర్ అభ్యర్థులు (తొలగించవద్దు), 3) మ్యాపింగ్ పట్టికతో వర్గ అసమానతలను పరిష్కరించండి. ప్రతి దశ తర్వాత అడ్డు వరుసల సంఖ్య మరియు సారాంశం గణాంకాలను ముద్రించండి, తద్వారా నేను మార్పును చూడగలను మరియు నిర్ధారించగలను. స్వయంచాలక కేటాయింపు/తొలగింపు చొప్పించడం.
తేడా స్పష్టంగా ఉంది: బలమైన సంకల్పం AIని పర్యవేక్షించబడిన సహాయకుడిగా ఉంచుతుంది, రివర్సిబుల్ మరియు డాక్యుమెంట్ చేయబడిన దశలను ఉత్పత్తి చేస్తుంది.
మూడు చిన్న కేసులు
కేసు 1 — సగటు అసైన్మెంట్ ట్రాప్. 5,000 మంది వ్యక్తుల కోసం ఒక విశ్లేషకుడి ఆదాయ డేటా 18% లేదు. అతను AIకి "ఖాళీలను పూరించమని" చెప్పాడు; AI వాటన్నింటినీ సగటున అంచనా వేసింది. ఫలితం: ఆదాయం యొక్క వ్యత్యాసం 22% తగ్గింది మరియు విద్య-ఆదాయ సంబంధం యొక్క గుణకం దాని కంటే బలహీనంగా మారింది. సరైన మార్గం: లోపం MAR (విద్య కారణంగా), బహుళ అసైన్మెంట్ (ఎలుకలు) ద్వారా పూరించాల్సి ఉంటుంది. పాఠం: నింపే పద్ధతి యంత్రాంగంపై ఆధారపడి ఉంటుంది.
కేస్ 2 - అవుట్లియర్ క్లీనింగ్ అన్వేషణను రివర్స్ చేస్తుంది. ఒక సంస్థ డేటాలో 3 చాలా పెద్ద సంస్థలు (మొత్తం పరిశీలనలో 0.6%) ఉన్నాయి. AI యొక్క "క్లీనింగ్" సూచన ద్వారా ఇవి తొలగించబడ్డాయి; స్కేల్ కోఎఫీషియంట్ యొక్క ఆర్థిక వ్యవస్థలు సానుకూల నుండి ప్రతికూలంగా మారాయి. అయితే, ఆ 3 కంపెనీలు నిజమైనవి మరియు పరిశ్రమలో ముఖ్యమైన భాగం. తొలగించడానికి బదులుగా పూర్తి మరియు బలమైన అంచనాతో నివేదించడం సరైన మార్గం. పాఠం: నిజమైన అవుట్లియర్లు డేటా, శబ్దం కాదు.
కేస్ 3 - సైలెంట్ కోడింగ్ లోపం. ఒక ప్యానెల్లో, తేదీ వేరియబుల్ రెండు వేర్వేరు ఫార్మాట్లలో వచ్చింది ("2020-03-01" మరియు "01/03/2020"). AI రూపొందించిన కాంబినేషన్ కోడ్ వాటిని వేర్వేరు విలువల కోసం తప్పుగా భావించినప్పుడు, 1,400 పరిశీలనలు సరిపోలలేదు మరియు వృద్ధి రేట్లు హాస్యాస్పదంగా మారాయి. విశ్లేషకుడు వరుసల సంఖ్యను తనిఖీ చేయకపోయినా పర్వాలేదు. పాఠం: ప్రతి దశ తర్వాత పరిశీలన గణనలు మరియు చిత్తశుద్ధి తనిఖీలు తప్పనిసరి.
సాధారణ తప్పులు
- గుడ్డిగా సగటుతో ఖాళీని పూరించడం. ఇది వ్యత్యాసాన్ని తగ్గిస్తుంది, అనిశ్చితిని దాచిపెడుతుంది మరియు MAR/MNARలో పక్షపాతాన్ని సృష్టిస్తుంది. మొదట యంత్రాంగాన్ని వర్గీకరించండి.
- అవుట్లియర్ను తొలగిస్తోంది "ఎందుకంటే ఇది ఇబ్బంది పెడుతుంది". నిజమైన అవుట్లైయర్లు డేటాను సూచిస్తాయి; తొలగించడం ఫలితాన్ని వంచుతోంది. తప్పును సరిదిద్దండి, వాస్తవమైనదాన్ని ఉంచండి.
- ముడి డేటాను నొక్కడం. ముడి డేటాను ఎప్పుడూ సవరించవద్దు; కోడ్తో అన్ని క్లీనప్లను ప్రత్యేక కాపీలో చేయండి, తద్వారా దాన్ని తిరిగి మార్చవచ్చు.
- దశల ప్రభావాన్ని కొలవడం లేదు. ప్రతి దశ తర్వాత అడ్డు వరుసల సంఖ్య మరియు సారాంశం గణాంకాలను తనిఖీ చేయకపోతే, నిశ్శబ్ద లోపాలు పేరుకుపోతాయి.
- ఫలితంగా శుభ్రపరచడం. "మీరు ఈ పంక్తిని జోడించినప్పుడు, ఫలితం మెరుగ్గా మారుతుంది" యొక్క తర్కం p-హ్యాకింగ్; విశ్లేషణ ఫలితానికి ముందు మరియు స్వతంత్రంగా క్లీనింగ్ ప్లాన్ చేయాలి.
చిట్కా: క్లీనప్కు ముందు మరియు తర్వాత అదే ప్రాథమిక గణాంకాలను (సగటు, మధ్యస్థ, పరిశీలనల సంఖ్య, కొన్ని సహసంబంధాలు) పక్కపక్కనే ఉంచే "ముందు/తర్వాత" పట్టికను ఉంచండి. ఊహించని జంప్ అనేది దాచిన లోపానికి ఉత్తమమైన సూచన.
సారాంశంలో
డేటా క్లీనింగ్ అనేది అనుభావిక పనిలో ఎక్కువ సమయం తీసుకునే మరియు నిర్ణయం తీసుకోవాల్సిన దశ. AI అనేది ఇందులో శక్తివంతమైన కోడ్ జెనరేటర్, కానీ అది షాట్లను పిలవదు: మీరు తప్పిపోయిన డేటా రకాన్ని (MCAR/MAR/MNAR) వర్గీకరిస్తారు, అవుట్లియర్ లోపం లేదా వాస్తవమా అని నిర్ణయించండి, ప్రతి దశను తిప్పికొట్టేలా మరియు డాక్యుమెంట్గా ఉంచండి. AI బ్లైండ్ "స్పష్టమైన" అధికారాన్ని ఇవ్వడానికి బదులుగా, దాని ప్రభావం కొలవబడిన మరియు ధృవీకరించబడిన దశల వారీ వర్క్ఫ్లోను ఏర్పాటు చేయండి. ప్రతి దశ తర్వాత పరిశీలనల సంఖ్య మరియు సారాంశం గణాంకాలను తనిఖీ చేయడం నిశ్శబ్ద లోపాలకు ఉత్తమ విరుగుడు.
అప్లికేషన్ టాస్క్
డేటా సెట్లో (మీ స్వంత డేటా లేదా నమూనా సెట్) తప్పిపోయిన మరియు అవుట్లయర్లను కలిగి ఉన్న కనీసం రెండు వేరియబుల్లను ఎంచుకోండి. పైన ఉన్న "దశల వారీగా, తొలగించవద్దు/పూరించవద్దు" ప్రాంప్ట్ ద్వారా AI నుండి డయాగ్నస్టిక్ కోడ్ను అభ్యర్థించండి మరియు దాన్ని అమలు చేయండి. లోపాన్ని MCAR/MAR/MNARగా వర్గీకరించండి మరియు మీ సమర్థనను ఒక వాక్యంలో వ్రాయండి. పరస్పర విరుద్ధమైన అభ్యర్థులను ఒక్కొక్కటిగా పరిశీలించి, ఏది తప్పు, ఏది వాస్తవమో నిర్ణయించండి. చివరగా, శుభ్రపరిచే ముందు/తర్వాత "ముందు-తర్వాత" పట్టికను రూపొందించండి మరియు ఏవైనా ఊహించని మార్పులు ఉంటే నివేదించండి.
చెక్లిస్ట్
- [ ] నేను ముడి డేటాను మార్చకుండా ప్రత్యేక కాపీలో శుభ్రం చేసాను.
- [ ] నేను లోపాన్ని MCAR/MAR/MNARగా వర్గీకరించాను మరియు తదనుగుణంగా పద్ధతిని ఎంచుకున్నాను.
- [ ] నేను అవుట్లయర్లను ఒక్కొక్కటిగా పరిశీలించాను, అవి లోపాలు ఉన్నాయా లేదా నిజమా అని; నేను దానిని గుడ్డిగా తొలగించలేదు.
- [ ] నేను ప్రతి శుభ్రపరిచే దశ తర్వాత పరిశీలనల సంఖ్య మరియు సారాంశ గణాంకాలను తనిఖీ చేసాను.
- [ ] నేను అన్ని దశలను కోడ్ మరియు వ్యాఖ్య లైన్తో డాక్యుమెంట్ చేసాను; తిప్పికొట్టే.
- [ ] నేను డేటాను ఉత్పత్తి చేసే ప్రక్రియ యొక్క పరిజ్ఞానంపై క్లీనింగ్ ఆధారంగా, విశ్లేషణ ఫలితంపై కాదు.