లాభాలు:
- తగిన గ్రాఫ్లతో (హిస్టోగ్రాం, బాక్స్ ప్లాట్, స్కాటర్ ప్లాట్) వేరియబుల్స్ పంపిణీ, కేంద్రం, వ్యాప్తి మరియు క్రమరాహిత్యాలను అన్వేషించే సామర్థ్యం.
- సహసంబంధాన్ని సరిగ్గా అర్థం చేసుకోగల సామర్థ్యం మరియు కారణవాదంతో గందరగోళం చెందకుండా స్కాటర్ ప్లాట్తో కలిసి చదవడం
- సారాంశం గణాంకాలు తప్పుదారి పట్టించగలవని అర్థం చేసుకునే సామర్థ్యం (ఆన్స్కాంబ్ పాఠం) మరియు మోడలింగ్ దిశను నిర్ణయించే పరికల్పనలను అభివృద్ధి చేస్తుంది.
నమూనాను నిర్మించే ముందు, డేటాను తెలుసుకోవడం అవసరం. డాక్టర్ రోగిని పరీక్షించకుండా మందులను సూచించనట్లే, డేటా సైంటిస్ట్ డేటాను "పరిశీలించకుండా" నమూనాను రూపొందించడు. ఈ పరీక్షను అన్వేషణాత్మక డేటా విశ్లేషణ (సంక్షిప్తంగా EDA) అంటారు: ఇది దృశ్యమానంగా మరియు గ్రాఫికల్గా డేటా యొక్క పంపిణీ, సంబంధాలు, ఆశ్చర్యాలు మరియు ఉచ్చులను కనుగొనే దశ. EDA యొక్క ఉద్దేశ్యం పరికల్పనలను రూపొందించడం, లోపాలను పట్టుకోవడం మరియు మోడలింగ్ దిశను నిర్ణయించడం. ఈ దశలో ఆర్టిఫిషియల్ ఇంటెలిజెన్స్ చాలా శక్తివంతమైన సహాయకుడు: ఇది ఏ చార్ట్ అనుకూలంగా ఉందో సూచిస్తుంది, దాని కోడ్ను వ్రాస్తుంది, పంపిణీని వివరిస్తుంది. కానీ ఒక వ్యక్తి తన/ఆమె ఫీల్డ్ పరిజ్ఞానంతో, అతను చూసే నమూనా నిజమా లేక యాదృచ్చికమా అని నిర్ణయిస్తాడు.
EDA దేని కోసం చూస్తుంది?
EDA నాలుగు ప్రశ్నలకు సమాధానాలు వెతుకుతుంది. పంపిణీ: ప్రతి వేరియబుల్ ఎలా పంపిణీ చేయబడుతుంది-ఇది సుష్టంగా, వక్రంగా లేదా రెండు-శిఖరంలో ఉందా? కేంద్ర ధోరణి మరియు వ్యాప్తి: సగటు, మధ్యస్థ, ప్రామాణిక విచలనం ఏమిటి? సంబంధాలు: వేరియబుల్స్ ఒకదానికొకటి ఎలా సంబంధం కలిగి ఉంటాయి? క్రమరాహిత్యాలు: ఊహించని విలువలు, అంతరాలు, సమూహాలు ఉన్నాయా? ఈ నాలుగు ప్రశ్నలు ఏ ఫీచర్ పని చేస్తుందో మరియు ఏ మోడల్ సముచితమో నిర్ణయిస్తాయి.
కొన్ని ప్రాథమిక భావనలను నిర్వచించండి. హిస్టోగ్రాం అనేది సంఖ్యా వేరియబుల్ యొక్క విలువలను విరామాలుగా విభజిస్తుంది మరియు ప్రతి విరామంలో ఎన్ని పరిశీలనలు ఉన్నాయో చూపే గ్రాఫ్; పంపిణీని చూడటానికి ఇది వేగవంతమైన మార్గం. వక్రత అనేది ఒక దిశలో పంపిణీ యొక్క మార్పు; ఆదాయం వంటి వేరియబుల్స్ కుడి వైపుకు వక్రంగా ఉంటాయి (మెజారిటీ తక్కువ, కొన్ని చాలా ఎక్కువ). ఒక బాక్స్ ప్లాట్ మీడియన్, క్వార్టైల్స్ మరియు అవుట్లయర్లను ఒక చూపులో చూపుతుంది. స్కాటర్ ప్లాట్ పాయింట్ల క్లౌడ్తో రెండు సంఖ్యా చరరాశుల సంబంధాన్ని చూపుతుంది.
సహసంబంధం: సంబంధం ఉంది కానీ జాగ్రత్తగా ఉండండి
సహసంబంధం - రెండు వేరియబుల్స్ ఎలా కలిసి కదులుతాయో కొలమానం; -1 మరియు +1 మధ్య ఉన్న సంఖ్య — అనేది EDA యొక్క ఎక్కువగా ఉపయోగించే మరియు తప్పుగా అర్థం చేసుకున్న సాధనం. +1 అంటే పరిపూర్ణ సహ-పెరుగుదల, -1 అంటే పరిపూర్ణ విలోమ సంబంధం, 0 అంటే సరళ సంబంధం లేదు. రెండు పెద్ద ఉచ్చులు ఉన్నాయి. మొదటిది, ప్రసిద్ధ నియమం: సహసంబంధం కారణం కాదు. ఐస్ క్రీం అమ్మకాలతో ఉక్కిరిబిక్కిరి అవుతున్న కేసులు; ఒకటి మరొకదానికి దారితీసినందున కాదు, కానీ వేసవి (దాచిన మూడవ వేరియబుల్) రెండింటినీ ప్రేరేపిస్తుంది. రెండవది, సహసంబంధం సరళ సంబంధాన్ని మాత్రమే కొలుస్తుంది; ఇది 0కి దగ్గరగా ఉన్న బలమైన కానీ వంపురేఖీయ సంబంధాన్ని సూచించవచ్చు. కాబట్టి సహసంబంధాన్ని చూసేటప్పుడు, స్కాటర్ ప్లాట్ను కూడా చూడండి.
హెచ్చరిక: AI సహసంబంధ సంఖ్యను ఇచ్చినప్పుడు, అది "A పెంచుతుంది B" వంటి కారణ భాషలోకి జారిపోవచ్చు. ఇది ప్రమాదకరం. సహసంబంధం కలిసి కదలికను మాత్రమే సూచిస్తుంది; అనుభవం, డొమైన్ జ్ఞానం మరియు జాగ్రత్తగా అనుమితి మాత్రమే కారణాన్ని నిర్ధారిస్తుంది.
Anscombe క్వార్టెట్: ఎందుకు కేవలం సంఖ్యను చూడకూడదు
గణాంకాలలో ఒక ప్రసిద్ధ ఉదాహరణ ఉంది: ఆన్స్కాంబ్ క్వార్టెట్. నాలుగు వేర్వేరు డేటా సెట్లు దాదాపు ఒకే సగటు, ఒకే వైవిధ్యం మరియు ఒకే సహసంబంధం (0.82); కానీ గ్రాఫ్ చేసినప్పుడు, అవి పూర్తిగా భిన్నంగా కనిపిస్తాయి - ఒక సరళ రేఖ, ఒకటి వక్రంగా, ఒక మేఘం ఒకే అవుట్లియర్ ద్వారా లాగబడుతుంది. పాఠం స్పష్టంగా ఉంది: సారాంశం గణాంకాలు తప్పుదారి పట్టించేవి, గ్రాఫ్ని చూడటం తప్పనిసరి. AI మీకు సగటులు మరియు సహసంబంధాలను అందించగలదు, కానీ గ్రాఫ్ను చూడకుండానే ఆ సంఖ్యలను విశ్వసించడం Anscombe ట్రాప్లో పడుతోంది.
దిగువ పట్టిక ఏ ప్రశ్నకు ఏ చార్ట్ సరిపోతుందో సంగ్రహిస్తుంది:
ప్రశ్న
తగిన గ్రాఫిక్
ఏమి చూపిస్తుంది
ఒకే వేరియబుల్ పంపిణీ
హిస్టోగ్రాం / KDE
ఆకారం, వక్రత, శీర్షాల సంఖ్య
కేంద్రం మరియు బయటి ప్రాంతాలు
బాక్స్ ప్లాట్
మధ్యస్థ, క్వార్టైల్స్, అవుట్లెర్స్
రెండు సంఖ్యల సంబంధం
స్కాటర్ చార్ట్
దిశ, బలం, వక్రత
వర్గం పోలిక
బార్ చార్ట్
సమూహాల మధ్య వ్యత్యాసం
కాలానుగుణంగా మారుతుంది
లైన్ చార్ట్
ధోరణి, కాలానుగుణత
బహుముఖ సంబంధం
సహసంబంధ ఉష్ణ పటం
సాధారణ సంబంధాల మాతృక
సింప్సన్ యొక్క పారడాక్స్: సమగ్ర డేటా అబద్ధం కావచ్చు
EDAలో ఒక రహస్య ఉచ్చు సింప్సన్ యొక్క వైరుధ్యం గురించి తెలుసుకోవాలి: మొత్తం డేటాను కలిసి పరిశీలించినప్పుడు ఒక నమూనా ఒక దిశను చూపుతుంది, కానీ డేటా అర్థవంతమైన ఉప సమూహాలుగా విభజించబడినప్పుడు రివర్స్ అవుతుంది. క్లాసిక్ ఉదాహరణ: యూనివర్శిటీలో మహిళా దరఖాస్తుదారులకు మొత్తం అంగీకార రేటు పురుషుల కంటే తక్కువగా కనిపిస్తుంది; కానీ డిపార్ట్మెంట్ల వారీగా చూస్తే, చాలా విభాగాల్లో పురుషుల కంటే మహిళల అంగీకార రేటు ఎక్కువగా ఉంది. ఎక్కడి నుంచి? మహిళలు ఎక్కువ పోటీ (తక్కువ అంగీకార రేట్లు) విభాగాలకు దరఖాస్తు చేసుకున్నారు; సంయుక్త సంఖ్య ఈ దాచిన వేరియబుల్ను నిల్వ చేస్తుంది. పాఠం స్పష్టంగా ఉంది: మొత్తం లేదా సగటును చూసినప్పుడు, అర్ధవంతమైన ఉప సమూహాలుగా (విభాగం, కాలం, ఛానెల్) విభజించబడినప్పుడు ఆ సంఖ్య అదే కథనాన్ని చెబుతుందో లేదో తనిఖీ చేయండి. AI మీకు కంబైన్డ్ రేట్ను అందించినప్పుడు, "మీరు దానిని సెగ్మెంట్ చేసినప్పుడు ఇది ఇప్పటికీ చెల్లుబాటులో ఉందా" అని అడగడం చాలా తప్పుదారి పట్టించే ఫలితాలను ప్రారంభంలోనే పొందుతుంది.
మూడు చిన్న కేసులు
కేసు 1 - రెండు దాచిన కొండలు. ఒక విశ్లేషకుడు సగటు కస్టమర్ వయస్సు 41 సంవత్సరాలుగా గుర్తించాడు మరియు దానిని "మధ్య వయస్కుల గుంపు"గా నివేదించాడు. కానీ హిస్టోగ్రాం రెండు శిఖరాలను చూపించింది: 22-28 మరియు 55-62 వయస్సు సమూహాలు. సగటు 41 నిజానికి ఎవరికీ ప్రాతినిధ్యం వహించలేదు. పాఠం: సగటును విశ్వసించే ముందు పంపిణీని ప్లాన్ చేయండి.
కేసు 2 - నకిలీ సహసంబంధం. ఒక బృందం "ప్రకటన వ్యయం" మరియు "అమ్మకాలు" మధ్య 0.78 సహసంబంధాన్ని కనుగొంది మరియు బడ్జెట్ను రెట్టింపు చేసింది. ఏది ఏమైనప్పటికీ, రెండింటినీ ప్రేరేపించినది కాలానుగుణ ప్రచారాలు; ప్రచారానికి దూరంగా ఉన్న సమయంలో, సంబంధం 0.10కి పడిపోయింది. 340 వేల TL అదనపు ప్రకటనలు ఆశించిన రాబడిని ఇవ్వలేదు. పాఠం: కారణానికి సహసంబంధాన్ని తప్పుగా భావించడం ఖరీదైనది.
కేస్ 3 - ఒంటరి కాంట్రారియన్ ద్వారా గీసిన గీత. రియల్ ఎస్టేట్ విశ్లేషణ చదరపు ఫుటేజ్ మరియు ధర (r=0.80) మధ్య బలమైన సంబంధాన్ని చూపించింది. స్కాటర్ ప్లాట్ను గీసినప్పుడు, దాదాపు మొత్తం సంబంధం ఒకే 12 మిలియన్ TL లగ్జరీ విల్లా ద్వారా సృష్టించబడింది; ఆ పాయింట్ తొలగించబడినప్పుడు, సహసంబంధం 0.31కి పడిపోయింది. పాఠం: స్కాటర్ ప్లాట్తో పాటు సహసంబంధాన్ని ఎల్లప్పుడూ చదవండి.
నాలుగు కాపీ చేయగల టెంప్లేట్లు
1) ఆటోమేటిక్ EDA సారాంశం:
నా దగ్గర పాండాలు డిఎఫ్ ఉన్నాయి. ఉత్పత్తి చేసే కోడ్ను వ్రాయండి: (1) df.info() మరియు df.describe(), (2) ప్రతి సంఖ్యా కాలమ్కు హిస్టోగ్రాం, (3) ప్రతి వర్గీయ కాలమ్కు గణన. వ్యాఖ్యానించవద్దు, కేవలం ఆవిష్కరణ కోడ్ను రూపొందించండి; నేను నమూనాలను అర్థం చేసుకుంటాను.
2) సహసంబంధం + దృశ్య (కారణం యొక్క హెచ్చరికతో):
సంఖ్యా నిలువు వరుసల కోసం సహసంబంధ మాతృక మరియు హీట్ మ్యాప్ను గీసే కోడ్ను వ్రాయండి. 3 అత్యధిక పరస్పర సంబంధం ఉన్న జతల స్కాటర్ ప్లాట్ను కూడా గీయండి. సహసంబంధం కారణాన్ని సూచించదని మీకు గుర్తుచేసే అవుట్పుట్కు వ్యాఖ్య లైన్ను జోడించండి. కారణ సంబంధమైన వాదనలు చేయవద్దు.
3) పంపిణీ నిర్ధారణ:
"income_tl" నిలువు వరుస కోసం: హిస్టోగ్రాం, బాక్స్ ప్లాట్, స్కేవ్నెస్ విలువ మరియు మధ్యస్థ/సగటు పోలికను ఉత్పత్తి చేసే కోడ్ను వ్రాయండి. పంపిణీ వంకరగా ఉందో లేదో నేను అర్థం చేసుకుంటాను; కేవలం కోడ్ ఇవ్వండి.
4) సెగ్మెంట్ పోలిక:
కస్టమర్లను "ఛానెల్" (వెబ్/మొబైల్) ద్వారా సరిపోల్చండి: ప్రతి ఛానెల్కు సగటు మొత్తం, మధ్యస్థ మొత్తం, ఆర్డర్ల సంఖ్య మరియు మొత్తం పంపిణీ యొక్క బాక్స్ప్లాట్ను ఉత్పత్తి చేసే కోడ్ను వ్రాయండి. రెండు ఛానెల్ల మధ్య వ్యత్యాసం యొక్క గణాంక ప్రాముఖ్యత కోసం ఏ పరీక్ష సముచితమో సూచించండి, కానీ నిర్ణయం నా ఇష్టం.
బలహీనమైన ప్రాంప్ట్ / బలమైన ప్రాంప్ట్
బలహీనమైన ప్రాంప్ట్:
ఈ డేటాలో ఆసక్తికరమైనదాన్ని కనుగొనండి.
"ఆసక్తికరమైనది" నిర్వచించబడలేదు; AI డేటాను చూడదు, కనుక ఇది దానిని తయారు చేస్తుంది లేదా సాధారణ ప్రకటనలను చేస్తుంది. దిశ లేదు, వేరియబుల్స్ లేదు, ప్రయోజనం లేదు.
శక్తివంతమైన ప్రాంప్ట్:
మీ పాత్ర: EDA అసిస్టెంట్. df నిలువు వరుసలు: వయస్సు (int), income_tl (ఫ్లోట్), నగరం (కేటగిరీ), ఛానెల్ (వెబ్/మొబైల్), మొత్తం (ఫ్లోట్). ప్రయోజనం: "మొత్తం" ప్రభావితం చేసే కారకాలను కనుగొనడం. టాస్క్: (1) మొత్తం పంపిణీని ప్లాట్ చేసే కోడ్, (2) మొత్తం మరియు వయస్సు మరియు ఆదాయం_tl మధ్య పంపిణీ గ్రాఫ్లు, (3) ఛానెల్ బ్రేక్డౌన్లో మొత్తం బాక్స్ ప్లాట్. కారణ దావాను స్థాపించడం; కేవలం ఆవిష్కరణ కోడ్ను రూపొందించండి మరియు నేను నమూనాను అర్థం చేసుకుంటాను.
ఇక్కడ, ప్రయోజనం, వేరియబుల్స్ మరియు "క్లెయిమ్ కాజాలిటీ" యొక్క పరిమితి స్పష్టంగా ఉన్నాయి.
సాధారణ తప్పులు
- సారాంశ గణాంకాలపై మాత్రమే ఆధారపడటం. Anscombe క్వార్టెట్ చూపినట్లుగా, అదే సగటు చాలా భిన్నమైన పంపిణీలను దాచిపెడుతుంది; చార్ట్ చూడండి.
- కారణం కోసం తప్పు సహసంబంధం. సహ-చర్య ఒకటి మరొకదానికి దారితీస్తుందని సూచించదు; దాచిన వేరియబుల్స్ పట్ల జాగ్రత్త వహించండి.
- స్కాటర్ ప్లాట్ లేకుండా సహసంబంధాన్ని చూడటం. ఒక సింగిల్ అవుట్లియర్ లేదా కర్విలేనియారిటీ సంఖ్యను తప్పుదారి పట్టిస్తుంది.
- సగటుతో టూ-పీక్డ్/స్కేవ్డ్ డిస్ట్రిబ్యూషన్ను సంగ్రహించడం. సగటు ఎవరికీ ప్రాతినిధ్యం వహించకపోవచ్చు.
- EDAని దాటవేసి నేరుగా మోడల్కి వెళ్లండి. గుర్తించబడని డేటా అంటే బ్లైండ్ మోడల్.
చిట్కా: ప్రతి కొత్త డేటా సెట్తో, మొదటి 30 నిమిషాలు గ్రాఫ్లను గీయడానికి వెచ్చించండి: ప్రతి సంఖ్య యొక్క హిస్టోగ్రాం, ముఖ్యమైన జతల స్కాటర్ ప్లాట్, వర్గాల బార్ చార్ట్. ఈ 30 నిమిషాలు రాబోయే రోజుల్లో భవిష్యత్తులో మోడలింగ్ లోపాలను నివారిస్తాయి.
సారాంశంలో
EDA అనేది మోడల్ను రూపొందించడానికి ముందు డేటాను తెలుసుకునే దశ మరియు నాలుగు ప్రశ్నలకు సమాధానాలను వెతుకుతుంది: పంపిణీ, కేంద్రం-వ్యాప్తి, సంబంధాలు మరియు క్రమరాహిత్యాలు. సారాంశ గణాంకాలు తప్పుదారి పట్టించవచ్చు; గ్రాఫ్ని చూడటం తప్పనిసరి (అన్స్కాంబ్ లెక్చర్). సహసంబంధం ఒక శక్తివంతమైన సాధనం, కానీ కారణం కాదు మరియు ఖచ్చితంగా స్కాటర్ ప్లాట్తో కలిపి చదవాలి. AI అనేది గ్రాఫిక్స్ మరియు రైటింగ్ కోడ్ని సూచించడానికి గొప్ప యాక్సిలరేటర్; కానీ ప్రజలు తాము చూసే నమూనా వాస్తవమా లేక యాదృచ్చికమా అని వారి క్షేత్ర పరిజ్ఞానంతో అర్థం చేసుకుంటారు.
అప్లికేషన్ టాస్క్
డేటాసెట్ను ఎంచుకుని, కేవలం EDA చేయండి: కనీసం మూడు సంఖ్యా వేరియబుల్ల హిస్టోగ్రాం, రెండు జతల వేరియబుల్ల స్కాటర్ ప్లాట్ మరియు కోరిలేషన్ హీట్ మ్యాప్ను సంగ్రహించండి. కనీసం ఒక "ఆశ్చర్యం" (రెండు శిఖరాలతో కూడిన పంపిణీ, నకిలీ సహసంబంధం కోసం అభ్యర్థి, ఒకే అవుట్లియర్ ద్వారా ఆకర్షించబడిన సంబంధం వంటివి) కనుగొని, దానిని ఒక వాక్యంలో వివరించండి. ఎటువంటి కారణ వాదనలు చేయకుండా వ్రాయండి.
చెక్లిస్ట్
- [ ] నేను ప్రతి సంఖ్యా వేరియబుల్ పంపిణీని గ్రాఫ్ చేసానా?
- [ ] నేను స్కాటర్ప్లాట్తో సహసంబంధాలను చూశానా?
- [ ] నేను కారణాన్ని మరియు సహసంబంధాన్ని వేరుగా ఉంచానా?
- [ ] నేను వక్రీకరించిన లేదా రెండు-పీక్ పంపిణీలను గమనించలేదా మరియు సగటును గుడ్డిగా విశ్వసించలేదా?
- [ ] నేను నా EDA పరిశోధనల నుండి కనీసం ఒక మోడలింగ్ అంశం/పరికల్పనను పొందానా?