యూనిట్లు
1. డేటా సైన్స్ మరియు అనలిటిక్స్‌లో ఆర్టిఫిషియల్ ఇంటెలిజెన్స్ పరిచయం: వర్క్‌ఫ్లో, పాత్రలు, సరిహద్దులు, ధ్రువీకరణ మరియు నీతి 2. డేటా సేకరణ మరియు మూల అవగాహన: స్కీమా, నమూనా, నాణ్యత మరియు లీక్ అవేర్‌నెస్ 3. డేటా క్లీనింగ్ మరియు ప్రీప్రాసెసింగ్: మిస్సింగ్ వాల్యూ, అవుట్‌లియర్ మరియు టైప్ కన్వర్షన్ 4. అన్వేషణాత్మక డేటా విశ్లేషణ (EDA): పంపిణీలు, సంబంధాలు మరియు ప్రారంభ అంతర్దృష్టులు 5. ఫీచర్ ఇంజనీరింగ్: వేరియంట్‌లను రూపొందించడం, కోడింగ్, స్కేలింగ్ మరియు లీకేజీని నివారించడం 6. మోడల్ బిల్డింగ్: సమస్య నిర్వచనం, అల్గోరిథం ఎంపిక మరియు శిక్షణ/టెస్ట్ స్ప్లిట్ 7. మోడల్ మూల్యాంకనం: కొలమానాలు, క్రాస్ ధ్రువీకరణ మరియు విపరీతమైన అభ్యాసం 8. విజువలైజేషన్ మరియు స్టోరీ టెల్లింగ్: ఖచ్చితమైన గ్రాఫిక్స్, హానెస్ట్ గ్రాఫిక్స్ 9. కోడ్ జనరేషన్: పైథాన్ (పాండాలు) మరియు SQLతో AI-సహాయక విశ్లేషణ 10. డేటా లీకేజ్ మరియు పునరుత్పత్తి: నిశ్శబ్ద విపత్తులు మరియు క్రమశిక్షణ 11. MLOps ఫౌండేషన్, ఎథిక్స్, గోప్యత మరియు బాధ్యతాయుతమైన విశ్లేషణలు
యూనిట్ 4 / 11

అన్వేషణాత్మక డేటా విశ్లేషణ (EDA): పంపిణీలు, సంబంధాలు మరియు ప్రారంభ అంతర్దృష్టులు

లాభాలు:

  • తగిన గ్రాఫ్‌లతో (హిస్టోగ్రాం, బాక్స్ ప్లాట్, స్కాటర్ ప్లాట్) వేరియబుల్స్ పంపిణీ, కేంద్రం, వ్యాప్తి మరియు క్రమరాహిత్యాలను అన్వేషించే సామర్థ్యం.
  • సహసంబంధాన్ని సరిగ్గా అర్థం చేసుకోగల సామర్థ్యం మరియు కారణవాదంతో గందరగోళం చెందకుండా స్కాటర్ ప్లాట్‌తో కలిసి చదవడం
  • సారాంశం గణాంకాలు తప్పుదారి పట్టించగలవని అర్థం చేసుకునే సామర్థ్యం (ఆన్స్‌కాంబ్ పాఠం) మరియు మోడలింగ్ దిశను నిర్ణయించే పరికల్పనలను అభివృద్ధి చేస్తుంది.

నమూనాను నిర్మించే ముందు, డేటాను తెలుసుకోవడం అవసరం. డాక్టర్ రోగిని పరీక్షించకుండా మందులను సూచించనట్లే, డేటా సైంటిస్ట్ డేటాను "పరిశీలించకుండా" నమూనాను రూపొందించడు. ఈ పరీక్షను అన్వేషణాత్మక డేటా విశ్లేషణ (సంక్షిప్తంగా EDA) అంటారు: ఇది దృశ్యమానంగా మరియు గ్రాఫికల్‌గా డేటా యొక్క పంపిణీ, సంబంధాలు, ఆశ్చర్యాలు మరియు ఉచ్చులను కనుగొనే దశ. EDA యొక్క ఉద్దేశ్యం పరికల్పనలను రూపొందించడం, లోపాలను పట్టుకోవడం మరియు మోడలింగ్ దిశను నిర్ణయించడం. ఈ దశలో ఆర్టిఫిషియల్ ఇంటెలిజెన్స్ చాలా శక్తివంతమైన సహాయకుడు: ఇది ఏ చార్ట్ అనుకూలంగా ఉందో సూచిస్తుంది, దాని కోడ్‌ను వ్రాస్తుంది, పంపిణీని వివరిస్తుంది. కానీ ఒక వ్యక్తి తన/ఆమె ఫీల్డ్ పరిజ్ఞానంతో, అతను చూసే నమూనా నిజమా లేక యాదృచ్చికమా అని నిర్ణయిస్తాడు.

EDA దేని కోసం చూస్తుంది?

EDA నాలుగు ప్రశ్నలకు సమాధానాలు వెతుకుతుంది. పంపిణీ: ప్రతి వేరియబుల్ ఎలా పంపిణీ చేయబడుతుంది-ఇది సుష్టంగా, వక్రంగా లేదా రెండు-శిఖరంలో ఉందా? కేంద్ర ధోరణి మరియు వ్యాప్తి: సగటు, మధ్యస్థ, ప్రామాణిక విచలనం ఏమిటి? సంబంధాలు: వేరియబుల్స్ ఒకదానికొకటి ఎలా సంబంధం కలిగి ఉంటాయి? క్రమరాహిత్యాలు: ఊహించని విలువలు, అంతరాలు, సమూహాలు ఉన్నాయా? ఈ నాలుగు ప్రశ్నలు ఏ ఫీచర్ పని చేస్తుందో మరియు ఏ మోడల్ సముచితమో నిర్ణయిస్తాయి.

కొన్ని ప్రాథమిక భావనలను నిర్వచించండి. హిస్టోగ్రాం అనేది సంఖ్యా వేరియబుల్ యొక్క విలువలను విరామాలుగా విభజిస్తుంది మరియు ప్రతి విరామంలో ఎన్ని పరిశీలనలు ఉన్నాయో చూపే గ్రాఫ్; పంపిణీని చూడటానికి ఇది వేగవంతమైన మార్గం. వక్రత అనేది ఒక దిశలో పంపిణీ యొక్క మార్పు; ఆదాయం వంటి వేరియబుల్స్ కుడి వైపుకు వక్రంగా ఉంటాయి (మెజారిటీ తక్కువ, కొన్ని చాలా ఎక్కువ). ఒక బాక్స్ ప్లాట్ మీడియన్, క్వార్టైల్స్ మరియు అవుట్‌లయర్‌లను ఒక చూపులో చూపుతుంది. స్కాటర్ ప్లాట్ పాయింట్ల క్లౌడ్‌తో రెండు సంఖ్యా చరరాశుల సంబంధాన్ని చూపుతుంది.

సహసంబంధం: సంబంధం ఉంది కానీ జాగ్రత్తగా ఉండండి

సహసంబంధం - రెండు వేరియబుల్స్ ఎలా కలిసి కదులుతాయో కొలమానం; -1 మరియు +1 మధ్య ఉన్న సంఖ్య — అనేది EDA యొక్క ఎక్కువగా ఉపయోగించే మరియు తప్పుగా అర్థం చేసుకున్న సాధనం. +1 అంటే పరిపూర్ణ సహ-పెరుగుదల, -1 అంటే పరిపూర్ణ విలోమ సంబంధం, 0 అంటే సరళ సంబంధం లేదు. రెండు పెద్ద ఉచ్చులు ఉన్నాయి. మొదటిది, ప్రసిద్ధ నియమం: సహసంబంధం కారణం కాదు. ఐస్ క్రీం అమ్మకాలతో ఉక్కిరిబిక్కిరి అవుతున్న కేసులు; ఒకటి మరొకదానికి దారితీసినందున కాదు, కానీ వేసవి (దాచిన మూడవ వేరియబుల్) రెండింటినీ ప్రేరేపిస్తుంది. రెండవది, సహసంబంధం సరళ సంబంధాన్ని మాత్రమే కొలుస్తుంది; ఇది 0కి దగ్గరగా ఉన్న బలమైన కానీ వంపురేఖీయ సంబంధాన్ని సూచించవచ్చు. కాబట్టి సహసంబంధాన్ని చూసేటప్పుడు, స్కాటర్ ప్లాట్‌ను కూడా చూడండి.

హెచ్చరిక: AI సహసంబంధ సంఖ్యను ఇచ్చినప్పుడు, అది "A పెంచుతుంది B" వంటి కారణ భాషలోకి జారిపోవచ్చు. ఇది ప్రమాదకరం. సహసంబంధం కలిసి కదలికను మాత్రమే సూచిస్తుంది; అనుభవం, డొమైన్ జ్ఞానం మరియు జాగ్రత్తగా అనుమితి మాత్రమే కారణాన్ని నిర్ధారిస్తుంది.

Anscombe క్వార్టెట్: ఎందుకు కేవలం సంఖ్యను చూడకూడదు

గణాంకాలలో ఒక ప్రసిద్ధ ఉదాహరణ ఉంది: ఆన్స్‌కాంబ్ క్వార్టెట్. నాలుగు వేర్వేరు డేటా సెట్‌లు దాదాపు ఒకే సగటు, ఒకే వైవిధ్యం మరియు ఒకే సహసంబంధం (0.82); కానీ గ్రాఫ్ చేసినప్పుడు, అవి పూర్తిగా భిన్నంగా కనిపిస్తాయి - ఒక సరళ రేఖ, ఒకటి వక్రంగా, ఒక మేఘం ఒకే అవుట్‌లియర్ ద్వారా లాగబడుతుంది. పాఠం స్పష్టంగా ఉంది: సారాంశం గణాంకాలు తప్పుదారి పట్టించేవి, గ్రాఫ్‌ని చూడటం తప్పనిసరి. AI మీకు సగటులు మరియు సహసంబంధాలను అందించగలదు, కానీ గ్రాఫ్‌ను చూడకుండానే ఆ సంఖ్యలను విశ్వసించడం Anscombe ట్రాప్‌లో పడుతోంది.

దిగువ పట్టిక ఏ ప్రశ్నకు ఏ చార్ట్ సరిపోతుందో సంగ్రహిస్తుంది:

ప్రశ్న

తగిన గ్రాఫిక్

ఏమి చూపిస్తుంది

ఒకే వేరియబుల్ పంపిణీ

హిస్టోగ్రాం / KDE

ఆకారం, వక్రత, శీర్షాల సంఖ్య

కేంద్రం మరియు బయటి ప్రాంతాలు

బాక్స్ ప్లాట్

మధ్యస్థ, క్వార్టైల్స్, అవుట్‌లెర్స్

రెండు సంఖ్యల సంబంధం

స్కాటర్ చార్ట్

దిశ, బలం, వక్రత

వర్గం పోలిక

బార్ చార్ట్

సమూహాల మధ్య వ్యత్యాసం

కాలానుగుణంగా మారుతుంది

లైన్ చార్ట్

ధోరణి, కాలానుగుణత

బహుముఖ సంబంధం

సహసంబంధ ఉష్ణ పటం

సాధారణ సంబంధాల మాతృక

సింప్సన్ యొక్క పారడాక్స్: సమగ్ర డేటా అబద్ధం కావచ్చు

EDAలో ఒక రహస్య ఉచ్చు సింప్సన్ యొక్క వైరుధ్యం గురించి తెలుసుకోవాలి: మొత్తం డేటాను కలిసి పరిశీలించినప్పుడు ఒక నమూనా ఒక దిశను చూపుతుంది, కానీ డేటా అర్థవంతమైన ఉప సమూహాలుగా విభజించబడినప్పుడు రివర్స్ అవుతుంది. క్లాసిక్ ఉదాహరణ: యూనివర్శిటీలో మహిళా దరఖాస్తుదారులకు మొత్తం అంగీకార రేటు పురుషుల కంటే తక్కువగా కనిపిస్తుంది; కానీ డిపార్ట్‌మెంట్ల వారీగా చూస్తే, చాలా విభాగాల్లో పురుషుల కంటే మహిళల అంగీకార రేటు ఎక్కువగా ఉంది. ఎక్కడి నుంచి? మహిళలు ఎక్కువ పోటీ (తక్కువ అంగీకార రేట్లు) విభాగాలకు దరఖాస్తు చేసుకున్నారు; సంయుక్త సంఖ్య ఈ దాచిన వేరియబుల్‌ను నిల్వ చేస్తుంది. పాఠం స్పష్టంగా ఉంది: మొత్తం లేదా సగటును చూసినప్పుడు, అర్ధవంతమైన ఉప సమూహాలుగా (విభాగం, కాలం, ఛానెల్) విభజించబడినప్పుడు ఆ సంఖ్య అదే కథనాన్ని చెబుతుందో లేదో తనిఖీ చేయండి. AI మీకు కంబైన్డ్ రేట్‌ను అందించినప్పుడు, "మీరు దానిని సెగ్మెంట్ చేసినప్పుడు ఇది ఇప్పటికీ చెల్లుబాటులో ఉందా" అని అడగడం చాలా తప్పుదారి పట్టించే ఫలితాలను ప్రారంభంలోనే పొందుతుంది.

మూడు చిన్న కేసులు

కేసు 1 - రెండు దాచిన కొండలు. ఒక విశ్లేషకుడు సగటు కస్టమర్ వయస్సు 41 సంవత్సరాలుగా గుర్తించాడు మరియు దానిని "మధ్య వయస్కుల గుంపు"గా నివేదించాడు. కానీ హిస్టోగ్రాం రెండు శిఖరాలను చూపించింది: 22-28 మరియు 55-62 వయస్సు సమూహాలు. సగటు 41 నిజానికి ఎవరికీ ప్రాతినిధ్యం వహించలేదు. పాఠం: సగటును విశ్వసించే ముందు పంపిణీని ప్లాన్ చేయండి.

కేసు 2 - నకిలీ సహసంబంధం. ఒక బృందం "ప్రకటన వ్యయం" మరియు "అమ్మకాలు" మధ్య 0.78 సహసంబంధాన్ని కనుగొంది మరియు బడ్జెట్‌ను రెట్టింపు చేసింది. ఏది ఏమైనప్పటికీ, రెండింటినీ ప్రేరేపించినది కాలానుగుణ ప్రచారాలు; ప్రచారానికి దూరంగా ఉన్న సమయంలో, సంబంధం 0.10కి పడిపోయింది. 340 వేల TL అదనపు ప్రకటనలు ఆశించిన రాబడిని ఇవ్వలేదు. పాఠం: కారణానికి సహసంబంధాన్ని తప్పుగా భావించడం ఖరీదైనది.

కేస్ 3 - ఒంటరి కాంట్రారియన్ ద్వారా గీసిన గీత. రియల్ ఎస్టేట్ విశ్లేషణ చదరపు ఫుటేజ్ మరియు ధర (r=0.80) మధ్య బలమైన సంబంధాన్ని చూపించింది. స్కాటర్ ప్లాట్‌ను గీసినప్పుడు, దాదాపు మొత్తం సంబంధం ఒకే 12 మిలియన్ TL లగ్జరీ విల్లా ద్వారా సృష్టించబడింది; ఆ పాయింట్ తొలగించబడినప్పుడు, సహసంబంధం 0.31కి పడిపోయింది. పాఠం: స్కాటర్ ప్లాట్‌తో పాటు సహసంబంధాన్ని ఎల్లప్పుడూ చదవండి.

నాలుగు కాపీ చేయగల టెంప్లేట్‌లు

1) ఆటోమేటిక్ EDA సారాంశం:

నా దగ్గర పాండాలు డిఎఫ్ ఉన్నాయి. ఉత్పత్తి చేసే కోడ్‌ను వ్రాయండి: (1) df.info() మరియు df.describe(), (2) ప్రతి సంఖ్యా కాలమ్‌కు హిస్టోగ్రాం, (3) ప్రతి వర్గీయ కాలమ్‌కు గణన. వ్యాఖ్యానించవద్దు, కేవలం ఆవిష్కరణ కోడ్‌ను రూపొందించండి; నేను నమూనాలను అర్థం చేసుకుంటాను.

2) సహసంబంధం + దృశ్య (కారణం యొక్క హెచ్చరికతో):

సంఖ్యా నిలువు వరుసల కోసం సహసంబంధ మాతృక మరియు హీట్ మ్యాప్‌ను గీసే కోడ్‌ను వ్రాయండి. 3 అత్యధిక పరస్పర సంబంధం ఉన్న జతల స్కాటర్ ప్లాట్‌ను కూడా గీయండి. సహసంబంధం కారణాన్ని సూచించదని మీకు గుర్తుచేసే అవుట్‌పుట్‌కు వ్యాఖ్య లైన్‌ను జోడించండి. కారణ సంబంధమైన వాదనలు చేయవద్దు.

3) పంపిణీ నిర్ధారణ:

"income_tl" నిలువు వరుస కోసం: హిస్టోగ్రాం, బాక్స్ ప్లాట్, స్కేవ్‌నెస్ విలువ మరియు మధ్యస్థ/సగటు పోలికను ఉత్పత్తి చేసే కోడ్‌ను వ్రాయండి. పంపిణీ వంకరగా ఉందో లేదో నేను అర్థం చేసుకుంటాను; కేవలం కోడ్ ఇవ్వండి.

4) సెగ్మెంట్ పోలిక:

కస్టమర్‌లను "ఛానెల్" (వెబ్/మొబైల్) ద్వారా సరిపోల్చండి: ప్రతి ఛానెల్‌కు సగటు మొత్తం, మధ్యస్థ మొత్తం, ఆర్డర్‌ల సంఖ్య మరియు మొత్తం పంపిణీ యొక్క బాక్స్‌ప్లాట్‌ను ఉత్పత్తి చేసే కోడ్‌ను వ్రాయండి. రెండు ఛానెల్‌ల మధ్య వ్యత్యాసం యొక్క గణాంక ప్రాముఖ్యత కోసం ఏ పరీక్ష సముచితమో సూచించండి, కానీ నిర్ణయం నా ఇష్టం.

బలహీనమైన ప్రాంప్ట్ / బలమైన ప్రాంప్ట్

బలహీనమైన ప్రాంప్ట్:

ఈ డేటాలో ఆసక్తికరమైనదాన్ని కనుగొనండి.

"ఆసక్తికరమైనది" నిర్వచించబడలేదు; AI డేటాను చూడదు, కనుక ఇది దానిని తయారు చేస్తుంది లేదా సాధారణ ప్రకటనలను చేస్తుంది. దిశ లేదు, వేరియబుల్స్ లేదు, ప్రయోజనం లేదు.

శక్తివంతమైన ప్రాంప్ట్:

మీ పాత్ర: EDA అసిస్టెంట్. df నిలువు వరుసలు: వయస్సు (int), income_tl (ఫ్లోట్), నగరం (కేటగిరీ), ఛానెల్ (వెబ్/మొబైల్), మొత్తం (ఫ్లోట్). ప్రయోజనం: "మొత్తం" ప్రభావితం చేసే కారకాలను కనుగొనడం. టాస్క్: (1) మొత్తం పంపిణీని ప్లాట్ చేసే కోడ్, (2) మొత్తం మరియు వయస్సు మరియు ఆదాయం_tl మధ్య పంపిణీ గ్రాఫ్‌లు, (3) ఛానెల్ బ్రేక్‌డౌన్‌లో మొత్తం బాక్స్ ప్లాట్. కారణ దావాను స్థాపించడం; కేవలం ఆవిష్కరణ కోడ్‌ను రూపొందించండి మరియు నేను నమూనాను అర్థం చేసుకుంటాను.

ఇక్కడ, ప్రయోజనం, వేరియబుల్స్ మరియు "క్లెయిమ్ కాజాలిటీ" యొక్క పరిమితి స్పష్టంగా ఉన్నాయి.

సాధారణ తప్పులు

  • సారాంశ గణాంకాలపై మాత్రమే ఆధారపడటం. Anscombe క్వార్టెట్ చూపినట్లుగా, అదే సగటు చాలా భిన్నమైన పంపిణీలను దాచిపెడుతుంది; చార్ట్ చూడండి.
  • కారణం కోసం తప్పు సహసంబంధం. సహ-చర్య ఒకటి మరొకదానికి దారితీస్తుందని సూచించదు; దాచిన వేరియబుల్స్ పట్ల జాగ్రత్త వహించండి.
  • స్కాటర్ ప్లాట్ లేకుండా సహసంబంధాన్ని చూడటం. ఒక సింగిల్ అవుట్‌లియర్ లేదా కర్విలేనియారిటీ సంఖ్యను తప్పుదారి పట్టిస్తుంది.
  • సగటుతో టూ-పీక్డ్/స్కేవ్డ్ డిస్ట్రిబ్యూషన్‌ను సంగ్రహించడం. సగటు ఎవరికీ ప్రాతినిధ్యం వహించకపోవచ్చు.
  • EDAని దాటవేసి నేరుగా మోడల్‌కి వెళ్లండి. గుర్తించబడని డేటా అంటే బ్లైండ్ మోడల్.
చిట్కా: ప్రతి కొత్త డేటా సెట్‌తో, మొదటి 30 నిమిషాలు గ్రాఫ్‌లను గీయడానికి వెచ్చించండి: ప్రతి సంఖ్య యొక్క హిస్టోగ్రాం, ముఖ్యమైన జతల స్కాటర్ ప్లాట్, వర్గాల బార్ చార్ట్. ఈ 30 నిమిషాలు రాబోయే రోజుల్లో భవిష్యత్తులో మోడలింగ్ లోపాలను నివారిస్తాయి.

సారాంశంలో

EDA అనేది మోడల్‌ను రూపొందించడానికి ముందు డేటాను తెలుసుకునే దశ మరియు నాలుగు ప్రశ్నలకు సమాధానాలను వెతుకుతుంది: పంపిణీ, కేంద్రం-వ్యాప్తి, సంబంధాలు మరియు క్రమరాహిత్యాలు. సారాంశ గణాంకాలు తప్పుదారి పట్టించవచ్చు; గ్రాఫ్‌ని చూడటం తప్పనిసరి (అన్స్‌కాంబ్ లెక్చర్). సహసంబంధం ఒక శక్తివంతమైన సాధనం, కానీ కారణం కాదు మరియు ఖచ్చితంగా స్కాటర్ ప్లాట్‌తో కలిపి చదవాలి. AI అనేది గ్రాఫిక్స్ మరియు రైటింగ్ కోడ్‌ని సూచించడానికి గొప్ప యాక్సిలరేటర్; కానీ ప్రజలు తాము చూసే నమూనా వాస్తవమా లేక యాదృచ్చికమా అని వారి క్షేత్ర పరిజ్ఞానంతో అర్థం చేసుకుంటారు.

అప్లికేషన్ టాస్క్

డేటాసెట్‌ను ఎంచుకుని, కేవలం EDA చేయండి: కనీసం మూడు సంఖ్యా వేరియబుల్‌ల హిస్టోగ్రాం, రెండు జతల వేరియబుల్‌ల స్కాటర్ ప్లాట్ మరియు కోరిలేషన్ హీట్ మ్యాప్‌ను సంగ్రహించండి. కనీసం ఒక "ఆశ్చర్యం" (రెండు శిఖరాలతో కూడిన పంపిణీ, నకిలీ సహసంబంధం కోసం అభ్యర్థి, ఒకే అవుట్‌లియర్ ద్వారా ఆకర్షించబడిన సంబంధం వంటివి) కనుగొని, దానిని ఒక వాక్యంలో వివరించండి. ఎటువంటి కారణ వాదనలు చేయకుండా వ్రాయండి.

చెక్లిస్ట్

  • [ ] నేను ప్రతి సంఖ్యా వేరియబుల్ పంపిణీని గ్రాఫ్ చేసానా?
  • [ ] నేను స్కాటర్‌ప్లాట్‌తో సహసంబంధాలను చూశానా?
  • [ ] నేను కారణాన్ని మరియు సహసంబంధాన్ని వేరుగా ఉంచానా?
  • [ ] నేను వక్రీకరించిన లేదా రెండు-పీక్ పంపిణీలను గమనించలేదా మరియు సగటును గుడ్డిగా విశ్వసించలేదా?
  • [ ] నేను నా EDA పరిశోధనల నుండి కనీసం ఒక మోడలింగ్ అంశం/పరికల్పనను పొందానా?