యూనిట్లు
1. డేటా సైన్స్ మరియు అనలిటిక్స్‌లో ఆర్టిఫిషియల్ ఇంటెలిజెన్స్ పరిచయం: వర్క్‌ఫ్లో, పాత్రలు, సరిహద్దులు, ధ్రువీకరణ మరియు నీతి 2. డేటా సేకరణ మరియు మూల అవగాహన: స్కీమా, నమూనా, నాణ్యత మరియు లీక్ అవేర్‌నెస్ 3. డేటా క్లీనింగ్ మరియు ప్రీప్రాసెసింగ్: మిస్సింగ్ వాల్యూ, అవుట్‌లియర్ మరియు టైప్ కన్వర్షన్ 4. అన్వేషణాత్మక డేటా విశ్లేషణ (EDA): పంపిణీలు, సంబంధాలు మరియు ప్రారంభ అంతర్దృష్టులు 5. ఫీచర్ ఇంజనీరింగ్: వేరియంట్‌లను రూపొందించడం, కోడింగ్, స్కేలింగ్ మరియు లీకేజీని నివారించడం 6. మోడల్ బిల్డింగ్: సమస్య నిర్వచనం, అల్గోరిథం ఎంపిక మరియు శిక్షణ/టెస్ట్ స్ప్లిట్ 7. మోడల్ మూల్యాంకనం: కొలమానాలు, క్రాస్ ధ్రువీకరణ మరియు విపరీతమైన అభ్యాసం 8. విజువలైజేషన్ మరియు స్టోరీ టెల్లింగ్: ఖచ్చితమైన గ్రాఫిక్స్, హానెస్ట్ గ్రాఫిక్స్ 9. కోడ్ జనరేషన్: పైథాన్ (పాండాలు) మరియు SQLతో AI-సహాయక విశ్లేషణ 10. డేటా లీకేజ్ మరియు పునరుత్పత్తి: నిశ్శబ్ద విపత్తులు మరియు క్రమశిక్షణ 11. MLOps ఫౌండేషన్, ఎథిక్స్, గోప్యత మరియు బాధ్యతాయుతమైన విశ్లేషణలు
యూనిట్ 10 / 11

డేటా లీకేజ్ మరియు పునరుత్పత్తి: నిశ్శబ్ద విపత్తులు మరియు క్రమశిక్షణ

లాభాలు:

  • డేటా లీకేజీ రకాలను గుర్తించే సామర్థ్యం (లక్ష్యం, సమయం, ప్రీప్రాసెసింగ్, సమూహ వరుస) మరియు 'నిజానికి చాలా మంచిది' స్కోర్‌ను అలారంగా ప్రశ్నించడం
  • పరీక్ష సెట్, పైప్‌లైన్ మరియు సరైన విభజన (కాలక్రమం/సమూహం) యొక్క ముందస్తు విభజనతో లీకేజీని నిరోధించే సామర్థ్యం
  • స్థిరమైన విత్తనాలు, సంస్కరణ నియంత్రణ మరియు మాన్యువల్ దశల తొలగింపుతో విశ్లేషణను పునరుత్పత్తి చేయగల సామర్థ్యం

డేటా సైన్స్‌లో ఎక్కువ ప్రయత్నాన్ని వృధా చేసే రెండు తప్పులు ఉన్నాయి మరియు అవి రెండూ కృత్రిమమైనవి ఎందుకంటే అవి అన్నీ "బాగా ఉన్నట్లు అనిపించినప్పుడు" విపత్తుకు దారితీస్తాయి. మొదటిది డేటా లీకేజీ: మోడల్ టెస్ట్ సెట్‌లో అద్భుతంగా పనిచేస్తుంది కానీ ఉత్పత్తిలో క్రాష్ అవుతుంది. రెండవది పునరుత్పాదకత: మీరు ఆరు నెలల తర్వాత విశ్లేషణను అమలు చేసి పూర్తిగా భిన్నమైన ఫలితాన్ని పొందుతారు. ఈ రెండు ఆపదలను లోతుగా తెలుసుకోవడం మరియు నివారించడం కోసం ఈ యూనిట్ అంకితం చేయబడింది. AI రెండు ప్రమాదాలను పెంచుతుంది (త్వరగా ఉత్పత్తి చేస్తుంది, దాచిన లీక్‌లను సూచిస్తుంది, మీరు మాన్యువల్ స్టెప్స్‌ని సులభతరం చేస్తుంది) కానీ సరిగ్గా ఉపయోగించినట్లయితే వాటిని కూడా తగ్గించవచ్చు. వ్యత్యాసం క్రమశిక్షణలో ఉంది.

డేటా లీక్: క్లైర్‌వాయెంట్ మోడల్

శిక్షణ సమయంలో మోడల్‌కు అసలు అంచనా వేసే సమయంలో లేని సమాచారాన్ని చూసినప్పుడు డేటా లీకేజీ అంటారు. మోడల్ ఈ సమాచారంతో "చీట్స్", టెస్ట్ సెట్‌లో అద్భుతంగా కనిపిస్తుంది, కానీ ఆ సమాచారం లేకుండా ఉత్పత్తిలో క్రాష్ అవుతుంది. లీక్ యొక్క లక్షణం దాదాపు ఎల్లప్పుడూ ఒకే విధంగా ఉంటుంది: నిజం కావడం చాలా మంచిది. మీరు 99% ఖచ్చితత్వాన్ని చూసినప్పుడు సంతోషించే ముందు, మీరు లీక్‌ల కోసం వెతకాలి.

లీకేజీ యొక్క ప్రధాన రకాలు:

1. గోల్ లీకేజ్: ఒక లక్షణం లక్ష్యం యొక్క ఫలితం. "రద్దు చేయబడింది" సూచనలో, "రద్దు తేదీ" లేదా "వాపసు మొత్తం" నిలువు వరుసలు లక్ష్యం యొక్క ఫలితం; ఫలితం స్పష్టంగా వచ్చినప్పుడు మాత్రమే అవి పూరించబడతాయి.

2. టైమ్ లీక్: భవిష్యత్తు సమాచారాన్ని గతంలోకి తీసుకురావడం. "గత 30 రోజుల సగటు"ను గణిస్తున్నప్పుడు, సూచన రోజు తర్వాత రోజులను చేర్చండి లేదా సమయ శ్రేణిని యాదృచ్ఛికంగా విభజించండి.

3. ప్రీ-ప్రాసెసింగ్ లీకేజీ: శిక్షణ/టెస్టింగ్ విభజనకు ముందు మొత్తం డేటా నుండి స్కేలింగ్, ఫిల్లింగ్, కోడింగ్ వంటి పరివర్తనలను నేర్చుకోవడం. పరీక్ష డేటా యొక్క సగటు శిక్షణకు ఆటంకం కలిగిస్తుంది.

4. నకిలీ/సమూహ వరుస లీక్: శిక్షణ మరియు పరీక్ష రెండింటిలోనూ ఒకే వ్యక్తికి చెందిన వరుసలు ఉంటాయి (ఒకే రోగిని వేర్వేరు సెట్లలో రెండు సార్లు సందర్శించడం). మోడల్ వ్యక్తిని కంఠస్థం చేస్తుంది.

లీక్ రకం

ఎలా పుడుతుంది

ఎలా నిరోధించాలి

లక్ష్యం లీక్

లక్ష్యం యొక్క ఫలితం కాలమ్

"ప్రిడిక్షన్ సమయంలో నా దగ్గర అది ఉందా" పరీక్ష

సమయం లీక్

భవిష్యత్తును గతానికి తీసుకురావడం

కాలక్రమ విభజన, విండో నియంత్రణ

ప్రీప్రాసెసింగ్ లీక్

ప్రీ-స్ప్లిట్ మార్పిడి

పైప్‌లైన్, శిక్షణ నుండి సరిపోతుంది

సమూహ వరుస లీక్

రెండు సెట్లలో ఒకే యూనిట్

గుంపుల వారీగా విభజించండి (గ్రూప్‌కెఫోల్డ్)

లీకేజీని నిరోధించే ఏకైక క్రమశిక్షణ

అన్ని రకాల లీక్‌లకు సాధారణ పరిష్కారం ఒక వాక్యం వరకు ఉంటుంది: నిజమైన భవిష్యత్తును అనుకరించడానికి పరీక్ష సెట్‌ను వీలైనంత త్వరగా వేరు చేయండి మరియు దానికి ఏమీ "బోధించవద్దు". ఆచరణలో, దీని అర్థం: మొదట విభజించండి, ఆపై శిక్షణ నుండి మాత్రమే అన్ని పరివర్తనలను నేర్చుకోండి మరియు వాటిని పైప్‌లైన్‌లో వర్తింపజేయండి (ఒకే గొలుసులో అన్ని దశలను సేకరించే నిర్మాణం). ప్రతి ఫీచర్ కోసం, "ప్రిడిక్షన్ సమయంలో నా దగ్గర ఈ సమాచారం ఉందా?" అనే ప్రశ్న అడగండి. సమయం ఉంటే, దానిని కాలక్రమానుసారంగా విభజించండి; అదే యూనిట్ పునరావృతమైతే, సమూహం ద్వారా విభజించండి.

జాగ్రత్త: లీక్‌లో అత్యంత ప్రమాదకరమైన అంశం ఏమిటంటే, అది విజయంగా కనిపిస్తుంది. ఒక చెడ్డ మోడల్ స్పష్టంగా పేలవమైన ఫలితాలను ఇస్తుంది మరియు గుర్తించబడుతుంది; లీకైన మోడల్ అద్భుతంగా పని చేస్తుంది, అందరినీ మెప్పిస్తుంది మరియు ఉత్పత్తిలో ఉంచబడుతుంది - అక్కడే పతనం ప్రారంభమవుతుంది. అందుకే "చాలా మంచి" ఫలితం అలారం కోసం కారణం, వేడుక కాదు.

పునరుత్పత్తి: ఒకే ఫలితాన్ని రెండుసార్లు పొందడం

పునరుత్పత్తి అనేది మీరు మరొక సమయంలో, మరొక మెషీన్‌లో విశ్లేషణను మళ్లీ అమలు చేసినప్పుడు అదే ఫలితాన్ని పొందగల సామర్థ్యం. ఇది లేకుండా, మీ విశ్లేషణ యాదృచ్ఛికం, శాస్త్రీయమైనది కాదు. పునరుత్పత్తిని బలహీనపరిచే ప్రధాన కారణాలు మరియు పరిష్కారాలు:

మాన్యువల్ దశలు: Excelలో సెల్‌ను మాన్యువల్‌గా మార్చడం, చార్ట్‌ను మాన్యువల్‌గా సవరించడం. పరిష్కారం: కోడ్‌లో ప్రతి దశను కలిగి ఉండండి.

స్థిరంగా లేని యాదృచ్ఛికత: మోడల్ శిక్షణ, నమూనా, విభజన యాదృచ్ఛికతను కలిగి ఉంటుంది. పరిష్కారం: యాదృచ్ఛిక విత్తనాన్ని పరిష్కరించండి (యాదృచ్ఛిక జనరేటర్ యొక్క ప్రారంభ విలువ) (random_state=42).

సంస్కరణ మార్పులు: లైబ్రరీ సంస్కరణ మారినప్పుడు ఫలితం మారవచ్చు. పరిష్కారం: డిపెండెన్సీలను పరిష్కరించండి (requirements.txt, ఎన్విరాన్మెంట్ ఫైల్).

రికార్డ్ కీపింగ్ లేదు: ఏ డేటా, ఏ కోడ్, ఏ పారామీటర్ ఉపయోగించబడిందో స్పష్టంగా లేదు. పరిష్కారం: సంస్కరణ నియంత్రణ (Git — కోడ్ యొక్క అన్ని సంస్కరణలను సేవ్ చేసే సిస్టమ్) మరియు డేటా సంస్కరణ.

"ఇది నా మెషీన్‌లో మాత్రమే పని చేస్తుంది": పరిష్కారం: పర్యావరణాన్ని డాక్యుమెంట్ చేయండి, వీలైతే కంటైనర్‌లను (డాకర్) ఉపయోగించండి.

మూడు చిన్న కేసులు

కేస్ 1 - టార్గెట్ లీక్. ఒక ఆరోగ్య విశ్లేషణ "పోస్ట్-డిశ్చార్జ్ మెడికేషన్" కాలమ్‌ని "రోగి తిరిగి చేర్చుకుంటారా" అని అంచనా వేసింది. రోగి డిశ్చార్జ్ అయిన తర్వాత మాత్రమే ఈ కాలమ్ పూరించబడింది. మోడల్ 96% ఇచ్చింది, ఉత్పత్తిలో 61%. 8 వారాల ప్రాజెక్ట్ చెత్త. పాఠం: ప్రతి లక్షణాన్ని "అది అంచనా వేసే సమయంలో ఉందా?"

కేస్ 2 - ప్రీప్రాసెసింగ్ లీక్. ఒక బృందం మొత్తం డేటాను స్కేల్ చేసి, ఆపై దానిని విభజించింది. పరీక్ష డేటా యొక్క సగటు స్కేలింగ్‌లో ఉంది. CV స్కోర్ 89%, వాస్తవ ఉత్పత్తి 76%. నేను పైప్‌లైన్‌కు మారినప్పుడు మరియు శిక్షణ నుండి మాత్రమే పరివర్తనల గురించి తెలుసుకున్నప్పుడు నకిలీ విజయం అదృశ్యమైంది. పాఠం: ముందుగా విభజించండి, తర్వాత మార్చండి.

కేసు 3 - పునరుత్పత్తి చేయడంలో వైఫల్యం. ఒక విశ్లేషకుడు మూడు నెలల తర్వాత మేనేజ్‌మెంట్‌కు అందించిన చార్ట్‌ను అప్‌డేట్ చేయాలనుకున్నాడు కానీ అతను దానిని ఎలా తయారు చేశాడో గుర్తులేదు; Excelలో అనేక దశలు మానవీయంగా చేయబడ్డాయి. ఫలితం ఫలించలేదు మరియు విశ్వాసం దెబ్బతింది. పాఠం: మాన్యువల్ దశలు లేవు, ప్రతిదీ కోడ్ మరియు Gitలో ఉంది.

నాలుగు కాపీ చేయగల టెంప్లేట్‌లు

1) లీక్ తనిఖీ:

మీ పాత్ర: లీక్ ఇన్స్పెక్టర్. లక్ష్యం: "చర్న్" (0/1), సూచన సూచన తేదీ: రికార్డ్_తేదీ. నేను మీకు ఈ లక్షణాల జాబితాను ఇస్తాను. ప్రతి ఫీచర్ కోసం: (ఎ) ఇది లక్ష్యం యొక్క పర్యవసానమా, (బి) అంచనా వేసే సమయంలో ఇది నాకు అందుబాటులో ఉందా, (సి) టైమ్ విండోలో భవిష్యత్తు ఉంటుందా? దానిని "అసురక్షిత/అనుమానాస్పద/లీక్"గా గుర్తించి, కారణాన్ని వ్రాయండి. ఫీచర్లు: [జాబితా]

2) లీక్ లేని పైప్‌లైన్:

స్క్లెర్న్ పైప్‌లైన్‌ను సెటప్ చేయండి: మొదటి స్ప్లిట్ రైలు/పరీక్ష (స్తరీకరించబడిన, సీడ్=42), ఆపై శిక్షణ నుండి మాత్రమే పైప్‌లైన్‌లో అన్ని ప్రీప్రాసెసింగ్ (ఇంప్యూట్, స్కేల్, ఎన్‌కోడ్) అమర్చండి. కోడ్ లీక్-రహితంగా ఎందుకు ఉందో వివరించండి, ఏ దశను ఎక్కడ నేర్చుకున్నారో వివరించండి.

3) పునరుత్పత్తి చెక్‌లిస్ట్ కోడ్:

నేను నా విశ్లేషణను పునరుత్పత్తి చేయాలనుకుంటున్నాను. జోడించే కోడ్/నిర్మాణాన్ని సూచించండి: (1) యాదృచ్ఛికత కోసం హార్డ్ సీడ్, (2) ఉపయోగించిన ప్రింటింగ్ లైబ్రరీ వెర్షన్‌లు, (3) డేటా మరియు అవుట్‌పుట్ కోసం తేదీ/వెర్షన్ ట్యాగ్. మాన్యువల్ దశలు లేవని నిర్ధారించుకోవడానికి నాకు చెక్‌లిస్ట్ ఇవ్వండి.

4) సమూహ విభజన (అదే యూనిట్ లీక్):

డేటాలో ఒకే customer_id బహుళ వరుసలలో ఉంది. ఒకే కస్టమర్ శిక్షణ మరియు పరీక్ష రెండింటిలోనూ ఉండకుండా నిరోధించే విభజనను (GroupKFold orGroupShuffleSplit, group = customer_id) చేయండి. విభజించిన తర్వాత రెండు సెట్‌లలో కస్టమర్‌లు లేరని ధృవీకరించడానికి కోడ్‌ని చేర్చండి.

బలహీనమైన ప్రాంప్ట్ / బలమైన ప్రాంప్ట్

బలహీనమైన ప్రాంప్ట్:

నా మోడల్ 98% ఖచ్చితత్వాన్ని అందించింది, అది గొప్పది కాదా? కోడ్‌ని ఆప్టిమైజ్ చేయండి.

98% వేడుకలు లీక్‌ను దాచిపెడతాయి. ఆప్టిమైజ్ చేయడానికి ముందు, ఈ స్కోర్ నిజమా కాదా అని ప్రశ్నించాలి.

శక్తివంతమైన ప్రాంప్ట్:

మీ పాత్ర: లీక్ ఇన్స్పెక్టర్. నా మోడల్ టెస్ట్ సెట్‌లో 98% ఖచ్చితత్వాన్ని అందిస్తుంది, ఇది నాకు "నిజంగా ఉండటం చాలా బాగుంది". తనిఖీ చేయండి: (1) లక్ష్యం ఫలితంగా ఏవైనా లక్షణాలు ఉన్నాయా, (2) విభజనకు ముందు చేసిన మార్పిడులు, (3) రెండు సెట్‌లలో ఒకే యూనిట్, (4) ఎప్పుడైనా లీక్‌లు ఉన్నాయా. ఏవైనా అనుమానాస్పద పాయింట్లను జాబితా చేయండి; లీక్‌ను కనుగొనడంపై దృష్టి పెట్టండి, స్కోర్‌ను పరిష్కరించడం కాదు.

ఇక్కడ, అధిక స్కోర్‌ని ప్రశ్నించడానికి సంకేతంగా పరిగణిస్తారు, జరుపుకోకూడదు.

సాధారణ తప్పులు

  • "చాలా మంచి" ఫలితాన్ని జరుపుకుంటున్నారు. చాలా మంచి-నిజమైన స్కోర్ అనేది లీక్ హెచ్చరిక, ఇది సాధించినది కాదు.
  • విభజనకు ముందు మొత్తం డేటా నుండి పరివర్తనను నేర్చుకోవడం. అత్యంత సాధారణ లీక్; పైప్‌లైన్‌తో ముందుగా విభజించండి.
  • సమయ శ్రేణిని యాదృచ్ఛికంగా విభజించడం. మోడల్ భవిష్యత్తును చూస్తుంది; కాలక్రమ విభజన తప్పనిసరి.
  • ఒకే యూనిట్‌ను రెండు సెట్లలో వదిలివేయడం. మోడల్ వ్యక్తిని గుర్తుంచుకుంటుంది; సమూహం ద్వారా విభజించండి.
  • మాన్యువల్‌గా అడుగుపెట్టి కోడ్‌లో రాయడం లేదు. విశ్లేషణ పునరుత్పాదకమవుతుంది; ప్రతిదీ కోడ్ మరియు Gitలో ఉండాలి.
చిట్కా: మీ ప్రాజెక్ట్ ప్రారంభంలో రెండు వాక్యాల "గౌరవ ప్రతిజ్ఞ" వ్రాయండి: "నేను పరీక్ష సెట్‌ను ఉత్పత్తిలో చూసే ముందు ఏ విధంగానూ తాకలేదు. ప్రతి దశ కోడ్‌లో ఉంటుంది మరియు విత్తనం స్థిరంగా ఉంటుంది." మీరు ఈ రెండు వాక్యాలపై నిజాయితీగా సంతకం చేయలేకపోతే, మీ ఫలితం ఇంకా నమ్మదగినది కాదు.

సారాంశంలో

డేటా లీకేజీ మరియు పునరుత్పత్తి చేయకపోవడం అనేది డేటా సైన్స్‌లో రెండు అత్యంత ఖరీదైన నిశ్శబ్ద లోపాలు. లీకేజ్ అనేది మోడల్ యొక్క భవిష్యత్తు దృష్టి మరియు తప్పుడు విజయంగా చూపుతుంది; పరీక్ష సెట్‌ను ముందుగానే విభజించడం, శిక్షణ (పైప్‌లైన్) నుండి మాత్రమే పరివర్తనలను నేర్చుకోవడం, ప్రతి లక్షణాన్ని "అంచనా సమయంలో నేను కలిగి ఉన్నానా" అనే ప్రశ్నను అడగడం మరియు సరైన విభజన (కాలక్రమానుసారం/సమూహం) చేయడం దీనికి పరిష్కారం. పునరుత్పత్తి అనేది ఒకే ఫలితాన్ని రెండుసార్లు పొందగలగడం; అతని పరిష్కారం మాన్యువల్‌గా దశలను తీసివేయడం, సీడ్‌ను పిన్ చేయడం, సంస్కరణలను స్తంభింపజేయడం మరియు ప్రతిదీ Gitలో ఉంచడం. AI ఈ ప్రమాదాలను పెంచవచ్చు లేదా తగ్గించవచ్చు; మీ క్రమశిక్షణే నిర్ణయిస్తుంది.

అప్లికేషన్ టాస్క్

మీరు నిర్మించిన మోడల్ (లేదా ఊహాత్మకమైనది) యొక్క ఫీచర్ జాబితాను తీసుకోండి మరియు ప్రతి లక్షణాన్ని "అంచనా సమయంలో ఈ సమాచారం నా వద్ద ఉందా?" అనే ప్రశ్నను అడగండి. వ్రాతపూర్వకంగా; కనీసం ఒక లీక్ అభ్యర్థిని కనుగొనండి. ఆపై మీ విశ్లేషణను పునరుత్పత్తి చేయడానికి చెక్‌లిస్ట్‌ను పూరించండి: విత్తనం స్థిరంగా ఉందా, మాన్యువల్ దశలు ఉన్నాయా, సంస్కరణలు రిజిస్టర్ చేయబడిందా, అవి Gitలో ఉన్నాయా. లోపాలను సరిచేయండి.

చెక్లిస్ట్

  • [ ] నేను లీక్ అలర్ట్‌గా "నిజానికి చాలా మంచిది" స్కోర్‌ని ప్రశ్నించానా?
  • [ ] నేను విభజన తర్వాత అన్ని పరివర్తనలను శిక్షణ నుండి నేర్చుకున్నానా?
  • [ ] నేను సమయం/సమూహ నిర్మాణం (కాలక్రమం/గ్రూప్‌కెఫోల్డ్) ప్రకారం విభజించానా?
  • [] నేను స్థిరమైన విత్తనంతో అన్ని యాదృచ్ఛికతను పునరావృతమయ్యేలా చేశానా?
  • [ ] నేను మాన్యువల్ దశలను తీసివేసి, ప్రతిదీ కోడ్ మరియు సంస్కరణ నియంత్రణలో ఉంచానా?