యూనిట్లు
1. డేటా సైన్స్ మరియు అనలిటిక్స్‌లో ఆర్టిఫిషియల్ ఇంటెలిజెన్స్ పరిచయం: వర్క్‌ఫ్లో, పాత్రలు, సరిహద్దులు, ధ్రువీకరణ మరియు నీతి 2. డేటా సేకరణ మరియు మూల అవగాహన: స్కీమా, నమూనా, నాణ్యత మరియు లీక్ అవేర్‌నెస్ 3. డేటా క్లీనింగ్ మరియు ప్రీప్రాసెసింగ్: మిస్సింగ్ వాల్యూ, అవుట్‌లియర్ మరియు టైప్ కన్వర్షన్ 4. అన్వేషణాత్మక డేటా విశ్లేషణ (EDA): పంపిణీలు, సంబంధాలు మరియు ప్రారంభ అంతర్దృష్టులు 5. ఫీచర్ ఇంజనీరింగ్: వేరియంట్‌లను రూపొందించడం, కోడింగ్, స్కేలింగ్ మరియు లీకేజీని నివారించడం 6. మోడల్ బిల్డింగ్: సమస్య నిర్వచనం, అల్గోరిథం ఎంపిక మరియు శిక్షణ/టెస్ట్ స్ప్లిట్ 7. మోడల్ మూల్యాంకనం: కొలమానాలు, క్రాస్ ధ్రువీకరణ మరియు విపరీతమైన అభ్యాసం 8. విజువలైజేషన్ మరియు స్టోరీ టెల్లింగ్: ఖచ్చితమైన గ్రాఫిక్స్, హానెస్ట్ గ్రాఫిక్స్ 9. కోడ్ జనరేషన్: పైథాన్ (పాండాలు) మరియు SQLతో AI-సహాయక విశ్లేషణ 10. డేటా లీకేజ్ మరియు పునరుత్పత్తి: నిశ్శబ్ద విపత్తులు మరియు క్రమశిక్షణ 11. MLOps ఫౌండేషన్, ఎథిక్స్, గోప్యత మరియు బాధ్యతాయుతమైన విశ్లేషణలు
యూనిట్ 2 / 11

డేటా సేకరణ మరియు మూల అవగాహన: స్కీమా, నమూనా, నాణ్యత మరియు లీక్ అవేర్‌నెస్

లాభాలు:

  • విభిన్న డేటా మూలాధారాలను (డేటాబేస్, API, ఫైల్, వెబ్ స్క్రాపింగ్) మరియు ప్రతి దానిలోని ఆపదలను గుర్తించగల సామర్థ్యం మరియు స్కీమాను సరిగ్గా అర్థం చేసుకోవడం
  • నమూనా జనాభా మరియు ఎంపిక పక్షపాతాన్ని సూచిస్తుందో లేదో మూల్యాంకనం చేయడం ద్వారా పునరావృత నమూనాను నిర్వహించగల సామర్థ్యం
  • సేకరణ దశలో డేటా లీకేజీని తొలగించగల సామర్థ్యం మరియు ప్రతి కాలమ్‌లో 'అంచనా సమయంలో నేను దానిని కలిగి ఉంటానా' అనే ప్రశ్న అడగడం ద్వారా చట్టపరమైన/నైతిక సరిహద్దులను గమనించగలరా?

ప్రతి విశ్లేషణ మీరు సేకరించిన డేటా నాణ్యతతో సమానంగా ఉంటుంది. ప్రపంచంలోని అత్యంత అధునాతన మోడల్ కూడా తప్పుగా సేకరించిన, పక్షపాతంతో నమూనా చేయబడిన లేదా భవిష్యత్తు గురించిన సమాచారాన్ని కలిగి ఉన్న డేటాతో పని చేస్తే అది నమ్మదగని ఫలితాలను ఇస్తుంది. కంప్యూటర్ సైన్స్‌లో, ఈ సూత్రం "గార్బేజ్ ఇన్, గార్బేజ్ అవుట్" (గార్బేజ్ ఇన్, గార్బేజ్ అవుట్) అని సంగ్రహించబడింది. ఈ యూనిట్‌లో, మేము డేటా సేకరణ దశను కవర్ చేస్తాము: మూలాన్ని అర్థం చేసుకోవడం, నమూనా చేయడం, నాణ్యమైన ప్రశ్నలను అడగడం మరియు మొదటి రోజు నుండి డేటా లీకేజీ ప్రమాదం గురించి అప్రమత్తంగా ఉండటం. ఈ దశలో కృత్రిమ మేధస్సు ఒక శక్తివంతమైన సహాయం; SQL ప్రశ్నను వ్రాస్తుంది, API పత్రాన్ని సంగ్రహిస్తుంది, డేటా ఒప్పందాన్ని చిత్తు చేస్తుంది. కానీ మీరు ఏ డేటాను సేకరిస్తారో మరియు ఆ డేటా మిమ్మల్ని సూచిస్తుందో లేదో నిర్ణయించేది మానవుడే.

డేటా మూలాలను తెలుసుకోవడం

డేటా వివిధ ప్రదేశాల నుండి వస్తుంది మరియు ప్రతి మూలానికి దాని స్వంత ఆపదలు ఉంటాయి. డేటాబేస్ (పట్టికలలో నిల్వ చేయబడిన నిర్మాణాత్మక డేటా, సాధారణంగా SQLతో ప్రశ్నించబడుతుంది) అత్యంత సాధారణ మూలం; ఇది నమ్మదగినది, కానీ దాని పథకాన్ని బాగా అర్థం చేసుకోవడం అవసరం. API (అప్లికేషన్ ప్రోగ్రామింగ్ ఇంటర్‌ఫేస్) ప్రత్యక్ష డేటాను అందిస్తుంది కానీ వేగ పరిమితులు మరియు ఫార్మాట్ మార్పుల ప్రమాదాన్ని కలిగి ఉంటుంది. ఫైల్‌లు (CSV, Excel, JSON) అనువైనవి కానీ ఫార్మాట్ అస్థిరతకు గురయ్యే అవకాశం ఉంది. వెబ్ స్క్రాపింగ్ శక్తివంతమైనది, కానీ దీనికి చట్టపరమైన మరియు నైతిక పరిమితులు ఉన్నాయి; ప్రతి సైట్ స్క్రాప్ చేయబడదు.

శ్రద్ధ: వెబ్ స్క్రాపింగ్ మరియు ఆటోమేటిక్ డేటా సేకరణ కోసం, సైట్ యొక్క వినియోగ నిబంధనలు, robots.txt ఫైల్ మరియు KVKK/GDPRకి అనుగుణంగా ఉండండి. అనధికార డేటా సేకరణ చట్టపరమైన బాధ్యతను సృష్టిస్తుంది. సమాచార భద్రత విషయంలో, మీకు అధికారం ఉన్న సిస్టమ్‌లపై మరియు రక్షణ/విశ్లేషణ ప్రయోజనాల కోసం మాత్రమే డేటా సేకరణ సాధనాలను ఉపయోగించండి; అనధికారిక యాక్సెస్ లేదా స్క్రాప్ చేయడం నిషేధించబడింది.

స్కీమాను అర్థం చేసుకోవడం: డేటాతో పరిచయం పొందడం

డేటా సెట్‌ను సేకరించే ముందు, మీరు దాని స్కీమా (నిలువుల పేర్లు, వాటి డేటా రకాలు, వాటి అర్థాలు మరియు ఒకదానికొకటి వాటి సంబంధాలు) అర్థం చేసుకోవాలి. "డేటా డిక్షనరీ"ని సృష్టించడంలో AI ఇక్కడ చాలా ఉపయోగకరంగా ఉంటుంది — ప్రతి కాలమ్ అంటే ఏమిటో వివరించే పట్టిక. కానీ AI ఉత్పత్తి చేసే వివరణలు అంచనాలు; డేటాను రూపొందించిన బృందంతో ప్రతి నిలువు వరుస యొక్క నిజమైన అర్థాన్ని నిర్ధారించండి. ఉదాహరణకు, "స్టేటస్" అనే నిలువు వరుసలో 0/1/2 ఉండవచ్చు; ఇవి "పెండింగ్‌లో ఉన్నాయో/ఆమోదించబడ్డాయో/రద్దు చేయబడినవో" లేదా మరేదైనా ఉన్నాయా అనేది కేవలం ఆవిర్భవించిన బృందానికి మాత్రమే తెలుసు.

కింది పట్టిక ప్రాథమిక వనరుల రకాలు మరియు హెచ్చరికలను సంగ్రహిస్తుంది:

మూలం

బలమైన పాయింట్

ఉచ్చు

AI ఎలా సహాయపడుతుంది

SQL డేటాబేస్

నిర్మాణాత్మక, నమ్మదగిన

కాంప్లెక్స్ జాయిన్స్

ప్రశ్న ముసాయిదా వ్రాస్తుంది

API

ప్రత్యక్ష డేటా

వేగ పరిమితి, ఆకారం మార్పు

డాక్యుమెంట్ సారాంశాలు, పుల్ కోడ్

CSV/Excel

సౌకర్యవంతమైన, వేగవంతమైన

ఫార్మాట్ అస్థిరత

కోడ్‌ని చదవండి/అన్వయించండి

వెబ్ స్క్రాపింగ్

విస్తృత చేరువ

చట్టపరమైన/నైతిక పరిమితి

పార్సింగ్ డ్రాఫ్ట్ (అధికారంలో)

లాగ్/ఈవెంట్ డేటా

వివరంగా

భారీ వాల్యూమ్

వడపోత ప్రశ్న

దృష్టాంతం: భాగం మొత్తం ప్రాతినిధ్యం వహిస్తుందా?

ఎక్కువ సమయం, మీరు మొత్తం డేటాతో కాకుండా నమూనా (జనాభా నుండి ఎంచుకున్న ఉపసమితి)తో పని చేస్తారు. క్లిష్టమైన ప్రశ్న: ఈ నమూనా జనాభాను సూచిస్తుందా? ఎంపిక పక్షపాతం అత్యంత సాధారణ ఉచ్చు. ఉదాహరణకు, మీరు మొబైల్ యాప్ నుండి వినియోగదారులను మాత్రమే నమూనా చేస్తే, మీరు వెబ్ వినియోగదారులను చూడలేరు మరియు మీ ఫలితాలు తప్పుదారి పట్టించేవిగా ఉంటాయి. యాదృచ్ఛిక నమూనా (ప్రతి రికార్డును ఎంపిక చేసుకునేందుకు సమాన అవకాశం ఉంటుంది) చాలా సందర్భాలలో సురక్షితమైనది; కానీ సమయ శ్రేణి డేటాలో, విభజన యాదృచ్ఛికంగా కాకుండా కాలక్రమానుసారంగా జరుగుతుంది (మనం దీనిని యూనిట్లు 7 మరియు 10లో చూస్తాము).

మొదటి రోజు నుండి లీక్ అవగాహన

డేటా లీకేజీ చాలా విపత్తులకు మూలం మరియు సాధారణంగా డేటా సేకరణ దశలో తలెత్తుతుంది. ఉదాహరణ: "ఇది రద్దు చేయబడిందా" అని అంచనా వేసేటప్పుడు, మీరు డేటాకు "రద్దు చేసే తేదీ" కాలమ్‌ని జోడిస్తే, మోడల్ భవిష్యత్తును చూస్తుంది. సేకరణ దశలో, ప్రతి కాలమ్‌కు ఒక ప్రశ్న అడగండి: "నేను అంచనా వేసే సమయంలో ఈ సమాచారం నా దగ్గర ఉంటుందా?" కాదనే సమాధానమైతే ఆ కాలమ్ లీక్ అవుతోంది. మేము ఈ అంశాన్ని యూనిట్ 10లో లోతుగా కవర్ చేస్తాము; అయితే అవగాహన మొదటి రోజు నుంచే ప్రారంభం కావాలి.

మూడు చిన్న కేసులు

కేసు 1 - ప్రాతినిధ్యం యొక్క సమస్య. ఒక బ్యాంకు తన క్రెడిట్ రిస్క్ మోడల్ (18,500 రికార్డులు) కోసం ఆమోదించబడిన రుణాలపై మాత్రమే డేటాను సేకరించింది. తిరస్కరణలు డేటాలో లేవు. మోడల్ నిజ ప్రపంచంలో తప్పుగా ఉంది ఎందుకంటే తిరస్కరించేవారు ఎలా ప్రవర్తిస్తారో అది ఎప్పుడూ చూడలేదు. పాఠం: నమూనా మీరు మీ నిర్ణయం తీసుకుంటున్న మొత్తం జనాభాకు ప్రతినిధిగా ఉండాలి.

కేసు 2 - నిశ్శబ్ద రూపం మార్పు. ఒక బృందం ప్రతిరోజూ API నుండి ధర డేటాను తీసుకుంటోంది. ఒక రోజు, API ప్రొవైడర్ కరెన్సీని USD నుండి EURకి మార్చారు, కానీ డొమైన్ పేరు అలాగే ఉంది. 12 రోజుల పాటు తప్పు యూనిట్‌లో డేటా సేకరించబడింది; 3,200 లైన్లు పాడయ్యాయి. పాఠం: API డేటాలో వాల్యూమ్ మరియు ఫార్మాట్ అనుగుణ్యతను క్రమం తప్పకుండా తనిఖీ చేయండి.

కేసు 3 - ప్రారంభ లీకేజ్. "చర్న్" అంచనా కోసం డేటాను సేకరిస్తున్నప్పుడు ఒక విశ్లేషకుడు "ఖాతా మూసివేతకు కారణం" కాలమ్‌ని చేర్చారు. కస్టమర్ వెళ్లిపోయిన తర్వాత మాత్రమే ఈ నిలువు వరుస పూరించబడింది. పరీక్ష సెట్‌లో మోడల్ 97% ఖచ్చితత్వాన్ని అందించింది; అంచనా సమయంలో ఆ కాలమ్ ఖాళీగా ఉన్నందున ఇది ప్రొడక్షన్‌లో పని చేయలేదు. పాఠం: ప్రతి కాలమ్‌ను "ప్రిడిక్షన్ సమయంలో నా దగ్గర ఉందా?" అనే ప్రశ్న అడగండి.

నాలుగు కాపీ చేయగల టెంప్లేట్‌లు

1) డేటా నిఘంటువు వెలికితీత:

మీ పాత్ర: డేటా సైంటిస్ట్ అసిస్టెంట్. పట్టిక యొక్క నిలువు వరుస పేర్లు మరియు నమూనా (అనామక) విలువలు క్రింద ఉన్నాయి. ప్రతి నిలువు వరుస కోసం, దాని అంచనా అర్థం, డేటాటైప్ మరియు సంభావ్య నాణ్యత ప్రమాదాలను పట్టికలో జాబితా చేయండి. మీకు ఖచ్చితంగా తెలియని నిలువు వరుసలను "నిర్ధారణ అవసరం"గా గుర్తించండి; మేకింగ్. నిలువు వరుసలు: [ఇక్కడ అతికించండి]

2) నమూనా కోడ్ (యాదృచ్ఛికం, పునరావృతం):

నా దగ్గర పాండాలు డిఎఫ్ ఉన్నాయి. 200,000 అడ్డు వరుసల నుండి ప్రతినిధి 5% యాదృచ్ఛిక నమూనాను సంగ్రహించే కోడ్‌ను వ్రాయండి. random_state=42 (పునరుత్పత్తి కోసం) ఉపయోగించండి. నమూనా యొక్క తరగతి పంపిణీ జనాభాకు సమానంగా ఉందో లేదో తనిఖీ చేయడానికి కోడ్‌ని జోడించండి.

3) లీక్ స్కానింగ్ ప్రశ్న:

నేను మీకు ఈ నిలువు వరుసల జాబితాను ఇస్తాను. "ఇది రద్దు చేయబడిందా" (0/1) అంచనా వేయడం నా లక్ష్యం. ప్రతి నిలువు వరుస కోసం, అంచనా సమయంలో నేను దానిని కలిగి ఉంటానో లేదో అంచనా వేయండి మరియు దానిని "సురక్షితమైన / అనుమానాస్పద / లీక్"గా గుర్తించండి. మీ హేతువును ఒక వాక్యంలో వ్రాయండి. నిలువు వరుసలు: [జాబితా]

4) SQL పుల్ క్వెరీ డ్రాఫ్ట్:

నా వద్ద PostgreSQLలో "ఆర్డర్‌లు" మరియు "కస్టమర్‌లు" పట్టికలు ఉన్నాయి. గత 90 రోజుల ఆర్డర్‌లను కస్టమర్ సిటీతో కలిపి, ఒక్కో నగరానికి వచ్చిన ఆర్డర్‌ల మొత్తం మరియు సంఖ్యను తిరిగి ఇచ్చే JOIN ప్రశ్నను వ్రాయండి. తేదీ ఫిల్టర్ మరియు NULL నగరాలు ఎలా నిర్వహించబడతాయో వివరించండి. నేను ప్రశ్నను అమలు చేస్తాను మరియు దానిని ధృవీకరిస్తాను.

బలహీనమైన ప్రాంప్ట్ / బలమైన ప్రాంప్ట్

బలహీనమైన ప్రాంప్ట్:

ఈ డేటాబేస్ నుండి నాకు మంచి నమూనా డేటాను అందించండి.

"మంచిది" అస్పష్టంగా ఉంది; ఏ పెయింటింగ్, ఏ కాలం, ఏ పరిమాణం, ఏ ప్రయోజనం స్పష్టంగా లేదు. AI సాధారణ, బహుశా తప్పు ప్రశ్నను మాత్రమే ఉత్పత్తి చేస్తుంది.

శక్తివంతమైన ప్రాంప్ట్:

మీ పాత్ర: SQL అసిస్టెంట్. నా వద్ద "లావాదేవీల" పట్టిక ఉంది: నిలువు వరుసల id, customer_id, తేదీ (టైమ్‌స్టాంప్), మొత్తం (సంఖ్యా), ఛానెల్ (టెక్స్ట్: 'వెబ్'/'మొబైల్'). టాస్క్: 2024 సంవత్సరానికి ప్రతి ఛానెల్ నుండి 10,000 ప్రాతినిధ్య అడ్డు వరుసలను అందించే పునరావృతమయ్యే (ఆర్డర్ ద్వారా నిర్ణీత) ప్రశ్నను వ్రాయండి. ప్రయోజనం: ఛానెల్ తులనాత్మక విశ్లేషణ. మీ ప్రశ్న యొక్క ఊహలను జాబితా చేయండి.

ఇక్కడ పట్టిక, ప్రయోజనం, పరిమాణం మరియు పునరావృతం స్పష్టంగా ఉన్నాయి.

సాధారణ తప్పులు

  • నమూనా యొక్క ప్రాతినిధ్యాన్ని ప్రశ్నించడం లేదు. సులభంగా యాక్సెస్ చేయగల డేటా ఖచ్చితమైన డేటా కాదు; ఎంపిక పక్షపాతం ఫలితాన్ని వక్రీకరిస్తుంది.
  • కాలమ్ అర్థాలను AIకి అనుగుణంగా మార్చడం. మూలం జట్టు అర్థం తెలుసు; AI అంచనాను నిర్ధారించకుండా ఉపయోగించవద్దు.
  • API ఫార్మాట్/యూనిట్ మార్పును ట్రాక్ చేయడం లేదు. నిశ్శబ్ద మార్పు రోజుల తరబడి అవినీతి డేటాను సేకరిస్తుంది.
  • వసూళ్ల దశలోనే లీకేజీని పట్టించుకోవడం లేదు. "ప్రిడిక్షన్ సమయంలో నా దగ్గర అది ఉందా" అనే ప్రశ్న ముందుగానే అడగకపోతే, మోడల్ తప్పుడు విజయాన్ని ఇస్తుంది.
  • అనధికార లేదా చట్టవిరుద్ధమైన డేటాను సేకరించడం. robots.txt, ఉపయోగ నిబంధనలు మరియు KVKK ఉల్లంఘన తీవ్రమైన ప్రమాదం.
చిట్కా: ప్రతి కొత్త డేటా సోర్స్ కోసం ఒక పేజీ "డేటా కార్డ్"ని ఉంచండి: సోర్స్, పుల్ తేదీ, అడ్డు వరుసల సంఖ్య, తెలిసిన సరిహద్దులు మరియు లీకేజ్ ప్రమాదం ఉన్న నిలువు వరుసలు. ఈ కార్డ్ నెలల తర్వాత "ఈ డేటా ఏమిటి" ప్రశ్న మరియు పునరుత్పత్తిని సేవ్ చేస్తుంది.

సారాంశంలో

సేకరించిన డేటా నాణ్యత ద్వారా విశ్లేషణ యొక్క నాణ్యత పరిమితం చేయబడింది. మూలం (డేటాబేస్, API, ఫైల్, స్క్రాప్) మరియు స్కీమాను బాగా తెలుసుకోండి; నమూనా జనాభాకు ప్రతినిధి అని నిర్ధారించుకోండి; "అంచనా సమయంలో నా దగ్గర అది ఉందా?" అని ప్రతి నిలువు వరుసను అడగడం ద్వారా మొదటి రోజు నుండి లీకేజీని తొలగించండి. AI అనేది ప్రశ్న మరియు డాక్యుమెంట్ పనికి గొప్ప యాక్సిలరేటర్, కానీ మానవులు ఏ డేటాను సేకరించాలో మరియు దాని ప్రాతినిధ్యతను నిర్ణయిస్తారు. అధికారం, చట్టం మరియు గోప్యత యొక్క పరిమితులు ఎల్లప్పుడూ మొదటి స్థానంలో ఉంటాయి.

అప్లికేషన్ టాస్క్

డేటా మూలాన్ని ఎంచుకోండి (మీ స్వంత వ్యాపారం లేదా ఊహాత్మకం నుండి). పైన ఉన్న "డేటా డిక్షనరీ ఎక్స్‌ట్రాక్షన్" టెంప్లేట్‌తో AI నుండి డేటా డిక్షనరీ డ్రాఫ్ట్‌ను పొందండి; ఆపై ప్రతి నిలువు వరుస లీక్ అయిందో లేదో తెలుసుకోవడానికి మాన్యువల్‌గా మూల్యాంకనం చేయండి. కనీసం ఒక అనుమానాస్పద/లీక్ కాలమ్‌ని కనుగొని, అది ఎందుకు ప్రమాదకరమో ఒక్క వాక్యంలో వ్రాయడానికి ప్రయత్నించండి.

చెక్లిస్ట్

  • [ ] నేను సోర్స్ టీమ్‌తో డేటా సోర్స్ మరియు స్కీమాను నిర్ధారించానా?
  • [] నమూనా జనాభాకు ప్రతినిధి అని నేను తనిఖీ చేసానా?
  • [ ] నేను ప్రతి నిలువు వరుసను "అంచనా సమయంలో నేను కలిగి ఉంటానా?"
  • [ ] నేను నమూనాను పునరావృతమయ్యేలా (స్థిరమైన విత్తనం) చేశానా?
  • [ ] నేను సేకరణ యొక్క చట్టపరమైన/నైతిక (అధికారం, robots.txt, KVKK) పరిమితులను తనిఖీ చేశానా?