లాభాలు:
- డేటా సైన్స్ యొక్క ఆరు-దశల వర్క్ఫ్లో (సమస్య నిర్వచనం, సేకరణ, క్లీనింగ్, డిస్కవరీ, మోడలింగ్, కమ్యూనికేషన్) మరియు టాస్క్ రిస్క్ స్థాయి ప్రకారం, ప్రతి దశలో కృత్రిమ మేధస్సు పనిచేసే అధికారాన్ని వేరు చేయగల సామర్థ్యం
- ప్రతి కృత్రిమ మేధస్సు అవుట్పుట్ను మూలానికి కనెక్ట్ చేయడం, రన్ చేయడం మరియు పోల్చడం మరియు నిపుణుల వడపోత ద్వారా దానిని పంపడం ద్వారా దాన్ని ధృవీకరించే క్రమశిక్షణను వర్తింపజేయగల సామర్థ్యం.
- పునరుత్పత్తి మరియు గోప్యతా సూత్రాలను (కోడ్గా రాయడం, అనామకీకరణ) మొదటి రోజు నుండి విశ్లేషణ అలవాట్లుగా మార్చగల సామర్థ్యం
ముడి, గజిబిజి మరియు తరచుగా "అబద్ధం" డేటా ప్రతిరోజూ డేటా సైంటిస్ట్ డెస్క్పైకి వస్తుంది. విక్రయాల పట్టికలో, తేదీ కాలమ్ మూడు వేర్వేరు ఫార్మాట్లలో వ్రాయబడింది; కస్టమర్ నంబర్లు కొన్ని లైన్లలో ఖాళీగా ఉన్నాయి; నిలువు వరుస పేరు "ఆదాయం", కానీ అది TL మరియు USD విలువలు రెండింటినీ కలిగి ఉంటుంది. డేటా సైన్స్ యొక్క పని ఈ గందరగోళం నుండి నమ్మదగిన నిర్ణయం తీసుకోవడం: డేటాను సేకరించడం, దానిని శుభ్రం చేయడం, దానిని అన్వేషించడం, నమూనాను రూపొందించడం, ఫలితాన్ని ధృవీకరించడం మరియు దానిని కథనంగా మార్చడం. ఆర్టిఫిషియల్ ఇంటెలిజెన్స్ (AI, లేదా షార్ట్ కంప్యూటర్ సిస్టమ్ల కోసం AI, ఇది టెక్స్ట్ మరియు కోడ్ని రూపొందించడం, నమూనాలను గుర్తించడం, సంగ్రహించడం మరియు అంచనాలను రూపొందించడం) ఈ గొలుసులోని ప్రతి లింక్ను తాకగలదు: నిమిషాల్లో క్లీనప్ కోడ్ రాయడం, అన్వేషణాత్మక విశ్లేషణ కోసం గ్రాఫ్లను సిఫార్సు చేయడం, మోడల్ మెట్రిక్ను వివరించడం, SQL ప్రశ్నను సరిదిద్దడం. కానీ అదే AI అది ఎన్నడూ చూడని డేటా కోసం "కోరిలేషన్ 0.72" వంటి నమ్మకమైన కల్పనను కూడా మీకు అందిస్తుంది.
ఈ మొదటి యూనిట్ లైబ్రరీ పరిచయం కాదు. డేటా సైన్స్ వర్క్ఫ్లోలో AIని ఎక్కడ ఉంచాలో మరియు ఎక్కడ ఉంచకూడదో స్పష్టం చేయడం దీని ఉద్దేశం. మొదటి నుండి ప్రాథమిక సూత్రాన్ని తెలియజేస్తాము: AI సహాయకుడు, డేటా సైంటిస్ట్ కాదు. ఏ డేటాను సేకరించాలి, ఏ మెట్రిక్పై నిర్ణయం తీసుకోవాలి, మోడల్ను ఉత్పత్తిలో ఉంచాలా వద్దా మరియు ఎక్కడ నైతిక సరిహద్దులను గీయాలి అనే నిర్ణయం సమర్థ నిపుణుడిపై ఆధారపడి ఉంటుంది. ధృవీకరించని AI అవుట్పుట్, సంతకం చేయని విశ్లేషణ నివేదిక వలె ప్రమాదకరం.
డేటా సైన్స్ వర్క్ఫ్లో: ఎండ్-టు-ఎండ్ మ్యాప్
డేటా ప్రాజెక్ట్ను అర్థం చేసుకోవడానికి, దానిని ఆరు దశలుగా విభజించడం సహాయకరంగా ఉంటుంది. ఈ మొత్తం మాడ్యూల్ ఈ మ్యాప్ను అనుసరిస్తుంది.
1. సమస్య నిర్వచనం: ఏ నిర్ణయానికి మద్దతు ఇవ్వడానికి మనం దేనిని కొలుస్తాము, ఎందుకు? ఈ దశ AIకి అప్పగించబడలేదు; ఉద్యోగాన్ని నిర్వచించేది వ్యక్తి.
2. డేటా సేకరణ: మూలాలను గుర్తించడం, డేటాను సంగ్రహించడం, నమూనా చేయడం. (యూనిట్ 2)
3. డేటా క్లీనింగ్ మరియు ప్రీప్రాసెసింగ్: తప్పిపోయిన విలువ, అవుట్లియర్, టైప్ కన్వర్షన్. (యూనిట్ 3)
4. అన్వేషణాత్మక డేటా విశ్లేషణ (EDA - అన్వేషణాత్మక డేటా విశ్లేషణ, "కంటి ద్వారా" డేటా పంపిణీ మరియు సంబంధాలను గుర్తించే దశ): (యూనిట్ 4)
5. ఫీచర్ ఇంజనీరింగ్ మరియు మోడలింగ్: వేరియబుల్ జనరేషన్, అల్గోరిథం ఎంపిక, శిక్షణ, మూల్యాంకనం. (యూనిట్ 5, 6, 7)
6. కమ్యూనికేషన్ మరియు ప్రొడక్షన్: విజువలైజేషన్, స్టోరీ, MLOps (మోడల్ను ప్రత్యక్షంగా తీసుకొని దానిని పర్యవేక్షించే క్రమశిక్షణ). (యూనిట్ 8, 11)
AI ఈ ఆరు దశల్లో ఒక్కోదానిలో వేరే అధికారంతో పనిచేస్తుంది. దిగువ పట్టిక ఈ అధికార పంపిణీని సంగ్రహిస్తుంది; ఇది మాడ్యూల్ యొక్క ఏకైక అతి ముఖ్యమైన పట్టిక.
వేదిక
AI పాత్ర
ప్రమాద స్థాయి
ఎవరు ఆమోదిస్తారు
సమస్య నిర్వచనం
కలవరపరిచే భాగస్వామి
తక్కువ
డేటా సైంటిస్ట్ + వాటాదారు
శుభ్రపరిచే కోడ్ను వ్రాయండి
కోడ్ స్కెచ్ జనరేటర్
మధ్యస్థ
డేటా సైంటిస్ట్ (కోడ్ చదువుతుంది)
EDA వ్యాఖ్య
నమూనా సూచనకర్త
మధ్యస్థ
డేటా సైంటిస్ట్
ఫీచర్ జనరేషన్
ఆలోచన మరియు కోడ్ జెనరేటర్
మధ్యస్థ-ఎక్కువ
లీక్ నియంత్రణ తప్పనిసరి
మోడల్ ఎంపిక/మెట్రిక్
సలహాదారు
అధిక
డేటా సైంటిస్ట్
ఉత్పత్తిలో పెట్టాలని నిర్ణయం
సహాయక ఇన్పుట్
చాలా ఎక్కువ
బృందం + వ్యాపార యజమాని
నీతి/గోప్యతా ఆమోదం
ఉద్దీపన
చాలా ఎక్కువ
మానవుడు, ఎల్లప్పుడూ
ఈ చార్ట్లోని ఒక వాక్యాన్ని గుర్తుంచుకోండి: వాటాలు పెరిగేకొద్దీ, AI పాత్ర తగ్గిపోతుంది మరియు మానవ ఆమోదం పెరుగుతుంది.
ధృవీకరణ ఈ వ్యాపారం యొక్క ప్రధాన అంశం
AI భాషా నమూనాలు ఖచ్చితంగా కనిపిస్తాయి, కానీ అవి ఖచ్చితంగా ఉండకపోవచ్చు. సాంకేతిక భాషలో, దీనిని భ్రాంతి అని పిలుస్తారు: ఇది వాస్తవమైనట్లుగా ఒక సరళమైన వాక్యంలో ఉనికిలో లేని సమాచారాన్ని మోడల్ యొక్క కల్పన. డేటా సైన్స్లో, ఇది మూడు రూపాల్లో వస్తుంది. మొదటిది నకిలీ నంబర్: మీరు ఎటువంటి డేటాను ఇవ్వకుండా మోడల్ను "సగటు ఆర్డర్ మొత్తం ఎంత" అని అడిగితే, అది మీ డేటాను ఎన్నడూ చూడనప్పటికీ, నమ్మకంగా మీకు నంబర్ చెబుతుంది. రెండవది ఉనికిలో లేని ఫంక్షన్: మోడల్ ఉనికిలో లేని ఫంక్షన్ను సూచించవచ్చు, ఉదాహరణకు pandas.read_excel_fast(). మూడవది, తప్పు గణాంక వివరణ: మోడల్ "p-విలువ 0.04, కాబట్టి పరికల్పన 96% సరైనది" వంటి క్లాసిక్ గణాంక లోపాన్ని సజావుగా పునరావృతం చేయగలదు.
ధృవీకరణ క్రమశిక్షణ మూడు దశలను కలిగి ఉంటుంది:
- మూలానికి లింక్: ప్రతి సంఖ్య, రేటు మరియు ట్రెండ్ మీ డేటా నుండి రావాలి, AI మెమరీ నుండి కాదు. డేటాపై పనిచేసే కోడ్ కోసం AIని ఉపయోగించండి, డేటా గుర్తుంచుకోవడానికి కాదు.
- అమలు చేయండి మరియు సరిపోల్చండి: AI ద్వారా అందించబడిన ప్రతి కోడ్ను మీరే అమలు చేయండి; అది ఉత్పత్తి చేసే ప్రతి మెట్రిక్ను స్వతంత్ర బేస్లైన్తో పోల్చండి.
- నిపుణుల ఫిల్టర్: అవుట్పుట్ గణాంకాలు మరియు డొమైన్ పరిజ్ఞానానికి విరుద్ధంగా ఉందో లేదో మీరే పరీక్షించుకోండి.
హెచ్చరిక: AI రాసిన విశ్లేషణను రన్ చేయకుండా మరియు చదవకుండా ప్రెజెంటేషన్లో ఉంచడం సంతకం చేయని నివేదికను ప్రదర్శించడం లాంటిది. కోడ్ పనిచేస్తుందంటే అది సరైనదని అర్థం కాదు; తప్పు కాలమ్ను సంగ్రహించే కోడ్ కూడా లోపాలు లేకుండా పని చేస్తుంది.
పునరుత్పత్తి: ఒకే ఫలితాన్ని రెండుసార్లు ఉత్పత్తి చేయగలగడం
డేటా సైన్స్ యొక్క నిశ్శబ్దమైన కానీ క్లిష్టమైన సూత్రం పునరుత్పత్తి: మీరు ఆరు నెలల తర్వాత లేదా వేరే కంప్యూటర్లో మళ్లీ విశ్లేషణను అమలు చేసినప్పుడు, మీరు అదే ఫలితాన్ని పొందుతారు. AIతో పని చేస్తున్నప్పుడు ఈ ప్రమాదం పెరుగుతుంది, ఎందుకంటే మీరు AIకి "ఈ గ్రాఫ్ని రూపొందించండి" మరియు మాన్యువల్గా ప్లే చేయమని చెప్పినప్పుడు, దశలు అదృశ్యమవుతాయి. నియమం: ప్రతి దశ తప్పనిసరిగా కోడ్ మరియు సంస్కరణ నియంత్రణలో నమోదు చేయబడాలి (Git వంటివి); యాదృచ్ఛికతతో కూడిన దశల్లో, యాదృచ్ఛిక సీడ్ (యాదృచ్ఛిక సంఖ్య జనరేటర్ యొక్క ప్రారంభ విలువ; స్థిరంగా ఉంటే, ఫలితం పునరావృతమవుతుంది) స్థిరపరచబడాలి. మేము ఈ అంశాన్ని యూనిట్ 10లో లోతుగా వివరిస్తాము; ప్రస్తుతానికి, ఈ అలవాటును పొందండి: "చేతితో క్లిక్ చేయవద్దు, కోడ్లో వ్రాయండి."
మూడు చిన్న కేసులు
కేసు 1 - సురక్షిత త్వరణం. ఇ-కామర్స్ విశ్లేషకుడు సాధారణంగా 240 వేల వరుసల ఆర్డర్ టేబుల్ను క్లియర్ చేయడానికి సగం రోజు వెచ్చిస్తారు. అతను కాలమ్ పేర్లు మరియు మొదటి 5 వరుసలను (వ్యక్తిగత డేటా లేకుండా) AIకి ఇచ్చాడు మరియు పాండాలను శుభ్రపరిచే కోడ్ను అడిగాడు. AI 8 సెకన్లలో డ్రాఫ్ట్ను ఉత్పత్తి చేసింది; విశ్లేషకుడు కోడ్ లైన్ను లైన్ వారీగా చదివి, తేదీని అన్వయించడంలో లోపాన్ని పరిష్కరించి, దాన్ని అమలు చేశాడు. వ్యవధి: 4 గంటలకు బదులుగా 35 నిమిషాలు. AI కోడ్ని అందించింది, ధృవీకరణ మానవుని వద్దనే ఉంది.
కేస్ 2 — మేడ్-అప్ మెట్రిక్ ట్రాప్. ఒక ఇంటర్న్ AIని అడిగాడు, "ఈ డేటాపై యాదృచ్ఛిక ఫారెస్ట్ ఎంత ఖచ్చితమైనది?" మోడల్ శిక్షణ లేకుండా. "సుమారు 89%," AI చెప్పారు. ఇంటర్న్ దీన్ని ప్రదర్శనలో ఉంచారు; నిజమైన మోడల్ శిక్షణ పొందినప్పుడు, ఖచ్చితత్వం 71%. తప్పు: AIకి డేటా మరియు మోడల్లను అందించకుండా కొలమానాల కోసం వేచి ఉండటం.
కేసు 3 - నిశ్శబ్ద లీక్. ఒక బృందం ప్రశ్నించకుండానే "టార్గెట్ వేరియబుల్ యొక్క సగటును ఫీచర్గా జోడించు" అనే AI-సూచించిన ఆలోచనను అమలు చేసింది. మోడల్ టెస్ట్ సెట్లో 98% ప్రదర్శించింది, అయితే ఫీచర్ భవిష్యత్తు సమాచారాన్ని లీక్ చేస్తున్నందున ఉత్పత్తిలో క్రాష్ అయింది (డేటా లీక్, యూనిట్ 10). తప్పు: AI సిఫార్సును గణాంకపరంగా ఫిల్టర్ చేయడం లేదు.
బలహీనమైన ప్రాంప్ట్ / బలమైన ప్రాంప్ట్
బలహీనమైన ప్రాంప్ట్:
ఈ విక్రయాల డేటాను విశ్లేషించి, సగటు రాబడిని నాకు చెప్పండి.
ఈ దావా లోపభూయిష్టంగా ఉంది: AIకి డేటా ఇవ్వబడలేదు, కాబట్టి “సగటు ఆదాయం” మాత్రమే తయారు చేయబడుతుంది. నిలువు వరుసలు, కాలం లేదా కరెన్సీ స్పష్టంగా లేవు.
శక్తివంతమైన ప్రాంప్ట్:
మీ పాత్ర: డేటా సైంటిస్ట్కి సహాయం చేసే సహాయకుడు. నా దగ్గర పాండాస్ డేటాఫ్రేమ్ ఉంది: df. నిలువు వరుసలు:- order_date (టెక్స్ట్, ఫార్మాట్ "2024-03-01")- amount_tl (దశాంశం, కొన్ని అడ్డు వరుసలలో NaN)- customer_id (పూర్ణాంకం) టాస్క్: (1) సగటు మొత్తాన్ని లెక్కించే పాండాస్ కోడ్ను వ్రాయండి, (2) NaN విలువలను ఎలా నిర్వహిస్తుందో వివరించండి, (3) కోడ్ను అంచనా వేసే జాబితాను జాబితా చేయండి. డేటా కంటెంట్ను రూపొందించవద్దు; కోడ్ని రూపొందించండి మరియు నేను ఫలితాన్ని అమలు చేసి ధృవీకరిస్తాను.
ఈ అభ్యర్థనలో, పథకం, నిరీక్షణ మరియు "కల్పన నిషేధం" స్పష్టంగా ఉన్నాయి. మీరు ఇప్పటికీ అవుట్పుట్ను మీరే అమలు చేసి, ధృవీకరించండి.
నీతి మరియు గోప్యత యొక్క ప్రారంభం
డేటా సైన్స్ తరచుగా వ్యక్తిగత డేటాతో పని చేస్తుంది: కస్టమర్, రోగి, ఉద్యోగి రికార్డులు. Türkiyeలో KVKK (వ్యక్తిగత డేటా రక్షణ చట్టం) మరియు ఐరోపాలోని GDPR ఈ డేటాను రక్షిస్తాయి. మీ అసలు పేరు, ID, ఇమెయిల్ లేదా చిరునామాను పబ్లిక్ AI సాధనంలో అతికించడం ఉల్లంఘన. నియమం: భాగస్వామ్యం చేయడానికి ముందు డేటాను అనామకీకరించండి, అవసరమైతే స్కీమా (కాలమ్ పేర్లు, రకాలు) మరియు నకిలీ ఉదాహరణ వరుసను మాత్రమే అందించండి. మేము యూనిట్ 11లో నీతి అంశాన్ని మరింత లోతుగా చేస్తాము; మొదటి నుండి సూత్రాన్ని ఉంచుదాం: డేటాను అర్థం చేసుకోవడానికి, దాని నిర్మాణాన్ని పంచుకోవడం, దాని కంటెంట్ కాదు, తరచుగా సరిపోతుంది.
సాధారణ తప్పులు
- AIకి డేటా ఇవ్వకుండా సంఖ్యలు/కొలమానాల కోసం వేచి ఉంది. మోడల్ డేటాను యాక్సెస్ చేయదు; అతను ఇచ్చే నంబర్ నకిలీది. ఎల్లప్పుడూ ఫలితాన్ని లెక్కించి అమలు చేయండి.
- వర్కింగ్ కోడ్ సరైనదేనని ఆలోచిస్తున్నారు. తప్పు కాలమ్ను మార్చే కోడ్ కూడా లోపాలు లేకుండా నడుస్తుంది; లాజిక్ చదవకుండా నమ్మకండి.
- ఓపెన్ టూల్లో నిజమైన వ్యక్తిగత డేటాను అతికించడం. పేరు, ID నంబర్, ఇ-మెయిల్ ఎప్పుడూ భాగస్వామ్యం చేయబడవు; రేఖాచిత్రం సరిపోతుంది.
- దశలను మాన్యువల్గా చేయడం మరియు వాటిని కోడ్లో రాయడం లేదు. పునరుత్పత్తి చేయని విశ్లేషణ నమ్మదగనిది.
- ప్రశ్న లేకుండా గణాంకాలకు AI యొక్క వివరణను అంగీకరించడం. p-విలువ మరియు సహసంబంధం వంటి కాన్సెప్ట్లలో AI క్లాసిక్ తప్పులను పునరావృతం చేయగలదు.
చిట్కా: మీ ప్రతి AI సెషన్లలో ఒక చిన్న "రూల్ లైన్"ను చేర్చండి: "డేటా కంటెంట్ను రూపొందించవద్దు; కేవలం కోడ్/విశ్లేషణను రూపొందించండి మరియు నేను ఫలితాన్ని అమలు చేసి, ధృవీకరిస్తాను; మీకు ఖచ్చితంగా తెలియనప్పుడు 'ఖచ్చితంగా లేదు' అని సూచించండి." ఈ ఒక్క వాక్యం భ్రాంతుల ప్రమాదాన్ని గణనీయంగా తగ్గిస్తుంది.
సారాంశంలో
AI అనేది డేటా సైన్స్లో శక్తివంతమైన సహాయకుడు: ఇది క్లీనింగ్ కోడ్, EDA ఇంటర్ప్రెటేషన్, మోడల్ సిఫార్సు మరియు విజువలైజేషన్ను వేగవంతం చేస్తుంది. కానీ సమస్య నిర్వచనం, మెట్రిక్ ఎంపిక, ఉత్పత్తి నిర్ణయం మరియు నైతిక సరిహద్దులు మానవులకు చెందినవి. వర్క్ఫ్లో ఆరు దశలను కలిగి ఉంటుంది మరియు ప్రమాదం పెరిగేకొద్దీ AI పాత్ర చిన్నదిగా మారుతుంది. మూడు అలవాట్లు ప్రతిదానికీ పునాది: మూలం లింకింగ్ (ధృవీకరణ), పునరుత్పత్తి (కోడింగ్) మరియు అనామకీకరణ (గోప్యత). మీరు ఈ మూడింటిని అంతర్గతీకరించిన తర్వాత, మిగిలిన మాడ్యూల్లోని ప్రతి సాధనం మీకు సురక్షితమైన యాక్సిలరేటర్గా మారుతుంది.
అప్లికేషన్ టాస్క్
మీరు కలిగి ఉన్న చిన్న పట్టిక (లేదా ఊహాత్మకమైనది) యొక్క స్కీమాను రూపొందించండి: నిలువు వరుసల పేర్లు, రకాలు మరియు 2-3 నకిలీ ఉదాహరణ వరుసలు (నిజమైన వ్యక్తిగత డేటా లేకుండా). పైన ఉన్న "పవర్ఫుల్ ప్రాంప్ట్" టెంప్లేట్ని ఉపయోగించి సారాంశ గణాంకాల కోడ్ కోసం AIని అడగండి. కోడ్ని అమలు చేయండి, అవుట్పుట్ను మాన్యువల్ విలువతో సరిపోల్చండి, ఏవైనా నకిలీ అంచనాల కోసం తనిఖీ చేయండి మరియు మీ అన్వేషణలను 5 బుల్లెట్ పాయింట్లలో గమనించండి.
చెక్లిస్ట్
- [ ] నేను AIకి నిజమైన వ్యక్తిగత డేటాకు బదులుగా స్కీమా మరియు నకిలీ నమూనాను ఇచ్చానా?
- [ ] నేను అది ఉత్పత్తి చేసిన కోడ్ని లైన్ వారీగా చదివి అమలు చేశానా?
- [ ] నేను అవుట్పుట్లోని ప్రతి సంఖ్యను స్వతంత్రంగా ధృవీకరించానా?
- [ ] నేను విశ్లేషణ యొక్క ప్రతి దశను కోడ్లో వ్రాసి దానిని పునరావృతం చేశానా?
- [] నేను మిషన్ యొక్క ప్రమాద స్థాయిని నిర్ణయించి, తుది నిర్ణయాన్ని మానవునికి అప్పగించానా?