లాభాలు:
- పాండాలతో టెలిమెట్రీ, పరీక్ష మరియు ఉత్పత్తి డేటాను లోడ్ చేసి శుభ్రపరిచే పునరావృత విశ్లేషణ వర్క్ఫ్లోను ఏర్పాటు చేయగల సామర్థ్యం
- కృత్రిమ మేధస్సు నుండి కోడ్, గుణాలు మరియు విజువలైజేషన్ సహాయాన్ని స్వీకరించేటప్పుడు లైన్ ద్వారా అవుట్పుట్ లైన్ను అర్థం చేసుకునే మరియు ధృవీకరించగల సామర్థ్యం
- యూనిట్ స్థిరత్వం, డేటా లీకేజీ మరియు పునరుత్పత్తి కోసం విశ్లేషణ ఫలితాలను ఆడిట్ చేయగల సామర్థ్యం
మునుపటి యూనిట్లలో, మేము "సలహాదారు" వలె కృత్రిమ మేధస్సును ఉపయోగించాము. ఈ యూనిట్లో, మేము ఒక అడుగు ముందుకు వేసి, పైథాన్ని ఉపయోగించి మా స్వంత చేతులతో ఆటోమోటివ్ డేటాను విశ్లేషించే వర్క్ఫ్లోను ఏర్పాటు చేస్తాము. లక్ష్యం మిమ్మల్ని సాఫ్ట్వేర్ డెవలపర్గా చేయడం కాదు; AI నుండి కోడ్ సహాయాన్ని పొందుతున్నప్పుడు లైన్ ద్వారా ఆ కోడ్ను అర్థం చేసుకుని, ధృవీకరించగల ఇంజనీర్ను తయారు చేయడం. ఎందుకంటే AI ద్వారా ఉత్పత్తి చేయబడిన కోడ్ తప్పుగా ఉండవచ్చు, AI ద్వారా ఉత్పత్తి చేయబడిన వచనం వలె; వాల్యూమ్, లీక్ డేటా, సెంటర్ తప్పు కాలమ్ను గందరగోళపరచవచ్చు. కోడ్ని అర్థం చేసుకోకుండా అమలు చేయడం అనేది సంతకం చేయని నివేదికను ప్రచురించడం లాంటిది.
కొండచిలువ ఎందుకు? డేటా విశ్లేషణలో ఇది వాస్తవ ప్రమాణం కాబట్టి: మీరు పాండాలు (టేబులర్ డేటా), నంపీ (న్యూమరికల్ ప్రాసెసింగ్), మ్యాట్ప్లాట్లిబ్ (ప్లాట్) మరియు స్కికిట్-లెర్న్ (మెషిన్ లెర్నింగ్) లైబ్రరీలతో టెలిమెట్రీ, టెస్ట్ మరియు ప్రొడక్షన్ డేటాను సులభంగా ప్రాసెస్ చేయవచ్చు.
పునరుత్పాదక విశ్లేషణకు ఆరు దశలు
ఘన విశ్లేషణ ఎల్లప్పుడూ ఒకే ఫ్రేమ్వర్క్ను అనుసరిస్తుంది:
- లోడ్: ఫైల్ నుండి డేటాను చదవండి.
- తనిఖీ చేయండి: పరిమాణం, నిలువు వరుసలు, డేటా రకాలు, తప్పిపోయిన విలువలు.
- క్లీన్: మిస్సింగ్/అవుట్లియర్, యూనిట్, టైమ్స్టాంప్ కరెక్షన్.
- ఎక్స్ట్రాక్ట్ ఫీచర్: అర్థవంతమైన వేరియబుల్లను పొందండి.
- విశ్లేషణ/నమూనా: గణాంకాలు, విజువలైజేషన్ లేదా మోడల్.
- ధృవీకరించండి మరియు నివేదించండి: రిజల్ట్ ప్రొవిజన్, వాల్యూమ్/లీక్ చెక్, రికార్డింగ్.
చిట్కా: కోడ్ కోసం AIని అడుగుతున్నప్పుడు, "ప్రతి దశలో మీరు ఏమి చేస్తున్నారో వ్యాఖ్యానించండి మరియు మీ ఊహలను వ్రాయండి" అని చెప్పండి. కాబట్టి మీరు కోడ్ని చదివేటప్పుడు దాన్ని ధృవీకరించవచ్చు.
దశల వారీ ఉదాహరణ: టెలిమెట్రీ విశ్లేషణ
కింది కోడ్ CAN/టెలిమెట్రీ రికార్డ్ను లోడ్ చేస్తుంది మరియు ప్రాథమిక తనిఖీని చేస్తుంది. (గమనిక: కోడ్లను అమలు చేయడానికి ముందు మీరు వాటిని అర్థం చేసుకున్నారని నిర్ధారించుకోండి; కాలమ్ పేర్లు మీ డేటాను బట్టి మారుతూ ఉంటాయి.)
pd# 1 వలె పాండాలను దిగుమతి చేయండి: సెమీ-చుక్కల CSV, మొదటి కాలమ్ టైమ్స్టాంప్డిఎఫ్ = pd.read_csv("telemetry.csv", పార్స్_డేట్స్=["సమయం"])# 2) చెక్ప్రింట్(df.shape) # ఎన్ని అడ్డు వరుసలు, ఎన్ని నిలువు వరుసలు లేదా ఎన్ని కాలమ్ప్రింట్(df) కాలమ్ల రకం టెక్స్ట్)ప్రింట్(df.isna().sum()) # కాలమ్ప్రింట్కు తప్పిపోయిన విలువల సంఖ్య(df.describe()) # సారాంశ గణాంకాలు: నిమి, గరిష్టం, సగటు
వర్ణించు() అవుట్పుట్ ధృవీకరించడానికి మీ మొదటి అవకాశం: ఇంజిన్ వేగం గరిష్ట విలువ 45,000 rpm (సాధారణ ప్యాసింజర్ ఇంజిన్ ~7,000 rpm) అయితే, యూనిట్ లేదా సెన్సార్ లోపం ఉంది.
ఆడిటింగ్ దశలో అత్యంత తరచుగా ఉపయోగించే పాండాలు ఆదేశాలు మరియు అవి ఏమి చేస్తాయి:
ఆదేశం
ఏమి చేస్తుంది
ఇది ఏమి నిర్ధారిస్తుంది?
df.ఆకారం
అడ్డు వరుసలు/నిలువు వరుసల సంఖ్య
ఇది ఆశించిన పరిమాణంలో ఉందా?
df.dtypes
కాలమ్ రకాలు
నంబర్ కాలమ్ వచనంగా మారిందా?
df.isna().sum()
విలువ గణన లేదు
ఎంత స్థలం ఉంది?
df.వర్ణించు()
కనిష్ట/గరిష్టం/సగటు
ఇది భౌతికంగా సహేతుకమైనదేనా?
df.duplicated().sum()
నకిలీ వరుస
ద్వంద్వ రిజిస్ట్రేషన్ ఉందా?
# 3) క్లియర్: భౌతికంగా అసాధ్యమైన విలువలను గుర్తించండి
హెచ్చరిక: అవుట్లియర్ను వెంటనే తొలగించవద్దు; ఇది ఎందుకు విపరీతంగా ఉందో మొదట అర్థం చేసుకోండి. ఇది నిజమైన సంఘటన (ఆకస్మిక వేడి) లేదా సెన్సార్ వైఫల్యమా? గుడ్డిగా తొలగించడం వల్ల అసలు తప్పు దాగి ఉండవచ్చు.
# 4) ఎక్స్ట్రాక్ట్ ఫీచర్: ఉష్ణోగ్రత పెరుగుదల రేటు (ఉత్పన్నం)df = df.sort_values("time")df["sic_increase_speed"] = df["motor_sic"].diff() / df["time"].diff().dt.total_seconds సింపుల్. pltplt.plot(df["time"], df["motor_sic"])plt.xlabel("సమయం"); plt.ylabel("ఇంజిన్ ఉష్ణోగ్రత (C)")plt.title("ఇంజిన్ ఉష్ణోగ్రత కోర్సు")plt.show()
పైథాన్లో డేటా లీకేజీని నిరోధించడం
ప్రిడిక్షన్ మోడల్ను రూపొందించేటప్పుడు అత్యంత ప్రమాదకరమైన తప్పు డేటా లీకేజ్ (యూనిట్ 5): మోడల్ అంచనా సమయంలో తెలుసుకోలేని సమాచారాన్ని చూసినప్పుడు. సమయ శ్రేణిలో దీనిని నివారించడానికి గోల్డెన్ రూల్: గతంతో శిక్షణ పొందండి, భవిష్యత్తుతో పరీక్షించండి — యాదృచ్ఛికంగా షఫుల్ చేయవద్దు.
sklearn.model_selection దిగుమతి రైలు_పరీక్ష_విభజన నుండి # తప్పు: యాదృచ్ఛికంగా సమయ శ్రేణిని విభజించడం వలన భవిష్యత్తు లీక్ అవుతుంది# df[df["time"] > థ్రెషోల్డ్] # గత 20% భవిష్యత్తు
జాగ్రత్త: train_test_split డేటాను డిఫాల్ట్గా షఫుల్ చేస్తుంది (షఫుల్=ట్రూ). సమయ శ్రేణిలో, ఇది విద్యతో భవిష్యత్తును గందరగోళానికి గురి చేస్తుంది మరియు తప్పుడు అధిక స్కోర్ను ఉత్పత్తి చేస్తుంది. AI అది ఉత్పత్తి చేసే కోడ్లో దీన్ని చేసి ఉంటే, దాన్ని తప్పకుండా పరిష్కరించండి.
యూనిట్ స్థిరత్వం: నిశ్శబ్ద కిల్లర్
ఆటోమోటివ్లో అత్యంత కృత్రిమమైన లోపాలు యూనిట్ ఎర్రర్లు: km/h నుండి m/s, Nm నుండి lb-ft, బార్ నుండి kPa, °C నుండి K. విశ్లేషణలో ప్రతి కాలమ్ యొక్క యూనిట్ ఏమిటో డిక్షనరీని ఉంచడం మరియు మార్పిడులను స్పష్టంగా వ్రాయడం వలన ప్రాణాలను కాపాడుతుంది.
# యూనిట్లను స్పష్టంగా డాక్యుమెంట్ చేయండి = {"స్పీడ్": "కిమీ/గం", "మోటార్_సిక్": "సి", "ప్రెషర్": "బార్"}# అవసరమైతే స్పష్టమైన మార్పిడి (కిమీ/గం -> మీ/సె)df["స్పీడ్_మ్స్"] = డిఎఫ్["స్పీడ్"] / 3.6
మినీ కేస్ స్టడీస్
కేస్ 1 - వర్ణించు()తో లోపం ఏర్పడింది. ఒక విశ్లేషకుడు AI నుండి కోడ్ని అమలు చేస్తాడు మరియు పరిధిని అంచనా వేస్తాడు; ఫలితం అసంబద్ధంగా ఎక్కువ. మేము వర్ణించు() అవుట్పుట్ను చూసినప్పుడు, బ్యాటరీ సామర్థ్యం కొన్ని లైన్లలో Whలో మరియు మరికొన్ని లైన్లలో kWhలో నమోదు చేయబడిందని మనం చూస్తాము (1000 రెట్లు తేడా). యూనిట్ ఏకరీతి రకానికి తీసుకురాబడినప్పుడు, ఫలితం మెరుగుపడుతుంది. ముగింపు: ఒక సాధారణ సారాంశం గణాంకాలు చెడ్డ అంచనాను నిరోధించాయి.
కేసు 2 - గందరగోళం ఉచ్చు. పరీక్ష సెట్లో ఇంటర్న్ బ్రేక్ వేర్ మోడల్ 98% ఖచ్చితమైనది. కోడ్ని పరిశీలించినప్పుడు, train_test_split(shuffle=True) మరియు సమయ శ్రేణి మిశ్రమంగా ఉన్నట్లు చూడవచ్చు, అంటే శిక్షణలో భవిష్యత్తు పాయింట్లు లీక్ అవుతాయి. సమయంతో విభజించబడినప్పుడు, ఖచ్చితత్వం 80%కి పడిపోతుంది, కానీ అది ఇప్పుడు వాస్తవికమైనది. ముగింపు: AI కోడ్ పనిచేసినందున, అది సరైనది కాదు; మానవుడు లీక్ను పట్టుకున్నాడు.
కేస్ 3 - అవుట్లియర్ను అర్థం చేసుకోవడం. మన్నిక రికార్డులో, AI కోడ్ స్వయంచాలకంగా అవుట్లియర్ స్ట్రెయిన్ విలువలను తొలగిస్తుంది. ఇంజనీర్ తొలగించబడిన పాయింట్లను చూస్తాడు; పరీక్ష ఆసక్తిని కలిగి ఉన్న పగుళ్ల ప్రారంభానికి సంబంధించిన క్షణాలు ఇవి. తొలగింపు తీసివేయబడింది మరియు ఉల్లంఘనలు ప్రత్యేక సమీక్షలోకి తీసుకోబడతాయి. ఫలితం: "క్లీనింగ్" కింద నిజమైన సిగ్నల్ తొలగించబడుతుంది; అడుగడుగునా ప్రశ్నించండి.
ప్రాంప్ట్ టెంప్లేట్లు
టెంప్లేట్ 1 - అభ్యర్థన కోడ్ (వివరణతో):
పాత్ర: మీరు పైథాన్ డేటా అనలిస్ట్ మెంటర్. టాస్క్: టెలిమెట్రీ CSVని లోడ్ చేసే మరియు తనిఖీ చేసే కోడ్ను వ్రాయండి. సందర్భం: నిలువు వరుసలు: సమయం, వేగం(km/h), engine_sic(C), విప్లవం(rpm). పరిమితి: ప్రతి అడ్డు వరుసను వ్యాఖ్యానించండి; ఏ తనిఖీ చేయబడింది మరియు ఎందుకు వివరించబడింది; భౌతికంగా అసాధ్యమైన విలువ తనిఖీని జోడించండి; నిశ్శబ్దంగా ఏమీ తొలగించడం లేదు.అవుట్పుట్: వ్యాఖ్యానించిన కోడ్ + నేను ఏ అవుట్పుట్ని చూడాలి మరియు ఎందుకు చూడాలి.
టెంప్లేట్ 2 - లీక్ తనిఖీ:
పాత్ర: మీరు మెషీన్ లెర్నింగ్ కోడ్ రివ్యూయర్. టాస్క్: డేటా లీక్ల కోసం కింది శిక్షణ/టెస్ట్ స్ప్లిట్ కోడ్ని తనిఖీ చేయండి. సందర్భం: ఇది సమయ శ్రేణి (వాహన టెలిమెట్రీ). నిర్బంధం: యాదృచ్ఛిక షఫుల్ ఉంటే హెచ్చరించండి; కాలానుగుణంగా విభజించడాన్ని సూచించండి మరియు సమర్థించండి. అవుట్పుట్: అన్వేషణలు + సరిదిద్దబడిన కోడ్ + వివరణ.
టెంప్లేట్ 3 - యూనిట్ ధ్రువీకరణ:
పాత్ర: మీరు డేటా నాణ్యత ఆడిటర్. టాస్క్: డేటాఫ్రేమ్లో యూనిట్ అస్థిరత కోసం చూసే తనిఖీలను సూచించండి. సందర్భం: కెపాసిటీ కొన్ని అడ్డు వరుసలలో kWh మరియు మరికొన్ని వరుసలలో Wh ఉండవచ్చు. అవుట్పుట్: కోడ్ని తనిఖీ చేయండి + అనుమానాస్పద నమూనాను ఎలా కనుగొనాలో తనిఖీ చేయండి.
టెంప్లేట్ 4 - విజువలైజేషన్ + వ్యాఖ్య:
పాత్ర: మీరు డేటా విజువలైజేషన్ నిపుణుడు. పని: ఇంజిన్ ఉష్ణోగ్రత కోర్సు మరియు పెరుగుదల రేటును ప్లాట్ చేసే కోడ్ను వ్రాయండి. పరిమితి: యూనిట్తో అక్షాలను లేబుల్ చేయండి; దృశ్యమానంగా క్రమరాహిత్యాన్ని గుర్తించండి; గ్రాఫ్ను వివరించేటప్పుడు ఖచ్చితమైన తప్పును క్లెయిమ్ చేయవద్దు. అవుట్పుట్: కోడ్ + గ్రాఫ్లో ఏమి చూడాలి.
బలహీనమైన ప్రాంప్ట్ / బలమైన ప్రాంప్ట్
బలహీనమైన ప్రాంప్ట్:
ఈ డేటాతో మోడల్ను రూపొందించండి.
ఏ లక్ష్యం, ఏ కంపార్ట్మెంట్, ఏ ధృవీకరణ అనేది స్పష్టంగా లేదు; AI గిలకొట్టిన, లీకైన, యూనిట్-బ్లైండ్ కోడ్ను అవుట్పుట్ చేయగలదు.
శక్తివంతమైన ప్రాంప్ట్:
పాత్ర: మీరు పైథాన్ ML గురువు. టాస్క్: బ్రేక్ ప్యాడ్ వేర్ను అంచనా వేయడానికి మరియు ధ్రువీకరణ ఆపదలను ప్రదర్శించడానికి ప్రారంభ వర్క్ఫ్లోను వ్రాయండి. సందర్భం: సమయ శ్రేణి టెలిమెట్రీ; లక్ష్యం: మిగిలిన ప్యాడ్ మందం. నిర్బంధం: సమయ శ్రేణిని విభజించడం (షఫుల్ చేయడం లేదు); డేటా లీకేజ్ ప్రమాదంలో ఫ్లాగ్ లక్షణాలు; డాక్యుమెంట్ యూనిట్లు;ప్రతి దశను అర్థం చేసుకోండి; ఫలితం ఫీల్డ్లోకి వెళ్లే ముందు ఏ తనిఖీలు అవసరమో వ్రాయండి. అవుట్పుట్: వ్యాఖ్యానించిన కోడ్ + ధృవీకరణ చెక్లిస్ట్.
సాధారణ తప్పులు
- కోడ్ని అర్థం చేసుకోకుండా రన్ చేస్తోంది. AI కోడ్ కూడా తప్పుగా ఉండవచ్చు; లైన్ బై లైన్ చదవండి.
- మిక్సింగ్ సమయ శ్రేణి. shuffle=ట్రూ భవిష్యత్తును లీక్ చేస్తుంది మరియు నకిలీ స్కోర్ను ఉత్పత్తి చేస్తుంది.
- ఔట్లియర్ను గుడ్డిగా తొలగించండి. అసలు సిగ్నల్ (తప్పు ప్రారంభం) క్లియర్ చేయబడుతుంది.
- యూనిట్ డాక్యుమెంట్ చేయడం లేదు. km/h vs m/s, Wh vs kWh వంటి లోపాలు నిశ్శబ్దంగా పెరుగుతాయి.
- వివరణ()/చెక్ స్టెప్ని దాటవేయడం. మొదటి సారాంశ గణాంకాలలో చాలా లోపాలు కనిపిస్తాయి.
సారాంశంలో
- పైథాన్ (పాండాలు, నంపీ, మాట్ప్లాట్లిబ్, స్కికిట్-లెర్న్) అనేది ఆటోమోటివ్ డేటా విశ్లేషణ యొక్క వాస్తవ ప్రమాణం.
- పునరావృత విశ్లేషణ: లోడ్ చేయండి, తనిఖీ చేయండి, శుభ్రం చేయండి, ఫీచర్ చేయండి, విశ్లేషించండి, ధృవీకరించండి మరియు నివేదించండి.
- లైన్ ద్వారా AI ఉత్పత్తి చేసే కోడ్ను అర్థం చేసుకోవడం మరియు ధృవీకరించడం అత్యవసరం; ఇది పని చేస్తుంది కాబట్టి ఇది సరైనదని అర్థం కాదు.
- సమయ శ్రేణిలో గత/భవిష్యత్తు వ్యత్యాసాన్ని నిర్వహించండి; యాదృచ్ఛిక షఫులింగ్ డేటా లీకేజీని సృష్టిస్తుంది.
- యూనిట్ అనుగుణ్యత మరియు ఔట్లియర్ ఇంటర్ప్రెటేషన్ నిశ్శబ్దంగా ఉంటాయి కానీ ధృవీకరణ యొక్క క్లిష్టమైన అంశాలు.
అప్లికేషన్ టాస్క్
చిన్న డేటా సెట్ (నిజమైన లేదా సింథటిక్ టెలిమెట్రీ) తీసుకోండి. (1) ఆరు-దశల ఫ్రేమ్వర్క్ను అనుసరించి, టెంప్లేట్ 1తో లోడింగ్ మరియు కంట్రోల్ కోడ్ను రూపొందించండి మరియు మీరు ప్రతి పంక్తిని అర్థం చేసుకున్నారని నిర్ధారించండి. (2) వర్ణించు() అవుట్పుట్లో కనీసం ఒక అనుమానాస్పద విలువను కనుగొని, ఎందుకు అని పరిశోధించండి. (3) ప్రిడిక్షన్ టాస్క్లో, శిక్షణ/పరీక్ష విభజన సమయం మరియు టెంప్లేట్ 2తో లీకేజీ ప్రమాదాన్ని తనిఖీ చేయండి. (4) మీరు డిక్షనరీలో ఉపయోగించే ప్రతి నిలువు వరుస యూనిట్ను డాక్యుమెంట్ చేయండి.
చెక్లిస్ట్
- [ ] నేను ఆరు-దశల ఫ్రేమ్వర్క్తో విశ్లేషణను సెటప్ చేసాను.
- [ ] నేను లైన్ ద్వారా AI రూపొందించిన కోడ్ని చదివి అర్థం చేసుకున్నాను.
- [ ] నేను వర్ణన()/ఆడిట్తో అనుమానాస్పద విలువల కోసం వెతికాను.
- [ ] నేను సమయ శ్రేణిని సమయం ద్వారా విభజించాను (షఫుల్ చేయడం లేదు).
- [ ] నేను డేటా లీకేజ్ ప్రమాదంలో ఉన్న లక్షణాలను గుర్తించాను.
- [ ] నేను ప్రతి నిలువు వరుస యొక్క యూనిట్ను డాక్యుమెంట్ చేసాను మరియు మార్పిడులను స్పష్టంగా వ్రాసాను.