యూనిట్లు
1. ఆటోమోటివ్ ఇంజినీరింగ్‌లో ఆర్టిఫిషియల్ ఇంటెలిజెన్స్ మరియు వెరిఫికేషన్ డిసిప్లిన్ పరిచయం 2. వాహన రూపకల్పన మరియు అనుకరణ మద్దతు: CAE, CFD మరియు FEA 3. ADAS మరియు అటానమస్ డ్రైవింగ్: సెన్సింగ్ ఫండమెంటల్స్ 4. ప్రొడక్షన్ లైన్ క్వాలిటీ కంట్రోల్: విజువల్ డిఫెక్ట్ డిటెక్షన్ 5. ప్రిడిక్టివ్ మెయింటెనెన్స్ మరియు వెహికల్ టెలిమెట్రీ 6. పరీక్ష మరియు ధ్రువీకరణ డేటా విశ్లేషణ 7. మెటీరియల్ ఎంపిక మరియు లైట్ వెయిటింగ్ 8. సప్లై చైన్, డిమాండ్ మరియు ఇన్వెంటరీ అనలిటిక్స్ 9. పైథాన్‌తో ఆటోమోటివ్ డేటా విశ్లేషణ: ఎండ్-టు-ఎండ్ 10. ఫంక్షనల్ సేఫ్టీ, SOTIF, నీతి మరియు గోప్యత 11. ఎండ్-టు-ఎండ్ ఇంటిగ్రేషన్, MLOps మరియు ఇంజనీర్ బాధ్యత
యూనిట్ 9 / 11

పైథాన్‌తో ఆటోమోటివ్ డేటా విశ్లేషణ: ఎండ్-టు-ఎండ్

లాభాలు:

  • పాండాలతో టెలిమెట్రీ, పరీక్ష మరియు ఉత్పత్తి డేటాను లోడ్ చేసి శుభ్రపరిచే పునరావృత విశ్లేషణ వర్క్‌ఫ్లోను ఏర్పాటు చేయగల సామర్థ్యం
  • కృత్రిమ మేధస్సు నుండి కోడ్, గుణాలు మరియు విజువలైజేషన్ సహాయాన్ని స్వీకరించేటప్పుడు లైన్ ద్వారా అవుట్‌పుట్ లైన్‌ను అర్థం చేసుకునే మరియు ధృవీకరించగల సామర్థ్యం
  • యూనిట్ స్థిరత్వం, డేటా లీకేజీ మరియు పునరుత్పత్తి కోసం విశ్లేషణ ఫలితాలను ఆడిట్ చేయగల సామర్థ్యం

మునుపటి యూనిట్లలో, మేము "సలహాదారు" వలె కృత్రిమ మేధస్సును ఉపయోగించాము. ఈ యూనిట్‌లో, మేము ఒక అడుగు ముందుకు వేసి, పైథాన్‌ని ఉపయోగించి మా స్వంత చేతులతో ఆటోమోటివ్ డేటాను విశ్లేషించే వర్క్‌ఫ్లోను ఏర్పాటు చేస్తాము. లక్ష్యం మిమ్మల్ని సాఫ్ట్‌వేర్ డెవలపర్‌గా చేయడం కాదు; AI నుండి కోడ్ సహాయాన్ని పొందుతున్నప్పుడు లైన్ ద్వారా ఆ కోడ్‌ను అర్థం చేసుకుని, ధృవీకరించగల ఇంజనీర్‌ను తయారు చేయడం. ఎందుకంటే AI ద్వారా ఉత్పత్తి చేయబడిన కోడ్ తప్పుగా ఉండవచ్చు, AI ద్వారా ఉత్పత్తి చేయబడిన వచనం వలె; వాల్యూమ్, లీక్ డేటా, సెంటర్ తప్పు కాలమ్‌ను గందరగోళపరచవచ్చు. కోడ్‌ని అర్థం చేసుకోకుండా అమలు చేయడం అనేది సంతకం చేయని నివేదికను ప్రచురించడం లాంటిది.

కొండచిలువ ఎందుకు? డేటా విశ్లేషణలో ఇది వాస్తవ ప్రమాణం కాబట్టి: మీరు పాండాలు (టేబులర్ డేటా), నంపీ (న్యూమరికల్ ప్రాసెసింగ్), మ్యాట్‌ప్లాట్‌లిబ్ (ప్లాట్) మరియు స్కికిట్-లెర్న్ (మెషిన్ లెర్నింగ్) లైబ్రరీలతో టెలిమెట్రీ, టెస్ట్ మరియు ప్రొడక్షన్ డేటాను సులభంగా ప్రాసెస్ చేయవచ్చు.

పునరుత్పాదక విశ్లేషణకు ఆరు దశలు

ఘన విశ్లేషణ ఎల్లప్పుడూ ఒకే ఫ్రేమ్‌వర్క్‌ను అనుసరిస్తుంది:

  1. లోడ్: ఫైల్ నుండి డేటాను చదవండి.
  2. తనిఖీ చేయండి: పరిమాణం, నిలువు వరుసలు, డేటా రకాలు, తప్పిపోయిన విలువలు.
  3. క్లీన్: మిస్సింగ్/అవుట్‌లియర్, యూనిట్, టైమ్‌స్టాంప్ కరెక్షన్.
  4. ఎక్స్‌ట్రాక్ట్ ఫీచర్: అర్థవంతమైన వేరియబుల్‌లను పొందండి.
  5. విశ్లేషణ/నమూనా: గణాంకాలు, విజువలైజేషన్ లేదా మోడల్.
  6. ధృవీకరించండి మరియు నివేదించండి: రిజల్ట్ ప్రొవిజన్, వాల్యూమ్/లీక్ చెక్, రికార్డింగ్.
చిట్కా: కోడ్ కోసం AIని అడుగుతున్నప్పుడు, "ప్రతి దశలో మీరు ఏమి చేస్తున్నారో వ్యాఖ్యానించండి మరియు మీ ఊహలను వ్రాయండి" అని చెప్పండి. కాబట్టి మీరు కోడ్‌ని చదివేటప్పుడు దాన్ని ధృవీకరించవచ్చు.

దశల వారీ ఉదాహరణ: టెలిమెట్రీ విశ్లేషణ

కింది కోడ్ CAN/టెలిమెట్రీ రికార్డ్‌ను లోడ్ చేస్తుంది మరియు ప్రాథమిక తనిఖీని చేస్తుంది. (గమనిక: కోడ్‌లను అమలు చేయడానికి ముందు మీరు వాటిని అర్థం చేసుకున్నారని నిర్ధారించుకోండి; కాలమ్ పేర్లు మీ డేటాను బట్టి మారుతూ ఉంటాయి.)

pd# 1 వలె పాండాలను దిగుమతి చేయండి: సెమీ-చుక్కల CSV, మొదటి కాలమ్ టైమ్‌స్టాంప్‌డిఎఫ్ = pd.read_csv("telemetry.csv", పార్స్_డేట్స్=["సమయం"])# 2) చెక్‌ప్రింట్(df.shape) # ఎన్ని అడ్డు వరుసలు, ఎన్ని నిలువు వరుసలు లేదా ఎన్ని కాలమ్‌ప్రింట్(df) కాలమ్‌ల రకం టెక్స్ట్)ప్రింట్(df.isna().sum()) # కాలమ్‌ప్రింట్‌కు తప్పిపోయిన విలువల సంఖ్య(df.describe()) # సారాంశ గణాంకాలు: నిమి, గరిష్టం, సగటు

వర్ణించు() అవుట్‌పుట్ ధృవీకరించడానికి మీ మొదటి అవకాశం: ఇంజిన్ వేగం గరిష్ట విలువ 45,000 rpm (సాధారణ ప్యాసింజర్ ఇంజిన్ ~7,000 rpm) అయితే, యూనిట్ లేదా సెన్సార్ లోపం ఉంది.

ఆడిటింగ్ దశలో అత్యంత తరచుగా ఉపయోగించే పాండాలు ఆదేశాలు మరియు అవి ఏమి చేస్తాయి:

ఆదేశం

ఏమి చేస్తుంది

ఇది ఏమి నిర్ధారిస్తుంది?

df.ఆకారం

అడ్డు వరుసలు/నిలువు వరుసల సంఖ్య

ఇది ఆశించిన పరిమాణంలో ఉందా?

df.dtypes

కాలమ్ రకాలు

నంబర్ కాలమ్ వచనంగా మారిందా?

df.isna().sum()

విలువ గణన లేదు

ఎంత స్థలం ఉంది?

df.వర్ణించు()

కనిష్ట/గరిష్టం/సగటు

ఇది భౌతికంగా సహేతుకమైనదేనా?

df.duplicated().sum()

నకిలీ వరుస

ద్వంద్వ రిజిస్ట్రేషన్ ఉందా?

# 3) క్లియర్: భౌతికంగా అసాధ్యమైన విలువలను గుర్తించండి

హెచ్చరిక: అవుట్‌లియర్‌ను వెంటనే తొలగించవద్దు; ఇది ఎందుకు విపరీతంగా ఉందో మొదట అర్థం చేసుకోండి. ఇది నిజమైన సంఘటన (ఆకస్మిక వేడి) లేదా సెన్సార్ వైఫల్యమా? గుడ్డిగా తొలగించడం వల్ల అసలు తప్పు దాగి ఉండవచ్చు.

# 4) ఎక్స్‌ట్రాక్ట్ ఫీచర్: ఉష్ణోగ్రత పెరుగుదల రేటు (ఉత్పన్నం)df = df.sort_values("time")df["sic_increase_speed"] = df["motor_sic"].diff() / df["time"].diff().dt.total_seconds సింపుల్. pltplt.plot(df["time"], df["motor_sic"])plt.xlabel("సమయం"); plt.ylabel("ఇంజిన్ ఉష్ణోగ్రత (C)")plt.title("ఇంజిన్ ఉష్ణోగ్రత కోర్సు")plt.show()

పైథాన్‌లో డేటా లీకేజీని నిరోధించడం

ప్రిడిక్షన్ మోడల్‌ను రూపొందించేటప్పుడు అత్యంత ప్రమాదకరమైన తప్పు డేటా లీకేజ్ (యూనిట్ 5): మోడల్ అంచనా సమయంలో తెలుసుకోలేని సమాచారాన్ని చూసినప్పుడు. సమయ శ్రేణిలో దీనిని నివారించడానికి గోల్డెన్ రూల్: గతంతో శిక్షణ పొందండి, భవిష్యత్తుతో పరీక్షించండి — యాదృచ్ఛికంగా షఫుల్ చేయవద్దు.

sklearn.model_selection దిగుమతి రైలు_పరీక్ష_విభజన నుండి # తప్పు: యాదృచ్ఛికంగా సమయ శ్రేణిని విభజించడం వలన భవిష్యత్తు లీక్ అవుతుంది# df[df["time"] > థ్రెషోల్డ్] # గత 20% భవిష్యత్తు

జాగ్రత్త: train_test_split డేటాను డిఫాల్ట్‌గా షఫుల్ చేస్తుంది (షఫుల్=ట్రూ). సమయ శ్రేణిలో, ఇది విద్యతో భవిష్యత్తును గందరగోళానికి గురి చేస్తుంది మరియు తప్పుడు అధిక స్కోర్‌ను ఉత్పత్తి చేస్తుంది. AI అది ఉత్పత్తి చేసే కోడ్‌లో దీన్ని చేసి ఉంటే, దాన్ని తప్పకుండా పరిష్కరించండి.

యూనిట్ స్థిరత్వం: నిశ్శబ్ద కిల్లర్

ఆటోమోటివ్‌లో అత్యంత కృత్రిమమైన లోపాలు యూనిట్ ఎర్రర్‌లు: km/h నుండి m/s, Nm నుండి lb-ft, బార్ నుండి kPa, °C నుండి K. విశ్లేషణలో ప్రతి కాలమ్ యొక్క యూనిట్ ఏమిటో డిక్షనరీని ఉంచడం మరియు మార్పిడులను స్పష్టంగా వ్రాయడం వలన ప్రాణాలను కాపాడుతుంది.

# యూనిట్‌లను స్పష్టంగా డాక్యుమెంట్ చేయండి = {"స్పీడ్": "కిమీ/గం", "మోటార్_సిక్": "సి", "ప్రెషర్": "బార్"}# అవసరమైతే స్పష్టమైన మార్పిడి (కిమీ/గం -> మీ/సె)df["స్పీడ్_మ్స్"] = డిఎఫ్["స్పీడ్"] / 3.6

మినీ కేస్ స్టడీస్

కేస్ 1 - వర్ణించు()తో లోపం ఏర్పడింది. ఒక విశ్లేషకుడు AI నుండి కోడ్‌ని అమలు చేస్తాడు మరియు పరిధిని అంచనా వేస్తాడు; ఫలితం అసంబద్ధంగా ఎక్కువ. మేము వర్ణించు() అవుట్‌పుట్‌ను చూసినప్పుడు, బ్యాటరీ సామర్థ్యం కొన్ని లైన్లలో Whలో మరియు మరికొన్ని లైన్లలో kWhలో నమోదు చేయబడిందని మనం చూస్తాము (1000 రెట్లు తేడా). యూనిట్ ఏకరీతి రకానికి తీసుకురాబడినప్పుడు, ఫలితం మెరుగుపడుతుంది. ముగింపు: ఒక సాధారణ సారాంశం గణాంకాలు చెడ్డ అంచనాను నిరోధించాయి.

కేసు 2 - గందరగోళం ఉచ్చు. పరీక్ష సెట్‌లో ఇంటర్న్ బ్రేక్ వేర్ మోడల్ 98% ఖచ్చితమైనది. కోడ్‌ని పరిశీలించినప్పుడు, train_test_split(shuffle=True) మరియు సమయ శ్రేణి మిశ్రమంగా ఉన్నట్లు చూడవచ్చు, అంటే శిక్షణలో భవిష్యత్తు పాయింట్లు లీక్ అవుతాయి. సమయంతో విభజించబడినప్పుడు, ఖచ్చితత్వం 80%కి పడిపోతుంది, కానీ అది ఇప్పుడు వాస్తవికమైనది. ముగింపు: AI కోడ్ పనిచేసినందున, అది సరైనది కాదు; మానవుడు లీక్‌ను పట్టుకున్నాడు.

కేస్ 3 - అవుట్‌లియర్‌ను అర్థం చేసుకోవడం. మన్నిక రికార్డులో, AI కోడ్ స్వయంచాలకంగా అవుట్‌లియర్ స్ట్రెయిన్ విలువలను తొలగిస్తుంది. ఇంజనీర్ తొలగించబడిన పాయింట్లను చూస్తాడు; పరీక్ష ఆసక్తిని కలిగి ఉన్న పగుళ్ల ప్రారంభానికి సంబంధించిన క్షణాలు ఇవి. తొలగింపు తీసివేయబడింది మరియు ఉల్లంఘనలు ప్రత్యేక సమీక్షలోకి తీసుకోబడతాయి. ఫలితం: "క్లీనింగ్" కింద నిజమైన సిగ్నల్ తొలగించబడుతుంది; అడుగడుగునా ప్రశ్నించండి.

ప్రాంప్ట్ టెంప్లేట్‌లు

టెంప్లేట్ 1 - అభ్యర్థన కోడ్ (వివరణతో):

పాత్ర: మీరు పైథాన్ డేటా అనలిస్ట్ మెంటర్. టాస్క్: టెలిమెట్రీ CSVని లోడ్ చేసే మరియు తనిఖీ చేసే కోడ్‌ను వ్రాయండి. సందర్భం: నిలువు వరుసలు: సమయం, వేగం(km/h), engine_sic(C), విప్లవం(rpm). పరిమితి: ప్రతి అడ్డు వరుసను వ్యాఖ్యానించండి; ఏ తనిఖీ చేయబడింది మరియు ఎందుకు వివరించబడింది; భౌతికంగా అసాధ్యమైన విలువ తనిఖీని జోడించండి; నిశ్శబ్దంగా ఏమీ తొలగించడం లేదు.అవుట్‌పుట్: వ్యాఖ్యానించిన కోడ్ + నేను ఏ అవుట్‌పుట్‌ని చూడాలి మరియు ఎందుకు చూడాలి.

టెంప్లేట్ 2 - లీక్ తనిఖీ:

పాత్ర: మీరు మెషీన్ లెర్నింగ్ కోడ్ రివ్యూయర్. టాస్క్: డేటా లీక్‌ల కోసం కింది శిక్షణ/టెస్ట్ స్ప్లిట్ కోడ్‌ని తనిఖీ చేయండి. సందర్భం: ఇది సమయ శ్రేణి (వాహన టెలిమెట్రీ). నిర్బంధం: యాదృచ్ఛిక షఫుల్ ఉంటే హెచ్చరించండి; కాలానుగుణంగా విభజించడాన్ని సూచించండి మరియు సమర్థించండి. అవుట్‌పుట్: అన్వేషణలు + సరిదిద్దబడిన కోడ్ + వివరణ.

టెంప్లేట్ 3 - యూనిట్ ధ్రువీకరణ:

పాత్ర: మీరు డేటా నాణ్యత ఆడిటర్. టాస్క్: డేటాఫ్రేమ్‌లో యూనిట్ అస్థిరత కోసం చూసే తనిఖీలను సూచించండి. సందర్భం: కెపాసిటీ కొన్ని అడ్డు వరుసలలో kWh మరియు మరికొన్ని వరుసలలో Wh ఉండవచ్చు. అవుట్‌పుట్: కోడ్‌ని తనిఖీ చేయండి + అనుమానాస్పద నమూనాను ఎలా కనుగొనాలో తనిఖీ చేయండి.

టెంప్లేట్ 4 - విజువలైజేషన్ + వ్యాఖ్య:

పాత్ర: మీరు డేటా విజువలైజేషన్ నిపుణుడు. పని: ఇంజిన్ ఉష్ణోగ్రత కోర్సు మరియు పెరుగుదల రేటును ప్లాట్ చేసే కోడ్‌ను వ్రాయండి. పరిమితి: యూనిట్‌తో అక్షాలను లేబుల్ చేయండి; దృశ్యమానంగా క్రమరాహిత్యాన్ని గుర్తించండి; గ్రాఫ్‌ను వివరించేటప్పుడు ఖచ్చితమైన తప్పును క్లెయిమ్ చేయవద్దు. అవుట్‌పుట్: కోడ్ + గ్రాఫ్‌లో ఏమి చూడాలి.

బలహీనమైన ప్రాంప్ట్ / బలమైన ప్రాంప్ట్

బలహీనమైన ప్రాంప్ట్:

ఈ డేటాతో మోడల్‌ను రూపొందించండి.

ఏ లక్ష్యం, ఏ కంపార్ట్‌మెంట్, ఏ ధృవీకరణ అనేది స్పష్టంగా లేదు; AI గిలకొట్టిన, లీకైన, యూనిట్-బ్లైండ్ కోడ్‌ను అవుట్‌పుట్ చేయగలదు.

శక్తివంతమైన ప్రాంప్ట్:

పాత్ర: మీరు పైథాన్ ML గురువు. టాస్క్: బ్రేక్ ప్యాడ్ వేర్‌ను అంచనా వేయడానికి మరియు ధ్రువీకరణ ఆపదలను ప్రదర్శించడానికి ప్రారంభ వర్క్‌ఫ్లోను వ్రాయండి. సందర్భం: సమయ శ్రేణి టెలిమెట్రీ; లక్ష్యం: మిగిలిన ప్యాడ్ మందం. నిర్బంధం: సమయ శ్రేణిని విభజించడం (షఫుల్ చేయడం లేదు); డేటా లీకేజ్ ప్రమాదంలో ఫ్లాగ్ లక్షణాలు; డాక్యుమెంట్ యూనిట్లు;ప్రతి దశను అర్థం చేసుకోండి; ఫలితం ఫీల్డ్‌లోకి వెళ్లే ముందు ఏ తనిఖీలు అవసరమో వ్రాయండి. అవుట్‌పుట్: వ్యాఖ్యానించిన కోడ్ + ధృవీకరణ చెక్‌లిస్ట్.

సాధారణ తప్పులు

  • కోడ్‌ని అర్థం చేసుకోకుండా రన్ చేస్తోంది. AI కోడ్ కూడా తప్పుగా ఉండవచ్చు; లైన్ బై లైన్ చదవండి.
  • మిక్సింగ్ సమయ శ్రేణి. shuffle=ట్రూ భవిష్యత్తును లీక్ చేస్తుంది మరియు నకిలీ స్కోర్‌ను ఉత్పత్తి చేస్తుంది.
  • ఔట్‌లియర్‌ను గుడ్డిగా తొలగించండి. అసలు సిగ్నల్ (తప్పు ప్రారంభం) క్లియర్ చేయబడుతుంది.
  • యూనిట్ డాక్యుమెంట్ చేయడం లేదు. km/h vs m/s, Wh vs kWh వంటి లోపాలు నిశ్శబ్దంగా పెరుగుతాయి.
  • వివరణ()/చెక్ స్టెప్‌ని దాటవేయడం. మొదటి సారాంశ గణాంకాలలో చాలా లోపాలు కనిపిస్తాయి.

సారాంశంలో

  • పైథాన్ (పాండాలు, నంపీ, మాట్‌ప్లాట్‌లిబ్, స్కికిట్-లెర్న్) అనేది ఆటోమోటివ్ డేటా విశ్లేషణ యొక్క వాస్తవ ప్రమాణం.
  • పునరావృత విశ్లేషణ: లోడ్ చేయండి, తనిఖీ చేయండి, శుభ్రం చేయండి, ఫీచర్ చేయండి, విశ్లేషించండి, ధృవీకరించండి మరియు నివేదించండి.
  • లైన్ ద్వారా AI ఉత్పత్తి చేసే కోడ్‌ను అర్థం చేసుకోవడం మరియు ధృవీకరించడం అత్యవసరం; ఇది పని చేస్తుంది కాబట్టి ఇది సరైనదని అర్థం కాదు.
  • సమయ శ్రేణిలో గత/భవిష్యత్తు వ్యత్యాసాన్ని నిర్వహించండి; యాదృచ్ఛిక షఫులింగ్ డేటా లీకేజీని సృష్టిస్తుంది.
  • యూనిట్ అనుగుణ్యత మరియు ఔట్‌లియర్ ఇంటర్‌ప్రెటేషన్ నిశ్శబ్దంగా ఉంటాయి కానీ ధృవీకరణ యొక్క క్లిష్టమైన అంశాలు.

అప్లికేషన్ టాస్క్

చిన్న డేటా సెట్ (నిజమైన లేదా సింథటిక్ టెలిమెట్రీ) తీసుకోండి. (1) ఆరు-దశల ఫ్రేమ్‌వర్క్‌ను అనుసరించి, టెంప్లేట్ 1తో లోడింగ్ మరియు కంట్రోల్ కోడ్‌ను రూపొందించండి మరియు మీరు ప్రతి పంక్తిని అర్థం చేసుకున్నారని నిర్ధారించండి. (2) వర్ణించు() అవుట్‌పుట్‌లో కనీసం ఒక అనుమానాస్పద విలువను కనుగొని, ఎందుకు అని పరిశోధించండి. (3) ప్రిడిక్షన్ టాస్క్‌లో, శిక్షణ/పరీక్ష విభజన సమయం మరియు టెంప్లేట్ 2తో లీకేజీ ప్రమాదాన్ని తనిఖీ చేయండి. (4) మీరు డిక్షనరీలో ఉపయోగించే ప్రతి నిలువు వరుస యూనిట్‌ను డాక్యుమెంట్ చేయండి.

చెక్లిస్ట్

  • [ ] నేను ఆరు-దశల ఫ్రేమ్‌వర్క్‌తో విశ్లేషణను సెటప్ చేసాను.
  • [ ] నేను లైన్ ద్వారా AI రూపొందించిన కోడ్‌ని చదివి అర్థం చేసుకున్నాను.
  • [ ] నేను వర్ణన()/ఆడిట్‌తో అనుమానాస్పద విలువల కోసం వెతికాను.
  • [ ] నేను సమయ శ్రేణిని సమయం ద్వారా విభజించాను (షఫుల్ చేయడం లేదు).
  • [ ] నేను డేటా లీకేజ్ ప్రమాదంలో ఉన్న లక్షణాలను గుర్తించాను.
  • [ ] నేను ప్రతి నిలువు వరుస యొక్క యూనిట్‌ను డాక్యుమెంట్ చేసాను మరియు మార్పిడులను స్పష్టంగా వ్రాసాను.