युनिट 9 / 11

पायथनसह ऑटोमोटिव्ह डेटा विश्लेषण: एंड-टू-एंड

नफा:

  • पांडासह टेलीमेट्री, चाचणी आणि उत्पादन डेटा लोड आणि साफ करणारे पुनरावृत्ती करण्यायोग्य विश्लेषण कार्यप्रवाह स्थापित करण्याची क्षमता
  • कृत्रिम बुद्धिमत्तेकडून कोड, विशेषता आणि व्हिज्युअलायझेशन सहाय्य प्राप्त करताना आउटपुट लाइन ओळीनुसार समजून घेण्याची आणि सत्यापित करण्याची क्षमता
  • युनिट सुसंगतता, डेटा लीकेज आणि पुनरुत्पादनक्षमतेसाठी ऑडिट विश्लेषण परिणामांची क्षमता

मागील युनिट्समध्ये, आम्ही "सल्लागार" प्रमाणे कृत्रिम बुद्धिमत्ता वापरली. या युनिटमध्ये, आम्ही एक पाऊल पुढे जातो आणि पायथन वापरून ऑटोमोटिव्ह डेटाचे आमच्या स्वत: च्या हातांनी विश्लेषण करणारा कार्यप्रवाह स्थापित करतो. तुम्हाला सॉफ्टवेअर डेव्हलपर बनवणे हे ध्येय नाही; हे एक अभियंता बनवणे आहे जो AI कडून कोड सहाय्य मिळवताना ती कोड लाइन ओळीने समजू शकतो आणि सत्यापित करू शकतो. कारण AI द्वारे निर्मित कोड सदोष असू शकतो, जसे AI द्वारे निर्मित मजकूर; व्हॉल्यूम, लीक डेटा, मध्यभागी चुकीचा स्तंभ गोंधळात टाकू शकतो. कोड समजून न घेता चालवणे म्हणजे स्वाक्षरी नसलेला अहवाल प्रकाशित करण्यासारखे आहे.

अजगर का? कारण डेटा विश्लेषणामध्ये हे वास्तविक मानक आहे: तुम्ही पांडा (टॅब्युलर डेटा), नम्पी (संख्यात्मक प्रक्रिया), मॅटप्लॉटलिब (प्लॉट) आणि स्किट-लर्न (मशीन लर्निंग) लायब्ररीसह टेलिमेट्री, चाचणी आणि उत्पादन डेटावर सहज प्रक्रिया करू शकता.

पुनरुत्पादक विश्लेषणासाठी सहा चरण

एक ठोस विश्लेषण नेहमी समान फ्रेमवर्कचे अनुसरण करते:

  1. लोड करा: फाइलमधील डेटा वाचा.
  2. तपासणी करा: परिमाण, स्तंभ, डेटा प्रकार, गहाळ मूल्ये.
  3. स्वच्छ: गहाळ/बाह्य, युनिट, टाइमस्टॅम्प सुधारणा.
  4. अर्क वैशिष्ट्य: अर्थपूर्ण व्हेरिएबल्स मिळवा.
  5. विश्लेषण/मॉडेल: सांख्यिकी, व्हिज्युअलायझेशन किंवा मॉडेल.
  6. सत्यापित करा आणि अहवाल द्या: निकालाची तरतूद, व्हॉल्यूम/गळती तपासणी, रेकॉर्डिंग.
टीप: AI ला कोड विचारताना, "प्रत्येक पायरीवर तुम्ही काय करत आहात ते टिप्पण्या द्या आणि तुमचे अनुमान लिहा" असे म्हणा. त्यामुळे तुम्ही कोड वाचताच त्याची पडताळणी करू शकता.

चरण-दर-चरण उदाहरण: टेलीमेट्री विश्लेषण

खालील कोड CAN/टेलिमेट्री रेकॉर्ड लोड करतो आणि मूलभूत तपासणी करतो. (टीप: कोड चालवण्यापूर्वी तुम्हाला ते समजले असल्याची खात्री करा; कॉलमची नावे तुमच्या डेटानुसार बदलू शकतात.)

pd# म्हणून पांडा आयात करा 1) लोड करा: अर्ध-डॉटेड CSV, प्रथम स्तंभ timestampdf = pd.read_csv("telemetry.csv", parse_dates=["time"])# 2) चेकप्रिंट(df.shape) # किती पंक्ती, किती स्तंभप्रिंट (df.nty) सह प्रकार (df.nty) मजकूर)मुद्रण(df.isna().sum()) # गहाळ मूल्यांची संख्या प्रति स्तंभप्रिंट(df.describe()) # सारांश आकडेवारी: किमान, कमाल, सरासरी

describe() आउटपुट ही तुमची पडताळणी करण्याची पहिली संधी आहे: जर इंजिन गती कमाल मूल्य 45,000 rpm (सामान्य प्रवासी इंजिन ~7,000 rpm) असेल तर, युनिट किंवा सेन्सर दोष आहे.

ऑडिटिंग चरणात वारंवार वापरल्या जाणाऱ्या पांडा कमांड आणि ते काय करतात:

आज्ञा

काय करते

ते कशाची पुष्टी करते?

df.shape

पंक्ती/स्तंभांची संख्या

तो अपेक्षित आकार आहे का?

df.dtypes

स्तंभाचे प्रकार

संख्या स्तंभ मजकूर झाला आहे का?

df.isna().sum()

गहाळ मूल्य संख्या

किती जागा आहे?

df.describe()

किमान/कमाल/सरासरी

हे शारीरिकदृष्ट्या वाजवी आहे का?

df.duplicated().sum()

डुप्लिकेट पंक्ती

दुहेरी नोंदणी आहे का?

# 3) साफ करा: भौतिकदृष्ट्या अशक्य मूल्ये चिन्हांकित करा

खबरदारी: आउटलायर त्वरित हटवू नका; प्रथम ते आउटलायर का आहे ते समजून घ्या. ही एक वास्तविक घटना आहे (अचानक गरम होणे) किंवा सेन्सर अयशस्वी? आंधळेपणाने हटवल्याने खरा दोष लपवू शकतो.

# 4) अर्क वैशिष्ट्य: तापमान वाढीचा दर (डेरिव्हेटिव्ह)df = df.sort_values("time")df["sic_increase_speed"] = df["motor_sic"].diff() / df["time"].diff().dt.total_seconds()# 5t ploimit portal portalization. pltplt.plot(df["time"], df["motor_sic"])plt.xlabel("वेळ"); plt.ylabel("इंजिन तापमान (C)")plt.title("इंजिन तापमान अभ्यासक्रम")plt.show()

Python मध्ये डेटा लीक रोखणे

प्रेडिक्शन मॉडेल बनवताना सर्वात धोकादायक चूक म्हणजे डेटा लीकेज (युनिट 5): जेव्हा मॉडेलला अशी माहिती दिसते जी भविष्यवाणीच्या वेळी ओळखली जाऊ शकत नाही. वेळेच्या मालिकेत हे टाळण्यासाठी सुवर्ण नियम: भूतकाळासह ट्रेन करा, भविष्याशी चाचणी घ्या — यादृच्छिक बदल नाही.

sklearn.model_selection वरून import train_test_split# FALSE: यादृच्छिकपणे वेळ मालिका विभाजित केल्याने भविष्य# df[df["time"] > थ्रेशोल्ड] # शेवटचे 20% भविष्य लीक होते

खबरदारी: ट्रेन_टेस्ट_स्प्लिट डीफॉल्टनुसार डेटा शफल करते (शफल=ट्रू). टाइम सीरिजमध्ये, हे भविष्यात शिक्षणासह गोंधळात टाकते आणि चुकीचे उच्च स्कोअर तयार करते. AI ने तयार केलेल्या कोडमध्ये हे केले असल्यास, ते निश्चित करा.

युनिट सुसंगतता: मूक किलर

ऑटोमोटिव्हमधील सर्वात कपटी त्रुटी म्हणजे युनिट एरर: km/h ते m/s, Nm ते lb-ft, bar to kPa, °C ते K. विश्लेषणामध्ये प्रत्येक स्तंभाचे युनिट काय आहे याचा शब्दकोश ठेवणे आणि रूपांतरणे स्पष्टपणे लिहिल्याने जीव वाचतो.

# युनिट्सचे स्पष्टपणे दस्तऐवजीकरण करा = {"स्पीड": "किमी/ता", "मोटर_सिक": "सी", "प्रेशर": "बार"}# आवश्यक असल्यास स्पष्ट रूपांतरण (km/h -> m/s)df["speed_ms"] = df["स्पीड"] / 3.6

मिनी केस स्टडी

केस 1 - describe() सह त्रुटी आढळली. एक विश्लेषक AI वरून कोड चालवतो आणि श्रेणी अंदाज करतो; परिणाम मूर्खपणे उच्च आहे. जेव्हा आपण वर्णन() आउटपुट पाहतो तेव्हा आपल्याला दिसते की बॅटरीची क्षमता काही ओळींमध्ये Wh मध्ये आणि इतरांमध्ये kWh मध्ये (1000 पट फरक) प्रविष्ट केली आहे. जेव्हा युनिट एकसमान प्रकारात आणले जाते तेव्हा परिणाम सुधारतो. निष्कर्ष: एका साध्या सारांश आकडेवारीने वाईट अंदाज रोखला.

प्रकरण २ - गोंधळाचा सापळा. चाचणी सेटवर इंटर्नचे ब्रेक वेअर मॉडेल 98% अचूक होते. जेव्हा कोड तपासला जातो, तेव्हा असे दिसून येते की train_test_split(shuffle=True) आणि वेळ मालिका मिश्रित आहेत, म्हणजे भविष्यातील गुण प्रशिक्षणात गळती होतील. वेळेनुसार विभाजित केल्यावर, अचूकता 80% पर्यंत खाली येते, परंतु ती आता वास्तववादी आहे. निष्कर्ष: एआय कोड कार्य करत असल्यामुळे ते योग्य नव्हते; मानवाने गळती पकडली.

केस 3 - आउटलायर समजून घेणे. टिकाऊपणा रेकॉर्डमध्ये, AI कोड आपोआप आउटलियर स्ट्रेन व्हॅल्यू हटवतो. अभियंता हटविलेले बिंदू पाहतो; चाचणीला स्वारस्य असलेल्या क्रॅकच्या सुरुवातीचे हे क्षण होते. हटवणे काढून टाकले जाते आणि उल्लंघनांचे स्वतंत्र पुनरावलोकन केले जाते. परिणाम: "स्वच्छता" अंतर्गत वास्तविक सिग्नल हटविला जाऊ शकतो; प्रत्येक पाऊल प्रश्न.

प्रॉम्प्ट टेम्पलेट्स

टेम्पलेट 1 - विनंती कोड (स्पष्टीकरणासह):

भूमिका: तुम्ही पायथन डेटा विश्लेषक मार्गदर्शक आहात. कार्य: टेलीमेट्री CSV लोड आणि तपासणारा कोड लिहा. संदर्भ: स्तंभ: वेळ, गती(किमी/ता), इंजिन_एसिक(सी), क्रांती(आरपीएम) प्रतिबंध: प्रत्येक पंक्तीवर टिप्पणी करा; कोणता चेक केला आणि का केला हे स्पष्ट करा; भौतिकदृष्ट्या अशक्य मूल्य तपासणी जोडा; शांतपणे काहीही हटवत नाही. आउटपुट: कॉमेंट केलेला कोड + मी कोणते आउटपुट पहावे आणि का.

टेम्पलेट 2 - गळती तपासणी:

भूमिका: तुम्ही मशीन लर्निंग कोड रिव्ह्यूअर आहात. कार्य: डेटा लीकसाठी खालील प्रशिक्षण/चाचणी विभाजन कोड तपासा. संदर्भ: ही एक वेळ मालिका आहे (वाहन टेलिमेट्री). प्रतिबंध: यादृच्छिक फेरबदल असल्यास चेतावणी द्या; वेळेनुसार विभाजन सुचवा आणि त्याचे समर्थन करा. आउटपुट: निष्कर्ष + दुरुस्त केलेला कोड + स्पष्टीकरण.

टेम्पलेट 3 - युनिट प्रमाणीकरण:

भूमिका: तुम्ही डेटा गुणवत्ता ऑडिटर आहात.कार्य: डेटाफ्रेममध्ये युनिट विसंगती शोधणाऱ्या तपासण्या सुचवा. संदर्भ: क्षमता काही पंक्तींमध्ये kWh आणि इतरांमध्ये Wh असू शकते. आउटपुट: कोड + संशयास्पद नमुना कसा शोधायचा ते तपासा.

टेम्पलेट 4 - व्हिज्युअलायझेशन + टिप्पणी:

भूमिका: तुम्ही डेटा व्हिज्युअलायझेशन तज्ञ आहात. कार्य: इंजिन तापमानाचा कोर्स आणि वाढीचा दर प्लॉट करणारा कोड लिहा. प्रतिबंध: अक्षांना युनिटसह लेबल करा; दृश्यमानपणे विसंगती चिन्हांकित करा; आलेखाचा अर्थ लावताना निश्चित दोषाचा दावा करू नका. आउटपुट: कोड + आलेखामध्ये काय पहावे.

कमकुवत प्रॉम्प्ट / मजबूत प्रॉम्प्ट

कमकुवत प्रॉम्प्ट:

या डेटासह एक मॉडेल तयार करा.

कोणता टार्गेट, कोणता डबा, कोणता पडताळणी हे स्पष्ट होत नाही; AI स्क्रॅम्बल्ड, लीकी, युनिट-ब्लाइंड कोड आउटपुट करू शकते.

शक्तिशाली सूचना:

भूमिका: तुम्ही Python ML मार्गदर्शक आहात. कार्य: ब्रेक पॅड पोशाख अंदाज करण्यासाठी प्रारंभिक कार्यप्रवाह लिहा आणि प्रमाणीकरणातील त्रुटी प्रदर्शित करा. संदर्भ: वेळ मालिका टेलीमेट्री; लक्ष्य: उर्वरित पॅडची जाडी. मर्यादा: वेळेनुसार वेळ मालिका विभाजित करा (शफलिंग नाही); डेटा लीक होण्याच्या जोखमीवर फ्लॅग विशेषता; दस्तऐवज युनिट्स;प्रत्येक चरणाचा अर्थ लावा; निकाल फील्डमध्ये जाण्यापूर्वी कोणती तपासणी आवश्यक आहे ते लिहा. आउटपुट: टिप्पणी केलेला कोड + सत्यापन चेकलिस्ट.

सामान्य चुका

  • कोड समजून न घेता चालवणे. एआय कोड देखील सदोष असू शकतो; ओळीने ओळ वाचा.
  • मिक्सिंग वेळ मालिका. shuffle=सत्य भविष्यात लीक करते आणि बनावट स्कोअर तयार करते.
  • आंधळेपणाने आउटलायर हटवा. वास्तविक सिग्नल (फॉल्ट ऑनसेट) साफ केला जाऊ शकतो.
  • युनिटचे दस्तऐवजीकरण नाही. km/h vs m/s, Wh vs kWh सारख्या त्रुटी शांतपणे वाढतात.
  • वर्णन()/चेक चरण वगळणे. बहुतेक त्रुटी पहिल्या सारांश आकडेवारीमध्ये दिसतात.

सारांशात

  • पायथन (पांडा, नंपी, मॅटप्लॉटलिब, स्किट-लर्न) हे ऑटोमोटिव्ह डेटा विश्लेषणाचे वास्तविक मानक आहे.
  • पुनरावृत्ती करण्यायोग्य विश्लेषण: लोड, तपासणी, स्वच्छ, वैशिष्ट्य, विश्लेषण, प्रमाणीकरण आणि अहवाल द्या.
  • एआय ओळीने रेषेने तयार करतो तो कोड समजून घेणे आणि त्याची पडताळणी करणे अत्यावश्यक आहे; फक्त ते कार्य करते याचा अर्थ ते योग्य आहे असे नाही.
  • वेळ मालिकेत भूतकाळ/भविष्यातील फरक राखणे; यादृच्छिक बदलामुळे डेटा लीक होतो.
  • एकक सुसंगतता आणि बाह्य व्याख्या हे पडताळणीचे मूक परंतु गंभीर मुद्दे आहेत.

अर्ज कार्य

एक छोटा डेटा संच घ्या (वास्तविक किंवा सिंथेटिक टेलीमेट्री). (1) सहा-चरण फ्रेमवर्कचे अनुसरण करून, टेम्प्लेट 1 सह लोडिंग आणि कंट्रोल कोड व्युत्पन्न करा आणि तुम्हाला प्रत्येक ओळ समजली असल्याची पुष्टी करा. (2) describe() आउटपुटमध्ये किमान एक संशयास्पद मूल्य शोधा आणि का ते तपासा. (३) प्रेडिक्शन टास्कमध्ये, ट्रेनिंग/चाचणीची वेळ विभाजित करा आणि टेम्प्लेट २ सह गळतीचा धोका तपासा. (४) तुम्ही डिक्शनरीमध्ये वापरत असलेल्या प्रत्येक कॉलमच्या युनिटचे दस्तऐवजीकरण करा.

चेकलिस्ट

  • [] मी सहा-चरण फ्रेमवर्कसह विश्लेषण सेट केले आहे.
  • [ ] मी एआय लाइनद्वारे तयार केलेला कोड वाचला आणि समजला.
  • [] मी describe()/audit सह संशयास्पद मूल्ये शोधली.
  • [ ] मी वेळ मालिका वेळेनुसार विभाजित केली आहे (बदल नाही).
  • डेटा लीक होण्याचा धोका असलेल्या विशेषता मी चिन्हांकित केल्या आहेत.
  • [ ] मी प्रत्येक स्तंभाच्या युनिटचे दस्तऐवजीकरण केले आणि रूपांतरणे स्पष्टपणे लिहिली.