युनिट 6 / 10

पर्यावरणीय डेटा आणि मॉनिटरिंग विश्लेषण

नफा:

  • वेळ मालिका, थ्रेशोल्ड क्रॉसिंग आणि सेन्सर गुणवत्ता नियंत्रण (QA/QC) संकल्पना लागू करण्याची क्षमता
  • AI सह विसंगती स्कॅनिंग, ट्रेंड सारांश आणि गहाळ डेटा धोरण तयार करण्याची क्षमता
  • कच्चा डेटा आणि कॅलिब्रेशनसह AI द्वारे निदर्शनास आणलेल्या मर्यादा आणि विसंगती सत्यापित करण्याची क्षमता

तुम्ही संघटित औद्योगिक क्षेत्राच्या सांडपाणी प्रक्रिया प्रकल्पात शिफ्ट इंजिनिअर आहात. आउटलेटवर स्थित एक सतत देखरेख केंद्र दर 15 मिनिटांनी विरघळलेला ऑक्सिजन (DO), pH, चालकता आणि रासायनिक ऑक्सिजन मागणी (COD) नोंदवते. सकाळी 03:40 वाजता, SCADA स्क्रीनवरील COD मूल्य 1,240 mg/L वर जाते आणि सिस्टम अलार्म वाढवते. डिस्चार्ज मर्यादा 250 mg/L. घाबरण्याआधी तुम्हाला प्रश्न विचारण्याची गरज आहे: ही खरी प्रदूषणाची घटना आहे की सेन्सर रेकॉर्डिंग आहे? या युनिटमध्ये, तुम्ही वेळ मालिका डेटा स्कॅन करण्यासाठी, विसंगती चिन्हांकित करण्यासाठी आणि ट्रेंड सारांश तयार करण्यासाठी "प्रथम वाचन सहाय्यक" म्हणून भाषा मॉडेल (LLM) कसे वापरावे ते शिकाल; पण तो अंतिम निर्णय तिच्यावर का सोडणार नाही यावर आम्ही चर्चा करत आहोत.

सतत देखरेख डेटाचे शरीरशास्त्र

पर्यावरण निरीक्षण डेटा ही नियमित वेळेच्या अंतराने गोळा केलेली वेळ मालिका आहे. प्रत्येक मापन बिंदूमध्ये एक टाइमस्टॅम्प, एक मूल्य आणि आदर्शपणे एक दर्जेदार ध्वज असतो. कच्चा डेटा समजण्यासाठी, तुम्ही तीन संकल्पनांमध्ये फरक केला पाहिजे:

  • कल: दीर्घकालीन कल (उदा. चालकतेमध्ये हंगामी वाढ).
  • ऋतू/चक्र: दिवस किंवा वर्षात पुनरावृत्ती होणारे नमुने (उदा. दिवसाच्या प्रकाशसंश्लेषणाद्वारे DO ची उंची).
  • Anomaly: Singular or short-term values ​​that statistically deviate from the expected pattern.

पॅरामीटर

ठराविक निरीक्षण श्रेणी

नमुना मर्यादा (डिस्चार्ज)

सामान्य सेन्सर समस्या

pH

1-5 मि

6-9 (एककविना)

संदर्भ इलेक्ट्रोड शिफ्ट

विरघळलेला ऑक्सिजन (DO)

५-१५ मि

≥ 5 mg/L (मिडियम प्राप्त)

मेम्ब्रेन फॉउलिंग (बायोफॉलिंग)

चालकता

५-१५ मि

वर्ग अवलंबून, µS/cm

कॅलिब्रेशन वाहून नेणे

सीओडी (सतत विश्लेषक)

15-60 मि

250mg/L

अभिकर्मक थकवा, clogging

PM10 (हवा)

1 तास

50 µg/m³ (24 तास)

आर्द्रता/संक्षेपण प्रभाव

QA/QC ध्वज महत्त्वाचे का आहेत?

QA/QC (गुणवत्ता हमी/गुणवत्ता नियंत्रण) म्हणजे प्रत्येक मोजमापावर विश्वास लेबल संलग्न करणे. जरी एखादे मूल्य सांख्यिकीयदृष्ट्या "ओव्हरशूट" असल्याचे दिसत असले तरीही, ते कॅलिब्रेशन विंडोच्या बाहेर घेतले असल्यास किंवा सेन्सर देखरेखीखाली असल्यास ते अवैध आहे. सामान्य ध्वज कोड:

ध्वजाचा अर्थ----------------------------------G चांगला — वैध, स्वीकृत मोजमापS संशयित — संशयास्पद, पडताळणी आवश्यकM गहाळ — गहाळ/रिक्त रेकॉर्डC कॅलिब्रेशन — कॅलिब्रेशन/देखभाल विंडो, डेटा अवैधE अंदाजित — अनुमानित अंदाजित मूल्य

टीप: जास्तीचे विश्लेषण सुरू करण्यापूर्वी नेहमी कॅलिब्रेशन आणि देखभाल नोंदी उघडा. जर 03:40 वाजता COD जंप स्वयंचलित रात्रभर कॅलिब्रेशन किंवा अभिकर्मक बदलाशी जुळत असेल, तर हा "C" ध्वज डेटा आहे; हा अलार्मचा विषय नाही तर डेटा क्लीनिंगचा आहे.

AI सह विसंगती स्कॅनिंग आणि ट्रेंड सारांश

टॅब्युलर डेटाचे द्रुतपणे पुनरावलोकन करण्यासाठी, मानवी डोळा चुकवू शकतील असे ध्वज नमुने आणि प्रारंभिक गृहितकांची क्रमवारी लावण्यासाठी तुम्ही LLM वापरू शकता. महत्त्वाचा मुद्दा: मॉडेलला कच्चा डेटा, एकके आणि मर्यादा एकत्र देणे आणि त्यातून पडताळणीयोग्य निरीक्षणे मागणे.

कमजोर प्रॉम्प्ट: "या पाण्याच्या गुणवत्तेच्या डेटामध्ये काही समस्या आहे का?" स्ट्राँग प्रॉम्प्ट: "खाली सांडपाणी डिस्चार्ज पॉइंट (स्तंभ: वेळ, COD [mg/L], चालकता [µS/cm], pH, QA ध्वज) च्या 15 मिनिटांच्या मॉनिटरिंग डेटाचा आहे. डिस्चार्ज COD मर्यादा 250 mg/L, pH श्रेणी 6-9 आहे. तुमचे कार्य: 1) फक्त मर्यादा वेळापत्रकांसह Ecetamps ची यादी करा. 'G' (चांगले) ध्वजांना वेगळ्या 'पडताळणी आवश्यक' सूचीमध्ये वेगळे करा 3) प्रत्येक ओव्हरशूटसाठी ते एकवचनी उडी (>= सलग 3 ओळी) आहे की नाही हे लक्षात ठेवा (आपण कोणत्याही घटनांमध्ये एकाचवेळी बदल करत नाही). त्याऐवजी 'कच्च्या डेटासह पुष्टी करणे आवश्यक आहे' असे लिहा.

शक्तिशाली प्रॉम्प्ट मॉडेलला ठोस प्रक्रियेशी बांधून ठेवते, ध्वजांचे विश्लेषण करते आणि भ्रमनिरास (मेड-अप इंटरप्रिटेशन) मर्यादित करण्यासाठी स्पष्ट "तुम्हाला खात्री नसल्यास, म्हणू नका" सूचना समाविष्ट करते.

खबरदारी: LLM संख्यात्मक थ्रेशोल्ड तुलनांमध्ये चुका करू शकते; 248 mg/L ला “ओलांड” किंवा 252 mg/L “मर्यादेच्या आत” असे चुकीचे लेबल करू शकते. कच्च्या सारणीवरून किंवा सूत्राने (उदा. मूल्य > 250) दृष्यदृष्ट्या, मॉडेल सूचीतील प्रत्येक ओलांडण्याची पुन्हा पडताळणी करा. मॉडेल स्कॅन करते; तुम्ही मर्यादा ठरवा.

गहाळ डेटा धोरण (अभियोग)

सेन्सर अडकतात, वीज जाते, संवाद खंडित होतो. तुम्ही गहाळ डेटा कसा भरता याचा थेट तुमच्या ट्रेंडवर आणि ओलांडण्याच्या विश्लेषणावर परिणाम होतो. खोटे आरोप अस्तित्वात नसलेले ओव्हरशूट "तयार" करू शकतात किंवा वास्तविक ओव्हरशूट लपवू शकतात.

np# 15 मिनिट COD मालिका म्हणून pdimport numpy म्हणून पांडा आयात करा; -999 डिव्हाइस कोड "डेटा नाही" "ध्वज": ["G", "G", "M", "M", "G", "S", "G", "G"],})# 1) डिव्हाइस कोड वास्तविक गहाळ मूल्यामध्ये रूपांतरित करा. ध्वज imputationgap = df["koi"].isna()df["koi_full"] = df["koi"].interpolate(limit=2)df.loc[gap & df["koi_full"].notna(), "flag"] = "E" # अंदाजे # 3 नुसार मर्यादा मोजण्यासाठी निर्णय (G) मूल्ये फक्त = df[(df["koi_full"] > 250) आणि (df["ध्वज"] == "G")]मुद्रण(asyms[["ts", "koi_full", "flag"]])

या दृष्टिकोनामध्ये, लहान अंतर भरले जातात, परंतु भरलेली मूल्ये E सह चिन्हांकित केली जातात आणि ओव्हरशूट निर्णय केवळ वास्तविक मापन (G) वरून घेतला जातो. 1240 mg/L चे मूल्य S (संशयास्पद) म्हणून ध्वजांकित केल्यामुळे, ते स्वयंचलित ओलांडण्याच्या सूचीमध्ये समाविष्ट केलेले नाही; प्रथम सत्यापित केले जाते.

सेन्सर ड्रिफ्ट आणि कॅलिब्रेशनद्वारे पडताळणी

ओव्हरशूट वास्तविक आहे की सेन्सर ड्रिफ्ट हे समवर्ती ग्रॅब नमुन्याचा प्रयोगशाळा परिणाम आहे हे निर्धारित करण्यासाठी सुवर्ण मानक. उदाहरणार्थ, जर सतत विश्लेषकाने 03:40 वाजता 1240 mg/L दाखवले आणि त्या वेळी घेतलेल्या नमुन्याचे प्रयोगशाळेत मोजलेले मूल्य 205 mg/L असेल, तर समस्या सेन्सरमध्ये आहे; डिस्चार्ज नाही. हे फील्ड आणि प्रयोगशाळेसह AI आउटपुट किंवा SCADA अलार्मचे त्रिकोण आहे.

मिनी केस

पिण्याच्या पाण्याच्या बेसिनमधील टर्बिडिटी सेन्सर तीन दिवसांपासून हळूहळू वाढलेला कल दर्शवत होता. शिफ्ट टीमने एलएलएमला साप्ताहिक डेटा दिला; "पाऊसोत्तर वाहून गेल्यामुळे गढूळपणामध्ये वास्तविक वाढ शक्य आहे," मॉडेलने म्हटले आहे. तथापि, अभियंत्याने हवामान खात्याच्या नोंदी पाहिल्या, तेव्हा त्यांना त्या आठवड्यात पाऊस पडला नाही असे दिसले. फील्ड तपासणी दरम्यान, असे समजले की सेन्सर ऑप्टिकल विंडोवर बायोफाउलिंग तयार झाले आहे; साफसफाई आणि कॅलिब्रेशननंतर, मूल्ये सामान्य झाली. LLM चे "संभाव्य वास्तविक घटना" चे स्पष्टीकरण बाह्य डेटा (पाऊस रेकॉर्ड) आणि फील्ड कंट्रोल द्वारे नाकारण्यात आले. धडा: मॉडेल एक प्रशंसनीय परंतु खोटी कथा तयार करू शकते; सत्यापन साखळी ते पकडते.

सामान्य चुका

  • कॅलिब्रेशन/देखभाल विंडो (ध्वज C) मधील डेटाला वास्तविक ओलांडणे चुकीचे आहे.
  • गहाळ डेटा शांतपणे भरणे आणि वास्तविक मोजमाप म्हणून आरोपित मूल्यांचा अहवाल देणे.
  • सतत घडणाऱ्या कार्यक्रमासाठी एकेरी बाऊन्स (एकल रेषा, शक्यतो विद्युत आवाज) चुकणे.
  • LLM च्या ब्रेकपॉइंट तुलनांवर आंधळेपणाने विश्वास ठेवणे (248 वि. 250).
  • एकाचवेळी पॅरामीटर्स (पीएच + चालकता + सीओडी) क्रॉस-चेक न करता एकाच पॅरामीटरवर आधारित निर्णय घेणे.
  • सॅम्पल/प्रयोगशाळा पुष्टीकरणासह सेन्सर ड्रिफ्ट नाकारता अलार्म "वास्तविक" घोषित करणे.
  • स्थानिक वेळ/UTC आणि ग्रीष्मकालीन वेळेच्या शिफ्टकडे दुर्लक्ष करणे आणि चुकीच्या वेळेला इव्हेंटचे श्रेय देणे.

सारांशात

  • पर्यावरण निरीक्षण डेटा एक वेळ मालिका आहे; कल, ऋतू आणि विसंगती यांमध्ये फरक केल्याशिवाय त्याचा अर्थ लावला जाऊ शकत नाही.
  • QA/QC ध्वज हे डेटाचे ट्रस्ट टॅग आहेत; निर्णय फक्त वैध (G) डेटावरून घेतले जातात.
  • LLM हा विसंगती स्कॅनिंग, ओलांडता सूची आणि ट्रेंड सारांश यासाठी एक द्रुत प्रथम वाचन सहाय्यक आहे, निर्णय घेणारा नाही.
  • गहाळ डेटा धोरण (अभियोग) पारदर्शक असावे; भरलेली मूल्ये चिन्हांकित केली आहेत आणि ओलांडलेल्या निर्णयासाठी आधार म्हणून घेतली जात नाहीत.
  • सेन्सर ड्रिफ्ट, बायोफौलिंग आणि कॅलिब्रेशन ड्रिफ्ट "नक्कल ओव्हरशूट" तयार करतात; ग्रॅब नमुना आणि प्रयोगशाळा पुष्टीकरण वेगळे करते.
  • एआय आउटपुट एक गृहितक आहे; कॅलिब्रेशन रेकॉर्ड आणि फील्ड कंट्रोलद्वारे पडताळणी केल्याशिवाय कच्चा डेटा अधिकृत अहवालात प्रवेश करत नाही.

अर्ज कार्य

तुमच्याकडे 24-तास, 15-मिनिटांचा मॉनिटरिंग डेटासेट घ्या (किंवा कृत्रिमरित्या व्युत्पन्न करा) (किमान एक पॅरामीटर: COD, pH, किंवा PM10) आणि एक रन तयार करा जो QA/QC ध्वज जोडेल आणि मर्यादा ओलांडू शकेल. प्रथम, एक सशक्त प्रॉम्प्ट लिहा आणि LLM ला विसंगती आणि अत्याधिक स्कॅनिंगसाठी विचारा; नंतर Python मधील मूल्य > मर्यादा फिल्टरसह समान मर्यादा स्वतंत्रपणे सत्यापित करा. कमीत कमी एक इम्प्युटेशन उदाहरण बनवा आणि भरलेली व्हॅल्यू E ने चिन्हांकित करा. प्रत्येक "ओव्हरशूट" साठी तुम्हाला "ग्रॅब सॅम्पल/कॅलिब्रेशन रेकॉर्डसह मी हे कसे सत्यापित करू?" एका वाक्यात प्रश्नाचे उत्तर द्या. शेवटी, LLM द्वारे ध्वजांकित केलेल्या विसंगतींपैकी किती वास्तविक घटना आहेत आणि किती सेन्सर/डेटा समस्या आहेत, औचित्यांसह सारणी करा.