इकाई 6 / 10

पर्यावरण डेटा और निगरानी विश्लेषण

लाभ:

  • समय श्रृंखला, थ्रेशोल्ड क्रॉसिंग और सेंसर गुणवत्ता नियंत्रण (क्यूए/क्यूसी) अवधारणाओं को लागू करने की क्षमता
  • एआई के साथ विसंगति स्कैनिंग, प्रवृत्ति सारांश और लापता डेटा रणनीति बनाने की क्षमता
  • कच्चे डेटा और अंशांकन के साथ एआई द्वारा बताई गई अधिकता और विसंगतियों को सत्यापित करने की क्षमता

आप एक संगठित औद्योगिक क्षेत्र के अपशिष्ट जल उपचार संयंत्र में शिफ्ट इंजीनियर हैं। आउटलेट पर स्थित एक सतत निगरानी स्टेशन हर 15 मिनट में घुलित ऑक्सीजन (डीओ), पीएच, चालकता और रासायनिक ऑक्सीजन मांग (सीओडी) को रिकॉर्ड करता है। सुबह 03:40 बजे, SCADA स्क्रीन पर COD मान बढ़कर 1,240 mg/L हो जाता है और सिस्टम अलार्म बजा देता है। डिस्चार्ज सीमा 250 मिलीग्राम/लीटर. घबराने से पहले आपको जो प्रश्न पूछने की ज़रूरत है वह यह है: क्या यह वास्तविक प्रदूषण घटना है या यह एक सेंसर रिकॉर्डिंग है? इस इकाई में, आप सीखेंगे कि समय श्रृंखला डेटा को स्कैन करने, विसंगतियों को चिह्नित करने और प्रवृत्ति सारांश उत्पन्न करने के लिए "प्रथम पठन सहायक" के रूप में भाषा मॉडल (एलएलएम) का उपयोग कैसे करें; लेकिन हम इस बात पर चर्चा कर रहे हैं कि वह अंतिम निर्णय कभी भी उस पर क्यों नहीं छोड़ेंगे।

सतत निगरानी डेटा का एनाटॉमी

पर्यावरण निगरानी डेटा नियमित समय अंतराल पर एकत्र की गई एक समय श्रृंखला है। प्रत्येक माप बिंदु पर एक टाइमस्टैम्प, एक मूल्य और आदर्श रूप से एक गुणवत्ता ध्वज होता है। कच्चे डेटा को समझने के लिए, आपको तीन अवधारणाओं में अंतर करना होगा:

  • प्रवृत्ति: दीर्घकालिक प्रवृत्ति (जैसे चालकता में मौसमी वृद्धि)।
  • मौसमी/चक्र: पैटर्न जो दिन या वर्ष के दौरान दोहराए जाते हैं (उदाहरण के लिए, दिन के समय प्रकाश संश्लेषण द्वारा डीओ की वृद्धि)।
  • विसंगति: एकवचन या अल्पकालिक मान जो सांख्यिकीय रूप से अपेक्षित पैटर्न से विचलित होते हैं।

पैरामीटर

विशिष्ट निगरानी सीमा

नमूना सीमा (निर्वहन)

सामान्य सेंसर समस्या

पीएच

1-5 मिनट

6-9 (इकाई रहित)

संदर्भ इलेक्ट्रोड शिफ्ट

घुलित ऑक्सीजन (डीओ)

5-15 मि

≥ 5 मिलीग्राम/लीटर (प्राप्त करने वाला माध्यम)

झिल्ली दूषण (जैव दूषण)

चालकता

5-15 मि

वर्ग पर निर्भर, µS/सेमी

अंशांकन बहाव

सीओडी (सतत विश्लेषक)

15-60 मि

250एमजी/एल

अभिकर्मक थकावट, रुकावट

पीएम10 (वायु)

1 घंटा

50 µg/m³ (24 घंटे)

आर्द्रता/संक्षेपण प्रभाव

क्यूए/क्यूसी झंडे क्यों महत्वपूर्ण हैं?

क्यूए/क्यूसी (गुणवत्ता आश्वासन/गुणवत्ता नियंत्रण) प्रत्येक माप पर एक विश्वास लेबल संलग्न करने के बारे में है। यहां तक ​​कि अगर कोई मान सांख्यिकीय रूप से "ओवरशूट" प्रतीत होता है, तो यह अमान्य है यदि इसे अंशांकन विंडो के बाहर ले जाया गया था या यदि सेंसर रखरखाव के अधीन है। सामान्य ध्वज कोड:

ध्वज का अर्थ----- --------------------------------- जी अच्छा - वैध, स्वीकृत माप एस संदिग्ध - संदिग्ध, सत्यापन आवश्यक एम गुम - गुम / खाली रिकॉर्ड सी अंशांकन - अंशांकन/रखरखाव विंडो, डेटा अमान्य ई अनुमानित - अनुमानित अनुमानित मूल्य

युक्ति: अधिकता विश्लेषण शुरू करने से पहले हमेशा अंशांकन और रखरखाव लॉग खोलें। यदि 03:40 पर सीओडी जंप स्वचालित रात्रिकालीन अंशांकन या अभिकर्मक परिवर्तन के साथ मेल खाता है, तो यह एक "सी" ध्वज डेटा है; यह अलार्म का विषय नहीं है, बल्कि डेटा सफाई का विषय है।

एआई के साथ विसंगति स्कैनिंग और रुझान सारांश

आप एलएलएम का उपयोग सारणीबद्ध डेटा की त्वरित समीक्षा करने, उन पैटर्नों को चिह्नित करने के लिए कर सकते हैं जो मानव आंख से छूट सकते हैं, और प्रारंभिक परिकल्पनाओं को सुलझा सकते हैं। महत्वपूर्ण बिंदु: मॉडल को कच्चा डेटा, इकाइयाँ और सीमाएँ एक साथ देना और उससे सत्यापन योग्य अवलोकन माँगना।

कमज़ोर संकेत: "क्या इस जल गुणवत्ता डेटा में कोई समस्या है?" मजबूत संकेत: "नीचे अपशिष्ट जल निर्वहन बिंदु (कॉलम: समय, सीओडी [मिलीग्राम/एल], चालकता [μS/सेमी], पीएच, क्यूए ध्वज) का 15 मिनट का निगरानी डेटा है। निर्वहन सीओडी सीमा 250 मिलीग्राम/लीटर, पीएच सीमा 6-9 है। आपका कार्य: 1) सीमा से अधिक वाले टाइमस्टैम्प की सूची बनाएं। 2) केवल 'जी' (अच्छे) झंडे वाली लाइनों का मूल्यांकन करें; उन्हें अलग करें सी/एम/एस एक अलग 'सत्यापन आवश्यक' सूची में चिह्नित करता है। 3) प्रत्येक ओवरशूट के लिए इंगित करें कि क्या यह एक एकल छलांग है (> = 3 लगातार लाइनें)। 4) ध्यान दें कि क्या चालकता और पीएच एक साथ बदलते हैं (एक साथ परिवर्तन वास्तविक घटना के पक्ष में सबूत है)।

शक्तिशाली संकेत मॉडल को एक ठोस प्रक्रिया से बांधता है, झंडों को पार्स करता है, और मतिभ्रम (बनी हुई व्याख्या) को सीमित करने के लिए एक स्पष्ट "यदि आप निश्चित नहीं हैं, तो मत कहें" निर्देश शामिल करता है।

सावधानी: एलएलएम संख्यात्मक सीमा तुलना में त्रुटियां कर सकता है; 248 मिलीग्राम/लीटर को "अधिक" या 252 मिलीग्राम/लीटर को "सीमा के भीतर" के रूप में गलत लेबल किया जा सकता है। मॉडल सूचियों की हर अतिरिक्तता को फिर से सत्यापित करें, या तो कच्ची तालिका से या किसी सूत्र के साथ (उदाहरण के लिए मान> 250)। मॉडल स्कैन करता है; सीमा आप तय करें.

गुम डेटा रणनीति (आरोप)

सेंसर बंद हो जाते हैं, बिजली चली जाती है, संचार टूट जाता है। आप छूटे हुए डेटा को कैसे भरते हैं, यह सीधे तौर पर आपके रुझान और अधिकता विश्लेषण को प्रभावित करता है। गलत आरोप एक ऐसा ओवरशूट "बना" सकता है जो अस्तित्व में ही नहीं है या वास्तविक ओवरशूट को छिपा सकता है।

पांडा को pdimport के रूप में आयात करें, np# 15 मिनट की COD श्रृंखला के रूप में सुन्न करें; -999 डिवाइस कोड "कोई डेटा नहीं" "फ्लैग": ["जी", "जी", "एम", "एम", "जी", "एस", "जी", "जी"],})# 1) डिवाइस कोड को वास्तविक लापता वैल्यूएफ.लोक में कनवर्ट करें। फ़्लैग इंप्यूटेशनगैप = df["koi"].isna()df["koi_full"] = df["koi"].interpolate(limit=2)df.loc[gap & df["koi_full"].notna(), "flag"] = "E" # अनुमानित# 3) सीमा से अधिक स्कैनिंग - केवल मापा (जी) मानों पर निर्णय के लिए असाइनमेंट = df[(df["koi_full"] > 250) और (df["flag"] == "G")]print(asyms[["ts", "koi_full", "flag"]])

इस दृष्टिकोण में, छोटे अंतराल भर दिए जाते हैं, लेकिन भरे गए मानों को ई से चिह्नित किया जाता है और ओवरशूट निर्णय केवल वास्तविक माप (जी) से किया जाता है। चूँकि 1240 मिलीग्राम/लीटर का मान एस (संदिग्ध) के रूप में चिह्नित किया गया है, यह स्वचालित अधिकता सूची में शामिल नहीं है; पहले सत्यापित किया जाता है.

सेंसर बहाव और अंशांकन द्वारा सत्यापन

यह निर्धारित करने के लिए स्वर्ण मानक कि क्या ओवरशूट वास्तविक है या सेंसर बहाव समवर्ती ग्रैब नमूने का प्रयोगशाला परिणाम है। उदाहरण के लिए, यदि निरंतर विश्लेषक ने 03:40 पर 1240 मिलीग्राम/लीटर दिखाया, और उस समय लिए गए नमूने का प्रयोगशाला मापा मूल्य 205 मिलीग्राम/लीटर है, तो समस्या सेंसर में है; निर्वहन नहीं. यह क्षेत्र और प्रयोगशाला के साथ AI आउटपुट या SCADA अलार्म का त्रिकोणासन है।

छोटा मामला

पीने के पानी के बेसिन में गंदलापन सेंसर तीन दिनों से धीरे-धीरे बढ़ने की प्रवृत्ति दिखा रहा था। शिफ्ट टीम ने एलएलएम को साप्ताहिक डेटा दिया; मॉडल में कहा गया है, "बारिश के बाद होने वाले अपवाह के कारण गंदगी में वास्तविक वृद्धि संभव है।" हालाँकि, जब इंजीनियर ने मौसम संबंधी रिकॉर्ड देखा, तो उसने देखा कि उस सप्ताह क्षेत्र में कोई बारिश नहीं हुई थी। क्षेत्र निरीक्षण के दौरान, यह समझ में आया कि सेंसर ऑप्टिकल विंडो पर जैव ईंधन बन गया था; सफाई और अंशांकन के बाद, मान सामान्य हो गए। एलएलएम की "संभावित वास्तविक घटना" की व्याख्या को बाहरी डेटा (वर्षा रिकॉर्ड) और क्षेत्र नियंत्रण द्वारा अस्वीकार कर दिया गया था। पाठ: मॉडल एक प्रशंसनीय लेकिन झूठी कहानी पेश कर सकता है; सत्यापन श्रृंखला इसे पकड़ लेती है।

सामान्य गलतियां

  • अंशांकन/रखरखाव विंडो (ध्वज सी) में डेटा को वास्तविक अधिकता समझ लेना।
  • गुम डेटा को चुपचाप भरना और आरोपित मूल्यों को वास्तविक माप के रूप में रिपोर्ट करना।
  • एक एकल उछाल (एकल रेखा, संभवतः विद्युत शोर) को एक सतत घटना समझ लेना।
  • एलएलएम की ब्रेकप्वाइंट तुलनाओं (248 बनाम 250) पर आंख मूंदकर भरोसा करना।
  • एक साथ मापदंडों (पीएच + चालकता + सीओडी) की जांच किए बिना एकल पैरामीटर के आधार पर निर्णय लेना।
  • ग्रैब सैंपल/प्रयोगशाला पुष्टिकरण के साथ सेंसर बहाव को खारिज किए बिना अलार्म को "वास्तविक" घोषित करना।
  • स्थानीय समय/यूटीसी और ग्रीष्म समय की पाली को नजरअंदाज करना और घटनाओं को गलत समय पर जिम्मेदार ठहराना।

संक्षेप में

  • पर्यावरण निगरानी डेटा एक समय श्रृंखला है; इसकी व्याख्या प्रवृत्ति, मौसमी और विसंगति में अंतर किए बिना नहीं की जा सकती।
  • क्यूए/क्यूसी झंडे डेटा का ट्रस्ट टैग हैं; निर्णय केवल वैध (जी) डेटा से किए जाते हैं।
  • एलएलएम विसंगति स्कैनिंग, अतिशयोक्ति सूची और प्रवृत्ति सारांश के लिए एक त्वरित प्रथम पठन सहायक है, निर्णय निर्माता नहीं।
  • गुम डेटा रणनीति (आरोपीकरण) पारदर्शी होनी चाहिए; भरे हुए मूल्यों को चिह्नित किया जाता है और अधिकता के निर्णय के आधार के रूप में नहीं लिया जाता है।
  • सेंसर ड्रिफ्ट, बायोफॉलिंग और कैलिब्रेशन ड्रिफ्ट "नकली ओवरशूट" उत्पन्न करते हैं; ग्रैब सैंपल और प्रयोगशाला पुष्टिकरण में अंतर करता है।
  • एआई आउटपुट एक परिकल्पना है; अंशांकन रिकॉर्ड और फ़ील्ड नियंत्रण द्वारा सत्यापन के बिना कच्चा डेटा आधिकारिक रिपोर्ट में दर्ज नहीं होता है।

आवेदन कार्य

आपके पास मौजूद 24 घंटे, 15 मिनट का मॉनिटरिंग डेटासेट लें (या कृत्रिम रूप से जेनरेट करें) (कम से कम एक पैरामीटर: सीओडी, पीएच, या पीएम10) और एक रन बनाएं जो क्यूए/क्यूसी झंडे जोड़ता है और सीमा से अधिक की सूची बनाता है। सबसे पहले, एक मजबूत संकेत लिखें और एलएलएम से विसंगति और अधिकता स्कैनिंग के लिए पूछें; फिर स्वतंत्र रूप से पायथन में वैल्यू > लिमिट फिल्टर के साथ समान अधिकता को सत्यापित करें। कम से कम एक प्रतिरूपण उदाहरण बनाएं और भरे हुए मानों को ई से चिह्नित करें। प्रत्येक "ओवरशूट" के लिए आप पाते हैं "मैं ग्रैब सैंपल/कैलिब्रेशन रिकॉर्ड के साथ इसे कैसे सत्यापित करूं?" प्रश्न का उत्तर एक वाक्य में दीजिये। अंततः, औचित्य सहित सारणीबद्ध करें कि एलएलएम द्वारा चिन्हित कितनी विसंगतियाँ वास्तविक घटनाएँ हैं और कितनी सेंसर/डेटा समस्याएँ हैं।