Njësia 6 / 10

Analiza e të dhënave mjedisore dhe monitorimit

Fitimet:

  • Aftësia për të aplikuar konceptet e serive kohore, të kalimit të pragut dhe të kontrollit të cilësisë së sensorit (QA/QC).
  • Aftësia për të krijuar skanim anomalish, përmbledhje trendi dhe strategji të të dhënave që mungojnë me AI
  • Aftësia për të verifikuar tejkalimet dhe anomalitë e theksuara nga AI me të dhëna të papërpunuara dhe kalibrim

Ju jeni një inxhinier turni në impiantin e trajtimit të ujërave të zeza të një zone të organizuar industriale. Një stacion monitorimi i vazhdueshëm i vendosur në dalje regjistron oksigjenin e tretur (DO), pH, përcjellshmërinë dhe kërkesën kimike për oksigjen (COD) çdo 15 minuta. Në orën 03:40 të mëngjesit, vlera COD në ekranin SCADA hidhet në 1240 mg/L dhe sistemi ngre një alarm. Kufiri i shkarkimit 250 mg/L. Pyetja që duhet të bëni përpara se të kapni panik është: A është ky një incident i vërtetë ndotjeje apo është një regjistrim me sensor? Në këtë njësi, ju do të mësoni se si të përdorni një model gjuhësor (LLM) si një "asistent i leximit të parë" për skanimin e të dhënave të serive kohore, shënimin e anomalive dhe gjenerimin e përmbledhjeve të tendencave; Por ne po diskutojmë pse ai nuk do t'ia lërë kurrë asaj vendimin përfundimtar.

Anatomia e të dhënave të monitorimit të vazhdueshëm

Të dhënat e monitorimit të mjedisit janë një seri kohore e mbledhur në intervale të rregullta kohore. Çdo pikë matje mbart një vulë kohore, një vlerë dhe në mënyrë ideale një flamur cilësor. Për të kuptuar të dhënat e papërpunuara, duhet të dalloni tre koncepte:

  • Trendi: Trendi afatgjatë (p.sh. rritja sezonale e përçueshmërisë).
  • Sezonaliteti/cikli: Modele që përsëriten gjatë ditës ose vitit (p.sh., ngritja e DO nga fotosinteza gjatë ditës).
  • Anomali: Vlerat singulare ose afatshkurtra që statistikisht devijojnë nga modeli i pritur.

Parametri

Gama tipike e monitorimit

Kufiri i mostrës (shkarkimi)

Problemi i zakonshëm i sensorit

pH

1-5 min

6-9 (pa njësi)

Zhvendosja e elektrodës së referencës

Oksigjen i tretur (DO)

5-15 min

≥ 5 mg/L (medium pranues)

Fryrja e membranës (biofouling)

përçueshmëri

5-15 min

Në varësi të klasës, µS/cm

Zhvendosja e kalibrimit

COD (analizues i vazhdueshëm)

15-60 min

250 mg/L

Lodhje e reagentit, bllokim

PM10 (ajër)

1 orë

50 µg/m³ (24 orë)

Efekti i lagështisë/kondensimit

Pse janë jetik flamujt QA/QC?

QA/QC (sigurimi i cilësisë / kontrolli i cilësisë) ka të bëjë me vendosjen e një etikete besimi për çdo matje. Edhe nëse një vlerë duket statistikisht si një "tejkalim", ajo është e pavlefshme nëse është marrë jashtë dritares së kalibrimit ose nëse sensori është nën mirëmbajtje. Kodet e zakonshme të flamurit:

Kuptimi i flamurit----- -------------------------------G Mirë — matje e vlefshme, e pranuarS Dyshohet — e dyshimtë, kërkohet verifikimM Mungon — mungon / Regjistrimi boshC Kalibrimi — Dritarja e kalibrimit/mirëmbajtjes, e të dhënave të pavlefshmeE vlerësuar — vlera e vlerësuar e imputuar

Këshillë: Hapni gjithmonë regjistrat e kalibrimit dhe mirëmbajtjes përpara se të filloni një analizë të tejkalimit. Nëse kërcimi COD në orën 03:40 përkon me kalibrimin automatik gjatë natës ose ndryshimin e reagentit, kjo është një e dhënë e flamurit "C"; Nuk është subjekt alarmi, por pastrimi i të dhënave.

Skanimi i anomalive dhe përmbledhja e tendencave me AI

Ju mund të përdorni LLM për të rishikuar shpejt të dhënat tabelare, modelet e flamurit që syrit të njeriut mund t'i mungojnë dhe për të renditur hipotezat fillestare. Pika kritike: Dhënia e modelit të të dhënave të papërpunuara, njësitë dhe kufiri së bashku dhe kërkimi i vëzhgimeve të verifikueshme prej tij.

NJOFTIM I DOBËT: "A ka ndonjë problem me këto të dhëna për cilësinë e ujit?" KËRKIM I FORTË: "Më poshtë janë 15 minuta të dhëna monitorimi të një pike shkarkimi të ujërave të zeza (kolonat: koha, COD [mg/L], përçueshmëria [µS/cm], pH, flamuri QA). Kufiri i COD-së së shkarkimit është 250 mg/L, diapazoni i pH 6-9. Detyra juaj: 1) Regjistroni vulat kohore vetëm me 2. (mirë) ndani ato me flamuj C/M/S në një listë të veçantë 'verifikimi i nevojshëm' verifikuar me të dhëna, shkruani 'duhet të konfirmohet me të dhëna të papërpunuara'.

Prompti i fuqishëm lidh modelin me një procedurë konkrete, analizon flamujt dhe përfshin një udhëzim të qartë "nëse nuk je i sigurt, mos thuaj" për të kufizuar halucinacionet (interpretim i sajuar).

Kujdes: LLM mund të bëjë gabime në krahasimet e pragut numerik; Mund të etiketojë gabimisht 248 mg/L si "tejkalim" ose 252 mg/L si "brenda kufirit". Ri-verifiko ÇDO tejkalim të listave të modeleve, qoftë vizualisht nga tabela e papërpunuar ose me një formulë (p.sh. vlera > 250). Modeli skanon; Ju vendosni kufirin.

Strategjia e të dhënave që mungon (imputimi)

Sensorët bllokohen, energjia shkon jashtë, komunikimi prishet. Mënyra se si plotësoni të dhënat që mungojnë ndikon drejtpërdrejt në analizën tuaj të tendencës dhe tejkalimit. Imputimi i rremë mund të "krijojë" një tejkalim që nuk ekziston ose të fshehë një tejkalim të vërtetë.

importoni panda si pdimport numpy si np# 15 minuta seri COD; -999 kodi i pajisjes "pa të dhëna" "flamur": ["G", "G", "M", "M", "G", "S", "G", "G"],})# 1) Konverto kodet e pajisjes në vlerat aktuale që mungojnë. flag imputationgap = df["koi"].isna()df["koi_full"] = df["koi"].interpolate(limit=2)df.loc[boshllëk & df["koi_full"].notna(), "flamur"] = "E" # tejkalim i kufizimeve për vendimin e matjeve 3) vlerat ONLY = df[(df["koi_full"] > 250) & (df["flamur"] == "G")]print(asyms[["ts", "koi_full", "flamur"]])

Në këtë qasje, boshllëqet e shkurtra plotësohen, por vlerat e mbushura shënohen me E dhe vendimi i tejkalimit merret vetëm nga matja aktuale (G). Meqenëse vlera 1240 mg/L është shënuar si S (e dyshimtë), ajo nuk përfshihet në listën e tejkalimeve automatike; verifikohet së pari.

Verifikimi nga zhvendosja e sensorit dhe kalibrimi

Standardi i artë për përcaktimin nëse një tejkalim është i vërtetë ose lëvizja e sensorit është rezultati laboratorik i një kampioni të njëkohshëm të kapjes. Për shembull, nëse analizuesi i vazhdueshëm tregoi 1240 mg/L në 03:40, dhe vlera e matur laboratorike e kampionit të marrë në atë kohë është 205 mg/L, problemi është në sensor; jo shkarkimi. Ky është trekëndëshi i daljes së AI ose alarmi SCADA me terrenin dhe laboratorin.

mini rast

Sensori i turbullirës në një pellg uji të pijshëm po shfaqte një trend gradualisht në rritje për tre ditë. Ekipi i ndërrimit i dha të dhëna javore LLM; "Një rritje reale e turbullirës për shkak të rrjedhjes pas reshjeve është e mundur," tha modelja. Megjithatë, kur inxhinieri shikoi të dhënat meteorologjike, ai pa se nuk kishte shi në rajon atë javë. Gjatë inspektimit në terren, u kuptua se në dritaren optike të sensorit ishte formuar biopastrim; Pas pastrimit dhe kalibrimit, vlerat u kthyen në normale. Interpretimi i LLM për "ngjarjen e mundshme aktuale" u hodh poshtë nga të dhënat e jashtme (rekord reshjesh) dhe kontrolli në terren. Mësimi: Modeli mund të prodhojë një histori të besueshme, por të rreme; zinxhiri i verifikimit e kap atë.

Gabimet e zakonshme

  • Gabimi i të dhënave në dritaren e kalibrimit/mirëmbajtjes (flamuri C) për tejkalim real.
  • Plotësimi i të dhënave që mungojnë në heshtje dhe raportimi i vlerave të imputuara si matje reale.
  • Gabimi i një kërcimi të vetëm (një linjë, ndoshta zhurmë elektrike) për një ngjarje të vazhdueshme.
  • Duke besuar verbërisht krahasimet e pikave të ndërprerjes së LLM (248 vs 250).
  • Marrja e vendimeve bazuar në një parametër të vetëm pa kontroll të kryqëzuar të parametrave të njëkohshëm (pH + përçueshmëri + COD).
  • Deklarimi i alarmit "real" pa përjashtuar zhvendosjen e sensorit me kampionin e kapjes/konfirmimin laboratorik.
  • Injorimi i lëvizjeve të orës lokale/UTC dhe të verës dhe atribuimi i ngjarjeve në kohën e gabuar.

Në përmbledhje

  • Të dhënat e monitorimit të mjedisit janë një seri kohore; Nuk mund të interpretohet pa dalluar trendin, sezonalitetin dhe anomalinë.
  • Flamujt QA/QC janë etiketa e besimit të të dhënave; vendimet merren vetëm nga të dhënat e vlefshme (G).
  • LLM është një asistent i shpejtë i leximit të parë për skanimin e anomalive, listën e tejkalimeve dhe përmbledhjen e tendencave, jo një vendimmarrës.
  • Strategjia e të dhënave që mungojnë (imputimi) duhet të jetë transparente; Vlerat e mbushura janë shënuar dhe nuk merren si bazë për vendimin e tejkalimit.
  • Zhvendosja e sensorit, biopastrimi dhe zhvendosja e kalibrimit prodhojnë "tejkalim të rremë"; dallon kampionin e kapjes dhe konfirmimin laboratorik.
  • Prodhimi i AI është një hipotezë; Të dhënat e papërpunuara nuk futen në raportin zyrtar pa verifikim nga regjistrimi i kalibrimit dhe kontrolli në terren.

Detyra e aplikimit

Merrni një grup të dhënash monitorimi 24-orësh dhe 15-minutësh që keni (ose gjeneroni në mënyrë sintetike) (të paktën një parametër: COD, pH ose PM10) dhe krijoni një ekzekutim që shton flamuj të QA/QC dhe liston tejkalimet e limiteve. Së pari, shkruani një kërkesë të fortë dhe kërkoni LLM për skanimin e anomalive dhe tejkalimeve; Pastaj verifikoni në mënyrë të pavarur të njëjtat tejkalime me filtrin e vlerës > limit në Python. Bëni të paktën një shembull imputimi dhe shënoni vlerat e mbushura me E. Për çdo "tejkalim" gjeni "si mund ta verifikoj këtë me kampionin e kapjes/kalibrimit?" Përgjigjuni pyetjes me një fjali. Në fund të fundit, tabeloni se sa nga anomalitë e shënuara nga LLM janë ngjarje reale dhe sa janë probleme sensori/të dhënash, me justifikime.