Enota 6 / 10

Analiza okoljskih podatkov in spremljanja

Dobički:

  • Sposobnost uporabe časovnih vrst, konceptov prečkanja praga in nadzora kakovosti senzorjev (QA/QC).
  • Sposobnost ustvarjanja strategije skeniranja nepravilnosti, povzetka trendov in manjkajočih podatkov z AI
  • Sposobnost preverjanja prekoračitev in nepravilnosti, na katere opozarja AI z neobdelanimi podatki in kalibracijo

Ste izmenski inženir na čistilni napravi organizirane industrijske cone. Postaja za neprekinjeno spremljanje, ki se nahaja na izhodu, beleži raztopljeni kisik (DO), pH, prevodnost in kemično porabo kisika (KPK) vsakih 15 minut. Ob 03:40 zjutraj vrednost COD na zaslonu SCADA poskoči na 1.240 mg/L in sistem sproži alarm. Meja izpusta 250 mg/L. Vprašanje, ki si ga morate zastaviti, preden zgrabite paniko, je: Ali gre za resnično onesnaženje ali je to posnetek senzorja? V tej enoti se boste naučili uporabljati jezikovni model (LLM) kot "pomočnika pri prvem branju" za pregledovanje podatkov časovnih vrst, označevanje nepravilnosti in ustvarjanje povzetkov trendov; Razpravljava pa o tem, zakaj končne odločitve nikoli ne bo prepustil njej.

Anatomija podatkov stalnega spremljanja

Podatki o spremljanju okolja so časovne vrste, zbrane v rednih časovnih intervalih. Vsaka merilna točka nosi časovni žig, vrednost in idealno oznako kakovosti. Če želite razumeti neobdelane podatke, morate razlikovati med tremi koncepti:

  • Trend: Dolgoročni trend (npr. sezonsko povečanje prevodnosti).
  • Sezonskost/cikel: vzorci, ki se ponavljajo čez dan ali leto (npr. zvišanje DO zaradi dnevne fotosinteze).
  • Anomalija: posamezne ali kratkoročne vrednosti, ki statistično odstopajo od pričakovanega vzorca.

Parameter

Tipično območje spremljanja

Omejitev vzorca (izpust)

Pogosta težava s senzorjem

pH

1-5 min

6-9 (brez enot)

Premik referenčne elektrode

Raztopljeni kisik (DO)

5-15 min

≥ 5 mg/l (sprejemni medij)

Obraščanje membrane (biološko obraščanje)

prevodnost

5-15 min

Odvisno od razreda, µS/cm

Kalibracijski zamik

COD (kontinuirani analizator)

15-60 min

250 mg/L

Izčrpanost reagenta, zamašitev

PM10 (zrak)

1 uro

50 µg/m³ (24 ur)

Učinek vlage/kondenzacije

Zakaj so zastavice QA/QC ključnega pomena?

QA/QC (zagotavljanje kakovosti/kontrola kakovosti) pomeni pritrditev oznake zaupanja vsaki meritvi. Tudi če je vrednost statistično videti kot "prekoračitev", je neveljavna, če je bila vzeta zunaj kalibracijskega okna ali če je senzor v vzdrževanju. Skupne kode zastave:

Pomen zastavice----- -----------------------------G Dobro — veljavno, sprejete meritveS Sumljivo — dvomljivo, potrebno je preverjanjeM Manjka — manjka/prazen zapisC Umerjanje — okno za umerjanje/vzdrževanje, podatki neveljavniE Ocenjeno — pripisana ocenjena vrednost

Namig: vedno odprite dnevnike umerjanja in vzdrževanja, preden začnete analizo preseganja. Če preskok COD ob 03:40 sovpada s samodejnim nočnim umerjanjem ali menjavo reagenta, je to podatek z oznako "C"; Ni tema za alarm, ampak za čiščenje podatkov.

Skeniranje anomalij in povzetek trendov z AI

LLM lahko uporabite za hiter pregled tabelaričnih podatkov, vzorcev zastavic, ki bi jih človeško oko lahko zgrešilo, in razvrščanje začetnih hipotez. Kritična točka: modelu dati neobdelane podatke, enote in omejitev skupaj ter zahtevati preverljiva opažanja iz tega.

ŠIBEK POZIV: "Ali obstaja težava s temi podatki o kakovosti vode?" MOČEN POZIV: »Spodaj je 15 minut podatkov spremljanja točke izpusta odpadne vode (stolpci: čas, KPK [mg/L], prevodnost [µS/cm], pH, zastavica QA). Omejitev KPK pri izpustu je 250 mg/L, območje pH 6–9. Vaša naloga: 1) Navedite časovne žige s preseženimi omejitvami. 2) Ocenite samo vrstice z zastavicami 'G' (dobro); ločite tiste z zastavicami C/M/S na ločenem seznamu 'preverjanje'. 3) Za vsako prekoračitev navedite, ali gre za posamezen skok (>= 3 zaporedne vrstice) Upoštevajte, ali se prevodnost in pH spreminjata hkrati (hkratna sprememba je dokaz v korist dejanskega dogodka). namesto tega potrditi z neobdelanimi podatki."

Zmogljiv poziv poveže model s konkretnim postopkom, razčleni zastavice in vključuje izrecno navodilo »če niste prepričani, ne povejte« za omejitev halucinacije (izmišljena interpretacija).

Pozor: LLM lahko povzroči napake pri numeričnih primerjavah pragov; Lahko napačno označi 248 mg/L kot "preseženo" ali 252 mg/L kot "znotraj meje". Znova preverite VSAKO preseganje, ki ga navaja model, vizualno iz neobdelane tabele ali s formulo (npr. vrednost > 250). Model skenira; Vi določite mejo.

Strategija manjkajočih podatkov (imputacija)

Senzorji se zamašijo, zmanjka elektrike, komunikacija se prekine. Kako boste izpolnili manjkajoče podatke, neposredno vpliva na vašo analizo trenda in preseganja. Lažna imputacija lahko "ustvari" prekoračitev, ki ne obstaja, ali skrije pravo prekoračitev.

uvozi pande kot pdimport numpy kot np# 15-minutna serija COD; -999 koda naprave "ni podatkov" "zastavica": ["G", "G", "M", "M", "G", "S", "G", "G"],})# 1) Pretvori kode naprav v dejansko manjkajočo vrednostf.loc[df["koi"] == -999, "koi"] = np.nan# 2) Linearna interpolacija za KRATKO vrzel (<= 2 koraka); flag imputationgap = df["koi"].isna()df["koi_full"] = df["koi"].interpolate(limit=2)df.loc[gap & df["koi_full"].notna(), "flag"] = "E" # Ocenjeno# 3) Skeniranje mejnih presežkov — Dodelitve za odločanje SAMO o izmerjenih (G) vrednostih = df[(df["koi_full"] > 250) & (df["flag"] == "G")]print(asyms[["ts", "koi_full", "flag"]])

Pri tem pristopu so kratke vrzeli zapolnjene, vendar so zapolnjene vrednosti označene z E in odločitev o prekoračitvi se sprejme samo na podlagi dejanske meritve (G). Ker je vrednost 1240 mg/L označena kot S (sumljivo), ni vključena v seznam avtomatskih preseganj; se najprej preveri.

Preverjanje z odmikom senzorja in kalibracijo

Zlati standard za ugotavljanje, ali je prekoračitev resnična ali zamik senzorja, je laboratorijski rezultat sočasnega zajemanja vzorca. Na primer, če je zvezni analizator ob 03:40 pokazal 1240 mg/L, laboratorijsko izmerjena vrednost takrat odvzetega vzorca pa je 205 mg/L, je težava v senzorju; ne odvajanje. To je triangulacija izhoda AI ali alarma SCADA s terenom in laboratorijem.

mini etui

Senzor motnosti v bazenu s pitno vodo je tri dni kazal postopno naraščajoč trend. Izmenska ekipa je dala tedenske podatke LLM; "Možno je resnično povečanje motnosti zaradi odtekanja po padavinah," je dejal model. Ko pa je inženir pogledal meteorološke zapise, je ugotovil, da tisti teden v regiji ni bilo dežja. Med pregledom na terenu je bilo ugotovljeno, da se je na optičnem oknu senzorja oblikovalo biološko obraščanje; Po čiščenju in kalibraciji so se vrednosti vrnile v normalno stanje. Interpretacijo LLM o "možnem dejanskem dogodku" so ovrgli zunanji podatki (zapis padavin) in terenska kontrola. Lekcija: Model lahko ustvari verodostojno, a lažno zgodbo; veriga preverjanja ga ujame.

Pogoste napake

  • Zamenjanje podatkov v oknu za umerjanje/vzdrževanje (zastavica C) za dejansko preseganje.
  • Tiho vnašanje manjkajočih podatkov in poročanje pripisanih vrednosti kot dejanskih meritev.
  • Zamenjajte posamezen odboj (ena vrstica, morda električni šum) za neprekinjen dogodek.
  • Slepo zaupanje primerjavam mejnih točk LLM (248 proti 250).
  • Sprejemanje odločitev na podlagi enega parametra brez navzkrižnega preverjanja sočasnih parametrov (pH + prevodnost + KPK).
  • Razglasitev alarma za "resničnega" brez izključitve premika senzorja z odvzetim vzorcem/laboratorijsko potrditvijo.
  • Ignoriranje lokalnega časa/UTC in premikov poletnega časa ter pripisovanje dogodkov napačnemu času.

Če povzamem

  • Podatki okoljskega monitoringa so časovne vrste; Ni ga mogoče razlagati brez razlikovanja med trendom, sezonskostjo in anomalijo.
  • Zastavice QA/QC so oznaka zaupanja podatkov; odločitve se sprejemajo le na podlagi veljavnih (G) podatkov.
  • LLM je pomočnik za hitro prvo branje za skeniranje nepravilnosti, seznam presežkov in povzetek trendov, ne pa oseba, ki sprejema odločitve.
  • Strategija manjkajočih podatkov (imputacija) mora biti pregledna; Izpolnjene vrednosti so označene in niso podlaga za odločitev o preseganju.
  • Zamik senzorja, biološko obraščanje in zamik kalibracije povzročijo "lažno prekoračitev"; razlikuje odvzeti vzorec in laboratorijsko potrditev.
  • Rezultat AI je hipoteza; Neobdelani podatki ne pridejo v uradno poročilo brez preverjanja z zapisom kalibracije in terensko kontrolo.

Aplikacijska naloga

Vzemite 24-urni in 15-minutni nabor podatkov o spremljanju, ki ga imate (ali sintetično ustvarjen) (vsaj en parameter: COD, pH ali PM10), in ustvarite postopek, ki dodaja oznake QA/QC in navaja presežene mejne vrednosti. Najprej napišite močan poziv in prosite LLM za skeniranje anomalij in preseganj; Nato neodvisno preverite iste prekoračitve s filtrom vrednost > omejitev v Pythonu. Naredite vsaj en primer imputiranja in označite izpolnjene vrednosti z E. Za vsako "prekoračitev" najdete "kako to preverim z zajemnim vzorcem/zapisom kalibracije?" Odgovorite na vprašanje z enim stavkom. Končno tabelarično razvrstite, koliko anomalij, ki jih je označil LLM, so resnični dogodki in koliko je težav s senzorji/podatki, z utemeljitvami.