Jednostka 6 / 10

Analiza danych środowiskowych i monitoringu

Zyski:

  • Umiejętność stosowania koncepcji szeregów czasowych, przekraczania progów i kontroli jakości czujników (QA/QC).
  • Możliwość tworzenia skanowania anomalii, podsumowania trendów i strategii brakujących danych za pomocą sztucznej inteligencji
  • Ability to verify exceedances and anomalies pointed out by AI with raw data and calibration

Jesteś inżynierem zmianowym w oczyszczalni ścieków zorganizowanej strefy przemysłowej. Stacja ciągłego monitorowania zlokalizowana na wylocie rejestruje zawartość rozpuszczonego tlenu (DO), pH, przewodność i chemiczne zapotrzebowanie tlenu (ChZT) co 15 minut. O 03:40 rano wartość ChZT na ekranie SCADA wzrasta do 1240 mg/l, a system ogłasza alarm. Limit rozładowania 250 mg/L. Pytanie, które musisz zadać, zanim wpadniesz w panikę, brzmi: czy jest to rzeczywisty przypadek zanieczyszczenia, czy też zapis z czujnika? W tej części dowiesz się, jak używać modelu językowego (LLM) jako „asystenta pierwszego czytania” do skanowania danych szeregów czasowych, zaznaczania anomalii i generowania podsumowań trendów; Ale rozmawiamy o tym, dlaczego nigdy nie pozostawi jej ostatecznej decyzji.

Anatomia danych z ciągłego monitorowania

Dane z monitoringu środowiska to szeregi czasowe zbierane w regularnych odstępach czasu. Każdy punkt pomiarowy posiada znacznik czasu, wartość i, w idealnym przypadku, flagę jakości. Aby nadać sens surowym danym, należy rozróżnić trzy pojęcia:

  • Trend: Trend długoterminowy (np. sezonowy wzrost przewodności).
  • Sezonowość/cykl: wzorce powtarzające się w ciągu dnia lub roku (np. podwyższenie poziomu DO w wyniku fotosyntezy w ciągu dnia).
  • Anomalia: Pojedyncze lub krótkotrwałe wartości, które statystycznie odbiegają od oczekiwanego wzorca.

Parametr

Typowy zakres monitorowania

Limit próbki (rozładowanie)

Typowy problem z czujnikiem

pH

1-5 minut

6-9 (bez jednostki)

Przesunięcie elektrody odniesienia

Rozpuszczony tlen (DO)

5-15 minut

≥ 5 mg/L (ośrodek odbiorczy)

Zanieczyszczenie membrany (biofouling)

przewodność

5-15 minut

Zależne od klasy, µS/cm

Dryft kalibracyjny

ChZT (analizator ciągły)

15-60 minut

250 mg/l

Wyczerpanie odczynnika, zatkanie

PM10 (powietrze)

1 godzina

50 µg/m3 (24 godziny)

Efekt wilgoci/kondensacji

Dlaczego flagi QA/QC są istotne?

QA/QC (zapewnienie jakości / kontrola jakości) polega na dołączeniu etykiety zaufania do każdego pomiaru. Nawet jeśli wartość statystycznie wydaje się być „przekroczona”, jest nieważna, jeśli została pobrana poza oknem kalibracji lub jeśli czujnik jest w trakcie konserwacji. Typowe kody flag:

Flaga Znaczenie------ -----------------------------G Dobry — ważny, zaakceptowany pomiarS Podejrzany — wątpliwy, wymagana weryfikacjaM Brakujący — brak/pusty zapisC Kalibracja — okno kalibracji/konserwacji, dane nieprawidłoweE Oszacowany — przypisana wartość szacunkowa

Wskazówka: Zawsze otwieraj dzienniki kalibracji i konserwacji przed rozpoczęciem analizy przekroczeń. Jeśli skok ChZT o godzinie 03:40 zbiega się z automatyczną kalibracją nocną lub wymianą odczynnika, jest to dane flagi „C”; Nie jest to powód do alarmu, ale do czyszczenia danych.

Skanowanie anomalii i podsumowanie trendów za pomocą sztucznej inteligencji

Możesz użyć LLM, aby szybko przeglądać dane tabelaryczne, sygnalizować wzorce, które ludzkie oko może przeoczyć, i porządkować wstępne hipotezy. Punkt krytyczny: przekazanie modelowi łącznie surowych danych, jednostek i limitów oraz poproszenie o weryfikowalne obserwacje z nich.

SŁABY PODPOWIEDŹ: „Czy występuje problem z danymi dotyczącymi jakości wody?” WAŻNA WSKAZÓWKA: „Poniżej znajduje się 15 minut danych monitorowania punktu zrzutu ścieków (kolumny: czas, ChZT [mg/L], przewodność [µS/cm], pH, flaga QA). Limit ChZT na zrzucie wynosi 250 mg/L, zakres pH 6-9. Twoje zadanie: 1) Wypisz znaczniki czasu z przekroczeniami limitów. 2) Oceniaj tylko linie ze flagami „G” (dobre); oddziel je za pomocą Flagi C/M/S na osobnej liście „wymagana weryfikacja”. 3) Wskaż dla każdego przekroczenia, czy jest to pojedynczy skok (pojedyncza linia), czy ciągły wzrost (>= 3 kolejne linie). 4) Zanotuj, czy przewodność i pH zmieniają się jednocześnie (jednoczesna zmiana jest dowodem na rzeczywiste zdarzenie. Nie dodawaj żadnych komentarzy, których nie jesteś pewien lub których nie można zweryfikować danymi).

Potężny monit wiąże model z konkretną procedurą, analizuje flagi i zawiera wyraźną instrukcję „jeśli nie jesteś pewien, nie mów”, aby ograniczyć halucynacje (wymyślona interpretacja).

Uwaga: LLM może popełniać błędy w numerycznych porównaniach progowych; Może błędnie oznaczyć 248 mg/L jako „przekracza” lub 252 mg/L jako „w granicach”. Zweryfikuj ponownie KAŻDE przekroczenie na liście modelu, albo wizualnie na podstawie surowej tabeli, albo za pomocą wzoru (np. wartość > 250). Model skanuje; Ty decydujesz o limicie.

Strategia dotycząca brakujących danych (imputacja)

Czujniki zostają zatkane, następuje przerwa w dostawie prądu, przerwa w komunikacji. Sposób uzupełniania brakujących danych ma bezpośredni wpływ na analizę trendów i przekroczeń. Fałszywe przypisanie może „stworzyć” przekroczenie, które nie istnieje, lub ukryć rzeczywiste przekroczenie.

importuj pandy jako pdimport numpy jako np# 15-minutowa seria COD; -999 kod urządzenia "brak danych" "flaga": ["G", "G", "M", "M", "G", "S", "G", "G"],})# 1) Konwertuj kody urządzeń na rzeczywiste brakujące wartościf.loc[df["koi"] == -999, "koi"] = np.nan# 2) Interpolacja liniowa dla KRÓTKIEJ przerwy (<= 2 kroki); flag imputationgap = df["koi"].isna()df["koi_full"] = df["koi"].interpolate(limit=2)df.loc[gap & df["koi_full"].notna(), "flag"] = "E" # Estimated# 3) Skanowanie przekroczeń limitów — Przypisania TYLKO do decyzji na temat zmierzonych wartości (G) = df[(df["koi_full"] > 250) & (df["flaga"] == "G")]print(asyms[["ts", "koi_full", "flaga"]])

W tym podejściu krótkie przerwy są wypełniane, ale wypełnione wartości są oznaczone literą E, a decyzja o przekroczeniu jest podejmowana tylko na podstawie rzeczywistego pomiaru (G). Ponieważ wartość 1240 mg/L jest oznaczona jako S (podejrzana), nie jest ona uwzględniana na liście automatycznych przekroczeń; jest najpierw weryfikowana.

Weryfikacja poprzez dryft czujnika i kalibrację

Złotym standardem w określaniu, czy przekroczenie jest rzeczywiste, czy też dryf czujnika, jest wynik laboratoryjny jednoczesnego pobrania próbki. Na przykład, jeśli analizator ciągły pokazał 1240 mg/L o godzinie 03:40, a zmierzona laboratoryjnie wartość próbki pobranej w tym czasie wynosi 205 mg/L, problem leży w czujniku; nie wyładowanie. Jest to triangulacja wyjścia AI lub alarmu SCADA z terenem i laboratorium.

mini etui

Czujnik zmętnienia w zbiorniku wody pitnej wykazywał stopniowo tendencję rosnącą przez trzy dni. Zespół zmianowy przekazywał LLM cotygodniowe dane; „Możliwy jest rzeczywisty wzrost zmętnienia w wyniku odpływu po opadach deszczu” – stwierdził model. Kiedy jednak inżynier przejrzał zapisy meteorologiczne, zauważył, że w tym tygodniu w regionie nie padało deszcz. Podczas oględzin terenowych stwierdzono, że na okienku optycznym czujnika utworzyły się osady biologiczne; Po czyszczeniu i kalibracji wartości wróciły do ​​normy. Interpretacja LLM dotycząca „możliwego rzeczywistego zdarzenia” została obalona przez dane zewnętrzne (zapis opadów) i badania terenowe. Lekcja: Model może stworzyć wiarygodną, ​​ale fałszywą historię; Łańcuch weryfikacji to wychwytuje.

Typowe błędy

  • Błędne dane w oknie kalibracji/konserwacji (flaga C) z rzeczywistym przekroczeniem.
  • Ciche uzupełnianie brakujących danych i raportowanie przypisanych wartości jako rzeczywistych pomiarów.
  • Mylenie pojedynczego odbicia (pojedyncza linia, prawdopodobnie szum elektryczny) ze zdarzeniem ciągłym.
  • Ślepe zaufanie porównaniom punktów przerwania LLM (248 vs 250).
  • Podejmowanie decyzji w oparciu o pojedynczy parametr bez sprawdzania krzyżowego równoczesnych parametrów (pH + przewodność + ChZT).
  • Deklarowanie alarmu jako „prawdziwego” bez wykluczenia dryfu czujnika z pobraniem próbki/potwierdzeniem laboratoryjnym.
  • Ignorowanie przesunięć czasu lokalnego/UTC i czasu letniego oraz przypisywanie zdarzeń niewłaściwemu czasowi.

Podsumowując

  • Dane z monitorowania środowiska to szeregi czasowe; Nie można go interpretować bez rozróżnienia trendu, sezonowości i anomalii.
  • Flagi QA/QC są znacznikiem zaufania danych; decyzje podejmowane są wyłącznie na podstawie aktualnych (G) danych.
  • LLM to szybki asystent pierwszego odczytu służący do skanowania anomalii, sporządzania list przekroczeń i podsumowywania trendów, a nie narzędzie do podejmowania decyzji.
  • Strategia dotycząca brakujących danych (imputacja) powinna być przejrzysta; Wypełnione wartości są zaznaczane i nie stanowią podstawy do decyzji o przekroczeniu.
  • Dryft czujnika, biozanieczyszczenia i dryft kalibracyjny powodują „fałszywe przeregulowanie”; rozróżnia pobranie próbki i potwierdzenie laboratoryjne.
  • Wyniki AI to hipoteza; Surowe dane nie trafiają do oficjalnego raportu bez weryfikacji poprzez zapis kalibracji i kontrolę w terenie.

Zadanie aplikacji

Weź 24-godzinny i 15-minutowy zestaw danych monitorowania, który posiadasz (lub wygenerowałeś syntetycznie) (co najmniej jeden parametr: ChZT, pH lub PM10) i utwórz przebieg, który dodaje flagi QA/QC i wyświetla listę przekroczeń limitów. Najpierw napisz mocny monit i poproś LLM o skanowanie anomalii i przekroczeń; Następnie niezależnie zweryfikuj te same przekroczenia za pomocą filtra wartość > limit w Pythonie. Zrób przynajmniej jeden przykład imputacji i zaznacz wypełnione wartości literą E. Dla każdego „przekroczenia” znajdziesz „Jak to zweryfikować za pomocą pobranej próbki/zapisu kalibracji?” Odpowiedz na pytanie jednym zdaniem. Na koniec należy sporządzić tabelę, ile anomalii oznaczonych przez LLM to rzeczywiste zdarzenia, a ile to problemy z czujnikami/danymi, wraz z uzasadnieniem.