Unité 6 / 10

Analyse des données environnementales et de la surveillance

Gains :

  • Capacité à appliquer les concepts de séries chronologiques, de franchissement de seuil et de contrôle qualité des capteurs (AQ/CQ)
  • Possibilité de créer une analyse des anomalies, un résumé des tendances et une stratégie de données manquantes avec l'IA
  • Capacité à vérifier les dépassements et les anomalies signalés par l'IA avec des données brutes et un étalonnage

Vous êtes ingénieur d'équipe dans la station d'épuration d'une zone industrielle organisée. Une station de surveillance continue située à la sortie enregistre l'oxygène dissous (OD), le pH, la conductivité et la demande chimique en oxygène (DCO) toutes les 15 minutes. A 03h40 du matin, la valeur DCO sur l'écran SCADA passe à 1 240 mg/L et le système déclenche une alarme. Limite de rejet 250 mg/L. La question que vous devez vous poser avant de paniquer est la suivante : s’agit-il d’un véritable incident de pollution ou s’agit-il d’un enregistrement d’un capteur ? Dans cette unité, vous apprendrez à utiliser un modèle de langage (LLM) comme « assistant de première lecture » pour analyser les données de séries chronologiques, marquer les anomalies et générer des résumés de tendances ; Mais nous discutons de la raison pour laquelle il ne lui laissera jamais la décision finale.

Anatomie des données de surveillance continue

Les données de surveillance environnementale sont une série chronologique collectée à intervalles de temps réguliers. Chaque point de mesure porte un horodatage, une valeur et idéalement un indicateur de qualité. Pour donner du sens aux données brutes, vous devez distinguer trois concepts :

  • Tendance : tendance à long terme (par exemple augmentation saisonnière de la conductivité).
  • Saisonnalité/cycle : modèles qui se répètent au cours de la journée ou de l'année (par exemple, élévation de l'OD par la photosynthèse diurne).
  • Anomalie : valeurs singulières ou à court terme qui s'écartent statistiquement du modèle attendu.

Paramètre

Plage de surveillance typique

Limite d'échantillonnage (décharge)

Problème de capteur courant

pH

1-5 minutes

6-9 (sans unité)

Décalage de l'électrode de référence

Oxygène dissous (OD)

5-15 minutes

≥ 5 mg/L (milieu récepteur)

Encrassement des membranes (biofouling)

conductivité

5-15 minutes

Dépend de la classe, µS/cm

Dérive d'étalonnage

DCO (analyseur continu)

15-60 minutes

250mg/L

Épuisement des réactifs, colmatage

PM10 (air)

1 heure

50 µg/m³ (24 heures)

Effet humidité/condensation

Pourquoi les indicateurs QA/QC sont-ils vitaux ?

L'AQ/CQ (assurance qualité / contrôle qualité) consiste à attacher une étiquette de confiance à chaque mesure. Même si une valeur apparaît statistiquement comme un « dépassement », elle n'est pas valide si elle a été prise en dehors de la fenêtre d'étalonnage ou si le capteur est en maintenance. Codes de drapeau courants :

Signification de l'indicateur ---------- -----------------------------G Bon — mesures valides et acceptéesS Suspect — douteux, vérification requiseM Manquant — enregistrement manquant/videC Étalonnage — fenêtre d'étalonnage/maintenance, données invalidesE Estimé — valeur estimée imputée

Astuce : ouvrez toujours les journaux d'étalonnage et de maintenance avant de lancer une analyse de dépassement. Si le saut de DCO à 03h40 coïncide avec un étalonnage automatique de nuit ou un changement de réactif, il s'agit d'une donnée d'indicateur « C » ; Ce n’est pas un sujet d’alarme, mais un sujet de nettoyage des données.

Analyse des anomalies et résumé des tendances avec l'IA

Vous pouvez utiliser LLM pour examiner rapidement des données tabulaires, signaler des modèles que l'œil humain pourrait manquer et trier les hypothèses initiales. Le point critique : donner au modèle les données brutes, les unités et la limite ensemble et en demander des observations vérifiables.

INVITE FAIBLE : « Y a-t-il un problème avec ces données sur la qualité de l’eau ? » INVITE FORTE : « Vous trouverez ci-dessous 15 minutes de données de surveillance d'un point de rejet d'eaux usées (colonnes : temps, DCO [mg/L], conductivité [µS/cm], pH, indicateur QA). La limite de DCO de rejet est de 250 mg/L, plage de pH 6-9. Votre tâche : 1) Répertorier les horodatages avec limite dépassée. 2) Évaluer uniquement les lignes avec des indicateurs « G » (bon) ; séparer celles avec C/M/S. 3) Indiquez pour chaque dépassement s'il s'agit d'un saut unique (une seule ligne) ou d'une augmentation continue (>= 3 lignes consécutives). 4) Notez si la conductivité et le pH changent simultanément (un changement simultané est une preuve en faveur de l'événement réel).

L'invite puissante lie le modèle à une procédure concrète, analyse les indicateurs et inclut une instruction explicite « si vous n'êtes pas sûr, ne le dites pas » pour limiter les hallucinations (interprétation inventée).

Attention : LLM peut commettre des erreurs dans les comparaisons de seuils numériques ; Peut étiqueter à tort 248 mg/L comme « dépasser » ou 252 mg/L comme « dans les limites ». Revérifiez CHAQUE dépassement répertorié par le modèle, soit visuellement à partir du tableau brut, soit avec une formule (par exemple, valeur > 250). Le modèle scanne ; Vous décidez de la limite.

Stratégie de données manquantes (imputation)

Les capteurs se bouchent, l’alimentation est coupée et la communication est interrompue. La manière dont vous remplissez les données manquantes affecte directement votre analyse des tendances et des dépassements. Une fausse imputation peut « créer » un dépassement qui n’existe pas ou cacher un dépassement réel.

importer des pandas en tant que pdimport numpy en tant que série COD de 15 minutes np# ; -999 code de périphérique "pas de données" "flag": ["G", "G", "M", "M", "G", "S", "G", "G"],})# 1) Convertir les codes de périphérique en valeurs manquantes réellesf.loc[df["koi"] == -999, "koi"] = np.nan# 2) Interpolation linéaire pour un espace COURT (<= 2 étapes); flag imputationgap = df["koi"].isna()df["koi_full"] = df["koi"].interpolate(limit=2)df.loc[gap & df["koi_full"].notna(), "flag"] = "E" # Estimation# 3) Analyse des dépassements de limite — Affectations pour la décision sur les valeurs mesurées (G) UNIQUEMENT = df[(df["koi_full"] > 250) & (df["flag"] == "G")]print(asyms[["ts", "koi_full", "flag"]])

Dans cette approche, de courts espaces sont comblés, mais les valeurs remplies sont marquées par E et la décision de dépassement est prise uniquement à partir de la mesure réelle (G). Puisque la valeur de 1 240 mg/L est signalée comme S (suspect), elle n'est pas incluse dans la liste de dépassement automatique ; est vérifié en premier.

Vérification par dérive du capteur et étalonnage

L’étalon-or pour déterminer si un dépassement est réel ou si une dérive du capteur est le résultat en laboratoire d’un échantillon instantané simultané. Par exemple, si l'analyseur continu indique 1 240 mg/L à 03h40 et que la valeur mesurée en laboratoire de l'échantillon prélevé à ce moment-là est de 205 mg/L, le problème vient du capteur ; pas de décharge. Il s'agit d'une triangulation de la sortie AI ou de l'alarme SCADA avec le terrain et le laboratoire.

mini-étui

Le capteur de turbidité d'un bassin d'eau potable affichait depuis trois jours une tendance à la hausse progressive. L'équipe de quart a fourni des données hebdomadaires à LLM ; "Une réelle augmentation de la turbidité due au ruissellement post-pluie est possible", indique le modèle. Cependant, lorsque l’ingénieur a examiné les relevés météorologiques, il a constaté qu’il n’y avait pas de pluie dans la région cette semaine-là. Lors de l'inspection sur le terrain, il a été constaté qu'un encrassement biologique s'était formé sur la fenêtre optique du capteur ; Après nettoyage et calibrage, les valeurs sont revenues à la normale. L'interprétation de LLM de « l'événement réel possible » a été réfutée par des données externes (enregistrement des précipitations) et par le contrôle sur le terrain. Leçon : Le modèle peut produire une histoire plausible mais fausse ; la chaîne de vérification l'attrape.

Erreurs courantes

  • Confondre les données de la fenêtre d'étalonnage/maintenance (drapeau C) avec un dépassement réel.
  • Remplissez silencieusement les données manquantes et rapportez les valeurs imputées comme des mesures réelles.
  • Confondre un rebond singulier (une seule ligne, éventuellement un bruit électrique) avec un événement continu.
  • Faire aveuglément confiance aux comparaisons de points d'arrêt de LLM (248 contre 250).
  • Prendre des décisions basées sur un seul paramètre sans recouper les paramètres simultanés (pH + conductivité + DCO).
  • Déclarer l'alarme « réelle » sans exclure la dérive du capteur avec un échantillon instantané/confirmation en laboratoire.
  • Ignorer les décalages d’heure locale/UTC et d’heure d’été et attribuer des événements à la mauvaise heure.

En résumé

  • Les données de surveillance environnementale sont une série chronologique ; Elle ne peut être interprétée sans distinguer tendance, saisonnalité et anomalie.
  • Les indicateurs QA/QC sont l’étiquette de confiance des données ; les décisions sont prises uniquement à partir de données (G) valides.
  • LLM est un assistant de première lecture rapide pour l'analyse des anomalies, la liste des dépassements et le résumé des tendances, et non un décideur.
  • La stratégie relative aux données manquantes (imputation) doit être transparente ; Les valeurs renseignées sont marquées et ne servent pas de base à la décision de dépassement.
  • La dérive du capteur, l'encrassement biologique et la dérive d'étalonnage produisent un « dépassement parasite » ; fait la distinction entre l’échantillon choisi et la confirmation en laboratoire.
  • La sortie de l’IA est une hypothèse ; Les données brutes n'entrent pas dans le rapport officiel sans vérification par enregistrement d'étalonnage et contrôle sur le terrain.

Tâche de candidature

Prenez un ensemble de données de surveillance de 24 heures et 15 minutes dont vous disposez (ou générez de manière synthétique) (au moins un paramètre : DCO, pH ou PM10) et créez une exécution qui ajoute des indicateurs AQ/CQ et répertorie les dépassements de limites. Tout d'abord, rédigez une invite forte et demandez à LLM une analyse des anomalies et des dépassements ; Vérifiez ensuite indépendamment les mêmes dépassements avec le filtre valeur > limite en Python. Faites au moins un exemple d'imputation et marquez les valeurs remplies avec E. Pour chaque « dépassement », vous trouvez « comment puis-je vérifier cela avec l'échantillon instantané/l'enregistrement d'étalonnage ? Répondez à la question en une phrase. En fin de compte, indiquez combien d'anomalies signalées par LLM sont des événements réels et combien sont des problèmes de capteurs/données, avec justifications.