Ieguvumi:
- Spēja pielietot laika rindas, sliekšņa šķērsošanas un sensoru kvalitātes kontroles (QA/QC) koncepcijas
- Spēja izveidot anomāliju skenēšanu, tendenču kopsavilkumu un trūkstošo datu stratēģiju ar AI
- Spēja pārbaudīt AI norādītos pārsniegumus un anomālijas, izmantojot neapstrādātus datus un kalibrēšanu
Jūs esat maiņas inženieris organizētās industriālās zonas notekūdeņu attīrīšanas iekārtās. Nepārtraukta monitoringa stacija, kas atrodas pie izejas, reģistrē izšķīdušo skābekli (DO), pH, vadītspēju un ķīmisko skābekļa patēriņu (ĶSP) ik pēc 15 minūtēm. 03:40 no rīta COD vērtība SCADA ekrānā palielinās līdz 1240 mg/L un sistēma izsauc trauksmi. Izplūdes robeža 250 mg/L. Jautājums, kas jums jāuzdod pirms panikas, ir šāds: vai tas ir īsts piesārņojuma gadījums vai arī sensora ieraksts? Šajā nodaļā jūs uzzināsiet, kā izmantot valodas modeli (LLM) kā "pirmās lasīšanas palīgu" laikrindu datu skenēšanai, anomāliju atzīmēšanai un tendenču kopsavilkumu ģenerēšanai; Bet mēs apspriežam, kāpēc viņš nekad neatstās galīgo lēmumu viņas ziņā.
Nepārtrauktas uzraudzības datu anatomija
Vides monitoringa dati ir laika rindas, kas apkopotas ar regulāriem laika intervāliem. Katram mērījumu punktam ir laika zīmogs, vērtība un ideālā gadījumā kvalitātes karogs. Lai izprastu neapstrādātus datus, ir jānošķir trīs jēdzieni:
- Tendence: ilgtermiņa tendence (piemēram, sezonāls vadītspējas pieaugums).
- Sezonalitāte/cikls: modeļi, kas atkārtojas dienas vai gada laikā (piemēram, DO paaugstināšanās dienas fotosintēzes rezultātā).
- Anomālija: atsevišķas vai īstermiņa vērtības, kas statistiski atšķiras no paredzamā modeļa.
Parametrs
Tipisks uzraudzības diapazons
Parauga ierobežojums (izlāde)
Bieža sensora problēma
pH
1-5 min
6-9 (bez vienības)
Atsauces elektrodu nobīde
Izšķīdušais skābeklis (DO)
5-15 min
≥ 5 mg/l (uztverošā vide)
Membrānas piesārņojums (biopiesārņojums)
vadītspēja
5-15 min
Atkarīgs no klases, µS/cm
Kalibrēšanas novirze
COD (nepārtrauktais analizators)
15-60 min
250 mg/l
Reaģenta izsīkums, aizsērēšana
PM10 (gaiss)
1 stunda
50 µg/m³ (24 stundas)
Mitruma/kondensāta efekts
Kāpēc QA/QC karodziņi ir ļoti svarīgi?
QA/QC (kvalitātes nodrošināšana/kvalitātes kontrole) ir uzticamības etiķetes pievienošana katram mērījumam. Pat ja statistiski šķiet, ka vērtība ir "pārsniegums", tā nav derīga, ja tā tika ņemta ārpus kalibrēšanas loga vai ja sensoram tiek veikta apkope. Parastie karoga kodi:
Karoga nozīme----- ------------------------------G Labs — derīgs, pieņemts mērījumsS Aizdomīgs — apšaubāms, nepieciešama pārbaudeM Trūkst — trūkst / tukšs ierakstsC Kalibrēšana — kalibrēšanas/apkopes logs, dati nederīgiE Aptuvenā — aprēķinātā aptuvenā vērtība
Padoms: vienmēr atveriet kalibrēšanas un apkopes žurnālus, pirms sākat pārsnieguma analīzi. Ja COD lēciens 03:40 sakrīt ar automātisku nakts kalibrēšanu vai reaģenta maiņu, tie ir "C" karoga dati; Tas nav paredzēts trauksmei, bet gan datu tīrīšanai.
Anomāliju skenēšana un tendenču kopsavilkums ar AI
Varat izmantot LLM, lai ātri pārskatītu tabulas datus, atzīmētu modeļus, ko cilvēka acs var nepamanīt, un sakārtotu sākotnējās hipotēzes. Kritiskais punkts: dodot modelim neapstrādātus datus, vienības un limitu kopā un pieprasot no tā pārbaudāmus novērojumus.
VĀJS PROMPT: "Vai ir problēma ar šiem ūdens kvalitātes datiem?" STIPRI UZDEVĒJUMS: "Zemāk ir 15 minūšu notekūdeņu novadīšanas punkta monitoringa dati (kolonnas: laiks, ĶSP [mg/L], vadītspēja [µS/cm], pH, QA karodziņš). Izplūdes ĶSP ierobežojums ir 250 mg/L, pH diapazons 6-9. Jūsu uzdevums: 1) Saraksta laikspiedolus ar atsevišķiem karodziņus, kuros ir tikai EGvaluate2 līnijas. ar C/M/S karodziņiem atsevišķā sarakstā “Nepieciešama pārbaude”. tā vietā jāapstiprina ar neapstrādātiem datiem”.
Spēcīgā uzvedne piesaista modeli konkrētai procedūrai, parsē karogus un ietver skaidru norādījumu "ja neesat pārliecināts, nesakiet", lai ierobežotu halucinācijas (izdomāta interpretācija).
Uzmanību: LLM var pieļaut kļūdas skaitlisko sliekšņu salīdzināšanā; Var kļūdaini marķēt 248 mg/L kā “pārsniegt” vai 252 mg/l kā “ierobežojumā”. Atkārtoti pārbaudiet KATRU modeļu sarakstu pārsniegumu vai nu vizuāli no neapstrādātas tabulas, vai ar formulu (piemēram, vērtība > 250). Modelis skenē; Jūs izlemjat ierobežojumu.
Trūkst datu stratēģijas (imputācija)
Sensori aizsērējas, pazūd strāva, pārtrūkst sakari. Tas, kā jūs aizpildāt trūkstošos datus, tieši ietekmē jūsu tendenču un pārsniegumu analīzi. Viltus piedēvēšana var "radīt" pārtēriņu, kas neeksistē, vai slēpt īstu pārtēriņu.
importēt pandas kā pdimport numpy kā np# 15 minūšu COD sērija; -999 ierīces kods "nav datu" "karogs": ["G", "G", "M", "M", "G", "S", "G", "G"],})# 1) Konvertējiet ierīces kodus uz faktiski trūkstošiem valuedf.loc[df["koi"] == -999, "koi"] = np.nan# 2) Lineāras interpolācijas soļi (SHORT=2); karodziņš imputationgap = df["koi"].isna()df["koi_full"] = df["koi"].interpolate(limit=2)df.loc[gap & df["koi_full"].notna(), "flag"] = "E" # Paredzamās zīmes # skenēšanas vērtības (3) Robežvērtības pārsniegumiem G lēmums TIKAI = df[(df["koi_full"] > 250) & (df["karogs"] == "G")]print(asyms[["ts", "koi_full", "flag"]])
Šajā pieejā tiek aizpildītas īsas atstarpes, bet aizpildītās vērtības tiek apzīmētas ar E, un lēmums par pārsniegumu tiek pieņemts tikai no faktiskā mērījuma (G). Tā kā vērtība 1240 mg/L ir atzīmēta kā S (aizdomīga), tā nav iekļauta automātisko pārsniegumu sarakstā; vispirms tiek pārbaudīts.
Pārbaude ar sensora novirzi un kalibrēšanu
Zelta standarts, lai noteiktu, vai pārsniegums ir reāls vai sensora novirze, ir vienlaicīgas parauga laboratorijas rezultāts. Piemēram, ja nepārtrauktais analizators pulksten 03:40 uzrādīja 1240 mg/L un tajā laikā ņemtā parauga laboratoriski izmērītā vērtība ir 205 mg/L, problēma ir sensorā; neizlādējas. Šī ir AI izvades vai SCADA trauksmes triangulācija ar lauku un laboratoriju.
mini futrālis
Duļķainības sensors dzeramā ūdens baseinā trīs dienas uzrādīja pakāpenisku pieauguma tendenci. Maiņu komanda sniedza iknedēļas datus LLM; "Iespējams reāls duļķainības pieaugums pēc nokrišņu noteces dēļ," sacīja modelis. Taču, kad inženieris aplūkoja meteoroloģiskos ierakstus, viņš redzēja, ka šajā reģionā lietus nav bijis. Lauka apskates laikā tika saprasts, ka uz sensora optiskā loga izveidojies biopiesārņojums; Pēc tīrīšanas un kalibrēšanas vērtības atgriezās normālā stāvoklī. LLM interpretāciju par "iespējamo faktisko notikumu" atspēkoja ārējie dati (nokrišņu rekords) un lauka kontrole. Nodarbība: modelis var radīt ticamu, bet nepatiesu stāstu; verifikācijas ķēde to uztver.
Biežas kļūdas
- Datu kļūda kalibrēšanas/apkopes logā (karogs C) attiecībā uz reālu pārsniegumu.
- Klusi aizpildiet trūkstošos datus un ziņojiet par aprēķinātajām vērtībām kā reālus mērījumus.
- Atsevišķa atlēciena (viena līnija, iespējams, elektrisks troksnis) jaukšana ar nepārtrauktu notikumu.
- Akli uzticoties LLM pārtraukuma punktu salīdzinājumiem (248 pret 250).
- Lēmumu pieņemšana, pamatojoties uz vienu parametru, nepārbaudot vienlaicīgus parametrus (pH + vadītspēja + ĶSP).
- Trauksmes pasludināšana par "īstu", neizslēdzot sensora novirzi ar greifera parauga/laboratorijas apstiprinājumu.
- Vietējā laika/UTC un vasaras laika maiņas ignorēšana un notikumu attiecināšana uz nepareizu laiku.
Rezumējot
- Vides monitoringa dati ir laikrindas; To nevar interpretēt, nenošķirot tendenci, sezonalitāti un anomāliju.
- QA/QC karodziņi ir datu uzticamības tags; lēmumus pieņem tikai no derīgiem (G) datiem.
- LLM ir ātrs pirmās lasīšanas palīgs anomāliju skenēšanai, pārsniegumu uzskaitei un tendenču kopsavilkumam, nevis lēmumu pieņēmējs.
- Trūkstošo datu stratēģijai (imputācijai) jābūt pārredzamai; Aizpildītās vērtības ir atzīmētas un netiek ņemtas par pamatu lēmumam par pārsniegšanu.
- Sensora novirze, biopiesārņojums un kalibrēšanas novirze rada “neīstu pārtēriņu”; atšķir greifera paraugu un laboratorijas apstiprinājumu.
- AI izvade ir hipotēze; Neapstrādāti dati netiek ievadīti oficiālajā pārskatā bez pārbaudes ar kalibrēšanas ierakstu un lauka kontroli.
Lietojumprogrammas uzdevums
Izmantojiet 24 stundu un 15 minūšu pārraudzības datu kopu (vai ģenerējiet to sintētiski) (vismaz viens parametrs: ĶSP, pH vai PM10) un izveidojiet izpildi, kas pievieno QA/QC karogus un uzskaita ierobežojumu pārsniegumus. Vispirms uzrakstiet spēcīgu uzvedni un lūdziet LLM veikt anomāliju un pārsniegumu skenēšanu; Pēc tam neatkarīgi pārbaudiet tos pašus pārsniegumus, izmantojot Python vērtību > limita filtru. Izveidojiet vismaz vienu imputācijas piemēru un atzīmējiet aizpildītās vērtības ar E. Katram "pārsniegumam" tiek atrasts "kā to pārbaudīt, izmantojot paņemšanas paraugu/kalibrēšanas ierakstu?" Atbildiet uz jautājumu vienā teikumā. Visbeidzot, tabulējiet, cik daudzas no LLM atzīmētajām anomālijām ir reāli notikumi un cik daudzas ir sensoru/datu problēmas, norādot pamatojumu.