단위 6 / 10

환경 데이터 및 모니터링 분석

이득:

  • 시계열, 임계값 교차 및 센서 품질 관리(QA/QC) 개념을 적용하는 능력
  • AI를 통해 이상 징후 스캔, 추세 요약 및 누락 데이터 전략을 생성하는 기능
  • AI가 지적한 초과 및 이상 징후를 원시 데이터 및 캘리브레이션으로 검증하는 기능

당신은 조직화된 산업 구역의 폐수 처리장에서 근무하는 교대 엔지니어입니다. 배출구에 위치한 연속 모니터링 스테이션은 15분마다 용존 산소(DO), pH, 전도도 및 화학적 산소 요구량(COD)을 기록합니다. 오전 3시 40분에 SCADA 화면의 COD 값이 1,240mg/L로 점프하고 시스템에서 경보를 울립니다. 배출 한도는 250mg/L입니다. 당황하기 전에 물어봐야 할 질문은 이것이 실제 오염 사고입니까, 아니면 센서 기록입니까?입니다. 이 단원에서는 시계열 데이터 스캔, 이상 징후 표시 및 추세 요약 생성을 위한 "첫 번째 읽기 보조자"로 언어 모델(LLM)을 사용하는 방법을 배웁니다. 하지만 우리는 왜 그가 최종 결정을 그녀에게 맡기지 않을 것인지 논의하고 있습니다.

지속적인 모니터링 데이터 분석

환경 모니터링 데이터는 일정한 시간 간격으로 수집된 시계열입니다. 각 측정 지점에는 타임스탬프, 값, 이상적으로는 품질 플래그가 포함됩니다. 원시 데이터를 이해하려면 다음 세 가지 개념을 구별해야 합니다.

  • 추세: 장기 추세(예: 전도도의 계절적 증가).
  • 계절성/주기: 하루 또는 일년 동안 반복되는 패턴(예: 주간 광합성에 의한 DO 상승).
  • 이상(Anomaly): 예상 패턴에서 통계적으로 벗어나는 특이값 또는 단기 값입니다.

매개변수

일반적인 모니터링 범위

샘플 한도(방전)

일반적인 센서 문제

pH

1~5분

6-9(단위 없음)

기준 전극 이동

용존산소(DO)

5~15분

≥ 5mg/L(수용 배지)

막 오염(생물 오염)

전도성

5~15분

클래스에 따라 다름, µS/cm

교정 드리프트

COD(연속 분석기)

15~60분

250mg/L

시약 고갈, 막힘

PM10(공기)

1시간

50μg/m³(24시간)

습도/결로 효과

QA/QC 플래그가 중요한 이유는 무엇입니까?

QA/QC(품질 보증/품질 관리)는 모든 측정에 신뢰 라벨을 부착하는 것입니다. 값이 통계적으로 "오버슈트"로 나타나는 경우에도 교정 기간을 벗어나거나 센서가 유지 관리 중인 경우에는 유효하지 않습니다. 일반적인 플래그 코드:

플래그 의미------ ----------------G 양호 — 유효, 허용된 측정 S 의심 — 의심, 확인 필요M 누락 — 누락/빈 기록C 보정 — 보정/유지보수 기간, 데이터 유효하지 않음E 추정 — 대치된 추정 값

팁: 초과 분석을 시작하기 전에 항상 교정 및 유지 관리 로그를 엽니다. 03:40의 COD 점프가 자동 야간 보정 또는 시약 변경과 일치하는 경우 이는 "C" 플래그 데이터입니다. 알람 대상이 아니고 데이터 정리용입니다.

AI를 통한 이상 징후 스캔 및 추세 요약

LLM을 사용하면 표 형식 데이터를 빠르게 검토하고, 사람의 눈으로 놓칠 수 있는 패턴을 표시하고, 초기 가설을 분류할 수 있습니다. 중요한 점은 모델에 원시 데이터, 단위 및 한계를 함께 제공하고 모델에서 검증 가능한 관찰을 요청하는 것입니다.

약한 프롬프트: "이 수질 데이터에 문제가 있습니까?" 강력한 프롬프트: "아래는 폐수 배출 지점의 15분 모니터링 데이터입니다(열: 시간, COD [mg/L], 전도도 [μS/cm], pH, QA 플래그). 배출 COD 한계는 250mg/L, pH 범위 6-9입니다. 작업: 1) 한계 초과가 있는 타임스탬프를 나열합니다. 2) 'G'(양호) 플래그가 있는 라인만 평가하고 C/M/S 플래그가 있는 라인을 별도의 '검증 필요' 목록. 3) 각 오버슈트에 대해 단일 점프(단일 라인) 또는 연속 상승(>= 3개 연속 라인)인지 표시합니다. 4) 전도도와 pH가 동시에 변경되는지 확인합니다(동시 변경은 실제 이벤트에 유리한 증거입니다). 확실하지 않거나 데이터로 확인할 수 없는 설명을 추가하지 마십시오.

강력한 프롬프트는 모델을 구체적인 절차에 바인딩하고 플래그를 구문 분석하며 환각을 제한하기 위한 명시적인 "확실하지 않은 경우 말하지 마세요" 지침을 포함합니다(만들어진 해석).

주의: LLM은 수치 임계값 비교에서 오류를 일으킬 수 있습니다. 248mg/L을 "초과"로 잘못 표시하거나 252mg/L를 "한계 내"로 잘못 표시할 수 있습니다. 원시 테이블에서 시각적으로 또는 공식(예: 값 > 250)을 사용하여 모델 목록의 모든 초과 항목을 다시 확인합니다. 모델이 스캔됩니다. 한도는 당신이 결정합니다.

누락된 데이터 전략(대치)

센서가 막히고 전원이 꺼지며 통신이 중단됩니다. 누락된 데이터를 채우는 방법은 추세 및 초과 분석에 직접적인 영향을 미칩니다. 잘못된 대체는 존재하지 않는 초과를 "생성"하거나 실제 초과를 숨길 수 있습니다.

팬더를 pdimport numpy로 np#으로 가져오기 15분 COD 시리즈; -999 장치 코드 "no data" "flag": ["G", "G", "M", "M", "G", "S", "G", "G"],})# 1) 장치 코드를 실제 누락된 값으로 변환합니다.df.loc[df["koi"] == -999, "koi"] = np.nan# 2) SHORT 간격(<= 2 단계)에 대한 선형 보간; flag imputationgap = df["koi"].isna()df["koi_full"] = df["koi"].interpolate(limit=2)df.loc[gap & df["koi_full"].notna(), "flag"] = "E" # 추정된# 3) 한계 초과 스캐닝 - 측정된(G) 값에 대한 결정만을 위한 할당 = df[(df["koi_full"] > 250) & (df["flag"] == "G")]print(asyms[["ts", "koi_full", "flag"]])

이 접근 방식에서는 짧은 간격이 채워지지만 채워진 값은 E로 표시되고 오버슈트 결정은 실제 측정(G)에서만 이루어집니다. 1240mg/L 값은 S(의심)로 표시되므로 자동 초과 목록에 포함되지 않습니다. 먼저 확인됩니다.

센서 드리프트 및 교정을 통한 검증

오버슈트가 실제인지 아니면 센서 드리프트인지 결정하기 위한 최적의 표준은 동시 샘플 채취의 실험실 결과입니다. 예를 들어 연속 분석기가 03시 40분에 1240mg/L로 나타났고, 당시 채취한 샘플의 실험실 측정값이 205mg/L라면 문제는 센서에 있는 것입니다. 방전이 아닙니다. 이는 AI 출력이나 SCADA 경보를 현장 및 연구실과 삼각 측량하는 것입니다.

미니 케이스

식수통의 탁도 센서는 3일 동안 점차 증가하는 경향을 보였습니다. 교대팀은 LLM에 주간 데이터를 제공했습니다. “강우 후 유출수로 인해 탁도가 실제로 증가할 수 있습니다.”라고 모델은 말했습니다. 그러나 엔지니어가 기상 기록을 살펴보니 그 주에는 해당 지역에 비가 내리지 않았습니다. 현장 조사 과정에서 센서 광학창에 생물 부착물이 형성된 것으로 파악되었습니다. 청소 및 교정 후 값이 정상으로 돌아왔습니다. "가능한 실제 사건"에 대한 LLM의 해석은 외부 데이터(강우 기록)와 현장 통제에 의해 반박되었습니다. 교훈: 모델은 그럴듯하지만 잘못된 이야기를 만들어낼 수 있습니다. 검증 체인이 이를 포착합니다.

일반적인 실수

  • 교정/유지보수 창(플래그 C)의 데이터를 실제 초과로 착각합니다.
  • 누락된 데이터를 자동으로 채우고 귀속된 값을 실제 측정값으로 보고합니다.
  • 단일 바운스(단일 회선, 전기적 노이즈일 수 있음)를 연속 이벤트로 착각합니다.
  • LLM의 중단점 비교(248 대 250)를 맹목적으로 신뢰합니다.
  • 동시 매개변수(pH + 전도도 + COD)를 교차 확인하지 않고 단일 매개변수를 기반으로 결정을 내립니다.
  • 샘플 수집/실험실 확인을 통해 센서 표류를 배제하지 않고 경보를 "실제"로 선언합니다.
  • 현지 시간/UTC 및 서머 타임 시프트를 무시하고 이벤트를 잘못된 시간으로 간주합니다.

요약하면

  • 환경 모니터링 데이터는 시계열입니다. 추세, 계절성, 이상현상을 구분하지 않고는 해석할 수 없습니다.
  • QA/QC 플래그는 데이터의 신뢰 태그입니다. 의사결정은 유효한(G) 데이터에서만 이루어집니다.
  • LLM은 의사 결정자가 아닌 이상 징후 검색, 초과 목록 및 추세 요약을 위한 빠른 첫 번째 읽기 도우미입니다.
  • 누락된 데이터 전략(대체)은 투명해야 합니다. 채워진 값은 표시되며 초과 결정의 기초로 간주되지 않습니다.
  • 센서 드리프트, 생물 부착 및 보정 드리프트는 "가짜 오버슈트"를 ​​생성합니다. 샘플 채취와 실험실 확인을 구별합니다.
  • AI 출력은 가설입니다. 원시 데이터는 교정 기록 및 현장 관리를 통한 확인 없이는 공식 보고서에 입력되지 않습니다.

응용과제

보유한(또는 종합적으로 생성한) 24시간 15분 모니터링 데이터 세트(최소 하나의 매개변수: COD, pH 또는 PM10)를 가져와서 QA/QC 플래그를 추가하고 한계 초과 목록을 나열하는 실행을 생성하십시오. 먼저, 강력한 프롬프트를 작성하고 LLM에 이상 및 초과 검색을 요청하세요. 그런 다음 Python에서 값 > 제한 필터를 사용하여 동일한 초과를 독립적으로 확인합니다. 하나 이상의 전가 예를 만들고 채워진 값을 E로 표시합니다. 각 "오버슈트"에 대해 "샘플/보정 기록을 사용하여 이를 어떻게 확인합니까?"를 찾습니다. 질문에 한 문장으로 답해보세요. 궁극적으로 LLM이 표시한 이상 현상 중 실제 이벤트 수와 센서/데이터 문제 수는 몇 개인지 정당한 근거와 함께 표로 작성합니다.