단위 2 / 11

에너지 데이터, SCADA 및 스마트 미터: 시계열 준비

이득:

  • SCADA, 스마트 미터 및 시장 데이터의 구조, 단위 및 일반적인 품질 문제를 인식하는 능력
  • 인공 지능을 통해 누락된 데이터, 이상치 및 타임스탬프 문제를 감지하고 정리 작업 흐름을 구축하는 기능
  • AI 출력의 에너지 시계열에서 해상도, 시간대, 일광 절약 시간 등의 트랩을 확인하는 기능

거의 모든 에너지 분석은 시계열, 즉 시간 축을 따라 배열된 측정값으로 시작됩니다. 미터의 15분 소비, 터빈의 두 번째 회전 속도, 피더(배전선)의 시간당 전류는 모두 시계열입니다. 이번 단원에서는 에너지 데이터가 어디서 왔는지, 여기에는 어떤 함정이 포함되어 있는지, 인공지능을 사용하여 이 데이터를 신뢰할 수 있게 만드는 방법을 알아봅니다. 처음부터 이 원칙을 확립합시다. 더티 데이터를 사용한 가장 현명한 분석도 더티 결과를 낳습니다. 에너지 공학에서는 대부분의 시간을 모델이 아닌 데이터의 신뢰성을 높이는 데 사용하는데, 이 부분에서는 인공지능이 가장 안전한 기여를 합니다.

에너지 데이터의 출처와 구조

에너지 데이터는 주로 여러 소스에서 나옵니다. SCADA(감시 제어 및 데이터 수집 시스템)는 배전반 및 그리드 장비에서 즉각적인 측정값을 수집합니다. 이는 일반적으로 초 또는 분 분해능이며 전압, 전류, 전력 및 온도와 같은 양을 포함합니다. 스마트 미터 데이터는 일반적으로 15분 간격으로 소비량을 측정하며 청구 및 수요 분석의 기초가 됩니다. 기상 데이터(온도, 일사량, 풍속)는 생산 및 수요 예측의 입력입니다. 시장 데이터(시간당 가격)는 경제 분석의 입력입니다.

이러한 데이터의 일반적인 특징은 타임스탬프(각 측정값이 속한 날짜-시간 태그)와 하나 이상의 측정값을 포함한다는 것입니다. 이것이 가장 중요한 점입니다. 타임스탬프를 올바르게 이해하지 못하면 다른 모든 것이 무너집니다.

해상도, 시간대 및 일광 절약 시간 트랩

에너지 데이터의 오류 중 놀라울 정도로 많은 부분이 시간 축에서 발생합니다. 특히 세 가지 함정을 강조해 보겠습니다.

해결 혼란. 계량기는 15분 에너지(kWh) 또는 순간 전력(kW)을 보고합니까? 이들을 합산하면 다른 결과가 나옵니다. 15분 동안 4kW 값의 평균이 전력이고, 4개 값의 합은 시간당 에너지와 일치하지 않습니다(15분당 에너지의 합이 필요함). 단위와 분해능을 함께 이해하지 않으면 합산이 불가능합니다.

시간대. 데이터는 현지 시간(터키예의 경우 TRT/UTC+3) 또는 표준시(UTC)로 유지됩니까? 서로 다른 시스템에서 나오는 두 시리즈는 서로 다른 시간대에 있을 수 있습니다. 결합 시 3시간 교대가 전체 피크 시간 분석을 방해합니다.

일광 절약 시간(DST). 일광 절약 시간제로 전환한 국가에서는 1년에 한 번 시간이 "사라지고" 1년에 한 번씩 "반복"됩니다. 그러면 해당 날짜에 23시간 또는 25시간이 생성되고 시간별 프로필이 중단됩니다. Türkiye는 2016년부터 영구 일광 절약 시간제(UTC+3)를 구현했기 때문에 이 문제는 로컬 데이터에는 나타나지 않지만 국제 또는 이전 데이터로 작업할 때 여전히 이 문제가 발생합니다.

주의 사항: 타임스탬프의 라벨은 "범위 시작"입니까, 아니면 "범위 끝"입니까? 14:00이라는 라벨이 붙은 기록은 14:00-14:15 또는 13:45-14:00을 나타냅니까? 이 단일 결정으로 피크 클럭을 한 조각씩 이동할 수 있습니다. 각 데이터 세트의 시작 부분에서 이 규칙을 명확하게 만드세요.

단계별: 인공 지능을 사용한 데이터 준비 워크플로

1단계 — 발견. 데이터를 파악하세요. 행 수, 범위, 해상도, 단위는 무엇입니까? AI에 처음 몇 백 개의 행을 제공하고 구조를 요약하면 열의 의미와 가능한 단위가 빠르게 드러납니다. 그러나 AI의 단위 추정은 가설이다. 원본 문서에서 확인됩니다.

2단계 - 타임라인을 표준화합니다. 단일 시간대에 맞추고, 해상도를 수정하고, 태그 규칙(시작/끝)을 지정합니다. AI는 불규칙한 간격과 누락된 타임스탬프를 감지하는 코드를 생성할 수 있습니다.

3단계 — 불완전하고 중복된 기록. 통신 단절은 공허함을 만들고 다시 이중 녹음을 만든다. AI는 격차와 중복을 표시하는 일련의 규칙을 생성합니다. 짧은 간격(예: 15분)은 적절한 방법으로 채울 수 있으며, 긴 간격은 분석에서 제외되어 보고됩니다.

4단계 - 이상값. 마이너스 소비(생산 없음), 물리적 상한을 초과하는 전력, 급격한 점프. AI는 통계 및 규칙 기반 이상치 탐지 기능을 제공합니다. 그러나 이상치가 항상 오류인 것은 아닙니다. 실제 이벤트(예: 공장이 온라인으로 전환되는 경우)일 수도 있습니다. 엔지니어는 이렇게 구별합니다.

5단계 - 확인. 정리된 데이터는 물리적 앵커를 사용하여 테스트됩니다. 일출/일몰은 태양광 발전을 재설정해야 하며 야간 부하는 주간보다 낮아야 하며 총 에너지는 청구서와 일치해야 합니다.

세 가지 미니 케이스: 숫자로 알아보기

사례 1 — 한 시간 전진. 한 분석가의 태양광 생산량 데이터에 따르면 정오 피크 시간은 13시가 아닌 14시입니다. 문제는 패널에 있는 것이 아니었습니다. 데이터는 UTC였지만 현지 시간인 것으로 생각되었습니다. 3시간 교대 근무가 확인되자(해가 뜨기 전의 생산 모습으로 인해 닻이 사라졌음) 전체 분석이 개선되었습니다. 잘못된 해석으로 인한 투자 결정이 방지되었습니다.

사례 2 — 중복 녹음. 한 유통 공급 장치의 30일 시간별 데이터에서 총 소비량은 예상보다 약 4% 더 높았습니다. AI 지원 재생 감지 결과, 통신 재접속 시 일부 시간이 두 번 기록된 것으로 나타났습니다. 68개의 반복 기록을 지운 후 총액이 청구서와 일치했습니다.

사례 3 — 거짓 0. 한 미터는 통신이 끊기는 동안 소비량을 "0"으로 보고했습니다. 그러나 소비는 계속됐다. 이러한 잘못된 0은 평균을 낮추고 수요 예측을 오도했습니다. AI는 "존재 플래그와 함께 0개의 값을 검사한다"는 규칙을 제안했다. 잘못된 0은 누락된 데이터로 표시되었으며 실제 0과 구분되었습니다(예: 폐쇄된 작업장).

약한 프롬프트 / 강한 프롬프트

약한 프롬프트:

이 카운터 데이터를 지웁니다.[데이터]

강력한 프롬프트:

귀하의 역할: 에너지 데이터 분석가. 다음 계량기 데이터는 15분 간격, 현지 시간(UTC+3)에 대한 것이며 타임스탬프는 간격의 시작(kWh 단위)을 나타냅니다. 작업:1) 누락된 타임스탬프 및 중복 기록 목록(수 및 시간).2) 음수 값과 물리적 상한(계약 전력 25kW)을 초과하는 값을 별도로 표시합니다. 삭제하지 말고 표시만 하세요. 3) 의사소통 오류가 의심되는 실제 0과 잘못된 0을 구별할 수 있는 검사를 제공합니다. 어떤 값도 직접 입력하지 마세요. 먼저 확인해 주시면 충전 내용을 확인해 드리겠습니다.

강력한 프롬프트는 처음부터 해상도, 시간대, 태그 규칙 및 상한을 제공합니다. 이는 AI에 "먼저 탐지하고 나중에 질문"하는 원칙을 부과합니다. 이렇게 하면 데이터가 자동으로 손상되지 않습니다.

복사 가능한 템플릿 4개

1) 데이터 프로파일링:

행 수, 날짜 범위, 해상도, 예상 단위 및 각 열의 의미, 누락 비율, 최소/최대/평균 등 데이터의 프로필을 만듭니다. "확인 필요" 태그로 단위 추정치를 표시합니다.

2) 시간축 제어:

이 시계열에서는 (a) 예상 범위를 벗어난 간격, (b) 반복되는 타임스탬프, (c) 일광 절약 시간/시간대로 인한 가능한 이동을 감지합니다. 각 결과를 해당 기간과 함께 나열합니다. 수정 제안을 별도로 작성하세요. 애플리케이션.

3) 이상치 규칙:

전력 0-[X] kW, 온도 [A]-[B] °C와 같은 물리적 한계를 사용하여 이상값을 표시합니다. 또한 통계적 이상치(예: 중앙값에서 너무 멀리 벗어나는 경우)에 대한 별도의 목록을 만드세요. 각 이상치에 대해 "가능한 오류 또는 실제 사건"에 대한 질문을 제기합니다. 내가 결정하겠습니다.

4) 청소 후 확인:

다음과 같은 물리적 앵커를 사용하여 정리된 데이터를 테스트하고 불일치를 보고합니다. 태양광 생산량은 밤에 0이어야 합니다. 총 에너지는 예상 청구서 수준 내에 있어야 합니다. 야간 부하는 주간 피크보다 낮아야 합니다. 각 앵커에 대해 통과/실패를 작성합니다.

데이터 품질 문제 표

문제

증상

검증 앵커

시간대 이동

위쪽 시계가 말도 안되는 곳에 있어요

일출/일몰에 맞춰 정렬

서머타임(DST)

23/25시간 일

낮 길이 계산

가짜 제로

통신이 두절된 경우 0

통신 플래그와 일치

재등록

총 청구액 초과

타임스탬프 고유성 확인

단위 혼란

랭크 60/1000번 변태

kW←kWh 변환 확인

음수 값

생산이 없을 때의 마이너스 소비

물리적 기호 규칙

일반적인 실수

  • 누락된 데이터를 0으로 자동으로 채웁니다. 0은 "데이터 없음"이 아니라 "소비 없음"을 의미합니다. 두 가지를 혼합하면 평균과 예측이 왜곡됩니다.
  • 이상치를 자동으로 삭제합니다. 이상치는 실제 사건일 수 있습니다. 삭제하기 전에 엔지니어 검토가 필요합니다.
  • 시간대를 가정합니다. "아마도 지역적일 것입니다"라고 말하는 것은 가장 비용이 많이 드는 실수 중 하나입니다. 항상 출처에서 확인하세요.
  • 혼합하여 용해도를 수집합니다. 전력(kW) 값을 에너지(kWh)로 추가하면 합계가 잘못됩니다.
  • 청결도를 확인하지 않습니다. 정리된 데이터도 손상될 수 있습니다. 반드시 물리적 앵커로 테스트해 보세요.
팁: 데이터 정리의 각 단계를 "데이터 로그"에 기록합니다(표시된 레코드 수, 채워진 레코드 수, 사용된 규칙). 이 로그는 재현성과 감사 가능성을 모두 보장합니다. 1년 후 "이 숫자는 어디서 왔지?" 질문에 대답합니다.

요약하면

에너지 분석의 기본은 깨끗한 시계열입니다. 데이터는 SCADA, 계량기, 기상학 및 시장에서 나옵니다. 각각에는 해상도, 단위, 시간대 및 일광 절약 시간 트랩이 있습니다. AI는 누락/중복/이상치 감지를 가속화하는 데 매우 강력하지만 삭제 및 채우기 결정은 엔지니어에게 맡겨야 하며 결과는 물리적 앵커를 통해 검증되어야 합니다. 타임스탬프를 제대로 이해하지 못하면 분석을 신뢰할 수 없습니다.

응용과제

에너지 시계열(미터, 생산량 또는 온도)을 손에 넣으세요. "타임라인 감사" 및 "데이터 프로파일링" 템플릿을 사용하여 AI에 품질 보고서를 요청하세요. 그런 다음 세 가지 사항을 수동으로 확인합니다. 단위와 해상도가 올바른지, 피크 클럭이 물리적으로 합리적인지, 총 에너지가 청구서와 일치합니까? 발견한 데이터 품질 문제와 해결 방법을 간략하게 설명하세요.

체크리스트

  • [ ] 자료의 출처, 해상도, 단위를 확인하였습니다.
  • [ ] 시간대 및 타임스탬프 라벨 규칙(시작/종료)을 명확히 했습니다.
  • [ ] 서머타임으로 인한 하루 23/25시간의 위험성을 확인했습니다.
  • [ ] 누락 및 중복된 기록을 발견하여 신고했습니다.
  • [ ] "오류 또는 사건"을 구분하여 이상치를 조사했습니다.
  • [ ] 나는 거짓 0과 실제 0을 구별했다
  • [ ] 정리된 데이터를 물리적 앵커로 검증하고 데이터 로그를 보관했습니다.