单位 2 / 11

能源数据、SCADA 和智能电表:时间序列准备

收益:

  • 能够识别SCADA、智能电表和市场数据的结构、单元和典型质量问题
  • 能够利用人工智能检测丢失数据、异常值和时间戳问题并建立清理工作流程
  • 能够验证AI输出中能源时间序列中的分辨率、时区和夏令时等陷阱

几乎所有能量分析都从时间序列开始:沿时间轴排列的测量值。仪表 15 分钟的消耗量、涡轮机的第二转速、馈线(配电线)每小时的电流——都是时间序列。在本单元中,我们将了解能源数据的来源、其中包含哪些陷阱,以及如何使用人工智能使这些数据变得可靠。让我们从一开始就确立这个原则:即使是对脏数据进行最明智的分析也会给出脏结果。在能源工程中,大部分时间不是花在模型上,而是花在使数据可靠上,而人工智能在这部分提供了最安全的贡献。

能源数据的来源和结构

能源数据主要来自多个来源。 SCADA(监控和数据采集系统)从配电盘和电网设备收集瞬时测量值;它通常以秒或分钟为单位,包括电压、电流、功率和温度等量。智能电表数据通常以 15 分钟为间隔测量消耗量,是计费和需求分析的基础。气象数据(温度、辐照度、风速)是生产和需求预测的输入。市场数据(每小时价格)是经济分析的输入。

这些数据的共同特征是它们包含时间戳(每个测量所属的日期时间标签)和一个或多个测量值。这是最关键的一点:如果不能正确理解时间戳,其他一切都会崩溃。

分辨率、时区和夏令时陷阱

能源数据中的误差很大一部分来自时间轴。让我们特别强调三个陷阱。

分辨率混乱。电表报告的是 15 分钟电量 (kWh) 还是瞬时功率 (kW)?将它们相加会得到不同的结果:15分钟内的四个kW值的平均值就是功率,而四个之和并不对应于每小时的能量(需要每刻钟能量的总和)。如果不一起了解单位和分辨率,就无法进行求和。

时区。数据是按照本地时间(土耳其的 TRT/UTC+3)还是世界时间 (UTC) 保存的?来自不同系统的两个系列可能位于不同时区;组合时的三小时轮班扰乱了整个高峰时段的分析。

夏令时 (DST)。在实行夏令时的国家,一个小时每年“消失”一次,每年“重复”一次。这会在这些日子创建 23 或 25 小时的工作日,并破坏每小时的配置文件。由于土耳其自 2016 年起实施永久夏令时 (UTC+3),因此本地数据上不会出现此问题,但在使用国际或旧数据时仍然会遇到此问题。

注意:时间戳的标签是“范围开始”还是“范围结束”?标记为 14:00 的记录是否表示 14:00-14:15 还是 13:45-14:00?这一单一决定可能会将峰值时钟偏移一个片段。在每个数据集的开始就明确这条规则。

一步一步:使用人工智能的数据准备工作流程

第 1 步——发现。了解数据:有多少行、什么范围、什么分辨率、什么单位?为人工智能提供前几百行并总结结构,可以快速揭示列的含义和可能的单元。但人工智能的单位估计只是一个假设;从源文件中可以确认这一点。

第 2 步——标准化时间线。捕捉到单个时区、修复分辨率、指定标记规则(开始/结束)。人工智能可以生成检测不规则间隔和缺失时间戳的代码。

步骤 3 — 不完整且重复的记录。沟通故障再次造成空虚和双重记录。人工智能产生了一套标记差距和重复的规则;短间隙(例如单个 15 分钟)可以通过合适的方法来填补,长间隙被排除在分析和报告之外。

第 4 步——异常值。负消耗(无产出)、力量超过物理上限、突然跳跃。人工智能提供统计和基于规则的异常值检测;但异常值并不总是一个错误——它也可能是一个真实的事件(例如,一家工厂上线)。工程师做出了这种区分。

第 5 步 — 验证。清理后的数据通过物理锚点进行测试:日出/日落必须重置太阳能发电,夜间负荷必须低于白天,总能量必须与账单一致。

三个迷你案例:从数字来看

案例 1——一小时的失误。一位分析师的太阳能发电数据显示,中午峰值出现在 14:00,而不是 13:00。问题不在于面板,而在于面板。数据是 UTC,但被认为是当地时间。当注意到三小时轮班(日出前生产的出现暴露了锚点)时,整个分析有所改善;投资决策因误解而受阻。

案例 2 — 重复录音。在一个配电支线的 30 天每小时数据中,总消耗量比预期高出约 4%。人工智能辅助重播检测显示,某些小时在通信重连中被记录了两次。清除68条重复记录后,总数与帐单相符。

情况 3 — 假零。在通信中断期间,一台仪表报告消耗量为“0”;然而,消费仍在继续。这些假零降低了平均值并误导了需求预测。 AI建议规则“检查0值和存在标志”;假零被标记为缺失数据并与真零分开(例如,封闭的工作场所)。

弱提示/强提示

弱提示:

清除该计数器数据。[数据]

强力提示:

您的角色:能源数据分析师。以下电表数据为 15 分钟间隔,当地时间(UTC+3),时间戳表示间隔的开始时间,单位 kWh。 任务:1)列出缺失时间戳和重复记录(数量和时间)。2)分别标记负值和超出物理上限的值(合同功率 25 kW);不要删除,只需标记。3)提供检查以区分疑似误传的假零和真实零。不要自己填写任何值;先识别一下,我再确认填充。

强大的提示从一开始就给出分辨率、时区、标签规则和上限;它对人工智能实行“先检测,后询问”的原则。这样数据就不会被悄悄损坏。

四个可复制模板

1) 数据分析:

创建以下数据的配置文件:行数、日期范围、分辨率、估计单位和每列的含义、缺失率、最小/最大/平均值。用“需要验证”标签标记单位估计值。

2)时间轴控制:

在此时间序列中,检测:(a) 超出预期范围的间隙,(b) 重复时间戳,(c) 由于夏令时/时区而可能发生的变化。列出每个发现及其时间范围。单独写下您的纠正建议;应用。

3)异常值规则:

使用这些物理限制标记异常值:功率 0-[X] kW,温度 [A]-[B] °C。还要单独列出统计异常值(例如偏离中位数太远)。对于每个异常值,提出“可能的错误或实际事件”的问题;让我决定吧。

4)清洗后验证:

使用以下物理锚点测试清理后的数据并报告不一致之处:夜间太阳能发电量应为零;总能源必须在预期的账单水平之内;夜间负荷必须低于白天高峰。为每个锚点写入通过/失败。

数据质量问题表

问题

症状

验证锚

时区转换

顶部时钟处于不合逻辑的位置

与日出/日落对齐

夏令时(DST)

每天 23/25 小时

计算一天的长度

假零

0 表示通讯中断

与通讯标志匹配

重新注册

高于账单总额

检查时间戳唯一性

单位混乱

排名60/1000次变态

验证 kW↔kWh 换算

负值

没有生产时的负消耗

体征规则

常见错误

  • 默默地用零填充缺失的数据。零意味着“没有消耗”,而不是“没有数据”;将两者混合会扭曲平均值和预测。
  • 自动删除异常值。异常值可能是真实事件;删除前需要工程师审核。
  • 假设时区。说“这可能是本地的”是最昂贵的错误之一;始终从源头进行验证。
  • 通过混合收集溶解度。将功率 (kW) 值添加为能量 (kWh) 会得出错误的总数。
  • 不验证清洁度。清理后的数据也可能已损坏;请务必使用物理锚点对其进行测试。
提示:在“数据日志”中写下数据清理的每个步骤:标记了多少条记录,填充了多少条记录,使用了哪些规则。该日志确保了可重复性和可审计性;一年后“这个数字是从哪里来的?”回答了问题。

总之

能量分析的基础是清洁时间序列。数据来自SCADA、仪表、气象、市场;每个都有分辨率、单位、时区和夏令时陷阱。人工智能在加速缺失/重复/异常值检测方面非常强大,但删除和填充决策应由工程师决定,并且结果应使用物理锚点进行验证。如果没有正确理解时间戳,任何分析都是不可靠的。

应用任务

手上拿一个能量时间序列(仪表、产量或温度)。使用“时间线审核”和“数据分析”模板向 AI 请求质量报告。然后手动验证三件事:单位和分辨率是否正确,峰值时钟物理上是否合理,总能量是否与账单一致?简要描述您发现的数据质量问题以及解决方法。

清单

  • [ ] 我已确认数据来源、分辨率和单位
  • [ ] 我澄清了时区和时间戳标签规则(开始/结束)
  • [ ] 我检查了由于夏令时而导致每天 23/25 小时的风险
  • [ ] 我检测到丢失和重复的记录并报告了它们
  • [ ] 我通过“错误或事件”的区别检查了异常值
  • [ ] 我区分了假零和真零
  • [ ] 我用物理锚点验证了清理后的数据并保留了数据日志