收益:
- 解释能源设备中故障模式、传感器数据和预测性维护的商业价值。
- 能够利用人工智能配置异常检测、剩余使用寿命估计和警报优先级
- 能够管理误报/错过的故障平衡以及维护决策中专家批准的需要
电力系统中的设备故障代价高昂,有时甚至很危险:电力变压器爆炸会造成数百万美元的损失和长时间停电;损坏风力涡轮机齿轮箱意味着数月的生产损失。传统维护遵循“损坏时修复”(故障维护)或“按计划更换”(定期维护)逻辑;两者的干预要么太晚,要么太早。预测性维护旨在不断监测设备的实际状况,在故障发生前预测并及时干预。人工智能是处理大量传感器并产生洞察力的强大工具。在本单元中,我们将了解故障模式、人工智能辅助异常检测和剩余寿命估计及其局限性。
故障模式和传感器数据
预测性维护的基础是设备发生故障时会留下痕迹。故障不会突然发生,而是通常作为一个过程而发展,并且该过程会产生可测量的症状。
- 电力变压器:油温、负载,尤其是溶解气体分析(DGA;测量油中累积的气体)。某些气体的增加表明内部电弧、过热或绝缘恶化。
- 风力涡轮机:齿轮箱和轴承振动、温度、油颗粒、功率曲线偏差。轴承退化会产生特征振动频率。
- 电缆和线路:局部放电(绝缘体中的小电流放电)、温度。
- 断路器和开关设备:通断开关数量、分闸时间、接触电阻。
人工智能可以捕捉人眼可能错过的这些信号中的微妙趋势和多元模式。异常是数据与正常行为的统计偏差;这通常是预测性维护的第一个信号。
提示:良好的预测性维护始于充分了解“正常”。如果不知道设备正常运行时产生什么样的传感器信号,就不可能识别偏差。所以第一个投资就是建立“健康行为”的清洁基础。
两项基本任务:异常检测和剩余寿命
人工智能在预测维护方面有两个主要任务。
当设备偏离正常状态时,异常检测可以尽早发现。该模型学习健康的行为并根据它测试传入的数据;偏差产生警报。这里最关键的参数是阈值:偏差多少算作警报?
剩余使用寿命 (RUL) 是对设备发生故障之前的时间的估计。这样可以计划维护(零件订购、停运窗口)。 RUL 估计本质上是不确定的,应该给出一个范围。
误报/错过故障平衡
预测性维护的核心是平衡。误报(误报)是在没有故障的情况下产生警报;这会导致不必要的维护、浪费停机时间,并且最危险的是,团队对警报失去信心(“狼来了”效应)。漏检故障(漏报)是指未能预测实际故障;意外爆炸意味着损坏和安全风险。
如果降低阈值,漏检故障会减少,但误报会增加;如果增加它,则会发生相反的情况。正确的阈值是根据这两种故障的成本来设置的:配电变压器漏检故障的成本远高于路灯,因此在关键设备中阈值保持更敏感(更容易误报)。
注意:“模型的准确度为 95%”在预测性维护中具有误导性。由于故障很少见,即使是不发出警报的模型也可能有 95% 的“准确度”,但它甚至无法捕获任何一个实际故障。因此,成功是通过漏失故障率和误报率来单独衡量的,而不是通过整体准确性来衡量的。
一步一步:人工智能驱动的预测性维护
第一步——建立健康的基础。通过足够的数据了解设备的正常运行特征。
第 2 步 — 选择并验证传感器。适合故障模式的信号(振动、DGA、温度);检查传感器校准。
第 3 步 — 构建异常模型。检测偏离正常值的模型;该阈值是根据设备关键性设置的。
第 4 步 — 确定警报的优先级。并非所有偏差都具有同样的紧迫性; AI 按严重性和可能的故障类型对警报进行排序。
第 5 步 — 专家验证。每一个重大报警都会交给维护工程师进行审核;人工智能不进行诊断,它提供假设和优先级。
第 6 步——反馈。实际故障/正常结果反馈给模型;改进了阈值和模型。
三个迷你案例:从数字来看
案例1——变压器预警。在电力变压器的 DGA 数据中,AI 捕获了某些气体(乙烯)缓慢但稳定的增加;单次测量在正常范围内,但趋势异常。专家审查发现了一个热点(连接过热)。通过有计划的干预,避免了可能出现的故障;估计避免的损失约为数百万里拉。
案例2——狼来了。在一个风场中,阈值设置得太低;在另一个风场中,阈值设置得太低。该模型每周会产生数十次错误振动警报。随着时间的推移,团队开始忽视警报并错过了实际的轴承故障。当根据历史数据中的实际故障重新校准阈值时,误报减少到每周一次,信心又恢复了。
情况 3 — RUL 范围。对于变速箱,模型表示“剩余寿命约为 6 周”,但为奇数。事实上,不确定性增加了;零件在第 9 周到达,故障发生在第 5 周,并且出现了计划外停机。在下一次练习中,RUL 给出了一个间隔(“3-8 周,80% 置信度”),并根据合理的最坏情况提前了零件订单。
弱提示/强提示
弱提示:
看看这个振动数据,有没有什么故障?[数据]
强力提示:
您的角色:预测维护分析师。设备:风力涡轮机齿轮箱。-首先总结数据中的正常(健康)行为;识别异常情况。- 按严重性和可能的故障类型对偏差进行优先级排序;不要做出明确的诊断,不要提出假设。 - 对于每个假设,请指出哪些额外的测量/检查将证实它。 - 考虑误报和漏报故障的平衡;根据该设备的重要性证明您的阈值建议的合理性。 - 如果请求 RUL,请给出置信区间,而不是单个数字。数据:[振动/温度系列]
强大的提示首先定义正常,要求假设而不是诊断,添加验证步骤和阈值偏移,每隔一段时间提示 RUL - 从一开始就避免预测性维护的经典陷阱。
四个可复制模板
1)健康基础萃取:
从该设备的数据中提取正常/健康的运行特征:典型范围、季节性/负载相关变化。然后在此基础上定义异常。区分可由负载或温度解释的变化与真正的异常。
2) 报警优先级:
按严重程度、发展速度和可能的故障类型对以下偏差进行优先级排序。对于每个:紧急程度(紧急/监控/正常)、可能原因假设和验证步骤。做出明确的诊断;向维护工程师发出决定说明。
3)阈值平衡分析:
使用历史数据显示不同阈值对该异常分数的误报和漏报故障数量的影响。考虑设备的重要性([高/中/低]),建议并证明阈值的合理性。分别查看两种错误类型,而不是整体准确性。
4) RUL不确定度报告:
给出您对剩余使用寿命的估计,并给出范围和置信水平。什么时候会出现“最糟糕的情况”?根据这种最坏的情况建议零件采购和停电计划。
故障模式及信号表
设备
监测信号
早期症状
电源变压器
DGA、油温
气量增加,热点
风力涡轮机
振动、油粒
轴承/齿轮频率
电缆/线路
局部放电、温度
绝缘劣化
切割机
开通时间、接触电阻
机械减速
发电机
振动、温度、电流
不平衡、摩擦
常见错误
- 依赖于一般准确性。由于故障很少见,即使“不报警”也显示出较高的准确度;漏检的故障必须单独测量。
- 阈值设置不正确。阈值太低会导致“狼来了”效应,阈值太高会导致漏检。
- 有AI诊断。人工智能生成假设和优先级;最终诊断和干预决定属于专家。
- 给 RUL 一个奇数。在没有不确定性区间的情况下给出的寿命估计将导致计划外停机。
- 寻找异常现象而不认识正常现象。在没有建立健康基础的情况下进行的检测可能会将负载/季节变化误认为是故障。
总之
预测性维护旨在通过设备的传感器痕迹预测故障,及时进行干预。人工智能在异常检测和剩余寿命预测方面能力强大;但其成功与否不是通过总体准确性来衡量的,而是通过误报和遗漏故障的平衡来衡量的。阈值是根据设备关键性设置的,人工智能生成假设而不是诊断,RUL 是间隔开的,每个重要警报都会经过专家验证。
应用任务
获取设备(变压器、涡轮机、电机)的传感器时间序列。使用“健康基线提取”和“警报优先级”模板请求 AI 进行分析。确保首先定义正常;然后问问自己发现的任何偏差是否可以用负载或温度来解释。选择一个阈值并写下该阈值如何改变误报/漏报故障平衡。
清单
- [ ] 我已经定义了设备健康/正常行为的基础
- [ ]我选择了适合故障模式的传感器信号并考虑了校准
- [ ] 我将异常与负载/季节效应分开
- [ ] 我根据设备关键性和两种故障类型的成本确定了阈值
- [ ] 我查看的是误报/漏失故障率,而不是整体准确度
- [ ] 我向人工智能询问假设和验证步骤,而不是诊断
- [ ] 我提出了带有置信区间的 RUL 估计值,并经过专家批准