收益:
- 能够区分排放量(来自源头)和浓度(在空气中测量),并将校准数据转换为 AQI 并将其与阈值进行比较
- 能够建立短期污染预测模型,并诚实地展示每个预测的置信区间和模型限制
- 能够用证据支持公共卫生主张,而无需人工智能调整需要分发/物理的部分
空气污染是看不见的,但却是致命的:它每年导致数百万人过早死亡,并与气候变化交织在一起。机构对其自身的烟囱排放及其周围的空气质量负责。在本单元中,您将学习空气质量参数、测量和建模方法、人工智能预测以及所有这些的局限性。
首先是概念。空气质量通常通过几种主要污染物来衡量:PM2.5 和 PM10(小于 2.5 和 10 微米的颗粒物 - 可吸入粉尘)、NO2(燃烧产生的二氧化氮)、SO2(二氧化硫)、O3(地面臭氧)和 CO(一氧化碳)。 AQI(空气质量指数)是将这些污染物转换为公众可以理解的单一颜色/数字等级(良好-危险)的指数。排放量是指从源头释放的量,而浓度是指空气中的浓度;重要的是不要混淆两者。
提示:排放(来自源头)和浓度(在空气中测量)是两个不同的东西。风、温度和地形导致相同的排放物产生截然不同的浓度。说“烟囱里的空气少了”并不意味着“附近的空气干净”。
建模:从排放到浓度
计算从烟囱出来的污染物到达附近社区的浓度是一个扩散模型的问题。这些模型使用气象学(风向/风速、大气稳定性)和地形。经典模型(例如高斯分布模型)是基于物理的;人工智能用于加速这些模型、解释输出并从大型测量数据集中提取模式,但将物理“融入”人工智能是危险的。
天气预报:预测明天的天气
人工智能最强大的领域是预测:利用历史测量、气象和交通数据建立模型来预测明天或几个小时后的污染物水平。这对于公共卫生警告和预防(例如交通限制)很有价值。但每个预测都存在不确定性,当模型超出训练条件(例如意外火灾)时,模型就会出错。
一步一步:空气质量分析
1. 选择问题和参数。哪种污染物、哪个地点、持续多长时间?
2. 验证数据来源。参考站还是低成本传感器?口径?
3. 预处理。清理丢失的数据、传感器漂移、极端异常值。
4. 转换为AQI 并与阈值进行比较。是否超出法定限度?
5. 模型/预测。趋势、季节性、未来预测。
6. 报告不确定性。始终提供带有置信区间和模型限制的估计值。
三个迷你箱子
案例 1 — 排放浓度混淆。一家工厂希望宣布其烟囱排放量减少了 20%,因此“附近的空气清洁了 20%”。专家表示,当时风向发生变化,浓度实际上受到气象影响;排放量减少是真实的,但浓度声称没有证据。该声明仅限于“我们将烟囱排放量减少了 20%”;没有证据的航空索赔。
案例 2 — 传感器校准。一所学校通过低成本传感器收到了“危险的 PM2.5”警报。当专家将传感器与附近的参考站进行比较时,他发现该值在高湿度下会膨胀;湿度校正后,该值下降至“中等”水平。未经校准的传感器可能会引起恐慌。 (这再次显示了传感器校准在每个测量领域的重要性。)
案例 3 — 预测不确定性。第二天,一个市政府通过其人工智能预测模型发出了“高污染”警告,但一场意想不到的沙尘暴破坏了这一预测。该团队此前曾报告称该模型“对于非训练数据事件不可靠”;因此,警告被认为是“可能的”,并且没有失去信心。明确不确定性是负责任地使用预测。
弱提示/强提示
弱提示:
用这些天气数据预测明天。
弱点:对参数、位置、数据质量、模型类型和不确定性没有需求。输出将是一个数字,其可靠性未知。
强力提示:
您的角色:空气质量数据科学家。利用以下 PM2.5 每小时数据和气象(风、湿度、温度),在 Python 中建立未来 24 小时的简单预测模型(例如梯度提升)。步骤:(1)数据清理和传感器漂移控制,(2)特征准备,(3)模型,(4)给出带有置信区间的预测。明确说明模型的局限性(非教育情况下的不可靠性)。数据:[此处]
四个可复制模板
1)空气数据清洗+AQI:
使用 Python 清理以下空气质量测量值(下冲、卡住、漂移、过冲)并将其转换为标准 AQI。指定您使用的 AQI 公式;配件。标记超出法定阈值的时间。数据:[此处]
2) 排放量与浓度的区别:
检查以下声明:是否与排放量(来自源头)或浓度(在空气中测量)有关?突出显示混淆两者的部分或忽略气象学,并建议根据证据进行谨慎的重述。索赔:[此处]
3)预测模型(具有不确定性):
您的角色:数据科学家。使用以下时间序列构建[污染物]的短期预测模型 (Python)。给出每个预测的置信区间。清楚地写出在什么条件下(非训练事件、极端天气)模型会不可靠。过于乐观的事实主张 FAKE.Data:[此处]
4)资源贡献总结:
根据下面的空气质量和风力数据,分析高污染时段风的方向,以提供可能的来源方向的线索。不要直接说“这就是来源”;提供概率和验证。数据:[此处]
常见错误
- 混淆发射与浓度。烟囱的减少并不意味着空气的清洁。
- 依赖于未校准的传感器。湿度和漂移使数值膨胀。
- 给出没有不确定性的估计。每个估计值都应该给出一个置信区间。
- 让物理与人工智能相契合。分布模型需要物理; LLM的“预测”不是物理学。
- 记住法律门槛。从立法中获取极限值。
注意:空气质量声明涉及公众健康。虚假的“干净”声明会让人们面临风险;毫无根据的“肮脏”警报会造成不必要的恐慌和经济损失。用校准数据、适当的模型和明确的不确定性来支持每个主张。
综上所述
空气质量;它需要将排放与浓度分离、校准测量、适当的建模和具有不确定性的预测。人工智能;它在数据清理、模式提取和短期预测方面功能强大。但基于物理的分布、传感器校准、法律阈值和不确定性的诚实报告属于专家。烟囱上的数字与附近空气中的数字不一样。
应用任务
准备某个地点的假设每小时 PM2.5 和气象数据。使用第一个模板,让人工智能清理数据,将其转换为 AQI,并标记阈值超出情况。然后使用第三个模板构建短期预测模型,并确保每个预测都有一个置信区间。最后,使用模板 2 对您的空气质量声明的排放/浓度进行审核。
清单
- [ ] 我正确区分了排放量和浓度。
- [ ] 我检查了传感器数据的校准和漂移。
- [ ] 我从正确的公式/立法中获得了 AQI 和阈值。
- [ ] 我提出了带有置信区间和模型极限的估计值。
- [ ] 我没有让AI适应需要分布/物理的部分。
- [ ] 我用证据支持公共卫生主张。