利益:
- 排出量(発生源から)と濃度(空気中で測定)を区別し、校正されたデータを AQI に変換してしきい値と比較する機能
- 短期汚染予測モデルを構築し、信頼区間とモデル限界を使用して各予測を正直に提示する能力
- 配布/物理を必要とする部分を人工知能に適応させることなく、公衆衛生上の主張を証拠でサポートする機能
大気汚染は目に見えませんが、致命的です。毎年何百万人もの早死にを引き起こしており、気候変動と絡み合っています。機関は、自身の煙道からの排出と周囲の大気の質の両方に責任を負います。この単元では、大気質パラメータ、測定およびモデリング方法、AI による予測、およびこれらすべての限界について学びます。
まずはコンセプト。空気の質は通常、いくつかの主要な汚染物質で測定されます。PM2.5 および PM10 (2.5 および 10 ミクロン未満の粒子状物質 - 吸入性粉塵)、NO2 (二酸化窒素 - 燃焼によるもの)、SO2 (二酸化硫黄)、O3 (地表オゾン)、CO (一酸化炭素) です。 AQI (大気質指数) は、これらの汚染物質を、一般の人々が理解できる単一の色と数字のスケール (良いものから危険なもの) に変換した指数です。排出量は発生源から放出される量、濃度は大気中の濃度です。この 2 つを混同しないことが重要です。
ヒント: 排出量 (発生源からの) と濃度 (空気中で測定) は 2 つの異なるものです。風、気温、地形により、同じ放出でも濃度が大きく異なります。 「煙突から出る空気が少なくなった」と言っても「近くの空気がきれいになった」わけではありません。
モデリング: 排出から濃度まで
煙突から出た汚染物質が近隣地域に到達する濃度を計算することは、分散モデリングの問題です。これらのモデルは、気象学 (風向/風速、大気の安定性) と地形を使用します。古典的なモデル (ガウス分布モデルなど) は物理ベースです。 AI は、これらのモデルを加速し、出力を解釈し、大規模な測定データセットからパターンを抽出するために使用されますが、物理学を AI に「適合させる」ことは危険です。
予報:明日の天気を予測する
AI の最も得意な分野は予測です。過去の測定値、気象学、交通データを使用して、明日または数時間後の汚染レベルを予測するモデルを構築します。これは、公衆衛生上の警告や予防措置 (交通規制など) に役立ちます。しかし、すべての予測には不確実性があり、モデルがトレーニングされた条件から外れた場合 (予期せぬ火災など)、モデルは間違ってしまいます。
ステップバイステップ: 大気質分析
1. 質問とパラメータを選択します。どの汚染物質が、どの場所で、どのくらいの期間続くのか?
2. データソースを確認します。基準局ですか、それとも低コストのセンサーですか?口径?
3. 前処理。欠落データ、センサーのドリフト、極端な外れ値をクリーンアップします。
4. AQI に変換し、しきい値と比較します。法定の制限を超えていませんか?
5. モデル化/予測。トレンド、季節性、将来の予測。
6. 不確実性を報告する。常に信頼区間とモデル限界を含む推定値を提示します。
ミニケース3個
ケース 1 — 排出量と濃度の混同。ある施設は、煙突からの排出量を 20% 削減したため、「近隣の空気が 20% きれいになった」と発表したいと考えていました。専門家は、その時点で風向きが変化し、濃度が実際に気象の影響を受けたことを示した。排出削減は事実であったが、濃度の主張には根拠がなかった。声明は「スタック排出量を20%削減した」に限定されていた。証拠を削除しない航空主張。
ケース 2 — センサーの校正。ある学校は、低コストのセンサーで「危険な PM2.5」の警報を受け取りました。専門家がセンサーを近くの基準局と比較したところ、高湿度では値が大きくなっていることがわかりました。湿度補正後は「中」レベルまで値が下がりました。センサーが校正されていないとパニックが発生する可能性があります。 (これは、あらゆる測定領域においてセンサーのキャリブレーションがいかに重要であるかを改めて示しています。)
ケース 3 — 予測の不確実性。ある自治体は翌日、AI予測モデルを使って「高汚染」を警告したが、予期せぬ砂嵐により予測は失敗した。チームは以前、このモデルは「トレーニング以外のデータ イベントに対しては信頼性が低い」と報告していました。したがって、警告は「可能性がある」ものとして提示され、自信が失われることはありませんでした。不確実性を明確にすることは、予測を責任を持って使用することです。
弱いプロンプト / 強いプロンプト
弱いプロンプト:
この気象データを使用して明日を予測します。
弱い理由: パラメーター、場所、データ品質、モデルの種類、不確実性は要求されません。出力は単一の数値ですが、その信頼性は不明です。
強力なプロンプト:
あなたの役割: 大気質データサイエンティスト。次の PM2.5 の時間ごとのデータと気象学 (風、湿度、温度) を使用して、Python で今後 24 時間の簡単な予測モデル (勾配ブースティングなど) を設定します。ステップ: (1) データ クリーニングとセンサー ドリフト制御、(2) 特徴の準備、(3) モデル、(4) 信頼区間を使用した予測の提供。モデルの限界(教育以外の状況における信頼性の低さ)を明確に述べます。データ: [ここ]
コピー可能な 4 つのテンプレート
1) 航空データ クリーニング + AQI:
Python を使用して次の空気品質測定値 (アンダーシュート、スタック、ドリフト、オーバーシュート) をクリーンアップし、標準 AQI に変換します。使用する AQI 式を指定します。フィッティング。法定基準を超える時間をマークします。データ: [ここ]
2) 排出量と濃度の区別:
次の主張を確認してください。それは排出量 (発生源からの) に関するものですか、それとも濃度 (空気中で測定) に関するものですか? 2 つを混同している部分を強調するか、気象学を無視して、証拠に基づいた慎重な言い直しを提案します。主張: [ここ]
3) 予測モデル (不確実性あり):
あなたの役割: データサイエンティスト。次の時系列を使用して、[汚染物質] の短期予測モデル (Python) を構築します。それぞれの予測に信頼区間を与えます。どのような条件 (トレーニング イベント以外、異常気象) でモデルの信頼性が低くなるかを明確に記述します。過度に楽観的な真実主張 FAKE.Data: [ここ]
4) リソース貢献の概要:
以下の大気質と風のデータから、汚染の多い時間帯に風がどの方向から吹いているかを分析し、考えられる発生源の方向についての手がかりを与えます。 「これがソースです」とあからさまに言わないでください。確率と検証を提供します。データ: [ここ]
よくある間違い
- 放出と濃度を混同する。煙突の減少は空気の清浄を意味しません。
- 校正されていないセンサーに依存している。湿度とドリフトにより値が大きくなります。
- 不確実性のない見積りを提示します。すべての推定値には信頼区間を指定する必要があります。
- 物理学を AI に適合させる。分布モデルには物理学が必要です。 LLM の「予測」は物理学ではありません。
- 法的なしきい値を覚えておいてください。法律から制限値を取得します。
注意: 大気質に関する主張は公衆衛生に関わるものです。誤った「クリーン」な主張は人々を危険にさらします。根拠のない「汚い」警報は、不必要なパニックと経済的損害を引き起こします。校正されたデータ、適切なモデル、明確な不確実性によって各主張を裏付けます。
要約すると
空気の質。排出量を濃度から分離し、測定値を校正し、適切なモデリングと不確実性を伴う予測を行う必要があります。 AI;データクリーニング、パターン抽出、短期予測に強力です。ただし、物理学に基づく分布、センサーの校正、法的しきい値、不確実性の正直な報告は専門家に属します。煙突の数字は近所の空気と同じではありません。
アプリケーションタスク
ある場所の仮想の 1 時間ごとの PM2.5 と気象データを準備します。 1 番目のテンプレートでは、AI にデータをクリーンアップさせ、AQI に変換し、しきい値超過をマークします。次に、3 番目のテンプレートを使用して短期予測モデルを構築し、各予測に信頼区間があることを確認します。最後に、テンプレート 2 を使用して、大気質に関する主張の排出量/濃度を監査してもらいます。
チェックリスト
- [ ] 排出量と濃度を正しく区別しました。
- [ ] センサーデータのキャリブレーションとドリフトを確認しました。
- [ ] 正しい公式/法律から AQI としきい値を取得しました。
- [ ] 信頼区間とモデル限界を使用して推定値を提示しました。
- [ ] 分散/物理が必要な部分を AI に適応させていませんでした。
- [ ] 私は公衆衛生上の主張を証拠をもって支持しました。