利益:
- リスクのレベルに応じて、化学ワークフロー(アイデア、設計、分析、レポート)において人工知能が時間を節約する部分と、構造、数、リソース、安全性の決定が人間に委ねられる部分を区別できるようになります。
- 構造-番号-リソース-セキュリティの 4 つのステップで各出力を独立してチェックする規律を適用する能力
- でっち上げられた化合物や数字、虚偽の参照、セキュリティ上の誤解が、この職業にとってリスクであり、最初から考慮する必要がある理由を理解してください。
化学は、物質の構造、変換、特性を研究する実験科学です。化学者は実験室で重さを量り、溶解し、加熱し、測定します。彼は机に向かって、分子を描き、反応を計画し、スペクトルを解釈し、文献に目を通し、レポートを作成します。人工知能 (略して AI、ここでは具体的には、大規模な言語モデル、つまり大量のテキスト データでトレーニングされた、「次に可能性の高い単語」を予測してテキストを生成するソフトウェア) は、これらのデスクワークの多くを劇的にスピードアップできます。ただし、ラボ自体を構築するわけではなく、体重計を読み取るわけでもありません。そして最も重要なことに、ユーザーに代わって生成される数値、公式、引用を検証することもありません。このモジュールでは、化学で AI をエンドツーエンドで責任を持って使用する方法を学びます。
この最初の単元では、AI は化学のアシスタントであり、化学者ではないという 1 つのアイデアを皆さんの心に植え付けたいと思います。コードを作成し、アウトラインを作成し、逆合成フレームワークを構築し、スペクトル ピークの解釈を支援し、文献を要約します。ただし、分子が実際に合成できるかどうか、反応が安全かどうか、参照物質が本物かどうかを判断し、最終的な責任を負うのは有能な化学者です。
AI は化学のワークフローのどこに適合しますか?
化学プロジェクトを大まかに 5 つのフェーズに分けてみましょう: (1) アイデアと文献、(2) 分子と反応設計、(3) 実験室での応用、(4) 分析と特性評価、(5) 報告。 AI はこれらの段階で非常に異なる価値を持ちます。
- アイデアと文献: AI はトピックをすばやく要約し、重要な概念を説明し、検索用語を生成します。しかし、彼は帰属をでっち上げることはできる。これについては後ほど説明します。
- 設計: SMILES (分子をテキスト文字列として記述する形式。詳細は後述) を生成し、逆合成ステップを提案し、反応性の代替案をリストします。提案は良いものであり、保証ではありません。
- 研究室: ここでは AI は何もしません。計量、加熱、安全対策は人間が行っています。 AI は手順の作成を支援するだけです。その手順を実行する前に、安全のために人間が監視する必要があります。
- 分析: NMR、IR、質量スペクトル (これらは分子の構造を示す測定技術) の解釈において、YZ はピークをグループ化し、考えられる構造をリストするのに役立ちます。最後の課題はあなたのものです。
- レポート作成: 実験ノート、記事の草案、安全フォームの草案を作成します。それは非常に強力です。ただし、数字はあなたの数字と一致するはずです。
ヒント: AI を使用するのに最も安全な場所は、「何か問題が発生した場合にすぐに気付いて修正される」領域 (草案テキスト、コードの骨子、用語の説明) です。最も危険な場所は、定数、参照、セキュリティ アサーション、数値結果など、「偽の場合は静かに拡散する」領域です。
なぜ注意しなければならないのでしょうか? 3つの構造的リスク
大きな言語モデルは、電卓や化学エンジンではありません。統計的に「可能性が高い」テキストを生成します。これは、化学における 3 つの具体的なリスクにつながります。
- でっち上げ(幻覚):モデルではない化合物、存在しない反応、または間違った分子量を自信を持って書き留めることができます。たとえば、「化合物 X の分子量は 154.2 g/mol」と書かれていますが、正しい値は 168.2 です。
- 偽の引用: 「Smith et al., 2019, Journal of Organic Chemistry」など、現実的に見えてもまったく存在しない出典が示される可能性があります。彼はDOI番号をでっち上げることさえできる。
- 安全性の誤り: 試薬の危険な組み合わせ (例: 不適切な比率の酸化剤と有機溶媒) を「問題なし」として提示する可能性があります。
これら 3 つのリスクは、このモジュールの各単元で何度も登場します。解決策は AI から逃げることではなく、独立した情報源で各出力を検証する規律を確立することです。
ミニケース
ケース 1 — 当てはめられた分子量。大学院生がAIにパラニトロフェノールの分子量を尋ねた。 「139.11 g/mol」とAIは言いました。学生は自信を持って、0.05 mol に対して 6.96 g の重さを計画しました。しかし、パラニトロフェノールの分子量は 139.11 g/mol であり、今回はそれが正しかったのですが、学生は一度も確認していませんでした。次の化合物 (パラアミノフェノール、実際の値 109.13 g/mol) について、YZ は「123.15」と言いました。今回は生徒が式(C6H7NO2)から手計算して捕まえました:6×12.011 + 7×1.008 + 14.007 + 2×15.999 = 109.13。レッスン: 式を使わずに各分子量を計算します。
ケース 2 — 偽の DOI。研究者は文献レビューで AI に 5 つの情報源を求めました。 5 つのうち 2 つの DOI は、クリックすると「見つかりません」を返しました。見出しは事実でしたが、記事はそうではありませんでした。 40分の時間の無駄。教訓: すべての引用をデータベース (DOI、PubMed、Reaxys) で検証せずに使用すべきではありません。
ケース 3 — 安全と思われる危険。ユーザーが AI に掃除手順について質問しました。 AI は間接的に、次亜塩素酸塩を含む溶液と酸性溶液を混合するという提案を出しました。この組み合わせでは塩素ガスが発生する可能性があります。幸いなことに、ユーザーは安全データシート (SDS) を見て立ち止まりました。教訓: すべての手順は、実施前に人間による SDS と危険性の検査が行われます。
弱いプロンプト / 強いプロンプト
弱いプロンプト:
この分子を合成します。
この主張は曖昧です。どのような分子、どのような出発物質、どのようなスケール、どのような制約があるのでしょうか? AI がそのギャップを補います。
強力なプロンプト:
役割: あなたは有機合成の経験豊富なアシスタントです。標的分子: 4-メトキシアセトフェノン (SMILES: COc1ccc(cc1)C(C)=O)。出発原料としてアニソールがあります。タスク: 2 段階の逆合成の提案を行います。各ステップ: 試薬、条件 (温度、溶媒)、および起こり得る副反応。制約: フィッティングが不明な場合は「検証」とマークします。出力: 番号付きのステップ + 検証するポイントのリスト。
違い: 役割、正確なターゲット (SMILES を使用)、コンテキスト、ステップ数、出力形式、および「フィッティング」制約。これらは、化学における優れたプロンプトの 5 つの構成要素です。役割、正確な構造表現、コンテキスト、タスク、検証制約です。
AI ツールの種類: 言語モデルまたは化学ツール?
化学では 2 つの異なる「AI」に遭遇するため、これらを混同しないことが重要です。
ジャンル
どういうことですか
信頼性
使用例
一般的な言語モデル
テキスト/コードの生成、説明、下書きの作成
数字は重視せず、言語を重視する
手順概要、用語説明
化学ライブラリ(RDKitなど)
分子を決定論的に処理し、分子量を計算します
高 (ルールベース)
SMILES認証、MAアカウント
カスタム予測モデル (逆合成、機能)
データに基づいてトレーニングされた予測を提供します
中程度、地域に応じて
逆合成、溶解度推定
文献・検索ツール
実際のデータベースクエリ
ソースによっては高い
帰属確認、反応検索
最も堅牢なワークフローは、これらを組み合わせたものです。言語モデルがアイデアを生成し、化学ライブラリが数値を決定論的に計算し、文献ツールが帰属を検証し、人間が検証します。次の単元でこのチェーンを確立します。
検証規律: 4 つのステップ
AI の各出力をラボまたはレポートに入力する前に、次の 4 つの手順を実行します。
- 構造: 分子/反応表記 (SMILES/InChI) は有効ですか?ツール(RDKit)で解析できますか?
- 番号: 分子量、化学量論、収率の計算は個別に (手動またはライブラリーによって) 検証されましたか?
- 出典: すべての主張と帰属は実際のデータベースで検証されていますか?
- 安全性: 手順の各試薬について SDS を読みましたか。危険な組み合わせはありますか?
注: これらの 4 つの手順は、「時々」ではなく「常に」適用されます。 AI が正しい 20 の状況は、AI が間違っている 1 つの状況を許すものではありません。なぜなら、化学では、その状況とは爆発、中毒、撤回された論文などである可能性があるからです。
よくある間違い
- AIの出力を「リソース」と勘違いする。 AI はリソースではなく、リソースを (場合によっては間違って) 記憶しようとするジェネレーターです。ソースデータベースです。
- 番号を信頼します。分子量、pKa、沸点などの数値を検証せずに使用します。これらは決定論的に計算/検索できます。言語モデルに質問するのは最も弱い方法です。
- セキュリティを AI にアウトソーシングします。 「AIは危険だとは言っていない」からといって、それが安全であるとは限りません。危険性評価は人間と SDS の仕事です。
- 曖昧なプロンプト。分子をその名前ではなく構造によって与えます (SMILES/InChI)。これにより、名前の混乱により不正確な分子が生成されます。
- たった一度の試みを信じて。同じ質問を別の方法で再度質問し、一貫性を確認しません。
要約すると
- AI は化学における強力なデスクアシスタントです。コード、概要、説明、スキャンスケルトンを生成します。しかし、研究室はそれを行わず、その出力を検証しません。
- 偽の化合物/数値、偽の帰属、セキュリティ上の誤りという 3 つの固有のリスクがあります。
- 一般的な言語モデルと決定論的化学ツール (RDKit、データベース) を分離して組み合わせます。
- 構造 – 番号 – ソース – セキュリティの 4 つのステップを通じて各出力を取得します。
- 適切なプロンプト: 役割、明示的な構造表現、コンテキスト、タスク、検証制約が含まれます。
アプリケーションタスク
自分で研究した分子を選択してください (例: アスピリン、SMILES: CC(=O)Oc1ccccc1C(=O)O)。 AI に 3 つのことを質問します: (1) 分子量、(2) 2 つの参考論文、(3) 合成ステップ。次に、それぞれを個別に検証します。式から分子量を手動で計算し、DOI で引用を確認し、安全な目で合成ステップを検査します。どの出力が正しく出力され、どの出力に修正が必要でしょうか?半ページの「検証記録」を保管します。
チェックリスト
- [ ] AI は化学者ではなくアシスタントであることに気づきました。
- [ ] 私は例を挙げて、捏造、虚偽の帰属、不信感のリスクを認識しています。
- [ ] 私は言語モデルと決定論的化学ツールを区別できます。
- [ ] 構造 – 番号 – ソース – セキュリティの 4 つのステップを各出力に適用します。
- [ ] 私は分子を名前ではなく構造表記 (SMILES/InChI) で説明します。
- [ ] 少なくとも 1 つの検証ログを保存しました。