ユニット 7 / 11

分子特性の予測と QSAR: 分解能、pKa およびモデル限界

利益:

  • 決定論的に計算された特徴と統計的に推定された特徴を区別し、信頼レベルを決定する能力
  • 適用領域の概念を使用して、モデルが信頼できる領域を評価する機能
  • 特性予測を使用して候補者をランク付けし、実験を通じて最終決定を下す必要があることを理解する能力。

分子を合成する前に、私たちはよく「それは水溶性ですか? 酸性はどの程度ですか? 細胞膜を通過しますか? 薬剤候補として妥当ですか?」と尋ねます。実験前にこれらの質問に対する答えを予測しておくと、時間を大幅に節約できます。 AI とその特殊なモデル (特に QSAR — 定量的構造活性関係、つまり分子の構造記述子から特性を予測する統計モデル) は、これらの予測に強力です。ただし、これらの予測は確率の予測であり、測定値ではありません。この単元では、特徴予測、その長所、そして最も重要な概念である適用可能ゾーン (モデルが信頼できる領域) について学びます。

どのような特徴が予測されますか?

  • logP: 分子の油/水分配係数。親油性(脂肪を好む性質)を示します。薬物の吸収に重要です。
  • 溶解度 (logS): 水への溶解度。
  • pKa: 酸性/アルカリ性。基がイオン化する pH。
  • TPSA: トポロジカル極表面積。透水係数の推定に使用されます。
  • リピンスキーの「5 つのルール」: 経口薬候補の分子量、logP、水素結合ドナー/アクセプターの数の実用的なしきい値。

これらの値の一部は、RDKit などのツールを使用して決定論的に計算されます (TPSA、水素結合数など)。それらの一部は統計的推定値 (logS、生物学的活性) です。この違いを知ることで、どれだけ信頼できるかが決まります。

ヒント: 特徴が「計算済み」(ルールベース、再現可能) か「予測」(モデルから、不確実) かを区別します。計算には高い自信を持ち、予測には慎重な自信を持ち、実験によって予測を検証します。

適用範囲:最も重要な概念

QSAR モデルは、トレーニングされた分子に類似した分子に対して適切に機能します。トレーニング データとは大きく異なる分子 (たとえば、非常に大きくて珍しい骨格) を指定した場合でも、モデルは数値を生成しますが、その数値は信頼できません。これを「適用範囲外」といいます。モデルは常に答えを与えます。答えが信頼できるかどうかを判断するのはあなたの仕事です。

言語モデルが属性値を与える場合はさらに危険です。基礎的な計算を行わずに、「ありそうな」値として数値を生成します。したがって、可能であれば、言語モデルからではなく、不確実性を与える決定論的ツール (RDKit) または QSAR モデルから特徴値を取得します。

ステップバイステップ: 安全な機能の予測

  1. 分子の検証: RDKit を使用して SMILES を解析します (ユニット 2)。
  2. 決定論的なものを計算します: MA、logP (計算)、TPSA、RDKit からの水素結合数。
  3. 予測を個別にマークする: logS、アクティビティなどのモデル予測を「予測」タグで保持します。
  4. 適用範囲を確認します。分子はトレーニング データと似ていますか?非常に大きい/異常ですか?
  5. 決定ではなくランキングに使用する: 予測を使用して候補をランク付けします。究極の選択は実験です。
  6. 実験によるクローズアップ: 重要な特性 (溶解度、pKa) を測定によって検証します。

コピー可能な 4 つのテンプレート

1) RDKit の決定論的機能:

from rdkit import Chemfrom rdkit.Chem import Descriptors, rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1ccccc1C(=O)O") # aspirinprint("MA:",round(Descriptors.MolWt(mol),2))print("logP (計算済み):", round(Descriptors.MolLogP(mol),2))print("TPSA:",round(Descriptors.TPSA(mol),1))print("水素結合ドナー:", rdMolDescriptors.CalcNumHBD(mol))print("水素結合アクセプター:", rdMolDescriptors.CalcNumHBA(mol))

2) リピンスキールールの評価:

分子 (SMILES): [SMILES]タスク: RDKit から計算される MA、logP、HBD、HBA 値を使用してリピンスキー ルールの 5 への準拠を評価します。各基準を個別に合格/不合格としてマークします。ルール: 数字をでっち上げないでください。 RDKit から取得します、コメントします。

3) 特徴推定 + 不確実性の要求:

分子 (SMILES): [SMILES]タスク: 水溶解度 (logS) (高/中/低) の定性的推定を行い、構造的特徴を使用して理論的根拠を説明します。正確な数字は言わないでください。これは予測であり、実験によって確認する必要があることを述べます。分子に異常な構造がある場合は警告します (適用可能性リスク)。

4) 候補ランキング(予測による優先順位付け):

以下は 5 つの分子の SMILES です。タスク: 構造的特徴 (極性基、環、親油性の数) に基づいて、水溶性の観点からそれらをランク付けします (最も溶解度が高いものから最も低いものまで)。各ランク付けの決定の根拠を書いてください。注: これは予備的な並べ替えです。最終的な選定は実測により行います。

弱いプロンプト / 強いプロンプト

弱い:

この分子の溶解度はどれくらいでしょうか?

AI は計算上存在しない数値をでっち上げます (例: 「12 mg/mL」)。それは自信を与えますが、間違っている可能性があります。

強い:

分子 (SMILES): [SMILES]。タスク: 1) RDKit で計算される logP、TPSA、HBD/HBA を与えます: [値]。2) これらの値に基づいて、解像度が高/中/低かを解釈します。3) 正確な数値を与えます。それは推測であり、実験が必要であることを述べてください。

違いは、車両から決定論的な値を取得し、AI にそれを解釈させるだけでした。私たちは不確実性と実験の必要性を明確に求めました。

機能の種類と信頼レベル

特徴

入手方法

信頼

メモ

分子量

RDKit (決定論的)

非常に高い

式から切り出す

TPSA、HBD/HBA

RDKit (決定論的)

高い

ルールベースの

logP (計算値)

RDKitモデル

中~高

実験的なものから逸脱する可能性があります

logS (解像度)

QSAR推定値

中程度

適用範囲に応じて異なります

pKa

スペシャルモデル

中程度

複雑な構造に陥ってしまいます

生物活性

QSAR/ML

変数

必ずテストして検証してください

ミニケース

ケース 1 — 適合する解像度の数。学生が AI に化合物の溶解度について質問しました。彼は「25 mg/mL」という答えを受け取り、それに応じて実験計画を立てました。測定の実際の値は約 2 mg/mL で、10 倍の差がありました。 AIが数字をでっち上げたのだ。教訓: 解像度などのプロパティを言語モデルから数値として取得しないでください。定性的な予測 + 測定。

ケース 2 — 適用範囲外。 QSAR モデルでは、トレーニング セットとは大きく異なる大きな高分子の「活性が高い」と報告されました。ユーザーは、分子がトレーニング データに似ていないことに気づき、予測は信頼できないと判断しました。実験では活性が非常に低かった。教訓: モデルは常に応答します。範囲外の場合、回答は無意味です。

ケース 3 — リピンスキーの正しい使用。 1 つの候補分子について、AI は RDKit の値である MA 512 (>500、境界線)、logP 4.8 (良好)、HBD 2、HBA 7 を使用してリピンスキーを評価しました。ユーザーは「1 つの基準は残っているが、ルールは絶対的ではない」と正しく解釈し、分子を完全に削除しませんでした。教訓: ルールはガイドラインであり、しきい値ではありません。文脈を踏まえて解釈する。

よくある間違い

  • 言語モデルから機能数を取得します。計算されていない値は捏造されます。不確実性のある決定論的なツールまたはモデルを使用します。
  • 適用分野は無視。モデルは各分子の数値を生成します。フィールド外では信頼できない。
  • 推定測定値を考慮します。 logS は推定値です。これは実験的な解決策に代わるものではありません。
  • リピンスキーが絶対ルールだと考える。境界線上にある候補者は自動的に排除されません。多くの薬物は規則に違反しています。
  • 「計算済み」と「推定」を混同しています。 TPSA は計算され (信頼性があり)、アクティビティは推定されます (不確実)。
注意: 特徴予測は、候補のランク付けと優先順位付けに最適です。ただし、単独で決定を下すことはできません。 「モデルは可溶性であると言っている」は仮説です。 「計ってみたら、溶けました」という結果です。

要約すると

  • 分子の特性は実験前に予測できるため、時間を大幅に節約できます。
  • いくつかの特徴は決定論的に計算され (MA、TPSA、HBD/HBA)、いくつかは統計的推定値 (logS、アクティビティ) です。
  • 適用性の領域は最も重要な概念です。モデルは常に応答しますが、領域の外では信頼性がありません。
  • 言語モデルではなく、RDKit または曖昧さモデルから機能数を取得します。
  • 予測を使用して候補をランク付けします。実験して最終決定を下してください。

アプリケーションタスク

5 つの分子 (例: 薬物シリーズ) を選択します。 RDKitでそれぞれのMA、logP、TPSA、HBD、HBAを計算し、Lipinskiを評価します。別途、AI に各分子の溶解度の定性的推定 (数値ではない) と適用分野の警告を要求します。決定的な値と AI 予測をテーブルに収集します。どの分子が最も薬物らしいプロファイルを示しましたか?不確実性が最も高いのはどこですか?

チェックリスト

  • [ ] 私は決定論的な計算されたプロパティと予測されたプロパティを区別します。
  • [ ] 言語モデルではなく、RDKit/モデルからプロパティ値を取得しています。
  • [ ] 適用範囲外の分子に気づきました。
  • [ ] 私はリピンスキーをガイドとして使用しており、絶対的な規則ではありません。
  • [ ] ランキングの予測と実験の決定に使用します。
  • [ ] 重要な機能を測定によって検証する計画があります。