ユニット 4 / 11

タンパク質構造と AlphaFold: 構造の予測、信頼スコア、および検証の読み取り

利益:

  • AlphaFold の働き、pLDDT や PAE などの信頼スコア、構造が「予測」であることを理解し、人工知能で構造を正しく解釈できる
  • 信頼度スコアが低い領域 (柔軟/不規則) を認識し、過剰解釈を回避し、実験的証拠と比較する能力
  • 構造予測を仮説として扱い、機能的主張を実験的検証に結び付けるという規律を適用する能力。

タンパク質の働きを理解するには、多くの場合、その三次元の折り畳まれた構造を知ることが必要です。なぜなら機能は構造から生まれるからです。何十年もの間、実験(X 線結晶構造解析や極低温電子顕微鏡)でタンパク質の構造を決定するには、数か月から数年かかりました。 AlphaFold (アミノ酸配列からタンパク質の構造を予測する DeepMind が開発した人工知能システム) はこれを数分に短縮し、数億個のタンパク質の予測構造を公開しました。この単元では、AlphaFold 出力の読み取り方法、信頼スコアの解釈方法、およびこの解釈で LLM を安全に使用する方法を学習します。

重要な違い: AlphaFold は構造予測ツールであり、その出力は予測であり、実験的真実ではありません。 LLM (ChatGPT のようなチャット モデル) は、AlphaFold 自体ではありません。タンパク質の座標を「記憶」することはできません。 LLM を使用して AlphaFold 出力を解釈および説明します。 AlphaFold データベースまたはツールから構造自体を取得します。

基本的な概念

  • 一次構造:アミノ酸配列(タンパク質の文字鎖)。
  • 二次・三次構造:ヘリックス(アルファヘリックス)、シート(ベータシート)、鎖の三次元折り構造。
  • pLDDT: 各アミノ酸の AlphaFold の局所信頼度スコア (範囲は 0 ~ 100)。90+ は非常に高い信頼性を意味し、70 ~ 90 は良いことを意味し、50 ~ 70 は低いことを意味し、50 未満は非常に低い信頼性を意味します。低 pLDDT の領域は、一般に「無秩序な」領域 (明確なひだのない) です。
  • PAE (Predicted Aligned Error): 2 つの領域の相対位置の予測誤差。これは、ドメインの配置が相互にどの程度信頼できるかを示します。
  • PDB: 実験タンパク質の構造が保存されるデータベースおよびファイル形式。

AlphaFold 出力の読み取り: ステップバイステップ

1. 正しいタンパク質と配列を選択します。 UniProt (タンパク質情報データベース) 番号でタンパク質を識別します。 AlphaFold データベースでこの番号の構造を見つけます。

2. pLDDT マップを確認します。構造のどの部分が高い信頼度で予測されているか (青)、どの部分が低い信頼度で予測されているか (オレンジ/黄色) を確認します。信頼性の低い領域のコメントには注意してください。

3. PAE チャートを読み取ります。 PAE は、マルチドメインタンパク質内のドメインの相対的な配置が信頼できるかどうかを示します。 PAE が高いということは、フィールドの相対的な位置が不確実であることを意味します。

4. 実験構造と比較します。可能な場合は、PDB 内の実験構造と一致します。 AlphaFold の予測が実験に近い場合、信頼度は高まります。

5. バリアント効果を解釈します。構造に対するアミノ酸変化の影響を解釈するときは、pLDDT とその領域 (活性部位、結合ポケット) の機能的重要性を合わせて考慮してください。

ヒント: pLDDT が低いことは必ずしも「間違った推測」を意味するわけではありません。それは多くの場合、その地域が実際に本質的に無秩序であることを示しています。したがって、信頼度が低いことは、正確な生物学的事実を反映している場合があります。これを区別するために、異常予測ツールを使用してシーケンスを確認することもできます。

ミニケース3個

ケース 1 — 低信頼ゾーンを拡大解釈する。ある学生は、AlphaFold 構造の「ループ」が特定のポケットに収まると主張し、AI がこれを確認しました。しかし、学生が pLDDT を見ると、そのステッチのスコアが 42 (非常に低い) であることがわかりました。したがって彼の立場は信頼できませんでした。申し立ては取り下げられた。教訓: コメントする前に必ずローカルの信頼スコアを確認してください。

ケース 2 — メイクアップコーディネート。研究者は LLM にタンパク質の特定のアミノ酸の 3D 座標を尋ねました。 LLM は小数点以下 3 桁まで説得力のある数字を与えました。研究者がそれらを AlphaFold PDB ファイル内の実際の座標と比較したところ、それらが完全に捏造されたものであることがわかりました。 LLM は座標を「記憶」できません。座標はファイルから読み取る必要があります。

ケース 3 — 確認が得られました。博士課程の学生は、ある変異体 (p.Gly12Val) がタンパク質の活性部位に近いかどうか疑問に思いました。 YZ は、活性部位残基が UniProt で指定されていることを思い出させました。学生は UniProt を開いて活性部位を見つけ、構造ビューア (PyMOL) で Gly12 が AlphaFold 構造のこの部位から 8 オングストローム離れていることを測定しました。数値測定は「近い」という主張を具体化しました。

例: 構造ファイルからの pLDDT の読み取り

# AlphaFold PDB ファイルでは、pLDDT は B-factor 列に格納されます。 from Bio.PDB import PDBParserimport numpy as npyapi = PDBParser(QUIET=True).get_struction("AF", "AF-P04637-F1.pdb")plddt = [ Structure.get_atoms() のアトムの atom.bfactor if atom.name == "CA"]print("Average pLDDT:", Round(np.mean(plddt), 1))print("信頼度が低い (<70) 残留率 (%):",round(100 * np.mean(np.array(plddt) < 70), 1))

これにより、コメントする前に構造の全体的な信頼性を数値で確認できます。

コピー可能な 4 つのテンプレート

1) 構造の解釈 (信頼度スコア付き):

あなたの役割: 構造生物学のアシスタント。 UniProt [数字] タンパク質の AlphaFold 構造を解釈するのを手伝ってください。これらの質問に答えますが、フィッティング/スコアの調整を行います: どの領域で pLDDT が高い/低いと予想されるか、PAE は何を示すか、実験構造 (PDB) はあるか、どのように比較すればよいですか?ファイルから値を読み取ります。

2) バリアント構造の効果:

次の変異体がタンパク質の構造に及ぼす影響の可能性を解釈するのを手伝ってください: [p.あからさまな「破壊的」主張の代わりに、どのような証拠を探すべきかを教えてください。

3) pLDDT/PAE の説明:

pLDDT と PAE の違い、バリアント解析ではどちらをいつ見るべきか、例を使って説明します。単一ドメインのタンパク質の場合とマルチドメインのタンパク質の場合を分けて考えてください。

4) 構造比較計画:

AlphaFold 予測と実験的な PDB 構造を比較したいと考えています。 RMSD (構造間の平均偏差) を計算する方法、どのツール (PyMOL、Biopython) で計算するか、どのしきい値が「良好なオーバーラップ」としてカウントされるか?段階的な計画を立てます。

弱いプロンプト / 強いプロンプト

弱者: 「このタンパク質の構造を描いて、p.Arg273His の効果を教えてください。」

問題: LLM は構造/フィット座標を描画できません。信頼スコアは考慮されません。決定的な効果があるという主張には根拠がないでしょう。

Strong: 「UniProt P04637 の AlphaFold ビルドを自分でダウンロードしました。UniProt で p.Arg273His 残基の pLDDT とその機能的アノテーションを見て、その効果をどのように解釈すべきかを段階的に教えてください。決定的な主張の代わりにどのような証拠を探すべきかを教えてください。」

強力な理由: 構造は情報源から取得され、信頼スコアが中心に置かれ、主張は証拠にリンクされます。

質問

AlphaFold は配送しますか?

確認できる場所・方法

3D 折り予測

はい

AlphaFold DB / ファイル

地元の信頼

はい (pLDDT)

B 因子カラム

ドメイン間のロケーション

はい (PAE)

PAEチャート

実験的な実際の構造

いいえ

PDB (実験的)

バリアントの正確な機能的影響

いいえ

機能研究+専門家

よくある間違い

  • 信頼度スコアをスキップします。低 pLDDT 領域の解釈は信頼できません。
  • 予測を経験的事実と取り違える。 AlphaFold の出力は推定値です。重要な決定には経験的な証拠が必要です。
  • LLM に座標を要求します。座標は記憶されるのではなく、ファイルから読み取られます。
  • PAEは無視します。マルチドメインタンパク質では、ドメインの相対的な位置が不確実な場合があります。
  • 自信が低いとすぐに「間違い」とみなします。場合によっては、その領域が非常に不均一になることがあります。
注意: AlphaFold ビルドでは「静的」イメージが表示されます。タンパク質は実際には複数の立体構造に入ることができる可動分子であることを思い出してください。動的動作を完全に反映する単一の構造はありません。

深さ: AlphaFold が構造的に静かな場所

AlphaFold は強力ですが、何ができないかを知っていれば、それを安全に使用することは半分は終わります。まず、標準の AlphaFold は単一のタンパク質を空間内で折り畳みます。リガンド、イオン、補因子、薬物分子はモデル化されません。酵素や基質の活性部位にある亜鉛イオンは構造には現れません。したがって、「このポケットは空で機能不全に陥っています」などのコメントは誤解を招く可能性があります。第 2 に、これは突然変異の影響を直接モデル化しません。同じ配列に近い 2 つのバリアントを導入したとしても、AlphaFold は通常、ほぼ同じ構造を生成します。 AlphaFold からの 2 つの予測を比較することによって、「この亜種は構造を破壊する」という主張を証明することはできません。第三に、翻訳後修飾(リン酸化、グリコシル化など)や膜内の膜タンパク質の実際の環境が考慮されていません。

好例: あるチームは、AlphaFold 画像から、キナーゼ酵素の ATP 結合ポケットに近い変異体が「ポケットを閉じる」と主張しました。人工知能も確認されました。実験的な結晶構造 (PDB) を開いたところ、AlphaFold がモデル化していないその領域の補因子がすでにポケットを形成しているようでした。変異体の効果はまったく異なるメカニズムによるものでした。 2 番目のケース: 研究者は、2 つのフィールド間の「ループ」が 2 つのフィールドを接続していると仮説を立てました。 PAE マップでは、これら 2 つのエリア間に高い誤差 (不明確な相対位置) が示されていたため、接続の主張には根拠がありませんでした。 PAE を読むことで、メカニズムの欠陥を防ぐことができました。

5) AlphaFold ボーダー コントロール テンプレート:

次の構造上の主張を検討する前に、この質問で AlphaFold のどのような制限が影響するかを列挙してください: [主張]。特にリガンド/イオン/補因子の欠損、変異モデリングの欠如、PAE の不確実性に関して、どのような追加の証拠 (実験構造、機能研究) が必要かを教えてください。

要約すると

  • AlphaFold は配列から構造を予測する強力なツールですが、その出力は推測です。信頼スコアと合わせて読む必要があります。
  • pLDDT はローカルの信頼を示し、PAE はクロスドメインの場所の信頼を示します。コメントする前に両方見てください。
  • LLM は座標や構造を「記憶」することができません。 AlphaFold/PDB から構造を取得し、コメントで LLM を使用します。
  • 重要な決定には経験的証拠と専門家の判断が不可欠です。

アプリケーションタスク

タンパク質 (よく研究されている腫瘍抑制因子など) の AlphaFold 構造を UniProt 番号でダウンロードします。上記のコード スニペットを使用して、平均 pLDDT と低安全残留率を計算します。次に、バリアントを選択し、AI に 2 番目のテンプレートを使用した解釈プランを依頼します。その残基の pLDDT と UniProt の機能アノテーションを自分で確認してください。自分の主張を数値的な信頼値に結び付けます。

チェックリスト

  • [ ] AlphaFold/PDB から UniProt 番号を使用して構造を取得しました。
  • [ ] コメントする前に pLDDT と PAE を読みました。
  • [ ] 私は LLM に座標/スコアを作成するよう依頼しませんでした。
  • [ ] バリアントの解釈を対応する残基の信頼スコアにリンクしました。
  • [ ] 可能な場合は実験構造と比較しました。
  • [ ] 私は専門家の判断と経験的証拠によってこの重大な決定を支持しました。