หน่วย
1. ปัญญาประดิษฐ์เบื้องต้นทางชีววิทยา: บทบาท ขอบเขต การตรวจสอบความถูกต้อง และจริยธรรม 2. พื้นฐานการวิเคราะห์ข้อมูลทางชีวภาพด้วย Python 3. การวิเคราะห์ลำดับและชีวสารสนเทศศาสตร์: DNA, RNA และโปรตีน 4. ข้อมูล Omics และการวิเคราะห์มิติสูง 5. โครงสร้างโปรตีนและ AlphaFold: ชัยชนะของปัญญาประดิษฐ์ในชีววิทยา 6. การวิเคราะห์รูปภาพและการระบุประเภท/เซลล์ 7. การออกแบบเชิงทดลอง: การสร้างแผนการที่มั่นคงด้วยปัญญาประดิษฐ์ 8. การวิเคราะห์ข้อมูลและการตรวจสอบความถูกต้องทางสถิติ 9. การแสดงภาพทางวิทยาศาสตร์: การแสดงข้อมูลอย่างตรงไปตรงมาและเข้าใจได้ 10. การทบทวนวรรณกรรมและการเขียนทางวิทยาศาสตร์ 11. จริยธรรม ความปลอดภัยทางชีวภาพ การรักษาความลับ และความซื่อสัตย์ทางวิทยาศาสตร์
หน่วย 5 / 11

โครงสร้างโปรตีนและ AlphaFold: ชัยชนะของปัญญาประดิษฐ์ในชีววิทยา

กำไร:

  • ทำความเข้าใจระดับโครงสร้างโปรตีนและโครงสร้างที่ AlphaFold คาดการณ์จากลำดับ
  • ความสามารถในการอ่านคะแนนความเชื่อมั่นของ pLDDT และ PAE ได้อย่างถูกต้อง และตีความพื้นที่ความเชื่อมั่นต่ำว่า 'ไม่แน่นอน/ยืดหยุ่น' แทนที่จะเป็น 'ไม่ถูกต้อง'
  • เข้าใจความจำเป็นในการตรวจสอบความถูกต้องของการทำนายโครงสร้างด้วยหลักฐานการทดลอง (PDB, การทดสอบกิจกรรม) ในการตัดสินใจที่มีผลกระทบสูง

โปรตีนเป็นโมเลกุลที่ทำงานของเซลล์ เอนไซม์เร่งปฏิกิริยา ผู้ขนส่งจะเคลื่อนย้ายโมเลกุลไปรอบๆ โปรตีนที่มีโครงสร้างทำให้เซลล์ดำเนินต่อไป สิ่งที่โปรตีนทำนั้นขึ้นอยู่กับรูปร่าง (โครงสร้าง) พับสามมิติของมัน เป็นเวลาหลายทศวรรษมาแล้วที่การทำนายโครงสร้างของโปรตีนจากลำดับของมันถือเป็นปัญหาที่ยากที่สุดในวิชาชีววิทยา ในปี 2021 ระบบปัญญาประดิษฐ์ของ DeepMind ที่เรียกว่า AlphaFold ได้ก้าวกระโดดครั้งประวัติศาสตร์ในปัญหานี้ โดยคาดการณ์ว่าโครงสร้างของโปรตีนหลายร้อยล้านชนิดจะมีความแม่นยำใกล้เคียงกับการทดลอง ในหน่วยนี้ เราจะพูดถึงวิธีใช้ AlphaFold และเครื่องมือที่คล้ายกันจากมุมมองของนักชีววิทยา และคุณสามารถไว้วางใจผลลัพธ์ของมันได้มากน้อยเพียงใด

นี่คือความสำเร็จที่เป็นรูปธรรมที่สุดของปัญญาประดิษฐ์ในด้านชีววิทยา แต่แม้แต่เครื่องมือคาดการณ์ก็มีข้อจำกัดและจำเป็นต้องตรวจสอบความถูกต้อง

ระดับโครงสร้างโปรตีน

  • โครงสร้างปฐมภูมิ: ลำดับกรดอะมิโน (ลำดับตัวอักษร)
  • โครงสร้างรอง: พับเฉพาะ; เช่น อัลฟาเฮลิกส์ และเบต้าชีต
  • โครงสร้างระดับตติยภูมิ: รูปร่าง 3 มิติของห่วงโซ่ทั้งหมด
  • โครงสร้างควอเทอร์นารี: การรวมกันของหลายโซ่

AlphaFold ทำนายโครงสร้างระดับอุดมศึกษา (รูปร่าง 3 มิติ) จากโครงสร้างหลัก (ลำดับ) โดยทำสิ่งนี้ผ่านรูปแบบที่เรียนรู้จากการจัดตำแหน่ง (MSA) ของลำดับที่เกี่ยวข้องกับวิวัฒนาการ

กำลังอ่านเอาต์พุต AlphaFold

AlphaFold ไม่เพียงแต่ให้โครงสร้างเท่านั้น นอกจากนี้ยังให้คะแนนความมั่นใจสำหรับการทำนายแต่ละครั้งอีกด้วย การทำความเข้าใจสิ่งเหล่านี้เป็นกุญแจสำคัญในการไม่ไว้วางใจอย่างสุ่มสี่สุ่มห้า:

  • pLDDT: คะแนนความเชื่อมั่นเฉพาะที่ระหว่าง 0-100 สำหรับกรดอะมิโนแต่ละตัว ค่าที่มากกว่า 90 ถือว่าเชื่อถือได้มาก 70-90 ถือว่าเชื่อถือได้ 50-70 ไม่แน่ใจ ส่วนค่าที่ต่ำกว่า 50 น่าจะเป็นภูมิภาคที่ไม่เป็นระเบียบ
  • PAE (ข้อผิดพลาดที่คาดการณ์ไว้): ความเชื่อมั่นตำแหน่งสัมพัทธ์ระหว่างโดเมน; มันแสดงให้เห็นว่าการวางตำแหน่งโดเมนที่สัมพันธ์กันนั้นมีความน่าเชื่อถือเพียงใดในโปรตีนหลายโดเมนขนาดใหญ่
เคล็ดลับ: เมื่อคุณเห็นพื้นที่ที่มี pLDDT ต่ำ (ไม่ใช่สีน้ำเงิน สีส้ม/แดง) ในโมเดล AlphaFold ให้อ่านว่า "คลุมเครือหรือยืดหยุ่น" แทนที่จะเป็น "ไม่ถูกต้อง" บริเวณเหล่านี้มักเป็นชิ้นส่วนโปรตีนที่ไม่เป็นระเบียบและมีความสำคัญทางชีวภาพ

ทีละขั้นตอน: ตรวจโปรตีนด้วย AlphaFold

  1. ค้นหาลำดับ: รับลำดับโปรตีนของคุณจาก UniProt
  2. รับโครงสร้าง: ค้นหาใน AlphaFold DB (พร้อมสำหรับโปรตีนส่วนใหญ่) หรือรันด้วย ColabFold
  3. ประเมินความมั่นใจ: ดูที่ pLDDT และ PAE; ภูมิภาคไหนเชื่อถือได้?
  4. แสดงภาพ: ตรวจสอบในแบบ 3 มิติด้วย PyMOL หรือ py3Dmol
  5. ตีความ: ประเมินขอบเขตการทำงาน เช่น ไซต์ที่ใช้งานอยู่ กระเป๋าเข้าเล่ม
  6. ตรวจสอบ: เปรียบเทียบโครงสร้างการทดลอง (X-ray/cryo-EM ใน PDB) หากมี

ปัญญาประดิษฐ์ (LLM) เขียนโค้ดในขั้นตอนเหล่านี้ (การแสดงภาพด้วย py3Dmol การสรุปคะแนน) และอธิบายแนวคิด AlphaFold นั้นเป็นแบบจำลองการทำนายโครงสร้างแบบแยกส่วน LLM ช่วยคุณตีความผลลัพธ์

เทมเพลตพร้อมท์ที่คัดลอกได้

บทบาท: คุณเป็นผู้ช่วยชีววิทยาโครงสร้าง ภารกิจ: อธิบายคะแนน AlphaFold pLDDT และ PAE ให้กับนักศึกษาระดับบัณฑิตศึกษา อธิบายว่าแต่ละคะแนนใช้วัดอะไร เกณฑ์ใดที่ถือว่าเชื่อถือได้ และควรตีความภูมิภาคที่มีคะแนนต่ำอย่างไร

ฉันจะรันลำดับโปรตีนที่ได้รับจาก UniProt ใน ColabFold ได้อย่างไร อธิบายขั้นตอนและการจำกัดทรัพยากร/เวลาที่ฉันจำเป็นต้องทราบ ความยาวลำดับ: [N] กรดอะมิโน

เขียนโค้ด Python ที่แสดงภาพไฟล์ PDB (predicted.pdb) ในรูปแบบ 3 มิติ และกำหนดสีตามคะแนน pLDDT ด้วย py3Dmol ปล่อยให้มันทำงานใน Jupyter พร้อมความคิดเห็น

ฉันมีการคาดการณ์ AlphaFold และโครงสร้างการทดลองจาก PDB ให้รหัสและความคิดเห็นที่จัดแนวทั้งสองและคำนวณ RMSD (ค่าเบี่ยงเบนกำลังสองเฉลี่ย) อธิบายว่ามีอังสตรอมต่ำกว่า RMSD จำนวนเท่าใดจึงถือว่าดี

พรอมต์อ่อน / พรอมต์แรง

อ่อนแอ: "บอกรูปร่างของโปรตีนนี้หน่อยสิ"

แข็งแกร่ง: "ฉันตรวจสอบโมเดล AlphaFold ของโปรตีน UniProt P04637 (human p53) โดเมนการจับ DNA มี pLDDT สูง (>90) ปลายทาง N และปลายทาง C มี pLDDT ต่ำ (<50) ฉันจะตีความรูปแบบนี้ได้อย่างไร อธิบายความเป็นไปได้ที่จุดสิ้นสุดที่มีคะแนนต่ำนั้นเป็นภูมิภาคที่ไม่เป็นระเบียบและมีความสำคัญเชิงการทำงานของสิ่งนี้ โดยไม่ต้องอ้างโครงสร้างที่แน่ชัด"

ความแตกต่าง: ข้อความแจ้งที่ทรงพลังประกอบด้วยโปรตีนจริง รูปแบบคะแนนจริง และการขอความคิดเห็น โมเดลจะตีความข้อมูลที่คุณให้มาแทนที่จะ "จดจำ" ข้อมูลนั้น

มินิเคสสามอัน

กรณีที่ 1 — การเข้าใจผิดว่าบริเวณที่ไม่เป็นระเบียบเนื่องจากข้อผิดพลาด: นักเรียนคนหนึ่งกำจัดบริเวณ pLDDT ต่ำที่ส่วนท้ายของโปรตีนเพราะ “AlphaFold เดาผิด” อย่างไรก็ตาม ภูมิภาคนั้นก็เป็นพื้นที่ที่มีการเปิดใช้งานผิดปกติเช่นกันจากการทดลอง นักเรียนตีความภูมิภาคได้อย่างถูกต้องเมื่อแบบจำลองอธิบายว่า pLDDT ที่ต่ำมักจะสะท้อนถึงความยืดหยุ่นที่แท้จริง

กรณีที่ 2 — ผลกระทบจากการกลายพันธุ์เกินจริง: นักวิจัยอ้างว่าการเปลี่ยนแปลงกรดอะมิโนเพียงครั้งเดียวทำให้เกิด "ความแตกต่างอย่างมาก" ในรูปแบบ AlphaFold อย่างไรก็ตาม AlphaFold ไม่สามารถทำนายผลความเสถียรของการกลายพันธุ์แบบจุดเดียวได้อย่างน่าเชื่อถือ ความแตกต่างอาจเป็นเสียงรบกวนของรุ่น โมเดลเรียกคืนขีดจำกัดนี้และนำไปสู่เครื่องมือเฉพาะ (เช่น เครื่องมือคาดการณ์ความเสถียร)

กรณีที่ 3 — ได้มาจากการตรวจสอบความถูกต้อง: ทีมจัดแนวการทำนาย AlphaFold กับโครงสร้างการทดลองใน PDB RMSD กลายเป็น 1.2 อังสตรอม (เหมาะสมมาก) สิ่งนี้ทำให้พวกเขาสามารถพึ่งพาการทำนายและตั้งสมมติฐานเกี่ยวกับกระเป๋าที่มีผลผูกพัน และออกแบบการทดลองตามนั้น การตรวจสอบความน่าเชื่อถือที่สมเหตุสมผล

แผนภูมิเปรียบเทียบ

คะแนน/แนวคิด

มีมาตรการอะไร

เกณฑ์ที่เชื่อถือได้

pLDDT

ความไว้วางใจในอาคารท้องถิ่น (0-100)

>90 ดีมาก <50 ไม่ปกติ

พีเออี

ความน่าเชื่อถือสถานที่ตั้งข้ามโดเมน

ต่ำ(เข้ม)กำลังดี

RMSD

ข้อตกลงกับการทดลอง (อังสตรอม)

<2 Å โดยทั่วไปดี

ข้อผิดพลาดทั่วไป

  • การพิจารณา pLDDT ที่ต่ำว่าเป็น "ข้อบกพร่อง": โดยทั่วไปแล้ว จะเป็นบริเวณที่ไม่เป็นระเบียบ/ยืดหยุ่นได้ โปรดอย่าลบออก
  • รับประกันเอฟเฟกต์การกลายพันธุ์เดี่ยวด้วย AlphaFold: ไม่ใช่เครื่องมือที่เหมาะสมสำหรับงาน
  • การเพิกเฉยต่อคะแนนความเชื่อมั่น: สมมติว่าแบบจำลองทั้งหมดมีความน่าเชื่อถือเท่ากัน
  • การข้ามโครงสร้างการทดลอง: หากมีโครงสร้างจริงใน PDB อย่าลืมเปรียบเทียบด้วย
  • การตีความเครือข่ายที่ซับซ้อน/หลายเครือข่ายเป็นห่วงโซ่เดียว: การโต้ตอบต้องใช้โหมดพิเศษ (AlphaFold-Multimer)
ข้อควรระวัง: AlphaFold เป็นเครื่องมือที่น่าทึ่ง แต่เป็นการคาดเดา ไม่ใช่ความเป็นจริงเชิงประจักษ์ การตัดสินใจที่มีผลกระทบสูงเป็นพิเศษ เช่น เป้าหมายยาใหม่ ตำแหน่งที่มีผลผูกพัน หรือผลการกลายพันธุ์ ไม่ควรดำเนินการโดยไม่สนับสนุนการทำนายด้วยหลักฐานการทดลอง (โครงสร้าง การทดสอบฤทธิ์)

จากโครงสร้างสู่การใช้งาน: เห็นกระเป๋าเพียงพอหรือไม่?

การได้รับโครงสร้าง 3 มิติของโปรตีนนั้นน่าตื่นเต้น แต่โครงสร้างเพียงอย่างเดียวไม่ได้บอกคุณถึงการทำงาน คุณสามารถดูตำแหน่งที่ทำงานอยู่ (ช่องที่สารตั้งต้นจับกัน) ของเอนไซม์ อย่างไรก็ตาม โครงสร้างไม่ได้ระบุว่าโมเลกุลใดเกาะอยู่ ทำงานเร็วแค่ไหน หรืออยู่ที่ตำแหน่งใดในเซลล์ AlphaFold เป็นจุดเริ่มต้น: สร้างสมมติฐาน (“กระเป๋านี้อาจผูก ATP”) การทดลองจะทดสอบ AI ช่วยให้คุณกำหนดสมมติฐานเหล่านี้และเขียนโค้ดที่วิเคราะห์โครงสร้าง แต่การอ้างฟังก์ชันจำเป็นต้องมีหลักฐานเชิงประจักษ์

การใช้งานที่มีประสิทธิภาพอีกอย่างหนึ่งคือการเปรียบเทียบโครงสร้าง แม้ว่าลำดับของโปรตีนทั้งสองจะแตกต่างกันมาก แต่โครงสร้างของพวกมันก็อาจจะคล้ายกัน นี่เป็นเบาะแสของความสัมพันธ์ทางวิวัฒนาการที่ห่างไกลหรือการทำงานร่วมกัน เครื่องมืออย่าง Foldseek จะมองหาความคล้ายคลึงกันของโครงสร้างอย่างรวดเร็ว โมเดลช่วยให้คุณตีความผลลัพธ์ของเครื่องมือเหล่านี้และเขียนโค้ดเปรียบเทียบ

จัดโครงสร้าง AlphaFold ของโปรตีนสองตัวให้สอดคล้องกับ Bio.PDB คำนวณ RMSD และรายงานว่าบริเวณใดทับซ้อนกันและส่วนใดแยกออกจากกัน แสดงความคิดเห็นว่าความคล้ายคลึงกันของโครงสร้างเป็นเบาะแสของความสัมพันธ์เชิงหน้าที่ แต่ไม่ใช่หลักฐาน

เชิงซ้อน ปฏิสัมพันธ์ และขอบเขต

โปรตีนไม่ได้ทำงานโดยลำพัง แต่บ่อยครั้งทำงานร่วมกับพันธมิตร (โปรตีนอื่นๆ, DNA, โมเลกุลขนาดเล็ก) AlphaFold-Multimer สามารถทำนายโปรตีนเชิงซ้อนได้ แต่เพียงอย่างเดียวไม่เพียงพอสำหรับพลังและความเป็นจริงของการมีปฏิสัมพันธ์ เมื่อแบบจำลองทำนายว่า “โปรตีนสองตัวมีปฏิสัมพันธ์กัน” นี่เป็นสมมติฐานเบื้องต้น ควรได้รับการยืนยันโดยการทดลอง เช่น co-immunoprecipitation (co-IP) ใช้ AI เพื่อทำความเข้าใจว่าเครื่องมือเหล่านี้เหมาะสมตรงไหนและประเมินความเชื่อมั่นของผลลัพธ์ คะแนนความเชื่อมั่น (โดยเฉพาะอินเทอร์เฟซ PAE) มีความสำคัญมากกว่าที่เคยในการคาดการณ์ที่ซับซ้อน

AlphaFold ไม่ใช่ตัวเลือกเดียว

แม้ว่า AlphaFold จะเป็นผู้บุกเบิก แต่ก็ไม่ใช่เครื่องมือเดียวเท่านั้น ESMfold (Meta) ทำการทำนายอย่างรวดเร็วจากลำดับเดียว โดยไม่ต้องมีการจัดแนววิวัฒนาการ เหมาะสำหรับการสแกนชุดลำดับขนาดใหญ่ แต่โดยทั่วไปจะมีความแม่นยำน้อยกว่า AlphaFold เล็กน้อย RoseTTAFold เป็นอีกหนึ่งทางเลือกที่ทรงพลัง AlphaFold3 และเวอร์ชันที่ใหม่กว่าที่คล้ายกันยังรวมถึงโปรตีนเชิงซ้อนของโปรตีน-ลิแกนด์และกรดนิวคลีอิกของโปรตีนด้วย คุณสามารถปรึกษา AI ว่าเครื่องมือใดที่เหมาะกับปัญหาการก่อสร้าง (ความเร็วหรือความแม่นยำ โซ่เดี่ยวหรือซับซ้อน) แต่อย่าลืมอ่านเกณฑ์ชี้วัดความน่าเชื่อถือของเครื่องมือแต่ละรายการตามขนาดของตัวเอง สิ่งที่ถือว่าคะแนน "ดี" ในเครื่องมือหนึ่งจะได้รับการตีความต่างกันในอีกเครื่องมือหนึ่ง

โดยสรุป

AlphaFold ปฏิวัติชีววิทยาโดยการทำนายโครงสร้างโปรตีนจากลำดับของมัน อย่างไรก็ตาม ควรอ่านผลลัพธ์ร่วมกับคะแนนความเชื่อมั่น (pLDDT, PAE) เขตความเชื่อมั่นต่ำควรตีความว่า "ไม่แน่นอน/ยืดหยุ่น" มากกว่า "ไม่ถูกต้อง" ปัญญาประดิษฐ์ (LLM) ช่วยคุณอธิบายคะแนนเหล่านี้ เขียนโค้ดการแสดงภาพ และเปรียบเทียบกับโครงสร้างการทดลอง สำหรับการตัดสินใจที่มีผลกระทบสูง การทำนายต้องได้รับการสนับสนุนจากหลักฐานเชิงประจักษ์

งานสมัคร

เลือกโปรตีน (เช่น เอนไซม์ที่คุณสนใจ) ค้นหาอาร์เรย์จาก UniProt และโครงสร้างจาก AlphaFold DB ให้ AI เขียนและรันโค้ดด้วย py3Dmol ที่สร้างสีโครงสร้างตาม pLDDT ระบุโซนปลอดภัยสูงและต่ำ ให้แบบจำลองตีความความสำคัญทางชีวภาพที่เป็นไปได้ของบริเวณที่มีความมั่นใจต่ำ และตรวจสอบโครงสร้างการทดลองใน PDB

รายการตรวจสอบ

  • [ ] ฉันประเมินโครงสร้างร่วมกับคะแนน pLDDT/PAE
  • [ ] ฉันตีความโซนความมั่นใจต่ำว่า "ไม่แน่นอน/ยืดหยุ่น" ไม่ใช่ "ข้อผิดพลาด"
  • [ ] ฉันไม่มั่นใจใน AlphaFold มากนักสำหรับเอฟเฟ็กต์การกลายพันธุ์เดี่ยว
  • [ ] ฉันเปรียบเทียบกับโครงสร้างการทดลอง (PDB) ถ้ามี
  • [ ] ฉันคิดถึงเครื่องมือที่เหมาะสมสำหรับ polychain/complex
  • [ ] ฉันสนับสนุนการตัดสินใจที่มีผลกระทบสูงด้วยหลักฐานเชิงประจักษ์