หน่วย
1. ปัญญาประดิษฐ์เบื้องต้นในอณูชีววิทยาและพันธุศาสตร์: บทบาท ขอบเขต การตรวจสอบความถูกต้อง จริยธรรม และความเป็นส่วนตัว 2. การวิเคราะห์ลำดับ DNA/RNA: การจัดตำแหน่ง ลวดลาย กรอบการอ่านแบบเปิด และชีวสารสนเทศพื้นฐาน 3. การตีความตัวแปร: การทำให้เกิดโรคโดยการกำหนด VCF, การกำหนด HGVS และเกณฑ์ ACMG 4. โครงสร้างโปรตีนและ AlphaFold: การทำนายโครงสร้างการอ่าน คะแนนความเชื่อมั่น และการตรวจสอบความถูกต้อง 5. การสนับสนุนการออกแบบ CRISPR: การเลือก gRNA ผลกระทบนอกเป้าหมาย และการตรวจสอบการทดลอง 6. การวิเคราะห์ข้อมูล Omics: RNA-seq, การแสดงออก, สถิติ และการเพิ่มคุณค่าของเส้นทาง 7. การทบทวนวรรณกรรมและการเขียนทางวิทยาศาสตร์: การตรวจสอบแหล่งที่มาและความเสี่ยงของการอ้างอิงที่เป็นเท็จ 8. การตีความทางคลินิก: การรายงาน การอนุมัติจากผู้เชี่ยวชาญ การตรวจสอบความถูกต้อง และข้อจำกัด 9. วินัยของอาการประสาทหลอนและการรับรองความถูกต้อง: ยีนที่สร้างขึ้น ลำดับ ความหลากหลาย และการระบุแหล่งที่มา 10. จริยธรรม ความเป็นส่วนตัว และการปกป้องข้อมูล: ความรับผิดชอบพิเศษของข้อมูลทางพันธุกรรม 11. กรณีแบบครบวงจร: การเดินทางของตัวแปรจากการค้นพบไปสู่รายงานทางคลินิก
หน่วย 2 / 11

การวิเคราะห์ลำดับ DNA/RNA: การจัดตำแหน่ง ลวดลาย กรอบการอ่านแบบเปิด และชีวสารสนเทศพื้นฐาน

กำไร:

  • ทำความเข้าใจแนวคิดของการจัดลำดับ การค้นหาบรรทัดฐาน และกรอบการอ่านแบบเปิด (ORF) และให้ปัญญาประดิษฐ์สร้างโค้ด Biopython/การวิเคราะห์ที่ปฏิบัติการได้และสามารถตรวจสอบได้
  • ความสามารถในการตรวจสอบสมมติฐานของเฟรม สาย และเวอร์ชันจีโนมในลำดับและรหัสที่สร้างขึ้นโดยปัญญาประดิษฐ์ และเปรียบเทียบผลลัพธ์กับข้อมูลอ้างอิงที่ทราบ
  • ความสามารถในการประยุกต์วินัยในการไม่ใช้ลำดับใดๆ ที่กำหนดโดยปัญญาประดิษฐ์จากส่วนหัว และยืนยันแต่ละลำดับจากแหล่งที่มาหลัก เช่น NCBI / Ensembl

การวิเคราะห์ลำดับเป็นงานพื้นฐานที่สุดของอณูชีววิทยา นั่นคือ การอ่านสาย DNA (หรือ U ใน RNA) ที่ประกอบด้วยตัวอักษร A, T, G, C แล้วเปรียบเทียบ และค้นหาบริเวณที่มีความหมาย (ยีน ลวดลาย ลำดับการควบคุม) ที่อยู่ภายใน ในหน่วยนี้ คุณจะได้เรียนรู้วิธีใช้ปัญญาประดิษฐ์ (AI) เป็นพันธมิตรในการเขียนโค้ดและการตีความในงานเหล่านี้ แต่คุณจะได้เรียนรู้ว่าเหตุใดคุณจึงควรตรวจสอบผลลัพธ์ด้วยโค้ดปฏิบัติการและแหล่งที่มาหลักเสมอ ชุดเครื่องมือหลักของเราคือ Biopython (ไลบรารี Python ที่เขียนขึ้นสำหรับการทำงานกับลำดับทางชีววิทยา) และเครื่องมือการจัดตำแหน่งอย่างเป็นทางการ

คำเตือนประการแรก: LLM สามารถสร้างข้อผิดพลาดจากหน่วยความจำได้ แม้จะเป็นเพียงลำดับสั้นๆ ก็ตาม มันสามารถผสมตัวอักษรเมื่อถูกขอให้คำนวณส่วนเสริมย้อนกลับของลำดับที่อยู่ตรงหน้า ดังนั้นอย่าดำเนินการสตริงโดยอาศัยการตอบกลับข้อความของ AI แต่ใช้โค้ดที่ AI เขียนและคุณเรียกใช้

แนวคิดพื้นฐาน: เราทำงานด้วยอะไร?

  • คู่เบส (bp): หน่วยตัวอักษรของ DNA จีโนมมนุษย์มีค่าประมาณ 3.2 พันล้าน bp
  • Strand: DNA เป็นเกลียวคู่ ทั้งสองเส้นเป็นปฏิปักษ์ของกันและกัน สิ่งสำคัญคือเธรดใดที่มีการประกาศตัวแปร
  • Codon: กลุ่มสามฐาน; โคดอนแต่ละตัวสอดคล้องกับกรดอะมิโน (ส่วนประกอบของโปรตีน) ตัวอย่างเช่น ATG มักจะเป็นรหัสเริ่มต้น (เมไทโอนีน)
  • กรอบการอ่านแบบเปิด (ORF): ขอบเขตลำดับที่สามารถเขียนโค้ดสำหรับโปรตีน โดยขยายจากรหัสเริ่มต้นไปจนถึงรหัสหยุด (TAA, TAG, TGA)
  • บรรทัดฐาน: การทำซ้ำรูปแบบลำดับสั้น ๆ ที่มีฟังก์ชันเฉพาะ ตัวอย่างเช่น บริเวณที่ปัจจัยการถอดความผูกมัด
  • การจัดตำแหน่ง: การจัดเรียงลำดับตั้งแต่สองลำดับขึ้นไปไว้ข้างใต้เพื่อดูความคล้ายคลึงกัน

ทีละขั้นตอน: ขั้นตอนการทำงานการวิเคราะห์ลำดับ

1. รับซีรีส์จากแหล่งที่เชื่อถือได้ อย่าให้ AI พูดว่า "เตือน" ลำดับ; ดาวน์โหลดเป็น FASTA (รูปแบบข้อความมาตรฐานที่เก็บลำดับ) จากแหล่งที่มา เช่น NCBI, Ensembl ฯลฯ และมอบลำดับนี้ให้กับ AI

2. ทำธุรกรรมเสร็จสิ้นด้วยรหัส มีการดำเนินการต่างๆ เช่น การเติมเต็มแบบย้อนกลับ การถอดรหัส (DNA→RNA) การแปล (RNA→โปรตีน) อัตราส่วน GC ที่ทำโดยรหัส Biopython และรันโค้ดด้วยตนเอง

3. ตรวจสอบสมมติฐานของเฟรมเวิร์กและเธรด ขอให้เขา/เธอระบุอย่างชัดเจนในบรรทัดแสดงความคิดเห็นว่าโค้ดกำลังทำงานอยู่เธรดใดและกรอบการอ่านใด

4. เปรียบเทียบผลลัพธ์กับข้อมูลอ้างอิงที่ทราบ จับคู่โปรตีนหรือ ORF ที่คุณผลิตกับบันทึกที่รู้จักในฐานข้อมูล ความยาวและความไม่ตรงกันเริ่มต้นจะทำให้เกิดข้อผิดพลาดที่พบบ่อยที่สุด

5. ยืนยันการจัดตำแหน่งด้วยเครื่องมืออย่างเป็นทางการ อย่าปล่อยให้ AI "ลูกตา" มีความคล้ายคลึงกันของสองซีรีส์ รับคะแนนตัวเลขด้วย BLAST (เครื่องมือค้นหาความคล้ายคลึงกันของลำดับ) หรือไลบรารีการจัดตำแหน่ง

เคล็ดลับ: ให้ความยาวของสตริงเป็นการตรวจสอบครั้งแรกของคุณเสมอ จำนวนกรดอะมิโนของโปรตีนมีค่าประมาณหนึ่งในสามของจำนวนเบสของลำดับการเข้ารหัส (ไม่รวมรหัสหยุด) หากความยาวไม่พอดี แสดงว่าโครงหรือด้ายผิด

มินิเคสสามอัน

กรณีที่ 1 — ข้อผิดพลาดส่วนเสริมผกผัน นักเรียนคนหนึ่งถาม AI เกี่ยวกับส่วนเติมเต็มย้อนกลับของลำดับ 5'-GATTACA-3'; AI ให้ "TGTAATC" (ถูกต้อง) อย่างไรก็ตาม ในลำดับที่ยาวกว่า 20 ฐาน AI ข้ามฐานและผลลัพธ์คือ 19 ฐาน เมื่อนักเรียนรันด้วย Seq("...").reverse_complement() ใน Biopython มันต้องใช้ 20 เบสและตรวจพบข้อผิดพลาด เวลาที่เสียไป: 2 นาที

กรณีที่ 2 — การเปลี่ยนเฟรม นักวิจัยมีลำดับการเข้ารหัส 900 เบสที่แปลเป็นโปรตีน AI "อ่าน" โปรตีนกรดอะมิโน 280 ตัวด้วยข้อความ สิ่งที่คาดหวังคือกรดอะมิโน 299 ตัว (900/3 - 1 สต็อป) ความแตกต่างก็คือ AI เริ่มต้นจากนิวคลีโอไทด์ที่สอง ได้รับความยาวที่ถูกต้องเมื่อโค้ดเริ่มต้นจากเฟรมแรก

กรณีที่ 3 — ได้รับการยืนยัน ช่างเทคนิคในห้องปฏิบัติการตรวจสอบลำดับ 16S rRNA ของแบคทีเรียสองสายพันธุ์โดยถามว่า "เหมือนกันหรือไม่" เขาถาม AI; “ก็น่าจะเหมือนกัน” AI กล่าว เมื่อช่างเทคนิคใช้งาน BLAST เขาเห็นความคล้ายคลึงกัน 97.8% และความแตกต่างพื้นฐาน 12 จุด ซึ่งเป็นความแตกต่างที่สำคัญสำหรับการเลือกปฏิบัติในระดับสายพันธุ์ หากไม่มีคะแนนเป็นตัวเลข จะมีการป้อนผลลัพธ์ "เดียวกัน" ที่ไม่ถูกต้องในรายงาน

ตัวอย่าง: สตรีม Biopython ที่ตรวจสอบได้

จาก Bio.Seq import Seq# นำเข้าลำดับจาก FASTA ที่คุณดาวน์โหลดจาก NCBI; อย่าให้ AI พูดว่า "เตือนฉัน" dna = Seq("ATGGCCATTGTAATGGGCCGCTGAAAGGGTGCCCGATAG")พิมพ์("ความยาว (bp):", len(dna))พิมพ์("อัตรา GC (%):", รอบ(100 * (dna.count("G") + dna.count("C")) / len(dna), 1))พิมพ์("ส่วนเสริมย้อนกลับ:", dna.reverse_complement())# การแปลจากเฟรม 1; จนถึงการหยุด codonprotein = dna.translate(to_stop=True)print("Protein:",โปรตีน, "| ความยาว (มม.):", len(โปรตีน))

แม้ว่า AI จะเขียนโค้ดนี้ แต่คุณจะเห็นความแม่นยำของเอาต์พุตจากการรัน ความยาว อัตราส่วน GC และโปรตีนเทียบได้กับข้อมูลอ้างอิงที่ทราบ

เทมเพลตที่สามารถคัดลอกได้สี่แบบ

1) การดำเนินการอาเรย์ที่ตรวจสอบได้:

เขียนโค้ด Biopython ที่ปฏิบัติการได้สำหรับลำดับ FASTA ต่อไปนี้: [ลำดับ/งาน] คำนวณความยาว อัตราส่วน GC ส่วนเสริมแบบย้อนกลับ และการแปลจากเฟรมที่ 1 แสดงความคิดเห็นว่าเธรดและเฟรมใดที่สันนิษฐาน อย่าสร้างลำดับ เพียงใช้ลำดับที่ฉันให้คุณ

2) การคัดกรอง ORF:

เขียนโค้ด Python ที่จะค้นหาเฟรมการอ่านที่เปิดอยู่ทั้งหมดตามลำดับที่กำหนด (และทั้งสามเฟรมบนแถบย้อนกลับเสริม) รายงานตำแหน่งเริ่มต้น ความยาว และการแปลโปรตีนสำหรับ ORF แต่ละรายการ ทำเครื่องหมาย ORF ที่ยาวที่สุดด้วย

3) การยืนยันการจัดตำแหน่ง:

ฉันต้องการเปรียบเทียบสองอาร์เรย์ "คล้ายกัน?" อย่าตัดสินด้วยตา เขียนโค้ดการจัดตำแหน่งแบบคู่และรายงานเปอร์เซ็นต์ความคล้ายคลึงและจำนวนความแตกต่างเป็นตัวเลข ที่มา: [ชุดที่ 1], [ชุดที่ 2]

4) ค้นหา Motif:

ค้นหาบรรทัดฐานต่อไปนี้ (เช่นเดียวกับนิพจน์ทั่วไป) ในสตริงที่กำหนด: [motif] ระบุตำแหน่ง (ตาม 1) ของการแข่งขันทั้งหมด เขียนและระบุการจับคู่ที่ทับซ้อนกันด้วย

พรอมต์อ่อน / พรอมต์แรง

จุดอ่อน: "เขียนโปรตีนของลำดับนี้: ATGGCC..."

ปัญหา: AI แปลด้วยข้อความ อาจทำให้เฟรม/เธรดสับสน ไม่สามารถตรวจสอบความยาวได้

แข็งแกร่ง: "เขียนโค้ด Biopython ที่ปฏิบัติการได้ซึ่งแปลลำดับต่อไปนี้จากเฟรม 1 รายงานความยาวและรหัสหยุด อย่าเปลี่ยนลำดับ เพียงใช้ลำดับที่ฉันให้ไว้: ATGGCC..."

ทำไมจึงมีประสิทธิภาพ: การประมวลผลเสร็จสิ้นในโค้ด กรอบงานชัดเจน สามารถตรวจสอบเอาต์พุตเป็นตัวเลขได้

ภารกิจ

แนวทางที่ผิด

แนวทางที่ถูกต้อง

ส่วนประกอบย้อนกลับ

ให้ AI เขียนข้อความ

ไบโอไพธอน ย้อนกลับ_เสริม()

การแปล

ให้ AI แปลจากหน่วยความจำ

รหัสระบุกรอบงาน

ความคล้ายคลึงกัน

“คล้ายกัน?” การตัดสินใจด้วยตา

BLAST/คะแนนการจัดตำแหน่ง

แม่ลาย

ให้ AI นับด้วยมือ

รหัสพร้อมรายการสถานที่

แหล่งที่มาของอาร์เรย์

ให้เอไอจำได้

FASTA จาก NCBI/Ensembl

ข้อผิดพลาดทั่วไป

  • ไม่ระบุกรอบ. การแปลจากเฟรมที่ไม่ถูกต้องทำให้เกิดโปรตีนที่สั้นหรือผิดพลาด
  • พันเส้นด้าย รูปแบบหรือมาตรฐานอาจอยู่ในเธรดย้อนกลับ ควรเขียนสมมติฐานของเธรด
  • ทำให้ AI จดจำลำดับได้ LLM ไม่สามารถสร้างสตริงแบบยาวได้โดยไม่มีข้อผิดพลาด คุณมักจะให้ซีรีส์
  • ตัดสินด้วยตาเพื่อความคล้ายคลึง อย่าพูดว่า "เหมือน/คล้ายกัน" โดยไม่มีคะแนนเป็นตัวเลข
  • ส่วนผสมของอาร์เอ็นเอ/ดีเอ็นเอ การผสม U กับ T จะรบกวนการแปล ชี้แจงประเภทอินพุต
ข้อควรระวัง: แม้แต่ความคล้ายคลึงกันในเปอร์เซ็นต์ที่สูงใน BLAST และเครื่องมือที่คล้ายกันก็ไม่ได้หมายความว่า "เหมือนกัน" ทางชีววิทยาเสมอไป ค่า e-value (ความน่าจะเป็นของโอกาส) และความยาวของขอบเขตที่สอดคล้องกันควรได้รับการประเมินร่วมกัน

ความลึก: อ่านเอาต์พุต BLAST ได้อย่างถูกต้อง

การให้ AI ตีความผลลัพธ์ BLAST ช่วยประหยัดเวลา แต่อย่าตัดสินใจใดๆ จนกว่าคุณจะอ่านทั้งสามประเด็นด้วยตัวเอง ค่าแรกคือค่า e-value (ค่าที่คาดหวัง): จำนวนครั้งที่คาดหวังคะแนนนี้สามารถเกิดขึ้นได้โดยบังเอิญ ค่าที่น้อยมากเช่น 1e-50 หมายความว่าแรง ค่าเช่น 0.1 เกือบจะเกิดเสียงรบกวน ประการที่สองคือความครอบคลุมของการสืบค้น: เปอร์เซ็นต์ของลำดับการสืบค้นที่การจับคู่ครอบคลุม; ความคล้ายคลึงกัน 98% แต่ความครอบคลุมเพียง 20% หมายความว่าส่วนเล็กๆ ของลำดับมีความคล้ายคลึงและทำให้เข้าใจผิด ที่สามคือเปอร์เซ็นต์เอกลักษณ์ หากไม่มีทั้งสามอ่านร่วมกัน เปอร์เซ็นต์ที่สูงเพียงอย่างเดียวก็ไม่สามารถพิสูจน์อะไรได้

ตัวอย่างที่เป็นรูปธรรม: นักวิจัยได้ทำลายส่วนของยีนที่เขาเพิ่งจัดลำดับ “99% ตรงกับมนุษย์ BRCA2 ยีนเดียวกัน” AI กล่าว เมื่อนักวิจัยดูผลลัพธ์ เขาเห็นว่าความครอบคลุมเพียง 15% ส่วนที่ตรงกันนั้นเป็นเพียงขอบเขตสั้น ๆ ที่ทำซ้ำจากฐานหลายพันฐานของ BRCA2 การตีความที่ถูกต้องไม่ใช่ "ยีนเดียวกัน" แต่ "มีรูปแบบการทำซ้ำร่วมกัน" การอ่านขอบเขตทำให้มีการระบุที่ไม่ถูกต้องโดยสิ้นเชิง

คอลัมน์ระเบิด

มันพูดว่าอะไร

กับดัก

ค่า E

ความน่าจะเป็นของเรื่องบังเอิญ

หากสูงการแข่งขันอาจไม่มีความหมาย

ครอบคลุมการค้นหา

อัตราการค้นหาที่ครอบคลุม

หากต่ำเปอร์เซ็นต์จะทำให้เข้าใจผิด

อัตลักษณ์เปอร์เซ็นต์

อัตราฐานที่ตรงกัน

เพียงอย่างเดียวไม่เพียงพอ

บิตสกอร์

ความแรงของการจัดตำแหน่งที่เป็นมาตรฐาน

ตีความตามความยาว

5) เทมเพลตการตีความเอาท์พุต BLAST:

ตีความตาราง BLAST ต่อไปนี้ แต่ไม่ต้องตัดสินใจ: สรุปค่า e-value ความครอบคลุมของการค้นหา และเปอร์เซ็นต์เอกลักษณ์สำหรับแต่ละแถวแยกกัน และระบุเกณฑ์ที่ต้องปฏิบัติตามก่อนที่จะถึงข้อสรุป เช่น "ยีนเดียวกัน" ตาราง: [วาง]

โดยสรุป

  • การดำเนินการตามลำดับ (การเสริมแบบย้อนกลับ การแปล ORF อัตราส่วน GC) ควรทำด้วยโค้ดที่ AI เขียนและคุณรัน ไม่ใช่ด้วยการตอบกลับข้อความของ AI
  • ควรระบุสมมติฐานของกรอบงานและเธรดอย่างชัดเจนเสมอ การตรวจสอบความยาวเป็นเครื่องมือตรวจจับข้อผิดพลาดที่เร็วที่สุด
  • รับลำดับจากแหล่งที่เชื่อถือได้เสมอ (NCBI, Ensembl) อย่าให้ AI จดจำมัน
  • ความคล้ายคลึงกันและการจัดตำแหน่งได้รับการประเมินโดยเครื่องมืออย่างเป็นทางการและคะแนนตัวเลข ไม่ใช่ด้วยตา

งานสมัคร

ดาวน์โหลดลำดับการเข้ารหัสสั้นๆ จากแหล่งที่เชื่อถือได้ (เช่น NCBI) ด้วยเทมเพลต 1 และ 2 ข้างต้น ให้ขอรหัส Biopython จาก AI เรียกใช้โค้ด เปรียบเทียบความยาวและลำดับของโปรตีนที่คุณผลิตกับบันทึกที่ทราบในฐานข้อมูล หากคุณพบข้อมูลที่ไม่ตรงกัน ให้ลองแก้ไขโดยเปลี่ยนสมมติฐานของเฟรมเวิร์ก/เธรด และจดบันทึกกระบวนการ

รายการตรวจสอบ

  • [ ] ฉันได้รับลำดับจากแหล่งที่เชื่อถือได้ ฉันไม่มี AI จดจำมัน
  • [ ] ฉันดำเนินการอาร์เรย์ด้วยโค้ดที่ปฏิบัติการได้
  • [ ] ฉันได้ระบุกรอบการทำงานและสมมติฐานของเธรดไว้อย่างชัดเจน
  • [ ] ฉันเปรียบเทียบความยาวโปรตีน/ORF กับข้อมูลอ้างอิง
  • [ ] ฉันประเมินความคล้ายคลึงกับเครื่องมืออย่างเป็นทางการและคะแนนตัวเลข
  • [ ] ฉันตรวจสอบการแยก RNA/DNA และ U/T