หน่วย
1. ปัญญาประดิษฐ์เบื้องต้นทางชีววิทยา: บทบาท ขอบเขต การตรวจสอบความถูกต้อง และจริยธรรม 2. พื้นฐานการวิเคราะห์ข้อมูลทางชีวภาพด้วย Python 3. การวิเคราะห์ลำดับและชีวสารสนเทศศาสตร์: DNA, RNA และโปรตีน 4. ข้อมูล Omics และการวิเคราะห์มิติสูง 5. โครงสร้างโปรตีนและ AlphaFold: ชัยชนะของปัญญาประดิษฐ์ในชีววิทยา 6. การวิเคราะห์รูปภาพและการระบุประเภท/เซลล์ 7. การออกแบบเชิงทดลอง: การสร้างแผนการที่มั่นคงด้วยปัญญาประดิษฐ์ 8. การวิเคราะห์ข้อมูลและการตรวจสอบความถูกต้องทางสถิติ 9. การแสดงภาพทางวิทยาศาสตร์: การแสดงข้อมูลอย่างตรงไปตรงมาและเข้าใจได้ 10. การทบทวนวรรณกรรมและการเขียนทางวิทยาศาสตร์ 11. จริยธรรม ความปลอดภัยทางชีวภาพ การรักษาความลับ และความซื่อสัตย์ทางวิทยาศาสตร์
หน่วย 4 / 11

ข้อมูล Omics และการวิเคราะห์มิติสูง

กำไร:

  • ความสามารถในการเข้าใจปัญหาการเปรียบเทียบหลายรายการ และรวมการแก้ไข FDR (อัตราการค้นพบที่ผิดพลาด) ในการวิเคราะห์
  • ความสามารถในการแยกแยะนัยสำคัญทางสถิติและทางชีวภาพโดยการประเมินค่า p และขนาดผลกระทบ (การเปลี่ยนแปลง log2 fold) ร่วมกัน
  • ความสามารถในการรับรู้และหลีกเลี่ยงกับดักข้อมูลที่มีมิติสูง เช่น ผลกระทบแบบแบตช์และการกระโดดข้ามสาเหตุ

คำว่า "omics" อธิบายวิธีการที่วัดระดับโมเลกุลทั้งหมดในเซลล์: จีโนมิกส์ (DNA ทั้งหมด), การถอดเสียง (RNA ทั้งหมด / การแสดงออกของยีน), โปรตีโอมิกส์ (โปรตีนทั้งหมด), เมแทบอลิซึม (โมเลกุลขนาดเล็กทั้งหมด) คุณลักษณะทั่วไปของการวัดเหล่านี้คือมีขนาดที่มีมิติสูง โดยมีการวัดตัวแปรหลายพันหรือหลายหมื่นตัว (ยีน โปรตีน) พร้อมกันในตัวอย่างเดียว แต่โดยปกติแล้วจำนวนตัวอย่างจะน้อย (เช่น ผู้ป่วย 20 ราย) สถานการณ์ “ตัวแปรมากมาย ตัวอย่างน้อย” นี้เป็นที่มาของความท้าทายเฉพาะด้านชีววิทยาและด้านที่ AI สามารถช่วยได้มากที่สุด

ในหน่วยนี้ เราจะพูดถึงการวิเคราะห์การแสดงออกที่แตกต่างกัน (การค้นหายีนที่การแสดงออกเปลี่ยนแปลงอย่างมีนัยสำคัญระหว่างสองกลุ่ม) และบทบาทของปัญญาประดิษฐ์ในกระบวนการทำงานนี้ผ่านตัวอย่างของการถอดเสียง (RNA-seq)

ปัญหาหลักของข้อมูลมิติสูง

หากคุณทดสอบยีนหลายพันยีนในคราวเดียว คุณจะพบยีนที่ดูเหมือน "สำคัญ" โดยบังเอิญ แม้ว่าจะไม่มีความแตกต่างที่แท้จริงก็ตาม หากคุณทดสอบยีน 20,000 ตัวโดยมีข้อผิดพลาด 5% ประมาณ 1,000 ยีนอาจกลายเป็น "สำคัญ" โดยบังเอิญ สิ่งนี้เรียกว่าปัญหาการเปรียบเทียบหลายรายการ และเป็นข้อผิดพลาดที่สำคัญที่สุดของการวิเคราะห์โอมิกส์ วิธีแก้ไขคือแก้ไขค่า p (เช่น คำนวณ FDR - อัตราการค้นพบที่ผิดพลาดด้วยวิธี Benjamini-Hochberg) AI มีประโยชน์มากในการอธิบายแนวคิดนี้และการเขียนโค้ดที่ถูกต้อง แต่เป็นความรับผิดชอบของคุณที่จะต้องจำไว้ว่าต้องใช้การแก้ไข

เคล็ดลับ: หากคุณเห็นตัวเลขเช่น "3,000 ยีนมีการเปลี่ยนแปลงอย่างมีนัยสำคัญ" ในผลลัพธ์ของ Omics ให้ตื่นตระหนก โดยปกติจะเป็นสัญญาณว่ายังไม่ได้ทำการแก้ไขการเปรียบเทียบหลายครั้ง รายการตามความเป็นจริงจะมียีนนับสิบถึงหลายร้อยยีนในการทดลองที่ออกแบบมาอย่างดี

การแสดงออกเชิงอนุพันธ์ RNA-seq: ทีละขั้นตอน

  1. การนับดิบ: ตารางที่มีจำนวนการอ่านในแต่ละตัวอย่างสำหรับแต่ละยีน
  2. คุณภาพและการกรอง: ทิ้งยีนที่มีการแสดงออกต่ำมาก
  3. การทำให้เป็นมาตรฐาน: แก้ไขความแตกต่างของขนาดไลบรารีระหว่างตัวอย่าง (จำนวนเดรัจฉานไม่สามารถเทียบเคียงได้)
  4. แบบจำลองทางสถิติ: ทดสอบความแตกต่างของกลุ่มด้วย DESeq2 หรือ edgeR (ไลบรารี R) หรือ pyDESeq2 ใน Python
  5. การแก้ไขการเปรียบเทียบหลายรายการ: คำนวณ FDR; โดยปกติจะเป็นเกณฑ์ของ FDR <0.05
  6. ขนาดเอฟเฟกต์: ประเมินด้วยการเปลี่ยนแปลง log2 เท่า: จำนวนครั้งที่นิพจน์เพิ่มขึ้น/ลดลง
  7. หมายเหตุ: เชื่อมโยงยีนที่สำคัญกับวิถีทางชีวภาพ

ปัญญาประดิษฐ์ 3-6 โดยจะเขียนโค้ดขั้นตอน อธิบายแนวคิด และช่วยคุณตีความผลลัพธ์ อย่างไรก็ตาม โมเดลไม่สามารถบอกได้ว่า "ยีนใดเปลี่ยนแปลง" โดยไม่เห็นข้อมูลดิบของคุณ รหัสและสถิติบอกคุณสิ่งนี้

เทมเพลตพร้อมท์ที่คัดลอกได้

บทบาท: คุณเป็นผู้ช่วยวิเคราะห์การถอดเสียง บริบท: ฉันมีตารางการนับดิบ (CSV) RNA-seq จากกลุ่มควบคุม 12 รายการ และตัวอย่างการรักษา 12 รายการ งาน: แสดงรายการขั้นตอนของการวิเคราะห์นิพจน์เชิงอนุพันธ์ด้วย pyDESeq2 อธิบายว่าเหตุใดแต่ละขั้นตอนจึงมีความจำเป็น วางแผนก่อน รหัสที่สอง อย่าลืมรวมการแก้ไขการเปรียบเทียบหลายรายการ

ผลลัพธ์การวิเคราะห์ของฉันแสดงยีน 4,200 ตัวเป็น "p<0.05" ทำไมเรื่องนี้ถึงน่าสงสัย? อธิบายการแก้ไขการเปรียบเทียบหลายรายการ (Benjamini-Hochberg FDR) และให้โค้ด Python ทำการกรองที่ถูกต้อง

เขียนโค้ดที่ดึงพล็อตภูเขาไฟจากตารางผลลัพธ์นิพจน์ดิฟเฟอเรนเชียลของฉัน (ยีน, log2FC, คอลัมน์ padj) ระบายสียีนด้วย FDR<0.05 และ |log2FC|>1 ติดป้ายกำกับ 10 อันดับแรก

ฉันจะวิเคราะห์รายการยีนที่สำคัญนี้เพื่อเพิ่มคุณค่าให้กับวิถีได้อย่างไร อธิบายขั้นตอน gseapy หรือ g:Profiler อย่าอ้างสาเหตุที่แท้จริงในความคิดเห็น ให้ใช้ภาษาที่สัมพันธ์กัน รายการยีน: [รายการ]

พรอมต์อ่อน / พรอมต์แรง

อ่อนแอ: "บอกฉันว่ายีนใดมีความสำคัญต่อผลผลิต RNA-seq"

แข็งแกร่ง: "ฉันมีเอาต์พุต pyDESeq2 จากตัวควบคุม 12 ตัว ตัวอย่างการรักษา 12 ตัวอย่าง: ตารางที่มียีน, log2FoldChange, คอลัมน์ padj ให้โค้ดที่กรองยีนที่มีนัยสำคัญด้วยเกณฑ์ FDR<0.05 และ |log2FC|>1 รายงานตัวเลข และจัดอันดับยีนที่แข็งแกร่งที่สุด 20 ยีนตามขนาดเอฟเฟกต์ จากนั้นอธิบายว่าเหตุใดเกณฑ์เหล่านี้จึงสมเหตุสมผล"

ความแตกต่าง: พรอมต์ที่มีประสิทธิภาพมีคอลัมน์เอาต์พุตจริง เกณฑ์ และคำขอตรวจสอบ แบบจำลองจะประมวลผลข้อมูลของคุณแทนที่จะสร้างชื่อยีนที่สร้างขึ้น

มินิเคสสามอัน

กรณีที่ 1 — ภัยพิบัติที่ไม่มีการแก้ไข: กลุ่มพบยีน “สำคัญ” จำนวน 3,800 ยีนที่มีค่า p<0.05 โดยไม่มีการแก้ไข จึงได้ส่งตีพิมพ์เผยแพร่ เมื่อผู้ตัดสินขอให้แก้ไข FDR รายการลดลงเหลือ 47 ยีน หากปัญญาประดิษฐ์เพิ่มโค้ด Benjamini-Hochberg ตั้งแต่ต้น ความลำบากใจนี้ก็คงไม่เกิดขึ้น บทเรียน: การแก้ไขไม่สามารถต่อรองได้

กรณีที่ 2 — ผลกระทบของแบทช์: ในการศึกษาหนึ่ง ตัวอย่างได้รับการประมวลผลในสองวันที่แตกต่างกัน สิ่งที่พวกเขาคิดว่าเป็นความแตกต่างระหว่าง "ผู้ป่วยกับกลุ่มควบคุม" จริงๆ แล้วคือความแตกต่างระหว่าง "วันที่ 1 กับวันที่ 2" (ผลกระทบแบบกลุ่ม: ความแตกต่างทางเทคนิคเนื่องจากฝ่ายเก็บตัวอย่าง) AI ช่วยกำจัดสัญญาณปลอมโดยแนะนำให้เพิ่มตัวแปรแบทช์ให้กับโมเดล (~ แบทช์ + เงื่อนไขในสูตรโมเดล)

กรณีที่ 3 — ไม่สนใจการเปลี่ยนแปลงของรอยพับ: นักเรียนคนหนึ่งประกาศว่า "สำคัญที่สุด" เป็นยีนที่การแสดงออกเปลี่ยนไป 2% แต่วัดได้ว่ามีความเสถียรมาก เพียงแค่ดูที่ค่า p ในขณะที่ขนาดเอฟเฟกต์ (log2FC) เกือบจะเป็นศูนย์ นัยสำคัญทางสถิติไม่ใช่นัยสำคัญทางชีวภาพ แบบจำลองนี้อธิบายความแตกต่างนี้และแนะนำให้เห็นภาพด้วยกราฟภูเขาไฟ

ตารางเปรียบเทียบ: ความชัดเจนของแนวคิด

แนวคิด

ความหมาย

เหตุใดจึงสำคัญ?

ค่า p

ความน่าจะเป็นของความแตกต่างเป็นเรื่องบังเอิญ

เพียงอย่างเดียวอาจทำให้เข้าใจผิดได้

FDR (ปัดเจ)

แก้ไขอัตราข้อผิดพลาดในการทดสอบหลายครั้ง

จำกัดผลบวกลวง

การเปลี่ยนแปลง log2 เท่า

ขนาดเอฟเฟกต์

บ่งบอกถึงความสำคัญทางชีวภาพ

เอฟเฟกต์แบบแบตช์

ความแตกต่างของแบทช์ทางเทคนิค

สร้างสัญญาณปลอม

การทำให้เป็นมาตรฐาน

การแก้ไขมาตราส่วนระหว่างตัวอย่าง

ทำให้การเปรียบเทียบเป็นไปอย่างยุติธรรม

ข้อผิดพลาดทั่วไป

  • การข้ามการแก้ไขการเปรียบเทียบหลายรายการ: ข้อผิดพลาดที่พบบ่อยที่สุดและร้ายแรงที่สุด
  • เพียงดูที่ค่า p: อย่าลืมพิจารณาขนาดเอฟเฟกต์ (log2FC) ด้วยกัน
  • ไม่รวมผลกระทบแบบกลุ่มในแบบจำลอง: การเข้าใจผิดความแตกต่างทางเทคนิคสำหรับความแตกต่างทางชีวภาพ
  • ลืมการทำให้เป็นมาตรฐาน: การเปรียบเทียบตัวเลขดิบโดยตรง
  • ภาษาเชิงสาเหตุ: การพูดว่า "ยีนนี้ทำให้เกิดโรค"; ข้อมูล Omics แสดงความสัมพันธ์ สาเหตุต้องมีการทดลองเพิ่มเติม
ข้อควรระวัง: ในข้อมูลที่มีมิติสูง "มีนัยสำคัญทางสถิติ" และ "มีนัยสำคัญทางชีวภาพ" เป็นสองสิ่งที่แตกต่างกัน รายชื่อยีนที่ผลิตโดยปัญญาประดิษฐ์นั้นเป็นสมมติฐานเบื้องต้น ยีนผู้สมัครแต่ละตัวไม่ควรได้รับการพิจารณาขั้นสุดท้ายหากไม่มีการตรวจสอบโดยวิธีการอิสระ (qPCR, การวัดโปรตีน)

การลดขนาดและการควบคุมคุณภาพ

สิ่งแรกที่ต้องทำในข้อมูลมิติสูงคือการดูโครงสร้างทั่วไปของกลุ่มตัวอย่าง PCA (การวิเคราะห์องค์ประกอบหลัก: การลดตัวแปรนับพันลงในแกนสรุปเพียงไม่กี่แกนและแสดงใน 2 มิติ) เป็นเครื่องมือมาตรฐานสำหรับสิ่งนี้ หากกลุ่มที่คุณคาดหวัง (การควบคุม/การรักษา) ถูกแยกออกจากแผนภูมิ PCA ก็ถือว่าดี แต่หากตัวอย่างถูกจัดกลุ่มตาม "วันที่ประมวลผล" แทนที่จะเป็นกลุ่ม นี่เป็นคำเตือนผลกระทบแบบแบตช์ แผนภูมิเดียวกันยังแสดงตัวอย่างค่าผิดปกติ (ล้มเหลว) รายการเดียวทันที

วาด PCA จากตารางนิพจน์ปกติของฉัน (ยีนแถว ตัวอย่างคอลัมน์) ตัวอย่างสีตามกลุ่ม (ควบคุม/บำบัด) ปรับรูปร่างตามการประมวลผลเป็นชุด แสดงความคิดเห็นว่าจะเห็นเอฟเฟกต์แบบกลุ่มหรือรูปแบบค่าผิดปกติในกราฟหรือไม่

ขั้นตอนฮิวริสติกนี้ขับเคลื่อนการวิเคราะห์ส่วนที่เหลือ: เป็นการดีกว่าที่จะตรวจจับค่าผิดปกติตั้งแต่เนิ่นๆ ดีกว่าเสียเวลาหลายเดือนกับผลลัพธ์ปลอม

ข้อมูลเซลล์เดียว: มิติใหม่

ในช่วงไม่กี่ปีที่ผ่านมา การจัดลำดับ RNA เซลล์เดียว (single-cell RNA-seq: การวัดโปรไฟล์การแสดงออกของเซลล์แต่ละเซลล์นับพัน) แพร่หลายมากขึ้น ที่นี่ข้อมูลจะยิ่งใหญ่ขึ้นอีก: เซลล์นับหมื่นเซลล์ และยีนหลายพันยีนในแต่ละเซลล์ เครื่องมือเช่น Scanpy (Python) ประมวลผลข้อมูลนี้ จัดกลุ่มเซลล์และระบุประเภทเซลล์ AI เขียนโค้ดสำหรับเวิร์กโฟลว์นี้ แต่การตั้งชื่อทางชีววิทยาของประเภทเซลล์ (ไม่ว่าคลัสเตอร์จะเป็น “ทีเซลล์” หรือ “มาโครฟาจ”) จะขึ้นอยู่กับยีนมาร์กเกอร์และความรู้ของผู้เชี่ยวชาญ อย่าลืมยืนยันป้ายกำกับประเภทเซลล์ที่แบบจำลองกำหนดให้กับคลัสเตอร์ที่มีเครื่องหมายที่รู้จัก นี่เป็นขั้นตอนที่เข้าใจผิดกันมากที่สุดในการวิเคราะห์เซลล์เดี่ยว

เปิดข้อมูลและความสามารถในการทำซ้ำ

การศึกษาเกี่ยวกับ Omics ส่วนใหญ่จะอัปโหลดข้อมูลไปยังพื้นที่เก็บข้อมูลสาธารณะ: GEO (Gene Expression Omnibus) และ ArrayExpress สำหรับการแสดงออกของยีน, SRA (Sequence Read Archive) สำหรับลำดับดิบ, PRIDE สำหรับโปรตีโอมิกส์ นี่เป็นสิ่งสำคัญเพื่อให้ผู้อื่นสามารถตรวจสอบผลลัพธ์ของคุณได้ และเพื่อให้คุณสามารถวิเคราะห์ข้อมูลจากการศึกษาอื่น ๆ ได้อีกครั้ง AI สามารถเขียนโค้ด (ด้วยเครื่องมือเช่น GEOparse) ที่ดาวน์โหลดและจัดระเบียบข้อมูลจากหมายเลขทะเบียน GEO (เช่น หมายเลข GSE) แต่อย่าลืมอ่านและยืนยันการออกแบบข้อมูลที่คุณดาวน์โหลด (จำนวนกลุ่ม จำนวนการทำซ้ำ การประมวลผลใด) จากบันทึกต้นฉบับ หากแบบจำลองอ้างว่า "จดจำ" การออกแบบการศึกษา ก็ถือเป็นการคาดเดาที่ต้องได้รับการตรวจสอบเกือบทุกครั้ง

โดยสรุป

ข้อมูล Omics วัดตัวแปรนับพันในขนาดตัวอย่างขนาดเล็ก สิ่งนี้จะสร้างกับดักของการเปรียบเทียบหลายรายการ เอฟเฟกต์แบบกลุ่ม และการตีความมากเกินไป ปัญญาประดิษฐ์ โดยจะเขียนโค้ดสำหรับการวิเคราะห์นิพจน์เชิงอนุพันธ์ อธิบายแนวคิด และช่วยคุณตีความผลลัพธ์ อย่างไรก็ตาม เป็นความรับผิดชอบของคุณที่จะใช้การแก้ไข FDR ประเมินขนาดเอฟเฟกต์ และหลีกเลี่ยงภาษาของสาเหตุ ยีนผู้สมัครเป็นเพียงสมมติฐานจนกว่าจะได้รับการตรวจสอบโดยวิธีอิสระ

งานสมัคร

รับหรือสร้างตารางผลลัพธ์นิพจน์ดิฟเฟอเรนเชียลตัวอย่าง (gen, log2FC, padj) ให้ AI เขียนโค้ดที่กรองตาม FDR<0.05 และ |log2FC|>1 รายงานจำนวนยีนที่สำคัญ และพล็อตกราฟภูเขาไฟ เรียกใช้รหัส จากนั้นให้แบบจำลองคำนวณจำนวนยีนที่จะปรากฏ "สำคัญ" หากไม่มีการแก้ไข และตีความความแตกต่าง

รายการตรวจสอบ

  • [ ] ฉันใช้การแก้ไขการเปรียบเทียบหลายรายการ (FDR)
  • ฉันประเมินขนาดเอฟเฟกต์ (log2FC) รวมถึงค่า p [ ]
  • [ ] ฉันตรวจสอบชุดงาน/ตัวแปรทางเทคนิค
  • [ ] ฉันไม่ได้ข้ามขั้นตอนการทำให้เป็นมาตรฐาน
  • [ ] ฉันใช้ภาษาแห่งความสัมพันธ์มากกว่าความเป็นเหตุเป็นผล
  • [ ] ฉันทำเครื่องหมายยีนผู้สมัครเป็นสมมติฐานที่ต้องได้รับการยืนยัน