Đơn vị 6 / 11

Phân tích dữ liệu Omics: RNA-seq, Biểu hiện, Thống kê và Làm giàu con đường

Lợi nhuận:

  • Khả năng hiểu quy trình làm việc RNA-seq, phân tích biểu thức vi phân và hiệu chỉnh nhiều thử nghiệm (FDR) và sử dụng trí tuệ nhân tạo tạo ra mã phân tích có thể kiểm chứng
  • Khả năng giải thích một cách phê phán các kết quả làm giàu con đường về mặt thống kê và sinh học
  • Khả năng thực hiện kỷ luật kiểm tra các giả định thống kê và nhiều cạm bẫy thử nghiệm cũng như xác minh ý nghĩa sinh học một cách độc lập.

“Omics” là tên gọi chung của các phương pháp đo lường tất cả các phân tử của tế bào hoặc mô cùng nhau: genomics (tất cả DNA), phiên mã (tất cả RNA/biểu hiện), proteomics (tất cả protein), chuyển hóa (tất cả các chất chuyển hóa). Dữ liệu này rất lớn - một thí nghiệm RNA-seq bao gồm các phép đo hàng chục nghìn gen. Trong phần này, bạn sẽ học cách sử dụng trí tuệ nhân tạo (AI) làm trợ lý trong phân tích omics để viết mã, chọn số liệu thống kê và soạn thảo diễn giải sinh học; nhưng bạn sẽ biết tại sao bạn phải xác minh kết quả thống kê và sinh học.

Cảnh báo nghiêm trọng: Trong Omics, các lỗi nguy hiểm nhất là lỗi thống kê và vô hình. AI có thể viết mã bỏ qua nhiều lần hiệu chỉnh so sánh (bên dưới), chọn sai xét nghiệm hoặc tạo ra danh sách gen “dương tính giả”. Ngoài ra, AI còn có thể đưa ra những tuyên bố sinh học như “gen này tăng ở bệnh kia” mà không cần nguồn nào cả. Cách đúng đắn: thực hiện phân tích bằng mã thực thi, có thể kiểm tra được và xác nhận từng tuyên bố sinh học trong tài liệu.

Các khái niệm cơ bản

  • Biểu hiện: Bao nhiêu gen được dịch thành RNA; thước đo “hoạt động”.
  • Biểu hiện khác biệt (DE): Các gen có biểu hiện thay đổi đáng kể giữa hai nhóm (ví dụ: bệnh nhân/khỏe mạnh).
  • giá trị p: Xác suất mà sự khác biệt là sự trùng hợp ngẫu nhiên; nếu nhỏ thì sự khác biệt được coi là "đáng kể".
  • Hiệu chỉnh so sánh nhiều lần: Khi xem xét hàng chục nghìn gen cùng một lúc, tình cờ sẽ có một số gen "đáng kể". Để khắc phục điều này, các phương pháp như FDR (tỷ lệ phát hiện sai) / Stewamini-Hochberg được sử dụng. Nếu sự điều chỉnh này bị bỏ qua, hàng trăm phát hiện sai sẽ xuất hiện.
  • log2 lần thay đổi (log2FC): Logarit của tỷ lệ biểu hiện của một gen giữa hai nhóm với cơ số 2; +1 nghĩa là tăng gấp đôi, −1 nghĩa là giảm gấp đôi.
  • Làm giàu con đường: Tìm ra con đường sinh học nào (ví dụ: phân chia tế bào, miễn dịch) các gen bị thay đổi tập trung; Cơ sở dữ liệu như GO và KEGG được sử dụng.
  • Hiệu ứng hàng loạt: Sự khác biệt giả phi sinh học phát sinh từ việc xử lý mẫu vào các ngày/thiết bị khác nhau.

Từng bước: Phân tích omics được hỗ trợ bởi AI

1. Làm rõ thiết kế và câu hỏi thí nghiệm. Có bao nhiêu mẫu, bao nhiêu nhóm, bao nhiêu lần lặp lại? Sức mạnh thống kê có đủ không? Giải thích thiết kế cho AI.

2. Chọn công cụ/phương pháp phù hợp với AI. Đối với RNA-seq, hãy chọn các phương pháp tiêu chuẩn như DESeq2/edgeR (gói thống kê được thiết kế cho dữ liệu đếm); Sử dụng các phương pháp đã được chứng minh thay vì số liệu thống kê mà AI “bịa ra”.

3. Chạy mã và kiểm tra kết quả đầu ra trung gian. Không tiến hành phân tích DE mà không chuẩn hóa, kiểm soát hiệu ứng lô, vẽ đồ thị chất lượng (PCA).

4. Thực thi sửa lỗi so sánh nhiều lần. Lọc kết quả theo giá trị đã sửa (padj/FDR), không phải giá trị p thô.

5. Xác nhận cách giải thích sinh học trong tài liệu. Giải thích kết quả làm giàu của lộ trình bằng AI, nhưng hãy xác minh từng tuyên bố tại nguồn.

Mẹo: Trong phân tích DE, trước tiên hãy xem biểu đồ tác động tổng hợp và chất lượng. Nếu các mẫu được phân cụm theo ngày chúng được xử lý chứ không phải theo nhóm sinh học, thì hầu hết các gen "có ý nghĩa" mà bạn tìm thấy là những tác động tích lũy chứ không phải sinh học thực sự.

ba trường hợp nhỏ

Trường hợp 1 - Giá trị p không được hiệu chỉnh. Một sinh viên đã kiểm tra 20.000 gen bằng mã do AI viết và tìm thấy "540 gen quan trọng". Khi kiểm tra mã, anh thấy AI đã bỏ qua nhiều lần chỉnh sửa so sánh. Khi hiệu chỉnh FDR được thêm vào, số lượng gen quan trọng giảm xuống còn 32. Nếu không có hiệu chỉnh, hơn 500 gen sai sẽ dựa trên câu chuyện.

Trường hợp 2 - Tuyên bố sinh học bịa đặt. Đối với một gen nằm trong danh sách DE, một nhà nghiên cứu đã hỏi AI "gen này có tác dụng gì đối với căn bệnh này?" anh ấy hỏi; AI giải thích cơ chế thuyết phục và bài viết. Khi tìm kiếm trên PubMed, anh thấy cả cơ chế đó lẫn bài báo đều không tồn tại. Xác nhận quyền sở hữu đã bị xóa khỏi báo cáo.

Trường hợp 3 - Đã đạt được xác nhận. Một nghiên cứu sinh tiến sĩ nhận thấy rằng các mẫu cách nhau hai ngày trong lô PCA. Yêu cầu AI thêm biến hiệu ứng hàng loạt vào mã; Sau khi chỉnh sửa, danh sách gen đã thay đổi hoàn toàn và trở nên có ý nghĩa về mặt sinh học. Nếu không có biểu đồ kiểm soát chất lượng, kết quả giả có thể đã được công bố.

Ví dụ: lọc với giá trị p đã sửa

nhập gấu trúc dưới dạng pd# để bảng 'de' là kết quả từ công cụ DE (DESeq2/edgeR):# cột: gen, log2FC, pvalue, padj (FDR-đã sửa)de = pd.read_csv("de_results.csv")đáng kể = de[(de["padj"] < 0.05) & (de["log2FC".abs() >= 1)]print("Raw p<0,05:", (de["pvalue"] < 0,05).sum())print("FDR-đã sửa padj<0,05 & |log2FC|>=1:", len(đáng kể))

Sự khác biệt giữa số thô và số đã sửa minh họa tại sao việc so sánh nhiều lần lại quan trọng.

Bốn mẫu có thể sao chép

1) Kế hoạch phân tích và lựa chọn phương pháp:

Vai trò của bạn: trợ lý tin sinh học. Thiết lập kế hoạch phân tích cho thí nghiệm RNA-seq sau: [số nhóm, số lượng mẫu/bản sao, câu hỏi]. Tôi nên chọn công cụ tiêu chuẩn nào (DESeq2/edgeR) và tại sao, cần có những bước kiểm soát chất lượng nào (PCA, hiệu ứng lô), làm cách nào để áp dụng hiệu chỉnh so sánh nhiều lần? Viết từng bước một.

2) Mã + kiểm tra bắt buộc:

Viết mã thực thi để thực hiện phân tích DE sau: [chi tiết]. Mã PHẢI bao gồm chuẩn hóa, biểu đồ chất lượng PCA, kiểm soát hiệu ứng hàng loạt và hiệu chỉnh FDR (Benjamini-Hochberg). Bình luận từng bước. Lọc với giá trị p đã sửa, không phải giá trị p thô.

3) Nhận xét làm phong phú lộ trình:

Giúp giải thích kết quả làm giàu con đường cho danh sách các gen quan trọng này: [danh sách/đầu ra]. Giải thích con đường nào nổi bật, nhưng cho tôi biết nguồn nào (GO, KEGG, bài báo được bình duyệt) để xác nhận từng tuyên bố sinh học. Cơ chế/bài viết LẮP.

4) Kiểm toán thống kê:

Kiểm tra mã phân tích sau để tìm lỗi thống kê: [code]. Cụ thể: lựa chọn thử nghiệm không chính xác, bỏ qua hiệu chỉnh so sánh nhiều lần, bỏ qua hiệu ứng hàng loạt, sao chép không đủ. Liệt kê từng vấn đề bạn tìm thấy và cách khắc phục.

Dấu nhắc yếu / Dấu nhắc mạnh

Yếu: "Tìm các gen quan trọng trong dữ liệu RNA-seq này."

Vấn đề: Phương pháp, kiểm soát chất lượng và nhiều so sánh không được chỉ định; AI có thể đưa ra một danh sách đầy những kết quả dương tính giả mà không cần sửa chữa.

Mạnh: "Viết mã thực hiện phân tích DE cho dữ liệu đếm RNA-seq này bằng logic DESeq2, bao gồm kiểm soát chất lượng và kiểm soát hiệu ứng hàng loạt bằng PCA và các bộ lọc có hiệu chỉnh FDR; nhận xét từng bước và giải thích lý do bạn chọn phương pháp này."

Tại sao nó mạnh mẽ: Phương pháp này là tiêu chuẩn, chất lượng và sự điều chỉnh là bắt buộc, kết quả có thể kiểm tra được.

Rủi ro

triệu chứng

đề phòng

dương tính giả

Quá nhiều gen "có ý nghĩa"

FDR/hiệu chỉnh so sánh nhiều lần

tác động tập thể

Các mẫu được nhóm theo ngày

PCA + biến hàng loạt

kiểm tra sai

Kiểm tra bình thường để đếm dữ liệu

Phương pháp phù hợp như DESeq2/edgeR

sinh học tạo thành

Cơ chế hàn

Xác nhận văn học

không đủ điện

1-2 lần lặp lại

Đủ sự lặp lại trong thiết kế

Những lỗi thường gặp

  • Bỏ qua nhiều hiệu chỉnh so sánh. Lỗi thống kê phổ biến nhất và có hại nhất.
  • Bỏ qua tác động tập thể. Nó tạo ra sự khác biệt sinh học sai lầm.
  • Áp dụng thử nghiệm không chính xác để đếm dữ liệu. RNA-seq yêu cầu các phương pháp đặc biệt.
  • Chấp nhận yêu cầu sinh học mà không có nguồn. AI có thể tạo nên các cơ chế và vật phẩm.
  • Khái quát hóa với sự lặp lại không đủ. Không có sức mạnh thống kê, kết quả là không đáng tin cậy.
Thận trọng: “Có ý nghĩa thống kê” không giống như “có ý nghĩa về mặt sinh học”. Một thay đổi rất nhỏ nhưng có ý nghĩa về mặt kỹ thuật có thể không có ý nghĩa về mặt sinh học; Trong các mẫu lớn, mọi thứ đều có thể trở nên "có ý nghĩa". Đánh giá log2FC và giá trị p cùng nhau.

Độ sâu: những cạm bẫy nền tảng và tính toán kép trong quá trình làm giàu con đường

Kết quả làm phong phú lộ trình dựa trên hai giả định tiềm ẩn mà hầu hết mọi người không nhận ra và AI có thể âm thầm vượt qua chúng. Đầu tiên là lựa chọn nền/vũ trụ: việc làm giàu so sánh tập hợp "gen đã thay đổi" với tập hợp "gen đã được xem xét". Nếu nền được lấy từ toàn bộ bộ gen nhưng thí nghiệm của bạn chỉ đo một bảng mô cụ thể thì kết quả sẽ được “làm giàu” một cách giả tạo. Nền đúng là các gen thực sự có thể được biểu hiện/đo lường trong thí nghiệm. Một nhóm đã phát hiện ra “sự phong phú đáng kể của con đường miễn dịch” bằng cách tạo nền nhầm lẫn cho toàn bộ bộ gen; Khi phân tích được lặp lại với nền tảng chính xác (các gen được đo), sự làm giàu biến mất—phát hiện này là một phương pháp giả tạo.

Thứ hai, kích thước bộ gen và tính toán kép: các con đường rất lớn và chung (ví dụ: “quá trình trao đổi chất”, hàng nghìn gen) xuất hiện “đáng kể” trong hầu hết mọi danh sách; những con đường nhỏ, cụ thể sẽ mang lại nhiều thông tin hơn. Ngoài ra, do cùng một gen được tìm thấy trong nhiều con đường nên việc coi các con đường chồng chéo là bằng chứng độc lập là sai lầm. Điểm thứ ba: không thể hiện được chiều hướng làm giàu; Một con đường có thể được làm phong phú hơn, nhưng một nửa số gen bên trong nó có thể được tăng lên và nửa còn lại có thể bị giảm đi. Để thấy được điều này, cần phải kiểm tra riêng thông tin định hướng (chẳng hạn như GSEA).

cái bẫy

triệu chứng

đề phòng

nền sai

Mọi thứ dường như phong phú

Lấy nền gen đo

Con đường rất chung chung

“Sự trao đổi chất” luôn xuất hiện

Tập trung vào những con đường nhỏ, cụ thể

đếm gấp đôi

con đường chồng chéo

Đừng coi đó là bằng chứng độc lập

bỏ qua hướng

tăng/giảm hỗn hợp

Điều khiển hướng với GSEA

Tóm lại

  • AI trong phân tích omics; là trợ lý lựa chọn phương pháp, viết mã và soạn thảo bình luận; các quyết định thống kê và sinh học phải được chứng minh.
  • Nên sử dụng các phương pháp tiêu chuẩn, đã được chứng minh (DESeq2/edgeR); Không nên bỏ qua việc kiểm soát chất lượng và kiểm tra tác động tập thể.
  • Hiệu chỉnh so sánh nhiều lần (FDR) là bắt buộc; kết quả được lọc với giá trị đã sửa.
  • Mọi tuyên bố sinh học phải được xác nhận trong tài liệu; "đáng kể" nên được phân biệt với "quan trọng".

Nhiệm vụ ứng dụng

Lấy bảng kết quả DE mẫu (hoặc bộ dữ liệu RNA-seq mở). So sánh số lượng gen đáng kể dựa trên giá trị p thô và ngưỡng padj đã hiệu chỉnh với đoạn mã trên. Nhận xét về sự khác biệt trong một câu. Sau đó yêu cầu giải thích sinh học với mẫu 3 cho một gen đặc trưng và tự kiểm tra tuyên bố đó trong PubMed.

danh sách kiểm tra

  • [ ] Tôi đã đánh giá thiết kế thử nghiệm và sức mạnh thống kê.
  • [ ] Tôi đã chọn một phương pháp tiêu chuẩn, thuận tiện.
  • [ ] Tôi đã thực hiện PCA và kiểm soát chất lượng hiệu ứng hàng loạt.
  • [ ] Tôi đã áp dụng hiệu chỉnh nhiều so sánh (FDR).
  • [ ] Tôi đã lọc kết quả với giá trị p đã sửa.
  • [ ] Tôi đã xác nhận những tuyên bố sinh học trong tài liệu.