단위 3 / 10

Omics 데이터 분석: Transcriptomics, Proteomics 및 Multi-Omics 통합

이득:

  • 차등 발현 분석의 다중 테스트 수정(수정된 p-값) 및 배수 변화를 올바르게 해석하고 위양성을 방지하는 기능
  • 배치 효과를 감지하고 이를 PCA를 통해 모델에 추가하고 생물학적 차이에서 기술적 노이즈를 분리합니다.
  • 각 경로 ID를 소스에 연결하고 경로 강화 및 다중 오믹스 통합에서 생물학적 일관성을 유지하면서 이를 제어하는 능력

셀은 단일 숫자가 아닙니다. 수천 개의 유전자, 단백질, 대사산물이 동시에 춤을 추는 시스템이다. Omics(생물학적 층 전체를 측정하는 접근 방식의 총칭)는 유전체학(DNA), 전사체학(RNA - 유전자가 작동하는 정도와 정도), 단백질체학(단백질), 대사체학(소분자) 등 전체 춤을 포착하려고 합니다. 각 오믹스 레이어는 수천 개의 차원적이고 시끄럽고 비용이 많이 드는 데이터를 생성합니다. AI는 이러한 고차원 데이터를 스캔하고 패턴을 표시하는 데 강력합니다. 하지만 어떤 패턴이 생물학적 진실이고 어떤 패턴이 기술적 잡음인지 결정하는 사람은 바로 당신입니다.

본 단원에서는 가장 일반적인 오믹스 분석인 전사체학(transcriptomics)을 진행합니다. 이 원칙은 다른 레이어에도 적용됩니다. 일반적인 작업 흐름: 원시 데이터의 발현 매트릭스(행은 유전자, 열은 샘플, 세포는 발현 수준), 정규화(기술적 차이 제거), 차등 발현 분석(두 조건 간에 크게 변화하는 유전자 찾기), 경로 강화(변경된 유전자가 클러스터된 생물학적 경로 찾기) 및 해석.

미분 표현: 배수 변화 및 수정된 p-값

유전자가 "변경"되었는지 확인하기 위해 두 가지 숫자를 살펴봅니다. 변화 배수(일반적으로 log2 척도에서 발현이 증가/감소하는 횟수)와 조정된 p 값(padj - 다중 테스트가 수행될 때 위양성을 제어하는 ​​통계)입니다. 왜 고쳐야 할까요? 동시에 20,000개의 유전자를 테스트하기 때문입니다. 우연히도 수백 개의 유전자가 "중요한" 것으로 판명될 수 있습니다. Benjamini-Hochberg와 같은 방법을 사용하여 잘못된 발견 비율을 제한하는 다중 테스트 수정이 없으면 목록은 오해의 소지가 있습니다. AI는 이 통계를 계산하는 스크립트를 작성할 수 있지만 수정 사항을 생략하면 결과는 과학적으로 방어할 수 없습니다.

주의: AI는 원시 p-값을 기반으로 "500개의 유전자가 크게 변경되었습니다"라고 말할 수 있습니다. 수정된 p-값을 보면 숫자가 30으로 떨어질 수 있습니다. 항상 다중 테스트 수정 사항을 직접 확인하세요. 이것이 출판물 승인과 거부의 차이입니다.

배치 효과: 가장 교활한 함정

배치 효과(다른 요일, 장치 또는 사람에 따라 샘플 처리에서 발생하는 기술적 차이)는 오믹스 분석에서 가장 큰 오류 원인입니다. 두 가지 조건이 서로 다른 두 날에 처리된 경우 표시되는 "생물학적 차이"는 실제로 날짜 차이일 수 있습니다. AI는 모델에 배치 변수를 추가할 것을 제안할 수 있지만(예: ~ 배치 + 조건) 이를 올바르게 설정하고 실험 설계에서 혼동하지 않는 것은 귀하의 책임입니다.

Tip: 분석을 시작하기 전 PCA(Principal Component Analysis - 고차원 데이터를 여러 축에 요약하고 시각화하는 방법) 차트를 그려보세요. 샘플이 생물학적 조건이 아닌 배치별로 클러스터링된 경우 배치 효과가 지배적이므로 먼저 수정해야 합니다.

다중 오믹스 통합

진정한 이해는 종종 여러 층을 합치는 것에서 나옵니다. 유전자가 더 열심히 작동하지만 단백질이 증가하지 않으면 조절은 번역 수준에서 이루어집니다. 다양한 오믹스 레이어를 단일 모델로 결합하는 다중 오믹스 통합은 AI가 더욱 강력해지는 부분이기도 하지만 가장 오해를 불러일으키는 부분이기도 합니다. 레이어의 스케일, 노이즈 및 샘플 일치가 다르기 때문입니다. AI는 통합 워크플로를 제안하지만 결과의 생물학적 일관성은 사용자가 제어합니다.

세 개의 미니 케이스

사례 1 — 강화가 가속화되었습니다. 암 프로젝트에서 1,240개의 차등 유전자가 발견되었습니다. AI는 세포주기와 DNA 복구 경로를 강조하여 경로 강화를 위해 준비했습니다. 팀은 2시간 만에 가설 지도를 만들었습니다. 그러나 그들은 독립적인 도구(g:Profiler)를 사용하여 각 경로를 다시 테스트한 결과 하나의 경로가 AI에 의해 잘못 매핑되었음을 발견했습니다.

사례 2 — 일괄 트랩. 한 연구실에서는 두 치료 그룹 사이에 "놀라운" 900개의 유전자 차이가 있음을 발견했습니다. PCA를 수행했을 때 샘플이 배치별로 분리되어 있는 것을 확인했습니다. 일괄 수정 후 실제 차이는 60개 유전자로 감소했습니다. AI는 첫 번째 분석에서 의도치 않게 배치변수를 생략했습니다.

사례 3 - 만들어진 경로 이름. 한 학생이 AI에게 유전자 목록을 주고 "어떤 KEGG 경로인가요?"라고 질문했습니다. AI는 마치 실제처럼 진로 ID와 이름을 알려줬다. 학생이 KEGG를 검색했을 때 해당 ID가 존재하지 않는다는 것을 확인했습니다. 검증을 통해 조작된 결과를 방지했습니다.

복사 가능한 템플릿 4개

1) DESeq2 작업흐름 개요:

귀하의 역할: 계산 생물학자. R/DESeq2를 사용하여 RNA-seq 차등 발현 분석을 위한 단계별 스크립트를 작성합니다: 카운트 매트릭스 판독, 설계 공식(~ 배치 + 조건), 정규화, 결과 테이블. 명시적으로 다중 테스트 수정(BH)을 적용하고 padjcolumn을 사용하십시오. 설명 줄에 각 단계의 기능을 설명하세요.

2) 품질/배치 관리:

RNA-seq QC 체크리스트를 알려주세요: PCA를 사용한 배치 제어, 라이브러리 크기, 유전자 검출 수, 이상값 검출. 각 측정항목에 대해 "내가 본 내용이 나를 걱정하게 만듭니다" 임계값을 지정합니다. 배치와 생물학적 조건이 혼합된 경우 어떻게 해야 하는지 설명하십시오.

3) 농축 결과 검증:

풍부한 경로 목록(경로 수, padj, 유전자)을 제공하겠습니다. 각 경로의 ID(KEGG/GO ID)를 그대로 기록하고 꾸며내지 마십시오. padj < 0.05로 결과를 필터링합니다. 생물학적으로 서로를 지원하는 경로를 지정하되 각 ID를 "데이터베이스에서 확인해야 함"으로 표시합니다.

4) 다중 오믹스 일관성 확인:

전사체 및 단백질체는 유전자/단백질 쌍에 대한 발현 방향이 상충됩니다. 이에 대한 가능한 생물학적(번역 후 편집) 및 기술적(측정 노이즈, 샘플 일치) 이유를 나열하고 각각을 테스트하는 방법을 알려주십시오.

약한 프롬프트 / 강한 프롬프트

약한 프롬프트:

이 유전자 목록에서 중요한 경로의 이름을 지정하십시오.

출처도 없고, 통계도 없고, 조작된 경로의 위험이 높습니다.

강력한 프롬프트:

귀하의 역할: 계산 생물학자. 첨부된 차등유전자표(gene, log2FC, padj)에서는 padj < 0.05인 유전자만을 취합니다. 이러한 유전자와 제가 사용할 도구(g:Profiler)를 사용하여 수행할 GO 농축 분석 단계를 알려주십시오. 경로 이름은 FAKE입니다. 도구를 실행하고 분석을 수행하겠습니다. 올바른 방법론과 여러 테스트 수정 사항만 설명하면 됩니다.

차이점: 명확한 필터, 방법론 집중, 조작 금지 및 사용자에게 검증을 남깁니다.

오믹스 분석 단계

단계

목적

흔한 실수

AI 역할

정규화

기술적 차이 제거

잘못된 방법 선택

스크립트 + 근거

PCA/QC

일괄 및 이상치 감지

내 발걸음을 건너 뛰다

이미지 + 댓글

미분 표현

변화하는 유전자를 찾아서

수정되지 않은 p

스크립트 초안

농축

길을 찾아라

조작된 경로

방법론

통합

레이어 병합

크기 조정/일치 오류

워크플로우 권장사항

단일 세포 오믹스: 새로운 규모

최근에는 수천 개의 세포 각각의 발현 프로파일을 개별적으로 측정하는 단일 세포 시퀀싱이 오믹스를 새로운 차원으로 끌어올렸습니다. 이제 "조직의 평균 발현" 대신 해당 조직 내의 각 세포 유형을 개별적으로 볼 수 있습니다. 이 힘은 새로운 함정을 야기합니다. 데이터가 극도로 희박하고(대부분의 유전자는 대부분의 세포에서 판독값이 0입니다(드롭아웃)). 크기는 수만 개의 세포 × 2만 개의 유전자이며, 세포 유형 분리는 대부분 클러스터링을 통해 수행됩니다. AI는 단일 세포 데이터에 대한 클러스터링 및 세포 유형 라벨링 개요를 생성하는 데 강력합니다. 그러나 알려진 마커 유전자를 사용하여 각 클러스터가 실제 세포 유형인지 아니면 기술적 인공물(예: 죽은 세포, 두 세포가 함께 묶인 것)인지 확인합니다. 실제 문헌에서 해당 클러스터의 마커 유전자를 확인하지 않고 AI가 제안한 세포 유형 라벨을 받아들이지 마십시오.

팁: 단일 세포 분석에서 AI가 클러스터에 "T 세포" 라벨을 제안하는 경우 T 세포 마커(예: CD3)가 실제로 해당 클러스터에서 높게 발현되는지 직접 확인하십시오. 레이블이 토큰에서 지원되지 않는 경우 이는 결론이 아니라 가설입니다.

일반적인 실수

  • 여러 테스트 수정을 건너뜁니다. 목록은 원시 p-값으로 가득 차 있습니다. padj를 사용해야 합니다.
  • 배치 효과를 생물학으로 착각함. 먼저 PCA로 확인해야 합니다.
  • 바닥 변경을 유일한 기준으로 삼는 것입니다. 높은 배수 변화는 발현이 낮고 시끄러운 유전자에서 오해의 소지가 있을 수 있습니다.
  • 만들어진 경로/GO 정체성을 받아들입니다. 모든 신원은 데이터베이스에서 확인되어야 합니다.
  • 표본 크기를 과소평가합니다. 2x2 설계에서는 통계적 검정력이 낮습니다. 결과는 주의 깊게 해석되어야 합니다.

요약하면

오믹스 분석은 시끄러운 고차원 데이터로 작동하며 AI는 데이터를 스캔하고, 스크립트를 작성하고, 패턴을 표시하여 이 데이터를 가속화합니다. 그러나 미분 표현의 다중 테스트 수정, PCA를 통한 일괄 제어 및 농축의 소스 검증은 필수입니다. 다중 오믹스 통합은 강력하지만 오해의 소지가 있습니다. 레이어의 규모와 노이즈 차이를 고려하여 각 결과의 생물학적 일관성을 확인합니다.

응용과제

공개적으로 이용 가능한 RNA-seq 카운트 매트릭스를 찾아보세요(예: GEO에서). AI가 "DESeq2 워크플로" 템플릿을 사용하여 분석 스크립트를 작성하고 다중 테스트 수정이 실제로 적용되었는지 코드를 체크인하도록 합니다. 그런 다음 AI에게 강화 코멘트를 요청하고 AI가 반환하는 모든 경로 ID를 KEGG 또는 GO 데이터베이스에 대해 하나씩 확인합니다. 얼마나 많은 것이 진짜인지 주목하세요.

체크리스트

  • [ ] 미분 분석에서는 원시 p-값이 아닌 padj(보정)를 사용했습니다.
  • [ ] PCA로 배치 효과를 확인하고 필요하면 모델에 추가했습니다.
  • [ ] 나는 배수 변화가 높지만 발현이 낮은 유전자를 조심스럽게 해석했습니다.
  • [ ] 실제 데이터베이스와 비교하여 각 경로/GO ID를 확인했습니다.
  • [ ] 표본 크기의 통계적 검정력을 평가했습니다.
  • [ ] 나는 다중오믹스 모순을 생물학적 원인과 기술적인 원인으로 나누었습니다.