단위 8 / 11

데이터 분석 및 통계 검증

이득:

  • 데이터의 종류와 분포에 적합한 검정을 선택하고 가정(정규성, 분산)을 확인하는 능력
  • p-값의 실제 의미를 이해하고 효과 크기 및 신뢰 구간과 함께 결과를 보고하는 능력
  • 발견-검증 분리, 다중 비교 수정 및 전체 보고를 통해 p-해킹으로부터 보호

실험은 끝났고 데이터가 들어왔습니다. 이제 우리는 가장 중요하고 가장 잘못된 단계에 있습니다. 데이터를 올바르게 분석하고 결과를 정직하게 해석하는 것입니다. 생물학적 데이터는 잡음이 많고 불안정하며 다변수인 경우가 많습니다. 잘못된 테스트 선택, 암묵적인 가정 위반, 무의식적인 p-해킹(원하는 결과를 얻을 때까지 분석 시도)은 출판된 생물학 문헌에서 재현성 위기의 주요 원인입니다. AI는 올바른 테스트를 선택하고, 가정을 확인하고, 분석 코드를 작성하는 데 도움을 줍니다. 그러나 통계적 무결성은 귀하의 책임입니다.

이 단원에서는 일반적인 통계 테스트, 가정 확인 및 p-해킹으로부터 자신을 보호하는 방법을 다룹니다.

올바른 테스트 선택

테스트 선택은 데이터의 유형과 분포에 따라 달라집니다. 인공 지능은 이러한 선택을 하는 데 도움이 되지만 이를 맹목적으로 적용해서는 안 됩니다.

  • 두 그룹, 연속 데이터, 정규 분포: 독립 t-검정.
  • 두 그룹, 비정규: Mann-Whitney U(비모수적: 분포 가정이 필요하지 않음)
  • 2개 이상의 그룹: ANOVA(분산 분석) + 사후 테스트.
  • 범주형 데이터(개수): 카이제곱 또는 Fisher 정확 검정.
  • 관계: 상관관계(Pearson/Spearman) 또는 회귀.
팁: 테스트를 선택하기 전에 데이터를 시각화하세요. 히스토그램이나 상자 그림은 t-검정에 필요한 정규성과 이상치를 즉시 보여줍니다. "그래프 먼저, 테스트는 나중에"는 좋은 습관입니다.

가정 확인

모든 테스트에는 숨겨진 가정이 있습니다. t-검정은 정규 분포와 분산 등분포를 가정합니다. 이를 위반하면 결과가 오해될 수 있습니다. AI는 다음 가정을 확인하는 코드를 작성합니다.

역할: 당신은 생물통계학 조수입니다. 작업: 두 데이터 그룹(정규성(Shapiro-Wilk), 균등 분산(Levene))을 비교하기 전에 t-검정의 가정을 확인하는 코드를 작성하세요. 가정이 위반되면 어떤 대체 테스트로 진행해야 하는지 알려주세요. 주석과 함께 Python 코드를 제공합니다.

정규성이 깨지면 코드는 Mann-Whitney로 리디렉션됩니다. 이 "먼저 확인하고 나중에 결정" 흐름을 통해 잘못된 테스트를 수행하는 것을 방지할 수 있습니다.

p-해킹과 자신을 보호하는 방법

p-hacking은 p<0.05가 될 때까지 다양한 방식으로 데이터를 분석합니다. 즉, 다양한 테스트를 시도하고, 이상값을 선택적으로 삭제하고, 그룹을 추가/제거하고, 수많은 변수 중에서 "중요한" 것이 무엇인지 보고합니다. 이것이 가짜 발견의 주요 원천입니다. 보호 방법:

  1. 분석 계획을 미리 수정합니다(7단원).
  2. 유의미한 테스트만 보고하는 것이 아니라 모든 테스트를 보고합니다.
  3. 다중 비교(FDR/Bonferroni)를 수정합니다.
  4. p-값 옆에 효과 크기와 신뢰 구간을 지정합니다.
  5. 별도의 검색 및 검증: 독립 세트의 검색 세트에서 찾은 내용을 테스트합니다.

단계별: 정직한 분석

  1. 데이터를 시각화합니다(분산형, 이상값).
  2. 가정을 확인하세요.
  3. 미리 결정한 테스트를 수행하십시오.
  4. 다중 비교를 수정합니다.
  5. 보고서 효과 크기 + 신뢰 구간.
  6. 제한사항을 명확하게 작성하세요.

복사 가능한 프롬프트 템플릿

처리량 시각화: 각 그룹에 대한 히스토그램 및 상자 그림을 표시하고 이상값을 표시합니다. 그런 다음 정규성을 해석합니다. 데이터 열: [이름]. 주석과 함께 Python 코드를 제공합니다.

두 그룹을 비교하고 싶습니다. 데이터의 특성: [유형, N, 분포]. 어떤 테스트가 적절한가요? 가정을 확인하고, 테스트를 수행하고, 효과 크기와 p-값이 포함된 95% 신뢰 구간을 보고합니다.

나는 분석에서 15개의 서로 다른 유전자를 테스트했습니다. Bonferroni 및 Benjamini-Hochberg 수정을 적용하는 코드를 제공하고 두 방법의 차이점을 설명하십시오.

약한 프롬프트 / 강한 프롬프트

약함: "이 두 그룹이 다른가요? t-테스트를 해보세요."

Strong: "두 그룹(대조군 n=18, 치료 n=20)이 있고 종속 변수는 효소 활성(연속)입니다. 먼저 Shapiro-Wilk를 사용하여 분포를 시각화하고 정규성을 테스트합니다. 정상이면 t-테스트를 ​​적용하고, 그렇지 않으면 Mann-Whitney를 적용합니다. 결과를 p-값, 효과 크기(Cohen's d 또는 순위-바이시리얼) 및 95% 신뢰 구간으로 보고합니다. 선택한 테스트와 그 이유를 설명하십시오."

차이점: 강력한 프롬프트에는 데이터 유형, 샘플 수, 가정 확인 및 전체 보고 요청이 있습니다. 모델은 맹목적으로 t-test를 적용하는 대신 올바른 경로를 따릅니다.

세 개의 미니 케이스

사례 1 - 잘못된 테스트: 학생이 크게 왜곡된(비정규) 데이터에 t-테스트를 ​​적용한 결과 p=0.048을 발견했습니다. 인공지능이 정규성 검사를 추가했을 때 데이터가 정상적으로 나오지 않았습니다. Mann-Whitney를 사용하면 p=0.11입니다. 실제 결과는 의미가 없었습니다. 교훈: 가정을 확인하지 않고 테스트하는 것은 오해의 소지가 있습니다.

사례 2 - 선택적 이상값 삭제: 연구원은 결과를 의미 있게 만들기 위해 두 개의 "이상값" 점을 삭제했습니다. 모델은 이상치 폐기가 사전 정의된 규칙(예: IQR 방법)을 기반으로 하고 보고되어야 함을 강조했습니다. 임의 삭제는 p-해킹입니다. 교훈: 미리 이상값 규칙을 설정하세요.

사례 3 - 효과 크기 회복: 한 연구에서는 p=0.001이었지만 효과 크기(d=0.1)는 거의 0이었습니다. 큰 표본에서는 유의미한 차이가 있는 것으로 나타났습니다. 인공지능이 효과크기를 보고했을 때 그 결과는 실질적인 가치가 없는 것으로 드러났다. 교훈: p가 작다고 해서 문제가 되지는 않습니다.

비교 차트

상태

올바른 접근

피해야 할 것

비정상적인 데이터

비모수적 테스트

강제 t-검정

멀티 테스트

수정 적용

조 p<0.05

특이치

사전 정의된 규칙

임의삭제

중요한 결과

효과 크기 + CI

그냥 피

발견 발견

독립 세트에 대한 유효성 검사

한세트로 마무리

일반적인 실수

  • 가설 통제되지 않은 테스트: 잘못된 테스트로 인한 허위 유의성.
  • p-해킹(p-hacking): 원하는 결과가 나올 때까지 분석을 시도합니다.
  • p-값만 보고: 효과 크기 및 신뢰 구간을 생략합니다.
  • 다중 비교를 수정하지 않음: 거짓 긍정.
  • 인과관계 도약: 상관관계로부터 인과관계를 추론합니다.
주의: AI는 원하는 결과를 "생성"하지 않지만 잘못된 테스트에 대한 코드를 기꺼이 작성합니다. 통계적 무결성이 있습니다. 모든 시험을 보고하고, 사전에 분석을 계획하고, 효과 크기를 놓치지 마십시오. 출판을 위한 분석을 위해 생물통계학자와 협력하십시오.

p-값의 실제 의미

생물학에서 가장 오해되는 개념은 p-값입니다. p-값은 "가설이 참일 확률"이 아닙니다. 이는 "실제로는 차이가 없는데 관찰한 것보다 크거나 더 극단적인 차이를 볼 확률"입니다. 이 미묘하지만 중요한 차이는 결과를 과장하지 않는 데 중요합니다. p=0.03은 "효과가 97% 실제"라는 의미는 아닙니다. AI가 결과를 해석하도록 할 때 이 정의를 올바르게 사용하는지 확인하세요. 모델은 때때로 일반적인 잘못된 해석을 반복할 수 있습니다.

신뢰 구간(CI)은 효과의 크기와 불확실성을 함께 표시하므로 p-값보다 더 많은 정보를 제공하는 경우가 많습니다. "차이 2.4배(95% CI: 1.8-3.1)"는 "p<0.05"보다 훨씬 더 많은 의미를 갖습니다. 즉, 효과의 방향, 크기 및 측정 정확도가 모두 다릅니다. 보고서에서 GA를 강조표시하세요.

결과를 해석할 때 p-값의 올바른 정의를 사용하십시오. "효과가 사실일 확률"과 같은 잘못된 진술을 피하십시오. 대신, 효과크기와 95% 신뢰구간 측면에서 실질적인 의미를 설명하세요. 결과: [데이터]

상관관계, 인과관계, 관찰 데이터

대부분의 생물학적 데이터는 관찰적입니다. 무언가가 다른 것과 함께 변화하는 것을 볼 수 있지만 무엇이 원인인지는 알 수 없습니다. "유전자 X의 발현은 질병과 상관관계가 있다"라는 문장은 X가 질병을 유발한다는 것을 의미하지 않습니다. 질병이 X를 증가시키거나 세 번째 요인이 두 가지 모두에 영향을 미칠 수 있습니다. 인과관계는 중재적 실험(X 변경 및 결과 측정)을 통해서만 확립될 수 있습니다. AI는 텍스트에서 자신도 모르게 인과적 언어(“원인”, “이끌다”)를 사용할 수 있습니다. 이러한 관점에서 각 결론 문장을 검토하고 관찰 결과를 상관 언어(“상관됨”, “함께 변화함”)로 표현합니다.

쌍을 이루는 데이터와 독립된 데이터 분리

테스트 선택에서 가장 자주 간과되는 차이점은 표본이 독립적인지 쌍인지 여부입니다. 동일한 개인으로부터 전후 측정을 수행하는 경우(예: 치료 전후 동일한 환자의 혈액 값) 이러한 측정은 독립적이지 않습니다. 페어링 테스트가 필요합니다. 여기서 독립 2-표본 t-검정을 사용하면 데이터의 일치 정보가 삭제되고 검정력이 감소합니다. 심지어 결과가 반전될 수도 있습니다. 규칙은 간단합니다. "이 두 측정값이 동일한 생물학적 단위에서 나온 것입니까?" 대답이 '예'이면 쌍 검정(쌍 t-검정 또는 Wilcoxon 부호 순위 검정)을 사용하고, '아니오'이면 독립 검정을 사용합니다. 인공지능에게 테스트를 요청할 때 데이터의 일치 구조를 지정해야 합니다. 지정하지 않으면 모델이 독립성을 가정하고 잘못된 테스트를 권장하는 경우가 많습니다.

두 가지 측정 세트가 있습니다. 중요: 이러한 측정은 동일한 개인(쌍) 이전/이후에 수행되었습니다. 이 일치를 고려한 올바른 테스트(쌍 t-테스트 또는 Wilcoxon)를 선택하고 가정을 확인한 후 효과 크기로 보고하세요. 독립을 가정하지 마십시오.

요약하면

정확한 데이터 분석; 데이터 유형에 대한 적절한 검정 선택, 가정 확인, 다중 비교 수정, p-값 외에 효과 크기 및 신뢰 구간 보고. 가장 큰 위험은 p-해킹입니다. 해독제는 사전 분석 계획, 전체 보고, 발견-검증 분리입니다. 인공 지능은 테스트 선택 및 가정 확인에 강력한 도움을 주지만 통계적 무결성은 인간에게 있습니다.

응용과제

두 그룹이 포함된 데이터 세트(자신의 데이터 또는 샘플)를 가져옵니다. 먼저 AI가 데이터를 시각화하고 정규성을 테스트하는 코드를 작성하도록 합니다. 결과에 따라 적절한 테스트(t-테스트 또는 Mann-Whitney)를 적용하고 p-값과 함께 효과 크기 및 신뢰 구간을 보고합니다. 그런 다음 수정이 없는 다중 비교와 결과에 대한 수정이 있는 다중 비교의 효과를 비교합니다.

체크리스트

  • [ ] 테스트하기 전에 데이터를 시각화했습니다.
  • [ ] 테스트 가정(정규성, 분산)을 확인했습니다.
  • [ ] 나는 적절한 검정을 선택했고, 무턱대고 t-검정을 적용하지는 않았습니다.
  • [ ] 다중 비교를 수정했습니다.
  • 나는 [ ] p-값과 효과 크기 및 신뢰 구간을 보고했습니다.
  • [ ] 분석계획을 미리 수정하여 p-해킹을 피했습니다.