이득:
- p-hacking, HARKing, 선택적 보고 및 분기 경로 정원이 잘못된 결과를 낳는다는 점을 이해하고 인공 지능이 이러한 함정을 어떻게 가속화할 수 있는지 알아보세요.
- 인공지능 지원으로 사전등록, 분석계획, 다중비교 규율, 민감도 분석 등 방어체계 구축 능력
- 인공지능이 '의미 있는 결과 찾기' 유형의 요청을 거부하고 최종 책임이 연구자에게 있음을 가능하게 하는 정직한 요청 설계를 내면화할 수 있습니다.
이전 단원에서 우리는 p-값이 무엇인지, 무엇이 아닌지 살펴보았습니다. 이번 단원에서 우리는 더 어두운 주제, 즉 통계적 무결성을 위협하는 체계적 함정을 살펴볼 것입니다. 이들 중 대부분은 의도적인 부정행위가 아닙니다. 이는 선의의 연구자라도 깨닫지 못한 채 빠져드는 교활한 메커니즘입니다. 그리고 인공 지능(AI)을 사용하면 수십 개의 분석을 몇 초 만에 실행할 수 있으므로 이러한 함정을 더 쉽고 빠르게 수행할 수 있습니다. 본 단원의 목적은 AI를 "의미 있는 결과를 찾는 기계"에서 정직한 조수로 변화시키는 규율을 확립하는 것입니다.
기본적인 함정
p-hacking(p-value Hunting): 유의미한 결과(p<0.05)를 얻을 때까지 다양한 방법으로 분석을 다시 시도합니다. 변수 추가 및 제거, 하위 표본 선택, 이상값 정의 변경, 다른 변환 시도, 다른 결과 변수 사용, 의미 있는 데이터 수집 중지... 각 시도는 새로운 "기회"를 제공합니다. 열심히 노력하면 그 중 하나가 실제로는 별 효과가 없더라도 의미 있는 것으로 판명될 것입니다. 그 결과, 출판되었지만 재현할 수 없는 가짜 결과가 나왔습니다.
HARKing(결과가 알려진 후 가설): 결과를 보고 가설을 세우고 "처음부터 이렇게 예상했다"고 제시합니다. 데이터를 보고 가장 눈에 띄는 관계를 찾은 다음, 해당 가설을 테스트하기 위해 고안된 것처럼 논문을 작성합니다. 이는 발견이 확인된 것처럼 보이게 하여 독자를 오도합니다.
선택적 보고(체리피킹): 수십 번의 분석 중 "좋은" 것만 보고하고 나머지는 조용히 묻어둡니다. 이는 "파일 서랍 문제"라고도 알려져 있습니다. 의미 없는 결과가 서랍에 남아 있어 문헌이 체계적으로 편향되게 됩니다.
갈림길의 정원: Andrew Gelman의 용어. 단 한 번의 의도적인 p-해킹이 없더라도 연구원은 데이터(어떤 변수, 어떤 임계값, 어떤 하위 그룹, 어떤 변환)를 기반으로 많은 합리적인 선택을 합니다. 이러한 조사 자유도는 매우 다양하므로 악의가 없더라도 수많은 분석 중에서 의미 있는 것을 효과적으로 선택할 수 있습니다. 그 결과 다시 오탐률이 증가합니다.
주의: 이러한 함정의 대부분은 고의적인 속임수가 아닙니다. "방금 몇 가지 모델을 더 시도했습니다.", "이상값을 제거했을 때 더 깔끔해졌습니다.", "이 하위 그룹에서 효과가 더 명확해졌습니다."와 같이 겉으로 보기에 순진해 보이는 단계의 합은 잘못된 결과를 생성할 수 있습니다. 정직은 의도의 문제가 아니라 방법의 문제입니다.
AI가 이러한 함정을 확대하는 이유는 무엇입니까?
3가지 모델을 직접 시험해 보려면 시간이 걸립니다. YZ는 몇 분 안에 50개의 모델 변형, 10개의 다양한 변환, 8개의 하위 그룹을 생성합니다. 이 힘은 정직한 계획 없이는 재앙입니다. “이 데이터에서 의미 있는 관계를 찾아주세요” 또는 “이 가설을 뒷받침하는 모델을 구축하세요”와 같은 요청은 AI를 직접 p-해킹 엔진으로 전환시킵니다. AI도 도움이 되기를 원합니다. 당신을 만족시킬 수 있는 "의미 있는" 결과를 찾는 경향이 있습니다. 그렇기 때문에 신속한 디자인이 정직의 첫 번째 방어선입니다.
방어: 공정한 사업 과정
1. 사전 등록: 분석을 수행하기 전에 가설, 변수, 모델 및 테스트를 서면(타임 스탬프가 표시된 플랫폼에 가능)으로 기록하는 것을 의미합니다. 따라서 발견은 확인과 분리됩니다. 나중에 변경하는 모든 항목에는 "탐색기"라는 태그가 지정됩니다.
2. 분석 계획: 사전 기록이 불가능하더라도 데이터를 자세히 살펴보기 전에 분석 계획(1차 가설, 1차 결과 변수, 주요 모델)을 작성하세요. '주요 분석'과 '추가/탐색 분석'을 처음부터 구분하여 보고서에 유지합니다.
3. 모든 것을 보고하세요: 시도한 모델을 숨기지 마세요. "민감도 분석"(강건성 검사) 섹션에서는 사양에 따라 결과가 어떻게 달라지는지 보여줍니다. 그 결과는 그럴듯한 선택이 많이 있을 경우에만 강력합니다.
4. 다중 비교 규율: 테스트를 너무 많이 했다면 수정하세요(6단원). "몇 번이나 테스트를 진행했나요?"라는 질문에 답하세요. 솔직히.
5. 민감도 분석: 다른 샘플, 다른 제어 세트 및 다른 변환을 사용하여 주요 결과를 반복합니다. 결과가 바뀌면 숨기지 말고 신고하세요.
비교 차트: 정직함과 함정
신청
함정 모양
정직한 동등
모델 선택
의미가 있을 때까지 시도(p-해킹)
사전 계획된 마스터 모델
가설
사실 이후의 피팅(HARKing)
사전 녹음, 데이터 이전
보고
아름다운 것만 보여주지 마세요
모든 사양 + 감도
하위 그룹
가장 눈에 띄는 것을 선택
사전 정의되고 수정 가능
데이터 수집
말이 된다면 그만둬
미리 결정된 샘플
복사 가능한 프롬프트 4개
1. 정직한 주장 프레임워크:
귀하의 역할: 정직한 통계 보조원. 내 목표는 의미 있는 결과를 찾는 것이 아니라 올바른 결과를 찾는 것입니다. 규칙:- "말이 될 때까지 모델을 사용해 보세요" 유형 제안을 제공하지 마십시오. - 보고해야 할 여러 사양을 제안하는 경우 알려주십시오. - p-해킹으로 이어질 수 있는 단계에 대해 경고하십시오. 발견과 확인을 분리하여 먼저 주요 모델을 명확히 할 수 있도록 도와주세요.
2. 분석 계획 초안:
연구를 위한 예비 분석 계획 초안 작성을 도와주세요: 1차 가설, 1차 결과 변수, 주요 모델 사양, 사전 정의된 하위 그룹, 다중 비교 전략. "탐색적" 분석과 "확증적" 분석을 별도의 제목에 넣으세요. 데이터를 보지 않고 이 항목을 작성해야 한다는 점을 상기시켜 주세요.
3. 민감도 분석:
나의 주요 발견은 민감도 분석 코드(R)를 작성하는 것입니다. 나의 목표는 결과가 얼마나 확실한지 확인하는 것이지 최선의 결과를 선택하는 것이 아닙니다. 모든 결과를 표시합니다.
4. 자체 모니터링:
분석 과정을 설명하겠습니다. p-해킹/HARKing/선택적 보고를 위한 체크리스트를 제공하고 내 단계 중 위험한 단계를 표시하세요. 얼마나 많은 모델/테스트를 시도했는지, 어떤 모델/테스트를 보고할 계획인지 다시 물어보세요.
약한 프롬프트 / 강한 프롬프트
약한 프롬프트:
이 데이터에서 어떤 변수가 중요한 관계를 나타내는지 확인하고 가장 적합한 모델을 찾으세요.
이 프롬프트는 직접적인 p-해킹 지시입니다. AI는 수십 가지 조합을 시도하고 "가장 합리적인" 조합을 제시합니다. 그 결과는 복제할 수 없는 허위 발견인 것이 거의 확실합니다.
강력한 프롬프트:
당신의 역할: 정직한 조수. 내가 미리 결정한 기본 모델은 Y ~ X + 컨트롤입니다. 이 모델을 예측하는 코드를 작성하세요. 다른 "더 의미 있는" 모델을 찾지 마십시오. 또한 결과의 견고성을 확인할 수 있도록 민감도 분석을 제안합니다. 그러나 가장 좋은 결과를 선택하는 것이 아니라 모든 결과를 보고할 것이라는 점을 알아두십시오. 탐색 결과를 '확인됨'으로 기록하지 마세요.
차이점: 강한 의지는 기본 모델을 수정하고 검색을 금지하며 모든 결과를 보고하도록 요구합니다.
세 개의 미니 케이스
사례 1 - 하위 그룹 사냥. 한 연구원은 전체 표본에서 아무런 효과도 발견하지 못했습니다. 그는 AI에게 “어느 하위 그룹에서 유의미한가?”라고 물었다. YZ는 연령, 성별, 지역 조합을 스캔한 결과 "35~44세 도시 여성의 경우 p = 0.03"을 발견했습니다. 이 기사는 이 하위 그룹을 기반으로 작성되었습니다. 그의 복제는 아무런 효과도 발견하지 못했습니다. 이는 수십 개의 하위 그룹에서 발생한 우연의 결과였습니다. 교훈: 데이터가 HARKing된 후 선택된 하위 그룹은 확인되지 않습니다.
사례 2 - 전환 사냥. 학생 수준에서 보면 의미 없는 관계로 밝혀지는 관계; 로그, 제곱근, 제곱 및 지연 형식으로 시도해 보았습니다. 그는 로그-로그 형식에서 p=0.048을 발견하고 그 내용만 보고했습니다. 운 좋게도 5가지 형태 중 하나가 임계점을 넘었습니다. 올바른 방법은 이론이 포함된 양식을 미리 선택하고 민감도 표에 모든 양식의 결과를 표시하는 것입니다. 교훈: 선택적 보고는 잘못된 의미를 낳습니다.
사례 3 — 정직한 프레이밍이 작동하는 방식. 분석 전에 사전 등록된 한 팀: 단일 1차 가설, 단일 주요 모델, 사전 정의된 하위 그룹 2개, Bonferroni 수정. 주효과는 유의미하지 않았지만 팀은 이를 솔직하게 보고했습니다. 탐색적인 개인은 한 가지 발견에 "향후 테스트가 필요하다"고 표시했습니다. 연구는 재현 가능하고 신뢰할 수 있었습니다. 교훈: 정직한 계획은 "실패"한 결과도 가치 있게 만듭니다.
일반적인 실수
- AI에게 "의미 있는 결과를 찾도록" 지시합니다. 이것은 바로 해킹입니다. 결과가 아닌 정확성을 요구하는 정직한 프레임에 AI를 배치합니다.
- 확인을 통해 발견을 제시합니다(HARKing). 데이터 이후에 확립된 가설을 "처음부터 예측했다"고 쓰는 것은 오해의 소지가 있다. 탐색적 결과에 라벨을 붙입니다.
- 좋은 결과만 보고하겠습니다. 테스트된 모든 사양을 표시합니다. 감정 분석을 숨기면 무결성이 손상됩니다.
- 하위 그룹/전환 심사. 수십 개의 하위 그룹이나 변환 중에서 가장 중요한 것을 선택하면 잘못된 결과가 생성됩니다. 미리 파악하고 수정하세요.
- 얼마나 많은 테스트를 수행했는지 잊어버렸습니다. 총 시도 횟수를 추적하세요. 이 숫자를 모르면 p-값을 정직하게 해석할 수 없습니다.
팁: 결과를 기록하기 전에 다음과 같이 자문해 보십시오. "이 결과를 찾을 때까지 몇 가지 방법을 조용히 시도했으며 모두 보고하고 있습니까?" 에세이 중 일부가 서랍에 남아 있으면 보고서가 실제보다 더 강력해 보입니다.
요약하면
p-해킹, HARKing, 선택적 보고 및 분기 경로의 정원; 대부분은 의도치 않게 작동하지만 허위적이고 재현할 수 없는 결과를 생성하는 함정입니다. AI는 수십 가지 분석을 즉시 시도할 수 있기 때문에 이러한 함정을 가속화합니다. "의미 있는 결과 찾기" 유형의 요청은 AI를 p-해킹 엔진으로 전환합니다. 방어; 사전 등록 및 분석 계획을 통해 발견과 확인을 분리하고, 모든 사양 및 민감도 분석을 보고하고, 다중 비교를 수정하고, "올바른 결과"를 요구하는 정직한 프레임워크에 AI를 배치합니다. 최종 책임은 언제나 연구자에게 있습니다.
응용과제
데이터를 보기 전에 연구 질문을 선택하고 간단한 분석 계획(1차 가설, 주요 모델, 1차 결과 변수, 사전 정의된 하위 그룹, 다중 비교 전략)을 작성합니다. 그런 다음 주요 모델을 추정하십시오. 그런 다음 민감도 분석(다양한 컨트롤, 이상치 포함/제외, 다양한 함수 형식)을 수행하고 모든 결과를 단일 테이블에 표시합니다. 한 단락에서 p-해킹의 위험이 있는 단계와 정직한 프레임워크가 이를 어떻게 제한하는지 평가하세요.
체크리스트
- [ ] 데이터를 살펴보기 전에 분석 계획/마스터 모델을 작성했습니다.
- [ ] 탐색적 분석과 확증적 분석을 별도로 표시했습니다. 나는 생각하지 않았습니다.
- [ ] 시도한 모든 사양을 보고했습니다. 나는 단지 아름다운 것을 선택한 것이 아닙니다.
- [ ] 하위 그룹과 변환을 미리 정의했지만 데이터 이후에는 스캔하지 않았습니다.
- [ ] 나는 얼마나 많은 테스트를 실행했는지 추적하고 필요한 수정 사항을 적용했습니다.
- [ ] 나는 “의미를 찾는 것”보다는 “진실을 찾는 것”의 맥락에서 AI를 사용했습니다. 나는 책임을 맡았습니다.