단위 3 / 11

탐색적 데이터 분석 및 시각화: 인공 지능을 이용한 그래프 작성 및 해석

이득:

  • 인공지능 지원으로 기술통계 및 분포/관계형 차트를 생성하고, 데이터 및 질문에 따라 적합한 차트 유형을 선택하는 기능
  • 인공지능이 생성한 이미지에서 오해의 소지가 있는 선택(점선 축, 부적절한 크기, 과도한 평활화)을 인식하고 정직한 시각화 원리를 적용하는 능력
  • 탐색적 분석을 구별할 수 있다는 것은 가설을 생성하기 위한 것이며, 동일한 데이터로 발견과 확인을 하는 함정(P-해킹의 문을 여는 것)입니다.

데이터를 정리한 후 경험적 연구자의 첫 번째 임무는 데이터를 알아내는 것입니다. 이 단계를 탐색적 데이터 분석(EDA - 탐색적 데이터 분석)이라고 합니다. 이는 그래프와 요약 통계를 통해 데이터를 조사하고 데이터의 구조, 패턴 및 놀라움을 확인하는 프로세스입니다. 목표는 아직 가설을 테스트하는 것이 아니라 데이터에 익숙해지고 질문을 생성하며 향후 구축할 모델의 토대를 마련하는 것입니다. 이번 단원에서는 인공 지능(AI)이 어떻게 EDA 및 시각화를 가속화하는지, 그리고 AI가 생성하는 그래픽을 주의 깊게 감사해야 하는 이유를 살펴보겠습니다.

먼저 두 가지 기본적인 차이점을 살펴보겠습니다. 첫째, 기술통계(평균, 중앙값, 표준편차, 사분위수 등 데이터를 요약하는 숫자)와 시각화(동일한 정보를 그래픽으로 표시)는 서로를 보완합니다. 그들은 함께 데이터를 설명합니다. 둘째, 가장 중요한 점은 발견과 확인이 구별되어야 한다는 것입니다. 탐색적 분석은 가설을 생성하기 위한 것입니다. 동일한 데이터로 가설을 탐색하고 "테스트한 결과 유의미한 것으로 나타났습니다"라고 말하면 p-해킹의 문이 열리며, 이에 대해서는 다음 단원에서 살펴보겠습니다. 데이터를 보고 패턴을 확인하는 것은 무료입니다. 그러나 해당 패턴을 동일한 데이터에서 "검증된 결과"로 선언하는 것은 오해의 소지가 있습니다.

단계별 탐색적 분석

1. 일변량 관점. 각 변수를 개별적으로 조사합니다. 분포가 대칭인지 아니면 편향되어 있는지, 언덕이 몇 개나 있나요? 이상값은 어디에 있나요? 수치 변수의 경우 히스토그램(값을 범위로 나누어 빈도를 표시하는 플롯) 및 상자 플롯(상자 플롯 - 중앙값, 사분위수 및 극단값을 표시하는 차트) 범주형 변수의 경우 빈도표와 막대 차트를 사용합니다.

2. 이변량 보기. 두 변수 사이의 관계를 확인합니다. 두 숫자 변수에 대한 산점도(각 관측치를 x-y 평면의 점으로 표시), 숫자 범주에 대한 그룹화된 상자 그림, 두 범주에 대한 교차 분석. 상관 계수를 보기 전에 산점도를 살펴보십시오. 동일한 상관 관계가 매우 다른 패턴을 나타낼 수 있습니다(유명한 Anscombe 4중주가 이를 보여줍니다. 4개의 데이터 세트에는 거의 동일한 통계가 있지만 플롯하면 완전히 다른 것으로 나타납니다).

3. 올바른 차트 유형을 선택하십시오. 차트 유형은 질문과 데이터 유형에 따라 다릅니다. 분포를 위한 히스토그램; 관계를 위한 산란; 시간에 따른 변화를 보여주는 선형 차트 카테고리 비교를 위한 막대 차트; (주의 깊게) 전체에 대한 부분의 비율에 대한 누적 막대입니다. AI는 신속하게 코드를 생성하지만 "어떤 질문에 대한 그래프"를 결정하는 것은 귀하의 몫입니다.

4. 패턴을 참고하세요. 결과를 선언하지 마세요. 발견한 흥미로운 패턴을 "발견 노트"로 기록하되, 이를 확인된 결과로 간주하지 마십시오. 확인은 별도의 단계로 이루어지며, 별도의 데이터나 미리 정해진 일정을 사용하는 것이 좋습니다.

정직한 시각화 원칙

그래픽은 확신합니다. 그러므로 오해를 불러일으키는 위력도 높다. AI는 미학적이지만 때로는 오해의 소지가 있는 선택을 할 수 있습니다. 다음 정책을 확인하세요.

  • 막대형 차트에서는 y축이 0부터 시작해야 합니다. 점선 축은 작은 차이를 크게 나타냅니다.
  • 규모는 일관되어야 합니다. 두 차트를 비교하는 경우 동일한 축 범위를 사용하세요.
  • 과도한 스무딩은 실제 패턴을 숨길 수 있습니다. 추세선은 보기에는 좋지만 데이터를 너무 "평활화"하면 오해의 소지가 있을 수 있습니다.
  • 색상과 3D 장식은 데이터가 아니라 주의를 왜곡합니다. 단순성을 선택하십시오.
  • 누락된 데이터와 표본 크기가 표시되어야 합니다. "n=12"와 "n=12,000"은 동일하게 보이지 않아야 합니다.
주의: AI가 제작한 그래픽이 아름답다고 해서 그것이 사실은 아닙니다. 그가 저지르는 가장 흔한 실수는 막대 차트에서 축을 0부터 시작하지 않고 두 그룹 간의 차이를 과장하는 것입니다. 항상 축을 확인하십시오.

비교 차트: 질문 → 차트

물어보세요

올바른 차트

흔한 실수

이 변수는 어떻게 배포됩니까?

히스토그램/박스 플롯

원형 차트를 사용하세요

두 개의 숫자 변수가 관련되어 있습니까?

산점도

상관관계 수만 봐도

시간이 지나면서 어떻게 변했나요?

꺾은선형 차트

막대 차트로 추세 파악하기

그룹 간의 차이점은 무엇입니까?

그룹화된 상자/막대(처음부터)

잘린 축 막대

부분 대 전체 비율?

누적 막대(주의)

다중 슬라이스 원형 차트

복사 가능한 프롬프트 4개

1. 자동 검색 코드:

귀하의 역할: EDA 보조자. 나는 데이터를 공유하지 않으며 R(ggplot2) 코드를 원합니다. 'data' data.frame에는 수치형(소득, 연령, 지출) 변수와 범주형(지역, 교육) 변수가 있습니다. 작업: 각 숫자에 대한 히스토그램, 각 범주에 대한 막대 차트, 소득~연령에 대한 산점도를 생성하는 코드를 작성합니다. 막대 차트에서는 y축이 0부터 시작하도록 합니다. 코멘트 라인을 추가하세요.

2. 상관성 검토(상관관계 + 시각적 함께):

소득과 지출에 대한 Pearson 상관관계를 계산하고 분산형 차트 + 선형 추세를 그리는 코드를 작성합니다. 상관관계 수를 신뢰하기 전에 차트를 검토하도록 상기시켜주는 주석 라인을 추가하세요(Anscombe 경고). 추세선을 지나치게 평활화하지 마십시오.

3. 무결성 감사:

정직한 시각화를 위해 다음 ggplot 코드를 확인하세요:[code]. 다음 사항을 확인하고 수정하세요. y축이 0부터 시작하는지, 척도가 일관적인지, 표본 크기가 표시되는지, 과도하게 평탄화되어 있는지 등을 확인하세요. 각 수정 사항에 대한 정당성을 설명하세요.

4. 발견 노트 작성(발견 아님):

내가 만든 그래프를 바탕으로 관찰을 '발견 기록'으로 나열하세요. 각 항목을 '확정적 발견'이 아닌 '검증할 가설'이라는 언어로 작성하세요. 예: '고등교육 소득이 더 분산된 것 같습니다. 별도의 데이터로 테스트해야 합니다.' 인과관계와 확정적인 진술은 피하세요.

약한 프롬프트 / 강한 프롬프트

약한 프롬프트:

수익률로부터 멋진 그래프를 만들고 그것이 무엇을 의미하는지 말해주세요.

이 프롬프트는 오해의 소지가 있는 출력을 유도합니다. "아름답다"는 미학에 초점을 맞추는 반면 "그것이 의미하는 것"은 AI가 발견에서 최종 결론으로 ​​도약하도록 유도합니다. 인과관계, 과장된 발언이 뒤따른다.

강력한 프롬프트:

귀하의 역할: 정직한 EDA 보조자. 작업: (1) 내 질문에 적합한 차트 유형을 선택하고 이유를 작성합니다. (2) 막대 차트에서 0부터 축을 시작합니다. (3) DISCOVERY NOTE 언어로 출력을 해석합니다. 확정적/인과적 주장은 "테스트해야 함" 언어로 가설을 제안합니다. (4) 표본이 작으면(n<30) 경고합니다. 내 환경에서 차트를 실행하고 확인하겠습니다.

차이점: 강한 의지는 차트 유형을 정당화하고 정직성의 규칙을 부과하며 발견과 확인을 혼동하지 않습니다.

세 개의 미니 케이스

사례 1 - 이산 축 과장. 분석가는 두 지점(7.8 및 8.0, 10점 만점)의 만족도 점수를 막대 차트로 표시했습니다. 7.5에서 YZ 축을 시작할 때 두 번째 분기는 첫 번째 분기보다 거의 두 배 높게 나타났습니다. 반면 그 차이는 2.5%에 불과했다. 경영진은 잘못된 인상을 받은 지점에 보상을 하려고 했습니다. 축을 처음부터 시작했을 때 차이는 거의 눈에 띄지 않았습니다. 교훈: 축 선택만으로도 인식이 바뀐다.

사례 2 — 상관 관계를 신뢰하고 차트를 건너뜁니다. 한 연구원은 두 변수 사이의 r = 0.81을 보고 "강한 선형 관계"라고 썼습니다. 그의 컨설턴트가 산점도를 요청했을 때 그 관계는 실제로 단일 극단적인 관찰로 인한 것임을 알 수 있었고, 해당 점이 제거되자 상관관계는 0.12로 떨어졌습니다. 교훈: 상관 계수는 그래프를 대체할 수 없습니다. 항상 분산을 살펴보세요.

사례 3 — 발견과 확인을 혼동합니다. 한 학생은 40개의 변수 데이터 세트에서 모든 쌍 상관 관계를 조사하고 가장 높은 것(r=0.52)을 선택한 다음 "교육과 저축 사이에 중요한 관계가 있음을 발견했습니다(p=0.004)"라고 썼습니다. 그러나 40개의 변수에는 수백 개의 쌍이 있었습니다. 가장 높은 것을 선택한 것은 우연에 의한 잘못된 발견이었습니다. 교훈: 발견된 패턴은 동일한 데이터에서 "테스트하고 중요하다고 선언"할 수 없습니다. 별도의 확인이 필요합니다.

일반적인 실수

  • 막대 차트에서는 축을 0부터 시작하지 않습니다. 그것은 작은 차이를 과장합니다. 가장 흔한 시각적 거짓말. 항상 확인하세요.
  • 상관관계를 살펴보고 차트를 건너뜁니다. 동일한 상관관계는 매우 다른 패턴에서 비롯됩니다. 이상치 관계에 적합할 수 있습니다. 첫째, 분산.
  • 발견에서 발견된 패턴을 동일한 데이터의 '증거'로 간주합니다. 이것이 p-해킹의 관문입니다. 확인은 별도로 이루어집니다.
  • 차트 유형이 잘못되었습니다. 추세에 대한 막대 및 분포에 대한 파이와 같은 일치는 오해의 소지가 있습니다. 질문에 따라 장르를 선택하세요.
  • 샘플 크기를 숨깁니다. n=8과 n=8,000은 동일한 그래프에서 동일하게 보여서는 안 됩니다. 불확실성이 표시되어야합니다.
팁: 차트를 게시하기 전에 "축을 변경하면 스토리가 바뀔까?"라고 자문해 보세요. 대답이 '예'라면 아마도 부정직한 곳에서 피벗을 시작한 것입니다.

요약하면

탐색적 데이터 분석은 데이터를 충족하고, 패턴을 확인하고, 가설을 생성하는 단계입니다. 확인된 내용이 아닙니다. AI는 기술 통계와 그래프 코드를 빠르게 생성하지만 질문에 따라 그래프 유형을 선택하고 공정성 원칙(0축, 일관된 척도, 명백한 불확실성)을 제어합니다. 상관관계 수치를 신뢰하기 전에 분산을 살펴보세요. 발견에서 발견한 패턴을 동일한 데이터에서 '증거'로 선언하지 마세요. AI의 아름다운 그래프가 올바른 그래프를 의미하는 것은 아닙니다.

응용과제

데이터 세트에서 변수를 3개 이상 선택하세요. 정직 규칙을 적용하는 프롬프트와 함께 탐색적 그래프(히스토그램, 분산형, 박스형)를 생성하는 코드를 AI에 요청하고 실행합니다. 각 차트에 대해 (1) 질문에 대한 차트 유형의 적합성, (2) 축의 정직성, (3) 표본 크기의 가시성을 확인하십시오. 가설 언어로 적어도 하나의 "발견 노트"를 작성하십시오("...별도로 테스트된 것으로 보입니다"). 개수와 분산의 상관관계를 조사하고 둘 사이에 불일치가 있으면 보고합니다.

체크리스트

  • [ ] 내 질문과 데이터 유형에 따라 차트 유형을 선택했습니다.
  • [ ] 막대 차트에서는 y축을 0부터 시작합니다. 축의 정직성을 확인해 보았습니다.
  • [ ] 상관 관계를 신뢰하기 전에 산점도를 살펴보았습니다.
  • [ ] 표본크기와 불확실성을 그래프에 반영하였습니다.
  • [ ] 탐색에서 찾은 패턴을 '증거'가 아닌 '검증할 가설'로 썼습니다.
  • [ ] 확인을 위해 동일한 데이터를 사용하지 않을 것이며 별도의 단계가 필요하다는 점을 언급했습니다.