단위 1 / 11

데이터 과학 및 분석의 인공 지능 소개: 워크플로, 역할, 경계, 검증 및 윤리

이득:

  • 데이터 사이언스의 6단계 워크플로우(문제 정의, 수집, 정리, 발견, 모델링, 커뮤니케이션)를 구분하는 능력과 각 단계에서 인공지능이 작동하는 권한을 업무 위험 수준에 따라 구분하는 능력
  • 각각의 인공지능 출력물을 소스에 연결하고, 실행 및 비교하고, 전문가 필터링을 거쳐 검증하는 규율을 적용하는 능력.
  • 재현성과 개인 정보 보호 원칙(코드 작성, 익명화)을 첫날부터 분석 습관으로 전환하는 능력

원시적이고 지저분하며 종종 "거짓말"을 하는 데이터가 매일 데이터 과학자의 책상에 놓입니다. 판매 테이블에서 날짜 열은 세 가지 형식으로 작성됩니다. 고객 번호가 일부 줄에 비어 있습니다. 열 이름은 "income"이지만 TL과 USD 값이 모두 포함되어 있습니다. 데이터 과학의 임무는 이러한 혼란 속에서 신뢰할 수 있는 결정을 내리는 것입니다. 즉, 데이터를 수집하고, 정리하고, 탐색하고, 모델을 구축하고, 결과를 검증하고, 이를 스토리로 전환하는 것입니다. 인공 지능(AI, 줄여서 AI, 즉 텍스트와 코드를 생성하고, 패턴을 인식하고, 요약하고, 예측할 수 있는 컴퓨터 시스템)은 몇 분 만에 정리 코드 작성, 탐색적 분석을 위한 그래프 추천, 모델의 지표 해석, SQL 쿼리 수정 등 이 체인의 모든 링크에 접근할 수 있습니다. 그러나 동일한 AI는 한 번도 본 적이 없는 데이터에 대해 "상관관계 0.72"와 같은 확실한 조작을 제공할 수도 있습니다.

이 첫 번째 단원은 도서관 소개가 아닙니다. 그 목적은 데이터 과학 워크플로에서 AI를 어디에 배치해야 하는지, 어디에 배치하지 말아야 하는지를 명확히 하는 것입니다. 처음부터 기본 원칙을 제시해 보겠습니다. AI는 데이터 과학자가 아니라 보조자입니다. 어떤 데이터를 수집할지, 어떤 지표를 결정할지, 모델을 생산에 투입할지 여부, 윤리적 경계를 어디에서 설정할지에 대한 결정은 유능한 전문가에게 달려 있습니다. 서명되지 않은 분석 보고서와 마찬가지로 확인되지 않은 AI 출력은 위험합니다.

데이터 과학 워크플로: 엔드투엔드 맵

데이터 프로젝트를 이해하려면 이를 6단계로 나누는 것이 도움이 됩니다. 이 전체 모듈은 이 맵을 따릅니다.

1. 문제 정의: 어떤 결정을 뒷받침하기 위해 무엇을, 왜 측정합니까? 이 단계는 AI에 위임되지 않습니다. 직업을 정의하는 사람은 바로 사람이다.

2. 데이터 수집: 소스 식별, 데이터 추출, 샘플링. (2단원)

3. 데이터 정리 및 전처리: 누락된 값, 이상치, 유형 변환. (3단원)

4. 탐색적 데이터 분석(EDA - 탐색적 데이터 분석, 데이터의 분포와 관계를 "눈으로" 인식하는 단계): (단위 4)

5. 기능 엔지니어링 및 모델링: 변수 생성, 알고리즘 선택, 훈련, 평가. (5, 6, 7단원)

6. 커뮤니케이션 및 제작: 시각화, 스토리, MLOps(모델을 실시간으로 촬영하고 모니터링하는 훈련). (8, 11단원)

AI는 이 6단계 각각에서 서로 다른 권한으로 작동합니다. 아래 표에는 이러한 권한 분배가 요약되어 있습니다. 이것은 모듈에서 가장 중요한 단일 테이블입니다.

무대

AI의 역할

위험 수준

승인하는 사람

문제 정의

브레인스토밍 파트너

낮음

데이터 과학자 + 이해관계자

정리 코드 작성

코드 스케치 생성기

중간

데이터 과학자(코드 읽기)

EDA 코멘트

패턴 제안자

중간

데이터 과학자

기능 생성

아이디어 및 코드 생성기

중간 높이

누출 관리는 필수입니다

모델 선택/측정항목

컨설턴트

높다

데이터 과학자

생산에 투입하기로 결정

보조 입력

매우 높다

팀 + 사업주

윤리/개인정보 승인

각성제

매우 높다

인간은 언제나

이 차트의 한 문장을 기억하세요. 위험이 커질수록 AI의 역할은 줄어들고 인간의 승인은 커집니다.

검증이 이 비즈니스의 핵심인 이유

AI 언어 모델은 확실해 보이지만 확실하지 않을 수 있습니다. 전문 용어로 이를 환각이라고 합니다. 모델이 존재하지 않는 정보를 유창한 문장으로 사실인 것처럼 조작하는 것입니다. 데이터 과학에서 이는 세 가지 형태로 나타납니다. 첫 번째는 가짜 숫자입니다. 모델에 데이터를 제공하지 않고 "평균 주문 금액이 얼마입니까"라고 묻는 경우 데이터를 본 적이 없더라도 모델은 자신있게 숫자를 알려줄 것입니다. 두 번째는 존재하지 않는 함수입니다. 모델은 pandas.read_excel_fast()와 같이 전혀 존재하지 않는 함수를 제안할 수 있습니다. 셋째, 잘못된 통계 해석: 모델은 "p-값이 0.04이므로 가설이 96% 정확합니다"와 같은 고전적인 통계 오류를 원활하게 반복할 수 있습니다.

검증 분야는 세 단계로 구성됩니다.

  1. 소스 링크: 모든 숫자, 속도 및 추세는 AI의 메모리가 아닌 데이터에서 나와야 합니다. 데이터를 기억하는 코드가 아닌 데이터를 조작하는 코드에 AI를 사용하세요.
  2. 실행 및 비교: AI가 직접 제공한 각 코드 조각을 실행합니다. 생성된 각 측정항목을 독립적인 기준과 비교합니다.
  3. 전문가 필터: 출력이 통계 및 도메인 지식과 모순되는지 여부를 직접 테스트합니다.
주의: AI가 작성한 분석 내용을 실행하지 않고 프레젠테이션에 넣는 것은 서명되지 않은 보고서를 발표하는 것과 같습니다. 코드가 작동한다고 해서 코드가 정확하다는 의미는 아닙니다. 잘못된 열을 합산하는 코드도 오류 없이 작동합니다.

재현성: 동일한 결과를 두 번 생성할 수 있는 것

데이터 과학의 조용하지만 중요한 원칙은 재현성입니다. 6개월 후 다시 분석을 실행하거나 다른 컴퓨터에서 분석을 실행하면 동일한 결과를 얻을 수 있습니다. AI로 작업할 때 이러한 위험은 더 커집니다. AI에게 "이 그래프를 만드세요"라고 지시하고 수동으로 재생하면 단계가 사라지기 때문입니다. 규칙: 모든 단계는 코드 및 버전 관리(예: Git)에 등록되어야 합니다. 무작위성과 관련된 단계에서는 무작위 시드(난수 생성기의 초기 값, 고정된 경우 결과가 반복 가능함)를 수정해야 합니다. 이 주제는 10단원에서 더욱 심화될 것입니다. 지금은 "손으로 클릭하지 말고 코드를 작성하세요."라는 습관을 들이세요.

세 개의 미니 케이스

사례 1 - 안전한 가속. 전자 상거래 분석가는 일반적으로 24만 행의 주문 테이블을 정리하는 데 반나절을 소비합니다. 그는 AI에 열 이름과 처음 5행(개인 데이터 제외)을 제공하고 팬더 청소 코드를 요청했습니다. AI는 8초 만에 초안을 작성했습니다. 분석가는 코드를 한 줄씩 읽고 날짜 구문 분석 오류를 수정한 후 실행했습니다. 소요 시간: 4시간이 아닌 35분. AI는 코드를 제공하고 검증은 인간에게 맡겨졌습니다.

사례 2 — 구성된 메트릭 트랩. 한 인턴이 AI에게 "이 데이터의 랜덤 포레스트는 얼마나 정확합니까?"라고 질문했습니다. 모델을 전혀 훈련하지 않고 말이죠. AI는 “약 89%”라고 말했다. 인턴은 이것을 프레젠테이션에 넣었습니다. 실제 모델을 훈련시켰을 때 정확도는 71%였습니다. 실수: AI에 데이터와 모델을 제공하지 않고 측정항목을 기다리는 것입니다.

사례 3 - 소리 없는 누출. 한 팀은 AI가 제시한 '타겟 변수의 평균을 특징으로 추가'하는 아이디어를 의문 없이 구현했다. 모델은 테스트 세트에서 98%의 성능을 발휘했지만 기능이 미래 정보를 유출했기 때문에 프로덕션에서 충돌이 발생했습니다(데이터 유출, 유닛 10). 실수: AI 추천을 통계적으로 필터링하지 않습니다.

약한 프롬프트 / 강한 프롬프트

약한 프롬프트:

이 판매 데이터를 분석하여 평균 수익을 알려주세요.

이 주장에는 결함이 있습니다. AI에는 데이터가 제공되지 않았기 때문에 "평균 소득"만 구성할 수 있습니다. 열, 기간, 통화가 모두 명확하지 않습니다.

강력한 프롬프트:

귀하의 역할: 데이터 과학자를 돕는 조수. 팬더 DataFrame: df가 있습니다. 열:- order_date(텍스트, "2024-03-01" 형식)- amount_tl(10진수, 일부 행의 NaN)- customer_id(정수)작업: (1) 평균 금액을 계산하는 Pandas 코드 작성,(2) NaN 값을 처리하는 방법 설명,(3) 코드에서 가정하는 내용을 나열합니다. 데이터 내용을 구성하지 마십시오. 코드를 생성하면 실행하여 결과를 확인하겠습니다.

이번 요청에는 그 계획과 기대, '조작 금지'가 명확하다. 여전히 출력을 직접 실행하고 확인합니다.

윤리와 개인정보 보호의 시작

데이터 과학은 고객, 환자, 직원 기록 등 개인 데이터를 다루는 경우가 많습니다. 터키의 KVKK(개인 데이터 보호법)와 유럽의 GDPR이 이 데이터를 보호합니다. 공개 AI 도구에 실명, ID, 이메일, 주소를 붙여넣는 것은 위반입니다. 규칙: 공유하기 전에 데이터를 익명화하고 필요한 경우 스키마(열 이름, 유형) 및 더미 예제 행만 제공하세요. 우리는 11단원에서 윤리라는 주제를 심화할 것입니다. 처음부터 원칙을 적용해 보겠습니다. 데이터를 이해하려면 내용이 아닌 구조를 공유하는 것만으로도 충분합니다.

일반적인 실수

  • AI에 데이터를 제공하지 않고 숫자/메트릭스를 기다리는 중입니다. 모델이 데이터에 액세스할 수 없습니다. 그가 준 전화번호는 가짜다. 항상 결과를 계산하고 실행하십시오.
  • 작업 코드가 정확하다고 생각합니다. 잘못된 열을 조작하는 코드도 오류 없이 실행됩니다. 논리를 읽지 않고 신뢰하지 마십시오.
  • 공개 도구에 실제 개인 데이터를 붙여 넣습니다. 이름, ID 번호, 이메일은 절대 공유되지 않습니다. 다이어그램이면 충분합니다.
  • 단계를 수동으로 수행하고 코드에 기록하지 않습니다. 재현할 수 없는 분석은 신뢰할 수 없습니다.
  • AI의 통계 해석을 의심 없이 받아들인다. AI는 p-값 및 상관관계와 같은 개념에서 고전적인 실수를 반복할 수 있습니다.
팁: 각 AI 세션에 짧은 "규칙 라인"을 포함하십시오. "데이터 내용을 구성하지 마십시오. 코드/분석을 생성하면 제가 실행하고 결과를 확인할 것입니다. 확실하지 않은 부분에는 '확실하지 않음'을 표시하십시오." 이 한 문장은 환각의 위험을 크게 줄여줍니다.

요약하면

AI는 데이터 과학의 강력한 보조자입니다. AI는 코드 정리, EDA 해석, 모델 추천 및 시각화를 가속화합니다. 그러나 문제 정의, 지표 선택, 생산 결정 및 윤리적 경계는 인간에게 속합니다. 워크플로는 6단계로 구성되며 위험이 증가할수록 AI의 역할은 작아집니다. 소스 연결(검증), 재현성(코딩), 익명화(기밀성)라는 세 가지 습관이 모든 것의 기초입니다. 이 세 가지를 내면화하면 모듈의 나머지 부분에 있는 모든 도구가 안전한 가속기가 됩니다.

응용과제

열 이름, 유형, 2-3개의 더미 예제 행(실제 개인 데이터 없음) 등 가지고 있는 작은 테이블(또는 가상 테이블)의 스키마를 만드십시오. 위의 "강력한 프롬프트" 템플릿을 사용하여 AI에 요약 통계 코드를 요청하세요. 코드를 실행하고, 출력을 수동 값과 비교하고, 잘못된 가정이 있는지 확인하고, 5개의 주요 항목에 결과를 기록해 두세요.

체크리스트

  • [ ] 실제 개인 데이터가 아닌 스키마와 가짜 샘플을 AI에 제공했을 뿐인가요?
  • [ ] 생성된 코드를 한 줄씩 읽고 실행했습니까?
  • [ ] 출력의 각 숫자를 독립적으로 확인했습니까?
  • [ ] 분석의 모든 단계를 코드에 작성하고 반복 가능하게 만들었습니까?
  • [ ] 임무의 위험 수준을 결정하고 최종 결정을 사람에게 할당했습니까?