이득:
- 원시 경제 데이터(관찰 누락, 단위 혼동, 빈도 불일치)를 정리하고 인공 지능의 도움으로 분석 준비를 할 수 있는 능력
- 실명목 변환, 지수화, 성장률, 계절 조정 등 표준 경제 변환을 인공 지능 코드로 인쇄하고 수동으로 검증하는 기능
- 탐색적 데이터 분석(요약통계, 분포, 이상치, 상관관계)을 통해 데이터를 인식하고 인공지능 요약을 비판적으로 읽는 능력
경제 데이터는 분석할 준비가 되어 있는 경우가 거의 없습니다. TURKSTAT에서 다운로드한 테이블에는 몇 달이 누락되어 있고, 한 열은 천 개의 괄호가 있는 텍스트로 표시되고, 환율은 "1.234,56"과 같은 터키어 형식이며, 한 시리즈는 월별이고 다른 시리즈는 분기별입니다. 경제학자의 시간 대부분은 분석이 아니라 분석을 위한 데이터를 준비하는 데 소비됩니다. AI는 정리 단계를 제안하고, 팬더(Python의 데이터 처리 라이브러리)를 작성하고, 표준 경제 변화를 체계화합니다. 하지만 이 장치에는 불변의 규칙도 있습니다. 즉, 인공 지능이 작성한 모든 변환을 읽고 적어도 한 번의 관찰에서 수동으로 확인합니다. 실질-명목 주기가 잘못된 기반에 있으면 전체 분석이 조용히 쇠퇴합니다.
청소: 어떤 문제, 어떻게 해결하나요?
경제 데이터와 그 논리의 가장 일반적인 문제는 다음과 같습니다.
- 불완전한 관찰. 한 달/분기가 비어 있습니다. 해결책은 상황에 따라 다릅니다. 실제로 존재하지 않으면 공백으로 남겨집니다. 기술적인 격차가 있는 경우에는 신중한 보간이 이루어지지만 제작 간의 경계는 얇습니다.
- 단위와 형식의 혼란. 텍스트 "12.345.6"은 숫자로 변환되어야 합니다. 백만/10억은 일관성을 유지해야 합니다.
- 주파수 불일치. 월별 및 분기별 시리즈를 결합하려면 하나가 집계됩니다(월별에서 분기별). 평균, 총계 또는 기말인지 여부는 지표의 특성(재고/유량 구분)에 따라 다릅니다.
- 이상치(극단) 값. 관찰 결과가 크게 벗어나는 경우: 실제 사건(위기, 가격 인상)입니까, 아니면 데이터 오류입니까? 삭제하기 전에는 이해됩니다.
- 날짜 정렬. 다양한 계열의 날짜 형식과 기간 정의가 동기화됩니다.
주의: 누락된 데이터를 채우는 것은 무해해 보이지만 이는 경제적인 결정입니다. 위기 월을 "이웃 달의 평균"으로 채우는 것은 분석에서 해당 위기를 삭제하는 것을 의미합니다. 작성하기 전에 "이 공백이 존재하는 이유는 무엇입니까?"라고 질문하십시오. 질문에 답하십시오.
표준적인 경제 변화
경제학자의 일상 레퍼토리에서의 변화와 그 정의:
- 명목 → 실수. 가격 영향 조정: 실질 가치 = 명목 가치 / 물가 지수 × 100. 디플레이터(조정 지수)의 기준 연도가 결과의 기준을 결정합니다.
- 인덱싱. 선택한 기간 = 100이 되도록 계열 크기를 조정합니다. 다양한 크기의 시리즈를 비교하는 데 유용합니다.
- 성장률. 연간: (이번 기간 동일 기간 / 전년도 - 1) × 100. 정기 요율과 연간 요율은 다릅니다. 혼란스러운 것은 흔한 실수입니다.
- 계절 수정. 정기적인 계절 효과 정화(여름 관광, 휴가); 원시 계열과 계절 조정 계열은 서로 다른 이야기를 전달합니다.
- 이동 평균. 노이즈를 완화하고 추세를 가시화합니다.
- 로그와 차분. 성장 역학 및 정상성을 조사합니다(시계열 단위로 심화됨).
팁: 변환할 때마다 "유닛과 베이스는 어떻게 되었나요?"라는 질문을 받게 됩니다. 묻다. 실제 시리즈의 기본은 디플레이터의 기본입니다. 색인화된 시리즈의 기본은 선택한 기간입니다. 이를 기록해 두면 향후 실수를 예방할 수 있습니다.
탐색적 데이터 분석(EDA)
데이터를 모델에 입력하기 전에 데이터를 인식하는 것이 필요합니다. 탐색적 데이터 분석(EDA)에는 요약 통계(평균, 중앙값, 표준 편차, 최소-최대), 분포 형태, 시간 경과에 따른 경과, 이상치 및 계열 간 상관 관계가 포함됩니다. AI는 이러한 단계에 대한 코드를 신속하게 생성합니다. 당신의 임무는 경제적인 눈으로 결과를 읽는 것입니다. "이 평균이 합리적인가요? 이 상관 관계는 우연의 일치입니까 아니면 알려진 관계입니까?"
주의: 상관관계는 여기서 식별 수단일 뿐 인과관계를 증명하는 것은 아닙니다. 두 계열이 함께 움직인다는 사실(예: 아이스크림 판매 및 익사 - 둘 다 여름에 촉발됨)이 반드시 하나가 다른 계열로 이어진다는 것을 의미하는 것은 아닙니다. 우리는 7단원에서 이러한 구별을 더욱 심화시킬 것입니다.
세 개의 미니 케이스
사례 1 - 디플레이터 베이스가 잘못되었습니다. 분석가는 임금계열을 구현하기 위해 인공지능으로 코드를 작성하게 했습니다. 코드는 작동했고 결과는 합리적으로 보였습니다. 하지만 분석가가 CALCULATE 단계에서 2020년을 수동으로 계산했지만 작동하지 않았습니다. 문제: 인공지능은 2003=100을 기준으로 디플레이터를 사용하고 2015년 가격으로 임금 시리즈를 요청했습니다. 기지가 충돌했습니다. 코드는 한 줄 수정으로 복구되었으며 전체 시리즈가 제자리에 놓였습니다.
사례 2 - 자동 볼륨 오류. 한 기관에서는 수출 데이터를 천 달러로 줄이고 수입 데이터를 백만 달러로 줄였습니다. 인공지능이 '대외무역수지'를 위해 두 가지를 제거하자 결과는 터무니없는 적자였다. EDA의 최소-최대 보기에서는 오류가 드러났습니다. 두 계열의 크기 순서가 1000배만큼 달랐습니다. 장치가 균등화되면 균형이 정확해졌습니다.
사례 3 - 이상값을 삭제하지 않음. 시리즈의 한 달은 매우 낮았습니다. AI는 "이상치, 정리하자"를 제안했다. 분석가는 그 달에 자연재해로 인해 생산이 실제로 중단되었다고 조사했습니다. 그 가치는 진짜였습니다. 삭제하면 역사가 왜곡됩니다. 삭제 대신 각주를 달았습니다. AI의 '명확한' 권고는 맹목적으로 따르지 않았습니다.
전환 검증 테이블
전환
포뮬러 에센스
수동 체크포인트
실현
명목 / 가격 지수 × 100
디플레이터 베이스 = 결과 베이스?
연간 성장
(t / t-12월 – 1)×100
종이에 기간 계산하기
인덱싱
시리즈/기준 기간 × 100
기준 기간 값이 100인가요?
월간→분기별
흐름: 수집 / 재고: 기간 종료
올바른 수집방법은?
이동 평균
지난 n 기간 평균
창 길이가 맞나요?
복사 가능한 템플릿 4개
1) 청소 계획:
[열 및 샘플 행]이라는 원시 데이터가 있습니다. 누락된 값, 단위/형식 문제, 날짜 정렬, 빈도 정렬, 가능한 이상값 등 분석 준비를 위한 정리 계획을 세우십시오. 각 단계가 필요한 이유를 한 문장으로 설명하세요. 아직 코드를 작성하지 마세요. 먼저 계획을 확인해 보겠습니다.
2) 팬더 정리 코드:
내가 승인한 계획에 따라 Pandas 코드를 작성합니다. 코드가 주석 줄을 사용하여 각 단계에서 수행하는 작업을 나타내도록 합니다. 변환 후 행 수와 누락된 값을 인쇄합니다. 관찰 내용을 조용히 지우지 마십시오. 삭제한 모든 줄을 보고하세요.
3) 실현(검증 가능):
[가격 지수]로 이 명목 시리즈를 실현하세요. 디플레이터를 사용할 때 디플레이터의 기준 연도를 명확하게 기재하십시오. 결과 계열의 기준이 무엇인지 지정합니다. 제가 수동으로 확인할 수 있도록 단일 기간 동안 계정을 단계별로 보여주세요.
4) 탐색적 분석 요약:
정리된 데이터(요약 통계, 시계열 도표, 이상치 스캔, 상관 행렬)에 대한 탐색적 분석 코드를 작성합니다. 결과를 해석할 때 찾은 상관관계가 인과관계가 아님을 분명히 하고, 눈에 띄는 점 3가지를 나열하십시오.
약한 프롬프트 / 강한 프롬프트
약한 프롬프트:
이 데이터를 지웁니다.
AI는 무엇을 청소해야 할지 모르고 가정에 따라 행동합니다. 관찰 내용을 삭제하고 단위를 변경할 수 있지만 눈치채지 못할 것입니다.
강력한 프롬프트:
이번 월별 대외 무역 데이터에서 수출은 '천 달러', 수입은 '백만 달러' 단위로 나타납니다. 두 값을 "백만 달러" 단위로 동일하게 만들고 누락된 달을 표시하되 채우지 말고 날짜를 월말에 맞춥니다. 각 단계에서 영향을 받는 행 수를 인쇄합니다. 자동으로 행을 삭제하지 않습니다. 그런 다음 내가 수동으로 확인할 수 있는 방식으로 한 달 동안의 잔액을 표시합니다.
일반적인 실수
- 변환 코드를 읽지 않고 실행합니다. 잘못된 베이스/단위는 전체 분석을 조용히 손상시킵니다.
- 생각 없이 누락된 데이터를 채우는 중입니다. 위기/재난 기간을 평균으로 지웁니다.
- 이상값을 자동으로 삭제합니다. 실제 이벤트를 데이터 오류로 착각합니다.
- 계절별 성장과 연간 성장을 혼동합니다. 둘은 크기가 다릅니다.
- 주파수를 잘못 결합했습니다. Stock 시리즈를 수집하여 Flow로 처리합니다.
- EDA의 상관관계를 인과관계로 착각합니다. 인식 도구를 증거로 착각합니다.
요약하면
데이터 정리 및 변환은 눈에 보이지 않지만 경제 분석의 결정적인 80%를 차지합니다. 인공 지능은 이러한 기계적 작업 속도를 극적으로 향상시킵니다. 하지만 모든 정리 단계와 모든 변환을 읽고 최소한 하나의 관찰 내용을 수동으로 확인하는 것은 사용자의 몫입니다. 디플레이터 베이스, 단위, 주파수 및 이상치 결정은 경제적 결정이며 맹목적으로 인공 지능에 맡길 수 없습니다. 탐색적 분석은 데이터를 도입하지만 상관관계에는 인과관계가 없습니다.
응용과제
실제 원시 시리즈(예: 월별 CPI 및 명목 임금/소득 시리즈)를 다운로드합니다. 1차 템플릿으로 청소 계획을 작성하고, 2차 템플릿으로 코드를 생성하고, 3차 템플릿으로 시리즈를 구현해 보세요. 그런 다음 종이에 단일 기간의 실제 가치를 계산하고 이를 인공 지능의 출력과 비교합니다. 불일치를 발견하면 해당 소스(베이스/유닛)를 진단하고 수정하고 진행 상황을 기록합니다.
체크리스트
- [ ] 코드가 작성되기 전에 정리 계획을 검토하고 승인했습니다.
- [ ] 인공지능이 보고한 모든 줄을 삭제/변경했습니다. 자동 삭제는 없습니다.
- [ ] 누락된 데이터를 채울 때 "왜 비어 있나요?"라고 질문할 수 있습니다. 나는 그 질문에 대답했다.
- [ ] 이상치가 실제 사건인지 아니면 데이터 오류인지 조사했습니다.
- [ ] 구현에서는 디플레이터 베이스와 아웃컴 베이스가 일치함을 확인하였습니다.
- [ ] 하나 이상의 기간에 대한 변환을 수동으로 다시 계산했습니다.
- [ ] 나는 EDA의 상관관계를 인과관계로 제시하지 않았습니다.