단위 1 / 11

계량경제학 및 통계의 인공 지능: 역할, 경계, 인증 및 개인 정보 보호

이득:

  • 경험적 워크플로(데이터 정리, 코드, 시각화, 초안 해석)에서 인공 지능이 실시간을 절약하는 부분과 작업 위험 수준에 따라 모델 선택, 인과 관계 주장 및 출판 결정과 같은 결정이 전문가에게 맡겨지는 부분을 구별할 수 있습니다.
  • 재계산, 소스 연결, 통계 필터링 단계를 통해 각 인공지능 출력(숫자, 계수, 코드, 설명)을 검증하는 규율을 적용하는 기능입니다.
  • KVKK/GDPR 및 데이터 사용 계약 범위 내에서 마이크로 데이터 및 기밀/라이선스 데이터 세트를 안전하게 처리하고 적절한 도구를 선택하는 습관을 습득하는 능력.

계량 경제학자나 응용 통계학자의 책상에서는 매일 같은 질문이 반복됩니다. 이 데이터 세트를 신뢰할 수 있습니까? 이러한 결측값을 어떻게 처리해야 할까요? 이 회귀 계수는 실제로 무엇을 말합니까? 이 관계는 인과관계인가, 아니면 단지 상관관계인가? 이 p-값이 중요하므로 기사나 정책 개요에 기재해도 되나요? 이러한 질문 중 일부는 반복적이고 코드 집약적이며 시간 소모적입니다. 데이터 정리, 동일한 그래프를 10번 플롯팅, R 또는 Python 코드 디버깅, 결과를 테이블에 문자열로 묶기 등이 있습니다. 다른 사람들은 조사 결과의 타당성, 출판물의 정직성 또는 정책 결정의 정확성을 직접적으로 결정합니다.

인공 지능(간단히 말하면 AI - 인간처럼 텍스트와 코드를 생성하고, 패턴을 인식하고, 데이터를 요약하고, 코멘트를 작성할 수 있는 컴퓨터 시스템. 오늘날 가장 많이 사용되는 형태는 대규모 언어 모델, 즉 거대한 텍스트를 학습하고 다음 단어를 예측하여 문장을 작성하는 시스템)이 이 표의 바로 중앙에 있습니다. 올바르게 사용하면 데이터 정리 코드 시간을 몇 분으로 줄이고 복잡한 통계 테스트의 구문을 상기시키거나 계수 해석 초안을 작성합니다. 잘못 사용하면 겉으로는 확실하지만 완전히 조작된 숫자, 잘못된 의미 또는 인과관계가 아닌 관계를 "발견"으로 제시합니다.

이 첫 번째 단원은 소프트웨어 소개가 아닙니다. 그 목적은 경험적 작업 흐름에서 AI를 어디에 배치해야 하는지, 어디에 배치하지 말아야 하는지를 명확히 하는 것입니다. 계량경제학은 "방법이 중요"하고 간접적으로 "의사 결정이 중요한" 분야입니다. 구축한 모델의 계수는 중앙 은행의 이자율 결정, 규제 기관의 정책 변경 또는 기업의 백만 달러 투자에 대한 입력이 될 수 있습니다. 처음부터 기본 원칙을 내세우자: 인공지능은 연구자가 아닌 분석 보조자이다. 모델 선택, 식별 전략, 인과관계 주장, 출판 및 정책 결정에 대한 책임과 최종 승인은 유능한 전문가에게 있습니다.

경험적 작업 흐름의 계층과 AI의 위치

실증적 연구를 세 가지 계층으로 나누는 것이 유용합니다. 실행 계층은 데이터 정리 코드, 그래프 그리기, 테이블 형식 지정, 구문 디버깅 등 일상적인 기술 작업입니다. 방법 계층은 어떤 모델, 어떤 식별 전략, 어떤 테스트, 어떤 가정 확인 등 분석 결정입니다. 해석 및 결정 계층은 결과의 의미입니다. 즉, 계수가 말하는 내용, 인과관계, 정책에 대한 의미, 게시 여부 등입니다. AI는 세 가지 레이어를 모두 다루지만 각각 다른 권한을 갖습니다. 실행 계층에서 AI는 신속하게 코드 초안을 작성하고 생성합니다. 해석 및 결정 계층에서는 입력만 제공되고 전문가가 결정을 내립니다.

처음부터 몇 가지 기본 용어를 정의해 보겠습니다. 계량경제학은 경제, 사회 데이터를 통계적 방법으로 분석하고 관계를 측정하는 학문입니다. 회귀분석은 결과 변수(종속변수)와 하나 이상의 설명변수(독립변수)의 관계를 수치적으로 모델링하는 방법입니다. 계수는 설명 변수의 한 단위 변화가 결과 변수와 평균적으로 몇 단위의 변화와 연관되어 있는지를 나타내는 숫자입니다. p-값은 실제로 효과가 없을 때 관찰된 결과(또는 더 극단적인 결과)가 우연히 발생할 확률입니다. 다음 단원에서 이러한 개념을 하나씩 설명하겠습니다. 지금은 다음 사항을 알아 두십시오. 이 모든 것에서 AI는 청사진, 코드 및 설명을 제공하지만 과학적 결정을 내리지는 않습니다.

다음 표는 임무별 AI의 역할과 위험 수준을 요약한 것입니다.

퀘스트

AI의 역할

위험 수준

승인하는 사람

데이터 정리 코드 작성

코드 생성기

낮음

분석가 자신(코드 테스트 포함)

차트/표 초안

스케치 생성기

낮음

분석가

테스트/모델 구문 알림

참고 보조자

낮음-중간

분석가

구배계수 해석

초안 작성자

중간

경제학자

모델/식별 전략 선택

보조 입력

높다

전문 연구원

인과관계 주장

초안일 뿐 최종 단어는 없음

매우 높다

전문가 + 동료 검토

출판/정책 결정

입력만 가능

매우 높다

담당 조사관/기관

이 표의 한 줄을 명심하십시오. 위험이 증가함에 따라 AI의 역할은 줄어들고 전문가의 승인은 커집니다.

"검증"이 이 사업의 핵심인 이유

언어 모델은 답변에 자신감을 갖고 있는 것처럼 보이지만 확실하지 않을 수도 있습니다. 전문 용어로 이를 환각이라고 합니다. 모델이 존재하지 않는 정보를 유창한 문장으로 마치 사실인 것처럼 조작하는 것입니다. 계량경제학자에게 이는 치명적인 함정입니다. 이 모델은 "2015~2020년 투르키예의 실업률과 인플레이션 간의 상관관계는 0.62입니다."와 같은 정확한 수치를 제공할 수 있습니다. 그러나 그는 귀하의 데이터를 본 적이 없으며 이 숫자는 완전히 조작되었습니다. 또는 "백색 테스트 p-값은 0.03이었습니다."라고 말할 수도 있습니다. 반면 어떤 테스트도 실행하지 않았습니다. 실제로 존재하지 않는 인수를 사용하여 R 함수를 호출할 수 있습니다. 그는 세 곡 모두를 똑같은 유창함으로 노래합니다. 옳고 그름을 가르는 유일한 것은 당신의 지식과 확인하는 습관입니다.

검증 분야는 세 단계로 구성됩니다.

  1. 자신의 환경에서 재계산/실행: AI의 메모리가 아닌 자신의 데이터로 R/Python에서 AI가 제공하는 모든 숫자, 비율, 테스트 결과 및 계수를 계산합니다. 결과를 기억하는 것이 아니라 코드를 작성하는 데 AI를 사용하세요. 코드를 실행하면 출력이 생성됩니다.
  2. 소스 링크: 방법 규칙, 공식 및 정의에 대해서는 교과서, 방법 기사 및 공식 문서를 참조하십시오. 신뢰할 수 있는 출처를 통해 AI의 "이 테스트의 가정은 다음과 같습니다"라는 진술을 확인합니다.
  3. 통계 필터: 출력이 통계 논리(가정, 표본, 효과 크기, 불확실성)와 모순되는지 여부를 전문가의 눈으로 테스트합니다. "의미있지만 터무니없는" 결과를 거부하세요.
주의: AI가 생성한 계수, 테스트 또는 해석을 검증하지 않고 기사, 논문 또는 정책 노트에 넣는 것은 검토되지 않은 결과를 게시하는 것과 같습니다. 출력이 유창하다고 해서 사실이 아닙니다. 그 숫자가 확실해 보인다고 해서 그것은 실제가 아니다.

개인 정보 보호: 마이크로 데이터 및 라이선스 데이터는 비공개로 보호됩니다.

마이크로데이터(개인, 가구, 회사 또는 환자 수준의 단일 기록)는 계량경제학에서 자주 사용됩니다. 이 데이터의 대부분은 개인 데이터이며 터키의 KVKK(개인 데이터 보호법)와 유럽의 GDPR에 따라 보호됩니다. 또한 TurkStat, 중앙은행, 패널 데이터 제공업체 및 상업 소스는 종종 데이터 사용 계약과 함께 데이터를 제공합니다. 이러한 계약은 제3자에게 데이터를 전송하는 것을 금지합니다. 신원 정보, 소득, 건강 또는 회사 비밀이 포함된 테이블을 공개 AI 채팅 도구에 붙여넣는 것은 KVKK/GDPR 위반이자 계약 위반입니다. 데이터가 외부 서버로 이동하고 일부 도구의 모델 교육에 사용될 수 있기 때문입니다.

규칙은 간단합니다. 데이터를 안전한 환경에 보관하고 AI에게 코드와 방법만 요청하세요. 이상적인 작업 흐름은 다음과 같습니다. AI에게 분석 코드를 요청하고, 자신의 컴퓨터/기업 서버에서 실제 데이터로 코드를 실행합니다. 정말로 데이터를 공유해야 하는 경우, 익명화(ID 필드 제거), 집계(개인이 아닌 평균/개수), 기관용 도구 선택, 데이터 처리 계약이 있고 교육에 데이터를 사용하지 않는 경우.

세 개의 미니 케이스

사례 1 — 안전하고 효율적인 사용. 한 연구원은 먼저 40,000행의 가계 예산 데이터를 수동으로 정리하는 데 6시간을 보냈습니다. 데이터를 전혀 공유하지 않고 AI에게 변수명과 구조만 설명하고 클리닝 코드만 요청했다. AI는 R 스크립트를 생성했습니다. 연구원은 자신의 환경에서 코드를 실행해 각 단계의 행 수와 요약 통계를 확인하고 두 가지 논리 오류를 수정했습니다. 소요 시간: 6시간 대신 70분. 데이터는 결코 유출되지 않았습니다. 책임은 연구원에게 남았습니다.

사례 2 - 확인되지 않은 숫자 트랩. 한 대학원생이 AI에게 “GDP 성장과 해외직접투자 사이의 탄력성은 얼마나 됩니까?”라고 질문했습니다. AI는 어떤 데이터에도 접근하지 않았음에도 불구하고 자신있게 '약 0.34'라는 수치를 내놨다. 학생은 문헌 요약에 다음과 같이 썼습니다. 그의 조언자가 출처를 물었을 때 그 숫자는 근거가 없으며 완전히 조작된 것으로 밝혀졌습니다. 실수: AI에 데이터와 리소스를 제공하지 않고 AI로부터 구체적인 통계를 기대합니다.

사례 3 — 기밀 유지 및 계약 위반. 한 분석가는 허가 받은 회사 패널로부터 회사명과 매출액이 포함된 엑셀을 공개 AI 툴에 업로드하고 "패널 회귀를 하라"고 말했다. 데이터 제공업체의 계약은 데이터를 제3자 시스템으로 전송하는 것을 금지했습니다. 이 사건으로 인해 규정 준수 검토가 이루어졌습니다. 올바른 방법은 회사 이름을 익명 코드로 바꾸거나 데이터를 공유하지 않고 패널 회귀 코드만 요청하여 자체 환경에서 실행하는 것이었습니다.

약한 프롬프트 / 강한 프롬프트

약한 프롬프트:

인플레이션과 실업 사이의 관계를 분석하고 계수를 기술하십시오.

이 주장은 틀렸습니다. AI에 데이터가 제공되지 않았으며 어느 국가, ​​어느 기간, 어떤 모델이 명확하지 않습니다. AI는 만들어진 계수로만 답변할 수 있습니다.

강력한 프롬프트:

귀하의 역할: 귀하는 계량경제학 연구원을 보조하는 분석 보조원입니다. 나는 귀하와 데이터를 공유하지 않습니다. 나는 단지 RUNNABLE R 코드를 원합니다. 연간 패널이 있습니다: 변수 국가, 연도, 실업률, 인플레이션(모두 숫자). 작업: 1) 실업 ~ 인플레이션에 대한 고정 효과 패널 회귀 코드 작성(plm 패키지), 2) 주석 줄을 사용하여 코드의 각 단계를 설명, 3) 계수는 CAUSAL이 아닌 관계형으로 해석되어야 한다는 점에 유의하고, 4) 확실하지 않은 함수 인수를 구성합니다. 제 환경에서 실행해서 결과를 확인해보겠습니다.

이 요청에서는 데이터가 공유되지 않으며 역할, 패키지, 의견 기대 및 "조작" 금지가 명확합니다. 여전히 출력을 직접 실행하고 확인합니다.

다음 표에는 이 단원의 한 문장 규칙이 요약되어 있습니다.

원리

그것은 무엇을 의미합니까?

AI는 보조자다

과학적 판단과 책임은 전문가에게 있다

코드를 요청하고 결과를 생성하세요

AI는 숫자를 기억하지 못합니다. 당신은 그것을 실행하고 계산

데이터를 유지하다

마이크로/라이센스 데이터는 보안 환경을 벗어나지 않습니다.

확인하다

모든 이슈, 코드, 댓글이 확인됩니다. 제작은 거부됩니다

일반적인 실수

  • 데이터를 제공하지 않고도 AI로부터 구체적인 통계를 기대합니다. 모델이 데이터에 액세스할 수 없습니다. 그것이 제공하는 계수, 상관 관계 및 p-값은 가짜입니다. 항상 코드를 요청하고 결과를 직접 생성하세요.
  • 환각 기능에 의존합니다. AI가 존재하지 않는 R/Python 함수나 인수를 제안할 수 있습니다. 코드를 실행하고 확인하지 않고 코드를 수락하지 마십시오.
  • 공개 도구에 마이크로데이터를 업로드하는 중입니다. 이는 KVKK/GDPR 및 데이터 사용 계약을 위반하는 것입니다. 데이터를 익명화하거나 전혀 공유하지 마세요.
  • 유창함을 정확성으로 착각합니다. 잘 작성된 리뷰는 부정확할 수 있습니다. 문장의 아름다움은 증거가 아닙니다.
  • 통제 없이 인과적인 언어를 받아들이는 것. YZ는 종종 “X가 Y를 증가시킨다”고 말합니다. 대부분의 회귀는 관계만 보여줍니다. 디자인으로 인과관계 주장을 방어하세요.
팁: AI로 작업할 때 다음 질문을 스스로에게 물어보세요. "심판원이나 감사자가 이 출력을 요청하면 소스와 계정을 보여줄 수 있습니까?" 대답이 '아니오'이면 출력을 아직 사용할 준비가 되지 않은 것입니다.

요약하면

AI는 계량경제학 및 통계 워크플로우의 실행 계층(코드, 정리, 그래프, 초안)에서 실질적이고 대규모 가속을 제공합니다. 그러나 모델 선택, 인과관계, 해석, 출판 및 정책 결정은 전문가의 몫입니다. 세 가지 기본 원칙: AI에게 숫자를 상기시키지 말고, 코드를 요청하고 결과를 직접 생성 및 확인하세요. 보안 환경에서 마이크로/라이센스 데이터를 제거하지 마십시오. 각 출력을 통계적으로 필터링합니다. 검증되지 않은 AI 결과는 검토되지 않은 결과만큼 위험합니다.

응용과제

자신의 (또는 예제) 데이터 세트를 고려하십시오. 데이터 공유 없이 변수 구조만 기술하면 기술통계와 간단한 그래프를 생성하는 R이나 Python 코드를 AI에게 물어보세요. 자신의 환경에서 수신 코드를 실행하십시오. 그런 다음 체크리스트를 유지하십시오. (1) 코드가 오류 없이 실행되었는지, (2) 예상한 행/관찰의 수, (3) AI의 주석 문장 중 인과적인 언어를 사용하여 수정해야 하는 문장은 무엇입니까? 한 문단에 AI가 당신을 구해준 시간과 당신이 발견한 적어도 하나의 버그에 대해 적으세요.

체크리스트

  • [ ] AI가 구체적인 통계를 요구하도록 만들지 않았습니다. 코드를 요청하고 결과를 직접 제작했습니다.
  • [ ] 내 환경에서 제공된 모든 수치와 테스트 결과를 다시 계산했습니다.
  • [ ] 사용하는 함수/인자가 실제로 존재하는지 확인했습니다.
  • [ ] 마이크로/개인/라이선스 데이터를 공개 도구에 업로드하지 않았습니다.
  • [ ] 인과적 언어가 포함된 댓글을 표시하고 관계형 언어로 옮겼습니다.
  • [ ] 나는 감사관에게 결과의 출처와 회계를 보여줄 수 있습니다.