단위 7 / 11

데이터 기반 의사결정 및 공공 데이터 분석

이득:

  • 데이터 작업의 품질, 기밀성 및 해석 위험을 인식하고 안전한 분석 흐름을 구축합니다.
  • 오해의 소지가 있는 단일 지표와 조작 가능성이 있는 측정값을 구별하여 목적에 맞는 올바른 지표를 선택합니다.
  • 오해의 소지가 있는 차트 기술(0에서 시작하지 않는 축, 선택된 범위)을 인식하고 정직한 시각화를 관찰합니다.

대중은 애플리케이션 번호, 해결 시간, 예산 항목, 인구 이동, 서비스 요청, 감사 결과, 만족도 조사 등 매일 데이터를 생성합니다. 이 데이터의 대부분은 Excel 스프레드시트, 양식 및 기록 시스템에 저장되어 있지만 분석에는 전문 지식과 시간이 필요하기 때문에 결정으로 변환되지는 않습니다. 데이터 기반 의사 결정(의견이나 습관이 아닌 측정된 증거를 기반으로 리소스를 할당하고 정책을 설정하는 접근 방식)은 공공 부문의 효율성과 공정성을 모두 높입니다. 리소스는 숫자를 기반으로 가장 필요한 곳에 전달됩니다. 여기서 AI는 표를 이해하고, 패턴과 이상 징후를 찾고, 요약 통계를 추출하고, 결과를 간단한 문장으로 번역하는 강력한 조력자입니다. 이 단원에서는 AI를 통해 원시 공개 데이터에서 방어 가능한 결정까지의 경로를 단축하고 가장 중요한 측면, 즉 숫자의 올바른 해석에서 규율을 유지하는 방법을 알아봅니다.

데이터 작업의 세 가지 위험

데이터는 강력하지만 세 가지 함정이 있으며 AI는 이러한 함정을 완화하거나 확대할 수 있습니다.

  1. 상관관계 ≠ 인과관계. 두 가지가 함께 변한다고 해서 하나가 다른 하나를 유발한다는 의미는 아닙니다. 아이스크림 판매와 익사가 증가하고 있습니다. 둘 다 여름 더위와 관련이 있고, 서로 연관되어 있지 않기 때문입니다. AI는 '왜냐하면' 문장을 유창하게 구성합니다. 인과관계에 대한 모든 주장에 의문을 제기하십시오.
  2. 편향된/누락된 데이터. 데이터는 누구로부터, 어떻게 수집되었나요? 불만 사항 데이터에는 불만을 제기할 수 있는 사람만 반영됩니다. 인터넷에 접속할 수 있는 디지털 애플리케이션 데이터. 누락된 그룹이 표시되지 않으면 결정이 편향됩니다.
  3. 맥락이 없는 숫자. "30% 증가"만으로는 의미가 없습니다. 어느 기간에 따라 절대 수치는 얼마입니까? AI에게 맥락을 물어보세요.
주의: AI가 귀하가 제공한 표를 분석하는 동안, 때때로 표 외부에서 "합리적"이지만 허구의 숫자를 추가하거나 누락된 셀을 자동으로 채웁니다. 각 출력 번호를 소스 테이블과 비교합니다. AI에게 "제가 제공하는 표의 값만 사용하고, 누락된 경우 '데이터 없음'이라고 말하세요"라는 규칙을 부여하세요.

단계별 데이터 분석 흐름

  1. 질문을 명확히 하세요. 결정에 대한 답을 찾고 있는 질문은 무엇입니까? ("어느 동네에서 해결 시간이 가장 오래 걸리나요?")
  2. 데이터를 알아보세요. 열은 무엇이며 단위는 무엇이며 기간은 무엇이며 누락되거나 잘못된 값이 있습니까?
  3. 개인 데이터를 추출합니다. 분석에 개인 식별이 필요하지 않은 경우 익명화/집계합니다(단원 11 참조).
  4. 요약과 패턴이 나타난다. AI가 기본 통계, 그룹화, 이상 징후 표시를 수행하도록 하세요.
  5. 댓글에 질문을 해보세요. 상관관계인가 인과관계인가? 대체 설명? 그룹이 누락되었나요?
  6. 시각화하고 단순화하세요. 의사결정자가 이해할 수 있는 간단한 요약 및 그래픽입니다.
  7. 결정과 그 이유를 문서화하십시오. 어떤 데이터를 바탕으로 어떤 결정이 내려졌나요? 감사 추적.

세 개의 미니 케이스

사례 1 - 소스가 올바른 위치로 이동했습니다. 과거에는 지자체에서 공원 관리 예산을 '동네별로 균등하게' 배분했습니다. 18개월간 수요·이용 데이터를 AI로 분석한 결과, 3개 동네의 1인당 수요는 평균의 2.4배였다. 예산은 필요에 따라 재분배되었습니다. 추가 비용 없이 전반적인 만족도가 높아졌습니다.

사례 2 - 편향된 데이터가 발견되었습니다. 한 기관은 디지털 애플리케이션 데이터를 보고 "시민이 더 이상 요금소에 오지 않는다"고 결론을 내립니다. 하지만 분석에서 연령별 지원을 요청한 결과, 65세 이상의 지원자는 여전히 대부분 카운터에서 오는 것으로 나타났습니다. 디지털 데이터만 본다면 이 그룹은 무시될 것입니다. 박스오피스 서비스는 그대로 유지됐다.

사례 3 - 인위적인 인과관계가 중단되었습니다. YZ 측은 표를 해석하면서 "검사 횟수가 늘어나 사고가 줄었다"고 말했다. 분석가는 같은 기간 날씨도 변했고 교통량이 감소했다는 사실을 상기시켰습니다. 한 가지 원인으로만 돌리는 것은 오해의 소지가 있습니다. 해당 보도는 '관계는 있으나 인과관계가 입증되지 않았다'고 수정됐다.

복사 가능한 템플릿 4개

1) 테이블에 대해 알아보기:

귀하의 역할: 데이터 분석가. 아래 표를 검토하고 이 표의 값만을 기준으로 합니다. (1) 각 열의 내용, 단위 및 기간을 요약하고, (2) 누락/잘못된 것으로 나타나는 셀을 요약하고, (3) 눈에 띄는 상위 3개 패턴을 ​​요약합니다. 테이블 외부에서 숫자 추가 누락된 경우 "데이터 없음"이라고 말합니다.TABLE: [데이터 붙여넣기]

2) 맥락을 포함한 요약 통계:

아래 표에서 다음 질문에 답하세요: [질문]. 절대 수치 + 비율 + 비교 기간과 같은 맥락으로 결과를 제공해야 합니다. "X% 증가"라고 말할 때는 어느 정도, 어느 기간에 걸쳐 증가했는지 명시하세요. 주어진 데이터를 사용하세요.TABLE: [data] QUESTION: [question]

3) 인과관계 질문자:

다음 결과를 해석하되 주의: 상관관계와 인과관계를 혼동하지 마십시오. 이 관계에 대해 최소한 3가지 대체 설명을 생성합니다(세 번째 변수, 역방향, 우연의 일치). 인과관계를 입증하기 위해 추가로 어떤 데이터가 필요한지 알려주세요. 발견 항목: [관계]

4) 결정에 대한 간단한 요약:

데이터 전문가가 아닌 의사 결정자를 위해 다음 분석을 단순화합니다. 5개 이하의 항목, 각 항목은 결과 및 "이것이 무엇을 의미하는지" 설명입니다. 또한 데이터의 불확실성과 한계를 명확하게 기록합니다. 새로운 정보를 추가합니다.분석: [텍스트]

약한 프롬프트 / 강한 프롬프트

약함: "이 차트를 분석하고 우리가 무엇을 해야 하는지 알려주세요."

Strong: "당신의 역할은 데이터 분석가입니다. 아래 표만 사용하십시오. 외부에서 숫자를 추가하지 마십시오. 누락된 셀에 '데이터 없음'이라고 말하십시오. 먼저 열, 단위 및 기간을 파악하십시오. 그런 다음 절대 숫자 + 비율 + 비교 기간으로 '해결 시간이 가장 긴 이웃'이라는 질문에 답하십시오. 패턴을 찾으면 인과 관계로 설명하기 전에 3가지 대체 설명을 제시하십시오. 마지막으로 결정을 내리는 데이터(누락 그룹, 짧은 기간)의 지점과 경계를 나열하십시오."

차이점: 강력한 프롬프트는 데이터 충실도, 컨텍스트, 인과관계 규율 및 의사결정 경계를 함께 설정합니다. 결과는 방어 가능한 분석입니다.

데이터 비즈니스에서 AI를 어디에서 신뢰할 수 있습니까?

사업

AI 신뢰

규칙

테이블 요약, 그룹화

높다

데이터만 제공됨

이상/패턴 마킹

중간

인간의 확인

인과관계 해석

낮음

대체 설명이 필요합니다.

누락된 데이터 채우기

너무 낮음

그런 일이 일어나지 않도록 하세요. "데이터가 없습니다"

단순화/시각적 요약

높다

의미는 보존되어야 한다

지표 설계 및 오해의 소지가 있는 차트 트랩

데이터를 활용한 의사결정에서 가장 중요한 단계는 올바른 지표(현상을 측정 가능하게 만드는 수치 표현, 예를 들어 "평균 처리 시간" 또는 "애플리케이션당 비용")를 선택하는 것입니다. 잘못된 지표는 정확한 데이터가 있더라도 잘못된 결정으로 이어집니다. "총 해결된 청구 건수"는 증가하는 것처럼 보이지만 "시민 1인당 대기 시간"은 악화될 수 있습니다. AI는 주제에 대한 후보 지표와 각 지표가 무엇을 측정하고 숨기는지 나열할 수 있습니다. 하지만 어떤 지표가 공익을 진정으로 나타내는지는 귀하가 결정합니다. 또한, AI가 제안하거나 설명하는 그래프에서는 시각화(0에서 시작하지 않는 축, 불균형 척도, 선택된 시간 간격 등의 기술로 인식을 왜곡하는) 오해의 소지가 있는 시각화의 위험성에 유의하세요. 공개 데이터의 정직한 시각은 거버넌스의 일부입니다.

미니 케이스 - 잘못된 표시, 잘못된 자랑. 한 유닛은 "월당 닫힌 파일 수" 표시에서 기록을 깨고 있었습니다. 하지만 시민 불만은 늘었다. 정확한 지표인 '첫 번째 연락 해결 비율'을 살펴보면 비율이 58%에서 44%로 떨어졌습니다. 즉, 파일이 빠르게 닫혔다가 다시 열렸습니다. 지표가 변경되면 관리 우선순위도 변경됩니다.

미니 케이스 — 0에서 시작하지 않는 축입니다. 프레젠테이션에서 설명한 AI 그래프에서 세로축은 40에서 시작하는데, 2% 증가는 드라마틱한 도약처럼 보였다. 축이 0으로 이동하면 실제 그림이 나타나고 과장된 인식에서 결정이 제거됩니다.

지표 선택을 지원하는 템플릿:

과제: 다음 목적을 위한 5개의 후보 지표를 제안합니다. 목적: [예: 시민 서비스 품질 향상]각 지표에 대해: 측정 대상 | 무엇을 숨길 수 있나요 | 조작에 대한 개방성 | 권장 읽기 빈도. 다음: 이 지표를 함께 읽으려면 3개의 경고(그 자체로는 오해의 소지가 있는 경고)를 작성하세요. 규칙: 숫자를 생성하지 마세요. 인디케이터 디자인만 제안해주세요.

주의: "숫자는 객관적"이라는 오해에 빠지지 마십시오. 측정하는 숫자, 표시 방법, 선택하는 범위는 모두 해석의 문제입니다. 정확한 데이터를 확보하는 것만큼 투명하고 정직한 대중의 해석이 중요합니다.

일반적인 실수

  • 인과관계를 혼동하는 상관관계. "함께 증가했다"는 것이 원인이 아닙니다. 대체 설명을 찾아보세요.
  • AI가 누락된 데이터를 채워줍니다. 분석은 만들어진 값으로 붕괴됩니다. 누락된 부분은 남겨두세요.
  • 편향된 데이터를 일반화합니다. 불만 사항/디지털 데이터가 모든 사람을 대표하는 것은 아닙니다. 누락된 그룹을 쿼리합니다.
  • 맥락 없이 숫자를 제시합니다. 비율 옆에는 절대 수치와 비교 기간이 있어야 합니다.
  • 개인 데이터를 불필요하게 분석합니다. 집계된 데이터가 충분할 경우 개인 식별을 사용하지 마십시오.
  • 결정을 문서화하지 않습니다. 감사를 위해 어떤 데이터를 기록해야 하는지에 따라 어떤 결정이 내려졌습니까?

요약하면

데이터 기반 의사결정은 공공 부문에서 자원을 공정하고 효율적으로 분배하는 가장 강력한 방법입니다. AI는 이 비즈니스에서 그림을 이해하고 패턴을 찾고 결과를 단순화하는 빠른 조력자입니다. 그러나 AI가 숫자를 구성하도록 하지 말고, 누락된 데이터를 채우도록 하지 말고, 인과관계와 상관관계를 혼동하지 않도록 하고, 편향되거나 불완전한 데이터를 일반화하지 않도록 하십시오. 숫자에는 힘이 있습니다. 이를 올바르게 해석하고 결정을 문서화하는 사람이 더 강합니다.

응용과제

귀하의 장치에서 실제 (개인 데이터가 제거된) 테이블을 얻으십시오. "테이블 알아보기" 템플릿을 사용하여 데이터를 소개한 다음 "상황별 요약 통계" 템플릿을 사용하여 결정을 위한 중요한 질문에 대한 답변을 얻으세요. 새로운 관계에 "인과관계 질문자" 템플릿을 적용하고 최소한 하나의 대체 설명을 찾으세요. AI가 테이블 외부에서 숫자를 추가하는지 확인하세요.

체크리스트

  • [ ] AI는 주어진 테이블만 사용했습니다. 그는 외부에서 전화번호를 추가하지 않았습니다.
  • [ ] 누락된 정보를 기재하지 않았습니다. 저는 "데이터 없음"으로 놔뒀습니다.
  • [ ] 각 결과를 맥락(절대수 + 비율 + 기간)과 함께 제시했습니다.
  • [ ] 나는 인과관계 주장에 대한 대안적인 설명을 제시했습니다.
  • [ ] 편향/누락된 데이터와 누락된 그룹의 위험을 평가했습니다.
  • [ ] 나는 결정과 그 결정의 근거가 되는 데이터를 문서화했습니다.