단위 6 / 11

데이터 준비 및 기능 엔지니어링: 인공 지능을 사용한 보험 통계 데이터 처리

이득:

  • 인공지능 지원을 통해 정책 및 손상 데이터의 누락된 값, 이상치, 노출 및 데이터 품질 문제를 탐지하고 수정 초안을 생성하는 기능
  • 특성 엔지니어링(새로운 변수 파생, 그룹화, 코딩) 및 올바른 컨텍스트를 갖춘 인공 지능에 대한 노출 정규화
  • 인공지능이 제안한 데이터 변환은 데이터 유출 및 숨겨진 편견의 위험에 대해 보험계리사가 감사해야 한다는 점을 이해하세요.

통계 업무 중 가장 적게 이야기되지만 시간이 가장 많이 소요되는 부분은 데이터 준비입니다. 경험이 풍부한 보험계리사는 모델링 프로젝트의 대부분의 시간이 데이터 정리, 결합 및 수정에 소비된다는 것을 알고 있습니다. 모델이 아무리 훌륭하더라도 입력 데이터가 손상되면 출력도 손상됩니다. 즉, "가비지가 들어가면 쓰레기가 나옵니다." 본 단원에서는 보험증권 및 청구 데이터의 일반적인 문제점, 이를 AI로 감지하고 수정하는 방법, 기능 엔지니어링(기존 데이터에서 더 많은 정보를 제공하는 새로운 변수 파생) 접근 방식을 살펴보겠습니다.

처음부터 경고합니다. 데이터 준비는 기술적이고 순진해 보이는 단계이지만 가장 위험한 오류가 숨어 있는 곳입니다. 잘못된 노출 정규화, 숨겨진 데이터 유출 또는 무의식적으로 도입된 편향은 모든 후속 모델을 자동으로 손상시킵니다. AI는 이 단계를 크게 가속화하지만 제어하지 않고 방치하면 위험도 확대됩니다.

보험 통계 데이터의 일반적인 문제

보험 증권 및 청구 데이터는 거의 깨끗하게 도착하지 않습니다. 가장 일반적인 문제는 다음과 같습니다. 누락된 값: 일부 정책에는 차량 연령, 직업 또는 지역이 비어 있습니다. 이를 맹목적으로 평균으로 채우면 편향이 발생할 수 있습니다. 결핍 자체는 때때로 정보를 전달합니다(누락된 것은 다른 그룹입니다). 이상값: 마이너스 보험료, 200년 보험, 노출 제로 정책과 같은 비논리적인 기록입니다. 이것이 데이터 오류인지 실제 극단적인 경우인지 구별해야 합니다. 불일치: 동일한 지역의 다른 철자("Istanbul", "Istanbul", "34"), 날짜 형식 혼동. 중복 항목: 동일한 피해가 두 번 입력됩니다.

그러나 보험계리와 관련된 가장 중요한 문제는 노출입니다. 보험이 연도 중반에 시작되면 전체 "보험 연도"가 아닌 해당 연도에 대한 부분적인 노출(예: 0.5년)을 제공합니다. 빈도와 손상률은 항상 노출에 대해 정규화되어야 합니다. 그렇지 않으면 단기 정책은 위험도가 높아 보입니다. AI는 노출 계산을 코딩할 수 있지만 정의와 비즈니스 규칙을 제공해야 합니다.

다음 표에는 일반적인 문제와 올바른 접근 방식이 요약되어 있습니다.

문제

잘못된 접근 방식

올바른 접근

누락된 값

모두 평균으로 채워라

결핍을 분석하십시오. 때로는 별도의 카테고리를 열 때도 있습니다.

특이치

자동 삭제

데이터 오류와 실제 리드를 구별

노출

1년 동안 모든 보험 상품을 계산합니다.

부분 노출 계산

카테고리 불일치

무시하다

표준사전과 일치

반복되는 손상

눈치채지 마

주요 필드로 중복 제거

특성 추출: 데이터에서 지식 도출

기능 엔지니어링은 기존 원시 변수에서 모델에 더 유용한 새로운 변수를 파생하는 기술입니다. 예: 생년월일의 "연령", 연령의 "연령 그룹"(비닝), 차량 제조사 모델의 "위험 세그먼트", 주소-정책 조합의 "연간 마일리지 추정치". 좋은 특징은 원시 데이터보다 더 강력한 신호를 전달하고 모델의 정확성과 해석 가능성을 모두 높입니다.

보험계리 업무에는 세 가지 기법이 자주 사용됩니다. 바인딩: 연속 변수(연령)를 의미 있는 그룹으로 분리합니다. 이는 비선형 관계를 포착하고 관세를 읽을 수 있게 만듭니다. 인코딩: 범주형 변수(지역)를 모델에 적합한 수치 형식으로 변환합니다. 위험 기반 코딩(각 범주를 고유한 피해율로 표시)은 일반적이지만 주의해서 수행해야 합니다. 정규화: 모든 것을 노출로 나누어 비교 가능하게 만듭니다. AI는 이러한 변환을 위한 코드를 신속하게 생성합니다. 하지만 각 변환의 논리를 승인해야 합니다.

팁: 대상 인코딩은 강력하지만 데이터 유출이 발생하기 쉽습니다. 카테고리의 평균 손상을 계산할 때 행 자체 손상을 포함하면 모델이 "속임수"가 됩니다. 항상 교차 검증 패턴으로 훈련 데이터 내에서 이 작업을 수행하십시오.

가장 교활한 위험: 데이터 유출 및 암묵적 편견

데이터 유출은 예측 당시 실제로 존재하지 않는 정보가 모델에 유입되는 것을 말합니다. 전형적인 예: 청구 금액을 예측하는 모델에 "지불된 청구서"와 같은 결과를 포함하는 변수를 도입합니다. 모델은 테스트 데이터에서는 완벽해 보이지만 예측 시점에는 해당 정보를 사용할 수 없기 때문에 실제 세계에서는 쓸모가 없습니다. 누출은 흔히 숨겨져 있으며 신중한 보험 통계적 추론에 의해서만 포착됩니다. AI는 일반적으로 이를 알아차리지 못하며 때로는 누출 변수를 "매우 강력한 예측 변수"라고 칭찬하기도 합니다.

두 번째 교활한 위험은 암묵적인 편견입니다. 과거 데이터가 특정 그룹을 부당하게 나타내는 경우(예: 한 지역이 역사적으로 너무 많은 정책을 거부당한 경우) 해당 데이터에서 파생된 기능은 해당 편향을 전달하고 모델은 이를 미래에 복제합니다. 기능 엔지니어링 단계는 이러한 편향을 인식하고 수정할 수 있는 가장 중요한 순간입니다.

주의: 변수가 "예측력을 엄청나게 향상"할 때 기뻐하기 전에 이 변수가 예측 시점에 실제로 존재합니까, 아니면 미래를 포함합니까? 너무 좋아 보이는 결과는 종종 누출의 징후입니다.

데이터 준비에 AI를 사용하는 방법

1) 데이터 품질 심사:

귀하의 역할: 데이터 품질 보조자. 귀하는 보험 통계적 수익률을 보유하고 있습니다. 열:policy_id,start_date,end_date,age,region,vehicle_age,premium,claim_count,claim_amount.체크리스트와 Python(pandas) 코드 스케치 제공:- 누락된 값을 열별로 계산합니다.-불합리한 값에 플래그를 지정합니다(음수 프리미엄, 연령 <16 또는 >100, end<start).- 시작/끝에서 부분 노출(년)을 계산합니다. 삭제하지 마세요. 보고만 하면 제가 결정할 수 있어요.

2) 특징 도출:

내 트래픽 데이터에서 새로운 기능을 도출하고 싶습니다. 사용 가능: age, vehicle_age, 지역, Annual_km, Usage_type.- 어떤 연령 및 km 그룹(비닝)을 추천하시나요? - 데이터 유출 없이 '지역'에 대한 위험 기반 코딩을 어떻게 할 수 있나요?- 시도해 볼 만한 새로운 기능 3가지를 제안하고 각각에 대한 보험 통계적 근거를 작성하세요. 내가 결정할 것이다.

3) 누출 검사:

내 모델은 연령, 지역, 차량 연령, PAID_CLAIM_FLAG, SETTLEMENT_DAYS 등의 변수를 사용하여 손상 가능성을 예측합니다. 다음 변수 중 데이터 유출 위험이 있는 변수는 무엇입니까? 각각에 대해 예측 시점에 사용 가능한지 여부를 평가합니다. 의심스러운 항목과 그 이유를 나열하세요.

4) 노출 표준화:

내 보험 중 일부는 올해 중반에 시작됩니다. 빈도를 올바르게 계산하기 위해 노출 정규화를 설명하고 코딩합니다. 빈도 = 총 청구 건수 / 총 노출(보험 연도). 연중에 시작되는 보험의 노출을 계산하는 방법을 예와 함께 보여줍니다.

약한 프롬프트 / 강한 프롬프트

약한 프롬프트:

데이터를 정리하고 모델에 사용할 준비를 합니다.

AI는 어떤 열이 어떤 것인지, 비즈니스 규칙, 노출 정의를 알지 못합니다. 맹목적으로 데이터를 삭제하고 채우고 손상시킬 수 있습니다.

강력한 프롬프트:

귀하의 역할: 보험 통계 데이터 준비 보조자.데이터 사전:policy_id(신원), 시작/종료 날짜(보험 기간),나이(예상 16-90), 보험료(반드시 >0이어야 함),claim_count(>=0),claim_amount(>=0).작업:1) 각 열에 대한 합리성 규칙을 작성하고 REPORT 위반(삭제).2) 부분 노출을 계산하는 코드 제공.3) 누락에 대한 3가지 다른 전략 '나이'(삭제). / 평균 / 별도 범주) 플러스 마이너스가 있음; 판단은 나에게 맡기세요.4) 유출 위험이 있는 열이 있으면 경고합니다. 모든 기록은 자동 삭제됩니다. 나는 모든 결정을 승인할 것입니다.

세 개의 미니 케이스

사례 1 - 노출 오류. 한 포트폴리오에서는 단기(3개월) 여행 정책이 1년으로 계산되어 빈도가 실제보다 4배 낮게 나타났습니다. 가격이 잘못 떨어졌습니다. 보험계리사가 익스포저를 분수(보험 연도 0.25)로 계산하면 실제 빈도가 공개되고 관세가 수정되었습니다. AI가 생성한 부분 노출 코드; 보험계리사가 정의를 내렸습니다.

사례 2 - 잠재 누출. 도우미가 손상 확률 모델에 "파일 폐쇄 시간" 변수를 추가하자 정확도가 크게 향상되었습니다. 기쁨은 짧았습니다. 이 변수는 손상이 발생한 후에만 알 수 있었습니다. 즉, 예측 당시에는 사용할 수 없었습니다. 누출변수를 제거하면 모델이 현실적인 수준으로 감소합니다. 그는 AI 변수를 '강력한 예측자'라고 칭찬했다. 보험계리사의 판단이 함정에 빠졌다.

사례 3 — 편향의 복제. 한 회사는 과거 데이터에서 '신청 거부' 패턴을 도출하여 이를 새 모델에 적용했습니다. 분석 결과, 과거 거부 사례가 특정 지역에 불균형적으로 집중된 것으로 나타났습니다. 이는 역사적 편견이 있음을 의미합니다. 이 기능은 모델에서 제거되었으며 보다 중립적인 위험 지표로 대체되었습니다. AI는 패턴이 이웃과 겹치는 것을 측정하는 분석을 생성했습니다. 윤리적 결정은 보험계리사와 준법감시 부서가 내렸습니다.

일반적인 실수

  • 아무 생각 없이 평균으로 결측값을 채우는 것. 부족함 자체가 지식일 수도 있습니다. 맹목적으로 채우는 것은 편견을 낳는다.
  • 이상값을 자동으로 삭제합니다. 일부는 진정한 극단적인 경우입니다. 데이터를 오류와 분리하지 않고 삭제하면 정보가 파괴됩니다.
  • 노출을 정규화하지 않습니다. 단기 보험을 1년 단위로 계산하면 빈도가 왜곡되고 가격도 왜곡됩니다.
  • 데이터 유출을 인지하지 못합니다. 너무 좋은 결과는 종종 미래와 관련된 변수의 신호입니다. 예측 시점에 각 변수가 존재하는지 쿼리합니다.
  • 암묵적 편견을 미래에 가져옵니다. 과거 데이터의 불공정성은 파생된 특성으로 누출될 수 있습니다. 기능 단계에서 확인해보세요.

요약하면

보험 통계 모델링은 주로 데이터 준비에 관한 것입니다. 입력이 손상되면 출력도 손상됩니다. 일반적인 문제는 누락된 값, 이상치, 불일치 및 중복입니다. 중요한 보험계리적 문제는 노출 정규화입니다. 기능 엔지니어링(그룹화, 코딩, 정규화)은 데이터에서 더 강력한 신호를 도출합니다. 가장 교활한 위험은 데이터 유출과 암묵적인 편견입니다. 둘 다 보험 통계적 추론에 의해서만 포착됩니다. AI는 이 단계를 크게 가속화합니다. 스캔하면 코드와 권장 사항이 생성됩니다. 그러나 자동으로 기록을 삭제하지 말고 사람이 누출 및 편견을 확인하고 각 변환을 승인하도록 하십시오.

응용과제

작은 익명 정책 데이터 사전(5~7개 열, 각각 합리적인 범위)을 준비합니다. AI에게 (a) 각 열의 합리성 규칙 및 위반 신고 코드, (b) 부분 노출 계산, (c) 시도해 볼 수 있는 3가지 새로운 기능 제안을 요청하세요. 그런 다음 의도적인 "누수 트랩" 변수를 목록에 추가하고(예: "보상 지급") AI가 이를 누출로 포착하는지 테스트합니다.

체크리스트

  • [ ] 누락된 항목과 이상값을 삭제하기 전에 이유를 분석했습니까?
  • [ ] 노출을 올바르게 분류하고 정규화했습니까?
  • [ ] 새로 파생된 각 기능에 대한 보험계리적 근거를 작성했습니까?
  • [ ] 예측 시점에 각 변수가 실제로 존재(누출)하는지 의문이 들었나요?
  • [ ] 파생된 특징의 암묵적 편향을 검사했습니까?
  • [ ] AI가 자동으로 기록을 삭제하고 모든 결정을 스스로 승인하지 않았나요?