Lợi nhuận:
- Khả năng thiết lập mô hình tuyến tính tổng quát (GLM), khái niệm hệ số rủi ro, thuế quan và phí bảo hiểm rủi ro với sự hỗ trợ của trí tuệ nhân tạo và dịch các hệ số sang ngôn ngữ kinh doanh
- Khả năng thảo luận về sự cân bằng giữa lựa chọn biến, tương tác, trang bị quá mức và khả năng diễn giải của các mô hình học máy (GBM) với trí tuệ nhân tạo
- Có thể hiểu rằng mô hình định giá không có các biến số bị cấm/phân biệt đối xử và việc tuân thủ biểu giá cuối cùng với luật pháp và cạnh tranh là việc của chuyên gia tính toán.
Giá của hợp đồng bảo hiểm không được xác định một cách ngẫu nhiên. Nguy cơ xảy ra tai nạn giao thông đối với người lái xe 22 tuổi mới có bằng lái xe sống ở thành phố lớn cao hơn về mặt thống kê so với người lái xe 45 tuổi, 20 năm kinh nghiệm; Trong một hệ thống công bằng, phí bảo hiểm cũng phải khác nhau. Công việc của chuyên gia tính toán là đo lường sự khác biệt này và phản ánh nó vào giá được gọi là định giá và phân loại rủi ro. Trong phần này, chúng ta sẽ thảo luận về mô hình tuyến tính tổng quát (GLM), nền tảng tính toán định giá và các lựa chọn thay thế học máy của nó, đồng thời xem cách sử dụng AI một cách an toàn trong quy trình này.
Một số thuật ngữ cơ bản. Yếu tố rủi ro là biến số ảnh hưởng đến rủi ro và được sử dụng để định giá (tuổi, tuổi xe, khu vực, mục đích sử dụng). Biểu giá là một bộ quy tắc xác định cách tính phí bảo hiểm theo các yếu tố rủi ro. Phí bảo hiểm rủi ro là chi phí tổn thất dự kiến thuần túy; Khi cộng các chi phí, hoa hồng, tỷ suất lợi nhuận và chi phí vốn, phí bảo hiểm thương mại (giá bán) sẽ được hình thành. Hãy nhắc lại từ đầu: AI gợi ý biến, xây dựng mô hình, giải thích hệ số; Nhưng biến số nào là hợp pháp và đạo đức và liệu mức thuế cuối cùng có tuân thủ luật pháp và cạnh tranh hay không đều thuộc về đơn vị tính toán và tuân thủ.
Tại sao GLM là tiêu chuẩn trong tính toán bảo hiểm
Phương pháp được sử dụng nhiều nhất trong việc định giá là GLM. GLM là viết tắt của “mô hình tuyến tính tổng quát”: nó mở rộng hồi quy tuyến tính cổ điển để phù hợp với các mục tiêu không được phân phối chuẩn, chẳng hạn như dữ liệu thiệt hại. Nó có hai thành phần cơ bản. Họ phân phối: Poisson được chọn cho tần số, gamma được chọn cho cường độ (logic ở đơn vị 2). Hàm liên kết (link): thường là logarit, cho phép các thừa số có tác dụng nhân. Cấu trúc nhân rất có giá trị trong tính toán bảo hiểm vì đó chính xác là cách thiết lập biểu giá: phí bảo hiểm cơ bản × hệ số tuổi × hệ số khu vực × hệ số phương tiện.
Ưu điểm lớn nhất của GLM là khả năng diễn giải. Một hệ số cho bạn biết trực tiếp: “nhóm tài xế trẻ tăng tần suất lên 1,6 lần so với nhóm tham chiếu”. Tính minh bạch này rất quan trọng theo ba cách: (1) cơ quan quản lý và kiểm toán nội bộ có thể hiểu và phê duyệt mô hình; (2) có thể thấy rõ tác động bị cấm/phân biệt đối xử; (3) logic giá có thể được giải thích cho đội ngũ quản lý và bán hàng. Các mô hình học máy phức tạp hơn (bên dưới) đôi khi cho độ chính xác cao hơn nhưng lại ảnh hưởng đến tính minh bạch.
Gợi ý: Hệ số GLM được tính theo thang logarit. Yêu cầu AI chuyển hệ số thành “hệ số nhân” với exp(cofactor); Sẽ dễ dàng hơn nhiều khi dịch sang ngôn ngữ kinh doanh (ví dụ: hệ số 0,47 → hệ số ≈ 1,60 → “rủi ro hơn 60%”).
Lựa chọn biến, trang bị quá mức và học máy
Quyết định quan trọng nhất trong việc định giá là biến nào sẽ vẫn còn trong mô hình. Có hai cái bẫy. Một số biến số làm mù mô hình: nếu nhân tố rủi ro quan trọng bị bỏ sót, giá sẽ sai. Quá thay đổi/trang bị quá mức khiến mô hình ghi nhớ dữ liệu trong quá khứ: mô hình nhầm nhiễu với tín hiệu và không thực hiện được các chính sách mới. Sự cân bằng được thiết lập thông qua xác thực chéo - chia dữ liệu thành các phần đào tạo và kiểm tra, đồng thời kiểm tra nó trên dữ liệu mà mô hình không nhìn thấy, tính đơn giản và lý luận tính toán.
Sự tương tác cũng rất quan trọng: đôi khi tác động kết hợp của hai yếu tố khác với tổng tác động riêng biệt của chúng (một chiếc xe trẻ + thể thao có thể rủi ro hơn tổng tác động riêng lẻ của chúng). Trong GLM, các tương tác được thêm vào một cách rõ ràng.
Trong những năm gần đây, các mô hình như GBM (máy tăng cường độ dốc - một phương pháp học máy mạnh mẽ kết hợp nhiều cây quyết định nhỏ) đã trở nên phổ biến trong việc định giá. Chúng tự động nắm bắt các mô hình và tương tác phức tạp, thường đưa ra dự đoán chính xác hơn GLM. Nhưng nó phải trả giá: xu hướng trở thành "hộp đen". Thực tiễn phổ biến hiện nay là sử dụng GBM để khám phá và tạo ý tưởng và GLM cho biểu giá minh bạch cuối cùng; hoặc diễn giải đầu ra GBM bằng các công cụ giải thích như SHAP.
Bảng sau so sánh hai cách tiếp cận:
tiêu chí
GLM
GBM (học máy)
Khả năng giải thích
Cao (bật hệ số)
Thấp (cần có công cụ chú thích)
Chụp tương tác
Đã thêm thủ công
tự động
Nguy cơ trang bị quá mức
thấp-trung bình
Cao (cần điều chỉnh cẩn thận)
Phê duyệt của cơ quan quản lý/kiểm toán
dễ dàng
Khó khăn, cần thêm tài liệu
Cách sử dụng điển hình
biểu giá cuối cùng
khám phá, so sánh
Cách sử dụng AI trong việc định giá
1) Dịch hệ số GLM sang ngôn ngữ kinh doanh:
Tôi thiết lập tần số GLM (Poisson, liên kết nhật ký). Một số hệ số (thang log): age_group_18_25: 0,47 ; vùng_đa số: 0,22 ; arac_yasi_10plus: -0,15. Chuyển đổi từng hệ số thành hệ số nhân với exp() và giải thích nó bằng một câu mà người quản lý có thể hiểu được. Cũng nhắc nhở nhóm tham khảo là gì.
2) Thảo luận về biến/tương tác:
Vai trò của bạn: trợ lý định giá. Các biến ứng cử viên của tôi cho mô hình tần suất giao thông là: tuổi, giới tính, khu vực, tuổi xe, công suất động cơ, km hàng năm, nghề nghiệp. - Những biến số nào có thể có rủi ro từ góc độ quy định/đạo đức (ví dụ: phân biệt đối xử gián tiếp)? - Những tương tác song phương nào sẽ có ý nghĩa để thử? - Tôi nên làm theo những bước xác minh nào để tránh trang bị quá mức? Ra quyết định; Hãy cho tôi khuôn khổ để kiểm soát và thảo luận.
3) Mã kiểm soát quá mức:
Viết mã nhận xét để đánh giá GLM với xác thực chéo k-fold bằng cách sử dụng Python + scikit-learn / statsmodels. Sử dụng độ lệch Poisson làm thước đo. So sánh điểm đào tạo và điểm kiểm tra, đồng thời giải thích trong dòng nhận xét cách đọc dấu hiệu quá phù hợp. Thư viện là giả mạo.
4) Sàng lọc biến phân biệt đối xử/thay thế:
'Mã bưu điện' hóa ra là một biến số mạnh trong mô hình định giá của tôi. Giải thích rủi ro của việc đại diện gián tiếp cho một đặc điểm bị cấm (ví dụ: dân tộc, thu nhập) như một biến đại diện. - Tôi nên làm phân tích gì để kiểm tra rủi ro này? - Có những lựa chọn thay thế nào để giảm thiểu rủi ro? Cung cấp tư vấn pháp luật; vẽ ra một khuôn khổ kỹ thuật và đạo đức.
Dấu nhắc yếu / Dấu nhắc mạnh
Dấu nhắc yếu:
Xây dựng mô hình định giá tốt nhất cho bảo hiểm giao thông.
"Tốt nhất" không được xác định; Không có dữ liệu, không có hạn chế, không có pháp luật. AI đưa ra một câu trả lời chung chung, không thể áp dụng được.
Lời nhắc mạnh mẽ:
Vai trò của bạn: trợ lý cho chuyên gia tính toán giá cả. Bối cảnh: Tôi đang xây dựng mô hình tần số nhánh lưu lượng, GLM (Poisson, liên kết nhật ký). Các biến tôi có: nhóm tuổi, tuổi xe, vùng (tỉnh), km hàng năm, mục đích sử dụng. Ràng buộc: luật pháp không thể sử dụng giới tính; Tôi cần tránh sự phân biệt đối xử gián tiếp. Nhiệm vụ:1) Đề xuất đặc tả mô hình ban đầu với các biến này (bao gồm cả các nhóm tham chiếu).2) Đưa ra lý do cho 2 tương tác mà tôi nên thử.3) Đưa ra danh sách các bước để kiểm tra trang bị quá mức.4) Thêm lưu ý đặc biệt cho 'khu vực' về mặt phân biệt đối xử gián tiếp. Tôi sẽ đưa ra quyết định; Bạn cung cấp khuôn khổ và sự biện minh.
ba trường hợp nhỏ
Trường hợp 1 - Giá trị của tính minh bạch. Một công ty đã trình bày một mô hình định giá rất chính xác mà họ xây dựng bằng GBM cho cơ quan quản lý, nhưng không thể giải thích các hệ số; phê duyệt bị trì hoãn Chuyên gia tính toán đã xây dựng một GLM thu được các tín hiệu tương tự; Độ chính xác giảm 2%, nhưng vì mọi yếu tố đều có thể được tính đến nên mô hình đã được xác thực trong vòng một tháng. GBM được để dành cho trinh sát, GLM trở thành thuế quan. YZ nhanh chóng tạo ra mã và mô tả bộ điều chỉnh để so sánh hiệu suất của hai mẫu xe.
Trường hợp 2 - Bẫy trang bị quá mức. Một người trợ giúp đã đạt điểm tuyệt đối về dữ liệu huấn luyện khi anh ta thêm hơn 40 biến và nhiều tương tác vào mô hình. Nhưng khi xác thực chéo, điểm kiểm tra bị giảm: mô hình đã ghi nhớ tiếng ồn. Hiệu suất trong thế giới thực tăng lên khi số lượng biến giảm xuống còn 12 và được đơn giản hóa. Bài học: hãy nhìn vào điểm dữ liệu chưa từng có chứ không phải điểm huấn luyện.
Trường hợp 3 - Phân biệt đối xử gián tiếp. Trong một mô hình, biến "lân cận" giải thích rõ ràng về phí bảo hiểm. Phân tích cho thấy biến này phần lớn trùng lặp với sự tập trung dân tộc, tức là nó là đại diện cho một đặc điểm bị cấm. Chuyên gia tính toán đã thay thế biến này bằng các chỉ số rủi ro trung tính hơn (loại đường, tình trạng đỗ xe); cả rủi ro đạo đức và pháp lý đều giảm. AI tạo ra phân tích tương quan đo lường sự chồng chéo và các đề xuất biến thay thế; Đơn vị tính toán và tuân thủ đã đưa ra quyết định.
Những lỗi thường gặp
- Biến mô hình không thể diễn giải thành công thức cuối cùng. Một mức giá không thể giải thích được cho cơ quan quản lý, kiểm toán và khách hàng là không bền vững; Sự minh bạch là điều cần thiết.
- Dựa vào điểm học vấn. Trang bị quá mức chỉ được phát hiện trong dữ liệu không nhìn thấy được (xác thực chéo).
- Sử dụng các biến bị cấm/thay thế mà không kiểm tra. Các biến số như mã zip và nghề nghiệp có thể mang đến sự phân biệt đối xử gián tiếp; Hãy chắc chắn để kiểm tra nó.
- Nhầm lẫn giữa phí bảo hiểm rủi ro và phí bảo hiểm thương mại. Chỉ riêng chi phí thiệt hại thuần túy không phải là giá bán; chi phí, lợi nhuận và chi phí vốn được cộng thêm.
- Để lại hệ số trên thang đo log và hiểu sai nó. Nhận xét mà không chuyển đổi nó thành hệ số nhân với exp() sẽ gây ra lỗi.
Thận trọng: Khuyến nghị của AI về mô hình "cho độ chính xác tốt nhất" không tự động là mô hình "nên được sử dụng". Minh bạch, công bằng và tuân thủ pháp luật là những tiêu chí bắt buộc cũng như tính chính xác trong việc định giá tính toán.
Tóm lại
Định giá là quá trình đo lường rủi ro với các yếu tố rủi ro và chuyển nó thành mức phí bảo hiểm hợp lý. GLM là tiêu chuẩn định giá tính toán bảo hiểm với cấu trúc nhân và có thể giải thích được; Các hệ số được chuyển đổi thành các thừa số với exp(). Các mô hình học máy như GBM có thể chính xác hơn nhưng chúng làm giảm tính minh bạch và thường được sử dụng để khám phá. Lựa chọn biến phải được bảo vệ chống lại sự phù hợp quá mức bằng cách xác nhận chéo và sự phân biệt gián tiếp (biến thay thế) phải được kiểm soát cẩn thận. AI xây dựng mô hình, viết mã và giải thích hệ số; Nhưng việc tuân thủ đạo đức pháp lý và biểu giá cuối cùng thuộc về đơn vị tính toán và tuân thủ.
Nhiệm vụ ứng dụng
Liệt kê 5-6 yếu tố rủi ro cho chuyên ngành. Yêu cầu AI cung cấp (a) thông số kỹ thuật ban đầu của GLM với các yếu tố này, (b) 2 tương tác để thử và lý do căn bản của chúng, (c) sàng lọc các biến có thể có nguy cơ bị phân biệt đối xử gián tiếp. Sau đó, đưa ra ví dụ về 3 hệ số log, yêu cầu AI chuyển nó thành hệ số nhân với exp() và chuyển sang ngôn ngữ nghiệp vụ, đồng thời xác minh các hệ số theo cách thủ công.
danh sách kiểm tra
- [ ] Mô hình của tôi có thể được giải thích không; Tôi có thể dịch tác động của từng yếu tố sang ngôn ngữ kinh doanh không?
- [ ] Tôi đã kiểm tra tình trạng trang bị quá mức bằng xác thực chéo chưa?
- [ ] Tôi đã quét để tìm sự phân biệt gián tiếp đối với các biến bị cấm và biến đại diện chưa?
- [ ] Tôi đã tách phần bù rủi ro khỏi phần bù thương mại một cách có ý thức chưa?
- [ ] Tôi có chuyển đổi các hệ số thành số nhân với exp() và diễn giải chúng một cách chính xác không?
- [ ] Tôi có đưa ra quyết định cuối cùng về thuế quan cùng với đơn vị lập pháp và tuân thủ không?