Keuntungan:
- Keupayaan untuk mengesan nilai yang hilang, outlier, pendedahan dan masalah kualiti data dalam dasar dan merosakkan data dengan sokongan kecerdasan buatan dan menghasilkan draf pembetulan
- Kejuruteraan ciri (penerbitan pembolehubah baharu, pengelompokan, pengekodan) dan normalisasi pendedahan kepada kecerdasan buatan dengan konteks yang betul
- Fahami bahawa transformasi data yang dicadangkan oleh kecerdasan buatan harus diaudit oleh aktuari terhadap risiko kebocoran data dan berat sebelah tersembunyi.
Bahagian kerja aktuari yang paling kurang diperkatakan tetapi memakan masa adalah penyediaan data. Aktuari yang berpengalaman tahu bahawa kebanyakan masa projek pemodelan dihabiskan untuk membersihkan, menggabungkan dan membetulkan data. Tidak kira betapa elegan model itu, jika data input rosak, outputnya rosak—pendek kata, "sampah masuk, sampah keluar." Dalam unit ini, kita akan melihat masalah biasa data dasar dan tuntutan, cara untuk mengesan dan membetulkannya dengan AI, dan pendekatan kejuruteraan ciri (yang diperolehi pembolehubah baharu yang lebih bermaklumat daripada data sedia ada).
Amaran dari awal: penyediaan data adalah langkah yang kelihatan teknikal dan tidak bersalah, tetapi di sinilah ralat yang paling berbahaya bersembunyi. Normalisasi pendedahan yang salah, kebocoran data tersembunyi atau kecenderungan yang diperkenalkan tanpa disedari secara senyap merosakkan semua model berikutnya. AI sangat mempercepatkan langkah ini, tetapi jika dibiarkan tidak terkawal, ia juga meningkatkan risiko.
Masalah biasa data aktuari
Data dasar dan tuntutan hampir tidak pernah sampai dengan bersih. Masalah yang paling biasa ialah: Nilai hilang: sesetengah polisi mempunyai umur kenderaan kosong, pekerjaan atau wilayah. Membuta tuli mengisi ini dengan purata boleh mewujudkan berat sebelah; kekurangan itu sendiri kadangkala membawa maklumat (yang hilang adalah kumpulan yang berbeza). Outlier: rekod yang tidak logik seperti premium negatif, polisi yang diinsuranskan berusia 200 tahun, sifar pendedahan. Ia mesti dibezakan sama ada ini adalah ralat data atau kes kelebihan sebenar. Ketidakkonsistenan: ejaan berbeza bagi rantau yang sama ("Istanbul", "Istanbul", "34"), kekeliruan format tarikh. Entri pendua: kemasukan kerosakan yang sama dua kali.
Tetapi isu paling kritikal khusus untuk aktuari ialah pendedahan. Jika polisi bermula pertengahan tahun, ia memberikan pendedahan pecahan (mis. 0.5 tahun) untuk tahun itu, bukan "tahun dasar" penuh. Kekerapan dan kadar kerosakan hendaklah sentiasa dinormalkan kepada pendedahan; sebaliknya polisi jangka pendek kelihatan berisiko tinggi. AI boleh mengodkan pengiraan pendedahan, tetapi anda mesti memberikan definisi dan peraturan perniagaan.
Jadual berikut meringkaskan masalah biasa dan pendekatan yang betul:
masalah
pendekatan yang salah
pendekatan yang betul
nilai hilang
Isi semua dengan purata
Menganalisis kekurangan; kadangkala buka kategori berasingan
terpencil
Auto padam
Bezakan antara ralat data dan petunjuk sebenar
pendedahan
Kira semua polisi selama 1 tahun
Kira pendedahan pecahan
Ketidakkonsistenan kategori
abaikan
Padankan dengan kamus standard
kerosakan berulang
jangan perasan
Nyahpendua dengan medan utama
Kejuruteraan ciri: memperoleh pengetahuan daripada data
Kejuruteraan ciri ialah seni memperoleh pembolehubah baharu yang lebih berguna kepada model daripada pembolehubah mentah sedia ada. Contoh: "umur" dari tarikh lahir, "kumpulan umur" (binning) dari umur, "segmen risiko" daripada model pembuatan kenderaan, "anggaran perbatuan tahunan" daripada gabungan alamat-dasar. Ciri yang baik membawa isyarat yang lebih kuat daripada data mentah dan meningkatkan ketepatan dan kebolehtafsiran model.
Tiga teknik sering digunakan dalam kerja aktuari. Mengikat: memisahkan pembolehubah berterusan (umur) kepada kumpulan yang bermakna; ini menangkap perhubungan bukan linear dan menjadikan tarif boleh dibaca. Pengekodan: menukar pembolehubah kategori (rantau) ke dalam format berangka yang sesuai untuk model; Pengekodan berasaskan risiko (mewakili setiap kategori dengan kadar kerosakannya sendiri) adalah perkara biasa tetapi harus dilakukan dengan berhati-hati. Normalisasi: menjadikan segala-galanya setanding dengan membahagikannya dengan pendedahannya. AI cepat menjana kod untuk transformasi ini; Tetapi anda mesti meluluskan logik setiap transformasi.
Petua: Pengekodan sasaran berkuasa tetapi terdedah kepada kebocoran data: model "menipu" jika anda memasukkan kerosakan baris sendiri semasa mengira purata kerosakan kategori. Sentiasa lakukan ini dalam data latihan, dalam corak pengesahan silang.
Bahaya paling berbahaya: kebocoran data dan berat sebelah tersirat
Kebocoran data ialah pengenalan maklumat ke dalam model yang sebenarnya tidak wujud pada masa ramalan. Contoh klasik: memperkenalkan pembolehubah yang mengandungi hasil, seperti "tuntutan dibayar," ke dalam model yang meramalkan jumlah tuntutan. Model ini kelihatan sempurna dalam data ujian tetapi tidak berguna dalam dunia nyata kerana maklumat itu tidak tersedia pada masa ramalan. Kebocoran selalunya tersembunyi dan hanya ditangkap oleh penaakulan aktuari yang teliti — AI biasanya tidak perasan, malah kadangkala memuji pembolehubah bocor sebagai "peramal yang sangat berkuasa."
Bahaya berbahaya kedua ialah berat sebelah tersirat. Jika data sejarah secara tidak adil mewakili kumpulan tertentu (contohnya, kawasan telah dinafikan secara sejarah terlalu banyak dasar), ciri yang diperoleh daripada data tersebut membawa kecenderungan tersebut dan model itu mereplikasinya ke masa hadapan. Fasa kejuruteraan ciri ialah saat yang paling kritikal apabila bias ini boleh dikenali dan diperbetulkan.
Awas: Sebelum anda bergembira apabila pembolehubah "meningkatkan kuasa ramalan dengan sangat baik," tanya: adakah pembolehubah ini sebenarnya hadir pada masa ramalan, atau adakah ia melibatkan masa depan? Keputusan yang kelihatan terlalu baik selalunya merupakan tanda kebocoran.
Cara menggunakan AI dalam penyediaan data
1) Pemeriksaan kualiti data:
Peranan anda: pembantu kualiti data. Anda mempunyai hasil polisi aktuari. Lajur: policy_id, start_date, end_date, age, region, vehicle_age, premium, claim_count, claim_amount.Beri saya senarai semak dan lakaran kod Python (panda):- Kira nilai yang hilang mengikut lajur.- Tandakan nilai yang tidak munasabah (premium negatif, umur<16 atau >100, akhir<permulaan tahun) BUKAN hitung. Hanya laporkan supaya saya boleh membuat keputusan.
2) Terbitan ciri:
Saya ingin mendapatkan ciri baharu daripada data trafik saya. Tersedia: umur, umur_kenderaan, wilayah, km tahunan, jenis_penggunaan.- Kumpulan umur dan km (binning) manakah yang anda cadangkan, mengapa?- Bagaimanakah saya boleh melakukan pengekodan berasaskan risiko untuk 'wilayah' tanpa kebocoran data?- Cadangkan 3 ciri baharu yang patut dicuba dan tulis justifikasi aktuari untuk setiap satu. Saya akan membuat keputusan.
3) Pemeriksaan kebocoran:
Model saya meramalkan KEMUNGKINAN kerosakan dengan pembolehubah berikut: umur, wilayah, umur_kenderaan, PAID_CLAIM_FLAG, SETTLEMENT_DAYS. Antara pembolehubah ini yang manakah menimbulkan risiko kebocoran data? Untuk setiap satu, nilai sama ada ia akan tersedia pada masa ramalan. Senaraikan yang mencurigakan dan mengapa.
4) Normalisasi pendedahan:
Beberapa polisi saya bermula pertengahan tahun. Terangkan dan kodkan penormalan pendedahan untuk mengira kekerapan dengan betul: kekerapan = jumlah_kiraan_tuntutan / jumlah pendedahan (tahun dasar). Tunjukkan dengan contoh cara mengira pendedahan polisi yang bermula pada pertengahan tahun.
Gesaan lemah / Gesaan kuat
Gesaan yang lemah:
Bersihkan data dan sediakan untuk model.
AI tidak tahu lajur mana, peraturan perniagaan, definisi pendedahan; Ia boleh memadam dan mengisi dan merosakkan data secara membuta tuli.
Gesaan kuat:
Peranan anda: pembantu penyediaan data aktuari. Kamus data: policy_id (identity), mula/tarikh_akhir (tempoh polisi), umur (dijangka 16-90), premium (mesti >0), claim_count (>=0), claim_amount (>=0).Tugas:1) Tulis peraturan kemunasabahan untuk setiap lajur dan LAPORAN pelanggaran (pemadaman) yang berbeza (pemadaman).2) Berikan pendedahan kod yang berbeza kepada pecahan3. (padam). / kategori purata / berasingan) hadir dengan tambah-tolak; Serahkan keputusan kepada saya.4) Beri amaran jika terdapat ruangan yang mungkin menimbulkan risiko kebocoran. Pemadaman automatik mana-mana rekod; Saya akan meluluskan setiap keputusan.
tiga kes mini
Kes 1 — Ralat pendedahan. Dalam satu portfolio, polisi perjalanan jangka pendek (3 bulan) dikira sebagai tahun penuh, jadi kekerapan muncul empat kali lebih rendah daripada yang sebenarnya; Harga jatuh secara tidak betul. Apabila aktuari mengira pendedahan sebagai pecahan (0.25 tahun polisi), kekerapan sebenar telah didedahkan dan tarif telah diperbetulkan. AI menjana kod pendedahan pecahan; Aktuari memberi definisi.
Kes 2 — Kebocoran terpendam. Apabila pembantu menambah pembolehubah "masa penutupan fail" pada model kebarangkalian kerosakan, ketepatan meningkat secara mendadak. Kegembiraan itu tidak lama: pembolehubah ini hanya boleh diketahui selepas kerosakan berlaku, bermakna ia tidak tersedia pada masa ramalan. Apabila pembolehubah bocor dialih keluar, model menurun ke tahap realistik. Dia memuji pembolehubah AI sebagai "peramal yang kuat"; Penghakiman aktuari menangkap perangkap.
Kes 3 - Replikasi bias. Satu syarikat memperoleh corak "penolakan permohonan" daripada data sejarah dan memasukkannya ke dalam model baharu. Analisis menunjukkan bahawa penolakan masa lalu tertumpu secara tidak seimbang di kawasan kejiranan tertentu, bermakna terdapat kecenderungan sejarah. Ciri ini telah dialih keluar daripada model dan digantikan dengan penunjuk risiko yang lebih neutral. AI menghasilkan analisis yang mengukur pertindihan corak dengan kejiranan; Keputusan etika telah dibuat oleh aktuari dan unit pematuhan.
Kesilapan biasa
- Mengisi nilai yang hilang dengan min tanpa berfikir. Kekurangan itu sendiri mungkin pengetahuan; Mengisinya secara membuta tuli menimbulkan prasangka.
- Padamkan outlier secara automatik. Sesetengahnya adalah kes tepi yang benar; Memadam data tanpa memisahkannya daripada ralat memusnahkan maklumat.
- Tidak menormalkan pendedahan. Mengira polisi pendek sebagai tahun penuh memesongkan kekerapan dan memesongkan harga.
- Tidak perasan kebocoran data. Keputusan yang terlalu baik selalunya merupakan tanda pembolehubah yang melibatkan masa depan; Tanya sama ada setiap pembolehubah hadir pada masa ramalan.
- Membawa bias tersirat ke masa hadapan. Ketidakadilan dalam data sejarah boleh bocor ke dalam ciri terbitan; Semak ia pada peringkat ciri.
Secara ringkasnya
Pemodelan aktuari sebahagian besarnya adalah mengenai penyediaan data; Jika input rosak, output juga rosak. Masalah biasa ialah kehilangan nilai, outlier, tidak konsisten dan pertindihan; Isu aktuari yang kritikal ialah normalisasi pendedahan. Kejuruteraan ciri — pengumpulan, pengekodan, normalisasi — memperoleh isyarat yang lebih kuat daripada data. Bahaya yang paling berbahaya ialah kebocoran data dan berat sebelah tersirat; kedua-duanya ditangkap hanya oleh penaakulan aktuari. AI sangat mempercepatkan langkah ini: pengimbasan menjana kod dan cadangan. Tetapi jangan padamkan sebarang rekod secara automatik, biarkan manusia menyemak kebocoran dan berat sebelah, dan meluluskan setiap penukaran.
Tugasan permohonan
Sediakan kamus data dasar tanpa nama kecil (5-7 lajur, julat munasabah setiap satu). Minta AI untuk (a) peraturan kemunasabahan dan kod laporan pelanggaran untuk setiap lajur, (b) pengiraan pendedahan pecahan, (c) cadangan untuk 3 ciri baharu untuk dicuba. Kemudian tambahkan pembolehubah "perangkap kebocoran" yang disengajakan pada senarai (cth. "pampasan dibayar") dan uji sama ada AI menangkapnya sebagai kebocoran.
senarai semak
- [ ] Adakah saya telah menganalisis mengapa sebelum memadam hilang dan terpencil?
- [ ] Adakah saya telah memfraksinasi dan menormalkan pendedahan dengan betul?
- [ ] Adakah saya telah menulis justifikasi aktuari untuk setiap ciri yang baru diterbitkan?
- [ ] Pernahkah saya mempersoalkan sama ada setiap pembolehubah sebenarnya ada (kebocoran) pada masa ramalan?
- [ ] Adakah saya telah mengimbas bias tersirat dalam ciri terbitan?
- [ ] Adakah saya tidak mempunyai AI secara automatik memadam sebarang rekod dan meluluskan setiap keputusan sendiri?