Unit 10 / 11

Bias, Etika dan Kos: Kejuruteraan AI yang Bertanggungjawab dan Mampan

Keuntungan:

  • Keupayaan untuk mengesan diskriminasi tersembunyi dengan memahami bahawa berat sebelah datang daripada data (sejarah, perwakilan, pengukuran, pengagregatan) dan menilai model berdasarkan subkumpulan
  • Keupayaan untuk memberikan penjelasan, pengawasan manusia dan akauntabiliti dalam keputusan berimpak tinggi dan ketelusan dokumen dengan kad model
  • Keupayaan untuk mengurus kos kewangan dan alam sekitar tanpa menjejaskan kualiti dengan model terkecil yang mencukupi, pemendekan segera, cache dan kelompok

Model secara teknikal mungkin berfungsi dengan sempurna tetapi masih salah — jika ia tidak adil kepada sesetengah orang, tidak dapat dijelaskan atau menghasilkan kos yang tidak mampan. Dalam unit ini, kami merangkumi tiga dimensi kejuruteraan ML yang "tidak kelihatan" tetapi menentukan: berat sebelah dan keadilan, etika dan ketelusan, kos dan kemampanan. Ini bukan perhiasan yang ditambahkan kemudian, tetapi bahagian penting dalam kualiti kejuruteraan.

Dari mana datangnya prasangka?

Bias model (layanan sistematik model terhadap kumpulan tertentu secara berbeza/tidak adil) biasanya datang daripada data, bukan model. Sumber:

  • Bias sejarah: Data mencerminkan ketidakadilan masa lalu. Jika kumpulan tertentu telah diberi kurang kredit pada masa lalu, model yang dilatih pada data tersebut akan mempelajari dan mengekalkan diskriminasi ini.
  • Bias perwakilan: Sesetengah kumpulan kurang diwakili dalam data; model berprestasi buruk untuk mereka (cth. ketepatan rendah dalam demografi sampel kecil).
  • Bias pengukuran: Label sendiri adalah berat sebelah (mis., jika takrifan "pekerja yang baik" adalah berdasarkan keputusan kenaikan pangkat yang lalu).
  • Bias pengagregatan: Oleh kerana data datang daripada saluran tertentu, ia tidak mewakili alam semesta.

Model ini bukan sahaja mempelajari kecenderungan ini; ditingkatkan dengan mengautomasikannya. Keputusan berat sebelah seseorang mempengaruhi orang lain; Keputusan model berat sebelah adalah berjuta-juta.

Awas: Jangan tersilap mengatakan "model itu neutral kerana ia hanya matematik." Model ini mempelajari dan mengautomasikan berat sebelah manusia dalam data. Berkecuali bukanlah lalai, tetapi hasil yang mesti diukur dan dipastikan.

mengukur keadilan

Untuk mengurus keadilan, perlu diukur terlebih dahulu. Untuk melakukan ini, nilaikan model berdasarkan subkumpulan: adakah metrik seperti ketepatan, ingatan semula, kadar positif palsu sama merentas kumpulan demografi yang berbeza? Beberapa konsep keadilan:

  • Keadilan kumpulan: Adakah model melayan kumpulan yang berbeza dengan betul/salah pada kadar yang sama?
  • Kesaksamaan peluang: Adakah model menangkap yang benar-benar positif secara sama rata dalam semua kumpulan (ingat sama)?

Fakta penting: definisi keadilan yang berbeza mungkin tidak dipenuhi pada masa yang sama (ini adalah akibat matematik). Takrif keadilan yang diutamakan dalam konteks ini ialah keputusan beretika dan perniagaan, bukan teknikal, dan dibuat bersama pihak berkepentingan.

Pendekatan yang lemah / Pendekatan yang kuat

Lemah: "Ketepatan keseluruhan model ialah 88%, yang adil."

Güçlü: "Ketepatan keseluruhan ialah 88%, tetapi apabila kami membahagikannya kepada subkumpulan, penarikan balik adalah 91% dalam satu kumpulan dan 67% dalam kumpulan lain — model itu secara sistematik kehilangan kumpulan itu. Kami mendokumentasikan sebabnya (kekurangan perwakilan), mengumpul data untuk kumpulan itu dan menilai semula dengan definisi sama-sama yang kami akan putuskan dengan matlamat penarikan balik yang sama.

Perbezaannya: pendekatan yang kukuh tidak berselindung di sebalik metrik umum, ia memisahkan subkumpulan dan menganggap keadilan sebagai keputusan terbuka.

Etika dan ketelusan

Prinsip teras AI yang bertanggungjawab ialah:

  • Kebolehjelasan: Bolehkah dijelaskan mengapa model membuat keputusan ini? Dalam keputusan berimpak tinggi (kredit, pengambilan pekerja, penjagaan kesihatan) seseorang mempunyai hak untuk mendapatkan penjelasan. Model yang tidak dapat dijelaskan tidak boleh digunakan dalam bidang ini atau harus disokong oleh kaedah yang boleh dijelaskan.
  • Pengawasan manusia: Keputusan berimpak tinggi tidak boleh dibuat secara automatik; Model mencadangkan, manusia mengesahkan.
  • Akauntabiliti: Harus jelas siapa yang bertanggungjawab apabila model membuat ralat. "Model memutuskan" bukan alasan.
  • Ketelusan: Pengguna harus tahu bahawa mereka berinteraksi dengan AI dan cara data mereka digunakan.

Di banyak negara dan sektor, prinsip-prinsip ini juga terkandung dalam perundangan (ketelusan, pengauditan dan kewajipan pengawasan manusia untuk sistem AI berisiko tinggi). Jurutera bertanggungjawab untuk mengetahui peraturan bidangnya.

Petua: Simpan "kad model" untuk setiap model berimpak tinggi: perkara yang model itu lakukan, data yang digunakan untuk dilatih, sejauh mana ia berfungsi dalam kumpulan mana, had yang diketahui. Dokumen ini adalah alat ketelusan dan akauntabiliti.

Kos dan kemampanan

AI tidak murah. Kos diuruskan dalam dua dimensi:

Kos kewangan:

  • Kos token (LLM): Setiap token kos permintaan dan tindak balas; Apabila volum bertambah, bil bertambah. Gesaan panjang yang tidak perlu, pemilihan model yang terlalu besar dan gelung ejen yang tidak terkawal (unit 5) meningkatkan kos.
  • Latihan dan pengehosan: Penalaan halus dan pembentangan model menanggung kos perkakasan.
  • Pengoptimuman: Jangan gunakan model besar jika model kecil sudah memadai; cache soalan lazim; memendekkan gesaan; Batch apa yang boleh diproses.

Kos alam sekitar: Latihan model besar dan inferens menggunakan tenaga yang ketara. Kemampanan menjadikan mengelakkan pengiraan yang tidak perlu (model saiz yang betul, seni bina yang cekap) sebagai tanggungjawab profesional.

Petua: Peraturan pertama pengoptimuman kos: "Apakah model terkecil yang mencukupi untuk kerja ini?" Meletakkan model paling berkuasa di mana-mana adalah seperti menukul paku dengan tukul besi — mahal dan tidak perlu.

tiga kes mini

Kes 1 - Diskriminasi tersembunyi. Model saringan perekrutan kelihatan baik secara keseluruhan. Analisis subkumpulan mendapati bahawa model itu secara sistematik menggariskan calon wanita kerana data sejarah didominasi lelaki-ia telah mempelajari kecenderungan sejarah. Model dihentikan, data seimbang dan metrik kesaksamaan dipantau. Kebenaran umum menutup diskriminasi yang tersembunyi.

Kes 2 - Penolakan tanpa sebab. Model kredit menolak permohonan, tetapi tiada siapa yang dapat menjelaskan sebabnya. Apabila pelanggan meminta penjelasan undang-undang, pasukan itu tidak dapat membalas. Model tersebut telah ditarik balik daripada digunakan dalam keputusan berimpak tinggi sehingga kaedah yang boleh dijelaskan ditambah dan justifikasi dihasilkan untuk setiap penolakan. Pengajaran: kebolehjelasan adalah penting dalam membuat keputusan berimpak tinggi.

Kes 3 - Kejutan Bill. Satu pasukan menggunakan LLM terbesar dan gesaan yang sangat panjang untuk setiap permintaan. Bil bulanan telah meningkat tanpa diduga. Analisis pasca: kebanyakan permintaan boleh diselesaikan dengan model kecil, separuh daripada gesaan adalah berlebihan dan soalan yang kerap boleh dicache. Ketiga-tiga pengoptimuman ini mengurangkan kos dengan ketara, tanpa menjejaskan kualiti. Pengajaran: model yang paling berkuasa tidak diperlukan di mana-mana.

Templat yang boleh disalin

Bantu saya menilai model ini untuk berat sebelah/keadilan. Subkumpulan (demografi/segmen) manakah yang harus saya bahagikan dan ukur? Apakah metrik (ketepatan, ingatan semula, kadar positif palsu mengikut kumpulan) yang harus saya bandingkan? Bolehkah definisi keadilan yang berbeza bercanggah, yang mana harus saya utamakan dalam konteks ini dan mengapa? Konteks model/keputusan: [penjelasan]

Hasilkan kad model draf untuk model berimpak tinggi ini. Harus termasuk: tujuan, data latihan dan tarikh, prestasi dalam subkumpulan, had yang diketahui, penggunaan yang sesuai/tidak sesuai, status kebolehjelasan, titik pengawasan manusia. Model: [penerangan]

Bantu saya mengurangkan kos pelaksanaan LLM ini, tanpa menjejaskan kualiti.Tersedia: saiz model, purata panjang gesaan, volum permintaan, adakah terdapat cache? Nilai:1) Adakah model yang lebih kecil mencukupi (untuk tugasan yang mana)?2) Bolehkah gesaan dipendekkan?3) Bolehkah permintaan yang kerap dicache?4) Adakah terdapat kerja tersedia untuk kelompok?Tuliskan anggaran impak setiap.

Hasilkan senarai semak etika/tanggungjawab untuk sistem keputusan berimpak tinggi ini.- Kebolehjelasan: bolehkah justifikasi keputusan dihasilkan?- Pengawasan manusia: adakah keputusan berimpak tinggi tertakluk kepada kelulusan?- Akauntabiliti: siapa yang bertanggungjawab sekiranya berlaku kesilapan?- Ketelusan: adakah pengguna tahu bahawa AI sedang digunakan?- Peraturan: apakah obligasi undang-undang yang terlibat: [?

Jadual sumber berat sebelah

Sumber

gejala

langkah berjaga-jaga

berat sebelah sejarah

Diskriminasi masa lalu berterusan

Audit data + metrik kesaksamaan

bias perwakilan

Ketepatan rendah dalam kumpulan sampel kecil

Analisis subkumpulan + pengimbangan

berat sebelah pengukuran

label berat sebelah

Semakan proses label

Bias pengagregatan

Alam semesta tidak diwakili

Kepelbagaian sumber

Kesilapan biasa

  • Bergantung pada metrik keseluruhan. Diskriminasi tersembunyi tidak dapat dilihat tanpa analisis subkumpulan.
  • Dengan mengandaikan "model neutral". Model mempelajari dan menguatkan bias dalam data.
  • Membiarkan keputusan berimpak tinggi kepada model yang tidak dapat dijelaskan. Risiko undang-undang dan etika.
  • Melangkaui pengawasan manusia. "Model memutuskan" bukan alasan.
  • Meletakkan model terbesar di mana-mana. Kos dan tenaga yang tidak perlu.
  • Tidak menjejaki kos. Bil membengkak senyap.

Secara ringkasnya

Model yang betul secara teknikal masih gagal jika ia tidak adil, boleh dijelaskan dan mampan. Bias kebanyakannya datang daripada data dan model membesarkannya pada skala; Ukur kesaksamaan mengikut subkumpulan dan bersetuju dengan pihak berkepentingan tentang definisi keadilan yang perlu diutamakan. Kebolehjelasan, pengawasan manusia, dan akauntabiliti adalah penting dalam keputusan berimpak tinggi; Ketelusan dokumen dengan kad model. Urus kos dan tenaga: pilih model terkecil yang mencukupi, pendekkan gesaan, gunakan cache dan kelompok. Dimensi ini adalah bahagian penting dalam kualiti kejuruteraan, bukan tambahan yang ditambahkan kemudian.

Tugasan permohonan

Bahagikan model kepada sekurang-kurangnya dua subkumpulan dan bandingkan penarikan balik dan kadar positif palsu berdasarkan kumpulan; Jika terdapat perbezaan yang ketara, tulis sebab dan langkah berjaga-jaga. Draf kad model ringkas untuk model berimpak tinggi (tujuan, data, prestasi subkumpulan, sempadan, kebolehjelasan). Kenal pasti sekurang-kurangnya dua pengoptimuman konkrit (pemangkasan minimum / segera / cache / kelompok) untuk mengurangkan kos melaksanakan LLM dan menulis anggaran kesannya.

senarai semak

  • [ ] Saya menilai model berdasarkan subkumpulan, saya tidak bergantung pada metrik umum.
  • [ ] Saya memutuskan dengan pihak berkepentingan definisi keadilan yang akan saya utamakan.
  • [ ] Keputusan berimpak tinggi boleh dijelaskan dan tertakluk kepada kelulusan manusia.
  • [ ] Saya mendokumenkan ketelusan dan sempadan dengan kad corak.
  • [ ] Saya memilih model terkecil yang mencukupi; Saya mengoptimumkan prompt/cache/batch.
  • [ ] Saya memantau kesan kos dan tenaga.