Keuntungan:
- Dapat membezakan di mana dalam aliran kerja ML (kod, data, dokumen) kecerdasan buatan menjimatkan masa dengan risiko rendah, dan keputusan seperti metrik / data / dimasukkan ke dalam pengeluaran diserahkan kepada manusia, mengikut tahap risiko tugas.
- Keupayaan untuk menerapkan disiplin yang mengesahkan setiap output AI dengan menyambungkannya kepada sumber, menjalankannya semula, mengukurnya dan menghantarnya melalui penapis kejuruteraan.
- Keupayaan untuk memperoleh tabiat untuk tidak menghantar data sulit dan peribadi mentah kepada alat luaran, menggunakan alat yang diluluskan korporat dan mengendalikan isu keselamatan hanya untuk tujuan pertahanan.
Kecerdasan Buatan dalam Kejuruteraan Pembelajaran Mesin: Peranan, Sempadan, Pengesahan dan Tanggungjawab
Jurutera pembelajaran mesin (jurutera ML: profesional perisian yang mereka bentuk, melatih dan membawa model yang belajar daripada data kepada pengeluaran) hari ini bekerja dengan alat kecerdasan buatan lain pada setiap langkah tugasnya. Pembantu pengekodan berkuat kuasa semasa menulis kod, model perbualan semasa meneroka data dan model bahasa yang besar (LLM: rangkaian saraf dengan berbilion parameter yang memahami dan menghasilkan teks) semasa menghasilkan dokumentasi. Modul ini menganggap kecerdasan buatan sebagai kedua-dua produk yang dibangunkan dan alat kerja harian seorang jurutera ML. Ia beroperasi dengan menggambarkan sempadan tanggungjawab dengan jelas tanpa mencampurkan dua peranan.
Dalam unit pertama ini, kami menjawab soalan asas: Di manakah dalam kejuruteraan ML kecerdasan buatan menjimatkan masa nyata, dan di manakah kita perlu menyerahkan keputusan kepada manusia? Jawapannya adalah di tengah-tengah disiplin kejuruteraan: orang yang membuat adalah pantas, orang yang mengesahkan adalah bertanggungjawab.
Di manakah kecerdasan buatan berguna dalam kejuruteraan ML?
Projek ML melalui kira-kira baris berikut: pengumpulan data, pembersihan data, kejuruteraan ciri (menterjemah data mentah kepada isyarat digital yang model boleh faham), latihan model, penilaian, penggunaan (pengerahan: membuka model kepada pengguna sebenar) dan pemantauan. AI membantu di setiap perhentian di talian ini, tetapi tahap kuasanya berbeza-beza.
Ganjaran tinggi, kawasan berisiko rendah: menghasilkan rangka kod, merangka fungsi transformasi data, mentafsir mesej log, menerangkan surih tindanan, meringkaskan nota percubaan, menulis dokumentasi dan README, mencadangkan kes ujian. Di sini, kesilapan kecerdasan buatan adalah murah; kerana output akan melalui ujian dan semakan.
Bidang berisiko tinggi: memutuskan data apa yang dimasukkan ke dalam latihan, mengesahkan sama ada model harus dimasukkan ke dalam pengeluaran, menilai metrik adalah "cukup baik", keputusan untuk memproses data peribadi, menutup kelemahan keselamatan sebagai "sampah". Ini menjejaskan wang, privasi, liabiliti undang-undang dan kepercayaan pengguna. Kepintaran buatan memberikan cadangan di sini; Keputusan dibuat oleh jurutera yang cekap dan pasukan yang bertanggungjawab.
Petua: Sebelum menyumber luar tugas kepada AI, tanya: "Berapa kos jika output ini salah, dan betapa mudahnya sesiapa sahaja akan dapat menangkap kesilapan itu?" Jika harga rendah dan tangkapan mudah, teruskan. Jika harganya tinggi atau sukar untuk ditangkap, gunakan AI hanya untuk draf dan anda membuat keputusan.
Disiplin pengesahan: tiga langkah
Dalam kejuruteraan ML, keluaran AI bukanlah "kerja yang telah selesai"; Ia adalah draf. Jalankan setiap output melalui tiga langkah ini:
- Sambungkannya ke sumber. Jika model menyatakan nombor, ambang atau "amalan terbaik", asaskannya pada dokumentasi rasmi, nilai sebenar dalam pangkalan kod atau metrik yang diukur. "Kesesuaian model" (halusinasi: pengeluaran maklumat bukan sebenar yang yakin oleh model bahasa) paling kerap ditangkap di sini.
- Mulakan semula dan ukur. Jalankan kod yang dijana, kira semula metrik yang dihasilkan pada set ujian anda sendiri, sahkan pertanyaan SQL yang dicadangkan pada sampel kecil. Kod yang tidak berfungsi adalah tidak bernilai, walaupun ia kelihatan bagus.
- Lulus melalui penapis kejuruteraan. Adakah output bertahan pada skala? Adakah kes tepi (data kosong, input sangat besar, medan hilang) telah dipertimbangkan? Adakah terdapat pelanggaran keselamatan dan privasi? Hanya orang yang tahu bidang boleh melakukan langkah ini.
Gesaan lemah / Gesaan kuat
Gesaan lemah: "Tuliskan saya beberapa kod latihan model."
Gesaan berkuasa: "Tulis skrip latihan untuk klasifikasi binari dengan scikit-learn. Input: data/train.parket, lajur sasaran is_churn. Terdapat ketidakseimbangan kelas (kadar positif ~8%), kendalikannya dengan class_weight. Gunakan PR-AUC (kawasan di bawah keluk ingatan ketepatan) sebagai metrik penilaian, kerana ketepatan data mengelirukan pada akhir2 untuk tidak seimbang. set cetakan kod PR-AUC."
Perbezaan: tugas segera kedua mengandungi kebenaran data, metrik yang betul, maklumat ketidakseimbangan dan keperluan kebolehulangan. Dari konteks inilah output boleh disahkan dan boleh digunakan.
Privasi dan keselamatan data: tanggungjawab pertama jurutera
Jurutera ML sering menyentuh data syarikat yang paling sensitif: rekod pelanggan, sejarah transaksi, data kesihatan atau kewangan, log sistem pengeluaran. Tiga peraturan apabila memberikan data kepada alat kecerdasan buatan:
- Jangan hantar data peribadi dan sulit mentah kepada alat luaran. Sebagai contoh, bukannya menampal e-mel pelanggan ke dalam gesaan, hantarkan skema dan sampel tiruan (sintetik). Gunakan contoh bertopeng seperti "cth: ahmet@example.com" dan bukannya data sebenar.
- Gunakan kenderaan yang diluluskan korporat. Pilih alatan yang jelas mengikut kontrak tempat data diproses, sama ada ia disimpan, sama ada ia digunakan untuk pendidikan atau tidak. Memproses data korporat dengan akaun peribadi adalah pelanggaran dalam kebanyakan syarikat.
- Dasar data minimum. Berikan konteks minimum yang diperlukan untuk menyelesaikan tugas. Bukan keseluruhan jadual, tetapi 5 lajur dan skema yang berkaitan.
Awas: Anggap bahawa teks yang anda berikan kepada model bahasa tidak boleh dibuat asal. Jangan hantar data peribadi mentah dengan berfikir "Saya akan memadamkannya kemudian"; Risiko berlaku semasa ia dihantar.
Penggunaan pertahanan dalam bidang keselamatan
Jurutera ML sering memasang sistem keselamatan: pengesanan penipuan, klasifikasi trafik berniat jahat, pengesahan. Sepanjang modul ini, kami meliputi isu keselamatan untuk tujuan pertahanan sahaja: mengesan serangan, mengeraskan sistem, menutup kelemahan. Menggunakan kecerdasan buatan untuk akses tanpa kebenaran, kebocoran data atau campur tangan tanpa kebenaran ke dalam sistem orang lain adalah menyalahi undang-undang dan bertentangan dengan etika profesional. Apabila anda menemui kelemahan, cara yang betul ialah melaporkannya secara bertanggungjawab dan membetulkannya; bukan mengeksploitasi.
tiga kes mini
Kes 1 - Masa disimpan. Seorang jurutera ML biasanya akan menghabiskan setengah hari melakukan analisis data penerokaan (EDA) bagi set data 40 lajur. Dia memberikan output skema dan df.describe() kepada kecerdasan buatan dan bertanya, "Lajur yang manakah mempunyai outlier tinggi dan kadar hilang, transformasi manakah yang anda cadangkan?" Dalam masa 20 minit, dia menerima senarai keutamaan, mengesahkan setiap item dengan kodnya sendiri. Jimat: ~3 jam, risiko ralat rendah kerana mengukur setiap tuntutan.
Kes 2 - Ralat ditangkap. "Ketepatan latihan adalah 99%, hebat," model itu berkata seorang pembantu sembang. Jurutera menggunakan langkah ketiga (penapis kejuruteraan) dan menyedari: lajur sasaran telah membocorkan atribut secara tidak sengaja (kebocoran data: model melihat maklumat yang tidak sepatutnya dilihat dalam latihan). Prestasi sebenar adalah jauh lebih rendah. Kesangsian jurutera, bukan tafsiran "hebat" AI, menyelamatkan pekerjaan itu.
Kes 3 - Mencegah pelanggaran privasi. Satu pasukan sedang menampal log ralat pengeluaran ke dalam model luaran dan berkata "betulkan ralat ini". Terdapat nombor pengenalan pelanggan dalam log. Pasukan membuat peraturan menulis skrip kecil yang menutup log terlebih dahulu (menjadikan nombor ID mereka ***) dan menghantarnya ke arah itu. Risiko pelanggaran telah hilang, kelajuan bantuan tidak berubah.
Templat yang boleh disalin
Tugasan: [apa yang perlu dilakukan, ayat tunggal]Konteks: [skema data, saiz, kekangan; TIADA data peribadi SEBENAR]Kekangan: [bahasa/perpustakaan, prestasi, kebolehulangan]Metrik: [cara mengukur kejayaan]Output yang diingini: [kod/huraian/senarai] dan sebab dalam format ini
Semak kod ini. Nilai bukan sahaja ia berfungsi, tetapi juga dari segi:1) Kes tepi (input kosong, lajur tiada, data yang sangat besar)2) Risiko kebocoran data3) Kebolehulangan (benih, versi)Cadangkan pembetulan untuk setiap masalah yang anda temui. Tandai "sahkan" di mana anda tidak pasti. Kod: [kod]
Tafsirkan hasil metrik ini, tetapi tanya dahulu: adakah metrik ini betul untuk masalah ini? Masalah: [pengkelasan seimbang/tidak seimbang, regresi, kedudukan...]Metrik dan nilai yang dilaporkan: [cth. ketepatan 0.99]Metrik yang manakah akan anda cadangkan dan mengapa, dan apakah tanda yang perlu saya cari untuk membuat saya meragui keputusan semasa?
Semak sama ada terdapat maklumat peribadi/sulit dalam data yang saya akan berikan kepada gesaan berikut. Senaraikan medan (nama, e-mel, nombor ID, telefon, alamat) yang perlu ditutup dalam teks di bawah. Teks: [teks]
Jadual peranan dan kuasa
Pencarian
Peranan kecerdasan buatan
Pemilik keputusan
Kod rangka / fungsi transformasi
penjana draf
Jurutera (ulasan)
EDA / ringkasan data
pemecut
Jurutera (mengesahkan dengan mengukur)
Tafsiran metrik
Cadangan
jurutera
Apakah data yang akan dimasukkan ke dalam latihan?
Cadangan
Pasukan + pemilik data
Letakkan model ke dalam pengeluaran
Peringatan senarai semak
Jurutera + pasukan yang bertanggungjawab
Pemprosesan data peribadi
Tiada (tidak digunakan)
Pengawal undang-undang + data
Kesilapan biasa
- Menggunakan output tanpa mengesahkannya. Kesilapan yang paling biasa dan paling mahal. Kod atau metrik yang kelihatan bagus tidak bermakna ia betul.
- Menampal data sulit mentah ke dalam alat. Setelah dihantar, ia tidak boleh dibawa balik.
- Bergantung pada metrik yang salah. Metrik yang tidak serasi seperti ketepatan dalam data tidak seimbang dan RMSE dalam masalah kedudukan mengelirukan.
- Menganggap kecerdasan buatan sebagai pembuat keputusan. Dia memberi cadangan; Tanggungjawab terletak pada penandatangan.
- Gesaan tanpa konteks. Permintaan samar-samar seperti "tulis model" menghasilkan output yang tidak dapat disahkan.
Secara ringkasnya
Kecerdasan buatan ialah kedua-dua produk yang dibangunkan oleh jurutera ML dan replikator hariannya. Nilainya paling tinggi dalam tugas berisiko rendah, mudah disahkan seperti kod-data-dokumen; Keputusan yang mempengaruhi wang, privasi dan keselamatan kekal dengan orang itu. Sambungkan setiap output ke sumber, ukur sekali lagi, lalui penapis kejuruteraan. Lindungi data sulit, gunakan kenderaan yang diluluskan, bekerja dalam keselamatan untuk tujuan pertahanan sahaja. Disiplin ini adalah asas untuk semua unit seterusnya.
Tugasan permohonan
Pilih tugas daripada projek anda sendiri (cth. menulis fungsi pembersihan data). Mula-mula tulis gesaan yang lemah, kemudian tulis gesaan yang kuat menggunakan templat dalam unit ini. Ambil kedua-dua output, gunakan pengesahan tiga langkah (pautan ke sumber, jalankan semula, penapis kejuruteraan). Perhatikan gesaan yang menjimatkan berapa minit dan berapa banyak pembetulan.
senarai semak
- [ ] Saya telah menentukan tahap risiko (rendah/tinggi) tugas saya.
- [ ] Saya tidak meletakkan sebarang data peribadi/sulit sebenar dalam gesaan; Saya menutupnya atau menggunakan sampel sintetik.
- [ ] Saya menyambungkan output kepada sumber, menjalankannya semula, menapisnya dari perspektif kejuruteraan.
- [ ] Saya menyemak bahawa saya telah memilih metrik yang betul.
- [ ] Saya membuat keputusan kritikal (memasukkannya ke dalam pengeluaran, pemprosesan data) sendiri/dengan pasukan, saya tidak menyerahkannya kepada kecerdasan buatan.
- [ ] Saya menggunakan kenderaan yang diluluskan oleh korporat.