Keuntungan:
- Keupayaan untuk membezakan aliran kerja enam peringkat sains data (takrifan masalah, pengumpulan, pembersihan, penemuan, pemodelan, komunikasi) dan kuasa di mana kecerdasan buatan berfungsi pada setiap peringkat, mengikut tahap risiko tugas
- Keupayaan untuk menerapkan disiplin yang mengesahkan setiap keluaran kecerdasan buatan dengan menyambungkannya kepada sumber, menjalankan dan membandingkannya, dan meneruskannya melalui penapisan pakar.
- Keupayaan untuk menukar prinsip kebolehulangan dan privasi (menulis kepada kod, anonimisasi) kepada tabiat analisis dari hari pertama
Data mentah, kucar-kacir dan sering "berbohong" mendarat di meja saintis data setiap hari. Dalam jadual jualan, lajur tarikh ditulis dalam tiga format berbeza; nombor pelanggan kosong dalam beberapa baris; Nama lajur ialah "pendapatan", tetapi ia mengandungi nilai TL dan USD. Tugas sains data adalah untuk membuat keputusan yang boleh dipercayai daripada kekacauan ini: mengumpul data, membersihkannya, menerokanya, membina model, mengesahkan hasilnya dan mengubahnya menjadi cerita. Kecerdasan buatan (AI, atau AI untuk sistem komputer pendek yang boleh menjana teks dan kod, mengecam corak, meringkaskan dan membuat ramalan) boleh menyentuh setiap pautan dalam rantaian ini: menulis kod pembersihan dalam beberapa minit, mengesyorkan graf untuk analisis penerokaan, mentafsir metrik model, membetulkan pertanyaan SQL. Tetapi AI yang sama juga boleh memberi anda fabrikasi yang yakin seperti "korelasi 0.72" untuk data yang tidak pernah dilihatnya.
Unit pertama ini bukan pengenalan perpustakaan. Tujuannya adalah untuk menjelaskan tempat untuk meletakkan AI dalam aliran kerja sains data dan tempat untuk tidak meletakkannya. Mari kita susun prinsip asas dari awal: AI ialah pembantu, bukan saintis data. Keputusan mengenai data yang hendak dikumpul, metrik yang perlu diputuskan, sama ada untuk meletakkan model dalam pengeluaran, dan tempat untuk melukis sempadan etika terletak pada pakar yang kompeten. Output AI yang tidak disahkan adalah berisiko, begitu juga dengan laporan analisis yang tidak ditandatangani.
Aliran kerja sains data: peta hujung ke hujung
Untuk memahami projek data, adalah berguna untuk memecahkannya kepada enam fasa. Keseluruhan modul ini mengikuti peta ini.
1. Definisi masalah: Apakah yang kita ukur, mengapa, untuk menyokong keputusan yang mana? Fasa ini tidak diwakilkan kepada AI; Ia adalah orang yang menentukan pekerjaan.
2. Pengumpulan data: Mengenal pasti sumber, mengekstrak data, persampelan. (Unit 2)
3. Pembersihan dan prapemprosesan data: Nilai tiada, outlier, penukaran jenis. (Unit 3)
4. Analisis data penerokaan (EDA - Analisis Data Penerokaan, peringkat mengenali pengedaran dan hubungan data "mengikut mata"): (Unit 4)
5. Kejuruteraan dan pemodelan ciri: Penjanaan pembolehubah, pemilihan algoritma, latihan, penilaian. (Unit 5, 6, 7)
6. Komunikasi dan pengeluaran: Visualisasi, cerita, MLOps (disiplin mengambil model secara langsung dan memantaunya). (Unit 8, 11)
AI beroperasi dengan kuasa yang berbeza dalam setiap enam peringkat ini. Jadual di bawah meringkaskan pengagihan kuasa ini; Ini adalah jadual tunggal yang paling penting dalam modul.
pentas
Peranan AI
Tahap risiko
Siapa yang meluluskan
Definisi masalah
rakan kongsi sumbang saran
rendah
Ahli sains data + pemegang kepentingan
Tulis kod pembersihan
Penjana lakaran kod
sederhana
Ahli sains data (membaca kod)
Komen EDA
penanda corak
sederhana
saintis data
Penjanaan ciri
Penjana idea dan kod
sederhana tinggi
Kawalan kebocoran adalah satu kemestian
Pemilihan model/metrik
perunding
tinggi
saintis data
Keputusan untuk dimasukkan ke dalam pengeluaran
input tambahan
sangat tinggi
Pasukan + pemilik perniagaan
Kelulusan etika/privasi
perangsang
sangat tinggi
manusia, sentiasa
Perlu diingat satu ayat daripada carta ini: apabila kepentingan meningkat, peranan AI mengecut dan kelulusan manusia bertambah.
Mengapa pengesahan menjadi nadi perniagaan ini
Model bahasa AI kelihatan pasti, tetapi mereka mungkin tidak pasti. Dalam bahasa teknikal, ini dipanggil halusinasi: ia adalah rekaan model maklumat yang tidak wujud dalam ayat yang lancar seolah-olah ia benar. Dalam sains data, ini terdapat dalam tiga bentuk. Yang pertama ialah nombor palsu: jika anda bertanya kepada model "apakah purata jumlah pesanan" tanpa memberikan sebarang data, ia akan memberitahu anda nombor dengan yakin, walaupun ia tidak pernah melihat data anda. Yang kedua ialah fungsi yang tidak wujud: model mungkin mencadangkan fungsi yang tidak wujud sama sekali, seperti pandas.read_excel_fast(). Ketiga, tafsiran statistik yang salah: model boleh mengulangi ralat statistik klasik dengan lancar seperti "nilai p ialah 0.04, jadi hipotesis adalah 96% betul".
Disiplin pengesahan terdiri daripada tiga langkah:
- Pautan ke sumber: Setiap nombor, kadar dan aliran harus datang daripada data anda, bukan memori AI. Gunakan AI untuk kod yang beroperasi pada data, bukan untuk ia mengingati data.
- Jalankan dan bandingkan: Jalankan setiap keping kod yang diberikan oleh AI sendiri; Bandingkan setiap metrik yang dihasilkannya kepada garis dasar bebas.
- Penapis pakar: Uji sendiri sama ada output bercanggah dengan statistik dan pengetahuan domain.
Awas: Meletakkan analisis yang ditulis oleh AI ke dalam pembentangan tanpa menjalankan dan membacanya adalah seperti membentangkan laporan yang tidak ditandatangani. Hanya kerana kod berfungsi tidak bermakna ia betul; Kod yang menjumlahkan lajur yang salah juga berfungsi tanpa ralat.
Kebolehulangan: dapat menghasilkan hasil yang sama dua kali
Prinsip senyap tetapi kritikal dalam sains data ialah kebolehulangan: apabila anda menjalankan analisis semula enam bulan kemudian atau pada komputer lain, anda mendapat hasil yang sama. Risiko ini meningkat apabila bekerja dengan AI, kerana apabila anda memberitahu AI untuk "membuat graf ini" dan memainkannya secara manual, langkah itu hilang. Peraturan: setiap langkah mesti didaftarkan dalam kod dan kawalan versi (seperti Git); Dalam langkah-langkah yang melibatkan rawak, benih rawak (nilai awal penjana nombor rawak; jika tetap, hasilnya boleh diulang) harus diperbaiki. Kami akan mendalami topik ini dalam Unit 10; Buat masa ini, amalkan tabiat ini: "Jangan klik dengan tangan, tulis dalam kod."
tiga kes mini
Kes 1 — Pecutan selamat. Seorang penganalisis e-dagang biasanya akan menghabiskan setengah hari untuk mengosongkan jadual pesanan sebanyak 240 ribu baris. Dia memberikan nama lajur dan 5 baris pertama (tanpa data peribadi) kepada AI dan meminta kod pembersihan panda. AI menghasilkan draf dalam 8 saat; Penganalisis membaca kod baris demi baris, membetulkan ralat dalam penghuraian tarikh dan menjalankannya. Tempoh: 35 minit dan bukannya 4 jam. AI menyediakan kod, pengesahan kekal dengan manusia.
Kes 2 — Perangkap metrik yang dibuat. Seorang pelatih bertanya kepada AI, "Seberapa tepat hutan rawak pada data ini?" tanpa melatih model sama sekali. "Kira-kira 89%," kata AI. Pelatih memasukkan ini ke dalam pembentangan; Apabila model sebenar dilatih, ketepatannya ialah 71%. Kesilapan: Menunggu metrik tanpa memberikan data dan model kepada AI.
Kes 3 — Kebocoran senyap. Satu pasukan melaksanakan idea yang dicadangkan AI untuk "menambah min pembolehubah sasaran sebagai ciri" tanpa mempersoalkannya. Model tersebut menunjukkan prestasi 98% pada set ujian tetapi ranap dalam pengeluaran kerana ciri tersebut membocorkan maklumat masa hadapan (kebocoran data, Unit 10). Kesilapan: Tidak menapis cadangan AI secara statistik.
Gesaan lemah / Gesaan kuat
Gesaan yang lemah:
Analisis data jualan ini dan beritahu saya purata hasil.
Tuntutan ini adalah cacat: AI tidak diberikan data, jadi "pendapatan purata" hanya boleh dibuat. Lajur, mahupun tempoh, mahupun mata wang tidak jelas.
Gesaan kuat:
Peranan anda: pembantu membantu saintis data. Saya mempunyai DataFrame panda: df. Lajur:- tarikh_pesanan (teks, dalam format "2024-03-01")- amount_tl (perpuluhan, NaN dalam beberapa baris)- id_pelanggan (integer)Tugas: (1) tulis kod panda yang mengira jumlah purata,(2) terangkan cara ia mengendalikan nilai NaN,(3) senaraikan andaian yang dibuat oleh kod tersebut. Jangan reka kandungan data; hanya menjana kod dan saya akan menjalankan dan mengesahkan hasilnya.
Dalam permintaan ini, skema, jangkaan dan "larangan rekaan" adalah jelas. Anda masih menjalankan dan mengesahkan output sendiri.
Permulaan etika dan privasi
Sains data sering berfungsi dengan data peribadi: pelanggan, pesakit, rekod pekerja. KVKK (Undang-undang Perlindungan Data Peribadi) di Türkiye dan GDPR di Eropah melindungi data ini. Menampal nama sebenar, ID, e-mel atau alamat anda ke dalam alat AI awam adalah satu pelanggaran. Peraturan: awanamakan data sebelum berkongsi, hanya sediakan skema (nama lajur, jenis) dan baris contoh tiruan jika perlu. Kami akan mendalami topik etika dalam Unit 11; Mari kita letakkan prinsip dari awal: Untuk memahami data, berkongsi strukturnya, bukan kandungannya, selalunya cukup.
Kesilapan biasa
- Menunggu nombor/metrik tanpa memberikan data kepada AI. Model tidak boleh mengakses data; Nombor yang dia beri adalah palsu. Sentiasa pastikan hasilnya dikira dan dijalankan.
- Berfikir bahawa kod kerja adalah betul. Kod yang memanipulasi lajur yang salah juga berjalan tanpa ralat; Jangan percaya tanpa membaca logik.
- Menampal data peribadi sebenar ke dalam alat terbuka. Nama, nombor ID, e-mel tidak pernah dikongsi; Gambar rajah sudah memadai.
- Melakukan langkah secara manual dan tidak menulisnya ke dalam kod. Analisis yang tidak boleh dihasilkan semula tidak boleh dipercayai.
- Menerima tafsiran statistik AI tanpa persoalan. AI boleh mengulangi kesilapan klasik dalam konsep seperti nilai-p dan korelasi.
Petua: Sertakan "garis peraturan" pendek dalam setiap sesi AI anda: "Jangan buat kandungan data; hanya jana kod/analisis dan saya akan jalankan dan sahkan hasilnya; nyatakan 'tidak pasti' di mana anda tidak pasti." Ayat tunggal ini mengurangkan risiko halusinasi dengan ketara.
Secara ringkasnya
AI ialah pembantu yang berkuasa dalam sains data: ia mempercepatkan kod pembersihan, tafsiran EDA, pengesyoran model dan visualisasi. Tetapi definisi masalah, pemilihan metrik, keputusan pengeluaran dan sempadan etika adalah milik manusia. Aliran kerja mempunyai enam peringkat, dan peranan AI menjadi lebih kecil apabila risiko meningkat. Tiga tabiat adalah asas kepada segala-galanya: pautan sumber (pengesahan), kebolehulangan (pengekodan), dan anonimisasi (kerahsiaan). Sebaik sahaja anda menghayati ketiga-tiga ini, setiap alat dalam modul yang lain menjadi pemecut yang selamat untuk anda.
Tugasan permohonan
Hanya buat skema jadual kecil yang anda miliki (atau satu hipotesis): nama lajur, jenis dan 2-3 baris contoh tiruan (tanpa data peribadi sebenar). Minta AI untuk kod statistik ringkasan menggunakan templat "Powerful prompt" di atas. Jalankan kod, bandingkan output dengan nilai manual, semak sebarang andaian palsu, dan catatkan penemuan anda dalam 5 titik peluru.
senarai semak
- [ ] Adakah saya hanya memberikan AI skema dan sampel palsu dan bukannya data peribadi sebenar?
- [ ] Adakah saya membaca dan menjalankan kod yang dihasilkannya baris demi baris?
- [ ] Adakah saya telah mengesahkan secara bebas setiap nombor dalam output?
- [ ] Adakah saya telah menulis setiap langkah analisis ke dalam kod dan menjadikannya boleh diulang?
- [ ] Adakah saya telah menentukan tahap risiko misi dan menyerahkan keputusan muktamad kepada manusia?