Keuntungan:
- Mampu membezakan di mana dalam aliran kerja empirikal (pembersihan data, kod, visualisasi, tafsiran draf) kecerdasan buatan menjimatkan masa nyata dan di mana keputusan seperti pemilihan model, tuntutan kausalitas dan keputusan penerbitan diserahkan kepada pakar, mengikut tahap risiko tugas
- Keupayaan untuk menerapkan disiplin yang mengesahkan setiap keluaran kecerdasan buatan (nombor, pekali, kod, ulasan) melalui langkah pengiraan semula, memaut kepada sumber dan penapisan statistik.
- Keupayaan untuk memproses data mikro dan set data sulit/berlesen dengan selamat dalam skop KVKK/GDPR dan perjanjian penggunaan data dan memperoleh tabiat memilih alat yang sesuai.
Soalan yang sama berulang setiap hari di meja pakar ekonomi atau statistik gunaan: Adakah set data ini boleh dipercayai; Apa yang perlu dilakukan dengan nilai yang hilang ini? Apakah yang sebenarnya dikatakan oleh pekali regresi ini? Adakah hubungan ini bersebab atau hanya korelasi? Oleh kerana nilai-p ini penting, bolehkah saya menulisnya dalam artikel atau ringkasan dasar? Beberapa soalan ini adalah berulang, intensif kod dan memakan masa: membersihkan data, memplot graf yang sama sepuluh kali, menyahpepijat kod R atau Python, menyusun keputusan ke dalam jadual. Yang lain secara langsung menentukan kesahihan penemuan, kejujuran penerbitan, atau ketepatan keputusan dasar.
Kecerdasan buatan (pendek kata AI, AI - sistem komputer yang boleh menghasilkan teks dan kod seperti manusia, mengenali corak, meringkaskan data dan menulis komen; bentuk yang paling banyak digunakan hari ini ialah model bahasa yang besar, iaitu sistem yang dilatih pada teks besar dan membina ayat dengan meramal perkataan seterusnya) terletak betul-betul di tengah-tengah jadual ini. Apabila digunakan dengan betul, ia mengurangkan jam kod pembersihan data kepada minit, mengingatkan anda tentang sintaks ujian statistik yang kompleks, atau mendraf tafsiran pekali. Apabila digunakan secara salah, ia memaparkan nombor yang kelihatan pasti tetapi direka sepenuhnya, kepentingan palsu atau hubungan bukan sebab sebagai "penemuan".
Unit pertama ini bukan pengenalan perisian. Tujuannya adalah untuk menjelaskan tempat untuk meletakkan AI dalam aliran kerja empirikal anda dan tempat untuk tidak meletakkannya. Ekonometrik ialah medan "kritikal kaedah" dan secara tidak langsung "kritikal keputusan": pekali model yang anda bina boleh menjadi input kepada keputusan kadar faedah bank pusat, perubahan dasar pengawal selia atau pelaburan berjuta-juta dolar firma. Mari kita susun prinsip asas dari awal: Kecerdasan buatan ialah pembantu analisis, bukan penyelidik. Tanggungjawab dan kelulusan akhir pemilihan model, strategi pengenalan, penegasan kausaliti, penerbitan dan keputusan dasar terletak pada pakar yang kompeten.
Lapisan aliran kerja empirikal dan tempat AI
Adalah berguna untuk membahagikan kajian empirikal kepada tiga lapisan. Lapisan pelaksanaan ialah kerja teknikal sehari-hari: kod pembersihan data, lukisan graf, pemformatan jadual, penyahpepijatan sintaks. Lapisan kaedah ialah keputusan analitikal: model mana, strategi pengenalpastian mana, ujian mana, semakan andaian mana. Lapisan tafsiran dan keputusan ialah maksud penemuan: apa yang dikatakan oleh pekali, adakah ia bersebab, apakah maksudnya untuk dasar, sekiranya ia diterbitkan. AI menyentuh ketiga-tiga lapisan, tetapi dengan kuasa yang berbeza dalam setiap lapisan. Pada lapisan pelaksanaan, AI dengan cepat mendraf dan menjana kod; Pada lapisan tafsiran dan keputusan, hanya input diberikan dan pakar membuat keputusan.
Mari kita tentukan beberapa istilah asas dari awal. Ekonometrik ialah cabang yang menganalisis data ekonomi dan sosial dengan kaedah statistik dan mengukur hubungan. Regresi ialah kaedah yang memodelkan secara numerik hubungan pembolehubah hasil (pembolehubah bersandar) dengan satu atau lebih pembolehubah penjelasan (pembolehubah bebas). Pekali ialah nombor yang menunjukkan berapa banyak unit perubahan secara purata perubahan satu unit dalam pembolehubah penjelasan dikaitkan dengan pembolehubah hasil. Nilai-p ialah kebarangkalian bahawa hasil yang diperhatikan (atau hasil yang lebih ekstrem) akan berlaku secara kebetulan apabila tiada kesan sebenarnya wujud. Kami akan menerangkan konsep ini satu persatu dalam unit berikut; Buat masa ini, ketahui perkara ini: Dalam semua ini, AI memberi anda pelan tindakan, kod dan penjelasan, tetapi ia tidak membuat keputusan saintifik.
Jadual berikut meringkaskan peranan dan tahap risiko AI mengikut misi:
Pencarian
Peranan AI
Tahap risiko
Siapa yang meluluskan
Menulis kod sanitasi data
penjana kod
rendah
Penganalisis sendiri (dengan ujian kod)
Draf carta/jadual
penjana lakaran
rendah
penganalisis
Peringatan sintaks ujian/model
Pembantu rujukan
rendah-sederhana
penganalisis
Tafsiran pekali draf
penulis draf
sederhana
ahli ekonomi
Pemilihan strategi model/pengenalpastian
input tambahan
tinggi
pengkaji pakar
Tuntutan penyebab
Hanya draf, bukan kata akhir
sangat tinggi
Pakar + ulasan rakan sebaya
Keputusan penerbitan/dasar
input sahaja
sangat tinggi
Penyiasat/institusi yang bertanggungjawab
Perlu diingat satu baris dalam jadual ini: apabila risiko meningkat, peranan AI mengecut dan kelulusan pakar berkembang.
Mengapa "pengesahan" menjadi nadi perniagaan ini
Model bahasa kelihatan yakin dengan jawapan mereka, tetapi mereka mungkin tidak pasti. Dalam bahasa teknikal, ini dipanggil halusinasi: ia adalah rekaan model maklumat yang tidak wujud dalam ayat yang lancar, seolah-olah ia benar. Bagi ahli ekonomi, ini adalah perangkap maut. Model ini boleh memberi anda nombor yang tepat seperti "Korelasi antara pengangguran dan inflasi di Türkiye antara 2015-2020 ialah 0.62"; Walau bagaimanapun, dia tidak pernah melihat data anda dan nombor ini dibuat sepenuhnya. Atau ia mungkin berkata, "Nilai p ujian putih ialah 0.03"; sedangkan ia tidak menjalankan sebarang ujian. Ia boleh memanggil fungsi R dengan hujah yang sebenarnya tidak wujud. Dia menyanyikan ketiga-tiganya dengan kefasihan yang sama; Satu-satunya perkara yang memisahkan yang betul dari yang salah ialah pengetahuan anda dan tabiat anda untuk mengesahkan.
Disiplin pengesahan terdiri daripada tiga langkah:
- Kira semula / jalankan dalam persekitaran anda sendiri: Kira setiap nombor, nisbah, keputusan ujian dan pekali yang diberikan oleh AI dalam R/Python dengan data anda sendiri, bukan dari ingatan AI. Gunakan AI untuk menulis kod, bukan untuk mengingati hasilnya. Jalankan kod, anda menghasilkan output.
- Pautan ke sumber: Bergantung pada buku teks, artikel kaedah dan dokumen rasmi untuk peraturan kaedah, formula dan definisi. Sahkan kenyataan AI "andaian ujian ini adalah" dengan sumber yang boleh dipercayai.
- Penapis statistik: Uji dengan mata pakar sama ada output bercanggah dengan logik statistik (andaian, sampel, saiz kesan, ketidakpastian). Tolak keputusan "bermakna tetapi tidak masuk akal".
Awas: Meletakkan pekali, ujian atau tafsiran yang dijana AI dalam artikel, tesis atau nota dasar tanpa mengesahkannya adalah seperti menerbitkan penemuan yang belum disemak. Hanya kerana output fasih adalah tidak benar; Hanya kerana bilangannya kelihatan pasti, ia tidak benar.
Privasi: data mikro dan data berlesen dilindungi secara peribadi
Microdata (rekod tunggal di peringkat individu, isi rumah, firma atau pesakit) sering digunakan dalam ekonometrik. Kebanyakan data ini adalah data peribadi dan dilindungi di bawah KVKK (Undang-undang Perlindungan Data Peribadi) di Türkiye dan GDPR di Eropah. Selain itu, TurkStat, bank pusat, penyedia data panel dan sumber komersial sering menyediakan data dengan perjanjian penggunaan data; Perjanjian ini melarang pemindahan data kepada pihak ketiga. Menampal jadual yang mengandungi maklumat identiti, pendapatan, kesihatan atau rahsia syarikat ke dalam alat sembang AI awam ialah pelanggaran KVKK/GDPR dan pelanggaran kontrak; kerana data pergi ke pelayan luaran dan boleh digunakan dalam latihan model dalam beberapa alatan.
Peraturannya mudah: simpan data dalam persekitaran selamatnya sendiri, tanya AI hanya untuk kod dan kaedah. Aliran kerja yang ideal ialah ini: minta AI untuk kod analisis, anda menjalankan kod dengan data sebenar pada pelayan komputer/perusahaan anda sendiri. Jika anda benar-benar mesti berkongsi data, gunakan awanama (alih keluar medan ID), agregat (purata/kira berbanding individu), dan pilih alatan yang bersifat institusi, mempunyai perjanjian pemprosesan data dan jangan gunakan data anda dalam pendidikan.
tiga kes mini
Kes 1 — Penggunaan yang selamat dan cekap. Seorang penyelidik pertama kali menghabiskan 6 jam membersihkan 40,000 baris data belanjawan isi rumah secara manual. Tanpa berkongsi data sama sekali, dia hanya menerangkan nama pembolehubah dan struktur kepada AI dan meminta kod pembersihan. AI menghasilkan skrip R; Penyelidik menjalankan kod dalam persekitarannya sendiri, menyemak bilangan baris dan statistik ringkasan setiap langkah, dan membetulkan dua ralat logik. Tempoh: 70 minit dan bukannya 6 jam. Data tidak pernah keluar; Tanggungjawab tetap ada pada penyelidik.
Kes 2 — Perangkap nombor tidak disahkan. "Apakah keanjalan antara pertumbuhan KDNK dan pelaburan langsung asing," seorang pelajar siswazah bertanya kepada AI. AI dengan yakin memberikan sejumlah "kira-kira 0.34" walaupun ia tidak mempunyai akses kepada sebarang data. Pelajar menulis ini dalam ringkasan literatur; Apabila penasihatnya bertanyakan sumbernya, ternyata nombor itu tiada asas dan direka-reka sama sekali. Kesilapan: Mengharapkan statistik konkrit daripada AI tanpa memberikan data dan sumber kepadanya.
Kes 3 — Kerahsiaan dan pelanggaran kontrak. Seorang penganalisis memuat naik Excel, yang dia terima daripada panel syarikat berlesen, yang mengandungi nama dan perolehan syarikat, ke alat AI yang tersedia secara umum dan berkata "lakukan regresi panel." Kontrak pembekal data melarang pemindahan data ke sistem pihak ketiga; Insiden itu mendorong semakan pematuhan. Cara yang betul ialah menggantikan nama syarikat dengan kod tanpa nama atau tidak berkongsi data dan hanya meminta kod regresi panel dan menjalankannya dalam persekitarannya sendiri.
Gesaan lemah / Gesaan kuat
Gesaan yang lemah:
Analisis hubungan antara inflasi dan pengangguran dan nyatakan pekali.
Tuntutan ini salah: Tiada data diberikan kepada AI, tidak jelas negara mana, tempoh mana, model mana. AI hanya boleh menjawab dengan pekali yang dibuat.
Gesaan kuat:
Peranan anda: anda ialah pembantu analisis yang membantu penyelidik ekonometrik. SAYA TIDAK berkongsi data dengan anda; Saya hanya mahu kod RUNNABLE R. Saya mempunyai panel tahunan: pembolehubah negara, tahun, pengangguran, inflasi (semua angka). Tugasan: 1) tulis kod regresi panel kesan tetap untuk pengangguran ~ inflasi (pakej plm), 2) terangkan setiap langkah dalam kod dengan baris komen, 3) ambil perhatian bahawa pekali harus ditafsirkan sebagai hubungan, bukan SEBAB, 4) buat hujah fungsi yang anda tidak pasti; Saya akan menjalankan dan mengesahkan keputusan dalam persekitaran saya sendiri.
Dalam permintaan ini, tiada data dikongsi, peranan, pakej, jangkaan komen dan larangan "fabrikasi" adalah jelas. Anda masih menjalankan dan mengesahkan output sendiri.
Jadual berikut meringkaskan peraturan satu ayat dalam pelajaran ini:
prinsip
Apakah maksudnya
AI ialah pembantu
Keputusan dan tanggungjawab saintifik adalah milik pakar
Minta kod, hasilkan hasilnya
AI tidak ingat nombornya; anda menjalankannya dan mengira
menyimpan data
Data mikro/berlesen tidak meninggalkan persekitaran yang selamat
mengesahkan
Setiap isu, kod, ulasan disemak; rekaan ditolak
Kesilapan biasa
- Mengharapkan statistik konkrit daripada AI tanpa memberikan data. Model tidak boleh mengakses data; Pekali, korelasi dan nilai p yang diberikannya adalah palsu. Sentiasa minta kod dan hasilkan sendiri.
- Bergantung pada fungsi halusinasi. AI mungkin mencadangkan fungsi atau hujah R/Python yang tidak wujud. Jangan terima kod tanpa menjalankan dan mengesahkannya.
- Memuat naik mikrodata ke alat awam. Ia adalah pelanggaran KVKK/GDPR dan perjanjian penggunaan data. Anonimkan data atau jangan kongsi sama sekali.
- Tersilap kefasihan untuk ketepatan. Semakan yang ditulis dengan baik mungkin tidak tepat. Keindahan ayat bukan bukti.
- Menerima bahasa sebab akibat tanpa kawalan. YZ sering berkata "X meningkatkan Y"; sedangkan kebanyakan regresi hanya menunjukkan hubungan. Pertahankan tuntutan sebab akibat dengan reka bentuk.
Petua: Apabila bekerja dengan AI, tanya diri anda soalan ini: "Jika pengadil atau juruaudit meminta output ini, bolehkah saya menunjukkan sumber dan akaun?" Jika jawapannya tidak, output belum sedia untuk digunakan.
Secara ringkasnya
AI menyediakan pecutan sebenar dan besar-besaran dalam lapisan pelaksanaan (kod, pembersihan, graf, draf) aliran kerja ekonometrik dan statistik; bagaimanapun, pemilihan model, kausaliti, tafsiran, penerbitan dan keputusan dasar adalah milik pakar. Tiga disiplin asas: jangan ingatkan AI nombor, minta kod dan jana dan sahkan hasilnya sendiri; jangan keluarkan data mikro/berlesen daripada persekitaran selamat; penapis statistik setiap keluaran. Output AI yang tidak disahkan adalah sama berisiko seperti penemuan yang belum disemak.
Tugasan permohonan
Pertimbangkan set data anda sendiri (atau contoh). Minta AI untuk kod R atau Python yang menghasilkan statistik deskriptif dan graf ringkas dengan hanya menerangkan struktur pembolehubah, tanpa berkongsi data. Jalankan kod masuk dalam persekitaran anda sendiri. Kemudian simpan senarai semak: (1) adakah kod berjalan tanpa ralat, (2) ialah bilangan baris/pemerhatian seperti yang anda jangkakan, (3) ayat ulasan AI yang manakah menggunakan bahasa sebab dan harus diperbaiki. Dalam satu perenggan, tulis tentang masa AI menyelamatkan anda dan sekurang-kurangnya satu pepijat yang anda tangkap.
senarai semak
- [ ] Saya tidak membuat AI meminta statistik konkrit; Saya meminta kod dan menghasilkan hasilnya sendiri.
- [ ] Saya mengira semula setiap nombor dan keputusan ujian yang diberikan dalam persekitaran saya sendiri.
- [ ] Saya mengesahkan bahawa fungsi/hujah yang digunakannya sebenarnya wujud.
- [ ] Saya tidak memuat naik data mikro/peribadi/berlesen ke alat awam.
- [ ] Saya menandai komen yang mengandungi bahasa sebab dan mengalihkannya ke bahasa perhubungan.
- [ ] Saya dapat menunjukkan sumber dan perakaunan output kepada juruaudit.