Keuntungan:
- Kemampuan melaporkan temuan empiris kepada audiens sasaran (akademik, kebijakan, manajemen) dengan dukungan kecerdasan buatan, dalam bahasa yang jujur dan tidak ambigu
- Kemampuan untuk menulis secara lengkap kesimpulan, batasan dan pernyataan etika (kerahasiaan data, konflik kepentingan, pengungkapan penggunaan kecerdasan buatan) dan menghindari penyajian yang menyesatkan
- Kemampuan kecerdasan buatan untuk mengenali draf laporan yang menghasilkan bahasa yang berlebihan, sepihak, atau kausal dan mempertahankan bahwa tanggung jawab atas teks dan klaim akhir berada di tangan peneliti.
Ujian Modul
1. Seorang peneliti bertanya 'Berapa koefisien korelasi antara pengangguran dan inflasi di Türkiye antara tahun 2015 dan 2020?' tanpa memberikan data apa pun kepada kecerdasan buatan. dia bertanya dan langsung menuliskan angka 0,62 di artikelnya. Apa kesalahan mendasar dalam pendekatan ini?
- A) Mengharapkan statistik konkrit dari kecerdasan buatan tanpa memberikan data yang terverifikasi; ✔ Menggunakan nomor yang mungkin dibuat-buat tanpa memverifikasinya
- B) Koefisien korelasi tidak boleh digunakan dalam sebuah artikel.
- C) Korelasi tidak dapat dihitung antara pengangguran dan inflasi
- D) Kecerdasan buatan hanya dapat mengakses data setelah tahun 2020
Penjelasan: Model bahasa AI tidak dapat menghasilkan statistik tanpa mengakses kumpulan data; Nomor yang ia berikan kemungkinan besar hanyalah halusinasi (dibuat-buat). Koefisien, rasio, dan hasil pengujian harus dihitung dari data terverifikasi milik peneliti sendiri, bukan diambil dari memori model.
2. Apa yang dimaksud dengan data yang hilang 'tidak hilang secara acak' (MNAR) dan mengapa hal ini penting?
- A) Kekurangannya disebabkan oleh nilai itu sendiri yang tidak teramati; Itu sebabnya tugas sederhana bisa menimbulkan bias ✔
- B) Data hilang sepenuhnya secara acak dan tidak menimbulkan bias apa pun.
- C) Data yang hilang harus selalu diselesaikan dengan menghapus baris.
- D) Data yang hilang tidak mempengaruhi analisis dengan cara apapun.
Penjelasan: Dalam kasus MNAR (Missing Not At Random), hilangnya itu sendiri bergantung pada besarnya nilai yang tidak teramati (misal, mereka yang berpenghasilan tinggi tidak melaporkan pendapatannya). Dalam hal ini, penghapusan sederhana atau penugasan rata-rata memberikan hasil yang bias; Mekanisme defisiensi harus dimodelkan. Metode penugasan yang disarankan oleh kecerdasan buatan tidak boleh diterapkan begitu saja tanpa mengetahui mekanismenya.
3. Seorang analis meminta AI membuat diagram batang, dan AI memulai sumbu y pada 40, bukan nol. Perbedaan sebenarnya sebesar 2% antara kedua kelompok terlihat sangat besar pada grafik. Apa pendekatan yang tepat?
- A) Memulai sumbu dari awal atau mengubah tipe grafik; ✔ untuk menunjukkan ukuran sebenarnya dari perbedaan tersebut tanpa menyesatkan
- B) Menggunakan grafik apa adanya karena AI membuat pilihan terbaik
- C) Mulai sumbu pada 45 untuk membuat perbedaan lebih besar
- D) Jangan pernah menggunakan visual selain diagram batang
Penjelasan: Dalam diagram batang, sumbu putus-putus (sumbu y yang tidak dimulai dari nol) menyesatkan dengan membesar-besarkan perbedaan kecil. Dalam visualisasi yang jujur, sumbu diagram batang harus dimulai dari nol atau perbedaannya harus dinyatakan dengan jelas. Merupakan tanggung jawab analis untuk memverifikasi gambar dan memperbaikinya jika perlu.
4. Bagaimana fakta bahwa suatu koefisien 'signifikan' (p<0,05) dalam regresi linier sering disalahartikan dalam interpretasi kecerdasan buatan?
- A) Penyajian signifikansi yang dilebih-lebihkan karena pengaruhnya besar dan penting atau terdapat hubungan sebab dan akibat ✔
- B) Signifikansi selalu menunjukkan bahwa pengaruhnya kecil
- C) p<0,05 membuktikan bahwa koefisien tersebut benar sekali
- D) Koefisien yang signifikan tidak boleh dilaporkan.
Penjelasan: Signifikansi statistik berkaitan dengan kekuatan bukti bahwa pengaruhnya berbeda dari nol; Hal ini tidak berarti bahwa pengaruhnya besar, penting atau bersifat sebab-akibat. AI sering kali menyajikan kata 'signifikan' sebagai 'dampak signifikan/kuat'. Peneliti juga harus mengevaluasi ukuran efek, interval kepercayaan, dan konteks.
5. Apa yang dimaksud dengan istilah 'p-hacking' dan mengapa AI dapat mempermudahnya?
- A) Mencoba berbagai analisis hingga masuk akal; AI melakukan ini dengan sangat cepat, meningkatkan risiko ✔
- B) Menganalisis data satu kali dan dengan rencana yang telah ditentukan
- C) memperluas sampel untuk meningkatkan nilai p
- D) Hanya melaporkan statistik deskriptif
Penjelasan: p-hacking adalah mencoba berbagai variabel, subsampel, transformasi, atau model hingga muncul hasil yang berarti; ini menghasilkan temuan palsu berdasarkan kebetulan. Karena AI dapat mencoba lusinan varian model dalam hitungan detik, AI dapat mempercepat p-hacking tanpa rencana yang matang. Pertahanan; prapendaftaran, rencana analisis tetap, dan koreksi perbandingan berganda.
6. Mengapa menemukan regresi R-kuadrat yang tinggi antara dua deret waktu yang tidak stasioner (akar unit) bisa menyesatkan?
- A) Regresi palsu dapat terjadi karena tren umum; ✔ Output R-kuadrat tinggi tanpa hubungan nyata
- B) R-kuadrat yang tinggi selalu membuktikan hubungan sebab akibat yang kuat.
- C) Deret yang tidak stasioner tidak dapat dimasukkan ke dalam regresi sama sekali.
- D) R-kuadrat tidak dapat dihitung dalam deret waktu
Penjelasan: Jika tidak ada hubungan kointegrasi yang sama antara deret-deret yang tidak stasioner, regresi palsu dapat menghasilkan R-kuadrat yang tinggi dan koefisien yang signifikan hanya karena tren yang sama; padahal tidak ada hubungan nyata. Oleh karena itu, uji stasioneritas dan akar unit harus dilakukan terlebih dahulu, dan bila perlu dilakukan uji beda atau uji kointegrasi.
7. Asumsi dasar apa yang mendasari validitas desain Difference-in-Differences?
- A) Asumsi tren paralel: kelompok akan mengikuti arah yang sama jika tidak ada intervensi ✔
- B) Kelompok perlakuan dan kontrol pada awalnya sama persis
- C) Distribusi sampel normal
- D) Variabel tidak mengandung data yang hilang
Penjelasan: DiD berasumsi bahwa jika tidak ada intervensi, variabel hasil pada kelompok perlakuan dan kelompok kontrol akan bergerak paralel dari waktu ke waktu (asumsi tren paralel). Jika asumsi ini tidak terpenuhi, maka estimasi tersebut menjadi bias. AI dapat menghasilkan kode DiD, namun tugas peneliti adalah mempertahankan dan menguji tren paralel.
8. Manakah dari berikut ini yang merupakan praktik wajib untuk analisis yang dapat direproduksi?
- A) Memperbaiki benih dalam langkah acak, mencatat versi dan kode paket ✔
- B) Salin hasilnya secara manual ke spreadsheet dan hapus kodenya
- C) Adalah normal untuk melihat hasil yang berbeda di setiap proses.
- D) Hanya menyimpan grafik akhir, tidak berbagi data dan kode
Deskripsi: Reproduksibilitas; Hasil yang sama dapat diperoleh kembali dengan data dan kode yang sama. Memperbaiki benih dalam langkah acak, menyimpan versi paket, dan mengeksekusi kode di dalam dokumen (pemrograman melek huruf) adalah landasannya. Menyalin hasil secara manual atau berbasis klik, langkah-langkah non-logging akan mengganggu kemampuan reproduksi.
9. Apa yang menyebabkan heteroskedastisitas mendistorsi regresi linier dan apa solusi umumnya?
- A) Ini mendistorsi kesalahan standar; solusinya adalah kesalahan standar yang kuat atau transformasi yang sesuai ✔
- B) Ini sepenuhnya membatalkan estimasi koefisien dan tidak memiliki solusi
- C) Selalu mengurangi R-kuadrat menjadi nol
- D) Hanya terjadi jika sampel sangat kecil dan dapat diabaikan
Penjelasan: Heteroskedastisitas membuat estimasi koefisien tidak bias tetapi salah menghitung kesalahan standar; Hal ini membuat nilai p dan interval kepercayaan tidak dapat diandalkan. Solusi umum adalah dengan menggunakan kesalahan standar yang kuat/HC atau konversi yang sesuai. Harus diverifikasi bahwa solusi yang disarankan AI benar-benar memperbaiki masalah, bukan menyembunyikannya.
10. Seorang peneliti mengunggah mikrodata yang berisi informasi identifikasi tingkat pasien dan pendapatan ke alat obrolan AI publik dan mengatakan 'lakukan regresi'. Apa masalah utama dari perilaku ini?
- A) Mengunggah data pribadi/berlisensi ke alat eksternal merupakan pelanggaran kerahasiaan dan kontrak ✔
- B) Regresi sama sekali tidak dapat dilakukan oleh kecerdasan buatan
- C) Data mikro sama sekali tidak cocok untuk regresi
- D) AI selalu salah menghitung regresi
Penjelasan: Data pribadi/khusus seperti identitas dan pendapatan dilindungi berdasarkan KVKK/GDPR dan sebagian besar perjanjian penggunaan data; Mengunggahnya ke perangkat eksternal yang dapat menyimpan data merupakan pelanggaran. Cara yang benar; Menganonimkan data, menggunakan alat keamanan lokal/institusi, atau sekadar meminta kode dari kecerdasan buatan dan menjalankan kode di lingkungannya sendiri.
11. Apa yang diamati ketika multikolinearitas tinggi?
- A) Koefisien menjadi tidak stabil dan kesalahan standar menjadi meningkat; Koefisien individu mungkin menjadi tidak berarti ✔
- B) R-kuadrat selalu berkurang menjadi nol
- C) Perkiraan koefisien menjadi lebih tepat setiap saat
- D) Skala variabel terikatnya berubah
Penjelasan: Pada multikolinearitas tinggi, variabel independen berkorelasi kuat satu sama lain; Perkiraan koefisien menjadi tidak stabil, kesalahan standar menjadi meningkat, dan koefisien individu mungkin menjadi tidak signifikan, sedangkan model secara keseluruhan mungkin signifikan. Ini didiagnosis dengan kriteria seperti VIF. Kecerdasan buatan mungkin menyarankan penghapusan variabel, namun terserah kepada peneliti untuk memutuskan variabel mana yang tetap bersifat teoritis.
12. Apa yang dimaksud dengan kekuatan statistik dan apa risiko dari studi berdaya rendah?
- A) Kemungkinan mendeteksi efek yang ada; daya rendah melewatkan efek sebenarnya dan membuat temuan tidak dapat diandalkan ✔
- B) kemungkinan penurunan nilai p; daya yang lebih rendah selalu memberikan hasil yang lebih andal
- C) Nilai konstan yang tidak bergantung pada ukuran sampel
- D) Sebuah konsep yang hanya valid jika kecerdasan buatan digunakan
Penjelasan: Kekuatan adalah probabilitas mendeteksi suatu efek yang benar-benar ada (1 dikurangi kesalahan tipe II). Penelitian dengan kekuatan rendah mungkin kehilangan efek yang sebenarnya; Selain itu, beberapa hasil yang signifikan mungkin membawa dampak yang berlebihan ('kutukan pemenang') dan peningkatan angka positif palsu. Oleh karena itu, perhitungan daya/sampel penting dilakukan sebelum analisis.
13. Mengapa secara etis perlu untuk mengungkapkan penggunaan kecerdasan buatan dalam sebuah artikel?
- A) Untuk transparansi dan akuntabilitas; ✔ Pembaca dan wasit dapat mengevaluasi prosesnya dan tanggung jawab tetap berada di tangan penulis
- B) Penggunaan kecerdasan buatan secara otomatis membatalkan hasil
- C) Diminta oleh majalah untuk tujuan periklanan saja
- D) Mengalihkan hak cipta atas penjelasan tersebut kepada kecerdasan buatan
Pengungkapan: Transparansi diperlukan agar pembaca dan pengulas dapat mengevaluasi bagaimana hasil dihasilkan; Banyak jurnal dan institusi kini mewajibkan pengungkapan penggunaan AI. Selain itu, karena kecerdasan buatan dapat menghasilkan kesalahan/halusinasi, jujur saja jika kami menyatakan bahwa tanggung jawab tetap berada di tangan penulis dan langkah apa yang diaudit.
14. Apa yang dimaksud dengan 'pembatasan pengecualian' dalam metode Variabel Instrumen (IV)?
- A) Alat mempengaruhi hasil hanya melalui variabel internal, tidak ada cara langsung lainnya ✔
- B) Instrumen tidak mempunyai hubungan dengan variabel hasil.
- C) Instrumen tidak berhubungan dengan variabel endogen.
- D) Rata-rata selalu berupa variabel biner (0/1).
Penjelasan: Batasan eksklusi mengharuskan instrumen mempengaruhi variabel hasil hanya melalui variabel penjelas endogen dan tidak melalui cara langsung atau faktor lain yang tidak teramati. Asumsi ini tidak dapat sepenuhnya diuji berdasarkan data; Hal ini dipertahankan atas dasar teori dan institusional. AI boleh saja menulis kode IV, tetapi tugas peneliti adalah mempertahankan validitas alat tersebut.
15. Apa yang dimaksud dengan masalah 'Taman jalur bercabang' dalam analisis fleksibel tanpa prapendaftaran?
- A) Terlalu banyak pilihan analisis masuk akal yang dibuat berdasarkan data meningkatkan tingkat positif palsu, bahkan secara tidak sengaja ✔
- B) Metode analisis harus tunggal dan wajib
- C) Masalah yang hanya terjadi jika terjadi kecurangan yang disengaja.
- D) Situasi yang menghilang secara spontan seiring bertambahnya sampel
Penjelasan: Setelah melihat data, peneliti dapat membuat banyak pilihan yang masuk akal tentang variabel, subkelompok, transformasi, atau ambang batas mana yang akan digunakan. Sekalipun tidak ada satu pun 'peretasan p yang disengaja', fleksibilitas ini meningkatkan tingkat positif palsu karena tingkat positif yang signifikan dipilih secara efektif dari sejumlah besar analisis. Prapendaftaran dan rencana analisis tetap membatasi fleksibilitas ini.