Keuntungan:
- Keupayaan untuk melaporkan penemuan empirikal kepada khalayak sasaran (akademik, dasar, pengurusan) dengan sokongan kecerdasan buatan, dalam bahasa yang jujur dan tidak jelas
- Keupayaan untuk menulis kesimpulan sepenuhnya, had dan pernyataan etika (kerahsiaan data, konflik kepentingan, pendedahan penggunaan kecerdasan buatan) dan mengelakkan pembentangan yang mengelirukan
- Keupayaan kecerdasan buatan untuk mengenali draf laporan yang menghasilkan bahasa yang berlebihan, berat sebelah atau sebab dan mengekalkan tanggungjawab untuk teks dan tuntutan akhir terletak pada penyelidik.
Peperiksaan Modul
1. Seorang penyelidik bertanya 'Apakah pekali korelasi antara pengangguran dan inflasi di Türkiye antara 2015 dan 2020?' tanpa memberikan sebarang data kepada kecerdasan buatan. dia bertanya dan menulis nombor 0.62 terus ke dalam artikelnya. Apakah kesilapan asas dalam pendekatan ini?
- A) Mengharapkan statistik konkrit daripada kecerdasan buatan tanpa memberikan data yang disahkan; ✔ Menggunakan nombor yang mungkin dibuat tanpa mengesahkannya
- B) Pekali korelasi tidak boleh digunakan dalam artikel.
- C) Korelasi tidak boleh dikira antara pengangguran dan inflasi
- D) Kepintaran buatan hanya boleh mengakses data selepas 2020
Penjelasan: Model bahasa AI tidak boleh menghasilkan statistik tanpa mengakses set data; Nombor yang diberikannya berkemungkinan besar halusinasi (rekaan). Pekali, nisbah dan keputusan ujian hendaklah dikira daripada data penyelidik sendiri yang disahkan, bukan diambil daripada ingatan model.
2. Apakah maksud kehilangan data sebagai 'tidak hilang secara rawak' (MNAR) dan mengapa ia penting?
- A) Kekurangan adalah disebabkan oleh nilai yang tidak diperhatikan itu sendiri; Sebab tu assignment mudah boleh buat bias ✔
- B) Data hilang sepenuhnya secara rawak dan tidak menimbulkan sebarang berat sebelah.
- C) Data yang hilang hendaklah sentiasa diselesaikan dengan memadamkan baris.
- D) Data yang hilang tidak menjejaskan analisis dalam apa cara sekalipun.
Penjelasan: Dalam kes MNAR (Missing Not At Random), kehilangan itu sendiri bergantung pada magnitud nilai yang tidak diperhatikan (cth. orang yang berpendapatan tinggi tidak melaporkan pendapatan mereka). Dalam kes ini, pemadaman mudah atau tugasan purata memberikan hasil yang berat sebelah; Mekanisme kekurangan mesti dimodelkan. Kaedah tugasan yang dicadangkan oleh kecerdasan buatan tidak boleh digunakan secara membuta tuli tanpa mengetahui mekanisme ini.
3. Seorang penganalisis meminta AI membuat carta bar, dan AI memulakan paksi-y pada 40 dan bukannya sifar. Perbezaan sebenar 2% antara kedua-dua kumpulan kelihatan besar pada graf. Apakah pendekatan yang betul?
- A) Memulakan paksi dari awal atau menukar jenis carta; ✔ untuk menunjukkan saiz sebenar perbezaan tanpa mengelirukan
- B) Menggunakan carta sebagaimana adanya kerana AI membuat pilihan terbaik
- C) Memulakan paksi pada 45 untuk membuat perbezaan lebih besar
- D) Jangan sekali-kali menggunakan visual dan bukannya carta bar
Penjelasan: Dalam carta bar, paksi putus-putus (paksi-y yang tidak bermula dari sifar) mengelirukan dengan membesar-besarkan perbezaan kecil. Dalam visualisasi yang jujur, paksi carta bar harus bermula dari sifar atau perbezaannya harus dinyatakan dengan jelas. Adalah menjadi tanggungjawab penganalisis untuk mengesahkan imej dan membetulkannya jika perlu.
4. Bagaimanakah fakta bahawa pekali adalah 'signifikan' (p<0.05) dalam regresi linear sering disalah nyatakan dalam tafsiran kecerdasan buatan?
- A) Penyampaian kepentingan yang dibesar-besarkan kerana kesannya adalah besar dan penting atau kausalitas ditubuhkan ✔
- B) Kepentingan sentiasa menunjukkan bahawa kesannya adalah kecil
- C) p<0.05 membuktikan bahawa pekali adalah betul-betul betul
- D) Pekali yang ketara tidak boleh dilaporkan.
Penjelasan: Kepentingan statistik berkaitan dengan kekuatan bukti bahawa kesannya berbeza daripada sifar; Ia tidak bermakna kesannya besar, penting atau bersebab. AI sering membentangkan perkataan 'signifikan' sebagai 'impak ketara/kuat'. Penyelidik juga harus menilai saiz kesan, selang keyakinan, dan konteks.
5. Apakah yang dimaksudkan dengan istilah 'p-hacking' dan mengapa AI boleh menjadikannya lebih mudah?
- A) Mencuba pelbagai analisis sehingga ia masuk akal; AI melakukan ini dengan cepat, meningkatkan risiko ✔
- B) Menganalisis data sekali dan dengan rancangan yang telah ditetapkan
- C) mengembangkan sampel untuk meningkatkan nilai-p
- D) Melaporkan statistik deskriptif sahaja
Penjelasan: p-penggodaman mencuba pembolehubah, subsampel, transformasi atau model yang berbeza sehingga hasil yang bermakna muncul; ini menghasilkan penemuan palsu berdasarkan kebetulan. Memandangkan AI boleh mencuba berpuluh-puluh varian model dalam beberapa saat, ia boleh mempercepatkan p-hacking tanpa rancangan yang jujur. Pertahanan; prapendaftaran, pelan analisis tetap dan pembetulan perbandingan berganda.
6. Mengapakah mencari regresi R kuasa dua tinggi antara dua siri masa tidak pegun (akar unit) boleh mengelirukan?
- A) Regresi palsu mungkin berlaku disebabkan oleh aliran biasa; ✔ Keluaran R kuasa dua tinggi tanpa perhubungan sebenar
- B) Kuasa dua R tinggi sentiasa membuktikan hubungan sebab akibat yang kuat.
- C) Siri tidak pegun tidak boleh dimasukkan ke dalam regresi sama sekali.
- D) R-kuasa dua tidak boleh dikira dalam siri masa
Penjelasan: Jika tiada perhubungan kointegrasi sepunya antara siri tidak pegun, regresi palsu boleh menghasilkan pekali R kuasa dua dan ketara yang tinggi hanya disebabkan oleh aliran sepunya; sedangkan tiada hubungan sebenar. Oleh itu, ujian kepegunan dan punca unit perlu dilakukan terlebih dahulu, dan jika perlu, perbezaan perlu diambil atau kointegrasi perlu diuji.
7. Apakah andaian asas yang berdasarkan kesahihan reka bentuk Perbezaan-dalam-Perbezaan?
- A) Andaian aliran selari: kumpulan akan mengikut arah yang sama jika tiada campur tangan ✔
- B) Kumpulan rawatan dan kawalan adalah sama pada mulanya
- C) Taburan normal sampel
- D) Pembolehubah tidak mengandungi sebarang data yang hilang
Penjelasan: JPS mengandaikan bahawa jika tiada campur tangan, pembolehubah hasil bagi kumpulan rawatan dan kawalan akan berjalan selari dari semasa ke semasa (andaian arah aliran selari). Jika andaian ini tidak dipenuhi, anggaran adalah berat sebelah. AI boleh menghasilkan kod DiD, tetapi tugas penyelidik untuk mempertahankan dan menguji trend selari.
8. Antara berikut, yang manakah merupakan amalan wajib untuk analisis yang boleh diterbitkan semula?
- A) Memperbaiki benih dalam langkah rawak, merekodkan versi pakej dan kod ✔
- B) Salin keputusan secara manual ke hamparan dan padamkan kod
- C) Adalah perkara biasa untuk melihat hasil yang berbeza dalam setiap larian.
- D) Hanya menyimpan grafik akhir, tidak berkongsi data dan kod
Penerangan: Kebolehulangan; Keputusan yang sama boleh diperoleh semula dengan data dan kod yang sama. Membetulkan benih dalam langkah rawak, menyimpan versi pakej dan melaksanakan kod dalam dokumen (pengaturcaraan celik) adalah asas ini. Menyalin keputusan secara manual atau berasaskan klik, langkah bukan pembalakan menjejaskan kebolehulangan.
9. Apakah heteroskedastisitas memesongkan regresi linear dan apakah penyelesaian lazimnya?
- A) Ia memutarbelitkan ralat standard; penyelesaian adalah ralat piawai yang teguh atau transformasi yang sesuai ✔
- B) Ia membatalkan sepenuhnya anggaran pekali dan tidak mempunyai penyelesaian
- C) Sentiasa kurangkan R-kuasa dua kepada sifar
- D) Berlaku hanya jika sampel sangat kecil dan boleh diabaikan
Penjelasan: Heteroskedastisitas meninggalkan anggaran pekali tidak berat sebelah tetapi salah mengira ralat piawai; Ini menjadikan nilai-p dan selang keyakinan tidak boleh dipercayai. Penyelesaian biasa ialah menggunakan ralat standard teguh/HC atau penukaran yang sesuai. Ia mesti disahkan bahawa penyelesaian yang dicadangkan oleh AI sebenarnya membetulkan masalah dan bukannya menyembunyikannya.
10. Seorang penyelidik memuat naik mikrodata yang mengandungi maklumat pengenalan peringkat pesakit dan pendapatan ke dalam alat sembang AI awam dan berkata 'lakukan regresi'. Apakah masalah utama dengan tingkah laku ini?
- A) Memuat naik data peribadi/berlesen ke alat luaran merupakan pelanggaran kerahsiaan dan kontrak ✔
- B) Regresi tidak boleh dilakukan oleh kecerdasan buatan sama sekali
- C) Data mikro tidak sesuai untuk regresi sama sekali
- D) AI sentiasa salah mengira regresi
Penjelasan: Data peribadi/khas seperti identiti dan pendapatan dilindungi di bawah KVKK/GDPR dan kebanyakan perjanjian penggunaan data; Memuat naiknya ke peranti luaran yang boleh menyimpan data adalah satu pelanggaran. Cara yang betul; Menganonimkan data, menggunakan alat selamat tempatan/institusi, atau hanya meminta kod daripada kecerdasan buatan dan menjalankan kod dalam persekitarannya sendiri.
11. Apakah yang diperhatikan apabila multikolineariti adalah tinggi?
- A) Pekali menjadi tidak stabil dan ralat piawai menjadi melambung; Pekali individu mungkin menjadi tidak bermakna ✔
- B) kuasa dua R sentiasa berkurangan kepada sifar
- C) Anggaran pekali menjadi lebih tepat sepanjang masa
- D) Skala pembolehubah bersandar berubah
Penjelasan: Dalam multikolineariti yang tinggi, pembolehubah bebas berkorelasi kuat antara satu sama lain; Anggaran pekali menjadi tidak stabil, ralat piawai menjadi melambung, dan pekali individu mungkin menjadi tidak ketara, manakala model keseluruhan mungkin penting. Ia didiagnosis dengan kriteria seperti VIF. Kecerdasan buatan mungkin mencadangkan penghapusan pembolehubah, tetapi terpulang kepada penyelidik untuk memutuskan pembolehubah yang harus kekal sebagai teori.
12. Apakah kuasa statistik dan apakah risiko kajian kuasa rendah?
- A) Kemungkinan mengesan kesan sedia ada; kuasa rendah terlepas kesan sebenar dan menjadikan penemuan tidak boleh dipercayai ✔
- B) kebarangkalian mengurangkan nilai-p; kuasa yang lebih rendah sentiasa memberikan hasil yang lebih dipercayai
- C) Nilai malar bebas daripada saiz sampel
- D) Konsep yang sah hanya apabila kecerdasan buatan digunakan
Penjelasan: Kuasa ialah kebarangkalian untuk mengesan kesan yang sebenarnya wujud (1 tolak ralat jenis II). Kajian berkuasa rendah mungkin terlepas kesan sebenar; Selain itu, beberapa keputusan penting mungkin membawa saiz kesan yang dibesar-besarkan ('kutukan pemenang') dan kadar positif palsu meningkat. Oleh itu, pengiraan kuasa/sampel adalah penting sebelum analisis.
13. Mengapakah secara etika perlu mendedahkan penggunaan kecerdasan buatan dalam artikel?
- A) Untuk ketelusan dan akauntabiliti; ✔ pembaca dan pengadil boleh menilai proses dan tanggungjawab tetap di tangan penulis
- B) Penggunaan kecerdasan buatan secara automatik membatalkan keputusan
- C) Diminta oleh majalah untuk tujuan pengiklanan sahaja
- D) Memindahkan hak cipta penjelasan kepada kecerdasan buatan
Pendedahan: Ketelusan adalah perlu supaya pembaca dan penyemak boleh menilai bagaimana keputusan dihasilkan; Banyak jurnal dan institusi kini memerlukan pendedahan penggunaan AI. Selain itu, memandangkan kecerdasan buatan boleh menghasilkan ralat/halusinasi, adalah satu perkara yang jujur untuk menyatakan bahawa tanggungjawab itu kekal pada pengarang dan langkah mana yang telah diaudit.
14. Apakah yang diperlukan oleh 'sekatan pengecualian' dalam kaedah Pembolehubah Instrumen (IV)?
- A) Alat mempengaruhi keputusan hanya melalui pembolehubah dalaman, tiada cara langsung lain ✔
- B) Instrumen tidak mempunyai hubungan dengan pembolehubah hasil.
- C) Instrumen tidak berkaitan dengan pembolehubah endogen.
- D) Min sentiasa pembolehubah binari (0/1).
Penjelasan: Kekangan pengecualian memerlukan instrumen mempengaruhi pembolehubah hasil hanya melalui pembolehubah penerangan endogen dan bukan melalui sebarang cara langsung atau faktor yang tidak diperhatikan. Andaian ini tidak boleh diuji sepenuhnya daripada data; Ia dipertahankan atas dasar teori dan institusi. AI mungkin menulis kod IV, tetapi tugas penyelidik untuk mempertahankan kesahihan alat tersebut.
15. Apakah maksud masalah 'Taman laluan bercabang' dalam analisis fleksibel tanpa prapendaftaran?
- A) Terlalu banyak pilihan analisis munasabah yang dibuat berdasarkan data meningkatkan kadar positif palsu, walaupun secara tidak sengaja ✔
- B) Kaedah analisis mestilah tunggal dan wajib
- C) Masalah yang hanya berlaku apabila berlaku penipuan yang disengajakan.
- D) Keadaan yang hilang secara spontan apabila sampel membesar
Penjelasan: Selepas melihat data, penyelidik boleh membuat banyak pilihan yang munasabah tentang pembolehubah, subkumpulan, transformasi atau ambang yang hendak digunakan. Walaupun tiada 'penggodaman p yang disengajakan' tunggal, fleksibiliti ini meningkatkan kadar positif palsu kerana yang signifikan dipilih dengan berkesan daripada sejumlah besar analisis. Prapendaftaran dan pelan analisis tetap mengehadkan fleksibiliti ini.