Satuan 8 / 11

Produksi Soal dan Ujian

Keuntungan:

  • Kemampuan untuk memiliki kecerdasan buatan menghasilkan pertanyaan pilihan ganda, pengecoh berdasarkan kesalahan umum, dan kunci solusi dengan menentukan topik, level, dan distribusi kesulitan.
  • Kemampuan untuk menangkap kesalahan kunci yang salah dan beberapa/nol pilihan yang benar dengan memvalidasi secara independen setiap kunci pertanyaan dan jawaban, sebaiknya secara massal, dengan SymPy
  • Kemampuan untuk mengevaluasi kualitas pengecoh, ketidakjelasan dan keseimbangan kesulitan soal, serta menyetujui setiap soal sebelum mengikuti ujian.

Mempersiapkan soal ujian dan latihan adalah salah satu tugas yang paling memakan waktu dalam pendidikan matematika: menetapkan soal dengan tingkat kesulitan yang sesuai, merancang pengecoh yang masuk akal (pilihan yang salah tetapi masuk akal), menyiapkan kunci jawaban, dan menyeimbangkan kesulitan membutuhkan waktu berjam-jam. Kecerdasan buatan dapat mempercepat proses ini — menghasilkan lusinan variasi pertanyaan, pilihan ganda, dan kunci solusi dari satu topik. Namun keakuratan setiap pertanyaan yang dihasilkan dan bebas kesalahan setiap kunci jawaban harus diverifikasi secara independen; Kunci yang salah berarti siswa kehilangan poin secara tidak adil. Dalam unit ini Anda akan mempelajari cara menggunakan AI sebagai mitra pembuatan pertanyaan dan cara memoderasi setiap pertanyaan.

Beberapa definisi. Distraktor adalah suatu pilihan dalam soal pilihan ganda yang tidak benar tetapi berhubungan dengan kesalahan umum yang mungkin dilakukan siswa. Distraktor yang baik tidaklah acak; Mencerminkan kesalahan tipikal (kesalahan tanda, kebingungan aturan). Kunci jawaban adalah daftar jawaban yang benar atas pertanyaan. Keseimbangan kesulitan adalah pembagian soal mudah-sedang-sulit yang tepat dalam suatu ujian.

Kontribusi AI pada pembuatan pertanyaan

  • Variasi pertanyaan: Beberapa pertanyaan serupa dari suatu pola (mengubah angka).
  • Desain pengecoh: Pilihan yang masuk akal salah berdasarkan kesalahan umum.
  • Garis besar kunci solusi: Solusi langkah demi langkah untuk setiap masalah.
  • Tingkat kesulitan: Mengklasifikasikan soal menjadi mudah/sedang/sulit.
  • Cakupan mata pelajaran: Kumpulan pertanyaan yang mencakup berbagai subtopik silabus.
  • Kesesuaian taksonomi Bloom: Pertanyaan menurut tingkat kognitif seperti mengingat, menerapkan, menganalisis.

Langkah demi langkah: menghasilkan serangkaian pertanyaan yang andal

1. Tentukan topik, level dan jumlah pertanyaan. Seperti "kelas 10 SMA, persamaan kuadrat, 10 soal pilihan ganda".

2. Tanyakan jenis pertanyaan dan distribusi kesulitannya. Mintalah pembagian seperti "4 mudah, 4 sedang, 2 keras".

3. Selesaikan setiap pertanyaan secara mandiri. Selesaikan setiap pertanyaan sendiri atau dengan SymPy; Bandingkan dengan kunci jawaban yang disediakan oleh YZ. Langkah ini tidak bisa dinegosiasikan.

4. Periksa pengalih perhatian. Apakah pilihan yang salah benar-benar salah? Terkadang AI menghasilkan lebih dari satu pilihan yang benar, atau pengecoh sebenarnya benar. Periksa setiap opsi.

5. Menjamin hanya ada satu jawaban yang benar. Dalam pilihan ganda, tepat satu pilihan harus benar; Tidak boleh ada nol atau lebih dari satu yang benar.

6. Periksa ketidakpastian dan duplikasi. Apakah pertanyaannya bersifat univokal? Apakah kedua pertanyaan tersebut mengukur hal yang sama? Apakah angkanya masuk akal (misalnya jika akarnya negatif)?

Perhatian: AI membuat dua kesalahan paling umum saat membuat pertanyaan pilihan ganda: (1) pilihan yang ditandai "benar" sebenarnya salah, (2) lebih dari satu pilihan benar, atau tidak ada satupun yang benar. Jangan menggunakan pertanyaan apa pun tanpa menyelesaikan setiap pertanyaan secara mandiri dan mengevaluasi keempat opsi secara terpisah sebagai benar/salah.

Bagan kendali mutu pertanyaan

kontrol

Pertanyaan

apa yang harus dicari

akurasi

Apakah kunci jawabannya benar?

Konfirmasi dengan solusi independen

hanya benar

Apakah hanya 1 pilihan yang benar?

3 lainnya pasti salah

Kualitas pengalih perhatian

Apakah kesalahannya masuk akal?

Harus didasarkan pada kesalahan tipikal

Kejelasan

Apakah pertanyaannya bersifat univokal?

Seharusnya tidak ada ketidakpastian

Kepatuhan tingkat

Apakah tingkat kesulitannya sesuai dengan tujuan?

Tidak terlalu mudah dan tidak terlalu sulit

Ruang lingkup

Apakah topiknya terwakili dengan baik?

Subtopik seimbang

tiga kasus mini

Kasus 1 — Kunci salah. Seorang guru membuat satu set pilihan ganda yang terdiri dari 12 pertanyaan. Ketika dia menyelesaikan setiap pertanyaan dengan SymPy, dia menemukan bahwa dalam 3 dari 12 pertanyaan, opsi yang ditandai AI sebagai "benar" salah — jawaban yang benar sebenarnya adalah opsi lain. Guru meluruskan kuncinya. Jika set ini digunakan tanpa verifikasi, seluruh kelas akan dievaluasi secara tidak adil dalam 3 pertanyaan.

Kasus 2 — Dua pilihan yang benar. Dalam satu pertanyaan, AI memasukkan “x = 2” dan “x = 2 atau x = −2”; Keduanya benar dalam arti tertentu, dan pertanyaannya tidak jelas. Guru mengatur ulang pilihan dan hanya menyisakan satu jawaban yang benar. Pengalih perhatian pastilah salah.

Kasus 3 — Pengalih perhatian yang lemah. Di kelas teknik, AI menempatkan pengecoh yang tidak relevan seperti "42", "aksaray", "biru", "17" dll ke dalam sebuah pertanyaan; Jawaban yang benar jelas adalah “17”. Guru meminta pengecoh numerik berdasarkan kesalahan penghitungan yang umum (misalnya, nilai yang dihasilkan dari kesalahan tanda), dan pertanyaan tersebut menjadi pembeda yang sebenarnya. Pengalih yang baik mewakili jalan yang benar dan salah.

Empat templat yang dapat disalin

1) Kumpulan pertanyaan pilihan ganda:

Hasilkan [n] pertanyaan PILIHAN GANDA tentang [topik]. Tingkat:[tingkat]. Kesulitan: [x mudah, y sedang, z sulit]. Biarkan setiap pertanyaan memiliki 4 pilihan; Misalkan EXACT 1 benar dan 3 lainnya merupakan pengecoh yang masuk akal berdasarkan kesalahan tipikal. Tulis juga solusi langkah demi langkah dan jawaban yang benar untuk setiap pertanyaan. Saya akan memverifikasi semuanya dengan SymPy.

2) Variasi soal (dari pola):

Ambil pertanyaan ini sebagai POLA: [contoh pertanyaan]. Hasilkan [n] versi berbeda yang mengukur konsep yang sama tetapi dengan angka/konteks yang berbeda. Selesaikan jawaban untuk setiap versi langkah demi langkah. Biarkan jawabannya berbeda satu sama lain.

3) Pembuatan kunci solusi:

Hasilkan solusi LANGKAH DEMI LANGKAH dan jawaban akhir untuk setiap pertanyaan di bawah ini. Tentukan aturan yang Anda gunakan. Tandai solusi yang Anda tidak yakin; Saya akan memverifikasi setiap jawaban secara independen. Pertanyaan: [di sini]

4) Peningkatan distraktor:

Tinjau pengecoh untuk pertanyaan pilihan ganda ini. Jelaskan kesalahan khas siswa yang mana yang berhubungan dengan setiap pengecoh yang salah. Gantikan pengecoh yang tidak relevan atau jelas-jelas salah dengan pengecoh yang didasarkan pada kesalahan sebenarnya. Pertanyaan: [di sini]

Perintah lemah / Perintah kuat

Lemah: "Beri saya 10 pertanyaan turunan."
Hasil: Tingkat tidak pasti, distribusi kesulitan acak, kunci jawaban tidak terverifikasi, kumpulan pengecoh acak (jika ada).
Kuat : “Buatlah 10 soal turunan pilihan ganda untuk kelas 12 SMA: 4 mudah (aturan dasar), 4 sedang (aturan rantai/perkalian), 2 sulit (fungsi majemuk). Misalkan setiap soal ada 4 pilihan, tepat 1 benar, yang lainnya adalah pengecoh berdasarkan kesalahan tipikal (lupa turunan dalam, tanda kesalahan). Selesaikan setiap pertanyaan selangkah demi selangkah dan tunjukkan jawaban yang benar."
Hasil: Himpunan yang seimbang, seimbang, pengecoh bermakna dan setiap jawaban dapat diaudit.

Kesalahan umum

  • Tidak memverifikasi kunci jawaban. Apa yang dikatakan AI sebagai "benar" sering kali salah; Selesaikan setiap pertanyaan secara mandiri.
  • Lebih dari satu/nol adalah pilihan yang tepat. Dalam pilihan ganda harus ada satu kebenaran; Periksa setiap opsi secara terpisah.
  • Distraktor yang lemah. Pilihan yang tidak relevan atau jelas-jelas salah membuat pertanyaan menjadi tidak khas.
  • Tidak merinci distribusi kesulitannya. Semuanya tampaknya memiliki kesulitan yang sama; Evaluasi level tidak dapat dilakukan.
  • Pengulangan dan tumpang tindih. Pertanyaan yang berbeda mungkin mengukur konsep yang sama; Periksa saldo cakupan.
  • Ekspresi tidak jelas. Pertanyaan dengan makna ganda menyesatkan siswa secara tidak adil.
Tip: Cara paling efisien untuk memvalidasi serangkaian pertanyaan adalah dengan menulis kode yang menyelesaikan semua pertanyaan sekaligus dengan SymPy. Beri tahu AI "tulis kode yang menyelesaikan masing-masing dari 10 masalah ini dengan SymPy", jalankan kode tersebut, dan bandingkan secara massal hasil SymPy dengan kunci jawaban AI. Dengan cara ini, Anda memeriksa 10 pertanyaan tidak satu per satu, tetapi secara kolektif dan deterministik.

Singkatnya

AI secara dramatis mempercepat pembuatan soal matematika dan ujian: variasi soal, desain pengalih perhatian, kunci solusi, tingkat kesulitan. Namun setiap pertanyaan dan setiap kunci jawaban harus divalidasi secara independen — sebaiknya diverifikasi secara massal dengan SymPy. Kesalahan yang paling sering terjadi adalah kunci jawaban salah, pilihan benar banyak/tidak ada, dan pengecoh lemah. Menentukan topik, level dan distribusi kesulitan dari awal akan meningkatkan kualitas. Pertanyaan apa pun yang belum diverifikasi tidak boleh dimasukkan dalam ujian.

Tugas aplikasi

Pilih topik. Minta AI menghasilkan 8-10 soal pilihan ganda + solusi dengan distribusi kesulitan tertentu dengan template pertama. Kemudian, mengingat dari unit 4, minta AI menulis kode yang menyelesaikan semua pertanyaan dengan SymPy dan menjalankan kode tersebut. Bandingkan hasil SymPy dengan kunci jawaban YZ. Verifikasi bahwa terdapat tepat satu pilihan yang benar dalam setiap pertanyaan dan pengecohnya benar-benar salah. Temukan dan perbaiki setidaknya satu kesalahan atau pengalih perhatian yang lemah.

daftar periksa

  • [ ] Saya telah menyatakan dengan jelas subjek, level dan distribusi kesulitannya.
  • [] Saya menyelesaikan setiap pertanyaan secara mandiri (sebaiknya batch dengan SymPy).
  • [ ] Kunci jawaban saya bandingkan dengan hasil SymPy.
  • [ ] Saya memverifikasi bahwa hanya ada satu pilihan yang benar di setiap pertanyaan.
  • [ ] Saya memeriksa bahwa pengecoh didasarkan pada kesalahan umum dan sebenarnya salah.
  • [ ] Saya memastikan tidak ada pernyataan yang tidak jelas dan tidak ada pertanyaan yang berulang-ulang.