Enhet 8 / 11

Fråge- och tentamensproduktion

Vinster:

  • Förmågan att ha artificiell intelligens producerar flervalsfrågor, distraktorer baserade på typiska fel och lösningsnycklar genom att specificera ämne, nivå och svårighetsfördelning.
  • Möjlighet att fånga fel nyckel och flera/noll korrekta alternativfel genom att oberoende validera varje fråge- och svarsnyckel, helst i bulk, med SymPy
  • Förmåga att utvärdera kvaliteten på distraktörer, frågornas entydighet och svårighetsbalans och godkänna varje fråga innan provet tas.

Att förbereda examens- och övningsfrågor är en av de mest tidskrävande uppgifterna inom matematikundervisning: att ställa frågor med lämplig svårighetsgrad, utforma rimliga distraktorer (fel men rimliga alternativ), förbereda svarsnyckeln och balanseringssvårigheter tar timmar. Artificiell intelligens kan påskynda denna process – generera dussintals frågevariationer, flervalsalternativ och lösningsnycklar från ett ämne. Men riktigheten av varje fråga som produceras och felfriheten för varje svarsnyckel måste verifieras oberoende av varandra; En felaktig nyckel innebär att elever på ett orättvist sätt förlorar poäng. I den här enheten kommer du att lära dig hur du använder AI som en frågegenereringspartner och hur du modererar varje fråga.

Några definitioner. En distraktor är ett alternativ i en flervalsfråga som inte är korrekt men som motsvarar ett vanligt misstag eleven kan göra. En bra distraktor är inte slumpmässig; Återspeglar ett typiskt fel (teckenfel, regelförvirring). Svarsnyckeln är en lista med korrekta svar på frågorna. Svårighetsbalans är lämplig fördelning av lätt-medelsvåra frågor i ett prov.

Bidrag av AI till frågegenerering

  • Frågevariation: Flera liknande frågor från ett mönster (ändra siffrorna).
  • Distraktordesign: Troligtvis felaktiga val baserat på vanliga fel.
  • Lösningsnyckelöversikt: Steg-för-steg-lösning för varje problem.
  • Svårighetsgrad: Klassificera frågor som lätt/medel/svårt.
  • Ämnetäckning: Uppsättningar av frågor som täcker olika delämnen i en kursplan.
  • Bloom taxonomy fit: Fråga enligt kognitiva nivåer som att komma ihåg, applicera, analysera.

Steg för steg: generera en pålitlig uppsättning frågor

1. Ange ämne, nivå och antal frågor. Som "10:e klass gymnasiet, andragradsekvationer, 10 flervalsfrågor."

2. Fråga efter frågetyp och svårighetsfördelning. Be om en distribution som "4 lätta, 4 medelstora, 2 svåra."

3. Lös varje fråga självständigt. Lös varje fråga själv eller med SymPy; Jämför det med svarsnyckeln från YZ. Detta steg är icke förhandlingsbart.

4. Kontrollera om det finns distraktorer. Är fel alternativ verkligen fel? Ibland producerar AI mer än ett korrekt alternativ, eller så är en distraktor faktiskt korrekt. Markera varje alternativ.

5. Garantera att det finns exakt ett korrekt svar. I flervalsalternativ måste exakt ett alternativ vara korrekt; Det får inte finnas noll eller mer än en korrekt.

6. Kontrollera om det finns osäkerhet och dubbelarbete. Är frågan entydig? Mäter de två frågorna samma sak? Är siffrorna rimliga (t.ex. om roten ska vara negativ)?

Observera: AI gör två vanligaste misstag när man genererar flervalsfrågor: (1) alternativet som det markerade "sant" är faktiskt fel, (2) mer än ett alternativ är korrekt, eller inget av dem är korrekt. Använd inte någon fråga utan att lösa varje fråga självständigt och utvärdera vart och ett av de fyra alternativen separat som sant/falskt.

Fråga kvalitetskontrolldiagram

kontroll

Fråga

vad man ska söka efter

noggrannhet

Är svarsnyckeln korrekt?

Bekräftelse av oberoende lösning

bara sant

Är bara 1 alternativ korrekt?

De andra 3 måste ha fel

Distraktorkvalitet

Är misstagen rimliga?

Bör baseras på typiska fel

Tydlighet

Är frågan entydig?

Det ska inte råda någon osäkerhet

Nivåöverensstämmelse

Är svårigheten lämplig för målet?

Varken för lätt eller för svårt

Omfattning

Är ämnet väl representerat?

Underämnen är balanserade

tre minifodral

Fall 1 — Fel nyckel. En lärare tog fram en flervalsuppsättning med 12 frågor. När han löste varje fråga med SymPy fann han att i 3 av de 12 frågorna var alternativet som AI:n hade markerat "korrekt" felaktigt - det faktiska rätta svaret var ett annat alternativ. Läraren rättade till nycklarna. Om denna uppsättning hade använts utan verifiering skulle hela klassen ha utvärderats orättvist i 3 frågor.

Fall 2 — Två korrekta alternativ. I en fråga satte AI både "x = 2" och "x = 2 eller x = −2"; Båda var sanna på sätt och vis, och frågan var oklar. Läraren ordnade om alternativen och lämnade bara ett rätt svar. Distraktorer måste vara uppenbart felaktiga.

Fall 3 — Svag distraktor. I en ingenjörsklass placerade AI irrelevanta distraktorer som "42", "aksaray", "blå", "17" etc. i en fråga; Rätt svar var uppenbarligen "17". Läraren bad om numeriska distraktorer baserade på typiska beräkningsfel (t.ex. värde som härrör från teckenfel), och frågorna blev sanna diskriminatorer. Den goda distraktören representerar en sann falsk väg.

Fyra kopierbara mallar

1) Flervalsfrågor:

Generera [n] MULTIPLE CHOICE-frågor om [ämne]. Nivå:[nivå]. Svårighetsgrad: [x lätt, y medel, z svårt]. Låt varje fråga ha 4 alternativ; Låt EXAKT 1 vara korrekt och de andra 3 är rimliga distraktorer baserat på typiska fel. Skriv också steg för steg lösning och rätt svar för varje fråga. Jag kommer att verifiera dem alla med SymPy.

2) Frågevariation (från mönster):

Ta denna fråga som MÖNSTER: [exempelfråga]. Generera [n] olika versioner som mäter samma koncept men med varierande siffror/kontext. Lös svaren för varje version steg för steg. Låt svaren vara olika.

3) Generering av lösningsnyckel:

Ta fram en STEG-FÖR-STEG-lösning och slutligt svar för var och en av frågorna nedan. Ange vilken regel du använder. Markera lösningen du är osäker på; Jag kommer självständigt att verifiera varje svar. Frågor: [här]

4) Distraktorförbättring:

Granska distraktorerna för denna flervalsfråga. Förklara VILKA typiska elevfel varje felaktig distraktor motsvarar. Byt ut irrelevanta eller uppenbart felaktiga distraktorer med sådana som baseras på faktiska fel. Fråga: [här]

Svag prompt / Stark prompt

Svag: "Gör mig 10 härledda frågor."
Resultat: Osäker nivå, slumpmässig svårighetsfördelning, overifierad svarsnyckel, slumpmässig uppsättning distraktorer (om några).
Stark: "Ta fram 10 flervalsderivatfrågor för 12:e klass i gymnasiet: 4 enkla (grundläggande regler), 4 medium (kedja/produktregel), 2 svåra (sammansatta funktioner). Låt det vara 4 val i varje fråga, exakt 1 rätt, de andra är distraktorer baserade på typiska fel (glömma den inre derivatan, lös varje fråga steg för steg och ange rätt svarsfel."
Resultat: En uppsättning som är jämn, balanserad, distraktorer är meningsfulla och varje svar är granskningsbart.

Vanliga misstag

  • Verifierar inte svarsnyckeln. Det AI säger är "rätt" är ofta fel; Lös varje fråga självständigt.
  • Mer än en/noll är det korrekta alternativet. I multiple choice måste det finnas exakt en sanning; Kontrollera varje alternativ separat.
  • Svaga distraktörer. Irrelevanta eller uppenbart felaktiga alternativ gör frågan oskarnant.
  • Anger inte svårighetsfördelningen. De verkar alla ha samma svårighet; Nivåutvärdering kan inte göras.
  • Upprepning och överlappning. Olika frågor kan mäta samma koncept; Kontrollera täckningsbalansen.
  • Vaga uttryck. Frågor med dubbla betydelser vilseleder eleverna på orättvist sätt.
Tips: Det mest effektiva sättet att validera en uppsättning frågor är att skriva kod som löser alla frågor på en gång med SymPy. Berätta för AI:en "skriv kod som löser vart och ett av dessa 10 problem med SymPy", kör koden och jämför SymPy-resultaten i stort sett med AI:s svarsnyckel. På så sätt kontrollerar du de 10 frågorna inte en efter en, utan kollektivt och deterministiskt.

Sammanfattningsvis

AI påskyndar dramatiskt generering av matematiska frågor och prov: frågevariation, distraktordesign, lösningsnyckel, svårighetsgrad. Men varje fråga och varje svarsnyckel måste valideras oberoende – helst bulkverifieras med SymPy. De vanligaste felen är fel svarsnyckel, flera/noll korrekta alternativ och svaga distraktorer. Att specificera ämne, nivå och svårighetsfördelning från början ökar kvaliteten. Eventuella overifierade frågor ska inte delta i provet.

Applikationsuppgift

Välj ett ämne. Låt AI producera 8-10 flervalsfrågor + lösningar med en viss svårighetsfördelning med den första mallen. Sedan, kom ihåg från enhet 4, låt AI:en skriva en kod som löser alla frågor med SymPy och köra koden. Jämför SymPy-resultat med YZ:s svarsnyckel. Kontrollera att det finns exakt ett korrekt val i varje fråga och att distraktorerna faktiskt är felaktiga. Hitta och korrigera minst ett fel eller svag distraktor.

checklista

  • [ ] Jag har tydligt angett ämne, nivå och svårighetsfördelning.
  • [ ] Jag löste varje fråga självständigt (helst batch med SymPy).
  • [ ] Jag jämförde svarsnyckeln med SymPy-resultaten.
  • [ ] Jag har verifierat att det finns exakt ett korrekt alternativ i varje fråga.
  • [ ] Jag kontrollerade att distraktorerna var baserade på typiska fel och faktiskt var fel.
  • [ ] Jag såg till att det inte fanns några vaga uttalanden och inga upprepade frågor.