Enhed 6 / 11

Måling-evaluering og rubrikdesign: Kriterier, niveau og konsistens

Gevinster:

  • Evne til at forstå analytiske og holistiske rubriktyper, kriterier og succesniveaukoncepter og designe en gennemsigtig rubrik med støtte fra kunstig intelligens.
  • Evne til at producere præstationsafstemte metrics og pointvægte til præstationsopgave, portefølje- og projektevaluering.
  • Evne til at forstå, at beslutningen om at give karakterer og afsluttende evaluering tilkommer læreren, at kunstig intelligens ikke kan score alene, og at sammenhængen skal kontrolleres af læreren.

Det er nemt at fortælle en elev "det her projekt fik 70"; men eleven spørger "hvorfor 70?" eller forældrene gør indsigelse, skal du have et retfærdigt og forsvarligt grundlag. Dette grundlag er rubrikken: et scoringsværktøj, der på forhånd viser efter hvilke kriterier og på hvilke niveauer en præstation (projekt, sammensætning, præsentation, portfolio) vil blive evalueret. En god rubrik fortæller både eleven "hvad der forventes af dig" og gør lærerens scoring konsekvent og gennemsigtig. AI udarbejder hurtigt præstationsrelaterede målinger og niveaudefinitioner; Du bestemmer justering, retfærdighed og vægte. Grænsen er klar: Karaktergivning og slutevaluering er en beslutning, der påvirker eleven; Ansvaret og den endelige godkendelse ligger hos læreren. AI kan ikke score alene.

Rubriktyper og komponenter

Der er to grundlæggende typer. Den analytiske rubrik opdeler præstation i separate kriterier - for eksempel "indhold", "organisation", "sprog og udtryk", "skrivning" i et essay - og giver hvert kriterium point på separate præstationsniveauer (f.eks. 4=meget god, 3=god, 2=forbedrende, 1=begyndelse). Giver detaljeret feedback, men det tager tid at forberede og score. Den holistiske rubrik giver et enkelt overordnet niveau til hele studiet; Det er hurtigt, men det viser ikke, hvor det kommer til kort.

Komponenterne i en analytisk rubrik er: kriterier (hvad vi evaluerer), niveauer (hvor godt), niveaudefinition af hver celle (konkret indikator for det niveau) og vægte (hvilken procentdel af scoren er hvilket kriterium). Definitionen af ​​godt niveau er observerbar: ikke "velskrevet", men "ikke mere end 2 tastefejl og afsnit i logisk rækkefølge".

Tip: Del rubrikken med eleven FØR opgaven. Rubrik er ikke et overraskelsesnoteværktøj, men et læringskort; Hvis eleven ved, hvad han skal arbejde med, producerer han et bedre produkt.

Konsistens og retfærdighed

Den reelle værdi af rubrikken er konsistens: Når to lærere scorer det samme arbejde på to forskellige tidspunkter, bør resultatet være ens. Dette kaldes rater reliability. AI kan producere rubrikkens disposition, men læreren sørger for konsistensen: det er lærerens opgave at gøre niveaubeskrivelserne tilstrækkeligt konkrete, at "kalibrere" nogle få casestudier med rubrikken (forsøgsscoring) og at præcisere reglen i marginale tilfælde.

Af hensyn til retfærdigheden bør rubrikken ikke score ting, der er irrelevante for resultatet (håndskriftens skønhed, materiale, som eleven har brug for socioøkonomisk adgang til). AI tilføjer nogle gange ikke-opnåelseskriterier såsom "præsentationsæstetik"; Det er nødvendigt at sortere dem fra.

Trin for trin: Rubrikdesign med AI

  1. Giv opgaven og præstationen. Hvad rubrikken vil måle afhænger af hvilket resultat.
  2. Vælg genre. Hvis du ønsker detaljeret feedback, analytisk; hvis du ønsker hurtig generel bedømmelse, holistisk.
  3. Bed om kriterier, men filtrer dem. 3-5 kriterier vedrørende præstation; fjerne de irrelevante.
  4. Definitioner på konkrete niveauer. Spørg efter observerbare indikatorer.
  5. Tabe sig. Hvilket kriterium er vigtigere? Lad i alt være 100.
  6. Kalibrer. Score 1-2 prøveundersøgelser med rubrikker og testkonsistens.
  7. Tag den endelige beslutning. Selvom AI foreslår en prøvescore, giver læreren den endelige karakter.

tre minisager

Tilfælde 1 — Udtrækning af ikke-opfyldt kriterium. En tyrkisk lærer bad AI om en analytisk rubrik til et essay. AI foreslog 5 kriterier, men det ene var "håndskriftskønhed" - et kriterium, der var irrelevant for resultatet og uretfærdigt straffede eleven med underudviklet håndskrift. Læreren tog den ud og erstattede den med "idéudvikling". Rubrikken var både retfærdig og resultatafstemt.

Case 2 — Konkretisering. I en lærers første rubrik var niveauerne abstrakte, såsom "meget god / god / rimelig"; To elever havde taget forskellige niveauer af lignende arbejde. Han fortalte AI at "omskrive hvert niveau med en observerbar indikator." Da der kom konkrete definitioner som "Godt = mindst 3 eksempler og et klart konklusionsafsnit", steg konsistensen, og indsigelserne faldt.

Tilfælde 3 — Kalibrering. I en projektevaluering scorede læreren først 3 prøveprojekter med rubrikken produceret af AI. AI tilbød 85 til nogen; Læreren fandt det samme projekt en rubrik 72, fordi AI havde fortolket et kriterium for generøst. Læreren præciserede niveaubeskrivelsen og tildelte selv de endelige karakterer. AI fremskyndede udkastet; Læreren tog beslutningen.

Kopierbare skabeloner

1) Analytisk rubrikoversigt:

Din rolle: [fag]lærer. Opgave: "[skriv præstationsopgave]", præstation: "[præstation]", [X. klasse]. Lav en analytisk rubrik med 4 kriterier. Lad hvert kriterium relateres til resultatet (ADD ikke-objektive kriterier såsom håndskrift og æstetik). Skriv 4 succesniveauer og en OBSERVÆRbar indikator for hvert niveau. Væg kriterierne, så det samlede antal er 100.

2) Konkretisering af niveaudefinitioner:

Niveaubeskrivelserne i den følgende rubrik er meget abstrakte ("god", "fair"). Omskriv hvert niveau med observerbare, tællige indikatorer (f.eks. "ikke mere end 2 fejl", "mindst 3 eksempler"). Rubrik: [indsæt]

3) Holistisk rubrik (hurtig evaluering):

Skriv en 4-niveaus holistisk rubrik for "[opgave]". Lad hvert niveau observerbart beskrive arbejdets generelle karakter i et enkelt afsnit. Gain: "[gain]". Giv også noteintervaller.

4) Kalibreringskontrol:

Nedenfor er en rubrik og elevarbejde. I henhold til rubrikken skal du angive dit niveau i hvert mål, med begrundelse. Giv dette som et FORSLAG; Jeg giver den endelige karakter. Markér eventuelle kriterier, der forbliver uklare. Rubrik + undersøgelse: [indsæt]

Svag prompt / Stærk prompt

Svag prompt:

Skriv en rubrik til projektet.

Ingen opgave, præstation, type, antal kriterier, vægt; En ikke-opnået og abstrakt rubrik vises.

Kraftig prompt:

Din rolle: naturfagslærer. Opgave: "Eleven forsker i en vedvarende energikilde og udarbejder en plakat." Mål: "Den studerende forklarer energikildens arbejdsprincip og fordele." 7. klasse. Analytisk rubrik med 4 kriterier: indholdsnøjagtighed, klarhed i forklaring, brug af kilder, orden. Tilføjelse af ikke-opnåelseskriterier. Lad hvert niveau være observerbart; Summen af vægtene er 100.

funktion

Analytisk rubrik

holistisk rubrik

Antal kriterier

Flere, scoret separat

Enkelt generel dom

Feedback

Detaljeret, kriteriebaseret

Generelt

hastighed

langsom

hurtigt

mest passende

Proces/færdighedsudvikling

Hurtigt overblik

Bidrag af AI

Kriterier + niveauoversigt

Udkast til niveauafsnit

Almindelige fejl

  • Ikke-opnåelsesforanstaltning. At score ting, der ikke er relateret til resultatet, såsom håndskrift, æstetik og adgang til materialer, besejrer retfærdighed.
  • Abstrakt niveau definition. Definitioner som "god/fair" fører til inkonsekvens og indvendinger; Brug observerbar indikator.
  • Viser rubrikken senere. Ikke at dele før opgaven fratager eleven målet.
  • At lave AI-graden. AI kan foreslå prøveresultater, men læreren giver den endelige karakter; Konsistenskontrol er lærerens.
  • Springer kalibrering over. At bruge rubrikken uden at prøve det med casestudier giver overraskende resultater.
Forsigtig: Det er fristende, men risikabelt at give AI et elevarbejde og sige "score" det. Elevens arbejde kan indeholde personlige data (anonymisere), og AI'ens score kan være inkonsekvent/biastisk. Brug AI til at FORESLÅ punkter og skitsere feedback; Du bestemmer.

Sammenfattende

Rubrik er værktøjet, der gør evaluering gennemsigtig, konsekvent og forsvarlig. Analytisk rubrik giver kriteriebaseret detaljeret feedback, holistisk rubrik giver hurtig generel bedømmelse. AI udarbejder hurtigt præstationsrelaterede målinger, konkrete niveaudefinitioner og vægte; Men det er lærerens ansvar at sortere ikke-opnåelseskriterier, gøre niveauerne observerbare, kalibrere dem og give den endelige karakter. Karakter er en beslutning, der påvirker eleven; Det er ikke delegeret til AI.

Ansøgningsopgave

Opret en rubrik med 4 kriterier med skabelonen "Analytisk rubrikoversigt" for en præstationsopgave, du snart skal give. Fjern eventuelle ikke-opnåelseskriterier og gør niveaudefinitioner observerbare. Test derefter konsistens ved at score dine (eller hypotetiske) 2 prøveundersøgelser med denne rubrik; Vurder, om resultaterne fra de to undersøgelser afspejler deres sande kvaliteter, og foretag justeringer af din rubrik.

tjekliste

  • [ ] Er alle kriterier opnåede relaterede (ingen ikke-opnåelseskriterier)?
  • [ ] Er niveaudefinitionerne observerbare og konkrete?
  • [ ] Jeg bestemte vægtene og deres sum er 100?
  • [ ] Vil jeg dele rubrikken med eleven før opgaven?
  • [ ] Kalibrerede jeg rubrikken med prøvearbejdet og gav selv den endelige karakter?