Enhet 10 / 10

Ende-til-ende-applikasjon: Evaluering, validering, etikk og grenser

Gevinster:

  • Evne til å sette opp et lite testsett (eval) som evaluerer en modell med egne data
  • Bygg inn menneskelig verifisering, grenser og retningslinjer for ansvarlig bruk i arbeidsflyten
  • Gjenkjenne hallusinasjoner, personvern og etiske risikoer og iverksette avbøtende tiltak

Du har valgt riktig modell; Er jobben gjort? Nei, det virkelige arbeidet starter nå. Å sette en modell inn i virksomheten din kommer ned til å teste den mot dine egne data, validere produksjonen og utforme den på en ansvarlig måte. Denne siste enheten gjør hele modulen til en ende-til-ende-applikasjon: du lærer hvordan du setter opp en liten testsuite (eval), legger inn menneskelig verifisering i arbeidsflyten, håndterer hallusinasjons- og personvernrisikoer og trekker etiske grenser. Når enheten er ferdig, vil du være utstyrt til ikke bare å velge en modell, men også sette den i drift med selvtillit.

Evaluering (Eval): Testing med dine egne data

Nå vet du at bare de faktiske dataene dine, ikke annonser, kan fortelle om en modell passer til virksomheten din. Måten å måle dette på er å sette opp et evalueringssett (eval): en liten samling prøver fra arbeidet ditt der det riktige svaret er kjent.

En enkel eval er satt opp slik:

  1. Samle 10-30 ekte prøver. Velg input som er typisk for jobben din (miks vanskelig og enkelt).
  2. Bestem "riktig/forventet utgang" for hvert eksempel. Hva ville en ekspert svare?
  3. Kjør kandidater gjennom de samme eksemplene. Test modellene du sammenligner en etter en med samme sett.
  4. Score resultatene. I hvor mange eksempler er det sant? Hvor tok han feil? Er feil akseptable?
  5. Sammenlign og velg. Velg ikke den høyeste totale poengsummen, men den som er mest pålitelig i de mest kritiske eksemplene for deg.
Tips: Ikke stol blindt på topplistene. En modell kan rangeres først globalt, men prestere dårligere enn andreplassmodellen i dine spesifikke tyrkiske lovtekster. Din egen vurdering av 20 prøver er verdt mer enn hundrevis av offentlige tester.

Hallusinasjon: Modellens mest lumske risiko

En hallusinasjon er når modellen produserer informasjon som faktisk ikke er sann, på et selvsikkert språk. I stedet for å si «jeg vet ikke», kan modellen produsere et ikke-eksisterende lovverk, en oppdiktet statistikk eller en falsk dato; Dessuten gjør han dette på et ekstremt overbevisende språk. Dette er det farligste aspektet ved AI fordi feil maskerer seg som sannhet.

Du kan ikke eliminere hallusinasjonen helt, men du kan redusere den og fange den:

  • Baser det på kilden: Be modellen om å generere svar fra dokumentene du gir, ikke fra sitt eget «minne» (RAG-logikk).
  • Be om kilder: Si: "Ved siden av hvert krav, skriv dokumentet/delen som den er basert på"; Hvis han ikke kan gi en kilde, vær mistenksom.
  • Få folk til å si at de ikke er sikre: Instruksjonen "Hvis du ikke er sikker, skriv 'ikke tydelig'" reduserer modelltilpasningen.
  • Menneskelig verifisering: Kritiske utdata må verifiseres av et menneske.
Forsiktig: Bruk aldri modellutdata uten å validere det for juridiske, medisinske eller økonomiske avgjørelser. En "lovartikkel" eller "doseinformasjon" produsert av modellen kan være fullstendig fabrikkert. På disse områdene er AI et utkast/foreløpig verktøy; En kompetent person har alltid det siste ordet.

Krav til menneskelig verifisering

Kunstig intelligens fungerer best som et verktøy som akselererer mennesker, ikke setter dem uten jobb. Riktig oppsett er som følger: produserer eller prekvalifiserer modellutkastet; mennesket vurderer, korrigerer og godkjenner. Hvor streng verifiseringen må være, avhenger av kostnadene ved feilen.

Quest

Feilkostnad

menneskelig verifisering

Utkast til produktbeskrivelse

lav

Prøvekontroll er nok

Kundesvar på e-post

medium

Gjennomgang før innlevering

Kontraktsrisikoanalyse

høy

Artikkel for artikkel ekspertbekreftelse

Medisinsk/økonomisk rådgivning

veldig høy

Full ekspertverifisering, kun AI-støtte

Denne tabellen finner balansen mellom "manuelt sjekke hver utgang" og "ikke sjekke i det hele tatt." Selv om prøvekontroll er tilstrekkelig for lavkostjobber, må hver utgang verifiseres for høyprisjobber.

Etisk og ansvarlig bruk

Selv om modellvalg kan virke som en teknisk beslutning, ligger det etiske ansvar bak:

  • Åpenhet: La dine kunder eller ansatte vite at du bruker AI på passende steder. En kunde har rett til å vite om de snakker med et menneske eller AI.
  • Bias: Modeller kan arve bias fra dataene de er trent på. Overvåk rettferdigheten av utfall på sensitive områder som rekruttering og kredittvurdering.
  • Personvern: Integrer databeskyttelsesprinsippene du lærte i enhet 8 i arbeidsflyten; Ikke send personopplysninger hensynsløst.
  • Ansvarlighet: Når en feil oppstår, er ikke "AI made it"-forsvaret nok. Ansvaret ligger hos institusjonen som bruker kjøretøyet. Så dokumenter bekreftelsesprosesser.
Tips: Skriv en liten "policy for ansvarlig bruk" i arbeidsflyten din: hvilke jobber kan bruke AI, hvilke data kan ikke sendes, hvem vil bekrefte det, og hvordan feil vil bli rapportert. Dette dokumentet på én side forhindrer store problemer i fremtiden.

Tre realistiske tilfeller

Sak 1 - Angre uten å etablere eval. Et forsikringsteam begynner å oppsummere krav uten å teste den mest populære modellen. Etter to uker innser de at modellen ofte gjør feil i tyrkiske tekniske termer og leser noen beløp feil. Når de setter opp en eval på 20 prøver og sammenligner de tre modellene, bytter de til modellen som ikke er den mest populære, men som er mer nøyaktig i tyrkiske tekniske tekster. Tapet: to uker og korrekturarbeid. Leksjon: eval først, distribuer senere.

Tilfelle 2 — Prosessen som fanger opp hallusinasjonen. En advokatfullmektig ser en "Høyesterettsavgjørelse"-referanse i modellutskriften. Siden prosessen deres har en regel for «verifiser hver referanse», ser han etter avgjørelsen og finner ut at det ikke finnes noen slik avgjørelse; Han laget en modell. Takket være menneskelig verifisering når fabrikkert informasjon aldri kunden. Uten verifikasjonsregelen kunne tapet av omdømme vært alvorlig.

Tilfelle 3 – Tillit med åpenhet. Et e-handelsselskap produserer kundestøttesvar med AI, men legger til en merknad under hvert svar: "Dette svaret ble utarbeidet med støtte for kunstig intelligens og ble gjennomgått av en av våre representanter." Kunder er mer fornøyd med både den raske responsen og selvtilliten ved å se et menneske engasjert. Åpenhet er ikke en svakhet å skjule, men en kilde til tillit.

Svak forespørsel / sterk forespørsel: Verifiserbar utgang

Svak melding:

Fortell meg om de risikable klausulene i denne kontrakten.

Kan passe modell; ingen kilde, ingen tegn til usikkerhet.

Kraftig ledetekst:

Din rolle: kontraktsanalytiker (den endelige avgjørelsen tilhører en advokat). Oppgave: Fremhev potensielt risikable klausuler i følgende kontrakt. For hvert funn: (1) klausulnummer og ordrett sitat, (2) hvorfor det er risikabelt, (3) ditt konfidensnivå (høy/middels/lav). Stol bare på klausuler i teksten; Ikke dikt opp noe som ikke står i teksten. Der du ikke er sikker, skriv "advokatbekreftelse kreves". [kontrakt]

Sterk melding kobler hvert krav til kilden (artikkelnummer + sitering), krever konfidensnivå og forbyr fabrikasjon; Dette gjør hallusinasjonen fangelig.

Kopierbare maler

1. Eval-settdesign:

Design et evalueringssett for følgende oppgave [TASK]. Foreslå 15 eksempelinndata (blandet lett-middels-vanskelig), hvordan "forventet korrekt utgang" vil bli definert for hver, og bestem et poengkriterium (1-5).

2. Hallusinasjonsreduserende innpakning:

Skriv om følgende melding for å redusere fabrikasjon: "[PROMPT]". Legg til regler for å sitere kilder, spesifisere konfidensnivåer og "fortell meg hvis du ikke er sikker."

3. Verifikasjonsflytdesign:

I følgende arbeidsflyt [WORKFLOW] Design et menneskelig verifiseringstrinn for AI-utdata. Bestem hvor streng verifiseringen skal være basert på kostnadene ved feil; skriv hvem som skal sjekke hva, når.

4. Utkast til retningslinjer for ansvarlig bruk:

Lag en én-sides "policy for ansvarlig AI-bruk" for et team i [INDUSTRY]. Ta med følgende overskrifter: tillatt bruk, forbudte data, verifikasjonsansvar, transparensrapportering, feilrapportering.

Vanlige feil

  • Utrulling uten Eval: Starte modellen uten å teste den med dine egne data og legge merke til feil etter at de gjenspeiles i kunden/jobben.
  • Å stole på hallusinasjoner: Bruke modellens selvsikre språk som sannhet uten å verifisere referansene.
  • Omgå menneskelig verifisering: La utdata være ukontrollert i høykostnadsbeslutninger; Lent seg på "AI did it"-forsvaret.
  • Unngå åpenhet: Skjuler bruken din av AI; opplever tap av tillit når det oppstår.
  • Ignorerer etikk og skjevhet: Bruker sensitive beslutninger (ansettelser, kreditt) uten å overvåke rettferdigheten til resultatet.

Oppsummert

  • Før du distribuerer en modell, sett opp et lite evalueringssett med dine egne data og test kandidatene; generelle rangeringer representerer ikke virksomheten din.
  • Hallusinasjon er modellens selvsikre produksjon av falskt språk; Fanget opp av kildeattribusjon, tillitsnivå og menneskelig verifisering.
  • Stringensen av menneskelig verifisering justeres i henhold til kostnadene ved feil; På kritiske områder er AI kun støtte, avgjørelsen er menneskelig.
  • Åpenhet, skjevhetskontroll, konfidensialitet og ansvarlighet; er de fire pilarene for ansvarlig AI-bruk. Én side policy forhindrer store risikoer.

Søknadsoppgave

Sett opp et evalueringssett med 15 eksempler med mal 1 i denne enheten (evalsettdesign) for kandidatmodellen(e) du valgte gjennom hele modulen og sammenlign minst to modeller mot dette settet. Design deretter hvordan utdataene skal verifiseres av mennesker med mal 3 (valideringsflyt) og lag utkast til en policy på én side for teamet ditt med mal 4 (policy for ansvarlig bruk). Disse tre leveransene gjør hele modulen til en brukbar distribusjonsplan.

sjekkliste

  • [ ] Med mine egne data kan jeg sette opp et lite evalueringssett og sammenligne modeller.
  • [ ] Jeg kan gjenkjenne hallusinasjoner og bruke formildende og stoppende tiltak.
  • [ ] Jeg kan justere strengheten til menneskelig verifisering basert på kostnadene ved feil.
  • [ ] Jeg kan legge inn prinsipper for åpenhet, partiskhet, konfidensialitet og ansvarlighet i arbeidsflyten.
  • [ ] Jeg kan utarbeide en policy for ansvarlig AI-bruk på én side.

Moduleksamen

1. Hva er forskjellen mellom en AI 'leverandør' og en 'modellfamilie'?

  • A) Leverandøren er selskapet som utvikler modellen, og modellfamilien er modellgruppen til det selskapet under et merke ✔
  • B) De er nøyaktig det samme og brukes om hverandre
  • C) Leverandør er prisen på modellen, modellfamilien er modellens hastighet.
  • D) Modellfamilie refererer til selskapet, leverandør refererer til en enkelt modellversjon

Beskrivelse: Leverandøren er selskapet som utviklet modellen (f.eks. Anthropic); Modellfamilie er modellgruppen som det selskapet samler under et merke (for eksempel Claude). Modellversjon er en spesifikk versjon innenfor familien.

2. Hvordan kan 'vektene' til en modell defineres mest nøyaktig?

  • A) Det er antall tokens som modellen kan produsere per minutt
  • B) Det er milliarder av numeriske parametere som modellen lærer under trening og lagrer informasjonen. ✔
  • C) Det er den månedlige abonnementsavgiften til modellen
  • D) Det er antall språk som støttes av modellen

Beskrivelse: Vekter er milliarder av numeriske parametere som modellen lærer under trening; Det er der "alt modellen vet" lagres. Den lukkede/eksplisitte vektforskjellen avhenger av om disse parameterne kan lastes ned og kjøres.

3. Hvilket utsagn er sant om 'open-weight' og 'open-source'?

  • A) De er nøyaktig de samme konseptene og gir begge ubegrenset kommersiell bruk
  • B) Åpen vekt gjør alltid treningsdataene offentlige også
  • C) Det er ikke det samme; Ved åpen vekting deles vanligvis bare parametere og lisensvilkår kan begrense kommersiell bruk ✔
  • D) Åpen kildekode-modeller kan ikke lastes ned, åpne vektmodeller kan lastes ned

Forklaring: I åpen vekting deles bare modellparametere; opplæringsdata og prosesser blir ofte ikke avslørt, og noen lisenser begrenser kommersiell bruk. Så "åpen vekt" er ikke akkurat det samme som "åpen kildekode".

4. Hvilket av følgende er det mest avgjørende modelltrekket for et juridisk team som leser og analyserer lange kontrakter?

  • A) Å ha den laveste tokenprisen
  • B) Å ha visuell (multimodal) prosesseringsevne
  • C) Å ha en åpen vekt lisens
  • D) Å ha et bredt kontekstvindu ✔

Forklaring: Modellen trenger et stort kontekstvindu for å behandle lange dokumenter som helhet; Kontekstvinduet er den totale mengden tokens modellen kan huske på om gangen.

5. Hva er sant om token-priser for lukkede vektmodeller?

  • A) Output-tokenet er vanligvis betydelig dyrere enn input-tokenet ✔
  • B) Input og output er alltid nøyaktig samme pris
  • C) Kun fast månedlig avgift belastes, bruksbeløpet er irrelevant
  • D) Input token er alltid mange ganger dyrere enn output

Forklaring: Prisen beregnes per token, og output token modellen produserer er vanligvis flere ganger dyrere enn input token du sender. Derfor øker lange og unødvendige utskrifter kostnadene raskt.

6. Hvilken funksjon i en modell er avgjørende for et regnskapsteam som ønsker å automatisk trekke ut data fra fakturabilder?

  • A) Bredest mulig kontekstvindu
  • B) Multimodalitet (visuell prosesseringsevne) ✔
  • C) Åpen vektsertifikat
  • D) Det høyeste nivået av resonnement

Forklaring: For å forstå visuelt innhold må modellen kunne behandle bilder så vel som tekst, det vil si at den må være multimodal. Multimodalitet er modellens evne til å håndtere flere typer data, som tekst, bilder og noen ganger lyd.

7. Hva er det mest logiske valget for en enkel oppgave med høyt volum (f.eks. positiv/negativ klassifisering av tusenvis av anmeldelser)?

  • A) Alltid den sterkeste og dyreste resonneringsmodellen
  • B) En modell som kun fungerer på åpen vekt og på egen server
  • C) En lett og rimelig modell, fordi oppgaven er enkel og volumet høyt ✔
  • D) Modellen med det bredeste kontekstvinduet

Beskrivelse: En lett, rimelig modell gjør susen for enkle oppgaver med store volum; Bruk av den kraftigste og mest kostbare modellen skaper unødvendige kostnader her. Den riktige tilnærmingen er å matche oppgavens vanskelighetsgrad til modellnivået.

8. Hva utløser sending av tekst som inneholder personopplysninger til en utenlandsbasert AI-leverandør i form av KVKK?

  • A) Det skaper ikke noe juridisk ansvar
  • B) Har kun betydning hvis leverandøren er i EU, i ingen andre tilfeller
  • C) Det er strengt forbudt under alle omstendigheter, uansett om dataene er anonyme eller ikke
  • D) Dataoverføring til utlandet vurderes og er underlagt de spesielle vilkårene til KVKK ✔

Forklaring: Driftsdata på serverne til en leverandør i utlandet regnes som "dataoverføring til utlandet" og er underlagt KVKKs spesielle vilkår om dette emnet (som eksplisitt samtykke, tilstrekkelighetsbeslutning, passende forsikringer).

9. Hva gjør en modells "resonneringsmodus" og hvordan påvirker det kostnadene?

  • A) Det øker nøyaktigheten i komplekse problemer, men øker kostnadene og forsinkelsen ettersom det genererer flere tokens ✔
  • B) Gjør alltid modellen fri
  • C) Øker bare antall språk som støttes av modellen
  • D) Forkort alltid svarene og reduser kostnadene

Beskrivelse: Resonneringsmodus lar modellen 'tenke' trinn for trinn før du gir svaret; Det øker nøyaktigheten i flertrinns og komplekse problemer, men det øker også kostnadene og forsinkelsen fordi det genererer flere tokens.

10. Hva er den mest pålitelige tilnærmingen når du skal evaluere (evaluere) en modell for din egen virksomhet?

  • A) Bare å velge den mest populære modellen og bruke den uten å teste
  • B) Sett opp et lite testsett med dine egne virkelige oppgaver og sammenlign modeller med det ✔
  • C) Bare å se på referansepoengsummen nevnt i annonser
  • D) Godta automatisk modellen med det høyeste kontekstvinduet som det beste

Forklaring: I stedet for å stole blindt på ledertavler, vil å lage et lite testsett med dine egne virkelige oppgaver og sammenligne modeller på dette settet avsløre den som virkelig passer din bedrift.

11. Hvordan bør kunnskapen om at modellutdata kan inneholde "hallusinasjoner" forme arbeidsflyten din?

  • A) Utdataene skal alltid anses som korrekte og publiseres direkte
  • B) Hallusinasjoner sees bare i gratismodeller, ikke i betalte modeller
  • C) Ved kritiske beslutninger må utdata verifiseres av et menneske og kildene må bekreftes ✔
  • D) Hallusinasjonen kan elimineres helt ved ganske enkelt å endre modellen

Forklaring: En hallusinasjon er når modellen produserer informasjon som faktisk ikke er sann, på et selvsikkert språk. På grunn av denne risikoen bør verifisering av utdata fra et menneske være nødvendig, spesielt for juridiske, medisinske og økonomiske avgjørelser.

12. Hva er den grunnleggende logikken i "modellporteføljen"-tilnærmingen som er tatt i bruk av modne institusjoner?

  • A) For å sikre enkelhet ved å få hver jobb utført av en enkelt, dyreste modell.
  • B) Bruker kun den billigste modellen og ignorerer kvaliteten fullstendig
  • C) Ikke bruk noen modeller og gjør alt arbeidet manuelt
  • D) Optimalisere kostnadene og redusere avhengigheten av en enkelt leverandør ved å bruke forskjellige modeller i henhold til oppgaven ✔

Beskrivelse: Modellporteføljen skal bruke ulike modeller i henhold til oppgaven: billig modell for enkle og klumpete jobber, kraftig modell for komplekse jobber, åpen vekt/regional modell for konfidensielle data. Dette både optimerer kostnadene og reduserer avhengigheten av en enkelt leverandør.

13. Hvorfor kan opprinnelsesland og retningslinjer for oppbevaring av data være et kriterium for modellvalg?

  • A) Fordi det direkte påvirker regulatoriske, datasuverenitets- og personvernkrav ✔
  • B) Kun fordi det bestemmer responshastigheten til modellen
  • C) Fordi det bestemmer filformatene som støttes av modellen
  • D) Fordi det ikke har noen praktisk effekt, er det bare en markedsføringsdetalj

Beskrivelse: Land hvor utvikleren av modellen befinner seg og hvor/hvor mye data som er lagret; Det er avgjørende med tanke på lovregulering, datasuverenitet og personvern. For eksempel, for en organisasjon som ønsker å være vert innen EU, blir en regional leverandør eller null lagringsalternativ viktig.

14. Hva forklarer best hvorfor det å lete etter en 'enkelt beste modell' i en oppgave er misvisende?

  • A) Alle modellene har faktisk nøyaktig de samme egenskapene
  • B) Modeller er sterke i forskjellige størrelser, så "best" avhenger av jobbkravet ✔
  • C) Den dyreste modellen er automatisk best til enhver oppgave
  • D) Modellvalg bør gjøres helt tilfeldig

Beskrivelse: Modeller er sterke på ulike dimensjoner som hastighet, kostnad, kontekst, multimodalitet, personvern og resonnement. En modell som er leder på én dimensjon kan være svak på en annen; så "best" avhenger alltid av jobbkravet.