Enhed 10 / 10

End-to-end ansøgning: Evaluering, validering, etik og grænser

Gevinster:

  • Mulighed for at opsætte et lille testsæt (eval), der evaluerer en model med dine egne data
  • Integrer menneskelig verifikation, begrænsninger og politik for ansvarlig brug i arbejdsgangen
  • Anerkend hallucinationer, privatliv og etiske risici og implementer afbødende foranstaltninger

Du har valgt den rigtige model; Er arbejdet udført? Nej, det rigtige arbejde starter nu. At sætte en model ind i din virksomhed handler om at teste den mod dine egne data, validere dens output og udforme den ansvarligt. Denne sidste enhed forvandler hele modulet til en ende-til-ende-applikation: du lærer, hvordan du opsætter en lille testsuite (eval), indlejrer menneskelig verifikation i arbejdsgangen, håndterer hallucinations- og privatlivsrisici og trækker etiske grænser. Når enheden er færdig, vil du være udstyret til ikke kun at vælge en model, men også idriftsætte den med tillid.

Evaluering (Eval): Test med dine egne data

Nu ved du, at kun dine faktiske data, ikke annoncer, kan fortælle, om en model passer til din virksomhed. Måden at måle dette på er at opsætte et evalueringssæt (eval): en lille samling af prøver fra dit arbejde, hvor det rigtige svar er kendt.

En simpel eval er sat op sådan:

  1. Saml 10-30 rigtige prøver. Vælg input, der er typiske for dit job (mix svært og nemt).
  2. Bestem det "korrekte/forventede output" for hvert eksempel. Hvad ville en ekspert svare?
  3. Kør kandidater gennem de samme eksempler. Test de modeller, du sammenligner en efter en med det samme sæt.
  4. Score resultaterne. I hvor mange eksempler er det sandt? Hvor gik han galt? Er fejl acceptable?
  5. Sammenlign og vælg. Vælg ikke den højeste samlede score, men den, der er mest pålidelig i de mest kritiske eksempler for dig.
Tip: Stol ikke blindt på ranglisterne. En model kan placeres først globalt, men klarer sig dårligere end andenpladsmodellen i dine specifikke tyrkiske lovtekster. Din egen vurdering af 20 prøver er mere værd end hundredvis af offentlige tests.

Hallucination: Modellens mest snigende risiko

En hallucination er, når modellen producerer information, der faktisk ikke er sand, i et selvsikkert sprog. I stedet for at sige "Jeg ved det ikke", kan modellen producere et ikke-eksisterende stykke lovgivning, en opdigtet statistik eller en falsk dato; Desuden gør han dette i et yderst overbevisende sprog. Dette er det farligste aspekt af kunstig intelligens, fordi fejl forklæder sig som sandhed.

Du kan ikke eliminere hallucinationen fuldstændigt, men du kan reducere den og fange den:

  • Baser det på kilden: Bed modellen om at generere svar fra de dokumenter, du leverer, ikke fra sin egen "hukommelse" (RAG-logik).
  • Anmod om kilder: Sig: "Ved siden af ​​hver påstand, skriv dokumentet/afsnittet, som det er baseret på"; Hvis han ikke kan give en kilde, så vær mistænksom.
  • Få folk til at sige, at de ikke er sikre: Instruktionen "Hvis du ikke er sikker, skriv 'ikke tydelig'" reducerer modeltilpasningen.
  • Menneskelig verifikation: Kritiske output skal verificeres af et menneske.
Forsigtig: Brug aldrig modeloutput uden at validere det for juridiske, medicinske eller økonomiske beslutninger. En "lovartikel" eller "dosisinformation" produceret af modellen kan være fuldstændigt fremstillet. På disse områder er AI et udkast/foreløbigt værktøj; En kompetent person har altid det sidste ord.

Krav til menneskelig verifikation

Kunstig intelligens fungerer bedst som et værktøj, der accelererer mennesker, ikke sætter dem uden arbejde. Den korrekte opsætning er som følger: producerer eller prækvalificerer modeludkastet; mennesket gennemgår, retter og godkender. Hvor streng verifikationen skal være afhænger af omkostningerne ved fejlen.

Quest

Fejlpris

menneskelig verifikation

Udkast til produktbeskrivelse

lav

Prøvekontrol er nok

Kunde-e-mail-svar

medium

Gennemgang forud for indsendelse

Kontraktrisikoanalyse

høj

Artikel for artikel ekspertbekræftelse

Medicinsk/økonomisk rådgivning

meget høj

Fuld ekspertverifikation, kun AI-support

Denne tabel finder balancen mellem "manuel kontrol af hvert output" og "kontrollerer overhovedet ikke." Selvom prøvekontrol er tilstrækkelig til billige job, skal hvert output verificeres for job til høje priser.

Etisk og ansvarlig brug

Selvom modelvalg kan virke som en teknisk beslutning, er der etiske ansvar bagved:

  • Gennemsigtighed: Lad dine kunder eller medarbejdere vide, at du bruger kunstig intelligens på passende steder. En kunde har ret til at vide, om de taler med et menneske eller AI.
  • Bias: Modeller kan arve bias fra de data, som de er trænet på. Overvåg retfærdigheden af ​​resultater på følsomme områder som rekruttering og kreditvurdering.
  • Privatliv: Integrer de databeskyttelsesprincipper, du lærte i enhed 8, i arbejdsgangen; Send ikke personlige data hensynsløst.
  • Ansvarlighed: Når der opstår en fejl, er "AI made it"-forsvaret ikke nok. Ansvaret ligger hos den institution, der bruger køretøjet. Så dokument verifikationsprocesser.
Tip: Skriv en lille "politik for ansvarlig brug" ind i din arbejdsgang: hvilke job kan bruge AI, hvilke data kan ikke sendes, hvem vil verificere det, og hvordan fejl vil blive rapporteret. Dette dokument på én side forhindrer store problemer i fremtiden.

Tre realistiske sager

Sag 1 — Beklager uden at fastslå eval. Et forsikringsteam begynder at opsummere krav uden at teste den mest populære model. Efter to uger indser de, at modellen ofte laver fejl i tyrkiske tekniske termer og læser nogle beløb forkert. Når de opsætter en eval på 20 prøver og sammenligner de tre modeller, skifter de til den model, der ikke er den mest populære, men som er mere præcis i tyrkiske tekniske tekster. Tabet: to uger og korrekturarbejde. Lektion: eval først, implementer senere.

Case 2 - Processen, der fanger hallucinationen. En advokatfuldmægtig ser en henvisning til "Højesterets afgørelse" i modeludskriften. Da deres proces har en regel om "bekræft hver reference", leder han efter beslutningen og finder, at der ikke eksisterer en sådan beslutning; Han lavede en model. Takket være menneskelig verifikation når opdigtede oplysninger aldrig kunden. Uden verifikationsreglen kunne tabet af omdømme have været alvorligt.

Case 3 — Tillid med gennemsigtighed. En e-handelsvirksomhed producerer kundesupportsvar med AI, men tilføjer en note under hvert svar: "Dette svar blev udarbejdet med støtte til kunstig intelligens og blev gennemgået af en af ​​vores repræsentanter." Kunderne er mere tilfredse med både den hurtige respons og selvtilliden ved at se et menneske engageret. Gennemsigtighed er ikke en svaghed at skjule, men en kilde til tillid.

Svag prompt / stærk prompt: Verificerbart output

Svag prompt:

Fortæl mig om de risikable klausuler i denne kontrakt.

Kan passe model; ingen kilde, ingen tegn på usikkerhed.

Kraftig prompt:

Din rolle: kontraktanalytiker (den endelige beslutning tilhører en advokat). Opgave: Fremhæv potentielt risikable klausuler i følgende kontrakt. For hvert fund: (1) klausulnummer og ordret citat, (2) hvorfor det er risikabelt, (3) dit tillidsniveau (høj/middel/lav). Stol kun på klausuler i teksten; Lad være med at opdigte noget, der ikke står i teksten. Hvor du ikke er sikker, skriv "advokatbekræftelse påkrævet". [kontrakt]

Stærk prompt knytter hver påstand til kilden (artikelnummer + citat), kræver pålidelighedsniveau og forbyder fremstilling; Dette gør hallucinationen fangbar.

Kopierbare skabeloner

1. Eval sætdesign:

Design et evalueringssæt til følgende opgave [OPGAVE]. Foreslå 15 prøveinput (blandet let-middel-svært), hvordan det "forventede korrekte output" ville blive defineret for hver, og bestem et scoringskriterium (1-5).

2. Hallucinationsreducerende indpakning:

Omskriv følgende prompt for at reducere fabrikation: "[PROMPT]". Tilføj regler for citering af kilder, angivelse af konfidensniveauer og "fortæl mig, hvis du ikke er sikker."

3. Verifikationsflowdesign:

I følgende workflow [WORKFLOW] Design et menneskeligt verifikationstrin for AI-outputtet. Bestem, hvor stringent verifikationen skal være baseret på omkostningerne ved fejl; skriv hvem der skal tjekke hvad, hvornår.

4. Udkast til politik for ansvarlig brug:

Udarbejd en "politik for ansvarlig AI-brug" på én side for et team i [INDUSTRI]. Inkluder følgende overskrifter: tilladte anvendelser, forbudte data, verifikationsansvar, gennemsigtighedsrapportering, fejlrapportering.

Almindelige fejl

  • Implementering uden Eval: Start af modellen uden at teste den med dine egne data og bemærke fejl, efter de er afspejlet i kunden/jobbet.
  • At stole på hallucination: Brug af modellens selvsikre sprog som sandhed uden at verificere referencerne.
  • Omgåelse af menneskelig verifikation: Lader output være ukontrolleret i højomkostningsbeslutninger; Læner sig på "AI did it"-forsvaret.
  • Undgå gennemsigtighed: Skjul din brug af kunstig intelligens; oplever tab af tillid, når det opstår.
  • Ignorerer etik og skævhed: Brug af følsomme beslutninger (ansættelse, kredit) uden at overvåge outputtets retfærdighed.

Sammenfattende

  • Inden du implementerer en model, skal du opsætte et lille evalueringssæt med dine egne data og teste kandidaterne; overordnede placeringer repræsenterer ikke din virksomhed.
  • Hallucination er modellens selvsikre produktion af falsk sprog; Indfanget af kildetilskrivning, tillidsniveau og menneskelig verifikation.
  • Stringensen af ​​menneskelig verifikation justeres i henhold til omkostningerne ved fejl; På kritiske områder er AI kun støtte, beslutningen er menneskets.
  • Gennemsigtighed, bias kontrol, fortrolighed og ansvarlighed; er de fire søjler i ansvarlig AI-brug. Én side politik forhindrer store risici.

Ansøgningsopgave

Opsæt et evalueringssæt med 15 eksempler med skabelon 1 i denne enhed (eval-sætdesign) for den eller de kandidatmodeller, du valgte i hele modulet, og sammenlign mindst to modeller med dette sæt. Design derefter, hvordan outputtet vil blive verificeret af mennesker med skabelon 3 (valideringsflow), og udarbejde et udkast til en én-sides politik for dit team med skabelon 4 (politik for ansvarlig brug). Disse tre leverancer gør hele modulet til en brugbar implementeringsplan.

tjekliste

  • [ ] Med mine egne data kan jeg opsætte et lille evalueringssæt og sammenligne modeller.
  • [ ] Jeg kan genkende hallucinationer og anvende formildende og standsende foranstaltninger.
  • [ ] Jeg kan justere strengheden af ​​menneskelig verifikation baseret på omkostningerne ved fejl.
  • [ ] Jeg kan integrere principper for gennemsigtighed, bias, fortrolighed og ansvarlighed i arbejdsgangen.
  • [ ] Jeg kan udarbejde en politik for ansvarlig AI-brug på én side.

Modul eksamen

1. Hvad er forskellen mellem en AI 'udbyder' og en 'modelfamilie'?

  • A) Udbyderen er den virksomhed, der udvikler modellen, og modelfamilien er den pågældende virksomheds modelgruppe under et brand ✔
  • B) De er nøjagtig det samme og bruges i flæng
  • C) Udbyder er prisen på modellen, modelfamilie er modellens hastighed.
  • D) Modelfamilie henviser til virksomheden, leverandør henviser til en enkelt modelversion

Beskrivelse: Udbyderen er den virksomhed, der har udviklet modellen (f.eks. Antropisk); Modelfamilie er den modelgruppe, som virksomheden samler under et brand (f.eks. Claude). Modelversion er en specifik version inden for familien.

2. Hvordan kan en models 'vægte' defineres mest præcist?

  • A) Det er antallet af tokens, som modellen kan producere i minuttet
  • B) Det er de milliarder af numeriske parametre, som modellen lærer under træning og gemmer sine informationer. ✔
  • C) Det er modellens månedlige abonnementsgebyr
  • D) Det er antallet af sprog, der understøttes af modellen

Beskrivelse: Vægte er milliarder af numeriske parametre, som modellen lærer under træning; Det er her, 'alt hvad modellen ved' opbevares. Den lukkede/eksplicitte vægt skelnen afhænger af, om disse parametre kan downloades og køres.

3. Hvilket udsagn er sandt om 'open-weight' og 'open-source'?

  • A) De er nøjagtig de samme koncepter og giver begge ubegrænset kommerciel brug
  • B) Åben vægt gør også træningsdataene offentlige
  • C) Det er ikke det samme; Ved åben vægtning er det normalt kun parametre, der deles, og licensvilkår kan begrænse kommerciel brug ✔
  • D) Open source-modeller kan ikke downloades, åbne vægtmodeller kan downloades

Forklaring: I åben vægtning deles kun modelparametre; træningsdata og -processer afsløres ofte ikke, og nogle licenser begrænser kommerciel brug. Så 'åben vægt' er ikke helt det samme som 'open source'.

4. Hvilket af følgende er det mest afgørende modeltræk for et juridisk team, der læser og analyserer lange kontrakter?

  • A) At have den laveste tokenpris
  • B) At have visuel (multimodal) bearbejdningsevne
  • C) At have en åben vægt licens
  • D) At have et bredt kontekstvindue ✔

Forklaring: Modellen har brug for et stort kontekstvindue for at behandle lange dokumenter som helhed; Kontekstvinduet er det samlede antal tokens, som modellen kan huske på ad gangen.

5. Hvad er sandt om token-priser for modeller med lukket vægt?

  • A) Output-tokenet er normalt betydeligt dyrere end input-tokenet ✔
  • B) Input og output er altid nøjagtig samme pris
  • C) Der opkræves kun et fast månedligt gebyr, forbrugsbeløb er irrelevant
  • D) Input token er altid mange gange dyrere end output

Forklaring: Prisen beregnes pr. token, og det output-token, modellen producerer, er normalt flere gange dyrere end det input-token, du sender. Derfor øger lange og unødvendige udskrifter omkostningerne hurtigt.

6. Hvilken funktion i en model er essentiel for et regnskabsteam, der automatisk ønsker at udtrække data fra fakturabilleder?

  • A) Det bredest mulige kontekstvindue
  • B) Multimodalitet (visuel bearbejdningsevne) ✔
  • C) Åben vægt licens
  • D) Det højeste niveau af ræsonnement

Forklaring: For at forstå visuelt indhold skal modellen kunne bearbejde billeder såvel som tekst, det vil sige at den skal være multimodal. Multimodalitet er modellens evne til at håndtere flere typer data, såsom tekst, billeder og nogle gange lyd.

7. Hvad er det mest logiske valg til en enkel opgave med stor volumen (f.eks. positiv/negativ klassificering af tusindvis af anmeldelser)?

  • A) Altid den stærkeste og dyreste ræsonnementmodel
  • B) En model, der kun virker på åben vægt og på egen server
  • C) En let og billig model, fordi opgaven er enkel og volumen høj ✔
  • D) Modellen med det bredeste kontekstvindue

Beskrivelse: En let, lavprismodel gør tricket til enkle, store opgaver; Brug af den mest kraftfulde og dyre model skaber her unødvendige omkostninger. Den korrekte tilgang er at matche opgavens sværhedsgrad til modelniveauet.

8. Hvad udløser afsendelse af tekst med persondata til en udenlandsk-baseret AI-udbyder i form af KVKK?

  • A) Det skaber ikke noget juridisk ansvar
  • B) Det har kun betydning, hvis udbyderen er i EU, i intet andet tilfælde
  • C) Det er strengt forbudt under alle omstændigheder, uanset om dataene er anonyme eller ej
  • D) Dataoverførsel til udlandet betragtes som og er underlagt de særlige betingelser i KVKK ✔

Forklaring: Driftsdata på en udbyders servere i udlandet betragtes som 'dataoverførsel til udlandet' og er underlagt KVKKs særlige betingelser om dette emne (såsom udtrykkeligt samtykke, beslutning om tilstrækkelighed, passende forsikringer).

9. Hvad gør en models 'ræsonnement'-tilstand, og hvordan påvirker det omkostningerne?

  • A) Det øger nøjagtigheden i komplekse problemer, men øger omkostningerne og forsinkelsen, da det genererer flere tokens ✔
  • B) Gør altid modellen fri
  • C) Øger kun antallet af sprog, der understøttes af modellen
  • D) Forkort altid svarene og reducer omkostningerne

Beskrivelse: Begrundelsestilstand gør det muligt for modellen at 'tænke' trin for trin, før de giver svaret; Det øger nøjagtigheden i komplekse problemer med flere trin, men det øger også omkostninger og forsinkelse, fordi det genererer flere tokens.

10. Hvad er den mest pålidelige tilgang, når du skal evaluere (evaluere) en model for din egen virksomhed?

  • A) Bare at vælge den mest populære model og bruge den uden at teste
  • B) Opstil et lille testsæt af dine egne rigtige opgaver og sammenlign modeller med det ✔
  • C) Bare se på benchmark-score nævnt i annoncer
  • D) Accepter automatisk modellen med det højeste kontekstvindue som det bedste

Forklaring: I stedet for blindt at stole på ranglister, vil oprettelse af et lille testsæt af dine egne rigtige opgaver og sammenligne modeller på dette sæt afsløre den, der virkelig passer til din virksomhed.

11. Hvordan skal viden om, at modeloutput kan indeholde 'hallucinationer', forme din arbejdsgang?

  • A) Outputtet skal altid betragtes som korrekt og publiceres direkte
  • B) Hallucination ses kun i gratis modeller, ikke i betalte modeller
  • C) Ved kritiske beslutninger skal output verificeres af et menneske, og kilderne skal bekræftes ✔
  • D) Hallucinationen kan helt elimineres ved blot at ændre modellen

Forklaring: En hallucination er, når modellen producerer information, der ikke er sand, i et sikkert sprog. På grund af denne risiko bør verifikation af output fra et menneske være påkrævet, især for juridiske, medicinske og økonomiske beslutninger.

12. Hvad er den grundlæggende logik i den "modelportefølje"-tilgang, som modne institutioner anvender?

  • A) For at sikre enkelhed ved at få hver opgave udført af en enkelt, dyreste model.
  • B) Bruger kun den billigste model og ignorerer fuldstændig kvalitet
  • C) Brug ingen modeller og gør alt arbejdet manuelt
  • D) Optimering af omkostninger og reduktion af afhængighed af en enkelt udbyder ved at bruge forskellige modeller i henhold til opgaven ✔

Beskrivelse: Modelporteføljen skal bruge forskellige modeller i henhold til opgaven: billig model til simple og omfangsrige job, kraftfuld model til komplekse jobs, åben vægt/regional model for fortrolige data. Dette både optimerer omkostningerne og reducerer afhængigheden af ​​en enkelt udbyder.

13. Hvorfor kan oprindelsesland og dataopbevaringspolitik være et kriterium for valg af model?

  • A) Fordi det direkte påvirker lovgivning, datasuverænitet og privatlivskrav ✔
  • B) Kun fordi det bestemmer modellens responshastighed
  • C) Fordi det bestemmer de filformater, der understøttes af modellen
  • D) Fordi det ikke har nogen praktisk effekt, er det blot en markedsføringsdetalje

Beskrivelse: Land, hvor udvikleren af modellen er placeret, og hvor/hvor meget data er lagret; Det er afgørende med hensyn til juridisk regulering, datasuverænitet og privatliv. For eksempel, for en organisation, der ønsker at være vært inden for EU, bliver en regional udbyder eller nul-lagringsmulighed vigtig.

14. Hvad forklarer bedst, hvorfor det er misvisende at lede efter en 'enkelt bedste model' i en opgave?

  • A) Alle modeller har faktisk nøjagtig de samme muligheder
  • B) Modeller er stærke i forskellige størrelser, så 'bedst' afhænger af jobkravet ✔
  • C) Den dyreste model er automatisk den bedste til enhver opgave
  • D) Modelvalg bør foretages helt tilfældigt

Beskrivelse: Modeller er stærke på forskellige dimensioner såsom hastighed, omkostninger, kontekst, multimodalitet, privatliv og ræsonnement. En model, der er leder på én dimension, kan være svag på en anden; så 'bedst' afhænger altid af jobkravet.