Enhet 10 / 10

End-to-end ansökan: utvärdering, validering, etik och gränser

Vinster:

  • Möjlighet att sätta upp en liten testuppsättning (eval) som utvärderar en modell med egna data
  • Bädda in mänsklig verifiering, gränser och policy för ansvarsfull användning i arbetsflödet
  • Erkänn hallucinationer, integritetsrisker och etiska risker och implementera mildrande åtgärder

Du har valt rätt modell; Är jobbet gjort? Nej, det riktiga arbetet börjar nu. Att lägga in en modell i ditt företag handlar om att testa den mot dina egna data, validera dess produktion och utforma den på ett ansvarsfullt sätt. Den här sista enheten förvandlar hela modulen till en heltäckande applikation: du kommer att lära dig hur du skapar en liten testsvit (eval), bäddar in mänsklig verifiering i arbetsflödet, hanterar hallucinations- och integritetsrisker och drar etiska gränser. När enheten är klar kommer du att vara utrustad för att inte bara välja en modell utan även ta i bruk den med tillförsikt.

Utvärdering (Eval): Testa med dina egna data

Nu vet du att endast din faktiska data, inte annonser, kan avgöra om en modell passar din verksamhet. Sättet att mäta detta är att sätta upp en utvärderingsuppsättning (eval): en liten samling prover från ditt arbete där det korrekta svaret är känt.

En enkel eval ställs in så här:

  1. Samla 10-30 riktiga prover. Välj ingångar som är typiska för ditt jobb (mix svårt och enkelt).
  2. Bestäm "korrekt/förväntad utdata" för varje exempel. Vad skulle en expert svara?
  3. Kör kandidater genom samma exempel. Testa modellerna du jämför en efter en med samma uppsättning.
  4. Gör poäng på resultaten. I hur många exempel är det sant? Var gjorde han fel? Är misstag acceptabla?
  5. Jämför och välj. Välj inte den högsta totalpoängen, utan den som är mest tillförlitlig i de mest kritiska exemplen för dig.
Tips: Lita inte blint på topplistorna. En modell kan rankas först globalt, men prestera sämre än modellen på andra plats i dina specifika turkiska lagtexter. Din egen utvärdering av 20 prover är värd mer än hundratals offentliga tester.

Hallucination: Modellens mest lömska risk

En hallucination är när modellen producerar information som faktiskt inte är sann, på ett säkert språk. Istället för att säga "Jag vet inte", kan modellen producera en icke-existerande lag, en påhittad statistik eller ett falskt datum; Dessutom gör han detta på ett extremt övertygande språk. Detta är den farligaste aspekten av AI eftersom fel maskerar sig som sanning.

Du kan inte eliminera hallucinationen helt, men du kan minska den och fånga den:

  • Basera det på källan: Be modellen att generera svar från de dokument du tillhandahåller, inte från sitt eget "minne" (RAG-logik).
  • Begär källor: Säg, "bredvid varje påstående, skriv dokumentet/avsnittet som det är baserat på"; Om han inte kan ge en källa, var misstänksam.
  • Få folk att säga att de inte är säkra: Instruktionen "Om du inte är säker, skriv "inte tydlig"" minskar modellanpassningen.
  • Mänsklig verifiering: Kritiska utdata måste verifieras av en människa.
Varning: Använd aldrig modellutdata utan att validera det för juridiska, medicinska eller ekonomiska beslut. En "lagartikel" eller "dosinformation" som produceras av modellen kan vara helt tillverkad. Inom dessa områden är AI ett utkast/preliminärt verktyg; En kompetent person har alltid sista ordet.

Krav på mänsklig verifiering

Artificiell intelligens fungerar bäst som ett verktyg som accelererar människor, inte sätter dem arbetslösa. Den korrekta inställningen är som följer: producerar eller förkvalificerar modellutkastet; människan granskar, korrigerar och godkänner. Hur strikt verifieringen behöver vara beror på kostnaden för felet.

Quest

Felkostnad

mänsklig verifiering

Utkast till produktbeskrivning

låg

Provkontroll räcker

Kundens e-postsvar

medium

Granskning före inlämning

Kontraktsriskanalys

hög

Artikel för artikel expertbekräftelse

Medicinsk/ekonomisk rådgivning

mycket hög

Fullständig expertverifiering, endast AI-stöd

Den här tabellen har balansen mellan "manuell kontroll av varje utdata" och "kontrollerar inte alls." Även om provkontroll är tillräcklig för lågkostnadsjobb, måste varje utdata verifieras för jobb med högt pris.

Etisk och ansvarsfull användning

Även om modellval kan verka som ett tekniskt beslut, finns det etiska ansvarsområden bakom det:

  • Transparens: Låt dina kunder eller anställda veta att du använder AI på lämpliga platser. En kund har rätt att veta om de pratar med en människa eller AI.
  • Bias: Modeller kan ärva bias från de data som de tränas på. Övervaka rättvisa resultaten inom känsliga områden som rekrytering och kreditbedömning.
  • Sekretess: Bädda in dataskyddsprinciperna du lärde dig i del 8 i arbetsflödet; Skicka inte personuppgifter hänsynslöst.
  • Ansvar: När ett misstag inträffar räcker inte "AI made it"-försvaret. Ansvaret ligger på den institution som använder fordonet. Så dokumentverifieringsprocesser.
Tips: Skriv en liten "policy för ansvarsfull användning" i ditt arbetsflöde: vilka jobb kan använda AI, vilken data kan inte skickas, vem kommer att verifiera den och hur fel kommer att rapporteras. Detta ensidiga dokument förhindrar stora problem i framtiden.

Tre realistiska fall

Fall 1 — Ånger utan att fastställa eval. Ett försäkringsteam börjar sammanfatta skadefall utan att testa den mest populära modellen. Efter två veckor inser de att modellen ofta gör fel i turkiska tekniska termer och läser vissa belopp felaktigt. När de sätter upp en eval på 20 prover och jämför de tre modellerna byter de till den modell som inte är den mest populära men som är mer exakt i turkiska tekniska texter. Förlusten: två veckor och korrekturarbete. Lektion: eval först, distribuera senare.

Fall 2 — Processen som fångar hallucinationen. En paralegal ser en referens till "Högsta domstolens beslut" i modellutskriften. Eftersom deras process har en regel för "verifiera varje referens", letar han efter beslutet och finner att inget sådant beslut existerar; Han skapade en modell. Tack vare mänsklig verifiering når tillverkad information aldrig kunden. Utan verifieringsregeln kunde förlusten av rykte ha varit allvarlig.

Fall 3 — Förtroende med öppenhet. Ett e-handelsföretag producerar kundsupportsvar med AI, men lägger till en anteckning under varje svar: "Detta svar förbereddes med stöd för artificiell intelligens och granskades av en av våra representanter." Kunderna är mer nöjda med både den snabba responsen och självförtroendet att se en människa engagerad. Transparens är inte en svaghet att dölja, utan en källa till förtroende.

Svag prompt/stark prompt: verifierbar utdata

Svag uppmaning:

Berätta för mig om de riskabla klausulerna i detta kontrakt.

Kan passa modell; ingen källa, inga tecken på osäkerhet.

Kraftfull uppmaning:

Din roll: kontraktsanalytiker (det slutliga beslutet tillhör en advokat). Uppgift: Markera potentiellt riskfyllda klausuler i följande kontrakt. För varje fynd: (1) klausulnummer och ordagrant citat, (2) varför det är riskabelt, (3) din självförtroendenivå (hög/medel/låg). Lita endast på satser i texten; Fabrikat inte något som inte står i texten. Där du inte är säker, skriv "advokatbekräftelse krävs". [kontrakt]

Stark prompt länkar varje påstående till källan (artikelnummer + hänvisning), kräver konfidensnivå och förbjuder tillverkning; Detta gör att hallucinationen kan fångas upp.

Kopierbara mallar

1. Eval scenografi:

Designa en utvärderingsuppsättning för följande uppgift [TASK]. Föreslå 15 exempelingångar (blandat lätt-medelsvårt), hur den "förväntade korrekta utdata" skulle definieras för varje, och bestäm ett poängkriterium (1-5).

2. Hallucinationsreducerande omslag:

Skriv om följande uppmaning för att minska tillverkningen: "[PROMPT]". Lägg till regler för att citera källor, ange konfidensnivåer och "säg till om du inte är säker."

3. Verifieringsflödesdesign:

I följande arbetsflöde [ARBETSFLÖDE] Designa ett mänskligt verifieringssteg för AI-utgången. Bestäm hur strikt verifieringen ska vara baserat på felkostnaden; skriv vem som ska kolla vad, när.

4. Utkast till policy för ansvarsfull användning:

Utforma en ensidig "policy för ansvarig AI-användning" för ett team i [INDUSTRI]. Inkludera följande rubriker: tillåten användning, förbjuden data, verifieringsansvar, transparensrapportering, felrapportering.

Vanliga misstag

  • Implementera utan Eval: Starta modellen utan att testa den med dina egna data och upptäcka fel efter att de återspeglas i kunden/jobbet.
  • Att förlita sig på hallucinationer: Att använda modellens självsäkra språk som sanning utan att verifiera referenserna.
  • Förbigå mänsklig verifiering: lämnar utdata okontrollerad vid högkostnadsbeslut; Lutar dig mot "AI did it"-försvaret.
  • Undvika transparens: Dölja din användning av AI; upplever förlust av förtroende när det inträffar.
  • Ignorera etik och partiskhet: Använda känsliga beslut (anställning, kredit) utan att övervaka rättvisa resultatet.

Sammanfattningsvis

  • Innan du distribuerar en modell, sätt upp en liten eval-set med dina egna data och testa kandidaterna; övergripande ranking representerar inte ditt företag.
  • Hallucination är modellens självsäkra produktion av falskt språk; Fångas av källtillskrivning, förtroendenivå och mänsklig verifiering.
  • Strängheten för mänsklig verifiering justeras efter kostnaden för fel; I kritiska områden är AI bara stöd, beslutet är mänskligt.
  • Transparens, partiskhet, konfidentialitet och ansvarsskyldighet; är de fyra pelarna för ansvarsfull AI-användning. En sidas policy förhindrar stora risker.

Applikationsuppgift

Sätt upp en utvärderingsuppsättning med 15 exempel med mall 1 i denna enhet (evaluppsättningsdesign) för den eller de kandidatmodeller du valde genom hela modulen och jämför minst två modeller mot denna uppsättning. Designa sedan hur resultatet ska verifieras av människor med mall 3 (valideringsflöde) och utarbeta en policy på en sida för ditt team med mall 4 (policy för ansvarsfull användning). Dessa tre leveranser gör hela modulen till en fungerande implementeringsplan.

checklista

  • [ ] Med mina egna data kan jag sätta upp en liten evaluppsättning och jämföra modeller.
  • [ ] Jag kan känna igen hallucinationer och vidta förmildrande och stoppande åtgärder.
  • [ ] Jag kan justera strängheten för mänsklig verifiering baserat på kostnaden för fel.
  • [ ] Jag kan integrera principer om transparens, partiskhet, konfidentialitet och ansvarighet i arbetsflödet.
  • [ ] Jag kan utarbeta en policy för ansvarsfull AI-användning på en sida.

Modulexamen

1. Vad är skillnaden mellan en AI "leverantör" och en "modellfamilj"?

  • A) Leverantören är företaget som utvecklar modellen, och modellfamiljen är modellgruppen för det företaget under ett varumärke ✔
  • B) De är exakt samma sak och används omväxlande
  • C) Leverantör är priset på modellen, modellfamilj är modellens hastighet.
  • D) Modellfamilj avser företaget, leverantör avser en enda modellversion

Beskrivning: Leverantören är det företag som utvecklade modellen (t.ex. Anthropic); Modellfamilj är den modellgrupp som det företaget samlar under ett varumärke (till exempel Claude). Modellversion är en specifik version inom familjen.

2. Hur kan en modells "vikter" definieras mest exakt?

  • A) Det är antalet polletter som modellen kan producera per minut
  • B) Det är de miljarder numeriska parametrar som modellen lär sig under träning och lagrar sin information. ✔
  • C) Det är den månatliga prenumerationsavgiften för modellen
  • D) Det är antalet språk som stöds av modellen

Beskrivning: Vikter är miljarder numeriska parametrar som modellen lär sig under träning; Det är där "allt modellen vet" lagras. Skillnaden mellan stängd och explicit vikt beror på om dessa parametrar kan laddas ner och köras.

3. Vilket påstående är sant om 'open-weight' och 'open-source'?

  • A) De är exakt samma koncept och båda ger obegränsad kommersiell användning
  • B) Öppen vikt gör också träningsdata offentliga
  • C) Det är inte samma sak; I öppen viktning delas vanligtvis bara parametrar och licensvillkor kan begränsa kommersiell användning ✔
  • D) Modeller med öppen källkod kan inte laddas ner, modeller med öppen vikt kan laddas ner

Förklaring: I öppen viktning delas endast modellparametrar; utbildningsdata och processer avslöjas ofta inte, och vissa licenser begränsar kommersiell användning. Så "öppen vikt" är inte exakt detsamma som "öppen källkod".

4. Vilket av följande är det mest avgörande modelldraget för ett juridiskt team som läser och analyserar långa kontrakt?

  • A) Att ha det lägsta tokenpriset
  • B) Att ha visuell (multimodal) bearbetningsförmåga
  • C) Att ha ett körkort för öppen vikt
  • D) Att ha ett brett sammanhangsfönster ✔

Förklaring: Modellen behöver ett stort sammanhangsfönster för att kunna behandla långa dokument som helhet; Kontextfönstret är det totala antalet tokens som modellen kan ha i åtanke åt gången.

5. Vilket är sant om tokenprissättning för modeller med stängd vikt?

  • A) Output-token är vanligtvis betydligt dyrare än input-token ✔
  • B) Ingång och produktion är alltid exakt samma pris
  • C) Endast fast månadsavgift tas ut, användningsbeloppet är irrelevant
  • D) Input token är alltid många gånger dyrare än output

Förklaring: Priset beräknas per token, och output-token som modellen producerar är vanligtvis flera gånger dyrare än input-token du skickar. Därför ökar långa och onödiga utskrifter kostnaderna snabbt.

6. Vilken funktion i en modell är väsentlig för ett redovisningsteam som automatiskt vill extrahera data från fakturabilder?

  • A) Bredast möjliga sammanhangsfönster
  • B) Multimodalitet (visuell bearbetningsförmåga) ✔
  • C) Öppen vikt licens
  • D) Den högsta nivån av resonemang

Förklaring: För att förstå visuellt innehåll måste modellen kunna bearbeta såväl bilder som text, det vill säga den måste vara multimodal. Multimodalitet är modellens förmåga att hantera flera typer av data, såsom text, bilder och ibland ljud.

7. Vilket är det mest logiska valet för en enkel uppgift med stora volymer (t.ex. positiv/negativ klassificering av tusentals recensioner)?

  • A) Alltid den starkaste och dyraste resonemangsmodellen
  • B) En modell som endast fungerar på öppen vikt och på egen server
  • C) En lätt och billig modell, eftersom uppgiften är enkel och volymen hög ✔
  • D) Modellen med det bredaste sammanhangsfönstret

Beskrivning: En lätt, lågkostnadsmodell gör susen för enkla uppgifter med stora volymer; Att använda den mest kraftfulla och dyraste modellen skapar här onödiga kostnader. Det korrekta tillvägagångssättet är att matcha uppgiftens svårighetsgrad till modellnivån.

8. Vad utlöser sändning av text som innehåller personuppgifter till en utlandsbaserad AI-leverantör i termer av KVKK?

  • A) Det skapar inget juridiskt ansvar
  • B) Spelar bara roll om leverantören är i EU, i inget annat fall
  • C) Det är strängt förbjudet under alla omständigheter, oavsett om uppgifterna är anonyma eller inte
  • D) Dataöverföring till utlandet övervägs och omfattas av de särskilda villkoren för KVKK ✔

Förklaring: Driftsdata på en leverantörs servrar utomlands betraktas som "dataöverföring utomlands" och är föremål för de särskilda villkoren från KVKK i detta ämne (såsom uttryckligt samtycke, adekvat beslut, lämpliga garantier).

9. Vad gör en modells "resoneringsläge" och hur påverkar det kostnaden?

  • A) Det ökar noggrannheten i komplexa problem, men ökar kostnaderna och fördröjningen eftersom det genererar fler tokens ✔
  • B) Gör alltid modellen fri
  • C) Ökar bara antalet språk som stöds av modellen
  • D) Förkorta alltid svaren och minska kostnaderna

Beskrivning: Resoneringsläget gör att modellen kan "tänka" steg för steg innan du ger svaret; Det ökar noggrannheten i flerstegs och komplexa problem, men det ökar också kostnaden och fördröjningen eftersom det genererar fler tokens.

10. Vilket är det mest tillförlitliga tillvägagångssättet när man utvärderar (utvärderar) en modell för sin egen verksamhet?

  • A) Bara att välja den mest populära modellen och använda den utan att testa
  • B) Sätt upp en liten testuppsättning av dina egna verkliga uppgifter och jämför modeller med den ✔
  • C) Bara titta på referensresultatet som nämns i annonser
  • D) Acceptera automatiskt modellen med det högsta sammanhangsfönstret som det bästa

Förklaring: Istället för att förlita sig blint på topplistor, skapa en liten testuppsättning av dina egna verkliga uppgifter och jämföra modeller på denna uppsättning avslöja den som verkligen passar ditt företag.

11. Hur bör kunskapen om att modellutdata kan innehålla "hallucinationer" forma ditt arbetsflöde?

  • A) Resultatet ska alltid anses vara korrekt och publiceras direkt
  • B) Hallucinationer ses bara i gratismodeller, inte i betalmodeller
  • C) Vid kritiska beslut måste resultatet verifieras av en människa och källorna måste bekräftas ✔
  • D) Hallucinationen kan helt elimineras genom att helt enkelt byta modell

Förklaring: En hallucination är när modellen producerar information som faktiskt inte är sann, på ett säkert språk. På grund av denna risk bör verifiering av utdata av en människa krävas, särskilt för juridiska, medicinska och ekonomiska beslut.

12. Vilken är den grundläggande logiken i den "modellportfölj"-metod som används av mogna institutioner?

  • A) För att säkerställa enkelhet genom att varje jobb görs av en enda, dyraste modell.
  • B) Använder bara den billigaste modellen och struntar helt i kvalitet
  • C) Använd inga modeller och gör allt arbete manuellt
  • D) Optimera kostnaden och minska beroendet av en enskild leverantör genom att använda olika modeller beroende på uppgiften ✔

Beskrivning: Modellportföljen är att använda olika modeller efter uppgiften: billig modell för enkla och skrymmande jobb, kraftfull modell för komplexa jobb, öppen vikt/regional modell för konfidentiell data. Detta både optimerar kostnaden och minskar beroendet av en enskild leverantör.

13. Varför kan ursprungsland och datalagringspolicy vara ett kriterium för val av modell?

  • A) Eftersom det direkt påverkar reglering, datasuveränitet och integritetskrav ✔
  • B) Bara för att det bestämmer modellens svarshastighet
  • C) Eftersom det bestämmer filformaten som stöds av modellen
  • D) Eftersom det inte har någon praktisk effekt är det bara en marknadsföringsdetalj

Beskrivning: Land där utvecklaren av modellen finns och var/hur mycket data lagras; Det är avgörande när det gäller lagreglering, datasuveränitet och integritet. Till exempel, för en organisation som vill vara värd inom EU, blir en regional leverantör eller nolllagringsalternativ viktigt.

14. Vilket förklarar bäst varför det är missvisande att leta efter en "enda bästa modell" i en uppgift?

  • A) Alla modeller har faktiskt exakt samma kapacitet
  • B) Modeller är starka i olika storlekar, så "bäst" beror på jobbets krav ✔
  • C) Den dyraste modellen är automatiskt den bästa vid varje uppgift
  • D) Modellval bör göras helt slumpmässigt

Beskrivning: Modeller är starka på olika dimensioner som hastighet, kostnad, sammanhang, multimodalitet, integritet och resonemang. En modell som är ledande på en dimension kan vara svag på en annan; så "bäst" beror alltid på jobbets krav.