Jedinica 10 / 10

Primjena s kraja na kraj: evaluacija, validacija, etika i granice

Dobici:

  • Sposobnost postavljanja malog skupa testova (eval) koji procjenjuje model s vašim vlastitim podacima
  • Ugradite ljudsku verifikaciju, ograničenja i politiku odgovornog korišćenja u radni tok
  • Prepoznajte halucinacije, privatnost i etičke rizike i implementirajte mjere ublažavanja

Odabrali ste pravi model; Je li posao obavljen? Ne, pravi posao počinje sada. Stavljanje modela u vaše poslovanje svodi se na njegovo testiranje u odnosu na vaše vlastite podatke, validaciju njegovih rezultata i odgovorno uokvirivanje. Ova završna jedinica pretvara cijeli modul u end-to-end aplikaciju: naučit ćete kako postaviti mali test paket (eval), ugraditi ljudsku verifikaciju u radni tok, upravljati halucinacijama i rizicima privatnosti i povući etičke granice. Kada se jedinica završi, bićete opremljeni ne samo da odaberete model, već i da ga s povjerenjem stavite u rad.

Evaluacija (Eval): testiranje s vlastitim podacima

Sada znate da samo vaši stvarni podaci, a ne oglasi, mogu reći da li model odgovara vašem poslovanju. Način da se to izmjeri je postavljanje skupa evaluacije (eval): mala zbirka uzoraka iz vašeg rada za koje je poznat tačan odgovor.

Jednostavna procjena je postavljena ovako:

  1. Prikupite 10-30 pravih uzoraka. Odaberite unose koji su tipični za vaš posao (pomiješajte teško i lako).
  2. Odredite "tačan/očekivani rezultat" za svaki primjer. Šta bi stručnjak odgovorio?
  3. Provedite kandidate kroz iste primjere. Testirajte modele koje upoređujete jedan po jedan sa istim kompletom.
  4. Ocenite rezultate. U koliko primjera je to istina? Gdje je pogriješio? Da li su greške prihvatljive?
  5. Uporedite i izaberite. Izaberite ne najviši ukupni rezultat, već onaj koji je najpouzdaniji u najkritičnijim primjerima za vas.
Savjet: Nemojte slijepo vjerovati rang listama. Model može biti na prvom mjestu na globalnom nivou, ali ima lošije rezultate od modela na drugom mjestu u vašim specifičnim turskim pravnim tekstovima. Vaša vlastita procjena od 20 uzoraka vrijedi više od stotina javnih testova.

Halucinacije: Najpodmukliji rizik modela

Halucinacija je kada model proizvede informacije koje zapravo nisu istinite, na pouzdanom jeziku. Umjesto da kaže „ne znam“, model može proizvesti nepostojeći zakon, izmišljenu statistiku ili lažni datum; Štaviše, on to radi na izuzetno uvjerljivom jeziku. Ovo je najopasniji aspekt AI jer se greška maskira kao istina.

Halucinaciju ne možete potpuno eliminirati, ali je možete smanjiti i uhvatiti:

  • Zasnovajte na izvoru: Zamolite model da generiše odgovore iz dokumenata koje date, a ne iz sopstvene "memorije" (RAG logika).
  • Izvori zahtjeva: Recite: "Pored svakog zahtjeva napišite dokument/odjeljak na kojem se zasniva"; Ako ne može dati izvor, budite sumnjičavi.
  • Natjerati ljude da kažu da nisu sigurni: Uputa "Ako niste sigurni, napišite 'nije jasno'" smanjuje prilagođavanje modela.
  • Ljudska provjera: Kritične rezultate mora provjeriti čovjek.
Oprez: Nikada nemojte koristiti izlaz modela bez potvrđivanja za pravne, medicinske ili finansijske odluke. "Članak zakona" ili "informacija o dozi" proizveden od strane modela mogu biti potpuno izmišljeni. U ovim oblastima, AI je nacrt/preliminarni alat; Kompetentna osoba uvijek ima zadnju riječ.

Zahtjev za ljudsku verifikaciju

Umjetna inteligencija najbolje funkcionira kao alat koji ubrzava ljude, a ne ostavlja ih bez posla. Ispravno podešavanje je kako slijedi: proizvodi ili unaprijed kvalifikuje nacrt modela; ljudi pregledaju, ispravljaju i odobravaju. Koliko stroga verifikacija treba da bude zavisi od cene greške.

Quest

Trošak greške

ljudska verifikacija

Nacrt opisa proizvoda

nisko

Kontrola uzorka je dovoljna

Odgovor korisnika putem e-pošte

srednje

Pregled prije podnošenja

Analiza rizika ugovora

visoko

Stručna potvrda članak po članak

Medicinski/finansijski savjeti

veoma visoko

Potpuna stručna verifikacija, samo AI podrška

Ova tabela uspostavlja ravnotežu između "ručne provjere svakog izlaza" i "uopće ne provjere". Dok je kontrola uzorka dovoljna za poslove sa niskim troškovima, svaki izlaz mora biti verifikovan za poslove visoke cijene.

Etičko i odgovorno korištenje

Iako odabir modela može izgledati kao tehnička odluka, iza toga se kriju etičke odgovornosti:

  • Transparentnost: Obavijestite svoje klijente ili zaposlenike da koristite AI na odgovarajućim mjestima. Kupac ima pravo da zna da li razgovara sa čovekom ili AI.
  • Pristrasnost: modeli mogu naslijediti pristrasnost iz podataka na kojima su obučeni. Pratite pravednost rezultata u osjetljivim oblastima kao što su zapošljavanje i kreditna procjena.
  • Privatnost: Ugradite principe zaštite podataka koje ste naučili u jedinici 8 u tok rada; Nemojte bezobzirno slati lične podatke.
  • Odgovornost: Kada dođe do greške, odbrana "AI je to napravila" nije dovoljna. Odgovornost je na ustanovi koja koristi vozilo. Dakle, procesi verifikacije dokumenata.
Savjet: Upišite malu „politiku odgovornog korištenja“ u svoj radni tok: koji poslovi mogu koristiti AI, koji podaci se ne mogu slati, ko će to provjeriti i kako će se greške prijavljivati. Ovaj dokument na jednoj stranici sprečava velike probleme u budućnosti.

Tri realna slučaja

Slučaj 1 — Žaljenje bez utvrđivanja procjene. Tim osiguranja počinje sa sumiranjem šteta bez testiranja najpopularnijeg modela. Nakon dvije sedmice shvaćaju da model često griješi u turskim tehničkim terminima i pogrešno čita neke iznose. Kada postave procjenu od 20 uzoraka i uporede tri modela, prelaze na model koji nije najpopularniji, ali je precizniji u turskim tehničkim tekstovima. Gubitak: dvije sedmice i lektorski rad. Lekcija: prvo procijenite, a kasnije rasporedite.

Slučaj 2 — Proces koji hvata halucinaciju. Paralegal vidi referencu na "odluku Vrhovnog suda" u modelu ispisa. Pošto njihov proces ima pravilo "provjeri svaku referencu", on traži odluku i nalazi da takva odluka ne postoji; On je napravio model. Zahvaljujući ljudskoj provjeri, izmišljene informacije nikada ne dođu do klijenta. Bez pravila verifikacije, gubitak ugleda mogao bi biti ozbiljan.

Slučaj 3 — Poverenje sa transparentnošću. Kompanija za e-trgovinu proizvodi odgovore korisničke podrške pomoću AI, ali dodaje napomenu ispod svakog odgovora: "Ovaj odgovor je pripremljen uz podršku umjetne inteligencije i pregledao ga je jedan od naših predstavnika." Kupci su zadovoljniji i brzim odgovorom i samopouzdanjem da vide ljudsko biće koje je angažovano. Transparentnost nije slabost koju treba sakriti, već izvor povjerenja.

Slaba prompt / jaka prompt: Provjerljivi izlaz

Slab upit:

Recite mi o rizičnim klauzulama ovog ugovora.

Može odgovarati modelu; nema izvora, nema znakova nesigurnosti.

Snažan upit:

Vaša uloga: ugovorni analitičar (konačna odluka pripada advokatu). Zadatak: Istaknite potencijalno rizične klauzule u sljedećem ugovoru. Za svaki nalaz: (1) broj klauzule i doslovni citat, (2) zašto je rizično, (3) nivo vašeg povjerenja (visok/srednji/nizak). Oslonite se samo na klauzule u tekstu; Ne izmišljajte ništa čega nema u tekstu. Gdje niste sigurni, napišite "potrebna potvrda advokata". [ugovor]

Jaka brza veza svake tvrdnje sa izvorom (broj članka + citat), zahtijeva nivo povjerenja i zabranjuje izmišljanje; Ovo čini halucinaciju uhvatljivom.

Copiable Templates

1. Eval scenografija:

Dizajnirajte skup evaluacije za sljedeći zadatak [TASK]. Predložite 15 uzoraka unosa (pomiješano lako-srednje-teško), kako bi se definirao "očekivani tačan rezultat" za svaki i odredite kriterij bodovanja (1-5).

2. Oblog za smanjenje halucinacija:

Ponovo napišite sljedeću prompt da biste smanjili fabrikovanje: "[PROMPT]". Dodajte pravila za citiranje izvora, navodeći nivoe pouzdanosti i "recite mi ako niste sigurni".

3. Dizajn toka verifikacije:

U sljedećem toku rada [WORKFLOW] Dizajnirajte korak ljudske verifikacije za AI izlaz. Odredite koliko stroga verifikacija treba da bude zasnovana na ceni greške; napišite ko će šta, kada proveravati.

4. Nacrt politike odgovornog korišćenja:

Nacrtajte "politiku odgovornog korištenja umjetne inteligencije" na jednoj stranici za tim u [INDUSTRIJA]. Uključite sljedeće naslove: dozvoljene upotrebe, zabranjeni podaci, odgovornost za verifikaciju, transparentno izvještavanje, prijavljivanje grešaka.

Uobičajene greške

  • Implementacija bez Eval-a: Pokretanje modela bez testiranja sa vlastitim podacima i uočavanje grešaka nakon što se odraze na klijenta/posla.
  • Oslanjanje na halucinacije: korištenje pouzdanog jezika modela kao istine bez provjere referenci.
  • Zaobilazeći ljudsku verifikaciju: ostavljajući izlaz neprovjerenim u odlukama sa visokim troškovima; Oslanjajući se na odbranu „AI je to uradila“.
  • Izbjegavanje transparentnosti: skrivanje vaše upotrebe AI; doživite gubitak samopouzdanja kada se to dogodi.
  • Ignoriranje etike i pristrasnosti: Korištenje osjetljivih odluka (zapošljavanje, kredit) bez praćenja pravednosti rezultata.

Ukratko

  • Prije implementacije modela, postavite mali skup za procjenu sa svojim vlastitim podacima i testirajte kandidate; ukupna rang lista ne predstavlja vaš posao.
  • Halucinacija je modelova samouvjerena proizvodnja lažnog jezika; Snimljeno atribucijom izvora, nivoom povjerenja i ljudskom provjerom.
  • Strogost ljudske verifikacije se prilagođava prema cijeni greške; U kritičnim oblastima AI je samo podrška, odluka je ljudska.
  • Transparentnost, kontrola pristrasnosti, povjerljivost i odgovornost; su četiri stuba odgovorne upotrebe AI. Politika jedne stranice sprečava velike rizike.

Zadatak aplikacije

Postavite skup za evaluaciju od 15 primjera sa predloškom 1 u ovoj jedinici (procjena seta dizajna) za model(e) kandidata koje ste odabrali kroz modul i uporedite najmanje dva modela sa ovim skupom. Zatim dizajnirajte način na koji će ljudi verificirati izlaz pomoću predloška 3 (tok validacije) i nacrtajte politiku na jednoj stranici za vaš tim sa šablonom 4 (politika odgovornog korištenja). Ova tri rezultata pretvaraju cijeli modul u izvodljiv plan implementacije.

kontrolna lista

  • [ ] Sa svojim vlastitim podacima, mogu postaviti mali skup za procjenu i uporediti modele.
  • [ ] Mogu prepoznati halucinacije i primijeniti mjere ublažavanja i hapšenja.
  • [ ] Mogu prilagoditi strogost ljudske verifikacije na osnovu cijene greške.
  • [ ] Mogu da ugradim principe transparentnosti, pristrasnosti, povjerljivosti i odgovornosti u radni tok.
  • [ ] Mogu izraditi politiku odgovorne upotrebe AI na jednoj stranici.

Modul Exam

1. Koja je razlika između AI „provajdera“ i „porodice modela“?

  • A) Provajder je kompanija koja razvija model, a porodica modela je grupa modela te kompanije pod brendom ✔
  • B) Oni su potpuno ista stvar i koriste se naizmjenično
  • C) Provajder je cijena modela, porodica modela je brzina modela.
  • D) Porodica modela se odnosi na kompaniju, dobavljač se odnosi na jednu verziju modela

Opis: Dobavljač je kompanija koja je razvila model (npr. Anthropic); Porodica modela je grupa modela koju ta kompanija prikuplja pod brendom (na primjer, Claude). Verzija modela je posebna verzija unutar porodice.

2. Kako se 'težine' modela mogu najtačnije definirati?

  • A) To je broj tokena koje model može proizvesti u minuti
  • B) To su milijarde numeričkih parametara koje model uči tokom treninga i pohranjuje svoje informacije. ✔
  • C) To je mjesečna pretplata modela
  • D) To je broj jezika koje model podržava

Opis: Težine su milijarde numeričkih parametara koje model uči tokom treninga; To je mjesto gdje je pohranjeno 'sve što model zna'. Zatvorena/eksplicitna razlika težine zavisi od toga da li se ovi parametri mogu preuzeti i pokrenuti.

3. Koja je tvrdnja tačna o 'open-weight' i 'open-source'?

  • A) To su potpuno isti koncepti i oba daju neograničenu komercijalnu upotrebu
  • B) Otvorena težina uvijek objavljuje i podatke o treningu
  • C) Nije ista stvar; U otvorenom ponderiranju obično se dijele samo parametri i uslovi licence mogu ograničiti komercijalnu upotrebu ✔
  • D) Modeli otvorenog koda se ne mogu preuzeti, modeli otvorenih težina se mogu preuzeti

Objašnjenje: U otvorenom ponderiranju, dijele se samo parametri modela; podaci i procesi obuke često se ne otkrivaju, a neke licence ograničavaju komercijalnu upotrebu. Dakle, 'open weight' nije potpuno isto što i 'open source'.

4. Koja je od sljedećeg najodlučnija karakteristika modela za pravni tim koji čita i analizira duge ugovore?

  • A) Imaju najnižu cijenu tokena
  • B) Imati vizuelnu (multimodalnu) sposobnost obrade
  • C) Imati otvorenu licencu za težinu
  • D) Imati širok prozor konteksta ✔

Objašnjenje: Modelu je potreban veliki kontekstni prozor za obradu dugih dokumenata u cjelini; Prozor konteksta je ukupna količina tokena koju model može imati na umu u jednom trenutku.

5. Što je istina o cijenama tokena za zatvorene modele težine?

  • A) Izlazni token je obično znatno skuplji od ulaznog tokena ✔
  • B) Ulaz i izlaz su uvijek potpuno iste cijene
  • C) Naplaćuje se samo fiksna mjesečna naknada, iznos korištenja nije bitan
  • D) Ulazni token je uvijek mnogo puta skuplji od izlaznog

Objašnjenje: Cijena se izračunava po tokenu, a izlazni token koji model proizvodi je obično nekoliko puta skuplji od ulaznog tokena koji šaljete. Stoga dugi i nepotrebni ispisi brzo povećavaju troškove.

6. Koja je karakteristika modela neophodna za računovodstveni tim koji želi automatski izdvojiti podatke iz slika računa?

  • A) Najširi mogući kontekstni prozor
  • B) Multimodalnost (sposobnost vizuelne obrade) ✔
  • C) Dozvola za otvorenu težinu
  • D) Najviši nivo rezonovanja

Objašnjenje: Da bi razumio vizualni sadržaj, model mora biti u stanju obraditi slike kao i tekst, odnosno mora biti multimodalan. Multimodalnost je sposobnost modela da rukuje više vrsta podataka, kao što su tekst, slike, a ponekad i audio.

7. Koji je najlogičniji izbor za veliki, jednostavan zadatak (npr. pozitivna/negativna klasifikacija hiljada recenzija)?

  • A) Uvijek najjači i najskuplji model rasuđivanja
  • B) Model koji radi samo na otvorenoj težini i na vlastitom serveru
  • C) Lagan i jeftin model, jer je zadatak jednostavan, a zapremina velika ✔
  • D) Model sa najširim kontekstnim prozorom

Opis: Lagani, jeftin model radi trik za jednostavne zadatke velikog obima; Korištenje najmoćnijeg i najskupljeg modela ovdje stvara nepotrebne troškove. Ispravan pristup je uskladiti težinu zadatka s nivoom modela.

8. Šta pokreće slanje teksta koji sadrži lične podatke stranom AI provajderu u smislu KVKK-a?

  • A) Ne stvara nikakvu pravnu odgovornost
  • B) Važno je samo ako je provajder u EU, ni u kom drugom slučaju
  • C) Strogo je zabranjeno u svim okolnostima, bez obzira na to da li su podaci anonimni ili ne
  • D) Prenos podataka u inostranstvo se smatra i podleže posebnim uslovima KVKK ✔

Objašnjenje: Operativni podaci na serverima provajdera u inostranstvu smatraju se 'prenosom podataka u inostranstvo' i podliježu posebnim uslovima KVKK-a o ovoj temi (kao što je izričit pristanak, odluka o adekvatnosti, odgovarajuća jamstva).

9. Šta radi modus 'reasoning' modela i kako to utiče na cijenu?

  • A) Povećava preciznost u složenim problemima, ali povećava troškove i kašnjenje jer generiše više tokena ✔
  • B) Uvijek čini model slobodnim
  • C) Samo povećava broj jezika koje model podržava
  • D) Uvijek skratite odgovore i smanjite troškove

Opis: Reasoning mode omogućava modelu da 'razmišlja' korak po korak prije nego što da odgovor; Povećava preciznost u višestepenim i složenim problemima, ali takođe povećava troškove i kašnjenje jer generiše više tokena.

10. Koji je najpouzdaniji pristup prilikom evaluacije (evaluacije) modela za vlastito poslovanje?

  • A) Samo odabir najpopularnijeg modela i korištenje bez testiranja
  • B) Postavite mali testni set svojih stvarnih zadataka i uporedite modele s njim ✔
  • C) Gledajući samo referentni rezultat koji se spominje u reklamama
  • D) Automatski prihvatite model sa najvišim kontekstom prozora kao najbolji

Objašnjenje: Umjesto da se slijepo oslanjate na ploče s najboljim rezultatima, kreiranje malog testnog skupa vlastitih stvarnih zadataka i poređenje modela na ovom skupu otkrit će onaj koji stvarno odgovara vašem poslovanju.

11. Kako saznanje da rezultat modela može sadržavati 'halucinacije' treba da oblikuje vaš radni tok?

  • A) Izlaz treba uvijek smatrati ispravnim i direktno objavljivati
  • B) Halucinacije se viđaju samo kod besplatnih modela, ne i kod plaćenih modela
  • C) U kritičnim odlukama, izlaz mora biti provjeren od strane čovjeka, a izvori moraju biti potvrđeni ✔
  • D) Halucinacija se može potpuno eliminirati jednostavnom promjenom modela

Objašnjenje: Halucinacija je kada model proizvede informacije koje zapravo nisu istinite, na pouzdanom jeziku. Zbog ovog rizika, treba zahtijevati provjeru rezultata od strane čovjeka, posebno za pravne, medicinske i finansijske odluke.

12. Koja je osnovna logika pristupa 'model portfolia' koji su usvojile zrele institucije?

  • A) Da bi se osigurala jednostavnost tako što će svaki posao obaviti jedan, najskuplji model.
  • B) Koristeći samo najjeftiniji model i potpuno zanemarujući kvalitet
  • C) Nemojte koristiti nikakve modele i sve radite ručno
  • D) Optimiziranje troškova i smanjenje ovisnosti o jednom dobavljaču korištenjem različitih modela prema zadatku ✔

Opis: Portfolio modela je korištenje različitih modela prema zadatku: jeftini model za jednostavne i obimne poslove, moćan model za složene poslove, otvoreni težinski/regionalni model za povjerljive podatke. Ovo istovremeno optimizuje troškove i smanjuje zavisnost od jednog dobavljača.

13. Zašto bi država porijekla i politika zadržavanja podataka mogli biti kriterij za odabir modela?

  • A) Zato što direktno utiče na regulatorne, zahtjeve za suverenitet podataka i privatnost ✔
  • B) Samo zato što određuje brzinu odziva modela
  • C) Zato što određuje formate datoteka koje model podržava
  • D) Budući da nema praktičnog efekta, to je samo marketinški detalj

Opis: Država u kojoj se nalazi programer modela i gdje/koliko se podataka pohranjuje; Odlučujuća je u pogledu pravne regulative, suvereniteta podataka i privatnosti. Na primjer, za organizaciju koja želi biti domaćin unutar EU, regionalni provajder ili opcija nulte memorije postaje važna.

14. Što najbolje objašnjava zašto je traženje 'jednog najboljeg modela' u zadatku pogrešno?

  • A) Svi modeli zapravo imaju potpuno iste mogućnosti
  • B) Modeli su jaki u različitim veličinama, tako da 'najbolji' ovisi o zahtjevima posla ✔
  • C) Najskuplji model je automatski najbolji u svakom zadatku
  • D) Odabir modela treba izvršiti potpuno nasumično

Opis: Modeli su jaki u različitim dimenzijama kao što su brzina, cijena, kontekst, multimodalnost, privatnost i obrazloženje. Model koji je lider u jednoj dimenziji može biti slab u drugoj; tako da 'najbolji' uvijek zavisi od zahtjeva posla.