Jedinica 10 / 10

Primjena od kraja do kraja: evaluacija, provjera valjanosti, etika i granice

Dobici:

  • Sposobnost postavljanja malog testnog skupa (eval) koji procjenjuje model s vašim vlastitim podacima
  • Ugradite ljudsku provjeru, ograničenja i politiku odgovorne upotrebe u tijek rada
  • Prepoznati halucinacije, rizike privatnosti i etičke rizike i primijeniti mjere za njihovo ublažavanje

Odabrali ste pravi model; Je li posao obavljen? Ne, pravi posao počinje sada. Stavljanje modela u vaše poslovanje svodi se na njegovo testiranje u odnosu na vlastite podatke, provjeru valjanosti rezultata i odgovorno oblikovanje. Ova posljednja jedinica pretvara cijeli modul u aplikaciju od kraja do kraja: naučit ćete kako postaviti mali testni paket (eval), ugraditi ljudsku provjeru u tijek rada, upravljati halucinacijama i rizicima privatnosti i povući etičke granice. Nakon što je jedinica gotova, bit ćete opremljeni ne samo za odabir modela, već i za puštanje u rad s povjerenjem.

Evaluacija (Eval): testiranje s vlastitim podacima

Sada znate da samo vaši stvarni podaci, a ne oglasi, mogu reći odgovara li model vašem poslovanju. Način da se to izmjeri je postavljanje skupa za ocjenjivanje (eval): male zbirke uzoraka iz vašeg rada za koje je poznat točan odgovor.

Jednostavna eval je postavljena ovako:

  1. Prikupite 10-30 pravih uzoraka. Odaberite inpute koji su tipični za vaš posao (pomiješajte teške i lake).
  2. Odredite "točan/očekivani rezultat" za svaki primjer. Što bi stručnjak odgovorio?
  3. Provedite kandidate kroz iste primjere. Testirajte modele koje uspoređujete jedan po jedan s istim setom.
  4. Ocijenite rezultate. U koliko je to primjera točno? Gdje je pogriješio? Jesu li pogreške prihvatljive?
  5. Usporedi i odaberi. Odaberite ne najviši ukupni rezultat, već onaj koji je najpouzdaniji u najkritičnijim primjerima za vas.
Savjet: nemojte slijepo vjerovati pločama s najboljim rezultatima. Model može biti na prvom mjestu na globalnoj razini, ali ima lošije rezultate od drugoplasiranog modela u vašim specifičnim turskim pravnim tekstovima. Vaša vlastita procjena 20 uzoraka vrijedi više od stotina javnih testova.

Halucinacija: modelov najpodmukliji rizik

Halucinacija je kada model proizvodi informacije koje zapravo nisu istinite, samouvjerenim jezikom. Umjesto da kaže "ne znam", model bi mogao proizvesti nepostojeći dio zakona, izmišljenu statistiku ili lažni datum; Štoviše, on to čini izuzetno uvjerljivim jezikom. Ovo je najopasniji aspekt umjetne inteligencije jer se pogreška pretvara u istinu.

Halucinaciju ne možete potpuno eliminirati, ali je možete smanjiti i uhvatiti je:

  • Temeljite se na izvoru: Zamolite model da generira odgovore iz dokumenata koje ste dali, a ne iz vlastite "memorije" (RAG logika).
  • Izvori zahtjeva: Recite: "Pored svake tvrdnje napišite dokument/odjeljak na kojem se temelji"; Ako ne može dati izvor, budite sumnjičavi.
  • Natjerati ljude da kažu da nisu sigurni: Uputa "Ako niste sigurni, napišite 'nije jasno'" smanjuje uklapanje modela.
  • Ljudska provjera: Kritične rezultate mora provjeriti čovjek.
Oprez: Nikada nemojte koristiti izlaz modela bez provjere valjanosti za pravne, medicinske ili financijske odluke. "Zakonski članak" ili "informacije o dozi" koje proizvodi model mogu biti potpuno izmišljeni. U tim područjima AI je nacrt/preliminarni alat; Kompetentna osoba uvijek ima zadnju riječ.

Zahtjev za ljudsku provjeru

Umjetna inteligencija najbolje funkcionira kao alat koji ubrzava ljude, a ne ostavlja ih bez posla. Ispravna postavka je sljedeća: proizvodi ili pretkvalificira nacrt modela; ljudski pregledava, ispravlja i odobrava. Koliko stroga provjera treba biti ovisi o cijeni pogreške.

Potraga

Cijena pogreške

ljudska provjera

Skica opisa proizvoda

nizak

Dovoljna je kontrola uzorka

Odgovor korisnika putem e-pošte

srednji

Pregled prije podnošenja

Analiza rizika ugovora

visoka

Članak po članak stručna potvrda

Medicinski/financijski savjet

vrlo visoko

Potpuna stručna provjera, samo AI podrška

Ova tablica uspostavlja ravnotežu između "ručne provjere svakog izlaza" i "neprovjeravanja uopće". Dok je kontrola uzorka dovoljna za jeftine poslove, svaki rezultat mora biti verificiran za skupe poslove.

Etičko i odgovorno korištenje

Iako se odabir modela može činiti kao tehnička odluka, iza toga stoje etičke odgovornosti:

  • Transparentnost: Neka vaši klijenti ili zaposlenici znaju da koristite AI na odgovarajućim mjestima. Kupac ima pravo znati razgovara li s čovjekom ili umjetnom inteligencijom.
  • Pristranost: modeli mogu naslijediti pristranost iz podataka na kojima su obučeni. Pratite pravednost ishoda u osjetljivim područjima kao što su zapošljavanje i kreditna procjena.
  • Privatnost: Ugradite načela zaštite podataka koja ste naučili u jedinici 8 u tijek rada; Nemojte nepromišljeno slati osobne podatke.
  • Odgovornost: kada se dogodi pogreška, obrana "AI je uspjela" nije dovoljna. Odgovornost je na ustanovi koja koristi vozilo. Dakle, procesi provjere dokumenata.
Savjet: Napišite malu “pravila odgovorne upotrebe” u svoj tijek rada: koji poslovi mogu koristiti AI, koji se podaci ne mogu slati, tko će ih potvrditi i kako će se pogreške prijavljivati. Ovaj dokument od jedne stranice sprječava veće probleme u budućnosti.

Tri realna slučaja

Slučaj 1 — Žaljenje bez utvrđivanja vrijednosti. Osiguravateljski tim počinje sažimati zahtjeve bez testiranja najpopularnijeg modela. Nakon dva tjedna shvaćaju da model često griješi u turskim tehničkim terminima i krivo očitava neke iznose. Kada postave procjenu od 20 uzoraka i usporede tri modela, prebacuju se na model koji nije najpopularniji, ali je točniji u turskim tehničkim tekstovima. Gubitak: dva tjedna i rad na lektoriranju. Lekcija: prvo eval, implementiraj kasnije.

Slučaj 2 — Proces kojim se hvata halucinacija. Pomoćni pravnik vidi referencu "odluke Vrhovnog suda" u ispisu modela. Budući da njihov proces ima pravilo "provjeri svaku referencu", on traži odluku i otkriva da takva odluka ne postoji; Izmislio je model. Zahvaljujući ljudskoj provjeri, izmišljene informacije nikad ne dođu do klijenta. Bez pravila provjere gubitak ugleda mogao bi biti ozbiljan.

Slučaj 3 — Povjerenje s transparentnošću. Tvrtka za e-trgovinu proizvodi odgovore korisničke podrške s umjetnom inteligencijom, ali dodaje bilješku ispod svakog odgovora: "Ovaj odgovor pripremljen je uz podršku umjetne inteligencije i pregledao ga je jedan od naših predstavnika." Kupci su zadovoljniji i brzim odgovorom i samopouzdanjem kada vide angažirano ljudsko biće. Transparentnost nije slabost koju treba skrivati, već izvor povjerenja.

Slab odziv / jak upit: provjerljivi izlaz

Slab upit:

Recite mi o rizičnim klauzulama ovog ugovora.

Može odgovarati modelu; nema izvora, nema znakova nesigurnosti.

Snažan upit:

Vaša uloga: ugovorni analitičar (konačnu odluku donosi odvjetnik). Zadatak: Istaknite potencijalno rizične klauzule u sljedećem ugovoru. Za svaki nalaz: (1) broj odredbe i doslovni citat, (2) zašto je rizično, (3) vaša razina povjerenja (visoka/srednja/niska). Oslanjajte se samo na rečenice u tekstu; Nemojte izmišljati ništa što nije u tekstu. Gdje niste sigurni, napišite "potrebna potvrda odvjetnika". [ugovor]

Jaka brza poveznica svake tvrdnje s izvorom (broj članka + citat), zahtijeva razinu pouzdanosti i zabranjuje izmišljanje; To čini halucinaciju uhvatljivom.

Predlošci koji se mogu kopirati

1. Eval scenografija:

Osmislite skup evaluacije za sljedeći zadatak [ZADATAK]. Predložite 15 uzoraka inputa (mješoviti laki-srednje-teški), kako bi se definirao "očekivani točan izlaz" za svaki i odredite kriterij bodovanja (1-5).

2. Obloga za smanjenje halucinacija:

Prepišite sljedeći prompt kako biste smanjili proizvodnju: "[PROMPT]". Dodajte pravila za navođenje izvora, određivanje razina pouzdanosti i "recite mi ako niste sigurni".

3. Dizajn tijeka verifikacije:

U sljedećem tijeku rada [WORKFLOW] Dizajnirajte korak ljudske provjere za AI izlaz. Odredite koliko bi stroga provjera trebala biti na temelju cijene pogreške; napiši tko će što provjeriti, kada.

4. Nacrt politike odgovornog korištenja:

Nacrtajte "politiku odgovorne upotrebe umjetne inteligencije" na jednoj stranici za tim u [INDUSTRIJA]. Uključite sljedeće naslove: dopuštene uporabe, zabranjeni podaci, odgovornost za provjeru, izvješćivanje o transparentnosti, izvješćivanje o pogreškama.

Uobičajene greške

  • Implementacija bez Eval-a: Pokretanje modela bez testiranja s vlastitim podacima i uočavanje pogrešaka nakon što se reflektiraju u klijentu/poslu.
  • Oslanjanje na halucinacije: korištenje samouvjerenog jezika modela kao istine bez provjere referenci.
  • Zaobilaženje ljudske provjere: Ostavljanje izlaza neprovjerenim u skupim odlukama; Oslanjajući se na obranu "AI je to učinio".
  • Izbjegavanje transparentnosti: skrivanje vaše upotrebe AI; doživljava gubitak povjerenja kada se to dogodi.
  • Ignoriranje etike i pristranosti: Korištenje osjetljivih odluka (zapošljavanje, kredit) bez praćenja pravednosti rezultata.

Ukratko

  • Prije postavljanja modela, postavite mali eval set s vlastitim podacima i testirajte kandidate; ukupni poredak ne predstavlja vašu tvrtku.
  • Halucinacija je samouvjerena proizvodnja lažnog jezika modela; Snimljeno atribucijom izvora, razinom povjerenja i ljudskom provjerom.
  • Strogost ljudske provjere prilagođena je prema cijeni pogreške; U kritičnim područjima AI je samo podrška, odluka je na čovjeku.
  • Transparentnost, kontrola pristranosti, povjerljivost i odgovornost; su četiri stupa odgovorne upotrebe umjetne inteligencije. Politika jedne stranice sprječava velike rizike.

Zadatak aplikacije

Postavite evaluacijski skup od 15 primjera s predloškom 1 u ovoj jedinici (eval set design) za model(e) kandidata koji ste odabrali tijekom modula i usporedite najmanje dva modela s ovim skupom. Zatim osmislite način na koji će ljudi provjeriti rezultat pomoću predloška 3 (tijek provjere valjanosti) i nacrtajte politiku na jednoj stranici za svoj tim pomoću predloška 4 (pravila odgovorne upotrebe). Ova tri rezultata pretvaraju cijeli modul u izvediv plan implementacije.

popis za provjeru

  • [ ] S vlastitim podacima mogu postaviti mali skup procjena i usporediti modele.
  • [ ] Mogu prepoznati halucinacije i primijeniti mjere ublažavanja i zaustavljanja.
  • [ ] Mogu prilagoditi strogost ljudske provjere na temelju cijene pogreške.
  • [ ] Mogu ugraditi načela transparentnosti, pristranosti, povjerljivosti i odgovornosti u tijek rada.
  • [ ] Mogu izraditi politiku odgovorne upotrebe umjetne inteligencije na jednoj stranici.

Modul ispit

1. Koja je razlika između AI 'pružatelja' i 'model obitelji'?

  • A) Davatelj je tvrtka koja razvija model, a obitelj modela je grupa modela te tvrtke pod brendom ✔
  • B) Oni su potpuno ista stvar i koriste se naizmjenično
  • C) Provider je cijena modela, obitelj modela je brzina modela.
  • D) Obitelj modela odnosi se na tvrtku, dobavljač se odnosi na jednu verziju modela

Opis: pružatelj je tvrtka koja je razvila model (npr. Anthropic); Obitelj modela je grupa modela koju ta tvrtka okuplja pod markom (na primjer, Claude). Verzija modela je specifična verzija unutar obitelji.

2. Kako se mogu najtočnije definirati 'težine' modela?

  • A) To je broj žetona koje model može proizvesti u minuti
  • B) To su milijarde numeričkih parametara koje model uči tijekom obuke i pohranjuje svoje informacije. ✔
  • C) To je mjesečna pretplata za model
  • D) To je broj jezika koje model podržava

Opis: Težine su milijarde numeričkih parametara koje model uči tijekom treninga; To je mjesto gdje je pohranjeno 'sve što model zna'. Zatvoreno/eksplicitno razlikovanje težine ovisi o tome mogu li se ti parametri preuzeti i pokrenuti.

3. Koja je tvrdnja točna o 'open-weight' i 'open-source'?

  • A) To su potpuno isti koncepti i oba daju neograničenu komercijalnu upotrebu
  • B) Otvorena težina uvijek javno objavljuje podatke o treningu
  • C) Nije ista stvar; U otvorenom ponderiranju obično se dijele samo parametri, a licencni uvjeti mogu ograničiti komercijalnu upotrebu ✔
  • D) Modeli otvorenog koda ne mogu se preuzeti, otvoreni modeli težine mogu se preuzeti

Objašnjenje: U otvorenom ponderiranju dijele se samo parametri modela; podaci o obuci i procesi često se ne otkrivaju, a neke licence ograničavaju komercijalnu upotrebu. Dakle, "otvorena težina" nije potpuno isto što i "otvoreni kod".

4. Što je od sljedećeg najvažnija značajka modela za pravni tim koji čita i analizira duge ugovore?

  • A) Imati najnižu cijenu tokena
  • B) Posjedovanje sposobnosti vizualne (multimodalne) obrade
  • C) Posjedovanje dozvole za otvorenu težinu
  • D) Imati širok kontekstni prozor ✔

Objašnjenje: Model treba veliki kontekstni prozor za obradu dugačkih dokumenata u cjelini; Kontekstni prozor je ukupna količina tokena koju model može imati na umu u jednom trenutku.

5. Što je istina o cijenama tokena za modele zatvorene težine?

  • A) Izlazni token obično je znatno skuplji od ulaznog tokena ✔
  • B) Input i output su uvijek potpuno iste cijene
  • C) Naplaćuje se samo fiksna mjesečna naknada, iznos upotrebe nije bitan
  • D) Ulazni token je uvijek višestruko skuplji od izlaznog

Objašnjenje: Cijena se izračunava po tokenu, a izlazni token koji model proizvodi obično je nekoliko puta skuplji od ulaznog tokena koji šaljete. Stoga dugi i nepotrebni ispisi brzo povećavaju troškove.

6. Koja je značajka u modelu ključna za računovodstveni tim koji želi automatski izvući podatke iz slika faktura?

  • A) Najširi mogući kontekstni prozor
  • B) Multimodalnost (sposobnost vizualne obrade) ✔
  • C) Dozvola otvorene težine
  • D) Najviša razina rasuđivanja

Objašnjenje: Da bi razumio vizualni sadržaj, model mora moći obraditi slike kao i tekst, odnosno mora biti multimodalan. Multimodalnost je sposobnost modela da rukuje s više vrsta podataka, kao što su tekst, slike i ponekad zvuk.

7. Koji je najlogičniji izbor za jednostavan zadatak velike količine (npr. pozitivna/negativna klasifikacija tisuća recenzija)?

  • A) Uvijek najjači i najskuplji model rasuđivanja
  • B) Model koji radi samo na otvorenoj težini i na vlastitom poslužitelju
  • C) Lagan i jeftin model, jer je zadatak jednostavan, a glasnoća velika ✔
  • D) Model s najširim kontekstnim prozorom

Opis: Lagani, jeftini model čini trik za jednostavne, velike zadatke; Korištenje najsnažnijeg i najskupljeg modela ovdje stvara nepotrebne troškove. Ispravan pristup je uskladiti težinu zadatka s razinom modela.

8. Što pokreće slanje teksta koji sadrži osobne podatke inozemnom pružatelju AI u smislu KVKK?

  • A) Ne stvara nikakvu pravnu odgovornost
  • B) Važno je samo ako je pružatelj usluga u EU, ni u kojem drugom slučaju
  • C) Strogo je zabranjeno u svim okolnostima, bez obzira jesu li podaci anonimni ili ne
  • D) Prijenos podataka u inozemstvo dolazi u obzir i podliježe posebnim uvjetima KVKK ✔

Objašnjenje: Podaci o radu na poslužiteljima pružatelja u inozemstvu smatraju se 'prijenosom podataka u inozemstvo' i podliježu posebnim uvjetima KVKK o ovoj temi (kao što je izričit pristanak, odluka o primjerenosti, odgovarajuća jamstva).

9. Što radi način 'rezoniranja' modela i kako utječe na trošak?

  • A) Povećava točnost u složenim problemima, ali povećava troškove i kašnjenje jer generira više tokena ✔
  • B) Model uvijek čini slobodnim
  • C) Samo povećava broj jezika koje podržava model
  • D) Uvijek skratite odgovore i smanjite troškove

Opis: način rasuđivanja omogućuje modelu da 'razmišlja' korak po korak prije nego što da odgovor; Povećava točnost u složenim problemima s više koraka, ali također povećava troškove i kašnjenje jer generira više tokena.

10. Koji je najpouzdaniji pristup pri procjeni (ocjenjivanju) modela za vlastito poslovanje?

  • A) Samo odabir najpopularnijeg modela i njegovo korištenje bez testiranja
  • B) Postavite mali testni skup svojih stvarnih zadataka i usporedite modele s njim ✔
  • C) Samo gledajući referentni rezultat koji se spominje u oglasima
  • D) Automatski prihvati model s najvećim kontekstnim prozorom kao najbolji

Objašnjenje: Umjesto da se slijepo oslanjate na ploče s najboljim rezultatima, stvaranje malog testnog skupa vlastitih stvarnih zadataka i usporedba modela na ovom skupu otkrit će onaj koji stvarno odgovara vašem poslovanju.

11. Kako bi saznanje da izlazni podaci modela mogu sadržavati 'halucinacije' trebalo oblikovati vaš tijek rada?

  • A) Rezultat se uvijek treba smatrati točnim i izravno objaviti
  • B) Halucinacija se vidi samo u besplatnim modelima, ne i u plaćenim modelima
  • C) U kritičnim odlukama, izlaz mora provjeriti čovjek, a izvori moraju biti potvrđeni ✔
  • D) Halucinacija se može potpuno eliminirati jednostavnom promjenom modela

Objašnjenje: Halucinacija je kada model proizvodi informacije koje zapravo nisu istinite, samouvjerenim jezikom. Zbog ovog rizika trebala bi biti potrebna provjera rezultata od strane ljudi, posebno za pravne, medicinske i financijske odluke.

12. Koja je osnovna logika pristupa 'model portfelja' koji su usvojile zrele institucije?

  • A) Osigurati jednostavnost tako da svaki posao obavlja jedan, najskuplji model.
  • B) Korištenje samo najjeftinijeg modela i potpuno ignoriranje kvalitete
  • C) Nemojte koristiti nikakve modele i sav posao radite ručno
  • D) Optimiziranje troškova i smanjenje ovisnosti o jednom pružatelju korištenjem različitih modela prema zadatku ✔

Opis: portfelj modela je korištenje različitih modela prema zadatku: jeftini model za jednostavne i glomazne poslove, moćan model za složene poslove, otvoreni težinski/regionalni model za povjerljive podatke. Time se optimiziraju troškovi i smanjuje ovisnost o jednom pružatelju usluga.

13. Zašto bi zemlja podrijetla i politika zadržavanja podataka mogli biti kriterij za odabir modela?

  • A) Zato što izravno utječe na regulatorne zahtjeve, zahtjeve vezane uz suverenitet podataka i privatnost ✔
  • B) Samo zato što određuje brzinu odziva modela
  • C) Zato što određuje formate datoteka koje podržava model
  • D) Zato što nema praktičnog učinka, to je samo marketinški detalj

Opis: Država u kojoj se nalazi razvojni programer modela i gdje/koliko podataka je pohranjeno; Odlučujuća je u smislu zakonske regulative, suvereniteta podataka i privatnosti. Na primjer, za organizaciju koja želi biti domaćin unutar EU, regionalni pružatelj usluga ili opcija nulte pohrane postaje važna.

14. Što najbolje objašnjava zašto je traženje 'jednog najboljeg modela' u zadatku pogrešno?

  • A) Svi modeli zapravo imaju potpuno iste mogućnosti
  • B) Modeli su jaki u različitim veličinama, tako da 'najbolji' ovisi o zahtjevima posla ✔
  • C) Najskuplji model automatski je najbolji u svakom zadatku
  • D) Odabir modela treba biti potpuno slučajan

Opis: modeli su jaki u različitim dimenzijama kao što su brzina, cijena, kontekst, multimodalnost, privatnost i rasuđivanje. Model koji je vodeći u jednoj dimenziji može biti slab u drugoj; tako da 'najbolji' uvijek ovisi o zahtjevima posla.