Unitate 10 / 10

Aplicație end-to-end: evaluare, validare, etică și limite

Câștiguri:

  • Abilitatea de a configura un mic set de teste (eval) care evaluează un model cu propriile date
  • Încorporați verificarea umană, limitele și politica de utilizare responsabilă în fluxul de lucru
  • Recunoașteți halucinațiile, confidențialitatea și riscurile etice și implementați măsuri de atenuare

Ai ales modelul potrivit; Treaba este gata? Nu, adevărata muncă începe acum. Introducerea unui model în afacerea dvs. se rezumă la testarea acestuia pe baza propriilor date, validarea rezultatelor sale și încadrarea lui în mod responsabil. Această unitate finală transformă întregul modul într-o aplicație end-to-end: veți învăța cum să configurați o suită mică de teste (eval), să încorporați verificarea umană în fluxul de lucru, să gestionați halucinațiile și riscurile de confidențialitate și să trasați limite etice. Odată ce unitatea este terminată, veți fi echipat nu numai să selectați un model, ci și să îl puneți în funcțiune cu încredere.

Evaluare (Eval): testare cu propriile date

Acum știi că numai datele tale reale, nu anunțurile, pot spune dacă un model se potrivește afacerii tale. Modul de a măsura acest lucru este de a crea un set de evaluare (eval): o mică colecție de mostre din munca ta pentru care se cunoaște răspunsul corect.

O evaluare simplă este configurată astfel:

  1. Colectați 10-30 de mostre reale. Alegeți intrări care sunt tipice pentru munca dvs. (combinați dificil și ușor).
  2. Determinați „ieșirea corectă/așteptată” pentru fiecare exemplu. Ce ar răspunde un expert?
  3. Conduceți candidații prin aceleași exemple. Testați modelele pe care le comparați unul câte unul cu același set.
  4. Punctează rezultatele. În câte exemple este adevărat? Unde a greșit? Sunt greșelile acceptabile?
  5. Comparați și alegeți. Alegeți nu cel mai mare scor general, ci pe cel mai de încredere în exemplele cele mai critice pentru dvs.
Sfat: nu aveți încredere orbește în clasamente. Un model se poate clasa pe primul loc la nivel global, dar are rezultate mai slabe decât modelul de pe locul doi în textele legale specifice turcești. Evaluarea proprie a 20 de mostre valorează mai mult decât sute de teste publice.

Halucinația: cel mai insidios risc al modelului

O halucinație este atunci când modelul produce informații care nu sunt de fapt adevărate, într-un limbaj încrezător. În loc să spună „Nu știu”, modelul ar putea produce o legislație inexistentă, o statistică inventată sau o dată falsă; Mai mult, face asta într-un limbaj extrem de convingător. Acesta este cel mai periculos aspect al AI, deoarece eroarea se mascadă drept adevăr.

Nu poți elimina complet halucinația, dar o poți reduce și prinde:

  • Bazați-vă pe sursă: cereți modelului să genereze răspunsuri din documentele pe care le furnizați, nu din propria „memorie” (logica RAG).
  • Surse de solicitare: Spuneți „Lângă fiecare revendicare, scrieți documentul/secțiunea pe care se bazează”; Dacă nu poate da o sursă, fii suspicios.
  • A face oamenii să spună că nu sunt siguri: instrucțiunea „Dacă nu sunteți sigur, scrieți „nu este clar”” reduce potrivirea modelului.
  • Verificare umană: rezultatele critice trebuie verificate de un om.
Atenție: Nu utilizați niciodată rezultatul modelului fără a-l valida pentru decizii legale, medicale sau financiare. Un „articol de lege” sau „informații despre doză” produse de model pot fi complet fabricate. În aceste domenii, IA este un proiect/instrument preliminar; O persoană competentă are întotdeauna ultimul cuvânt.

Cerință pentru verificarea umană

Inteligența artificială funcționează cel mai bine ca un instrument care accelerează oamenii, nu îi scoate din muncă. Configurația corectă este următoarea: produce sau precalifică schița modelului; umanul revizuiește, corectează și aprobă. Cât de riguroasă trebuie să fie verificarea depinde de costul erorii.

Căutare

Costul erorii

verificare umană

Proiect de descriere a produsului

scăzută

Controlul eșantionului este suficient

Răspuns la e-mailul clientului

mediu

Examinare înainte de depunere

Analiza riscului contractual

înalt

Confirmare de expert articol cu articol

Sfaturi medicale/financiare

foarte sus

Verificare completă de către experți, doar suport AI

Acest tabel atinge echilibrul între „verificarea manuală a fiecărei ieșiri” și „neverificarea deloc”. În timp ce controlul eșantionului este suficient pentru lucrări cu costuri reduse, fiecare rezultat trebuie verificat pentru lucrări cu preț ridicat.

Utilizare etică și responsabilă

Deși selecția modelului poate părea o decizie tehnică, în spate există responsabilități etice:

  • Transparență: informați clienții sau angajații dvs. că utilizați AI în locuri adecvate. Un client are dreptul de a ști dacă vorbește cu un om sau cu AI.
  • Prejudecăți: Modelele pot moșteni părtinire din datele pe care sunt instruiți. Monitorizați corectitudinea rezultatelor în domenii sensibile, cum ar fi recrutarea și evaluarea creditului.
  • Confidențialitate: încorporați principiile de protecție a datelor pe care le-ați învățat în unitatea 8 în fluxul de lucru; Nu trimiteți date personale în mod imprudent.
  • Responsabilitate: Când apare o greșeală, apărarea „AI a făcut-o” nu este suficientă. Responsabilitatea revine instituției care utilizează vehiculul. Deci procesele de verificare a documentelor.
Sfat: scrieți o mică „politică de utilizare responsabilă” în fluxul dvs. de lucru: ce locuri de muncă pot folosi AI, ce date nu pot fi trimise, cine le va verifica și cum vor fi raportate erorile. Acest document de o pagină previne probleme majore în viitor.

Trei cazuri realiste

Cazul 1 — Regret fără a stabili eval. O echipă de asigurări începe să sintetizeze daunele fără a testa cel mai popular model. După două săptămâni, își dau seama că modelul greșește frecvent în termeni tehnici turci și citește greșit unele sume. Când stabilesc un eval de 20 de mostre și compară cele trei modele, trec la modelul care nu este cel mai popular, dar este mai precis în textele tehnice turcești. Pierderea: două săptămâni și travaliu de corecturi. Lecție: eval mai întâi, implementare mai târziu.

Cazul 2 — Procesul care captează halucinația. Un asistent legal vede o referință la „decizia Curții Supreme” în modelul tipărit. Deoarece procesul lor are o regulă „verificați fiecare referință”, el caută decizia și constată că nu există o astfel de decizie; A inventat un model. Datorită verificării umane, informațiile fabricate nu ajung niciodată la client. Fără regula de verificare, pierderea reputației ar fi putut fi gravă.

Cazul 3 — Încrederea cu transparență. O companie de comerț electronic produce răspunsuri de asistență pentru clienți cu inteligență artificială, dar adaugă o notă sub fiecare răspuns: „Acest răspuns a fost pregătit cu suport de inteligență artificială și a fost revizuit de unul dintre reprezentanții noștri”. Clienții sunt mai mulțumiți atât de răspunsul rapid, cât și de încrederea de a vedea o ființă umană angajată. Transparența nu este o slăbiciune de ascuns, ci o sursă de încredere.

Solicitare slabă / Solicitare puternică: Ieșire verificabilă

Prompt slab:

Spune-mi despre clauzele riscante ale acestui contract.

Se potrivesc modelului; nicio sursă, nici un semn de incertitudine.

Solicitare puternică:

Rolul dumneavoastră: analist contractual (decizia finală aparține unui avocat). Sarcină: Evidențiați clauze potențial riscante în următorul contract. Pentru fiecare constatare: (1) numărul clauzei și citatul textual, (2) de ce este riscant, (3) nivelul de încredere (ridicat/mediu/scăzut). Bazează-te doar pe clauze din text; Nu fabrica nimic care nu este în text. Acolo unde nu sunteți sigur, scrieți „se cere confirmarea avocatului”. [contract]

Prompt puternic leagă fiecare revendicare la sursă (număr articol + citare), necesită un nivel de încredere și interzice fabricarea; Acest lucru face ca halucinația să fie capturată.

Șabloane copiabile

1. Design set de evaluare:

Proiectați un set de evaluare pentru următoarea sarcină [SARCINA]. Sugerați 15 eșantion de intrări (mixte ușor-mediu-dificil), cum ar fi definită „producția corectă așteptată” pentru fiecare și determinați un criteriu de punctare (1-5).

2. Înveliș pentru reducerea halucinațiilor:

Rescrieți următorul prompt pentru a reduce fabricarea: „[PROMPT]”. Adăugați reguli pentru citarea surselor, specificarea nivelurilor de încredere și „spuneți-mi dacă nu sunteți sigur”.

3. Proiectarea fluxului de verificare:

În următorul flux de lucru [WORKFLOW] Proiectați un pas de verificare umană pentru ieșirea AI. Determinați cât de riguroasă ar trebui să fie verificarea pe baza costului erorii; scrie cine va verifica ce, când.

4. Proiect de politică de utilizare responsabilă:

Elaborați o „politică de utilizare responsabilă a IA” de o pagină pentru o echipă din [INDUSTRIE]. Includeți următoarele rubrici: utilizări permise, date interzise, ​​responsabilitatea verificării, raportarea transparenței, raportarea erorilor.

Greșeli comune

  • Implementarea fără Eval: Pornirea modelului fără a-l testa cu propriile date și observarea erorilor după ce acestea sunt reflectate în client/loc de muncă.
  • Bazându-se pe halucinații: Folosind limbajul încrezător al modelului ca adevăr fără a verifica referințele.
  • Ocolirea verificării umane: Lăsând rezultatul neverificat în deciziile cu costuri ridicate; Bazându-se pe apărarea „AI a făcut-o”.
  • Evitarea transparenței: ascunderea utilizării AI; întâmpinând pierderea încrederii atunci când apare.
  • Ignorarea eticii și a părtinirii: utilizarea deciziilor sensibile (angajare, credit) fără a monitoriza corectitudinea rezultatelor.

Pe scurt

  • Înainte de a implementa un model, configurați un mic set de evaluare cu propriile date și testați candidații; clasamentele generale nu reprezintă afacerea dvs.
  • Halucinația este producția încrezătoare a modelului de limbaj fals; Capturat de atribuirea sursei, nivelul de încredere și verificarea umană.
  • Severitatea verificării umane este ajustată în funcție de costul erorii; În zonele critice AI este doar suport, decizia aparține omului.
  • Transparență, control al părtinirii, confidențialitate și responsabilitate; sunt cei patru piloni ai utilizării responsabile a IA. Politica unei pagini previne riscurile majore.

Sarcina de aplicare

Creați un set de evaluare de 15 exemple cu șablonul 1 în această unitate (design set de evaluare) pentru modelele candidat(e) pe care le-ați selectat pe parcursul modulului și comparați cel puțin două modele cu acest set. Apoi proiectați modul în care rezultatul va fi verificat de oameni cu șablonul 3 (flux de validare) și elaborați o politică de o pagină pentru echipa dvs. cu șablonul 4 (politica de utilizare responsabilă). Aceste trei livrabile transformă întregul modul într-un plan de implementare viabil.

lista de verificare

  • [ ] Cu propriile mele date, pot configura un mic set de evaluare și pot compara modele.
  • [ ] Pot recunoaște halucinațiile și pot aplica măsuri de atenuare și de oprire.
  • [ ] Pot ajusta rigurozitatea verificării umane în funcție de costul erorii.
  • [ ] Pot încorpora principiile de transparență, părtinire, confidențialitate și responsabilitate în fluxul de lucru.
  • [ ] Pot redacta o politică de utilizare responsabilă a AI de o pagină.

Examenul modulului

1. Care este diferența dintre un „furnizor” AI și o „familie model”?

  • A) Furnizorul este compania care dezvoltă modelul, iar familia de modele este grupul de modele al acelei companii sub o marcă ✔
  • B) Sunt exact același lucru și sunt folosite interschimbabil
  • C) Furnizorul este prețul modelului, familia de modele este viteza modelului.
  • D) Familia de modele se referă la companie, furnizorul se referă la o singură versiune de model

Descriere: Furnizorul este compania care a dezvoltat modelul (de exemplu, Antropic); Familia de modele este grupul de modele pe care compania respectivă îl colectează sub o marcă (de exemplu, Claude). Versiunea model este o versiune specifică în cadrul familiei.

2. Cum pot fi definite cel mai precis „greutățile” unui model?

  • A) Este numărul de jetoane pe care modelul le poate produce pe minut
  • B) Sunt miliardele de parametri numerici pe care modelul îi învață în timpul antrenamentului și își stochează informațiile. ✔
  • C) Este taxa lunara de abonament a modelului
  • D) Este numărul de limbi acceptate de model

Descriere: Greutățile sunt miliarde de parametri numerici pe care modelul îi învață în timpul antrenamentului; Este locul în care este stocat „tot ce știe modelul”. Distincția pondere închisă/explicită depinde de dacă acești parametri pot fi descărcați și rulați.

3. Care afirmație este adevărată despre „open-weight” și „open-source”?

  • A) Sunt exact aceleași concepte și ambele oferă o utilizare comercială nelimitată
  • B) Greutatea deschisă face întotdeauna publice și datele de antrenament
  • C) Nu este același lucru; În ponderarea deschisă, de obicei sunt partajați doar parametrii, iar termenii de licență pot limita utilizarea comercială ✔
  • D) Modelele open source nu pot fi descărcate, modelele cu greutate deschisă pot fi descărcate

Explicație: În ponderarea deschisă, numai parametrii modelului sunt partajați; datele și procesele de instruire nu sunt adesea dezvăluite, iar unele licențe limitează utilizarea comercială. Deci „greutate deschisă” nu este exact la fel cu „sursă deschisă”.

4. Care dintre următoarele este caracteristica modelului cea mai decisivă pentru o echipă juridică care citește și analizează contractele lungi?

  • A) Având cel mai mic preț de simbol
  • B) Avand capacitate de procesare vizuala (multimodala).
  • C) Deținerea unei licențe de greutate deschisă
  • D) Având o fereastră de context largă ✔

Explicație: Modelul are nevoie de o fereastră de context mare pentru a procesa documente lungi ca întreg; Fereastra de context este cantitatea totală de jetoane pe care modelul le poate ține cont la un moment dat.

5. Ce este adevărat despre prețul token pentru modelele cu greutate închisă?

  • A) Jetonul de ieșire este de obicei semnificativ mai scump decât jetonul de intrare ✔
  • B) Intrarea și ieșirea sunt întotdeauna exact același preț
  • C) Se percepe doar taxă lunară fixă, valoarea de utilizare este irelevantă
  • D) Indicatorul de intrare este întotdeauna de multe ori mai scump decât ieșirea

Explicație: prețul este calculat pe token, iar jetonul de ieșire pe care modelul îl produce este de obicei de câteva ori mai scump decât jetonul de intrare pe care îl trimiteți. Prin urmare, imprimările lungi și inutile cresc costurile rapid.

6. Ce caracteristică dintr-un model este esențială pentru o echipă de contabilitate care dorește să extragă automat date din imaginile facturii?

  • A) Cea mai largă fereastră de context posibil
  • B) Multimodalitate (capacitate de procesare vizuală) ✔
  • C) Licență de greutate deschisă
  • D) Cel mai înalt nivel de raționament

Explicație: Pentru a înțelege conținutul vizual, modelul trebuie să fie capabil să proceseze atât imaginile cât și textul, adică trebuie să fie multimodal. Multimodalitatea este capacitatea modelului de a gestiona mai multe tipuri de date, cum ar fi text, imagini și uneori audio.

7. Care este cea mai logică alegere pentru o sarcină simplă și de volum mare (de exemplu, clasificarea pozitivă/negativă a mii de recenzii)?

  • A) Întotdeauna cel mai puternic și mai scump model de raționament
  • B) Un model care funcționează numai pe greutate deschisă și pe propriul server
  • C) Un model ușor și cu costuri reduse, deoarece sarcina este simplă și volumul este mare ✔
  • D) Modelul cu cea mai largă fereastră de context

Descriere: un model ușor, cu costuri reduse, face treaba pentru sarcini simple, cu volum mare; Utilizarea celui mai puternic și mai scump model creează aici costuri inutile. Abordarea corectă este de a potrivi dificultatea sarcinii la nivelul modelului.

8. Ce declanșează trimiterea de text care conține date personale către un furnizor de IA din străinătate în ceea ce privește KVKK?

  • A) Nu creează nicio răspundere juridică
  • B) Contează doar dacă furnizorul se află în UE, în niciun alt caz
  • C) Este strict interzis în orice împrejurare, indiferent dacă datele sunt sau nu anonime
  • D) Transferul de date în străinătate este considerat și este supus condițiilor speciale ale KVKK ✔

Explicație: Datele de operare de pe serverele unui furnizor din străinătate sunt considerate „transfer de date în străinătate” și sunt supuse condițiilor speciale ale KVKK pe acest subiect (cum ar fi consimțământul explicit, decizia de adecvare, asigurările corespunzătoare).

9. Ce face modul „raționament” al unui model și cum afectează costul?

  • A) Mărește acuratețea problemelor complexe, dar crește costul și întârzierea, deoarece generează mai multe jetoane ✔
  • B) Întotdeauna face modelul gratuit
  • C) Mărește doar numărul de limbi acceptate de model
  • D) Scurtați întotdeauna răspunsurile și reduceți costurile

Descriere: Modul de raționament permite modelului să „gândească” pas cu pas înainte de a da răspunsul; Mărește acuratețea problemelor complexe și cu mai mulți pași, dar crește și costul și întârzierea deoarece generează mai multe jetoane.

10. Care este cea mai de încredere abordare atunci când evaluați (evaluați) un model pentru propria afacere?

  • A) Doar alegerea celui mai popular model și utilizarea acestuia fără testare
  • B) Configurați un mic set de testare cu propriile sarcini reale și comparați modelele cu acesta ✔
  • C) Privind doar scorul de referință menționat în reclame
  • D) Acceptați automat modelul cu cea mai înaltă fereastră de context ca fiind cel mai bun

Explicație: În loc să te bazezi orbește pe clasamente, crearea unui set mic de teste cu propriile sarcini reale și compararea modelelor din acest set va dezvălui pe cel care se potrivește cu adevărat afacerii tale.

11. Cum ar trebui să vă influențeze fluxul de lucru cunoștințele că rezultatul modelului poate conține „halucinații”?

  • A) Ieșirea ar trebui să fie întotdeauna considerată corectă și publicată direct
  • B) Halucinația se vede doar la modelele gratuite, nu și la modelele plătite
  • C) În deciziile critice, rezultatul trebuie verificat de un om, iar sursele trebuie confirmate ✔
  • D) Halucinația poate fi eliminată complet prin simpla schimbare a modelului

Explicație: O halucinație este atunci când modelul produce informații care nu sunt de fapt adevărate, într-un limbaj încrezător. Din cauza acestui risc, verificarea rezultatelor de către un om ar trebui să fie necesară, în special pentru deciziile legale, medicale și financiare.

12. Care este logica de bază a abordării „portofoliu model” adoptată de instituțiile mature?

  • A) Pentru a asigura simplitatea prin efectuarea fiecărei lucrări de către un singur model, cel mai scump.
  • B) Folosind doar cel mai ieftin model și ignorând complet calitatea
  • C) Nu utilizați niciun model și faceți toată munca manual
  • D) Optimizarea costurilor și reducerea dependenței de un singur furnizor prin utilizarea diferitelor modele în funcție de sarcină ✔

Descriere: Portofoliul de modele este de a folosi diferite modele în funcție de sarcină: model ieftin pentru lucrări simple și voluminoase, model puternic pentru lucrări complexe, model deschis/regional pentru date confidențiale. Acest lucru optimizează costurile și reduce dependența de un singur furnizor.

13. De ce ar putea țara de origine și politica de păstrare a datelor să fie un criteriu pentru selecția modelului?

  • A) Pentru că are un impact direct asupra cerințelor de reglementare, suveranitatea datelor și confidențialitatea ✔
  • B) Doar pentru că determină viteza de răspuns a modelului
  • C) Pentru că determină formatele de fișiere suportate de model
  • D) Pentru că nu are efect practic, este doar un detaliu de marketing

Descriere: țara în care se află dezvoltatorul modelului și unde/cate date sunt stocate; Este decisiv în ceea ce privește reglementarea legală, suveranitatea datelor și confidențialitatea. De exemplu, pentru o organizație care dorește să găzduiască în UE, un furnizor regional sau o opțiune de stocare zero devine importantă.

14. Care explică cel mai bine de ce căutarea unui „cel mai bun model” într-o sarcină este înșelătoare?

  • A) Toate modelele au de fapt exact aceleași capacități
  • B) Modelele sunt puternice în diferite dimensiuni, așa că „cel mai bun” depinde de cerințele postului ✔
  • C) Cel mai scump model este automat cel mai bun la fiecare sarcină
  • D) Selectarea modelului trebuie făcută complet aleatoriu

Descriere: Modelele sunt puternice pe diferite dimensiuni, cum ar fi viteza, costul, contextul, multimodalitatea, confidențialitatea și raționamentul. Un model care este lider pe o dimensiune poate fi slab pe alta; așa că „cel mai bun” depinde întotdeauna de cerințele postului.