Kasu:
- Võimalus luua väike testkomplekt (eval), mis hindab mudelit teie enda andmetega
- Manustage töövoogu inimeste kontrollimine, piirangud ja vastutustundliku kasutamise eeskirjad
- Tunnistage hallutsinatsioone, privaatsust ja eetilisi riske ning rakendage leevendavaid meetmeid
Olete valinud õige mudeli; Kas töö on tehtud? Ei, tõeline töö algab nüüd. Mudeli kasutuselevõtt oma ettevõttesse taandub selle testimisele oma andmetega, selle väljundi kinnitamisega ja vastutustundliku raamimisega. See viimane osa muudab kogu mooduli täielikuks rakenduseks: saate teada, kuidas seadistada väikest testkomplekti (eval), manustada töövoogu inimeste kontrollimine, hallutsinatsioonide ja privaatsusriskide haldamine ning eetilised piirid. Kui seade on valmis, saate mitte ainult mudelit valida, vaid ka selle enesekindlalt kasutusele võtta.
Hindamine (Eval): testimine oma andmetega
Nüüd teate, et ainult teie tegelikud andmed, mitte reklaamid, saavad kindlaks teha, kas mudel sobib teie ettevõttega. Selle mõõtmise viis on koostada hindamiskomplekt (eval): väike kogum teie töö näidistest, mille õige vastus on teada.
Lihtne eval on seadistatud järgmiselt:
- Koguge 10-30 tõelist proovi. Valige sisendid, mis on teie töö jaoks tüüpilised (segage rasket ja lihtsat).
- Määrake iga näite jaoks "õige/oodatav väljund". Mida vastaks asjatundja?
- Laske kandidaadid läbi samade näidete. Testige võrreldavaid mudeleid ükshaaval sama komplektiga.
- Hinda tulemusi. Kui paljudes näidetes on see tõsi? Kus ta valesti läks? Kas vead on aktsepteeritavad?
- Võrdle ja vali. Valige mitte kõrgeim üldskoor, vaid see, mis on teie jaoks kõige kriitilisemates näidetes kõige usaldusväärsem.
Näpunäide: ärge pimesi usaldage edetabeleid. Mudel võib olla ülemaailmselt esikohal, kuid teie konkreetsetes Türgi juriidilistes tekstides toimida halvemini kui teise koha mudel. Teie enda 20 proovist koosnev hindamine on rohkem väärt kui sadu avalikke teste.
Hallutsinatsioonid: mudeli kõige salakavalam risk
Hallutsinatsioon on see, kui mudel toodab enesekindlas keeles teavet, mis tegelikult ei vasta tõele. Selle asemel, et öelda "ma ei tea", võib mudel luua olematu õigusakti, väljamõeldud statistika või vale kuupäeva; Pealegi teeb ta seda äärmiselt veenvas keeles. See on tehisintellekti kõige ohtlikum aspekt, sest viga maskeeritakse tõena.
Te ei saa hallutsinatsiooni täielikult kõrvaldada, kuid saate seda vähendada ja tabada:
- Lähtuge allikast: paluge mudelil genereerida vastused teie esitatud dokumentidest, mitte oma "mälust" (RAG-loogika).
- Päringu allikad: öelge: "Kirjutage iga nõude kõrvale dokument/jaotis, millel see põhineb"; Kui ta ei oska allikat anda, siis ole kahtlustav.
- Inimeste panemine ütlema, et nad pole kindlad: juhis "Kui te pole kindel, kirjutage "pole selge"" vähendab mudeli sobitamist.
- Inimese kontrollimine: kriitilisi väljundeid peab kontrollima inimene.
Ettevaatust. Ärge kunagi kasutage mudeliväljundit ilma seda juriidiliste, meditsiiniliste või finantsotsuste jaoks kinnitamata. Mudeli toodetud "seadusartikkel" või "annusteave" võib olla täielikult väljamõeldud. Nendes valdkondades on AI mustand/esialgne tööriist; Pädev inimene ütleb alati viimase sõna.
Inimkontrolli nõue
Tehisintellekt töötab kõige paremini vahendina, mis kiirendab inimesi, mitte ei jäta neid tööst välja. Õige seadistus on järgmine: toodab või eelkvalifitseerib mudeli kavandi; inimene vaatab üle, parandab ja kiidab heaks. Kui range kontrollimine peab olema, sõltub vea maksumusest.
Quest
Vea maksumus
inimese kontrollimine
Tootekirjelduse mustand
madal
Proovikontrollist piisab
Kliendi meili vastus
keskmine
Esitamiseelne ülevaatus
Lepingu riskianalüüs
kõrge
Artiklite kaupa eksperdi kinnitus
Meditsiiniline/finantsnõustamine
väga kõrge
Täielik ekspertide kinnitus, ainult AI tugi
See tabel loob tasakaalu "iga väljundi käsitsi kontrollimise" ja "üldse mittekontrollimise" vahel. Kuigi madala hinnaga tööde puhul piisab näidiskontrollist, tuleb kõrge hinnaga tööde puhul kontrollida iga väljundit.
Eetiline ja vastutustundlik kasutamine
Kuigi mudelivalik võib tunduda tehnilise otsusena, on selle taga eetilised kohustused:
- Läbipaistvus: andke oma klientidele või töötajatele teada, et kasutate tehisintellekti sobivates kohtades. Kliendil on õigus teada, kas ta räägib inimese või tehisintellektiga.
- Eelarvamus: mudelid võivad pärida kallutatust andmetest, mille põhjal neid koolitatakse. Jälgige tulemuste õiglust tundlikes valdkondades, nagu värbamine ja krediidihinnang.
- Privaatsus: lisage 8. üksuses õpitud andmekaitsepõhimõtted töövoogu; Ärge saatke isikuandmeid hoolimatult.
- Vastutus: kui juhtub viga, ei piisa kaitsest "AI tegi selle". Vastutus lasub sõidukit kasutaval asutusel. Nii et dokumentide kontrollimise protsessid.
Näpunäide. Kirjutage oma töövoosse väike vastutustundliku kasutamise eeskiri: millised tööd võivad AI-d kasutada, milliseid andmeid ei saa saata, kes neid kontrollib ja kuidas vigadest teatatakse. See üheleheküljeline dokument hoiab ära suuremad probleemid tulevikus.
Kolm realistlikku juhtumit
Juhtum 1 – kahetsus ilma eval. Kindlustusmeeskond alustab nõuete kokkuvõtet ilma populaarseimat mudelit testimata. Kahe nädala pärast mõistavad nad, et mudel teeb sageli türgi tehnilistes terminites vigu ja loeb mõningaid summasid valesti. Kui nad koostavad 20 näidist koosneva evali ja võrdlevad kolme mudelit, lülituvad nad mudelile, mis ei ole kõige populaarsem, kuid on Türgi tehnilistes tekstides täpsem. Kaotus: kaks nädalat ja korrektuuritöö. Õppetund: hinda kõigepealt, kasuta hiljem.
Juhtum 2 – protsess, mis tabab hallutsinatsiooni. Abinõunik näeb näidistrükil viidet "Riigikohtu otsus". Kuna nende protsessil on reegel "kontrollige iga viidet", otsib ta otsust ja leiab, et sellist otsust pole olemas; Ta koostas modelli. Tänu inimlikule kontrollile ei jõua fabritseeritud teave kunagi kliendini. Ilma kontrollireeglita oleks maine kaotus võinud olla tõsine.
Juhtum 3 – usaldage läbipaistvust. E-kaubandusettevõte toodab klienditoe vastuseid tehisintellektiga, kuid lisab iga vastuse alla märkuse: "See vastus koostati tehisintellekti toel ja selle vaatas läbi üks meie esindajatest." Kliendid on rohkem rahul nii kiire reageerimise kui ka kindlustundega, kui näevad, et inimene on kaasatud. Läbipaistvus ei ole nõrkus, mida varjata, vaid usalduse allikas.
Nõrk viip / tugev viip: kontrollitav väljund
Nõrk viip:
Rääkige mulle selle lepingu riskantsetest punktidest.
Sobib mudelile; pole allikat, pole märki ebakindlusest.
Võimas viip:
Sinu roll: lepinguanalüütik (lõpliku otsuse teeb jurist). Ülesanne: Tooge järgmises lepingus esile potentsiaalselt riskantsed klauslid. Iga leiu kohta: (1) klausli number ja sõnasõnaline tsitaat, (2) miks see on riskantne, (3) teie usaldustase (kõrge/keskmine/madal). Toetuge ainult tekstis olevatele klauslitele; Ärge fabritseerige midagi, mida tekstis pole. Kui te pole kindel, kirjutage "vajalik juristi kinnitus". [leping]
Tugev viip seob iga väite allikaga (artikli number + tsitaat), nõuab usaldustaset ja keelab väljamõeldised; See muudab hallutsinatsioonid tabatavaks.
Kopeeritavad mallid
1. Evali lavakujundus:
Koostage järgmise ülesande [ÜLESANNE] jaoks hindamiskomplekt. Soovitage 15 näidissisendit (sega lihtne-keskmine-raske), kuidas määratletaks igaühe jaoks "oodatav õige väljund" ja määrake hindamiskriteerium (1-5).
2. Hallutsinatsioone vähendav mähis:
Valmistamise vähendamiseks kirjutage järgmine viip ümber: "[VIIRA]". Lisage reeglid allikatele viitamiseks, usaldustasemete määramiseks ja "öelge, kui te pole kindel".
3. Kontrollimise voo kujundus:
Järgmises töövoos [WORKFLOW] kavandage AI väljundi jaoks inimese kontrollimise etapp. Vea maksumuse põhjal määrake kindlaks, kui range kontrollimine peaks olema; kirjutage, kes mida kontrollib, millal.
4. Vastutustundliku kasutamise poliitika projekt:
Koostage [INDUSTRY] meeskonna jaoks üheleheküljeline "vastutustundliku tehisintellekti kasutamise eeskiri". Lisage järgmised pealkirjad: lubatud kasutusalad, keelatud andmed, kontrollivastutus, läbipaistvuse aruandlus, vigadest teatamine.
Levinud vead
- Juurutamine ilma Evalita: mudeli käivitamine ilma seda oma andmetega testimata ja vigade märkamine pärast seda, kui need kajastuvad kliendis/töös.
- Hallutsinatsioonidele tuginemine: mudeli enesekindla keele kasutamine tõena ilma viiteid kontrollimata.
- Inimkontrollist möödahiilimine: suurte kuludega otsuste puhul väljundi kontrollimata jätmine; Toetudes kaitsele "AI tegi seda".
- Läbipaistvuse vältimine: tehisintellekti kasutamise varjamine; enesekindluse kaotus, kui see juhtub.
- Eetika ja eelarvamuste eiramine: tundlike otsuste (värbamine, krediit) kasutamine ilma väljundi õiglust jälgimata.
Kokkuvõttes
- Enne mudeli kasutuselevõttu koostage oma andmetega väike hindamiskomplekt ja testige kandidaate; üldine paremusjärjestus ei esinda teie ettevõtet.
- Hallutsinatsioonid on modelli enesekindel valekeele tootmine; Jäädvustatakse allika omistamise, usalduse taseme ja inimese kontrollimise abil.
- Inimkontrolli rangust kohandatakse vastavalt vea maksumusele; Kriitilistes piirkondades on AI ainult tugi, otsus on inimese teha.
- Läbipaistvus, eelarvamuste kontroll, konfidentsiaalsus ja vastutus; on vastutustundliku tehisintellekti kasutamise neli tugisammast. Ühe lehe poliitika hoiab ära suured riskid.
Rakenduse ülesanne
Seadistage moodulis valitud kandidaatmudeli(te) jaoks 15 näitest koosnev hindamiskomplekt malliga 1 selles üksuses (eval set design) ja võrrelge vähemalt kahte mudelit selle komplektiga. Seejärel kavandage, kuidas inimesed kontrollivad väljundit malliga 3 (valideerimisvoog), ja koostage oma meeskonna jaoks üheleheline poliitika malliga 4 (vastutustundliku kasutamise eeskirjad). Need kolm tulemust muudavad kogu mooduli toimivaks juurutusplaaniks.
kontrollnimekiri
- [ ] Enda andmetega saan luua väikese eval komplekti ja võrrelda mudeleid.
- [ ] Oskan hallutsinatsioonid ära tunda ning rakendada leevendavaid ja vahistamismeetmeid.
- [ ] Saan kohandada inimese kontrollimise rangust vea maksumuse alusel.
- [ ] Saan töövoogu kinnistada läbipaistvuse, erapoolikuse, konfidentsiaalsuse ja vastutuse põhimõtted.
- [ ] Saan koostada üheleheküljelise vastutustundliku tehisintellekti kasutamise poliitika.
Mooduli eksam
1. Mis vahe on tehisintellekti „pakkujal” ja „mudelperekonnal”?
- A) Pakkuja on mudelit välja töötav ettevõte ja mudeliperekond on selle ettevõtte mudeligrupp kaubamärgi all ✔
- B) Need on täpselt samad ja neid kasutatakse vaheldumisi
- C) Pakkuja on mudeli hind, mudelipere on mudeli kiirus.
- D) Mudeliperekond viitab ettevõttele, tarnija viitab ühele mudeliversioonile
Kirjeldus: pakkuja on mudeli välja töötanud ettevõte (nt Anthropic); Mudelperekond on mudeligrupp, mida see ettevõte kaubamärgi all kogub (näiteks Claude). Mudeliversioon on perekonna konkreetne versioon.
2. Kuidas saab mudeli "kaalu" kõige täpsemalt määratleda?
- A) See on žetoonide arv, mida mudel suudab minutis toota
- B) Just miljardeid arvparameetreid mudel õpib koolituse käigus ja salvestab selle teabe. ✔
- C) See on mudeli igakuine liitumistasu
- D) See on mudeli poolt toetatud keelte arv
Kirjeldus: Kaalud on miljardid numbrilised parameetrid, mida mudel treeningu ajal õpib; See on koht, kus on salvestatud "kõik, mida mudel teab". Suletud/selgesõnaline kaalu eristamine sõltub sellest, kas neid parameetreid saab alla laadida ja käivitada.
3. Milline väide vastab tõele "avatud kaalu" ja "avatud lähtekoodiga" kohta?
- A) Need on täpselt samad mõisted ja mõlemad pakuvad piiramatut kaubanduslikku kasutust
- B) Avatud kaal teeb alati ka treeninguandmed avalikuks
- C) See ei ole sama asi; Avatud kaalumisel jagatakse tavaliselt ainult parameetreid ja litsentsitingimused võivad piirata ärilist kasutamist ✔
- D) Avatud lähtekoodiga mudeleid ei saa alla laadida, avatud kaaluga mudeleid saab alla laadida
Selgitus: avatud kaalumisel jagatakse ainult mudeli parameetreid; koolitusandmeid ja -protsesse sageli ei avalikustata ning mõned litsentsid piiravad ärilist kasutamist. Seega ei ole „avatud kaal” täpselt sama mis „avatud lähtekoodiga”.
4. Milline järgmistest on pikki lepinguid lugeva ja analüüsiva juriidilise meeskonna jaoks kõige määravam mudel?
- A) Madalaima märgihinnaga
- B) visuaalse (multimodaalse) töötlemise võimega
- C) avatud kaaluloa omamine
- D) Laia konteksti akna olemasolu ✔
Selgitus. Mudel vajab pikkade dokumentide kui terviku töötlemiseks suurt kontekstiakent; Kontekstikaken on märkide koguarv, mida mudel võib korraga meeles pidada.
5. Mis vastab tõele suletud kaaluga mudelite märgihinna määramise kohta?
- A) Väljundtoken on tavaliselt oluliselt kallim kui sisendmärk ✔
- B) Sisend ja väljund on alati täpselt sama hinnaga
- C) Tasutakse ainult fikseeritud kuutasu, kasutussumma ei oma tähtsust
- D) Sisendmärk on alati kordades kallim kui väljund
Selgitus: Hind arvutatakse loa kohta ja mudeli toodetav väljundmärk on tavaliselt mitu korda kallim kui teie saadetud sisendmärk. Seetõttu suurendavad pikad ja mittevajalikud väljatrükid kiiresti kulusid.
6. Milline mudeli funktsioon on oluline raamatupidamismeeskonnale, kes soovib arvepiltidelt andmeid automaatselt eraldada?
- A) Võimalikult lai kontekstiaken
- B) Multimodaalsus (visuaalne töötlemisvõime) ✔
- C) Avatud kaaluluba
- D) Arutlusvõime kõrgeim tase
Selgitus: visuaalse sisu mõistmiseks peab mudel suutma töödelda nii pilte kui ka teksti, see tähendab, et see peab olema multimodaalne. Multimodaalsus on mudeli võime käsitleda mitut tüüpi andmeid, näiteks teksti, pilte ja mõnikord ka heli.
7. Mis on kõige loogilisem valik mahuka ja lihtsa ülesande jaoks (nt tuhandete arvustuste positiivne/negatiivne klassifikatsioon)?
- A) Alati tugevaim ja kallim arutlusmudel
- B) Mudel, mis töötab ainult avatud kaalul ja oma serveris
- C) Kerge ja odav mudel, kuna ülesanne on lihtne ja helitugevus suur ✔
- D) Kõige laiema kontekstiaknaga mudel
Kirjeldus: Kerge ja odav mudel teeb lihtsaid ja suuremahulisi ülesandeid. Kõige võimsama ja kallima mudeli kasutamine tekitab siin tarbetuid kulusid. Õige lähenemine on sobitada ülesande raskusaste mudelitasemega.
8. Mis vallandab KVKK mõistes isikuandmeid sisaldava teksti saatmise välismaal asuvale tehisintellekti pakkujale?
- A) See ei too kaasa õiguslikku vastutust
- B) See on oluline ainult siis, kui teenusepakkuja asub EL-is, mitte mingil muul juhul
- C) See on rangelt keelatud igal juhul, olenemata sellest, kas andmed on anonüümsed või mitte
- D) Andmete edastamine välismaale on arvestatav ja sellele kehtivad KVKK ✔ eritingimused
Selgitus: Tööandmeid välisriigis asuva teenusepakkuja serverites käsitletakse "andmete edastamisena välismaale" ja neile kehtivad KVKK selleteemalised eritingimused (nt selgesõnaline nõusolek, piisavuse otsus, asjakohased tagatised).
9. Mida teeb mudeli 'arutlusrežiim' ja kuidas see mõjutab kulusid?
- A) See suurendab keeruliste probleemide täpsust, kuid suurendab kulusid ja viivitust, kuna genereerib rohkem märke ✔
- B) Teeb mudeli alati vabaks
- C) Suurendab ainult mudeli poolt toetatavate keelte arvu
- D) Lühendage alati vastuseid ja vähendage kulusid
Kirjeldus: Arutlusrežiim võimaldab mudelil enne vastuse andmist samm-sammult "mõelda"; See suurendab mitmeastmeliste ja keeruliste probleemide täpsust, kuid suurendab ka kulusid ja viivitust, kuna genereerib rohkem märke.
10. Milline on kõige usaldusväärsem lähenemine enda ettevõtte mudeli hindamisel (hindamisel)?
- A) Lihtsalt vali kõige populaarsem mudel ja kasuta seda ilma testimiseta
- B) Koostage oma tegelikest ülesannetest väike testkomplekt ja võrrelge sellega mudeleid ✔
- C) Lihtsalt vaadates reklaamides mainitud võrdlusalust
- D) Aktsepteerige kõrgeima kontekstiaknaga mudel automaatselt parimaks
Selgitus. Selle asemel, et pimesi edetabelitele lootma jääda, looge oma tegelikest ülesannetest väike testkomplekt ja selle komplekti mudelite võrdlemine paljastab selle, mis teie ettevõttele tõesti sobib.
11. Kuidas peaks teie töövoogu kujundama teadmine, et mudeli väljund võib sisaldada hallutsinatsioone?
- A) Väljund tuleb alati lugeda õigeks ja avaldada otse
- B) Hallutsinatsioone võib näha ainult tasuta modellidel, tasulistel mudelitel mitte
- C) Kriitiliste otsuste puhul peab väljund olema inimese poolt kontrollitud ja allikad kinnitatud ✔
- D) Hallutsinatsiooni saab täielikult kõrvaldada lihtsalt mudelit muutes
Selgitus: Hallutsinatsioon on see, kui mudel toodab enesekindlas keeles teavet, mis tegelikult ei vasta tõele. Selle riski tõttu tuleks nõuda inimese väljundi kontrollimist, eriti juriidiliste, meditsiiniliste ja finantsotsuste puhul.
12. Mis on küpsetes asutustes kasutatava mudeliportfelli lähenemisviisi põhiloogika?
- A) Lihtsuse tagamiseks lasta iga töö teha ühe kõige kallima mudeliga.
- B) Kasutades ainult kõige odavamat mudelit ja ignoreerides täielikult kvaliteeti
- C) Ärge kasutage ühtegi mudelit ja tehke kogu töö käsitsi
- D) Kulude optimeerimine ja sõltuvuse vähendamine ühest pakkujast, kasutades erinevaid mudeleid vastavalt ülesandele ✔
Kirjeldus: Mudeliportfellis kasutatakse vastavalt ülesandele erinevaid mudeleid: odav mudel lihtsate ja mahukate tööde jaoks, võimas mudel keeruliste tööde jaoks, avatud kaal/piirkondlik mudel konfidentsiaalsete andmete jaoks. See optimeerib kulusid ja vähendab sõltuvust ühest pakkujast.
13. Miks võivad päritoluriik ja andmete säilitamise poliitika olla mudeli valiku kriteeriumiks?
- A) Kuna see mõjutab otseselt regulatiivseid, andmete suveräänsuse ja privaatsusnõudeid ✔
- B) Ainult sellepärast, et see määrab mudeli reageerimiskiiruse
- C) Kuna see määrab mudeli toetatud failivormingud
- D) Kuna sellel pole praktilist mõju, see on lihtsalt turundusdetail
Kirjeldus: Riik, kus mudeli arendaja asub ja kus/kui palju andmeid hoitakse; See on määrav õigusliku regulatsiooni, andmete suveräänsuse ja privaatsuse seisukohalt. Näiteks organisatsiooni jaoks, mis soovib majutada EL-i piires, muutub oluliseks piirkondlik pakkuja või nullsalvestusvõimalus.
14. Mis selgitab kõige paremini, miks ülesandes „ainsa parima mudeli” otsimine on eksitav?
- A) Kõigil mudelitel on tegelikult täpselt samad võimalused
- B) Mudelid on erinevas suuruses tugevad, seega 'parim' oleneb töönõudest ✔
- C) Kõige kallim mudel on automaatselt parim igas ülesandes
- D) Mudeli valik tuleks teha täiesti juhuslikult
Kirjeldus: mudelid on tugevad erinevates mõõtmetes, nagu kiirus, hind, kontekst, multimodaalsus, privaatsus ja arutluskäik. Mudel, mis on ühes dimensioonis liider, võib teises osas nõrk olla; nii et "parim" sõltub alati töökoha nõudest.