Egység 10 / 10

Végpontig terjedő alkalmazás: értékelés, érvényesítés, etika és határok

Nyereség:

  • Lehetőség egy kis tesztkészlet (eval) felállítására, amely a saját adataival értékeli a modellt
  • A munkafolyamatba ágyazhatja be az emberi ellenőrzést, a korlátozásokat és a felelősségteljes felhasználási szabályzatot
  • Ismerje fel a hallucinációt, a magánélet védelmét és az etikai kockázatokat, és hajtson végre enyhítő intézkedéseket

A megfelelő modellt választotta; Elkészült a munka? Nem, az igazi munka most kezdődik. A modell beépítése a vállalkozásba annyit jelent, hogy teszteli a saját adataival, validálja a kimenetét, és felelősségteljesen alakítja ki. Ez az utolsó egység az egész modult egy végponttól végpontig terjedő alkalmazássá változtatja: megtudhatja, hogyan állíthat be egy kis tesztcsomagot (eval), hogyan ágyazhat be emberi ellenőrzést a munkafolyamatba, hogyan kezelheti a hallucinációkat és az adatvédelmi kockázatokat, és hogyan húzhat meg etikai határokat. Az egység elkészülte után nemcsak kiválaszthatja a modellt, hanem magabiztosan üzembe is helyezheti.

Értékelés (Eval): Tesztelés saját adataival

Most már tudja, hogy csak a tényleges adatok, a hirdetések nem, mondhatják el, hogy egy modell megfelel-e vállalkozásának. Ennek mérésének módja egy értékelőkészlet (eval) felállítása: egy kis mintagyűjtemény a munkádból, amelyre ismert a helyes válasz.

Egy egyszerű értékelést a következőképpen állítunk be:

  1. Gyűjts össze 10-30 valódi mintát. Válasszon olyan bemeneteket, amelyek jellemzőek a munkájára (keverje a nehéz és a könnyű).
  2. Határozza meg a „helyes/elvárt kimenetet” minden egyes példához. Mit válaszolna egy szakértő?
  3. Futtassa végig a jelölteket ugyanazokon a példákon. Tesztelje egyenként az összehasonlítandó modelleket ugyanazzal a készlettel.
  4. Pontozd az eredményeket. Hány példában igaz? Hol hibázott? Elfogadhatóak a hibák?
  5. Hasonlítsa össze és válasszon. Ne a legmagasabb összpontszámot válassza, hanem azt, amelyik a legmegbízhatóbb az Ön számára legkritikusabb példákban.
Tipp: Ne bízzon vakon a ranglistákban. Előfordulhat, hogy egy modell globálisan az első helyen áll, de rosszabbul teljesít, mint a második helyen álló modell az Ön konkrét török ​​jogi szövegeiben. A 20 mintából álló saját értékelés többet ér, mint több száz nyilvános teszt.

Hallucináció: a modell legálomosabb kockázata

A hallucináció az, amikor a modell magabiztos nyelven olyan információkat állít elő, amelyek valójában nem igazak. A „nem tudom” mondás helyett a modell létrehozhat egy nem létező jogszabályt, egy kitalált statisztikát vagy hamis dátumot; Ráadásul ezt rendkívül meggyőző nyelven teszi. Ez a mesterséges intelligencia legveszélyesebb aspektusa, mert a hiba igazságnak álcázza magát.

A hallucinációt nem tudod teljesen megszüntetni, de csökkentheted és elkaphatod:

  • Alapozza meg a forrást: Kérje meg a modellt, hogy az Ön által megadott dokumentumokból generáljon válaszokat, ne a saját „memóriájából” (RAG logika).
  • Kérelem forrásai: Mondja: "Minden követelés mellé írja be azt a dokumentumot/szakaszt, amelyen alapul"; Ha nem tud forrást adni, gyanakodjon.
  • Az emberek azt mondják, hogy nem biztosak benne: A „Ha nem biztos benne, írja be, hogy „nem egyértelmű”” utasítás csökkenti a modellillesztést.
  • Emberi ellenőrzés: A kritikus kimeneteket embernek kell ellenőriznie.
Vigyázat: Soha ne használjon modellkimenetet anélkül, hogy azt jogi, egészségügyi vagy pénzügyi döntésekhez ellenőrizné. A modell által előállított "jogcikk" vagy "adagolási információ" teljesen kitalált lehet. Ezeken a területeken az AI tervezet/előzetes eszköz; Mindig a hozzáértő emberé az utolsó szó.

Az emberi ellenőrzés követelménye

A mesterséges intelligencia olyan eszközként működik a legjobban, amely felgyorsítja az embereket, nem pedig kiszorítja őket a munkából. A helyes beállítás a következő: elkészíti vagy előminősíti a modellvázlatot; az ember felülvizsgálja, javítja és jóváhagyja. Az, hogy milyen szigorúnak kell lennie az ellenőrzésnek, a hiba költségétől függ.

Quest

A hiba költsége

emberi ellenőrzés

Termékleírás tervezet

alacsony

Elegendő a mintaellenőrzés

Ügyfél e-mail válasz

közepes

Beküldés előtti felülvizsgálat

Szerződéses kockázatelemzés

magas

Cikkenként szakértői megerősítés

Orvosi/pénzügyi tanácsadás

nagyon magas

Teljes szakértői ellenőrzés, csak mesterséges intelligencia támogatás

Ez a táblázat egyensúlyt teremt a "minden kimenet manuális ellenőrzése" és az "egyáltalán nem ellenőrzés" között. Míg a mintaellenőrzés elegendő az alacsony költségű munkákhoz, minden kimenetet ellenőrizni kell a magas árú munkákhoz.

Etikus és felelősségteljes használat

Bár a modellválasztás technikai döntésnek tűnhet, etikai kötelezettségek állnak mögötte:

  • Átláthatóság: Tájékoztassa ügyfeleit vagy alkalmazottait, hogy megfelelő helyeken használ mesterséges intelligencia. Az ügyfélnek joga van tudni, hogy emberrel vagy mesterséges intelligenciával beszél-e.
  • Elfogultság: A modellek torzítást örökölhetnek azokból az adatokból, amelyekre betanították őket. Kövesse nyomon az eredmények igazságosságát az olyan érzékeny területeken, mint a toborzás és a hitelbírálat.
  • Adatvédelem: A 8. részben tanult adatvédelmi elvek beágyazása a munkafolyamatba; Ne küldjön meggondolatlanul személyes adatokat.
  • Elszámoltathatóság: Ha hiba történik, az „AI tette” védekezés nem elég. A felelősség a járművet használó intézményt terheli. Tehát a dokumentum-ellenőrzési folyamatok.
Tipp: Írjon be egy kis „felelősségteljes használat szabályzatot” a munkafolyamatba: mely feladatok használhatnak mesterséges intelligenciát, milyen adatokat nem lehet elküldeni, ki fogja ellenőrizni, és hogyan jelentik a hibákat. Ez az egyoldalas dokumentum megakadályozza a jövőbeni nagyobb problémákat.

Három reális eset

1. eset – Megbánás az értékelés megállapítása nélkül. Egy biztosítócsapat megkezdi a kárigények összegzését anélkül, hogy a legnépszerűbb modellt tesztelné. Két hét elteltével rájönnek, hogy a modell gyakran hibázik a török ​​szakkifejezéssel, és hibásan olvas le bizonyos összegeket. Amikor felállítanak egy 20 mintából álló értékelést, és összehasonlítják a három modellt, átváltanak arra a modellre, amely nem a legnépszerűbb, de pontosabb a török ​​szakszövegekben. A veszteség: két hét és lektorálási munka. Tanulság: először értékelje, később telepítse.

2. eset – A hallucinációt rögzítő folyamat. Egy jogvédő „Legfelsőbb Bírósági határozat” hivatkozást lát a nyomtatott mintán. Mivel folyamatukban van egy "minden hivatkozás ellenőrzése" szabály, megkeresi a döntést, és úgy találja, hogy nincs ilyen döntés; Modellt alkotott. Az emberi ellenőrzésnek köszönhetően a koholt információk soha nem jutnak el az ügyfélhez. Az ellenőrzési szabály nélkül a hírnév elvesztése súlyos lehetett volna.

3. eset – Bízzon az átláthatóságban. Egy e-kereskedelmi vállalat ügyfélszolgálati válaszokat készít mesterséges intelligencia segítségével, de minden válasz alá megjegyzést tesz: "Ez a válasz mesterséges intelligencia támogatásával készült, és egyik képviselőnk felülvizsgálta." Az ügyfelek elégedettebbek mind a gyors reagálással, mind a magabiztossággal, amikor egy emberi lényt látnak. Az átláthatóság nem elrejteni való gyengeség, hanem a bizalom forrása.

Gyenge felszólítás / Erős felszólítás: Ellenőrizhető kimenet

Gyenge felszólítás:

Meséljen a szerződés kockázatos kikötéseiről.

illeszkedik a modellhez; nincs forrás, semmi jele a bizonytalanságnak.

Erőteljes felszólítás:

Az Ön szerepe: szerződéselemző (a végső döntés jogászé). Feladat: Emelje ki a potenciálisan kockázatos kitételeket a következő szerződésben. Minden egyes megállapításhoz: (1) záradék száma és szó szerinti idézete, (2) miért kockázatos, (3) az Ön megbízhatósági szintje (magas/közepes/alacsony). Csak a szövegben lévő tagmondatokra hagyatkozzon; Ne gyárts olyat, ami nem szerepel a szövegben. Ha nem biztos benne, írja be, hogy "ügyvédi megerősítés szükséges". [szerződés]

Az erős felszólítás minden állítást a forráshoz kapcsol (cikkszám + idézet), megbízhatósági szintet igényel, és tiltja a kitalálást; Ez elkaphatóvá teszi a hallucinációt.

Másolható sablonok

1. Eval díszlet:

Tervezzen értékelőkészletet a következő feladathoz [FELADAT]. Javasoljon 15 minta bemenetet (vegyes könnyű-közepes-nehéz), hogyan definiálnák mindegyikhez a "várható helyes kimenetet", és határozzon meg egy pontozási kritériumot (1-5).

2. Hallucinációcsökkentő pakolás:

A gyártás csökkentése érdekében írja át a következő promptot: "[PROMPT]". Adjon meg szabályokat a források hivatkozására, a megbízhatósági szintek meghatározására, és "mondja el, ha nem vagy biztos benne".

3. Ellenőrzési folyamat tervezése:

A következő munkafolyamatban [WORKFLOW] Tervezz meg egy emberi ellenőrzési lépést az AI kimenethez. Határozza meg, milyen szigorúnak kell lennie az ellenőrzésnek a hiba költsége alapján; írd meg, hogy ki mit, mikor fog ellenőrizni.

4. Felelős felhasználási szabályzat tervezete:

Készítsen egy oldalas „felelős mesterséges intelligencia használatára vonatkozó irányelvet” az [INDUSTRY] egyik csapatának. Tartalmazza a következő címsorokat: engedélyezett felhasználások, tiltott adatok, ellenőrzési felelősség, átláthatósági jelentés, hibajelentés.

Gyakori hibák

  • Telepítés Eval nélkül: A modell elindítása anélkül, hogy saját adataival tesztelné, és észreveszi a hibákat, miután azok megjelennek az ügyfélben/munkában.
  • A hallucinációra hagyatkozás: A modell magabiztos nyelvezetének használata igazságként, a hivatkozások ellenőrzése nélkül.
  • Az emberi ellenőrzés megkerülése: a kimenet ellenőrizetlenül hagyása magas költségű döntéseknél; Az „AI megcsinálta” védelemre támaszkodva.
  • Az átláthatóság elkerülése: A mesterséges intelligencia használatának elrejtése; önbizalomvesztést tapasztal, amikor ez bekövetkezik.
  • Az etika és az elfogultság figyelmen kívül hagyása: Érzékeny döntések (felvétel, hitel) alkalmazása a kimenet tisztességességének ellenőrzése nélkül.

Összefoglalva

  • A modell üzembe helyezése előtt állítson össze egy kis eval készletet saját adataival, és tesztelje a jelölteket; az általános helyezés nem képviseli az Ön vállalkozását.
  • A hallucináció a modell magabiztos hamis beszédei; A forrás hozzárendelése, a bizalom szintje és az emberi ellenőrzés rögzíti.
  • Az emberi ellenőrzés szigorúságát a hiba költsége szerint módosítják; A kritikus területeken az AI csak támogatás, a döntés az emberé.
  • Átláthatóság, elfogultság ellenőrzése, titoktartás és elszámoltathatóság; a felelős AI használat négy pillére. Az egyoldalas szabályzat megakadályozza a nagyobb kockázatokat.

Pályázati feladat

Hozzon létre egy 15 példából álló értékelőkészletet az 1. sablonnal ebben az egységben (eval set design) a modulban kiválasztott jelölt modell(ek)hez, és hasonlítson össze legalább két modellt ezzel a készlettel. Ezután tervezze meg, hogy a kimenetet hogyan ellenőrizzék az emberek a 3. sablonnal (ellenőrzési folyamat), és készítsen egy egyoldalas szabályzatot csapatának a 4. sablonnal (felelősségteljes használat szabályzata). Ez a három termék az egész modult működőképes telepítési tervvé alakítja.

ellenőrző lista

  • [ ] Saját adataimmal fel tudok állítani egy kis eval halmazt, és összehasonlíthatok modelleket.
  • [ ] Fel tudom ismerni a hallucinációkat, és enyhítő és letartóztató intézkedéseket tudok alkalmazni.
  • [ ] Be tudom állítani az emberi ellenőrzés szigorúságát a hiba költsége alapján.
  • [ ] A munkafolyamatba be tudom ágyazni az átláthatóság, az elfogultság, a titoktartás és az elszámoltathatóság elveit.
  • [ ] Készíthetek egy egyoldalas felelős AI-használati szabályzatot.

Modul vizsga

1. Mi a különbség az AI „szolgáltató” és a „modellcsalád” között?

  • A) A szolgáltató a modellt fejlesztő cég, a modellcsalád pedig az adott cég modellcsoportja egy márka alatt ✔
  • B) Pontosan ugyanazok, és felcserélhetően használják
  • C) A szolgáltató a modell ára, a modellcsalád a modell sebessége.
  • D) A modellcsalád a vállalatra, a szállító egyetlen modellváltozatra utal

Leírás: A szolgáltató a modellt kifejlesztő vállalat (pl. Anthropic); A modellcsalád az a modellcsoport, amelyet a vállalat egy márka (például Claude) alatt gyűjt össze. A modellverzió egy adott verzió a családon belül.

2. Hogyan határozhatók meg a legpontosabban egy modell „súlyai”?

  • A) Az a tokenek száma, amelyet a modell percenként képes előállítani
  • B) Ez az a több milliárd numerikus paraméter, amelyet a modell megtanul a betanítás során, és tárolja az információit. ✔
  • C) Ez a modell havi előfizetési díja
  • D) A modell által támogatott nyelvek száma

Leírás: A súlyok több milliárd numerikus paraméter, amelyeket a modell megtanul az edzés során; Ez az a hely, ahol "mindent, amit a modell tud" tárolnak. A zárt/explicit súlykülönbség attól függ, hogy ezek a paraméterek letölthetők és futtathatók-e.

3. Melyik állítás igaz a „nyílt súlyú” és a „nyílt forráskódú” kifejezésekre?

  • A) Pontosan ugyanazok a fogalmak, és mindkettő korlátlan kereskedelmi felhasználást biztosít
  • B) A nyitott súly mindig nyilvánossá teszi az edzési adatokat is
  • C) Ez nem ugyanaz; Nyílt súlyozás esetén általában csak a paramétereket osztják meg, és a licencfeltételek korlátozhatják a kereskedelmi felhasználást ✔
  • D) A nyílt forráskódú modellek nem tölthetők le, a nyílt súlyú modellek letölthetők

Magyarázat: Nyílt súlyozás esetén csak a modellparaméterek vannak megosztva; A képzési adatok és folyamatok gyakran nem kerülnek nyilvánosságra, és egyes licencek korlátozzák a kereskedelmi felhasználást. Tehát a „nyílt súly” nem pontosan ugyanaz, mint a „nyílt forráskód”.

4. Az alábbiak közül melyik a legmeghatározóbb modelljellemző a hosszú szerződéseket olvasó és elemző jogi csapat számára?

  • A) A legalacsonyabb jelképes ár
  • B) Vizuális (multimodális) feldolgozási képességgel rendelkezik
  • C) Nyílt súlyengedéllyel rendelkezik
  • D) Széles kontextusablak ✔

Magyarázat: A modellnek nagy kontextusablakra van szüksége a hosszú dokumentumok egészének feldolgozásához; A kontextusablak a modell által egyszerre szem előtt tartható tokenek teljes mennyisége.

5. Mi igaz a zárt súlyú modellek token árazására?

  • A) A kimeneti token általában lényegesen drágább, mint a bemeneti token ✔
  • B) Az input és output mindig pontosan ugyanaz az ár
  • C) Csak fix havi díj kerül felszámításra, a használati összeg nem számít
  • D) A bemeneti token mindig sokszorosan drágább, mint a kimenet

Magyarázat: Az ár tokenenként van kiszámítva, és a modell által előállított kimeneti token általában többszöröse a küldött bemeneti tokennek. Ezért a hosszú és szükségtelen nyomatok gyorsan megnövelik a költségeket.

6. A modell melyik funkciója elengedhetetlen egy számlaképekből automatikusan adatokat kinyerni kívánó könyvelői csapat számára?

  • A) A lehető legszélesebb kontextusablak
  • B) Multimodalitás (vizuális feldolgozási képesség) ✔
  • C) Nyílt súlyengedély
  • D) A legmagasabb szintű érvelés

Magyarázat: A vizuális tartalom megértéséhez a modellnek képesnek kell lennie a képek és a szövegek feldolgozására is, azaz multimodálisnak kell lennie. A multimodalitás a modell azon képessége, hogy többféle adatot, például szöveget, képeket és néha hangot is képes kezelni.

7. Mi a leglogikusabb választás egy nagy volumenű, egyszerű feladathoz (pl. több ezer vélemény pozitív/negatív besorolása)?

  • A) Mindig a legerősebb és legdrágább érvelési modell
  • B) Olyan modell, amely csak nyitott súlyon és saját szerveren működik
  • C) Könnyű és olcsó modell, mert a feladat egyszerű és a hangerő nagy ✔
  • D) A legszélesebb kontextusablakkal rendelkező modell

Leírás: A könnyű, alacsony költségű modell egyszerű, nagy volumenű feladatokat hajt végre; A legerősebb és legdrágább modell használata itt felesleges költségeket okoz. A helyes megközelítés az, hogy a feladat nehézségét a modellszinthez igazítjuk.

8. Mi váltja ki a személyes adatokat tartalmazó szövegek elküldését egy külföldi székhelyű mesterségesintelligencia-szolgáltatónak KVKK-ban?

  • A) Nem keletkeztet semmilyen jogi felelősséget
  • B) Csak akkor számít, ha a szolgáltató az EU-ban van, más esetben nem
  • C) Szigorúan tilos minden körülmények között, függetlenül attól, hogy az adat anonim vagy sem
  • D) A külföldre történő adattovábbítás a KVKK ✔ speciális feltételeinek hatálya alá tartozik és vonatkozik rá

Magyarázat: A külföldi szolgáltató szerverein található működési adatok „külföldi adattovábbításnak” minősülnek, és a KVKK e tárgyban meghatározott speciális feltételei (például kifejezett hozzájárulás, megfelelőségi határozat, megfelelő biztosítékok) vonatkoznak rájuk.

9. Mit csinál egy modell „okoskodási” módja, és hogyan befolyásolja a költségeket?

  • A) Növeli az összetett problémák pontosságát, de növeli a költségeket és a késleltetést, mivel több tokent generál ✔
  • B) Mindig szabaddá teszi a modellt
  • C) Csak a modell által támogatott nyelvek számát növeli
  • D) Mindig rövidítse le a válaszokat és csökkentse a költségeket

Leírás: Az érvelési mód lehetővé teszi a modell számára, hogy lépésről lépésre „gondolkodjon”, mielőtt megadná a választ; Növeli a pontosságot többlépéses és összetett problémák esetén, de növeli a költségeket és a késleltetést is, mivel több tokent generál.

10. Mi a legmegbízhatóbb megközelítés saját vállalkozása modelljének értékelése (értékelése) során?

  • A) Csak válassza ki a legnépszerűbb modellt és használja azt tesztelés nélkül
  • B) Állítson össze egy kis tesztkészletet saját valós feladataiból, és hasonlítsa össze a modelleket vele ✔
  • C) Csak nézzük a hirdetésekben említett benchmark pontszámot
  • D) Automatikusan elfogadja a legmagasabb kontextusablakkal rendelkező modellt a legjobbnak

Magyarázat: Ahelyett, hogy vakon hagyatkozna a ranglistákra, készítsen egy kis tesztkészletet saját valódi feladataiból, és összehasonlítja a modelleket ezen a halmazon, és kiderül, melyik felel meg igazán vállalkozásának.

11. Hogyan alakíthatja munkafolyamatát az a tudat, hogy a modell kimenete „hallucinációkat” tartalmazhat?

  • A) A kimenetet mindig helyesnek kell tekinteni, és közvetlenül közzé kell tenni
  • B) Hallucináció csak ingyenes modelleknél látható, fizetős modelleknél nem
  • C) A kritikus döntéseknél a kimenetet embernek kell ellenőriznie és a forrásokat meg kell erősíteni ✔
  • D) A hallucináció teljesen kiküszöbölhető egyszerűen a modell megváltoztatásával

Magyarázat: Hallucinációról akkor beszélünk, amikor a modell olyan információt állít elő, amely valójában nem igaz, magabiztos nyelven. E kockázat miatt meg kell követelni a kimenet ember általi ellenőrzését, különösen jogi, egészségügyi és pénzügyi döntések esetén.

12. Mi az érett intézmények által alkalmazott „modellportfólió” megközelítés alapvető logikája?

  • A) Az egyszerűség biztosítása érdekében minden munkát egyetlen, legdrágább modellel kell elvégezni.
  • B) Csak a legolcsóbb modellt használja, és teljesen figyelmen kívül hagyja a minőséget
  • C) Ne használjon modelleket, és végezzen minden munkát kézzel
  • D) A költségek optimalizálása és az egyetlen szolgáltatótól való függőség csökkentése a feladatnak megfelelő különböző modellek használatával ✔

Leírás: A modellportfólió a feladatnak megfelelően különböző modelleket használ: olcsó modell egyszerű és terjedelmes munkákhoz, hatékony modell összetett munkákhoz, nyílt súlyú/regionális modell a bizalmas adatokhoz. Ez optimalizálja a költségeket és csökkenti az egyetlen szolgáltatótól való függést.

13. Miért lehet a modellválasztás kritériuma a származási ország és az adatmegőrzési politika?

  • A) Mert közvetlenül érinti a szabályozási, adatszuverenitási és adatvédelmi követelményeket ✔
  • B) Csak azért, mert ez határozza meg a modell válaszsebességét
  • C) Mert ez határozza meg a modell által támogatott fájlformátumokat
  • D) Mert nincs gyakorlati hatása, csak marketing részlet

Leírás: Ország, ahol a modell fejlesztője található, és hol/mennyi adatot tárolnak; Meghatározó a jogi szabályozás, az adatszuverenitás és a magánélet védelme szempontjából. Például egy olyan szervezet számára, amely az EU-n belül szeretne otthont adni, fontossá válik a regionális szolgáltató vagy a nulla tárolási lehetőség.

14. Melyik magyarázza legjobban azt, hogy miért félrevezető egy „egyetlen legjobb modell” keresése egy feladatban?

  • A) Valójában minden modell pontosan ugyanazokkal a képességekkel rendelkezik
  • B) A modellek különböző méretekben erősek, így a „legjobb” a munka követelményétől függ ✔
  • C) A legdrágább modell automatikusan a legjobb minden feladatban
  • D) A modellválasztást teljesen véletlenszerűen kell elvégezni

Leírás: A modellek különböző dimenziókban erősek, például sebesség, költség, kontextus, multimodalitás, adatvédelem és érvelés. Az egyik dimenzióban vezető modell lehet, hogy gyenge a másikban; tehát a „legjobb” mindig a munka követelményétől függ.