Egység 1 / 11

Mesterséges intelligencia az ML Engineeringben: szerep, határok, érvényesítés és felelősség

Nyereség:

  • Megkülönböztetni, hogy az ML munkafolyamatban (kód, adat, dokumentum) hol takarít meg időt a mesterséges intelligencia alacsony kockázat mellett, és hol marad az emberre az olyan döntés, mint a metrika / adatok / gyártásba helyezés, a feladat kockázati szintjének megfelelően.
  • Képes olyan diszciplínát alkalmazni, amely minden mesterséges intelligencia kimenetet a forráshoz való csatlakoztatásával, újrafuttatásával, mérésével és mérnöki szűrőn való átengedésével ellenőrzi.
  • Képes elsajátítani azt a szokást, hogy ne küldjön nyers bizalmas és személyes adatokat külső eszközökre, használja a vállalat által jóváhagyott eszközöket, és a biztonsági problémákat csak védekezési célból kezelje.

Mesterséges intelligencia a gépi tanulási mérnökökben: szerep, határok, érvényesítés és felelősség

A gépi tanulási mérnök (ML engineer: szoftverszakember, aki az adatokból tanuló modelleket tervez, képez ki és visz a termelésbe) ma egy másik mesterséges intelligencia eszközzel dolgozik munkája minden lépésében. A kódírási asszisztens kódíráskor, a beszélgetési modell az adatok feltárásakor, a nagy nyelvi modell (LLM: több milliárd paraméterrel rendelkező neurális hálózat, amely megért és előállít szöveget) pedig a dokumentáció készítésekor van érvényben. Ez a modul a mesterséges intelligenciát egyrészt a kifejlesztett terméknek, másrészt az ML mérnök napi munkaeszközének tekinti. Úgy működik, hogy világosan körülhatárolja a felelősség határait, anélkül, hogy a két szerepet összekeverné.

Ebben az első részben arra az alapkérdésre adunk választ: az ML mérnöki területen hol takarít meg valós időt a mesterséges intelligencia, és hol kell az emberre bíznunk a döntést? A válasz a mérnöki tudomány középpontjában van: aki készít, az gyors, aki ellenőrzi, az a felelős.

Hol jön jól a mesterséges intelligencia az ML mérnöki munkában?

Egy ML projekt nagyjából a következő vonalakon megy keresztül: adatgyűjtés, adattisztítás, jellemző tervezés (nyers adatok lefordítása digitális jelekké, amelyeket a modell érthet), modell betanítás, kiértékelés, üzembe helyezés (telepítés: a modell megnyitása a valós felhasználó előtt) és monitorozás. A mesterséges intelligencia ezen a vonalon minden megállóhelyen segít, de hatásköre változó.

Magas jövedelmező, alacsony kockázatú területek: kódváz készítése, adattranszformációs függvény készítése, naplóüzenetek értelmezése, veremnyomok leírása, kísérleti jegyzetek összefoglalása, dokumentáció és README írása, teszteset javaslata. Itt a mesterséges intelligencia hibái olcsók; mert a kimenet már átesik a tesztelésen és az áttekintésen.

Magas kockázatú területek: annak eldöntése, hogy milyen adatok kerüljenek a betanításba, annak megerősítése, hogy a modell gyártásba kerüljön-e, egy mérőszám „elég jó” megítélése, döntés a személyes adatok feldolgozásával kapcsolatban, a biztonsági rések „szemétként” történő lezárása. Ezek érintik a pénzt, a magánéletet, a jogi felelősséget és a felhasználók bizalmát. A mesterséges intelligencia ad itt javaslatokat; A döntést az illetékes mérnök és a felelős csapat hozza meg.

Tipp: Mielőtt kiszervezne egy feladatot az MI-nek, kérdezze meg: "Mi a költsége, ha ez a kimenet hibás, és milyen könnyen fogja bárki a hibát?" Ha alacsony az ár és könnyű a befogás, add tovább. Ha az ár magas, vagy a rögzítés nehézkes, csak a piszkozathoz használja az AI-t, és döntsön.

Ellenőrzési fegyelem: három lépés

Az ML tervezésben az AI kimenet soha nem „kész munka”; Ez egy piszkozat. Futtassa az egyes kimeneteket a következő három lépésben:

  1. Csatlakoztassa a forráshoz. Ha a modell számot, küszöböt vagy „bevált gyakorlatot” mondott, akkor azt hivatalos dokumentációra, a kódbázisban szereplő tényleges értékre vagy mért mutatóra alapozza. A „modell illesztése” (hallucináció: nem valós információk magabiztos előállítása a nyelvi modell által) leginkább itt fogható meg.
  2. Indítsa újra és mérje meg. Futtassa le a generált kódot, számolja újra az általa előállított metrikát a saját tesztkészletén, és érvényesítse a javasolt SQL-lekérdezést egy kis mintán. A nem működő kód semmit sem ér, még ha jól is néz ki.
  3. Engedje át egy műszaki szűrőn. A kimenet megállja a helyét? Figyelembe vették a szélső eseteket (üres adatok, nagyon nagy bevitel, hiányzó mezők)? Van-e biztonsági és adatvédelmi megsértés? Ezt a lépést csak az tudja megtenni, aki ismeri a területet.

Gyenge felszólítás / Erős felszólítás

Gyenge felszólítás: "Írjon nekem néhány modell képzési kódot."

Hatékony prompt: "Írjon edzési szkriptet a bináris osztályozáshoz a scikit-learn segítségével. Bemenet: data/train.parquet, céloszlop is_churn. Osztálykiegyensúlyozatlanság van (pozitív arány ~8%), kezelje a class_weight értékkel. Használja a PR-AUC-t (a precíziós visszahívási görbe alatti terület), mivel a hibás kiértékelési metrika accuracy un. véletlenszerű magról 42-re. Tesztelje a PR-AUC kódnyomtatási készlet végén."

Különbség: a második prompt feladat tartalmazza az adatok igazságát, a helyes mérőszámot, az egyensúlyi információkat és az ismételhetőségi követelményt. Ebből a kontextusból a kimenet ellenőrizhető és használható.

Adatvédelem és adatbiztonság: a mérnök első számú felelőssége

Az ML mérnök gyakran érinti a vállalat legérzékenyebb adatait: ügyfélnyilvántartásokat, tranzakciós előzményeket, egészségügyi vagy pénzügyi adatokat, termelési rendszerek naplóit. Három szabály a mesterséges intelligencia eszközöknek való adatszolgáltatás során:

  • Ne küldjön nyers személyes és bizalmas adatokat külső eszközöknek. Például ahelyett, hogy az ügyfél e-mailjeit a promptba illesztené, küldje el a sémát és a fiktív (szintetikus) mintákat. Valódi adatok helyett használjon maszkolt példát, például "ex: ahmet@example.com".
  • Használjon vállalati jóváhagyott járműveket. Válasszon olyan eszközöket, amelyekből szerződésben egyértelmű, hogy az adatokat hol dolgozzák fel, tárolják-e, oktatási célokra használják-e vagy sem. A vállalati adatok személyes fiókkal történő feldolgozása a legtöbb vállalatnál szabálysértésnek minősül.
  • Minimális adatkezelési szabályzat. Adja meg a feladat megoldásához szükséges minimális kontextust. Nem a teljes táblázat, hanem a vonatkozó 5 oszlop és séma.
Figyelem: Tételezzük fel, hogy a nyelvi modellhez adott szöveget nem lehet visszavonni. Ne küldjön nyers személyes adatokat úgy, hogy "később törlöm"; A kockázat az elküldés pillanatában jelentkezett.

Defenzív felhasználás a biztonság területén

Az ML mérnökei gyakran telepítenek biztonsági rendszereket: csalásészlelés, rosszindulatú forgalom besorolása, hitelesítés. Ebben a modulban csak védekezési céllal foglalkozunk a biztonsági kérdésekkel: a támadás észlelése, a rendszer keményítése, a sebezhetőség bezárása. A mesterséges intelligencia használata jogosulatlan hozzáférésre, adatszivárgásra vagy valaki más rendszerébe való jogosulatlan beavatkozásra illegális és a szakmai etika ellen is. Ha sérülékenységet talál, a megfelelő módszer az, ha felelősségteljesen jelenti azt, és kijavítja; nem kihasználni.

három mini tok

1. eset – Időmegtakarítás. Az ML mérnök általában fél napot tölt egy 40 oszlopos adathalmaz feltáró adatelemzésével (EDA). Megadta a sémát és a df.describe() kimenetet a mesterséges intelligenciának, és megkérdezte: "Melyik oszlopokban van magas kiugró és hiányzó arány, milyen átalakításokat javasol?" 20 perc alatt kapott egy prioritási listát, minden elemet saját kóddal ellenőrizve. Megtakarítás: ~3 óra, alacsony hibaveszély, mert minden kárigény mérve van.

2. eset – Hiba történt. „99%-os az edzés pontossága, nagyszerű” – mondta a modell egy chat-asszisztens. A mérnök alkalmazta a harmadik lépést (mérnöki szűrő), és rájött: a céloszlopban véletlenül kiszivárogtak az attribútumok (adatszivárgás: a modell olyan információkat lát, amelyeket nem kellene látnia a képzés során). A tényleges teljesítmény jóval alacsonyabb volt. A mérnök szkepticizmusa mentette meg a munkát, nem pedig az AI „nagyszerű” értelmezése.

3. eset – A magánélet megsértésének megelőzése. Egy csapat a gyártási hibanaplókat egy külső modellbe illesztette, és azt mondta, hogy "javítsa ezt a hibát". A naplókban ügyfélazonosító számok szerepeltek. A csapat azt a szabályt alkotta meg, hogy ír egy kis szkriptet, amely először elfedi a naplókat (az azonosító számukat ***-ba állítja), és így küldi el őket. A jogsértés veszélye megszűnt, a segítségnyújtás sebessége nem változott.

Másolható sablonok

Feladat: [mit kell tenni, egyetlen mondat]Kontextus: [adatséma, méret, megszorítások; NINCS AKTUÁLIS személyes adat]Korlátozások: [nyelv/könyvtár, teljesítmény, reprodukálhatóság]Mutatók: [hogyan mérjük a sikert]Kívánt kimenet: [kód/leírás/lista] és miért ebben a formátumban

Nézze meg ezt a kódot. Értékelje nemcsak, hogy működik, hanem a következők szempontjából is: 1) szélső esetek (üres bemenet, hiányzó oszlop, nagyon nagy adatok) 2) adatszivárgás kockázata3) Reprodukálhatóság (mag, verzió) Javasoljon javításokat minden talált problémára. Jelölje be az „ellenőrzés” lehetőséget, ha nem biztos benne. Kód: [kód]

Értelmezze ennek a mérőszámnak az eredményét, de először kérdezze meg: helyes-e ez a mérőszám erre a problémára?Probléma: [kiegyensúlyozott/kiegyensúlyozatlan osztályozás, regresszió, rangsor...]Jelentett mérőszám és érték: [pl. pontosság 0,99]Melyik mérőszámot javasolná és miért, és milyen jelekre kell figyelnem, hogy kételkedjek a jelenlegi eredményben?

Ellenőrizze, hogy vannak-e személyes/bizalmas információk az alábbi felszólításban közölt adatokban. Sorolja fel az alábbi szövegben azokat a mezőket (név, e-mail, azonosítószám, telefon, cím), amelyeket maszkolni kell. Szöveg: [szöveg]

Szerep- és hatáskör táblázat

Quest

A mesterséges intelligencia szerepe

A határozat tulajdonosa

Kódváz / transzformációs függvény

huzatgenerátor

Mérnök (vélemények)

EDA / adatösszegzés

gyorsító

Mérnök (méréssel ellenőrzi)

Metrikus értelmezés

Javaslat

mérnök

Milyen adatok kerülnek be a képzésbe?

Javaslat

Csapat + adattulajdonos

Állítsa be a modellt gyártásba

Ellenőrzőlista emlékeztető

Felelős mérnök + csapat

Személyes adatok feldolgozása

Nincs (nem használt)

Jogi + adatkezelő

Gyakori hibák

  • A kimenet használata érvényesítés nélkül. A leggyakoribb és legdrágább hiba. Az a kód vagy mérőszám, amely jól néz ki, nem jelenti azt, hogy helyes.
  • Nyers bizalmas adatok beillesztése az eszközbe. Elküldés után nem lehet visszavenni.
  • Rossz mérőszámra hagyatkozva. Az inkompatibilis mutatók, mint például a kiegyensúlyozatlan adatok pontossága és a rangsorolási problémák RMSE-je, félrevezetőek.
  • A mesterséges intelligencia félreértése döntéshozóként. Javaslatokat ad; A felelősség az aláírót terheli.
  • Kontextus nélküli felszólítás. Az olyan kétértelmű kérések, mint például a „modell írása”, ellenőrizhetetlen kimenetet eredményeznek.

Összefoglalva

A mesterséges intelligencia egyszerre az ML mérnöke által kifejlesztett termék és annak napi replikátora. Értéke az alacsony kockázatú, könnyen ellenőrizhető feladatokban a legmagasabb, mint például a code-data-document; A pénzt, a magánéletet és a biztonságot érintő döntések az adott személynél maradnak. Csatlakoztassa az egyes kimeneteket a forráshoz, mérje meg újra, menjen át műszaki szűrőn. Védje a bizalmas adatokat, használjon jóváhagyott járműveket, és csak védekezési célból dolgozzon a biztonság területén. Ez a diszciplína az alapja minden további egységnek.

Pályázati feladat

Válasszon egy feladatot a saját projektjéből (pl. adattisztító funkció írása). Először írjon egy gyenge promptot, majd írjon egy erős promptot az egység sablonjával. Vegye ki mindkét kimenetet, alkalmazza a háromlépcsős ellenőrzést (hivatkozás a forráshoz, újrafutás, műszaki szűrő). Jegyezze fel, hogy melyik prompt hány percet és hány javítást takarít meg.

ellenőrző lista

  • [ ] Meghatároztam a feladatom kockázati szintjét (alacsony/magas).
  • [ ] Nem adtam meg tényleges személyes/bizalmas adatot a promptban; Maszkíroztam, vagy szintetikus mintát használtam.
  • [ ] A kimenetet csatlakoztattam a forráshoz, újra lefuttattam, mérnöki szempontból szűrtem.
  • [ ] Ellenőriztem, hogy a megfelelő mérőszámot választottam-e ki.
  • [ ] A kritikus döntést (gyártásba helyezés, adatfeldolgozás) magam/a csapattal hoztam meg, nem bíztam a mesterséges intelligenciára.
  • [ ] Vállalati jóváhagyott járművet használtam.