Nyereség:
- Megkülönböztetni, hogy az ML munkafolyamatban (kód, adat, dokumentum) hol takarít meg időt a mesterséges intelligencia alacsony kockázat mellett, és hol marad az emberre az olyan döntés, mint a metrika / adatok / gyártásba helyezés, a feladat kockázati szintjének megfelelően.
- Képes olyan diszciplínát alkalmazni, amely minden mesterséges intelligencia kimenetet a forráshoz való csatlakoztatásával, újrafuttatásával, mérésével és mérnöki szűrőn való átengedésével ellenőrzi.
- Képes elsajátítani azt a szokást, hogy ne küldjön nyers bizalmas és személyes adatokat külső eszközökre, használja a vállalat által jóváhagyott eszközöket, és a biztonsági problémákat csak védekezési célból kezelje.
Mesterséges intelligencia a gépi tanulási mérnökökben: szerep, határok, érvényesítés és felelősség
A gépi tanulási mérnök (ML engineer: szoftverszakember, aki az adatokból tanuló modelleket tervez, képez ki és visz a termelésbe) ma egy másik mesterséges intelligencia eszközzel dolgozik munkája minden lépésében. A kódírási asszisztens kódíráskor, a beszélgetési modell az adatok feltárásakor, a nagy nyelvi modell (LLM: több milliárd paraméterrel rendelkező neurális hálózat, amely megért és előállít szöveget) pedig a dokumentáció készítésekor van érvényben. Ez a modul a mesterséges intelligenciát egyrészt a kifejlesztett terméknek, másrészt az ML mérnök napi munkaeszközének tekinti. Úgy működik, hogy világosan körülhatárolja a felelősség határait, anélkül, hogy a két szerepet összekeverné.
Ebben az első részben arra az alapkérdésre adunk választ: az ML mérnöki területen hol takarít meg valós időt a mesterséges intelligencia, és hol kell az emberre bíznunk a döntést? A válasz a mérnöki tudomány középpontjában van: aki készít, az gyors, aki ellenőrzi, az a felelős.
Hol jön jól a mesterséges intelligencia az ML mérnöki munkában?
Egy ML projekt nagyjából a következő vonalakon megy keresztül: adatgyűjtés, adattisztítás, jellemző tervezés (nyers adatok lefordítása digitális jelekké, amelyeket a modell érthet), modell betanítás, kiértékelés, üzembe helyezés (telepítés: a modell megnyitása a valós felhasználó előtt) és monitorozás. A mesterséges intelligencia ezen a vonalon minden megállóhelyen segít, de hatásköre változó.
Magas jövedelmező, alacsony kockázatú területek: kódváz készítése, adattranszformációs függvény készítése, naplóüzenetek értelmezése, veremnyomok leírása, kísérleti jegyzetek összefoglalása, dokumentáció és README írása, teszteset javaslata. Itt a mesterséges intelligencia hibái olcsók; mert a kimenet már átesik a tesztelésen és az áttekintésen.
Magas kockázatú területek: annak eldöntése, hogy milyen adatok kerüljenek a betanításba, annak megerősítése, hogy a modell gyártásba kerüljön-e, egy mérőszám „elég jó” megítélése, döntés a személyes adatok feldolgozásával kapcsolatban, a biztonsági rések „szemétként” történő lezárása. Ezek érintik a pénzt, a magánéletet, a jogi felelősséget és a felhasználók bizalmát. A mesterséges intelligencia ad itt javaslatokat; A döntést az illetékes mérnök és a felelős csapat hozza meg.
Tipp: Mielőtt kiszervezne egy feladatot az MI-nek, kérdezze meg: "Mi a költsége, ha ez a kimenet hibás, és milyen könnyen fogja bárki a hibát?" Ha alacsony az ár és könnyű a befogás, add tovább. Ha az ár magas, vagy a rögzítés nehézkes, csak a piszkozathoz használja az AI-t, és döntsön.
Ellenőrzési fegyelem: három lépés
Az ML tervezésben az AI kimenet soha nem „kész munka”; Ez egy piszkozat. Futtassa az egyes kimeneteket a következő három lépésben:
- Csatlakoztassa a forráshoz. Ha a modell számot, küszöböt vagy „bevált gyakorlatot” mondott, akkor azt hivatalos dokumentációra, a kódbázisban szereplő tényleges értékre vagy mért mutatóra alapozza. A „modell illesztése” (hallucináció: nem valós információk magabiztos előállítása a nyelvi modell által) leginkább itt fogható meg.
- Indítsa újra és mérje meg. Futtassa le a generált kódot, számolja újra az általa előállított metrikát a saját tesztkészletén, és érvényesítse a javasolt SQL-lekérdezést egy kis mintán. A nem működő kód semmit sem ér, még ha jól is néz ki.
- Engedje át egy műszaki szűrőn. A kimenet megállja a helyét? Figyelembe vették a szélső eseteket (üres adatok, nagyon nagy bevitel, hiányzó mezők)? Van-e biztonsági és adatvédelmi megsértés? Ezt a lépést csak az tudja megtenni, aki ismeri a területet.
Gyenge felszólítás / Erős felszólítás
Gyenge felszólítás: "Írjon nekem néhány modell képzési kódot."
Hatékony prompt: "Írjon edzési szkriptet a bináris osztályozáshoz a scikit-learn segítségével. Bemenet: data/train.parquet, céloszlop is_churn. Osztálykiegyensúlyozatlanság van (pozitív arány ~8%), kezelje a class_weight értékkel. Használja a PR-AUC-t (a precíziós visszahívási görbe alatti terület), mivel a hibás kiértékelési metrika accuracy un. véletlenszerű magról 42-re. Tesztelje a PR-AUC kódnyomtatási készlet végén."
Különbség: a második prompt feladat tartalmazza az adatok igazságát, a helyes mérőszámot, az egyensúlyi információkat és az ismételhetőségi követelményt. Ebből a kontextusból a kimenet ellenőrizhető és használható.
Adatvédelem és adatbiztonság: a mérnök első számú felelőssége
Az ML mérnök gyakran érinti a vállalat legérzékenyebb adatait: ügyfélnyilvántartásokat, tranzakciós előzményeket, egészségügyi vagy pénzügyi adatokat, termelési rendszerek naplóit. Három szabály a mesterséges intelligencia eszközöknek való adatszolgáltatás során:
- Ne küldjön nyers személyes és bizalmas adatokat külső eszközöknek. Például ahelyett, hogy az ügyfél e-mailjeit a promptba illesztené, küldje el a sémát és a fiktív (szintetikus) mintákat. Valódi adatok helyett használjon maszkolt példát, például "ex: ahmet@example.com".
- Használjon vállalati jóváhagyott járműveket. Válasszon olyan eszközöket, amelyekből szerződésben egyértelmű, hogy az adatokat hol dolgozzák fel, tárolják-e, oktatási célokra használják-e vagy sem. A vállalati adatok személyes fiókkal történő feldolgozása a legtöbb vállalatnál szabálysértésnek minősül.
- Minimális adatkezelési szabályzat. Adja meg a feladat megoldásához szükséges minimális kontextust. Nem a teljes táblázat, hanem a vonatkozó 5 oszlop és séma.
Figyelem: Tételezzük fel, hogy a nyelvi modellhez adott szöveget nem lehet visszavonni. Ne küldjön nyers személyes adatokat úgy, hogy "később törlöm"; A kockázat az elküldés pillanatában jelentkezett.
Defenzív felhasználás a biztonság területén
Az ML mérnökei gyakran telepítenek biztonsági rendszereket: csalásészlelés, rosszindulatú forgalom besorolása, hitelesítés. Ebben a modulban csak védekezési céllal foglalkozunk a biztonsági kérdésekkel: a támadás észlelése, a rendszer keményítése, a sebezhetőség bezárása. A mesterséges intelligencia használata jogosulatlan hozzáférésre, adatszivárgásra vagy valaki más rendszerébe való jogosulatlan beavatkozásra illegális és a szakmai etika ellen is. Ha sérülékenységet talál, a megfelelő módszer az, ha felelősségteljesen jelenti azt, és kijavítja; nem kihasználni.
három mini tok
1. eset – Időmegtakarítás. Az ML mérnök általában fél napot tölt egy 40 oszlopos adathalmaz feltáró adatelemzésével (EDA). Megadta a sémát és a df.describe() kimenetet a mesterséges intelligenciának, és megkérdezte: "Melyik oszlopokban van magas kiugró és hiányzó arány, milyen átalakításokat javasol?" 20 perc alatt kapott egy prioritási listát, minden elemet saját kóddal ellenőrizve. Megtakarítás: ~3 óra, alacsony hibaveszély, mert minden kárigény mérve van.
2. eset – Hiba történt. „99%-os az edzés pontossága, nagyszerű” – mondta a modell egy chat-asszisztens. A mérnök alkalmazta a harmadik lépést (mérnöki szűrő), és rájött: a céloszlopban véletlenül kiszivárogtak az attribútumok (adatszivárgás: a modell olyan információkat lát, amelyeket nem kellene látnia a képzés során). A tényleges teljesítmény jóval alacsonyabb volt. A mérnök szkepticizmusa mentette meg a munkát, nem pedig az AI „nagyszerű” értelmezése.
3. eset – A magánélet megsértésének megelőzése. Egy csapat a gyártási hibanaplókat egy külső modellbe illesztette, és azt mondta, hogy "javítsa ezt a hibát". A naplókban ügyfélazonosító számok szerepeltek. A csapat azt a szabályt alkotta meg, hogy ír egy kis szkriptet, amely először elfedi a naplókat (az azonosító számukat ***-ba állítja), és így küldi el őket. A jogsértés veszélye megszűnt, a segítségnyújtás sebessége nem változott.
Másolható sablonok
Feladat: [mit kell tenni, egyetlen mondat]Kontextus: [adatséma, méret, megszorítások; NINCS AKTUÁLIS személyes adat]Korlátozások: [nyelv/könyvtár, teljesítmény, reprodukálhatóság]Mutatók: [hogyan mérjük a sikert]Kívánt kimenet: [kód/leírás/lista] és miért ebben a formátumban
Nézze meg ezt a kódot. Értékelje nemcsak, hogy működik, hanem a következők szempontjából is: 1) szélső esetek (üres bemenet, hiányzó oszlop, nagyon nagy adatok) 2) adatszivárgás kockázata3) Reprodukálhatóság (mag, verzió) Javasoljon javításokat minden talált problémára. Jelölje be az „ellenőrzés” lehetőséget, ha nem biztos benne. Kód: [kód]
Értelmezze ennek a mérőszámnak az eredményét, de először kérdezze meg: helyes-e ez a mérőszám erre a problémára?Probléma: [kiegyensúlyozott/kiegyensúlyozatlan osztályozás, regresszió, rangsor...]Jelentett mérőszám és érték: [pl. pontosság 0,99]Melyik mérőszámot javasolná és miért, és milyen jelekre kell figyelnem, hogy kételkedjek a jelenlegi eredményben?
Ellenőrizze, hogy vannak-e személyes/bizalmas információk az alábbi felszólításban közölt adatokban. Sorolja fel az alábbi szövegben azokat a mezőket (név, e-mail, azonosítószám, telefon, cím), amelyeket maszkolni kell. Szöveg: [szöveg]
Szerep- és hatáskör táblázat
Quest
A mesterséges intelligencia szerepe
A határozat tulajdonosa
Kódváz / transzformációs függvény
huzatgenerátor
Mérnök (vélemények)
EDA / adatösszegzés
gyorsító
Mérnök (méréssel ellenőrzi)
Metrikus értelmezés
Javaslat
mérnök
Milyen adatok kerülnek be a képzésbe?
Javaslat
Csapat + adattulajdonos
Állítsa be a modellt gyártásba
Ellenőrzőlista emlékeztető
Felelős mérnök + csapat
Személyes adatok feldolgozása
Nincs (nem használt)
Jogi + adatkezelő
Gyakori hibák
- A kimenet használata érvényesítés nélkül. A leggyakoribb és legdrágább hiba. Az a kód vagy mérőszám, amely jól néz ki, nem jelenti azt, hogy helyes.
- Nyers bizalmas adatok beillesztése az eszközbe. Elküldés után nem lehet visszavenni.
- Rossz mérőszámra hagyatkozva. Az inkompatibilis mutatók, mint például a kiegyensúlyozatlan adatok pontossága és a rangsorolási problémák RMSE-je, félrevezetőek.
- A mesterséges intelligencia félreértése döntéshozóként. Javaslatokat ad; A felelősség az aláírót terheli.
- Kontextus nélküli felszólítás. Az olyan kétértelmű kérések, mint például a „modell írása”, ellenőrizhetetlen kimenetet eredményeznek.
Összefoglalva
A mesterséges intelligencia egyszerre az ML mérnöke által kifejlesztett termék és annak napi replikátora. Értéke az alacsony kockázatú, könnyen ellenőrizhető feladatokban a legmagasabb, mint például a code-data-document; A pénzt, a magánéletet és a biztonságot érintő döntések az adott személynél maradnak. Csatlakoztassa az egyes kimeneteket a forráshoz, mérje meg újra, menjen át műszaki szűrőn. Védje a bizalmas adatokat, használjon jóváhagyott járműveket, és csak védekezési célból dolgozzon a biztonság területén. Ez a diszciplína az alapja minden további egységnek.
Pályázati feladat
Válasszon egy feladatot a saját projektjéből (pl. adattisztító funkció írása). Először írjon egy gyenge promptot, majd írjon egy erős promptot az egység sablonjával. Vegye ki mindkét kimenetet, alkalmazza a háromlépcsős ellenőrzést (hivatkozás a forráshoz, újrafutás, műszaki szűrő). Jegyezze fel, hogy melyik prompt hány percet és hány javítást takarít meg.
ellenőrző lista
- [ ] Meghatároztam a feladatom kockázati szintjét (alacsony/magas).
- [ ] Nem adtam meg tényleges személyes/bizalmas adatot a promptban; Maszkíroztam, vagy szintetikus mintát használtam.
- [ ] A kimenetet csatlakoztattam a forráshoz, újra lefuttattam, mérnöki szempontból szűrtem.
- [ ] Ellenőriztem, hogy a megfelelő mérőszámot választottam-e ki.
- [ ] A kritikus döntést (gyártásba helyezés, adatfeldolgozás) magam/a csapattal hoztam meg, nem bíztam a mesterséges intelligenciára.
- [ ] Vállalati jóváhagyott járművet használtam.