Dobici:
- Mogućnost razlikovanja gdje u toku rada ML-a (kod, podaci, dokument) umjetna inteligencija štedi vrijeme uz niski rizik, a gdje su odluke kao što su metrika / podaci / stavljanje u proizvodnju prepuštene čovjeku, prema nivou rizika zadatka.
- Sposobnost primjene discipline koja provjerava svaki izlaz AI tako što ga povezuje sa izvorom, ponovo ga pokreće, mjeri i propušta kroz inženjerski filter.
- Sposobnost stjecanja navike da se neobrađene povjerljive i lične podatke ne šalju vanjskim alatima, korištenje korporativnih alata i rješavanje sigurnosnih pitanja samo u obrambene svrhe.
Umjetna inteligencija u inženjerstvu mašinskog učenja: uloga, granice, validacija i odgovornost
Inženjer mašinskog učenja (ML inženjer: softverski profesionalac koji dizajnira, obučava i donosi modele koji uče iz podataka u proizvodnju) danas radi sa još jednim alatom za veštačku inteligenciju na svakom koraku svog posla. Pomoćnik za kodiranje je na snazi kada se piše kod, model razgovora kada se istražuju podaci, a model velikog jezika (LLM: neuronska mreža sa milijardama parametara koja razumije i proizvodi tekst) kada se proizvodi dokumentacija. Ovaj modul smatra umjetnu inteligenciju i razvijenim proizvodom i svakodnevnim radnim alatom ML inženjera. Djeluje tako što jasno ocrtava granice odgovornosti bez miješanja te dvije uloge.
U ovoj prvoj cjelini odgovaramo na osnovno pitanje: Gdje u ML inženjeringu umjetna inteligencija štedi realno vrijeme, a gdje odluku moramo prepustiti ljudima? Odgovor je u srcu inženjerske discipline: onaj koji pravi je brz, onaj koji proverava je odgovoran.
Gdje umjetna inteligencija dolazi od koristi u ML inženjeringu?
ML projekat prolazi kroz otprilike sljedeće linije: prikupljanje podataka, čišćenje podataka, inženjering karakteristika (prevođenje neobrađenih podataka u digitalne signale koje model može razumjeti), obuku modela, evaluaciju, implementaciju (primjena: otvaranje modela stvarnom korisniku) i praćenje. AI pomaže na svakoj stanici na ovoj liniji, ali njen nivo autoriteta varira.
Područja s niskim rizikom s visokom nagradom: izrada skeleta koda, izrada funkcije transformacije podataka, tumačenje poruka dnevnika, opisivanje praćenja steka, sumiranje bilješki o eksperimentima, pisanje dokumentacije i README-ova, predlaganje test slučaja. Ovdje su greške umjetne inteligencije jeftine; jer će izlaz već proći kroz testiranje i pregled.
Područja visokog rizika: odlučivanje o tome koji podaci idu u obuku, potvrda da li model treba ići u proizvodnju, procjenjivanje da je metrika "dovoljno dobra", odluka o obradi ličnih podataka, zatvaranje sigurnosne ranjivosti kao "smeće". To utiče na novac, privatnost, pravnu odgovornost i povjerenje korisnika. Ovdje umjetna inteligencija daje prijedloge; Odluku o tome donosi nadležni inženjer i odgovorni tim.
Savjet: Prije nego što predate zadatak AI-u, pitajte: „Koja je cijena ako je ovaj izlaz pogrešan i koliko će lako iko shvatiti grešku?“ Ako je cijena niska i hvatanje je lako, proslijedite je dalje. Ako je cijena visoka ili je hvatanje teško, koristite AI samo za nacrt i odlučite.
Disciplina verifikacije: tri koraka
U ML inženjeringu, AI izlaz nikada nije “gotov posao”; To je nacrt. Pokrenite svaki izlaz kroz ova tri koraka:
- Povežite ga sa izvorom. Ako je model rekao broj, prag ili "najbolju praksu", zasnirajte to na službenoj dokumentaciji, stvarnoj vrijednosti u bazi koda ili izmjerenoj metrici. Ovdje se najčešće hvata “uklapanje modela” (halucinacija: pouzdana proizvodnja nestvarnih informacija pomoću jezičkog modela).
- Ponovo pokrenite i izmjerite. Pokrenite generirani kod, ponovno izračunajte metriku koju proizvodi na vašem vlastitom testnom skupu, potvrdite predloženi SQL upit na malom uzorku. Kod koji ne radi je bezvrijedan, čak i ako izgleda lijepo.
- Provucite ga kroz inženjerski filter. Da li izlaz ostaje na skali? Da li su razmotreni rubni slučajevi (prazni podaci, veoma veliki unos, polja koja nedostaju)? Postoji li povreda sigurnosti i privatnosti? Samo osoba koja poznaje ovu oblast može uraditi ovaj korak.
Slaba prompt / Jaka prompt
Slab upit: "Napišite mi neki kod za obuku modela."
Snažan prompt: "Napišite skriptu za obuku za binarnu klasifikaciju sa scikit-learn. Ulaz: data/train.parquet, ciljni stupac is_churn. Postoji neravnoteža klase (pozitivna stopa ~8%), riješite je s class_weight. Koristite PR-AUC (područje ispod krivulje preciznog opoziva) kao pogrešni podatak za procjenu nemetričke vrijednosti. nasumično seme do 42. Testirajte na kraju skupa za ispis koda PR-AUC."
Razlika: drugi prompt zadatak sadrži istinitost podataka, ispravnu metriku, informacije o neravnoteži i zahtjev za ponovljivost. Iz tog konteksta je rezultat provjerljiv i upotrebljiv.
Privatnost i sigurnost podataka: prva odgovornost inženjera
ML inženjer često dodiruje najosjetljivije podatke kompanije: evidenciju kupaca, istoriju transakcija, zdravstvene ili finansijske podatke, dnevnike proizvodnih sistema. Tri pravila prilikom davanja podataka alatima umjetne inteligencije:
- Nemojte slati neobrađene lične i povjerljive podatke vanjskim alatima. Na primjer, umjesto lijepljenja e-pošte korisnika u prompt, pošaljite shemu i lažne (sintetičke) uzorke. Koristite maskirani primjer poput "ex: ahmet@example.com" umjesto stvarnih podataka.
- Koristite vozila odobrena od strane preduzeća. Odaberite alate za koje je ugovorno jasno gdje se podaci obrađuju, da li se pohranjuju, da li se koriste za edukaciju ili ne. Obrada korporativnih podataka putem ličnog naloga predstavlja prekršaj u većini kompanija.
- Politika minimalnih podataka. Navedite minimalni kontekst potreban za rješavanje zadatka. Ne cijela tabela, već relevantnih 5 kolona i šema.
Oprez: Pretpostavite da se tekst koji date jezičkom modelu ne može poništiti. Nemojte slati neobrađene lične podatke misleći da ću ih obrisati kasnije; Rizik je nastupio u trenutku kada je poslan.
Odbrambena upotreba u oblasti sigurnosti
ML inženjeri često instaliraju sigurnosne sisteme: otkrivanje prijevara, klasifikaciju zlonamjernog prometa, autentifikaciju. Kroz ovaj modul pokrivamo sigurnosna pitanja samo u obrambene svrhe: otkrivanje napada, jačanje sistema, zatvaranje ranjivosti. Korištenje umjetne inteligencije za neovlašteni pristup, curenje podataka ili neovlaštenu intervenciju u tuđi sistem je i nezakonito i protivno profesionalnoj etici. Kada pronađete ranjivost, pravi način je da je prijavite odgovorno i popravite; ne eksploatisati.
tri mini kofera
Slučaj 1 - Ušteđeno vrijeme. ML inženjer bi obično proveo pola dana radeći istraživačku analizu podataka (EDA) skupa podataka od 40 kolona. Dao je shemu i df.describe() izlaz umjetnoj inteligenciji i upitao: "Koje kolone imaju visoku stopu odstupanja i propuštanja, koje transformacije preporučujete?" Za 20 minuta dobio je listu prioriteta, provjeravajući svaku stavku svojom šifrom. Ušteda: ~3 sata, mali rizik od greške jer se mjeri svaki zahtjev.
Slučaj 2 - Uhvaćena greška. "Tačnost treninga je 99%, odlična", rekao je model pomoćnik za ćaskanje. Inženjer je primenio treći korak (inženjerski filter) i shvatio: ciljna kolona ima slučajno propuštene atribute (curenje podataka: model vidi informacije koje ne bi trebalo da vidi u obuci). Stvarni učinak je bio mnogo niži. Inženjerov skepticizam, a ne "sjajna" interpretacija AI, spasila je posao.
Slučaj 3 - Sprečavanje narušavanja privatnosti. Tim je lijepio evidencije o greškama u proizvodnji u vanjski model i govorio "popravi ovu grešku". U evidenciji su bili identifikacioni brojevi kupaca. Tim je napravio pravilo da napiše malu skriptu koja prvo maskira logove (praveći njihove ID brojeve ***) i tako ih šalje. Rizik od kršenja je nestao, brzina pomoći se nije promijenila.
Predlošci koji se mogu kopirati
Zadatak: [šta raditi, jedna rečenica]Kontekst: [šema podataka, veličina, ograničenja; NEMA STVARNIH ličnih podataka]Ograničenja: [jezik/biblioteka, performanse, reproducibilnost]Metrike: [kako mjeriti uspjeh]Željeni izlaz: [kod/opis/lista] i zašto u ovom formatu
Pogledajte ovaj kod. Procijenite ne samo da radi, već iu smislu: 1) rubnih slučajeva (prazan unos, nedostajući stupac, veoma veliki podaci)2) Rizik od curenja podataka3) Reproducibilnost (seme, verzija) Predložite ispravke za svaki problem koji pronađete. Označite "provjeri" tamo gdje niste sigurni. Šifra: [šifra]
Protumačite rezultat ove metrike, ali prvo pitajte: da li je ova metrika tačna za ovaj problem? Problem: [uravnotežena/neuravnotežena klasifikacija, regresija, rangiranje...]Prijavljena metrika i vrijednost: [npr. preciznost 0,99]Koju metriku biste preporučili i zašto, i na koje znakove trebam obratiti pažnju da bih posumnjao u trenutni rezultat?
Provjerite ima li ličnih/povjerljivih informacija u podacima koje ću dati u sljedećem upitu. Navedite polja (ime, e-mail, ID broj, telefon, adresa) koja treba maskirati u tekstu ispod. Tekst: [tekst]
Tabela uloga i ovlaštenja
Quest
Uloga vještačke inteligencije
Vlasnik odluke
Kostur koda / funkcija transformacije
generator propuha
inženjer (recenzije)
EDA / sažetak podataka
akcelerator
Inženjer (provjerava mjerenjem)
Metrička interpretacija
Sugestija
inženjer
Koji podaci će ići u obuku?
Sugestija
Tim + vlasnik podataka
Stavite model u proizvodnju
Podsjetnik na kontrolnoj listi
Odgovorni inženjer + tim
Obrada ličnih podataka
Nema (ne koristi se)
Pravni + kontrolor podataka
Uobičajene greške
- Korištenje izlaza bez njegove validacije. Najčešća i najskuplja greška. Šifra ili metrika koja izgleda lijepo ne znači da je ispravna.
- Lijepljenje neobrađenih povjerljivih podataka u alat. Jednom poslano, ne može se vratiti.
- Oslanjajući se na pogrešnu metriku. Nekompatibilne metrike kao što su tačnost u neuravnoteženim podacima i RMSE u problemima sa rangiranjem obmanjuju.
- Pogrešiti veštačku inteligenciju kao donosioca odluka. On daje prijedloge; Odgovornost je na potpisniku.
- Bezkontekstualni prompt. Dvosmisleni zahtjevi kao što je "napišite model" proizvode neprovjerljiv rezultat.
Ukratko
Umjetna inteligencija je proizvod razvijen od strane ML inženjera i njegov svakodnevni replikator. Njegova vrijednost je najveća u niskorizičnim, lako provjerljivim zadacima kao što su kod-podaci-dokument; Odluke koje se tiču novca, privatnosti i sigurnosti ostaju na osobi. Povežite svaki izlaz na izvor, izmjerite ponovo, prođite kroz inženjerski filter. Zaštitite povjerljive podatke, koristite odobrena vozila, radite u sigurnosti samo u obrambene svrhe. Ova disciplina je osnova za sve naredne jedinice.
Zadatak aplikacije
Odaberite zadatak iz vlastitog projekta (npr. pisanje funkcije čišćenja podataka). Prvo napišite slab prompt, a zatim napišite jak upit koristeći šablon u ovoj jedinici. Uzmite oba izlaza, primijenite verifikaciju u tri koraka (link do izvora, ponovno pokretanje, inženjerski filter). Zabilježite koji prompt štedi koliko minuta i koliko ispravki.
kontrolna lista
- [ ] Odredio sam nivo rizika (nizak/visok) mog zadatka.
- [ ] Nisam stavio nikakve stvarne lične/povjerljive podatke u prompt; Ja sam ga maskirao ili koristio sintetički uzorak.
- [ ] Povezao sam izlaz sa izvorom, ponovo ga pokrenuo, filtrirao iz inženjerske perspektive.
- [ ] Provjerio sam da sam izabrao ispravnu metriku.
- [ ] Kritičku odluku (stavljanje u proizvodnju, obrada podataka) sam donio sam/sa timom, nisam je prepustio umjetnoj inteligenciji.
- [ ] Koristio sam vozilo koje je odobrila kompanija.