Vienetas 1 / 11

Dirbtinis intelektas ML inžinerijoje: vaidmuo, ribos, patvirtinimas ir atsakomybė

Pelnas:

  • Gebėjimas atskirti, kurioje ML darbo eigoje (kodas, duomenys, dokumentas) dirbtinis intelektas taupo laiką su maža rizika, o kur tokie sprendimai kaip metrika / duomenys / pateikimas į gamybą paliekami žmogui, atsižvelgiant į užduoties rizikos lygį.
  • Galimybė taikyti discipliną, kuri patikrina kiekvieną AI išvestį prijungiant ją prie šaltinio, paleidžiant iš naujo, išmatuojant ir perduodant per inžinerinį filtrą.
  • Galimybė įgyti įprotį nesiųsti neapdorotų konfidencialių ir asmeninių duomenų į išorinius įrankius, naudoti įmonės patvirtintus įrankius ir saugos problemas spręsti tik gynybiniais tikslais.

Dirbtinis intelektas mašininio mokymosi inžinerijoje: vaidmuo, ribos, patvirtinimas ir atsakomybė

Mašininio mokymosi inžinierius (ML inžinierius: programinės įrangos profesionalas, kuriantis, mokantis ir modelius, kurie mokosi iš duomenų į gamybą) šiandien kiekviename savo darbo etape dirba su kitu dirbtinio intelekto įrankiu. Kodavimo asistentas veikia rašant kodą, pokalbio modelis tiriant duomenis ir didelis kalbos modelis (LLM: neuroninis tinklas su milijardais parametrų, kuris supranta ir sukuria tekstą) kuriant dokumentus. Šiame modulyje dirbtinis intelektas laikomas ir kuriamu produktu, ir kaip kasdieniu ML inžinieriaus darbo įrankiu. Jis veikia aiškiai nubrėždamas atsakomybės ribas, nemaišydamas dviejų vaidmenų.

Šiame pirmajame skyriuje atsakome į pagrindinį klausimą: kur ML inžinerijoje dirbtinis intelektas taupo realų laiką, o kur mes turime palikti sprendimą žmonėms? Atsakymas yra inžinerinės disciplinos esmė: tas, kuris gamina, yra greitas, tas, kuris tikrina, yra atsakingas.

Kur dirbtinis intelektas praverčia ML inžinerijoje?

ML projektas apima maždaug tokias eilutes: duomenų rinkimas, duomenų valymas, funkcijų inžinerija (neapdorotų duomenų pavertimas skaitmeniniais signalais, kuriuos modelis gali suprasti), modelio mokymas, įvertinimas, diegimas (diegimas: modelio atvėrimas tikram vartotojui) ir stebėjimas. AI padeda kiekvienoje šios linijos stotelėje, tačiau jos autoriteto lygis skiriasi.

Didelio atlygio, mažos rizikos sritys: kodo skeleto kūrimas, duomenų transformavimo funkcijos rengimas, žurnalo pranešimų interpretavimas, krūvos pėdsakų aprašymas, eksperimento pastabų apibendrinimas, dokumentacijos ir README rašymas, bandomojo atvejo pasiūlymas. Čia dirbtinio intelekto klaidos yra pigios; nes produkcija jau bus išbandyta ir peržiūrima.

Didelės rizikos sritys: sprendimas, kokie duomenys bus naudojami mokymui, patvirtinimas, ar modelis turi būti pradėtas gaminti, metrikos vertinimas yra „pakankamai geras“, sprendimas apdoroti asmens duomenis, saugumo spragų uždarymas kaip „šiukšlių“. Tai turi įtakos pinigams, privatumui, teisinei atsakomybei ir vartotojų pasitikėjimui. Dirbtinis intelektas čia pateikia pasiūlymų; Sprendimą priima kompetentingas inžinierius ir atsakinga komanda.

Patarimas: prieš pateikdami užduotį dirbtiniam intelektui, paklauskite: „Kokia kaina, jei ši išvestis neteisinga, ir kaip lengvai kas nors pastebės klaidą? Jei kaina maža ir užfiksuoti lengva, perduokite. Jei kaina didelė arba užfiksuoti sunku, naudokite dirbtinį intelektą tik juodraščiui ir nuspręsite.

Tikrinimo disciplina: trys žingsniai

ML inžinerijoje AI išvestis niekada nėra „baigtas darbas“; Tai juodraštis. Paleiskite kiekvieną išvestį atlikdami šiuos tris veiksmus:

  1. Prijunkite jį prie šaltinio. Jei modelis nurodė skaičių, slenkstį arba „geriausią praktiką“, remkitės oficialiais dokumentais, faktine kodų bazės verte arba išmatuota metrika. Čia dažniausiai pagaunamas „modelio pritaikymas“ (haliucinacijos: tikras netikros informacijos pateikimas kalbos modeliu).
  2. Paleiskite iš naujo ir išmatuokite. Vykdykite sugeneruotą kodą, perskaičiuokite jo sukurtą metriką naudodami savo bandymų rinkinį, patvirtinkite siūlomą SQL užklausą nedideliame pavyzdyje. Neveikiantis kodas yra bevertis, net jei atrodo gražiai.
  3. Praleiskite jį per inžinerinį filtrą. Ar išvestis atlaiko mastelį? Ar buvo atsižvelgta į kraštutinius atvejus (tušti duomenys, labai didelė įvestis, trūkstami laukai)? Ar yra saugumo ir privatumo pažeidimas? Šį žingsnį gali atlikti tik tą sritį išmanantis žmogus.

Silpnas raginimas / Stiprus raginimas

Silpnas raginimas: „Parašykite man kokį nors modelio mokymo kodą“.

Galingas raginimas: "Parašykite treniruočių scenarijų, skirtą dvejetainei klasifikacijai su scikit-learn. Įvestis: data/train.parquet, tikslinis stulpelis yra_churn. Yra klasės disbalansas (teigiamas rodiklis ~8 %), apdorokite jį su class_weight. Naudokite PR-AUC (plotas po tikslumo atsiminimo kreive), nes accubalding dataxx metrika. atsitiktinė sėkla iki 42. Patikrinkite kodo spausdinimo rinkinio PR-AUC pabaigoje."

Skirtumas: antroje užduotyje yra duomenų tiesa, teisinga metrika, disbalanso informacija ir pakartojamumo reikalavimas. Būtent iš šio konteksto išvestis yra patikrinama ir tinkama naudoti.

Privatumas ir duomenų saugumas: pirmoji inžinieriaus atsakomybė

ML inžinierius dažnai paliečia jautriausius įmonės duomenis: klientų įrašus, operacijų istoriją, sveikatos ar finansinius duomenis, gamybos sistemų žurnalus. Trys taisyklės teikiant duomenis dirbtinio intelekto įrankiams:

  • Nesiųskite neapdorotų asmeninių ir konfidencialių duomenų į išorinius įrankius. Pavyzdžiui, užuot įklijuodami klientų el. laiškus į raginimą, siųskite schemą ir netikrus (sintetinius) pavyzdžius. Vietoj tikrų duomenų naudokite užmaskuotą pavyzdį, pvz., „ex: ahmet@example.com“.
  • Naudokite įmonės patvirtintas transporto priemones. Rinkitės įrankius, pagal kuriuos sutartimi aišku, kur duomenys tvarkomi, ar jie saugomi, ar naudojami švietimui, ar ne. Įmonės duomenų tvarkymas naudojant asmeninę paskyrą yra daugumos įmonių pažeidimas.
  • Minimali duomenų politika. Pateikite minimalų kontekstą, reikalingą užduočiai išspręsti. Ne visa lentelė, o atitinkami 5 stulpeliai ir schema.
Įspėjimas: Tarkime, kad teksto, kurį pateikiate kalbos modeliui, anuliuoti negalima. Nesiųskite neapdorotų asmens duomenų, galvodami „vėliau ištrinsiu“; Rizika iškilo jo išsiuntimo metu.

Apsauginis naudojimas saugumo srityje

ML inžinieriai dažnai diegia apsaugos sistemas: sukčiavimo aptikimą, kenkėjiško srauto klasifikavimą, autentifikavimą. Šiame modulyje aptariame saugumo problemas tik gynybos tikslais: atakos aptikimui, sistemos užkietėjimui, pažeidžiamumo pašalinimui. Dirbtinio intelekto naudojimas neteisėtai prieigai, duomenų nutekėjimui ar neteisėtam įsikišimui į kažkieno sistemą yra neteisėtas ir prieštarauja profesinei etikai. Radus pažeidžiamumą, teisingas būdas yra atsakingai apie tai pranešti ir ją ištaisyti; neišnaudoti.

trys mini dėklai

1 atvejis – sutaupytas laikas. ML inžinierius paprastai praleistų pusę dienos atlikdamas 40 stulpelių duomenų rinkinio tiriamąją duomenų analizę (EDA). Jis davė schemą ir df.describe() išvestį dirbtiniam intelektui ir paklausė: "Kuriose stulpeliuose yra didelis nuokrypis ir trūkstamas rodiklis, kokias transformacijas rekomenduojate?" Per 20 minučių jis gavo prioritetinį sąrašą, kiekvieną elementą patikrindamas savo kodu. Sutaupykite: ~3 valandas, maža klaidų rizika, nes matuojama kiekviena pretenzija.

2 atvejis – užfiksuota klaida. „Treniruočių tikslumas yra 99%, puiku“, – sakė modelis pokalbio asistentas. Inžinierius pritaikė trečiąjį žingsnį (inžinerinis filtras) ir suprato: tikslinėje stulpelyje netyčia nutekėjo atributai (duomenų nutekėjimas: modelis mato informaciją, kurios neturėtų matyti mokymo metu). Tikrasis našumas buvo daug mažesnis. Darbą išgelbėjo inžinieriaus skepticizmas, o ne „puikus“ AI aiškinimas.

3 atvejis – privatumo pažeidimo prevencija. Komanda įklijavo gamybos klaidų žurnalus į išorinį modelį ir pasakė „ištaisyti šią klaidą“. Žurnaluose buvo klientų identifikavimo numeriai. Komanda nustatė taisyklę parašyti nedidelį scenarijų, kuris pirmiausia užmaskuoja žurnalus (padaro jų ID numerius ***) ir nusiunčia juos tokiu būdu. Pažeidimo rizika išnyko, pagalbos greitis nepasikeitė.

Kopijuojami šablonai

Užduotis: [ką daryti, vienas sakinys]Kontekstas: [duomenų schema, dydis, apribojimai; JOKIŲ AKTUALIŲ asmens duomenų] Apribojimai: [kalba / biblioteka, našumas, atkuriamumas] Metrika: [kaip įvertinti sėkmę] Norima išvestis: [kodas / aprašymas / sąrašas] ir kodėl šiuo formatu

Patikrinkite šį kodą. Įvertinkite ne tik, kad jis veikia, bet ir pagal:1) Kraštinius atvejus (tuščia įvestis, trūksta stulpelio, labai dideli duomenys)2) Duomenų nutekėjimo rizika3) Atkuriamumas (sėkla, versija) Pasiūlykite pataisymus kiekvienai rastai problemai. Pažymėkite „patikrinti“, kur nesate tikri. Kodas: [kodas]

Interpretuokite šios metrikos rezultatą, bet pirmiausia paklauskite: ar ši metrika tinka šiai problemai?Problema: [subalansuota / nesubalansuota klasifikacija, regresija, reitingavimas...]Pranešta metrika ir reikšmė: [pvz.,. tikslumas 0,99]Kokią metriką rekomenduotumėte ir kodėl, ir kokių ženklų turėčiau ieškoti, kad suabejotu dabartiniu rezultatu?

Patikrinkite, ar duomenyse, kuriuos pateiksiu, yra asmeninės / konfidencialios informacijos. Žemiau esančiame tekste surašykite laukus (vardas, el. paštas, ID numeris, telefonas, adresas), kuriuos reikia užmaskuoti. Tekstas: [tekstas]

Vaidmenų ir autoritetų lentelė

Quest

Dirbtinio intelekto vaidmuo

Sprendimo savininkas

Kodo skeleto / transformacijos funkcija

traukos generatorius

Inžinierius (apžvalgos)

EDA / duomenų santrauka

akceleratorius

Inžinierius (tikrina išmatuodamas)

Metrinė interpretacija

Pasiūlymas

inžinierius

Kokie duomenys bus naudojami mokymuose?

Pasiūlymas

Komanda + duomenų savininkas

Įdėkite modelį į gamybą

Kontrolinio sąrašo priminimas

Atsakingas inžinierius + komanda

Asmens duomenų tvarkymas

Nėra (nenaudota)

Teisinis + duomenų valdytojas

Dažnos klaidos

  • Išvesties naudojimas jo nepatvirtinus. Dažniausia ir brangiausia klaida. Gražiai atrodantis kodas ar metrika nereiškia, kad jis teisingas.
  • Neapdorotų konfidencialių duomenų įklijavimas į įrankį. Išsiuntus jo negalima atsiimti.
  • Pasikliauti neteisinga metrika. Nesuderinamos metrikos, pvz., nesubalansuotų duomenų tikslumas ir RMSE reitingavimo problemose, yra klaidinančios.
  • Dirbtinis intelektas klaidingas kaip sprendimų priėmėjas. Jis teikia pasiūlymus; Atsakomybė tenka pasirašančiam asmeniui.
  • Raginimas be konteksto. Dviprasmiškos užklausos, tokios kaip „parašyti modelį“, sukuria nepatikrinamą išvestį.

Apibendrinant

Dirbtinis intelektas yra ir ML inžinieriaus sukurtas produktas, ir kasdienis jo replikatorius. Jo vertė yra didžiausia atliekant mažos rizikos, lengvai patikrinamas užduotis, tokias kaip kodas-duomenys-dokumentas; Sprendimai, turintys įtakos pinigams, privatumui ir saugumui, lieka asmeniui. Prijunkite kiekvieną išvestį prie šaltinio, išmatuokite dar kartą, praleiskite inžinerinį filtrą. Saugokite konfidencialius duomenis, naudokite patvirtintas transporto priemones, dirbkite saugos srityje tik gynybos tikslais. Ši disciplina yra visų tolesnių padalinių pagrindas.

Taikymo užduotis

Pasirinkite užduotį iš savo projekto (pvz., Duomenų valymo funkcijos rašymas). Pirmiausia parašykite silpną raginimą, tada parašykite stiprų raginimą naudodami šio įrenginio šabloną. Paimkite abu išėjimus, taikykite trijų veiksmų patvirtinimą (nuoroda į šaltinį, pakartokite, inžinerinis filtras). Atkreipkite dėmesį, kuris raginimas sutaupo, kiek minučių ir kiek pataisymų.

kontrolinis sąrašas

  • [ ] Nustačiau savo užduoties rizikos lygį (žemą/aukštą).
  • [ ] Į raginimą neįdėjau jokių faktinių asmens/konfidencialių duomenų; Užmaskavau arba naudojau sintetinį pavyzdį.
  • [ ] Prijungiau išvestį prie šaltinio, paleidau dar kartą, išfiltravau inžineriniu požiūriu.
  • [ ] Patikrinau, ar pasirinkau teisingą metriką.
  • [ ] Kritinį sprendimą (įleidimą į gamybą, duomenų apdorojimą) priėmiau pats/su komanda, nepalikau dirbtiniam intelektui.
  • [ ] Naudojau įmonės patvirtintą transporto priemonę.