Yksikkö 1 / 11

Tekoäly ML-tekniikassa: rooli, rajat, validointi ja vastuu

Voitot:

  • Kyky erottaa missä ML-työnkulussa (koodi, data, dokumentti) tekoäly säästää aikaa pienellä riskillä ja missä päätökset kuten metriikka/data/tuotantoon saattaminen jätetään ihmiselle tehtävän riskitason mukaan.
  • Kyky soveltaa kurinalaisuutta, joka tarkistaa jokaisen tekoälyn tuotoksen yhdistämällä sen lähteeseen, suorittamalla sen uudelleen, mittaamalla sen ja viemällä sen teknisen suodattimen läpi.
  • Kyky omaksua tapa olla lähettämättä raakaa luottamuksellista ja henkilökohtaista tietoa ulkoisiin työkaluihin, käyttää yrityksen hyväksymiä työkaluja ja käsitellä tietoturvakysymyksiä vain puolustustarkoituksiin.

Tekoäly koneoppimistekniikassa: rooli, rajat, validointi ja vastuu

Koneoppimisinsinööri (ML-insinööri: ohjelmistoammattilainen, joka suunnittelee, kouluttaa ja tuo datasta oppivia malleja tuotantoon) työskentelee nykyään toisen tekoälytyökalun kanssa työnsä jokaisessa vaiheessa. Koodausavustaja on käytössä koodia kirjoitettaessa, keskustelumalli dataa tutkiessa ja suuri kielimalli (LLM: miljardeja parametreja sisältävä neuroverkko, joka ymmärtää ja tuottaa tekstiä) dokumentaatiota tuottaessa. Tämä moduuli pitää tekoälyä sekä ML-insinöörin kehittämänä tuotteena että päivittäisenä työvälineenä. Se toimii rajaamalla selkeästi vastuun rajat sekoittamatta kahta roolia.

Tässä ensimmäisessä jaksossa vastaamme peruskysymykseen: Missä ML-tekniikassa tekoäly säästää reaaliaikaa, ja missä meidän on jätettävä päätös ihmisille? Vastaus on tekniikan alan ytimessä: se, joka tekee, on nopea, se, joka varmistaa, on vastuussa.

Missä tekoälystä on hyötyä ML-tekniikassa?

ML-projektissa kulkee suunnilleen seuraavat linjat: tiedonkeruu, tietojen puhdistus, ominaisuussuunnittelu (raakadatan kääntäminen digitaalisiksi signaaleiksi, joita malli voi ymmärtää), mallin koulutus, arviointi, käyttöönotto (käyttöönotto: mallin avaaminen todelliselle käyttäjälle) ja seuranta. Tekoäly auttaa jokaisella pysäkillä tällä linjalla, mutta sen auktoriteettitaso vaihtelee.

Korkean palkitsemisen, alhaisen riskin alueet: koodirungon tuottaminen, datan muunnosfunktion laatiminen, lokiviestien tulkitseminen, pinojäljen kuvaaminen, kokeen muistiinpanojen yhteenveto, dokumentaation ja README:ien kirjoittaminen, testitapauksen ehdottaminen. Täällä tekoälyn virheet ovat halpoja; koska tulos käy jo läpi testauksen ja tarkistuksen.

Korkean riskin alueet: päätetään, mitä dataa käytetään koulutukseen, vahvistetaan, pitäisikö malli siirtyä tuotantoon, arvioida mittari on "riittävän hyvä", päätös käsitellä henkilötietoja, sulkea tietoturvahaavoittuvuus "roskaksi". Nämä vaikuttavat rahaan, yksityisyyteen, oikeudelliseen vastuuseen ja käyttäjien luottamukseen. Tekoäly antaa tässä ehdotuksia; Päätöksen tekevät pätevä insinööri ja vastaava ryhmä.

Vinkki: Ennen kuin ulkoistat tehtävän tekoälylle, kysy: "Mitä maksaa, jos tämä tulos on väärä, ja kuinka helposti kukaan huomaa virheen?" Jos hinta on alhainen ja vangitseminen on helppoa, anna se eteenpäin. Jos hinta on korkea tai sieppaus vaikeaa, käytä tekoälyä vain luonnokseen ja päätät.

Varmistuskuri: kolme vaihetta

ML-tekniikassa AI-tulostus ei ole koskaan "valmis työ"; Se on luonnos. Suorita jokainen tulos näiden kolmen vaiheen kautta:

  1. Yhdistä se lähteeseen. Jos malli sanoi luvun, kynnyksen tai "parhaan käytännön", perusta se viralliseen dokumentaatioon, koodikannan todelliseen arvoon tai mitattuun mittariin. "Mallin sovitus" (hallusinaatio: epätodellisen tiedon varma tuottaminen kielimallilla) jää useimmiten kiinni tästä.
  2. Käynnistä uudelleen ja mittaa. Suorita luotu koodi, laske sen tuottama metriikka uudelleen omalla testijoukollasi, validoi ehdotettu SQL-kysely pienellä otoksella. Koodi, joka ei toimi, on arvoton, vaikka se näyttää hyvältä.
  3. Ohjaa se teknisen suodattimen läpi. Kestääkö tulos mittakaavassa? Onko reunatapauksia (tyhjät tiedot, erittäin suuri syöte, puuttuvat kentät) otettu huomioon? Onko tietoturva- ja yksityisyysloukkaus? Vain alan tunteva henkilö voi tehdä tämän vaiheen.

Heikko kehote / Vahva kehote

Heikko kehote: "Kirjoita minulle mallikoulutuskoodi."

Tehokas kehote: "Kirjoita harjoitusskripti binääristä luokittelua varten scikit-learnillä. Syöte: data/train.parquet, kohdesarake is_churn. Luokassa on epätasapainoa (positiivinen määrä ~8 %), käsittele se class_weight-arvolla. Käytä PR-AUC:ta (tarkkuuspalautuskäyrän alla oleva pinta-ala) koska accurading datan fix. satunnainen siemen 42:een. Testaa kooditulostussarjan PR-AUC lopussa."

Ero: toinen kehotetehtävä sisältää tietojen totuuden, oikean mittarin, epätasapainotiedot ja toistettavuusvaatimuksen. Tästä kontekstista tulos on todennettavissa ja käyttökelpoinen.

Yksityisyys ja tietoturva: insinöörin ensimmäinen vastuu

ML-insinööri koskettaa usein yrityksen arkaluontoisimpia tietoja: asiakastietoja, tapahtumahistoriaa, terveys- tai taloustietoja, tuotantojärjestelmien lokeja. Kolme sääntöä tietojen antamisessa tekoälytyökaluille:

  • Älä lähetä raakoja henkilökohtaisia ​​tai luottamuksellisia tietoja ulkoisiin työkaluihin. Esimerkiksi sen sijaan, että liität asiakkaiden sähköpostit kehotteeseen, lähetä skeema ja vale(synteettiset) näytteet. Käytä peitettyä esimerkkiä, kuten "ex: ahmet@example.com" oikeiden tietojen sijaan.
  • Käytä yrityksen hyväksymiä ajoneuvoja. Valitse työkalut, joista on sopimuksen mukaan selvää, missä tietoja käsitellään, säilytetäänkö niitä, käytetäänkö niitä koulutukseen vai ei. Yritystietojen käsittely henkilökohtaisella tilillä on rikkomus useimmissa yrityksissä.
  • Vähimmäistietokäytäntö. Anna tehtävän ratkaisemiseen tarvittava vähimmäiskonteksti. Ei koko taulukkoa, mutta asiaankuuluvat 5 saraketta ja skeema.
Varoitus: Oletetaan, että kielimallille antamaasi tekstiä ei voi kumota. Älä lähetä raakoja henkilötietoja ajatellen "Poistan ne myöhemmin"; Riski ilmeni heti, kun se lähetettiin.

Puolustuskäyttö turvallisuusalalla

ML-insinöörit asentavat usein turvajärjestelmiä: petosten havaitseminen, haitallisen liikenteen luokittelu, todennus. Käsittelemme koko tämän moduulin tietoturvakysymykset vain puolustustarkoituksessa: hyökkäyksen havaitseminen, järjestelmän vahvistaminen, haavoittuvuuden sulkeminen. Tekoälyn käyttö luvattomaan käyttöön, tietovuotoon tai luvattomaan puuttumiseen jonkun toisen järjestelmään on sekä laitonta että ammattietiikkaa vastaan. Kun löydät haavoittuvuuden, oikea tapa on ilmoittaa siitä vastuullisesti ja korjata se. ei hyödyntää.

kolme minilaukkua

Tapaus 1 - Säästynyt aika. ML-insinööri viettää tavallisesti puoli päivää 40 sarakkeen tietojoukon tutkivaan data-analyysiin (EDA). Hän antoi skeeman ja df.describe()-tulosteen tekoälylle ja kysyi: "Millä sarakkeilla on korkea poikkeava ja puuttuva taajuus, mitä muunnoksia suosittelette?" 20 minuutissa hän sai prioriteettiluettelon, joka vahvisti jokaisen kohteen omalla koodillaan. Säästö: ~3 tuntia, pieni virheriski, koska jokainen reklamaatio mitataan.

Tapaus 2 - havaittu virhe. "Harjoittelun tarkkuus on 99%, hienoa", malli kertoi chat-assistentista. Insinööri sovelsi kolmatta vaihetta (tekniikan suodatin) ja tajusi: kohdesarakkeessa oli vahingossa vuotanut attribuutteja (tietovuoto: malli näkee informaatiota, jota sen ei pitäisi nähdä koulutuksessa). Todellinen suorituskyky oli paljon heikompi. Insinöörin skeptisyys, ei tekoälyn "suuri" tulkinta, pelasti työpaikan.

Tapaus 3 - Yksityisyyden loukkaamisen estäminen. Ryhmä liitti tuotantovirhelokit ulkoiseen malliin ja sanoi "korjaa tämä virhe". Lokeissa oli asiakkaiden tunnistenumerot. Ryhmä teki säännön kirjoittaa pieni skripti, joka peittää lokit ensin (tekemällä niiden tunnusnumerot ***) ja lähettää ne tällä tavalla. Rikkomisen riski on kadonnut, avun nopeus ei ole muuttunut.

Kopioitavat mallit

Tehtävä: [mitä tehdä, yksi lause]Konteksti: [tietoskeema, koko, rajoitukset; EI TODELLISIA henkilötietoja] Rajoitukset: [kieli/kirjasto, suorituskyky, toistettavuus]Tiedot: [miten mitata menestystä]Haluttu tulos: [koodi/kuvaus/luettelo] ja miksi tässä muodossa

Tarkista tämä koodi. Arvioi sen toimivuuden lisäksi myös seuraavista seikoista: 1) reunatapaukset (tyhjä syöttö, puuttuva sarake, erittäin suuret tiedot) 2) tietovuodon riski3) uusittavuus (siemen, versio) ehdottaa korjauksia jokaiseen löytämääsi ongelmaan. Merkitse "vahvista", jos et ole varma. Koodi: [koodi]

Tulkitse tämän mittarin tulos, mutta kysy ensin: onko tämä mittari oikea tähän ongelmaan? Ongelma: [tasapainoinen/epätasapainoinen luokitus, regressio, sijoitus...]Raportoitu mittari ja arvo: [esim. tarkkuus 0,99]Mitä mittaria suosittelisit ja miksi, ja mitä merkkejä minun pitäisi etsiä, jotta epäilen nykyistä tulosta?

Tarkista, onko tiedoissa, jotka annan seuraavaan kehotteeseen, henkilökohtaisia/luottamuksellisia tietoja. Listaa alla olevaan tekstiin kentät (nimi, sähköpostiosoite, henkilötunnus, puhelinnumero, osoite), jotka pitää peittää. Teksti: [teksti]

Rooli- ja auktoriteettitaulukko

Quest

Tekoälyn rooli

Päätöksen omistaja

Koodirunko / muunnostoiminto

vetogeneraattori

Insinööri (arvostelut)

EDA / tietojen yhteenveto

kiihdytin

Insinööri (tarkistaa mittaamalla)

Metrin tulkinta

Ehdotus

insinööri

Mitä tietoja koulutukseen käytetään?

Ehdotus

Tiimi + tietojen omistaja

Laita malli tuotantoon

Tarkistuslistan muistutus

Vastuullinen insinööri + tiimi

Henkilötietojen käsittely

Ei mitään (ei käytetty)

Laki + rekisterinpitäjä

Yleisiä virheitä

  • Tulosteen käyttäminen vahvistamatta sitä. Yleisin ja kallein virhe. Hyvältä näyttävä koodi tai mittari ei tarkoita, että se olisi oikea.
  • Raakojen luottamuksellisten tietojen liittäminen työkaluun. Kun se on lähetetty, sitä ei voi ottaa takaisin.
  • Väärään mittariin luottaminen. Yhteensopimattomat mittarit, kuten epätasapainoisten tietojen tarkkuus ja sijoitusongelmien RMSE, ovat harhaanjohtavia.
  • Tekoälyn erehtyminen päätöksentekijänä. Hän antaa ehdotuksia; Vastuu on allekirjoittajalla.
  • Kontekstiton kehotus. Epäselvät pyynnöt, kuten "kirjoita malli", tuottavat varmentamattomia tuloksia.

Yhteenvetona

Tekoäly on sekä ML-insinöörin kehittämä tuote että sen päivittäinen replikaattori. Sen arvo on korkein vähäriskisissä, helposti tarkistettavissa tehtävissä, kuten koodi-data-asiakirja; Rahaan, yksityisyyteen ja turvallisuuteen vaikuttavat päätökset jäävät henkilölle. Liitä jokainen lähtö lähteeseen, mittaa uudelleen, kulje teknisen suodattimen läpi. Suojaa luottamuksellisia tietoja, käytä hyväksyttyjä ajoneuvoja, työskentele turvassa vain puolustustarkoituksessa. Tämä kurinalaisuus on kaikkien myöhempien yksiköiden perusta.

Sovellustehtävä

Valitse tehtävä omasta projektistasi (esim. tietojen puhdistustoiminnon kirjoittaminen). Kirjoita ensin heikko kehote ja sitten vahva kehote käyttämällä tämän yksikön mallia. Ota molemmat lähdöt, käytä kolmivaiheista vahvistusta (linkki lähteeseen, suorita uudelleen, suunnittelusuodatin). Huomaa, mikä kehote säästää kuinka monta minuuttia ja kuinka monta korjausta.

tarkistuslista

  • [ ] Olen määrittänyt tehtäväni riskitason (matala/korkea).
  • [ ] En laittanut kehotteeseen varsinaisia ​​henkilökohtaisia/luottamuksellisia tietoja; Peilin sen tai käytin synteettistä näytettä.
  • [ ] Yhdistin lähdön lähteeseen, suoritin sen uudelleen, suodatin sen teknisestä näkökulmasta.
  • [ ] Tarkistin, että valitsin oikean mittarin.
  • [ ] Tein kriittisen päätöksen (tuotantoon laittaminen, tietojenkäsittely) itse/tiimin kanssa, en jättänyt sitä tekoälylle.
  • [ ] Käytin yrityksen hyväksymää ajoneuvoa.