Kitengo 1 / 11

Akili Bandia katika Uhandisi wa ML: Jukumu, Mipaka, Uthibitishaji na Wajibu

Faida:

  • Kuwa na uwezo wa kutofautisha ni wapi katika mtiririko wa kazi wa ML (msimbo, data, hati) akili ya bandia huokoa wakati na hatari ndogo, na ambapo maamuzi kama vile kipimo / data / kuweka katika uzalishaji huachwa kwa mwanadamu, kulingana na kiwango cha hatari ya kazi.
  • Uwezo wa kutumia taaluma ambayo huthibitisha kila pato la AI kwa kuiunganisha kwenye chanzo, kuiendesha tena, kuipima, na kuipitisha kupitia kichujio cha kihandisi.
  • Uwezo wa kupata tabia ya kutotuma data mbichi ya siri na ya kibinafsi kwa zana za nje, kutumia zana zilizoidhinishwa na shirika, na kushughulikia maswala ya usalama kwa madhumuni ya kujihami pekee.

Akili Bandia katika Uhandisi wa Kujifunza kwa Mashine: Jukumu, Mipaka, Uthibitishaji na Wajibu

Mhandisi wa kujifunza mashine (mhandisi wa ML: mtaalamu wa programu ambaye husanifu, kutoa mafunzo na kuleta miundo inayojifunza kutoka kwa data hadi uzalishaji) leo anafanya kazi na zana nyingine ya kijasusi bandia katika kila hatua ya kazi yake. Mratibu wa usimbaji hutumika wakati wa kuandika msimbo, muundo wa mazungumzo wakati wa kuchunguza data, na muundo mkubwa wa lugha (LLM: mtandao wa neva wenye mabilioni ya vigezo vinavyoelewa na kutoa maandishi) wakati wa kutengeneza hati. Moduli hii inazingatia akili ya bandia kama bidhaa iliyotengenezwa na zana ya kila siku ya kazi ya mhandisi wa ML. Hufanya kazi kwa kuweka wazi mipaka ya wajibu bila kuchanganya majukumu mawili.

Katika kitengo hiki cha kwanza, tunajibu swali la msingi: Ni wapi katika uhandisi wa ML ambapo akili ya bandia huokoa wakati halisi, na ni wapi tunapaswa kuwaachia wanadamu uamuzi? Jibu liko katika moyo wa taaluma ya uhandisi: anayetengeneza ni haraka, anayethibitisha anawajibika.

Akili ya bandia huja wapi katika uhandisi wa ML?

Mradi wa ML unapitia takriban mistari ifuatayo: ukusanyaji wa data, kusafisha data, uhandisi wa vipengele (kutafsiri data ghafi katika mawimbi ya kidijitali ambayo muundo unaweza kuelewa), mafunzo ya kielelezo, tathmini, uwekaji (usambazaji: kufungua kielelezo kwa mtumiaji halisi) na ufuatiliaji. AI husaidia katika kila kituo kwenye mstari huu, lakini kiwango chake cha mamlaka kinatofautiana.

Maeneo yenye thawabu kubwa, yenye hatari ndogo: kuzalisha kiunzi cha msimbo, kuandaa kazi ya kubadilisha data, kutafsiri ujumbe wa kumbukumbu, kuelezea ufuatiliaji wa mrundikano, kufupisha madokezo ya majaribio, kuandika hati na READMEs, kupendekeza kesi ya jaribio. Hapa, makosa ya akili ya bandia ni nafuu; kwa sababu matokeo tayari yatapitia majaribio na ukaguzi.

Maeneo yenye hatari kubwa: kuamua ni data gani itaingia kwenye mafunzo, kuthibitisha ikiwa modeli inapaswa kuingizwa katika uzalishaji, kutathmini kipimo "ni nzuri ya kutosha", uamuzi wa kuchakata data ya kibinafsi, kufunga hatari ya usalama kama "junk". Haya huathiri pesa, faragha, dhima ya kisheria na uaminifu wa mtumiaji. Artificial intelligence inatoa mapendekezo hapa; Uamuzi huo unafanywa na mhandisi mwenye uwezo na timu inayohusika.

Kidokezo: Kabla ya kutoa kazi kwa AI, uliza: "Gharama ni nini ikiwa matokeo haya si sahihi, na mtu yeyote atapata kosa kwa urahisi vipi?" Ikiwa bei ni ya chini na kunasa ni rahisi, ipitishe. Ikiwa bei ni ya juu au ni ngumu kunasa, tumia AI kwa rasimu pekee na utaamua.

Nidhamu ya uthibitishaji: hatua tatu

Katika uhandisi wa ML, pato la AI kamwe sio "kazi iliyokamilishwa"; Ni rasimu. Endesha kila pato kupitia hatua hizi tatu:

  1. Iunganishe na chanzo. Iwapo muundo ulisema nambari, kiwango cha juu, au "mazoezi bora," inatokana na hati rasmi, thamani halisi katika msingi wa kanuni, au kipimo kilichopimwa. "Kufaa kwa mfano" (hallucination: uzalishaji wa ujasiri wa habari isiyo ya kweli na modeli ya lugha) mara nyingi hupatikana hapa.
  2. Anzisha tena na upime. Tekeleza msimbo uliotolewa, hesabu upya kipimo kinachozalisha kwenye seti yako ya majaribio, thibitisha hoja inayopendekezwa ya SQL kwenye sampuli ndogo. Nambari ambayo haifanyi kazi haina thamani, hata ikiwa inaonekana nzuri.
  3. Ipitishe kupitia kichujio cha uhandisi. Je, pato linasimama kwa kiwango? Je, visa vya ukingo (data tupu, ingizo kubwa sana, sehemu zinazokosekana) zimezingatiwa? Je, kuna ukiukaji wa usalama na faragha? Ni mtu anayejua uwanja pekee ndiye anayeweza kufanya hatua hii.

Mwongozo dhaifu / Mwongozo thabiti

Kidokezo hafifu: "Niandikie nambari ya kielelezo ya mafunzo."

Kidokezo chenye nguvu: "Andika hati ya mafunzo ya uainishaji wa mfumo wa jozi kwa kutumia scikit-learn. Ingizo: data/train.parquet, safu wima lengwa ni_churn. Kuna usawa wa darasa (kiwango chanya ~8%), ishughulikie kwa uzani wa darasa. Tumia PR-AUC (eneo lililo chini ya mkondo wa kukumbuka kwa usahihi) kama tathmini ya usawazishaji wa data bila mpangilio. mbegu hadi 42. Jaribu mwishoni mwa seti ya uchapishaji wa msimbo PR-AUC."

Tofauti: jukumu la pili la haraka lina ukweli wa data, metriki sahihi, maelezo ya usawa na hitaji la kurudiwa. Ni kutokana na muktadha huu ambapo matokeo yanaweza kuthibitishwa na kutumika.

Faragha na usalama wa data: jukumu la kwanza la mhandisi

Mhandisi wa ML mara nyingi hugusa data nyeti zaidi ya kampuni: rekodi za wateja, historia ya miamala, data ya afya au fedha, kumbukumbu za mifumo ya uzalishaji. Sheria tatu wakati wa kutoa data kwa zana za akili bandia:

  • Usitume data mbichi ya kibinafsi na ya siri kwa zana za nje. Kwa mfano, badala ya kubandika barua pepe za wateja kwenye dodoso, tuma sampuli za taratibu na dummy (synthetic). Tumia mfano uliofichwa kama "mf: ahmet@example.com" badala ya data halisi.
  • Tumia magari yaliyoidhinishwa na kampuni. Chagua zana ambazo ziko wazi kimkataba ambapo data inachakatwa, iwe imehifadhiwa, iwe inatumika kwa elimu au la. Kuchakata data ya shirika kwa kutumia akaunti ya kibinafsi ni ukiukaji katika makampuni mengi.
  • Kiwango cha chini cha sera ya data. Toa muktadha wa chini unaohitajika kutatua kazi. Sio jedwali zima, lakini safu wima 5 na schema husika.
Tahadhari: Chukulia kuwa maandishi unayotoa kwa muundo wa lugha hayawezi kutenduliwa. Usitume data mbichi ya kibinafsi ukifikiria "nitaifuta baadaye"; Hatari ilitokea wakati ilipotumwa.

Matumizi ya ulinzi katika uwanja wa usalama

Wahandisi wa ML mara nyingi huweka mifumo ya usalama: kugundua ulaghai, uainishaji mbaya wa trafiki, uthibitishaji. Katika sehemu hii yote, tunashughulikia masuala ya usalama kwa madhumuni ya kujihami pekee: kugundua shambulio, kuimarisha mfumo, kufunga uwezekano wa kuathiriwa. Kutumia akili bandia kwa ufikiaji usioidhinishwa, uvujaji wa data au uingiliaji kati usioidhinishwa katika mfumo wa mtu mwingine ni kinyume cha sheria na ni kinyume cha maadili ya kitaaluma. Unapopata athari, njia sahihi ni kuiripoti kwa kuwajibika na kuirekebisha; sio kunyonya.

kesi tatu ndogo

Kesi ya 1 - Muda umehifadhiwa. Mhandisi wa ML kwa kawaida angetumia nusu siku kufanya uchanganuzi wa data ya uchunguzi (EDA) wa seti ya data ya safu wima 40. Alitoa schema na df.describe() pato kwa akili ya bandia na akauliza, "Ni safu wima zipi zilizo na kiwango cha juu cha nje na kinachokosekana, unapendekeza mabadiliko gani?" Katika dakika 20, alipokea orodha iliyopewa kipaumbele, akithibitisha kila kitu na msimbo wake. Hifadhi: ~Saa 3, hatari ndogo ya hitilafu kwa sababu ilipimwa kila dai.

Kesi ya 2 - Hitilafu iliyopatikana. "Usahihi wa mafunzo ni 99%, mzuri," mwanamitindo huyo alikuwa na msaidizi wa gumzo. Mhandisi alitumia hatua ya tatu (kichujio cha uhandisi) na akagundua: safu wima lengwa ilikuwa na sifa zilizovuja kwa bahati mbaya (uvujaji wa data: modeli huona habari ambayo haipaswi kuona katika mafunzo). Utendaji halisi ulikuwa wa chini sana. Mashaka ya mhandisi, sio tafsiri "kubwa" ya AI, iliokoa kazi.

Kesi ya 3 - Kuzuia uvunjaji wa faragha. Timu ilikuwa inabandika kumbukumbu za hitilafu za uzalishaji kwenye muundo wa nje na kusema "rekebisha hitilafu hii". Kulikuwa na nambari za utambulisho za mteja kwenye kumbukumbu. Timu iliweka sheria ya kuandika hati ndogo ambayo hufunika kumbukumbu kwanza (kutengeneza nambari zao za vitambulisho ***) na kuzituma kwa njia hiyo. Hatari ya uvunjaji imetoweka, kasi ya usaidizi haijabadilika.

Violezo vinavyoweza kunakiliwa

Kazi: [cha kufanya, sentensi moja]Muktadha: [taratibu za data, saizi, vikwazo; HAKUNA data HALISI ya kibinafsi]Vikwazo: [lugha/maktaba, utendaji, uzalishwaji tena]Vipimo: [jinsi ya kupima mafanikio]Toleo linalohitajika: [msimbo/maelezo/orodha] na kwa nini katika umbizo hili

Angalia msimbo huu. Tathmini sio tu kwamba inafanya kazi, lakini pia kulingana na:1) Kesi za ukingo (ingizo tupu, safu wima inayokosekana, data kubwa sana)2) Hatari ya uvujaji wa data3) Uzalishaji tena (mbegu, toleo)Pendekeza marekebisho kwa kila tatizo unalopata. Weka alama "thibitisha" mahali ambapo huna uhakika. Kanuni: [code]

Tafsiri matokeo ya kipimo hiki, lakini kwanza uliza: je, kipimo hiki ni sahihi kwa tatizo hili? usahihi 0.99]Ungependekeza kipimo kipi na kwa nini, na ni ishara gani ninapaswa kutafuta ili kunifanya nitilie shaka matokeo ya sasa?

Angalia ikiwa kuna maelezo ya kibinafsi/ya siri katika data nitakayotoa kwa kidokezo kifuatacho. Orodhesha sehemu (jina, barua pepe, nambari ya kitambulisho, simu, anwani) ambazo zinahitaji kufunikwa katika maandishi hapa chini. Maandishi: [maandishi]

Jedwali la jukumu na mamlaka

Jitihada

Jukumu la akili ya bandia

Mmiliki wa uamuzi

Kitendaji cha mifupa ya msimbo / mabadiliko

rasimu ya jenereta

Mhandisi (maoni)

EDA / muhtasari wa data

kiongeza kasi

Mhandisi (anathibitisha kwa kupima)

Tafsiri ya kipimo

Pendekezo

mhandisi

Ni data gani itaingia kwenye mafunzo?

Pendekezo

Timu + mmiliki wa data

Weka mfano katika uzalishaji

Kikumbusho cha orodha

Mhandisi anayewajibika + timu

Usindikaji wa data ya kibinafsi

Hakuna (haijatumika)

Kidhibiti cha kisheria + cha data

Makosa ya kawaida

  • Kutumia pato bila kuithibitisha. Makosa ya kawaida na ya gharama kubwa zaidi. Nambari au kipimo kinachoonekana kizuri haimaanishi kuwa ni sahihi.
  • Kubandika data ghafi ya siri kwenye zana. Baada ya kutumwa, haiwezi kurejeshwa.
  • Inategemea kipimo kisicho sahihi. Vipimo visivyooana kama vile usahihi katika data isiyosawazishwa na RMSE katika matatizo ya cheo ni ya kupotosha.
  • Kukosea akili ya bandia kama mtoa maamuzi. Anatoa mapendekezo; Wajibu ni wa aliyetia sahihi.
  • Mwongozo usio na muktadha. Maombi yenye utata kama vile "andika muundo" hutoa matokeo yasiyoweza kuthibitishwa.

Kwa muhtasari

Akili Bandia ni bidhaa iliyotengenezwa na mhandisi wa ML na kinakilishi chake cha kila siku. Thamani yake ni ya juu zaidi katika hatari ndogo, kazi zilizothibitishwa kwa urahisi kama vile hati-data-data; Maamuzi yanayoathiri pesa, faragha na usalama hubaki na mtu. Unganisha kila pato kwa chanzo, pima tena, pitia kichujio cha uhandisi. Linda data ya siri, tumia magari yaliyoidhinishwa, fanya kazi kwa usalama kwa madhumuni ya kujihami pekee. Nidhamu hii ndiyo msingi wa vitengo vyote vinavyofuata.

Jukumu la maombi

Chagua kazi kutoka kwa mradi wako mwenyewe (k.m. kuandika kazi ya kusafisha data). Kwanza andika kidokezo dhaifu, kisha andika kidokezo dhabiti kwa kutumia kiolezo katika kitengo hiki. Chukua matokeo yote mawili, tumia uthibitishaji wa hatua tatu (kiungo cha chanzo, fanya upya, kichujio cha uhandisi). Kumbuka ni kidokezo kipi kinahifadhi dakika ngapi na masahihisho mangapi.

orodha ya ukaguzi

  • [ ] Nimebainisha kiwango cha hatari (chini/juu) cha kazi yangu.
  • [ ] Sikuweka data yoyote halisi ya kibinafsi/siri katika dodoso; Niliifunika uso au nilitumia sampuli ya sintetiki.
  • [ ] Niliunganisha pato kwa chanzo, niliendesha tena, nikaichuja kutoka kwa mtazamo wa kihandisi.
  • [ ] Nilikagua kuwa nilichagua kipimo sahihi.
  • [ ] Nilifanya uamuzi muhimu (kuiweka katika uzalishaji, usindikaji wa data) mwenyewe/na timu, sikuiacha kwa akili ya bandia.
  • [ ] Nilitumia gari lililoidhinishwa na shirika.