Јединица 1 / 11

Вештачка интелигенција у МЛ инжењерству: улога, границе, валидација и одговорност

Добици:

  • Бити у стању да разликује где у току рада МЛ (код, подаци, документ) вештачка интелигенција штеди време уз мали ризик, а где су одлуке као што су метрика / подаци / стављање у производњу препуштене човеку, у складу са нивоом ризика задатка.
  • Способност примене дисциплине која верификује сваки излаз АИ тако што га повезује са извором, поново га покреће, мери и пропушта кроз инжењерски филтер.
  • Способност стицања навике да се необрађене поверљиве и личне податке не шаљу спољним алатима, коришћење алата које је одобрила компанија и руковање безбедносним питањима само у одбрамбене сврхе.

Вештачка интелигенција у инжењерству машинског учења: улога, границе, валидација и одговорност

Инжењер машинског учења (МЛ инжењер: софтверски професионалац који дизајнира, обучава и доноси моделе који уче из података у производњу) данас ради са другим алатом вештачке интелигенције на сваком кораку свог посла. Помоћник за кодирање је на снази када се пише код, модел разговора када се истражују подаци, а модел великог језика (ЛЛМ: неуронска мрежа са милијардама параметара која разуме и производи текст) када се производи документација. Овај модул разматра вештачку интелигенцију и као развијени производ и као свакодневни радни алат инжењера МЛ. Делује тако што јасно оцртава границе одговорности без мешања две улоге.

У овој првој целини одговарамо на основно питање: Где у МЛ инжењерингу вештачка интелигенција штеди реално време, а где морамо да препустимо одлуку људима? Одговор је у срцу инжењерске дисциплине: онај ко прави је брз, онај који проверава је одговоран.

Где је вештачка интелигенција корисна у МЛ инжењерингу?

МЛ пројекат пролази кроз отприлике следеће линије: прикупљање података, чишћење података, инжењеринг карактеристика (превођење необрађених података у дигиталне сигнале које модел може да разуме), обука модела, евалуација, примена (примена: отварање модела стварном кориснику) и праћење. АИ помаже на свакој станици на овој линији, али њен ниво овлашћења варира.

Области са високом наградом и ниским ризиком: производња скелета кода, израда функције трансформације података, тумачење порука дневника, описивање праћења стека, сумирање белешки о експериментима, писање документације и РЕАДМЕ-ова, предлагање тест случаја. Овде су грешке вештачке интелигенције јефтине; јер ће излаз већ проћи кроз тестирање и преглед.

Области високог ризика: одлучивање о томе који подаци иду у обуку, потврда да ли модел треба да иде у производњу, процена да је метрика „довољно добра“, одлука да се лични подаци обрађују, затварање безбедносне рањивости као „смеће“. Ово утиче на новац, приватност, правну одговорност и поверење корисника. Вештачка интелигенција овде даје предлоге; Одлуку доноси надлежни инжењер и одговорни тим.

Савет: Пре него што предате задатак вештачкој интелигенцији, питајте: „Која је цена ако је овај излаз погрешан, и колико ће лако неко схватити грешку?“ Ако је цена ниска и хватање је лако, пренесите је даље. Ако је цена висока или је хватање тешко, користите АИ само за нацрт и одлучите.

Дисциплина верификације: три корака

У МЛ инжењерингу, АИ излаз никада није „готов посао“; То је нацрт. Покрените сваки излаз кроз ова три корака:

  1. Повежите га са извором. Ако је модел рекао број, праг или „најбољу праксу“, заснирајте то на званичној документацији, стварној вредности у бази кода или измереној метрици. Овде се најчешће хвата „уклапање модела“ (халуцинација: самоуверена производња нестварних информација помоћу језичког модела).
  2. Поново покрените и измерите. Покрените генерисани код, поново израчунајте метрику коју производи на сопственом тестном скупу, потврдите предложени СКЛ упит на малом узорку. Код који не ради је безвредни, чак и ако изгледа лепо.
  3. Провуците га кроз инжењерски филтер. Да ли излаз остаје на скали? Да ли су узети у обзир ивични случајеви (празни подаци, веома велики унос, поља која недостају)? Да ли постоји повреда безбедности и приватности? Само особа која познаје ову област може да уради овај корак.

Слаби промпт / Јаки промпт

Слаб упит: "Напишите ми неки код за обуку модела."

Снажан упит: „Напишите скрипту за обуку за бинарну класификацију помоћу сцикит-леарн. Улаз: дата/траин.паркует, циљна колона ис_цхурн. Постоји неравнотежа класе (позитивна стопа ~8%), управљајте њом са цласс_веигхт. Користите ПР-АУЦ (подручје испод криве прецизног опозива) као погрешна неметричка процена података. насумично семе до 42. Тестирајте на крају скупа за штампање кода ПР-АУЦ."

Разлика: други промптни задатак садржи истинитост података, тачну метрику, информације о неравнотежи и захтев за поновљивост. Из овог контекста резултат је проверљив и употребљив.

Приватност и безбедност података: прва одговорност инжењера

Инжењер МЛ често додирује најосетљивије податке компаније: евиденцију купаца, историју трансакција, здравствене или финансијске податке, евиденцију производних система. Три правила приликом давања података алатима вештачке интелигенције:

  • Не шаљите необрађене личне и поверљиве податке спољним алатима. На пример, уместо лепљења е-порука клијената у промпт, пошаљите шему и лажне (синтетичке) узорке. Користите маскирани пример као што је „ек: ахмет@екампле.цом“ уместо стварних података.
  • Користите возила одобрена од стране предузећа. Изаберите алате за које је уговорно јасно где се подаци обрађују, да ли се чувају, да ли се користе за образовање или не. Обрада корпоративних података са личним налогом представља прекршај у већини компанија.
  • Политика минималних података. Наведите минимални контекст потребан за решавање задатка. Не цела табела, већ релевантних 5 колона и шема.
Опрез: Претпоставите да се текст који дате језичком моделу не може опозвати. Немојте слати необрађене личне податке мислећи „касније ћу их избрисати“; Ризик је настао оног тренутка када је послат.

Одбрамбена употреба у области безбедности

МЛ инжењери често инсталирају сигурносне системе: откривање преваре, класификацију злонамерног саобраћаја, аутентификацију. У овом модулу покривамо безбедносна питања само у одбрамбене сврхе: откривање напада, јачање система, затварање рањивости. Коришћење вештачке интелигенције за неовлашћени приступ, цурење података или неовлашћену интервенцију у туђи систем је и незаконито и противно професионалној етици. Када пронађете рањивост, прави начин је да је пријавите одговорно и поправите; не експлоатисати.

три мини кофера

Случај 1 - Уштеђено време. МЛ инжењер би обично провео пола дана радећи истраживачку анализу података (ЕДА) скупа података од 40 колона. Дао је шему и излаз дф.десцрибе() вештачкој интелигенцији и упитао: „Које колоне имају високу стопу одступања и пропуштања, које трансформације препоручујете?“ За 20 минута добио је листу приоритета, верификујући сваку ставку својом шифром. Уштеда: ~3 сата, мали ризик од грешке јер се мери сваки захтев.

Случај 2 - Ухваћена грешка. „Тачност тренинга је 99%, одлична“, рекао је модел помоћник за ћаскање. Инжењер је применио трећи корак (инжењерски филтер) и схватио: циљна колона има случајно процуреле атрибуте (цурење података: модел види информације које не би требало да види у обуци). Стварни учинак је био много нижи. Инжењеров скептицизам, а не „сјајна“ интерпретација вештачке интелигенције, спасила је посао.

Случај 3 – Спречавање нарушавања приватности. Тим је лепио евиденције о грешкама у производњи у екстерни модел и говорио „поправи ову грешку“. У евиденцији су били идентификациони бројеви купаца. Тим је направио правило да напише малу скрипту која прво маскира дневнике (правећи њихове ИД бројеве ***) и тако их шаље. Ризик од кршења је нестао, брзина помоћи се није променила.

Шаблони који се могу копирати

Задатак: [шта да се ради, једна реченица]Контекст: [шема података, величина, ограничења; НЕМА СТВАРНИХ личних података]Ограничења: [језик/библиотека, перформансе, репродуцибилност]Метрике: [како мерити успех]Жељени резултат: [код/опис/листа] и зашто у овом формату

Погледајте овај код. Процените не само да функционише, већ иу смислу: 1) ивичних случајева (празан унос, недостајућа колона, веома велики подаци)2) Ризик од цурења података3) Репродуцибилност (семе, верзија) Предложите исправке за сваки проблем који пронађете. Означите „провери“ тамо где нисте сигурни. Шифра: [шифра]

Протумачите резултат ове метрике, али прво питајте: да ли је ова метрика тачна за овај проблем? Проблем: [уравнотежена/неуравнотежена класификација, регресија, рангирање...]Пријављена метрика и вредност: [нпр. прецизност 0,99]Коју метрику бисте препоручили и зашто, и које знакове треба да тражим да бих посумњао у тренутни резултат?

Проверите да ли постоје личне/поверљиве информације у подацима које ћу дати у следећем упиту. Наведите поља (име, е-маил, матични број, телефон, адреса) која треба да буду маскирана у тексту испод. Текст: [текст]

Табела улога и овлашћења

Куест

Улога вештачке интелигенције

Власник одлуке

Костур кода / функција трансформације

генератор пропуха

Инжењер (рецензије)

ЕДА / сажетак података

акцелератор

Инжењер (проверава мерењем)

Метричко тумачење

Предлог

инжењер

Који подаци ће ићи у обуку?

Предлог

Тим + власник података

Ставите модел у производњу

Подсетник за контролну листу

Одговорни инжењер + тим

Обрада личних података

Нема (не користи се)

Правни + контролор података

Уобичајене грешке

  • Коришћење излаза без његове валидације. Најчешћа и најскупља грешка. Шифра или метрика која изгледа лепо не значи да је тачна.
  • Лепљење необрађених поверљивих података у алатку. Када се једном пошаље, не може се вратити.
  • Ослањајући се на погрешну метрику. Некомпатибилне метрике као што су тачност у неуравнотеженим подацима и РМСЕ у проблемима са рангирањем обмањују.
  • Погрешити вештачку интелигенцију као доносиоца одлука. Он даје предлоге; Одговорност је на потписнику.
  • Безконтекстуални промпт. Двосмислени захтеви као што је „напишите модел“ производе непроверљив резултат.

Укратко

Вештачка интелигенција је и производ који је развио МЛ инжењер и његов свакодневни репликатор. Његова вредност је највећа у нискоризичним, лако верификованим задацима као што су код-подаци-документ; Одлуке које се тичу новца, приватности и безбедности остају на лицу. Повежите сваки излаз са извором, поново измерите, прођите кроз инжењерски филтер. Заштитите поверљиве податке, користите одобрена возила, радите у обезбеђењу само у одбрамбене сврхе. Ова дисциплина је основа за све наредне јединице.

Задатак апликације

Изаберите задатак из сопственог пројекта (нпр. писање функције чишћења података). Прво напишите слаб упит, а затим напишите јак упит користећи шаблон у овој јединици. Узмите оба излаза, примените верификацију у три корака (линк до извора, поновно покретање, инжењерски филтер). Имајте на уму који упит штеди колико минута и колико исправки.

контролна листа

  • [ ] Одредио сам ниво ризика (низак/висок) мог задатка.
  • [ ] Нисам ставио никакве стварне личне/поверљиве податке у промпт; Ја сам га маскирао или користио синтетички узорак.
  • [ ] Повезао сам излаз са извором, поново га покренуо, филтрирао из инжењерске перспективе.
  • [ ] Проверио сам да ли сам изабрао тачан показатељ.
  • [ ] Критичку одлуку (стављање у производњу, обрада података) сам донео сам/са тимом, нисам је препустио вештачкој интелигенцији.
  • [ ] Користио сам возило које је одобрила компанија.