Јединице
1. Увод у вештачку интелигенцију у науци о подацима и аналитици: ток посла, улоге, границе, валидација и етика 2. Прикупљање података и разумевање извора: шема, узорковање, квалитет и свест о цурењу 3. Чишћење података и претходна обрада: Недостајућа вредност, Оутлиер и конверзија типа 4. Истраживачка анализа података (ЕДА): дистрибуције, односи и почетни увиди 5. Инжењеринг карактеристика: генерисање варијанти, кодирање, скалирање и избегавање цурења 6. Изградња модела: дефиниција проблема, избор алгоритма и подела обуке/тестирања 7. Евалуација модела: метрика, унакрсна валидација и екстремно учење 8. Визуелизација и приповедање: тачна графика, искрена графика 9. Генерисање кода: Анализа уз помоћ вештачке интелигенције са Питхон-ом (панде) и СКЛ-ом 10. Цурење података и репродуктивност: тихе катастрофе и дисциплина 11. МЛОпс фондација, етика, приватност и одговорна аналитика
Јединица 11 / 11

МЛОпс фондација, етика, приватност и одговорна аналитика

Добици:

  • Способност разумевања МЛОпс фаза (пуштање, примена, надгледање, преобука, враћање) и померање модела и планирање праћене примене
  • Способност примене принципа правичности модела, транспарентности и одговорности и разликовања статистичке тачности од етичке прихватљивости
  • Способност заштите личних података принципима КВКК/ГДПР и додељивање коначне одговорности човеку у одлукама са великим утицајем

Обука модела и постизање високог резултата није крај, већ средина. Права вредност долази када се модел пусти у производњу и поуздано ради, прати се током времена без кварења, а цео процес се одвија у етичким и законским границама. Ова завршна јединица комбинује три теме: МЛОпс (дисциплина пуштања у рад, праћење и одржавање модела), етику (праведност, транспарентност, незлонамерност) и приватност (заштита личних података). АИ производи код, контролне листе и нацрте у овим областима; Али људи одлучују да ли ће модел бити активан, на кога ће то утицати и који подаци могу да се користе. Ове одлуке нису техничке, већ одлуке о одговорности.

МЛОпс: модел живи као производ

МЛОпс (Мацхине Леарнинг Оператионс – пракса покретања, праћења и ажурирања модела машинског учења у производњи) је прилагођавање ДевОпс-а у развоју софтвера науци о подацима. Основна идеја: модел није датотека која је једном обучена и заборављена, већ живи производ који захтева стално одржавање. Главне фазе:

1. Версионирање: Код (Гит), подаци и модел су верзионисани заједно; Евидентирано је који модел је произведен са којим подацима и кодом.

2. Примена: Модел се активира као АПИ или пакетни посао. Обично се прво даје малој публици (дистрибуција нијанси/канари).

3. Мониторинг: Перформансе модела и улазни подаци се стално прате.

4. Поновна обука: Када перформансе падну, модел се поново обучава са ажурираним подацима.

Промена узорка: тихо изобличење

Највећа опасност у производњи је дрифт модела (модел дрифт / дата дрифт). Свет се мења; Услови на којима сте тренирали свој модел (понашање купаца, цене, сезона, законска регулатива) се временом мењају и модел почиње да застарева. На пример, модел потражње обучен пре пандемије је потпуно погрешан током пандемије. Померање се јавља у два облика: померање података (дистрибуција промена улазних података) и померање концепта (однос између улазних и циљних промена). Начин да се ово ухвати је праћење: стално пратите дистрибуцију улаза, дистрибуцију предвиђања и (ако је могуће) учинак у поређењу са стварним резултатом.

Опрез: Модел пуштен у производњу ће се сам од себе покварити; Није питање "ако" већ "када". Примена модела без подешавања надгледања је као вожња аутомобила без контроле његовог мотора; Једног дана само мирно седи и не примећујеш.

МЛОпс елемент

Сврха

Ако се занемари

Версионинг

Знајући шта се производи

Непоновљиво, не може се пратити

Мониторинг

Видећи лапсус рано

Модел се тихо квари

преквалификација

будите у току

Предвиђања застаревају

Роллбацк

повратак на лош модел

Неисправан модел остаје активан

Документација

транспарентност, промет

Информације се заглављују у једној особи

Етика: моделске одлуке утичу на људе

Модели података се све више користе у одлукама које утичу на животе људи: кредит, запошљавање, осигурање, правда. Са овом моћи долази и одговорност. Главни етички ризици:

Пристрасност и дискриминација: Модел може научити и одржавати неправде у историјским подацима. Ако је одређеној групи у прошлости дато мање заслуга, модел претпоставља да је то „правило“ и аутоматизује дискриминацију. Зато је анализа праведности — провера да ли модел функционише слично за различите групе (пол, узраст, регион) — неопходна.

Транспарентност и објашњивост: Требало би да будете у стању да објасните зашто је модел одбио особу. „Црна кутија је тако рекла“ је етички и често правно неприхватљива. Зато су алати за објашњење (важност карактеристика, СХАП вредности) вредни.

Одговорност: Ко је одговоран ако модел донесе погрешну одлуку? Одговор је увек особа/институција, а не модел. Људски надзор (хуман-ин-тхе-лооп — човек који одобрава коначну одлуку) треба да буде очуван у одлукама са великим утицајем.

Опрез: Модел може бити статистички „тачан“, али етички неприхватљив. Веома прецизан модел који систематски доводи у неповољнији положај једну групу није добар модел. Искреност није замена за правду.

Приватност: лични подаци су пажљиво заштићени

Сирови материјал науке о подацима често су лични подаци, а ти подаци су заштићени законом: КВКК у Турској, ГДПР у Европи. Основни принципи су: ограничење сврхе (подаци се не користе у друге сврхе осим сврхе за коју су прикупљени), минимизација података (не прикупља се/задржава се више података него што је потребно), анонимизација (подаци се уклањају) и безбедност (подаци се чувају шифровани, а приступ им је ограничен). Критично правило када радите са АИ алатима: никада не лепите стварне личне податке у јавни АИ алат. Већину времена за анализу су довољни дијаграм и анонимни/синтетички узорак.

Додатни нагласак у контексту информационе безбедности: користите алате и технике науке о подацима само на подацима и системима за које имате овлашћења, у сврхе одбране и легитимне анализе. Неовлашћени приступ туђим подацима, поновна идентификација појединаца (извлачење идентитета из анонимних података) или неовлашћено профилисање је и незаконито и неетично.

три мини кофера

Случај 1 — Колапс без праћења. Компанија за е-трговину објавила је свој модел препоруке и није поставила праћење. Након 4 месеца каталог производа се значајно променио; модел је наставио да препоручује застареле производе, а стопа конверзије је тихо опала за 30%. Месецима нико није приметио. Поука: распоређивање без надзора постаје слепо.

Случај 2 — Скривена дискриминација. Модел скрининга запошљавања је научио о родној неравнотежи у историјским подацима и систематски потцењивао кандидаткиње. Није примећено јер није било анализе правичности; То је откривено у ревизији и институција се суочила са озбиљним репутацијским/правним ризиком. Поука: групна контрола правичности је од суштинског значаја у моделима са високим утицајем.

Случај 3 — Кршење поверљивости. Један аналитичар је учитао датотеку која садржи стварне е-поруке купаца и историју куповине у јавни алат за вештачку интелигенцију и рекао, „сажми сегменте“. Лични подаци су напустили институцију; КВКК процес је започео. Исправан начин је био уклањање поља идентитета и дељење само анонимних својстава. Поука: прави лични подаци не улазе у отворени алат.

Четири шаблона за копирање

1) Контролна листа пре имплементације:

Ваша улога: МЛОпс консултант. Наведите ствари које треба да проверим пре него што ставим модел у производњу: верзионисање, метрика праћења, план враћања, праг перформанси, упозорење о померању података, одговорна особа. Додајте објашњење од једне реченице „зашто је то важно“ за сваку ставку. ја ћу одлучити.

2) Дизајн праћења смене модела:

Предложите план праћења одступања за модел класификације у производњи: (1) које дистрибуције улаза треба да пратим, (2) који аларм за дистрибуцију предвиђања, (3) како упоредити перформансе када стигне прави резултат, (4) на ком прагу треба да се покрене поновна обука. Такође обезбедите скелет кода.

3) Контрола правичности:

Напишите код који упоређује перформансе мог модела за различите групе (нпр. старосни опсег, регион): присећање/прецизност и стопа позитивне одлуке за сваку групу. Упозорите ако постоји значајна разлика између група. Прављење каузалних/политичких интерпретација; Само ми покажите разлике и размотрићу одлуку.

4) Претходна провера приватности:

Пре него што дате податке АИ алату, проверите: да ли постоје лични подаци/идентитети (име, е-пошта, ИД, телефон, адреса, ИП) у листи колона испод? Ако јесте, наведите које би требало уклонити или анонимизирати. Колоне: [лист]. Сврха: дељење само анонимне шеме.

Слаби промпт / Јаки промпт

Слабо обавештење:

Мој модел је спреман, идите уживо.

Примена није један корак; Покретање уживо без праћења, враћања, праведности и контроле приватности је тихи позив за катастрофу.

Снажан упит:

Ваша улога: одговорни МЛОпс консултант. Мој модел је обучен, желим потпуну припрему пре него што кренем уживо. Генеришите: (1) контролну листу пре постављања, (2) план праћења одступања, (3) групни код за проверу праведности, (4) проверу приватности (да ли постоје лични подаци). Такође предложите како заштитити пристанак људи у одлукама са великим утицајем. Коначне одлуке су моје.

Овде се дистрибуција, праћење, правичност и приватност третирају као један одговоран процес.

Уобичајене грешке

  • Примена модела без подешавања надгледања. Модел нечујно клизи и изобличава се; Може потрајати месецима да се примети.
  • Заобилазећи проверу правде. Модел високе верности може систематски да угрози групу.
  • Доношење необјашњиве одлуке о црној кутији. Одлуке са великим утицајем морају бити објашњиве; „Манекенка је тако рекла“ није довољно.
  • Давање стварних личних података отвореном АИ алату. кршење КВКК/ГДПР; Дијаграм и анонимни пример су довољни.
  • Делегирање одлуке моделу. Одговорност увек лежи на особи; Одржава се људски надзор високог утицаја.
Савет: Пре него што кренете уживо са сваким моделом, поставите једно питање наглас: „Ако овај модел сутра тихо поквари или неправедно казни групу, како ћу га приметити и вратити?“ Ако немате јасан одговор на ово питање, модел још није спреман за производњу.

Укратко

Посао модела се не завршава високим резултатом, већ поузданим и одговорним радом у производњи. МЛОпс је дисциплина покретања уживо, праћења заношења, преобуке и враћања модела; Примена без праћења је тихи колапс. Етика захтева правичност, транспарентност и одговорност модела; статистичка тачност није замена за етичку прихватљивост. Приватност значи заштиту личних података принципима КВКК/ГДПР и држање стварних података даље од отворених алата. Све ове одлуке нису техничке, већ одлуке о одговорности и увек припадају човеку.

Задатак апликације

Размислите о томе као да намеравате да ставите модел који сте изградили (или хипотетички) у производњу и попуните четири листе: (1) контролну листу пре имплементације, (2) метрику кретања коју ћете пратити, (3) групни план контроле праведности, (4) контролу приватности. Затим напишите конкретан одговор на питање "Како ћу приметити ако се сутра тихо поквари и да га вратим?"

контролна листа

  • [ ] Да ли примењујем модел са планом за праћење (упозорење о проклизавању) и враћање?
  • [ ] Да ли сам проверио јаз у правичности/учинку за различите групе?
  • [ ] Да ли сам одржао „људ у петљи“ за одлуке са великим утицајем?
  • [ ] Да ли сам заштитио личне податке принципима КВКК/ГДПР и држао их даље од отворених алата?
  • [ ] Да ли сам ставио крајњу одговорност на човека, а не на модел?

Модул Екам

1. Научник за податке пита вештачку интелигенцију: „Колико је насумична шума тачна на овим подацима?“ без икакве обуке модела, и директно ставља у презентацију одговор „89%“. Шта је суштинска грешка у овом приступу?

  • А) Чекање на метрику без давања података и модела вештачкој интелигенцији; Игноришући да је број који производи лажан и да се права метрика може пронаћи само кроз обуку и тестирање ✔
  • Б) Мора користити логистичку регресију уместо насумичне шуме
  • Ц) Стопа тачности мора увек бити изнад 90%.
  • Д) Строго је забрањено укључивање метрике у презентацију

Објашњење: Вештачка интелигенција не може да произведе метрику без приступа моделу и подацима; Број који даје је халуцинација (измишљена). Метрика се добија сопственим прорачуном научника података тек након што је модел заиста обучен и тестиран. Непроверени излаз је као непотписани извештај.

2. Колона 'разлог затварања налога' је укључена када се прикупљају подаци за прогнозу одлива; Ова колона се попуњава тек након што купац оде. Модел даје 97% на тест сету, али не ради у производњи. Које је име и узрок овог стања?

  • А) Прекомерно учење; Модел је превише сложен
  • Б) цурење података; ✔ Коришћење информација које неће бити доступне у време предвиђања, али су резултат циља, као карактеристика
  • Ц) Недовољно учење; Модел је превише једноставан
  • Д) Пристрасност избора; мала величина узорка

Објашњење: Ово је класично цурење података: 'разлог затварања' је резултат циља и још увек је празан у време предвиђања. Модел ради трик са овим будућим знањем, изгледа одлично на тестном сету, али пада у производњи јер је та колона празна. Свакој колони треба поставити питање 'да ли га имам у тренутку предвиђања'.

3. Аналитичар попуњава вредности које недостају у колони прихода са средњом вредности; али нестали заправо припадају сегменту са ниским примањима који никада није пријавио приходе (систематски нестали). Зашто је ово пуњење нетачно?

  • А) Средња вредност је увек већа од медијане, па је нетачна
  • Б) Вредности које недостају никада не треба попуњавати, увек их треба брисати
  • Ц) Попуњавање систематске празнине средњом вредности искривљује податке вештачким представљањем те групе; Пуњење је обављено без постављања питања 'зашто је празан?' ✔
  • Д) Израчунавање просека ствара проблем са перформансама јер је преспоро

Објашњење: Узрок недостатка одређује решење. Када се систематски недостајући (јаз концентрисан у одређеној групи) попуни просеком, та група постаје вештачки 'просечан приход' и подаци се искривљују. Пре попуњавања треба поставити питање 'зашто је празан'; систематско/значајно недостајуће средње вредности не треба попуњавати.

4. Тим проналази корелацију од 0,78 између 'потрошње на огласе' и 'продаје' и удвостручује буџет; Међутим, оно што заправо покреће и једно и друго су сезонске кампање. Који принцип у статистици објашњава ову грешку?

  • А) Корелација није узрочна веза; Скривена трећа варијабла може утицати на обе варијабле ✔
  • Б) Пошто је корелација од 0,78 прениска, однос треба занемарити
  • Ц) Корелација увек доказује узрочност, тим је у праву
  • Д) Корелација између оглашавања и продаје не може се математички израчунати.

Објашњење: Корелација није узрочна веза. Две варијабле могу деловати заједно јер скривена трећа варијабла (овде сезонске кампање) утиче на обе. Закључак да једно узрокује друго може се утврдити само експериментом и теренским знањем; Сам број корелација није доказ узрочности.

5. Модел откривања преваре показује 99,2% тачности и тим слави; Међутим, стопа лажних трансакција у подацима је само 0,8%, а опозив модела је 6%. Шта показује ова табела?

  • А) Модел је савршен јер је тачност преко 99%
  • Б) Тачност доводи у заблуду са неуравнотеженим подацима; Модел пропушта скоро све лажне (мало опозив), треба погледати одговарајућу метрику ✔
  • Ц) Нема проблема јер је опозив модела висок
  • Д) Није било потребе да се прави модел јер је стопа лажирања била ниска

Објашњење: 'Тачност' је варљива у неуравнотеженим подацима. Када модел скоро сваку трансакцију назове „чистом“, добија високу тачност јер је лажњака веома мало, али не успева да ухвати лажне, што је његова главна сврха (подсећа се 6%). Стога, у неуравнотеженим проблемима, фокус није на тачности, већ на матрици конфузије и метрикама које су погодне за сврху посла, као што је опозив/прецизност.

6. У пројекту предвиђања потражње, временски зависни подаци се насумично деле на обуку/тестирање. Модел даје 93% тачности, али руши у производњи. Какав би требало да буде исправан приступ подели?

  • А) Увећавање тестног скупа, нпр. подела 50%/50%
  • Б) Коришћењем сложенијег модела
  • Ц) Потпуно уклоните партицију и тренирајте са свим подацима
  • Д) Хронолошко раздвајање: обука са старим периодом и тестирање са новим периодом, чиме се спречава да модел види будућност ✔

Објашњење: Ако се врши насумична подела у подацима временске серије, модел види будућност и предвиђа прошлост у обуци; то је цурење и производи успех који заправо не постоји. Исправан приступ је хронолошко раздвајање: обука са старим периодом и тестирање са новим периодом, имитирање реалног стања у производњи (предвиђање из прошлости у будућност).

7. Из којих података треба израчунати параметре скалирања (СтандардСцалер) у инжењерингу карактеристика и како их применити?

  • А) Требало би да се израчуна из свих података (обука + тестирање заједно) тако да буде тачније
  • Б) Требало би се израчунати посебно за сваки ред, из сопствене вредности тог реда
  • Ц) Треба да се израчуна само на основу података теста
  • Д) Треба га израчунати само на основу података о обуци, а затим исте параметре треба применити на податке теста; иначе ће цурити ✔

Објашњење: Параметри свих трансформација (средња вредност, стандардна девијација, итд.) као што су скалирање, кодирање и паддинг треба да се науче само из података за обуку, а затим исто треба применити на податке теста. Узимање тестних података у обзир такође доводи до тога да информације о тесту ометају обуку, односно цурење, и чини да модел изгледа боље него што јесте. Коришћење Пипелине-а то осигурава.

8. Модел даје 98% тачности на сету за обуку и 72% тачности на тест сету. Шта овај симптом указује и шта треба учинити?

  • А) Недовољно учење; модел треба учинити сложенијим
  • Б) цурење података; тест сет мора да се промени
  • Ц) Преоптерећење; модел треба поједноставити, применити регуларизацију и унакрсну валидацију ✔
  • Д) Нормална ситуација; Образовни резултат је ионако увек већи, мере предострожности су непотребне

Објашњење: Веома висок резултат у тренингу и значајно низак резултат у тестирању је класичан симптом преоптерећења: модел је упамтио шум података о тренингу, а не прави образац. Решења укључују поједностављење модела, више података, регуларизацију и верификацију стања унакрсном валидацијом. Ослањање само на резултат образовања крије ову замку.

9. У презентацији менаџмента, и-оса тракастог графикона у коме се продаја повећава са 1.000 на 1.020 почиње на 980 да би повећање изгледало огромно. Стварно повећање је 2%. Зашто је ово етичко питање?

  • А) Скраћена и-оса визуелно преувеличава малу разлику и обмањује гледаоца; Ради праведности, ос у поређеним шипкама треба да почиње од 0 ✔
  • Б) Тракасти графикони се никада не могу користити за податке о продаји
  • Ц) Нема проблема; Увек је добро да графикон изгледа импресивно
  • Д) И-оса увек треба да почиње од највеће вредности података

Објашњење: У тракастим графиконима за упоредне сврхе, и-оса би генерално требало да почиње од 0. Сечење осе и почетак од 980 чини да мала разлика од 2% делује визуелно огромно и обмањује посматрача. Етичка одговорност стручњака за податке је да нацрта поштене графиконе који не прецењују или потцењују податке.

10. Аналитичар проналази укупан промет 3 пута након спајања налога са табелом производа; Број линија је повећан са 240 хиљада на 690 хиљада. Шта је требало учинити да се спречи ова тиха грешка?

  • А) Укупан промет поделите са 3
  • Б) Увек користите одвојене упите уместо ЈОИН
  • Ц) Потпуно брисање табеле производа
  • Д) Провера броја редова након спајања/ЈОИН и провера да ли су спојени преко исправног кључа; Рано хватање репликације ✔

Објашњење: Када постоји више редова за сваки производ (различите боје, на пример) у табели производа, ЈОИН преко погрешног кључа ће дуплирати сваку наруџбу и повећати укупне вредности. Код ради без грешака, али резултат је погрешан. Начин да се ово избегне је да проверите број редова након сваког спајања/ЈОИН и спојите са исправним кључем.

11. Модел скрининга запошљавања учи о родној неравнотежи у историјским подацима и систематски подцјењује кандидаткиње, али је његова укупна тачност висока. Шта ово значи?

  • А) Нема проблема јер модел има високу тачност
  • Б) Статистичка тачност није замена за етичку прихватљивост; модел је научио о дискриминацији у прошлости, потребна је групна провера праведности ✔
  • Ц) Даље повећање тачности модела решава проблем
  • Д) Правичност је изван делокруга науке о подацима

Објашњење: Чак и ако је модел статистички исправан, може бити етички неприхватљив. Модел учи неправду у подацима из прошлости и аутоматизује дискриминацију. Висок интегритет није замена за правду; У моделима са високим утицајем, контрола правичности, која мери разлику између учинка/одлуке за различите групе, је од суштинског значаја и крајња одговорност лежи на човеку.

12. Запослени отпрема датотеку која садржи стварне е-поруке купаца и историју куповине у јавни алат за вештачку интелигенцију и каже „сажми сегменте“. Зашто је ово озбиљна грешка и који је прави пут?

  • А) Нема проблема; АИ алати никада не чувају податке
  • Б) Грешка је у томе што је датотека превелика; требало смањити
  • Ц) Пружање стварних личних података отвореном алату представља кршење КВКК/ГДПР; поља идентитета су требало да буду уклоњена и да се дели само анонимна шема/својство ✔
  • Д) ЦСВ је требало да се користи уместо само Екцел-а

Објашњење: Када се прави лични подаци (као што су е-пошта, име, итд.) дају јавно доступном алату вештачке интелигенције, доћи ће до повреде приватности у оквиру КВКК / ГДПР; подаци напуштају организацију. Већину времена за анализу су довољни дијаграм и анонимни/синтетички узорак. Исправан начин је уклањање поља идентитета и дељење само анонимних својстава.

13. Модел препоруке је пуштен у производњу, али праћење није успостављено; Када се каталог производа промени после 4 месеца, модел наставља да препоручује старе производе и стопа конверзије тихо опада за 30%. Како се зове овај феномен?

  • А) Прекомерно учење; Модел памти сет за обуку
  • Б) Одношење модела; Како се свет мења, модел застарева нечујно, неприметно јер није успостављен надзор ✔
  • Ц) Пристрасност избора; пристрасност узорка
  • Д) Кршење минимизације података

Објашњење: Ово је померање модела (померање модела/података): када се свет промени (каталог, понашање, годишње доба) услови под којима је модел обучен се мењају и модел се тихо квари. Модел пуштен у производњу се сам од себе погоршава; Питање је 'када'. Примена без надгледања (праћење уноса и перформанси) онемогућава откривање деградације.

14. Модел који добија 88% тачности у једној подели тренинга/тестирања има петоструке резултате унакрсног провера од 88%, 71%, 83%, 64%, 79%. Шта то указује и зашто је важна унакрсна валидација?

  • А) Модел је стабилан; 88% је стварни учинак
  • Б) Унакрсна валидација је непотребна; Један одељак је довољан
  • Ц) Велика волатилност скорова указује да је модел нестабилан; унакрсна провера перформанси заснива перформансе на просеку и дистрибуцији више корпи, а не једне срећне корпе ✔
  • Д) Најбоље је пријавити највећи резултат (88%)

Објашњење: Један одељак може бити срећан или несретан; 88% је само резултат те лаке поделе. Унакрсна валидација дели податке више пута, заснивајући перформансе на средњој вредности (овде ~77%) и показујући променљивост резултата. Висока волатилност овде сугерише да је модел нестабилан; Ослањање на један одељак је погрешно.