Печалби:
- Способност за разбиране на фазите на MLOps (освобождаване, внедряване, мониторинг, преобучение, връщане назад) и моделиране на отклонение и планиране на наблюдавано внедряване
- Способност за прилагане на принципите на справедливост на модела, прозрачност и отчетност и разграничаване на статистическата точност от етичната приемливост
- Възможност за защита на личните данни с принципите на KVKK/GDPR и възлагане на крайна отговорност на човек при решения с голямо въздействие
Обучението на модел и получаването на висок резултат не е краят, а средата. Истинската стойност идва, когато моделът бъде пуснат в производство и работи надеждно, следи се във времето без влошаване и целият процес се извършва в рамките на етичните и законови граници. Тази заключителна единица съчетава три теми: MLOps (дисциплината за пускане на живо, наблюдение и поддържане на модели), етика (честност, прозрачност, безвредност) и поверителност (защита на личните данни). AI създава код, контролни списъци и чертежи в тези области; Но хората решават дали моделът ще бъде активен, кой ще бъде засегнат и какви данни могат да бъдат използвани. Тези решения не са технически, а решения за отговорност.
MLOps: моделът живее като продукт
MLOps (Machine Learning Operations - практиката за стартиране, наблюдение и актуализиране на модели за машинно обучение в производството) е адаптирането на DevOps в разработката на софтуер към науката за данни. Основната идея: моделът не е файл, който се обучава веднъж и се забравя, а жив продукт, който изисква постоянна поддръжка. Основни етапи:
1. Версии: Кодът (Git), данните и моделът се управляват заедно; Записва се кой модел с какви данни и код е произведен.
2. Внедряване: Моделът се пуска на живо като API или партидна работа. Обикновено първо се дава на малка публика (разпределение на сянка/канарчета).
3. Мониторинг: Ефективността на модела и входните данни се наблюдават постоянно.
4. Преобучение: Когато производителността спадне, моделът се преобучава с актуализирани данни.
Промяна на модела: тихо изкривяване
Най-голямата опасност в производството е отклонението на модела (отклоняване на модела / отклонение на данните). Светът се променя; Условията, при които сте обучили своя модел (поведение на клиента, цени, сезон, законодателство), се променят с времето и моделът започва да остарява. Например модел на търсене, обучен преди пандемията, е напълно грешен по време на пандемията. Дрейфът се среща в две форми: дрейф на данните (разпределението на промените на входните данни) и концептуален дрейф (връзката между входните и целевите промени). Начинът за улавяне на това е мониторинг: постоянно проследяване на входното разпределение, разпределението на прогнозите и (ако е възможно) ефективността в сравнение с действителния резултат.
Внимание: Пуснат в производство модел ще се развали сам; Не е въпросът „ако“, а „кога“. Внедряването на модели без настройване на мониторинг е като да карате кола, без изобщо да контролирате двигателя й; Един ден просто си стои тихо и ти не забелязваш.
MLOps елемент
Цел
Ако се пренебрегне
Версиониране
Знаейки какво се произвежда
Невъзпроизводими, непроследими
Мониторинг
Виждайки фиша рано
Моделът тихо се разваля
преквалификация
бъдете в крак с времето
Прогнозите остаряват
Връщане назад
връщане към лош модел
Дефектният модел остава жив
Документация
прозрачност, текучество
Информацията се забива в един човек
Етика: моделните решения засягат хората
Моделите на данни се използват все повече при решения, които засягат живота на хората: кредит, наемане, застраховка, правосъдие. С тази власт идва и отговорността. Основни етични рискове:
Пристрастия и дискриминация: Моделът може да научи и да увековечи несправедливости в исторически данни. Ако на определена група е даван по-малко кредит в миналото, моделът приема, че това е „правило“ и автоматизира дискриминацията. Ето защо анализът на справедливостта — проверка дали моделът работи по подобен начин за различни групи (пол, възраст, регион) — е от съществено значение.
Прозрачност и обяснимост: Трябва да можете да обясните защо даден модел е отхвърлил човек. „Черната кутия каза така“ е етично и често правно неприемливо. Ето защо инструментите за обяснение (важност на характеристиките, стойности на SHAP) са ценни.
Отговорност: Кой е отговорен, ако моделът вземе грешно решение? Отговорът винаги е човек/институция, а не модел. Човешкият надзор (човек в цикъла — човек, който одобрява окончателното решение) трябва да се запази при решения със силно въздействие.
Внимание: Един модел може да е статистически „правилен“, но етично неприемлив. Много точен модел, който систематично поставя в неравностойно положение една група, не е добър модел. Честността не е заместител на справедливостта.
Поверителност: личните данни са внимателно защитени
Суровият материал за науката за данни често са лични данни и тези данни са защитени от закона: KVKK в Турция, GDPR в Европа. Основните принципи са: ограничение на целта (данните не се използват за цели, различни от целта, за която са били събрани), минимизиране на данните (не се събират/задържат повече данни, отколкото е необходимо), анонимизация (идентифициращата информация се премахва) и сигурност (данните се съхраняват криптирани и достъпът е ограничен). Критично правило при работа с AI инструменти: никога не поставяйте реални лични данни в публичен AI инструмент. През повечето време диаграма и анонимна/синтетична проба са достатъчни за анализ.
Допълнителен акцент в контекста на информационната сигурност: използвайте инструменти и техники за наука за данни само върху данни и системи, за които имате правомощия, за защитни и легитимни цели на анализ. Неоторизиран достъп до нечии други данни, повторна идентификация на лица (извличане на самоличност от анонимни данни) или неоторизирано профилиране е както незаконно, така и неетично.
три мини калъфа
Случай 1 — Непроследено срутване. Компания за електронна търговия стартира със своя модел за препоръки и не е настроила проследяване. След 4 месеца продуктовият каталог се промени значително; моделът продължи да препоръчва остарели продукти и процентът на реализация тихо спадна с 30%. Никой не забеляза месеци наред. Поука: внедряването без мониторинг е на сляпо.
Случай 2 — Скрита дискриминация. Моделът за проверка на наемането на работа научи за дисбаланса между половете в историческите данни и систематично подценява кандидатите жени. Не беше забелязано, защото нямаше анализ на справедливостта; Това беше разкрито при одит и институцията беше изправена пред сериозен репутационен/правен риск. Поука: Груповият контрол на справедливостта е от съществено значение при моделите с голямо въздействие.
Случай 3 — Нарушаване на поверителността. Един анализатор зареди файл, съдържащ имейли на реални клиенти и история на покупките, в публичен AI инструмент и каза „обобщаване на сегменти“. Личните данни са напуснали институцията; Процесът на KVKK е започнал. Правилният начин беше да се премахнат полетата за самоличност и да се споделят само анонимни свойства. Поука: истинските лични данни не влизат в отворения инструмент.
Четири копируеми шаблона
1) Контролен списък преди внедряване:
Вашата роля: MLOps консултант. Избройте нещата, които трябва да проверя, преди да пусна модел в производство: версии, показатели за наблюдение, план за връщане назад, праг на производителност, предупреждение за отклонение на данните, отговорно лице. Добавете обяснение от едно изречение „защо има значение“ за всеки елемент. Аз ще реша.
2) Дизайн за проследяване на смяна на модела:
Предложете план за наблюдение на дрейфа за класификационен модел в производството: (1) какви разпределения на входа трябва да наблюдавам, (2) каква аларма за разпределението на прогнозата, (3) как да сравня производителността, когато пристигне реалният резултат, (4) при какъв праг трябва да се задейства повторно обучение. Също така предоставете кодов скелет.
3) Контрол на справедливостта:
Напишете код, който сравнява представянето на моя модел за различни групи (напр. възрастова група, регион): припомняне/прецизност и степен на положително решение за всяка група. Предупреждавайте, ако има значителна разлика между групите. Правене на причинно-следствени/политически интерпретации; Просто ми покажете разликите и аз ще обмисля решението.
4) Предварителна проверка за поверителност:
Преди да дадете данни на AI инструмент, проверете: има ли лични данни/данни за самоличност (име, имейл, ID, телефон, адрес, IP) в списъка с колони по-долу? Ако е така, избройте кои трябва да бъдат премахнати или анонимни. Колони: [списък]. Цел: споделяне само на анонимна схема.
Слаба подкана / Силна подкана
Слаба подкана:
Моят модел е готов, стартирайте.
Внедряването не е една стъпка; Пускането на живо без наблюдение, връщане назад, справедливост и контрол на поверителността е тиха покана за катастрофа.
Мощна подкана:
Вашата роля: отговорен MLOps консултант. Моят модел е обучен, искам пълна подготовка, преди да пусна на живо. Генерирайте: (1) контролен списък преди разгръщане, (2) план за наблюдение на дрейфа, (3) базиран на група код за проверка на справедливост, (4) проверка на поверителност (има ли лични данни). Предложете също как да защитите човешкото съгласие при решения със силно въздействие. Окончателните решения са мои.
Тук разпространението, наблюдението, справедливостта и поверителността се третират като един отговорен процес.
Често срещани грешки
- Внедряване на модел без настройка на мониторинг. Моделът тихо се плъзга и изкривява; Може да отнеме месеци, за да забележите.
- Заобикаляйки проверката на справедливостта. Моделът с висока точност може системно да поставя в неравностойно положение дадена група.
- Вземане на необяснимо решение за черна кутия. Решенията със силно въздействие трябва да бъдат обясними; „Моделът така каза“ не е достатъчно.
- Предоставяне на реални лични данни за отваряне на AI инструмент. нарушение на KVKK/GDPR; Диаграмата и анонимният пример са достатъчни.
- Делегиране на решението на модела. Отговорността винаги е на човек; Поддържа се високо въздействие върху хората.
Съвет: Преди да стартирате на живо с всеки модел, задайте един въпрос на глас: „Ако този модел тихо се счупи утре или несправедливо накаже група, как ще го забележа и върна обратно?“ Ако нямате ясен отговор на този въпрос, моделът все още не е готов за производство.
В обобщение
Работата на модела не завършва с висока оценка, а с надеждна и отговорна работа в производството. MLOps е дисциплината за активиране, наблюдение за дрейф, преквалификация и връщане на модела; Внедряването без проследяване е безшумен срив. Етиката изисква справедливост, прозрачност и отчетност на модела; статистическата точност не е заместител на етичната приемливост. Поверителността означава защита на личните данни с принципите на KVKK/GDPR и запазване на реалните данни далеч от отворени инструменти. Всички тези решения не са технически, а отговорни решения и винаги принадлежат на човек.
Задача за приложение
Мислете за това, сякаш ще поставите модел, който сте изградили (или хипотетичен) в производство, и попълнете четири списъка: (1) контролен списък преди внедряване, (2) показатели за отклонение, които ще проследявате, (3) базиран на група план за контрол на справедливостта, (4) контрол на поверителността. След това напишете конкретен отговор на въпроса "Как ще забележа, ако утре тихо се счупи и ще си го върна?"
контролен списък
- [ ] Разгръщам ли модела с план за наблюдение (предупреждение за пропуск) и връщане назад?
- [] Проверих ли разликата в справедливостта/производителността за различните групи?
- [ ] Поддържал ли съм „човек в цикъла“ при решения със силно въздействие?
- [ ] Защитил ли съм личните данни с принципите на KVKK/GDPR и ли съм ги пазил от отворени инструменти?
- [ ] Възложих ли крайната отговорност на човек, а не на модела?
Изпит по модул
1. Учен по данни пита изкуствения интелект: „Колко точна е произволната гора на тези данни?“ без изобщо да обучава модела и директно поставя отговора „89%“ в презентацията. Каква е основната грешка в този подход?
- A) Изчакване на метрики без даване на данни и модели на изкуствения интелект; Пренебрегвайки, че числото, което произвежда, е фалшиво и че истинският показател може да бъде намерен само чрез обучение и тестване ✔
- B) Трябва да използва логистична регресия вместо произволна гора
- C) Степента на точност винаги трябва да бъде над 90%.
- Г) Строго е забранено включването на метрики в презентацията
Обяснение: Изкуственият интелект не може да произведе метрика без достъп до модела и данните; Числото, което дава е халюцинация (измислена). Метриката се получава чрез собствено изчисление на специалиста по данни само след като моделът действително е бил обучен и тестван. Непровереният изход е като неподписан отчет.
2. Колоната „причина за закриване на акаунт“ е включена при събиране на данни за прогноза за отлив; Тази колона се попълва само след напускане на клиента. Моделът дава 97% на тестовия комплект, но не работи в производството. Какво е името и причината за това състояние?
- А) Свръхобучение; Моделът е твърде сложен
- B) Изтичане на данни; ✔ Използване на информация, която няма да е налична по време на прогнозиране, но е резултат от целта, като функция
- В) Недостатъчно обучение; Моделът е твърде прост
- Г) Пристрастие при избора; малък размер на извадката
Обяснение: Това е класическо изтичане на данни: „причината за затваряне“ е резултат от целта и все още е празна по време на прогнозата. Моделът върши работа с това бъдещо знание, изглежда страхотно на тестовия набор, но се срива в производството, защото тази колона е празна. Към всяка колона трябва да бъде зададен въпросът „имам ли го в момента на прогнозиране“.
3. Анализаторът попълва липсващите стойности в колоната за приходи със средната стойност; но изчезналите хора всъщност принадлежат към сегмента с ниски доходи, които никога не са декларирали доходи (системно изчезнали). Защо това попълване е неправилно?
- А) Средната стойност винаги е по-голяма от медианата, така че е неправилна
- B) Липсващите стойности никога не трябва да се попълват, те винаги трябва да се изтриват
- В) Запълването на систематичната празнина със средната стойност изкривява данните чрез изкуствено представяне на тази група; Пълненето беше извършено без да се задава въпросът "защо е празно?" ✔
- Г) Изчисляването на средната стойност създава проблем с производителността, защото е твърде бавно
Обяснение: Причината за дефицита определя решението. Когато системно липсващият (празнината, концентрирана в определена група) се запълни със средната стойност, тази група се превръща в изкуствено „среден доход“ и данните се изкривяват. Преди да го напълните, трябва да си зададете въпроса „защо е празен“; системна/значима липсваща средна не трябва да се попълва.
4. Екип открива корелация 0,78 между „разходи за реклама“ и „продажби“ и удвоява бюджета; Но това, което всъщност задейства и двете, са сезонни кампании. Какъв принцип в статистиката обяснява тази грешка?
- А) Корелацията не е причинно-следствена връзка; Скрита трета променлива може да засяга и двете променливи ✔
- Б) Тъй като корелацията от 0,78 е твърде ниска, връзката трябва да се игнорира
- В) Корелацията винаги доказва причинно-следствената връзка, екипът се е оправил
- Г) Корелацията между рекламата и продажбите не може да се изчисли математически.
Обяснение: Корелацията не е причинно-следствена връзка. Двете променливи може да действат заедно, защото скрита трета променлива (тук сезонни кампании) ги засяга и двете. Заключението, че едното причинява другото, може да бъде установено само чрез експеримент и полеви познания; Броят на корелациите сам по себе си не е доказателство за причинно-следствена връзка.
5. Моделът за откриване на измами показва 99,2% точност и екипът празнува; Въпреки това процентът на фалшивите транзакции в данните е само 0,8%, а изземването на модела е 6%. Какво показва тази таблица?
- A) Моделът е перфектен, защото точността е над 99%
- B) Точността е подвеждаща с небалансирани данни; Моделът пропуска почти всички фалшификати (слабо припомняне), трябва да се разгледа подходящият показател ✔
- В) Няма проблем, тъй като изтеглянето на модела е високо
- Г) Нямаше нужда да се изгражда модел, защото фалшивият процент беше нисък
Обяснение: „Точността“ е подвеждаща при небалансирани данни. Когато моделът нарича почти всяка транзакция „чиста“, той получава висока точност, тъй като фалшификатите са много малко, но не успява да улови фалшификати, което е основната му цел (припомнете си 6%). Следователно при небалансирани проблеми фокусът не е върху точността, а върху матрицата на объркването и показателите, подходящи за целите на работата, като например припомняне/прецизност.
6. В проект за прогнозиране на търсенето зависещите от времето данни се разделят произволно на обучение/тестване. Моделът дава 93% точност, но се срива в производството. Какъв трябва да бъде правилният подход към разделянето?
- A) Увеличаване на набора от тестове, напр. разделяне 50%/50%
- Б) Използване на по-сложен модел
- C) Напълно премахнете дяла и обучете с всички данни
- D) Хронологично разделяне: обучение със стария период и тестване с новия период, като по този начин не позволява на модела да види бъдещето ✔
Обяснение: Ако се извърши произволно разделяне на данни от времеви серии, моделът вижда бъдещето и прогнозира миналото в обучението; това е изтичане на информация и води до успех, който всъщност не съществува. Правилният подход е хронологично разделяне: обучение със стария период и тестване с новия период, имитиране на реалната ситуация в производството (прогнозиране от миналото към бъдещето).
7. От какви данни трябва да се изчисляват параметрите за мащабиране (StandardScaler) в инженеринга на функции и как трябва да се прилагат?
- A) Трябва да се изчисли от всички данни (обучение + тест заедно), така че да е по-точно
- B) Трябва да се изчислява отделно за всеки ред, от собствената стойност на този ред
- C) Трябва да се изчислява само от данни от теста
- Г) Трябва да се изчисли само от данните за обучението, след което същите параметри трябва да се приложат към данните от теста; в противен случай ще протече ✔
Обяснение: Параметрите на всички трансформации (средно, стандартно отклонение и т.н.) като мащабиране, кодиране и подпълване трябва да се научат само от данните за обучение, след което същото трябва да се приложи към данните от теста. Вземането под внимание на тестови данни също води до намеса на тестовата информация в обучението, тоест до изтичане и кара модела да изглежда по-добре, отколкото е. Използването на Pipeline гарантира това.
8. Един модел дава 98% точност на тренировъчния комплект и 72% точност на тестовия комплект. Какво показва този симптом и какво трябва да се направи?
- А) Недостатъчно обучение; моделът трябва да се направи по-сложен
- B) Изтичане на данни; наборът от тестове трябва да се промени
- В) Прекомерно оборудване; моделът трябва да бъде опростен, трябва да се приложи регулиране и кръстосано валидиране ✔
- Г) Нормална ситуация; Така или иначе оценката за образование винаги е по-висока, предпазните мерки са излишни
Обяснение: Много висок резултат при обучение и значително нисък резултат при тестване е класически симптом на пренастройване: моделът е запомнил шума от данните за обучение, а не реалния модел. Решенията включват опростяване на модела, повече данни, регулиране и проверка на състоянието с кръстосано валидиране. Разчитането единствено на образователния резултат крие този капан.
9. В управленска презентация оста y на стълбовидна диаграма, в която продажбите нарастват от 1000 на 1020, започва от 980, за да изглежда увеличението огромно. Реалното увеличение е 2%. Защо това е етичен въпрос?
- A) Скъсената ос Y визуално преувеличава малка разлика и подвежда зрителя; За справедливост оста в лентите за сравнение трябва да започва от 0 ✔
- B) Стълбовидните диаграми никога не могат да се използват за данни за продажби
- В) Няма проблем; Винаги е добре диаграмата да изглежда впечатляващо
- D) Оста Y трябва винаги да започва от най-голямата стойност на данните
Обяснение: В стълбовидни диаграми за сравнителни цели оста y обикновено трябва да започва от 0. Изрязването на оста и започването от 980 прави малка разлика от 2% визуално огромна и подвежда зрителя. Етичната отговорност на специалиста по данни е да изготвя честни графики, които не надценяват или подценяват данните.
10. Анализатор намира общия оборот 3 пъти след обединяване на поръчките с продуктовата таблица; Броят на линиите се увеличи от 240 хиляди на 690 хиляди. Какво трябваше да се направи, за да се предотврати тази тиха грешка?
- А) Разделете общия оборот на 3
- B) Винаги използвайте отделни заявки вместо JOIN
- C) Пълно изтриване на продуктовата таблица
- D) Проверка на броя на редовете след сливане/JOIN и проверка дали са обединени чрез правилния ключ; Ранно улавяне на репликация ✔
Обяснение: Когато има няколко реда за всеки продукт (различен цвят, например) в продуктовата таблица, JOIN чрез грешен ключ ще дублира всяка поръчка и ще увеличи общите суми. Кодът работи без грешки, но резултатът е грешен. Начинът да избегнете това е да проверите броя на редовете след всяко сливане/JOIN и да слеете с правилния ключ.
11. Моделът за скрининг при наемане научава за дисбаланса между половете в историческите данни и систематично подценява кандидатите жени, но общата му точност е висока. какво значи това
- А) Няма проблем, защото моделът е с висока точност
- Б) Статистическата точност не е заместител на етичната приемливост; моделът е научил за минала дискриминация, изисква се групова проверка за справедливост ✔
- C) По-нататъшното повишаване на точността на модела решава проблема
- Г) Справедливостта е извън обхвата на науката за данните
Обяснение: Дори един модел да е статистически правилен, той може да е етично неприемлив. Моделът научава несправедливостта в минали данни и автоматизира дискриминацията. Високата почтеност не е заместител на справедливостта; В моделите с голямо въздействие контролът на справедливостта, който измерва разликата в изпълнението/решението за различните групи, е от съществено значение и крайната отговорност е на човека.
12. Служител качва файл, съдържащ имейли на реални клиенти и история на покупките в публичен AI инструмент и казва „обобщаване на сегменти“. Защо това е сериозна грешка и кой е правилният начин?
- А) Няма проблем; AI инструментите никога не съхраняват данни
- B) Грешката е, че файлът е твърде голям; трябваше да бъде намалена
- В) Предоставянето на реални лични данни на отворен инструмент е нарушение на KVKK/GDPR; полетата за самоличност трябваше да бъдат премахнати и да се споделят само анонимни схеми/свойства ✔
- Г) Трябваше да се използва CSV вместо само Excel
Обяснение: Когато реални лични данни (като имейл, име и т.н.) се предоставят на публично достъпен инструмент за изкуствен интелект, ще има нарушение на поверителността в обхвата на KVKK / GDPR; данните напускат организацията. През повечето време диаграма и анонимна/синтетична проба са достатъчни за анализ. Правилният начин е да премахнете полетата за самоличност и да споделите само анонимни свойства.
13. Препоръчителен модел е пуснат в производство, но проследяването не е установено; Когато продуктовият каталог се промени след 4 месеца, моделът продължава да препоръчва стари продукти и процентът на реализация тихо пада с 30%. Как се нарича това явление?
- А) Свръхобучение; Моделът запомня тренировъчния набор
- B) Дрейф на модела; Тъй като светът се променя, моделът остарява тихо, незабелязано, защото не е установен мониторинг ✔
- В) Пристрастност при избора; отклонение на извадката
- Г) Нарушение на минимизирането на данните
Обяснение: Това е дрейф на модела (модел/данни): когато светът се промени (каталог, поведение, сезон), условията, при които моделът е бил обучен, се променят и моделът безшумно се поврежда. Пуснат в производство модел се разваля сам; Въпросът е „кога“. Внедряването без мониторинг (проследяване на въвеждане и производителност) прави невъзможно откриването на влошаване.
14. Модел, който получава 88% точност в едно обучение/тест, има 5-кратни резултати за кръстосано валидиране от 88%, 71%, 83%, 64%, 79%. Какво означава това и защо кръстосаното валидиране е важно?
- А) Моделът е стабилен; 88% е реално представяне
- B) Кръстосаното валидиране е ненужно; Едно отделение е достатъчно
- В) Голямата променливост на резултатите показва, че моделът е нестабилен; кръстосаното валидиране базира производителност на средната стойност и разпределение на множество контейнери, а не един късметлийски контейнер ✔
- Г) Най-добре е да докладвате най-висок резултат (88%)
Обяснение: Едно отделение може да носи късмет или нещастие; 88% бяха просто резултат от това лесно разделяне. Кръстосаното валидиране разделя данните многократно, базирайки ефективността на средната стойност (тук ~77%) и показвайки променливостта на резултатите. Високата волатилност тук предполага, че моделът е нестабилен; Разчитането на едно отделение е подвеждащо.