Добици:
- Способност да се обезбеди поновљивост са четири стуба (фиксирање семена, верзија података, замрзавање медија, надгледање експеримента) и произведе исти резултат када се понавља иста серија
- Способност комбиновања свих станица модула (метрика, подаци, модел, ЛЛМ компоненте, евалуација, правичност, безбедност, дистрибуција, надгледање) у ланцу од краја до краја
- Способност да се потврди да критична одлука остаје на човеку на сваком заустављању и документује пројекат на начин који се може ревидирати
Најподмуклији неуспех МЛ пројекта није крах; "Нећу поново добити исти резултат." Ако данас не можете да репродукујете резултат модела који сте пустили у производњу пре три месеца, ви заправо не контролишете тај модел. У овој завршној јединици продубљујемо репродуктивност: способност да се поуздано добије исти резултат са истим инпутима и комбинује цео модул у пројектној дисциплини од краја до краја.
Зашто је репродуктивност тешка
У обичном софтверу, исти код даје исти излаз. У МЛ постоји много више варијабли које одређују исход:
- Случајност: мешање података, иницијализација тежине, подела података — све се ослања на случајност.
- Подаци: Исти код производи другачији модел са различитим верзијама података.
- Окружење: Верзије библиотеке, хардвер (ЦПУ/ГПУ), чак и оперативни систем могу да промене резултат.
- Скривени случајеви: несачувани хиперпараметар, корак ручне препроцесирања, неопажени избор.
Репродуцибилност није „лепо имати“ већ научни и инжењерски императив. Резултат који се не може репродуковати је тврдња која се не може доказати.
Четири стуба поновљивости
1. Исправите случајност. Поставите све насумичне семе на једно место: подела података, иницијализација модела, мешање података. Фиксно семе је основа гаранције „исти резултат када поновите исту вожњу“.
2. Верзија података. Забележите са којом верзијом података је изведен сваки експеримент (верзија података у јединици 2). „Најновији подаци“ су нејасни; „верзија података в3, хеш абц123“ је тачна.
3. Замрзните медијум. Закачите све зависности на њихове тачне верзије (нпр. тачне верзије као што је нумпи==1.26.4 у рекуирементс.ткт или слику контејнера). "Најновија верзија" ће једног дана све покварити.
4. Пратите све (праћење експеримента). Аутоматски сачувај за сваки експеримент: верзију кода (гит урезивање), верзију података, све хиперпараметре, метрике и излазне структуре. Алати за праћење експеримента као што су МЛфлов, Веигхтс & Биасес то раде систематски. Без регистрације, питање "које је подешавање било најбоље" остаје без одговора.
Опрез: „Сетићу се касније“ је најскупља заблуда. Две недеље касније нећете се сетити које семе, које податке, који хиперпараметар сте користили. Аутоматско праћење елиминише ослањање на меморију.
Слаб приступ / Снажан приступ
Слаб: "Нашао сам најбољи модел, налази се на нотебоок рачунару, мислим да је његов резултат био 89%."
Снажно: „Покрени #147 у алату за праћење експеримента: гит урезивање а3ф9ц, верзија података в3 (хеш абц123), семе 42, сви хиперпараметри регистровани, тест ПР-АУЦ 0,887. Када поново покренем исту команду, добијам исти резултат мало по мало. Модел зависи од овог покретања у регистратору.“
Разлика: у снажном приступу резултат није заснован на сећању, већ на фиксном и надгледаном ланцу. Свако може произвести исти резултат сваки пут.
Пројекат од краја до краја: комбинација модула
Хајде сада да комбинујемо цео модул у један ток пројекта. Прави МЛ систем пролази кроз ове станице, а свака станица се надовезује на претходну:
- Дефиниција проблема: Шта решавамо, како мерити успех (јединица 3: прави показатељ, пословни контекст). Метрика и праг су јасни од почетка.
- Цевовод података: прикупљање, валидација, чишћење, партиционисање без цурења, управљање верзијама (јединица 2).
- Развој модела: Обука, поређење основног стања, унакрсна валидација, тврдо семе (јединица 3 + ова јединица).
- Компоненте ЛЛМ (ако је применљиво): РАГ (јединица 4) и/или агенти (јединица 5); фино подешавање ако је потребно (јединица 6).
- Евалуација: евал кластер са рубним и сигурносним случајевима, вишеслојна евалуација у ЛЛМ системима (целина 8).
- Ревизија правде и етике: Анализа подгрупа, модел картице, објашњивост (јединица 10).
- Ревизија безбедности: Промптна ињекција, приватност, ланац снабдевања (јединица 9).
- Дистрибуција: Паковање, постепена дистрибуција, враћање, регистар модела (јединица 7).
- Мониторинг: Трослојни надзор, аларми за заношење (целина 8).
- Репродуцибилност: семе, верзија података, праћење медија и експеримента у целом ланцу (ова јединица).
У овом току, АИ је акцелератор и генератор нацрта на сваком заустављању; али избор метрике, одлуке о подацима, правичност приоритета, праг за примену и одобрење за издавање — критичне одлуке остају за људима. Ово је суштина модула.
Документација: будућност ће вам бити захвална
Добар МЛ пројекат документује сам себе. У најмању руку, треба написати следеће: критеријуми проблема и успеха, извор података и верзија, избор модела и оправдања, резултати евалуације (укључујући подгрупе), позната ограничења и ризици, процедура примене и проналажења, план праћења. Овај документ је најбољи пријатељ особе (можда сте то ви) која се враћа пројекту након шест месеци.
три мини кофера
Случај 1 - Изгубљени резултат. Инжењер је обучио одличан модел, али није поправио семе и није сачувао верзију података. Када је напустио посао, нико није могао да репродукује тај резултат; модел је постао "легенда црне кутије" и на крају је направљен од нуле. Протраћене су недеље. Поука: резултат који се не може поновити је непостојећи резултат.
Случај 2 - Колапс животне средине. Један тим није поправио зависности. Када је библиотека аутоматски ажурирана, излази модела су се тихо мењали и производња је прекинута. Требало је данима да се пронађе проблем. Када су зависности биле замрзнуте и контејнеризоване са дефинитивним верзијама, проблем се више није појавио. Лекција: замрзнути животну средину.
Случај 3 – Моћ праћења. Тим је аутоматски надгледао сваки експеримент. Три месеца касније, током регулаторне ревизије, одговорили су на питање „са којим подацима, са којим поставкама, какав учинак је постигао у којим групама?“ са потпуним снимком у року од неколико минута. Инспекција је протекла без проблема. Поука: надгледање је алат за усаглашеност, а не само инжењерски.
Шаблони који се могу копирати
Урадите проверу репродуктивности за овај МЛ пројекат.- Да ли су све почетне вредности насумице фиксне (подела, иницијализација, мешање)?- Да ли су подаци верзионисани?- Да ли су зависности замрзнуте на тачне верзије?- Да ли се прати сваки експеримент (урезивање кода, подаци, хиперпараметар, метрика)? Напишите конкретне кораке како то поправити за сваку колону која недостаје. Структура пројекта: [опис]
Направите скелет плана за овај МЛ пројекат од краја до краја. Проблем: [опис] Покријте следећа стајалишта и означите где је ЉУДСКА одлука на свакој станици: проблем/метрика, цевовод, модел, (РАГ/агент/фино подешавање?), процена, правичност, безбедност, дистрибуција, праћење, поновљивост. Напишите главни ризик и корак верификације за свако заустављање.
Направите образац техничке документације за овај пројекат. Секције: проблем+критеријуми успеха, подаци (извор+верзија), избор модела+оправдање, евалуација (укључујући подгрупе), позната ограничења+ризици, примена+повратак, план праћења. Дајте поља која треба попунити за сваки одељак као питања.
Проверите подешавање надгледања мог експеримента: Да ли се аутоматски чува при сваком покретању: гит урезивање, верзија/хеш података, сви хиперпараметри, сви показатељи, окружење (верзије библиотеке)? Да ли добијам исти резултат када поново трчим исту трку? Подешавање: [опис]. Наведите недостатке и исправке.
Табела колона поновљивости
колона
Шта је фиксирано
Пример возила
случајност
сва семена
постављање семена
Подаци
Верзија података/хеш
ДВЦ
животне средине
Библиотечке верзије
Захтеви пин, Доцкер
Мониторинг
Код+подаци+подешавање+метрика
МЛфлов, В&Б
Уобичајене грешке
- Не поправља семе. Резултат се не може поновити.
- Не чува се верзија података. "Са којим подацима?" остаје без одговора.
- Не замрзавање зависности. Ажурирање ће тихо покварити све.
- Остављајући експерименте за памћење. Две недеље касније ништа се не памти.
- Препуштање критичних одлука вештачкој интелигенцији. Мере, правда и одлуке о расподели треба да остану у рукама људи.
- Одлагање документације. Будући тим (и ви) плаћате цену.
Укратко
Репродуцибилност је потпис озбиљног МЛ инжењеринга: резултат који се не може поновити је недоказива тврдња. Долази са четири колоне — исправите насумичне податке, податке о верзији, замрзните окружење, пратите сваки експеримент. Пројекат од краја до краја комбинује све тачке овог модула (метрика, подаци, модел, ЛЛМ компоненте, евалуација, праведност, безбедност, дистрибуција, праћење) у међусобно повезаном ланцу; Вештачка интелигенција је акцелератор на свакој станици, али критичне одлуке остају за човеком. Документујте све — за будући тим и ревизије. Ова дисциплина је оквир који подржава све што научите током модула.
Задатак апликације
Проверите МЛ пројекат у односу на четири стуба поновљивости: да ли су семе непроменљиве, да ли су подаци верзионисани, да ли је окружење замрзнуто, да ли се експерименти прате? Поправите колоне које недостају и докажите да можете двапут да покренете исто трчање и добијете исти резултат. Затим испишите ток пројекта од краја до краја (10 заустављања) на једној страници и означите „где је људска одлука“ на свакој станици. На крају, напишите кратак нацрт техничке документације.
контролна листа
- [ ] Све семе насумице су исправљене.
- [ ] Верзија података/хеш се бележи са сваким експериментом.
- [ ] Зависности су замрзнуте на чврсте верзије (пин/контејнер).
- [ ] Сваки експеримент се аутоматски надгледа (код+подаци+подешавање+метрика).
- [ ] Када поновим исту трку, добијам исти резултат.
- [ ] Проверио сам и документовао да критичне одлуке у току од краја до краја доносе људи.
Модул Екам
1. Као инжењер МЛ-а, који је најбољи приступ при позиционирању вештачке интелигенције у току рада?
- А) АИ је акцелератор у пословима ниског ризика; Критичне одлуке попут метрике, података и производње остају потврђене и препуштене људима ✔
- Б) Све док АИ излази изгледају добро, нема потребе за верификацијом
- Ц) Препуштање одлуке о пуштању модела у производњу вештачкој интелигенцији штеди време.
- Д) Вештачка интелигенција је корисна само за писање текста, нема никакве везе са подацима и радом модела
Опис: АИ је моћан акцелератор за нискоризичне, лако верификоване задатке као што су код, сажетак података и документи; Међутим, одговорност за одлуке које утичу на новац, поверљивост и правну одговорност, као што је избор метрике, који подаци иду у обуку, и стављање модела у производњу, лежи на квалификованом инжењеру и тиму. Сваки излаз не треба користити без провере.
2. Зашто се валидација шеме поставља на почетак цевовода података?
- А) Зато што директно повећава тачност модела
- Б) Зато што чини верзионисање података непотребним
- Ц) Зато што хвата оштећене податке у најранијој и најјефтинијој тачки и спречава их да процуре у следеће кораке ✔
- Д) Зато што елиминише потребу за етикетирањем
Објашњење: Што су корумпирани подаци раније ухваћени, то је јефтиније поправити их. Валидација шеме спречава нечујно цурење корумпираних података у обуку или производњу одбијањем података изван очекиваног типа и опсега на почетку линије (нпр. померање цене 100к са променом јединице); Иста грешка ухваћена у производњи је вишеструко скупља.
3. Који је исправан приступ када се подаци поделе на обуку и тестирање у проблему који укључује време (временске серије)?
- А) Коришћење случајног цепања јер је то увек најправеднији метод
- Б) Коришћење временског раздвајања: спречите цурење тако што ћете тренирати са прошлошћу и тестирати у будућности ✔
- Ц) Коришћење свих података и за обуку и за тестирање
- Д) Укључивање тестних података у параметре скалирања пре тренинга
Објашњење: Насумично подела на временске серије даје моделу предност 'види будућност' која се никада неће десити у производњи и вештачки надувава метрику (временско цурење). Исправна је временска подела: тренирај са прошлошћу, тестирај у будућности. Ово мери стварне перформансе које га одржавају у производњи.
4. Зашто је тачност погрешна у моделу откривања превара са позитивном стопом класе од 1,5%?
- А) Зато што је тачност увек мала на неуравнотеженим подацима
- Б) Зато што се тачност може користити само за проблеме регресије
- Ц) Зато што израчунавање тачности захтева много процесорске снаге
- Д) Чак и бедни модел који предвиђа већинску класу може бити веома прецизан, скривајући тако прави успех ✔
Објашњење: На неуравнотеженим подацима, чак и основни модел који каже 'назови све негативно' добија око 98,5% тачности, али неће ухватити ниједну превару. Стога, у неуравнотеженој класификацији, прецизност, опозив, Ф1 или ПР-АУЦ се користе уместо тачности, а свака метрика се тумачи према основном моделу.
5. Зашто је поређење основне линије битно када се говори о метрици модела?
- А) Зато што је основни модел увек бољи од стварног модела
- Б) Зато што је јасно да ли је метрика значајна или не само у поређењу са једноставним основним моделом ✔
- Ц) Зато што основни модел чини унакрсну валидацију непотребном
- Д) Зато што је основни модел законски обавезан у сваком извештају
Објашњење: метрика сама по себи није добра или лоша; Да ли је то добро или лоше према основном моделу. Реченица '85% тачно' значи скоро безвредна ако основни модел већ добија 84%, а савршена ако добије 50%. Без сидра за поређење, метрика је бесмислена.
6. Који је најкритичнији безбедносни елемент који би требало да буде укључен у производну линију РАГ (Ретриевал-Аугментед Генератион) система?
- А) Упутство да се ослањате само на дати извор, да кажете „не знам“ ако извор не постоји и да цитирате извор ✔
- Б) Рећи моделу да производи што дуже и креативне одговоре
- Ц) Модел даје предност сопственом образовном знању над ресурсима
- Д) Спровести сва упутства у документима донетим као команде
Објашњење: Најважнија инструкција РАГ-а је да каже моделу да се ослања само на дати извор, а ако информација није у извору, реците 'Не знам' и цитирајте извор без измишљања. Без ове тријаде, модел може занемарити контекст и произвести халуцинације, а одговор постаје непроверљив.
7. РАГ систем даје нетачне одговоре. Где је најбоље започети дијагнозу?
- А) Прво мерење преузимања (Рецалл@К): да ли прави комад икада стигне? ✔
- Б) Одмах замените модел већим
- Ц) Промените промпт насумично и наставите да покушавате
- Д) Уграђивање свих докумената у модел уз фино подешавање
Објашњење: РАГ-ова најслабија карика је обично преузимање, а не производња. Ако се тачан део никада не донесе, модел не може да произведе ту информацију, без обзира на то колико је промпт побољшан. Стога се прво Рецалл@К мери да би се видело да ли је стигао тачан део; Ако је дохват добар, онда се испитују производња и брза порука.
8. Које радње треба ставити иза људског одобрења када дајете алат агенту?
- А) Ниједан; Агент мора бити у стању да самостално изведе сваку радњу
- Б) Само реверзибилне радње као што су читање и претраживање података
- Ц) Неповратне радње или радње са великим утицајем као што су пренос новца, брисање, слање ✔
- Д) Радње које укључују само прорачуне
Опис: Акције су раздвојене по нивоу ризика. Задаци који се могу преузети као што су читање, претраживање, израчунавање и генерисање нацрта могу се обављати аутономно; Међутим, неповратне радње или радње са великим утицајем као што су трансфер новца, слање е-поште, брисање података, наруџбина итд. захтевају људско одобрење. Свака неопозива радња мора бити предмет сагласности.
9. Који је најбољи приступ дизајну против ризика од индиректног брзог убризгавања?
- А) Довољно је додати једну реченицу 'игноришите лоша упутства' у системски одзивник
- Б) Дајте више ауторитета моделу ослањајући се на упутства у екстерном садржају
- Ц) Не предузимати никакве мере предострожности јер се ињекција не може спречити
- Д) Изоловање екстерног садржаја као непоузданих података и успостављање слојевите одбране уз минимално овлашћење, одобрење и контролу излаза ✔
Опис: Спољни садржај који обрађује агент или РАГ, као што је веб страница, документ, е-пошта, итд., је непоуздани податак и може садржати тајна упутства. Исправан приступ је слојевита одбрана: изоловање спољашњег садржаја као 'података, а не команди' са јасним граничницима, примена минималног овлашћења, везивање неповратних радњи за људско одобрење и ревизија резултата. Један ред упутстава није довољан.
10. Која је главна разлика када се одлучује да ли проблем треба решити финим подешавањем или РАГ-ом?
- А) Проблеми са информацијама се боље решавају помоћу РАГ-а, проблеми у понашању/формату се боље решавају финим подешавањем ✔
- Б) Сваки проблем увек треба решити финим подешавањем
- Ц) РАГ се користи само за генерисање кода, фино подешавање се користи само за превод
- Д) Фино подешавање се увек може ажурирати јефтиније и брже од РАГ-а
Објашњење: Фино подешавање је слабо и ризично у подучавању модела новим информацијама; али је моћан у подучавању понашања, формата, тона и стила. „Узорна компанија не зна наше податке“ је проблем информација и припада РАГ-у. „Нека модел увек излази у нашем строгом формату“ је проблем понашања и кандидат за фино подешавање. Поред тога, пре финог подешавања треба искористити брзе и неколико снимака.
11. Шта је обавезно за безбедно постављање када се нови модел ставља у производњу?
- А) Ако је модел добар у тестирању, отворите га директно за 100% саобраћај
- Б) Уопште се не поставља надзор након распоређивања
- Ц) Фазна имплементација (сенка/канаринац) и унапред тестиран план враћања ✔
- Д) Објављивање модела чак и ако није достигнут праг евалуације
Објашњење: Отварање новог модела директно за сав саобраћај је ризично; Ако је погрешно, сви су погођени. Исправно је да је то постепена дистрибуција (сенка, канаринац) и да свака дистрибуција има тестиран план враћања. Дистрибуција није потпуна без плана за поврат; Могућност да се вратите на претходну верзију у року од неколико минута штити корисника када се модел неочекивано понаша у производњи.
12. Како МЛ модел може 'тихо' пропасти у производњи и који је начин да се то ухвати?
- А) Модел се сруши; евиденција сервера то показује
- Б) Стварањем погрешних предвиђања без грешака; ✔ Снима оперативни, улазни и излазни слојевити надзор
- Ц) Модел никада не може да пропадне тихо, увек аларм
- Д) Само праћење кашњења је довољно да се ухвати било каква деградација
Објашњење: Модел може покварити једноставно стварањем нетачних предвиђања без пада или грешака; Главни разлог за то је померање података и концепта. Само праћење оперативних метрика (латенција, стопа грешака) није довољно; такође треба пратити дистрибуцију улаза и дистрибуцију излаза/предвиђења. Померање уноса даје рано упозорење ако стварни резултат касни.
13. Који принцип је битан када се користи ЛЛМ-као судија за процену ЛЛМ система?
- А) ЛЛМ судија је увек тачан, људска верификација је непотребна
- Б) Судија мора донети одлуку само на основу дужине одговора.
- Ц) Контроле засноване на правилима и људска евалуација треба потпуно одбацити када се користе судије
- Д) Оцене судија треба калибрисати узорком обележеним људима и измерити њихову пристрасност пре него што им се може веровати ✔
Опис: ЛЛМ-рефере је такође модел; Може бити халуцинантно, пристрасно (фаворизирати дугачке, самоуверене одговоре) и недоследно. Према томе, резултати судија морају бити калибрисани узорком обележеним људима и њихова систематска пристрасност се мора мерити пре него што се донесе одлука о производњи. Непроверени судија даје лажно поверење.
14. Зашто је посматрање укупне тачности неадекватно приликом процене пристрасности модела?
- А) Укупна тачност је довољна јер увек одражава учинак најгоре групе
- Б) Укупна тачност сама по себи је недовољна јер може прикрити систематску разлику (скривену дискриминацију) између подгрупа ✔
- Ц) Зато што је тачност метрика која нема никакве везе са пристрасношћу
- Д) Пристрасност долази само од модела и нема никакве везе са подацима.
Објашњење: Укупна тачност може прикрити систематске разлике између подгрупа. На пример, док је укупна тачност 88%, опозив може бити 91% у једној групи и 67% у другој групи; Модел систематски пропушта ту групу. Стога, модел треба процењивати на основу подгрупа (демографија/сегмент) и са заинтересованим странама треба одлучити која дефиниција правде треба дати приоритет.
15. Које четири ствари морају бити фиксиране заједно да би резултат МЛ био поновљив?
- А) Само назив модела, величина, цена и датум издавања
- Б) Само ГПУ бренд и брзина интернета
- Ц) Само коначни резултат тачности модела; остало се може сачувати у сећању
- Д) Насумично семе, верзија података, окружење (верзије зависности) и праћење експеримента ✔
Опис: Репродуцибилност се постиже кроз четири стуба: фиксирање семена насумице, верзионисање података (верзија/хеш), замрзавање окружења (тачне верзије библиотеке/контејнер) и праћење сваког експеримента (урезивање кода, подаци, хиперпараметар, метрика). Без овог ланца није могуће репродуковати исти резултат; Непоновљив резултат је тврдња која се не може доказати.