Табыстар:
- ML жұмыс процесінде (код, деректер, құжат) жасанды интеллект уақытты төмен тәуекелмен үнемдейтінін және метрика / деректер / өндіріске енгізу сияқты шешімдерді тапсырманың тәуекел деңгейіне сәйкес адамға қалдыратынын ажырата білу.
- Әрбір AI шығысын көзге қосу, оны қайта іске қосу, өлшеу және инженерлік сүзгіден өткізу арқылы тексеретін пәнді қолдану мүмкіндігі.
- Шикі құпия және жеке деректерді сыртқы құралдарға жібермеу, корпоративтік мақұлдаған құралдарды пайдалану және қауіпсіздік мәселелерін тек қорғаныс мақсатында өңдеу әдетін меңгеру мүмкіндігі.
Машиналық оқыту инженериясындағы жасанды интеллект: рөл, шекаралар, тексеру және жауапкершілік
Машинаны оқыту инженері (ML инженері: деректерден өндіріске үйренетін үлгілерді әзірлейтін, үйрететін және әкелетін бағдарламалық жасақтама маманы) бүгінде жұмысының әр қадамында басқа жасанды интеллект құралымен жұмыс істейді. Кодтау көмекшісі код жазу кезінде, сөйлесу үлгісі деректерді зерттеу кезінде және үлкен тіл үлгісі (LLM: мәтінді түсінетін және шығаратын миллиардтаған параметрлері бар нейрондық желі) құжаттаманы жасау кезінде жұмыс істейді. Бұл модуль жасанды интеллектті әзірленген өнім және ML инженерінің күнделікті жұмыс құралы ретінде қарастырады. Ол екі рөлді араластырмай, жауапкершілік шекараларын нақты белгілеу арқылы жұмыс істейді.
Бұл бірінші бөлімде біз негізгі сұраққа жауап береміз: ML инженериясында жасанды интеллект нақты уақытты қай жерде үнемдейді және шешімді адамдарға қалдыру керек пе? Жауап инженерлік пәннің өзегінде жатыр: жасаған – жылдам, тексерген – жауапты.
Жасанды интеллект ML инженериясында қай жерде пайдалы?
ML жобасы шамамен келесі жолдардан өтеді: деректерді жинау, деректерді тазалау, мүмкіндіктерді жобалау (шикі деректерді модель түсіне алатын цифрлық сигналдарға аудару), модельді оқыту, бағалау, орналастыру (орналастыру: модельді нақты пайдаланушыға ашу) және бақылау. AI осы жолдағы әрбір аялдамада көмектеседі, бірақ оның өкілеттілік деңгейі әртүрлі.
Сыйлығы жоғары, тәуекелі төмен аймақтар: код қаңқасын жасау, деректерді түрлендіру функциясын жасау, журнал хабарламаларын интерпретациялау, стек ізін сипаттау, эксперимент жазбаларын қорытындылау, құжаттама мен README жазу, сынақ жағдайын ұсыну. Мұнда жасанды интеллект қателері арзан; өйткені нәтиже тестілеуден және тексеруден өтеді.
Тәуекел аймақтары: оқытуға қандай деректер жіберілетінін шешу, үлгінің өндіріске кіруі керек пе екенін растау, метриканы «жеткілікті жақсы» деп бағалау, жеке деректерді өңдеу шешімі, қауіпсіздік осалдығын «қоқыс» ретінде жабу. Бұл ақшаға, құпиялылыққа, заңды жауапкершілікке және пайдаланушы сеніміне әсер етеді. Мұнда жасанды интеллект ұсыныстар береді; Шешімді құзыретті инженер мен жауапты топ қабылдайды.
Кеңес: Жасанды интеллектке тапсырманы аутсорсингке бермес бұрын: «Егер бұл нәтиже дұрыс емес болса, оның құны қанша болады және қатені кез келген адам қаншалықты оңай ұстайды?» Деп сұраңыз. Бағасы төмен болса және басып алу оңай болса, оны жіберіңіз. Егер баға жоғары болса немесе түсіру қиын болса, AI-ны тек жоба үшін пайдаланыңыз және сіз шешесіз.
Тексеру пәні: үш қадам
ML инженериясында AI нәтижесі ешқашан «аяқталған жұмыс» болып табылмайды; Бұл жоба. Әрбір шығысты осы үш қадам арқылы іске қосыңыз:
- Оны көзге қосыңыз. Үлгі санды, шекті немесе «үздік тәжірибені» айтқан болса, оны ресми құжаттамаға, код базасындағы нақты мәнге немесе өлшенген көрсеткішке негіздеңіз. «Модельді сәйкестендіру» (галлюцинация: тілдік модель бойынша шынайы емес ақпаратты сенімді түрде шығару) мұнда жиі кездеседі.
- Қайта іске қосыңыз және өлшеңіз. Жасалған кодты іске қосыңыз, ол өзіңіздің сынақ жиыныңызда шығаратын метриканы қайта есептеңіз, шағын үлгіде ұсынылған SQL сұрауын растаңыз. Жұмыс істемейтін код, тіпті жақсы көрінсе де, түкке тұрғысыз.
- Оны инженерлік сүзгіден өткізіңіз. Шығару масштабта сақталады ма? Жиек жағдайлары (бос деректер, өте үлкен енгізу, жетіспейтін өрістер) қарастырылды ма? Қауіпсіздік пен құпиялылықты бұзу бар ма? Бұл қадамды тек саланы білетін адам ғана жасай алады.
Әлсіз шақыру / Күшті шақыру
Әлсіз нұсқау: "Маған үлгілік оқыту кодын жазыңыз."
Күшті шақыру: "Scikit-learn көмегімен екілік классификацияға арналған жаттығу сценарийін жазыңыз. Енгізіңіз: data/train.parquet, мақсатты баған is_churn. Сынып теңгерімсіздігі бар (оң мөлшерлеме ~8%), оны класс_салмағымен өңдеңіз. PR-AUC (дәлдік-еске түсіру қисығы астындағы аумақ) метрикалық қате болғандықтан, қате қателік үшін пайдаланыңыз. Деректер кездейсоқ тұқымды 42-ге бекітіңіз. PR-AUC кодты басып шығару жиынының соңында тексеріңіз.
Айырмашылық: екінші жедел тапсырмада деректер ақиқаты, дұрыс метрика, теңгерімсіздік туралы ақпарат және қайталану талабы бар. Дәл осы контекстен нәтиже тексерілетін және пайдалануға жарамды.
Құпиялылық және деректер қауіпсіздігі: инженердің бірінші жауапкершілігі
ML инженері компанияның ең құпия деректеріне жиі қол тигізеді: тұтынушы жазбалары, транзакциялар тарихы, денсаулық немесе қаржылық деректер, өндіріс жүйелерінің журналдары. Жасанды интеллект құралдарына деректерді берудің үш ережесі:
- Жеке және құпия деректерді сыртқы құралдарға жібермеңіз. Мысалы, тұтынушы электрондық пошталарын сұрауға қоюдың орнына схема мен жалған (синтетикалық) үлгілерді жіберіңіз. Нақты деректердің орнына "мысалы: ahmet@example.com" сияқты бүркенішті мысалды пайдаланыңыз.
- Корпоративтік мақұлдаған көліктерді пайдаланыңыз. Мәліметтердің қай жерде өңделетінін, сақталғанын, білім беру үшін пайдаланылғанын немесе пайдаланылмайтынын келісімшарт бойынша анық көрсететін құралдарды таңдаңыз. Жеке кабинетпен корпоративтік деректерді өңдеу көптеген компанияларда бұзушылық болып табылады.
- Минималды деректер саясаты. Тапсырманы шешуге қажетті минималды контекстті беріңіз. Бүкіл кесте емес, сәйкес 5 баған және схема.
Абайлаңыз: тіл үлгісіне берген мәтінді қайтару мүмкін емес деп есептеңіз. «Кейін жоямын» деген оймен өңделмеген жеке деректерді жібермеңіз; Тәуекел жіберілген сәтте орын алды.
Қауіпсіздік саласында қорғаныстық қолдану
ML инженерлері жиі қауіпсіздік жүйелерін орнатады: алаяқтықты анықтау, зиянды трафикті жіктеу, аутентификация. Бұл модульде біз тек қорғаныс мақсатындағы қауіпсіздік мәселелерін қарастырамыз: шабуылды анықтау, жүйені қатайту, осалдықты жабу. Рұқсатсыз кіру, деректердің ағуы немесе басқа біреудің жүйесіне рұқсатсыз араласу үшін жасанды интеллектті пайдалану заңсыз және кәсіби этикаға қайшы келеді. Сіз осалдықты тапқан кезде, оны жауапкершілікпен хабарлау және оны түзету дұрыс жол; пайдаланбау.
үш шағын іс
1-жағдай - Уақыт сақталды. ML инженері әдетте жарты күнді 40 бағандық деректер жинағын зерттеу деректерін талдауға (EDA) жұмсайды. Ол жасанды интеллектке схема мен df.describe() шығысын берді және «Қандай бағандарда жоғары шектен тыс және жетіспейтін көрсеткіш бар, қандай түрлендірулерді ұсынасыз?» деп сұрады. 20 минут ішінде ол әрбір элементті өз кодымен тексеріп, басымдық берілген тізімді алды. Сақтау: ~3 сағат, қате қаупі төмен, себебі әрбір шағым өлшенеді.
2-жағдай - ұсталған қате. Модель чат көмекшісі: «Жаттығу дәлдігі 99%, тамаша», - деді. Инженер үшінші қадамды (инженерлік сүзгіні) қолданды және түсінді: мақсатты бағанның атрибуттары кездейсоқ ағып кеткен (деректер ағып кетуі: модель оқуда көрмеуі керек ақпаратты көреді). Нақты өнімділік әлдеқайда төмен болды. Жасанды интеллекттің «керемет» түсіндірмесі емес, инженердің скептицизмі жұмысты сақтап қалды.
3-жағдай - Құпиялықты бұзуды болдырмау. Топ өндірістік қате журналдарын сыртқы үлгіге қойып, «осы қатені түзет» деп жатыр. Журналдарда тұтынушылардың сәйкестендіру нөмірлері болды. Команда алдымен журналдарды бүркейтін шағын сценарий жазу ережесін жасады (олардың идентификатор нөмірлерін *** жасау) және оларды осылай жіберу. Бұзылу қаупі жойылды, көмек көрсету жылдамдығы өзгерген жоқ.
Көшіретін үлгілер
Тапсырма: [не істеу керек, бір сөйлем]Мәтінмән: [деректер схемасы, өлшемі, шектеулері; Нақты жеке деректер ЖОҚ]Шектеулер: [тіл/кітапхана, өнімділік, қайталану]Метрикалар: [табысты өлшеу әдісі]Қажетті нәтиже: [код/сипаттама/тізім] және неге осы пішімде
Бұл кодты тексеріңіз. Оның жұмыс істеп тұрғанын ғана емес, сонымен қатар мыналар тұрғысынан да бағалаңыз: 1) Шеттік регистрлер (бос енгізу, жоқ баған, өте үлкен деректер)2) Деректердің ағып кету қаупі3) Қайталану мүмкіндігі (тұқым, нұсқа) Сіз тапқан әрбір мәселе бойынша түзетулерді ұсыныңыз. Сенімсіз жерде «тексеру» деп белгілеңіз. Код: [код]
Осы метриканың нәтижесін түсіндіріңіз, бірақ алдымен сұраңыз: бұл көрсеткіш осы мәселе үшін дұрыс па? Мәселе: [теңдестірілмеген/теңдестірілмеген жіктеу, регрессия, рейтинг...]Есептелген метрика және мән: [мыс. дәлдік 0,99]Қандай көрсеткішті ұсынар едіңіз және неліктен және ағымдағы нәтижеге күмәндану үшін қандай белгілерді іздеуім керек?
Мен келесі сұрауға беретін деректерде жеке/құпия ақпарат бар-жоғын тексеріңіз. Төмендегі мәтінде бүркемелеу қажет өрістерді (аты, электрондық поштасы, ID нөмірі, телефоны, мекенжайы) көрсетіңіз. Мәтін: [мәтін]
Рөлдер мен өкілеттіктер кестесі
Квест
Жасанды интеллекттің рөлі
Шешімнің иесі
Код қаңқасы / түрлендіру функциясы
тартпа генераторы
Инженер (пікірлер)
EDA / деректердің қысқаша мазмұны
үдеткіш
Инженер (өлшеу арқылы тексереді)
Метрикалық интерпретация
Ұсыныс
инженер
Тренингке қандай деректер кіреді?
Ұсыныс
Топ + деректер иесі
Модельді өндіріске енгізіңіз
Тексеру тізімінің еске салғышы
Жауапты инженер + команда
Жеке деректерді өңдеу
Ешбір (пайдаланбайды)
Заңды + деректер контроллері
Жалпы қателер
- Шығаруды растамай пайдалану. Ең көп таралған және ең қымбат қате. Жақсы көрінетін код немесе көрсеткіш оның дұрыс екенін білдірмейді.
- Құралға бастапқы құпия деректерді қою. Жіберілгеннен кейін оны қайтару мүмкін емес.
- Қате көрсеткішке сүйену. Теңгерімсіз деректердегі дәлдік және рейтинг мәселелеріндегі RMSE сияқты үйлеспейтін көрсеткіштер жаңылыстыру болып табылады.
- Шешім қабылдаушы ретінде жасанды интеллект қателесу. Ол ұсыныстар береді; Жауапкершілік қол қоюшыға жүктеледі.
- Мәтінмәнсіз шақыру. «Үлгі жазу» сияқты анық емес сұраулар тексерілмейтін нәтиже береді.
Қысқаша айтқанда
Жасанды интеллект ML инженері әзірлеген өнім және оның күнделікті репликаторы болып табылады. Оның мәні код-деректер-құжат сияқты қауіптілігі төмен, оңай тексерілетін тапсырмаларда ең жоғары; Ақшаға, құпиялылыққа және қауіпсіздікке әсер ететін шешімдер адамда қалады. Әрбір шығысты көзге қосыңыз, қайтадан өлшеңіз, инженерлік сүзгіден өткізіңіз. Құпия деректерді қорғаңыз, рұқсат етілген көліктерді пайдаланыңыз, тек қорғаныс мақсатында қауіпсіздікте жұмыс істеңіз. Бұл пән барлық кейінгі бөлімшелер үшін негіз болып табылады.
Қолданбалы тапсырма
Өз жобаңыздан тапсырманы таңдаңыз (мысалы, деректерді тазалау функциясын жазу). Алдымен әлсіз шақыруды жазыңыз, содан кейін осы блоктағы үлгіні пайдаланып күшті шақыруды жазыңыз. Екі нәтижені де алыңыз, үш сатылы тексеруді қолданыңыз (көзге сілтеме, қайта іске қосу, инженерлік сүзгі). Қай шақыру қанша минутты және қанша түзетуді сақтайтынын ескеріңіз.
бақылау парағы
- [ ] Тапсырмамның тәуекел деңгейін (төмен/жоғары) анықтадым.
- [ ] Нұсқауда ешқандай нақты жеке/құпия деректерді қоймадым; Мен оны маскировкаладым немесе синтетикалық үлгіні қолдандым.
- [ ] Мен шығысты көзге қостым, оны қайтадан іске қостым, оны инженерлік тұрғыдан сүздім.
- [ ] Мен дұрыс көрсеткішті таңдағанымды тексердім.
- [ ] Мен сыни шешімді (өндіріске енгізу, деректерді өңдеу) өзім/топпен қабылдадым, мен оны жасанды интеллектке қалдырған жоқпын.
- [ ] Мен корпоративтік мақұлдаған көлікті пайдаландым.