Табыстар:
- MLOps кезеңдерін (шығару, орналастыру, бақылау, қайта оқыту, кері қайтару) түсіну және дрейфті модельдеу және бақыланатын орналастыруды жоспарлау мүмкіндігі
- Үлгі әділдік, ашықтық және есеп беру қағидаттарын қолдану және статистикалық дәлдікті этикалық қолайлылықтан ажырата білу
- Жеке деректерді KVKK/GDPR принциптерімен қорғау және әсерлі шешімдер қабылдау кезінде адамға соңғы жауапкершілікті тағайындау мүмкіндігі
Модельді дайындау және жоғары балл алу - бұл соңғы емес, ортасы. Модель өндіріске енгізілгенде және сенімді жұмыс істегенде, уақыт өте келе нашарлаусыз бақыланатын және бүкіл процесс этикалық және құқықтық шекараларда жүзеге асырылған кезде нақты құндылық пайда болады. Бұл жабу бөлімі үш тақырыпты біріктіреді: MLOps (тіріге өту, үлгілерді бақылау және қолдау пәні), этика (әділдік, ашықтық, зиян келтірмеу) және құпиялылық (жеке деректерді қорғау). AI осы салаларда кодты, бақылау парақтарын және сызбаларды жасайды; Бірақ адамдар модельдің іске қосылатынын, кімге әсер ететінін және қандай деректерді пайдалануға болатынын шешеді. Бұл шешімдер техникалық емес, жауапкершілік шешімдері.
MLOps: модель өнім сияқты өмір сүреді
MLOps (Machine Learning Operations – өндірісте машиналық оқыту үлгілерін іске қосу, бақылау және жаңарту тәжірибесі) бағдарламалық жасақтаманы әзірлеудегі DevOps-ті деректер ғылымына бейімдеу болып табылады. Негізгі идея: модель бір рет оқытылып, ұмытылатын файл емес, үнемі күтімді қажет ететін тірі өнім. Негізгі кезеңдері:
1. Нұсқалау: Код (Git), деректер мен модель бірге нұсқаланады; Қай модель қандай деректермен және кодпен жасалғаны жазылады.
2. Орналастыру: модель API немесе топтамалық тапсырма ретінде тікелей қосылады. Әдетте алдымен шағын аудиторияға беріледі (көлеңке/канар тарату).
3. Мониторинг: Үлгінің өнімділігі мен кіріс деректері үнемі бақыланады.
4. Қайта даярлау: өнімділік төмендегенде, модель жаңартылған деректермен қайта оқытылады.
Үлгіні ауыстыру: дыбыссыз бұрмалау
Өндірістегі ең үлкен қауіп - модель дрейфі (модель дрейфі / деректердің дрейфі). Әлем өзгереді; Үлгіңізді үйреткен шарттар (тұтынушының мінез-құлқы, бағалар, маусым, заңнама) уақыт өте өзгереді және модель ескіре бастайды. Мысалы, пандемияға дейін дайындалған сұраныс моделі пандемия кезінде мүлдем дұрыс емес. Дрейф екі түрде болады: деректер дрейфі (кіріс деректерінің өзгеруінің таралуы) және концепцияның дрейфі (кіріс пен мақсат өзгерістерінің арасындағы байланыс). Оларды түсірудің жолы - бақылау: кірісті бөлуді, болжамды бөлуді және (мүмкіндігінше) нақты нәтижемен салыстырғанда өнімділікті үнемі қадағалаңыз.
Абайлаңыз: Өндіріске енгізілген үлгі өздігінен нашарлайды; Бұл «егер» емес, «қашан» мәселесі. Мониторинг орнатпай модельдерді қолдану оның қозғалтқышын ешқашан басқармай көлік жүргізумен бірдей; Бір күні ол жерде тыныш отырады және сіз байқамайсыз.
MLOps элементі
Мақсат
Елеусіз болса
Нұсқа жасау
Не өндірілетінін білу
Қайталанбайтын, бақыланбайтын
Бақылау
Сырғанақты ерте көру
Модель үнсіз бұзылады
қайта даярлау
жаңарып отырыңыз
Болжамдар ескіреді
Кері қайтару
нашар үлгіге оралу
Ақаулы үлгі тірі қалады
Құжаттама
ашықтық, айналым
Ақпарат бір адамның ішінде қалып қояды
Этика: үлгі шешімдер адамдарға әсер етеді
Деректер үлгілері адамдардың өміріне әсер ететін шешімдерде көбірек қолданылады: несие, жалдау, сақтандыру, әділеттілік. Бұл күш жауапкершілікпен келеді. Негізгі этикалық тәуекелдер:
Біржақтылық және кемсітушілік: модель тарихи деректердегі әділетсіздіктерді үйреніп, жалғастыра алады. Егер белгілі бір топқа бұрын азырақ несие берілсе, модель бұл «ереже» деп есептейді және кемсітуді автоматтандырады. Сондықтан әділдікті талдау — модельдің әртүрлі топтар үшін (жынысы, жасы, аймағы) бірдей орындайтынын тексеру — өте маңызды.
Мөлдірлік және түсініктілік: Сіз модель неліктен адамды қабылдамағанын түсіндіре білуіңіз керек. «Қара жәшік осылай деді» этикалық және көбінесе заңды түрде қабылданбайды. Сондықтан түсіндіру құралдары (мүмкіндік маңыздылығы, SHAP мәндері) құнды.
Жауапкершілік: егер модель қате шешім қабылдаса, кім жауапты? Жауап әрқашан үлгі емес, адам/мекеме. Әсері жоғары шешімдерде адамның бақылауы (адам-ақпарат — соңғы шешімді бекітетін адам) сақталуы керек.
Абайлаңыз: Үлгі статистикалық тұрғыдан «дұрыс» болуы мүмкін, бірақ этикалық тұрғыдан қабылданбайды. Бір топты жүйелі түрде кемсітетін жоғары дәлдіктегі модель жақсы үлгі емес. Адалдық әділдікті алмастыра алмайды.
Құпиялық: жеке деректер мұқият қорғалған
Деректер ғылымының шикізаты көбінесе жеке деректер болып табылады және бұл деректер заңмен қорғалады: Түркиядағы KVKK, Еуропадағы GDPR. Негізгі принциптер: мақсатты шектеу (деректер оны жинау мақсатынан басқа мақсаттарда пайдаланылмайды), деректерді минимизациялау (қажеттіден артық деректер жиналмайды/сақталмайды), анонимизация (сәйкестендіру ақпараты жойылады) және қауіпсіздік (деректер шифрланған түрде сақталады және қолжетімділік шектеледі). AI құралдарымен жұмыс істеу кезінде маңызды ереже: ешқашан нақты жеке деректерді жалпыға қолжетімді AI құралына қоймаңыз. Көбінесе диаграмма және анонимді/синтетикалық үлгі талдау үшін жеткілікті.
Ақпараттық қауіпсіздік контекстіндегі қосымша назар: деректер ғылымының құралдары мен әдістерін қорғаныс және заңды талдау мақсаттары үшін өкілеттігі бар деректер мен жүйелерде ғана пайдаланыңыз. Басқа біреудің деректеріне рұқсатсыз кіру, жеке тұлғаларды қайта сәйкестендіру (анонимді деректерден жеке басын алу) немесе рұқсатсыз профиль жасау заңсыз және әдепсіз болып табылады.
үш шағын іс
1-жағдай – Бақыланбайтын коллапс. Электрондық коммерция компаниясы өзінің ұсыныс үлгісімен тікелей эфирге шықты және бақылауды орнатпады. 4 айдан кейін өнім каталогы айтарлықтай өзгерді; модель ескірген өнімдерді ұсынуды жалғастырды және конверсия жылдамдығы тыныш 30% -ға төмендеді. Айлар бойы ешкім байқамады. Сабақ: бақылаусыз қолдану соқыр болып қалады.
2-жағдай – Жасырын кемсітушілік. Жалдау скрининг үлгісі тарихи деректердегі гендерлік теңгерімсіздік және әйел кандидаттарды жүйелі түрде төмендететін туралы білді. Әділдік сараптамасы болмағандықтан байқалмады; Бұл аудит барысында анықталды және мекеме елеулі беделге/құқықтық тәуекелге тап болды. Сабақ: Әділдіктің топтық бақылауы жоғары әсер ететін үлгілерде өте маңызды.
3-жағдай – Құпиялылықты бұзу. Бір талдаушы тұтынушылардың нақты электрондық пошталары мен сатып алу тарихы бар файлды жалпыға қолжетімді AI құралына жүктеп, «сегменттерді қорытындылау» деді. Жеке деректер мекемеден кеткен; KVKK процесі басталды. Дұрыс жол - сәйкестік өрістерін жою және тек анонимді сипаттарды ортақ пайдалану. Сабақ: нақты жеке деректер ашық құралға енбейді.
Көшірілетін төрт үлгі
1) Орналастыру алдындағы бақылау тізімі:
Сіздің рөліңіз: MLOps кеңесшісі. Үлгіні өндіріске енгізбес бұрын тексеру керек нәрселерді тізімдеңіз: нұсқа жасау, бақылау көрсеткіштері, кері қайтару жоспары, өнімділік шегі, деректердің ауытқуы туралы ескерту, жауапты адам. Әрбір элемент үшін бір сөйлемнен тұратын «бұл неге маңызды» түсіндірмесін қосыңыз. Мен шешемін.
2) Үлгі ауысымын қадағалау дизайны:
Өндірістегі жіктеу үлгісі үшін дрейфті бақылау жоспарын ұсыныңыз: (1) қандай кіріс үлестірімдерін бақылауым керек, (2) болжамды бөлу үшін қандай дабыл, (3) нақты нәтиже келгенде өнімділікті қалай салыстыру керек, (4) қай шекті деңгейде қайта оқытуды іске қосу керек. Сондай-ақ код қаңқасын қамтамасыз етіңіз.
3) Әділдік бақылау:
Менің үлгіімнің өнімділігін әртүрлі топтар үшін салыстыратын кодты жазыңыз (мысалы, жас диапазоны, аймақ): еске түсіру/дәлдік және әр топ үшін оң шешім жылдамдығы. Топтар арасында айтарлықтай айырмашылық болса ескертіңіз. Себептік/саяси интерпретациялар жасау; Маған тек айырмашылықтарды көрсетіңіз, мен шешімді қарастырамын.
4) Құпиялықты алдын ала тексеру:
AI құралына деректерді бермес бұрын мынаны тексеріңіз: төмендегі бағандар тізімінде жеке/жеке куәлік деректері (аты, электрондық поштасы, идентификаторы, телефоны, мекенжайы, IP) бар ма? Олай болса, қайсысын жою немесе анонимді ету керек екенін тізімдеңіз. Бағандар: [тізім]. Мақсаты: тек анонимді схеманы бөлісу.
Әлсіз шақыру / Күшті шақыру
Әлсіз шақыру:
Менің моделім дайын, тікелей эфирге шығыңыз.
Орналастыру бір қадам емес; Бақылаусыз, кері қайтарусыз, әділеттілік пен құпиялылықты бақылаусыз тікелей эфирге шығу - бұл апатқа үнсіз шақыру.
Күшті шақыру:
Сіздің рөліңіз: жауапты MLOps кеңесшісі. Менің моделім оқытылды, тікелей эфирге шықпас бұрын толық дайындықты қалаймын. Жасаңыз: (1) орналастыру алдындағы бақылау тізімі, (2) дрейфті бақылау жоспары, (3) топқа негізделген әділдікті тексеру коды, (4) құпиялылықты тексеру (жеке деректер бар ма). Сондай-ақ жоғары әсер ететін шешімдерде адам келісімін қалай қорғау керектігін ұсыныңыз. Соңғы шешімдер менікі.
Мұнда бөлу, бақылау, әділдік және құпиялылық біртұтас жауапты процесс ретінде қарастырылады.
Жалпы қателер
- Мониторинг орнатусыз үлгіні қолдану. Модель үнсіз сырғып, бұрмалайды; Байқауға айлар кетуі мүмкін.
- Әділдік тексеруін айналып өту. Дәлдігі жоғары үлгі топты жүйелі түрде кемсітуі мүмкін.
- Түсініксіз қара жәшік туралы шешім қабылдау. Жоғары әсер ететін шешімдер түсінікті болуы керек; «Модель солай айтты» дегені жеткіліксіз.
- AI құралын ашу үшін нақты жеке деректерді беру. KVKK/GDPR бұзу; Диаграмма мен анонимді мысал жеткілікті.
- Шешімді үлгіге беру. Жауапкершілік әрқашан адамда болады; Жоғары әсерлі адам бақылауы сақталады.
Кеңес: Әрбір модельмен тікелей эфирге шықпас бұрын, дауыстап бір сұрақ қойыңыз: «Егер бұл модель ертең тыныш бұзылса немесе топты әділетсіз жазаласа, мен оны қалай байқап, кері қайтарамын?» Егер сізде бұл сұраққа нақты жауап болмаса, модель әлі өндіріске дайын емес.
Қысқаша
Модельдің жұмысы жоғары баллмен аяқталмайды, өндірісте сенімді және жауапкершілікпен жұмыс істеумен аяқталады. MLOps – тікелей эфирге шығу, дрейфті бақылау, қайта даярлау және үлгіні кері қайтару пәні; Бақылаусыз орналастыру - үнсіз құлдырау. Этика үлгінің әділдігін, ашықтығын және есептілігін талап етеді; статистикалық дәлдік этикалық қолайлылықты алмастыра алмайды. Құпиялылық жеке деректерді KVKK/GDPR принциптерімен қорғауды және нақты деректерді ашық құралдардан алыс ұстауды білдіреді. Бұл шешімдердің барлығы техникалық емес, жауапкершілік шешімдері және әрқашан адамға тиесілі.
Қолданбалы тапсырма
Өзіңіз құрастырған (немесе гипотетикалық) үлгіні өндіріске енгізіп, төрт тізімді толтыратындай елестетіп көріңіз: (1) орналастыру алдындағы бақылау тізімі, (2) сіз қадағалайтын дрейф көрсеткіштері, (3) топқа негізделген әділдікті бақылау жоспары, (4) құпиялылықты бақылау. Одан кейін «Ертең үнсіз бұзылса мен оны қалай байқаймын және оны қайтарамын?» деген сұраққа нақты жауап жазыңыз.
бақылау парағы
- [ ] Модельді бақылау (слип ескертуі) және кері қайтару жоспарымен қолданамын ба?
- [ ] Мен әртүрлі топтар үшін әділдік/өнімділік алшақтығын тексердім бе?
- [ ] Әсері жоғары шешімдерді қабылдау кезінде адаммен байланыста болдым ба?
- [ ] Мен жеке деректерді KVKK/GDPR принциптерімен қорғадым және оларды ашық құралдардан аулақ ұстадым ба?
- [ ] Мен соңғы жауапкершілікті үлгіге емес, адамға жүктедім бе?
Модуль емтиханы
1. Деректер ғалымы жасанды интеллектке «Бұл деректерде кездейсоқ орман қаншалықты дәл?» деп сұрайды. модельді мүлде оқытпай, тікелей «89%» жауабын презентацияға салады. Бұл тәсілдегі негізгі қателік неде?
- A) Жасанды интеллектке деректер мен модельдер бермей, метриканы күту; Ол шығарған санның жалған екенін және нақты көрсеткішті тек оқыту және тестілеу арқылы табуға болатынын елемеу ✔
- B) Кездейсоқ орманның орнына логистикалық регрессияны қолдану керек
- C) Дәлдік көрсеткіші әрқашан 90%-дан жоғары болуы керек.
- D) Көрсетілімге метрика қосуға қатаң тыйым салынады
Түсініктеме: Жасанды интеллект үлгіге және деректерге қатынаусыз метриканы шығара алмайды; Ол берген сан – галлюцинация (ойдан шығарылған). Көрсеткіш модель нақты оқытылып, тексерілгеннен кейін ғана деректер зерттеушісінің жеке есептеуі арқылы алынады. Тексерілмеген нәтиже қол қойылмаған есеп сияқты.
2. "Тіркелгіні жабу себебі" бағаны шығын болжамы үшін деректерді жинау кезінде қосылады; Бұл баған тек тұтынушы кеткеннен кейін толтырылады. Модель сынақ жинағында 97% береді, бірақ өндірісте жұмыс істемейді. Бұл жағдайдың аты мен себебі қандай?
- A) Қосымша білім алу; Модель тым күрделі
- B) Мәліметтердің сыртқа шығуы; ✔ Болжау кезінде қол жетімді болмайтын, бірақ мақсаттың нәтижесі болып табылатын ақпаратты мүмкіндік ретінде пайдалану
- C) Оқытудың жеткіліксіздігі; Модель тым қарапайым
- D) Таңдаудың бұрмалануы; шағын үлгі өлшемі
Түсініктеме: Бұл деректердің классикалық ағып кетуі: «жабу себебі» мақсаттың нәтижесі болып табылады және болжау кезінде әлі бос. Модель осы болашақ біліммен трюк жасайды, ол сынақ жинағында тамаша көрінеді, бірақ бұл баған бос болғандықтан өндірісте бұзылады. Әрбір бағанға «болжау кезінде менде бар ма?» деген сұрақ қойылуы керек.
3. Талдаушы кіріс бағанындағы жетіспейтін мәндерді орташа мәнмен толтырады; бірақ із-түзсіз жоғалған адамдар табысы ешқашан декларацияланбаған (жүйелі түрде хабарсыз кеткен) аз қамтылған сегментке жатады. Неліктен бұл толтыру дұрыс емес?
- A) Орташа әрқашан медианадан үлкен, сондықтан ол дұрыс емес
- B) Жоқ мәндерді ешқашан толтыруға болмайды, олар әрқашан жойылуы керек
- C) Жүйелі бос орынды орташа мәнмен толтыру сол топты жасанды түрде көрсету арқылы деректерді бұрмалайды; Толтыру «неге бос?» деген сұрақ қойылмай жасалды. ✔
- D) Орташа мәнді есептеу өнімділік мәселесін тудырады, себебі ол өте баяу
Түсініктеме: Жетіспеушіліктің себебі шешімді анықтайды. Жүйелі жетіспейтін (белгілі бір топта шоғырланған олқылық) орташа мәнмен толтырылған кезде, бұл топ жасанды түрде «орташа табысқа» айналады және деректер бұрмаланады. Оны толтырмас бұрын «неге бос» деген сұрақ қойылуы керек; жүйелі/маңызды жетіспейтін ортаны толтыруға болмайды.
4. Команда «жарнама шығындары» мен «сатылым» арасындағы 0,78 корреляцияны тауып, бюджетті екі есе көбейтеді; Дегенмен, екеуін де тудыратын нәрсе маусымдық науқандар. Бұл қателікті статистиканың қандай принципі түсіндіреді?
- A) Корреляция себепті байланыс емес; Жасырын үшінші айнымалы екі айнымалыға да әсер етуі мүмкін ✔
- B) 0,78 корреляциясы тым төмен болғандықтан, қатынасты елемеу керек
- C) Корреляция әрқашан себеп-салдарлықты дәлелдейді, ұжым дұрыс түсінді
- D) Жарнама мен сату арасындағы корреляцияны математикалық жолмен есептеу мүмкін емес.
Түсініктеме: Корреляция себепті байланыс емес. Екі айнымалы мән бірге әрекет етуі мүмкін, себебі жасырын үшінші айнымалы (мұнда маусымдық науқандар) екеуіне де әсер етеді. Біреуі екіншісін тудырады деген қорытынды тәжірибе мен далалық білім арқылы ғана бекітіледі; Корреляция санының өзі себепті байланыстың дәлелі емес.
5. Алаяқтықты анықтау моделі 99,2% дәлдікті көрсетеді және команда тойлайды; Дегенмен, деректердегі жалған транзакция жылдамдығы бар болғаны 0,8% және модельді қайтарып алу 6% құрайды. Бұл кесте нені көрсетеді?
- A) Модель мінсіз, себебі дәлдік 99% жоғары
- B) Дәлдік теңгерімсіз деректермен жаңылыстырады; Модель барлық дерлік жалғандарды жіберіп алады (төмен еске түсіру), сәйкес метриканы ✔ қарау керек
- C) Модельді еске түсіру жоғары болғандықтан, проблема жоқ
- D) Модель құрудың қажеті болмады, өйткені жалған көрсеткіш төмен болды
Түсініктеме: «Дәлдік» теңгерімсіз деректерде жаңылыстырады. Модель әрбір дерлік транзакцияны «таза» деп атағанда, ол жоғары дәлдікке ие болады, өйткені жалғандар өте аз, бірақ ол жалғандарды ұстай алмайды, бұл оның негізгі мақсаты (6% еске түсіру). Сондықтан, теңгерімсіз есептер кезінде назар дәлдікке емес, шатастыру матрицасына және жұмыс мақсатына сәйкес келетін көрсеткіштерге, мысалы, еске түсіру/дәлдікке аударылады.
6. Сұранысты болжау жобасында уақытқа тәуелді деректер кездейсоқ түрде оқыту/тестілеуге бөлінеді. Модель 93% дәлдік береді, бірақ өндірісте бұзылады. Дұрыс бөлу тәсілі қандай болуы керек?
- A) Сынақ жинағын ұлғайту, мысалы. бөлу 50%/50%
- B) Күрделі модельді қолдану
- C) Бөлімді толығымен алып тастаңыз және барлық деректермен жаттықтырыңыз
- D) Хронологиялық бөлу: ескі кезеңмен жаттығу және жаңа кезеңмен тестілеу, осылайша модельдің болашақты көруіне кедергі жасайды ✔
Түсініктеме: Кездейсоқ бөлу уақыттық қатар деректерінде орындалса, модель болашақты көреді және тренингте өткенді болжайды; бұл ағып кету және іс жүзінде жоқ табысқа әкеледі. Дұрыс тәсіл – хронологиялық бөлу: ескі кезеңмен оқыту және жаңа кезеңмен сынау, өндірістегі нақты жағдайға еліктеу (өткеннен болашаққа болжау).
7. Мүмкіндік инженериясында масштабтау (StandardScaler) параметрлерін қандай деректерден есептеу керек және оларды қалай қолдану керек?
- A) Ол дәлірек болуы үшін барлық деректерден (жаттығу + тестілеу бірге) есептелуі керек
- B) Ол әр жол үшін, сол жолдың өз мәнінен бөлек есептелуі керек
- C) Тек сынақ деректерінен есептелуі керек
- D) Оны тек оқу деректерінен есептеу керек, содан кейін сынақ деректеріне бірдей параметрлерді қолдану керек; әйтпесе ағып кетеді ✔
Түсініктеме: Масштабтау, кодтау және толтыру сияқты барлық түрлендірулердің параметрлерін (орташа, стандартты ауытқу және т.б.) тек оқу деректерінен білу керек, содан кейін сынақ деректеріне де солай қолданылуы керек. Сынақ деректерін есепке алу сынақ ақпаратының жаттығуға кедергі келтіруіне, яғни ағып кетуіне әкеледі және үлгіні бұрынғыдан жақсырақ етеді. Құбырды пайдалану мұны қамтамасыз етеді.
8. Модель оқу жинағында 98% және сынақ жиынында 72% дәлдікті береді. Бұл симптом нені көрсетеді және не істеу керек?
- A) Жеткіліксіз оқу; үлгіні күрделірек ету керек
- B) Мәліметтердің сыртқа шығуы; сынақ жиынтығын өзгерту керек
- C) Шамадан тыс орнату; модель жеңілдетілген болуы керек, регуляризация және кросс-валидация қолданылуы керек ✔
- D) Қалыпты жағдай; Білім деңгейі бәрібір әрқашан жоғары, сақтық шаралары қажет емес
Түсініктеме: Жаттығудағы өте жоғары балл және тестілеудегі айтарлықтай төмен балл - артық фитингтің классикалық симптомы: модель нақты үлгіні емес, жаттығу деректерінің шуын жаттап алды. Шешімдерге үлгіні жеңілдету, қосымша деректерді, реттеуді және кросс-валидация арқылы күйді тексеру кіреді. Тек білім көрсеткішіне сену бұл тұзақты жасырады.
9. Басқару көрсетілімінде сатылымдар 1000-нан 1020-ға дейін өсетін бағаналы диаграмманың y осі өсім үлкен болып көрінуі үшін 980-ден басталады. Нақты өсім 2% құрайды. Неліктен бұл этикалық мәселе?
- A) Кесілген у осі кішкене айырмашылықты визуалды түрде ұлғайтады және көрерменді жаңылыстырады; Әділдік үшін салыстыру жолақтарындағы ось 0-ден басталуы керек ✔
- B) Бағаналы диаграммаларды ешқашан сату деректері үшін қолдануға болмайды
- C) Мәселе жоқ; Диаграмманы әсерлі етіп жасау әрқашан жақсы
- D) Y осі әрқашан деректердің ең үлкен мәнінен басталуы керек
Түсініктеме: Салыстырмалы мақсаттарға арналған бағаналы диаграммаларда y осі әдетте 0-ден басталуы керек. Осьті кесу және 980-ден бастау шағын 2% айырмашылық көрнекі түрде үлкен болып көрінеді және көрерменді жаңылыстырады. Деректер маманының этикалық жауапкершілігі - деректерді асыра немесе төмендетпейтін шынайы графиктерді салу.
10. Талдаушы тауар кестесімен тапсырыстарды БІРІКТІргеннен кейін жалпы айналымды 3 рет табады; Жолдар саны 240 мыңнан 690 мыңға дейін өсті. Бұл үнсіз қатені болдырмау үшін не істеу керек еді?
- А) Жалпы тауар айналымын 3-ке бөлеміз
- B) JOIN орнына әрқашан бөлек сұрауларды пайдаланыңыз
- C) Өнім кестесін толығымен жою
- D) Біріктіру/JOIN кейін жолдар санын тексеру және олардың дұрыс перне арқылы қосылғанын тексеру; Репликацияны ерте анықтау ✔
Түсініктеме: Өнім кестесінде әрбір өнім үшін бірнеше жолдар (мысалы, түрлі түсті) болғанда, қате перне арқылы JOIN әр тапсырысты қайталайды және қорытындыларды көбейтеді. Код қатесіз жұмыс істейді, бірақ нәтиже дұрыс емес. Бұған жол бермеудің жолы - әрбір біріктіру/ЖОҢУ және дұрыс пернемен біріктіруден кейінгі жолдар санын тексеру.
11. Жұмысқа қабылдау скрининг үлгісі тарихи деректердегі гендерлік теңгерімсіздік туралы және жүйелі түрде әйел үміткерлердің ұпайларымен танысады, бірақ оның жалпы дәлдігі жоғары. Бұл нені білдіреді?
- A) Модельдің дәлдігі жоғары болғандықтан, проблема жоқ
- B) Статистикалық дәлдік этикалық қолайлылықты алмастырмайды; модель өткен кемсітушілік туралы білді, топтық негізде әділдікті тексеру қажет ✔
- C) Модельдің дәлдігін одан әрі арттыру мәселені шешеді
- D) Әділдік деректер ғылымының шеңберінен тыс
Түсініктеме: Үлгі статистикалық тұрғыдан дұрыс болса да, ол этикалық тұрғыдан қабылданбауы мүмкін. Модель өткен деректердегі әділетсіздікті біледі және кемсітуді автоматтандырады. Жоғары адалдық әділдікті алмастыра алмайды; Әсері жоғары модельдерде әртүрлі топтар үшін өнімділік/шешім айырмашылығын өлшейтін әділетті бақылау маңызды және соңғы жауапкершілік адамда.
12. Қызметкер нақты тұтынушы электрондық пошталары мен сатып алу тарихы бар файлды жалпыға қолжетімді AI құралына жүктеп салып, «сегменттерді қорытындылау» дейді. Неліктен бұл күрделі қателік және дұрыс жол қандай?
- A) Мәселе жоқ; AI құралдары ешқашан деректерді сақтамайды
- B) Қате файлдың тым үлкен болуы; қысқартылуы керек еді
- C) Ашық құралға нақты жеке деректерді беру KVKK/GDPR бұзу болып табылады; сәйкестендіру өрістері жойылып, тек анонимді схема/сипатты бөлісу керек ✔
- D) Excel-дің орнына CSV пайдаланылуы керек еді
Түсініктеме: Жалпыға қолжетімді жасанды интеллект құралына нақты жеке деректер (мысалы, электрондық пошта, аты-жөні және т.б.) берілгенде, KVKK/GDPR аясында құпиялылық бұзылады; деректер ұйымнан шығады. Көбінесе диаграмма және анонимді/синтетикалық үлгі талдау үшін жеткілікті. Дұрыс жол - сәйкестік өрістерін жою және тек анонимді сипаттарды ортақ пайдалану.
13. Ұсыныс үлгісі өндіріске енгізілген, бірақ қадағалау орнатылмаған; Өнім каталогы 4 айдан кейін өзгерген кезде, модель ескі өнімдерді ұсынуды жалғастырады және конверсия жылдамдығы 30%-ға үнсіз төмендейді. Бұл құбылыс қалай аталады?
- A) Қосымша білім алу; Модель оқу жинағын есте сақтайды
- B) Модельдік дрейф; Әлем өзгерген сайын, бақылау орнатылмағандықтан, модель үнсіз, байқалмай ескіреді ✔
- C) Таңдаудың бұрмалануы; үлгінің ауытқуы
- D) Мәліметтерді минимизациялауды бұзу
Түсініктеме: Бұл модель дрейфі (модель/деректер дрейфі): әлем өзгерген кезде (каталог, мінез-құлық, маусым) модель оқытылатын шарттар ауысады және модель үнсіз бұзылады. Өндіріске енгізілген үлгі өздігінен нашарлайды; Бұл «қашан» мәселесі. Бақылаусыз орналастыру (енгізу мен өнімділікті қадағалау) деградацияны анықтау мүмкін емес.
14. Бір жаттығу/сынақ бөлу кезінде 88% дәлдікке ие болатын модельде 88%, 71%, 83%, 64%, 79% кросс-валификацияның 5 еселік ұпайлары бар. Бұл нені көрсетеді және кросс-валидация неліктен маңызды?
- A) Модель тұрақты; 88% - нақты өнімділік
- B) Айқас валидация қажет емес; Бір бөлім жеткілікті
- C) Ұпайлардың үлкен құбылмалылығы модельдің тұрақсыз екенін көрсетеді; кросс-валидация бір сәттік қалта емес, бірнеше жәшіктердің орташа және таралуы бойынша өнімділікке негізделеді ✔
- D) Ең жоғары ұпайды (88%) хабарлаған дұрыс
Түсініктеме: Бір купе сәттілік пен сәтсіз болуы мүмкін; 88% оңай бөлудің нәтижесі ғана болды. Кросс-валидация өнімділікті орташа мәнге (мұнда ~77%) негіздей отырып және ұпайлардың құбылмалылығын көрсете отырып, деректерді бірнеше рет бөледі. Мұндағы жоғары құбылмалылық модельдің тұрақсыз екенін көрсетеді; Бір бөлікке сену жаңылыс.