Табыстар:
- Төрт тірекпен қайталануды қамтамасыз ету мүмкіндігі (тұқымды бекіту, деректер нұсқасын жасау, медианы мұздату, экспериментті бақылау) және бір жүгірісті қайталағанда бірдей нәтижені алу
- Модульдің барлық аялдамаларын (метрика, деректер, үлгі, LLM құрамдастары, бағалау, әділдік, қауіпсіздік, тарату, бақылау) ақырғы тізбекте біріктіру мүмкіндігі
- Әрбір аялдамада маңызды шешімнің адамда болатынын тексеру және жобаны аудиторлық түрде құжаттау мүмкіндігі
ML жобасының ең жасырын сәтсіздігі апат емес; «Қайтадан бірдей нәтиже шықпайды». Егер сіз үш ай бұрын өндіріске енгізген модельдің бүгінгі ұпайын қайталай алмасаңыз, сіз бұл модельді шынымен басқара алмайсыз. Бұл жабу бөлімінде біз қайталану мүмкіндігін тереңдетеміз: бірдей кірістермен бірдей нәтижені сенімді түрде алу және барлық модульді жобаның соңына дейін біріктіру мүмкіндігі.
Неліктен қайталану қиын
Кәдімгі бағдарламалық жасақтамада бірдей код бірдей нәтиже береді. ML-де нәтижені анықтайтын көптеген айнымалылар бар:
- Кездейсоқтық: деректерді араластыру, салмақты инициализациялау, деректерді бөлу — барлығы кездейсоқтыққа негізделген.
- Деректер: Бір код әртүрлі деректер нұсқасы бар басқа модельді шығарады.
- Қоршаған орта: кітапхана нұсқалары, аппараттық құрал (CPU/GPU), тіпті операциялық жүйе нәтижені өзгерте алады.
- Жасырын жағдай: сақталмаған гиперпараметр, қолмен алдын ала өңдеу қадамы, ескерілмеген таңдау.
Репродуктивтілік «болған жақсы» емес, ғылыми және инженерлік императив. Қайта шығаруға болмайтын нәтиже дәлелденбейтін талап болып табылады.
Репродуктивтіліктің төрт тірегі
1. Кездейсоқтықты түзетіңіз. Барлық кездейсоқ тұқымдарды бір жерге орнатыңыз: деректерді бөлу, үлгіні баптандыру, деректерді араластыру. Бекітілген тұқым «бір жүгіруді қайталағанда бірдей нәтиже» кепілдігінің негізі болып табылады.
2. Деректер нұсқасы. Әрбір тәжірибенің қай деректер нұсқасымен орындалғанын жазыңыз (2 блокта деректер нұсқасын жасау). «Соңғы деректер» анық емес; «деректер нұсқасы v3, abc123 хэш» дәл.
3. Ортаны мұздатыңыз. Барлық тәуелділіктерді олардың нақты нұсқаларына бекітіңіз (мысалы, талаптар.txt ішіндегі numpy==1.26.4 немесе контейнер кескіні сияқты нақты нұсқалар). «Соңғы нұсқа» бір күні бәрін бұзады.
4. Барлығын қадағалаңыз (экспериментті қадағалау). Әрбір эксперимент үшін автоматты түрде сақтаңыз: код нұсқасы (git commit), деректер нұсқасы, барлық гиперпараметрлер, метрика және шығыс құрылымдары. MLflow, Weights & Biases сияқты экспериментті бақылау құралдары мұны жүйелі түрде жасайды. Тіркеусіз «қай параметр жақсы болды» деген сұрақ жауапсыз қалады.
Абайлаңыз: «Кейін есіме аламын» - бұл ең қымбат қателік. Екі аптадан кейін сіз қандай тұқымды, қандай деректерді, қандай гиперпараметрді пайдаланғаныңызды еске түсірмейсіз. Автоматты бақылау жадқа тәуелділікті жояды.
Әлсіз тәсіл / Күшті көзқарас
Әлсіз: «Мен ең жақсы үлгіні таптым, ол дәптерде бар, оның ұпайы 89% болды деп ойлаймын».
Күшті: "Тәжірибе бақылау құралында №147 іске қосыңыз: git commit a3f9c, деректер нұсқасы v3 (abc123 хэш), 42 тұқым, барлық гиперпараметрлер тіркелген, PR-AUC 0.887 сынағы. Мен бірдей пәрменді қайта іске қосқанда, мен бірдей нәтижені біртіндеп аламын. Үлгі тізілімдегі осы іске байланысты."
Айырмашылық: күшті тәсілде нәтиже жадқа емес, бекітілген және бақыланатын тізбекке негізделген. Әр адам әр уақытта бірдей нәтиже бере алады.
Ақырғы жоба: модульді біріктіру
Енді барлық модульді бір жоба ағынына біріктірейік. Нақты ML жүйесі осы аялдамалар арқылы өтеді және әрбір аялдама алдыңғысына негізделеді:
- Мәселенің анықтамасы: Біз нені шешіп жатырмыз, табысты қалай өлшеуге болады (3 бірлік: дұрыс метрика, бизнес контекст). Метрика мен шек басынан анық.
- Деректер құбыры: жинау, тексеру, тазалау, ағып кетпейтін бөлу, нұсқаларды құру (2 блок).
- Үлгіні әзірлеу: Тренинг, базалық салыстыру, кросс-валидация, қатты тұқым (3 бірлік + осы бірлік).
- LLM құрамдастары (егер қолданылса): RAG (4 блок) және/немесе агенттер (5 блок); қажет болса дәл баптау (6 блок).
- Бағалау: шеткі және қауіпсіздік жағдайлары бар бағалау кластері, LLM жүйелеріндегі көп деңгейлі бағалау (8 блок).
- Әділдік және этика аудиті: Топшаны талдау, үлгі картасы, түсіндіру (10-бөлім).
- Қауіпсіздік аудиті: Жедел енгізу, құпиялылық, жеткізу тізбегі (9 блок).
- Тарату: Буып-түю, біртіндеп тарату, кері қайтару, үлгі тізілімі (7 блок).
- Бақылау: Үш қабатты бақылау, дрейфтік дабылдар (8 блок).
- Репродукциялық: Тұқым, деректер нұсқасы, медиа және бүкіл тізбек бойынша тәжірибені бақылау (осы құрылғы).
Бұл ағында AI әр аялдамада үдеткіш және сызба генераторы болып табылады; бірақ метрикалық таңдау, деректер шешімдері, әділеттілік басымдылығы, орналастыру шегі және шығаруды мақұлдау — маңызды шешімдер адамда қалады. Бұл модульдің мәні.
Құжаттама: болашақ сізге алғыс айтады
Жақсы ML жобасының өзі құжат. Кем дегенде мыналар жазылуы керек: мәселе және табыс критерийлері, деректер көзі мен нұсқасы, үлгі таңдауы мен негіздемесі, бағалау нәтижелері (ішкі топтарды қоса), белгілі шектеулер мен тәуекелдер, орналастыру және іздеу процедурасы, бақылау жоспары. Бұл құжат алты айдан кейін жобаға қайта оралатын адамның (мүмкін ол сіз шығарсыз) ең жақсы досы.
үш шағын іс
1-жағдай - жоғалған нәтиже. Инженер керемет үлгіні оқытты, бірақ ол тұқымды түзетпеді және деректер нұсқасын сақтамады. Ол жұмыстан кеткенде, бұл нәтижені ешкім қайталай алмады; модель «қара жәшік аңызына» айналды және ақырында нөлден құрастырылды. Апталар босқа кетті. Сабақ: қайталанбайтын нәтиже - жоқ нәтиже.
2-жағдай – Қоршаған ортаның құлдырауы. Бір команда тәуелділіктерді түзетпеді. Кітапхана автоматты түрде жаңартылған кезде, үлгі шығыстары үнсіз өзгерді және өндіріс үзілді. Мәселені табу үшін бірнеше күн қажет болды. Тәуелділіктер қатып, түпкілікті нұсқалармен контейнерленген кезде, мәселе қайтадан пайда болмады. Сабақ: қоршаған ортаны мұздату.
3-жағдай – Бақылау күші. Команда әрбір экспериментті автоматты түрде бақылап отырды. Үш айдан кейін нормативтік аудит кезінде олар «қандай деректермен, қандай параметрлермен, қай топтарда қандай көрсеткіштерге қол жеткізді?» деген сұраққа жауап берді. минут ішінде толық жазбамен. Тексеру еш қиындықсыз өтті. Сабақ: мониторинг тек инженерлік емес, сәйкестік құралы болып табылады.
Көшіретін үлгілер
Осы ML жобасының қайталану мүмкіндігін тексеріңіз.- Барлық кездейсоқтық тұқымдары бекітілген ба (бөлу, инициализациялау, араластыру)?- Деректер нұсқалары бар ма?- Тәуелділіктер нақты нұсқаларға бекітілген бе?- Әрбір эксперимент (кодты орындау, деректер, гиперпараметр, метрика) бақыланады ма? Әрбір жетіспейтін баған үшін оны қалай түзетуге болатыны туралы нақты қадамдарды жазыңыз. Жоба құрылымы: [сипаттама]
Осы ML жобасы үшін жоспар қаңқасын жасаңыз. Мәселе: [сипаттама] Келесі аялдамаларды жабыңыз және әр аялдамада АДАМ шешімі қай жерде екенін белгілеңіз: мәселе/метрика, құбыр желісі, үлгі, (RAG/агент/дәл баптау?), бағалау, әділдік, қауіпсіздік, тарату, бақылау, қайталану. Әрбір аялдама үшін негізгі тәуекелді және тексеру қадамын жазыңыз.
Осы жоба үшін техникалық құжаттама үлгісін жасаңыз. Бөлімдер: мәселе+сәттілік критерийлері, деректер (көзі+нұсқа), үлгі таңдаулары+негіздеу, бағалау (ішкі топтарды қоса), белгілі шектеулер+тәуекелдер, орналастыру+қайтару, бақылау жоспары. Әр бөлім үшін толтырылатын өрістерді сұрақ ретінде беріңіз.
Тәжірибемді бақылау параметрлерін тексеріңіз: ол әрбір іске қосу кезінде автоматты түрде сақталады ма: git commit, деректер нұсқасы/хэш, барлық гиперпараметрлер, барлық көрсеткіштер, орта (кітапхана нұсқалары)? Бірдей жүгірісті қайта іске қосқанда бірдей нәтиже аламын ба? Орнату: [сипаттама]. Кемшіліктер мен түзетулерді тізімдеңіз.
Қайта шығару бағандарының кестесі
баған
Не бекітілген
Көлік үлгісі
кездейсоқтық
барлық тұқымдар
тұқым орнату
Деректер
Деректер нұсқасы/хэш
DVC
қоршаған орта
Кітапхана нұсқалары
талаптар пин, Docker
Бақылау
Код+деректер+параметрі+метрика
MLflow, W&B
Жалпы қателер
- Тұқым бекітпейді. Нәтижені қайталау мүмкін емес.
- Деректер нұсқасы сақталмады. «Қандай деректермен?» жауапсыз қалады.
- Мұздатпайтын тәуелділіктер. Жаңарту барлығын үнсіз бұзады.
- Эксперименттерді есте қалдыру. Екі аптадан кейін ештеңе есімде жоқ.
- Сыни шешімдерді жасанды интеллектке қалдыру. Метрика, әділеттілік және бөлу шешімдері адамдарда қалуы керек.
- Құжаттарды кейінге қалдыру. Болашақ команда (және сіз) бағаны төлейді.
Қысқаша айтқанда
Репродуктивтілік - маңызды ML инженериясының қолтаңбасы: қайталанбайтын нәтиже - дәлелденбейтін шағым. Ол төрт бағанмен келеді — кездейсоқтықты, нұсқа деректерін түзетіңіз, ортаны тоқтатыңыз, әрбір экспериментті бақылаңыз. Үздік жоба осы модульдің барлық тоқтауларын (метрика, деректер, үлгі, LLM құрамдастары, бағалау, әділдік, қауіпсіздік, тарату, бақылау) өзара байланысты тізбекте біріктіреді; Жасанды интеллект әр аялдамада үдеткіш болып табылады, бірақ маңызды шешімдер адамда қалады. Барлығын құжаттаңыз — болашақ топ пен аудиттер үшін. Бұл пән барлық модуль бойынша үйренетін барлық нәрсені қолдайтын құрылым болып табылады.
Қолданбалы тапсырма
ML жобасын төрт репродукциялық бағанға қарсы тексеріңіз: тұқымдар өзгермейді ме, деректер нұсқасы бар ма, қоршаған орта мұздатылған ба, эксперименттер бақыланады ма? Кез келген жетіспейтін бағандарды түзетіңіз және бір жүгірісті екі рет орындап, бірдей нәтижеге қол жеткізе алатыныңызды дәлелдеңіз. Содан кейін жобаның соңына дейін ағынын (10 аялдама) бір бетте шығарыңыз және әр аялдамада «адамның шешімі қайда» деп белгілеңіз. Соңында қысқаша техникалық құжаттама жобасын жазыңыз.
бақылау парағы
- [ ] Барлық кездейсоқтық тұқымдары бекітілген.
- [ ] Деректер нұсқасы/хэш әрбір тәжірибеде жазылады.
- [ ] Тәуелділіктер фирма нұсқаларына (pin/контейнер) бекітіледі.
- [ ] Әрбір эксперимент автоматты түрде бақыланады (код+деректер+параметрі+метрика).
- [ ] Бірдей жүгіруді қайталағанда, мен бірдей нәтиже аламын.
- [ ] Мен ақырғы ағындағы маңызды шешімдерді адамдар қабылдайтынын растадым және құжаттадым.
Модуль емтиханы
1. ML инженері ретінде жұмыс процесінде жасанды интеллектті орналастырудың ең жақсы тәсілі қандай?
- A) АИ тәуекелі төмен кәсіпорындардағы акселератор болып табылады; Көрсеткіштер, деректер және өндіріс сияқты маңызды шешімдер тексеріліп, адамға қалдырылады ✔
- B) AI нәтижелері жақсы көрінгенше, тексерудің қажеті жоқ
- C) Модельді өндіріске енгізу шешімін жасанды интеллектке қалдыру уақытты үнемдейді.
- D) Жасанды интеллект тек мәтін жазу үшін пайдалы, оның деректермен және модельдік жұмыстармен ешқандай байланысы жоқ
Сипаттама: AI – код, деректер дайджесті және құжаттар сияқты қауіптілігі төмен, оңай тексерілетін тапсырмаларға арналған қуатты үдеткіш; Дегенмен, деректер оқытуға жіберілетін метрикалық таңдау және үлгіні өндіріске енгізу сияқты ақшаға, құпиялылыққа және заңды жауапкершілікке әсер ететін шешімдер үшін жауапкершілік білікті инженер мен командаға жүктеледі. Әрбір шығыс растаусыз пайдаланылмауы керек.
2. Неліктен схеманы тексеру деректер құбырының басында орналастырылған?
- A) Өйткені ол модельдің дәлдігін тікелей арттырады
- B) Өйткені ол деректердің нұсқасын жасауды қажетсіз етеді
- C) Өйткені ол бүлінген деректерді ең ерте және ең арзан уақытта ұстап алады және оның келесі қадамдарға ағып кетуіне жол бермейді ✔
- D) Өйткені ол таңбалау қажеттілігін жояды
Түсініктеме: бүлінген деректер неғұрлым ертерек ұсталса, оны түзету арзанырақ болады. Схеманы тексеру жолдың басында күтілетін түр мен ауқымнан тыс деректерді қабылдамау арқылы бүлінген деректердің оқуға немесе өндіріске үнсіз ағып кетуіне жол бермейді (мысалы, бірлік өзгерген кезде бағаның 100 есе өзгеруі); Өндірісте ұсталған бірдей қате бірнеше есе қымбатқа түседі.
3. Уақытпен (уақыттық қатар) есептердегі мәліметтерді оқыту және тестілеуге бөлу кезінде қандай тәсіл дұрыс?
- A) Кездейсоқ бөлуді қолдану, себебі бұл әрқашан ең әділ әдіс
- B) Уақытша бөлуді пайдалану: өткенмен жаттығу және болашақта тестілеу арқылы ағып кетудің алдын алыңыз ✔
- C) Барлық деректерді оқыту және тестілеу ретінде пайдалану
- D) Жаттығу алдында сынақ деректерін масштабтау параметрлеріне енгізу
Түсініктеме: Уақыт қатарлары бойынша кездейсоқ бөлу модельге өндірісте ешқашан болмайтын «болашақты көру» артықшылығын береді және көрсеткіштерді жасанды түрде арттырады (уақытша ағып кету). Дұрысы - уақытша бөлу: өткенмен жаттығу, болашақта сынақ. Бұл оны өндірісте сақтайтын нақты өнімділікті өлшейді.
4. 1,5% оң класс көрсеткіші бар алаяқтықты анықтау үлгісінде дәлдік неге жаңылыстырады?
- A) Теңгерімсіз деректерде дәлдік әрқашан төмен болғандықтан
- B) Өйткені дәлдікті тек регрессия есептері бойынша қолдануға болады
- C) Өйткені дәлдікті есептеу көп өңдеу қуатын қажет етеді
- D) Көпшілік класын болжайтын шамалы модельдің өзі өте дәл болуы мүмкін, осылайша нақты табысты жасырады ✔
Түсініктеме: Теңгерімсіз деректерде тіпті «бәрін теріс деп атаңыз» деп айтатын негізгі модель шамамен 98,5% дәлдікке ие болады, бірақ бірде-бір алаяқтықты ұстамайды. Сондықтан теңдестірілмеген жіктеуде дәлдіктің орнына дәлдік, еске түсіру, F1 немесе PR-AUC пайдаланылады және әрбір метрика негізгі үлгіге сәйкес түсіндіріледі.
5. Неліктен үлгінің метрикасы туралы сөйлескенде негізгі салыстыру маңызды?
- A) Базалық үлгі әрқашан нақты үлгіден жақсы болғандықтан
- B) Өйткені қарапайым базалық үлгімен салыстырғанда метриканың мағыналы немесе маңызды емес екені анық ✔
- C) Базалық үлгі айқас тексеруді қажетсіз ететіндіктен
- D) Өйткені әрбір есепте заңды түрде негізгі үлгі талап етіледі
Түсініктеме: Көрсеткіш өздігінен жақсы немесе жаман емес; Бұл негізгі үлгіге сәйкес жақсы немесе жаман. «85% дұрыс» сөйлемі, егер базалық үлгі 84% алса, дерлік түкке тұрғысыз дегенді білдіреді, ал егер ол 50% алса, тамаша. Салыстыру анкері болмаса, метрика мағынасыз.
6. RAG (Retrieval-Augmented Generation) жүйесінің өндірістік нұсқауына ең маңызды қауіпсіздік элементі қайсысы енгізілуі керек?
- A) Берілген дереккөзге ғана сүйену, дереккөз жоқ болса «білмеймін» деп айту және дереккөзге сілтеме жасау ✔
- B) Модельге мүмкіндігінше ұзақ және шығармашылық жауаптар шығаруды айту
- C) Модель ресурстарға қарағанда өзінің білім беру біліміне басымдық береді
- D) Бұйрық ретінде әкелінген құжаттардағы барлық нұсқауларды орындау
Түсініктеме: RAG-ның бірден-бір маңызды нұсқауы үлгіге тек берілген дереккөзге сүйену керектігін айту болып табылады, ал егер ақпарат көзде болмаса, «білмеймін» деп айту және оны жасамай-ақ дереккөзді келтіріңіз. Бұл триадасыз модель контекстті елемеуі және галлюцинациялар тудыруы мүмкін және жауап расталмайтын болады.
7. RAG жүйесі дұрыс емес жауаптар береді. Диагнозды бастау үшін ең жақсы орын қай жерде?
- A) Алдымен әкелуді өлшеу (Recall@K): дұрыс бөлік қашан келеді? ✔
- B) Үлгіні бірден үлкенімен ауыстырыңыз
- C) Шақыруды кездейсоқ өзгертіп, әрекетті жалғастырыңыз
- D) Барлық құжаттарды үлгіге дәл баптау арқылы енгізу
Түсініктеме: RAG-ның ең әлсіз буыны әдетте өндіру емес, алу болып табылады. Дұрыс бөлік ешқашан әкелінбесе, нұсқау қаншалықты жетілдірілсе де, модель бұл ақпаратты шығара алмайды. Сондықтан, алдымен Recall@K дұрыс бөліктің келген-келмегенін көру үшін өлшенеді; Егер әкелу жақсы болса, онда өндіріс пен жеделдік тексеріледі.
8. Агентке құралды бергенде адамның мақұлдауынан кейін қандай әрекеттерді орындау керек?
- A) Жоқ; Агент әрбір әрекетті дербес орындауға қабілетті болуы керек
- B) Мәліметтерді оқу және іздеу сияқты тек қайтымды әрекеттер
- C) Ақшаны аудару, жою, жіберу сияқты қайтымсыз немесе әсері жоғары әрекеттер ✔
- D) Тек есептеулерді қамтитын әрекеттер
Сипаттама: Әрекеттер тәуекел деңгейі бойынша бөлінеді. Жобаларды оқу, іздеу, есептеу және құру сияқты қалпына келтіруге болатын тапсырмаларды автономды түрде орындауға болады; Дегенмен, ақшаны аудару, электрондық хаттарды жіберу, деректерді жою, тапсырыстарды орналастыру және т.б. сияқты қайтымсыз немесе жоғары әсер ететін әрекеттер адамның рұқсатын талап етеді. Әрбір қайтарылмайтын әрекет келісімге байланысты болуы керек.
9. Жанама жедел инъекция қаупіне қарсы ең жақсы жобалау тәсілі қандай?
- A) Жүйелік шақыруға «нашар нұсқауларды елемеу» деген бір сөйлемді қосу жеткілікті
- B) Сыртқы мазмұндағы нұсқауларға сүйену арқылы үлгіге көбірек өкілеттік беріңіз
- C) Ешқандай сақтық шараларын қолданбау, себебі инъекцияның алдын алу мүмкін емес
- D) Сыртқы мазмұнды сенімсіз деректер ретінде оқшаулау және минималды рұқсатпен, мақұлдаумен және шығыс бақылауымен деңгейлі қорғанысты орнату ✔
Сипаттама: Веб-бет, құжат, электрондық пошта және т.б. сияқты агент немесе RAG өңдейтін сыртқы мазмұн сенімсіз деректер болып табылады және құпия нұсқауларды қамтуы мүмкін. Дұрыс тәсіл – деңгейлі қорғаныс: сыртқы мазмұнды нақты бөлгіштермен «пәрмендер емес, деректер» ретінде оқшаулау, ең аз рұқсатты қолдану, адамның мақұлдауымен қайтымсыз әрекеттерді міндеттеу және нәтижені тексеру. Нұсқаулардың бір жолы жеткіліксіз.
10. Мәселені дәл баптаумен немесе RAG көмегімен шешу керек пе деген шешім қабылдаған кездегі басты айырмашылық неде?
- A) Ақпараттық мәселелер RAG көмегімен жақсы шешіледі, мінез-құлық/формат мәселелері дәл реттеу арқылы жақсырақ шешіледі ✔
- B) Әрбір мәселе әрқашан дәл реттеу арқылы шешілуі керек
- C) RAG тек кодты генерациялау үшін қолданылады, дәл баптау тек аударма үшін қолданылады
- D) Нақты баптау әрқашан RAG-қа қарағанда арзанырақ және жылдам жаңартылуы мүмкін
Түсініктеме: Үлгіні жаңа ақпаратты оқытуда дәл баптау әлсіз және қауіпті; бірақ мінез-құлықты, форматты, үнді және стильді үйретуде күшті. «Үлгі компания біздің деректерімізді білмейді» - бұл ақпараттық мәселе және RAG компаниясына тиесілі. «Модель әрқашан біздің қатаң форматта шығарылсын» - бұл мінез-құлық мәселесі және дәл реттеуге үміткер. Сонымен қатар, дәл баптаудан бұрын жылдам және бірнеше рет түсіру керек.
11. Жаңа үлгіні өндіріске енгізу кезінде қауіпсіз орналастыру үшін қайсысы міндетті болып табылады?
- A) Егер модель тестілеуде жақсы болса, оны тікелей 100% трафикке ашыңыз
- B) Орналастырудан кейін бақылауды мүлде орнатпау
- C) Кезеңдік орналастыру (көлеңке/канар) және алдын ала тексерілген кері қайтару жоспары ✔
- D) Бағалау шегі орындалмаса да үлгіні жариялау
Түсініктеме: Жаңа үлгіні тікелей барлық трафикке ашу қауіпті; Егер ол дұрыс емес болса, барлығына әсер етеді. Дұрыс нәрсе - бұл бірте-бірте тарату (көлеңке, канарей) және әрбір дистрибуцияда сынақтан өткен кері қайтару жоспары бар. Тарату кері жоспарсыз аяқталмайды; Алдыңғы нұсқаға бірнеше минут ішінде оралу мүмкіндігі модель өндірісте күтпеген жерден әрекет еткенде пайдаланушыны қорғайды.
12. ML моделі өндірісте қалай «үнсіз» сәтсіздікке ұшырауы мүмкін және оны ұстаудың жолы қандай?
- A) Модель бұзылады; сервер журналдары мұны көрсетеді
- B) Қателеспей қате болжамдар жасау арқылы; ✔ Ол операциялық, кіріс және шығыс деңгейлік бақылауды түсіреді
- C) Модель ешқашан үнсіз сәтсіздікке ұшырамайды, әрқашан дабыл
- D) Кез келген деградацияны ұстау үшін тек күту уақытын бақылау жеткілікті
Түсініктеме: Модель бұзылмай немесе қателер бермей, дұрыс емес болжамдар жасау арқылы ғана сәтсіздікке ұшырауы мүмкін; Мұның басты себебі - деректердің дрейфі және тұжырымдаманың дрейфі. Тек операциялық көрсеткіштерді (кідіріс, қателік жылдамдығы) бақылау жеткіліксіз; кірісті бөлу және шығыс/болжамдық үлестіруді де бақылау қажет. Егер нақты нәтиже кешіктірілсе, кіріс дрейфі ертерек ескерту береді.
13. LLM жүйесін бағалау үшін судья ретінде LLM қолдану кезінде қандай принцип маңызды?
- A) LLM-төреші әрқашан дұрыс, адамның тексеруі қажет емес
- B) Төреші тек жауаптың ұзақтығына қарай шешім қабылдауы керек.
- C) Төрешілер пайдаланылған кезде ережелерге негізделген бақылаулар мен адамдық бағалауды толығымен алып тастау керек
- D) Судья ұпайлары адам таңбаланған үлгімен калибрленуі керек және оларға сенуге болмас бұрын олардың ауытқуы өлшенуі керек ✔
Сипаттама: LLM-рефери де үлгі болып табылады; Бұл галлюцинаторлы, біржақты (ұзақ, сенімді жауаптарды ұнататын) және сәйкес келмейтін болуы мүмкін. Сондықтан, төреші ұпайлары адам таңбаланған үлгімен калибрленуі керек және олардың жүйелік ауытқуы өндіріс туралы шешім қабылданар алдында өлшенуі керек. Тексерілмеген төреші жалған сенім береді.
14. Неліктен үлгінің ауытқуын бағалау кезінде жалпы дәлдікке қарау жеткіліксіз?
- A) Жалпы дәлдік жеткілікті, өйткені ол әрқашан ең нашар топтың көрсеткіштерін көрсетеді
- B) Жалпы дәлдіктің өзі жеткіліксіз, өйткені ол ішкі топтар арасындағы жүйелі айырмашылықты (жасырын кемсітушілік) жасыруы мүмкін ✔
- C) Өйткені дәлдік – қиғаштыққа еш қатысы жоқ метрика
- D) Бағалау тек үлгіден келеді және деректерге ешқандай қатысы жоқ.
Түсініктеме: Жалпы дәлдік ішкі топтар арасындағы жүйелі айырмашылықтарды жасыруы мүмкін. Мысалы, жалпы дәлдік 88% болса, еске түсіру бір топта 91% және басқа топта 67% болуы мүмкін; Модель бұл топты жүйелі түрде өткізіп жібереді. Сондықтан модельді кіші топтар (демография/сегмент) негізінде бағалау керек және әділеттіліктің қандай анықтамасына басымдық беру керектігі мүдделі тараптармен шешілуі керек.
15. ML нәтижесі қайталанатын болуы үшін қандай төрт нәрсені бірге бекіту керек?
- A) Тек үлгі атауы, өлшемі, бағасы және шығарылған күні
- B) Тек GPU бренді және интернет жылдамдығы
- C) Модельдің соңғы дәлдік баллы ғана; қалғанын жадта сақтауға болады
- D) Кездейсоқтық тұқымы, деректер нұсқасы, орта (тәуелділік нұсқалары) және экспериментті бақылау ✔
Сипаттама: Қайта шығаруға төрт тірек арқылы қол жеткізіледі: кездейсоқтық тұқымдарын бекіту, деректерді нұсқалау (нұсқа/хэш), ортаны қатыру (нақты кітапхана нұсқалары/контейнер) және әрбір экспериментті бақылау (кодты орындау, деректер, гиперпараметр, метрика). Бұл тізбексіз бір нәтижені қайта шығару мүмкін емес; Қайталанбайтын нәтиже - дәлелденбейтін мәлімдеме.