Qazanclar:
- Dörd sütunla (toxumların fiksasiyası, məlumatların versiyasının yaradılması, medianın dondurulması, təcrübənin monitorinqi) təkrar istehsal qabiliyyətini təmin etmək və eyni qaçışı təkrarlayarkən eyni nəticəni əldə etmək bacarığı
- Modulun bütün dayanacaqlarını (ölçmələr, məlumatlar, model, LLM komponentləri, qiymətləndirmə, ədalətlilik, təhlükəsizlik, paylama, monitorinq) uçdan-uca zəncirdə birləşdirmək imkanı
- Kritik qərarın hər dayanacaqda insanda qaldığını yoxlamaq və layihəni audit edilə bilən şəkildə sənədləşdirmək bacarığı
ML layihəsinin ən məkrli uğursuzluğu qəza deyil; "Yenə eyni nəticə alınmayacaq." Üç ay əvvəl istehsala qoyduğunuz modelin xalını bu gün təkrar edə bilmirsinizsə, o modeli həqiqətən idarə etmirsiniz. Bu yekun bölmədə biz təkrarlanma qabiliyyətini dərinləşdiririk: eyni girişlərlə eyni nəticəni etibarlı şəkildə əldə etmək və bütün modulu layihə intizamında birləşdirmək bacarığı.
Nə üçün təkrar istehsal çətindir
Adi proqram təminatında eyni kod eyni çıxışı verir. ML-də nəticəni təyin edən daha çox dəyişənlər var:
- Təsadüfilik: Məlumatların qarışdırılması, çəkinin işə salınması, məlumatların bölünməsi - hamısı təsadüfiliyə əsaslanır.
- Data: Eyni kod fərqli məlumat versiyası ilə fərqli model istehsal edir.
- Ətraf mühit: Kitabxana versiyaları, aparat (CPU/GPU), hətta əməliyyat sistemi də nəticəni dəyişə bilər.
- Gizli hal: Saxlanmamış hiperparametr, əl ilə əvvəlcədən emal addımı, qeyd olunmamış seçim.
Reproduktivlik "sahibi olmaq xoşdur" deyil, elmi və mühəndislik tələbidir. Təkrarlana bilməyən nəticə sübut olunmayan iddiadır.
Təkrarlanmanın dörd sütunu
1. Təsadüfiliyi düzəldin. Bütün təsadüfi toxumları bir yerə qoyun: məlumatların bölünməsi, modelin işə salınması, məlumatların qarışdırılması. Sabit toxum "eyni qaçışı təkrarladığınız zaman eyni nəticə" zəmanətinin əsasını təşkil edir.
2. Verilənlərin versiyası. Hər eksperimentin hansı data versiyası ilə aparıldığını qeyd edin (2-ci bölmədə verilənlərin versiyalaşdırılması). “Son məlumatlar” qeyri-müəyyəndir; "data version v3, hash abc123" dəqiqdir.
3. Ortanı dondurun. Bütün asılılıqları onların dəqiq versiyalarına bağlayın (məsələn, tələblər.txt-də numpy==1.26.4 kimi dəqiq versiyalar və ya konteyner şəkli). "Son versiya" bir gün hər şeyi pozacaq.
4. Hər şeyi izləyin (təcrübənin izlənməsi). Hər bir təcrübə üçün avtomatik olaraq yadda saxlayın: kod versiyası (git commit), məlumat versiyası, bütün hiperparametrlər, ölçülər və çıxış strukturları. MLflow, Weights & Biases kimi sınaq izləmə vasitələri bunu sistemli şəkildə edir. Qeydiyyat olmadan "hansı parametr daha yaxşı idi" sualı cavabsız qalır.
Diqqət: "Sonra xatırlayacağam" ən bahalı səhvdir. İki həftə sonra hansı toxumu, hansı məlumatları, hansı hiperparametrdən istifadə etdiyinizi xatırlamayacaqsınız. Avtomatik izləmə yaddaşdan asılılığı aradan qaldırır.
Zəif yanaşma / Güclü yanaşma
Zəif: “Ən yaxşı modeli tapdım, notebookdadır, məncə, onun balı 89% olub”.
Güclü: "Təcrübə izləmə alətində №147-ni işə salın: git commit a3f9c, data version v3 (hash abc123), seed 42, bütün hiperparametrlər qeydə alınıb, PR-AUC 0.887-ni sınaqdan keçirin. Eyni əmri təkrar icra edəndə, eyni nəticəni yavaş-yavaş əldə edirəm. Model reyestrdəki bu qaçışdan asılıdır."
Fərq: güclü yanaşmada nəticə yaddaşa deyil, sabit və izlənilən zəncirə əsaslanır. Hər kəs hər dəfə eyni nəticəni verə bilər.
Başdan-başa layihə: modulun birləşməsi
İndi bütün modulu vahid layihə axınına birləşdirək. Həqiqi ML sistemi bu dayanacaqlardan keçir və hər bir dayanacaq əvvəlki birinə əsaslanır:
- Problemin tərifi: Biz nəyi həll edirik, uğuru necə ölçmək olar (vahid 3: düzgün metrik, biznes konteksti). Metrik və hədd əvvəldən aydındır.
- Məlumat kəməri: Toplama, doğrulama, təmizləmə, sızdırmaz bölmə, versiyalaşdırma (vahid 2).
- Modelin inkişafı: Təlim, əsas müqayisə, çarpaz doğrulama, sərt toxum (vahid 3 + bu vahid).
- LLM komponentləri (əgər varsa): RAG (vahid 4) və/və ya agentlər (vahid 5); zəruri hallarda incə tənzimləmə (vahid 6).
- Qiymətləndirmə: kənar və təhlükəsizlik halları ilə qiymətləndirmə klasteri, LLM sistemlərində çox səviyyəli qiymətləndirmə (vahid 8).
- Ədalət və etika auditi: Alt qrup təhlili, model kartı, izahlılıq (vahid 10).
- Təhlükəsizlik auditi: Sürətli inyeksiya, məxfilik, təchizat zənciri (bölmə 9).
- Dağıtım: Qablaşdırma, tədricən paylama, geri qaytarma, model reyestri (vahid 7).
- Monitorinq: Üç qatlı monitorinq, sürüşmə siqnalları (bölmə 8).
- Reproduktivlik: Toxum, məlumat versiyası, media və bütün zəncir boyunca təcrübə izləmə (bu vahid).
Bu axında AI hər dayanacaqda sürətləndirici və plan generatorudur; lakin metrik seçim, məlumat qərarları, ədalətlilik prioritetləri, yerləşdirmə həddi və buraxılış təsdiqi - kritik qərarlar insanda qalır. Bu modulun mahiyyətidir.
Sənədlər: gələcək sizə təşəkkür edəcək
Yaxşı bir ML layihəsi özünü sənədləşdirir. Ən azı aşağıdakılar yazılmalıdır: problem və müvəffəqiyyət meyarları, məlumat mənbəyi və versiyası, model seçimləri və əsaslandırmalar, qiymətləndirmə nəticələri (o cümlədən alt qruplar), məlum limitlər və risklər, yerləşdirmə və axtarış proseduru, monitorinq planı. Bu sənəd altı aydan sonra layihəyə qayıdan şəxsin (bəlkə də sizsiniz) ən yaxşı dostudur.
üç mini qutu
Case 1 - İtirilmiş nəticə. Mühəndis əla bir model hazırladı, lakin o, toxumu düzəltmədi və məlumat versiyasını saxlamadı. İşdən çıxanda heç kim bu nəticəni təkrarlaya bilməzdi; model "qara qutu əfsanəsi" oldu və nəticədə sıfırdan quruldu. Həftələr boşa çıxdı. Dərs: təkrar olunmayan nəticə mövcud olmayan nəticədir.
2-ci hal - Ətraf mühitin çökməsi. Bir komanda asılılıqları düzəltməmişdi. Kitabxana avtomatik yeniləndikdə, model çıxışları səssizcə dəyişdi və istehsal dayandırıldı. Problemi tapmaq günlər çəkdi. Asılılıqlar dondurulduqda və qəti versiyalarla konteynerləşdirildikdə problem yenidən baş vermədi. Dərs: ətraf mühiti dondurun.
Case 3 - Monitorinqin gücü. Komanda hər bir eksperimentə avtomatik nəzarət edirdi. Üç ay sonra tənzimləyici audit zamanı “hansı məlumatlarla, hansı parametrlərlə, hansı qruplarda hansı göstəriciləri əldə edib?” sualına cavab verdilər. dəqiqə ərzində tam qeyd ilə. Yoxlama rəvan keçdi. Dərs: monitorinq yalnız mühəndislik deyil, uyğunluq vasitəsidir.
Kopyalana bilən şablonlar
Bu ML layihəsi üçün reproduktivlik yoxlanışı aparın.- Bütün təsadüfilik toxumları sabitdirmi (bölün, işə salın, qarışdırın)?- Verilənlər versiyaya salınıb?- Asılılıqlar dəqiq versiyalar üçün dondurulubmu?- Hər bir təcrübə (kod qəbulu, data, hiperparametr, metrik) izlənilirmi? Hər bir çatışmayan sütun üçün onu necə düzəltmək barədə konkret addımlar yazın. Layihə strukturu: [təsvir]
Bu uçdan-uca ML layihəsi üçün plan skeleti hazırlayın. Problem: [təsvir] Aşağıdakı dayanacaqları əhatə edin və hər dayanacaqda İNSAN qərarının harada olduğunu qeyd edin: problem/metrik, boru kəməri, model, (RAG/agent/incə tənzimləmə?), qiymətləndirmə, ədalət, təhlükəsizlik, paylama, monitorinq, təkrar istehsal. Hər dayanacaq üçün əsas risk və yoxlama addımını yazın.
Bu layihə üçün texniki sənədlərin şablonunu hazırlayın. Bölmələr: problem+uğur meyarları, verilənlər (mənbə+versiya), model seçimləri+əsaslandırma, qiymətləndirmə (alt qruplar daxil olmaqla), məlum limitlər+risklər, yerləşdirmə+geri qayıtma, monitorinq planı. Hər bölmə üçün doldurulacaq sahələri sual olaraq verin.
Təcrübə monitorinqi quraşdırmamı yoxlayın: O, hər qaçışda avtomatik saxlanılırmı: git commit, data version/hesh, bütün hiperparametrlər, bütün ölçülər, mühit (kitabxana versiyaları)? Eyni qaçışı təkrar həyata keçirəndə eyni nəticəni alırammı? Quraşdırma: [təsvir]. Qüsurları və düzəlişləri sadalayın.
Təkrarlanma sütunları cədvəli
sütun
Nə düzəldilir
Avtomobil nümunəsi
təsadüfilik
bütün toxumlar
toxum qəbulu
Data
Məlumat versiyası/hash
DVC
mühit
Kitabxana versiyaları
tələblər pin, Docker
Monitorinq
Kod+data+parametri+metrik
MLflow, W&B
Ümumi səhvlər
- Toxumu düzəltməyin. Nəticə təkrarlana bilməz.
- Data versiyası saxlanmır. "Hansı məlumatlarla?" cavabsız qalır.
- Dondurucu asılılıqlar deyil. Bir yeniləmə səssizcə hər şeyi pozacaq.
- Təcrübələri yaddaşa buraxmaq. İki həftə sonra heç nə xatırlanmır.
- Kritik qərarları süni intellektə buraxmaq. Metriklər, ədalət və paylama qərarları insanlarda qalmalıdır.
- Sənədlərin təxirə salınması. Gələcək komanda (və siz) qiyməti ödəyəcəksiniz.
Xülasə
Təkrarlanma qabiliyyəti ciddi ML mühəndisliyinin imzasıdır: təkrarlana bilməyən nəticə sübut olunmayan iddiadır. Dörd sütunla gəlir - təsadüfiliyi, versiya məlumatlarını düzəldin, mühiti dondurun, hər bir təcrübəni izləyin. Başdan-ayağa layihə bu modulun bütün dayanacaqlarını (metrik, verilənlər, model, LLM komponentləri, qiymətləndirmə, ədalət, təhlükəsizlik, paylama, monitorinq) bir-birinə bağlı zəncirdə birləşdirir; Süni intellekt hər dayanacaqda sürətləndiricidir, lakin kritik qərarlar insanda qalır. Gələcək komanda və auditlər üçün hər şeyi sənədləşdirin. Bu intizam modul boyu öyrəndiyiniz hər şeyi təmin edən çərçivədir.
Tətbiq tapşırığı
Dörd reproduktivlik sütununa qarşı ML layihəsini yoxlayın: toxumlar dəyişməzdirmi, məlumat versiyalıdırmı, ətraf mühit dondurulubmu, təcrübələr izlənirmi? Hər hansı çatışmayan sütunları düzəldin və eyni qaçışı iki dəfə yerinə yetirə və eyni nəticə əldə edə biləcəyinizi sübut edin. Sonra layihənin sonuna qədər axınını (10 dayanacaq) bir səhifəyə çıxarın və hər dayanacaqda "insan qərarının harada olduğunu" qeyd edin. Nəhayət, qısa texniki sənədlərin layihəsini yazın.
yoxlama siyahısı
- [ ] Bütün təsadüfi toxumlar düzəldildi.
- [ ] Məlumat versiyası/hesh hər bir təcrübə ilə qeydə alınır.
- [ ] Asılılıqlar firma versiyalarına (pin/konteyner) dondurulur.
- [ ] Hər bir təcrübə avtomatik olaraq yoxlanılır (kod+data+parametr+metrik).
- [ ] Eyni qaçışı təkrarlayanda eyni nəticəni alıram.
- [ ] Mən təsdiqlədim və sənədləşdirdim ki, axındakı kritik qərarlar insanlar tərəfindən verilir.
Modul imtahanı
1. ML mühəndisi olaraq iş prosesində süni intellektin yerləşdirilməsi zamanı ən yaxşı yanaşma hansıdır?
- A) AI aşağı riskli bizneslərdə sürətləndiricidir; Metriklər, məlumatlar və istehsal kimi kritik qərarlar təsdiqlənir və insanın öhdəsinə buraxılır ✔
- B) Nə qədər ki, AI çıxışları yaxşı görünür, yoxlamaya ehtiyac yoxdur
- C) Modelin istehsalata verilməsi qərarını süni intellektə buraxmaq vaxta qənaət edir.
- D) Süni intellekt yalnız mətn yazmaq üçün faydalıdır, onun məlumat və model işi ilə heç bir əlaqəsi yoxdur
Təsvir: AI kod, məlumat həzmləri və sənədlər kimi aşağı riskli, asanlıqla yoxlanılan tapşırıqlar üçün güclü sürətləndiricidir; Bununla belə, pula, məxfiliyə və hüquqi məsuliyyətə təsir edən qərarlar, məsələn, metrik seçim, hansı məlumatların təlimə daxil olması və modelin istehsala buraxılması üçün məsuliyyət ixtisaslı mühəndis və komandanın üzərinə düşür. Hər bir çıxış yoxlanılmadan istifadə edilməməlidir.
2. Nə üçün sxemin yoxlanılması məlumat kəmərinin əvvəlində yerləşdirilir?
- A) Çünki modelin dəqiqliyini birbaşa artırır
- B) Çünki o, verilənlərin versiyalanmasını lazımsız edir
- C) Çünki o, zədələnmiş məlumatları ən erkən və ən ucuz nöqtədə tutur və sonrakı addımlara sızmasının qarşısını alır ✔
- D) Çünki etiketləmə ehtiyacını aradan qaldırır
İzahat: Korrupsiyaya uğramış məlumatlar nə qədər tez tutulsa, onu düzəltmək bir o qədər ucuzdur. Sxemlərin yoxlanılması xəttin əvvəlində gözlənilən tip və diapazondan kənar məlumatları rədd etməklə (məsələn, vahid dəyişikliyi ilə qiymətin 100x dəyişməsi) korlanmış məlumatların səssizcə təlimə və ya istehsala sızmasının qarşısını alır; İstehsalda tutulan eyni səhv dəfələrlə baha başa gəlir.
3. Vaxt (vaxt seriyası) ilə bağlı problemdə məlumatların təlim və sınaqlara bölünməsi zamanı düzgün yanaşma hansıdır?
- A) Təsadüfi bölmədən istifadə, çünki həmişə ən ədalətli üsuldur
- B) Müvəqqəti parçalanmadan istifadə: keçmişlə məşq edərək və gələcəkdə sınaqdan keçirərək sızmanın qarşısını alın ✔
- C) Bütün məlumatların həm təlim, həm də sınaq kimi istifadə edilməsi
- D) Təlimdən əvvəl test məlumatlarının miqyaslama parametrlərinə daxil edilməsi
İzahat: Zaman sıraları üzrə təsadüfi bölünmə modelə istehsalda heç vaxt baş verməyəcək "gələcəyi görən" üstünlük verir və ölçüləri süni şəkildə şişirdir (müvəqqəti sızma). Düzgün olanı müvəqqəti bölgüdür: keçmişlə məşq edin, gələcəkdə sınaqdan keçirin. Bu, onu istehsalda saxlayan faktiki performansı ölçür.
4. Müsbət sinif dərəcəsi 1,5% olan fırıldaqçılığın aşkarlanması modelində dəqiqlik niyə aldadıcıdır?
- A) Balanssız verilənlərdə Dəqiqlik həmişə aşağı olduğu üçün
- B) Çünki Dəqiqlik ancaq reqressiya məsələlərində istifadə oluna bilər
- C) Çünki Dəqiqliyin hesablanması çoxlu emal gücü tələb edir
- D) Çoxluq sinfini proqnozlaşdıran cüzi bir model belə çox dəqiq ola bilər və bununla da real uğuru gizlədə bilər ✔
İzahat: Balanssız məlumatlarda, hətta "hər şeyi mənfi adlandırın" deyən əsas model də təxminən 98,5% dəqiqlik əldə edir, lakin heç bir saxtakarlığa rast gəlməyəcək. Buna görə də balanssız təsnifatda dəqiqlik əvəzinə dəqiqlik, geri çağırma, F1 və ya PR-AUC istifadə olunur və hər bir metrik əsas modelə uyğun şərh edilir.
5. Modelin metrikası haqqında danışarkən əsas müqayisə nə üçün vacibdir?
- A) Çünki əsas model həmişə real modeldən daha yaxşıdır
- B) Çünki sadə baza modeli ilə müqayisədə metrikanın mənalı olub-olmaması aydın olur ✔
- C) Baza modeli çarpaz doğrulamayı lazımsız etdiyinə görə
- D) Çünki hər bir hesabatda əsas model qanuni olaraq tələb olunur
İzahat: Metrik özlüyündə yaxşı və ya pis deyil; Əsas modelə görə yaxşı və ya pisdir. '85% düzgün' cümləsi, əgər əsas model artıq 84% alırsa, demək olar ki, dəyərsiz, 50% isə mükəmməl deməkdir. Müqayisə lövbəri olmadan metrikanın mənası yoxdur.
6. RAG (Gətirilmə-Genişləndirilmiş Nəsil) sisteminin istehsal əmrinə daxil edilməli olan ən vacib təhlükəsizlik elementi hansıdır?
- A) Yalnız verilən mənbəyə istinad etmək, mənbə yoxdursa “bilmirəm” demək, mənbəyə istinad etmək göstərişi ✔
- B) Modelə mümkün qədər uzun və yaradıcı cavablar verməsini söyləmək
- C) Model öz təhsil biliklərini resurslardan üstün tutur
- D) Əmr kimi gətirilən sənədlərdəki bütün göstərişləri yerinə yetirmək
İzahat: RAG-ın yeganə ən vacib göstərişi modelə yalnız verilən mənbəyə etibar etməsini söyləməkdir, əgər məlumat mənbədə deyilsə, “bilmirəm” deyin və mənbəyə uydurmadan istinad edin. Bu triada olmadan model konteksti görməməzliyə vura və halüsinasiyalar yarada bilər və cavab yoxlanılmaz olur.
7. RAG sistemi səhv cavablar verir. Diaqnozu başlamaq üçün ən yaxşı yer haradadır?
- A) Əvvəlcə götürmənin ölçülməsi (Recall@K): düzgün parça nə vaxtsa gəlib çatırmı? ✔
- B) Dərhal modeli daha böyük modellə əvəz edin
- C) Təqdimatı təsadüfi olaraq dəyişdirin və cəhd etməyə davam edin
- D) Bütün sənədlərin incə tənzimləmə ilə modelə daxil edilməsi
İzahat: RAG-ın ən zəif halqası adətən istehsal deyil, gətirmədir. Düzgün hissə heç vaxt gətirilməzsə, sorğu nə qədər təkmilləşdirilsə də, model bu məlumatı istehsal edə bilməz. Buna görə də, düzgün hissənin gəlib-gəlmədiyini görmək üçün əvvəlcə Recall@K ölçülür; Əgər gətirmə yaxşı olarsa, o zaman istehsal və operativlik yoxlanılır.
8. Agentə alət verərkən insan razılığının arxasında hansı hərəkətlər edilməlidir?
- A) Yoxdur; Agent hər bir hərəkəti avtonom şəkildə yerinə yetirə bilməlidir
- B) Məlumatların oxunması və axtarışı kimi yalnız geri qaytarıla bilən hərəkətlər
- C) Pul köçürmə, silmə, göndərmə kimi geri dönməz və ya yüksək təsirli hərəkətlər ✔
- D) Yalnız hesablamaları əhatə edən hərəkətlər
Təsvir: Fəaliyyətlər risk səviyyəsinə görə ayrılır. Qaralamaları oxumaq, axtarmaq, hesablamaq və yaratmaq kimi geri götürülə bilən tapşırıqlar avtonom şəkildə həyata keçirilə bilər; Bununla belə, pul köçürmə, e-poçt göndərmə, məlumatların silinməsi, sifarişlərin yerləşdirilməsi və s. kimi geri dönməz və ya yüksək təsirli hərəkətlər insanın razılığını tələb edir. Hər bir geri alınmaz hərəkət razılığa tabe olmalıdır.
9. Dolayı təcili inyeksiya riskinə qarşı ən yaxşı dizayn yanaşması hansıdır?
- A) Sistem sorğusuna 'pis göstərişlərə məhəl qoyma' bir cümlə əlavə etmək kifayətdir
- B) Xarici məzmunda olan təlimatlara əsaslanaraq modelə daha çox səlahiyyət vermək
- C) İnyeksiyanın qarşısı alınmaz olduğundan heç bir tədbir görməmək
- D) Xarici məzmunu etibarsız məlumat kimi təcrid etmək və minimal icazə, təsdiq və çıxış nəzarəti ilə laylı müdafiənin qurulması ✔
Təsvir: Veb səhifə, sənəd, e-poçt və s. kimi agent və ya RAG tərəfindən işlənmiş xarici məzmun etibarsız məlumatlardır və məxfi təlimatları ehtiva edə bilər. Düzgün yanaşma laylı müdafiədir: xarici məzmunu aydın məhdudlaşdırıcılarla “əmrlər deyil, verilənlər” kimi təcrid etmək, minimal icazənin tətbiqi, geri dönməz hərəkətləri insanların təsdiqinə bağlamaq və nəticənin auditi. Tək bir təlimat xətti kifayət deyil.
10. Problemin incə tənzimləmə və ya RAG ilə həll edilməsinə qərar verərkən əsas fərq nədir?
- A) İnformasiya problemləri RAG ilə daha yaxşı həll edilir, davranış/format problemləri incə tənzimləmə ilə daha yaxşı həll edilir ✔
- B) Hər bir problem həmişə incə tənzimləmə ilə həll edilməlidir
- C) RAG yalnız kodun yaradılması üçün istifadə olunur, dəqiq tənzimləmə yalnız tərcümə üçün istifadə olunur
- D) Fine-tuning həmişə RAG-dan daha ucuz və daha sürətli yenilənə bilər
İzahat: İncə tənzimləmə modelə yeni məlumatları öyrətməkdə zəif və risklidir; lakin davranış, format, ton və üslub öyrətməkdə güclüdür. "Model şirkət məlumatlarımızı bilmir" informasiya problemidir və RAG-a məxsusdur. "Model həmişə bizim ciddi formatımızda çıxsın" davranış problemi və dəqiq tənzimləmə üçün namizəddir. Əlavə olaraq, dəqiq tənzimləmədən əvvəl tez və bir neçə çəkiliş istehlak edilməlidir.
11. Yeni modeli istehsala qoyarkən təhlükəsiz yerləşdirmə üçün hansı məcburidir?
- A) Model sınaqda yaxşıdırsa, onu birbaşa 100% trafikə açın
- B) Yerləşdirmədən sonra monitorinqi ümumiyyətlə qurmamaq
- C) Mərhələli yerləşdirmə (kölgə/kanariya) və əvvəlcədən sınaqdan keçirilmiş geri çəkilmə planı ✔
- D) Qiymətləndirmə həddi yerinə yetirilməsə belə modelin nəşri
İzahat: Yeni modeli birbaşa bütün trafikə açmaq risklidir; Səhvdirsə, hər kəs təsirlənir. Düzgün olan odur ki, bu, tədricən paylamadır (kölgə, kanareyka) və hər paylamanın sınaqdan keçmiş geri qaytarma planı var. Dağıtım geri çəkilmə planı olmadan tamamlanmır; Bir neçə dəqiqə ərzində əvvəlki versiyaya qayıda bilmək, model istehsalda gözlənilmədən davrandıqda istifadəçini qoruyur.
12. ML modeli istehsalda necə "səssiz" uğursuz ola bilər və bunu tutmağın yolu nədir?
- A) Model çökür; server qeydləri bunu göstərir
- B) Səhv etmədən yanlış proqnozlar verməklə; ✔ Əməliyyat, giriş və çıxış laylı monitorinqini çəkir
- C) Model heç vaxt səssizcə uğursuz ola bilməz, həmişə həyəcanlandırır
- D) Hər hansı deqradasiyanı tutmaq üçün sadəcə gecikmə müddətini izləmək kifayətdir
İzahat: Model qəzaya uğramadan və ya səhvlər vermədən səhv proqnozlar verməklə uğursuz ola bilər; Bunun əsas səbəbi data drift və konsepsiyanın sürüşməsidir. Yalnız əməliyyat göstəricilərinə (gecikmə, səhv dərəcəsi) nəzarət etmək kifayət deyil; giriş paylanması və çıxış/proqnoz bölgüsü də monitorinq edilməlidir. Daxiletmə sürüşməsi faktiki nəticə gecikdikdə erkən xəbərdarlıq verir.
13. LLM sistemini qiymətləndirmək üçün hakim kimi LLM-dən istifadə edərkən hansı prinsip vacibdir?
- A) LLM-hakim həmişə düzgündür, insan yoxlaması lazım deyil
- B) Hakim yalnız cavab uzunluğuna əsasən qərar verməlidir.
- C) Hakimlərdən istifadə edildikdə qaydalara əsaslanan nəzarət və insan qiymətləndirməsi tamamilə ləğv edilməlidir
- D) Hakimin xalları insan etiketli nümunə ilə kalibrlənməlidir və etibar edilməzdən əvvəl onların qərəzi ölçülməlidir ✔
Təsvir: LLM-hakim həm də modeldir; Bu hallüsinasiyalı, qərəzli (uzun, inamlı cavablara üstünlük verən) və uyğunsuz ola bilər. Buna görə də, hakim xalları insan etiketli nümunə ilə kalibrlənməlidir və istehsal qərarı verilməzdən əvvəl onların sistematik meylləri ölçülməlidir. Təsdiqlənməmiş hakim yalançı güvən verir.
14. Modelin qərəzliliyini qiymətləndirərkən ümumi dəqiqliyə baxmaq niyə qeyri-adekvatdır?
- A) Ümumi dəqiqlik kifayətdir, çünki həmişə ən pis qrupun fəaliyyətini əks etdirir
- B) Təkcə ümumi dəqiqlik kifayət deyil, çünki o, alt qruplar arasında sistematik fərqi (gizli ayrı-seçkiliyi) gizlədə bilər ✔
- C) Çünki dəqiqlik qərəzlə heç bir əlaqəsi olmayan bir metrikdir
- D) Qərəz yalnız modeldən gəlir və verilənlərlə heç bir əlaqəsi yoxdur.
İzahat: Ümumi dəqiqlik alt qruplar arasında sistematik fərqləri gizlədə bilər. Məsələn, ümumi dəqiqlik 88% olduğu halda, geri çağırma bir qrupda 91%, digər qrupda isə 67% ola bilər; Model sistematik olaraq həmin qrupdan qaçır. Buna görə də, model alt qruplar (demoqrafiya/seqment) əsasında qiymətləndirilməli və ədalətin hansı tərifinə üstünlük veriləcəyi maraqlı tərəflərlə birlikdə həll edilməlidir.
15. ML nəticəsinin təkrar oluna bilməsi üçün hansı dörd şey birlikdə sabitlənməlidir?
- A) Yalnız modelin adı, ölçüsü, qiyməti və buraxılış tarixi
- B) Yalnız GPU markası və internet sürəti
- C) Modelin yalnız yekun dəqiqlik balı; qalanını yaddaşda saxlamaq olar
- D) Təsadüfilik toxumu, məlumat versiyası, mühit (asılılıq versiyaları) və təcrübə izləmə ✔
Təsvir: Təkrarlanma dörd sütun vasitəsilə əldə edilir: təsadüfi toxumların fiksasiyası, verilənlərin versiyaya salınması (versiya/hesh), ətraf mühitin dondurulması (dəqiq kitabxana versiyaları/konteyner) və hər bir təcrübənin izlənməsi (kod öhdəliyi, məlumat, hiperparametr, metrik). Bu zəncir olmadan eyni nəticəni təkrarlamaq mümkün deyil; Təkrarlana bilməyən nəticə sübut edilə bilməyən bir iddiadır.