Mga nadagdag:
- Kakayahang tiyakin ang reproducibility na may apat na pillars (seed fixation, data versioning, media freezing, experiment monitoring) at makagawa ng parehong resulta kapag inuulit ang parehong run
- Kakayahang pagsamahin ang lahat ng paghinto ng module (mga sukatan, data, modelo, mga bahagi ng LLM, eval, patas, seguridad, pamamahagi, pagsubaybay) sa isang end-to-end na chain
- Kakayahang i-verify na ang kritikal na desisyon ay nananatili sa tao sa bawat paghinto at idokumento ang proyekto sa isang auditable na paraan
Ang pinaka mapanlinlang na kabiguan ng isang proyekto ng ML ay hindi isang pag-crash; "Hindi na nakakakuha ng parehong resulta muli." Kung hindi mo ma-reproduce ang score ngayon ng modelong inilagay mo sa produksyon tatlong buwan na ang nakakaraan, hindi mo talaga makokontrol ang modelong iyon. Sa pagsasara ng unit na ito, pinalalalim namin ang reproducibility: ang kakayahang mapagkakatiwalaang makuha ang parehong resulta sa parehong mga input at pagsamahin ang buong module sa isang end-to-end na disiplina sa proyekto.
Bakit mahirap ang reproducibility
Sa ordinaryong software, ang parehong code ay nagbibigay ng parehong output. Sa ML marami pang mga variable na tumutukoy sa kinalabasan:
- Randomness: Data shuffling, weight initialization, data splitting — lahat ay umaasa sa randomness.
- Data: Ang parehong code ay gumagawa ng iba't ibang modelo na may iba't ibang bersyon ng data.
- Environment: Ang mga bersyon ng library, hardware (CPU/GPU), kahit na ang operating system ay maaaring magbago ng resulta.
- Nakatagong kaso: Isang hindi na-save na hyperparameter, isang manu-manong hakbang sa paunang pagproseso, isang hindi nabanggit na pagpili.
Ang reproducibility ay hindi isang "masarap na magkaroon" ngunit isang pang-agham at engineering na kinakailangan. Ang isang resulta na hindi maaaring kopyahin ay isang paghahabol na hindi mapapatunayan.
Apat na haligi ng reproducibility
1. Ayusin ang randomness. Itakda ang lahat ng random na buto sa isang lugar: paghahati ng data, pagsisimula ng modelo, pag-shuffling ng data. Ang nakapirming buto ay ang batayan ng "parehong resulta kapag inulit mo ang parehong pagtakbo" na garantiya.
2. Bersyon ng data. Itala kung aling bersyon ng data ang ginawa ng bawat eksperimento (pag-bersyon ng data sa unit 2). Ang "pinakabagong data" ay malabo; Ang "bersyon ng data v3, hash abc123" ay eksakto.
3. I-freeze ang medium. I-pin ang lahat ng dependency sa kanilang eksaktong mga bersyon (hal. mga eksaktong bersyon tulad ng numpy==1.26.4 sa requirements.txt, o isang imahe ng container). Masisira ng "pinakabagong bersyon" ang lahat balang araw.
4. Subaybayan ang lahat (pagsubaybay sa eksperimento). Awtomatikong i-save para sa bawat eksperimento: bersyon ng code (git commit), bersyon ng data, lahat ng hyperparameter, sukatan at istruktura ng output. Ang mga tool sa pagsubaybay sa eksperimento tulad ng MLflow, Weights & Biases ay sistematikong ginagawa ito. Kung walang pagpaparehistro, ang tanong na "aling setting ang pinakamahusay" ay nananatiling hindi nasasagot.
Babala: "Tatandaan ko mamaya" ang pinakamahal na kamalian. Pagkalipas ng dalawang linggo, hindi mo na maaalala kung aling binhi, aling data, aling hyperparameter ang ginamit mo. Ang awtomatikong pagsubaybay ay nag-aalis ng pag-asa sa memorya.
Mahinang diskarte / Malakas na diskarte
Mahina: "Nakahanap ako ng pinakamagandang modelo, nasa notebook ito, sa tingin ko ay 89% ang score nito."
Malakas: "Patakbuhin ang #147 sa tool sa pagsubaybay sa eksperimento: git commit a3f9c, bersyon ng data v3 (hash abc123), seed 42, lahat ng hyperparameter na nakarehistro, subukan ang PR-AUC 0.887. Kapag pinatakbo ko muli ang parehong command, nakuha ko ang parehong resulta nang paunti-unti. Depende ang modelo sa pagtakbo na ito sa registry."
Ang pagkakaiba: sa malakas na diskarte ang resulta ay hindi batay sa isang memorya, ngunit sa isang nakapirming at sinusubaybayan na kadena. Ang bawat tao'y maaaring gumawa ng parehong resulta sa bawat oras.
End-to-end na proyekto: kumbinasyon ng module
Ngayon, pagsamahin natin ang buong module sa isang solong daloy ng proyekto. Ang isang tunay na sistema ng ML ay dumaan sa mga paghintong ito, at ang bawat paghinto ay bubuo sa nauna:
- Depinisyon ng problema: Ano ang aming nilulutas, kung paano sukatin ang tagumpay (unit 3: tamang sukatan, konteksto ng negosyo). Ang sukatan at threshold ay malinaw sa simula.
- Pipeline ng data: Pagkolekta, pagpapatunay, paglilinis, paghati-hati na walang leak, pag-bersyon (unit 2).
- Pagbuo ng modelo: Pagsasanay, paghahambing ng baseline, cross-validation, hard seed (unit 3 + unit na ito).
- Mga bahagi ng LLM (kung naaangkop): RAG (unit 4) at/o mga ahente (unit 5); fine-tuning kung kinakailangan (unit 6).
- Pagsusuri: eval cluster na may gilid at mga kaso ng seguridad, multi-layer eval sa mga LLM system (unit 8).
- Pag-audit ng hustisya at etika: Pagsusuri ng subgroup, card ng modelo, kakayahang maipaliwanag (unit 10).
- Pag-audit sa seguridad: Maagap na iniksyon, privacy, supply chain (unit 9).
- Pamamahagi: Packaging, unti-unting pamamahagi, rollback, pagpapatala ng modelo (unit 7).
- Pagsubaybay: Tatlong layer na pagsubaybay, mga drift alarm (unit 8).
- Reproducibility: Seed, bersyon ng data, media at pagsubaybay sa eksperimento sa buong chain (unit na ito).
Sa daloy na ito, ang AI ay isang accelerator at blueprint generator sa bawat paghinto; ngunit ang pagpili ng sukatan, mga desisyon sa data, pagiging patas na priyoridad, deployment threshold, at pag-apruba sa release — ang mga kritikal na desisyon ay nananatili sa tao. Ito ang kakanyahan ng modyul.
Dokumentasyon: salamat sa hinaharap
Ang isang magandang proyekto ng ML ay nagdodokumento mismo. Sa pinakamababa, ang mga sumusunod ay dapat na nakasulat: pamantayan ng problema at tagumpay, pinagmumulan ng data at bersyon, mga pagpili at katwiran ng modelo, mga resulta ng pagsusuri (kabilang ang mga subgroup), alam na mga limitasyon at panganib, pamamaraan sa pag-deploy at pagkuha, plano sa pagsubaybay. Ang dokumentong ito ay ang matalik na kaibigan ng tao (marahil ikaw ito) na bumalik sa proyekto pagkatapos ng anim na buwan.
tatlong mini case
Case 1 - Nawalang resulta. Isang engineer ang nagsanay ng isang mahusay na modelo, ngunit hindi niya inayos ang binhi at hindi na-save ang bersyon ng data. Nang umalis siya sa trabaho, walang sinuman ang maaaring magparami ng resultang iyon; ang modelo ay naging isang "alamat ng itim na kahon" at kalaunan ay itinayo mula sa simula. Nasayang ang mga linggo. Aralin: ang isang di-reproducible na resulta ay isang hindi umiiral na resulta.
Kaso 2 - Pagbagsak ng kapaligiran. Ang isang koponan ay hindi naayos ang mga dependency. Kapag ang isang library ay awtomatikong na-update, ang mga output ng modelo ay tahimik na nagbago at ang produksyon ay nagambala. Kinailangan ng mga araw upang mahanap ang problema. Kapag ang mga dependency ay na-freeze at nakalagay sa mga tiyak na bersyon, ang problema ay hindi na naulit. Aralin: palamigin ang kapaligiran.
Kaso 3 - Ang kapangyarihan ng pagsubaybay. Awtomatikong sinusubaybayan ng isang koponan ang bawat eksperimento. Pagkalipas ng tatlong buwan, sa panahon ng isang regulatory audit, sinagot nila ang tanong na "sa anong data, sa anong mga setting, anong performance ang nakuha nito sa aling mga grupo?" na may buong recording sa loob ng ilang minuto. Naging maayos ang inspeksyon. Aralin: Ang pagsubaybay ay isang tool sa pagsunod, hindi lamang isang engineering.
Mga nakopyang template
Gumawa ng reproducibility check para sa proyektong ML na ito.- Naayos ba ang lahat ng randomness seeds (split, initialize, shuffle)?- Naka-bersyon ba ang data?- Naka-freeze ba ang mga dependency sa eksaktong mga bersyon?- Sinusubaybayan ba ang bawat eksperimento (code commit, data, hyperparameter, metric)? Sumulat ng mga kongkretong hakbang kung paano ito ayusin para sa bawat nawawalang column. Istraktura ng proyekto: [paglalarawan]
Gumawa ng plan skeleton para sa end-to-end na ML project na ito. Problema: [paglalarawan] Takpan ang mga sumusunod na stop at markahan kung saan ang desisyon ng TAO sa bawat stop: problema/metric, pipeline, modelo, (RAG/agent/fine-tune?), eval, fairness, security, distribution, monitoring, reproducibility. Isulat ang pangunahing hakbang sa panganib at pag-verify para sa bawat paghinto.
Gumawa ng template ng teknikal na dokumentasyon para sa proyektong ito. Mga Seksyon: pamantayan sa problema+tagumpay, data (pinagmulan+bersyon), mga pagpipilian sa modelo+katuwiran, pagsusuri (kabilang ang mga subgroup), kilalang limitasyon+mga panganib, deployment+rollback, plano sa pagsubaybay. Ibigay ang mga patlang na pupunan para sa bawat seksyon bilang mga tanong.
Suriin ang aking setup ng pagsubaybay sa eksperimento: Auto-save ba ito sa bawat pagtakbo: git commit, bersyon/hash ng data, lahat ng hyperparameter, lahat ng sukatan, kapaligiran (mga bersyon ng library)? Nakukuha ko ba ang parehong resulta kapag nagpatakbo ako muli ng parehong pagtakbo? Setup: [paglalarawan]. Ilista ang mga bahid at pagwawasto.
Talahanayan ng mga column ng reproducibility
hanay
Kung ano ang naayos
Halimbawa ng sasakyan
pagiging random
lahat ng buto
pagtatakda ng binhi
Data
Bersyon/hash ng data
DVC
kapaligiran
Mga bersyon ng library
kinakailangan pin, Docker
Pagsubaybay
Code+data+setting+metric
MLflow, W&B
Mga karaniwang pagkakamali
- Hindi pag-aayos ng binhi. Hindi na mauulit ang resulta.
- Hindi sine-save ang bersyon ng data. "Sa anong data?" nananatiling walang sagot.
- Hindi nagyeyelong pagkagumon. Ang isang pag-update ay tahimik na sisira sa lahat.
- Iniiwan ang mga eksperimento sa memorya. Pagkalipas ng dalawang linggo ay wala nang maalala.
- Iniiwan ang mga kritikal na desisyon sa artificial intelligence. Ang mga sukatan, hustisya, at mga desisyon sa pamamahagi ay dapat manatili sa mga tao.
- Pagpapaliban ng dokumentasyon. Ang hinaharap na koponan (at ikaw) ang magbabayad ng presyo.
Sa buod
Ang reproducibility ay ang pirma ng seryosong ML engineering: ang di-reproducible na resulta ay ang hindi mapapatunayang claim. May kasama itong apat na column — ayusin ang randomness, data ng bersyon, freeze environment, subaybayan ang bawat eksperimento. Pinagsasama-sama ng isang end-to-end na proyekto ang lahat ng hinto ng modyul na ito (sukatan, data, modelo, mga bahagi ng LLM, eval, patas, seguridad, pamamahagi, pagsubaybay) sa isang magkakaugnay na chain; Ang artificial intelligence ay isang accelerator sa bawat paghinto, ngunit ang mga kritikal na desisyon ay nananatili sa tao. Idokumento ang lahat — para sa hinaharap na koponan at mga pag-audit. Ang disiplinang ito ay ang balangkas na nagpapanatili sa lahat ng iyong natutunan sa buong modyul.
Gawain ng aplikasyon
Suriin ang isang proyekto ng ML laban sa apat na mga haligi ng reproducibility: ang mga buto ba ay hindi nababago, ang data ba ay bersyon, ang kapaligiran ba ay nagyelo, ang mga eksperimento ba ay sinusubaybayan? Ayusin ang anumang nawawalang mga column at patunayan na maaari mong patakbuhin ang parehong pagtakbo nang dalawang beses at makuha ang parehong resulta. Pagkatapos ay i-output ang end-to-end na daloy ng proyekto (10 stop) sa isang pahina at markahan ang "kung nasaan ang desisyon ng tao" sa bawat stop. Panghuli, magsulat ng maikling teknikal na draft ng dokumentasyon.
checklist
- [ ] Naayos ang lahat ng randomness seeds.
- [ ] Ang bersyon/hash ng data ay naitala sa bawat eksperimento.
- [ ] Ang mga dependency ay naka-freeze sa mga firm na bersyon (pin/container).
- [ ] Ang bawat eksperimento ay awtomatikong sinusubaybayan (code+data+setting+metric).
- [ ] Kapag inulit ko ang parehong pagtakbo, nakukuha ko ang parehong resulta.
- [ ] Na-verify at naidokumento ko na ang mga kritikal na desisyon sa dulo hanggang dulong daloy ay ginagawa ng mga tao.
Pagsusulit sa Module
1. Bilang isang ML engineer, ano ang pinakamahusay na diskarte kapag nagpoposisyon ng artificial intelligence sa workflow?
- A) Ang AI ay isang accelerator sa mga negosyong mababa ang panganib; Ang mga kritikal na desisyon tulad ng mga sukatan, data, at produksyon ay mananatiling valid at ipinaubaya sa tao ✔
- B) Hangga't maganda ang hitsura ng mga output ng AI, hindi na kailangan ng pag-verify
- C) Ang pag-iwan sa desisyon na ilagay ang modelo sa produksyon sa artificial intelligence ay nakakatipid ng oras.
- D) Ang artificial intelligence ay kapaki-pakinabang lamang para sa pagsulat ng teksto, wala itong kinalaman sa data at gawaing modelo
Paglalarawan: Ang AI ay isang makapangyarihang accelerator para sa mababang panganib, madaling ma-verify na mga gawain tulad ng code, data digest, at mga dokumento; Gayunpaman, ang responsibilidad para sa mga desisyon na nakakaapekto sa pera, pagiging kumpidensyal, at legal na pananagutan, tulad ng pagpili ng sukatan, kung aling data ang mapupunta sa pagsasanay, at paglalagay ng modelo sa produksyon, ay nakasalalay sa kwalipikadong engineer at team. Ang bawat output ay hindi dapat gamitin nang walang pag-verify.
2. Bakit inilalagay ang pagpapatunay ng schema sa simula ng pipeline ng data?
- A) Dahil direktang pinapataas nito ang katumpakan ng modelo
- B) Dahil ginagawa nitong hindi kailangan ang pag-bersyon ng data
- C) Dahil nakakakuha ito ng sirang data sa pinakamaaga at pinakamurang punto at pinipigilan itong tumulo sa mga susunod na hakbang ✔
- D) Dahil inaalis nito ang pangangailangan para sa pag-label
Paliwanag: Ang mas maagang corrupt na data ay nakuha, mas mura ito upang ayusin ito. Pinipigilan ng pagpapatunay ng schema ang tiwaling data mula sa tahimik na pagtagas sa pagsasanay o produksyon sa pamamagitan ng pagtanggi sa data sa labas ng inaasahang uri at hanay sa simula ng linya (hal. pagbabago ng presyo ng 100x na may pagbabago ng unit); Ang parehong error na nahuli sa produksyon ay maraming beses na mas mahal.
3. Ano ang tamang diskarte kapag hinahati ang data sa pagsasanay at pagsubok sa isang problemang kinasasangkutan ng oras (time series)?
- A) Paggamit ng random na paghahati dahil ito ang palaging pinakamakatarungang paraan
- B) Paggamit ng temporal splitting: maiwasan ang pagtagas sa pamamagitan ng pagsasanay sa nakaraan at pagsubok sa hinaharap ✔
- C) Paggamit ng lahat ng data bilang parehong pagsasanay at pagsubok
- D) Pagsasama ng data ng pagsubok sa mga parameter ng scaling bago ang pagsasanay
Paliwanag: Ang random na paghahati sa serye ng oras ay nagbibigay sa modelo ng isang 'nakikita sa hinaharap' na kalamangan na hindi kailanman mangyayari sa produksyon at artipisyal na nagpapalaki ng mga sukatan (temporal na pagtagas). Ang tama ay temporal division: sanayin ang nakaraan, pagsubok sa hinaharap. Sinusukat nito ang aktwal na pagganap na nagpapanatili nito sa produksyon.
4. Bakit nakakapanlinlang ang katumpakan sa isang modelo ng pagtuklas ng panloloko na may positibong rate ng klase na 1.5%?
- A) Dahil laging mababa ang Accuracy sa hindi balanseng data
- B) Dahil ang Accuracy ay magagamit lamang sa mga problema sa regression
- C) Dahil ang pagkalkula ng Katumpakan ay nangangailangan ng maraming kapangyarihan sa pagpoproseso
- D) Kahit na ang isang maliit na modelo na hinuhulaan ang karamihan sa klase ay maaaring maging napaka-tumpak, kaya nagtatago ng tunay na tagumpay ✔
Paliwanag: Sa hindi balanseng data, kahit na ang pangunahing modelo na nagsasabing 'tawagan ang lahat ng negatibo' ay nakakakuha ng humigit-kumulang 98.5% na katumpakan ngunit hindi makakahuli ng kahit isang panloloko. Samakatuwid, sa hindi balanseng pag-uuri, ang precision, recall, F1 o PR-AUC ay ginagamit sa halip na katumpakan, at ang bawat sukatan ay binibigyang-kahulugan ayon sa isang batayang modelo.
5. Bakit mahalaga ang paghahambing ng baseline kapag pinag-uusapan ang sukatan ng isang modelo?
- A) Dahil ang batayang modelo ay palaging mas mahusay kaysa sa tunay na modelo
- B) Dahil ito ay malinaw kung ang isang sukatan ay makabuluhan o hindi lamang kung ihahambing sa isang simpleng baseline na modelo ✔
- C) Dahil ginagawa ng batayang modelo na hindi kailangan ang cross-validation
- D) Dahil ang pangunahing modelo ay legal na kinakailangan sa bawat ulat
Paliwanag: Ang sukatan ay hindi mabuti o masama sa sarili; Ito ay mabuti o masama ayon sa isang pangunahing modelo. Ang pangungusap na '85% tama' ay nangangahulugang halos walang halaga kung ang batayang modelo ay nakakuha na ng 84%, at perpekto kung ito ay nakakuha ng 50%. Kung walang paghahambing na anchor, ang sukatan ay walang kahulugan.
6. Alin ang pinakamahalagang elemento ng seguridad na dapat isama sa production prompt ng RAG (Retrieval-Augmented Generation) system?
- A) Instruksyon na umasa lamang sa ibinigay na pinagmulan, sabihing 'Hindi ko alam' kung wala ang pinagmulan, at banggitin ang pinagmulan ✔
- B) Pagsasabi sa modelo na gumawa ng mahaba at malikhaing mga sagot hangga't maaari
- C) Ang modelo ay inuuna ang sarili nitong kaalaman sa edukasyon kaysa sa mga mapagkukunan
- D) Ipatupad ang lahat ng mga tagubilin sa mga dokumentong dinala bilang mga utos
Paliwanag: Ang nag-iisang pinakamahalagang tagubilin ng RAG ay sabihin sa modelo na umasa lamang sa ibinigay na pinagmulan, at kung ang impormasyon ay wala sa pinagmulan, sabihin ang 'Hindi ko alam' at banggitin ang pinagmulan nang hindi ito binubuo. Kung wala ang triad na ito, maaaring balewalain ng modelo ang konteksto at magdulot ng mga guni-guni, at ang sagot ay hindi mabe-verify.
7. Ang RAG system ay nagbibigay ng mga maling sagot. Saan ang pinakamagandang lugar upang simulan ang diagnosis?
- A) Pagsukat ng fetch muna (Recall@K): dumating ba ang tamang piraso? ✔
- B) Agad na palitan ang modelo ng mas malaki
- C) Baguhin ang prompt nang random at magpatuloy sa pagsubok
- D) I-embed ang lahat ng mga dokumento sa modelo na may fine-tuning
Paliwanag: Ang pinakamahinang link ng RAG ay karaniwang fetch, hindi production. Kung ang tamang bahagi ay hindi kailanman dinadala, ang modelo ay hindi makakagawa ng impormasyong iyon, gaano man kalaki ang pagpapabuti ng prompt. Samakatuwid, ang unang Recall@K ay sinusukat upang makita kung ang tamang bahagi ay dumating; Kung maganda ang pagkuha, susuriin ang produksyon at prompt.
8. Anong mga aksyon ang dapat ilagay sa likod ng pag-apruba ng tao kapag nagbibigay ng tool sa isang ahente?
- A) Wala; Ang ahente ay dapat na magawa ang bawat aksyon nang nakapag-iisa
- B) Tanging mga nababagong aksyon tulad ng pagbabasa at paghahanap ng data
- C) Mga hindi maibabalik o mataas na epekto gaya ng paglilipat ng pera, pagtanggal, pagpapadala ng ✔
- D) Mga aksyon na nagsasangkot lamang ng mga kalkulasyon
Paglalarawan: Ang mga aksyon ay pinaghihiwalay ayon sa antas ng panganib. Ang mga maaaring makuhang gawain tulad ng pagbabasa, paghahanap, pagkalkula, at pagbuo ng mga draft ay maaaring gawin nang nakapag-iisa; Gayunpaman, ang mga hindi maibabalik o may malaking epekto gaya ng paglilipat ng pera, pagpapadala ng mga email, pagtanggal ng data, pag-order, atbp. ay nangangailangan ng pag-apruba ng tao. Ang bawat hindi mababawi na aksyon ay dapat sumailalim sa pahintulot.
9. Ano ang pinakamahusay na diskarte sa disenyo laban sa panganib ng hindi direktang pag-iniksyon?
- A) Ito ay sapat na upang magdagdag ng isang pangungusap na 'huwag pansinin ang masamang tagubilin' sa prompt ng system
- B) Bigyan ng higit na awtoridad ang modelo sa pamamagitan ng pag-asa sa mga tagubilin sa panlabas na nilalaman
- C) Hindi gumagawa ng anumang pag-iingat dahil ang pag-iniksyon ay hindi maiiwasan
- D) Pagbubukod ng panlabas na nilalaman bilang hindi mapagkakatiwalaang data at pagtatatag ng mga layered na depensa na may kaunting awtorisasyon, pag-apruba, at kontrol sa output ✔
Paglalarawan: Ang panlabas na nilalaman na pinoproseso ng ahente o RAG, tulad ng isang web page, dokumento, email, atbp., ay hindi pinagkakatiwalaang data at maaaring naglalaman ng mga lihim na tagubilin. Ang tamang diskarte ay layered defense: pagbubukod ng panlabas na content bilang 'data, hindi mga command' na may malinaw na mga delimiter, paglalapat ng minimal na awtorisasyon, pagbibigkis ng mga hindi maibabalik na aksyon sa pag-apruba ng tao, at pag-audit sa output. Ang isang linya ng mga tagubilin ay hindi sapat.
10. Ano ang pangunahing pagkakaiba kapag nagpapasya kung ang isang problema ay dapat lutasin gamit ang fine-tuning o RAG?
- A) Ang mga problema sa impormasyon ay mas mahusay na nalutas sa RAG, ang mga problema sa pag-uugali/format ay mas mahusay na nalutas sa pamamagitan ng fine-tuning ✔
- B) Ang bawat problema ay dapat laging lutasin sa pamamagitan ng fine-tuning
- C) Ang RAG ay ginagamit lamang para sa pagbuo ng code, ang fine-tuning ay ginagamit lamang para sa pagsasalin
- D) Ang fine-tuning ay palaging maa-update nang mas mura at mas mabilis kaysa sa RAG
Paliwanag: Ang fine-tuning ay mahina at mapanganib sa pagtuturo ng modelo ng bagong impormasyon; ngunit makapangyarihan sa pagtuturo ng gawi, pormat, tono at istilo. 'Hindi alam ng modelong kumpanya ang aming data' ay isang problema sa impormasyon at kabilang sa RAG. Ang 'Hayaan ang modelo ay palaging lumabas sa aming mahigpit na format' ay isang problema sa pag-uugali at isang kandidato para sa fine-tuning. Karagdagan pa, ang maagap at kaunting mga kuha ay dapat gamitin bago mag-fine-tune.
11. Alin ang mandatory para sa ligtas na pag-deploy kapag naglalagay ng bagong modelo sa produksyon?
- A) Kung ang modelo ay mahusay sa pagsubok, buksan ito nang direkta sa 100% trapiko
- B) Hindi nagse-set up ng pagsubaybay sa lahat pagkatapos ng pag-deploy
- C) Phased deployment (shadow/canary) at isang paunang nasubok na rollback plan ✔
- D) Pag-publish ng modelo kahit na ang evaluation threshold ay hindi naabot
Paliwanag: Ang direktang pagbubukas ng bagong modelo sa lahat ng trapiko ay mapanganib; Kung mali, lahat apektado. Ang tamang bagay ay ito ay isang unti-unting pamamahagi (anino, canary) at bawat pamamahagi ay may nasubok na plano ng rollback. Ang pamamahagi ay hindi kumpleto nang walang clawback plan; Ang kakayahang bumalik sa nakaraang bersyon sa loob ng ilang minuto ay nagpoprotekta sa user kapag hindi inaasahang kumilos ang modelo sa produksyon.
12. Paano mabibigo ang isang modelo ng ML nang 'tahimik' sa produksyon at ano ang paraan para mahuli ito?
- A) Ang modelo ay bumagsak; ipinapakita ito ng mga log ng server
- B) Sa pamamagitan ng paggawa ng mga maling hula nang hindi nagkakamali; ✔ Kinukuha nito ang operational, input at output layered monitoring
- C) Ang modelo ay hindi maaaring mabigo nang tahimik, palaging alarma
- D) Ang pagsubaybay lamang sa latency ay sapat na upang mahuli ang anumang pagkasira
Paliwanag: Maaaring mabigo ang modelo sa pamamagitan lamang ng paggawa ng mga maling hula nang hindi nagkaka-crash o nagbibigay ng mga error; Ang pangunahing dahilan nito ay ang data drift at concept drift. Ang pagsubaybay lamang sa mga sukatan ng pagpapatakbo (latency, rate ng error) ay hindi sapat; pamamahagi ng input at pamamahagi ng output/hula ay dapat ding subaybayan. Ang input drift ay nagbibigay ng maagang babala kung ang aktwal na resulta ay naantala.
13. Anong prinsipyo ang mahalaga kapag gumagamit ng LLM-bilang-hukom upang suriin ang isang LLM system?
- A) Laging tama ang LLM-referee, hindi kailangan ang pagpapatunay ng tao
- B) Ang referee ay dapat gumawa ng desisyon batay lamang sa haba ng sagot.
- C) Ang mga kontrol na nakabatay sa mga panuntunan at pagsusuri ng tao ay dapat na ganap na itapon kapag ginamit ang mga referee
- D) Dapat i-calibrate ang mga score ng judge gamit ang sample na may label na tao at sinusukat ang bias nito bago sila mapagkakatiwalaan ✔
Paglalarawan: Ang LLM-referee ay isa ring modelo; Maaari itong maging guni-guni, may kinikilingan (pabor sa mahaba, may kumpiyansa na mga sagot), at hindi naaayon. Samakatuwid, ang mga marka ng referee ay dapat i-calibrate gamit ang isang sample na may label na tao at ang kanilang sistematikong bias ay dapat masukat bago gawin ang desisyon sa produksyon. Ang hindi na-verify na referee ay nagbibigay ng maling kumpiyansa.
14. Bakit hindi sapat ang pagtingin sa pangkalahatang katumpakan kapag tinatasa ang bias ng modelo?
- A) Ang kabuuang katumpakan ay sapat dahil ito ay palaging sumasalamin sa pagganap ng pinakamasamang grupo
- B) Ang kabuuang katumpakan lamang ay hindi sapat dahil maaari nitong malabo ang sistematikong pagkakaiba (nakatagong diskriminasyon) sa pagitan ng mga subgroup ✔
- C) Dahil ang katumpakan ay isang sukatan na walang kinalaman sa pagkiling
- D) Ang bias ay nagmumula lamang sa modelo at walang kinalaman sa data.
Paliwanag: Maaaring malabo ng pangkalahatang katumpakan ang mga sistematikong pagkakaiba sa pagitan ng mga subgroup. Halimbawa, habang ang kabuuang katumpakan ay 88%, ang recall ay maaaring 91% sa isang grupo at 67% sa ibang grupo; Ang modelo ay sistematikong nakakaligtaan ang pangkat na iyon. Samakatuwid, ang modelo ay dapat suriin batay sa mga subgroup (demograpiko/segment) at kung aling kahulugan ng hustisya ang dapat unahin ay dapat pagpasiyahan sa mga stakeholder.
15. Anong apat na bagay ang dapat ayusin nang magkasama para maging reproducible ang resulta ng ML?
- A) Tanging pangalan ng modelo, laki, presyo at petsa ng paglabas
- B) Tanging tatak ng GPU at bilis ng internet
- C) Tanging ang huling marka ng katumpakan ng modelo; ang natitira ay maaaring itago sa memorya
- D) Randomness seed, bersyon ng data, kapaligiran (mga bersyon ng dependency) at pagsubaybay sa eksperimento ✔
Paglalarawan: Ang muling paggawa ay nakakamit sa pamamagitan ng apat na pillars: pag-aayos ng randomness seed, pag-bersyon ng data (bersyon/hash), pagyeyelo sa kapaligiran (mga eksaktong bersyon/lalagyan ng library), at pagsubaybay sa bawat eksperimento (code commit, data, hyperparameter, metric). Kung wala ang kadena na ito ay hindi posible na magparami ng parehong resulta; Ang isang hindi maaaring kopyahin na resulta ay isang paghahabol na hindi mapapatunayan.