бирдиги 11 / 11

Reproducibility жана End-to-End долбоору: Баарын бириктирүү

Пайдалар:

  • Төрт мамы менен кайталанууну камсыз кылуу мүмкүнчүлүгү (уруктарды бекитүү, маалыматтарды версиялоо, медианы тоңдуруу, эксперименттин мониторинги) жана бир эле жүгүрүү кайталанганда ошол эле натыйжаны чыгаруу
  • Модулдун бардык аялдамаларын (метрикалар, маалыматтар, моделдер, LLM компоненттери, баалоо, адилеттүүлүк, коопсуздук, бөлүштүрүү, мониторинг) аягына чейин чынжырга бириктирүү мүмкүнчүлүгү
  • Критикалык чечим ар бир аялдамада адамда калаарын текшерүү жана долбоорду аудитордук түрдө документтештирүү мүмкүнчүлүгү

ML долбоорунун эң тымызын ийгиликсиздиги кыйроо эмес; "Дагы бир эле жыйынтык жок." Эгерде сиз үч ай мурун өндүрүшкө киргизген моделиңиздин упайын бүгүн кайра чыгара албасаңыз, анда сиз ал моделди чындап көзөмөлдөбөйсүз. Бул жабуу бөлүмүндө биз кайталануучулукту тереңдетебиз: бир эле киргизүү менен бир эле натыйжаны ишенимдүү алуу жана бүт модулду аягына чейин долбоордук дисциплинада айкалыштыруу мүмкүнчүлүгү.

Эмне үчүн кайра чыгаруу кыйын

Кадимки программалык камсыздоодо бир эле код бир эле жыйынтыкты берет. MLде натыйжаны аныктаган дагы көптөгөн өзгөрмөлөр бар:

  • Кокустук: Маалыматтарды аралаштыруу, салмакты инициализациялоо, маалыматтарды бөлүштүрүү — бардыгы кокустукка таянат.
  • Берилиштер: Бир эле код ар кандай маалымат версиясы менен башка моделди чыгарат.
  • Курчап турган чөйрө: Китепкана версиялары, аппараттык камсыздоо (CPU/GPU), жада калса операциялык система да натыйжаны өзгөртө алат.
  • Жашыруун жагдай: сакталбаган гиперпараметр, кол менен алдын ала иштетүү кадамы, белгиленбеген тандоо.

Репродуктивдүүлүк "бар болуу жакшы" эмес, илимий жана инженердик императив. Кайра чыгарууга мүмкүн болбогон натыйжа – бул далилденбеген доомат.

Репродуктивдүүлүктүн төрт түркүгү

1. Кокустукту оңдоо. Бардык кокус үрөндөрдү бир жерге коюңуз: маалыматтарды бөлүү, моделди баштоо, маалыматтарды аралаштыруу. Бекитилген үрөн "бир эле чуркоону кайталаганда ошол эле натыйжа" гарантиясынын негизи болуп саналат.

2. Маалыматтын версиясы. Ар бир эксперимент кайсы маалымат версиясы менен аткарылганын жазыңыз (2-бөлүктө берилиштерди версиялоо). "Акыркы маалыматтар" бүдөмүк; "Data version v3, hash abc123" так.

3. Ортону тоңдуруңуз. Бардык көз карандылыктарды алардын так версияларына кадап коюңуз (мис., талаптар.txt файлындагы numpy==1.26.4 сыяктуу так версиялар же контейнер сүрөтү). "Акыркы версия" бир күнү баарын бузат.

4. Баарына көз салыңыз (экспериментке көз салуу). Ар бир эксперимент үчүн автоматтык түрдө сактаңыз: код версиясы (git commit), маалымат версиясы, бардык гиперпараметрлер, метрика жана чыгаруу структуралары. MLflow, Weights & Biases сыяктуу эксперименттик көз салуу куралдары муну системалуу түрдө жасайт. Каттоосуз, "кайсы орнотуу жакшы болду" деген суроо жоопсуз калууда.

Абайлаңыз: "Кийинчерээк эстейм" - бул эң кымбат жаңылыштык. Эки жумадан кийин сиз кайсы үрөндү, кайсы маалыматты, кайсы гиперпараметрди колдонгонуңузду эстебей каласыз. Автоматтык көз салуу эстутумга көз карандылыкты жок кылат.

Алсыз мамиле / Күчтүү мамиле

Алсыз: "Мен эң жакшы моделди таптым, ал блокнотто, менимче анын баллы 89% болду".

Күчтүү: "Экспериментке көз салуу куралында №147 иштетиңиз: git commit a3f9c, маалымат версиясы v3 (hash abc123), үрөн 42, бардык гиперпараметрлер катталган, PR-AUC 0.887 сынаңыз. Мен ошол эле буйрукту кайра иштеткенде, мен аз-аздан ошол эле натыйжаны алам. Модель реестрдеги бул ишке көз каранды."

Айырмасы: күчтүү мамиледе натыйжа эстутумга эмес, туруктуу жана көзөмөлдөнгөн чынжырга негизделген. Ар бир адам ар дайым бирдей натыйжа бере алат.

Долбоордун аягына чейин: модулдун айкалышы

Эми бүт модулду бир долбоордун агымына бириктирели. Чыныгы ML системасы бул аялдамалар аркылуу өтөт жана ар бир аялдама мурункусуна негизделет:

  1. Көйгөйдүн аныктамасы: Биз эмнени чечип жатабыз, ийгиликти кантип өлчөө керек (3-бирдик: туура метрика, бизнес контекст). Метрика жана босого башынан эле айкын.
  2. Маалымат түтүгү: чогултуу, текшерүү, тазалоо, агып чыкпаган бөлүү, версиялоо (2-бирдик).
  3. Моделди иштеп чыгуу: Тренинг, базалык салыштыруу, кайчылаш текшерүү, катуу үрөн (3-бирдик + бул бирдик).
  4. LLM компоненттери (эгер бар болсо): RAG (4-бөлүк) жана/же агенттер (5-бөлүк); зарыл болсо, тактоо (6 блок).
  5. Баалоо: чет жана коопсуздук учурлары бар баалоо кластери, LLM системаларында көп катмарлуу баалоо (8-бирдик).
  6. Адилеттик жана этика аудити: Топтук талдоо, үлгү картасы, түшүндүрүү (10-бөлүк).
  7. Коопсуздук аудити: Ыкчам киргизүү, купуялуулук, камсыздоо чынжырчасы (9-бөлүк).
  8. Таркатуу: Таңгактоо, акырындык менен бөлүштүрүү, артка кайтаруу, моделдин реестри (7-бирдик).
  9. Мониторинг: Үч катмарлуу мониторинг, дрейф сигнализациясы (блок 8).
  10. Репродукция: Үрөн, маалымат версиясы, медиа жана бүт чынжыр боюнча экспериментке көз салуу (бул бирдик).

Бул агымда AI ар бир аялдамада акселератор жана план генератору болуп саналат; бирок метрикалык тандоо, маалымат чечимдери, адилеттүүлүк приоритети, жайылтуу босогосу жана релизди бекитүү - маанилүү чечимдер адамда калат. Бул модулдун маңызы.

Документация: келечек сага ыраазы болот

Жакшы ML долбоорунун өзү документтери. Жок дегенде төмөндөгүлөр жазылышы керек: көйгөй жана ийгилик критерийлери, маалымат булагы жана версиясы, моделди тандоо жана негиздемелер, баа берүүнүн натыйжалары (анын ичинде чакан топтор), белгилүү чектер жана тобокелдиктер, жайылтуу жана издөө процедурасы, мониторинг планы. Бул документ алты айдан кийин долбоорго кайтып келген адамдын (балким ал сиздир) эң жакын досу.

үч мини учурлар

1-жагдай - жоголгон натыйжа. Инженер сонун моделди үйрөткөн, бирок ал үрөндү оңдогон эмес жана маалымат версиясын сактаган эмес. Ал жумуштан кеткенде, эч ким бул жыйынтыкты кайталай алган эмес; модель "кара куту легендасына" айланып, акыры нөлдөн баштап курулган. Апталар текке кетти. Сабак: кайталангыс натыйжа - бул болбогон натыйжа.

2-жагдай – Айлана-чөйрөнүн кыйрашы. Бир команда көз карандылыкты оңдой элек. Китепкана автоматтык түрдө жаңыртылганда, моделдин натыйжалары үнсүз өзгөрүп, өндүрүш үзгүлтүккө учурады. Көйгөйдү табууга бир нече күн кетти. Көз карандылыктар тоңдурулуп, анык версиялары менен контейнерге салынганда, көйгөй кайра пайда болгон жок. Сабак: айлана-чөйрөнү муздатуу.

3-жагдай – Мониторингдин күчү. Команда ар бир экспериментти автоматтык түрдө көзөмөлдөп турду. Үч айдан кийин регулятивдик аудиттин жүрүшүндө алар “кайсы маалыматтар менен, кандай орнотуулар менен, кайсы топтордо кандай көрсөткүчтөргө ээ болду?” деген суроого жооп беришти. мүнөттүн ичинде толук жазуу менен. Текшерүү бир калыпта өттү. Сабак: Мониторинг жөн гана инженердик эмес, шайкештиктин инструменти.

Көчүрмө шаблондор

Бул ML долбоору үчүн кайталануу мүмкүнчүлүгүн текшериңиз.- Бардык кокустуктар белгиленгенби (бөлүү, инициализациялоо, аралаштыруу)?- Берилиштер версияланганбы?- Көз карандылыктар так версияларга чейин тоңдурулганбы?- Ар бир эксперимент (код тапшыруу, маалымат, гиперпараметр, метрика) көзөмөлдөнөбү? Ар бир жетишпеген тилке үчүн аны кантип оңдоо боюнча конкреттүү кадамдарды жазыңыз. Долбоордун структурасы: [сүрөттөө]

Бул аягына чейин ML долбоору үчүн пландын скелетин чыгарыңыз. Көйгөй: [сүрөттүрүү] Төмөнкү аялдамаларды жаап, ар бир аялдамада АДАМ чечими кайсы жерде экенин белгилеңиз: көйгөй/метрика, түтүк, модель, (RAG/агент/тактоо?), баалоо, калыстык, коопсуздук, бөлүштүрүү, мониторинг, кайталануу. Ар бир аялдамага негизги тобокелдикти жана текшерүү кадамын жазыңыз.

Бул долбоор үчүн техникалык документтердин үлгүсүн чыгаргыла. Бөлүмдөр: көйгөй+ийгилик критерийлери, маалыматтар (булак+версия), моделди тандоо+негиздөө, баалоо (анын ичинде чакан топтор), белгилүү чектер+тобокелдиктер, жайылтуу+кайра, мониторинг планы. Ар бир бөлүм үчүн толтурула турган талааларды суроо катары бериңиз.

Эксперименттин мониторингинин жөндөөлөрүн текшериңиз: Ал ар бир иштетилгенде автоматтык түрдө сакталабы: git commit, маалымат версиясы/хэш, бардык гиперпараметрлер, бардык метрика, айлана-чөйрө (китепкана версиялары)? Мен ошол эле чуркоону кайра иштетсем, ошол эле натыйжаны аламбы? Орнотуу: [сүрөттүрүү]. Кемчиликтерди тизмектеп, оңдоо.

Кайра жаралуу тилкелеринин таблицасы

тилке

Эмне бекитилди

Унаанын мисалы

кокустук

бардык уруктар

үрөн орнотуу

Маалыматтар

Маалымат версиясы/хэш

DVC

айлана-чөйрө

Китепкана версиялары

талаптар пин, Docker

Мониторинг

Код+берилиш+жөндөө+метрика

MLflow, W&B

Жалпы каталар

  • Үрөндү оңдобойт. Натыйжа кайталанышы мүмкүн эмес.
  • Маалымат версиясы сакталбай жатат. "Кандай маалыматтар менен?" жоопсуз калууда.
  • Катуу көз карандылык эмес. Жаңыртуу унчукпай баарын бузат.
  • Эксперименттерди эсине калтыруу. Эки жумадан кийин эч нерсе эсинде жок.
  • Критикалык чечимдерди жасалма интеллектке калтыруу. Метрика, адилеттүүлүк жана бөлүштүрүү чечимдери элде калышы керек.
  • Документтерди кийинкиге калтыруу. Келечектеги команда (жана сиз) бааны төлөйт.

Кыскача айтканда

Кайталануу - бул олуттуу ML инженериясынын кол тамгасы: кайталанбоочу натыйжа - бул далилденбеген доомат. Ал төрт мамыча менен келет — кокустуктарды, версия маалыматтарын оңдоо, чөйрөнү тоңдуруу, ар бир экспериментке көз салуу. Үчтөн аягына чейин долбоор бул модулдун бардык аялдамаларын (метрика, маалыматтар, модель, LLM компоненттери, баалоо, адилеттүүлүк, коопсуздук, бөлүштүрүү, мониторинг) бири-бири менен байланышкан чынжырда бириктирет; Жасалма интеллект ар бир аялдамада акселератор болуп саналат, бирок маанилүү чечимдер адамда калат. Келечектеги команда жана аудиттер үчүн бардыгын документтештириңиз. Бул дисциплина сиз бүтүндөй модулда үйрөнгөн нерселердин баарын колдогон негиз болуп саналат.

Колдонмо тапшырмасы

ML долбоорун төрт кайталануучу мамыга каршы текшериңиз: уруктар өзгөрбөсбү, маалыматтар версияланганбы, чөйрө тоңуп калганбы, эксперименттер көзөмөлдөнөбү? Жетишпеген тилкелерди оңдоп, бир эле чуркоону эки жолу иштетип, ошол эле натыйжаны ала аларыңызды далилдеңиз. Андан кийин долбоордун аягына чейин агымын (10 аялдама) бир бетке чыгарып, ар бир аялдамада "адамдын чечими кайда" деп белгилеңиз. Акыр-аягы, кыска техникалык документтердин долбоорун жаз.

текшерүү тизмеси

  • [ ] Бардык кокустук уруктар белгиленген.
  • [ ] Маалымат версиясы/хэш ар бир экспериментте жазылат.
  • [ ] Көз карандылыктар бекем версияларга (пин/контейнер) тоңдурулган.
  • [ ] Ар бир эксперимент автоматтык түрдө көзөмөлдөнөт (код+берилиш+жөндөө+метрика).
  • [ ] Мен бир эле чуркоону кайталаганда, ошол эле натыйжаны алам.
  • [ ] Мен акырына чейин агымдагы критикалык чечимдерди адамдар кабыл аларын тастыктадым жана документтештирдим.

Модуль экзамени

1. ML инженери катары, жумуш процессинде жасалма интеллектти жайгаштырууда эң жакшы ыкма кайсы?

  • A) AI тобокелдиги аз ишканаларда акселератор болуп саналат; Өлчөмдөр, маалыматтар жана өндүрүш сыяктуу критикалык чечимдер тастыкталган бойдон калат жана адамдын өзүнө калтырылат ✔
  • B) AI натыйжалары жакшы көрүнгөнчө, текшерүүнүн кереги жок
  • C) Моделди өндүрүшкө киргизүү чечимин жасалма интеллектке калтыруу убакытты үнөмдөйт.
  • D) Жасалма интеллект текст жазуу үчүн гана пайдалуу, анын маалыматтарга жана моделдик иштерге эч кандай тиешеси жок

Сүрөттөмө: AI – код, маалымат дайджесттери жана документтер сыяктуу кооптуу, оңой текшерилген тапшырмалар үчүн күчтүү акселератор; Бирок, акчага, купуялуулукка жана юридикалык жоопкерчиликке таасир этүүчү чечимдер үчүн, мисалы, метрикалык тандоо, кайсы маалыматтар тренингге кире турган жана моделди өндүрүшкө киргизүү үчүн жоопкерчилик квалификациялуу инженерге жана командага жүктөлөт. Ар бир чыгарылыш текшерүүсүз колдонулбашы керек.

2. Эмне үчүн схеманын валидациясы маалымат түтүгүнүн башына коюлган?

  • A) Анткени ал моделдин тактыгын түздөн-түз жогорулатат
  • B) Анткени ал маалыматтар версиясын керексиз кылат
  • C) Анткени ал бузулган маалыматтарды эң эрте жана эң арзан учурда кармап, кийинки кадамдарга агып кетүүсүнө жол бербейт ✔
  • D) Анткени ал маркалоонун зарылдыгын жок кылат

Түшүндүрмө: Коррупцияланган маалыматтар канчалык эрте кармалса, аны оңдоо ошончолук арзан болот. Схеманы текшерүү линиянын башында күтүлгөн типтен жана диапазондон тышкары маалыматтарды четке кагуу менен бузулган маалыматтардын окууга же өндүрүшкө унчукпай агып кетүүсүнө жол бербейт (мисалы, бирдиктин өзгөрүшү менен баанын 100x жылышы); өндүрүштө кармалган ошол эле ката бир нече эсе кымбат турат.

3. Убакыт (убакыт сериясы) менен байланышкан маселеде маалыматтарды окутууга жана тестирлөөгө бөлүүдө кандай мамиле туура болот?

  • A) Кокус бөлүүнү колдонуу, анткени ал ар дайым эң адилеттүү ыкма
  • B) Убактылуу бөлүнүүнү колдонуу: өткөн менен машыгуу жана келечекте тестирлөө аркылуу агып кетүүнүн алдын алыңыз ✔
  • C) Бардык маалыматтарды окутуу жана тест катары колдонуу
  • D) Тренингден мурун масштабдоо параметрлерине тест маалыматтарын киргизүү

Түшүндүрмө: Убакыт катарлары боюнча кокус бөлүнүү моделге өндүрүштө эч качан болбой турган "келечектеги" артыкчылыкты берет жана метрикаларды жасалма түрдө жогорулатат (убактылуу агып кетүү). Туурасы - убактылуу бөлүнүү: өткөн менен машыгуу, келечекте сыноо. Бул өндүрүштө аны кармап турган иш жүзүндөгү аткарууну өлчөйт.

4. Эмне үчүн 1,5% оң класстык чен менен алдамчылыкты аныктоо моделинде тактык адаштыруучу?

  • A) Анткени тактык дайыма тең салмактуу эмес маалыматтарда төмөн
  • B) Анткени тактык регрессия маселелеринде гана колдонулушу мүмкүн
  • C) Анткени тактык эсептөө көп иштетүү күчүн талап кылат
  • D) Көпчүлүк классты алдын ала айткан анча-мынча модель да абдан так болушу мүмкүн, ошентип чыныгы ийгиликти жашырат✔

Түшүндүрмө: Тең салмактуу эмес маалыматтар боюнча, «баарын терс деп атагыла» деген негизги модель да 98,5% тактыкка ээ болот, бирок бир дагы алдамчылыкты кармабайт. Демек, тең салмактуу эмес классификацияда тактыктын ордуна тактык, кайра чакырып алуу, F1 же PR-AUC колдонулат жана ар бир метрика базалык моделге ылайык чечмеленет.

5. Моделдин метрикасы жөнүндө сөз кылууда базалык салыштыруу эмне үчүн маанилүү?

  • A) Негизги модель чыныгы моделден ар дайым жакшы болгондуктан
  • B) Себеби, жөнөкөй базалык моделге салыштырганда метрика мааниге ээби же жокпу айкын болот ✔
  • C) Негизги модел кайчылаш валидацияны керексиз кылгандыктан
  • D) Анткени ар бир отчетто негизги модель мыйзамдуу түрдө талап кылынат

Түшүндүрмө: Метрика өзүнөн өзү жакшы же жаман эмес; Бул негизги моделге ылайык жакшы же жаман. '85% туура' сүйлөм, эгерде базалык модель 84% алса, дээрлик эч нерсеге арзыбайт, ал эми 50% алса, идеалдуу дегенди билдирет. Салыштыруу казыксыз метрика маанисиз.

6. RAG (Retrieval-Augmented Generation) системасынын өндүрүштүк билдирүүсүнө камтылууга тийиш болгон эң маанилүү коопсуздук элементи кайсы?

  • А) Берилген булакка гана таянууга, булак жок болсо “билбейм” деп айтууга жана булакка шилтеме жасоого көрсөтмө ✔
  • B) Моделге мүмкүн болушунча узун жана чыгармачылык жоопторду чыгарууну айтуу
  • C) Модель ресурстарга караганда өзүнүн билим берүү билимине артыкчылык берет
  • D) Буйрук катары келтирилген документтердеги бардык көрсөтмөлөрдү аткаруу

Түшүндүрмө: RAGнын эң маанилүү көрсөтмөсү – бул моделге берилген булакка гана таянууну айтуу, ал эми маалымат булакта жок болсо, “билбейм” деп айтуу жана аны түзбөстөн булакка шилтеме берүү. Бул үчилтиксиз модель контекстти этибарга албай, галлюцинацияларды жаратышы мүмкүн жана жооп текшерилгис болуп калат.

7. RAG системасы туура эмес жоопторду берет. Диагнозду баштоо үчүн эң жакшы жер кайда?

  • A) Биринчи алып келүүнү өлчөө (Recall@K): туура кесим качан келет? ✔
  • B) Дароо моделди чоңураак менен алмаштыруу
  • C) Ыкчам билдирүүнү туш келди өзгөртүп, аракетти улантыңыз
  • D) Бардык документтерди моделге тактоо менен киргизүү

Түшүндүрмө: RAGнын эң алсыз звеносу өндүрүш эмес, адатта алып келүү болуп саналат. Туура бөлүгү эч качан алынып келинбесе, тездик канчалык жакшыртылбасын, модель ал маалыматты чыгара албайт. Ошондуктан, адегенде Recall@K туура бөлүктүн келген-келбегенин өлчөйт; Эгерде алып келүү жакшы болсо, анда өндүрүш жана ыкчам текшерилет.

8. Инструментти агентке бергенде адам жактыруусунан кийин кандай аракеттерди жасоо керек?

  • А) Жок; Агент ар бир аракетти өз алдынча аткарууга жөндөмдүү болушу керек
  • B) Маалыматтарды окуу жана издөө сыяктуу кайра кайтарылуучу гана аракеттер
  • C) Акча которуу, өчүрүү, жөнөтүү сыяктуу кайтарылгыс же жогорку таасирдүү аракеттер ✔
  • D) Эсептөөлөрдү гана камтыган аракеттер

Сүрөттөмө: Иш-аракеттер тобокелдик деңгээли боюнча бөлүнөт. Окуу, издөө, эсептөө жана долбоорлорду түзүү сыяктуу алынуучу тапшырмалар өз алдынча аткарылышы мүмкүн; Бирок, акча которуу, электрондук каттарды жөнөтүү, маалыматтарды жок кылуу, буйрутмаларды берүү ж. Ар бир кайтарылгыс аракет макулдукка тийиш.

9. Кыйыр тез сайынуу коркунучуна каршы мыкты долбоорлоо ыкмасы кайсы?

  • A) Системанын сунушуна "жаман нускамаларды этибар кылбоо" деген бир сүйлөмдү кошуу жетиштүү
  • B) Тышкы мазмундагы көрсөтмөлөргө таянуу менен моделге көбүрөөк ыйгарым укуктарды берүү
  • В) Инъекцияны алдын алуу мүмкүн болбогондуктан эч кандай чара көрбөгөндүк
  • D) Тышкы мазмунду ишенимсиз маалымат катары обочолонтуу жана минималдуу авторизация, бекитүү жана чыгууну көзөмөлдөө менен катмарлуу коргонууларды түзүү ✔

Сүрөттөмө: Веб баракча, документ, электрондук почта ж.б. сыяктуу агент же RAG тарабынан иштетилген тышкы мазмун ишенимсиз маалымат жана жашыруун нускамаларды камтышы мүмкүн. Туура мамиле - катмарлуу коргонуу: тышкы мазмунду так бөлгүчтөр менен "буйруктар эмес, маалымат" катары обочолонтуу, минималдуу авторизацияны колдонуу, адамдардын жактыруусуна кайтарылгыс аракеттерди жүргүзүү жана жыйынтыкты текшерүү. Бир сап инструкция жетишсиз.

10. Маселени тактоо же RAG менен чечүү керекпи, чечүүдө негизги айырмачылык эмнеде?

  • A) Маалыматтык көйгөйлөр RAG менен жакшыраак чечилет, жүрүм-турум/формат көйгөйлөрү тактоо менен жакшыраак чечилет ✔
  • B) Ар бир маселе ар дайым тактоо менен чечилиши керек
  • C) RAG кодду түзүү үчүн гана колдонулат, тактоо котормо үчүн гана колдонулат
  • D) Fine-tuning ар дайым RAG караганда арзан жана тез жаңыртылышы мүмкүн

Түшүндүрмө: Моделди жаңы маалыматка үйрөтүүдө майда-чүйдөсүнө чейин жөндөө алсыз жана кооптуу; бирок жүрүм-турум, формат, тон жана стилди үйрөтүүдө күчтүү. "Модель компания биздин маалыматтарыбызды билбейт" - бул маалыматтык көйгөй жана RAGга таандык. "Модель ар дайым биздин катуу форматта чыксын" - бул жүрүм-турум көйгөйү жана тактоо үчүн талапкер. Кошумчалай кетсек, тактоодон мурун тез жана бир нече кадрлар керектелиши керек.

11. Жаңы моделди өндүрүшкө киргизүүдө коопсуз жайылтуу үчүн кайсынысы милдеттүү?

  • A) Эгерде модель тестирлөөдө жакшы болсо, аны түз 100% трафикке ачыңыз
  • B) Жайгаштыргандан кийин мониторингди такыр орнотпогон
  • C) Этап-этабы менен жайылтуу (көлөкө/канария) жана алдын ала сыналган артка кайтаруу планы ✔
  • D) Баалоо босогосу аткарылбаса да моделди жарыялоо

Түшүндүрмө: Жаңы моделди түз бардык трафикке ачуу кооптуу; Эгер туура эмес болсо, бардыгына таасир этет. Туура нерсе, ал акырындык менен бөлүштүрүлөт (көлөкө, канарея) жана ар бир бөлүштүрүүнүн сыналган артка кайтаруу планы бар. Тартуу планы жок толук болбойт; Мурунку версияга бир нече мүнөттүн ичинде кайтып келүү, модель өндүрүштө күтүлбөгөн жерден аракет кылганда колдонуучуну коргойт.

12. ML модели өндүрүштө кантип "унчукпай" иштебей калышы мүмкүн жана аны кармоонун кандай жолу бар?

  • A) Модель кыйрады; сервер журналдары муну көрсөтөт
  • Б) Ката кетирбестен туура эмес божомолдорду чыгаруу менен; ✔ Бул оперативдүү, киргизүү жана чыгаруу катмарлуу мониторингди камтыйт
  • C) Модель эч качан унчукпай иштен чыга албайт, дайыма коңгуроо кылат
  • D) Ар кандай деградацияны кармоо үчүн күтүү убактысын жөн гана көзөмөлдөө жетиштүү

Түшүндүрмө: Модель кыйроого учурабай же ката кетирбестен, туура эмес болжолдоолорду жасап, жөн эле иштебей калышы мүмкүн; Мунун негизги себеби - маалыматтардын дрейфи жана концепциянын дрейфи. Жөн гана мониторинг жүргүзүү оперативдүү метрика (кетүү, ката ылдамдыгы) жетишсиз; кириш бөлүштүрүү жана чыгаруу/болжолдоо бөлүштүрүү да мониторинг жүргүзүү керек. Киргизүү дрейфи, эгер иш жүзүндөгү натыйжа кечиктирилсе, эрте эскертүү берет.

13. LLM системасын баалоо үчүн сот катары LLMди колдонууда кандай принцип маанилүү?

  • A) LLM-калыс дайыма туура, адам текшерүүнүн кереги жок
  • B) Калыс жооптун узундугуна жараша гана чечим чыгарышы керек.
  • C) Калыстар колдонулганда эрежелерге негизделген башкаруулар жана адамдык баалоо толугу менен жокко чыгарылышы керек
  • D) Судьялардын упайлары адам тарабынан белгиленген үлгү менен калибрлениши керек жана ишенимге ээ боло электе алардын бир жактуулугу өлчөнөт ✔

Сүрөттөмө: LLM-калыс да модель болуп саналат; Бул галлюцинатордук, бир жактуу (узун, ишенимдүү жоопторду жактырган) жана ыраатсыз болушу мүмкүн. Ошондуктан, калыстардын упайлары адам тарабынан белгиленген үлгү менен калибрленген болушу керек жана өндүрүш чечими кабыл алынганга чейин алардын системалуу тенденциясы өлчөнөт. Текшерилбеген калыс жалган ишеним берет.

14. Эмне үчүн моделдин бир жактуулугун баалоодо жалпы тактыкты кароо жетишсиз?

  • A) Жалпы тактык жетиштүү, анткени ал дайыма эң начар топтун көрсөткүчтөрүн чагылдырат
  • B) Жалгыз жалпы тактык жетишсиз, анткени ал подгруппалардын ортосундагы системалуу айырманы (жашыруун басмырлоону) жаап салышы мүмкүн ✔
  • C) Анткени тактык - бул бир тараптуулукка эч кандай тиешеси жок метрика
  • D) Бийлик моделден гана келип чыгат жана маалыматтарга эч кандай тиешеси жок.

Түшүндүрмө: Жалпы тактык подгруппалардын ортосундагы системалык айырмачылыктарды жашырышы мүмкүн. Мисалы, жалпы тактык 88% болсо, кайра чакырып алуу бир топто 91% жана башка топто 67% болушу мүмкүн; Модель системалуу түрдө ошол топту өткөрүп жиберет. Ошондуктан, моделди подгруппалардын (демография/сегмент) негизинде баалоо жана адилеттүүлүктүн кайсы аныктамасына артыкчылык берүү керектиги кызыкдар тараптар менен бирге чечилиши керек.

15. ML натыйжасы кайталанууга жарамдуу болушу үчүн кайсы төрт нерсени бириктирүү керек?

  • A) Бир гана моделдин аталышы, өлчөмү, баасы жана чыгарылган күнү
  • B) GPU бренди жана интернет ылдамдыгы гана
  • C) Моделдин тактыктын акыркы баллы гана; калганын эсинде сактаса болот
  • D) Кокустуктун үрөнү, маалымат версиясы, чөйрө (көз карандылык версиялары) жана экспериментке көз салуу ✔

Сүрөттөмө: Кайра жаралуу төрт мамычанын жардамы менен ишке ашат: кокустуктун үрөндөрүн бекитүү, маалыматтарды версиялоо (версия/хэш), чөйрөнү тоңдуруу (так китепкананын версиялары/контейнер) жана ар бир экспериментке көз салуу (код тапшыруу, маалымат, гиперпараметр, метрика). Бул чынжырсыз бир эле натыйжаны кайра чыгаруу мүмкүн эмес; Кайталанбас натыйжа - бул далилденбеген доомат.