Бирдиктер
1. Маалымат илиминде жана аналитикада жасалма интеллектке киришүү: иш процесси, ролдор, чек аралар, текшерүү жана этика 2. Маалыматтарды чогултуу жана булакты түшүнүү: схема, үлгүлөрдү алуу, сапат жана агып чыгууну билүү 3. Маалыматтарды тазалоо жана алдын ала кайра иштетүү: Жок маани, чектен чыгуу жана түрдү конверсиялоо 4. Изилдөөчү маалыматтарды талдоо (EDA): бөлүштүрүү, мамилелер жана баштапкы түшүнүктөр 5. Функция инженериясы: Варианттарды түзүү, коддоо, масштабдоо жана агып кетүүдөн сактануу 6. Моделди түзүү: Маселени аныктоо, алгоритмди тандоо жана окутуу/Тестти бөлүү 7. Моделди баалоо: метрика, кайчылаш текшерүү жана экстремалдуу үйрөнүү 8. Визуализация жана баяндоо: так графика, чынчыл графика 9. Кодду түзүү: Python (пандалар) жана SQL менен AI жардамы менен талдоо 10. Маалыматтын агып кетиши жана кайра жаралуу: Тынч кырсыктар жана тартип 11. MLOps Foundation, этика, купуялык жана жооптуу аналитика
бирдиги 5 / 11

Функция инженериясы: Варианттарды түзүү, коддоо, масштабдоо жана агып кетүүдөн сактануу

Пайдалар:

  • Домен билими менен маанилүү туунду өзгөчөлүктөрдү өндүрүү жана категориялык категорияларды тиешелүү методдор менен коддоо мүмкүнчүлүгү (бир ысык, белги, максаттуу)
  • Сандык өзгөрмөлөрдү моделдин түрүнө жараша масштабдоо мүмкүнчүлүгү (стандартташтыруу, нормалдаштыруу) жана керексиз же толук эмес масштабдан качуу
  • Тренингден/сыноодон кийин жана тренингден кийин гана бардык трансформацияларды үйрөнүү менен функциялардын агып кетишин болтурбоо мүмкүнчүлүгү

Машина үйрөнүүдө эски сөз бар: "Колдонмо машиналарды үйрөнүү - бул, негизинен, инженерия." Анткени моделдин ийгилиги көбүнчө кайсы алгоритмди тандаганыңыздан эмес, моделге кандай салымдарды бергениңизден келип чыгат. Функция инженериясы - бул модель үйрөнө турган чийки маалыматтардан маанилүү сигналдарды өндүрүү искусствосу. Жасалма интеллект бул этапта идеялардын бай булагы болуп саналат: "бул маалыматтардан кандай өзгөчөлүктөр жаралышы мүмкүн" деп сурасаңыз, анда ондогон сунуштар тизмеленген. Бирок бул сунуштардын айрымдары баалуу болушу мүмкүн, кээ бирлери пайдасыз, кээ бирлери коркунучтуу болушу мүмкүн (акан). Аны жөнгө салуу сиздин милдетиңиз.

Эмне үчүн өзгөчөлүк инженерия

Чийки маалыматтар моделге эң жакшы формада сейрек келет. "Туулган датасы" тилкеси эле маанисиз болгону менен, андан түзүлгөн "курагы" мааниси күчтүү белги. "Буйрутма убакыт белгисинен" "апта күнү", "күн/түн", "бул майрамбы" сыяктуу атрибуттарды чыгара аласыз. Сиз катышты ("карыз/киреше катышы") чыгаруу үчүн эки тилкени бириктире аласыз. Бул жерде, өзгөчөлүктөр инженериясы математикалык сигналга домен билимин которуп жатат; Дал ушундан улам бул этап адамдык акыл-эсти талап кылат.

Категориялык өзгөрмөлөрдү сандарга айландыруу: коддоо

Моделдер көбүнчө текст менен эмес, сандар менен иштешет. Категориялык өзгөрмөлөрдү (мисалы, шаар, түс, продукт түрү) сандарга айландыруу коддоо деп аталат. Үч жалпы ыкмалары:

Бир ысык коддоо: Ар бир категория үчүн 0/1 мааниси менен өзүнчө тилкени ачат. "Шаар" үчүн Стамбул, Анкара, Измир колонналары түзүлөт; Эгерде кардар Стамбулдан болсо, ошол тилке гана 1 болот. Категориялардын саны аз болгондо идеалдуу; Эгерде категориялар өтө көп болсо, ал жүздөгөн мамычаларды чыгарат (бул "өлчөмдүн жарылуусу" деп аталат).

Энбелгилерди коддоо: Ар бир категорияга сан берет (Стамбул=0, Анкара=1). Бул жөнөкөй, бирок кокусунан моделге ырааттуулукту үйрөтүшү мүмкүн (Анкара > Стамбул сыяктуу); ошондуктан ал иретсиз категорияларда этияттык менен колдонулат.

Максаттуу коддоо: Ар бир категорияны ошол категориядагы максаттуу өзгөрмөнүн орточо мааниси менен алмаштырат. Бул абдан күчтүү, бирок агып кетүүнүн эң коркунучтуу булагы: эгерде сиз тесттик маалыматтардын максатын эске алсаңыз, модель келечекти көрөт. Аны окутуу маалыматтарынан гана эсептөө керек жана кылдаттык менен (кайчылаш текшерүүнүн алкагында).

Масштабдоо: чоң сандар моделди каптабайт

Кээ бир моделдер (дистанттык моделдер, сызыктуу моделдер, нейрон тармактары) өзгөрмөлөрдүн масштабына сезгич келет. Эгерде "киреше" (0-500 000) жана "жашы" (0-100) бирдей схемага туш келсе, киреше чоңураак болгондуктан, үстөмдүк кылышы мүмкүн. Масштабтоо муну оңдойт. Эки кеңири таралган ыкма: стандартташтыруу (ар бир маанини "ортодон канча стандарттык четтөөлөргө" айлантат) жана нормалдаштыруу (min-max нормалдаштыруу - маанилерди 0-1 диапазонуна кысуу). Дарактарга негизделген моделдер (чечим дарактары, кокус токой) масштабды сезбейт, алар масштабды талап кылбайт.

Эскертүү: Масштабдоо жана коддоо параметрлери (орточо, стандарттык четтөө, категория-орто карта түзүү) окутуу маалыматтарынан гана эсептелиши керек, андан кийин тесттин маалыматтарына да ошондой эле колдонулушу керек. Анын ичинде сыноо маалыматтары агып кетет жана моделиңиз чындыгында караганда жакшыраак көрүнөт.

Өзгөчөлүк инженериясындагы агып кетүүнүн жүрөгү

Функцияларды генерациялоо – бул маалыматтар агып кетүү көбүнчө пайда болгон жерде. Эки типтүү ката: Убакыттын агып кетиши — келечектеги маалыматты камтыган функцияны чыгаруу (анын ичинде “акыркы 30 күндүк орточо көрсөткүчтү” эсептөөдө болжолдонгон күндөн кийинки күндөр). Статистиканын агып чыгышы — окутуу/сыноо бөлүүсүнө чейинки бардык маалыматтардан өзгөчөлүктү (масштабдык орточо, максаттуу коддоо мааниси) эсептөө. Эреже: поезд/сыноо сплит кылгандан кийин ар бир трансформацияны биринчи жана машыгуу маалыматтарынан үйрөнүңүз. Муну үзгүлтүксүз жасоонун эң коопсуз жолу - түтүктү колдонуу — бардык трансформацияларды бир чынжырга чогултуучу жана аларды бөлгөндөн кийин колдонуучу түзүлүш.

Метод

эмне үчүн

агып кетүү коркунучу

эскертүү

Бир ысык коддоо

Бир нече категориялар менен өзгөрмө

төмөн

Өлчөмүн бир нече категорияда жарылат

Энбелгилерди коддоо

Сорттолгон категория

төмөн

Тартипсиздик туура эмес тартипти үйрөтөт

максаттуу коддоо

Көп категориялуу, күчтүү сигнал

абдан бийик

Жөн гана билимден, резюмеде

стандартташтыруу

Сызыктуу/аралык моделдер

орто

Параметр билимге гана көз каранды

Убакыт терезеси өзгөчөлүгү

убакыт сериясы

бийик

Келечекти кош

үч мини учурлар

1-жагдай - Баалуу мүлк. Кредиттик топ чийки "айлык киреше" жана "ай сайын карызды төлөө" тилкелеринен "карыздын кирешеге катышы" өзгөчөлүгүн түздү. Бул жалгыз алынган өзгөчөлүк моделдин тактыгын 71% дан 79% га жогорулатты; анткени тобокелдикти чындап аныктаган абсолюттук киреше эмес, чен болчу. Сабак: домен билими менен түзүлгөн катыштар күчтүү сигналдар.

2-жагдай — Максаттуу коддоо агып чыгуу. Бир команда "почталык индексти" максаттуу коддоосу бар санга айландырды (ошол аймактагы орточо жоготуу ылдамдыгы), бирок бөлүүгө чейин бардык маалыматтардан ушундай кылды. Модель тесттик топтомдо 94% берип, өндүрүштө 68% га төмөндөгөн. 6 жумалык аракет текке кетти. Сабак: максаттуу коддоо тренингдин алкагында гана кылдаттык менен жүргүзүлөт.

3-жагдай - Масштабды унутуу. Бир аналитик кирешени (0-400,000) жана кардардын жашын (18-75) масштабдуу эмес аралыкка негизделген моделге киргизген. Модель дээрлик жалаң кирешени карап, курактык эффектти талкалаган. Масштабтоо кошулганда, сегменттөө маанисине ээ болду. Сабак: аралыкта/сызыктуу моделдерде масштабдоо көңүл бурулбайт.

Көчүрүү үчүн төрт шаблон

1) Функция идеясын түзүү (жоюу сизден көз каранды):

Сиздин ролуңуз: инженердик жардамчы. Менин df тилкелерим: туулган_датасы, буйрутма_убагы (убакыт белгиси), киреше_tl, карыз_tl, шаар, продукт_категориясы. Максат: "кредит төлөнөбү" (0/1). Бул тилкелерден түзүлө турган 15 функцияны сунуштаңыз; ар бири үчүн агып кетүү коркунучун (төмөн/орто/жогорку) көрсөтүңүз. Келечектеги маалыматты камтыгандарды так белгилеңиз.

2) Коопсуз коддоо (пост-бөлүү):

Бир ысыкта "шаар" жана "продукт_категориясы" коддолгон кодду жазыңыз. МААНИЛҮҮ: коддоону машыгуу маалыматтарына гана тууралаңыз, андан кийин тесттик маалыматтарды трансформациялаңыз (sklearn OneHotEncoder менен). Билим берүүдө көрүнбөгөн категорияны (handle_unknown) кантип иштетип жатканыңызды түшүндүрүңүз.

3) Түтүк өткөргүч менен агып кетпеген конверсия:

Sklearn Pipeline орнотуңуз: StandardScalerди сандык тилкелерге, OneHotEncoderди категориялык тилкелерге колдонуңуз, аягында классификаторду кошуңуз. Бардык трансформациялар поездден/сыноодон КИЙИН жана машыгуудан гана үйрөнүлөт. Кодду жана эмне үчүн ал агып кетпей турганын түшүндүрүңүз.

4) Убакыт терезеси өзгөчөлүгү (агымды көзөмөлдөө):

Ар бир кардар үчүн "акыркы 30 күндөгү буйрутмалардын саны" атрибутун түзүңүз, бирок болжолдонгон күндөн кийинки маалыматтарды ЭЧ КАЧАН камтпаңыз. Код келечекти карабасын саптан сап түшүндүрүңүз. Мен маалымдама датасы тилкесин берем.

Алсыз тездик / Күчтүү тездик

Алсыз билдирүү:

Бул маалыматтарга жакшы касиеттерди кошуңуз.

"Жакшы" аныкталбаган, максат так эмес, агып кетүүнү көзөмөлдөө жок. AI туш келди, балким, агып кеткен функцияларды жаратат.

Күчтүү билдирүү:

Сиздин ролуңуз: инженер. Максат: "30 күндүн ичинде өчүрүү" (0/1), болжолдуу маалымдама датасы: save_date. df.Task ичинде транзакция тарыхы бар: 8 функцияны жаратыңыз, АР БИР үчүн "Божомолдоо учурунда менде бул маалымат барбы" деген суроого жооп бериңиз. Убакыт терезесинин өзгөчөлүктөрүнө шилтеме датасынан кийин датаны кошуу. Поезд/сыноо бөлүмүнөн кийин аткарыла турган түтүккө ылайыктуу жол менен кодду жазыңыз.

Бул жерде максат, маалымдама убактысы жана агып чыгууну көзөмөлдөө башынан эле аныкталат.

Жалпы каталар

  • Бөлүүгө чейин бардык маалыматтардан трансформацияны үйрөнүү. Эгерде масштабдоо/коддоо параметри тесттик маалыматтарды көрсө, агып кетүү пайда болот.
  • Максаттуу коддоону этиятсыз колдонуу. Бул эң күчтүү, бирок эң аккан ыкма; жөн гана тренингден, кайчылаш текшерүүдө.
  • Убакыт терезеси өзгөчөлүгү менен келечекти кошуу. Эгерде "акыркы 30 күн" эсеби болжолдонгон күндөн кийин киргизилсе, модель келечекти көрөт.
  • Дарак моделинде керексиз масштабдоо жана сызыктуу моделде толук эмес масштабдоо. Масштабдоо чечимдери моделдин түрүнө ылайык кабыл алынат.
  • AIнын ар бир сунушун суроосуз кошуу. Сунуштар пайдасыз жана агып кеткен функцияларды камтышы мүмкүн.
Кеңеш: Сиз жараткан ар бир өзгөчөлүк үчүн бир суроо жазыңыз: "Мен бул маанини болжолдоо учурунда менде болгон маалымат менен эсептей аламбы?" Эгер жооп так "ооба" болбосо, функцияны колдонбоңуз. Бул жалгыз дисциплина өзгөчөлүккө байланыштуу агып чыгууларды жок кылат.

Кыскача айтканда

Функция инженериясы - чийки маалыматтардан маанилүү сигналдарды түзүү искусствосу жана көбүнчө алгоритмге караганда моделдин ийгилигин аныктайт. Категориялыктарды коддоо (бир ысык, энбелги, максаттуу), сандык көрсөткүчтөрдү масштабдоо (стандартташтыруу, нормалдаштыруу) жана домендик билим менен туунду функцияларды өндүрүү негизги инструменттер болуп саналат. Бирок бул фаза ошондой эле агып кетүүнүн өзөгү болуп саналат: бардык трансформацияларды тренингден/сыноодон кийин жана окуу маалыматтарынан гана үйрөнүү керек. AI көптөгөн идеяларды жаратат; Кымбатты коркунучтуудан айырмалай турган адамдын акылы.

Колдонмо тапшырмасы

Максаттуу өзгөрмөнү тандап, сизде бар тилкелерден бери дегенде беш туунду өзгөчөлүктөрдү түзүңүз. Алардын ар бири үчүн "болжолдоо маалында мен даярмынбы" деген суроого жазуу түрүндө жооп бериңиз жана жок дегенде бирөөсүн "агызып кетүү коркунучу жогору" деп жокко чыгарыңыз. Андан кийин бөлүмдөн кийин ишке ашырыла турган конвейердеги коопсуз функцияларды коддоңуз.

текшерүү тизмеси

  • [ ] Поезд/сыноо бөлүнгөндөн кийин бардык трансформацияларды колдондумбу?
  • [ ] Мен машыгуудан масштабдоо/коддоо параметрлерин гана үйрөндүмбү?
  • [ ] Ар бир өзгөчөлүк үчүн "болжолдоо учурунда менде барбы" деген суроого жооп бердимби?
  • [ ] Мен максаттуу коддоо сыяктуу жогорку тобокелдик ыкмаларына өзгөчө көңүл бурдум беле?
  • [ ] Мен моделдин түрүнө (дарак/сызыктуу) ылайыктуу түрдө масштабдоону чечтимби?