Пайдалар:
- Берилиш түтүгүн орнотуу (жыйноо, текшерүү, тазалоо, өзгөртүү, бөлүү, версиялоо) жана схеманын валидациясын түтүктүн башында коюу
- Маалыматтын агып кетишин алдын алуу үчүн талаанын маанисине жана бөлүштүрүүгө негизделген жетишпеген маани жана маркировка чечимдерин кабыл алуу мүмкүнчүлүгү (топтук жана убактылуу)
- Берилиштер версиясын жана кокустуктун үрөнүн бекитүү аркылуу кайталануучу маалымат базасын түзүү мүмкүнчүлүгү
Ар бир машинаны үйрөнүү тутумунун чыныгы күчү моделде эмес, маалыматтарда. Тажрыйбалуу инженерлер билишет: "таштанды кирди, таштанды чыгарды" - жаман маалыматтар менен азыктанган эң алдыңкы модель да жаман натыйжаларды берет. Бул бөлүмдө биз маалымат түтүгүн (маалымат түтүгү: чийки маалыматтарды моделдик окутууга даяр кылган кадамдардын тизмеги) аягына чейин орнотобуз жана бул линиянын кайсы баскычында биз жасалма интеллектти коопсуз колдоно аларыбызды билебиз.
Маалымат линиясынын кадамдары
Маалымат линиясы адатта бул аялдамалар аркылуу өтөт:
- Коллекция (жутуу): булактардан берилиштерди алуу (маалымат базасы, API, журнал файлдары, окуя агымдары).
- Текшерүү: Берилиштер күтүлгөн схемага, типтерге жана диапазонго ылайык келерин текшерүү.
- Тазалоо: жетишпеген баалуулуктарды, кайталанма жазууларды, четтөөлөрдү жана карама-каршылыктарды иштетүү.
- Трансформация: чийки маалыматтарды атрибуттарга айландыруу — мисалы, категориялык өзгөрмөнү санга айландыруу, күндөн баштап "апта күнүн" чыгаруу.
- Бөлүү: Тренинг, валидация жана тестирлөө комплекстерине бөлүү.
- Версиялоо: Кайсы модель кайсы маалыматтар менен үйрөтүлгөнүн жаздыруу.
Жасалма интеллект өзгөчө 2, 3 жана 4-кадамдарда код долбоорлорун жана идеяларды жаратып, убакытты үнөмдөйт. Бирок кайсы жазууну жокко чыгаруу, кайсынысы жетишпеген маанини толтуруу жана кантип берүү сыяктуу чечимдер маалыматтарды билген инженерге таандык; анткени туура эмес тазалоо моделдин ичине жашыруун ык салышы мүмкүн.
Маалыматтарды текшерүү: линияны эрте коргоо
Эң кымбат каталар өндүрүштө эмес, текшерүү кадамын өткөрүп жибергенде башталат. Схеманы текшерүү автоматтык түрдө ар бир келген маалыматтардын партиясы күтүлгөн структурага ылайык келерин текшерет. Мисалы, 0-120 жаш тилкеси, электрондук почтанын талаасы бошбу, тилкелердин саны өзгөрдүбү?
Кеңеш: Текшерүүнү саптын башына коюңуз. Бузулган маалыматтар канчалык тез кармалса, аны оңдоо ошончолук арзан болот. Өндүрүштө кармалган схема катасы окутуу баскычында кармалган катага караганда бир нече эсе кымбат.
Төмөнкү маалымат схемасы үчүн pandera (же Great Expectations) менен валидация схемасын жазыңыз. Мамычалар жана эрежелер:- user_id: бүтүн, нөл болушу мүмкүн эмес, уникалдуу- жашы: бүтүн, 0-120 болушу мүмкүн эмес- катталуу_даты: дата, келечекте боло албайт- өлкө: категориялык, топтомдон {TR, DE, АКШ, Улуу Британия}- баланс: ондук, терс болушу мүмкүн эмес Ар бир эреже бузуу үчүн олуттуу ката кабарын чыгарыңыз. Тестти коддун аягындагы сынык сызык менен көрсөтүңүз.
Тазалоо: аны адам чечет
Жок болгон маанилер ар бир маалымат топтомунун реалдуулугу. Башкаруу жолдору:
- Жок кылуу: Өтө жогорку жетишпеген чен менен сапты/мамычаны жокко чыгаруу. Бирок маалымат жоготуу жана бир жактуу болуу коркунучу бар.
- Импутация: Орточо, медианалык, эң көп болгон маани же моделге негизделген болжолдоо менен импутация.
- Желек: "Жок болгон" маалыматты өзүнчө желек тилкесинде сактоо - кээде жетишпегендиктин өзү сигнал болуп саналат.
Кайсынысы туура, маселеге жараша болот. Медициналык маалымат топтомунда "кандын баасы өлчөнгөн эмес" маалыматы жок кылынбай, сакталышы керек; Анткени дарыгердин өлчөөдөн баш тартуусу да белги. AI сизге варианттарды жана кодду бере алат; Сиз кайсынысы талаанын реалдуулугуна туура келерин тандайсыз.
Алсыз тездик / Күчтүү тездик
Начар эскертүү: "Жетишкен маанилерди толтуруңуз."
Күчтүү эскертүү: "Төмөнкү тилкелерде жетишпеген маанилер бар: киреше (12% жетишпейт, оңго кыйшайган бөлүштүрүү), last_login (30% жок). Кирешени медиана менен толтурууну сунуштаңыз, бирок эмне үчүн медиананы эмес экенин түшүндүрүңүз. Last_login үчүн жетишпеген маани маанилүү болушу мүмкүн деп эсептеңиз (колдонуучу эч качан кирген эмес); бир жактуу мамиле моделге кошумча болот."
Айырмасы: күчтүү ыкчам маалымат бөлүштүрүүнү жана аймактын маанисин берет; жасалма интеллект механикалык толтуруу ордуна чечим колдоо өндүрөт.
этикеткалоо: сапаты өлчөнөт
Көзөмөлдөнгөн окутууда (мисалдар туура жооптор менен берилген окуу) моделдин үйрөнгөн нерсеси этикеткалар (белгилер: ар бир мисал үчүн туура жооп). Энбелгилердин сапаты шыпты белгилейт — эгер адамдар ырааттуу эмес белгилешсе, модель ырааттуу эмес үйрөнөт.
Аннотаторлор аралык макулдашуу ар кандай адамдардын бир эле үлгүгө бир эле энбелгисин берүү ылдамдыгын өлчөйт; Ал Коэндин Каппасы сыяктуу коэффициент менен туюнтулат. Төмөн шайкештик же тапшырма түшүнүксүз же нускама начар экенин көрсөтүп турат.
Жасалма интеллект маркировкалоого эки жол менен жардам берет: (1) аннотация боюнча нускаманы түзүү, (2) алдын ала белгилөө жана аны адам гана оңдоп коюу. Бирок LLM менен алдын ала энбелгилөө бир тузак бар: моделдин системалуу катасы бүт энбелгилер топтомуна агып кетиши мүмкүн. Ошондуктан адамдар ар дайым LLM энбелгилерин текшеришет.
Көңүл буруңуз: LLM тарабынан чыгарылган этикеткаларды "негизги чындык" деп эсептебеңиз. Адам менен үлгүнү текшерип, LLM-адамдын тууралыгын өлчөө. Эгерде шайкештик төмөн болсо, алдын ала белгилөө пайдага караганда көбүрөөк зыян алып келет.
Маалыматтарды бөлүү: агып кетүүнүн алдын алуу
Маалыматтарды окутуу/валидация/тестирлөө деп бөлүүдө эң коркунучтуу ката - бул маалыматтардын агып кетиши: тесттик маалыматты окутууга аралаштыруу. Мисалдар:
- Ошол эле колдонуучунун жазуулары тренингге да, тестирлөөгө да кирет (топтун агымы).
- Тренингде келечекти жана убакыт сериясындагы тестирлөөдө өткөндү колдонуу (убактылуу агып кетүү).
- Бардык маалыматтардан масштабдоо (нормалаштыруу) параметрлерин эсептөө жана андан кийин бөлүү.
Убактылуу бөлүнүү убакытты камтыган көйгөйлөр үчүн абдан маанилүү: өткөн менен машыгуу, келечектеги сыноо. Кокус бөлүштүрүү өндүрүштө эч качан болбой турган "келечектеги" пайданы берет жана көрсөткүчтөрдү көбөйтөт.
Маалыматтарды версиялоо жана кайталоо
"Биз бул моделди кандай маалыматтар менен үйрөттүк?" Суроого бир нече айдан кийин жооп бере алуу олуттуу ML инженериясынын өзгөчөлүгү болуп саналат. Берилиштерди версиялоо ар бир маалыматтын сүрөтүн ID (хэш же версия теги) менен сактайт. Код сыяктуу DVC (Data Version Control) версиясынын дайындары сыяктуу куралдар.
Моделдин жыйынтыгын кайра чыгаруу үчүн үч нерсени тактоо керек: маалымат версиясы, код версиясы жана кокустук урук. Бул үчилтиксиз “мен да ушундай жыйынтык алдым” деп айтууга болбойт. Биз 11-бөлүмдө Репродукцияны тереңдетебиз; бирок маалымат түтүкчөсүндөгү үрөндү бекитүү ушул жерден башталат.
үч мини учурлар
1-жагдай - Күн схемасын текшерүү сакталды. Команда жогорку системанын баа талаасын пенниден лирага айландырганда, бардык баалар 100 эсе төмөндөдү. Схеманы текшерүү партияны "баа диапазондон тышкары" деп четке какты жана модель бузулган маалыматтар менен үйрөтүлгөн эмес. Текшербестен, ката туура эмес божомолдор менен өндүрүштө гана байкалат.
2-жагдай - туура эмес толтуруу. Кредиттик моделде жетишпеген киреше маанилери орточо менен толтурулган. Бирок жетишпеген кирешелер негизинен аз камсыз болгон топко таандык; орточо бул топту жасалма түрдө "байыткан" жана модель аларга адилетсиз жогорку чекти сунуш кылган. Медиана + жок желек менен көйгөй чечилди.
3-жагдай - Убактылуу агып кетүү. Суроо-талапты болжолдоо модели тесттик топтомдо сонун көрүндү (95% тактык), бирок өндүрүштө бузулуп калды. Эмне үчүн: кокустуктан улам, модель келечекти көргөн. Убактылуу туташууга өтүү тесттин тактыгын 78% га төмөндөттү, бирок бул чыныгы аткаруу жана аны өндүрүштө сактап калды.
Көчүрмө шаблондор
Төмөнкү берилиштер топтомун үч топтомго бөлүңүз: окутуу/текшерүү/тестүү.Чектөө: Бул убакыт сериясы; ТЕМПОРАЛДЫК бөлүүнү колдонуңуз (өтмүштө машыгуу, келечекте сыноо). Партиянын агып кетишин болтурбоо: бир эле `customer_id` бир кластерде гана болсун. Машыгуу топтомунан ГАНА масштабдоо параметрлерин эсептеп, андан соң баарына колдонуңуз. Ар бир кадамда коддо канча сап калганын басып чыгарып, эч кандай агып кетпегендигин текшерген ырастоону кошуңуз.
Бул энбелгилөө тапшырмасы үчүн аннотация нускамасынын долбоорун жазыңыз.Тапшырма: [мис. Кардарлардын сынына оң/терс/нейтралдуу энбелги белгилеңиз]Чек арадагы учурларды тактаңыз: сарказм, аралаш эмоция, өнүмгө тиешеси жок сын-пикирди кантип белгилөө керек? Теггерлердин ырааттуулугун арттыра турган 5 мисал жана 3 кыйын кырдуу жагдайды бериңиз.
Бул маалымат түтүгү үчүн кайталануу мүмкүнчүлүгүн текшерүү тизмесин түзүңүз:- Берилиштер версиясы кантип бекитилиши керек?- Кайсы кокустуктун уруктары кайда коюлушу керек?- Кандай метаберилиштер (маалыматтар хэши, саптардын саны, датасы) журналга киргизилиши керек? Менин код базам: [тил/китепкана]
Дайындардын агып кетиши үчүн бул тазалоо кодун текшериңиз. Тактап айтканда, муну карап көрүңүз: масштабдоо/коддоо параметрлери бөлүнүүдөн мурун эсептелгенби? Кандайдыр бир статистика бардык маалыматтардын негизиндеби же жөн гана тренингби? Код: [код]
Чечим таблицасы: баалуулук стратегиясы жок
Статус
Сунушталган ыкма
Эмне үчүн
Сандык, бурмаланган бөлүштүрүү
медиана менен толтуруу
Орточо көрсөткүчкө четтөөлөр таасир этет
Сандык, симметриялуу
орточо менен толтуруу
Маалыматты коргойт
жетишсиздиги олуттуу болушу мүмкүн
Желек тилкеси + толтуруу
Жетишсиздик - бул сигнал
Жетишпеген көрсөткүч > 60%
Баалоо/жокко чыгаруу тилкеси
Ызы-чуу өтө көп
Категориялык
"Белгисиз" категориясы
Жасалма көпчүлүктү түзбөйт
Жалпы каталар
- Текшерүү өткөрүп жиберилүүдө. Схема көзөмөлү жок бузулган маалыматтар унчукпай кирип кетет.
- Бөлүү алдында масштабдоо. Ал билим берүү тармагына тесттик статистиканы чыгарат.
- Убакыт катарларында туш келди бөлүүнү колдонуу. Ал жасалма жогорку көрсөткүчтөрдү чыгарат.
- LLM энбелгилерине сокур ишенүү. Системалык ката маалыматтар боюнча тарайт.
- Маалымат версиясы сакталбай жатат. Сиз натыйжаны кайра чыгара албайсыз.
- Орточо менен механикалык толтуруу. Бул талаа маанисин четке кагып, бир жактуулукту кошот.
Кыскача айтканда
Маалымат түтүгү ML тутумунун негизи болуп саналат жана моделге караганда көбүрөөк күч-аракетти талап кылат. Текшерүүнү жогору жагына коюңуз; домен билими менен тазалоо жана этикеткалоо чечимдерди кабыл алуу; отсекте агып кетүүнүн (топтук жана убактылуу) алдын алуу; маалымат версиясын жана үрөнүн оңдоо. AI бул сапта кодду жана идеяларды жаратат, бирок кайсы маалыматтарды жана кантип иштетүүнү сиз чечесиз — анткени бул жерде ар бир туура эмес чечим моделге жашыруун кемчилик катары өтөт.
Колдонмо тапшырмасы
Өзүңүздүн маалымат топтомуңузга валидация схемасын (pandera/Great Expectations) жазыңыз жана атайылап жаман сапты кошуп, анын кармалып калганын көрсөтүңүз. Андан кийин берилиштерди убактылуу же партияга бөлүп, машыгуудан гана масштабдоо параметрлерин эсептеп, ырастоо менен эч кандай агып кетпегендигин текшериңиз. Берилиштер версиясын жана саптардын санын метадайындар файлына жазыңыз.
текшерүү тизмеси
- [ ] Схеманы текшерүү саптын башында иштейт.
- [ ] Мен талаа маанисине негизделген жетишпеген маани стратегиясын тандадым, аны механикалык түрдө толтурган жокмун.
- [ ] Мен этикетканын сапатын өлчөдүм (шайкештик); Мен LLM тэгдерин адам тарабынан текшердим.
- [ ] Мен панелде топтук жана убактылуу агып кетүүнүн алдын алдым.
- [ ] Масштабдоо/коддоо машыгуу топтомунан гана эсептелет.
- [ ] Маалымат версиясы, катарлардын саны жана жазылган урук.