નફો:
- ડેટા પાઇપલાઇન સેટ કરવાની ક્ષમતા (સંગ્રહ, માન્યતા, સફાઇ, પરિવર્તન, વિભાજન, સંસ્કરણ) અને પાઇપલાઇનની શરૂઆતમાં સ્કીમા માન્યતા મૂકવાની ક્ષમતા
- ડેટા લીકેજ (જૂથ અને ટેમ્પોરલ) અટકાવવા માટે ફીલ્ડ અર્થ અને વિભાજનના આધારે ખૂટતા મૂલ્ય અને લેબલિંગ નિર્ણયો લેવાની ક્ષમતા
- ડેટા વર્ઝન અને રેન્ડમનેસ સીડ ફિક્સ કરીને પ્રજનનક્ષમ ડેટા બેઝ બનાવવાની ક્ષમતા
દરેક મશીન લર્નિંગ સિસ્ટમની વાસ્તવિક શક્તિ ડેટામાં રહેલી છે, મોડેલમાં નહીં. અનુભવી એન્જિનિયરો જાણે છે: "કચરો અંદર, કચરો બહાર કાઢો" — સૌથી અદ્યતન મોડલ પણ ખરાબ ડેટા ફીડ કરે છે તે ખરાબ પરિણામો લાવશે. આ એકમમાં, અમે ડેટા પાઇપલાઇન (ડેટા પાઇપલાઇન: સ્ટેપ્સની સાંકળ કે જે કાચા ડેટાને મોડલ તાલીમ માટે તૈયાર કરે છે) સ્થાપિત કરીએ છીએ અને આ લાઇનના કયા સ્ટેપ પર આપણે આર્ટિફિશિયલ ઇન્ટેલિજન્સનો સુરક્ષિત રીતે ઉપયોગ કરી શકીએ છીએ તે શીખીએ છીએ.
ડેટા લાઇનના પગલાં
ડેટા લાઇન સામાન્ય રીતે આ સ્ટોપ્સમાંથી પસાર થાય છે:
- કલેક્શન (ઇન્જેશન): સ્ત્રોતોમાંથી ડેટા ખેંચવો (ડેટાબેઝ, API, લોગ ફાઇલો, ઇવેન્ટ સ્ટ્રીમ્સ).
- માન્યતા: ડેટા અપેક્ષિત સ્કીમા, પ્રકારો અને શ્રેણીઓને અનુરૂપ છે કે કેમ તે તપાસવું.
- સફાઈ: ગુમ થયેલ મૂલ્યો, ડુપ્લિકેટ રેકોર્ડ્સ, આઉટલીયર અને અસંગતતાઓને સંભાળવી.
- રૂપાંતરણ: કાચા ડેટાને વિશેષતાઓમાં ફેરવવું — જેમ કે સ્પષ્ટ ચલને નંબરમાં રૂપાંતરિત કરવું, તારીખથી "સપ્તાહનો દિવસ" ઉત્પન્ન કરવો.
- વિભાજન: તાલીમ, માન્યતા અને પરીક્ષણ સેટમાં અલગ થવું.
- સંસ્કરણ: રેકોર્ડિંગ કે કયા મોડેલને કયા ડેટા સાથે તાલીમ આપવામાં આવી હતી.
આર્ટિફિશિયલ ઇન્ટેલિજન્સ કોડ ડ્રાફ્ટ્સ અને આઇડિયા જનરેટ કરીને સમય બચાવે છે, ખાસ કરીને સ્ટેપ 2, 3 અને 4માં. પરંતુ કયા રેકોર્ડને કાઢી નાખવો, કયું મૂલ્ય ખૂટે છે અને કેવી રીતે ભરવાનું છે, તે ડેટા જાણનાર એન્જિનિયરના નિર્ણયો છે; કારણ કે અયોગ્ય સફાઈ મોડેલમાં છુપાયેલ પૂર્વગ્રહ દાખલ કરી શકે છે.
ડેટા વેરિફિકેશન: લાઇનનો પ્રારંભિક સંરક્ષણ
સૌથી ખર્ચાળ ભૂલો ઉત્પાદનમાં શરૂ થતી નથી, પરંતુ જ્યાં ચકાસણીનું પગલું છોડવામાં આવે છે. સ્કીમા માન્યતા આપમેળે તપાસ કરે છે કે ડેટાનો દરેક ઇનકમિંગ બેચ અપેક્ષિત માળખાને અનુરૂપ છે કે કેમ. ઉદાહરણ તરીકે, શું 0-120 વચ્ચેની વય કૉલમ છે, શું ઈમેલ ફીલ્ડ ખાલી છે, શું કૉલમની સંખ્યા બદલાઈ છે?
ટીપ: લાઇનની શરૂઆતમાં ચકાસણી મૂકો. ભ્રષ્ટ ડેટા જેટલો વહેલો પકડાશે, તેને ઠીક કરવો તેટલો સસ્તો છે. ઉત્પાદનમાં પકડાયેલી સ્કીમા ભૂલ તાલીમ તબક્કામાં પકડાયેલી એક કરતાં ઘણી ગણી વધુ ખર્ચાળ છે.
નીચેની ડેટા સ્કીમા માટે પેન્ડેરા (અથવા મહાન અપેક્ષાઓ) સાથે માન્યતા યોજના લખો. કૉલમ અને નિયમો:- user_id: પૂર્ણાંક, શૂન્ય ન હોઈ શકે, અનન્ય- વય: પૂર્ણાંક, 0-120- સાઇનઅપ_તારીખથી ન હોઈ શકે: તારીખ, ભવિષ્યમાં ન હોઈ શકે- દેશ: સ્પષ્ટ, સેટ {TR, DE, US, UK}- સંતુલન: દશાંશ, નકારાત્મક હોઈ શકતા નથી દરેક નિયમ માટે અર્થપૂર્ણ ભૂલ સંદેશ બનાવો. કોડના અંતે તૂટેલી લાઇનના ઉદાહરણ સાથે ટેસ્ટ બતાવો.
સફાઈ: તે માણસ નક્કી કરે છે
ખૂટતા મૂલ્યો દરેક ડેટા સેટની વાસ્તવિકતા છે. હેન્ડલ કરવાની રીતો:
- કાઢી નાખવું: ખૂબ ઊંચા ખૂટતા દર સાથે પંક્તિ/કૉલમને કાઢી નાખવું. પરંતુ માહિતીના નુકશાન અને પૂર્વગ્રહનું જોખમ રહેલું છે.
- આરોપણ: સરેરાશ, મધ્ય, સૌથી વધુ વારંવાર મૂલ્ય અથવા મોડેલ-આધારિત અનુમાન સાથે આરોપણ.
- ધ્વજ: એક અલગ ફ્લેગ કોલમમાં માહિતી "ખુટતી હતી" સ્ટોર કરવી — કેટલીકવાર ખૂટે છે તે સિગ્નલ હોય છે.
કયું સાચું છે તે સમસ્યા પર આધારિત છે. તબીબી ડેટા સેટમાં, "બ્લડ વેલ્યુ ન માપવામાં આવી" માહિતી કાઢી નાખવાને બદલે સાચવવી જોઈએ; કારણ કે ડોકટર દ્વારા માપ લેવાનો ઇનકાર પણ એક સંકેત છે. AI તમને વિકલ્પો અને કોડ આપી શકે છે; તમે પસંદ કરો કે જે એક ક્ષેત્રની વાસ્તવિકતાને બંધબેસે છે.
નબળા પ્રોમ્પ્ટ / મજબૂત પ્રોમ્પ્ટ
નબળા પ્રોમ્પ્ટ: "ગુમ થયેલ મૂલ્યો ભરો."
સ્ટ્રોંગ પ્રોમ્પ્ટ: "નીચેની કૉલમ્સમાં ખૂટતા મૂલ્યો છે: આવક (12% ખૂટે છે, જમણું-તરછું વિતરણ), લાસ્ટ_લોગિન (30% ખૂટે છે). સરેરાશ સાથે આવક ભરવાનું સૂચન કરો, પરંતુ શા માટે મધ્યમ અને તેનો અર્થ નથી તે સમજાવો. છેલ્લા_લોગિન માટે, ગુમ થયેલ મૂલ્ય નોંધપાત્ર હોઈ શકે છે (વપરાશકર્તાએ ક્યારેય genlelogin_ન કરવાને બદલે ફ્લેગ ઇન કરવાનું ધ્યાનમાં લીધું નથી); પૂર્વગ્રહ લખો ક્યાં તો અભિગમ મોડેલમાં ઉમેરશે."
તફાવત: મજબૂત પ્રોમ્પ્ટ વિતરણ માહિતી અને વિસ્તાર અર્થ આપે છે; કૃત્રિમ બુદ્ધિ યાંત્રિક ભરણને બદલે નિર્ણયને સમર્થન આપે છે.
લેબલિંગ: ગુણવત્તા માપવામાં આવે છે
નિરીક્ષણ કરેલ શિક્ષણમાં (શિક્ષણ કે જેમાં સાચા જવાબો સાથે ઉદાહરણો આપવામાં આવે છે), મોડેલ જે શીખે છે તે લેબલ્સ છે (લેબલ્સ: દરેક ઉદાહરણ માટે સાચો જવાબ). લેબલ ગુણવત્તા ટોચમર્યાદા સેટ કરે છે — જો લોકો અસંગત રીતે લેબલ કરે છે, તો મોડેલ અસંગત રીતે શીખે છે.
આંતર-એનોટેટર કરાર એ દરને માપે છે કે જે દરે જુદા જુદા લોકો સમાન નમૂનાને સમાન લેબલ આપે છે; તે કોહેનના કપ્પા જેવા ગુણાંક દ્વારા વ્યક્ત થાય છે. ઓછું પાલન સૂચવે છે કે કાર્ય અસ્પષ્ટ છે અથવા સૂચના નબળી છે.
આર્ટિફિશિયલ ઇન્ટેલિજન્સ બે રીતે લેબલિંગ કરવામાં મદદ કરે છે: (1) એનોટેશન માર્ગદર્શિકાનો મુસદ્દો તૈયાર કરવો, (2) પ્રી-લેબલિંગ અને માનવ માત્ર તેને સુધારે છે. પરંતુ LLM સાથે પ્રી-લેબલીંગમાં ખામી છે: મોડેલની પદ્ધતિસરની ભૂલ સમગ્ર લેબલ સેટમાં લીક થઈ શકે છે. તેથી જ મનુષ્ય હંમેશા કેટલાક LLM લેબલ તપાસે છે.
ધ્યાન: LLM દ્વારા ઉત્પાદિત લેબલોને "ગ્રાઉન્ડ ટ્રુથ" તરીકે ન ગણશો. માનવ સાથે નમૂના તપાસો અને એલએલએમ-માનવ ફિટને માપો. જો અનુપાલન ઓછું હોય, તો પ્રી-લેબલીંગ સારા કરતાં વધુ નુકસાન કરશે.
ડેટા પાર્ટીશન: લિકેજ અટકાવો
તાલીમ/માન્યતા/પરીક્ષણમાં ડેટાને વિભાજિત કરતી વખતે સૌથી ખતરનાક ભૂલ એ ડેટા લીકેજ છે: તાલીમમાં પરીક્ષણ માહિતીનું મિશ્રણ. ઉદાહરણો:
- સમાન વપરાશકર્તાના રેકોર્ડ્સ તાલીમ અને પરીક્ષણ (જૂથ લીક) બંનેમાં આવે છે.
- તાલીમમાં ભવિષ્યનો ઉપયોગ કરવો અને સમય શ્રેણી (ટેમ્પોરલ લિકેજ) માં પરીક્ષણમાં ભૂતકાળનો ઉપયોગ કરવો.
- બધા ડેટામાંથી સ્કેલિંગ (સામાન્યીકરણ) પરિમાણોની ગણતરી કરવી અને પછી વિભાજન કરવું.
સમયને લગતી સમસ્યાઓ માટે ટેમ્પોરલ વિભાજન આવશ્યક છે: ભૂતકાળ સાથે તાલીમ, ભવિષ્યમાં પરીક્ષણ. રેન્ડમ સ્પ્લિટિંગ "ભવિષ્ય" લાભ આપે છે જે ઉત્પાદનમાં ક્યારેય થશે નહીં અને મેટ્રિક્સ વધે છે.
ડેટા સંસ્કરણ અને પુનઃઉત્પાદનક્ષમતા
"અમે આ મોડેલને કયા ડેટા સાથે તાલીમ આપી છે?" મહિનાઓ પછી પ્રશ્નનો જવાબ આપવા સક્ષમ બનવું એ ગંભીર ML એન્જિનિયરિંગની ઓળખ છે. ડેટા વર્ઝનિંગ દરેક ડેટા સ્નેપશોટને ID (હેશ અથવા વર્ઝન ટેગ) સાથે સ્ટોર કરે છે. કોડ જેવા ડીવીસી (ડેટા વર્ઝન કંટ્રોલ) વર્ઝન ડેટા જેવા સાધનો.
મોડેલના પરિણામનું પુનઃઉત્પાદન કરવા માટે, ત્રણ વસ્તુઓ નિશ્ચિત હોવી આવશ્યક છે: ડેટા સંસ્કરણ, કોડ સંસ્કરણ અને રેન્ડમ સીડ. આ ત્રણેય વિના "મને સમાન પરિણામ મળ્યું" એમ કહેવું શક્ય નથી. અમે એકમ 11 માં પ્રજનનક્ષમતાને વધુ ઊંડું કરીશું; પરંતુ ડેટા પાઇપલાઇનમાં બીજને ઠીક કરવાનું અહીંથી શરૂ થાય છે.
ત્રણ નાના કેસો
કેસ 1 - દિવસની સ્કીમા માન્યતા સાચવવામાં આવી. જ્યારે એક ટીમે અપસ્ટ્રીમ સિસ્ટમ પ્રાઇસ ફીલ્ડને પેનિસમાંથી લીરામાં રૂપાંતરિત કર્યું, ત્યારે તમામ કિંમતો 100 ગણી ઘટી ગઈ. સ્કીમા માન્યતાએ બેચને "કિંમતની શ્રેણીની બહાર" તરીકે નકારી કાઢી હતી અને મોડેલને દૂષિત ડેટા સાથે તાલીમ આપવામાં આવી ન હતી. ચકાસણી વિના, ભૂલ માત્ર ઉત્પાદનમાં જ જોવામાં આવશે, ખોટી આગાહીઓ સાથે.
કેસ 2 - ખોટો ભરણનો પૂર્વગ્રહ. ક્રેડિટ મોડેલમાં, ખૂટતી આવકના મૂલ્યો સરેરાશ સાથે ભરવામાં આવ્યા હતા. પરંતુ ખૂટતી આવક મુખ્યત્વે ઓછી આવક ધરાવતા જૂથમાં હતી; સરેરાશ કૃત્રિમ રીતે આ જૂથને "સમૃદ્ધ" બનાવ્યું, અને મોડેલે તેમને અયોગ્ય રીતે ઊંચી મર્યાદા ઓફર કરી. મધ્ય + ખૂટતા ધ્વજ સાથે સમસ્યાને ઠીક કરી.
કેસ 3 - ટેમ્પોરલ લિકેજ. ડિમાન્ડ ફોરકાસ્ટિંગ મોડલ ટેસ્ટ સેટ (95% સચોટતા) પર સરસ દેખાતું હતું પરંતુ ઉત્પાદનમાં ક્રેશ થયું હતું. શા માટે: રેન્ડમ વિભાજનને કારણે, મોડેલે ભવિષ્ય જોયું હતું. ટેમ્પોરલ બિનિંગ પર સ્વિચ કરવાથી પરીક્ષણની ચોકસાઈ ઘટીને 78% થઈ ગઈ — પરંતુ તે વાસ્તવિક પ્રદર્શન હતું અને તેને ઉત્પાદનમાં રાખવામાં આવ્યું.
નકલ કરી શકાય તેવા નમૂનાઓ
નીચેના ડેટાસેટને ત્રણ સેટમાં વિભાજિત કરો: તાલીમ/માન્યતા/પરીક્ષણ. નિયંત્રણ: આ એક સમય શ્રેણી છે; ટેમ્પોરલ સ્પ્લિટિંગનો ઉપયોગ કરો (ભૂતકાળમાં ટ્રેન, ભવિષ્યમાં પરીક્ષણ). બેચ લીકેજ અટકાવો: એક જ ક્લસ્ટરમાં સમાન `ગ્રાહક_આઇડી` રાખો. માત્ર પ્રશિક્ષણ સમૂહમાંથી માપન પરિમાણોની ગણતરી કરો, પછી બધાને લાગુ કરો. દરેક પગલા પર કોડમાં કેટલી લીટીઓ બાકી છે તે છાપો અને એક ભારણ ઉમેરો કે જે કોઈ લીક નથી તેની તપાસ કરે છે.
આ લેબલીંગ કાર્ય માટે ડ્રાફ્ટ એનોટેશન માર્ગદર્શિકા લખો. કાર્ય: [દા.ત. લેબલ ગ્રાહક સમીક્ષા હકારાત્મક/નકારાત્મક/તટસ્થ] સરહદી કિસ્સાઓ સ્પષ્ટ કરો: કટાક્ષ, મિશ્ર લાગણી, ઉત્પાદન સાથે અસંબંધિત સમીક્ષાને કેવી રીતે લેબલ કરવું? 5 ઉદાહરણો અને 3 મુશ્કેલ કિસ્સાઓ આપો જે સમગ્ર ટેગર્સમાં સુસંગતતા વધારશે.
આ ડેટા પાઈપલાઈન માટે પુનઃઉત્પાદનક્ષમતા ચેકલિસ્ટ બનાવો:- ડેટા વર્ઝન કેવી રીતે ફિક્સ કરવું જોઈએ?- કયા રેન્ડમનેસ સીડ્સ ક્યાં સેટ કરવા જોઈએ?- કયા મેટાડેટા (ડેટા હેશ, પંક્તિની સંખ્યા, તારીખ) લોગ કરવા જોઈએ? મારો કોડબેઝ: [ભાષા/લાઇબ્રેરી]
ડેટા લીકેજ માટે આ ક્લીનઅપ કોડ તપાસો. ખાસ કરીને આને જુઓ: શું સ્કેલિંગ/એન્કોડિંગ પરિમાણોની ગણતરી વિભાજન પહેલાં કરવામાં આવે છે? શું કોઈપણ આંકડા બધા ડેટા અથવા ફક્ત તાલીમમાંથી ગણવામાં આવે છે? કોડ: [કોડ]
નિર્ણય કોષ્ટક: મૂલ્ય વ્યૂહરચના ખૂટે છે
સ્થિતિ
ભલામણ કરેલ અભિગમ
શા માટે
સંખ્યાત્મક, ત્રાંસુ વિતરણ
મધ્યક સાથે ભરો
સરેરાશ આઉટલિયર્સ દ્વારા પ્રભાવિત થાય છે
સંખ્યાત્મક, સપ્રમાણ
સરેરાશ સાથે ભરો
માહિતીનું રક્ષણ કરે છે
ઉણપ નોંધપાત્ર હોઈ શકે છે
ફ્લેગ કૉલમ + ભરો
અભાવ એ સંકેત છે
ખૂટતો દર > 60%
કૉલમનું મૂલ્યાંકન કરો/કાઢી નાખો
ઘોંઘાટ ખૂબ છે
વર્ગીકૃત
"અજ્ઞાત" શ્રેણી
કૃત્રિમ બહુમતી બનાવતી નથી
સામાન્ય ભૂલો
- ચકાસણી છોડવી. સ્કીમા નિયંત્રણ વિના, દૂષિત ડેટા ચુપચાપ અંદર જાય છે.
- વિભાજન પહેલાં સ્કેલિંગ. તે શિક્ષણમાં પરીક્ષાના આંકડાઓ લીક કરે છે.
- સમય શ્રેણીમાં રેન્ડમ વિભાજનનો ઉપયોગ કરવો. તે નકલી ઉચ્ચ મેટ્રિક્સ ઉત્પન્ન કરે છે.
- LLM લેબલ પર આંધળો વિશ્વાસ. પદ્ધતિસરની ભૂલ સમગ્ર ડેટામાં ફેલાય છે.
- ડેટા સંસ્કરણ સાચવી રહ્યું નથી. તમે પરિણામ પુનઃઉત્પાદિત કરી શકતા નથી.
- સરેરાશ સાથે યાંત્રિક ભરણ. તે ક્ષેત્રના અર્થને અવગણે છે, પૂર્વગ્રહ ઉમેરે છે.
સારાંશમાં
ડેટા પાઇપલાઇન એ ML સિસ્ટમનો પાયો છે અને મોડેલ કરતાં વધુ પ્રયત્નોને પાત્ર છે. ટોચ પર ચકાસણી મૂકો; ડોમેન જ્ઞાન સાથે સફાઈ અને લેબલીંગના નિર્ણયો લેવા; કમ્પાર્ટમેન્ટમાં લિકેજ (જૂથ અને ટેમ્પોરલ) અટકાવો; ડેટા સંસ્કરણ અને બીજને ઠીક કરો. AI આ લાઇન પર કોડ અને વિચારો જનરેટ કરે છે, પરંતુ તે તમારા પર નિર્ભર છે કે કયા ડેટા પર પ્રક્રિયા કરવી અને કેવી રીતે કરવી — કારણ કે અહીં દરેક ખોટો નિર્ણય છુપી ખામી તરીકે મોડેલમાં પસાર થાય છે.
એપ્લિકેશન કાર્ય
તમારા પોતાના ડેટાસેટ પર માન્યતા યોજના (પાન્ડેરા/ગ્રેટ એક્સપેક્ટેશન્સ) લખો અને જાણીજોઈને ખરાબ પંક્તિ ઉમેરો અને બતાવો કે તે પકડાઈ ગઈ છે. પછી ડેટાને અસ્થાયી રૂપે અથવા બેચવાઇઝ વિભાજિત કરો, માત્ર તાલીમમાંથી સ્કેલિંગ પરિમાણોની ગણતરી કરો અને ખાતરી કરો કે ત્યાં કોઈ લીકેજ નથી. મેટાડેટા ફાઇલમાં ડેટા વર્ઝન અને પંક્તિની ગણતરી લખો.
ચેકલિસ્ટ
- [ ] સ્કીમા માન્યતા લાઇનની ટોચ પર ચાલે છે.
- [ ] મેં ફીલ્ડ અર્થના આધારે ગુમ થયેલ મૂલ્ય વ્યૂહરચના પસંદ કરી, મેં તેને યાંત્રિક રીતે ભર્યું નથી.
- [ ] મેં લેબલની ગુણવત્તા માપી (અનુપાલન); મેં માનવ-તપાસ કરેલ LLM ટૅગ્સ.
- [] મેં ફલકમાં જૂથ અને ટેમ્પોરલ લિકેજને અટકાવ્યું.
- [ ] સ્કેલિંગ/એનકોડિંગની ગણતરી માત્ર તાલીમ સેટમાંથી કરવામાં આવે છે.
- [ ] ડેટા સંસ્કરણ, પંક્તિઓની સંખ્યા અને બીજ રેકોર્ડ કરેલ છે.