એકમો
1. ડેટા વિજ્ઞાન અને વિશ્લેષણમાં કૃત્રિમ બુદ્ધિનો પરિચય: વર્કફ્લો, ભૂમિકાઓ, સીમાઓ, માન્યતા અને નીતિશાસ્ત્ર 2. ડેટા કલેક્શન અને સોર્સ અન્ડરસ્ટેન્ડિંગ: સ્કીમા, સેમ્પલિંગ, ક્વોલિટી અને લીક અવેરનેસ 3. ડેટા ક્લીનિંગ અને પ્રીપ્રોસેસિંગ: ખૂટતું મૂલ્ય, આઉટલાયર અને પ્રકારનું રૂપાંતરણ 4. સંશોધનાત્મક ડેટા વિશ્લેષણ (EDA): વિતરણ, સંબંધો અને પ્રારંભિક આંતરદૃષ્ટિ 5. ફિચર એન્જિનિયરિંગ: વેરિઅન્ટ્સ જનરેટ કરવું, કોડિંગ, સ્કેલિંગ અને લિકેજ ટાળવું 6. મોડલ બિલ્ડીંગ: સમસ્યાની વ્યાખ્યા, અલ્ગોરિધમ પસંદગી અને તાલીમ/પરીક્ષણ વિભાજન 7. મોડલ મૂલ્યાંકન: મેટ્રિક્સ, ક્રોસ-વેલિડેશન અને એક્સ્ટ્રીમ લર્નિંગ 8. વિઝ્યુલાઇઝેશન અને સ્ટોરીટેલિંગ: સચોટ ગ્રાફિક્સ, પ્રમાણિક ગ્રાફિક્સ 9. કોડ જનરેશન: પાયથોન (પાંડા) અને SQL સાથે AI-આસિસ્ટેડ વિશ્લેષણ 10. ડેટા લિકેજ અને પુનઃઉત્પાદનક્ષમતા: સાયલન્ટ ડિઝાસ્ટર અને શિસ્ત 11. MLOps ફાઉન્ડેશન, એથિક્સ, પ્રાઈવસી અને રિસ્પોન્સિબલ એનાલિટિક્સ
એકમ 4 / 11

સંશોધનાત્મક ડેટા વિશ્લેષણ (EDA): વિતરણ, સંબંધો અને પ્રારંભિક આંતરદૃષ્ટિ

નફો:

  • યોગ્ય ગ્રાફ (હિસ્ટોગ્રામ, બોક્સ પ્લોટ, સ્કેટર પ્લોટ) સાથે ચલોના વિતરણ, કેન્દ્ર, સ્પ્રેડ અને વિસંગતતાઓનું અન્વેષણ કરવાની ક્ષમતા.
  • સહસંબંધને યોગ્ય રીતે અર્થઘટન કરવાની ક્ષમતા અને તેને કાર્યકારણ સાથે ગૂંચવણમાં મૂક્યા વિના, સ્કેટર પ્લોટ સાથે વાંચવાની ક્ષમતા
  • સારાંશના આંકડા ભ્રામક હોઈ શકે છે તે સમજવાની ક્ષમતા (એન્સકોમ્બે પાઠ) અને મોડેલિંગની દિશા નિર્ધારિત કરતી પૂર્વધારણાઓ વિકસાવવી.

મોડેલ બનાવતા પહેલા, ડેટા જાણવો જરૂરી છે. જેમ ડૉક્ટર દર્દીની તપાસ કર્યા વિના દવા લખી શકતા નથી, તેમ ડેટા સાયન્ટિસ્ટ ડેટાની "તપાસ" કર્યા વિના મોડેલ બનાવતા નથી. આ પરીક્ષાને એક્સપ્લોરેટરી ડેટા એનાલિસિસ (ટૂંકમાં EDA) કહેવામાં આવે છે: તે ડેટાના વિતરણ, સંબંધો, આશ્ચર્ય અને જાળને દૃષ્ટિની અને ગ્રાફિકલી રીતે શોધવાનો તબક્કો છે. EDA નો હેતુ પૂર્વધારણાઓ જનરેટ કરવાનો, ભૂલો પકડવાનો અને મોડેલિંગ દિશા નિર્ધારિત કરવાનો છે. આ તબક્કે કૃત્રિમ બુદ્ધિ એ ખૂબ જ શક્તિશાળી સહાયક છે: તે સૂચવે છે કે કયો ચાર્ટ યોગ્ય છે, તેનો કોડ લખે છે, વિતરણનું અર્થઘટન કરે છે. પરંતુ વ્યક્તિ તેના/તેણીના ક્ષેત્રના જ્ઞાન સાથે નક્કી કરે છે કે તે જે પેટર્ન જુએ છે તે વાસ્તવિક છે કે સંયોગ.

EDA શું શોધે છે?

EDA ચાર પ્રશ્નોના જવાબ માંગે છે. વિતરણ: દરેક ચલ કેવી રીતે વિતરિત થાય છે - શું તે સપ્રમાણ, ત્રાંસી અથવા બે-શિખર છે? કેન્દ્રીય વલણ અને ફેલાવો: સરેરાશ, મધ્ય, પ્રમાણભૂત વિચલન શું છે? સંબંધો: ચલો એકબીજા સાથે કેવી રીતે સંબંધિત છે? વિસંગતતાઓ: શું ત્યાં અનપેક્ષિત મૂલ્યો, ગાબડાં, જૂથો છે? આ ચાર પ્રશ્નો નક્કી કરે છે કે કઈ સુવિધા કામ કરશે અને કયું મોડેલ યોગ્ય છે.

ચાલો કેટલાક મૂળભૂત ખ્યાલો વ્યાખ્યાયિત કરીએ. હિસ્ટોગ્રામ એ એક ગ્રાફ છે જે સંખ્યાત્મક ચલના મૂલ્યોને અંતરાલોમાં વિભાજિત કરે છે અને દર્શાવે છે કે દરેક અંતરાલમાં કેટલા અવલોકનો છે; વિતરણ જોવાની તે સૌથી ઝડપી રીત છે. Skewness એ એક દિશામાં વિતરણની પાળી છે; આવક જેવા ચલો જમણી તરફ વળેલા છે (બહુમતી ઓછી, થોડી ઘણી ઊંચી). એક બોક્સ પ્લોટ એક નજરમાં મધ્યક, ચતુર્થાંશ અને આઉટલાયર બતાવે છે. સ્કેટર પ્લોટ પોઈન્ટના વાદળ સાથે બે સંખ્યાત્મક ચલોનો સંબંધ દર્શાવે છે.

સહસંબંધ: સંબંધ છે પરંતુ સાવચેત રહો

સહસંબંધ - બે ચલો એકસાથે કેવી રીતે આગળ વધે છે તેનું માપ; -1 અને +1 વચ્ચેની સંખ્યા — એ EDA નું સૌથી વધુ વપરાતું અને સૌથી વધુ ગેરસમજ થયેલું સાધન છે. +1 એટલે સંપૂર્ણ સહ-વધારો, -1 એટલે સંપૂર્ણ વ્યસ્ત સંબંધ, 0 એટલે કોઈ રેખીય સંબંધ નથી. બે મોટા ફાંસો છે. પ્રથમ, પ્રખ્યાત નિયમ: સહસંબંધ એ કારણ નથી. આઈસ્ક્રીમના વેચાણ સાથે ગૂંગળામણના કેસમાં વધારો; એટલા માટે નહીં કે એક બીજા તરફ દોરી જાય છે, પરંતુ કારણ કે ઉનાળો (છુપાયેલ ત્રીજો ચલ) બંનેને ટ્રિગર કરે છે. બીજું, સહસંબંધ માત્ર રેખીય સંબંધને માપે છે; તે 0 ની નજીકના મજબૂત પરંતુ વળાંકવાળા સંબંધને સૂચવી શકે છે. તેથી સહસંબંધને જોતી વખતે, સ્કેટર પ્લોટને પણ જોવાની ખાતરી કરો.

સાવધાન: જ્યારે AI સહસંબંધ નંબર આપે છે, ત્યારે તે કારણભૂત ભાષામાં સરકી શકે છે જેમ કે "A વધે છે B." આ ખતરનાક છે. સહસંબંધ માત્ર એકસાથે ચળવળ સૂચવે છે; માત્ર અનુભવ, ડોમેન જ્ઞાન અને સાવચેત અનુમાન જ કારણ સ્થાપિત કરે છે.

Anscombe ચોકડી: શા માટે માત્ર નંબર જોવા નથી

આંકડાઓમાં એક પ્રખ્યાત ઉદાહરણ છે: એન્સકોમ્બે ચોકડી. ચાર અલગ-અલગ ડેટા સેટમાં લગભગ સમાન સરેરાશ, સમાન ભિન્નતા અને સમાન સહસંબંધ (0.82); પરંતુ જ્યારે આલેખ કરવામાં આવે છે, ત્યારે તેઓ સંપૂર્ણપણે અલગ દેખાય છે - એક સીધી રેખા, એક વક્ર, એક વાદળ એક જ આઉટલાયર દ્વારા ખેંચાય છે. પાઠ સ્પષ્ટ છે: સારાંશના આંકડા ભ્રામક છે, ગ્રાફ જોવો આવશ્યક છે. AI તમને સરેરાશ અને સહસંબંધો આપી શકે છે, પરંતુ ગ્રાફ જોયા વિના તે નંબરો પર વિશ્વાસ કરવો એ Anscombe ટ્રેપમાં ફસાઈ જાય છે.

નીચેનું કોષ્ટક સારાંશ આપે છે કે કયો ચાર્ટ કયા પ્રશ્ન સાથે બંધબેસે છે:

પ્રશ્ન

યોગ્ય ગ્રાફિક

શું બતાવે છે

એક ચલનું વિતરણ

હિસ્ટોગ્રામ / KDE

આકાર, ત્રાંસીપણું, શિરોબિંદુઓની સંખ્યા

કેન્દ્ર અને બહારના

બોક્સ પ્લોટ

મધ્યક, ચતુર્થાંશ, આઉટલાયર

બે સંખ્યાનો સંબંધ

સ્કેટર ચાર્ટ

દિશા, તાકાત, વક્રતા

શ્રેણી સરખામણી

બાર ચાર્ટ

જૂથો વચ્ચે તફાવત

સમય સાથે બદલાવ

રેખા ચાર્ટ

વલણ, મોસમ

બહુવિધ સંબંધ

સહસંબંધ ગરમી નકશો

સામાન્ય સંબંધ મેટ્રિક્સ

સિમ્પસનનો વિરોધાભાસ: એકીકૃત ડેટા જૂઠું બોલી શકે છે

EDA માં એક સ્નીકી ટ્રેપ છે જેનાથી વાકેફ થવું એ સિમ્પસનનો વિરોધાભાસ છે: જ્યારે તમામ ડેટાને એકસાથે તપાસવામાં આવે ત્યારે પેટર્ન એક દિશા બતાવી શકે છે, પરંતુ જ્યારે ડેટાને અર્થપૂર્ણ પેટાજૂથોમાં વિભાજિત કરવામાં આવે ત્યારે વિપરીત. ઉત્તમ ઉદાહરણ: યુનિવર્સિટીમાં સ્ત્રી અરજદારો માટે એકંદરે સ્વીકૃતિ દર પુરૂષો કરતાં ઓછો હોય તેવું લાગે છે; પરંતુ જ્યારે વિભાગ દ્વારા વિભાગને જોવામાં આવે છે, ત્યારે મોટાભાગના વિભાગોમાં પુરૂષો કરતાં સ્ત્રીઓનો સ્વીકૃતિ દર વધારે છે. ક્યાંથી? મહિલાઓએ વધુ સ્પર્ધાત્મક (નીચા સ્વીકૃતિ દર) વિભાગોમાં અરજી કરી; સંયુક્ત સંખ્યા આ છુપાયેલા ચલને સંગ્રહિત કરે છે. પાઠ સ્પષ્ટ છે: કુલ અથવા સરેરાશ જોતી વખતે, અર્થપૂર્ણ પેટાજૂથો (સેગમેન્ટ, પીરિયડ, ચેનલ) માં વિભાજિત કરવામાં આવે ત્યારે તે સંખ્યા સમાન વાર્તા કહે છે કે કેમ તે તપાસવાનું નિશ્ચિત કરો. જ્યારે AI તમને સંયુક્ત દર આપે છે, ત્યારે પૂછવામાં આવે છે કે "શું તે હજુ પણ માન્ય છે જ્યારે તમે તેને વિભાજિત કરો છો" તો મોટાભાગના ગેરમાર્ગે દોરનારા પરિણામો શરૂઆતમાં જ આવશે.

ત્રણ નાના કેસો

કેસ 1 - બે છુપાયેલી ટેકરીઓ. એક વિશ્લેષકે સરેરાશ ગ્રાહકની ઉંમર 41 હોવાનું શોધી કાઢ્યું અને તેને "મધ્યમ વયની ભીડ" તરીકે જાણ કરી. પરંતુ હિસ્ટોગ્રામ બે શિખરો દર્શાવે છે: 22-28 અને 55-62 વય જૂથો. સરેરાશ 41 એ ખરેખર કોઈનું પ્રતિનિધિત્વ કર્યું નથી. પાઠ: સરેરાશ પર વિશ્વાસ કરતા પહેલા વિતરણનું કાવતરું બનાવો.

કેસ 2 - બનાવટી સહસંબંધ. એક ટીમે "જાહેરાત ખર્ચ" અને "વેચાણ" વચ્ચે 0.78 સહસંબંધ શોધી કાઢ્યો અને બજેટને બમણું કર્યું. જો કે, બંને મોસમી ઝુંબેશને કારણભૂત બનાવે છે; ઝુંબેશની બહારના સમયગાળા દરમિયાન, સંબંધ ઘટીને 0.10 થઈ ગયો. 340 હજાર TL વધારાની જાહેરાતથી અપેક્ષિત વળતર મળ્યું નથી. પાઠ: કાર્યકારણ માટે સહસંબંધની ભૂલ કરવી ખર્ચાળ છે.

કેસ 3 - એકલા વિરોધી દ્વારા દોરવામાં આવેલી રેખા. રિયલ એસ્ટેટ વિશ્લેષણે ચોરસ ફૂટેજ અને કિંમત (r=0.80) વચ્ચે મજબૂત સંબંધ દર્શાવ્યો હતો. જ્યારે સ્કેટર પ્લોટ દોરવામાં આવ્યો હતો, ત્યારે લગભગ સમગ્ર સંબંધ એક જ 12 મિલિયન TL લક્ઝરી વિલા દ્વારા બનાવવામાં આવ્યો હતો; જ્યારે તે બિંદુ દૂર કરવામાં આવ્યું હતું, ત્યારે સહસંબંધ ઘટીને 0.31 થયો હતો. પાઠ: હંમેશા સ્કેટર પ્લોટ સાથે સહસંબંધ વાંચો.

ચાર નકલ કરી શકાય તેવા નમૂનાઓ

1) આપોઆપ EDA સારાંશ:

મારી પાસે પાંડા ડીએફ છે. કોડ લખો જે બનાવે છે: (1) df.info() અને df.describe(), (2) દરેક આંકડાકીય કૉલમ માટે હિસ્ટોગ્રામ, (3) દરેક વર્ગીકૃત કૉલમ માટે ગણતરી. ટિપ્પણી કરશો નહીં, ફક્ત શોધ કોડ જનરેટ કરો; હું પેટર્નનું અર્થઘટન કરું છું.

2) સહસંબંધ + દ્રશ્ય (કારણકારણની ચેતવણી સાથે):

કોડ લખો જે આંકડાકીય કૉલમ માટે સહસંબંધ મેટ્રિક્સ અને હીટ મેપ દોરે છે. 3 સૌથી વધુ સહસંબંધિત જોડીનો સ્કેટર પ્લોટ પણ દોરો. આઉટપુટમાં એક ટિપ્પણી લાઇન ઉમેરો જે તમને યાદ કરાવે છે કે સહસંબંધ કારણભૂત નથી. કારણભૂત દાવાઓ ન કરો.

3) વિતરણ નિદાન:

"આવક_ટીએલ" કૉલમ માટે: કોડ લખો જે હિસ્ટોગ્રામ, બૉક્સ પ્લોટ, સ્ક્યુનેસ મૂલ્ય અને સરેરાશ/સરળ સરખામણી બનાવે છે. હું અર્થઘટન કરીશ કે શું વિતરણ ત્રાંસુ છે કે નહીં; માત્ર કોડ આપો.

4) સેગમેન્ટ સરખામણી:

"ચેનલ" (વેબ/મોબાઇલ) દ્વારા ગ્રાહકોની તુલના કરો: કોડ લખો જે દરેક ચેનલ માટે સરેરાશ રકમ, સરેરાશ રકમ, ઓર્ડરની સંખ્યા અને રકમ વિતરણનો બોક્સપ્લોટ બનાવે છે. બે ચેનલો વચ્ચેના તફાવતના આંકડાકીય મહત્વ માટે કયું પરીક્ષણ યોગ્ય છે તે સૂચવો, પરંતુ નિર્ણય મારા પર છે.

નબળા પ્રોમ્પ્ટ / મજબૂત પ્રોમ્પ્ટ

નબળા પ્રોમ્પ્ટ:

આ ડેટામાં કંઈક રસપ્રદ શોધો.

"રસપ્રદ" અવ્યાખ્યાયિત છે; AI ડેટા જોતું નથી, તેથી તે કાં તો તેને બનાવે છે અથવા સામાન્ય નિવેદનો આપે છે. ત્યાં કોઈ દિશા નથી, કોઈ ચલ નથી, કોઈ હેતુ નથી.

શક્તિશાળી પ્રોમ્પ્ટ:

તમારી ભૂમિકા: EDA સહાયક. df કૉલમ્સ: ઉંમર (int), Income_tl (ફ્લોટ), શહેર (શ્રેણી), ચેનલ (વેબ/મોબાઇલ), રકમ (ફ્લોટ). હેતુ: "રકમ" ને અસર કરતા પરિબળોને શોધવા માટે. કાર્ય: (1) રકમના વિતરણનો કોડ, (2) રકમ અને વય અને આવક વચ્ચેના વિતરણ ગ્રાફ, (3) ચેનલ બ્રેકડાઉનમાં રકમનો બોક્સ પ્લોટ. કારણભૂત દાવાની સ્થાપના; ફક્ત શોધ કોડ જનરેટ કરો અને હું પેટર્નનું અર્થઘટન કરીશ.

અહીં, હેતુ, ચલ અને "કારણકારણનો દાવો કરવાની" મર્યાદા સ્પષ્ટ છે.

સામાન્ય ભૂલો

  • માત્ર સારાંશના આંકડા પર આધાર રાખવો. Anscombe ચોકડી બતાવે છે તેમ, સમાન સરેરાશ ખૂબ જ અલગ વિતરણોને છુપાવે છે; ચાર્ટ જુઓ.
  • કાર્યકારણ માટે સહસંબંધની ભૂલ. સહ-ક્રિયા સૂચવે નથી કે એક બીજા તરફ દોરી જાય છે; છુપાયેલા ચલોથી સાવધ રહો.
  • છૂટાછવાયા પ્લોટ વિના સહસંબંધ જોવું. એક જ આઉટલીયર અથવા વક્રતા નંબરને ગેરમાર્ગે દોરે છે.
  • સરેરાશ સાથે દ્વિ-શિખર/ત્રાંસી વિતરણનો સારાંશ. સરેરાશ કોઈનું પ્રતિનિધિત્વ ન કરી શકે.
  • EDA છોડો અને સીધા મોડેલ પર જાઓ. અજાણ્યો ડેટા એટલે અંધ મોડેલ.
ટીપ: દરેક નવા ડેટા સેટ સાથે, પ્રથમ 30 મિનિટ માત્ર ગ્રાફ દોરવા માટે વિતાવો: દરેક આંકડાકીયનો હિસ્ટોગ્રામ, નોંધપાત્ર જોડીનો સ્કેટર પ્લોટ, શ્રેણીઓનો બાર ચાર્ટ. આ 30 મિનિટ આવનારા દિવસો માટે ભાવિ મોડેલિંગ ભૂલોને અટકાવે છે.

સારાંશમાં

EDA એ મોડેલ બનાવતા પહેલા ડેટા જાણવાનો તબક્કો છે અને ચાર પ્રશ્નોના જવાબો શોધે છે: વિતરણ, કેન્દ્ર-સ્પ્રેડ, સંબંધો અને વિસંગતતાઓ. સારાંશના આંકડા ભ્રામક હોઈ શકે છે; ગ્રાફ જોવો અનિવાર્ય છે (એન્સકોમ્બે વ્યાખ્યાન). સહસંબંધ એ એક શક્તિશાળી સાધન છે, પરંતુ કાર્યકારણ નથી અને ચોક્કસપણે સ્કેટર પ્લોટ સાથે વાંચવું જોઈએ. ગ્રાફિક્સ અને કોડ લખવાનું સૂચન કરવા માટે AI એ એક ઉત્તમ પ્રવેગક છે; પરંતુ લોકો તેમના ક્ષેત્રના જ્ઞાન સાથે અર્થઘટન કરે છે કે તેઓ જે પેટર્ન જુએ છે તે વાસ્તવિક છે કે સંયોગ.

એપ્લિકેશન કાર્ય

ડેટાસેટ પસંદ કરો અને ફક્ત EDA કરો: ઓછામાં ઓછા ત્રણ આંકડાકીય ચલોનો હિસ્ટોગ્રામ, ચલોની બે જોડીનો સ્કેટર પ્લોટ અને સહસંબંધ ગરમીનો નકશો કાઢો. ઓછામાં ઓછું એક "આશ્ચર્ય" શોધો (જેમ કે બે શિખરો સાથેનું વિતરણ, બનાવટી સહસંબંધ માટે ઉમેદવાર, એક જ આઉટલીયર દ્વારા આકર્ષાયેલ સંબંધ) અને તેને એક વાક્યમાં સમજાવો. કોઈપણ કારણદર્શક દાવા કર્યા વિના લખો.

ચેકલિસ્ટ

  • [ ] શું મેં દરેક સંખ્યાત્મક ચલના વિતરણનો આલેખ કર્યો છે?
  • [ ] શું મેં સ્કેટરપ્લોટ સાથેના સહસંબંધો જોયા છે?
  • શું મેં કાર્યકારણ અને સહસંબંધને અલગ રાખ્યા છે?
  • [ ] શું મેં ત્રાંસી અથવા બે-પીક વિતરણની નોંધ લીધી નથી અને સરેરાશ પર આંધળો વિશ્વાસ કર્યો છે?
  • [ ] શું મેં મારા EDA તારણોમાંથી ઓછામાં ઓછું એક મોડેલિંગ પાસું/પૂર્તિધારણ મેળવ્યું છે?