એકમો
1. અર્થશાસ્ત્ર અને આંકડામાં કૃત્રિમ બુદ્ધિ: ભૂમિકાઓ, સીમાઓ, પ્રમાણીકરણ અને ગોપનીયતા 2. ડેટા ક્લીનિંગ અને તૈયારી: ખૂટે છે ડેટા, આઉટલિયર્સ અને કોડિંગ 3. સંશોધનાત્મક ડેટા વિશ્લેષણ અને વિઝ્યુલાઇઝેશન: આર્ટિફિશિયલ ઇન્ટેલિજન્સ સાથે ગ્રાફિંગ અને અર્થઘટન 4. લીનિયર રીગ્રેશન: મોડલ બિલ્ડીંગ, ગુણાંક અર્થઘટન અને ધારણાઓ 5. રીગ્રેસન ડાયગ્નોસ્ટિક્સ અને ઉલ્લંઘન: સમકક્ષતા, હેટરોસેડેસ્ટીસીટી, સ્વતઃસંબંધ 6. પૂર્વધારણા પરીક્ષણ અને p-મૂલ્ય: મહત્વ, શક્તિ અને બહુવિધ સરખામણીઓ 7. પી-હેકિંગ, હાર્કિંગ અને આંકડાકીય અખંડિતતા: આર્ટિફિશિયલ ઇન્ટેલિજન્સના યુગમાં મુશ્કેલીઓ 8. સમય શ્રેણી વિશ્લેષણ: સ્થિરતા, ARIMA અને આગાહી 9. કારણ અને નીતિ વિશ્લેષણ: DiD, IV, RDD અને આર્ટિફિશિયલ ઇન્ટેલિજન્સ 10. કોડ જનરેશન અને પ્રજનનક્ષમતા: R/Python, વર્ઝનિંગ અને રિપ્રોડ્યુસિબિલિટી 11. અહેવાલ લેખન, સંદેશાવ્યવહાર અને નૈતિકતા: પ્રસ્તુત પરિણામો અને સંચાર સીમાઓ
એકમ 3 / 11

સંશોધનાત્મક ડેટા વિશ્લેષણ અને વિઝ્યુલાઇઝેશન: આર્ટિફિશિયલ ઇન્ટેલિજન્સ સાથે ગ્રાફિંગ અને અર્થઘટન

નફો:

  • આર્ટિફિશિયલ ઇન્ટેલિજન્સ સપોર્ટ સાથે વર્ણનાત્મક આંકડા અને વિતરણ/સંબંધ ચાર્ટ બનાવવાની ક્ષમતા અને ડેટા અને પ્રશ્ન અનુસાર યોગ્ય ચાર્ટ પ્રકાર પસંદ કરો
  • કૃત્રિમ બુદ્ધિમત્તા દ્વારા ઉત્પાદિત છબીઓમાં ગેરમાર્ગે દોરતી પસંદગીઓ (ડૅશેડ અક્ષ, અયોગ્ય સ્કેલ, અતિશય સ્મૂથિંગ) ઓળખવાની ક્ષમતા અને પ્રમાણિક વિઝ્યુલાઇઝેશન સિદ્ધાંતો લાગુ કરવા
  • તે પારખવામાં સક્ષમ બનવું એ સંશોધનાત્મક વિશ્લેષણ પૂર્વધારણાઓ પેદા કરવા માટે છે અને સમાન ડેટા (જે પી-હેકિંગના દરવાજા ખોલે છે) સાથે શોધ અને પુષ્ટિ કરવાની છટકું છે.

ડેટા સાફ કર્યા પછી, પ્રયોગમૂલક સંશોધકનું પ્રથમ કામ તેને જાણવાનું છે. આ તબક્કાને એક્સપ્લોરેટરી ડેટા એનાલિસિસ (EDA - એક્સપ્લોરેટરી ડેટા એનાલિસિસ) કહેવામાં આવે છે: તે આલેખ અને સારાંશના આંકડાઓ સાથે ડેટાને તપાસવાની અને તેની રચના, પેટર્ન અને આશ્ચર્યને જોવાની પ્રક્રિયા છે. ઉદ્દેશ્ય હજુ સુધી કોઈ પૂર્વધારણાને ચકાસવાનો નથી, પરંતુ ડેટાથી પરિચિત થવાનો, પ્રશ્નો પેદા કરવા અને ભવિષ્યમાં તમે જે મોડેલ બનાવશો તેના માટે પાયાનું કામ કરવું. આ એકમમાં, આપણે જોઈશું કે આર્ટિફિશિયલ ઈન્ટેલિજન્સ (AI) EDA અને વિઝ્યુઅલાઈઝેશનને કેવી રીતે વેગ આપે છે, પરંતુ તે જે ગ્રાફિક્સ ઉત્પન્ન કરે છે તેનું ધ્યાનપૂર્વક ઓડિટ કરવું જોઈએ.

ચાલો પહેલા બે મૂળભૂત તફાવતો કરીએ. પ્રથમ, વર્ણનાત્મક આંકડાઓ (સંખ્યાઓ કે જે ડેટાનો સારાંશ આપે છે જેમ કે સરેરાશ, મધ્ય, પ્રમાણભૂત વિચલન, ચતુર્થાંશ) અને વિઝ્યુલાઇઝેશન (સમાન માહિતીને ગ્રાફિકલી દર્શાવે છે) એકબીજાના પૂરક છે; તેઓ એકસાથે ડેટાનું વર્ણન કરે છે. બીજું, અને સૌથી મહત્વપૂર્ણ: શોધ અને પુષ્ટિને અલગ પાડવી આવશ્યક છે. સંશોધનાત્મક વિશ્લેષણ પૂર્વધારણાઓ પેદા કરવા માટે છે; સમાન ડેટા સાથે પૂર્વધારણાનું અન્વેષણ કરવું અને "મેં તેનું પરીક્ષણ કર્યું અને તે નોંધપાત્ર જણાયું" કહેવાથી પી-હેકિંગનો દરવાજો ખુલે છે, જે આપણે આગામી એકમમાં જોઈશું. ડેટા જોવા અને પેટર્ન જોવા માટે તે મફત છે; પરંતુ તે જ ડેટામાં તે પેટર્નને "સાબિત શોધ" જાહેર કરવી ભ્રામક છે.

પગલું દ્વારા પગલું સંશોધન વિશ્લેષણ

1. એકીકૃત દૃશ્ય. દરેક ચલને વ્યક્તિગત રીતે તપાસો: શું તેનું વિતરણ સપ્રમાણ છે કે ત્રાંસુ છે; ત્યાં કેટલી ટેકરીઓ છે; બહારના લોકો ક્યાં છે? સંખ્યાત્મક ચલો માટે, હિસ્ટોગ્રામ (મૂલ્યોને શ્રેણીઓમાં વિભાજિત કરીને આવર્તન દર્શાવતો પ્લોટ) અને બોક્સપ્લોટ (બોક્સપ્લોટ — મધ્ય, ચતુર્થાંશ અને આત્યંતિક મૂલ્યો દર્શાવતો ચાર્ટ); સ્પષ્ટ ચલો માટે, આવર્તન કોષ્ટકો અને બાર ચાર્ટનો ઉપયોગ કરો.

2. બાયવેરિયેટ વ્યુ. બે ચલો વચ્ચેનો સંબંધ જુઓ: બે આંકડાકીય ચલો માટે સ્કેટર પ્લોટ (દરેક અવલોકનને x-y પ્લેન પર એક બિંદુ તરીકે બતાવે છે), સંખ્યાત્મક-વર્ગીય માટે જૂથબદ્ધ બોક્સ પ્લોટ, બે વર્ગીકૃત માટે ક્રોસટેબ. સહસંબંધ ગુણાંકને જોતા પહેલા, સ્કેટર પ્લોટને જોવાની ખાતરી કરો: સમાન સહસંબંધ ખૂબ જ અલગ પેટર્ન બતાવી શકે છે (વિખ્યાત એન્સકોમ્બે ચોકડી આ દર્શાવે છે; ચાર ડેટા સેટમાં લગભગ સમાન આંકડા હોય છે, પરંતુ જ્યારે પ્લોટ કરવામાં આવે ત્યારે તે સંપૂર્ણપણે અલગ હોય છે).

3. સાચો ચાર્ટ પ્રકાર પસંદ કરો. ચાર્ટનો પ્રકાર તમારા પ્રશ્ન અને ડેટા પ્રકાર પર આધારિત છે. વિતરણ માટે હિસ્ટોગ્રામ; સંબંધ માટે છૂટાછવાયા; સમય સાથે ફેરફાર માટે રેખા ચાર્ટ; શ્રેણી સરખામણી માટે બાર ચાર્ટ; સમગ્ર ભાગોના ગુણોત્તર માટે (કાળજીપૂર્વક) સ્ટેક્ડ બાર. AI તમારા માટે ઝડપથી કોડ જનરેટ કરે છે, પરંતુ "કયા પ્રશ્ન માટે કયો ગ્રાફ" નો નિર્ણય તમારો છે.

4. પેટર્નની નોંધ લો, પરિણામો જાહેર કરશો નહીં. તમે "શોધ નોંધ" તરીકે જુઓ છો તે કોઈપણ રસપ્રદ પેટર્નને રેકોર્ડ કરો, પરંતુ તેને પુષ્ટિ થયેલ શોધ ગણશો નહીં. પુષ્ટિ એક અલગ પગલામાં કરવામાં આવે છે, પ્રાધાન્યમાં અલગ ડેટા અથવા પૂર્વનિર્ધારિત શેડ્યૂલ સાથે.

પ્રામાણિક વિઝ્યુલાઇઝેશન સિદ્ધાંતો

ગ્રાફિક ખાતરી આપે છે; તેથી, તેની ગેરમાર્ગે દોરવાની શક્તિ પણ વધારે છે. AI સૌંદર્યલક્ષી પરંતુ ક્યારેક ભ્રામક પસંદગીઓ કરી શકે છે. આ નીતિઓ તપાસો:

  • બાર ચાર્ટમાં, y-અક્ષ શૂન્યથી શરૂ થવો જોઈએ. ડૅશ કરેલ અક્ષ નાના તફાવતો મોટા તરીકે દર્શાવે છે.
  • સ્કેલ સુસંગત હોવું જોઈએ. જો બે ચાર્ટની સરખામણી કરવામાં આવી રહી હોય, તો સમાન અક્ષ શ્રેણીનો ઉપયોગ કરો.
  • વધુ પડતી સ્મૂથિંગ સાચી પેટર્ન છુપાવી શકે છે. ટ્રેન્ડ લાઇન સરસ લાગે છે, પરંતુ જો તે ડેટાને વધુ પડતો "સુગમ" કરે છે, તો તે ભ્રામક બની શકે છે.
  • રંગ અને 3D શણગાર ધ્યાન વિકૃત કરે છે, ડેટા નહીં. સરળતા પસંદ કરો.
  • ખૂટતો ડેટા અને નમૂનાનું કદ દૃશ્યમાન હોવું જોઈએ. "n=12" અને "n=12,000" એકસરખા ન દેખાવા જોઈએ.
ધ્યાન: AI દ્વારા ઉત્પાદિત ગ્રાફિક્સ સુંદર હોવાને કારણે, તે સાચા નથી. તે જે સૌથી સામાન્ય ભૂલ કરે છે તે બાર ચાર્ટમાં અક્ષને શૂન્યથી શરૂ ન કરવાની અને બે જૂથો વચ્ચેના તફાવતને અતિશયોક્તિ કરવાની છે. હંમેશા ધરી તપાસો.

સરખામણી ચાર્ટ: પ્રશ્ન → ચાર્ટ

પૂછો

સાચો ચાર્ટ

સામાન્ય ભૂલ

આ ચલ કેવી રીતે વિતરિત થાય છે?

હિસ્ટોગ્રામ/બોક્સ પ્લોટ

પાઇ ચાર્ટનો ઉપયોગ કરો

શું બે આંકડાકીય ચલો સંબંધિત છે?

સ્કેટર પ્લોટ

માત્ર સહસંબંધોની સંખ્યા જોઈ રહ્યા છીએ

તે સમય સાથે કેવી રીતે બદલાયો છે?

રેખા ચાર્ટ

બાર ચાર્ટ વડે વલણ જણાવવું

જૂથો વચ્ચે શું તફાવત છે?

જૂથબદ્ધ બોક્સ/બાર (શરૂઆતથી)

કાપેલી ધરીની લાકડી

પાર્ટ-ટુ-હોલ રેશિયો?

સ્ટૅક્ડ બાર (સાવધાની સાથે)

મલ્ટિ-સ્લાઇસ પાઇ ચાર્ટ

ચાર નકલ કરી શકાય તેવા સંકેતો

1. સ્વતઃ શોધ કોડ:

તમારી ભૂમિકા: EDA સહાયક. હું ડેટા શેર કરતો નથી, મને R (ggplot2) કોડ જોઈએ છે. 'ડેટા' ડેટા ફ્રેમમાં સંખ્યાત્મક (આવક, ઉંમર, ખર્ચ) અને વર્ગીકૃત (પ્રદેશ, શિક્ષણ) ચલ છે. કાર્ય: કોડ લખો જે દરેક આંકડાકીય માટે હિસ્ટોગ્રામ, દરેક વર્ગીકૃત માટે બાર ચાર્ટ અને આવક~વય માટે સ્કેટર પ્લોટ બનાવે છે. બાર ચાર્ટમાં, y-અક્ષને ZERO થી શરૂ થવા દો. ટિપ્પણી લાઇન ઉમેરો.

2. સહસંબંધ સમીક્ષા (સંબંધ + દ્રશ્ય એકસાથે):

કોડ લખો કે જે બંને આવક અને ખર્ચ માટે પીયર્સન સહસંબંધની ગણતરી કરે છે અને સ્કેટર પ્લોટ + રેખીય વલણ દર્શાવે છે. સહસંબંધ ગણતરી (Anscombe ચેતવણી) પર વિશ્વાસ કરતા પહેલા ચાર્ટની તપાસ કરવા માટે મને યાદ કરાવતી ટિપ્પણી લાઇન ઉમેરો. વલણ રેખાને વધુ પડતી સરળ ન કરો.

3. અખંડિતતા ઓડિટ:

પ્રમાણિક વિઝ્યુલાઇઝેશન માટે નીચેનો ggplot કોડ તપાસો:[code]. નીચેનાને તપાસો અને સુધારો: શું y-અક્ષ શૂન્યથી શરૂ થાય છે, શું સ્કેલ સુસંગત છે, શું નમૂનાનું કદ દૃશ્યમાન છે, શું વધુ પડતું સ્મૂથિંગ છે? તમે કરેલા દરેક સુધારા માટેનું સમર્થન સમજાવો.

4. શોધ નોંધ બનાવવી (શોધ નથી):

હું બનાવેલ ગ્રાફના આધારે, અવલોકનોને 'શોધ નોંધ' તરીકે સૂચિબદ્ધ કરો; દરેક વસ્તુને 'પરીક્ષણ કરવા માટે પૂર્વધારણા'ની ભાષામાં લખો, 'નિર્ણાયક શોધ' નહીં. ઉદાહરણ: 'ઉચ્ચ શિક્ષણમાં આવક વધુ ફેલાયેલી દેખાય છે; અલગ ડેટા સાથે પરીક્ષણ કરવું જોઈએ.' કારણભૂત અને નિશ્ચિત નિવેદનો ટાળો.

નબળા પ્રોમ્પ્ટ / મજબૂત પ્રોમ્પ્ટ

નબળા પ્રોમ્પ્ટ:

ઉપજમાંથી સરસ આલેખ બનાવો અને મને કહો કે તેનો અર્થ શું છે.

આ પ્રોમ્પ્ટ ભ્રામક આઉટપુટને આમંત્રણ આપે છે: "સુંદર" સૌંદર્ય શાસ્ત્ર પર ધ્યાન કેન્દ્રિત કરે છે, જ્યારે "તેનો અર્થ શું છે" એઆઈને શોધમાંથી ચોક્કસ નિષ્કર્ષ પર જવા માટે દબાણ કરે છે. કારણભૂત, અતિશયોક્તિપૂર્ણ ટિપ્પણીઓ અનુસરે છે.

શક્તિશાળી પ્રોમ્પ્ટ:

તમારી ભૂમિકા: પ્રામાણિક EDA સહાયક. કાર્ય: (1) મારા પ્રશ્નને અનુરૂપ ચાર્ટનો પ્રકાર પસંદ કરો અને વાજબીતા લખો, (2) બાર ચાર્ટમાં શૂન્યથી અક્ષ શરૂ કરો, (3) ડિસ્કવરી નોટની ભાષામાં આઉટપુટનું અર્થઘટન કરો: કોઈ ચોક્કસ/કારણકારી દાવો "પરીક્ષણ કરવું આવશ્યક છે" માં પૂર્વધારણા સૂચવતો નથી, જો હું નાનો નમૂનો (3) યુદ્ધ (4) ચલાવીશ, તો (3) મારા પોતાના વાતાવરણમાં ચાર્ટ બનાવો અને તેને ચકાસો.

તફાવત: મજબૂત ઇચ્છા ચાર્ટના પ્રકારને ન્યાયી ઠેરવે છે, પ્રમાણિકતાના નિયમો લાદે છે અને પુષ્ટિ સાથે શોધને ગૂંચવતું નથી.

ત્રણ નાના કેસો

કેસ 1 - અલગ અક્ષ અતિશયોક્તિ. એક વિશ્લેષકે બાર ચાર્ટમાં બે શાખાઓ (7.8 અને 8.0; 10માંથી) ના સંતોષ સ્કોર્સ દર્શાવ્યા. 7.5 થી YZ અક્ષ શરૂ કરતી વખતે, બીજી શાખા પ્રથમ કરતા લગભગ બમણી ઊંચી દેખાય છે; જ્યારે તફાવત માત્ર 2.5% હતો. મેનેજમેન્ટ ખોટી છાપ હેઠળ શાખાને ઈનામ આપવાનું હતું. જ્યારે મેં શરૂઆતથી ધરી શરૂ કરી ત્યારે તફાવત લગભગ અદ્રશ્ય હતો. પાઠ: અક્ષની પસંદગી એકલા દ્રષ્ટિને બદલે છે.

કેસ 2 - સહસંબંધ પર વિશ્વાસ કરવો અને ચાર્ટને છોડી દેવો. એક સંશોધકે બે ચલો વચ્ચે r = 0.81 જોયું અને "મજબૂત રેખીય સંબંધ" લખ્યું. જ્યારે તેના કન્સલ્ટન્ટે સ્કેટર પ્લોટ માટે પૂછ્યું, ત્યારે એવું જોવામાં આવ્યું કે સંબંધ ખરેખર એક જ આત્યંતિક અવલોકનને કારણે હતો, અને જ્યારે તે બિંદુ દૂર કરવામાં આવ્યો, ત્યારે સહસંબંધ ઘટીને 0.12 થઈ ગયો. પાઠ: સહસંબંધ ગણતરી ગ્રાફ માટે કોઈ વિકલ્પ નથી; હંમેશા સ્કેટર જુઓ.

કેસ 3 - પુષ્ટિ સાથે ગૂંચવણભરી શોધ. એક વિદ્યાર્થીએ 40-વેરિયેબલ ડેટા સેટમાં તમામ જોડીવાર સહસંબંધો જોયા, સૌથી વધુ (r=0.52) પસંદ કર્યા અને લખ્યું, "અમને શિક્ષણ અને બચત (p=0.004) વચ્ચે નોંધપાત્ર સંબંધ જોવા મળ્યો." જો કે, 40 ચલોમાં સેંકડો જોડીઓ હતી; સૌથી વધુ પસંદ કરવું એ તકને કારણે ખોટી શોધ હતી. પાઠ: શોધાયેલ પેટર્ન સમાન ડેટામાં "પરીક્ષણ અને નોંધપાત્ર જાહેર" કરી શકાતી નથી; અલગ પુષ્ટિ જરૂરી છે.

સામાન્ય ભૂલો

  • બાર ચાર્ટમાં શૂન્યથી અક્ષ શરૂ થતો નથી. તે નાના તફાવતને અતિશયોક્તિ કરે છે; સૌથી સામાન્ય દ્રશ્ય અસત્ય. હંમેશા તપાસો.
  • સહસંબંધ જોઈએ છીએ અને ચાર્ટ છોડો છો. સમાન સહસંબંધ ખૂબ જ અલગ પેટર્નમાંથી આવે છે; બાહ્ય સંબંધ બંધબેસશે. પ્રથમ, છૂટાછવાયા.
  • શોધમાં મળેલ પેટર્નને સમાન ડેટામાં "પુરાવા" તરીકે ધ્યાનમાં લેવું. આ પી-હેકિંગનો પ્રવેશદ્વાર છે; પુષ્ટિ અલગથી કરવામાં આવે છે.
  • ખોટો ચાર્ટ પ્રકાર. ટ્રેન્ડ માટે બાર અને વિતરણ માટે પાઇ જેવી મેચો ગેરમાર્ગે દોરનારી છે. પ્રશ્નના આધારે શૈલી પસંદ કરો.
  • નમૂનાનું કદ છુપાવી રહ્યું છે. n=8 અને n=8,000 એ જ ગ્રાફ પર એકસરખા ન દેખાવા જોઈએ; અનિશ્ચિતતા દર્શાવવી જોઈએ.
ટીપ: ચાર્ટ પ્રકાશિત કરતા પહેલા, તમારી જાતને પૂછો: "જો હું ધરી બદલીશ તો શું વાર્તા બદલાશે?" જો જવાબ હા છે, તો તમે કદાચ અપ્રમાણિક જગ્યાએથી પીવટ શરૂ કર્યું છે.

સારાંશમાં

સંશોધનાત્મક ડેટા વિશ્લેષણ એ ડેટાને મળવા, પેટર્ન જોવા અને પૂર્વધારણાઓ બનાવવાનો તબક્કો છે; તે પુષ્ટિ નથી. AI ઝડપથી વર્ણનાત્મક આંકડા અને ગ્રાફ કોડ જનરેટ કરે છે, પરંતુ તમે તમારા પ્રશ્નના આધારે ગ્રાફનો પ્રકાર પસંદ કરો છો અને ઔચિત્યના સિદ્ધાંતોને નિયંત્રિત કરો છો (શૂન્ય અક્ષ, સુસંગત સ્કેલ, દેખીતી અનિશ્ચિતતા). સહસંબંધ નંબર પર વિશ્વાસ કરતા પહેલા સ્કેટર જુઓ; તમને શોધમાં મળેલી પેટર્નને સમાન ડેટામાં "પુરાવા" તરીકે જાહેર કરશો નહીં. AI ના સુંદર ગ્રાફનો અર્થ સાચો ગ્રાફ નથી.

એપ્લિકેશન કાર્ય

ડેટા સેટમાં ઓછામાં ઓછા ત્રણ ચલો પસંદ કરો. AI ને પૂછો અને કોડ ચલાવો કે જે પ્રામાણિકતાના નિયમોનો અમલ કરતા પ્રોમ્પ્ટ સાથે સંશોધનાત્મક ગ્રાફ્સ (હિસ્ટોગ્રામ, સ્કેટર, બોક્સવાળી) બનાવે છે. દરેક ચાર્ટ માટે: (1) પ્રશ્ન માટેના ચાર્ટની યોગ્યતા, (2) ધરીની પ્રામાણિકતા, (3) નમૂનાના કદની દૃશ્યતા તપાસો. પૂર્વધારણાની ભાષામાં ઓછામાં ઓછી એક "શોધ નોંધ" લખો ("...અલગથી પરીક્ષણ કરવામાં આવે તેવું લાગે છે"). કાઉન્ટ અને સ્કેટર બંને સાથેના સંબંધની તપાસ કરો અને જો તેમની વચ્ચે કોઈ વિસંગતતા હોય તો જાણ કરો.

ચેકલિસ્ટ

  • [ ] મેં મારા પ્રશ્ન અને ડેટા પ્રકાર પર આધારિત ચાર્ટ પ્રકાર પસંદ કર્યો.
  • [ ] બાર ચાર્ટમાં, હું y-અક્ષને શૂન્યથી શરૂ કરું છું; મેં ધરીની પ્રામાણિકતા તપાસી.
  • [ ] મેં સહસંબંધ પર વિશ્વાસ કરતા પહેલા સ્કેટરપ્લોટ તરફ જોયું.
  • [ ] મેં ગ્રાફ પર નમૂનાનું કદ અને અનિશ્ચિતતા પ્રતિબિંબિત કરી.
  • [ ] મેં અન્વેષણમાં મને જે દાખલાઓ મળ્યા તે "પુરાવા" ને બદલે "પરીક્ષણ કરવા માટે પૂર્વધારણા" તરીકે લખ્યા.
  • [ ] મેં નોંધ્યું છે કે હું પુષ્ટિ માટે સમાન ડેટાનો ઉપયોગ કરીશ નહીં અને એક અલગ પગલું જરૂરી છે.