નફો:
- રીગ્રેસન આઉટપુટ (ગુણાંક, પ્રમાણભૂત ભૂલ, પી-વેલ્યુ, આર-સ્ક્વેર) ને સચોટપણે વાંચવાની ક્ષમતા અને આર્ટિફિશિયલ ઇન્ટેલિજન્સ અર્થઘટનનું વિવેચનાત્મક મૂલ્યાંકન
- ક્ષતિઓને ઓળખવાની ક્ષમતા જેમ કે સહસંબંધ-કારણ ભેદ, અંતઃસ્ત્રાવ, અવગણવામાં આવેલા ચલો અને બનાવટી રીગ્રેસન, અને કૃત્રિમ બુદ્ધિની અતિશય કારણભૂત ભાષાને અંકુશમાં લેવાની ક્ષમતા
- મોડેલ સેટઅપ, કોડ અને ડાયગ્નોસ્ટિક ટેસ્ટ ડ્રાફ્ટિંગ માટે કૃત્રિમ બુદ્ધિનો ઉપયોગ કરવાની ક્ષમતા, મોડેલની પસંદગી અને અર્થઘટનની જવાબદારી મનુષ્યો પર છોડીને
ઇકોનોમેટ્રિક્સ એ ડેટા સાથે આર્થિક સિદ્ધાંતનું પરીક્ષણ કરવાની શિસ્ત છે, અને રીગ્રેશન તેનું મૂળભૂત સાધન છે. "આવક વધે તેમ વપરાશમાં કેટલો વધારો થાય છે?", "વ્યાજ અને રોકાણ વચ્ચે શું સંબંધ છે?" આ પ્રકારના પ્રશ્નોને રીગ્રેશન દ્વારા માપવામાં આવે છે. AI આ ક્ષેત્રમાં ખૂબ જ ઉપયોગી અને ખૂબ જ ખતરનાક બંને છે: તે સેકન્ડોમાં મોડલ કોડ અને ડાયગ્નોસ્ટિક પરીક્ષણો લખે છે, પરંતુ આઉટપુટનું અર્થઘટન કરતી વખતે ઘણી વખત વધુ પડતું કારણભૂત અને વધુ પડતું ચોક્કસ હોય છે. "X વધે છે Y" વાક્ય અસ્ખલિત રીતે બોલે છે; જ્યારે મોટાભાગના રીગ્રેસન માત્ર એક સંબંધને માપે છે. આ એકમનો ભાવાર્થ છે: મોડેલ સેટઅપ, કોડ અને ડાયગ્નોસ્ટિક પરીક્ષણ માટે AI નો ઉપયોગ કરો; પરંતુ મોડેલની પસંદગી, કાર્યકારણના નિર્ણય અને અર્થઘટનની જવાબદારી માનવ પર રાખો.
રીગ્રેસન આઉટપુટ વાંચવું
સરળ રીગ્રેસનનું આઉટપુટ ચાર વસ્તુઓ માટે જુએ છે:
- ગુણાંક. જ્યારે સમજૂતીત્મક ચલ એક એકમ દ્વારા વધે ત્યારે આશ્રિત ચલ કેટલો બદલાય છે તેનો અંદાજ. ચિહ્ન (વત્તા/માઈનસ) અને તીવ્રતાનો આર્થિક અર્થ હોવો જોઈએ.
- માનક ભૂલ. ગુણાંક અંદાજની અનિશ્ચિતતા; જો તે નાનું હોય, તો અંદાજ વધુ સચોટ છે.
- p-મૂલ્ય. તે "ખરેખર શૂન્ય" છે એવી ધારણા હેઠળ ગુણાંકની સંભાવના આટલી મોટી દેખાય છે. સ્મોલ પી (<0.05) "આંકડાકીય રીતે નોંધપાત્ર" હોવાનું કહેવાય છે - પરંતુ આ આર્થિક મહત્વ અથવા કાર્યકારણને સૂચિત કરતું નથી.
- આર-ચોરસ. આશ્રિત ચલમાં કેટલો ફેરફાર છે તે મોડેલ સમજાવે છે. ઉચ્ચ R-ચોરસનો અર્થ "સાચો મોડેલ" નથી; તે નકલી રીગ્રેશનમાં પણ વધુ હોઈ શકે છે.
ટીપ: આંકડાકીય મહત્વને આર્થિક મહત્વ સાથે ગૂંચવશો નહીં. એક ખૂબ જ નાની, વ્યવહારીક રીતે નજીવી અસર પણ મોટા નમૂનામાં "નોંધપાત્ર" (નાનું p) બની શકે છે. પ્રથમ, "શું આ ગુણાંકનું કદ આર્થિક રીતે મહત્વપૂર્ણ છે?" ', પછી મહત્વ માટે જુઓ.
સહસંબંધ કારણભૂત નથી: ક્લાસિક મુશ્કેલીઓ
ઇકોનોમેટ્રિક્સના હાર્દમાં આ ચેતવણી છે. રીગ્રેસન દ્વારા મળેલ સંબંધ ઘણીવાર કારણભૂત નથી. મુખ્ય મુશ્કેલીઓ:
- અવગણવામાં આવેલ ચલ. ત્રીજું પરિબળ કે જે X અને Y બંનેને અસર કરે છે પરંતુ મોડેલમાં નથી તે X અને Y વચ્ચે એક બનાવટી સંબંધ બનાવે છે.
- વિપરીત કાર્યકારણ (અંતઃજન્યતા). જ્યારે એવું માનવામાં આવે છે કે X Y ને અસર કરે છે, કદાચ Y X ને અસર કરે છે અથવા બંને પરસ્પર છે. (પોલીસની સંખ્યા અને ગુનાઃ ગુના વધ્યા એટલે શું પોલીસ વધી?)
- સ્યુડો રીગ્રેશન. બે બિન-સ્થિર (ટ્રેન્ડિંગ) શ્રેણી ઉચ્ચ આર-સ્ક્વેર અને નોંધપાત્ર ગુણાંક આપી શકે છે, તેમ છતાં તેમની વચ્ચે કોઈ વાસ્તવિક સંબંધ નથી. માત્ર એટલા માટે કે તેઓ બંને સમય સાથે વધે છે.
- પસંદગી પૂર્વગ્રહ. જો નમૂના રેન્ડમ ન હોય, તો સંબંધ ત્રાંસુ માપવામાં આવે છે.
કાર્યકારણનો દાવો માત્ર યોગ્ય ડિઝાઇન (પદ્ધતિઓ જેમ કે નિયંત્રિત પ્રયોગ, પ્રાકૃતિક પ્રયોગ, ઇન્સ્ટ્રુમેન્ટલ વેરીએબલ, ડિફરન્સ-ઇન-ડિફરન્સ) અને સ્પષ્ટ ધારણાઓથી જ સ્થાપિત કરી શકાય છે. કૃત્રિમ બુદ્ધિ ઘણીવાર આ સૂક્ષ્મતાને ચૂકી જાય છે.
સાવધાન: જો AI કહે છે કે "આ વેરીએબલ તેને વધારે/ઘટાડે છે", તો તરત જ બ્રેક લગાવો. સમસ્યા: શું ત્યાં કોઈ ચલ અવગણવામાં આવ્યા છે? શું વિપરીત કાર્યકારણ શક્ય છે? શું શ્રેણી સ્થિર છે? જ્યાં સુધી આ ત્રણ પ્રશ્નો પૂછવામાં ન આવે ત્યાં સુધી કોઈ કારણદર્શક વાક્ય અહેવાલમાં પ્રવેશતું નથી.
ડાયગ્નોસ્ટિક પરીક્ષણો
રીગ્રેસન વિશ્વસનીય બનવા માટે, તેની ધારણાઓનું પરીક્ષણ કરવામાં આવે છે: અવશેષોની પેટર્ન (ભૂલની શરતો) (ઓટોકોરિલેશન), હેટરોસ્કેડેસ્ટીસીટી (હેટરોસ્કેડેસ્ટીસીટી), મલ્ટીકોલીનરીટી (સ્પષ્ટીકરણ ચલો એકબીજા સાથે ખૂબ સમાન હોય છે), સામાન્ય વિતરણ. કૃત્રિમ બુદ્ધિ આ પરીક્ષણો માટે કોડ લખે છે; પરંતુ પરિણામોનું અર્થઘટન કરવું અને તે મુજબ મોડેલને સમાયોજિત કરવાનું અર્થશાસ્ત્રીનું કામ છે.
ત્રણ નાના કેસો
કેસ 1 - નકલી રીગ્રેસન. એક સંશોધકે બે ટ્રેન્ડ સીરિઝ (એક નજીવી ખર્ચ, એક નજીવી બીજી રકમ) પાછી ખેંચી; R-ચોરસ 0.98 હતો, ગુણાંક અત્યંત નોંધપાત્ર હતો. AI "એક મજબૂત સંબંધ છે," તેમણે કહ્યું. સંશોધકે સ્થિરતા માટે પરીક્ષણ કર્યું: બંને શ્રેણી બિન-સ્થિર હતી. એકવાર તેઓ અલગ થયા પછી, સંબંધ મોટાભાગે અદૃશ્ય થઈ ગયો. ઉચ્ચ આર-સ્ક્વેર્ડ ફક્ત એટલા માટે હતું કારણ કે તે બંને સમય સાથે વધ્યા હતા. બનાવટી રીગ્રેસન પકડાયું.
કેસ 2 — અવગણવામાં આવેલ ચલ. એક વિશ્લેષણમાં જાણવા મળ્યું છે કે "જાહેરાત ખર્ચ વેચાણમાં વધારો કરે છે." અર્થશાસ્ત્રીએ પૂછ્યું: શું મોડેલમાં મોસમી અસર છે? ત્યાં ન હતી. રજા પહેલા જાહેરાત અને વેચાણ બંને વધી રહ્યા હતા; સંબંધનો એક ભાગ મોસમ હતો. જ્યારે સિઝન ડમી ચલો ઉમેરવામાં આવ્યા હતા, ત્યારે જાહેરાતનો ગુણાંક નાનો બન્યો હતો. કારણદર્શક દાવો હળવો કરવામાં આવ્યો છે.
કેસ 3 - નોંધપાત્ર પરંતુ મામૂલી. મોટા માઇક્રોડેટા સેટમાં, ગુણાંક p<0.001 હતો; AI "મજબૂત અસર," તેમણે કહ્યું. પરંતુ ગુણાંકની તીવ્રતા વ્યવહારીક રીતે નહિવત્ હતી (આવકમાં મોટો ફેરફાર પરિણામને એક હજારમાં સ્થાને ખસેડ્યું). અર્થશાસ્ત્રીએ તેને "આંકડાકીય રીતે નોંધપાત્ર પરંતુ આર્થિક રીતે નજીવા" તરીકે યોગ્ય રીતે બનાવ્યું. મહત્વ એ મહત્વનો વિકલ્પ ન હતો.
ટિપ્પણી મધ્યસ્થતા કોષ્ટક
કૃત્રિમ બુદ્ધિ કહે છે
અર્થશાસ્ત્રી પૂછે છે
"X વધે છે Y"
અવગણવામાં આવેલ ચલ? વિપરીત કાર્યકારણ?
"આર-સ્ક્વેર ઉચ્ચ છે, મોડેલ સારું છે"
શું શ્રેણી સ્થિર છે? નકલી રીગ્રેશન?
"p<0.05, નોંધપાત્ર"
શું કદ આર્થિક રીતે મહત્વનું છે?
"ગુણાંક 0.3"
શું તેની નિશાની અને એકમ સિદ્ધાંત સાથે સુસંગત છે?
"સંબંધ મજબૂત છે"
શું નમૂનાની પસંદગી પક્ષપાતી છે?
ચાર નકલ કરી શકાય તેવા નમૂનાઓ
1) મોડલ ઇન્સ્ટોલેશન સ્કેચ:
હું નીચેના આર્થિક પ્રશ્નની તપાસ કરીશ: [પ્રશ્ન]. આશ્રિત ચલ: [Y].ઉમેદવાર વર્ણનકર્તા: [X's]. મને યોગ્ય પ્રારંભિક રીગ્રેસન સેટઅપ (સ્ટેટ્સમોડેલ્સ કોડ) સૂચવો. ક્યા કંટ્રોલ ચલોની જરૂર છે અને શા માટે તે સમજાવો. કાર્યકારણનો દાવો કરશો નહીં; સંબંધની ભાષાનો ઉપયોગ કરો.
2) ડાયગ્નોસ્ટિક પરીક્ષણો:
મેં સેટ કરેલ રીગ્રેસન માટે ડાયગ્નોસ્ટિક પરીક્ષણો કોડમાં લખો: ઓટોકોરિલેશન, હેટરોસેડેસ્ટીસીટી, મલ્ટીકોલીનરીટી, અવશેષોનું વિક્ષેપ, અને સ્થિરતા (જો તે સમય શ્રેણી છે). દરેક પરીક્ષણ પરિણામનું અર્થઘટન કેવી રીતે કરવું અને જો સમસ્યાઓ હોય તો શું કરવું તે સંક્ષિપ્તમાં લખો.
3) કાર્યકારણ નિયંત્રણ:
આ રીગ્રેસન પરિણામનું અર્થઘટન કરો, પરંતુ પહેલા આ ત્રણ ક્ષતિઓ તપાસો: (1) શું અવગણવામાં આવેલ ચલ હોઈ શકે છે અને કયું, (2) રિવર્સ કાર્યકારણ શક્ય છે, (3) શું શ્રેણી સ્થિર છે / શું બનાવટી રીગ્રેશનનું જોખમ છે? સ્પષ્ટપણે જણાવો કે શું પરિણામનું અર્થઘટન કારણભૂત અથવા માત્ર સંબંધી તરીકે કરવું જોઈએ.
4) મહત્વ-મહત્વ ભેદ:
નીચેના ગુણાંકનું અર્થઘટન કરો: મૂલ્ય [x], પ્રમાણભૂત ભૂલ [y], p-મૂલ્ય [z]. આંકડાકીય મહત્વને અલગથી, આર્થિક મહત્વનું અલગથી મૂલ્યાંકન કરો: શું આ ગુણાંકની તીવ્રતા વ્યવહારીક રીતે નોંધપાત્ર અસર છે? ઉદાહરણના દૃશ્યમાં અસરની તીવ્રતા નક્કી કરો.
નબળા પ્રોમ્પ્ટ / મજબૂત પ્રોમ્પ્ટ
નબળા પ્રોમ્પ્ટ:
આ ચલો સાથે રીગ્રેસન કરો અને પરિણામનું અર્થઘટન કરો.
કૃત્રિમ બુદ્ધિ નિદાન પરીક્ષણો કર્યા વિના અથવા સ્થિરતા તપાસ્યા વિના, કારણભૂત ભાષામાં તેનું અર્થઘટન કરે છે; બનાવટી રીગ્રેસન અથવા અવગણવામાં આવેલ ચલ ચૂકી જાય છે.
શક્તિશાળી પ્રોમ્પ્ટ:
આશ્રિત ચલ એ વપરાશ છે, સમજૂતીત્મક આવક; માસિક, ટ્રેન્ડિંગ શ્રેણી. પ્રથમ સ્થિરતાનું પરીક્ષણ કરો; જો જરૂરી હોય તો તફાવત મેળવો. રીગ્રેસન સેટ કરો, ડાયગ્નોસ્ટિક પરીક્ષણો ચલાવો (ઓટોકોરિલેશન, હેટરોસેડેસ્ટીસીટી). પરિણામનું અર્થઘટન કરતી વખતે અવગણવામાં આવેલા ચલો અને વિપરીત કાર્યકારણના જોખમોની સ્પષ્ટ ચર્ચા કરો; સાધક ભાષાને બદલે રિલેશનલનો ઉપયોગ કરો. મહત્વ અને આર્થિક મહત્વનું અલગથી મૂલ્યાંકન કરો અને દરેક પગલા માટે કોડ આપો.
સામાન્ય ભૂલો
- કાર્યકારણ માટે સહસંબંધની ભૂલ. સૌથી સામાન્ય અને સૌથી ખર્ચાળ ભૂલ.
- ગુણવત્તા માટે ઉચ્ચ R-ચોરસની ભૂલ કરવી. તે બનાવટી રીગ્રેશનમાં પણ વધુ છે.
- સ્ટેસીસ ચેકને બાયપાસ કરીને. પ્રચલિત શ્રેણીઓ બનાવટી સંબંધો પેદા કરે છે.
- અર્થપૂર્ણતાને મહત્વ સાથે ગૂંચવણમાં મૂકે છે. નાના p નો અર્થ મોટી અસર નથી.
- ડાયગ્નોસ્ટિક પરીક્ષણો છોડી દેવા. ઉલ્લંઘન કરાયેલ ધારણા સમગ્ર અનુમાનને હરાવે છે.
- AI ની કારણભૂત ભાષાને જેમ છે તેમ સ્વીકારવી. ચુકાદો માણસનો છે.
સારાંશમાં
રીગ્રેસન એ એક શક્તિશાળી પરંતુ મુશ્કેલીવાળું સાધન છે. વાંચન ગુણાંક, પ્રમાણભૂત ભૂલ, p-મૂલ્ય અને R-ચોરસ યોગ્ય રીતે; સહસંબંધ અને કાર્યકારણ વચ્ચેનો તફાવત; અવગણવામાં આવેલા ચલો, વિપરીત કાર્યકારણ અને નકલી રીગ્રેસન મુશ્કેલીઓ માટે તપાસવું; મહત્વ અને આર્થિક મહત્વ વચ્ચે તફાવત કરવો જરૂરી છે. AI કોડ અને નિદાન જનરેશનમાં વેગ આપી રહ્યું છે, પરંતુ તે ખૂબ જ કારણસર બોલે છે; મોડેલની પસંદગી અને કાર્યકારણનો નિર્ણય અર્થશાસ્ત્રી પર આધારિત છે.
એપ્લિકેશન કાર્ય
તમારી પાસેના ડેટા (દા.ત. વપરાશ-આવક) સાથે એક સરળ રીગ્રેશન સેટ કરો. 1લા નમૂના સાથે સેટઅપ તૈયાર કરો અને 2જા નમૂના સાથે નિદાન પરીક્ષણો તૈયાર કરો. પછી ટેમ્પલેટ 3 સાથે કાર્યકારણ તપાસો, ઓછામાં ઓછા એક સંભવિત અવગણવામાં આવેલા ચલ અને એક વિપરીત કાર્યકારણ દૃશ્યનું નામ આપો. AI ના પ્રારંભિક અર્થઘટનમાંથી એક કારણભૂત વાક્યને સંબંધિત ભાષામાં અનુવાદિત કરો અને ફેરફારની નોંધ લો.
ચેકલિસ્ટ
- [ ] મેં ગુણાંક, પ્રમાણભૂત ભૂલ, p-મૂલ્ય અને R-ચોરસ યોગ્ય રીતે વાંચ્યું છે.
- [ ] મેં શ્રેણીની સ્થિરતા તપાસી અને બનાવટી રીગ્રેસનનું જોખમ દૂર કર્યું.
- [ ] મેં અવગણવામાં આવેલ ચલ અને વિપરીત કાર્યકારણ શક્યતાઓને નામ આપ્યું છે.
- [ ] મેં ડાયગ્નોસ્ટિક પરીક્ષણો કર્યા અને ઉલ્લંઘનોનું મૂલ્યાંકન કર્યું.
- [ ] મેં આંકડાકીય મહત્વ અને આર્થિક મહત્વનું અલગથી મૂલ્યાંકન કર્યું.
- [ ] મેં આર્ટિફિશિયલ ઇન્ટેલિજન્સ ની સાધક ભાષાને રિલેશનલ ભાષામાં દોરેલી છે.
- [ ] મેં જાળવી રાખ્યું કે મોડેલની પસંદગી અને કાર્યકારણનો ચુકાદો મારો હતો.