യൂണിറ്റുകൾ
1. സാമ്പത്തികശാസ്ത്രത്തിലും സ്ഥിതിവിവരക്കണക്കിലും കൃത്രിമബുദ്ധി: റോളുകൾ, അതിരുകൾ, ആധികാരികത, സ്വകാര്യത 2. ഡാറ്റ ക്ലീനിംഗും തയ്യാറാക്കലും: നഷ്ടപ്പെട്ട ഡാറ്റ, ഔട്ട്‌ലറുകൾ, കോഡിംഗ് 3. പര്യവേക്ഷണ ഡാറ്റാ വിശകലനവും ദൃശ്യവൽക്കരണവും: കൃത്രിമ ബുദ്ധി ഉപയോഗിച്ച് ഗ്രാഫിംഗും വ്യാഖ്യാനവും 4. ലീനിയർ റിഗ്രഷൻ: മോഡൽ ബിൽഡിംഗ്, കോഫിഫിഷ്യൻ്റ് ഇൻ്റർപ്രെട്ടേഷൻ, അനുമാനങ്ങൾ 5. റിഗ്രഷൻ ഡയഗ്‌നോസ്റ്റിക്‌സും ലംഘനങ്ങളും: കോളിനാരിറ്റി, ഹെറ്ററോസെഡസ്‌റ്റിസിറ്റി, ഓട്ടോകോറിലേഷൻ 6. അനുമാന പരിശോധനയും പി-മൂല്യവും: പ്രാധാന്യം, ശക്തി, ഒന്നിലധികം താരതമ്യങ്ങൾ 7. പി-ഹാക്കിംഗ്, ഹാർക്കിംഗ്, സ്റ്റാറ്റിസ്റ്റിക്കൽ ഇൻ്റഗ്രിറ്റി: കൃത്രിമ ബുദ്ധിയുടെ യുഗത്തിലെ അപകടങ്ങൾ 8. സമയ ശ്രേണി വിശകലനം: നിശ്ചലത, അരിമ, പ്രവചനം 9. കാരണവും നയ വിശകലനവും: ഡിഐഡി, ഐവി, ആർഡിഡി, ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് 10. കോഡ് ജനറേഷനും പുനരുൽപ്പാദനവും: ആർ/പൈത്തൺ, വേർഷനിംഗ്, റീപ്രൊഡ്യൂസിബിലിറ്റി 11. റിപ്പോർട്ട് റൈറ്റിംഗ്, ആശയവിനിമയം, ധാർമ്മികത: ഫലങ്ങൾ അവതരിപ്പിക്കൽ, അതിരുകൾ ആശയവിനിമയം
യൂണിറ്റ് 1 / 11

സാമ്പത്തികശാസ്ത്രത്തിലും സ്ഥിതിവിവരക്കണക്കിലും കൃത്രിമബുദ്ധി: റോളുകൾ, അതിരുകൾ, ആധികാരികത, സ്വകാര്യത

നേട്ടങ്ങൾ:

  • ടാസ്‌ക് റിസ്ക് ലെവൽ അനുസരിച്ച്, എംപിരിയൽ വർക്ക്ഫ്ലോയിൽ (ഡാറ്റ ക്ലീനിംഗ്, കോഡ്, വിഷ്വലൈസേഷൻ, ഡ്രാഫ്റ്റ് ഇൻ്റർപ്രെറ്റേഷൻ) ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് തത്സമയം ലാഭിക്കുന്നുവെന്നും മോഡൽ തിരഞ്ഞെടുക്കൽ, കാര്യകാരണ ക്ലെയിം, പ്രസിദ്ധീകരണ തീരുമാനം എന്നിവ പോലുള്ള തീരുമാനങ്ങൾ വിദഗ്ധന് വിടുന്നത് എവിടെയാണെന്ന് വേർതിരിച്ചറിയാൻ കഴിയും.
  • ഓരോ ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് ഔട്ട്‌പുട്ടും (നമ്പർ, കോഫിഫിഷ്യൻ്റ്, കോഡ്, അഭിപ്രായം) പരിശോധിച്ചുറപ്പിക്കുന്ന ഒരു അച്ചടക്കം പ്രയോഗിക്കാനുള്ള കഴിവ്, വീണ്ടും കണക്കുകൂട്ടൽ, ഉറവിടത്തിലേക്ക് ലിങ്കുചെയ്യൽ, സ്റ്റാറ്റിസ്റ്റിക്കൽ ഫിൽട്ടറിംഗ് എന്നിവയിലൂടെ.
  • KVKK/GDPR, ഡാറ്റ ഉപയോഗ കരാറുകൾ എന്നിവയുടെ പരിധിയിൽ മൈക്രോ ഡാറ്റയും രഹസ്യസ്വഭാവമുള്ള/ലൈസൻസുള്ള ഡാറ്റാ സെറ്റുകളും സുരക്ഷിതമായി പ്രോസസ്സ് ചെയ്യാനും ഉചിതമായ ഉപകരണങ്ങൾ തിരഞ്ഞെടുക്കാനുള്ള ശീലം നേടാനുമുള്ള കഴിവ്.

ഒരു ഇക്കണോമെട്രിഷ്യൻ്റെയോ അപ്ലൈഡ് സ്റ്റാറ്റിസ്റ്റിഷ്യൻ്റെയോ മേശപ്പുറത്ത് എല്ലാ ദിവസവും ഇതേ ചോദ്യങ്ങൾ ആവർത്തിക്കുന്നു: ഈ ഡാറ്റ വിശ്വസനീയമാണോ; ഈ നഷ്ടപ്പെട്ട മൂല്യങ്ങളുമായി എന്തുചെയ്യണം? ഈ റിഗ്രഷൻ്റെ ഗുണകം യഥാർത്ഥത്തിൽ എന്താണ് പറയുന്നത്? ഈ ബന്ധം കാര്യകാരണമാണോ അതോ കേവലം പരസ്പര ബന്ധമാണോ? ഈ p-മൂല്യം പ്രാധാന്യമുള്ളതിനാൽ, എനിക്ക് ഇത് ലേഖനത്തിലോ നയ സംക്ഷിപ്തത്തിലോ എഴുതാമോ? ഈ ചോദ്യങ്ങളിൽ ചിലത് ആവർത്തനവും കോഡ്-തീവ്രവും സമയമെടുക്കുന്നതുമാണ്: ഡാറ്റ വൃത്തിയാക്കൽ, ഒരേ ഗ്രാഫ് പത്ത് തവണ പ്ലോട്ട് ചെയ്യുക, R അല്ലെങ്കിൽ പൈത്തൺ കോഡ് ഡീബഗ്ഗിംഗ് ചെയ്യുക, ഫലങ്ങൾ ഒരു പട്ടികയിലേക്ക് സ്ട്രിംഗ് ചെയ്യുക. മറ്റുള്ളവർ ഒരു കണ്ടെത്തലിൻ്റെ സാധുത, ഒരു പ്രസിദ്ധീകരണത്തിൻ്റെ സത്യസന്ധത അല്ലെങ്കിൽ ഒരു നയ തീരുമാനത്തിൻ്റെ കൃത്യത എന്നിവ നേരിട്ട് നിർണ്ണയിക്കുന്നു.

ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് (ചുരുക്കത്തിൽ, AI - മനുഷ്യരെപ്പോലെ ടെക്‌സ്‌റ്റും കോഡും നിർമ്മിക്കാനും പാറ്റേണുകൾ തിരിച്ചറിയാനും ഡാറ്റ സംഗ്രഹിക്കാനും അഭിപ്രായങ്ങൾ എഴുതാനും കഴിയുന്ന കമ്പ്യൂട്ടർ സംവിധാനങ്ങൾ; ഇന്ന് ഏറ്റവും കൂടുതൽ ഉപയോഗിക്കുന്ന ഫോം വലിയ ഭാഷാ മോഡലുകളാണ്, അതായത്, വലിയ ടെക്‌സ്‌റ്റിൽ പരിശീലനം ലഭിച്ചതും അടുത്ത വാക്ക് പ്രവചിച്ച് വാക്യങ്ങൾ നിർമ്മിക്കുന്നതുമായ സംവിധാനങ്ങൾ) ഈ പട്ടികയുടെ മധ്യത്തിലാണ്. ശരിയായി ഉപയോഗിക്കുമ്പോൾ, ഇത് മണിക്കൂറുകളോളം ഡാറ്റ ക്ലീനിംഗ് കോഡ് മിനിറ്റുകളായി കുറയ്ക്കുന്നു, സങ്കീർണ്ണമായ ഒരു സ്റ്റാറ്റിസ്റ്റിക്കൽ ടെസ്റ്റിൻ്റെ വാക്യഘടനയെക്കുറിച്ച് നിങ്ങളെ ഓർമ്മിപ്പിക്കുന്നു, അല്ലെങ്കിൽ ഒരു ഗുണകത്തിൻ്റെ വ്യാഖ്യാനം ഡ്രാഫ്റ്റ് ചെയ്യുന്നു. തെറ്റായി ഉപയോഗിക്കുമ്പോൾ, അത് ഉറപ്പുള്ളതും എന്നാൽ പൂർണ്ണമായും കെട്ടിച്ചമച്ചതുമായ ഒരു സംഖ്യ, തെറ്റായ പ്രാധാന്യം അല്ലെങ്കിൽ ഒരു "കണ്ടെത്തൽ" എന്ന നിലയിൽ ഒരു കാരണമില്ലാത്ത ബന്ധത്തെ അവതരിപ്പിക്കുന്നു.

ഈ ആദ്യ യൂണിറ്റ് ഒരു സോഫ്റ്റ്‌വെയർ ആമുഖമല്ല. നിങ്ങളുടെ അനുഭവപരമായ വർക്ക്‌ഫ്ലോയിൽ AI എവിടെ ഇടണമെന്നും ഒരിക്കലും എവിടെ വയ്ക്കരുതെന്നും വ്യക്തമാക്കുക എന്നതാണ് ഇതിൻ്റെ ഉദ്ദേശം. ഇക്കണോമെട്രിക്സ് ഒരു "രീതി-നിർണ്ണായകവും" പരോക്ഷമായി "തീരുമാനവും-നിർണ്ണായക" ഫീൽഡുമാണ്: നിങ്ങൾ നിർമ്മിക്കുന്ന ഒരു മോഡലിൻ്റെ ഗുണകം ഒരു സെൻട്രൽ ബാങ്കിൻ്റെ പലിശ നിരക്ക് തീരുമാനത്തിലേക്കോ റെഗുലേറ്ററുടെ നയമാറ്റത്തിലേക്കോ ഒരു സ്ഥാപനത്തിൻ്റെ ദശലക്ഷം ഡോളർ നിക്ഷേപത്തിലേക്കോ ഇൻപുട്ട് ആകാം. നമുക്ക് ആദ്യം മുതൽ അടിസ്ഥാന തത്വം നിരത്താം: ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് ഒരു വിശകലന സഹായിയാണ്, ഒരു ഗവേഷകനല്ല. മോഡൽ തിരഞ്ഞെടുക്കൽ, തിരിച്ചറിയൽ തന്ത്രം, കാര്യകാരണവാദം, പ്രസിദ്ധീകരണം, നയപരമായ തീരുമാനങ്ങൾ എന്നിവയുടെ ഉത്തരവാദിത്തവും അന്തിമ അംഗീകാരവും കഴിവുള്ള വിദഗ്ധനിൽ നിക്ഷിപ്തമാണ്.

എംപിരിയിക്കൽ വർക്ക്ഫ്ലോയുടെയും AI-യുടെ സ്ഥലത്തിൻ്റെയും പാളികൾ

ഒരു അനുഭവപരമായ പഠനത്തെ മൂന്ന് പാളികളായി വിഭജിക്കുന്നത് ഉപയോഗപ്രദമാണ്. എക്സിക്യൂഷൻ ലെയർ എന്നത് ദൈനംദിന സാങ്കേതിക ജോലിയാണ്: ഡാറ്റ ക്ലീനിംഗ് കോഡ്, ഗ്രാഫ് ഡ്രോയിംഗ്, ടേബിൾ ഫോർമാറ്റിംഗ്, സിൻ്റാക്സ് ഡീബഗ്ഗിംഗ്. രീതി പാളി എന്നത് വിശകലന തീരുമാനമാണ്: ഏത് മോഡൽ, ഏത് ഐഡൻ്റിഫിക്കേഷൻ സ്ട്രാറ്റജി, ഏത് ടെസ്റ്റ്, ഏത് അനുമാന പരിശോധന. വ്യാഖ്യാനവും തീരുമാന പാളിയുമാണ് കണ്ടെത്തലുകളുടെ അർത്ഥം: ഗുണകം എന്താണ് പറയുന്നത്, അത് കാരണമാണോ, നയത്തിന് എന്താണ് അർത്ഥമാക്കുന്നത്, അത് പ്രസിദ്ധീകരിക്കണം. AI മൂന്ന് ലെയറുകളിലും സ്പർശിക്കുന്നു, എന്നാൽ ഓരോന്നിലും വ്യത്യസ്ത അധികാരമുണ്ട്. എക്സിക്യൂഷൻ ലെയറിൽ, AI പെട്ടെന്ന് ഡ്രാഫ്റ്റ് ചെയ്യുകയും കോഡ് സൃഷ്ടിക്കുകയും ചെയ്യുന്നു; വ്യാഖ്യാനത്തിലും തീരുമാന പാളിയിലും, ഇൻപുട്ട് മാത്രം നൽകുകയും വിദഗ്ദ്ധൻ തീരുമാനമെടുക്കുകയും ചെയ്യുന്നു.

നമുക്ക് ആദ്യം മുതൽ കുറച്ച് അടിസ്ഥാന നിബന്ധനകൾ നിർവചിക്കാം. സാമ്പത്തികവും സാമൂഹികവുമായ ഡാറ്റയെ സ്ഥിതിവിവരക്കണക്കുകൾ ഉപയോഗിച്ച് വിശകലനം ചെയ്യുകയും ബന്ധങ്ങൾ അളക്കുകയും ചെയ്യുന്ന ശാഖയാണ് ഇക്കണോമെട്രിക്സ്. ഒന്നോ അതിലധികമോ വിശദീകരണ വേരിയബിളുകളുമായുള്ള (സ്വതന്ത്ര വേരിയബിളുകൾ) ഒരു ഫല വേരിയബിളിൻ്റെ (ആശ്രിത വേരിയബിൾ) ബന്ധത്തെ സംഖ്യാപരമായി മാതൃകയാക്കുന്ന ഒരു രീതിയാണ് റിഗ്രഷൻ. ഒരു വിശദീകരണ വേരിയബിളിലെ ഒരു യൂണിറ്റ് മാറ്റം ഫല വേരിയബിളുമായി ബന്ധപ്പെട്ടിരിക്കുന്ന ശരാശരി എത്ര യൂണിറ്റ് മാറ്റമാണെന്ന് കാണിക്കുന്ന സംഖ്യയാണ് ഗുണകം. ഒരു ഫലവും യഥാർത്ഥത്തിൽ നിലവിലില്ലാത്തപ്പോൾ നിരീക്ഷിച്ച ഫലം (അല്ലെങ്കിൽ കൂടുതൽ തീവ്രമായ ഫലം) ആകസ്മികമായി സംഭവിക്കാനുള്ള സാധ്യതയാണ് p-മൂല്യം. ഇനിപ്പറയുന്ന യൂണിറ്റുകളിൽ ഞങ്ങൾ ഈ ആശയങ്ങൾ ഓരോന്നായി വിശദീകരിക്കും; ഇപ്പോൾ, ഇതറിയുക: ഇവയിലെല്ലാം, AI നിങ്ങൾക്ക് ബ്ലൂപ്രിൻ്റ്, കോഡ്, വിശദീകരണം എന്നിവ നൽകുന്നു, പക്ഷേ അത് ശാസ്ത്രീയ തീരുമാനങ്ങൾ എടുക്കുന്നില്ല.

ദൗത്യം അനുസരിച്ച് AI-യുടെ റോളും അപകടസാധ്യത നിലയും ഇനിപ്പറയുന്ന പട്ടിക സംഗ്രഹിക്കുന്നു:

അന്വേഷണം

AI യുടെ പങ്ക്

റിസ്ക് ലെവൽ

ആർ അംഗീകരിക്കുന്നു

ഡാറ്റ സാനിറ്റൈസേഷൻ കോഡ് എഴുതുന്നു

കോഡ് ജനറേറ്റർ

താഴ്ന്ന

അനലിസ്റ്റ് തന്നെ (കോഡ് ടെസ്റ്റിംഗിനൊപ്പം)

ചാർട്ട്/ടേബിൾ ഡ്രാഫ്റ്റ്

സ്കെച്ച് ജനറേറ്റർ

താഴ്ന്ന

അനലിസ്റ്റ്

ടെസ്റ്റ്/മോഡൽ വാക്യഘടന റിമൈൻഡർ

റഫറൻസ് അസിസ്റ്റൻ്റ്

താഴ്ന്ന ഇടത്തരം

അനലിസ്റ്റ്

ഡ്രാഫ്റ്റ് കോഫിഫിഷ്യൻ്റ് വ്യാഖ്യാനം

കരട് എഴുത്തുകാരൻ

ഇടത്തരം

സാമ്പത്തിക ശാസ്ത്രജ്ഞൻ

മോഡൽ/തിരിച്ചറിയൽ തന്ത്രം തിരഞ്ഞെടുക്കൽ

സഹായ ഇൻപുട്ട്

ഉയർന്നത്

വിദഗ്ധ ഗവേഷകൻ

കാര്യകാരണ വാദം

ഒരു ഡ്രാഫ്റ്റ് മാത്രം, ഒരിക്കലും അവസാന വാക്ക് അല്ല

വളരെ ഉയർന്നത്

വിദഗ്ദ്ധൻ + പിയർ അവലോകനം

പ്രസിദ്ധീകരണം/നയ തീരുമാനം

ഇൻപുട്ട് മാത്രം

വളരെ ഉയർന്നത്

ഉത്തരവാദിത്തമുള്ള അന്വേഷകൻ/സ്ഥാപനം

ഈ പട്ടികയിലെ ഒരു വരി മനസ്സിൽ വയ്ക്കുക: അപകടസാധ്യത വർദ്ധിക്കുന്നതിനനുസരിച്ച്, AI-യുടെ പങ്ക് ചുരുങ്ങുകയും വിദഗ്ധരുടെ അംഗീകാരം വർദ്ധിക്കുകയും ചെയ്യുന്നു.

എന്തുകൊണ്ടാണ് "സ്ഥിരീകരണം" ഈ ബിസിനസിൻ്റെ ഹൃദയം

ഭാഷാ മോഡലുകൾ അവരുടെ ഉത്തരത്തിൽ ആത്മവിശ്വാസമുള്ളതായി തോന്നുന്നു, പക്ഷേ അവർക്ക് ഉറപ്പുണ്ടായിരിക്കില്ല. സാങ്കേതിക ഭാഷയിൽ, ഇതിനെ ഹാലുസിനേഷൻ എന്ന് വിളിക്കുന്നു: നിലവിലില്ലാത്ത വിവരങ്ങൾ ഒരു ഒഴുക്കുള്ള വാക്യത്തിൽ, അത് ശരിയാണെന്ന മട്ടിൽ മോഡലിൻ്റെ കെട്ടിച്ചമച്ചതാണ്. ഒരു സാമ്പത്തിക ശാസ്ത്രജ്ഞനെ സംബന്ധിച്ചിടത്തോളം ഇതൊരു മാരകമായ കെണിയാണ്. "2015-2020 കാലഘട്ടത്തിൽ തുർക്കിയിൽ തൊഴിലില്ലായ്മയും പണപ്പെരുപ്പവും തമ്മിലുള്ള പരസ്പരബന്ധം 0.62 ആണ്" എന്നതുപോലുള്ള കൃത്യമായ സംഖ്യ ഈ മോഡലിന് നൽകാനാകും; എന്നിരുന്നാലും, അവൻ നിങ്ങളുടെ ഡാറ്റ കണ്ടിട്ടില്ല, ഈ നമ്പർ പൂർണ്ണമായും നിർമ്മിച്ചതാണ്. അല്ലെങ്കിൽ, "വൈറ്റ് ടെസ്റ്റ് പി-വാല്യൂ 0.03 ആയിരുന്നു" എന്ന് പറഞ്ഞേക്കാം; അതേസമയം അത് ടെസ്റ്റുകളൊന്നും നടത്തിയില്ല. യഥാർത്ഥത്തിൽ നിലവിലില്ലാത്ത ഒരു ആർഗ്യുമെൻ്റ് ഉപയോഗിച്ച് ഇതിന് ഒരു R ഫംഗ്‌ഷനെ വിളിക്കാൻ കഴിയും. അവൻ മൂന്നും ഒരേ ഒഴുക്കോടെ പാടുന്നു; ശരിയും തെറ്റും വേർതിരിക്കുന്ന ഒരേയൊരു കാര്യം നിങ്ങളുടെ അറിവും പരിശോധിക്കാനുള്ള നിങ്ങളുടെ ശീലവുമാണ്.

സ്ഥിരീകരണ അച്ചടക്കം മൂന്ന് ഘട്ടങ്ങൾ ഉൾക്കൊള്ളുന്നു:

  1. നിങ്ങളുടെ സ്വന്തം പരിതസ്ഥിതിയിൽ വീണ്ടും കണക്കാക്കുക / പ്രവർത്തിപ്പിക്കുക: AI യുടെ മെമ്മറിയിൽ നിന്നല്ല, നിങ്ങളുടെ സ്വന്തം ഡാറ്റ ഉപയോഗിച്ച് R/Python-ൽ AI നൽകുന്ന എല്ലാ സംഖ്യയും അനുപാതവും ടെസ്റ്റ് ഫലവും ഗുണകവും കണക്കാക്കുക. കോഡ് എഴുതാൻ AI ഉപയോഗിക്കുക, ഫലം ഓർമ്മിക്കരുത്. കോഡ് പ്രവർത്തിപ്പിക്കുക, നിങ്ങൾ ഔട്ട്പുട്ട് നിർമ്മിക്കുക.
  2. ഉറവിടത്തിലേക്കുള്ള ലിങ്ക്: രീതി നിയമങ്ങൾ, സൂത്രവാക്യങ്ങൾ, നിർവചനങ്ങൾ എന്നിവയ്ക്കായി പാഠപുസ്തകങ്ങൾ, രീതികൾ ലേഖനങ്ങൾ, ഔദ്യോഗിക പ്രമാണങ്ങൾ എന്നിവയെ ആശ്രയിക്കുക. "ഈ ടെസ്റ്റിൻ്റെ അനുമാനം" എന്ന AI-യുടെ പ്രസ്താവന വിശ്വസനീയമായ ഒരു ഉറവിടം ഉപയോഗിച്ച് സ്ഥിരീകരിക്കുക.
  3. സ്റ്റാറ്റിസ്റ്റിക്കൽ ഫിൽട്ടർ: ഔട്ട്‌പുട്ട് സ്റ്റാറ്റിസ്റ്റിക്കൽ ലോജിക്കിന് (അനുമാനങ്ങൾ, സാമ്പിൾ, ഇഫക്റ്റ് സൈസ്, അനിശ്ചിതത്വം) വിരുദ്ധമാണോ എന്ന് വിദഗ്ദ കണ്ണുകളോടെ പരിശോധിക്കുക. "അർഥപൂർണവും എന്നാൽ അസംബന്ധവുമായ" ഫലം നിരസിക്കുക.
മുന്നറിയിപ്പ്: AI- ജനറേറ്റഡ് കോഫിഫിഷ്യൻ്റ്, ടെസ്റ്റ് അല്ലെങ്കിൽ വ്യാഖ്യാനം എന്നിവ സാധൂകരിക്കാതെ ഒരു ലേഖനത്തിലോ തീസിലോ പോളിസി നോട്ടിലോ ഇടുന്നത് അവലോകനം ചെയ്യാത്ത ഒരു കണ്ടെത്തൽ പ്രസിദ്ധീകരിക്കുന്നതിന് തുല്യമാണ്. ഔട്ട്പുട്ട് സുഗമമായതിനാൽ ശരിയല്ല; നമ്പർ ഉറപ്പാണെന്ന് തോന്നുന്നതുകൊണ്ട്, അത് യഥാർത്ഥമല്ല.

സ്വകാര്യത: മൈക്രോ ഡാറ്റയും ലൈസൻസുള്ള ഡാറ്റയും സ്വകാര്യമായി പരിരക്ഷിച്ചിരിക്കുന്നു

മൈക്രോഡാറ്റ (വ്യക്തി, ഗാർഹിക, സ്ഥാപനം അല്ലെങ്കിൽ രോഗി തലത്തിലുള്ള ഒറ്റ രേഖകൾ) എക്കണോമെട്രിക്സിൽ പതിവായി ഉപയോഗിക്കുന്നു. ഈ ഡാറ്റയിൽ ഭൂരിഭാഗവും വ്യക്തിഗത ഡാറ്റയാണ് കൂടാതെ Türkiye-യിലെ KVKK (വ്യക്തിഗത ഡാറ്റ സംരക്ഷണ നിയമം), യൂറോപ്പിലെ GDPR എന്നിവയ്ക്ക് കീഴിൽ പരിരക്ഷിച്ചിരിക്കുന്നു. കൂടാതെ, ടർക്ക്സ്റ്റാറ്റ്, സെൻട്രൽ ബാങ്കുകൾ, പാനൽ ഡാറ്റ ദാതാക്കളും വാണിജ്യ സ്രോതസ്സുകളും പലപ്പോഴും ഡാറ്റ ഉപയോഗ കരാറിനൊപ്പം ഡാറ്റ നൽകുന്നു; ഈ കരാറുകൾ മൂന്നാം കക്ഷികൾക്ക് ഡാറ്റ കൈമാറുന്നത് നിരോധിക്കുന്നു. ഒരു പൊതു AI ചാറ്റ് ടൂളിലേക്ക് ഐഡൻ്റിറ്റി വിവരങ്ങൾ, വരുമാനം, ആരോഗ്യം അല്ലെങ്കിൽ കമ്പനി രഹസ്യങ്ങൾ എന്നിവ അടങ്ങിയ ഒരു പട്ടിക ഒട്ടിക്കുന്നത് KVKK/GDPR ലംഘനവും കരാർ ലംഘനവുമാണ്; കാരണം ഡാറ്റ ഒരു ബാഹ്യ സെർവറിലേക്ക് പോകുകയും ചില ടൂളുകളിൽ മോഡൽ പരിശീലനത്തിൽ ഉപയോഗിക്കുകയും ചെയ്യാം.

നിയമം ലളിതമാണ്: ഡാറ്റ അതിൻ്റേതായ സുരക്ഷിത പരിതസ്ഥിതിയിൽ സൂക്ഷിക്കുക, കോഡും രീതികളും മാത്രം AI-യോട് ചോദിക്കുക. അനുയോജ്യമായ വർക്ക്ഫ്ലോ ഇതാണ്: വിശകലന കോഡിനായി AI-യോട് ചോദിക്കുക, നിങ്ങളുടെ സ്വന്തം കമ്പ്യൂട്ടർ/എൻ്റർപ്രൈസ് സെർവറിൽ യഥാർത്ഥ ഡാറ്റ ഉപയോഗിച്ച് നിങ്ങൾ കോഡ് പ്രവർത്തിപ്പിക്കുക. നിങ്ങൾ ശരിക്കും ഡാറ്റ പങ്കിടേണ്ടതുണ്ടെങ്കിൽ, അജ്ഞാതമാക്കുക (ഐഡി ഫീൽഡുകൾ നീക്കം ചെയ്യുക), സമാഹരിക്കുക (വ്യക്തിഗതമായതിനേക്കാൾ ശരാശരി/എണ്ണം), കൂടാതെ സ്ഥാപനപരവും ഡാറ്റ പ്രോസസ്സിംഗ് കരാറുള്ളതും വിദ്യാഭ്യാസത്തിൽ നിങ്ങളുടെ ഡാറ്റ ഉപയോഗിക്കാത്തതുമായ ടൂളുകൾ തിരഞ്ഞെടുക്കുക.

മൂന്ന് മിനി കേസുകൾ

കേസ് 1 - സുരക്ഷിതവും കാര്യക്ഷമവുമായ ഉപയോഗം. ഗാർഹിക ബജറ്റ് ഡാറ്റയുടെ 40,000 വരികൾ സ്വമേധയാ വൃത്തിയാക്കാൻ ഒരു ഗവേഷകൻ ആദ്യം 6 മണിക്കൂർ ചെലവഴിച്ചു. ഡാറ്റ ഷെയർ ചെയ്യാതെ തന്നെ, വേരിയബിൾ പേരുകളും ഘടനയും അദ്ദേഹം AI-യോട് വിവരിക്കുകയും ഒരു ക്ലീനിംഗ് കോഡ് ആവശ്യപ്പെടുകയും ചെയ്തു. AI ഒരു R സ്ക്രിപ്റ്റ് സൃഷ്ടിച്ചു; ഗവേഷകൻ സ്വന്തം പരിതസ്ഥിതിയിൽ കോഡ് പ്രവർത്തിപ്പിച്ചു, ഓരോ ഘട്ടത്തിൻ്റെയും വരികളുടെ എണ്ണവും സംഗ്രഹ സ്ഥിതിവിവരക്കണക്കുകളും പരിശോധിച്ച് രണ്ട് ലോജിക് പിശകുകൾ പരിഹരിച്ചു. ദൈർഘ്യം: 6 മണിക്കൂറിന് പകരം 70 മിനിറ്റ്. ഡാറ്റ ഒരിക്കലും പുറത്തു പോയിട്ടില്ല; ഉത്തരവാദിത്തം ഗവേഷകനിൽ തുടർന്നു.

കേസ് 2 - സ്ഥിരീകരിക്കാത്ത നമ്പർ ട്രാപ്പ്. "ജിഡിപി വളർച്ചയും വിദേശ നേരിട്ടുള്ള നിക്ഷേപവും തമ്മിലുള്ള ഇലാസ്തികത എന്താണ്," ഒരു ബിരുദ വിദ്യാർത്ഥി AI യോട് ചോദിച്ചു. ഒരു ഡാറ്റയിലേക്കും ആക്‌സസ് ഇല്ലെങ്കിലും AI ആത്മവിശ്വാസത്തോടെ "ഏകദേശം 0.34" എണ്ണം നൽകി. സാഹിത്യ സംഗ്രഹത്തിൽ വിദ്യാർത്ഥി ഇങ്ങനെ എഴുതി; അദ്ദേഹത്തിൻ്റെ ഉപദേഷ്ടാവ് ഉറവിടത്തെക്കുറിച്ച് ചോദിച്ചപ്പോൾ, നമ്പറിന് അടിസ്ഥാനമില്ലെന്നും പൂർണ്ണമായും കെട്ടിച്ചമച്ചതാണെന്നും മനസ്സിലായി. തെറ്റ്: ഡാറ്റയും ഉറവിടങ്ങളും നൽകാതെ AI-ൽ നിന്ന് കൃത്യമായ സ്ഥിതിവിവരക്കണക്കുകൾ പ്രതീക്ഷിക്കുന്നു.

കേസ് 3 - രഹസ്യാത്മകതയും കരാർ ലംഘനവും. ഒരു അനലിസ്റ്റ് എക്സൽ, കമ്പനിയുടെ പേരും വിറ്റുവരവും അടങ്ങുന്ന ലൈസൻസുള്ള കമ്പനി പാനലിൽ നിന്ന് തനിക്ക് ലഭിച്ച എക്സൽ, പൊതുവായി ലഭ്യമായ ഒരു AI ടൂളിലേക്ക് അപ്‌ലോഡ് ചെയ്യുകയും "പാനൽ റിഗ്രഷൻ ചെയ്യുക" എന്ന് പറയുകയും ചെയ്തു. ഡാറ്റ ദാതാവിൻ്റെ കരാർ മൂന്നാം കക്ഷി സിസ്റ്റങ്ങളിലേക്ക് ഡാറ്റ കൈമാറുന്നത് നിരോധിച്ചിരിക്കുന്നു; സംഭവം പാലിക്കൽ അവലോകനത്തിന് പ്രേരിപ്പിച്ചു. കമ്പനിയുടെ പേരുകൾ അജ്ഞാത കോഡുകൾ ഉപയോഗിച്ച് മാറ്റിസ്ഥാപിക്കുകയോ ഡാറ്റയൊന്നും പങ്കിടുകയോ പാനൽ റിഗ്രഷൻ കോഡ് മാത്രം അഭ്യർത്ഥിക്കുകയും സ്വന്തം പരിതസ്ഥിതിയിൽ പ്രവർത്തിപ്പിക്കുകയും ചെയ്യുക എന്നതായിരുന്നു ശരിയായ മാർഗം.

ദുർബലമായ പ്രോംപ്റ്റ് / ശക്തമായ പ്രോംപ്റ്റ്

ദുർബലമായ പ്രോംപ്റ്റ്:

പണപ്പെരുപ്പവും തൊഴിലില്ലായ്മയും തമ്മിലുള്ള ബന്ധം വിശകലനം ചെയ്ത് ഗുണകം പ്രസ്താവിക്കുക.

ഈ അവകാശവാദം തെറ്റാണ്: AI-ക്ക് ഡാറ്റയൊന്നും നൽകിയിട്ടില്ല, ഏത് രാജ്യം, ഏത് കാലഘട്ടം, ഏത് മോഡൽ എന്നിവ വ്യക്തമല്ല. AI-ന് ഒരു നിർമ്മിത ഗുണകം ഉപയോഗിച്ച് മാത്രമേ ഉത്തരം നൽകാൻ കഴിയൂ.

ശക്തമായ നിർദ്ദേശം:

നിങ്ങളുടെ പങ്ക്: നിങ്ങൾ ഇക്കണോമെട്രിക്സ് ഗവേഷകനെ സഹായിക്കുന്ന ഒരു വിശകലന സഹായിയാണ്. ഞാൻ നിങ്ങളുമായി ഡാറ്റ പങ്കിടുന്നില്ല; എനിക്ക് RUNNABLE R കോഡ് വേണം. എനിക്ക് വാർഷിക പാനൽ ഉണ്ട്: വേരിയബിളുകൾ രാജ്യം, വർഷം, തൊഴിലില്ലായ്മ, പണപ്പെരുപ്പം (എല്ലാ സംഖ്യകളും). ടാസ്ക്: 1) തൊഴിലില്ലായ്മ ~ നാണയപ്പെരുപ്പം (plm പാക്കേജ്) എന്നതിന് ഒരു നിശ്ചിത ഇഫക്റ്റ് പാനൽ റിഗ്രഷൻ കോഡ് എഴുതുക, 2) കോഡിലെ ഓരോ ഘട്ടവും ഒരു കമൻ്റ് ലൈനോടെ വിശദീകരിക്കുക, 3) കോഫിഫിഷ്യൻ റിലേഷണൽ ആയി വ്യാഖ്യാനിക്കണം, കാര്യകാരണമല്ല, 4) നിങ്ങൾക്ക് ഉറപ്പില്ലാത്ത ഫംഗ്ഷൻ ആർഗ്യുമെൻ്റ് ഉണ്ടാക്കുക; എൻ്റെ സ്വന്തം പരിതസ്ഥിതിയിൽ ഞാൻ ഓടി ഫലം പരിശോധിക്കും.

ഈ അഭ്യർത്ഥനയിൽ, ഡാറ്റയൊന്നും പങ്കിട്ടിട്ടില്ല, പങ്ക്, പാക്കേജുകൾ, അഭിപ്രായങ്ങളുടെ പ്രതീക്ഷ, "ഫാബ്രിക്കേഷൻ" നിരോധനം എന്നിവ വ്യക്തമാണ്. നിങ്ങൾ ഇപ്പോഴും ഔട്ട്പുട്ട് സ്വയം പ്രവർത്തിപ്പിച്ച് പരിശോധിച്ചുറപ്പിക്കുന്നു.

ഇനിപ്പറയുന്ന പട്ടിക ഈ പാഠത്തിലെ ഒറ്റ വാക്യ നിയമങ്ങൾ സംഗ്രഹിക്കുന്നു:

തത്വം

എന്താണ് അർത്ഥമാക്കുന്നത്

AI ഒരു സഹായിയാണ്

ശാസ്ത്രീയ തീരുമാനവും ഉത്തരവാദിത്തവും വിദഗ്ധനുടേതാണ്

കോഡ് അഭ്യർത്ഥിക്കുക, ഫലം ഉണ്ടാക്കുക

AI നമ്പർ ഓർക്കുന്നില്ല; നിങ്ങൾ അത് പ്രവർത്തിപ്പിച്ച് കണക്കാക്കുക

ഡാറ്റ സൂക്ഷിക്കുക

മൈക്രോ/ലൈസൻസുള്ള ഡാറ്റ സുരക്ഷിതമായ പരിതസ്ഥിതിയിൽ നിന്ന് പുറത്തുപോകില്ല

സ്ഥിരീകരിക്കുക

എല്ലാ പ്രശ്‌നങ്ങളും കോഡുകളും അഭിപ്രായങ്ങളും പരിശോധിക്കുന്നു; കെട്ടിച്ചമച്ചത് നിരസിക്കപ്പെട്ടു

സാധാരണ തെറ്റുകൾ

  • ഡാറ്റ നൽകാതെ AI-യിൽ നിന്ന് കൃത്യമായ സ്ഥിതിവിവരക്കണക്കുകൾ പ്രതീക്ഷിക്കുന്നു. മോഡലിന് ഡാറ്റ ആക്സസ് ചെയ്യാൻ കഴിയില്ല; ഇത് നൽകുന്ന കോഫിഫിഷ്യൻ്റ്, കോറിലേഷൻ, പി-വാല്യൂ എന്നിവ വ്യാജമാണ്. എല്ലായ്പ്പോഴും കോഡ് അഭ്യർത്ഥിക്കുകയും ഫലം സ്വയം നിർമ്മിക്കുകയും ചെയ്യുക.
  • ഭ്രമാത്മക പ്രവർത്തനങ്ങളെ ആശ്രയിക്കുന്നു. നിലവിലില്ലാത്ത ഒരു R/Python ഫംഗ്‌ഷനോ ആർഗ്യുമെൻ്റോ AI നിർദ്ദേശിച്ചേക്കാം. കോഡ് പ്രവർത്തിപ്പിച്ച് പരിശോധിച്ചുറപ്പിക്കാതെ സ്വീകരിക്കരുത്.
  • പൊതു ഉപകരണത്തിലേക്ക് മൈക്രോഡാറ്റ അപ്‌ലോഡ് ചെയ്യുന്നു. ഇത് കെവികെകെ/ജിഡിപിആറിൻ്റെയും ഡാറ്റ ഉപയോഗ കരാറിൻ്റെയും ലംഘനമാണ്. ഡാറ്റ അജ്ഞാതമാക്കുക അല്ലെങ്കിൽ അത് പങ്കിടരുത്.
  • ഫ്ലൂൻസി കൃത്യതയ്ക്കായി തെറ്റിദ്ധരിക്കുന്നു. നന്നായി എഴുതിയ അവലോകനം കൃത്യമല്ലായിരിക്കാം. വാചകത്തിൻ്റെ ഭംഗി തെളിവല്ല.
  • നിയന്ത്രണമില്ലാതെ കാര്യകാരണഭാഷ സ്വീകരിക്കുന്നു. YZ പലപ്പോഴും "X വർദ്ധിപ്പിക്കുന്നു Y" എന്ന് പറയുന്നു; അതേസമയം മിക്ക റിഗ്രഷനുകളും ബന്ധങ്ങളെ മാത്രമേ കാണിക്കൂ. ഡിസൈൻ ഉപയോഗിച്ച് കാര്യകാരണ അവകാശവാദത്തെ പ്രതിരോധിക്കുക.
നുറുങ്ങ്: AI-യിൽ പ്രവർത്തിക്കുമ്പോൾ, സ്വയം ഈ ചോദ്യം ചോദിക്കുക: "ഒരു റഫറിയോ ഓഡിറ്ററോ ഈ ഔട്ട്‌പുട്ട് ആവശ്യപ്പെടുകയാണെങ്കിൽ, എനിക്ക് ഉറവിടവും അക്കൗണ്ടും കാണിക്കാമോ?" ഇല്ല എന്നാണ് ഉത്തരം എങ്കിൽ, ഔട്ട്പുട്ട് ഇതുവരെ ഉപയോഗത്തിന് തയ്യാറായിട്ടില്ല.

ചുരുക്കത്തിൽ

ഇക്കോണോമെട്രിക്സ്, സ്റ്റാറ്റിസ്റ്റിക്സ് വർക്ക്ഫ്ലോയുടെ എക്സിക്യൂഷൻ ലെയറിൽ (കോഡ്, ക്ലീനപ്പ്, ഗ്രാഫ്, ഡ്രാഫ്റ്റ്) AI യഥാർത്ഥവും വൻതോതിലുള്ളതുമായ ത്വരണം നൽകുന്നു; എന്നിരുന്നാലും, മോഡൽ തിരഞ്ഞെടുക്കൽ, കാര്യകാരണം, വ്യാഖ്യാനം, പ്രസിദ്ധീകരണം, നയപരമായ തീരുമാനങ്ങൾ എന്നിവ വിദഗ്‌ധരുടേതാണ്. മൂന്ന് അടിസ്ഥാന വിഷയങ്ങൾ: നമ്പർ AI-യെ ഓർമ്മിപ്പിക്കരുത്, കോഡ് ആവശ്യപ്പെടുക, ഫലം സ്വയം സൃഷ്ടിക്കുകയും പരിശോധിക്കുകയും ചെയ്യുക; സുരക്ഷിത പരിതസ്ഥിതിയിൽ നിന്ന് മൈക്രോ/ലൈസൻസ് ഉള്ള ഡാറ്റ നീക്കം ചെയ്യരുത്; സ്റ്റാറ്റിസ്റ്റിക്കൽ ഫിൽട്ടർ ഓരോ ഔട്ട്പുട്ടും. പരിശോധിച്ചുറപ്പിക്കാത്ത AI ഔട്ട്‌പുട്ട് അവലോകനം ചെയ്യാത്ത കണ്ടെത്തൽ പോലെ തന്നെ അപകടകരമാണ്.

ആപ്ലിക്കേഷൻ ടാസ്ക്

നിങ്ങളുടെ സ്വന്തം (അല്ലെങ്കിൽ ഒരു ഉദാഹരണം) ഡാറ്റ സെറ്റ് പരിഗണിക്കുക. വിവരണാത്മക സ്ഥിതിവിവരക്കണക്കുകളും ലളിതമായ ഒരു ഗ്രാഫും നിർമ്മിക്കുന്ന R അല്ലെങ്കിൽ പൈത്തൺ കോഡിനായി AI-യോട് ആവശ്യപ്പെടുക, ഡാറ്റ പങ്കിടാതെ തന്നെ വേരിയബിൾ ഘടനയെ വിവരിക്കുക. നിങ്ങളുടെ സ്വന്തം പരിതസ്ഥിതിയിൽ ഇൻകമിംഗ് കോഡ് പ്രവർത്തിപ്പിക്കുക. തുടർന്ന് ഒരു ചെക്ക്‌ലിസ്റ്റ് സൂക്ഷിക്കുക: (1) കോഡ് പിശകുകളില്ലാതെ പ്രവർത്തിച്ചോ, (2) നിങ്ങൾ പ്രതീക്ഷിച്ചതുപോലെ വരികളുടെ/നിരീക്ഷണങ്ങളുടെ എണ്ണം, (3) AI-യുടെ കമൻ്റ് വാക്യങ്ങളിൽ ഏതാണ് കാര്യകാരണമായ ഭാഷ ഉപയോഗിക്കുന്നത്, അത് ശരിയാക്കണം. ഒരു ഖണ്ഡികയിൽ, AI നിങ്ങളെ സംരക്ഷിച്ച സമയത്തെക്കുറിച്ചും കുറഞ്ഞത് ഒരു ബഗെങ്കിലും നിങ്ങൾ പിടികൂടിയതിനെക്കുറിച്ചും എഴുതുക.

ചെക്ക്ലിസ്റ്റ്

  • [ ] ഞാൻ AI യെ കൃത്യമായ സ്ഥിതിവിവരക്കണക്കുകൾ ആവശ്യപ്പെടാൻ പ്രേരിപ്പിച്ചില്ല; ഞാൻ കോഡ് അഭ്യർത്ഥിക്കുകയും ഫലം സ്വയം തയ്യാറാക്കുകയും ചെയ്തു.
  • [ ] എൻ്റെ സ്വന്തം പരിതസ്ഥിതിയിൽ അത് നൽകിയ എല്ലാ സംഖ്യകളും പരിശോധന ഫലങ്ങളും ഞാൻ വീണ്ടും കണക്കാക്കി.
  • [ ] അത് ഉപയോഗിക്കുന്ന ഫംഗ്‌ഷനുകൾ/ആർഗ്യുമെൻ്റുകൾ യഥാർത്ഥത്തിൽ നിലവിലുണ്ടെന്ന് ഞാൻ പരിശോധിച്ചു.
  • [ ] ഞാൻ ഒരു പൊതു ഉപകരണത്തിലേക്ക് മൈക്രോ/വ്യക്തിഗത/ലൈസൻസുള്ള ഡാറ്റ അപ്‌ലോഡ് ചെയ്തിട്ടില്ല.
  • [ ] ഞാൻ കാര്യകാരണ ഭാഷ അടങ്ങിയ അഭിപ്രായങ്ങൾ അടയാളപ്പെടുത്തി അവ ബന്ധ ഭാഷയിലേക്ക് നീക്കി.
  • [ ] ഔട്ട്‌പുട്ടിൻ്റെ ഉറവിടവും അക്കൗണ്ടിംഗും ഒരു ഓഡിറ്ററെ കാണിക്കാൻ എനിക്ക് കഴിയും.