യൂണിറ്റുകൾ
1. ഡാറ്റാ സയൻസിലും അനലിറ്റിക്‌സിലും ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസിൻ്റെ ആമുഖം: വർക്ക്ഫ്ലോ, റോളുകൾ, അതിരുകൾ, മൂല്യനിർണ്ണയം, ധാർമ്മികത 2. വിവര ശേഖരണവും ഉറവിട ധാരണയും: സ്കീമ, സാമ്പിളിംഗ്, ഗുണനിലവാരം, ചോർച്ച അവബോധം 3. ഡാറ്റ ക്ലീനിംഗും പ്രീപ്രോസസിംഗും: നഷ്‌ടമായ മൂല്യം, ഔട്ട്‌ലിയർ, തരം പരിവർത്തനം 4. എക്സ്പ്ലോറേറ്ററി ഡാറ്റ അനാലിസിസ് (EDA): വിതരണങ്ങൾ, ബന്ധങ്ങൾ, പ്രാരംഭ സ്ഥിതിവിവരക്കണക്കുകൾ 5. ഫീച്ചർ എഞ്ചിനീയറിംഗ്: വേരിയൻ്റുകൾ സൃഷ്ടിക്കുന്നു, കോഡിംഗ്, സ്കെയിലിംഗ്, ചോർച്ച ഒഴിവാക്കൽ 6. മോഡൽ ബിൽഡിംഗ്: പ്രശ്ന നിർവചനം, അൽഗോരിതം തിരഞ്ഞെടുക്കൽ, പരിശീലനം/ടെസ്റ്റ് വിഭജനം 7. മോഡൽ മൂല്യനിർണ്ണയം: മെട്രിക്‌സ്, ക്രോസ്-വാലിഡേഷൻ, എക്‌സ്ട്രീം ലേണിംഗ് 8. ദൃശ്യവൽക്കരണവും കഥപറച്ചിലും: കൃത്യമായ ഗ്രാഫിക്സ്, സത്യസന്ധമായ ഗ്രാഫിക്സ് 9. കോഡ് ജനറേഷൻ: പൈത്തൺ (പാണ്ടകൾ), SQL എന്നിവയ്‌ക്കൊപ്പമുള്ള AI-അസിസ്റ്റഡ് അനാലിസിസ് 10. ഡാറ്റ ചോർച്ചയും പുനരുൽപ്പാദനവും: നിശബ്ദ ദുരന്തങ്ങളും അച്ചടക്കവും 11. MLOps ഫൗണ്ടേഷൻ, എത്തിക്സ്, പ്രൈവസി, റെസ്‌പോൺസിബിൾ അനലിറ്റിക്‌സ്
യൂണിറ്റ് 1 / 11

ഡാറ്റാ സയൻസിലും അനലിറ്റിക്‌സിലും ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസിൻ്റെ ആമുഖം: വർക്ക്ഫ്ലോ, റോളുകൾ, അതിരുകൾ, മൂല്യനിർണ്ണയം, ധാർമ്മികത

നേട്ടങ്ങൾ:

  • ഡാറ്റാ സയൻസിൻ്റെ ആറ്-ഘട്ട വർക്ക്ഫ്ലോയും (പ്രശ്ന നിർവചനം, ശേഖരണം, വൃത്തിയാക്കൽ, കണ്ടെത്തൽ, മോഡലിംഗ്, ആശയവിനിമയം) ടാസ്‌ക് റിസ്ക് ലെവൽ അനുസരിച്ച് ഓരോ ഘട്ടത്തിലും ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് പ്രവർത്തിക്കുന്ന അതോറിറ്റി എന്നിവയെ വേർതിരിച്ചറിയാനുള്ള കഴിവ്
  • ഓരോ ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് ഔട്ട്‌പുട്ടും സോഴ്‌സുമായി ബന്ധിപ്പിച്ച്, പ്രവർത്തിപ്പിക്കുകയും താരതമ്യം ചെയ്യുകയും, വിദഗ്ധ ഫിൽട്ടറിംഗിലൂടെ കടന്നുപോകുകയും ചെയ്യുന്ന ഒരു അച്ചടക്കം പ്രയോഗിക്കാനുള്ള കഴിവ്.
  • പുനരുൽപാദനക്ഷമതയും സ്വകാര്യത തത്വങ്ങളും (കോഡിലേക്ക് എഴുതൽ, അജ്ഞാതമാക്കൽ) ആദ്യ ദിവസം മുതൽ വിശകലന ശീലങ്ങളാക്കി മാറ്റാനുള്ള കഴിവ്

അസംസ്‌കൃതവും കുഴഞ്ഞുമറിഞ്ഞതും പലപ്പോഴും “നുണ പറയുന്നതുമായ” ഡാറ്റ എല്ലാ ദിവസവും ഒരു ഡാറ്റാ സയൻ്റിസ്റ്റിൻ്റെ മേശപ്പുറത്ത് പതിക്കുന്നു. വിൽപ്പന പട്ടികയിൽ, തീയതി കോളം മൂന്ന് വ്യത്യസ്ത ഫോർമാറ്റുകളിൽ എഴുതിയിരിക്കുന്നു; ഉപഭോക്തൃ നമ്പറുകൾ ചില വരികളിൽ ശൂന്യമാണ്; ഒരു കോളത്തിൻ്റെ പേര് "വരുമാനം" എന്നാണ്, എന്നാൽ അതിൽ TL, USD മൂല്യങ്ങൾ അടങ്ങിയിരിക്കുന്നു. ഈ കുഴപ്പത്തിൽ നിന്ന് വിശ്വസനീയമായ ഒരു തീരുമാനം എടുക്കുക എന്നതാണ് ഡാറ്റാ സയൻസിൻ്റെ ജോലി: ഡാറ്റ ശേഖരിക്കുക, വൃത്തിയാക്കുക, പര്യവേക്ഷണം ചെയ്യുക, ഒരു മാതൃക നിർമ്മിക്കുക, ഫലം സാധൂകരിക്കുക, അതിനെ ഒരു സ്റ്റോറിയാക്കി മാറ്റുക. ടെക്‌സ്‌റ്റും കോഡും സൃഷ്‌ടിക്കാനും പാറ്റേണുകൾ തിരിച്ചറിയാനും സംഗ്രഹിക്കാനും പ്രവചനങ്ങൾ നടത്താനും കഴിയുന്ന ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് (AI, അല്ലെങ്കിൽ ഹ്രസ്വമായ കമ്പ്യൂട്ടർ സിസ്റ്റങ്ങൾക്ക് AI) ഈ ശൃംഖലയിലെ എല്ലാ ലിങ്കുകളും സ്‌പർശിക്കാൻ കഴിയും: മിനിറ്റുകൾക്കുള്ളിൽ ക്ലീനപ്പ് കോഡ് എഴുതുക, പര്യവേക്ഷണ വിശകലനത്തിനായി ഗ്രാഫുകൾ ശുപാർശ ചെയ്യുക, മോഡലിൻ്റെ മെട്രിക് വ്യാഖ്യാനിക്കുക, ഒരു SQL ചോദ്യം ശരിയാക്കുക. എന്നാൽ ഇതുവരെ കണ്ടിട്ടില്ലാത്ത ഡാറ്റയ്‌ക്കായി "കോറിലേഷൻ 0.72" പോലെയുള്ള ആത്മവിശ്വാസം നൽകുന്ന ഫാബ്രിക്കേഷനും ഇതേ AI-ന് നിങ്ങൾക്ക് നൽകാൻ കഴിയും.

ഈ ആദ്യ യൂണിറ്റ് ഒരു ലൈബ്രറി ആമുഖമല്ല. ഡാറ്റാ സയൻസ് വർക്ക്ഫ്ലോയിൽ AI എവിടെ വയ്ക്കണം എന്നും എവിടെ വയ്ക്കരുതെന്നും വ്യക്തമാക്കുക എന്നതാണ് ഇതിൻ്റെ ഉദ്ദേശം. നമുക്ക് ആദ്യം മുതൽ അടിസ്ഥാന തത്വം നിരത്താം: AI ഒരു സഹായിയാണ്, ഒരു ഡാറ്റ ശാസ്ത്രജ്ഞനല്ല. ഏത് ഡാറ്റ ശേഖരിക്കണം, ഏത് മെട്രിക് തീരുമാനിക്കണം, ഒരു മോഡൽ ഉൽപ്പാദനത്തിൽ ഉൾപ്പെടുത്തണമോ, എവിടെ നൈതിക അതിരുകൾ വരയ്ക്കണം എന്നീ കാര്യങ്ങളുടെ തീരുമാനം കഴിവുള്ള വിദഗ്ദ്ധനുടേതാണ്. ഒപ്പിടാത്ത വിശകലന റിപ്പോർട്ട് പോലെ, സ്ഥിരീകരിക്കാത്ത AI ഔട്ട്‌പുട്ട് അപകടകരമാണ്.

ഡാറ്റാ സയൻസ് വർക്ക്ഫ്ലോ: എൻഡ്-ടു-എൻഡ് മാപ്പ്

ഒരു ഡാറ്റാ പ്രോജക്റ്റ് മനസിലാക്കാൻ, അതിനെ ആറ് ഘട്ടങ്ങളായി വിഭജിക്കുന്നത് സഹായകമാണ്. ഈ മൊഡ്യൂളും ഈ മാപ്പിനെ പിന്തുടരുന്നു.

1. പ്രശ്ന നിർവചനം: ഏത് തീരുമാനത്തെ പിന്തുണയ്ക്കാൻ ഞങ്ങൾ എന്താണ് അളക്കുന്നത്, എന്തുകൊണ്ട്? ഈ ഘട്ടം AI-ലേക്ക് നിയുക്തമാക്കിയിട്ടില്ല; ജോലി നിർവചിക്കുന്നത് വ്യക്തിയാണ്.

2. ഡാറ്റ ശേഖരണം: ഉറവിടങ്ങൾ തിരിച്ചറിയൽ, ഡാറ്റ എക്‌സ്‌ട്രാക്റ്റുചെയ്യൽ, സാമ്പിൾ എടുക്കൽ. (യൂണിറ്റ് 2)

3. ഡാറ്റ ക്ലീനിംഗും പ്രീപ്രോസസിംഗും: നഷ്ടപ്പെട്ട മൂല്യം, ഔട്ട്‌ലിയർ, തരം പരിവർത്തനം. (യൂണിറ്റ് 3)

4. പര്യവേക്ഷണ ഡാറ്റ വിശകലനം (EDA - എക്സ്പ്ലോറേറ്ററി ഡാറ്റ അനാലിസിസ്, "കണ്ണിലൂടെ" ഡാറ്റയുടെ വിതരണവും ബന്ധങ്ങളും തിരിച്ചറിയുന്ന ഘട്ടം): (യൂണിറ്റ് 4)

5. ഫീച്ചർ എൻജിനീയറിങ്ങും മോഡലിംഗും: വേരിയബിൾ ജനറേഷൻ, അൽഗോരിതം തിരഞ്ഞെടുക്കൽ, പരിശീലനം, മൂല്യനിർണ്ണയം. (യൂണിറ്റ് 5, 6, 7)

6. ആശയവിനിമയവും നിർമ്മാണവും: ദൃശ്യവൽക്കരണം, കഥ, MLOps (മോഡൽ തത്സമയം എടുക്കുകയും നിരീക്ഷിക്കുകയും ചെയ്യുന്ന അച്ചടക്കം). (യൂണിറ്റ് 8, 11)

ഈ ആറ് ഘട്ടങ്ങളിൽ ഓരോന്നിലും വ്യത്യസ്തമായ അധികാരത്തോടെയാണ് AI പ്രവർത്തിക്കുന്നത്. താഴെയുള്ള പട്ടിക അധികാരത്തിൻ്റെ ഈ വിതരണത്തെ സംഗ്രഹിക്കുന്നു; മൊഡ്യൂളിൻ്റെ ഏറ്റവും പ്രധാനപ്പെട്ട പട്ടികയാണിത്.

സ്റ്റേജ്

AI യുടെ പങ്ക്

റിസ്ക് ലെവൽ

ആർ അംഗീകരിക്കുന്നു

പ്രശ്ന നിർവചനം

മസ്തിഷ്കപ്രക്ഷോഭം പങ്കാളി

താഴ്ന്ന

ഡാറ്റ ശാസ്ത്രജ്ഞൻ + ഓഹരി ഉടമ

ഒരു ക്ലീനപ്പ് കോഡ് എഴുതുക

കോഡ് സ്കെച്ച് ജനറേറ്റർ

ഇടത്തരം

ഡാറ്റ ശാസ്ത്രജ്ഞൻ (കോഡ് വായിക്കുന്നു)

EDA അഭിപ്രായം

പാറ്റേൺ നിർദ്ദേശകൻ

ഇടത്തരം

ഡാറ്റ ശാസ്ത്രജ്ഞൻ

ഫീച്ചർ ജനറേഷൻ

ആശയവും കോഡ് ജനറേറ്ററും

ഇടത്തരം-ഉയരം

ചോർച്ച നിയന്ത്രണം അനിവാര്യമാണ്

മോഡൽ തിരഞ്ഞെടുക്കൽ/മെട്രിക്

കൺസൾട്ടൻ്റ്

ഉയർന്നത്

ഡാറ്റ ശാസ്ത്രജ്ഞൻ

ഉൽപ്പാദനത്തിൽ ഉൾപ്പെടുത്താൻ തീരുമാനം

സഹായ ഇൻപുട്ട്

വളരെ ഉയർന്നത്

ടീം + ബിസിനസ്സ് ഉടമ

ധാർമ്മികത/സ്വകാര്യത അംഗീകാരം

ഉത്തേജനം

വളരെ ഉയർന്നത്

മനുഷ്യൻ, എപ്പോഴും

ഈ ചാർട്ടിൽ നിന്നുള്ള ഒരു വാചകം ഓർമ്മിക്കുക: ഓഹരികൾ ഉയരുമ്പോൾ, AI-യുടെ പങ്ക് ചുരുങ്ങുകയും മനുഷ്യരുടെ അംഗീകാരം വർദ്ധിക്കുകയും ചെയ്യുന്നു.

എന്തുകൊണ്ടാണ് സ്ഥിരീകരണം ഈ ബിസിനസിൻ്റെ കാതൽ

AI ഭാഷാ മോഡലുകൾ ഉറപ്പാണ്, പക്ഷേ അവ ഉറപ്പില്ലായിരിക്കാം. സാങ്കേതിക ഭാഷയിൽ, ഇതിനെ ഹാലുസിനേഷൻ എന്ന് വിളിക്കുന്നു: നിലവിലില്ലാത്ത വിവരങ്ങൾ ശരിയാണെന്ന മട്ടിൽ ഒഴുക്കുള്ള ഒരു വാക്യത്തിൽ മോഡലിൻ്റെ കെട്ടിച്ചമച്ചതാണ് ഇത്. ഡാറ്റാ സയൻസിൽ, ഇത് മൂന്ന് രൂപങ്ങളിൽ വരുന്നു. ആദ്യത്തേത് ഒരു വ്യാജ നമ്പറാണ്: ഡാറ്റയൊന്നും നൽകാതെ നിങ്ങൾ മോഡലിനോട് "ശരാശരി ഓർഡർ തുക എത്ര" എന്ന് ചോദിച്ചാൽ, നിങ്ങളുടെ ഡാറ്റ ഒരിക്കലും കണ്ടിട്ടില്ലെങ്കിലും അത് ആത്മവിശ്വാസത്തോടെ നിങ്ങളോട് ഒരു നമ്പർ പറയും. രണ്ടാമത്തേത് നിലവിലില്ലാത്ത ഒരു ഫംഗ്‌ഷനാണ്: pandas.read_excel_fast() പോലെ, നിലവിലില്ലാത്ത ഒരു ഫംഗ്‌ഷൻ മോഡൽ നിർദ്ദേശിച്ചേക്കാം. മൂന്നാമതായി, തെറ്റായ സ്ഥിതിവിവരക്കണക്ക്: "p-മൂല്യം 0.04 ആണ്, അതിനാൽ അനുമാനം 96% ശരിയാണ്" പോലുള്ള ഒരു ക്ലാസിക് സ്റ്റാറ്റിസ്റ്റിക്കൽ പിശക് മോഡലിന് സുഗമമായി ആവർത്തിക്കാനാകും.

സ്ഥിരീകരണ അച്ചടക്കം മൂന്ന് ഘട്ടങ്ങൾ ഉൾക്കൊള്ളുന്നു:

  1. ഉറവിടത്തിലേക്കുള്ള ലിങ്ക്: ഓരോ നമ്പറും നിരക്കും ട്രെൻഡും നിങ്ങളുടെ ഡാറ്റയിൽ നിന്നായിരിക്കണം, AI-യുടെ മെമ്മറിയിൽ നിന്നല്ല. ഡാറ്റയിൽ പ്രവർത്തിക്കുന്ന കോഡിനായി AI ഉപയോഗിക്കുക, അത് ഡാറ്റ ഓർക്കാൻ വേണ്ടിയല്ല.
  2. പ്രവർത്തിപ്പിക്കുക, താരതമ്യം ചെയ്യുക: AI നൽകുന്ന ഓരോ കോഡും പ്രവർത്തിപ്പിക്കുക; അത് നിർമ്മിക്കുന്ന ഓരോ മെട്രിക്കും ഒരു സ്വതന്ത്ര അടിസ്ഥാനവുമായി താരതമ്യം ചെയ്യുക.
  3. വിദഗ്‌ദ്ധ ഫിൽട്ടർ: ഔട്ട്‌പുട്ട് സ്ഥിതിവിവരക്കണക്കുകൾക്കും ഡൊമെയ്ൻ വിജ്ഞാനത്തിനും വിരുദ്ധമാണോ എന്ന് സ്വയം പരിശോധിക്കുക.
മുന്നറിയിപ്പ്: AI എഴുതിയ ഒരു വിശകലനം പ്രവർത്തിപ്പിക്കാതെയും വായിക്കാതെയും ഒരു അവതരണത്തിലേക്ക് ഇടുന്നത് ഒപ്പിടാത്ത റിപ്പോർട്ട് അവതരിപ്പിക്കുന്നതിന് തുല്യമാണ്. കോഡ് പ്രവർത്തിക്കുന്നതിനാൽ അത് ശരിയാണെന്ന് അർത്ഥമാക്കുന്നില്ല; തെറ്റായ കോളം സംഗ്രഹിക്കുന്ന ഒരു കോഡും പിശകുകളില്ലാതെ പ്രവർത്തിക്കുന്നു.

പുനരുൽപ്പാദനക്ഷമത: ഒരേ ഫലം രണ്ടുതവണ സൃഷ്ടിക്കാൻ കഴിയും

ഡാറ്റാ സയൻസിൻ്റെ നിശബ്‌ദവും എന്നാൽ നിർണായകവുമായ തത്വം പുനരുൽപ്പാദനക്ഷമതയാണ്: ആറ് മാസത്തിന് ശേഷം അല്ലെങ്കിൽ മറ്റൊരു കമ്പ്യൂട്ടറിൽ നിങ്ങൾ വീണ്ടും ഒരു വിശകലനം നടത്തുമ്പോൾ, നിങ്ങൾക്ക് അതേ ഫലം ലഭിക്കും. AI-യുമായി പ്രവർത്തിക്കുമ്പോൾ ഈ അപകടസാധ്യത വർദ്ധിക്കുന്നു, കാരണം നിങ്ങൾ AI-യോട് "ഈ ഗ്രാഫ് ഉണ്ടാക്കി" അത് സ്വമേധയാ പ്ലേ ചെയ്യാൻ പറയുമ്പോൾ, ഘട്ടങ്ങൾ അപ്രത്യക്ഷമാകും. നിയമം: ഓരോ ഘട്ടവും കോഡിലും പതിപ്പ് നിയന്ത്രണത്തിലും (Git പോലെ) രജിസ്റ്റർ ചെയ്തിരിക്കണം; ക്രമരഹിതത ഉൾപ്പെടുന്ന ഘട്ടങ്ങളിൽ, ക്രമരഹിതമായ വിത്ത് (റാൻഡം നമ്പർ ജനറേറ്ററിൻ്റെ പ്രാരംഭ മൂല്യം; ഉറപ്പിച്ചാൽ, ഫലം ആവർത്തിക്കും) ഉറപ്പിക്കണം. ഞങ്ങൾ ഈ വിഷയം യൂണിറ്റ് 10 ൽ കൂടുതൽ ആഴത്തിലാക്കും; ഇപ്പോൾ, ഈ ശീലം നേടുക: "കൈകൊണ്ട് ക്ലിക്ക് ചെയ്യരുത്, കോഡിൽ എഴുതുക."

മൂന്ന് മിനി കേസുകൾ

കേസ് 1 - സുരക്ഷിതമായ ത്വരണം. ഒരു ഇ-കൊമേഴ്‌സ് അനലിസ്റ്റ് സാധാരണയായി 240 ആയിരം വരികളുടെ ഓർഡർ ടേബിൾ മായ്‌ക്കാൻ അര ദിവസം ചെലവഴിക്കും. അദ്ദേഹം കോളത്തിൻ്റെ പേരുകളും ആദ്യത്തെ 5 വരികളും (വ്യക്തിഗത ഡാറ്റ ഇല്ലാതെ) AI-ക്ക് നൽകുകയും പാണ്ടകൾ വൃത്തിയാക്കുന്നതിനുള്ള കോഡ് ആവശ്യപ്പെടുകയും ചെയ്തു. AI 8 സെക്കൻഡിനുള്ളിൽ ഡ്രാഫ്റ്റ് നിർമ്മിച്ചു; അനലിസ്റ്റ് കോഡ് വരി വരിയായി വായിക്കുകയും തീയതി പാഴ്‌സിംഗിലെ ഒരു പിശക് പരിഹരിച്ച് അത് പ്രവർത്തിപ്പിക്കുകയും ചെയ്തു. ദൈർഘ്യം: 4 മണിക്കൂറിന് പകരം 35 മിനിറ്റ്. AI കോഡ് നൽകി, പരിശോധിച്ചുറപ്പിക്കൽ മനുഷ്യനിൽ തുടർന്നു.

കേസ് 2 - നിർമ്മിച്ച മെട്രിക് ട്രാപ്പ്. ഒരു ഇൻ്റേൺ AI-യോട് ചോദിച്ചു, "ഈ ഡാറ്റയിൽ റാൻഡം ഫോറസ്റ്റ് എത്രത്തോളം കൃത്യമാണ്?" മോഡലിനെ പരിശീലിപ്പിക്കാതെ തന്നെ. “ഏകദേശം 89%,” AI പറഞ്ഞു. ഇൻ്റേൺ ഇത് അവതരണത്തിൽ ഉൾപ്പെടുത്തി; യഥാർത്ഥ മോഡൽ പരിശീലിപ്പിച്ചപ്പോൾ, കൃത്യത 71% ആയിരുന്നു. തെറ്റ്: AI-ക്ക് ഡാറ്റയും മോഡലുകളും നൽകാതെ അളവുകൾക്കായി കാത്തിരിക്കുന്നു.

കേസ് 3 - നിശബ്ദ ചോർച്ച. "ടാർഗെറ്റ് വേരിയബിളിൻ്റെ ശരാശരി ഒരു സവിശേഷതയായി ചേർക്കുക" എന്ന AI നിർദ്ദേശിച്ച ആശയം ഒരു ടീം ചോദ്യം ചെയ്യാതെ നടപ്പിലാക്കി. മോഡൽ ടെസ്റ്റ് സെറ്റിൽ 98% പ്രകടനം നടത്തി, പക്ഷേ ഫീച്ചർ ഭാവിയിലെ വിവരങ്ങൾ ചോർത്തുന്നതിനാൽ ഉൽപാദനത്തിൽ തകർന്നു (ഡാറ്റ ചോർച്ച, യൂണിറ്റ് 10). തെറ്റ്: സ്ഥിതിവിവരക്കണക്കനുസരിച്ച് AI ശുപാർശ ഫിൽട്ടർ ചെയ്യുന്നില്ല.

ദുർബലമായ പ്രോംപ്റ്റ് / ശക്തമായ പ്രോംപ്റ്റ്

ദുർബലമായ പ്രോംപ്റ്റ്:

ഈ വിൽപ്പന ഡാറ്റ വിശകലനം ചെയ്ത് ശരാശരി വരുമാനം എന്നോട് പറയുക.

ഈ അവകാശവാദം പിഴവുള്ളതാണ്: AI-ക്ക് ഡാറ്റ നൽകിയിട്ടില്ല, അതിനാൽ "ശരാശരി വരുമാനം" മാത്രമേ ഉണ്ടാക്കാൻ കഴിയൂ. കോളങ്ങളോ കാലഘട്ടമോ കറൻസിയോ വ്യക്തമല്ല.

ശക്തമായ നിർദ്ദേശം:

നിങ്ങളുടെ റോൾ: ഒരു ഡാറ്റ ശാസ്ത്രജ്ഞനെ സഹായിക്കുന്ന സഹായി. എനിക്ക് ഒരു പാണ്ടസ് ഡാറ്റാഫ്രെയിം ഉണ്ട്: df. കോളങ്ങൾ:- order_date (ടെക്‌സ്റ്റ്, ഫോർമാറ്റിൽ "2024-03-01")- തുക_tl (ദശാംശം, ചില വരികളിൽ NaN)- customer_id (പൂർണ്ണസംഖ്യ) ടാസ്‌ക്: (1) ശരാശരി തുക കണക്കാക്കുന്ന പാണ്ടസ് കോഡ് എഴുതുക, (2) ഇത് NaN മൂല്യങ്ങൾ എങ്ങനെ കൈകാര്യം ചെയ്യുന്നുവെന്ന് വിശദീകരിക്കുക, (3) കോഡ് അനുമാനം ലിസ്റ്റ് ചെയ്യുന്നു. ഡാറ്റ ഉള്ളടക്കം ഉണ്ടാക്കരുത്; കോഡ് സൃഷ്‌ടിക്കുക, ഞാൻ ഫലം പ്രവർത്തിപ്പിച്ച് പരിശോധിക്കും.

ഈ അഭ്യർത്ഥനയിൽ, പദ്ധതിയും പ്രതീക്ഷയും "കെട്ടുകഥയുടെ നിരോധനവും" വ്യക്തമാണ്. നിങ്ങൾ ഇപ്പോഴും ഔട്ട്പുട്ട് സ്വയം പ്രവർത്തിപ്പിച്ച് പരിശോധിച്ചുറപ്പിക്കുന്നു.

ധാർമ്മികതയുടെയും സ്വകാര്യതയുടെയും തുടക്കം

ഡാറ്റാ സയൻസ് പലപ്പോഴും വ്യക്തിഗത ഡാറ്റയുമായി പ്രവർത്തിക്കുന്നു: ഉപഭോക്താവ്, രോഗി, ജീവനക്കാരുടെ രേഖകൾ. Türkiye-യിലെ KVKK (Personal Data Protection Law), യൂറോപ്പിലെ GDPR എന്നിവ ഈ ഡാറ്റയെ സംരക്ഷിക്കുന്നു. നിങ്ങളുടെ യഥാർത്ഥ പേര്, ഐഡി, ഇമെയിൽ അല്ലെങ്കിൽ വിലാസം ഒരു പൊതു AI ടൂളിലേക്ക് ഒട്ടിക്കുന്നത് ഒരു ലംഘനമാണ്. നിയമം: പങ്കിടുന്നതിന് മുമ്പ് ഡാറ്റ അജ്ഞാതമാക്കുക, ആവശ്യമെങ്കിൽ സ്കീമയും (നിര നാമങ്ങൾ, തരങ്ങളും) ഡമ്മി ഉദാഹരണ നിരയും മാത്രം നൽകുക. യൂണിറ്റ് 11-ൽ നൈതികതയുടെ വിഷയം ഞങ്ങൾ ആഴത്തിലാക്കും; നമുക്ക് ആദ്യം മുതൽ തത്വം നൽകാം: ഡാറ്റ മനസിലാക്കാൻ, അതിൻ്റെ ഘടന പങ്കിടുന്നത് പലപ്പോഴും മതിയാകും, ഉള്ളടക്കമല്ല.

സാധാരണ തെറ്റുകൾ

  • AI-ക്ക് ഡാറ്റ നൽകാതെ നമ്പറുകൾ/മെട്രിക്‌സിനായി കാത്തിരിക്കുന്നു. മോഡലിന് ഡാറ്റ ആക്സസ് ചെയ്യാൻ കഴിയില്ല; ഇയാൾ നൽകുന്ന നമ്പർ വ്യാജമാണ്. എല്ലായ്‌പ്പോഴും ഫലം കണക്കാക്കി പ്രവർത്തിപ്പിക്കുക.
  • വർക്കിംഗ് കോഡ് ശരിയാണെന്ന് കരുതുന്നു. തെറ്റായ കോളം കൈകാര്യം ചെയ്യുന്ന കോഡും പിശകുകളില്ലാതെ പ്രവർത്തിക്കുന്നു; യുക്തി വായിക്കാതെ വിശ്വസിക്കരുത്.
  • യഥാർത്ഥ വ്യക്തിഗത ഡാറ്റ ഓപ്പൺ ടൂളിലേക്ക് ഒട്ടിക്കുന്നു. പേര്, ഐഡി നമ്പർ, ഇ-മെയിൽ എന്നിവ ഒരിക്കലും പങ്കിടില്ല; ഡയഗ്രം മതി.
  • ഘട്ടങ്ങൾ സ്വമേധയാ ചെയ്യുക, അവ കോഡിൽ എഴുതാതിരിക്കുക. പുനർനിർമ്മിക്കാനാവാത്ത വിശകലനം വിശ്വസനീയമല്ല.
  • സ്ഥിതിവിവരക്കണക്കുകളുടെ AI യുടെ വ്യാഖ്യാനം ചോദ്യം ചെയ്യാതെ സ്വീകരിക്കുന്നു. പി-വാല്യൂ, കോറിലേഷൻ തുടങ്ങിയ ആശയങ്ങളിൽ AI-ക്ക് ക്ലാസിക് തെറ്റുകൾ ആവർത്തിക്കാനാകും.
നുറുങ്ങ്: നിങ്ങളുടെ ഓരോ AI സെഷനുകളിലും ഒരു ചെറിയ "റൂൾ ലൈൻ" ഉൾപ്പെടുത്തുക: "ഡാറ്റ ഉള്ളടക്കം ഉണ്ടാക്കരുത്; കോഡ്/വിശകലനം സൃഷ്‌ടിക്കുക, ഫലം ഞാൻ പ്രവർത്തിപ്പിച്ച് പരിശോധിച്ചുറപ്പിക്കും; നിങ്ങൾക്ക് ഉറപ്പില്ലാത്തിടത്ത് 'അുറപ്പില്ല' എന്ന് സൂചിപ്പിക്കുക." ഈ ഒരൊറ്റ വാചകം ഭ്രമാത്മകതയുടെ അപകടസാധ്യത ഗണ്യമായി കുറയ്ക്കുന്നു.

ചുരുക്കത്തിൽ

ഡാറ്റാ സയൻസിലെ ശക്തമായ സഹായിയാണ് AI: ഇത് ക്ലീനിംഗ് കോഡ്, EDA വ്യാഖ്യാനം, മോഡൽ ശുപാർശ, ദൃശ്യവൽക്കരണം എന്നിവ ത്വരിതപ്പെടുത്തുന്നു. എന്നാൽ പ്രശ്ന നിർവചനം, മെട്രിക് സെലക്ഷൻ, പ്രൊഡക്ഷൻ ഡിസിഷൻ, നൈതിക അതിരുകൾ എന്നിവ മനുഷ്യൻ്റേതാണ്. വർക്ക്ഫ്ലോയ്ക്ക് ആറ് ഘട്ടങ്ങളുണ്ട്, അപകടസാധ്യത വർദ്ധിക്കുന്നതിനനുസരിച്ച് AI-യുടെ പങ്ക് ചെറുതായിത്തീരുന്നു. മൂന്ന് ശീലങ്ങളാണ് എല്ലാത്തിൻ്റെയും അടിസ്ഥാനം: ഉറവിട ലിങ്കിംഗ് (സാധുവാക്കൽ), പുനരുൽപാദനക്ഷമത (കോഡിംഗ്), അജ്ഞാതവൽക്കരണം (രഹസ്യത). ഇവ മൂന്നും നിങ്ങൾ ഇൻ്റേണലൈസ് ചെയ്തുകഴിഞ്ഞാൽ, ബാക്കിയുള്ള മൊഡ്യൂളിലുള്ള എല്ലാ ടൂളും നിങ്ങൾക്ക് സുരക്ഷിതമായ ആക്സിലറേറ്ററായി മാറുന്നു.

ആപ്ലിക്കേഷൻ ടാസ്ക്

നിങ്ങളുടെ പക്കലുള്ള ഒരു ചെറിയ പട്ടികയുടെ (അല്ലെങ്കിൽ സാങ്കൽപ്പികമായ ഒന്ന്) ഒരു സ്കീമ ഉണ്ടാക്കുക: കോളം പേരുകൾ, തരങ്ങൾ, കൂടാതെ 2-3 ഡമ്മി ഉദാഹരണ വരികൾ (യഥാർത്ഥ വ്യക്തിഗത ഡാറ്റ ഇല്ലാതെ). മുകളിലുള്ള "പവർഫുൾ പ്രോംപ്റ്റ്" ടെംപ്ലേറ്റ് ഉപയോഗിച്ച് ഒരു സംഗ്രഹ സ്ഥിതിവിവരക്കണക്ക് കോഡിനായി AI-യോട് ആവശ്യപ്പെടുക. കോഡ് റൺ ചെയ്യുക, ഔട്ട്‌പുട്ട് ഒരു മാനുവൽ മൂല്യവുമായി താരതമ്യം ചെയ്യുക, ഏതെങ്കിലും വ്യാജ അനുമാനങ്ങൾ ഉണ്ടോയെന്ന് പരിശോധിക്കുക, 5 ബുള്ളറ്റ് പോയിൻ്റുകളിൽ നിങ്ങളുടെ കണ്ടെത്തലുകൾ ശ്രദ്ധിക്കുക.

ചെക്ക്ലിസ്റ്റ്

  • [] യഥാർത്ഥ വ്യക്തിഗത ഡാറ്റയ്ക്ക് പകരം ഞാൻ AI-ക്ക് ഒരു സ്കീമയും വ്യാജ സാമ്പിളും നൽകിയോ?
  • [ ] അത് നിർമ്മിച്ച കോഡ് ഞാൻ വരി വരിയായി വായിച്ച് പ്രവർത്തിപ്പിച്ചോ?
  • [ ] ഔട്ട്പുട്ടിലെ ഓരോ നമ്പറും ഞാൻ സ്വതന്ത്രമായി പരിശോധിച്ചിട്ടുണ്ടോ?
  • [ ] വിശകലനത്തിൻ്റെ ഓരോ ഘട്ടവും ഞാൻ കോഡിൽ എഴുതി അത് ആവർത്തിക്കാവുന്നതാക്കിയിട്ടുണ്ടോ?
  • ദൗത്യത്തിൻ്റെ അപകട നില ഞാൻ നിർണ്ണയിക്കുകയും അന്തിമ തീരുമാനം ഒരു മനുഷ്യനെ ഏൽപ്പിക്കുകയും ചെയ്തിട്ടുണ്ടോ?