യൂണിറ്റുകൾ
1. ഡാറ്റാ സയൻസിലും അനലിറ്റിക്‌സിലും ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസിൻ്റെ ആമുഖം: വർക്ക്ഫ്ലോ, റോളുകൾ, അതിരുകൾ, മൂല്യനിർണ്ണയം, ധാർമ്മികത 2. വിവര ശേഖരണവും ഉറവിട ധാരണയും: സ്കീമ, സാമ്പിളിംഗ്, ഗുണനിലവാരം, ചോർച്ച അവബോധം 3. ഡാറ്റ ക്ലീനിംഗും പ്രീപ്രോസസിംഗും: നഷ്‌ടമായ മൂല്യം, ഔട്ട്‌ലിയർ, തരം പരിവർത്തനം 4. എക്സ്പ്ലോറേറ്ററി ഡാറ്റ അനാലിസിസ് (EDA): വിതരണങ്ങൾ, ബന്ധങ്ങൾ, പ്രാരംഭ സ്ഥിതിവിവരക്കണക്കുകൾ 5. ഫീച്ചർ എഞ്ചിനീയറിംഗ്: വേരിയൻ്റുകൾ സൃഷ്ടിക്കുന്നു, കോഡിംഗ്, സ്കെയിലിംഗ്, ചോർച്ച ഒഴിവാക്കൽ 6. മോഡൽ ബിൽഡിംഗ്: പ്രശ്ന നിർവചനം, അൽഗോരിതം തിരഞ്ഞെടുക്കൽ, പരിശീലനം/ടെസ്റ്റ് വിഭജനം 7. മോഡൽ മൂല്യനിർണ്ണയം: മെട്രിക്‌സ്, ക്രോസ്-വാലിഡേഷൻ, എക്‌സ്ട്രീം ലേണിംഗ് 8. ദൃശ്യവൽക്കരണവും കഥപറച്ചിലും: കൃത്യമായ ഗ്രാഫിക്സ്, സത്യസന്ധമായ ഗ്രാഫിക്സ് 9. കോഡ് ജനറേഷൻ: പൈത്തൺ (പാണ്ടകൾ), SQL എന്നിവയ്‌ക്കൊപ്പമുള്ള AI-അസിസ്റ്റഡ് അനാലിസിസ് 10. ഡാറ്റ ചോർച്ചയും പുനരുൽപ്പാദനവും: നിശബ്ദ ദുരന്തങ്ങളും അച്ചടക്കവും 11. MLOps ഫൗണ്ടേഷൻ, എത്തിക്സ്, പ്രൈവസി, റെസ്‌പോൺസിബിൾ അനലിറ്റിക്‌സ്
യൂണിറ്റ് 2 / 11

വിവര ശേഖരണവും ഉറവിട ധാരണയും: സ്കീമ, സാമ്പിളിംഗ്, ഗുണനിലവാരം, ചോർച്ച അവബോധം

നേട്ടങ്ങൾ:

  • വ്യത്യസ്‌ത ഡാറ്റ സ്രോതസ്സുകളും (ഡാറ്റാബേസ്, API, ഫയൽ, വെബ് സ്‌ക്രാപ്പിംഗ്) ഓരോന്നിൻ്റെയും പോരായ്മകൾ തിരിച്ചറിയാനും സ്‌കീമ ശരിയായി മനസ്സിലാക്കാനുമുള്ള കഴിവ്
  • സാമ്പിൾ ജനസംഖ്യയെയും തിരഞ്ഞെടുപ്പ് പക്ഷപാതത്തെയും പ്രതിനിധീകരിക്കുന്നുണ്ടോ എന്ന് വിലയിരുത്തുന്നതിലൂടെ ആവർത്തിക്കാവുന്ന സാമ്പിൾ ചെയ്യാനുള്ള കഴിവ്
  • ശേഖരണ ഘട്ടത്തിൽ ഡാറ്റ ചോർച്ച ഇല്ലാതാക്കാനും ഓരോ കോളത്തിലും 'പ്രവചന സമയത്ത് എനിക്കത് ലഭിക്കുമോ' എന്ന ചോദ്യം ചോദിച്ച് നിയമ/ധാർമ്മിക അതിരുകൾ നിരീക്ഷിക്കാനുമുള്ള കഴിവ്?

ഓരോ വിശകലനവും നിങ്ങൾ ശേഖരിക്കുന്ന ഡാറ്റയുടെ ഗുണനിലവാരം പോലെ മികച്ചതാണ്. തെറ്റായി ശേഖരിക്കുന്നതോ പക്ഷപാതപരമായി സാമ്പിൾ ചെയ്തതോ അല്ലെങ്കിൽ ഭാവിയെക്കുറിച്ചുള്ള വിവരങ്ങൾ ഉൾക്കൊള്ളുന്നതോ ആയ ഡാറ്റ ഉപയോഗിച്ച് പ്രവർത്തിക്കുകയാണെങ്കിൽ ലോകത്തിലെ ഏറ്റവും വികസിത മോഡൽ പോലും വിശ്വസനീയമല്ലാത്ത ഫലങ്ങൾ നൽകും. കമ്പ്യൂട്ടർ സയൻസിൽ, ഈ തത്വത്തെ "ഗാർബേജ് ഇൻ, ഗാർബേജ് ഔട്ട്" (ഗാർബേജ് ഇൻ, ഗാർബേജ് ഔട്ട്) എന്നാണ് സംഗ്രഹിച്ചിരിക്കുന്നത്. ഈ യൂണിറ്റിൽ, ഞങ്ങൾ ഡാറ്റാ ശേഖരണ ഘട്ടം ഉൾക്കൊള്ളുന്നു: ഉറവിടം മനസിലാക്കുക, സാമ്പിൾ എടുക്കുക, ഗുണനിലവാരമുള്ള ചോദ്യങ്ങൾ ചോദിക്കുക, ആദ്യ ദിവസം മുതൽ ഡാറ്റ ചോർച്ചയുടെ അപകടസാധ്യതയെക്കുറിച്ച് ജാഗ്രത പുലർത്തുക. ഈ ഘട്ടത്തിൽ ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് ഒരു ശക്തമായ സഹായമാണ്; SQL അന്വേഷണം എഴുതുന്നു, API പ്രമാണം സംഗ്രഹിക്കുന്നു, ഡാറ്റ കരാർ ഡ്രാഫ്റ്റ് ചെയ്യുന്നു. എന്നാൽ നിങ്ങൾ ഏത് ഡാറ്റയാണ് ശേഖരിക്കുന്നത്, ആ ഡാറ്റ നിങ്ങളെ പ്രതിനിധീകരിക്കുന്നുണ്ടോ എന്ന് തീരുമാനിക്കുന്നത് മനുഷ്യനാണ്.

ഡാറ്റ ഉറവിടങ്ങൾ അറിയുന്നു

ഡാറ്റ വ്യത്യസ്ത സ്ഥലങ്ങളിൽ നിന്ന് വരുന്നു, ഓരോ ഉറവിടത്തിനും അതിൻ്റേതായ കുഴപ്പങ്ങളുണ്ട്. ഡാറ്റാബേസ് (പട്ടികകളിൽ സംഭരിച്ചിരിക്കുന്ന ഘടനാപരമായ ഡാറ്റ, സാധാരണയായി SQL ഉപയോഗിച്ച് അന്വേഷിക്കുന്നു) ആണ് ഏറ്റവും സാധാരണമായ ഉറവിടം; ഇത് വിശ്വസനീയമാണ്, പക്ഷേ അതിൻ്റെ സ്കീം നന്നായി മനസ്സിലാക്കേണ്ടത് ആവശ്യമാണ്. API (അപ്ലിക്കേഷൻ പ്രോഗ്രാമിംഗ് ഇൻ്റർഫേസ്) തത്സമയ ഡാറ്റ നൽകുന്നു, എന്നാൽ വേഗത പരിധികളുടെയും ഫോർമാറ്റ് മാറ്റങ്ങളുടെയും അപകടസാധ്യത വഹിക്കുന്നു. ഫയലുകൾ (CSV, Excel, JSON) വഴക്കമുള്ളവയാണ്, എന്നാൽ ഫോർമാറ്റ് പൊരുത്തക്കേടുകൾക്ക് സാധ്യതയുണ്ട്. വെബ് സ്ക്രാപ്പിംഗ് ശക്തമാണ്, എന്നാൽ അതിന് നിയമപരവും ധാർമ്മികവുമായ പരിധികളുണ്ട്; എല്ലാ സൈറ്റുകളും സ്ക്രാപ്പ് ചെയ്യാൻ കഴിയില്ല.

ശ്രദ്ധിക്കുക: വെബ് സ്‌ക്രാപ്പിംഗിനും സ്വയമേവയുള്ള ഡാറ്റ ശേഖരണത്തിനും, സൈറ്റിൻ്റെ ഉപയോഗ നിബന്ധനകൾ, robots.txt ഫയൽ, KVKK/GDPR എന്നിവ പാലിക്കുക. അനധികൃത ഡാറ്റ ശേഖരണം നിയമപരമായ ബാധ്യത സൃഷ്ടിക്കുന്നു. വിവര സുരക്ഷയുടെ പശ്ചാത്തലത്തിൽ, നിങ്ങൾക്ക് അംഗീകൃതമായ സിസ്റ്റങ്ങളിലും പ്രതിരോധ/വിശകലന ആവശ്യങ്ങൾക്കും മാത്രം ഡാറ്റ ശേഖരണ ഉപകരണങ്ങൾ ഉപയോഗിക്കുക; അനധികൃത ആക്സസ് അല്ലെങ്കിൽ സ്ക്രാപ്പിംഗ് നിരോധിച്ചിരിക്കുന്നു.

സ്കീമ മനസ്സിലാക്കുന്നു: ഡാറ്റയുമായി പരിചയപ്പെടൽ

ഒരു ഡാറ്റാ സെറ്റ് ശേഖരിക്കുന്നതിന് മുമ്പ്, നിങ്ങൾ അതിൻ്റെ സ്കീമ (നിരകളുടെ പേരുകൾ, അവയുടെ ഡാറ്റ തരങ്ങൾ, അവയുടെ അർത്ഥങ്ങൾ, പരസ്പര ബന്ധങ്ങൾ) മനസ്സിലാക്കണം. ഒരു "ഡാറ്റ നിഘണ്ടു" സൃഷ്ടിക്കുന്നതിന് AI ഇവിടെ വളരെ ഉപയോഗപ്രദമാണ് - ഓരോ നിരയും എന്താണ് അർത്ഥമാക്കുന്നത് എന്ന് വിശദീകരിക്കുന്ന ഒരു പട്ടിക. എന്നാൽ AI നൽകുന്ന വിശദീകരണങ്ങൾ പ്രവചനങ്ങളാണ്; ഡാറ്റ നിർമ്മിച്ച ടീമുമായി ഓരോ കോളത്തിൻ്റെയും യഥാർത്ഥ അർത്ഥം സ്ഥിരീകരിക്കുക. ഉദാഹരണത്തിന്, "സ്റ്റാറ്റസ്" എന്ന കോളത്തിൽ 0/1/2 അടങ്ങിയിരിക്കാം; ഇവ "തീർപ്പുകൽപ്പിക്കാത്തവയാണോ/അംഗീകൃതമാണോ / റദ്ദാക്കിയവയാണോ" അല്ലെങ്കിൽ മറ്റെന്തെങ്കിലും ആണോ എന്ന് ഉത്ഭവിക്കുന്ന ടീമിന് മാത്രമേ അറിയൂ.

ഇനിപ്പറയുന്ന പട്ടിക അടിസ്ഥാന ഉറവിട തരങ്ങളും മുൻകരുതലുകളും സംഗ്രഹിക്കുന്നു:

ഉറവിടം

ശക്തമായ പോയിൻ്റ്

കെണി

AI എങ്ങനെ സഹായിക്കുന്നു

SQL ഡാറ്റാബേസ്

ഘടനാപരമായ, വിശ്വസനീയമായ

കോംപ്ലക്സ് ജോയിനുകൾ

ഒരു അന്വേഷണ ഡ്രാഫ്റ്റ് എഴുതുന്നു

API

തത്സമയ ഡാറ്റ

വേഗത പരിധി, ആകൃതി മാറ്റം

പ്രമാണ സംഗ്രഹങ്ങൾ, കോഡ് പുൾ ചെയ്യുക

CSV/Excel

ഫ്ലെക്സിബിൾ, ഫാസ്റ്റ്

ഫോർമാറ്റ് പൊരുത്തക്കേട്

കോഡ് വായിക്കുക/പാഴ്‌സ് ചെയ്യുക

വെബ് സ്ക്രാപ്പിംഗ്

വൈഡ് റീച്ച്

നിയമ/ധാർമ്മിക പരിധി

പാഴ്സിംഗ് ഡ്രാഫ്റ്റ് (അധികാരികതയ്ക്കുള്ളിൽ)

ലോഗ്/ഇവൻ്റ് ഡാറ്റ

വിശദമായി

വലിയ വോള്യം

ചോദ്യം ഫിൽട്ടർ ചെയ്യുന്നു

ചിത്രീകരണം: ഭാഗം മൊത്തത്തിൽ പ്രതിനിധീകരിക്കുന്നുണ്ടോ?

മിക്ക സമയത്തും, മുഴുവൻ ഡാറ്റയ്ക്കും പകരം നിങ്ങൾ ഒരു സാമ്പിൾ (പോപ്പുലേഷനിൽ നിന്ന് തിരഞ്ഞെടുത്ത ഒരു ഉപവിഭാഗം) ഉപയോഗിച്ചാണ് പ്രവർത്തിക്കുന്നത്. നിർണായകമായ ചോദ്യം ഇതാണ്: ഈ സാമ്പിൾ ജനസംഖ്യയെ പ്രതിനിധീകരിക്കുന്നുണ്ടോ? സെലക്ഷൻ ബയസ് ആണ് ഏറ്റവും സാധാരണമായ കെണി. ഉദാഹരണത്തിന്, നിങ്ങൾ മൊബൈൽ ആപ്പിൽ നിന്നുള്ള ഉപയോക്താക്കളെ മാത്രം മാതൃകയാക്കുകയാണെങ്കിൽ, നിങ്ങൾ വെബ് ഉപയോക്താക്കളെ കാണില്ല, നിങ്ങളുടെ ഫലങ്ങൾ തെറ്റിദ്ധരിപ്പിക്കുന്നതായിരിക്കും. റാൻഡം സാംപ്ലിംഗ് (ഓരോ റെക്കോർഡിനും തിരഞ്ഞെടുക്കപ്പെടാനുള്ള തുല്യ അവസരമുണ്ട്) മിക്ക കേസുകളിലും സുരക്ഷിതമാണ്; എന്നാൽ സമയ ശ്രേണി ഡാറ്റയിൽ, വിഭജനം ക്രമരഹിതമായിട്ടല്ല, കാലക്രമത്തിലാണ് ചെയ്യുന്നത് (നമ്മൾ ഇത് യൂണിറ്റുകൾ 7, 10 എന്നിവയിൽ കാണും).

ആദ്യ ദിവസം മുതൽ ചോർച്ച ബോധവൽക്കരണം

ഡാറ്റ ചോർച്ചയാണ് മിക്ക ദുരന്തങ്ങളുടെയും ഉറവിടം, ഇത് സാധാരണയായി ഡാറ്റ ശേഖരണ ഘട്ടത്തിലാണ് ഉണ്ടാകുന്നത്. ഉദാഹരണം: "ഇത് റദ്ദാക്കിയിരുന്നോ" എന്ന് പ്രവചിക്കുമ്പോൾ, നിങ്ങൾ ഡാറ്റയിലേക്ക് "റദ്ദാക്കൽ തീയതി" കോളം ചേർത്താൽ, മോഡൽ ഭാവിയിലേക്ക് നോക്കുന്നു. ഒത്തുചേരൽ ഘട്ടത്തിൽ, ഓരോ കോളത്തിനും ഒരു ചോദ്യം ചോദിക്കുക: "ഞാൻ പ്രവചനം നടത്തുന്ന സമയത്ത് ഈ വിവരം യഥാർത്ഥത്തിൽ എനിക്ക് ലഭിക്കുമോ?" ഇല്ല എന്നാണ് ഉത്തരമെങ്കിൽ ആ കോളം ചോരുകയാണ്. യൂണിറ്റ് 10-ൽ ഞങ്ങൾ ഈ വിഷയം ആഴത്തിൽ ഉൾപ്പെടുത്തും; എന്നാൽ ബോധവൽക്കരണം ആദ്യ ദിവസം മുതൽ ആരംഭിക്കണം.

മൂന്ന് മിനി കേസുകൾ

കേസ് 1 - പ്രാതിനിധ്യത്തിൻ്റെ പ്രശ്നം. ഒരു ബാങ്ക് അതിൻ്റെ ക്രെഡിറ്റ് റിസ്ക് മോഡലിന് (18,500 റെക്കോർഡുകൾ) അംഗീകൃത വായ്പകളുടെ ഡാറ്റ മാത്രമാണ് ശേഖരിച്ചത്. നിരസിക്കലുകൾ ഡാറ്റയിൽ ഉണ്ടായിരുന്നില്ല. നിരസിക്കുന്നവർ എങ്ങനെ പെരുമാറുമെന്ന് ഒരിക്കലും കണ്ടിട്ടില്ലാത്തതിനാൽ യഥാർത്ഥ ലോകത്ത് മോഡൽ തെറ്റായിരുന്നു. പാഠം: സാമ്പിൾ നിങ്ങൾ തീരുമാനമെടുക്കുന്ന മുഴുവൻ ജനസംഖ്യയുടെയും പ്രതിനിധിയായിരിക്കണം.

കേസ് 2 - സൈലൻ്റ് ഫോം മാറ്റം. ഒരു ടീം എല്ലാ ദിവസവും ഒരു API-യിൽ നിന്ന് വില ഡാറ്റ പിൻവലിക്കുകയായിരുന്നു. ഒരു ദിവസം, API ദാതാവ് കറൻസി USD-ൽ നിന്ന് EUR-ലേക്ക് മാറ്റി, എന്നാൽ ഡൊമെയ്ൻ നാമം അതേപടി തുടർന്നു. തെറ്റായ യൂണിറ്റിൽ 12 ദിവസത്തേക്ക് ഡാറ്റ ശേഖരിച്ചു; 3,200 ലൈനുകൾ കേടായി. പാഠം: API ഡാറ്റയിലെ വോളിയവും ഫോർമാറ്റ് സ്ഥിരതയും പതിവായി പരിശോധിക്കുക.

കേസ് 3 - ആദ്യകാല ചോർച്ച. ഒരു "ചർൺ" എസ്റ്റിമേറ്റിനായി ഡാറ്റ ശേഖരിക്കുമ്പോൾ ഒരു അനലിസ്റ്റ് "അക്കൗണ്ട് ക്ലോഷറിനുള്ള കാരണം" കോളം ഉൾപ്പെടുത്തിയിട്ടുണ്ട്. ഉപഭോക്താവ് പോയതിനുശേഷം മാത്രമാണ് ഈ കോളം പൂരിപ്പിച്ചത്. ടെസ്റ്റ് സെറ്റിൽ മോഡൽ 97% കൃത്യത നൽകി; പ്രവചന സമയത്ത് ആ കോളം ശൂന്യമായതിനാൽ ഇത് നിർമ്മാണത്തിൽ പ്രവർത്തിച്ചില്ല. പാഠം: ഓരോ കോളത്തിലും "പ്രവചന സമയത്ത് എനിക്കത് ഉണ്ടോ?" എന്ന ചോദ്യം ചോദിക്കുക.

പകർത്താവുന്ന നാല് ടെംപ്ലേറ്റുകൾ

1) ഡാറ്റാ നിഘണ്ടു വേർതിരിച്ചെടുക്കൽ:

നിങ്ങളുടെ റോൾ: ഡാറ്റ സയൻ്റിസ്റ്റ് അസിസ്റ്റൻ്റ്. ഒരു പട്ടികയുടെ കോളം നാമങ്ങളും സാമ്പിൾ (അജ്ഞാത) മൂല്യങ്ങളും ചുവടെയുണ്ട്. ഓരോ കോളത്തിനും, അതിൻ്റെ കണക്കാക്കിയ അർത്ഥം, ഡാറ്റാടൈപ്പ്, സാധ്യതയുള്ള ഗുണനിലവാര അപകടസാധ്യതകൾ എന്നിവ പട്ടികയിൽ ലിസ്റ്റ് ചെയ്യുക. നിങ്ങൾക്ക് ഉറപ്പില്ലാത്ത കോളങ്ങൾ "സ്ഥിരീകരണം ആവശ്യമാണ്" എന്ന് അടയാളപ്പെടുത്തുക; നിർമ്മാണം എന്നർത്ഥം. നിരകൾ: [ഇവിടെ ഒട്ടിക്കുക]

2) സാമ്പിൾ കോഡ് (റാൻഡം, ആവർത്തിക്കാവുന്നത്):

എനിക്ക് പാണ്ടകൾ ഡിഎഫ് ഉണ്ട്. 200,000 വരികളിൽ നിന്ന് ഒരു പ്രതിനിധി 5% റാൻഡം സാമ്പിൾ വേർതിരിച്ചെടുക്കുന്ന കോഡ് എഴുതുക. random_state=42 (പുനർനിർമ്മാണത്തിനായി) ഉപയോഗിക്കുക. സാമ്പിളിൻ്റെ ക്ലാസ് ഡിസ്ട്രിബ്യൂഷൻ പോപ്പുലേഷനുമായി സാമ്യമുള്ളതാണെന്ന് പരിശോധിക്കാൻ കോഡ് ചേർക്കുക.

3) ചോർച്ച സ്കാനിംഗ് ചോദ്യം:

ഈ നിരകളുടെ ലിസ്റ്റ് ഞാൻ നിങ്ങൾക്ക് തരാം. "ഇത് റദ്ദാക്കിയിട്ടുണ്ടോ" (0/1) പ്രവചിക്കുക എന്നതാണ് എൻ്റെ ലക്ഷ്യം. ഓരോ കോളത്തിനും, പ്രവചന സമയത്ത് അത് യഥാർത്ഥത്തിൽ എനിക്ക് ലഭിക്കുമോ എന്ന് വിലയിരുത്തുകയും "സുരക്ഷിത / സംശയാസ്പദമായ / ചോർച്ച" എന്ന് അടയാളപ്പെടുത്തുകയും ചെയ്യുക. നിങ്ങളുടെ യുക്തി ഒരു വാചകത്തിൽ എഴുതുക. നിരകൾ: [ലിസ്റ്റ്]

4) SQL പുൾ ക്വറി ഡ്രാഫ്റ്റ്:

എനിക്ക് PostgreSQL-ൽ "ഓർഡറുകൾ", "ഉപഭോക്താക്കൾ" എന്നീ പട്ടികകളുണ്ട്. കഴിഞ്ഞ 90 ദിവസത്തെ ഓർഡറുകൾ ഉപഭോക്തൃ നഗരവുമായി സംയോജിപ്പിച്ച് ഓരോ നഗരത്തിൻ്റെയും മൊത്തം തുകയും ഓർഡറുകളുടെ എണ്ണവും നൽകുന്ന ഒരു JOIN ചോദ്യം എഴുതുക. തീയതി ഫിൽട്ടറും NULL നഗരങ്ങൾ എങ്ങനെ കൈകാര്യം ചെയ്യപ്പെടുന്നുവെന്നും വിശദീകരിക്കുക. ഞാൻ ചോദ്യം റൺ ചെയ്ത് പരിശോധിച്ചുറപ്പിക്കും.

ദുർബലമായ പ്രോംപ്റ്റ് / ശക്തമായ പ്രോംപ്റ്റ്

ദുർബലമായ പ്രോംപ്റ്റ്:

ഈ ഡാറ്റാബേസിൽ നിന്ന് എനിക്ക് നല്ലൊരു സാമ്പിൾ ഡാറ്റ കൊണ്ടുവരിക.

"നല്ലത്" എന്നത് അവ്യക്തമാണ്; ഏത് പെയിൻ്റിംഗ്, ഏത് കാലഘട്ടം, ഏത് വലുപ്പം, ഏത് ഉദ്ദേശ്യം വ്യക്തമല്ല. AI ഒരു സാധാരണ, ഒരുപക്ഷേ തെറ്റായ അന്വേഷണം മാത്രമേ നിർമ്മിക്കൂ.

ശക്തമായ നിർദ്ദേശം:

നിങ്ങളുടെ റോൾ: SQL അസിസ്റ്റൻ്റ്. എനിക്ക് ഒരു "ഇടപാടുകൾ" പട്ടികയുണ്ട്: നിരകളുടെ ഐഡി, കസ്റ്റമർ_ഐഡി, തീയതി (ടൈംസ്റ്റാമ്പ്), തുക (സംഖ്യ), ചാനൽ (ടെക്സ്റ്റ്: 'വെബ്'/'മൊബൈൽ'). ടാസ്‌ക്: 2024-ൽ ഓരോ ചാനലിൽ നിന്നും 10,000 പ്രതിനിധി വരികൾ നൽകുന്ന ഒരു ആവർത്തന (ഓർഡർ പ്രകാരം നിർണ്ണയിക്കുന്ന) ചോദ്യം എഴുതുക. ഉദ്ദേശ്യം: ചാനൽ താരതമ്യ വിശകലനം. നിങ്ങളുടെ അന്വേഷണത്തിൻ്റെ അനുമാനങ്ങൾ പട്ടികപ്പെടുത്തുക.

ഇവിടെ പട്ടിക, ഉദ്ദേശ്യം, വലിപ്പം, ആവർത്തനക്ഷമത എന്നിവ വ്യക്തമാണ്.

സാധാരണ തെറ്റുകൾ

  • സാമ്പിളിൻ്റെ പ്രാതിനിധ്യത്തെ ചോദ്യം ചെയ്യുന്നില്ല. എളുപ്പത്തിൽ ആക്സസ് ചെയ്യാവുന്ന ഡാറ്റ കൃത്യമായ ഡാറ്റയല്ല; തിരഞ്ഞെടുപ്പ് പക്ഷപാതം ഫലത്തെ വളച്ചൊടിക്കുന്നു.
  • കോളം അർത്ഥങ്ങൾ AI-യിലേക്ക് പൊരുത്തപ്പെടുത്തുന്നു. ഉറവിട ടീമിന് അർത്ഥം അറിയാം; AI പ്രവചനം സ്ഥിരീകരിക്കാതെ ഉപയോഗിക്കരുത്.
  • API ഫോർമാറ്റ്/യൂണിറ്റ് മാറ്റം ട്രാക്ക് ചെയ്യുന്നില്ല. നിശബ്ദമായ മാറ്റം ദിവസങ്ങളോളം കേടായ ഡാറ്റ ശേഖരിക്കുന്നു.
  • ശേഖരണ ഘട്ടത്തിലെ ചോർച്ച അവഗണിക്കുന്നു. "പ്രവചന സമയത്ത് എനിക്ക് അത് ഉണ്ടോ" എന്ന ചോദ്യം നേരത്തെ ചോദിച്ചില്ലെങ്കിൽ, മോഡൽ തെറ്റായ വിജയം നൽകും.
  • അനധികൃതമോ നിയമവിരുദ്ധമോ ആയ ഡാറ്റ ശേഖരിക്കുന്നു. robots.txt, ഉപയോഗ നിബന്ധനകൾ, KVKK എന്നിവയുടെ ലംഘനം ഗുരുതരമായ അപകടമാണ്.
നുറുങ്ങ്: ഓരോ പുതിയ ഡാറ്റാ ഉറവിടത്തിനും ഒരു പേജ് "ഡാറ്റ കാർഡ്" സൂക്ഷിക്കുക: ഉറവിടം, പുൾ തീയതി, വരികളുടെ എണ്ണം, അറിയപ്പെടുന്ന അതിരുകൾ, ചോർച്ച സാധ്യതയുള്ള നിരകൾ. ഈ കാർഡ് മാസങ്ങൾക്ക് ശേഷം "എന്തായിരുന്നു ഈ ഡാറ്റ" എന്ന ചോദ്യവും പുനരുൽപാദനക്ഷമതയും സംരക്ഷിക്കുന്നു.

ചുരുക്കത്തിൽ

വിശകലനത്തിൻ്റെ ഗുണനിലവാരം ശേഖരിച്ച ഡാറ്റയുടെ ഗുണനിലവാരത്താൽ പരിമിതപ്പെടുത്തിയിരിക്കുന്നു. ഉറവിടവും (ഡാറ്റാബേസ്, API, ഫയൽ, സ്‌ക്രാപ്പ്) സ്കീമയും നന്നായി അറിയുക; സാമ്പിൾ ജനസംഖ്യയുടെ പ്രതിനിധിയാണെന്ന് ഉറപ്പാക്കുക; “പ്രവചന സമയത്ത് എനിക്കത് ഉണ്ടോ?” എന്ന് ഓരോ കോളത്തിലും ചോദിച്ച് ആദ്യ ദിവസം മുതൽ ചോർച്ച ഇല്ലാതാക്കുക. അന്വേഷണത്തിനും ഡോക്യുമെൻ്റ് വർക്കിനുമുള്ള മികച്ച ആക്സിലറേറ്ററാണ് AI, എന്നാൽ ഏത് ഡാറ്റയാണ് ശേഖരിക്കേണ്ടതെന്നും അതിൻ്റെ പ്രാതിനിധ്യവും മനുഷ്യരാണ് തീരുമാനിക്കുന്നത്. അധികാരം, നിയമം, രഹസ്യസ്വഭാവം എന്നിവയുടെ പരിധികൾ എപ്പോഴും ഒന്നാമതാണ്.

ആപ്ലിക്കേഷൻ ടാസ്ക്

ഒരു ഡാറ്റ ഉറവിടം തിരഞ്ഞെടുക്കുക (നിങ്ങളുടെ സ്വന്തം ബിസിനസ്സിൽ നിന്നോ സാങ്കൽപ്പികത്തിൽ നിന്നോ). മുകളിലുള്ള "ഡാറ്റ നിഘണ്ടു എക്‌സ്‌ട്രാക്ഷൻ" ടെംപ്ലേറ്റ് ഉപയോഗിച്ച് AI-യിൽ നിന്ന് ഒരു ഡാറ്റ നിഘണ്ടുവിൻ്റെ ഡ്രാഫ്റ്റ് നേടുക; തുടർന്ന് ഓരോ കോളവും ചോർന്നോ എന്ന് സ്വയം വിലയിരുത്തുക. കുറഞ്ഞത് ഒരു സംശയാസ്പദമായ/ചോർച്ച കോളമെങ്കിലും കണ്ടെത്തി അത് അപകടകരമാണെന്ന് ഒറ്റ വാചകത്തിൽ എഴുതാൻ ശ്രമിക്കുക.

ചെക്ക്ലിസ്റ്റ്

  • [ ] സോഴ്സ് ടീമുമായി ഞാൻ ഡാറ്റ ഉറവിടവും സ്കീമയും സ്ഥിരീകരിച്ചിട്ടുണ്ടോ?
  • [ ] സാമ്പിൾ ജനസംഖ്യയുടെ പ്രതിനിധിയാണെന്ന് ഞാൻ പരിശോധിച്ചിട്ടുണ്ടോ?
  • [ ] "എസ്റ്റിമേറ്റ് സമയത്ത് എനിക്കത് ലഭിക്കുമോ?" എന്ന ചോദ്യം ഞാൻ ഓരോ കോളത്തിലും ചോദിച്ചിട്ടുണ്ടോ?
  • [ ] ഞാൻ സാമ്പിൾ ആവർത്തിക്കാവുന്ന (നിശ്ചിത വിത്ത്) ആക്കിയിട്ടുണ്ടോ?
  • [ ] ശേഖരണത്തിൻ്റെ നിയമപരമായ/ധാർമ്മികമായ (അതോറിറ്റി, robots.txt, KVKK) പരിധികൾ ഞാൻ പരിശോധിച്ചിട്ടുണ്ടോ?