യൂണിറ്റുകൾ
1. ഡാറ്റാ സയൻസിലും അനലിറ്റിക്‌സിലും ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസിൻ്റെ ആമുഖം: വർക്ക്ഫ്ലോ, റോളുകൾ, അതിരുകൾ, മൂല്യനിർണ്ണയം, ധാർമ്മികത 2. വിവര ശേഖരണവും ഉറവിട ധാരണയും: സ്കീമ, സാമ്പിളിംഗ്, ഗുണനിലവാരം, ചോർച്ച അവബോധം 3. ഡാറ്റ ക്ലീനിംഗും പ്രീപ്രോസസിംഗും: നഷ്‌ടമായ മൂല്യം, ഔട്ട്‌ലിയർ, തരം പരിവർത്തനം 4. എക്സ്പ്ലോറേറ്ററി ഡാറ്റ അനാലിസിസ് (EDA): വിതരണങ്ങൾ, ബന്ധങ്ങൾ, പ്രാരംഭ സ്ഥിതിവിവരക്കണക്കുകൾ 5. ഫീച്ചർ എഞ്ചിനീയറിംഗ്: വേരിയൻ്റുകൾ സൃഷ്ടിക്കുന്നു, കോഡിംഗ്, സ്കെയിലിംഗ്, ചോർച്ച ഒഴിവാക്കൽ 6. മോഡൽ ബിൽഡിംഗ്: പ്രശ്ന നിർവചനം, അൽഗോരിതം തിരഞ്ഞെടുക്കൽ, പരിശീലനം/ടെസ്റ്റ് വിഭജനം 7. മോഡൽ മൂല്യനിർണ്ണയം: മെട്രിക്‌സ്, ക്രോസ്-വാലിഡേഷൻ, എക്‌സ്ട്രീം ലേണിംഗ് 8. ദൃശ്യവൽക്കരണവും കഥപറച്ചിലും: കൃത്യമായ ഗ്രാഫിക്സ്, സത്യസന്ധമായ ഗ്രാഫിക്സ് 9. കോഡ് ജനറേഷൻ: പൈത്തൺ (പാണ്ടകൾ), SQL എന്നിവയ്‌ക്കൊപ്പമുള്ള AI-അസിസ്റ്റഡ് അനാലിസിസ് 10. ഡാറ്റ ചോർച്ചയും പുനരുൽപ്പാദനവും: നിശബ്ദ ദുരന്തങ്ങളും അച്ചടക്കവും 11. MLOps ഫൗണ്ടേഷൻ, എത്തിക്സ്, പ്രൈവസി, റെസ്‌പോൺസിബിൾ അനലിറ്റിക്‌സ്
യൂണിറ്റ് 3 / 11

ഡാറ്റ ക്ലീനിംഗും പ്രീപ്രോസസിംഗും: നഷ്‌ടമായ മൂല്യം, ഔട്ട്‌ലിയർ, തരം പരിവർത്തനം

നേട്ടങ്ങൾ:

  • നഷ്‌ടമായ മൂല്യങ്ങളുടെ കാരണം (റാൻഡം, സിസ്റ്റമാറ്റിക്, അർത്ഥവത്തായത്) വേർതിരിച്ചറിയാനും ഉചിതമായ തന്ത്രം തിരഞ്ഞെടുത്ത് പരിശീലനത്തിൽ നിന്ന് മാത്രം ഫിൽ മൂല്യം കണക്കാക്കാനുമുള്ള കഴിവ്
  • അവ ഇല്ലാതാക്കുന്നതിന് മുമ്പ് ഔട്ട്‌ലൈയറുകൾ പരിശോധിക്കുകയും ഒരു ഡാറ്റ പിശകും യഥാർത്ഥ അപൂർവ സംഭവവും തമ്മിൽ വേർതിരിച്ചറിയാനുള്ള കഴിവ്
  • തരം, ഫോർമാറ്റ് പൊരുത്തക്കേടുകൾ സ്റ്റാൻഡേർഡിലേക്ക് കൊണ്ടുവരുമ്പോൾ വരികളുടെ/ശൂന്യതകളുടെ എണ്ണത്തിൽ ഓരോ ഘട്ടത്തിൻ്റെയും സ്വാധീനം നിരീക്ഷിച്ച് നിശബ്ദമായ നഷ്ടം തടയാനുള്ള കഴിവ്

ഒരു ഡാറ്റാ സയൻ്റിസ്റ്റിൻ്റെ സമയത്തിൻ്റെ ഏകദേശം 60-80 ശതമാനം ശുചീകരണത്തിനാണ് പോകുന്നത്; വ്യവസായത്തിൽ, ഇതിനെ "ഡാറ്റ റാംഗ്ലിംഗ്" (ഡാറ്റ റാംഗ്ലിംഗ് അല്ലെങ്കിൽ ഡാറ്റ ക്ലീനിംഗ്) എന്ന് പകുതി തമാശയായി വിളിക്കുന്നു. യഥാർത്ഥ-ലോക ഡാറ്റ ഒരിക്കലും വിശകലനത്തിന് തയ്യാറാകാത്തതിനാൽ: തീയതികൾ മിക്സഡ് ഫോർമാറ്റിലാണ്, നമ്പറുകൾ ടെക്സ്റ്റായി സൂക്ഷിക്കുന്നു, ചില സെല്ലുകൾ ശൂന്യമാണ്, ഒരു ഉപഭോക്താവ് രണ്ട് വ്യത്യസ്ത അക്ഷരവിന്യാസങ്ങളോടെ ഒരേ പട്ടികയിൽ മൂന്ന് തവണ പ്രത്യക്ഷപ്പെടുന്നു. ഈ യൂണിറ്റിൽ ഞങ്ങൾ ക്ലീനപ്പിൻ്റെ മൂന്ന് അടിസ്ഥാന വശങ്ങൾ ഉൾക്കൊള്ളുന്നു: നഷ്‌ടമായ മൂല്യങ്ങൾ, ഔട്ട്‌ലറുകൾ, തരം/ഫോർമാറ്റ് പരിവർത്തനം. കൃത്രിമബുദ്ധി ഈ ജോലിയിൽ അസാധാരണമായ വേഗതയുള്ള സഹായിയാണ്; എന്നാൽ എന്ത് വൃത്തിയാക്കണം, എങ്ങനെ എന്ന് തീരുമാനിക്കുന്നത് നിങ്ങളാണ്, കാരണം ഓരോ ക്ലീനിംഗ് തിരഞ്ഞെടുപ്പും വിശകലനം മാറ്റുന്നു.

വൃത്തിയാക്കലിൻ്റെ സുവർണ്ണ നിയമം: ഓരോ മാറ്റവും ഒരു തീരുമാനമാണ്

ഒരു സെൽ ഇല്ലാതാക്കുക, നഷ്‌ടമായ മൂല്യം ശരാശരി ഉപയോഗിച്ച് പൂരിപ്പിക്കുക, ഒരു ഔട്ട്‌ലിയർ ട്രിം ചെയ്യുക-ഇവയൊന്നും "നിഷ്‌പക്ഷ" പ്രവർത്തനങ്ങളല്ല. ഓരോന്നും ഡാറ്റ മാറ്റുകയും ഫലത്തെ ബാധിക്കുകയും ചെയ്യുന്നു. അതിനാൽ വൃത്തിയാക്കലിൻ്റെ സുവർണ്ണ നിയമം: കോഡിലേക്ക് എല്ലാ മാറ്റങ്ങളും എഴുതുക, യുക്തി ശ്രദ്ധിക്കുക, യഥാർത്ഥ ഡാറ്റ ഒരിക്കലും പുനരാലേഖനം ചെയ്യരുത്. AI നിങ്ങൾക്ക് വേഗത്തിലുള്ള ക്ലീനപ്പ് കോഡ് നൽകുന്നു, എന്നാൽ ആ കോഡ് എന്താണ് ചെയ്യുന്നതെന്ന് മനസിലാക്കേണ്ടത് നിങ്ങളുടെ ഉത്തരവാദിത്തമാണ്; "ശൂന്യമായ വരികൾ ഇല്ലാതാക്കുക" എന്ന് നിങ്ങൾ പറയുമ്പോൾ എത്ര വരികൾ പോയി എന്ന് കാണാതെ അത് പ്രവർത്തിപ്പിക്കരുത്.

മുന്നറിയിപ്പ്: യഥാർത്ഥ റോ ഡാറ്റ ഒരിക്കലും പരിഷ്കരിക്കരുത്. വൃത്തിയാക്കിയ പതിപ്പ് ഒരു പ്രത്യേക ഫയൽ/ടേബിളിലേക്ക് എഴുതുക. ഈ രീതിയിൽ, നിങ്ങൾ ഒരു പിശക് കണ്ടെത്തിയാൽ, നിങ്ങൾക്ക് സ്ക്വയർ ഒന്നിലേക്ക് മടങ്ങുകയും പുനരുൽപാദനക്ഷമത നിലനിർത്തുകയും ചെയ്യാം.

നഷ്‌ടമായ മൂല്യങ്ങൾ: എന്തുകൊണ്ട് ഇത് ശൂന്യമാണ്, എന്തുചെയ്യണം

ഒരു സെൽ ശൂന്യമായിരിക്കുമ്പോഴാണ് നഷ്‌ടമായ മൂല്യം (സാധാരണയായി NaN - "നമ്പർ അല്ല" എന്ന് പാണ്ടകളിൽ പ്രത്യക്ഷപ്പെടുന്നത്). എന്നാൽ വിടവിൻ്റെ കാരണം പരിഹാരം നിർണ്ണയിക്കുന്നു. മൂന്ന് സാധാരണ സാഹചര്യങ്ങളുണ്ട്. ക്രമരഹിതമായി കാണുന്നില്ല: സെൻസർ ഒരു നിമിഷം പ്രവർത്തിച്ചില്ല; അത് പൂരിപ്പിക്കുന്നത് ന്യായമായിരിക്കാം. വ്യവസ്ഥാപിതമായി നഷ്‌ടമായി: ഒരു ഫോം ഫീൽഡ് ചില ഉപഭോക്താക്കൾക്ക് മാത്രമേ ആവശ്യപ്പെടുകയുള്ളൂ; ഇവിടെയുള്ള വിടവ് യഥാർത്ഥത്തിൽ വിവരമാണ്. ഗണ്യമായി കാണുന്നില്ല: "മടങ്ങുന്ന തീയതി" ശൂന്യമാണെങ്കിൽ, ഉപഭോക്താവ് മടങ്ങിയില്ല; ഈ സ്പേസ് അർത്ഥമാക്കുന്നത് 0 അല്ലെങ്കിൽ "ഒന്നുമില്ല", അത് പൂരിപ്പിച്ചിട്ടില്ല.

പ്രധാന തന്ത്രങ്ങൾ:

തന്ത്രം

എപ്പോഴാണ് അത് ഉചിതം?

അപകടം

വരി ഇല്ലാതാക്കുക

നഷ്‌ടമായ നിരക്ക് വളരെ കുറവാണ് (<5%) ക്രമരഹിതവുമാണ്

ഡാറ്റയും പ്രാതിനിധ്യവും നഷ്ടപ്പെടുന്നു

ഒരു കോളം ഇല്ലാതാക്കുക

കോളത്തിൻ്റെ ഭൂരിഭാഗവും ശൂന്യമാണ് (>60%)

വിവരങ്ങളുടെ നഷ്ടം

ശരാശരി / ശരാശരി പൂരിപ്പിക്കൽ

സംഖ്യ, ക്രമരഹിതമായി കാണുന്നില്ല

ഇത് വ്യത്യാസം കുറയ്ക്കുകയും വിതരണത്തെ വികലമാക്കുകയും ചെയ്യുന്നു

വിഭാഗം "അജ്ഞാതം"

വർഗ്ഗീയമായ, വ്യവസ്ഥാപിതമായി കാണുന്നില്ല

അധിക വിഭാഗങ്ങൾ സൃഷ്ടിക്കുന്നു

മോഡൽ ഉപയോഗിച്ചുള്ള പ്രവചനം

സങ്കീർണ്ണമായ, വിലയേറിയ കോളം

ലീക്ക് റിസ്ക്, സങ്കീർണ്ണത

നിർണായക പോയിൻ്റ്: പരിശീലന ഡാറ്റയിൽ നിന്ന് മാത്രമേ ഇംപ്യൂട്ടേഷൻ മൂല്യം കണക്കാക്കാവൂ, അതേ മൂല്യം ടെസ്റ്റ് ഡാറ്റയിലും പ്രയോഗിക്കണം. നിങ്ങൾ ടെസ്റ്റ് ഡാറ്റയുടെ ശരാശരി ഉൾപ്പെടുത്തിയാൽ, നിങ്ങൾ ചോർച്ച സൃഷ്ടിക്കുന്നു (യൂണിറ്റ് 10). ശരാശരി (ഓർഡിനൽ ഡാറ്റയുടെ മധ്യമൂല്യം) പലപ്പോഴും ശരാശരിയേക്കാൾ മുൻഗണന നൽകുന്നു, കാരണം ഇത് ശരാശരിയേക്കാൾ പുറത്തുള്ളവർക്ക് കൂടുതൽ കരുത്തുറ്റതാണ്.

ഔട്ട്‌ലറുകൾ: പിശകോ യഥാർത്ഥമോ?

ഒരു ഔട്ട്‌ലിയർ രണ്ട് കാര്യങ്ങളിൽ ഒന്നാകാം: ഒരു ഡാറ്റ പിശക് (വയസ് കോളത്തിൽ 999) അല്ലെങ്കിൽ ഒരു യഥാർത്ഥ എന്നാൽ അപൂർവ ഇവൻ്റ് (ഒരു ഉപഭോക്താവിൻ്റെ $2 ദശലക്ഷം ഓർഡർ). രണ്ടും ആശയക്കുഴപ്പത്തിലാക്കുന്നത് വിനാശകരമാണ്: ഒരു യഥാർത്ഥ ഔട്ട്‌ലിയർ ഇല്ലാതാക്കുക, നിങ്ങൾ പ്രധാനപ്പെട്ട വിവരങ്ങൾ വലിച്ചെറിയുക; നിങ്ങൾ ഒരു തെറ്റ് ഉപേക്ഷിച്ചാൽ, നിങ്ങളുടെ ശരാശരി നഷ്ടമാകും. അതിനാൽ, അത് സ്വയമേവ ഇല്ലാതാക്കരുത്, ആദ്യം ഔട്ട്‌ലിയർ പരിശോധിക്കേണ്ടത് ആവശ്യമാണ്.

പൊതുവായ കണ്ടെത്തൽ രീതികൾ: IQR രീതി (ഇൻ്റർക്വാർട്ടൈൽ റേഞ്ച്; ഡാറ്റയുടെ 25%, 75% ക്വിൻ്റിലുകൾ തമ്മിലുള്ള വ്യത്യാസത്തിൻ്റെ 1.5 മടങ്ങ് കൂടുതലുള്ള മൂല്യങ്ങൾ ഔട്ട്‌ലയറുകളായി കണക്കാക്കപ്പെടുന്നു) കൂടാതെ z- സ്‌കോറും (ഒരു മൂല്യത്തിൽ നിന്ന് അകലെയുള്ള സ്റ്റാൻഡേർഡ് ഡീവിയേഷനുകളുടെ എണ്ണം; സാധാരണയായി അത് 3-ൽ കൂടുതലാണെങ്കിൽ ഒരു ഔട്ട്‌ലിയർ). AI ഈ കണക്കുകൂട്ടലുകൾക്കുള്ള കോഡ് നിമിഷങ്ങൾക്കുള്ളിൽ എഴുതുന്നു; എന്നാൽ "ഇല്ലാതാക്കുക" എന്ന് പറയുന്നതിന് മുമ്പ്, ആ മൂല്യങ്ങൾ എന്താണെന്ന് പരിശോധിക്കുക.

തരം, ഫോർമാറ്റ് പരിവർത്തനം: നിശബ്ദ പിശക് ഉറവിടം

ഏറ്റവും തലവേദനയായ ഒന്നാണ് ഡാറ്റാ ടൈപ്പ് ആശയക്കുഴപ്പം. ഒരു "തുക" കോളം വാചകമായി സംഭരിച്ചിട്ടുണ്ടെങ്കിൽ, നിങ്ങൾക്ക് ചേർക്കാൻ കഴിയില്ല; "ആയിരത്തി ഇരുനൂറ്റമ്പത്" എന്നതിനുപകരം "1,250.50" പോലുള്ള ഒരു ടർക്കിഷ് ഫോർമാറ്റ് ചെയ്ത നമ്പർ പ്രോഗ്രാം തെറ്റായി വായിക്കുന്നു. തീയതികൾ ("01/03/2024" ദിവസം-മാസം അല്ലെങ്കിൽ മാസം-ദിവസം?), വിഭാഗങ്ങൾ ("പുരുഷൻ"/"പുരുഷൻ"/"എം" ഒന്നുതന്നെയാണോ?) യൂണിറ്റുകളും (TL അല്ലെങ്കിൽ kuruş?) നിശബ്ദമായി തെറ്റായ ഫലങ്ങൾ നൽകുന്നു. വൃത്തിയാക്കലിൻ്റെ ഒരു വലിയ ഭാഗം ഈ പൊരുത്തക്കേടുകളെ സ്റ്റാൻഡേർഡിലേക്ക് വലിച്ചിടുകയാണ്: തീയതികൾ ഒരു ഫോർമാറ്റിലേക്കും വിഭാഗങ്ങൾ ഒരു അക്ഷരവിന്യാസത്തിലേക്കും അക്കങ്ങൾ ഒരു യൂണിറ്റിലേക്കും.

മൂന്ന് മിനി കേസുകൾ

കേസ് 1 - ശരാശരി കെണി. വരുമാന നിരയിലെ 320 നഷ്‌ടമായ മൂല്യങ്ങൾ ശരാശരി ($48,500) ഉപയോഗിച്ച് ഒരു ടീം പൂരിപ്പിച്ചു. എന്നാൽ പോരായ്മകൾ വ്യവസ്ഥാപിതമായിരുന്നു: ഒരിക്കലും വരുമാനം പ്രഖ്യാപിച്ചിട്ടില്ലാത്ത താഴ്ന്ന വരുമാന വിഭാഗമായിരുന്നു ഇവ. ശരാശരി പൂരിപ്പിക്കൽ ഈ ഗ്രൂപ്പിനെ കൃത്രിമമായി സമ്പന്നമാക്കി, ക്രെഡിറ്റ് മോഡൽ തെറ്റായിരുന്നു. പാഠം: പൂരിപ്പിക്കുന്നതിന് മുമ്പ് "എന്തുകൊണ്ട് ഇത് ശൂന്യമാണ്" എന്ന് ചോദിക്കുക.

കേസ് 2 - ഇല്ലാതാക്കാൻ പാടില്ലാത്ത ഔട്ട്‌ലിയർ. ഒരു റീട്ടെയിൽ അനലിസ്റ്റ് "പിശകുകൾ" എന്ന് കരുതി വിൽപ്പന ഡാറ്റയിലെ 4 വലിയ ഓർഡറുകൾ (1.8 ദശലക്ഷം TL വീതം) ഇല്ലാതാക്കി. എന്നിരുന്നാലും, ഇവ യഥാർത്ഥ കോർപ്പറേറ്റ് ഓർഡറുകളായിരുന്നു കൂടാതെ മൊത്തം വിറ്റുവരവിൻ്റെ 22% ആയിരുന്നു. പോസ്റ്റ്-ഡിലീഷൻ പ്രവചന മോഡൽ സ്ഥാപനപരമായ ആവശ്യം പൂർണ്ണമായും നഷ്‌ടപ്പെടുത്തി. പാഠം: അത് ഇല്ലാതാക്കുന്നതിന് മുമ്പ് ഔട്ട്‌ലിയർ പരിശോധിക്കുക.

കേസ് 3 - തീയതി ഫോർമാറ്റ് ദുരന്തം. ഒരു CSV-യിൽ, തീയതികൾ "2024-03-01", "01.03.2024" എന്നിവയിൽ ചേർത്തു. YZ എഴുതിയ കോഡ് ആദ്യ ഫോർമാറ്റ് അനുസരിച്ച് പാഴ്‌സ് ചെയ്തപ്പോൾ, 6,400 വരികൾ "അസാധുവായ തീയതി" ആയി NaT ആയി മാറുകയും വിശകലനത്തിൽ നിന്ന് നിശബ്ദമായി ഒഴിവാക്കപ്പെടുകയും ചെയ്തു. വരികളുടെ എണ്ണം കുറഞ്ഞപ്പോൾ മാത്രമാണ് അനലിസ്റ്റ് ഇത് ശ്രദ്ധിച്ചത്. പാഠം: പരിവർത്തനത്തിന് ശേഷം വരികളുടെയും ശൂന്യതകളുടെയും എണ്ണം എപ്പോഴും പരിശോധിക്കുക.

പകർത്താവുന്ന നാല് ടെംപ്ലേറ്റുകൾ

1) നഷ്‌ടമായ മൂല്യ മാപ്പ്:

എനിക്ക് പാണ്ടകൾ ഡിഎഫ് ഉണ്ട്. ഓരോ നിരയ്ക്കും നഷ്‌ടമായതിൻ്റെ (NaN) എണ്ണവും ശതമാനവും കാണിക്കുന്ന ഒരു പട്ടിക നിർമ്മിക്കുന്ന കോഡ് എഴുതുക. തുടർന്ന്, 40% ൽ കൂടുതലുള്ള മിസ്സിംഗ് റേറ്റ് ഉള്ള കോളങ്ങളും 5% ൽ താഴെയുള്ള റേറ്റ് ഉള്ളവയും വെവ്വേറെ ലിസ്റ്റ് ചെയ്യുക. ഈ രോഗനിർണയ കോഡ് സൃഷ്ടിക്കുക, നിങ്ങൾ നിർദ്ദേശിക്കുന്ന തന്ത്രമല്ല; ഞാൻ തീരുമാനം എടുക്കും.

2) ഔട്ട്‌ലിയർ പരിശോധന (ഇല്ലാതാക്കലല്ല):

IQR രീതി ഉപയോഗിച്ച് എൻ്റെ "തുക" കോളത്തിന് പുറത്തുള്ളവരെ കണ്ടെത്തുന്ന (ഇല്ലാതാക്കുന്നില്ല!) കോഡ് എഴുതുക. ഔട്ട്ലൈയിംഗ് വരികൾ ഒരു പ്രത്യേക df-ൽ ഇടുക, അങ്ങനെ എനിക്ക് അവ നേരിട്ട് പരിശോധിക്കാം. ഔട്ട്‌ലൈയറുകളുടെ എണ്ണവും മൊത്തം അവരുടെ വിഹിതവും പ്രിൻ്റ് ചെയ്യുക.

3) തരം/ഫോർമാറ്റ് സ്റ്റാൻഡേർഡൈസേഷൻ:

ഇനിപ്പറയുന്ന കോളങ്ങൾ സ്റ്റാൻഡേർഡ് ചെയ്യുന്ന കോഡ് എഴുതുക:- "തീയതി": മിക്സഡ് ഫോർമാറ്റുകൾ ആകാം ("2024-03-01", "01.03.2024"); അവയെല്ലാം ഡേറ്റ്‌ടൈമിലേക്ക് പരിവർത്തനം ചെയ്യുക, വിവർത്തനം ചെയ്യാൻ കഴിയാത്തവ എണ്ണി റിപ്പോർട്ട് ചെയ്യുക (നിശബ്ദമായി വലിച്ചെറിയുക). - "ലിംഗം": "ആൺ"/"ആൺ"/"എം" -> "എം", "സ്ത്രീ"/"സ്ത്രീ"/"എഫ്" -> "കെ". - "തുക": ടർക്കിഷ് ഫോർമാറ്റ് ചെയ്ത വാചകം ("1.250,50") -> ദശാംശ സംഖ്യ. ഓരോ പരിവർത്തനത്തിന് ശേഷവും എത്ര വരികൾ ബാധിച്ചുവെന്ന് പ്രിൻ്റ് ചെയ്യുക.

4) വൃത്തിയാക്കുന്നതിന് മുമ്പ്/ശേഷം പരിശോധിക്കുക:

ഒരു ക്ലീനപ്പ് ഘട്ടത്തിന് മുമ്പും ശേഷവും തിരഞ്ഞെടുത്ത നിരകളുടെ df.shape, നഷ്‌ടമായ എണ്ണം, സംഗ്രഹ സ്ഥിതിവിവരക്കണക്കുകൾ (മീൻ, മീഡിയൻ, മിനിറ്റ്, പരമാവധി) എന്നിവ താരതമ്യം ചെയ്യുന്ന കോഡ് എഴുതുക. ഉദ്ദേശ്യം: ക്ലീനിംഗ് മാറുന്നത് കാണുന്നതിന്.

ദുർബലമായ പ്രോംപ്റ്റ് / ശക്തമായ പ്രോംപ്റ്റ്

ദുർബലമായ പ്രോംപ്റ്റ്:

ഈ ഡാറ്റ മായ്ക്കുക.

"വ്യക്തം" എന്നത് അവ്യക്തമാണ്; നഷ്‌ടമായ ഭാഗങ്ങൾ ഇല്ലാതാക്കണം, എന്ത് പൂരിപ്പിക്കണം, ഏത് കോളം പ്രോസസ്സ് ചെയ്യണം, എങ്ങനെ എന്നിവ AI-ക്ക് അറിയില്ല. ഫലം: അന്ധമായ, മാറ്റാനാവാത്ത മാറ്റങ്ങൾ.

ശക്തമായ നിർദ്ദേശം:

നിങ്ങളുടെ റോൾ: ഡാറ്റ ക്ലീൻസിംഗ് അസിസ്റ്റൻ്റ്. df നിരകൾ: customer_id (int), രജിസ്ട്രേഷൻ_ഡേറ്റ് (മിക്സഡ് ഫോർമാറ്റ് ടെക്സ്റ്റ്), income_tl (ടെക്സ്റ്റ്, "1,200.00"), നഗരം (ടെക്സ്റ്റ്, പൊരുത്തമില്ലാത്ത അക്ഷരവിന്യാസം). നിയമങ്ങൾ:- യഥാർത്ഥ df മാറ്റുന്നു; df_clean എന്ന് പേരിട്ടിരിക്കുന്ന പകർപ്പിൽ പ്രവർത്തിക്കുക.- income_tl എന്ന നമ്പറിലേക്ക് പരിവർത്തനം ചെയ്യുക, വിവർത്തനം ചെയ്യാൻ കഴിയാത്തത് എണ്ണുക.- record_date ഡേറ്റാ ടൈമിലേക്ക് മാറ്റുക, പിശക് റിപ്പോർട്ട് ചെയ്യുക.- എൻ്റെ അംഗീകാരമില്ലാതെ ഒരു വരിയും ഇല്ലാതാക്കരുത്; സ്ഥാനാർത്ഥികളെ പ്രത്യേകം കാണിക്കുക. ഓരോ ഘട്ടത്തിനും ശേഷം, df_temiz.shape ഉം കാണാതായ നമ്പറും പ്രിൻ്റ് ചെയ്യുക.

ഇവിടെ ഉറവിടം സംരക്ഷിക്കപ്പെടുന്നു, എല്ലാ പരിവർത്തനങ്ങളും കണക്കാക്കുന്നു, ഇല്ലാതാക്കൽ മനുഷ്യന് അവശേഷിക്കുന്നു.

സാധാരണ തെറ്റുകൾ

  • "എന്തിനാണ് ഇത് ശൂന്യമായത്?" എന്ന് ചോദിക്കാതെ വിടവുകൾ നികത്തുന്നു. വ്യവസ്ഥാപിത/പ്രധാനമായ നഷ്‌ടത ശരാശരി ഉപയോഗിച്ച് പൂരിപ്പിക്കുന്നത് ഡാറ്റയെ വളച്ചൊടിക്കുന്നു.
  • അത് പരിശോധിക്കാതെ ഔട്ട്‌ലിയർ ഇല്ലാതാക്കുന്നു. യഥാർത്ഥവും എന്നാൽ അപൂർവവുമായ സംഭവങ്ങൾ ഉപേക്ഷിക്കുന്നത് പ്രധാനപ്പെട്ട വിവരങ്ങൾ നശിപ്പിക്കുന്നു.
  • എല്ലാ ഡാറ്റയിൽ നിന്നും പാഡിംഗ് മൂല്യം കണക്കാക്കുന്നു. ടെസ്റ്റ് ഡാറ്റ ഉൾപ്പെടെ ചോർച്ച സൃഷ്ടിക്കുന്നു; പരിശീലനത്തിൽ നിന്ന് കണക്കാക്കുക.
  • പരിവർത്തനത്തിനുശേഷം വരികളുടെ/ശൂന്യതകളുടെ എണ്ണം പരിശോധിക്കുന്നില്ല. നിശബ്ദമായി NaT/NaN ആയ വരികൾ വിശകലനത്തിൽ നിന്ന് ഒഴിവാക്കിയിരിക്കുന്നു.
  • യഥാർത്ഥ ഡാറ്റ പുനരാലേഖനം ചെയ്യുന്നു. തിരിച്ചുവരവും പുനരുൽപാദനക്ഷമതയും നഷ്ടപ്പെട്ടു.
നുറുങ്ങ്: "മുൻപ്-പിന്നീട്" ഒരു താരതമ്യം ഉപയോഗിച്ച് ക്ലീൻ പ്രവർത്തിപ്പിക്കുക. ഓരോ ഘട്ടത്തിനും ശേഷവും നിർണ്ണായക നിരകളുടെ df.shape, നഷ്ടപ്പെട്ട എണ്ണം, സംഗ്രഹ സ്ഥിതിവിവരക്കണക്കുകൾ എന്നിവ പ്രിൻ്റ് ചെയ്യുക. അതിനാൽ ഒരു ഘട്ടം അപ്രതീക്ഷിതമായി 6,000 വരികൾ നശിപ്പിക്കുന്നതായി നിങ്ങൾ ഉടൻ കാണുന്നു.

ചുരുക്കത്തിൽ

ഡാറ്റാ സയൻസിൻ്റെ ഏറ്റവും കൂടുതൽ സമയമെടുക്കുന്നതും തീരുമാനമെടുക്കേണ്ടതുമായ ഘട്ടമാണ് ശുദ്ധീകരണം. ഓരോ മാറ്റവും ഡാറ്റയെ മാറ്റുന്നു, അതിനാൽ ഓരോന്നും ബോധപൂർവമായ തീരുമാനമാണ്. നഷ്‌ടമായ മൂല്യങ്ങൾക്ക്, "എന്തുകൊണ്ട് ഇത് ശൂന്യമാണ്?" ഏതെങ്കിലും ഔട്ട്‌ലൈയറുകൾ ഇല്ലാതാക്കുന്നതിന് മുമ്പ് അവ അവലോകനം ചെയ്യുക; തരവും ഫോർമാറ്റും സ്റ്റാൻഡേർഡിലേക്ക് കൊണ്ടുവരിക. പരിശീലന ഡാറ്റയിൽ നിന്ന് മാത്രം ഫിൽ മൂല്യം കണക്കാക്കുക, ഒറിജിനൽ സൂക്ഷിക്കുക, ഓരോ ഘട്ടത്തിൻ്റെയും ആഘാതം കണക്കാക്കി ട്രാക്ക് ചെയ്യുക. AI ഈ ബിസിനസ്സിലെ ഒരു വലിയ ആക്സിലറേറ്ററാണ്, എന്നാൽ നിങ്ങൾ എന്ത് വൃത്തിയാക്കണമെന്നും എന്തിന് വൃത്തിയാക്കണമെന്നും മനുഷ്യരാണ് തീരുമാനിക്കുന്നത്.

ആപ്ലിക്കേഷൻ ടാസ്ക്

ഒരു ചെറിയ ടേബിൾ എടുത്ത് (അല്ലെങ്കിൽ സൃഷ്‌ടിക്കുക) അതിൽ മൂന്ന് പ്രശ്‌നങ്ങൾ മനഃപൂർവ്വം തിരുകുക: നഷ്ടപ്പെട്ട മൂല്യമുള്ള ട്യൂപ്പിൾ, ഒരു ഔട്ട്‌ലിയർ, ഒരു മിക്സഡ് ഡേറ്റ് ഫോർമാറ്റ്. മുകളിലുള്ള ടെംപ്ലേറ്റുകൾ ഉപയോഗിച്ച് AI-യിൽ നിന്ന് രോഗനിർണയവും സ്റ്റാൻഡേർഡൈസേഷൻ കോഡും അഭ്യർത്ഥിക്കുക; ഓരോ ഘട്ടത്തിനും മുമ്പോ ശേഷമോ വരികളുടെയും ശൂന്യതകളുടെയും എണ്ണം താരതമ്യം ചെയ്യുക. കുറഞ്ഞത് ഒരു "നിശബ്ദ നഷ്ടം" പിടിക്കാൻ ശ്രമിക്കുക, നിങ്ങൾ അത് എങ്ങനെ ശ്രദ്ധിച്ചുവെന്ന് ശ്രദ്ധിക്കുക.

ചെക്ക്ലിസ്റ്റ്

  • [ ] ഞാൻ യഥാർത്ഥ അസംസ്‌കൃത ഡാറ്റ സൂക്ഷിച്ച് കോപ്പിയിൽ പ്രവർത്തിച്ചോ?
  • [ ] നഷ്‌ടമായ ഓരോ കോളത്തിനും "എന്തുകൊണ്ട് ഇത് ശൂന്യമാണ്" എന്ന ചോദ്യം ഞാൻ ചോദിച്ചിട്ടുണ്ടോ?
  • [ ] ഔട്ട്‌ലൈയറുകൾ ഇല്ലാതാക്കുന്നതിന് മുമ്പ് ഞാൻ അവ അവലോകനം ചെയ്‌തിട്ടുണ്ടോ?
  • [ ] പരിശീലന ഡാറ്റയിൽ നിന്ന് മാത്രമാണോ ഞാൻ പാഡിംഗ് മൂല്യം കണക്കാക്കിയത്?
  • [ ] ഓരോ ഘട്ടത്തിനുശേഷവും ഞാൻ ലൈനുകളുടെ/ശൂന്യതകളുടെ എണ്ണം പരിശോധിച്ച് നിശ്ശബ്ദമായ നഷ്ടം ഇല്ലാതാക്കുകയാണോ?