യൂണിറ്റുകൾ
1. ML എഞ്ചിനീയറിംഗിലെ ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ്: പങ്ക്, അതിരുകൾ, മൂല്യനിർണ്ണയം, ഉത്തരവാദിത്തം 2. ഡാറ്റ പൈപ്പ്ലൈൻ: ശേഖരണം, ശുദ്ധീകരണം, ടാഗിംഗ്, പതിപ്പ് 3. മാതൃകാ പരിശീലനവും മൂല്യനിർണ്ണയവും: കൃത്യമായ അളവുകൾ, സത്യസന്ധമായ ബെഞ്ച്മാർക്കിംഗ് 4. LLM അപേക്ഷ: RAG ഉപയോഗിച്ചുള്ള നിങ്ങളുടെ സ്വന്തം ഡാറ്റയെ അടിസ്ഥാനമാക്കിയുള്ള ഉത്തരങ്ങൾ 5. LLM ആപ്ലിക്കേഷൻ: ഏജൻ്റ്സ്, ടൂളിംഗ്, സെക്യൂർ ഓട്ടോമേഷൻ 6. ഫൈൻ-ട്യൂണിംഗ് അടിസ്ഥാനം: എപ്പോൾ, എങ്ങനെ, എന്ത് അപകടസാധ്യതയോടെ 7. MLOps, വിന്യാസം: ലാബിൽ നിന്ന് ഉൽപ്പാദനത്തിലേക്ക് മോഡൽ മാറ്റുന്നു 8. ഇവലും മോണിറ്ററിംഗും: ഉൽപ്പാദനത്തിൽ മോഡൽ യഥാർത്ഥത്തിൽ എന്താണ് ചെയ്യുന്നതെന്ന് അറിയുക 9. സുരക്ഷയും സ്വകാര്യതയും: AI സിസ്റ്റങ്ങളെ പ്രതിരോധിക്കുന്നു 10. പക്ഷപാതം, ധാർമ്മികത, ചെലവ്: ഉത്തരവാദിത്തവും സുസ്ഥിരവുമായ AI എഞ്ചിനീയറിംഗ് 11. പുനരുൽപാദനക്ഷമതയും എൻഡ്-ടു-എൻഡ് പ്രോജക്റ്റും: എല്ലാം സംയോജിപ്പിക്കുന്നു
യൂണിറ്റ് 2 / 11

ഡാറ്റ പൈപ്പ്ലൈൻ: ശേഖരണം, ശുദ്ധീകരണം, ടാഗിംഗ്, പതിപ്പ്

നേട്ടങ്ങൾ:

  • ഒരു ഡാറ്റാ പൈപ്പ്‌ലൈൻ സജ്ജീകരിക്കാനുള്ള കഴിവ് (ശേഖരണം, മൂല്യനിർണ്ണയം, ശുദ്ധീകരണം, രൂപാന്തരപ്പെടുത്തൽ, വിഭജനം, പതിപ്പ്) പൈപ്പ്ലൈനിൻ്റെ തുടക്കത്തിൽ സ്കീമ മൂല്യനിർണ്ണയം സ്ഥാപിക്കുക
  • ഡാറ്റ ചോർച്ച തടയുന്നതിന് (ഗ്രൂപ്പും ടെമ്പറലും) ഫീൽഡ് അർത്ഥത്തെയും വിഭജനത്തെയും അടിസ്ഥാനമാക്കി നഷ്ടമായ മൂല്യവും ലേബൽ തീരുമാനങ്ങളും എടുക്കാനുള്ള കഴിവ്
  • ഡാറ്റ പതിപ്പും റാൻഡംനെസ് സീഡും ശരിയാക്കി പുനരുൽപ്പാദിപ്പിക്കാവുന്ന ഡാറ്റാ ബേസ് സൃഷ്ടിക്കാനുള്ള കഴിവ്

എല്ലാ മെഷീൻ ലേണിംഗ് സിസ്റ്റത്തിൻ്റെയും യഥാർത്ഥ ശക്തി ഡാറ്റയിലാണ്, മോഡലിലല്ല. പരിചയസമ്പന്നരായ എഞ്ചിനീയർമാർക്ക് അറിയാം: "ഗാർബേജ് ഇൻ, ഗാർബേജ് ഔട്ട്" - മോശം ഡാറ്റ നൽകുന്ന ഏറ്റവും വിപുലമായ മോഡൽ പോലും മോശം ഫലങ്ങൾ ഉണ്ടാക്കും. ഈ യൂണിറ്റിൽ, ഞങ്ങൾ ഡാറ്റ പൈപ്പ്‌ലൈൻ സ്ഥാപിക്കുന്നു (ഡാറ്റ പൈപ്പ്‌ലൈൻ: മോഡൽ പരിശീലനത്തിന് റോ ഡാറ്റ തയ്യാറാക്കുന്ന ഘട്ടങ്ങളുടെ ശൃംഖല) അവസാനം മുതൽ അവസാനം വരെ നമുക്ക് കൃത്രിമ ബുദ്ധി സുരക്ഷിതമായി ഉപയോഗിക്കാമെന്ന് മനസിലാക്കുക.

ഡാറ്റ ലൈനിൻ്റെ ഘട്ടങ്ങൾ

ഒരു ഡാറ്റാ ലൈൻ സാധാരണയായി ഈ സ്റ്റോപ്പുകളിലൂടെ കടന്നുപോകുന്നു:

  1. ശേഖരണം (ഉൾപ്പെടുത്തൽ): ഉറവിടങ്ങളിൽ നിന്ന് ഡാറ്റ വലിക്കുന്നു (ഡാറ്റാബേസ്, API, ലോഗ് ഫയലുകൾ, ഇവൻ്റ് സ്ട്രീമുകൾ).
  2. മൂല്യനിർണ്ണയം: പ്രതീക്ഷിക്കുന്ന സ്കീമ, തരങ്ങൾ, ശ്രേണികൾ എന്നിവയുമായി ഡാറ്റ പൊരുത്തപ്പെടുന്നുണ്ടോയെന്ന് പരിശോധിക്കുന്നു.
  3. ക്ലീനിംഗ്: നഷ്ടപ്പെട്ട മൂല്യങ്ങൾ, തനിപ്പകർപ്പ് റെക്കോർഡുകൾ, ഔട്ട്‌ലറുകൾ, പൊരുത്തക്കേടുകൾ എന്നിവ കൈകാര്യം ചെയ്യുക.
  4. പരിവർത്തനം: അസംസ്‌കൃത ഡാറ്റയെ ആട്രിബ്യൂട്ടുകളാക്കി മാറ്റുന്നു - ഒരു സംഖ്യയിലേക്ക് ഒരു കാറ്റഗറിക്കൽ വേരിയബിളിനെ പരിവർത്തനം ചെയ്യുക, ഒരു തീയതിയിൽ നിന്ന് "ആഴ്ചയിലെ ദിവസം" ഉണ്ടാക്കുന്നത് പോലെ.
  5. വിഭജനം: പരിശീലനം, മൂല്യനിർണ്ണയം, ടെസ്റ്റിംഗ് സെറ്റുകൾ എന്നിങ്ങനെ വേർതിരിക്കുന്നു.
  6. പതിപ്പ്: ഏത് ഡാറ്റ ഉപയോഗിച്ച് ഏത് മോഡലാണ് പരിശീലിപ്പിച്ചതെന്ന് രേഖപ്പെടുത്തുന്നു.

ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് കോഡ് ഡ്രാഫ്റ്റുകളും ആശയങ്ങളും സൃഷ്ടിച്ചുകൊണ്ട് സമയം ലാഭിക്കുന്നു, പ്രത്യേകിച്ച് ഘട്ടങ്ങൾ 2, 3, 4 എന്നിവയിൽ. എന്നാൽ ഏത് റെക്കോർഡ് ഉപേക്ഷിക്കണം, ഏത് മൂല്യം നഷ്‌ടപ്പെടുത്തണം, എങ്ങനെ പൂരിപ്പിക്കണം തുടങ്ങിയ തീരുമാനങ്ങൾ ഡാറ്റ അറിയാവുന്ന എഞ്ചിനീയർക്കുള്ളതാണ്; കാരണം അനുചിതമായ ക്ലീനിംഗ് മോഡലിൽ ഒരു മറഞ്ഞിരിക്കുന്ന പക്ഷപാതം കുത്തിവയ്ക്കും.

ഡാറ്റ സ്ഥിരീകരണം: ലൈനിൻ്റെ ആദ്യകാല പ്രതിരോധം

ഏറ്റവും ചെലവേറിയ പിശകുകൾ ആരംഭിക്കുന്നത് ഉൽപ്പാദനത്തിലല്ല, മറിച്ച് സ്ഥിരീകരണ ഘട്ടം ഒഴിവാക്കുന്നിടത്താണ്. ഓരോ ഇൻകമിംഗ് ബാച്ചും ഡാറ്റ പ്രതീക്ഷിക്കുന്ന ഘടനയുമായി പൊരുത്തപ്പെടുന്നുണ്ടോയെന്ന് സ്കീമ മൂല്യനിർണ്ണയം സ്വയമേവ പരിശോധിക്കുന്നു. ഉദാഹരണത്തിന്, പ്രായ കോളം 0-120 ഇടയിലാണോ, ഇമെയിൽ ഫീൽഡ് ശൂന്യമാണോ, കോളങ്ങളുടെ എണ്ണം മാറിയിട്ടുണ്ടോ?

നുറുങ്ങ്: വരിയുടെ തുടക്കത്തിൽ സ്ഥിരീകരണം ഇടുക. അഴിമതിയുള്ള വിവരങ്ങൾ എത്രയും വേഗം പിടിക്കപ്പെടുന്നുവോ അത്രയും വിലകുറഞ്ഞതാണ് അത് പരിഹരിക്കുക. ഉൽപ്പാദനത്തിൽ പിടിക്കപ്പെട്ട ഒരു സ്കീമ പിശക് പരിശീലന ഘട്ടത്തിൽ പിടിക്കപ്പെട്ടതിനേക്കാൾ പലമടങ്ങ് ചെലവേറിയതാണ്.

ഇനിപ്പറയുന്ന ഡാറ്റാ സ്‌കീമയ്‌ക്കായി പാൻഡെറ (അല്ലെങ്കിൽ വലിയ പ്രതീക്ഷകൾ) ഉപയോഗിച്ച് ഒരു മൂല്യനിർണ്ണയ സ്കീം എഴുതുക. നിരകളും നിയമങ്ങളും:- user_id: പൂർണ്ണസംഖ്യ, അസാധുവാകാൻ കഴിയില്ല, അദ്വിതീയം- വയസ്സ്: പൂർണ്ണസംഖ്യ, 0-120-ൽ നിന്നും സൈൻഅപ്പ്_തീയതി: തീയതി, ഭാവിയിൽ ആകാൻ കഴിയില്ല- രാജ്യം: കാറ്റഗറിക്കൽ, സെറ്റിൽ നിന്ന് {TR, DE, US, UK}- ബാലൻസ്: ദശാംശം, നെഗറ്റീവ് ആയിരിക്കരുത് ഓരോ നിയമ ലംഘനത്തിനും അർത്ഥവത്തായ ഒരു പിശക് സന്ദേശം സൃഷ്ടിക്കുക. കോഡിൻ്റെ അവസാനം ഒരു ഉദാഹരണം തകർന്ന വരി ഉപയോഗിച്ച് ടെസ്റ്റ് കാണിക്കുക.

വൃത്തിയാക്കൽ: അത് തീരുമാനിക്കുന്നത് മനുഷ്യനാണ്

നഷ്‌ടമായ മൂല്യങ്ങൾ എല്ലാ ഡാറ്റാ സെറ്റിൻ്റെയും ഒരു യാഥാർത്ഥ്യമാണ്. കൈകാര്യം ചെയ്യാനുള്ള വഴികൾ:

  • ഇല്ലാതാക്കൽ: വളരെ ഉയർന്ന നഷ്‌ടമായ നിരക്കുള്ള ഒരു വരി/നിര നിരസിക്കുന്നു. എന്നാൽ വിവരങ്ങൾ നഷ്‌ടപ്പെടാനും പക്ഷപാതമുണ്ടാകാനും സാധ്യതയുണ്ട്.
  • ഇംപ്യൂട്ടേഷൻ: ശരാശരി, ഇടത്തരം, ഏറ്റവും പതിവ് മൂല്യം അല്ലെങ്കിൽ മോഡൽ അടിസ്ഥാനമാക്കിയുള്ള പ്രവചനം.
  • ഫ്ലാഗ്: ഒരു പ്രത്യേക ഫ്ലാഗ് കോളത്തിൽ "കാണാതായ" വിവരങ്ങൾ സംഭരിക്കുന്നത് - ചിലപ്പോൾ നഷ്‌ടമായത് തന്നെ സിഗ്നലാണ്.

ഏതാണ് ശരി എന്നത് പ്രശ്നത്തെ ആശ്രയിച്ചിരിക്കുന്നു. ഒരു മെഡിക്കൽ ഡാറ്റാ സെറ്റിൽ, "രക്തത്തിൻ്റെ മൂല്യം അളക്കാത്ത" വിവരങ്ങൾ ഇല്ലാതാക്കുന്നതിനു പകരം സംരക്ഷിക്കണം; കാരണം ഡോക്ടർ പോലും അളവെടുക്കാൻ വിസമ്മതിക്കുന്നത് ഒരു സൂചനയാണ്. AI-ന് നിങ്ങൾക്ക് ഓപ്ഷനുകളും കോഡും നൽകാൻ കഴിയും; ഫീൽഡിൻ്റെ യാഥാർത്ഥ്യത്തിന് അനുയോജ്യമായത് നിങ്ങൾ തിരഞ്ഞെടുക്കുക.

ദുർബലമായ പ്രോംപ്റ്റ് / ശക്തമായ പ്രോംപ്റ്റ്

ദുർബലമായ പ്രോംപ്റ്റ്: "നഷ്‌ടമായ മൂല്യങ്ങൾ പൂരിപ്പിക്കുക."

ശക്തമായ നിർദ്ദേശം: "ഇനിപ്പറയുന്ന കോളങ്ങളിൽ മൂല്യങ്ങൾ നഷ്‌ടപ്പെട്ടിരിക്കുന്നു: വരുമാനം (12% നഷ്‌ടമായി, വലത്-ചരിഞ്ഞ വിതരണം), last_login (30% കാണുന്നില്ല). വരുമാനം മീഡിയൻ ഉപയോഗിച്ച് പൂരിപ്പിക്കാൻ നിർദ്ദേശിക്കുക, എന്നാൽ എന്തിനാണ് ശരാശരിയും അർത്ഥവുമല്ലെന്ന് വിശദീകരിക്കുക. ലാസ്റ്റ്_ലോഗിന്, നഷ്‌ടമായ മൂല്യം പ്രാധാന്യമർഹിക്കുന്നതായി കരുതുക (ഉപയോക്താവ് ഒരിക്കലും ലോഗിൻ ചെയ്‌തിട്ടില്ല. പക്ഷപാതം ഒന്നുകിൽ സമീപനം മോഡലിനെ കൂട്ടിച്ചേർക്കും."

വ്യത്യാസം: ശക്തമായ പ്രോംപ്റ്റ് വിതരണ വിവരങ്ങളും ഏരിയ അർത്ഥവും നൽകുന്നു; മെക്കാനിക്കൽ ഫില്ലിംഗിന് പകരം ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് ഡിസിഷൻ സപ്പോർട്ട് ഉണ്ടാക്കുന്നു.

ലേബലിംഗ്: ഗുണനിലവാരം അളക്കുന്നു

സൂപ്പർവൈസ്ഡ് ലേണിംഗിൽ (ശരിയായ ഉത്തരങ്ങളുള്ള ഉദാഹരണങ്ങൾ നൽകുന്ന പഠനം), മോഡൽ പഠിക്കുന്നത് ലേബലുകളാണ് (ലേബലുകൾ: ഓരോ ഉദാഹരണത്തിനും ശരിയായ ഉത്തരം). ലേബൽ ഗുണനിലവാരം ഒരു പരിധി നിശ്ചയിക്കുന്നു - ആളുകൾ അസ്ഥിരമായി ലേബൽ ചെയ്യുകയാണെങ്കിൽ, മോഡൽ പൊരുത്തക്കേടോടെ പഠിക്കുന്നു.

വ്യത്യസ്ത ആളുകൾ ഒരേ സാമ്പിളിന് ഒരേ ലേബൽ നൽകുന്ന നിരക്ക് ഇൻ്റർ-അനോട്ടേറ്റർ കരാർ അളക്കുന്നു; കോഹെൻസ് കപ്പ പോലെയുള്ള ഒരു ഗുണകമാണ് ഇത് പ്രകടിപ്പിക്കുന്നത്. കുറഞ്ഞ അനുസരണം സൂചിപ്പിക്കുന്നത് ഒന്നുകിൽ ചുമതല അവ്യക്തമാണ് അല്ലെങ്കിൽ നിർദ്ദേശം ദുർബലമാണ്.

ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് രണ്ട് തരത്തിൽ ലേബൽ ചെയ്യാൻ സഹായിക്കുന്നു: (1) വ്യാഖ്യാന മാർഗ്ഗരേഖ തയ്യാറാക്കൽ, (2) പ്രീ-ലേബൽ ചെയ്യൽ, മനുഷ്യനെ മാത്രം അത് ശരിയാക്കുക. എന്നാൽ LLM ഉപയോഗിച്ചുള്ള പ്രീ-ലേബലിംഗിന് ഒരു അപകടമുണ്ട്: മോഡലിൻ്റെ സിസ്റ്റമാറ്റിക് പിശക് മുഴുവൻ ലേബൽ സെറ്റിലേക്കും ചോർന്നേക്കാം. അതുകൊണ്ടാണ് മനുഷ്യർ എപ്പോഴും ചില LLM ലേബലുകൾ പരിശോധിക്കുന്നത്.

ശ്രദ്ധിക്കുക: LLM നിർമ്മിച്ച ലേബലുകൾ "ഗ്രൗണ്ട് ട്രൂട്ട്" ആയി കണക്കാക്കരുത്. ഒരു മനുഷ്യനുള്ള ഒരു സാമ്പിൾ പരിശോധിച്ച് LLM-മനുഷ്യ ഫിറ്റ് അളക്കുക. പാലിക്കൽ കുറവാണെങ്കിൽ, പ്രീ-ലേബൽ ചെയ്യുന്നത് ഗുണത്തേക്കാളേറെ ദോഷം ചെയ്യും.

ഡാറ്റ പാർട്ടീഷൻ: ചോർച്ച തടയുക

പരിശീലനം / മൂല്യനിർണ്ണയം / പരിശോധന എന്നിങ്ങനെ ഡാറ്റ വിഭജിക്കുമ്പോൾ ഏറ്റവും അപകടകരമായ തെറ്റ് ഡാറ്റ ചോർച്ചയാണ്: ടെസ്റ്റ് വിവരങ്ങൾ പരിശീലനത്തിലേക്ക് മിശ്രണം ചെയ്യുക. ഉദാഹരണങ്ങൾ:

  • ഒരേ ഉപയോക്താവിൻ്റെ റെക്കോർഡുകൾ പരിശീലനത്തിലും പരിശോധനയിലും (ഗ്രൂപ്പ് ലീക്ക്) ഉൾപ്പെടുന്നു.
  • ഭാവിയെ പരിശീലനത്തിലും ഭൂതകാലത്തെ സമയ ശ്രേണിയിലെ പരീക്ഷണത്തിലും ഉപയോഗിക്കുക (താൽക്കാലിക ചോർച്ച).
  • എല്ലാ ഡാറ്റയിൽ നിന്നും സ്കെയിലിംഗ് (നോർമലൈസേഷൻ) പാരാമീറ്ററുകൾ കണക്കാക്കുകയും തുടർന്ന് വിഭജിക്കുകയും ചെയ്യുന്നു.

സമയവുമായി ബന്ധപ്പെട്ട പ്രശ്നങ്ങൾക്ക് താൽക്കാലിക വിഭജനം അത്യാവശ്യമാണ്: ഭൂതകാലത്തെ പരിശീലിപ്പിക്കുക, ഭാവിയിൽ പരീക്ഷിക്കുക. ക്രമരഹിതമായ വിഭജനം ഉൽപാദനത്തിൽ ഒരിക്കലും സംഭവിക്കാത്ത ഒരു "ഭാവി" ആനുകൂല്യം നൽകുകയും അളവുകൾ വർദ്ധിപ്പിക്കുകയും ചെയ്യുന്നു.

ഡാറ്റ പതിപ്പിംഗും പുനരുൽപാദനക്ഷമതയും

"ഏത് ഡാറ്റ ഉപയോഗിച്ചാണ് ഞങ്ങൾ ഈ മോഡലിനെ പരിശീലിപ്പിച്ചത്?" മാസങ്ങൾക്ക് ശേഷം ചോദ്യത്തിന് ഉത്തരം നൽകാൻ കഴിയുന്നത് ഗുരുതരമായ എംഎൽ എഞ്ചിനീയറിംഗിൻ്റെ മുഖമുദ്രയാണ്. ഡാറ്റ പതിപ്പ് ഓരോ ഡാറ്റ സ്നാപ്പ്ഷോട്ടും ഒരു ഐഡി (ഹാഷ് അല്ലെങ്കിൽ പതിപ്പ് ടാഗ്) ഉപയോഗിച്ച് സംഭരിക്കുന്നു. കോഡ് പോലുള്ള ഡിവിസി (ഡാറ്റ പതിപ്പ് കൺട്രോൾ) പതിപ്പ് ഡാറ്റ പോലുള്ള ഉപകരണങ്ങൾ.

ഒരു മോഡലിൻ്റെ ഫലം പുനർനിർമ്മിക്കുന്നതിന്, മൂന്ന് കാര്യങ്ങൾ പരിഹരിക്കേണ്ടതുണ്ട്: ഡാറ്റ പതിപ്പ്, കോഡ് പതിപ്പ്, ക്രമരഹിതമായ വിത്ത്. ഈ ത്രയമില്ലാതെ "എനിക്ക് ഒരേ ഫലം ലഭിച്ചു" എന്ന് പറയാൻ കഴിയില്ല. ഞങ്ങൾ യൂണിറ്റ് 11-ൽ പുനരുൽപ്പാദനക്ഷമത വർദ്ധിപ്പിക്കും; എന്നാൽ ഡാറ്റ പൈപ്പ്ലൈനിൽ വിത്ത് ഉറപ്പിക്കുന്നത് ഇവിടെ നിന്നാണ്.

മൂന്ന് മിനി കേസുകൾ

കേസ് 1 - ദിവസത്തെ സ്കീമ മൂല്യനിർണ്ണയം സംരക്ഷിച്ചു. ഒരു ടീം അപ്‌സ്ട്രീം സിസ്റ്റം പ്രൈസ് ഫീൽഡ് പെന്നികളിൽ നിന്ന് ലിറസിലേക്ക് പരിവർത്തനം ചെയ്തപ്പോൾ, എല്ലാ വിലകളും 100 മടങ്ങ് കുറഞ്ഞു. സ്കീമ മൂല്യനിർണ്ണയം ബാച്ചിനെ "വില പരിധിക്ക് പുറത്താണ്" എന്ന് നിരസിച്ചു, കൂടാതെ കേടായ ഡാറ്റ ഉപയോഗിച്ച് മോഡൽ പരിശീലിപ്പിച്ചിട്ടില്ല. സ്ഥിരീകരണം കൂടാതെ, തെറ്റായ പ്രവചനങ്ങളോടെ, ഉൽപ്പാദനത്തിൽ മാത്രമേ പിശക് ശ്രദ്ധിക്കപ്പെടുകയുള്ളൂ.

കേസ് 2 - തെറ്റായ പൂരിപ്പിക്കൽ പക്ഷപാതം. ഒരു ക്രെഡിറ്റ് മോഡലിൽ, നഷ്ടപ്പെട്ട വരുമാന മൂല്യങ്ങൾ ശരാശരിയിൽ നിറഞ്ഞു. എന്നാൽ നഷ്ടപ്പെട്ട വരുമാനം പ്രധാനമായും താഴ്ന്ന വരുമാനമുള്ള വിഭാഗത്തിലായിരുന്നു; ശരാശരി കൃത്രിമമായി ഈ ഗ്രൂപ്പിനെ "സമ്പന്നമാക്കി", കൂടാതെ മോഡൽ അവർക്ക് അന്യായമായ ഉയർന്ന പരിധി വാഗ്ദാനം ചെയ്തു. മീഡിയൻ + കാണാതായ ഫ്ലാഗിലെ പ്രശ്നം പരിഹരിച്ചു.

കേസ് 3 - താൽക്കാലിക ചോർച്ച. ഒരു ഡിമാൻഡ് പ്രവചന മോഡൽ ടെസ്റ്റ് സെറ്റിൽ മികച്ചതായി കാണപ്പെട്ടു (95% കൃത്യത) എന്നാൽ ഉൽപ്പാദനത്തിൽ തകർന്നു. എന്തുകൊണ്ട്: ക്രമരഹിതമായ വിഭജനം കാരണം, മോഡൽ ഭാവി കണ്ടു. ടെമ്പറൽ ബിന്നിംഗിലേക്ക് മാറുന്നത് ടെസ്റ്റ് കൃത്യത 78% ആയി കുറഞ്ഞു - എന്നാൽ അത് യഥാർത്ഥ പ്രകടനമായിരുന്നു, അത് ഉൽപ്പാദനത്തിൽ നിലനിർത്തി.

പകർത്താവുന്ന ടെംപ്ലേറ്റുകൾ

ഇനിപ്പറയുന്ന ഡാറ്റാസെറ്റിനെ മൂന്ന് സെറ്റുകളായി വിഭജിക്കുക: പരിശീലനം/സാധുവാക്കൽ/പരിശോധന. നിയന്ത്രണം: ഇതൊരു സമയ ശ്രേണിയാണ്; ടെമ്പറൽ സ്പ്ലിറ്റിംഗ് ഉപയോഗിക്കുക (പണ്ടത്തെ ട്രെയിൻ, ഭാവിയിൽ പരീക്ഷിക്കുക). ബാച്ച് ചോർച്ച തടയുക: ഒരേ `കസ്റ്റമർ_ഐഡി' ഒരു ക്ലസ്റ്ററിൽ മാത്രം ഉണ്ടായിരിക്കുക. പരിശീലന സെറ്റിൽ നിന്ന് മാത്രം സ്കെയിലിംഗ് പാരാമീറ്ററുകൾ കണക്കാക്കുക, തുടർന്ന് എല്ലാവർക്കും ബാധകമാക്കുക. ഓരോ ഘട്ടത്തിലും കോഡിൽ എത്ര വരികൾ അവശേഷിക്കുന്നുവെന്ന് പ്രിൻ്റ് ചെയ്യുകയും ചോർച്ചയുണ്ടോയെന്ന് പരിശോധിക്കുന്ന ഒരു ഉറപ്പ് ചേർക്കുകയും ചെയ്യുക.

ഈ ലേബലിംഗ് ടാസ്‌ക്കിനായി ഒരു ഡ്രാഫ്റ്റ് വ്യാഖ്യാന മാർഗ്ഗരേഖ എഴുതുക. ടാസ്‌ക്: [ഉദാ. ഉപഭോക്തൃ അവലോകനം പോസിറ്റീവ്/നെഗറ്റീവ്/ന്യൂട്രൽ ലേബൽ ചെയ്യുക]ബോർഡർലൈൻ കേസുകൾ വ്യക്തമാക്കുക: പരിഹാസം, സമ്മിശ്ര വികാരം, ഉൽപ്പന്നവുമായി ബന്ധമില്ലാത്ത അവലോകനം എങ്ങനെ ലേബൽ ചെയ്യാം? ടാഗറുകളിലുടനീളം സ്ഥിരത വർദ്ധിപ്പിക്കുന്ന 5 ഉദാഹരണങ്ങളും 3 ബുദ്ധിമുട്ടുള്ള കേസുകളും നൽകുക.

ഈ ഡാറ്റാ പൈപ്പ്‌ലൈനിനായി ഒരു പുനരുൽപ്പാദന ചെക്ക്‌ലിസ്റ്റ് നിർമ്മിക്കുക:- ഡാറ്റ പതിപ്പ് എങ്ങനെ ശരിയാക്കണം?- ഏത് ക്രമരഹിതമായ വിത്തുകൾ എവിടെയാണ് സജ്ജീകരിക്കേണ്ടത്?- ഏത് മെറ്റാഡാറ്റ (ഡാറ്റ ഹാഷ്, റോ കൗണ്ട്, തീയതി) ലോഗ് ചെയ്യണം? എൻ്റെ കോഡ്ബേസ്: [ഭാഷ/ലൈബ്രറി]

ഡാറ്റ ചോർച്ചയ്ക്കായി ഈ ക്ലീനപ്പ് കോഡ് പരിശോധിക്കുക. പ്രത്യേകമായി ഇത് നോക്കുക: സ്കെയിലിംഗ്/എൻകോഡിംഗ് പാരാമീറ്ററുകൾ വിഭജിക്കുന്നതിന് മുമ്പ് കണക്കാക്കിയിട്ടുണ്ടോ? ഏതെങ്കിലും സ്ഥിതിവിവരക്കണക്കുകൾ എല്ലാ ഡാറ്റയിൽ നിന്നും കണക്കാക്കിയതാണോ അതോ പരിശീലനത്തിൽ നിന്നാണോ? കോഡ്: [കോഡ്]

തീരുമാന പട്ടിക: നഷ്‌ടമായ മൂല്യ തന്ത്രം

നില

ശുപാർശ ചെയ്യുന്ന സമീപനം

എന്തിന്

സംഖ്യാപരമായ, ചരിഞ്ഞ വിതരണം

മീഡിയൻ ഉപയോഗിച്ച് പൂരിപ്പിക്കുക

ശരാശരിയെ പുറമ്പോക്ക് ബാധിക്കുന്നു

സംഖ്യാപരമായ, സമമിതി

ശരാശരി നിറയ്ക്കുക

വിവരങ്ങൾ സംരക്ഷിക്കുന്നു

കുറവ് ഗണ്യമായിരിക്കാം

ഫ്ലാഗ് കോളം + പൂരിപ്പിക്കുക

അഭാവം ഒരു സിഗ്നലാണ്

നഷ്‌ടമായ നിരക്ക്> 60%

നിരയെ വിലയിരുത്തുക/നിരസിക്കുക

ശബ്ദം വളരെ കൂടുതലാണ്

വിഭാഗീയം

"അജ്ഞാത" വിഭാഗം

കൃത്രിമ ഭൂരിപക്ഷം സൃഷ്ടിക്കുന്നില്ല

സാധാരണ തെറ്റുകൾ

  • സ്ഥിരീകരണം ഒഴിവാക്കുന്നു. സ്കീമ നിയന്ത്രണമില്ലാതെ, കേടായ ഡാറ്റ നിശബ്ദമായി ഒളിഞ്ഞുനോക്കുന്നു.
  • വിഭജിക്കുന്നതിന് മുമ്പ് സ്കെയിലിംഗ്. ഇത് പരീക്ഷയുടെ സ്ഥിതിവിവരക്കണക്കുകൾ വിദ്യാഭ്യാസത്തിലേക്ക് ചോർത്തുന്നു.
  • സമയ ശ്രേണിയിൽ ക്രമരഹിതമായ വിഭജനം ഉപയോഗിക്കുന്നു. ഇത് വ്യാജ ഉയർന്ന അളവുകൾ നിർമ്മിക്കുന്നു.
  • LLM ലേബലുകളെ അന്ധമായി വിശ്വസിക്കുന്നു. സിസ്റ്റമാറ്റിക് പിശക് ഡാറ്റയിലുടനീളം വ്യാപിക്കുന്നു.
  • ഡാറ്റ പതിപ്പ് സംരക്ഷിക്കുന്നില്ല. നിങ്ങൾക്ക് ഫലം പുനർനിർമ്മിക്കാൻ കഴിയില്ല.
  • ശരാശരി ഉപയോഗിച്ച് മെക്കാനിക്കൽ പൂരിപ്പിക്കൽ. ഇത് ഫീൽഡ് അർത്ഥത്തെ അവഗണിക്കുന്നു, പക്ഷപാതം ചേർക്കുന്നു.

ചുരുക്കത്തിൽ

ML സിസ്റ്റത്തിൻ്റെ അടിത്തറയാണ് ഡാറ്റ പൈപ്പ്ലൈൻ, മോഡലിനേക്കാൾ കൂടുതൽ പരിശ്രമം അർഹിക്കുന്നു. മുകളിൽ സ്ഥിരീകരണം ഇടുക; ഡൊമെയ്ൻ അറിവ് ഉപയോഗിച്ച് ക്ലീനിംഗ്, ലേബൽ തീരുമാനങ്ങൾ എടുക്കുക; കമ്പാർട്ട്മെൻ്റിൽ ചോർച്ച (ഗ്രൂപ്പ് ആൻഡ് ടെമ്പറൽ) തടയുക; ഡാറ്റ പതിപ്പും വിത്തും ശരിയാക്കുക. AI ഈ ലൈനിൽ കോഡും ആശയങ്ങളും സൃഷ്ടിക്കുന്നു, എന്നാൽ ഏത് ഡാറ്റയാണ് പ്രോസസ്സ് ചെയ്യേണ്ടതെന്നും എങ്ങനെ പ്രോസസ്സ് ചെയ്യണമെന്നും തീരുമാനിക്കേണ്ടത് നിങ്ങളാണ് - കാരണം ഇവിടെയുള്ള ഓരോ തെറ്റായ തീരുമാനവും ഒരു മറഞ്ഞിരിക്കുന്ന പിഴവായി മോഡലിലേക്ക് കടന്നുപോകുന്നു.

ആപ്ലിക്കേഷൻ ടാസ്ക്

നിങ്ങളുടെ സ്വന്തം ഡാറ്റാസെറ്റിൽ ഒരു മൂല്യനിർണ്ണയ സ്കീം (പണ്ടേര/വലിയ പ്രതീക്ഷകൾ) എഴുതുകയും മനഃപൂർവ്വം ഒരു മോശം വരി ചേർക്കുകയും അത് പിടിക്കപ്പെട്ടതായി കാണിക്കുകയും ചെയ്യുക. തുടർന്ന് ഡാറ്റയെ താൽകാലികമായോ ബാച്ച് തിരിച്ചോ വിഭജിക്കുക, പരിശീലനത്തിൽ നിന്ന് മാത്രം സ്കെയിലിംഗ് പാരാമീറ്ററുകൾ കണക്കാക്കുക, കൂടാതെ ഒരു ഉറപ്പോടെ ചോർച്ചയില്ലെന്ന് പരിശോധിക്കുക. ഒരു മെറ്റാഡാറ്റ ഫയലിലേക്ക് ഡാറ്റ പതിപ്പും വരി എണ്ണവും എഴുതുക.

ചെക്ക്ലിസ്റ്റ്

  • സ്കീമ മൂല്യനിർണ്ണയം ലൈനിൻ്റെ മുകളിൽ പ്രവർത്തിക്കുന്നു.
  • [ ] ഫീൽഡ് അർത്ഥത്തെ അടിസ്ഥാനമാക്കി ഞാൻ നഷ്ടപ്പെട്ട മൂല്യ തന്ത്രം തിരഞ്ഞെടുത്തു, ഞാൻ അത് യാന്ത്രികമായി പൂരിപ്പിച്ചില്ല.
  • [ ] ഞാൻ ലേബൽ ഗുണനിലവാരം അളന്നു (അനുസരണം); ഞാൻ LLM ടാഗുകൾ മനുഷ്യർ പരിശോധിച്ചു.
  • [ ] ഞാൻ പാളിയിലെ ഗ്രൂപ്പും താൽക്കാലിക ചോർച്ചയും തടഞ്ഞു.
  • [ ] പരിശീലന സെറ്റിൽ നിന്ന് മാത്രം കണക്കാക്കുന്ന സ്കെയിലിംഗ്/എൻകോഡിംഗ്.
  • [ ] ഡാറ്റ പതിപ്പ്, വരികളുടെ എണ്ണവും വിത്തും രേഖപ്പെടുത്തി.