യൂണിറ്റുകൾ
1. ML എഞ്ചിനീയറിംഗിലെ ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ്: പങ്ക്, അതിരുകൾ, മൂല്യനിർണ്ണയം, ഉത്തരവാദിത്തം 2. ഡാറ്റ പൈപ്പ്ലൈൻ: ശേഖരണം, ശുദ്ധീകരണം, ടാഗിംഗ്, പതിപ്പ് 3. മാതൃകാ പരിശീലനവും മൂല്യനിർണ്ണയവും: കൃത്യമായ അളവുകൾ, സത്യസന്ധമായ ബെഞ്ച്മാർക്കിംഗ് 4. LLM അപേക്ഷ: RAG ഉപയോഗിച്ചുള്ള നിങ്ങളുടെ സ്വന്തം ഡാറ്റയെ അടിസ്ഥാനമാക്കിയുള്ള ഉത്തരങ്ങൾ 5. LLM ആപ്ലിക്കേഷൻ: ഏജൻ്റ്സ്, ടൂളിംഗ്, സെക്യൂർ ഓട്ടോമേഷൻ 6. ഫൈൻ-ട്യൂണിംഗ് അടിസ്ഥാനം: എപ്പോൾ, എങ്ങനെ, എന്ത് അപകടസാധ്യതയോടെ 7. MLOps, വിന്യാസം: ലാബിൽ നിന്ന് ഉൽപ്പാദനത്തിലേക്ക് മോഡൽ മാറ്റുന്നു 8. ഇവലും മോണിറ്ററിംഗും: ഉൽപ്പാദനത്തിൽ മോഡൽ യഥാർത്ഥത്തിൽ എന്താണ് ചെയ്യുന്നതെന്ന് അറിയുക 9. സുരക്ഷയും സ്വകാര്യതയും: AI സിസ്റ്റങ്ങളെ പ്രതിരോധിക്കുന്നു 10. പക്ഷപാതം, ധാർമ്മികത, ചെലവ്: ഉത്തരവാദിത്തവും സുസ്ഥിരവുമായ AI എഞ്ചിനീയറിംഗ് 11. പുനരുൽപാദനക്ഷമതയും എൻഡ്-ടു-എൻഡ് പ്രോജക്റ്റും: എല്ലാം സംയോജിപ്പിക്കുന്നു
യൂണിറ്റ് 11 / 11

പുനരുൽപാദനക്ഷമതയും എൻഡ്-ടു-എൻഡ് പ്രോജക്റ്റും: എല്ലാം സംയോജിപ്പിക്കുന്നു

നേട്ടങ്ങൾ:

  • നാല് തൂണുകൾ (സീഡ് ഫിക്സേഷൻ, ഡാറ്റ പതിപ്പിംഗ്, മീഡിയ ഫ്രീസിംഗ്, പരീക്ഷണ നിരീക്ഷണം) ഉപയോഗിച്ച് പുനരുൽപാദനക്ഷമത ഉറപ്പാക്കാനും ഒരേ ഓട്ടം ആവർത്തിക്കുമ്പോൾ അതേ ഫലം നൽകാനുമുള്ള കഴിവ്
  • മൊഡ്യൂളിൻ്റെ എല്ലാ സ്റ്റോപ്പുകളും (മെട്രിക്‌സ്, ഡാറ്റ, മോഡൽ, എൽഎൽഎം ഘടകങ്ങൾ, എവൽ, ഫെയർനസ്, സെക്യൂരിറ്റി, ഡിസ്ട്രിബ്യൂഷൻ, മോണിറ്ററിംഗ്) എൻഡ്-ടു-എൻഡ് ചെയിനിൽ സംയോജിപ്പിക്കാനുള്ള കഴിവ്
  • ഓരോ സ്റ്റോപ്പിലും നിർണായകമായ തീരുമാനം മനുഷ്യൻ്റെ പക്കലുണ്ടെന്ന് പരിശോധിച്ചുറപ്പിക്കാനും ഓഡിറ്റബിൾ രീതിയിൽ പ്രോജക്റ്റ് രേഖപ്പെടുത്താനുമുള്ള കഴിവ്

ഒരു ML പ്രോജക്റ്റിൻ്റെ ഏറ്റവും വഞ്ചനാപരമായ പരാജയം ഒരു തകർച്ചയല്ല; "ഇനിയും അതേ ഫലം ലഭിക്കുന്നില്ല." മൂന്ന് മാസം മുമ്പ് നിങ്ങൾ ഉൽപ്പാദിപ്പിച്ച മോഡലിൻ്റെ സ്കോർ നിങ്ങൾക്ക് ഇന്ന് പുനർനിർമ്മിക്കാൻ കഴിയുന്നില്ലെങ്കിൽ, നിങ്ങൾ ആ മോഡലിനെ ശരിക്കും നിയന്ത്രിക്കില്ല. ഈ ക്ലോസിംഗ് യൂണിറ്റിൽ, ഞങ്ങൾ പുനരുൽപ്പാദനക്ഷമതയെ ആഴത്തിലാക്കുന്നു: ഒരേ ഇൻപുട്ടുകൾ ഉപയോഗിച്ച് ഒരേ ഫലം വിശ്വസനീയമായി നേടാനും മുഴുവൻ മൊഡ്യൂളും ഒരു എൻഡ്-ടു-എൻഡ് പ്രോജക്റ്റ് അച്ചടക്കത്തിൽ സംയോജിപ്പിക്കാനുമുള്ള കഴിവ്.

എന്തുകൊണ്ട് പുനരുൽപാദനം ബുദ്ധിമുട്ടാണ്

സാധാരണ സോഫ്‌റ്റ്‌വെയറിൽ, ഒരേ കോഡ് ഒരേ ഔട്ട്‌പുട്ട് നൽകുന്നു. ML-ൽ ഫലം നിർണ്ണയിക്കുന്ന നിരവധി വേരിയബിളുകൾ ഉണ്ട്:

  • ക്രമരഹിതം: ഡാറ്റ ഷഫിൾ ചെയ്യൽ, ഭാരം ആരംഭിക്കൽ, ഡാറ്റ വിഭജനം - എല്ലാം ക്രമരഹിതമായി ആശ്രയിക്കുന്നു.
  • ഡാറ്റ: ഒരേ കോഡ് വ്യത്യസ്ത ഡാറ്റ പതിപ്പിനൊപ്പം വ്യത്യസ്ത മോഡൽ നിർമ്മിക്കുന്നു.
  • പരിസ്ഥിതി: ലൈബ്രറി പതിപ്പുകൾ, ഹാർഡ്‌വെയർ (സിപിയു/ജിപിയു), ഓപ്പറേറ്റിംഗ് സിസ്റ്റത്തിന് പോലും ഫലം മാറ്റാൻ കഴിയും.
  • മറഞ്ഞിരിക്കുന്ന കേസ്: സംരക്ഷിക്കപ്പെടാത്ത ഹൈപ്പർപാരാമീറ്റർ, മാനുവൽ പ്രീപ്രോസസിംഗ് ഘട്ടം, ശ്രദ്ധിക്കപ്പെടാത്ത തിരഞ്ഞെടുപ്പ്.

പുനരുൽപ്പാദനക്ഷമത "ഉണ്ടായതിൽ സന്തോഷം" അല്ല, മറിച്ച് ഒരു ശാസ്ത്രീയവും എഞ്ചിനീയറിംഗും അനിവാര്യമാണ്. പുനർനിർമ്മിക്കാൻ കഴിയാത്ത ഒരു ഫലം തെളിയിക്കാൻ കഴിയാത്ത ഒരു അവകാശവാദമാണ്.

പുനരുൽപ്പാദനക്ഷമതയുടെ നാല് തൂണുകൾ

1. ക്രമരഹിതത പരിഹരിക്കുക. എല്ലാ റാൻഡം സീഡുകളും ഒരിടത്ത് സജ്ജമാക്കുക: ഡാറ്റ വിഭജനം, മോഡൽ സമാരംഭിക്കൽ, ഡാറ്റ ഷഫിൾ ചെയ്യൽ. "നിങ്ങൾ ഒരേ ഓട്ടം ആവർത്തിക്കുമ്പോൾ ഒരേ ഫലം" എന്ന ഗ്യാരണ്ടിയുടെ അടിസ്ഥാനം ഫിക്സഡ് സീഡാണ്.

2. ഡാറ്റ പതിപ്പ്. ഏത് ഡാറ്റ പതിപ്പിലാണ് ഓരോ പരീക്ഷണവും നടത്തിയതെന്ന് രേഖപ്പെടുത്തുക (യൂണിറ്റ് 2 ലെ ഡാറ്റ പതിപ്പിംഗ്). "ഏറ്റവും പുതിയ ഡാറ്റ" അവ്യക്തമാണ്; "ഡാറ്റ പതിപ്പ് v3, ഹാഷ് abc123" കൃത്യമാണ്.

3. മീഡിയം ഫ്രീസ് ചെയ്യുക. എല്ലാ ഡിപൻഡൻസികളും അവയുടെ കൃത്യമായ പതിപ്പുകളിലേക്ക് പിൻ ചെയ്യുക (ഉദാ. numpy==1.26.4 പോലെയുള്ള കൃത്യമായ പതിപ്പുകൾ ആവശ്യങ്ങൾ.txt അല്ലെങ്കിൽ ഒരു കണ്ടെയ്‌നർ ഇമേജ്). "ഏറ്റവും പുതിയ പതിപ്പ്" ഒരു ദിവസം എല്ലാം തകർക്കും.

4. എല്ലാം ട്രാക്ക് ചെയ്യുക (പരീക്ഷണ ട്രാക്കിംഗ്). ഓരോ പരീക്ഷണത്തിനും സ്വയമേവ സംരക്ഷിക്കുക: കോഡ് പതിപ്പ് (ജിറ്റ് കമ്മിറ്റ്), ഡാറ്റ പതിപ്പ്, എല്ലാ ഹൈപ്പർപാരാമീറ്ററുകളും മെട്രിക്‌സും ഔട്ട്‌പുട്ട് ഘടനകളും. MLflow, Weights & Biases പോലുള്ള പരീക്ഷണ ട്രാക്കിംഗ് ടൂളുകൾ ഇത് വ്യവസ്ഥാപിതമായി ചെയ്യുന്നു. രജിസ്ട്രേഷൻ കൂടാതെ, "ഏത് ക്രമീകരണമാണ് മികച്ചത്" എന്ന ചോദ്യത്തിന് ഉത്തരം ലഭിച്ചിട്ടില്ല.

മുന്നറിയിപ്പ്: "ഞാൻ പിന്നീട് ഓർക്കും" എന്നതാണ് ഏറ്റവും ചെലവേറിയ തെറ്റ്. രണ്ടാഴ്ച കഴിഞ്ഞ് നിങ്ങൾ ഏത് വിത്ത്, ഏത് ഡാറ്റ, ഏത് ഹൈപ്പർപാരാമീറ്റർ ഉപയോഗിച്ചുവെന്ന് നിങ്ങൾക്ക് ഓർമ്മയില്ല. ഓട്ടോമാറ്റിക് ട്രാക്കിംഗ് മെമ്മറിയെ ആശ്രയിക്കുന്നത് ഇല്ലാതാക്കുന്നു.

ദുർബലമായ സമീപനം / ശക്തമായ സമീപനം

ദുർബലമായത്: "ഞാൻ മികച്ച മോഡൽ കണ്ടെത്തി, അത് നോട്ട്ബുക്കിലാണ്, അതിൻ്റെ സ്കോർ 89% ആണെന്ന് ഞാൻ കരുതുന്നു."

ശക്തമായത്: "പരീക്ഷണ ട്രാക്കിംഗ് ടൂളിൽ #147 റൺ ചെയ്യുക: git commit a3f9c, ഡാറ്റ പതിപ്പ് v3 (hash abc123), സീഡ് 42, എല്ലാ ഹൈപ്പർപാരാമീറ്ററുകളും രജിസ്റ്റർ ചെയ്തു, PR-AUC 0.887 പരീക്ഷിക്കുക. ഞാൻ അതേ കമാൻഡ് വീണ്ടും പ്രവർത്തിപ്പിക്കുമ്പോൾ, എനിക്ക് അതേ ഫലം ബിറ്റ് ബിറ്റ് ആയി ലഭിക്കുന്നു. മോഡൽ registry-യിലെ ഈ റണ്ണിനെ ആശ്രയിച്ചിരിക്കുന്നു."

വ്യത്യാസം: ശക്തമായ സമീപനത്തിൽ ഫലം മെമ്മറിയെ അടിസ്ഥാനമാക്കിയുള്ളതല്ല, മറിച്ച് സ്ഥിരവും നിരീക്ഷിക്കപ്പെടുന്നതുമായ ഒരു ശൃംഖലയിലാണ്. എല്ലാവർക്കും ഓരോ തവണയും ഒരേ ഫലം നൽകാൻ കഴിയും.

എൻഡ്-ടു-എൻഡ് പ്രോജക്റ്റ്: മൊഡ്യൂളിൻ്റെ സംയോജനം

ഇപ്പോൾ മൊഡ്യൂളിനെ ഒരൊറ്റ പ്രോജക്റ്റ് ഫ്ലോയിലേക്ക് സംയോജിപ്പിക്കാം. ഒരു യഥാർത്ഥ ML സിസ്റ്റം ഈ സ്റ്റോപ്പുകളിലൂടെ കടന്നുപോകുന്നു, ഓരോ സ്റ്റോപ്പും മുമ്പത്തേതിൽ നിർമ്മിക്കുന്നു:

  1. പ്രശ്ന നിർവചനം: ഞങ്ങൾ എന്താണ് പരിഹരിക്കുന്നത്, വിജയം അളക്കുന്നത് എങ്ങനെ (യൂണിറ്റ് 3: ശരിയായ മെട്രിക്, ബിസിനസ് സന്ദർഭം). മെട്രിക്കും ത്രെഷോൾഡും തുടക്കം മുതൽ വ്യക്തമാണ്.
  2. ഡാറ്റ പൈപ്പ്ലൈൻ: ശേഖരണം, മൂല്യനിർണ്ണയം, ശുദ്ധീകരണം, ചോർച്ചയില്ലാത്ത പാർട്ടീഷനിംഗ്, പതിപ്പ് (യൂണിറ്റ് 2).
  3. മാതൃകാ വികസനം: പരിശീലനം, അടിസ്ഥാന താരതമ്യം, ക്രോസ്-വാലിഡേഷൻ, ഹാർഡ് സീഡ് (യൂണിറ്റ് 3 + ഈ യൂണിറ്റ്).
  4. LLM ഘടകങ്ങൾ (ബാധകമെങ്കിൽ): RAG (യൂണിറ്റ് 4) കൂടാതെ/അല്ലെങ്കിൽ ഏജൻ്റുകൾ (യൂണിറ്റ് 5); ആവശ്യമെങ്കിൽ ഫൈൻ-ട്യൂണിംഗ് (യൂണിറ്റ് 6).
  5. മൂല്യനിർണ്ണയം: എഡ്ജ്, സെക്യൂരിറ്റി കേസുകൾ ഉള്ള ഇവാൽ ക്ലസ്റ്റർ, LLM സിസ്റ്റങ്ങളിലെ മൾട്ടി-ലെയർ എവൽ (യൂണിറ്റ് 8).
  6. നീതിയും ധാർമിക ഓഡിറ്റും: ഉപഗ്രൂപ്പ് വിശകലനം, മോഡൽ കാർഡ്, വിശദീകരണം (യൂണിറ്റ് 10).
  7. സുരക്ഷാ ഓഡിറ്റ്: പെട്ടെന്നുള്ള കുത്തിവയ്പ്പ്, സ്വകാര്യത, വിതരണ ശൃംഖല (യൂണിറ്റ് 9).
  8. വിതരണം: പാക്കേജിംഗ്, ക്രമേണ വിതരണം, റോൾബാക്ക്, മോഡൽ രജിസ്ട്രി (യൂണിറ്റ് 7).
  9. നിരീക്ഷണം: ത്രീ-ലെയർ മോണിറ്ററിംഗ്, ഡ്രിഫ്റ്റ് അലാറങ്ങൾ (യൂണിറ്റ് 8).
  10. പുനരുൽപാദനക്ഷമത: മുഴുവൻ ശൃംഖലയിലുടനീളം വിത്ത്, ഡാറ്റ പതിപ്പ്, മീഡിയ, പരീക്ഷണ ട്രാക്കിംഗ് (ഈ യൂണിറ്റ്).

ഈ ഒഴുക്കിൽ, ഓരോ സ്റ്റോപ്പിലും AI ഒരു ആക്സിലറേറ്ററും ബ്ലൂപ്രിൻ്റ് ജനറേറ്ററും ആണ്; എന്നാൽ മെട്രിക് സെലക്ഷൻ, ഡാറ്റ തീരുമാനങ്ങൾ, ഫെയർനെസ് മുൻഗണന, വിന്യാസ പരിധി, റിലീസ് അംഗീകാരം - നിർണായക തീരുമാനങ്ങൾ മനുഷ്യൻ്റെ പക്കലുണ്ട്. ഇതാണ് മൊഡ്യൂളിൻ്റെ സാരാംശം.

ഡോക്യുമെൻ്റേഷൻ: ഭാവി നിങ്ങൾക്ക് നന്ദി പറയും

ഒരു നല്ല ML പ്രോജക്റ്റ് സ്വയം രേഖപ്പെടുത്തുന്നു. കുറഞ്ഞത്, ഇനിപ്പറയുന്നവ എഴുതണം: പ്രശ്നവും വിജയ മാനദണ്ഡവും, ഡാറ്റ ഉറവിടവും പതിപ്പും, മോഡൽ തിരഞ്ഞെടുക്കലുകളും ന്യായീകരണങ്ങളും, മൂല്യനിർണ്ണയ ഫലങ്ങൾ (ഉപഗ്രൂപ്പുകൾ ഉൾപ്പെടെ), അറിയപ്പെടുന്ന പരിധികളും അപകടസാധ്യതകളും, വിന്യാസവും വീണ്ടെടുക്കലും നടപടിക്രമം, നിരീക്ഷണ പദ്ധതി. ആറ് മാസത്തിന് ശേഷം പ്രോജക്റ്റിലേക്ക് മടങ്ങുന്ന വ്യക്തിയുടെ (ഒരുപക്ഷേ അത് നിങ്ങളായിരിക്കാം) ഏറ്റവും നല്ല സുഹൃത്താണ് ഈ പ്രമാണം.

മൂന്ന് മിനി കേസുകൾ

കേസ് 1 - ഫലം നഷ്ടപ്പെട്ടു. ഒരു എഞ്ചിനീയർ ഒരു മികച്ച മോഡലിനെ പരിശീലിപ്പിച്ചു, പക്ഷേ അദ്ദേഹം വിത്ത് ശരിയാക്കുകയോ ഡാറ്റ പതിപ്പ് സംരക്ഷിക്കുകയോ ചെയ്തില്ല. അവൻ ജോലി ഉപേക്ഷിച്ചപ്പോൾ, ആ ഫലം ​​പുനർനിർമ്മിക്കാൻ ആർക്കും കഴിഞ്ഞില്ല; മോഡൽ ഒരു "ബ്ലാക്ക് ബോക്സ് ഇതിഹാസം" ആയിത്തീർന്നു, ഒടുവിൽ ആദ്യം മുതൽ നിർമ്മിക്കപ്പെട്ടു. ആഴ്ചകൾ പാഴായി. പാഠം: പുനരുൽപ്പാദിപ്പിക്കാനാവാത്ത ഫലം നിലവിലില്ലാത്ത ഫലമാണ്.

കേസ് 2 - പരിസ്ഥിതി തകർച്ച. ഒരു ടീം ഡിപൻഡൻസികൾ നിശ്ചയിച്ചിരുന്നില്ല. ഒരു ലൈബ്രറി യാന്ത്രികമായി അപ്ഡേറ്റ് ചെയ്യുമ്പോൾ, മോഡൽ ഔട്ട്പുട്ടുകൾ നിശബ്ദമായി മാറുകയും ഉത്പാദനം തടസ്സപ്പെടുകയും ചെയ്തു. പ്രശ്നം കണ്ടുപിടിക്കാൻ ദിവസങ്ങളെടുത്തു. ഡിപൻഡൻസികൾ ഫ്രീസുചെയ്‌ത് നിശ്ചിത പതിപ്പുകൾക്കൊപ്പം കണ്ടെയ്‌നറൈസ് ചെയ്‌തപ്പോൾ, പ്രശ്നം വീണ്ടും ഉണ്ടായില്ല. പാഠം: പരിസ്ഥിതിയെ മരവിപ്പിക്കുക.

കേസ് 3 - നിരീക്ഷണത്തിൻ്റെ ശക്തി. ഓരോ പരീക്ഷണവും ഒരു സംഘം സ്വയമേവ നിരീക്ഷിച്ചു. മൂന്ന് മാസത്തിന് ശേഷം, ഒരു റെഗുലേറ്ററി ഓഡിറ്റിനിടെ, "ഏത് ഡാറ്റ ഉപയോഗിച്ച്, ഏത് ക്രമീകരണങ്ങൾ ഉപയോഗിച്ച്, ഏത് ഗ്രൂപ്പുകളിൽ ഏത് പ്രകടനമാണ് ഇതിന് ലഭിച്ചത്?" എന്ന ചോദ്യത്തിന് അവർ ഉത്തരം നൽകി. മിനിറ്റുകൾക്കുള്ളിൽ പൂർണ്ണമായ റെക്കോർഡിംഗിനൊപ്പം. പരിശോധന തകൃതിയായി നടന്നു. പാഠം: നിരീക്ഷണം ഒരു കംപ്ലയൻസ് ടൂൾ ആണ്, ഒരു എഞ്ചിനീയറിംഗ് മാത്രമല്ല.

പകർത്താവുന്ന ടെംപ്ലേറ്റുകൾ

ഈ ML പ്രോജക്റ്റിനായി ഒരു പുനരുൽപ്പാദനക്ഷമത പരിശോധിക്കുക.- എല്ലാ റാൻഡംനെസ് സീഡുകളും ഉറപ്പിച്ചിട്ടുണ്ടോ (വിഭജിക്കുക, ഇനീഷ്യലൈസ് ചെയ്യുക, ഷഫിൾ ചെയ്യുക) നഷ്‌ടമായ ഓരോ കോളത്തിനും ഇത് എങ്ങനെ ശരിയാക്കാം എന്നതിനെക്കുറിച്ചുള്ള കൃത്യമായ ഘട്ടങ്ങൾ എഴുതുക. പ്രോജക്റ്റ് ഘടന: [വിവരണം]

ഈ എൻഡ്-ടു-എൻഡ് ML പ്രോജക്റ്റിനായി ഒരു പ്ലാൻ അസ്ഥികൂടം നിർമ്മിക്കുക. പ്രശ്നം: [വിവരണം] ഇനിപ്പറയുന്ന സ്റ്റോപ്പുകൾ മൂടുക, ഓരോ സ്റ്റോപ്പിലും ഹ്യൂമൻ തീരുമാനം എവിടെയാണെന്ന് അടയാളപ്പെടുത്തുക: പ്രശ്നം/മെട്രിക്, പൈപ്പ്ലൈൻ, മോഡൽ, (RAG/ഏജൻ്റ്/ഫൈൻ-ട്യൂൺ?), എവൽ, ഫെയർനസ്, സെക്യൂരിറ്റി, വിതരണം, നിരീക്ഷണം, പുനരുൽപാദനക്ഷമത. ഓരോ സ്റ്റോപ്പിനുമുള്ള പ്രധാന അപകടസാധ്യതയും സ്ഥിരീകരണ ഘട്ടവും എഴുതുക.

ഈ പ്രോജക്റ്റിനായി ഒരു സാങ്കേതിക ഡോക്യുമെൻ്റേഷൻ ടെംപ്ലേറ്റ് നിർമ്മിക്കുക. വിഭാഗങ്ങൾ: പ്രശ്നം+വിജയ മാനദണ്ഡം, ഡാറ്റ (ഉറവിടം+പതിപ്പ്), മോഡൽ തിരഞ്ഞെടുക്കലുകൾ+നീതിനിർണ്ണയം, വിലയിരുത്തൽ (ഉപഗ്രൂപ്പുകൾ ഉൾപ്പെടെ), അറിയപ്പെടുന്ന പരിധികൾ+അപകടങ്ങൾ, വിന്യാസം+റോൾബാക്ക്, മോണിറ്ററിംഗ് പ്ലാൻ. ഓരോ വിഭാഗത്തിനും പൂരിപ്പിക്കേണ്ട ഫീൽഡുകൾ ചോദ്യങ്ങളായി നൽകുക.

എൻ്റെ പരീക്ഷണ നിരീക്ഷണ സജ്ജീകരണം പരിശോധിക്കുക: ഓരോ ഓട്ടത്തിലും ഇത് സ്വയമേവ സംരക്ഷിക്കപ്പെടുന്നുണ്ടോ: git കമ്മിറ്റ്, ഡാറ്റ പതിപ്പ്/ഹാഷ്, എല്ലാ ഹൈപ്പർപാരാമീറ്ററുകളും, എല്ലാ അളവുകളും, പരിസ്ഥിതി (ലൈബ്രറി പതിപ്പുകൾ)? ഞാൻ വീണ്ടും അതേ ഓട്ടം ഓടുമ്പോൾ അതേ ഫലം ലഭിക്കുമോ? സജ്ജീകരണം: [വിവരണം]. കുറവുകളും തിരുത്തലുകളും പട്ടികപ്പെടുത്തുക.

പുനർനിർമ്മാണ നിരകളുടെ പട്ടിക

കോളം

എന്താണ് ഉറപ്പിച്ചിരിക്കുന്നത്

വാഹന ഉദാഹരണം

ക്രമരഹിതത

എല്ലാ വിത്തുകൾ

വിത്ത് ക്രമീകരണം

ഡാറ്റ

ഡാറ്റ പതിപ്പ്/ഹാഷ്

ഡിവിസി

പരിസ്ഥിതി

ലൈബ്രറി പതിപ്പുകൾ

ആവശ്യകതകൾ പിൻ, ഡോക്കർ

നിരീക്ഷണം

കോഡ്+ഡാറ്റ+ക്രമീകരണം+മെട്രിക്

MLflow, W&B

സാധാരണ തെറ്റുകൾ

  • വിത്ത് ശരിയാക്കുന്നില്ല. ഫലം ആവർത്തിക്കാനാവില്ല.
  • ഡാറ്റ പതിപ്പ് സംരക്ഷിക്കുന്നില്ല. "എന്ത് ഡാറ്റ ഉപയോഗിച്ച്?" ഉത്തരം കിട്ടാതെ അവശേഷിക്കുന്നു.
  • ആസക്തികളെ മരവിപ്പിക്കുന്നതല്ല. ഒരു അപ്ഡേറ്റ് നിശബ്ദമായി എല്ലാം തകർക്കും.
  • പരീക്ഷണങ്ങൾ ഓർമ്മയിലേക്ക് വിടുന്നു. രണ്ടാഴ്ച കഴിഞ്ഞിട്ടും ഒന്നും ഓർമയില്ല.
  • നിർണായക തീരുമാനങ്ങൾ ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസിന് വിടുന്നു. അളവുകൾ, നീതി, വിതരണ തീരുമാനങ്ങൾ എന്നിവ ജനങ്ങളുടെ പക്കലായിരിക്കണം.
  • ഡോക്യുമെൻ്റേഷൻ മാറ്റിവയ്ക്കുന്നു. ഭാവി ടീമും (നിങ്ങളും) വില നൽകുന്നു.

ചുരുക്കത്തിൽ

പുനരുൽപ്പാദനക്ഷമത ഗുരുതരമായ ML എഞ്ചിനീയറിംഗിൻ്റെ ഒപ്പാണ്: പുനർനിർമ്മിക്കാനാവാത്ത ഫലം തെളിയിക്കാനാവാത്ത അവകാശവാദമാണ്. ഇത് നാല് നിരകളുമായാണ് വരുന്നത് - ക്രമരഹിതത പരിഹരിക്കുക, പതിപ്പ് ഡാറ്റ, ഫ്രീസ് എൻവയോൺമെൻ്റ്, ഓരോ പരീക്ഷണവും ട്രാക്ക് ചെയ്യുക. ഒരു എൻഡ്-ടു-എൻഡ് പ്രോജക്റ്റ് ഈ മൊഡ്യൂളിൻ്റെ എല്ലാ സ്റ്റോപ്പുകളും (മെട്രിക്, ഡാറ്റ, മോഡൽ, LLM ഘടകങ്ങൾ, എവൽ, ഫെയർനസ്, സെക്യൂരിറ്റി, ഡിസ്ട്രിബ്യൂഷൻ, മോണിറ്ററിംഗ്) പരസ്പരം ബന്ധിപ്പിച്ച ഒരു ശൃംഖലയിൽ സംയോജിപ്പിക്കുന്നു; ഓരോ സ്റ്റോപ്പിലും ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് ഒരു ആക്സിലറേറ്ററാണ്, എന്നാൽ നിർണായകമായ തീരുമാനങ്ങൾ മനുഷ്യൻ്റെ പക്കലുണ്ട്. എല്ലാം രേഖപ്പെടുത്തുക - ഭാവി ടീമിനും ഓഡിറ്റിനും. മൊഡ്യൂളിലുടനീളം നിങ്ങൾ പഠിക്കുന്ന എല്ലാ കാര്യങ്ങളും നിലനിർത്തുന്ന ചട്ടക്കൂടാണ് ഈ അച്ചടക്കം.

ആപ്ലിക്കേഷൻ ടാസ്ക്

നാല് പുനരുൽപ്പാദന തൂണുകൾക്കെതിരെ ഒരു ML പ്രോജക്റ്റ് പരിശോധിക്കുക: വിത്തുകൾ മാറ്റമില്ലാത്തതാണോ, ഡാറ്റ പതിപ്പിച്ചതാണോ, പരിസ്ഥിതി മരവിച്ചിട്ടുണ്ടോ, പരീക്ഷണങ്ങൾ ട്രാക്ക് ചെയ്തിട്ടുണ്ടോ? നഷ്‌ടമായ ഏതെങ്കിലും നിരകൾ പരിഹരിച്ച് ഒരേ റൺ രണ്ടുതവണ പ്രവർത്തിപ്പിക്കാനും ഒരേ ഫലം നേടാനും കഴിയുമെന്ന് തെളിയിക്കുക. തുടർന്ന് ഒരു പേജിൽ പ്രോജക്റ്റിൻ്റെ എൻഡ്-ടു-എൻഡ് ഫ്ലോ (10 സ്റ്റോപ്പുകൾ) ഔട്ട്പുട്ട് ചെയ്ത് ഓരോ സ്റ്റോപ്പിലും "മനുഷ്യൻ്റെ തീരുമാനം എവിടെയാണ്" എന്ന് അടയാളപ്പെടുത്തുക. അവസാനമായി, ഒരു ചെറിയ സാങ്കേതിക ഡോക്യുമെൻ്റേഷൻ ഡ്രാഫ്റ്റ് എഴുതുക.

ചെക്ക്ലിസ്റ്റ്

  • [ ] എല്ലാ ക്രമരഹിത വിത്തുകളും ഉറപ്പിച്ചു.
  • [ ] ഓരോ പരീക്ഷണത്തിലും ഡാറ്റ പതിപ്പ്/ഹാഷ് രേഖപ്പെടുത്തുന്നു.
  • [ ] ആശ്രിതത്വങ്ങൾ ദൃഢമായ പതിപ്പുകളിലേക്ക് മരവിപ്പിച്ചിരിക്കുന്നു (പിൻ/കണ്ടെയ്‌നർ).
  • [ ] ഓരോ പരീക്ഷണവും സ്വയമേവ നിരീക്ഷിക്കപ്പെടുന്നു (കോഡ്+ഡാറ്റ+ക്രമീകരണം+മെട്രിക്).
  • [ ] ഞാൻ ഒരേ ഓട്ടം ആവർത്തിക്കുമ്പോൾ, എനിക്ക് അതേ ഫലം ലഭിക്കും.
  • [ ] അവസാനം മുതൽ അവസാനം വരെയുള്ള ഒഴുക്കിൽ നിർണായക തീരുമാനങ്ങൾ എടുക്കുന്നത് മനുഷ്യരാണെന്ന് ഞാൻ പരിശോധിച്ചുറപ്പിക്കുകയും രേഖപ്പെടുത്തുകയും ചെയ്തു.

മൊഡ്യൂൾ പരീക്ഷ

1. ഒരു ML എഞ്ചിനീയർ എന്ന നിലയിൽ, വർക്ക്ഫ്ലോയിൽ ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് സ്ഥാപിക്കുമ്പോൾ ഏറ്റവും മികച്ച സമീപനം ഏതാണ്?

  • A) അപകടസാധ്യത കുറഞ്ഞ ബിസിനസ്സുകളിൽ AI ഒരു ആക്സിലറേറ്ററാണ്; മെട്രിക്‌സ്, ഡാറ്റ, പ്രൊഡക്ഷൻ തുടങ്ങിയ നിർണായക തീരുമാനങ്ങൾ സാധൂകരിക്കപ്പെടുകയും മനുഷ്യന് വിട്ടുകൊടുക്കുകയും ചെയ്യുന്നു ✔
  • B) AI ഔട്ട്‌പുട്ടുകൾ മികച്ചതായി കാണപ്പെടുന്നിടത്തോളം, സ്ഥിരീകരണത്തിൻ്റെ ആവശ്യമില്ല
  • സി) മോഡൽ നിർമ്മിക്കാനുള്ള തീരുമാനം ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസിന് വിടുന്നത് സമയം ലാഭിക്കുന്നു.
  • ഡി) ടെക്‌സ്‌റ്റ് എഴുതാൻ മാത്രമേ ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് ഉപയോഗപ്രദമാകൂ, ഇതിന് ഡാറ്റയുമായും മോഡൽ വർക്കുമായും യാതൊരു ബന്ധവുമില്ല

വിവരണം: കോഡ്, ഡാറ്റ ഡൈജസ്റ്റുകൾ, ഡോക്യുമെൻ്റുകൾ എന്നിവ പോലുള്ള അപകടസാധ്യത കുറഞ്ഞതും എളുപ്പത്തിൽ പരിശോധിച്ചുറപ്പിച്ചതുമായ ജോലികൾക്കുള്ള ശക്തമായ ആക്സിലറേറ്ററാണ് AI; എന്നിരുന്നാലും, പണം, രഹസ്യസ്വഭാവം, നിയമപരമായ ബാധ്യത എന്നിവയെ ബാധിക്കുന്ന തീരുമാനങ്ങളുടെ ഉത്തരവാദിത്തം, മെട്രിക് സെലക്ഷൻ, ഏത് ഡാറ്റ പരിശീലനത്തിലേക്ക് പോകുന്നു, മോഡൽ ഉൽപ്പാദിപ്പിക്കൽ എന്നിവ, യോഗ്യതയുള്ള എഞ്ചിനീയറിനും ടീമിനുമാണ്. ഓരോ ഔട്ട്‌പുട്ടും പരിശോധിച്ചുറപ്പിക്കാതെ ഉപയോഗിക്കാൻ പാടില്ല.

2. ഒരു ഡാറ്റ പൈപ്പ്ലൈനിൻ്റെ തുടക്കത്തിൽ സ്കീമ മൂല്യനിർണ്ണയം സ്ഥാപിക്കുന്നത് എന്തുകൊണ്ട്?

  • എ) കാരണം ഇത് മോഡലിൻ്റെ കൃത്യത നേരിട്ട് വർദ്ധിപ്പിക്കുന്നു
  • ബി) കാരണം ഇത് ഡാറ്റ പതിപ്പ് അനാവശ്യമാക്കുന്നു
  • സി) കാരണം ഇത് കേടായ ഡാറ്റ ഏറ്റവും നേരത്തെയും വിലകുറഞ്ഞതുമായ ഘട്ടത്തിൽ പിടിക്കുകയും അടുത്ത ഘട്ടങ്ങളിലേക്ക് ചോരുന്നത് തടയുകയും ചെയ്യുന്നു ✔
  • ഡി) കാരണം ഇത് ലേബലിംഗിൻ്റെ ആവശ്യകത ഇല്ലാതാക്കുന്നു

വിശദീകരണം: നേരത്തെയുള്ള കേടായ ഡാറ്റ പിടിക്കപ്പെടുന്നു, അത് പരിഹരിക്കുന്നതിന് വിലകുറഞ്ഞതാണ്. സ്‌കീമ മൂല്യനിർണ്ണയം, ലൈനിൻ്റെ തുടക്കത്തിൽ പ്രതീക്ഷിക്കുന്ന തരത്തിനും ശ്രേണിക്കും പുറത്തുള്ള ഡാറ്റ നിരസിച്ചുകൊണ്ട് (ഉദാ. യൂണിറ്റ് മാറ്റത്തിനൊപ്പം വില 100 മടങ്ങ് മാറുന്നത്) പരിശീലനത്തിലേക്കോ ഉൽപ്പാദനത്തിലേക്കോ നിശബ്ദമായി ചോർന്നൊലിക്കുന്ന അഴിമതി ഡാറ്റ തടയുന്നു; ഉൽപ്പാദനത്തിൽ പിടിക്കപ്പെട്ട അതേ പിഴവ് പലമടങ്ങ് ചെലവേറിയതാണ്.

3. സമയം (ടൈം സീരീസ്) ഉൾപ്പെടുന്ന ഒരു പ്രശ്നത്തിൽ പരിശീലനവും പരിശോധനയും ആയി ഡാറ്റയെ വിഭജിക്കുമ്പോൾ ശരിയായ സമീപനം എന്താണ്?

  • എ) ക്രമരഹിതമായ വിഭജനം ഉപയോഗിക്കുന്നു, കാരണം ഇത് എല്ലായ്പ്പോഴും മികച്ച രീതിയാണ്
  • ബി) താൽക്കാലിക വിഭജനം ഉപയോഗിക്കുന്നു: ഭൂതകാലത്തെ പരിശീലിപ്പിച്ച് ഭാവിയിൽ പരീക്ഷിച്ചുകൊണ്ട് ചോർച്ച തടയുക ✔
  • സി) പരിശീലനമായും പരിശോധനയായും എല്ലാ ഡാറ്റയും ഉപയോഗിക്കുന്നു
  • ഡി) പരിശീലനത്തിന് മുമ്പ് സ്കെയിലിംഗ് പാരാമീറ്ററുകളിലേക്ക് ടെസ്റ്റ് ഡാറ്റ സംയോജിപ്പിക്കുക

വിശദീകരണം: സമയ ശ്രേണിയിലെ ക്രമരഹിതമായ വിഭജനം മോഡലിന് ഒരു 'ഭാവി കാണാനുള്ള' നേട്ടം നൽകുന്നു, അത് ഉൽപ്പാദനത്തിൽ ഒരിക്കലും സംഭവിക്കില്ല, കൂടാതെ അളവുകൾ കൃത്രിമമായി വർദ്ധിപ്പിക്കുകയും ചെയ്യുന്നു (താൽക്കാലിക ചോർച്ച). ശരിയായത് താൽക്കാലിക വിഭജനമാണ്: ഭൂതകാലത്തെ പരിശീലിപ്പിക്കുക, ഭാവിയിൽ പരീക്ഷിക്കുക. ഇത് ഉൽപ്പാദനത്തിൽ നിലനിർത്തുന്ന യഥാർത്ഥ പ്രകടനത്തെ അളക്കുന്നു.

4. 1.5% പോസിറ്റീവ് ക്ലാസ് റേറ്റ് ഉള്ള ഒരു തട്ടിപ്പ് കണ്ടെത്തൽ മോഡലിൽ കൃത്യത തെറ്റിദ്ധരിപ്പിക്കുന്നത് എന്തുകൊണ്ട്?

  • എ) കാരണം അസന്തുലിതമായ ഡാറ്റയിൽ കൃത്യത എപ്പോഴും കുറവാണ്
  • ബി) കാരണം റിഗ്രഷൻ പ്രശ്നങ്ങളിൽ മാത്രമേ കൃത്യത ഉപയോഗിക്കാനാകൂ
  • സി) കാരണം കൃത്യത കണക്കുകൂട്ടലിന് വളരെയധികം പ്രോസസ്സിംഗ് പവർ ആവശ്യമാണ്
  • D) ഭൂരിപക്ഷ വിഭാഗത്തെ പ്രവചിക്കുന്ന ഒരു തുച്ഛമായ മോഡൽ പോലും വളരെ കൃത്യതയുള്ളതാണ്, അങ്ങനെ യഥാർത്ഥ വിജയം മറയ്ക്കുന്നു ✔

വിശദീകരണം: അസന്തുലിതമായ ഡാറ്റയിൽ, 'എല്ലാം നെഗറ്റീവായി വിളിക്കുക' എന്ന് പറയുന്ന ഒരു അടിസ്ഥാന മോഡലിന് പോലും ഏകദേശം 98.5% കൃത്യത ലഭിക്കുന്നു, പക്ഷേ ഒരു തട്ടിപ്പ് പോലും പിടിക്കപ്പെടില്ല. അതിനാൽ, അസന്തുലിതമായ വർഗ്ഗീകരണത്തിൽ, കൃത്യതയ്ക്ക് പകരം കൃത്യത, തിരിച്ചുവിളിക്കൽ, F1 അല്ലെങ്കിൽ PR-AUC ഉപയോഗിക്കുന്നു, കൂടാതെ ഓരോ മെട്രിക്കും അടിസ്ഥാന മാതൃക അനുസരിച്ച് വ്യാഖ്യാനിക്കപ്പെടുന്നു.

5. ഒരു മോഡലിൻ്റെ മെട്രിക്കിനെക്കുറിച്ച് പറയുമ്പോൾ അടിസ്ഥാന താരതമ്യം അനിവാര്യമായിരിക്കുന്നത് എന്തുകൊണ്ട്?

  • എ) കാരണം അടിസ്ഥാന മോഡൽ എല്ലായ്പ്പോഴും യഥാർത്ഥ മോഡലിനേക്കാൾ മികച്ചതാണ്
  • ബി) കാരണം ഒരു മെട്രിക് അർത്ഥവത്താണോ അല്ലയോ എന്നത് ഒരു ലളിതമായ അടിസ്ഥാന മോഡലുമായി താരതമ്യപ്പെടുത്തുമ്പോൾ മാത്രമല്ല ✔
  • സി) അടിസ്ഥാന മോഡൽ ക്രോസ്-വാലിഡേഷൻ ആവശ്യമില്ലാത്തതിനാൽ
  • ഡി) എല്ലാ റിപ്പോർട്ടിലും അടിസ്ഥാന മാതൃക നിയമപരമായി ആവശ്യമാണ്

വിശദീകരണം: ഒരു മെട്രിക് സ്വയം നല്ലതോ ചീത്തയോ അല്ല; അടിസ്ഥാന മാതൃകയനുസരിച്ച് ഇത് നല്ലതോ ചീത്തയോ ആണ്. '85% ശരി' എന്ന വാക്യത്തിൻ്റെ അർത്ഥം അടിസ്ഥാന മോഡലിന് ഇതിനകം 84% ലഭിച്ചാൽ ഏതാണ്ട് വിലപ്പോവില്ല, 50% കിട്ടിയാൽ പെർഫെക്റ്റ്. ഒരു താരതമ്യ ആങ്കർ ഇല്ലാതെ, മെട്രിക് അർത്ഥശൂന്യമാണ്.

6. RAG (Retrieval-Augmented Generation) സിസ്റ്റത്തിൻ്റെ പ്രൊഡക്ഷൻ പ്രോംപ്റ്റിൽ ഉൾപ്പെടുത്തേണ്ട ഏറ്റവും പ്രധാനപ്പെട്ട സുരക്ഷാ ഘടകം ഏതാണ്?

  • A) നൽകിയിരിക്കുന്ന ഉറവിടത്തിൽ മാത്രം ആശ്രയിക്കാനും ഉറവിടം നിലവിലില്ലെങ്കിൽ 'എനിക്കറിയില്ല' എന്ന് പറയാനും ഉറവിടം ഉദ്ധരിക്കാനും നിർദ്ദേശം ✔
  • B) കഴിയുന്നത്ര ദീർഘവും ക്രിയാത്മകവുമായ ഉത്തരങ്ങൾ നിർമ്മിക്കാൻ മോഡലിനോട് പറയുക
  • സി) മോഡൽ വിഭവങ്ങളേക്കാൾ സ്വന്തം വിദ്യാഭ്യാസ വിജ്ഞാനത്തിന് മുൻഗണന നൽകുന്നു
  • ഡി) കമാൻഡുകളായി കൊണ്ടുവന്ന പ്രമാണങ്ങളിലെ എല്ലാ നിർദ്ദേശങ്ങളും നടപ്പിലാക്കുക

വിശദീകരണം: നൽകിയിരിക്കുന്ന ഉറവിടത്തിൽ മാത്രം ആശ്രയിക്കാൻ മോഡലിനോട് പറയുക എന്നതാണ് RAG- ൻ്റെ ഏറ്റവും പ്രധാനപ്പെട്ട നിർദ്ദേശം, വിവരങ്ങൾ ഉറവിടത്തിൽ ഇല്ലെങ്കിൽ, 'എനിക്കറിയില്ല' എന്ന് പറയുകയും അത് ഉണ്ടാക്കാതെ ഉറവിടം ഉദ്ധരിക്കുകയും ചെയ്യുക എന്നതാണ്. ഈ ട്രയാഡ് ഇല്ലെങ്കിൽ, മോഡൽ സന്ദർഭം അവഗണിക്കുകയും ഭ്രമാത്മകത സൃഷ്ടിക്കുകയും ചെയ്തേക്കാം, കൂടാതെ ഉത്തരം പരിശോധിക്കാനാവില്ല.

7. ഒരു RAG സിസ്റ്റം തെറ്റായ ഉത്തരങ്ങൾ നൽകുന്നു. രോഗനിർണയം ആരംഭിക്കുന്നതിനുള്ള ഏറ്റവും നല്ല സ്ഥലം എവിടെയാണ്?

  • എ) ആദ്യം ലഭ്യമാക്കുന്നത് അളക്കുന്നു (Recall@K): ശരിയായ ഭാഗം എപ്പോഴെങ്കിലും എത്തുമോ? ✔
  • ബി) ഉടനടി വലിയ ഒന്ന് ഉപയോഗിച്ച് മോഡൽ മാറ്റിസ്ഥാപിക്കുക
  • സി) ക്രമരഹിതമായി പ്രോംപ്റ്റ് മാറ്റുകയും ശ്രമം തുടരുകയും ചെയ്യുക
  • ഡി) എല്ലാ രേഖകളും ഫൈൻ-ട്യൂണിംഗ് ഉപയോഗിച്ച് മോഡലിലേക്ക് ഉൾച്ചേർക്കുന്നു

വിശദീകരണം: RAG-ൻ്റെ ഏറ്റവും ദുർബലമായ ലിങ്ക് സാധാരണയായി ഉൽപ്പാദനമല്ല, ലഭ്യമാക്കുന്നതാണ്. ശരിയായ ഭാഗം ഒരിക്കലും കൊണ്ടുവന്നില്ലെങ്കിൽ, എത്ര പ്രോംപ്റ്റ് മെച്ചപ്പെടുത്തിയാലും മോഡലിന് ആ വിവരങ്ങൾ നൽകാൻ കഴിയില്ല. അതിനാൽ, ശരിയായ ഭാഗം വന്നിട്ടുണ്ടോ എന്നറിയാൻ ആദ്യം Recall@K അളക്കുന്നു; ലഭിക്കുന്നത് നല്ലതാണെങ്കിൽ, ഉൽപ്പാദനവും പ്രോംപ്റ്റും പരിശോധിക്കും.

8. ഒരു ഏജൻ്റിന് ഒരു ഉപകരണം നൽകുമ്പോൾ മനുഷ്യൻ്റെ അംഗീകാരത്തിന് പിന്നിൽ എന്ത് പ്രവർത്തനങ്ങൾ നടത്തണം?

  • എ) ഒന്നുമില്ല; എല്ലാ പ്രവർത്തനങ്ങളും സ്വയംഭരണപരമായി നിർവഹിക്കാൻ ഏജൻ്റിന് കഴിയണം
  • B) ഡാറ്റ റീഡിംഗ്, സെർച്ച് എന്നിവ പോലുള്ള റിവേഴ്‌സിബിൾ പ്രവർത്തനങ്ങൾ മാത്രം
  • C) പണം കൈമാറ്റം, ഇല്ലാതാക്കൽ, അയയ്‌ക്കൽ ✔ തുടങ്ങിയ മാറ്റാനാവാത്ത അല്ലെങ്കിൽ ഉയർന്ന സ്വാധീനം ചെലുത്തുന്ന പ്രവർത്തനങ്ങൾ
  • ഡി) കണക്കുകൂട്ടലുകൾ മാത്രം ഉൾപ്പെടുന്ന പ്രവർത്തനങ്ങൾ

വിവരണം: റിസ്ക് ലെവൽ അനുസരിച്ച് പ്രവർത്തനങ്ങൾ വേർതിരിച്ചിരിക്കുന്നു. വായന, തിരയൽ, കണക്കുകൂട്ടൽ, ഡ്രാഫ്റ്റുകൾ സൃഷ്ടിക്കൽ തുടങ്ങിയ വീണ്ടെടുക്കാവുന്ന ജോലികൾ സ്വയംഭരണപരമായി ചെയ്യാൻ കഴിയും; എന്നിരുന്നാലും, പണം കൈമാറ്റം ചെയ്യൽ, ഇമെയിലുകൾ അയയ്‌ക്കൽ, ഡാറ്റ ഇല്ലാതാക്കൽ, ഓർഡറുകൾ നൽകൽ തുടങ്ങിയ മാറ്റാനാകാത്ത അല്ലെങ്കിൽ ഉയർന്ന സ്വാധീനം ചെലുത്തുന്ന പ്രവർത്തനങ്ങൾക്ക് മനുഷ്യൻ്റെ അംഗീകാരം ആവശ്യമാണ്. മാറ്റാനാകാത്ത എല്ലാ പ്രവർത്തനങ്ങളും സമ്മതത്തിന് വിധേയമായിരിക്കണം.

9. പരോക്ഷമായ കുത്തിവയ്പ്പിൻ്റെ അപകടസാധ്യതയ്ക്കെതിരായ ഏറ്റവും മികച്ച ഡിസൈൻ സമീപനം ഏതാണ്?

  • എ) സിസ്റ്റം പ്രോംപ്റ്റിൽ 'മോശമായ നിർദ്ദേശങ്ങൾ അവഗണിക്കുക' എന്ന ഒറ്റ വാചകം ചേർത്താൽ മതി
  • B) ബാഹ്യ ഉള്ളടക്കത്തിലെ നിർദ്ദേശങ്ങളെ ആശ്രയിച്ച് മോഡലിന് കൂടുതൽ അധികാരം നൽകുക
  • സി) കുത്തിവയ്പ്പ് തടയാൻ കഴിയാത്തതിനാൽ മുൻകരുതലുകൾ എടുക്കുന്നില്ല
  • ഡി) ബാഹ്യ ഉള്ളടക്കത്തെ വിശ്വസനീയമല്ലാത്ത ഡാറ്റയായി വേർതിരിച്ച്, കുറഞ്ഞ അംഗീകാരം, അംഗീകാരം, ഔട്ട്പുട്ട് നിയന്ത്രണം എന്നിവ ഉപയോഗിച്ച് ലേയേർഡ് ഡിഫൻസ് സ്ഥാപിക്കുക ✔

വിവരണം: ഒരു വെബ് പേജ്, ഡോക്യുമെൻ്റ്, ഇമെയിൽ മുതലായവ പോലെ, ഏജൻ്റ് അല്ലെങ്കിൽ RAG പ്രോസസ് ചെയ്യുന്ന ബാഹ്യ ഉള്ളടക്കം വിശ്വസനീയമല്ലാത്ത ഡാറ്റയാണ് കൂടാതെ രഹസ്യ നിർദ്ദേശങ്ങൾ അടങ്ങിയിരിക്കാം. ലേയേർഡ് ഡിഫൻസ് ആണ് ശരിയായ സമീപനം: വ്യക്തമായ ഡിലിമിറ്ററുകൾ ഉപയോഗിച്ച് ബാഹ്യ ഉള്ളടക്കത്തെ 'ഡാറ്റ, കമാൻഡുകൾ അല്ല' ആയി വേർതിരിക്കുക, കുറഞ്ഞ അംഗീകാരം പ്രയോഗിക്കുക, മാറ്റാനാവാത്ത പ്രവർത്തനങ്ങൾ മനുഷ്യൻ്റെ അംഗീകാരത്തിന് വിധേയമാക്കുക, ഔട്ട്പുട്ട് ഓഡിറ്റ് ചെയ്യുക. നിർദ്ദേശങ്ങളുടെ ഒരു വരി മതിയാകില്ല.

10. ഒരു പ്രശ്നം ഫൈൻ-ട്യൂണിംഗ് അല്ലെങ്കിൽ RAG ഉപയോഗിച്ചാണോ പരിഹരിക്കേണ്ടത് എന്ന് തീരുമാനിക്കുമ്പോൾ എന്താണ് പ്രധാന വ്യത്യാസം?

  • A) വിവര പ്രശ്നങ്ങൾ RAG ഉപയോഗിച്ച് നന്നായി പരിഹരിക്കപ്പെടുന്നു, പെരുമാറ്റം/ഫോർമാറ്റ് പ്രശ്നങ്ങൾ ഫൈൻ-ട്യൂണിംഗ് ഉപയോഗിച്ച് നന്നായി പരിഹരിക്കപ്പെടും ✔
  • ബി) എല്ലാ പ്രശ്‌നങ്ങളും എല്ലായ്പ്പോഴും ഫൈൻ ട്യൂണിംഗ് വഴി പരിഹരിക്കണം
  • സി) RAG കോഡ് സൃഷ്ടിക്കാൻ മാത്രമാണ് ഉപയോഗിക്കുന്നത്, ഫൈൻ ട്യൂണിംഗ് വിവർത്തനത്തിന് മാത്രമാണ് ഉപയോഗിക്കുന്നത്
  • ഡി) ഫൈൻ-ട്യൂണിംഗ് എല്ലായ്പ്പോഴും RAG-നേക്കാൾ വിലകുറഞ്ഞതും വേഗത്തിലുള്ളതുമായ അപ്ഡേറ്റ് ചെയ്യാവുന്നതാണ്

വിശദീകരണം: ഫൈൻ-ട്യൂണിംഗ് മോഡൽ പുതിയ വിവരങ്ങൾ പഠിപ്പിക്കുന്നതിൽ ദുർബലവും അപകടകരവുമാണ്; എന്നാൽ പെരുമാറ്റം, ഫോർമാറ്റ്, ടോൺ, ശൈലി എന്നിവ പഠിപ്പിക്കുന്നതിൽ ശക്തനാണ്. 'മോഡൽ കമ്പനിക്ക് ഞങ്ങളുടെ ഡാറ്റ അറിയില്ല' എന്നത് ഒരു വിവര പ്രശ്‌നമാണ്, ഇത് RAG-ൻ്റേതാണ്. 'മോഡൽ എല്ലായ്പ്പോഴും ഞങ്ങളുടെ കർശനമായ ഫോർമാറ്റിൽ ഔട്ട്‌പുട്ട് ചെയ്യട്ടെ' എന്നത് ഒരു പെരുമാറ്റ പ്രശ്‌നവും മികച്ച ട്യൂണിംഗിനുള്ള സ്ഥാനാർത്ഥിയുമാണ്. കൂടാതെ, ഫൈൻ-ട്യൂണിംഗിന് മുമ്പ് പ്രോംപ്റ്റും കുറച്ച് ഷോട്ടുകളും ഉപയോഗിക്കണം.

11. ഒരു പുതിയ മോഡൽ ഉൽപ്പാദിപ്പിക്കുമ്പോൾ സുരക്ഷിതമായി വിന്യാസം ചെയ്യേണ്ടത് ഏതാണ്?

  • എ) ടെസ്റ്റിംഗിൽ മോഡൽ മികച്ചതാണെങ്കിൽ, അത് നേരിട്ട് 100% ട്രാഫിക്കിലേക്ക് തുറക്കുക
  • ബി) വിന്യാസത്തിന് ശേഷം നിരീക്ഷണം സജ്ജീകരിക്കുന്നില്ല
  • സി) ഘട്ടം ഘട്ടമായുള്ള വിന്യാസവും (നിഴൽ/കാനറി) മുൻകൂട്ടി പരിശോധിച്ച റോൾബാക്ക് പ്ലാനും ✔
  • ഡി) മൂല്യനിർണ്ണയ പരിധി പാലിച്ചില്ലെങ്കിൽ പോലും മോഡൽ പ്രസിദ്ധീകരിക്കൽ

വിശദീകരണം: പുതിയ മോഡൽ എല്ലാ ട്രാഫിക്കിലേക്കും നേരിട്ട് തുറക്കുന്നത് അപകടകരമാണ്; തെറ്റാണെങ്കിൽ എല്ലാവരെയും ബാധിക്കും. ശരിയായ കാര്യം, ഇത് ക്രമാനുഗതമായ വിതരണമാണ് (ഷാഡോ, കാനറി) കൂടാതെ എല്ലാ വിതരണത്തിനും പരീക്ഷിച്ച റോൾബാക്ക് പ്ലാൻ ഉണ്ട്. ഒരു ക്ലാബാക്ക് പ്ലാൻ ഇല്ലാതെ ഒരു വിതരണം പൂർത്തിയാകില്ല; മോഡൽ ഉൽപ്പാദനത്തിൽ അപ്രതീക്ഷിതമായി പ്രവർത്തിക്കുമ്പോൾ മിനിറ്റുകൾക്കുള്ളിൽ മുമ്പത്തെ പതിപ്പിലേക്ക് മടങ്ങാൻ കഴിയുന്നത് ഉപയോക്താവിനെ സംരക്ഷിക്കുന്നു.

12. ഒരു ML മോഡൽ എങ്ങനെയാണ് നിർമ്മാണത്തിൽ 'നിശബ്ദമായി' പരാജയപ്പെടുന്നത്, ഇത് പിടിക്കാനുള്ള വഴി എന്താണ്?

  • എ) മോഡൽ തകരുന്നു; സെർവർ ലോഗുകൾ ഇത് കാണിക്കുന്നു
  • ബി) തെറ്റുകൾ വരുത്താതെ തെറ്റായ പ്രവചനങ്ങൾ സൃഷ്ടിക്കുന്നതിലൂടെ; ✔ ഇത് പ്രവർത്തന, ഇൻപുട്ട്, ഔട്ട്പുട്ട് ലേയേർഡ് മോണിറ്ററിംഗ് ക്യാപ്‌ചർ ചെയ്യുന്നു
  • സി) മോഡലിന് ഒരിക്കലും നിശബ്ദമായി പരാജയപ്പെടാൻ കഴിയില്ല, എല്ലായ്പ്പോഴും അലാറം
  • ഡി) ഏതെങ്കിലും തരംതാഴ്ത്തൽ പിടിപെടാൻ ലേറ്റൻസി നിരീക്ഷിച്ചാൽ മതി

വിശദീകരണം: തകരുകയോ പിശകുകൾ നൽകുകയോ ചെയ്യാതെ തെറ്റായ പ്രവചനങ്ങൾ സൃഷ്ടിച്ചുകൊണ്ട് മോഡൽ പരാജയപ്പെടാം; ഇതിൻ്റെ പ്രധാന കാരണം ഡാറ്റ ഡ്രിഫ്റ്റും കൺസെപ്റ്റ് ഡ്രിഫ്റ്റുമാണ്. പ്രവർത്തന അളവുകൾ (ലേറ്റൻസി, പിശക് നിരക്ക്) നിരീക്ഷിക്കുന്നത് മാത്രം പോരാ; ഇൻപുട്ട് വിതരണവും ഔട്ട്പുട്ട്/പ്രവചന വിതരണവും നിരീക്ഷിക്കണം. യഥാർത്ഥ ഫലം വൈകുകയാണെങ്കിൽ ഇൻപുട്ട് ഡ്രിഫ്റ്റ് നേരത്തെ മുന്നറിയിപ്പ് നൽകുന്നു.

13. ഒരു LLM സിസ്റ്റം മൂല്യനിർണ്ണയം ചെയ്യുന്നതിന് LLM-as-judge ഉപയോഗിക്കുമ്പോൾ എന്ത് തത്വമാണ് അത്യന്താപേക്ഷിതമായത്?

  • എ) LLM-റഫറി എപ്പോഴും ശരിയാണ്, മനുഷ്യ പരിശോധന അനാവശ്യമാണ്
  • B) ഉത്തര ദൈർഘ്യം മാത്രം അടിസ്ഥാനമാക്കി റഫറി തീരുമാനമെടുക്കണം.
  • സി) റഫറിമാരെ ഉപയോഗിക്കുമ്പോൾ നിയമങ്ങളെ അടിസ്ഥാനമാക്കിയുള്ള നിയന്ത്രണങ്ങളും മാനുഷിക മൂല്യനിർണ്ണയവും പൂർണ്ണമായും ഉപേക്ഷിക്കണം
  • D) ജഡ്ജി സ്‌കോറുകൾ മനുഷ്യൻ ലേബൽ ചെയ്‌ത സാമ്പിൾ ഉപയോഗിച്ച് കാലിബ്രേറ്റ് ചെയ്യുകയും അവ വിശ്വസിക്കുന്നതിന് മുമ്പ് അവയുടെ പക്ഷപാതം അളക്കുകയും വേണം ✔

വിവരണം: LLM-റഫറിയും ഒരു മാതൃകയാണ്; അത് ഭ്രമാത്മകവും പക്ഷപാതപരവും (ദീർഘമായ, ആത്മവിശ്വാസമുള്ള ഉത്തരങ്ങളെ അനുകൂലിക്കുന്നതും) പൊരുത്തമില്ലാത്തതുമാകാം. അതിനാൽ, റഫറി സ്കോറുകൾ ഒരു മനുഷ്യ ലേബൽ ചെയ്ത സാമ്പിൾ ഉപയോഗിച്ച് കാലിബ്രേറ്റ് ചെയ്യുകയും പ്രൊഡക്ഷൻ തീരുമാനം എടുക്കുന്നതിന് മുമ്പ് അവയുടെ ചിട്ടയായ പക്ഷപാതം അളക്കുകയും വേണം. സ്ഥിരീകരിക്കാത്ത റഫറി തെറ്റായ ആത്മവിശ്വാസം നൽകുന്നു.

14. മോഡൽ ബയസ് വിലയിരുത്തുമ്പോൾ മൊത്തത്തിലുള്ള കൃത്യത നോക്കുന്നത് അപര്യാപ്തമായിരിക്കുന്നത് എന്തുകൊണ്ട്?

  • എ) മൊത്തത്തിലുള്ള കൃത്യത മതി, കാരണം അത് എല്ലായ്പ്പോഴും ഏറ്റവും മോശം ഗ്രൂപ്പിൻ്റെ പ്രകടനത്തെ പ്രതിഫലിപ്പിക്കുന്നു
  • ബി) ഉപഗ്രൂപ്പുകൾ തമ്മിലുള്ള വ്യവസ്ഥാപരമായ വ്യത്യാസം (മറഞ്ഞിരിക്കുന്ന വിവേചനം) മറയ്ക്കാൻ കഴിയുന്നതിനാൽ മൊത്തത്തിലുള്ള കൃത്യത മാത്രം മതിയാകില്ല ✔
  • സി) കാരണം കൃത്യത എന്നത് പക്ഷപാതവുമായി യാതൊരു ബന്ധവുമില്ലാത്ത ഒരു മെട്രിക് ആണ്
  • ഡി) ബയസ് മോഡലിൽ നിന്ന് മാത്രമാണ് വരുന്നത്, ഡാറ്റയുമായി യാതൊരു ബന്ധവുമില്ല.

വിശദീകരണം: മൊത്തത്തിലുള്ള കൃത്യത ഉപഗ്രൂപ്പുകൾ തമ്മിലുള്ള വ്യവസ്ഥാപിത വ്യത്യാസങ്ങൾ മറച്ചേക്കാം. ഉദാഹരണത്തിന്, മൊത്തത്തിലുള്ള കൃത്യത 88% ആണെങ്കിലും, തിരിച്ചുവിളിക്കുന്നത് ഒരു ഗ്രൂപ്പിൽ 91% ഉം മറ്റൊരു ഗ്രൂപ്പിൽ 67% ഉം ആയിരിക്കാം; മോഡൽ വ്യവസ്ഥാപിതമായി ആ ഗ്രൂപ്പിനെ നഷ്‌ടപ്പെടുത്തുന്നു. അതിനാൽ, ഉപഗ്രൂപ്പുകളുടെ (ജനസംഖ്യാശാസ്ത്രം/വിഭാഗം) അടിസ്ഥാനത്തിൽ മാതൃക വിലയിരുത്തുകയും നീതിയുടെ ഏത് നിർവചനത്തിന് മുൻഗണന നൽകണമെന്ന് ബന്ധപ്പെട്ടവരുമായി തീരുമാനിക്കുകയും വേണം.

15. ഒരു ML ഫലം പുനർനിർമ്മിക്കുന്നതിന് ഏതെല്ലാം നാല് കാര്യങ്ങൾ ഒരുമിച്ച് ഉറപ്പിക്കണം?

  • എ) മോഡലിൻ്റെ പേര്, വലുപ്പം, വില, റിലീസ് തീയതി എന്നിവ മാത്രം
  • B) GPU ബ്രാൻഡും ഇൻ്റർനെറ്റ് വേഗതയും മാത്രം
  • സി) മോഡലിൻ്റെ അന്തിമ കൃത്യത സ്കോർ മാത്രം; ബാക്കിയുള്ളവ ഓർമ്മയിൽ സൂക്ഷിക്കാം
  • ഡി) റാൻഡംനെസ് സീഡ്, ഡാറ്റ പതിപ്പ്, പരിസ്ഥിതി (ആശ്രിത പതിപ്പുകൾ), പരീക്ഷണ ട്രാക്കിംഗ് ✔

വിവരണം: നാല് തൂണുകളിലൂടെയാണ് പുനരുൽപാദനക്ഷമത കൈവരിക്കുന്നത്: ക്രമരഹിതമായ വിത്തുകൾ, പതിപ്പിംഗ് ഡാറ്റ (പതിപ്പ്/ഹാഷ്), പരിസ്ഥിതി മരവിപ്പിക്കൽ (കൃത്യമായ ലൈബ്രറി പതിപ്പുകൾ/കണ്ടെയ്‌നർ), ഓരോ പരീക്ഷണവും ട്രാക്കുചെയ്യൽ (കോഡ് കമ്മിറ്റ്, ഡാറ്റ, ഹൈപ്പർപാരാമീറ്റർ, മെട്രിക്). ഈ ശൃംഖല കൂടാതെ ഒരേ ഫലം പുനർനിർമ്മിക്കാൻ സാധ്യമല്ല; പുനർനിർമ്മിക്കാനാവാത്ത ഫലം തെളിയിക്കാൻ കഴിയാത്ത ഒരു അവകാശവാദമാണ്.