യൂണിറ്റുകൾ
1. ML എഞ്ചിനീയറിംഗിലെ ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ്: പങ്ക്, അതിരുകൾ, മൂല്യനിർണ്ണയം, ഉത്തരവാദിത്തം 2. ഡാറ്റ പൈപ്പ്ലൈൻ: ശേഖരണം, ശുദ്ധീകരണം, ടാഗിംഗ്, പതിപ്പ് 3. മാതൃകാ പരിശീലനവും മൂല്യനിർണ്ണയവും: കൃത്യമായ അളവുകൾ, സത്യസന്ധമായ ബെഞ്ച്മാർക്കിംഗ് 4. LLM അപേക്ഷ: RAG ഉപയോഗിച്ചുള്ള നിങ്ങളുടെ സ്വന്തം ഡാറ്റയെ അടിസ്ഥാനമാക്കിയുള്ള ഉത്തരങ്ങൾ 5. LLM ആപ്ലിക്കേഷൻ: ഏജൻ്റ്സ്, ടൂളിംഗ്, സെക്യൂർ ഓട്ടോമേഷൻ 6. ഫൈൻ-ട്യൂണിംഗ് അടിസ്ഥാനം: എപ്പോൾ, എങ്ങനെ, എന്ത് അപകടസാധ്യതയോടെ 7. MLOps, വിന്യാസം: ലാബിൽ നിന്ന് ഉൽപ്പാദനത്തിലേക്ക് മോഡൽ മാറ്റുന്നു 8. ഇവലും മോണിറ്ററിംഗും: ഉൽപ്പാദനത്തിൽ മോഡൽ യഥാർത്ഥത്തിൽ എന്താണ് ചെയ്യുന്നതെന്ന് അറിയുക 9. സുരക്ഷയും സ്വകാര്യതയും: AI സിസ്റ്റങ്ങളെ പ്രതിരോധിക്കുന്നു 10. പക്ഷപാതം, ധാർമ്മികത, ചെലവ്: ഉത്തരവാദിത്തവും സുസ്ഥിരവുമായ AI എഞ്ചിനീയറിംഗ് 11. പുനരുൽപാദനക്ഷമതയും എൻഡ്-ടു-എൻഡ് പ്രോജക്റ്റും: എല്ലാം സംയോജിപ്പിക്കുന്നു
യൂണിറ്റ് 1 / 11

ML എഞ്ചിനീയറിംഗിലെ ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ്: പങ്ക്, അതിരുകൾ, മൂല്യനിർണ്ണയം, ഉത്തരവാദിത്തം

നേട്ടങ്ങൾ:

  • എംഎൽ വർക്ക്ഫ്ലോയിൽ (കോഡ്, ഡാറ്റ, ഡോക്യുമെൻ്റ്) ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് കുറഞ്ഞ അപകടസാധ്യതയുള്ള സമയം ലാഭിക്കുന്നുവെന്നും ടാസ്‌ക് റിസ്ക് ലെവൽ അനുസരിച്ച് മെട്രിക് / ഡാറ്റ / ഉൽപ്പാദനത്തിൽ ഉൾപ്പെടുത്തൽ പോലുള്ള തീരുമാനങ്ങൾ മനുഷ്യന് വിടുന്നത് എവിടെയാണെന്ന് വേർതിരിച്ചറിയാൻ കഴിയും.
  • ഓരോ AI ഔട്ട്‌പുട്ടും ഉറവിടവുമായി ബന്ധിപ്പിച്ച്, വീണ്ടും പ്രവർത്തിപ്പിച്ച്, അളക്കുന്നതിലൂടെ, ഒരു എഞ്ചിനീയറിംഗ് ഫിൽട്ടറിലൂടെ കടന്നുപോകുന്നതിലൂടെ അത് പരിശോധിക്കുന്ന ഒരു അച്ചടക്കം പ്രയോഗിക്കാനുള്ള കഴിവ്.
  • രഹസ്യസ്വഭാവമുള്ളതും വ്യക്തിഗതവുമായ ഡാറ്റകൾ ബാഹ്യ ഉപകരണങ്ങളിലേക്ക് അയയ്‌ക്കാതിരിക്കുക, കോർപ്പറേറ്റ്-അംഗീകൃത ടൂളുകൾ ഉപയോഗിക്കുക, പ്രതിരോധ ആവശ്യങ്ങൾക്കായി മാത്രം സുരക്ഷാ പ്രശ്‌നങ്ങൾ കൈകാര്യം ചെയ്യുക എന്നിവ ശീലമാക്കാനുള്ള കഴിവ്.

മെഷീൻ ലേണിംഗ് എഞ്ചിനീയറിംഗിലെ ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ്: പങ്ക്, അതിരുകൾ, മൂല്യനിർണ്ണയം, ഉത്തരവാദിത്തം

ഒരു മെഷീൻ ലേണിംഗ് എഞ്ചിനീയർ (ML എഞ്ചിനീയർ: ഡാറ്റയിൽ നിന്ന് ഉൽപ്പാദനത്തിലേക്ക് പഠിക്കുന്ന മോഡലുകൾ രൂപകൽപ്പന ചെയ്യുകയും പരിശീലിപ്പിക്കുകയും കൊണ്ടുവരികയും ചെയ്യുന്ന ഒരു സോഫ്റ്റ്വെയർ പ്രൊഫഷണൽ) ഇന്ന് തൻ്റെ ജോലിയുടെ ഓരോ ഘട്ടത്തിലും മറ്റൊരു കൃത്രിമബുദ്ധി ഉപകരണം ഉപയോഗിച്ച് പ്രവർത്തിക്കുന്നു. കോഡ് എഴുതുമ്പോൾ ഒരു കോഡിംഗ് അസിസ്റ്റൻ്റ്, ഡാറ്റ പര്യവേക്ഷണം ചെയ്യുമ്പോൾ ഒരു സംഭാഷണ മാതൃക, ഡോക്യുമെൻ്റേഷൻ നിർമ്മിക്കുമ്പോൾ ഒരു വലിയ ഭാഷാ മോഡൽ (LLM: ടെക്‌സ്‌റ്റ് മനസിലാക്കുകയും നിർമ്മിക്കുകയും ചെയ്യുന്ന കോടിക്കണക്കിന് പാരാമീറ്ററുകളുള്ള ഒരു ന്യൂറൽ നെറ്റ്‌വർക്ക്) എന്നിവ പ്രാബല്യത്തിൽ വരും. ഈ മൊഡ്യൂൾ ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസിനെ വികസിപ്പിച്ച ഉൽപ്പന്നമായും ഒരു ML എഞ്ചിനീയറുടെ ദൈനംദിന പ്രവർത്തന ഉപകരണമായും കണക്കാക്കുന്നു. രണ്ട് റോളുകളും ഇടകലർത്താതെ ഉത്തരവാദിത്തത്തിൻ്റെ അതിരുകൾ വ്യക്തമായി നിർവചിച്ചുകൊണ്ടാണ് ഇത് പ്രവർത്തിക്കുന്നത്.

ഈ ആദ്യ യൂണിറ്റിൽ, ഞങ്ങൾ അടിസ്ഥാന ചോദ്യത്തിന് ഉത്തരം നൽകുന്നു: എംഎൽ എഞ്ചിനീയറിംഗിൽ ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് തത്സമയം ലാഭിക്കുന്നത് എവിടെയാണ്, തീരുമാനം മനുഷ്യരെ ഏൽപ്പിക്കേണ്ടത് എവിടെയാണ്? ഉത്തരം എഞ്ചിനീയറിംഗ് അച്ചടക്കത്തിൻ്റെ ഹൃദയഭാഗത്താണ്: നിർമ്മിക്കുന്നയാൾ വേഗതയുള്ളതാണ്, സ്ഥിരീകരിക്കുന്നയാൾ ഉത്തരവാദിയാണ്.

എംഎൽ എഞ്ചിനീയറിംഗിൽ ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് എവിടെയാണ് ഉപയോഗപ്രദമാകുന്നത്?

ഒരു ML പ്രോജക്റ്റ് ഏകദേശം ഇനിപ്പറയുന്ന വരികളിലൂടെ കടന്നുപോകുന്നു: ഡാറ്റ ശേഖരണം, ഡാറ്റ ക്ലീനിംഗ്, ഫീച്ചർ എഞ്ചിനീയറിംഗ് (മോഡലിന് മനസ്സിലാക്കാൻ കഴിയുന്ന ഡിജിറ്റൽ സിഗ്നലുകളിലേക്ക് റോ ഡാറ്റ വിവർത്തനം ചെയ്യുക), മോഡൽ പരിശീലനം, മൂല്യനിർണ്ണയം, വിന്യാസം (വിന്യാസം: യഥാർത്ഥ ഉപയോക്താവിന് മോഡൽ തുറക്കൽ) കൂടാതെ നിരീക്ഷണം. ഈ ലൈനിലെ ഓരോ സ്റ്റോപ്പിലും AI സഹായിക്കുന്നു, എന്നാൽ അതിൻ്റെ അധികാര നില വ്യത്യാസപ്പെടുന്നു.

ഉയർന്ന റിവാർഡ്, കുറഞ്ഞ അപകടസാധ്യതയുള്ള മേഖലകൾ: ഒരു കോഡ് അസ്ഥികൂടം നിർമ്മിക്കുക, ഒരു ഡാറ്റാ ട്രാൻസ്ഫോർമേഷൻ ഫംഗ്‌ഷൻ തയ്യാറാക്കുക, ലോഗ് സന്ദേശങ്ങൾ വ്യാഖ്യാനിക്കുക, ഒരു സ്റ്റാക്ക് ട്രെയ്സ് വിവരിക്കുക, പരീക്ഷണ കുറിപ്പുകൾ സംഗ്രഹിക്കുക, ഡോക്യുമെൻ്റേഷനും README-കളും എഴുതുക, ഒരു ടെസ്റ്റ് കേസ് നിർദ്ദേശിക്കുക. ഇവിടെ, ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസിൻ്റെ തെറ്റുകൾ വിലകുറഞ്ഞതാണ്; കാരണം ഔട്ട്‌പുട്ട് ഇതിനകം തന്നെ പരിശോധനയിലൂടെയും അവലോകനത്തിലൂടെയും കടന്നുപോകും.

ഉയർന്ന അപകടസാധ്യതയുള്ള മേഖലകൾ: പരിശീലനത്തിലേക്ക് ഏത് ഡാറ്റയാണ് പോകുന്നതെന്ന് തീരുമാനിക്കുക, ഒരു മോഡൽ ഉൽപ്പാദനത്തിലേക്ക് പോകണമോ എന്ന് സ്ഥിരീകരിക്കുക, ഒരു മെട്രിക് "മതി" എന്ന് വിലയിരുത്തുക, വ്യക്തിഗത ഡാറ്റ പ്രോസസ്സ് ചെയ്യാനുള്ള തീരുമാനം, ഒരു സുരക്ഷാ അപകടസാധ്യത "ജങ്ക്" ആയി അടയ്ക്കുക. ഇവ പണം, സ്വകാര്യത, നിയമപരമായ ബാധ്യത, ഉപയോക്തൃ വിശ്വാസം എന്നിവയെ ബാധിക്കുന്നു. ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് ഇവിടെ നിർദ്ദേശങ്ങൾ നൽകുന്നു; കഴിവുള്ള എഞ്ചിനീയറും ഉത്തരവാദിത്തമുള്ള ടീമും ചേർന്നാണ് തീരുമാനം എടുക്കുന്നത്.

നുറുങ്ങ്: ഒരു ടാസ്‌ക്ക് AI-ലേക്ക് ഔട്ട്‌സോഴ്‌സ് ചെയ്യുന്നതിനുമുമ്പ് ചോദിക്കുക: "ഈ ഔട്ട്‌പുട്ട് തെറ്റാണെങ്കിൽ എന്ത് വില വരും, എത്ര എളുപ്പത്തിൽ ആരെങ്കിലും തെറ്റ് പിടിക്കും?" വില കുറവാണെങ്കിൽ പിടിച്ചെടുക്കൽ എളുപ്പമാണെങ്കിൽ, അത് കൈമാറുക. വില ഉയർന്നതോ ക്യാപ്‌ചർ ബുദ്ധിമുട്ടോ ആണെങ്കിൽ, ഡ്രാഫ്റ്റിനായി മാത്രം AI ഉപയോഗിക്കുക, നിങ്ങൾ തീരുമാനിക്കുക.

സ്ഥിരീകരണ അച്ചടക്കം: മൂന്ന് ഘട്ടങ്ങൾ

ML എഞ്ചിനീയറിംഗിൽ, AI ഔട്ട്പുട്ട് ഒരിക്കലും "പൂർത്തിയായ ജോലി" അല്ല; അതൊരു ഡ്രാഫ്റ്റാണ്. ഈ മൂന്ന് ഘട്ടങ്ങളിലൂടെ ഓരോ ഔട്ട്പുട്ടും പ്രവർത്തിപ്പിക്കുക:

  1. ഇത് ഉറവിടത്തിലേക്ക് ബന്ധിപ്പിക്കുക. മോഡൽ ഒരു നമ്പർ, ഒരു പരിധി അല്ലെങ്കിൽ "മികച്ച സമ്പ്രദായം" എന്ന് പറഞ്ഞാൽ, അത് ഔദ്യോഗിക ഡോക്യുമെൻ്റേഷൻ, കോഡ്ബേസിലെ യഥാർത്ഥ മൂല്യം അല്ലെങ്കിൽ അളന്ന മെട്രിക് എന്നിവയെ അടിസ്ഥാനമാക്കിയുള്ളതാണ്. "മോഡലിൻ്റെ ഫിറ്റിംഗ്" (ഭ്രമാത്മകത: ഭാഷാ മോഡലിൻ്റെ യഥാർത്ഥ വിവരങ്ങളുടെ ആത്മവിശ്വാസത്തോടെയുള്ള ഉൽപ്പാദനം) മിക്കപ്പോഴും ഇവിടെ പിടിക്കപ്പെടുന്നു.
  2. പുനരാരംഭിച്ച് അളക്കുക. ജനറേറ്റുചെയ്‌ത കോഡ് പ്രവർത്തിപ്പിക്കുക, നിങ്ങളുടെ സ്വന്തം ടെസ്റ്റ് സെറ്റിൽ അത് ഉൽപാദിപ്പിക്കുന്ന മെട്രിക് വീണ്ടും കണക്കാക്കുക, ഒരു ചെറിയ സാമ്പിളിൽ നിർദ്ദേശിച്ച SQL ചോദ്യം സാധൂകരിക്കുക. നല്ലതായി തോന്നിയാലും പ്രവർത്തിക്കാത്ത കോഡ് വിലപ്പോവില്ല.
  3. ഒരു എഞ്ചിനീയറിംഗ് ഫിൽട്ടറിലൂടെ കടന്നുപോകുക. ഔട്ട്പുട്ട് സ്കെയിലിൽ നിലനിൽക്കുമോ? എഡ്ജ് കേസുകൾ (ശൂന്യമായ ഡാറ്റ, വളരെ വലിയ ഇൻപുട്ട്, നഷ്‌ടമായ ഫീൽഡുകൾ) പരിഗണിച്ചിട്ടുണ്ടോ? സുരക്ഷയുടെയും സ്വകാര്യതയുടെയും ലംഘനമുണ്ടോ? ഫീൽഡ് അറിയാവുന്ന ഒരാൾക്ക് മാത്രമേ ഈ ഘട്ടം ചെയ്യാൻ കഴിയൂ.

ദുർബലമായ പ്രോംപ്റ്റ് / ശക്തമായ പ്രോംപ്റ്റ്

ദുർബലമായ നിർദ്ദേശം: "എനിക്ക് കുറച്ച് മോഡൽ പരിശീലന കോഡ് എഴുതുക."

ശക്തമായ നിർദ്ദേശം: "ബൈനറി ക്ലാസിഫിക്കേഷനായി സ്‌കിക്കിറ്റ്-ലേൺ ഉപയോഗിച്ച് ഒരു പരിശീലന സ്‌ക്രിപ്റ്റ് എഴുതുക. ഇൻപുട്ട്: ഡാറ്റ/ട്രെയിൻ.പാർക്ക്വെറ്റ്, ടാർഗെറ്റ് കോളം is_churn. ക്ലാസ് അസന്തുലിതാവസ്ഥ (പോസിറ്റീവ് നിരക്ക് ~8%), ക്ലാസ്_വെയ്‌റ്റ് ഉപയോഗിച്ച് ഇത് കൈകാര്യം ചെയ്യുക. PR-AUC ഉപയോഗിക്കുക (കൃത്യത-വീണ്ടെടുക്കൽ കർവിന് കീഴിലുള്ള ഏരിയ) കാരണം ഡാറ്റാ ലീഡിംഗ് മെട്രിക്, തെറ്റിദ്ധരിപ്പിക്കുന്ന മെട്രിക് ആണ്. ക്രമരഹിതമായ വിത്ത് 42 ആയി ശരിയാക്കുക. കോഡ് പ്രിൻ്റ് സെറ്റിൻ്റെ അവസാനം PR-AUC പരിശോധിക്കുക."

വ്യത്യാസം: രണ്ടാമത്തെ പ്രോംപ്റ്റ് ടാസ്‌ക്കിൽ ഡാറ്റ സത്യം, ശരിയായ മെട്രിക്, അസന്തുലിതാവസ്ഥ വിവരങ്ങൾ, ആവർത്തന ആവശ്യകത എന്നിവ അടങ്ങിയിരിക്കുന്നു. ഈ സന്ദർഭത്തിൽ നിന്നാണ് ഔട്ട്‌പുട്ട് പരിശോധിക്കാവുന്നതും ഉപയോഗയോഗ്യവുമാകുന്നത്.

സ്വകാര്യതയും ഡാറ്റ സുരക്ഷയും: എഞ്ചിനീയറുടെ ആദ്യ ഉത്തരവാദിത്തം

ML എഞ്ചിനീയർ പലപ്പോഴും കമ്പനിയുടെ ഏറ്റവും സെൻസിറ്റീവ് ഡാറ്റയെ സ്പർശിക്കുന്നു: ഉപഭോക്തൃ രേഖകൾ, ഇടപാട് ചരിത്രം, ആരോഗ്യം അല്ലെങ്കിൽ സാമ്പത്തിക ഡാറ്റ, പ്രൊഡക്ഷൻ സിസ്റ്റങ്ങളുടെ ലോഗുകൾ. ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് ടൂളുകൾക്ക് ഡാറ്റ നൽകുമ്പോൾ മൂന്ന് നിയമങ്ങൾ:

  • വ്യക്തിഗതവും രഹസ്യാത്മകവുമായ ഡാറ്റ ബാഹ്യ ഉപകരണങ്ങളിലേക്ക് അയയ്ക്കരുത്. ഉദാഹരണത്തിന്, പ്രോംപ്റ്റിലേക്ക് ഉപഭോക്തൃ ഇമെയിലുകൾ ഒട്ടിക്കുന്നതിന് പകരം, സ്കീമയും ഡമ്മി (സിന്തറ്റിക്) സാമ്പിളുകളും അയയ്ക്കുക. യഥാർത്ഥ ഡാറ്റയ്‌ക്ക് പകരം "ഉദാ: ahmet@example.com" പോലുള്ള മുഖംമൂടിയുള്ള ഉദാഹരണം ഉപയോഗിക്കുക.
  • കോർപ്പറേറ്റ് അംഗീകൃത വാഹനങ്ങൾ ഉപയോഗിക്കുക. ഡാറ്റ എവിടെയാണ് പ്രോസസ്സ് ചെയ്യുന്നത്, അത് സംഭരിച്ചിട്ടുണ്ടോ, വിദ്യാഭ്യാസത്തിനായി ഉപയോഗിച്ചിട്ടുണ്ടോ ഇല്ലയോ എന്ന് കരാർ പ്രകാരം വ്യക്തമായ ടൂളുകൾ തിരഞ്ഞെടുക്കുക. ഒരു സ്വകാര്യ അക്കൗണ്ട് ഉപയോഗിച്ച് കോർപ്പറേറ്റ് ഡാറ്റ പ്രോസസ്സ് ചെയ്യുന്നത് മിക്ക കമ്പനികളിലും ലംഘനമാണ്.
  • കുറഞ്ഞ ഡാറ്റ നയം. ചുമതല പരിഹരിക്കുന്നതിന് ആവശ്യമായ ഏറ്റവും കുറഞ്ഞ സന്ദർഭം നൽകുക. മുഴുവൻ പട്ടികയല്ല, പ്രസക്തമായ 5 നിരകളും സ്കീമയും.
മുന്നറിയിപ്പ്: ഒരു ഭാഷാ മോഡലിന് നിങ്ങൾ നൽകുന്ന വാചകം പഴയപടിയാക്കാനാകില്ലെന്ന് കരുതുക. "ഞാൻ അത് പിന്നീട് ഇല്ലാതാക്കാം" എന്ന് കരുതി അസംസ്‌കൃത വ്യക്തിഗത ഡാറ്റ അയയ്‌ക്കരുത്; അയച്ച നിമിഷം തന്നെ അപകടം സംഭവിച്ചു.

സുരക്ഷാ മേഖലയിൽ പ്രതിരോധ ഉപയോഗം

ML എഞ്ചിനീയർമാർ പലപ്പോഴും സുരക്ഷാ സംവിധാനങ്ങൾ ഇൻസ്റ്റാൾ ചെയ്യുന്നു: വഞ്ചന കണ്ടെത്തൽ, ക്ഷുദ്ര ട്രാഫിക് വർഗ്ഗീകരണം, പ്രാമാണീകരണം. ഈ മൊഡ്യൂളിലുടനീളം, പ്രതിരോധ ആവശ്യങ്ങൾക്കായി മാത്രം ഞങ്ങൾ സുരക്ഷാ പ്രശ്നങ്ങൾ കവർ ചെയ്യുന്നു: ആക്രമണം കണ്ടെത്തൽ, സിസ്റ്റം കഠിനമാക്കൽ, അപകടസാധ്യത അടയ്ക്കൽ. ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് ഉപയോഗിക്കുന്നത് അനധികൃത ആക്‌സസ്, ഡാറ്റ ചോർച്ച അല്ലെങ്കിൽ മറ്റൊരാളുടെ സിസ്റ്റത്തിലേക്ക് അനധികൃതമായി ഇടപെടൽ എന്നിവ നിയമവിരുദ്ധവും പ്രൊഫഷണൽ നൈതികതയ്ക്ക് എതിരുമാണ്. നിങ്ങൾ ഒരു അപകടസാധ്യത കണ്ടെത്തുമ്പോൾ, അത് ഉത്തരവാദിത്തത്തോടെ റിപ്പോർട്ട് ചെയ്യുകയും അത് പരിഹരിക്കുകയും ചെയ്യുക എന്നതാണ് ശരിയായ മാർഗം; ചൂഷണം ചെയ്യരുത്.

മൂന്ന് മിനി കേസുകൾ

കേസ് 1 - സമയം ലാഭിച്ചു. ഒരു ML എഞ്ചിനീയർ സാധാരണയായി 40 കോളം ഡാറ്റാ സെറ്റിൻ്റെ പര്യവേക്ഷണ ഡാറ്റ വിശകലനം (EDA) ചെയ്യാൻ അര ദിവസം ചെലവഴിക്കും. അദ്ദേഹം ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസിന് സ്കീമയും df.describe() ഔട്ട്‌പുട്ടും നൽകി, "ഏത് കോളങ്ങൾക്കാണ് ഉയർന്ന ഔട്ട്‌ലയർ, മിസ്സിംഗ് നിരക്ക്, ഏത് രൂപാന്തരങ്ങളാണ് നിങ്ങൾ ശുപാർശ ചെയ്യുന്നത്?" 20 മിനിറ്റിനുള്ളിൽ, ഓരോ ഇനവും അതിൻ്റേതായ കോഡ് ഉപയോഗിച്ച് പരിശോധിച്ചുറപ്പിച്ച ഒരു മുൻഗണനാ ലിസ്റ്റ് അദ്ദേഹത്തിന് ലഭിച്ചു. സംരക്ഷിക്കുക: ~3 മണിക്കൂർ, ഓരോ ക്ലെയിമും അളന്നതിനാൽ പിശക് സാധ്യത കുറവാണ്.

കേസ് 2 - പിടിപെട്ട പിശക്. “പരിശീലന കൃത്യത 99% ആണ്, മികച്ചതാണ്,” മോഡലിന് ഒരു ചാറ്റ് അസിസ്റ്റൻ്റ് പറഞ്ഞു. എഞ്ചിനീയർ മൂന്നാം ഘട്ടം (എഞ്ചിനീയറിംഗ് ഫിൽട്ടർ) പ്രയോഗിച്ചു, തിരിച്ചറിഞ്ഞു: ടാർഗെറ്റ് കോളത്തിൽ ആകസ്മികമായി ആട്രിബ്യൂട്ടുകൾ ചോർന്നു (ഡാറ്റ ചോർച്ച: പരിശീലനത്തിൽ കാണാൻ പാടില്ലാത്ത വിവരങ്ങൾ മോഡൽ കാണുന്നു). യഥാർത്ഥ പ്രകടനം വളരെ കുറവായിരുന്നു. AI-യുടെ "മഹത്തായ" വ്യാഖ്യാനമല്ല, എഞ്ചിനീയറുടെ സംശയമാണ് ജോലിയെ രക്ഷിച്ചത്.

കേസ് 3 - സ്വകാര്യത ലംഘനം തടയുന്നു. ഒരു ടീം പ്രൊഡക്ഷൻ പിശക് ലോഗുകൾ ഒരു ബാഹ്യ മോഡലിലേക്ക് ഒട്ടിക്കുകയും "ഈ പിശക് പരിഹരിക്കുക" എന്ന് പറയുകയും ചെയ്തു. ലോഗുകളിൽ കസ്റ്റമർ ഐഡൻ്റിഫിക്കേഷൻ നമ്പറുകൾ ഉണ്ടായിരുന്നു. ആദ്യം ലോഗുകൾ മറയ്ക്കുന്ന ഒരു ചെറിയ സ്ക്രിപ്റ്റ് എഴുതി (അവരുടെ ഐഡി നമ്പറുകൾ *** ആക്കുക) ആ വഴിക്ക് അയയ്ക്കുക എന്ന നിയമം ടീം ഉണ്ടാക്കി. ലംഘനത്തിൻ്റെ സാധ്യത അപ്രത്യക്ഷമായി, സഹായത്തിൻ്റെ വേഗത മാറിയിട്ടില്ല.

പകർത്താവുന്ന ടെംപ്ലേറ്റുകൾ

ടാസ്ക്: [എന്താണ് ചെയ്യേണ്ടത്, ഒറ്റ വാചകം] സന്ദർഭം: [ഡാറ്റ സ്കീമ, വലുപ്പം, നിയന്ത്രണങ്ങൾ; യഥാർത്ഥ വ്യക്തിഗത ഡാറ്റ ഇല്ല]നിയന്ത്രണങ്ങൾ: [ഭാഷ/ലൈബ്രറി, പ്രകടനം, പുനരുൽപാദനക്ഷമത]മെട്രിക്‌സ്: [വിജയം അളക്കുന്നതെങ്ങനെ]ആവശ്യമുള്ള ഔട്ട്‌പുട്ട്: [കോഡ്/വിവരണം/ലിസ്റ്റ്] എന്തിനാണ് ഈ ഫോർമാറ്റിൽ

ഈ കോഡ് പരിശോധിക്കുക. ഇത് പ്രവർത്തിക്കുന്നു എന്ന് മാത്രമല്ല, ഇവയുടെ അടിസ്ഥാനത്തിലും വിലയിരുത്തുക:1) എഡ്ജ് കേസുകൾ (ശൂന്യമായ ഇൻപുട്ട്, നഷ്ടപ്പെട്ട കോളം, വളരെ വലിയ ഡാറ്റ)2) ഡാറ്റ ചോർച്ചയുടെ അപകടസാധ്യത3) പുനരുൽപാദനക്ഷമത (വിത്ത്, പതിപ്പ്)നിങ്ങൾ കണ്ടെത്തുന്ന ഓരോ പ്രശ്നത്തിനും പരിഹാരങ്ങൾ നിർദ്ദേശിക്കുക. നിങ്ങൾക്ക് ഉറപ്പില്ലാത്തിടത്ത് "സ്ഥിരീകരിക്കുക" എന്ന് അടയാളപ്പെടുത്തുക. കോഡ്: [കോഡ്]

ഈ മെട്രിക്കിൻ്റെ ഫലം വ്യാഖ്യാനിക്കുക, എന്നാൽ ആദ്യം ചോദിക്കുക: ഈ പ്രശ്നത്തിന് ഈ മെട്രിക് ശരിയാണോ? പ്രശ്നം: [സന്തുലിതമായ/അസന്തുലിതമായ വർഗ്ഗീകരണം, റിഗ്രഷൻ, റാങ്കിംഗ്...]റിപ്പോർട്ട് ചെയ്ത മെട്രിക്കും മൂല്യവും: [ഉദാ. കൃത്യത 0.99]ഏത് മെട്രിക് ആണ് നിങ്ങൾ ശുപാർശ ചെയ്യുന്നത്, എന്തുകൊണ്ട്, നിലവിലെ ഫലത്തെ സംശയിക്കാൻ ഞാൻ എന്ത് സൂചനകൾ തേടണം?

ഇനിപ്പറയുന്ന പ്രോംപ്റ്റിൽ ഞാൻ നൽകുന്ന ഡാറ്റയിൽ വ്യക്തിഗത/രഹസ്യ വിവരങ്ങൾ ഉണ്ടോയെന്ന് പരിശോധിക്കുക. ചുവടെയുള്ള വാചകത്തിൽ മറയ്ക്കേണ്ട ഫീൽഡുകൾ (പേര്, ഇമെയിൽ, ഐഡി നമ്പർ, ഫോൺ, വിലാസം) ലിസ്റ്റ് ചെയ്യുക. വാചകം: [ടെക്സ്റ്റ്]

റോളും അധികാര പട്ടികയും

അന്വേഷണം

ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസിൻ്റെ പങ്ക്

തീരുമാനത്തിൻ്റെ ഉടമ

കോഡ് അസ്ഥികൂടം / പരിവർത്തന പ്രവർത്തനം

ഡ്രാഫ്റ്റ് ജനറേറ്റർ

എഞ്ചിനീയർ (അവലോകനങ്ങൾ)

EDA / ഡാറ്റ സംഗ്രഹം

ആക്സിലറേറ്റർ

എഞ്ചിനീയർ (അളന്ന് പരിശോധിക്കുന്നു)

മെട്രിക് വ്യാഖ്യാനം

നിർദ്ദേശം

എഞ്ചിനീയർ

പരിശീലനത്തിന് എന്ത് ഡാറ്റ നൽകും?

നിർദ്ദേശം

ടീം + ഡാറ്റ ഉടമ

മോഡൽ ഉൽപ്പാദിപ്പിക്കുക

ചെക്ക്‌ലിസ്റ്റ് ഓർമ്മപ്പെടുത്തൽ

ഉത്തരവാദിത്തമുള്ള എഞ്ചിനീയർ + ടീം

വ്യക്തിഗത ഡാറ്റ പ്രോസസ്സിംഗ്

ഒന്നുമില്ല (ഉപയോഗിച്ചിട്ടില്ല)

നിയമ + ഡാറ്റ കൺട്രോളർ

സാധാരണ തെറ്റുകൾ

  • ഔട്ട്പുട്ട് സാധൂകരിക്കാതെ ഉപയോഗിക്കുന്നു. ഏറ്റവും സാധാരണവും ചെലവേറിയതുമായ തെറ്റ്. മനോഹരമായി കാണപ്പെടുന്ന കോഡോ മെട്രിക്കോ അത് ശരിയാണെന്ന് അർത്ഥമാക്കുന്നില്ല.
  • ഉപകരണത്തിലേക്ക് റോ രഹസ്യാത്മക ഡാറ്റ ഒട്ടിക്കുന്നു. ഒരിക്കൽ അയച്ചാൽ തിരിച്ചെടുക്കാൻ കഴിയില്ല.
  • തെറ്റായ മെട്രിക്കിനെ ആശ്രയിക്കുന്നു. അസന്തുലിതമായ ഡാറ്റയിലെ കൃത്യത, റാങ്കിംഗ് പ്രശ്‌നങ്ങളിലെ RMSE എന്നിവ പോലെയുള്ള പൊരുത്തമില്ലാത്ത മെട്രിക്‌സ് തെറ്റിദ്ധരിപ്പിക്കുന്നതാണ്.
  • ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് തീരുമാന നിർമ്മാതാവായി തെറ്റിദ്ധരിക്കുന്നു. അദ്ദേഹം നിർദ്ദേശങ്ങൾ നൽകുന്നു; ഉത്തരവാദിത്തം ഒപ്പിട്ടയാൾക്കാണ്.
  • സന്ദർഭരഹിതമായ പ്രോംപ്റ്റ്. "ഒരു മോഡൽ എഴുതുക" പോലെയുള്ള അവ്യക്തമായ അഭ്യർത്ഥനകൾ പരിശോധിച്ചുറപ്പിക്കാനാവാത്ത ഔട്ട്പുട്ട് ഉണ്ടാക്കുന്നു.

ചുരുക്കത്തിൽ

എംഎൽ എഞ്ചിനീയറും അതിൻ്റെ ദൈനംദിന റെപ്ലിക്കേറ്ററും വികസിപ്പിച്ചെടുത്ത ഉൽപ്പന്നമാണ് ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ്. കോഡ്-ഡാറ്റ-ഡോക്യുമെൻ്റ് പോലുള്ള അപകടസാധ്യത കുറഞ്ഞതും എളുപ്പത്തിൽ പരിശോധിച്ചുറപ്പിച്ചതുമായ ജോലികളിൽ ഇതിൻ്റെ മൂല്യം ഉയർന്നതാണ്; പണം, സ്വകാര്യത, സുരക്ഷ എന്നിവയെ ബാധിക്കുന്ന തീരുമാനങ്ങൾ വ്യക്തിയുടെ പക്കലുണ്ട്. ഓരോ ഔട്ട്‌പുട്ടും ഉറവിടത്തിലേക്ക് ബന്ധിപ്പിക്കുക, വീണ്ടും അളക്കുക, എഞ്ചിനീയറിംഗ് ഫിൽട്ടറിലൂടെ കടന്നുപോകുക. രഹസ്യസ്വഭാവമുള്ള ഡാറ്റ പരിരക്ഷിക്കുക, അംഗീകൃത വാഹനങ്ങൾ ഉപയോഗിക്കുക, പ്രതിരോധ ആവശ്യങ്ങൾക്കായി മാത്രം സെക്യൂരിറ്റിയിൽ പ്രവർത്തിക്കുക. ഈ അച്ചടക്കം എല്ലാ തുടർന്നുള്ള യൂണിറ്റുകളുടെയും അടിസ്ഥാനമാണ്.

ആപ്ലിക്കേഷൻ ടാസ്ക്

നിങ്ങളുടെ സ്വന്തം പ്രോജക്റ്റിൽ നിന്ന് ഒരു ടാസ്ക് തിരഞ്ഞെടുക്കുക (ഉദാ. ഒരു ഡാറ്റ ക്ലീനിംഗ് ഫംഗ്ഷൻ എഴുതുന്നത്). ആദ്യം ഒരു ദുർബലമായ പ്രോംപ്റ്റ് എഴുതുക, തുടർന്ന് ഈ യൂണിറ്റിലെ ടെംപ്ലേറ്റ് ഉപയോഗിച്ച് ശക്തമായ ഒരു പ്രോംപ്റ്റ് എഴുതുക. രണ്ട് ഔട്ട്‌പുട്ടുകളും എടുക്കുക, ത്രീ-സ്റ്റെപ്പ് വെരിഫിക്കേഷൻ പ്രയോഗിക്കുക (ഉറവിടത്തിലേക്കുള്ള ലിങ്ക്, വീണ്ടും പ്രവർത്തിപ്പിക്കുക, എഞ്ചിനീയറിംഗ് ഫിൽട്ടർ). ഏത് പ്രോംപ്റ്റാണ് എത്ര മിനിറ്റ്, എത്ര തിരുത്തലുകൾ എന്നിവ ലാഭിക്കുന്നുവെന്ന് ശ്രദ്ധിക്കുക.

ചെക്ക്ലിസ്റ്റ്

  • [ ] എൻ്റെ ടാസ്ക്കിൻ്റെ റിസ്ക് ലെവൽ (താഴ്ന്ന/ഉയർന്നത്) ഞാൻ നിർണ്ണയിച്ചു.
  • [ ] ഞാൻ പ്രോംപ്റ്റിൽ യഥാർത്ഥ വ്യക്തിഗത/രഹസ്യ വിവരങ്ങളൊന്നും നൽകിയിട്ടില്ല; ഞാൻ അത് മറയ്ക്കുകയോ സിന്തറ്റിക് സാമ്പിൾ ഉപയോഗിക്കുകയോ ചെയ്തു.
  • [ ] ഞാൻ ഔട്ട്‌പുട്ട് ഉറവിടവുമായി ബന്ധിപ്പിച്ചു, അത് വീണ്ടും പ്രവർത്തിപ്പിച്ചു, ഒരു എഞ്ചിനീയറിംഗ് വീക്ഷണകോണിൽ നിന്ന് ഫിൽട്ടർ ചെയ്തു.
  • [ ] ഞാൻ ശരിയായ മെട്രിക് തിരഞ്ഞെടുത്തിട്ടുണ്ടോയെന്ന് പരിശോധിച്ചു.
  • [ ] ഞാൻ തന്നെ/ടീമിനൊപ്പം നിർണായകമായ തീരുമാനം (അത് പ്രൊഡക്ഷൻ, ഡാറ്റ പ്രോസസ്സിംഗ് എന്നിവയിൽ ഉൾപ്പെടുത്തി) എടുത്തു, ഞാൻ അത് ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസിന് വിട്ടുകൊടുത്തില്ല.
  • [ ] ഞാൻ കോർപ്പറേറ്റ് അംഗീകൃത വാഹനമാണ് ഉപയോഗിച്ചത്.