യൂണിറ്റുകൾ
1. ML എഞ്ചിനീയറിംഗിലെ ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ്: പങ്ക്, അതിരുകൾ, മൂല്യനിർണ്ണയം, ഉത്തരവാദിത്തം 2. ഡാറ്റ പൈപ്പ്ലൈൻ: ശേഖരണം, ശുദ്ധീകരണം, ടാഗിംഗ്, പതിപ്പ് 3. മാതൃകാ പരിശീലനവും മൂല്യനിർണ്ണയവും: കൃത്യമായ അളവുകൾ, സത്യസന്ധമായ ബെഞ്ച്മാർക്കിംഗ് 4. LLM അപേക്ഷ: RAG ഉപയോഗിച്ചുള്ള നിങ്ങളുടെ സ്വന്തം ഡാറ്റയെ അടിസ്ഥാനമാക്കിയുള്ള ഉത്തരങ്ങൾ 5. LLM ആപ്ലിക്കേഷൻ: ഏജൻ്റ്സ്, ടൂളിംഗ്, സെക്യൂർ ഓട്ടോമേഷൻ 6. ഫൈൻ-ട്യൂണിംഗ് അടിസ്ഥാനം: എപ്പോൾ, എങ്ങനെ, എന്ത് അപകടസാധ്യതയോടെ 7. MLOps, വിന്യാസം: ലാബിൽ നിന്ന് ഉൽപ്പാദനത്തിലേക്ക് മോഡൽ മാറ്റുന്നു 8. ഇവലും മോണിറ്ററിംഗും: ഉൽപ്പാദനത്തിൽ മോഡൽ യഥാർത്ഥത്തിൽ എന്താണ് ചെയ്യുന്നതെന്ന് അറിയുക 9. സുരക്ഷയും സ്വകാര്യതയും: AI സിസ്റ്റങ്ങളെ പ്രതിരോധിക്കുന്നു 10. പക്ഷപാതം, ധാർമ്മികത, ചെലവ്: ഉത്തരവാദിത്തവും സുസ്ഥിരവുമായ AI എഞ്ചിനീയറിംഗ് 11. പുനരുൽപാദനക്ഷമതയും എൻഡ്-ടു-എൻഡ് പ്രോജക്റ്റും: എല്ലാം സംയോജിപ്പിക്കുന്നു
യൂണിറ്റ് 9 / 11

സുരക്ഷയും സ്വകാര്യതയും: AI സിസ്റ്റങ്ങളെ പ്രതിരോധിക്കുന്നു

നേട്ടങ്ങൾ:

  • AI- നിർദ്ദിഷ്‌ട ആക്രമണ പ്രതലങ്ങൾ തിരിച്ചറിയാനുള്ള കഴിവ് (പ്രാമ്പ്റ്റ് ഇൻജക്ഷൻ, ഡാറ്റാ വിഷബാധ, രഹസ്യാത്മക ഡാറ്റ ചോർച്ച, അംഗത്വം വേർതിരിച്ചെടുക്കൽ) കൂടാതെ ലേയേർഡ് പ്രതിരോധം രൂപകൽപ്പന ചെയ്യാനും
  • ഒരു ഡിസൈൻ തത്വമായി സ്വകാര്യത പ്രയോഗിക്കാനുള്ള കഴിവ്: ഡാറ്റ ചെറുതാക്കൽ, മറയ്ക്കൽ, ആക്സസ് നിയന്ത്രണം, നിലനിർത്തൽ കാലയളവ്
  • പ്രതിരോധ ആവശ്യങ്ങൾക്കായി മാത്രം സുരക്ഷാ പ്രവർത്തനങ്ങൾ നടത്താനും, അപകടസാധ്യതകൾ ഉത്തരവാദിത്തത്തോടെ വെളിപ്പെടുത്താനും, അനധികൃത ഉപയോഗം ഒഴിവാക്കാനുമുള്ള കഴിവ്

ഒരു മെഷീൻ ലേണിംഗ് സിസ്റ്റം പരമ്പരാഗത സോഫ്‌റ്റ്‌വെയറിൻ്റെ എല്ലാ സുരക്ഷാ അപകടസാധ്യതകളും വഹിക്കുകയും അതുല്യമായ പുതിയ ആക്രമണ പ്രതലങ്ങൾ ചേർക്കുകയും ചെയ്യുന്നു. ഒരു ഇൻപുട്ട് വഴി മോഡൽ കബളിപ്പിക്കപ്പെടാം, പരിശീലന ഡാറ്റ വിഷലിപ്തമാക്കാം, രഹസ്യ വിവരങ്ങൾ ഔട്ട്പുട്ടിലേക്ക് ചോർത്താം. ഈ യൂണിറ്റിൽ, പ്രതിരോധ വീക്ഷണകോണിൽ നിന്ന് AI സിസ്റ്റങ്ങളെ ഞങ്ങൾ പരിഗണിക്കുന്നു: ആക്രമണങ്ങൾ തിരിച്ചറിയൽ, സിസ്റ്റം കഠിനമാക്കൽ, സ്വകാര്യത സംരക്ഷിക്കൽ. ഈ വിവരങ്ങൾ അനധികൃത പ്രവേശനത്തിനോ ആക്രമണത്തിനോ വേണ്ടിയല്ല, മറിച്ച് നിങ്ങളുടെ സ്വന്തം സിസ്റ്റങ്ങൾ സുരക്ഷിതമായി സൂക്ഷിക്കുന്നതിനാണ്.

AI-നിർദ്ദിഷ്ട ആക്രമണ പ്രതലങ്ങൾ

ക്ലാസിക് സെക്യൂരിറ്റിക്ക് പുറമേ (ആധികാരികത, അംഗീകാരം, എൻക്രിപ്ഷൻ), ML സിസ്റ്റങ്ങൾ ഇനിപ്പറയുന്നവയ്ക്ക് അപകടസാധ്യതയുള്ളവയാണ്:

  • പെട്ടെന്നുള്ള കുത്തിവയ്പ്പ്: LLM-ലേക്കുള്ള ഇൻപുട്ടിൽ മറഞ്ഞിരിക്കുന്ന നിർദ്ദേശം മോഡൽ നഷ്ടപ്പെടുത്തുന്നു. ഏറ്റവും സാധാരണവും പ്രായോഗികവുമായ LLM സുരക്ഷാ അപകടസാധ്യത.
  • ഡാറ്റാ വിഷബാധ: പരിശീലന ഡാറ്റയിലേക്ക് മോശം സാമ്പിളുകൾ തിരുകിക്കൊണ്ട് ഒരു ആക്രമണകാരി മോഡലിലേക്ക് ഒരു മറഞ്ഞിരിക്കുന്ന പിൻവാതിൽ അല്ലെങ്കിൽ പക്ഷപാതം അവതരിപ്പിക്കുന്നു.
  • മോഡൽ അനുമാനവും വിപരീതവും: മോഡലിലേക്ക് ഒന്നിലധികം ചോദ്യങ്ങൾ അയച്ചുകൊണ്ട് ഒരു ആക്രമണകാരി പരിശീലന ഡാറ്റയോ മോഡൽ സ്വഭാവമോ പുനർനിർമ്മിക്കുന്നു.
  • അംഗത്വ അനുമാനം: വിദ്യാഭ്യാസത്തിൽ ഒരു പ്രത്യേക വ്യക്തിയുടെ ഡാറ്റ ഉപയോഗിക്കുന്നുണ്ടോ എന്ന് അനുമാനിക്കുന്നു — ഒരു സ്വകാര്യതാ ലംഘനം.
  • സെൻസിറ്റീവ് ഡാറ്റ ചോർച്ച: ഔട്ട്‌പുട്ടിലെ പരിശീലന ഡാറ്റയിൽ മോഡൽ രഹസ്യ വിവരങ്ങൾ (പേര്, ഐഡൻ്റിറ്റി, രഹസ്യം) വെളിപ്പെടുത്തുന്നു.

ഈ അപകടങ്ങളിൽ ഓരോന്നിനും പ്രതിരോധമുണ്ട്; ഡിസൈൻ ഘട്ടത്തിൽ റിസ്ക് പരിഗണിക്കുക എന്നതാണ് പ്രധാന കാര്യം.

പെട്ടെന്നുള്ള കുത്തിവയ്പ്പ്: ഏറ്റവും പെട്ടെന്നുള്ള ഭീഷണി

രണ്ട് തരത്തിലുള്ള പ്രോംപ്റ്റ് കുത്തിവയ്പ്പുകൾ ഉണ്ട്:

  • നേരിട്ടുള്ള: ഉപയോക്താവ് വ്യക്തിപരമായി "മുമ്പത്തെ നിർദ്ദേശങ്ങൾ അവഗണിക്കുക" പോലുള്ള വാചകം നൽകുന്നു.
  • പരോക്ഷം: മോഡൽ പ്രോസസ്സ് ചെയ്യുന്ന ഒരു ബാഹ്യ സന്ദർഭത്തിൽ (വെബ് പേജ്, പ്രമാണം, ഇമെയിൽ) മോശം നിർദ്ദേശം മറച്ചിരിക്കുന്നു. മോഡൽ ബാഹ്യ ഉള്ളടക്കം വിശ്വസനീയമായി കൈകാര്യം ചെയ്യുന്നതിനാൽ, ഏജൻ്റുമാർക്കും RAG-നും പ്രത്യേകിച്ച് അപകടകരമാണ്.

പ്രതിരോധ പാളികൾ:

  1. Parsing: Separate system instruction and user/external data with clear delimiters; ബാഹ്യ ഉള്ളടക്കം "ഡാറ്റ, കമാൻഡുകൾ അല്ല" എന്ന് അടയാളപ്പെടുത്തുക.
  2. മിനിമം പവറുകൾ: ക്യാപ്‌ചർ ചെയ്‌താലും മോഡലിന് എത്രമാത്രം കേടുപാടുകൾ വരുത്താനാകുമെന്ന് പരിമിതപ്പെടുത്തുക (യൂണിറ്റ് 5 ലെ വാഹന ശക്തികൾ).
  3. ഔട്ട്‌പുട്ട് നിയന്ത്രണം: നിങ്ങൾ ഉപയോഗിക്കുന്നതിന് മുമ്പ് മോഡൽ എന്താണ് നിർമ്മിക്കുന്നതെന്ന് പരിശോധിക്കുക - പ്രത്യേകിച്ചും അത് ഒരു പ്രവർത്തനത്തിലേക്ക് വിവർത്തനം ചെയ്യുകയാണെങ്കിൽ.
  4. മനുഷ്യ അംഗീകാരം: ഉയർന്ന അപകടസാധ്യതയുള്ള പ്രവർത്തനങ്ങളെ അംഗീകാരവുമായി ബന്ധിപ്പിക്കുക.
മുൻകരുതൽ: ഒറ്റ പ്രതിരോധം കൊണ്ട് നിങ്ങൾക്ക് പെട്ടെന്ന് കുത്തിവയ്പ്പ് പൂർണ്ണമായും പരിഹരിക്കാൻ കഴിയില്ല; ലേയേർഡ് ഡിഫൻസ് (ആഴത്തിൽ പ്രതിരോധം) ആവശ്യമാണ്. നിർണായക അനുമാനം: "മോഡൽ ചില സമയങ്ങളിൽ കബളിപ്പിക്കപ്പെട്ടേക്കാം; അതിനാൽ അത് വഞ്ചിക്കപ്പെട്ടാൽ സംഭവിക്കുന്ന ഏറ്റവും മോശമായത് എന്താണ്, ഞാൻ അത് എങ്ങനെ പരിമിതപ്പെടുത്തും?"

ദുർബലമായ സമീപനം / ശക്തമായ സമീപനം

ദുർബലമായത്: "സിസ്റ്റം പ്രോംപ്റ്റിൽ ഞാൻ 'മോശമായ നിർദ്ദേശങ്ങൾ അവഗണിക്കുക' എന്ന് ടൈപ്പ് ചെയ്തു, ഞങ്ങൾ സുരക്ഷിതരാണ്."

ശക്തമായത്: "ഞങ്ങൾ ബാഹ്യ ഉള്ളടക്കം <data> ടാഗുകൾ ഉപയോഗിച്ച് പൊതിഞ്ഞ് 'ഉള്ളിലെ നിർദ്ദേശങ്ങൾ അവഗണിക്കുക' എന്ന് പറഞ്ഞു. ഞങ്ങൾ മോഡലിൻ്റെ ടൂളുകളെ ഏറ്റവും കുറഞ്ഞ അംഗീകാരത്തിലേക്ക് പരിമിതപ്പെടുത്തി, മാറ്റാനാകാത്ത പ്രവർത്തനങ്ങളെ മനുഷ്യൻ്റെ അംഗീകാരത്തിലേക്ക് പരിമിതപ്പെടുത്തി, എല്ലാ ടൂൾ കോളുകളും ലോഗ് ചെയ്തു, കൂടാതെ ഉപയോഗത്തിന് മുമ്പ് ഔട്ട്‌പുട്ട് റൂൾ ചെക്കുകൾക്ക് വിധേയമാക്കി. ഞങ്ങൾ ലെയറുകളിലാണ് ആശ്രയിക്കുന്നത്, ഒരു പ്രതിരോധമല്ല."

വ്യത്യാസം: ശക്തമായ സമീപനത്തിന് ഒറ്റവരി നിർദ്ദേശം മതിയാകില്ലെന്നും കേടുപാടുകൾ പരിമിതപ്പെടുത്തുന്ന പാളികൾ നിർമ്മിക്കുമെന്നും അറിയാം.

സ്വകാര്യത: തുടക്കം മുതൽ ഡാറ്റ പരിരക്ഷിച്ചിരിക്കുന്നു

സ്വകാര്യത എന്നത് പിന്നീട് ചേർത്ത ഒരു ഫീച്ചറല്ല, അതൊരു ഡിസൈൻ തത്വമാണ് (രൂപകൽപ്പന പ്രകാരം സ്വകാര്യത). അടിസ്ഥാന പ്രയോഗങ്ങൾ:

  • ഡാറ്റ ചെറുതാക്കരുത്: ആവശ്യത്തിലധികം വ്യക്തിഗത ഡാറ്റ ശേഖരിക്കുകയും സംഭരിക്കുകയും ചെയ്യരുത്. ശേഖരിക്കാത്ത വിവരങ്ങൾ ചോർത്താൻ കഴിയില്ല.
  • അജ്ഞാതമാക്കലും മറയ്ക്കലും: മോഡലിന് നൽകുന്നതിന് മുമ്പ് വ്യക്തിഗത ഐഡൻ്റിഫയറുകൾ (പേര്, ഐഡി, ഇമെയിൽ) മാസ്ക് ചെയ്യുക അല്ലെങ്കിൽ നീക്കം ചെയ്യുക.
  • ആക്സസ് നിയന്ത്രണം: ഡാറ്റയും മോഡലും ആക്സസ് ചെയ്യുന്നവരെ പരിമിതപ്പെടുത്തുകയും ലോഗ് ചെയ്യുകയും ചെയ്യുക (യൂണിറ്റ് 4-ലെ RAG ആക്സസ് നിയന്ത്രണം).
  • നിലനിർത്തൽ കാലയളവ്: നിങ്ങൾ എത്രത്തോളം ഡാറ്റ നിലനിർത്തുന്നുവെന്ന് പോളിസി പ്രകാരം നിർണ്ണയിക്കുക; കാലഹരണപ്പെട്ട ഒന്ന് ഇല്ലാതാക്കുക.

ഡിഫറൻഷ്യൽ പ്രൈവസി (പരിശീലന വേളയിൽ നിയന്ത്രിത ശബ്‌ദം ചേർത്തുകൊണ്ട് ഒരു വ്യക്തിയുടെ ഡാറ്റയെ സാരമായി ബാധിക്കുന്നതിൽ നിന്ന് ഒരു വ്യക്തിയുടെ ഡാറ്റയെ തടയുന്ന ഒരു സാങ്കേതികത), ഫെഡറേറ്റഡ് ലേണിംഗ് (ഡാറ്റയെ കേന്ദ്രത്തിലേക്ക് മാറ്റാതെ ഉപകരണങ്ങളിൽ പരിശീലിപ്പിക്കുന്ന സമീപനം) എന്നിവ വിപുലമായ സ്വകാര്യത സാങ്കേതികതകളാണ്; സെൻസിറ്റീവ് ഡാറ്റയുമായി പ്രവർത്തിക്കുമ്പോൾ പരിഗണിക്കണം.

നുറുങ്ങ്: ഏതെങ്കിലും ഡാറ്റ പ്രോസസ്സ് ചെയ്യുന്നതിന് മുമ്പ്, ചോദിക്കുക: "ഈ സ്വകാര്യ ഡാറ്റ ചോർന്നാൽ, ആർക്കാണ് എന്ത് ദോഷം സംഭവിക്കുക?" കേടുപാടുകൾ ഗുരുതരമാണെങ്കിൽ, ഒന്നുകിൽ ഡാറ്റ ശേഖരിക്കരുത് അല്ലെങ്കിൽ മറച്ചുവെച്ച് പ്രോസസ്സ് ചെയ്യരുത്. ഇതുവരെ ശേഖരിക്കപ്പെടാത്ത ഡാറ്റയാണ് ഏറ്റവും സുരക്ഷിതമായ ഡാറ്റ.

പരിശീലന ഡാറ്റയും മോഡൽ സപ്ലൈ ചെയിൻ സുരക്ഷയും

നിങ്ങളുടെ മോഡൽ പോലെ, നിങ്ങൾ ഉപയോഗിക്കുന്ന ഘടകങ്ങളും ഒരു സുരക്ഷാ പ്രശ്നമാണ്:

  • ഡാറ്റ ഉറവിട ട്രസ്റ്റ്: പരിശീലന ഡാറ്റ വിശ്വസനീയമാണോ അതോ വിഷലിപ്തമാകുമോ? പൊതു ഡാറ്റാ സെറ്റുകൾ ഓഡിറ്റ് ചെയ്യുക.
  • മൂന്നാം കക്ഷി മോഡലുകളും ലൈബ്രറികളും: നിങ്ങൾ ഡൗൺലോഡ് ചെയ്‌ത പ്രീ-ട്രെയിൻഡ് മോഡലോ ആശ്രിതത്വമോ ക്ഷുദ്രകരമായിരിക്കാം. അതിൻ്റെ ഉറവിടം, ഒപ്പ്, അറിയപ്പെടുന്ന കേടുപാടുകൾ എന്നിവ പരിശോധിക്കുക.
  • വിതരണ ശൃംഖല: നിങ്ങളുടെ ML പൈപ്പ്ലൈനിലെ എല്ലാ ഉപകരണവും പാക്കേജും വിശ്വാസത്തിൻ്റെ ഒരു കണ്ണിയാണ്; നിങ്ങൾ ഏറ്റവും ദുർബലമായ ലിങ്ക് പോലെ സുരക്ഷിതനാണ്.

ഉത്തരവാദിത്ത വെളിപ്പെടുത്തലും ധാർമ്മിക അതിരുകളും

നിങ്ങളുടെ സ്വന്തം സിസ്റ്റത്തിലോ വെണ്ടർ സിസ്റ്റത്തിലോ - ഒരു അപകടസാധ്യത കണ്ടെത്തുമ്പോൾ - ശരിയായ കോഴ്സ് ഉത്തരവാദിത്ത വെളിപ്പെടുത്തലാണ്: സ്വകാര്യമായി അപകടസാധ്യത ബന്ധപ്പെട്ട കക്ഷിക്ക് റിപ്പോർട്ട് ചെയ്യുകയും അത് പരിഹരിക്കാൻ സമയം നൽകുകയും ചെയ്യുക, അത് ചൂഷണം ചെയ്യുകയോ പ്രചരിപ്പിക്കുകയോ ചെയ്യരുത്. ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് അല്ലെങ്കിൽ അനധികൃത ആക്‌സസ്, ഡാറ്റ ചോർച്ച അല്ലെങ്കിൽ മറ്റൊരാളുടെ സിസ്റ്റത്തിൽ അനധികൃതമായി ഇടപെടൽ എന്നിവയ്‌ക്കായി നിങ്ങൾ നേടിയ സുരക്ഷാ വിവരങ്ങളോ ഉപയോഗിക്കുന്നത് നിയമവിരുദ്ധവും പ്രൊഫഷണൽ നൈതികതയ്ക്ക് വിരുദ്ധവുമാണ്. ഈ മൊഡ്യൂളിൻ്റെ സുരക്ഷാ ഉള്ളടക്കം പൂർണ്ണമായും പ്രതിരോധം, കണ്ടെത്തൽ, കാഠിന്യം എന്നിവയ്ക്കുള്ളതാണ്.

മൂന്ന് മിനി കേസുകൾ

കേസ് 1 - പരോക്ഷ കുത്തിവയ്പ്പിൻ്റെ പരിമിതി. ഒരു RAG സപ്പോർട്ട് ബോട്ട് വെബ് ഉള്ളടക്കം റെൻഡർ ചെയ്യുകയായിരുന്നു. മറഞ്ഞിരിക്കുന്ന നിർദ്ദേശങ്ങൾ ഒരു പേജിൽ അടക്കം ചെയ്തു. മോഡൽ ഭാഗികമായി കബളിപ്പിക്കപ്പെട്ടു, പക്ഷേ ബോട്ടിന് റൈറ്റ് പ്രിവിലേജുകളൊന്നും ഉണ്ടായിരുന്നില്ല (മിനിമൽ പ്രിവിലേജുകൾ) കൂടാതെ ഉപയോക്താവിന് പ്രദർശിപ്പിക്കുന്നതിന് മുമ്പ് റൂൾ ചെക്കിംഗിലൂടെ ഔട്ട്പുട്ട് കൈമാറി; അത് ഹാനികരമായി മാറുകയും പിടികൂടുകയും ചെയ്തു. പാളികളുള്ള പ്രതിരോധം ഒരു പരാജയം ഒരു ദുരന്തമാകുന്നതിൽ നിന്ന് തടഞ്ഞു.

കേസ് 2 - രഹസ്യ ഡാറ്റ ചോർച്ച. ഒരു ടീം ഫൈൻ-ട്യൂൺ ചെയ്ത ഉപഭോക്തൃ പിന്തുണ അവരെ മറയ്ക്കാതെ ഒരു മോഡലിലേക്ക് ലോഗിൻ ചെയ്യുന്നു (യൂണിറ്റ് 6). മോഡൽ അപ്രസക്തമായ ചോദ്യങ്ങളിൽ യഥാർത്ഥ ഉപഭോക്തൃ പേരുകൾ സൃഷ്ടിക്കാൻ തുടങ്ങി. അംഗത്വം നീക്കം ചെയ്യാനുള്ള സാധ്യതയും ഉണ്ടായിരുന്നു. മോഡൽ പിൻവലിച്ചു, ഡാറ്റ മാസ്ക് ചെയ്തു, നിലനിർത്തൽ നയം തിരുത്തി. പാഠം: രഹസ്യാത്മക ഡാറ്റ വിദ്യാഭ്യാസത്തിൽ പ്രവേശിക്കരുത്.

കേസ് 3 - വിഷ ഡാറ്റ സെറ്റ്. ഒരു ടീം ഓഡിറ്റ് ചെയ്യാതെ തന്നെ പൊതുവായി ലഭ്യമായ ഡാറ്റാസെറ്റിൽ പരിശീലിച്ചു. ഒരു നിർദ്ദിഷ്ട ട്രിഗർ വാക്ക് (ബാക്ക്‌ഡോർ) കണ്ടപ്പോൾ മോഡലിനെ കബളിപ്പിക്കുന്ന വിഷ സാമ്പിളുകൾ സെറ്റിൽ ഉണ്ടായിരുന്നു. ഓഡിറ്റിംഗും അനോമലി സ്കാനിംഗും ചേർത്ത ശേഷം ഈ സാമ്പിളുകൾ പിടിച്ചെടുത്തു. പാഠം: ഡാറ്റ ഉറവിടം പരിശോധിക്കുക, അന്ധമായി വിശ്വസിക്കരുത്.

പകർത്താവുന്ന ടെംപ്ലേറ്റുകൾ

Check this LLM/agent system for prompt injection.- Are system instructions and user/external data clearly separated?- Is external content marked as "data" or is it handled as a command?- What is the worst that would happen if the model is fooled (authorization limit)?- Are irreversible actions subject to human approval?- Is the output inspected before use?System: [description]. ലേയേർഡ് ഡിഫൻസീവ് പോരായ്മകൾ പട്ടികപ്പെടുത്തുക.

രഹസ്യാത്മകതയ്ക്കായി ഈ ഡാറ്റ പ്രോസസ്സിംഗ് ഫ്ലോ ഓഡിറ്റ് ചെയ്യുക.- ശേഖരിച്ച ഓരോ വ്യക്തിഗത ഫീൽഡും ശരിക്കും ആവശ്യമാണോ (മിനിമൈസേഷൻ)?- മോഡലിലേക്ക് പോകുന്ന ഡാറ്റയിൽ ഏതൊക്കെ ഫീൽഡുകൾ മറയ്ക്കണം?- ആക്സസ് നിയന്ത്രണവും ലോഗിംഗും ഉണ്ടോ?- നിലനിർത്തൽ കാലയളവ് നിർവചിച്ചിട്ടുണ്ടോ?ഫ്ലോ: [വിവരണം]. ഓരോ കുറവിനും തിരുത്തൽ നിർദ്ദേശിക്കുക.

ഈ വാചകത്തിൽ, മോഡലിലേക്ക് അയയ്‌ക്കുന്നതിന് മുമ്പ് മറയ്ക്കേണ്ട വ്യക്തിഗത ഡാറ്റ കണ്ടെത്തുക. ഫീൽഡുകൾ: പേര്, ഇമെയിൽ, ഫോൺ, ഐഡി/പാസ്‌പോർട്ട് നമ്പർ, വിലാസം, കാർഡ് നമ്പർ, ഐപി. ഓരോ കണ്ടെത്തലും അതിൻ്റെ തരവും ശുപാർശ ചെയ്യുന്ന മാസ്‌കും ഉപയോഗിച്ച് ലിസ്റ്റ് ചെയ്യുക. ബാക്കിയുള്ള വാചകം മാറ്റിസ്ഥാപിക്കരുത്. ടെക്സ്റ്റ്: [ടെക്സ്റ്റ്]

ഈ മൂന്നാം കക്ഷി മോഡൽ/ലൈബ്രറി നിർമ്മിക്കുന്നതിന് മുമ്പ് ഒരു സുരക്ഷാ ചെക്ക്‌ലിസ്റ്റ് സൃഷ്‌ടിക്കുക.- ഉറവിടവും പ്രസാധകരും വിശ്വസനീയമാണോ, ഒപ്പ് പരിശോധിച്ചിട്ടുണ്ടോ?- അറിയപ്പെടുന്ന കേടുപാടുകൾക്കായി സ്‌കാൻ ചെയ്‌തിട്ടുണ്ടോ (CVE)?- ഇതിന് എന്ത് പ്രത്യേകാവകാശങ്ങൾ/ആക്സസ് ആവശ്യമാണ്, ഇത് കുറയ്ക്കാൻ കഴിയുമോ?ഘടകം: [പേര്/ഉറവിടം]

അപകട-പ്രതിരോധ പട്ടിക

റിസ്ക്

പ്രതിരോധം

പാളി

പെട്ടെന്നുള്ള കുത്തിവയ്പ്പ്

പാഴ്‌സിംഗ് + മിനിമൽ പ്രിവിലേജ് + ഔട്ട്‌പുട്ട് നിയന്ത്രണം

ഡിസൈൻ + റൺടൈം

ഡാറ്റ വിഷബാധ

ഉറവിട നിയന്ത്രണം + അനോമലി സ്കാനിംഗ്

ഡാറ്റ ലൈൻ

രഹസ്യ ഡാറ്റ ചോർച്ച

മാസ്കിംഗ് + ഡാറ്റ ചെറുതാക്കൽ

ഡാറ്റ + പരിശീലനം

അംഗത്വം വേർതിരിച്ചെടുക്കൽ

വ്യത്യസ്തമായ സ്വകാര്യത

വിദ്യാഭ്യാസം

അമിതമായ അധികാരം

കുറഞ്ഞ അംഗീകാരം + അംഗീകാരം

ഏജൻ്റ് ഡിസൈൻ

വിതരണ ശൃംഖല

ഘടക പരിശോധന + ഒപ്പ്

ആസക്തി

സാധാരണ തെറ്റുകൾ

  • ഒറ്റവരി കൊണ്ട് പെട്ടെന്നുള്ള കുത്തിവയ്പ്പ് നിങ്ങൾ പരിഹരിച്ചുവെന്ന് കരുതുന്നു. പാളികളുള്ള പ്രതിരോധം അനിവാര്യമാണ്.
  • രഹസ്യാത്മക ഡാറ്റ മറയ്ക്കാതെ പ്രോസസ്സ് ചെയ്യുക/പരിശീലിപ്പിക്കുക. മോഡലിൽ ശാശ്വതമായി നുഴഞ്ഞുകയറുന്നു.
  • വിശ്വസനീയമായ ബാഹ്യ ഉള്ളടക്കം പരിഗണിക്കുന്നത്. പരോക്ഷ കുത്തിവയ്പ്പ് ഗേറ്റ്.
  • ഡാറ്റ ഉറവിടം പരിശോധിക്കുന്നില്ല. വിഷബാധ ശ്രദ്ധിക്കപ്പെടാതെ പോകുന്നു.
  • മൂന്നാം കക്ഷി ഘടകത്തെ അന്ധമായി വിശ്വസിക്കുന്നു. വിതരണ ശൃംഖല വിടവ്.
  • സ്വകാര്യത പിന്നീട് ചേർക്കുമെന്ന് കരുതി. ഇത് ഡിസൈനിൽ നിന്ന് ആരംഭിക്കണം.

ചുരുക്കത്തിൽ

ക്ലാസിക്കൽ സുരക്ഷാ അപകടസാധ്യതകൾ കൂടാതെ, AI സിസ്റ്റങ്ങൾ വേഗത്തിലുള്ള കുത്തിവയ്പ്പ്, ഡാറ്റാ വിഷബാധ, രഹസ്യാത്മക ഡാറ്റ ചോർച്ച, അംഗത്വം വേർതിരിച്ചെടുക്കൽ തുടങ്ങിയ സവിശേഷമായ ഭീഷണികൾ വഹിക്കുന്നു. അവയൊന്നും ഒരു അളവുകോൽ കൊണ്ട് പരിഹരിക്കാവുന്നതല്ല; ലേയേർഡ് ഡിഫൻസ് (പാഴ്സിംഗ്, കുറഞ്ഞ അംഗീകാരം, ഔട്ട്പുട്ട് നിയന്ത്രണം, മനുഷ്യ അംഗീകാരം) ആവശ്യമാണ്. സ്വകാര്യത ഒരു ഡിസൈൻ തത്വമാണ്: ഡാറ്റ ചെറുതാക്കുക, മറയ്ക്കുക, ആക്‌സസ് പരിമിതപ്പെടുത്തുക, നിലനിർത്തൽ കാലയളവുകൾ ഏർപ്പെടുത്തുക. ഘടകവും ഡാറ്റ വിതരണ ശൃംഖലയും നിയന്ത്രിക്കുക. ഈ വിവരങ്ങളെല്ലാം പ്രതിരോധത്തിനും കണ്ടെത്തലിനും ഏകീകരണത്തിനുമുള്ളതാണ്; കേടുപാടുകൾ ഉത്തരവാദിത്തത്തോടെ വിശദീകരിക്കുക, ഒരിക്കലും ചൂഷണം ചെയ്യരുത്.

ആപ്ലിക്കേഷൻ ടാസ്ക്

Check an LLM/agent system (your own project or example) for prompt injection: are system instructions and external data separated, what is the authorization limit if the model is tricked, are irreversible actions confirmed? പ്രതിരോധത്തിൻ്റെ രണ്ട് പാളികളെങ്കിലും ചേർക്കുക. മോഡലിലേക്ക് പോകുന്ന സാമ്പിൾ ഡാറ്റയിൽ മാസ്ക് ചെയ്യേണ്ട ഏതെങ്കിലും വ്യക്തിഗത ഫീൽഡുകൾ പ്രത്യേകം കണ്ടെത്തി മാസ്ക് ചെയ്യുക. നിങ്ങൾ ഉപയോഗിക്കുന്ന ഏതെങ്കിലും മൂന്നാം കക്ഷി ഘടകത്തിൻ്റെ ഉറവിടവും അറിയപ്പെടുന്ന കേടുപാടുകളും പരിശോധിക്കുക.

ചെക്ക്ലിസ്റ്റ്

  • [ ] System instruction and external/user data are clearly separated.
  • [ ] ബാഹ്യ ഉള്ളടക്കം ഡാറ്റയായി അടയാളപ്പെടുത്തിയിരിക്കുന്നു, കമാൻഡുകളല്ല.
  • [ ] മോഡൽ കബളിപ്പിക്കപ്പെട്ടാലും, കേടുപാടുകൾ ചുരുങ്ങിയ അധികാരത്തിൽ പരിമിതപ്പെടുത്തിയിരിക്കുന്നു.
  • [ ] വ്യക്തിഗത ഡാറ്റ മറച്ചു/കുറച്ചു; സംഭരണ ​​കാലയളവ് നിർവചിച്ചിരിക്കുന്നു.
  • [ ] ഡാറ്റ ഉറവിടവും മൂന്നാം കക്ഷി ഘടകങ്ങളും പരിശോധിച്ചു.
  • [ ] എൻ്റെ സുരക്ഷാ ജോലി പ്രതിരോധ ആവശ്യങ്ങൾക്കുള്ളതാണ്; ഞാൻ വിടവുകൾ ഉത്തരവാദിത്തത്തോടെ വിശദീകരിക്കുന്നു.