యూనిట్లు
1. ML ఇంజనీరింగ్‌లో ఆర్టిఫిషియల్ ఇంటెలిజెన్స్: పాత్ర, సరిహద్దులు, ధ్రువీకరణ మరియు బాధ్యత 2. డేటా పైప్‌లైన్: సేకరణ, శుభ్రపరచడం, ట్యాగింగ్ మరియు సంస్కరణ 3. మోడల్ శిక్షణ మరియు మూల్యాంకనం: ఖచ్చితమైన కొలమానాలు, నిజాయితీ బెంచ్‌మార్కింగ్ 4. LLM అప్లికేషన్: RAGతో మీ స్వంత డేటా ఆధారంగా సమాధానాలు 5. LLM అప్లికేషన్: ఏజెంట్లు, టూలింగ్ మరియు సురక్షిత ఆటోమేషన్ 6. ఫైన్-ట్యూనింగ్ బేసిస్: ఎప్పుడు, ఎలా మరియు ఏ ప్రమాదంతో 7. MLOps మరియు విస్తరణ: మోడల్‌ను ల్యాబ్ నుండి ఉత్పత్తికి తరలించడం 8. ఈవల్ మరియు మానిటరింగ్: ఉత్పత్తిలో మోడల్ నిజంగా ఏమి చేస్తుందో తెలుసుకోవడం 9. భద్రత మరియు గోప్యత: డిఫెండింగ్ AI సిస్టమ్స్ 10. బయాస్, ఎథిక్స్ అండ్ కాస్ట్: రెస్పాన్సిబుల్ అండ్ సస్టైనబుల్ AI ఇంజనీరింగ్ 11. పునరుత్పత్తి మరియు ఎండ్-టు-ఎండ్ ప్రాజెక్ట్: ప్రతిదీ కలపడం
యూనిట్ 9 / 11

భద్రత మరియు గోప్యత: డిఫెండింగ్ AI సిస్టమ్స్

లాభాలు:

  • AI-నిర్దిష్ట దాడి ఉపరితలాలను గుర్తించే సామర్థ్యం (ప్రాంప్ట్ ఇంజెక్షన్, డేటా పాయిజనింగ్, కాన్ఫిడెన్షియల్ డేటా లీకేజ్, మెంబర్‌షిప్ ఎక్స్‌ట్రాక్షన్) మరియు లేయర్డ్ డిఫెన్స్‌లను రూపొందించడం
  • గోప్యతను డిజైన్ సూత్రంగా వర్తించే సామర్థ్యం: డేటా కనిష్టీకరణ, మాస్కింగ్, యాక్సెస్ నియంత్రణ మరియు నిలుపుదల కాలం
  • రక్షణ ప్రయోజనాల కోసం మాత్రమే భద్రతా పనిని నిర్వహించడం, హానిని బాధ్యతాయుతంగా బహిర్గతం చేయడం మరియు అనధికార వినియోగాన్ని నివారించడం

మెషీన్ లెర్నింగ్ సిస్టమ్ సాంప్రదాయ సాఫ్ట్‌వేర్ యొక్క అన్ని భద్రతా ప్రమాదాలను కలిగి ఉంటుంది మరియు ప్రత్యేకమైన కొత్త దాడి ఉపరితలాలను జోడిస్తుంది. మోడల్‌ను ఇన్‌పుట్ ద్వారా మోసం చేయవచ్చు, శిక్షణ డేటా విషపూరితం కావచ్చు మరియు రహస్య సమాచారం అవుట్‌పుట్‌లోకి లీక్ కావచ్చు. ఈ యూనిట్‌లో, మేము AI సిస్టమ్‌లను రక్షణ దృక్కోణం నుండి పరిశీలిస్తాము: దాడులను గుర్తించడం, సిస్టమ్‌ను గట్టిపరచడం, గోప్యతను రక్షించడం. ఈ సమాచారం అనధికారిక యాక్సెస్ లేదా దాడి కోసం కాదు, మీ స్వంత సిస్టమ్‌లను సురక్షితంగా ఉంచడానికి.

AI-నిర్దిష్ట దాడి ఉపరితలాలు

క్లాసిక్ సెక్యూరిటీతో పాటు (ప్రామాణీకరణ, అధికారం, ఎన్‌క్రిప్షన్), ML సిస్టమ్‌లు వీటికి హాని కలిగిస్తాయి:

  • ప్రాంప్ట్ ఇంజెక్షన్: LLMకి ఇన్‌పుట్‌లో దాచబడిన సూచన మోడల్‌ను కోల్పోతుంది. అత్యంత సాధారణ మరియు అత్యంత ఆచరణాత్మక LLM భద్రతా ప్రమాదం.
  • డేటా పాయిజనింగ్: దాడి చేసే వ్యక్తి శిక్షణ డేటాలో చెడు నమూనాలను చొప్పించడం ద్వారా దాచిన బ్యాక్‌డోర్ లేదా పక్షపాతాన్ని మోడల్‌లోకి ప్రవేశపెడతాడు.
  • మోడల్ అనుమితి మరియు విలోమం: దాడి చేసే వ్యక్తి మోడల్‌కు బహుళ ప్రశ్నలను పంపడం ద్వారా శిక్షణ డేటా లేదా మోడల్ ప్రవర్తనను పునర్నిర్మిస్తాడు.
  • సభ్యత్వ అనుమితి: విద్యలో నిర్దిష్ట వ్యక్తి యొక్క డేటా ఉపయోగించబడుతుందో లేదో ఊహించడం — గోప్యతా ఉల్లంఘన.
  • సున్నితమైన డేటా లీక్: మోడల్ అవుట్‌పుట్‌లోని శిక్షణ డేటాలో రహస్య సమాచారాన్ని (పేరు, గుర్తింపు, రహస్యం) వెల్లడిస్తుంది.

ఈ ప్రమాదాలలో ప్రతిదానికి రక్షణలు ఉన్నాయి; డిజైన్ దశలో ప్రమాదాన్ని పరిగణనలోకి తీసుకోవడం ప్రధాన విషయం.

ప్రాంప్ట్ ఇంజెక్షన్: అత్యంత తక్షణ ముప్పు

ప్రాంప్ట్ ఇంజెక్షన్లో రెండు రకాలు ఉన్నాయి:

  • ప్రత్యక్షం: వినియోగదారు వ్యక్తిగతంగా "మునుపటి సూచనలను విస్మరించు" వంటి వచనాన్ని నమోదు చేస్తారు.
  • పరోక్ష: మోడల్ ప్రాసెస్ చేసే బాహ్య సందర్భంలో (వెబ్ పేజీ, పత్రం, ఇమెయిల్) చెడు సూచన దాచబడింది. మోడల్ బాహ్య కంటెంట్‌ను విశ్వసనీయంగా నిర్వహిస్తుంది కాబట్టి ఏజెంట్లు మరియు RAGకి ముఖ్యంగా ప్రమాదకరం.

రక్షణ పొరలు:

  1. Parsing: Separate system instruction and user/external data with clear delimiters; బాహ్య కంటెంట్‌ను "డేటా, ఆదేశాలు కాదు"గా గుర్తించండి.
  2. కనిష్ట అధికారాలు: మోడల్ క్యాప్చర్ చేయబడినప్పటికీ ఎంత నష్టాన్ని కలిగిస్తుందో పరిమితం చేయండి (యూనిట్ 5లో వాహన అధికారాలు).
  3. అవుట్‌పుట్ నియంత్రణ: మీరు మోడల్‌ని ఉపయోగించే ముందు మోడల్ ఏమి ఉత్పత్తి చేస్తుందో ధృవీకరించండి - ప్రత్యేకించి అది చర్యగా అనువదిస్తే.
  4. మానవ ఆమోదం: అధిక-ప్రమాదకర చర్యలను ఆమోదంతో ముడిపెట్టండి.
జాగ్రత్త: మీరు ఒకే రక్షణతో ప్రాంప్ట్ ఇంజెక్షన్‌ను పూర్తిగా పరిష్కరించలేరు; లేయర్డ్ డిఫెన్స్ (లోతులో రక్షణ) అవసరం. క్లిష్టమైన ఊహ: "మోడల్ ఏదో ఒక సమయంలో మోసపోవచ్చు; కాబట్టి అది మోసగించబడితే జరిగే చెత్త ఏమిటి మరియు నేను దానిని ఎలా పరిమితం చేయాలి?"

బలహీనమైన విధానం / బలమైన విధానం

బలహీనం: "నేను సిస్టమ్ ప్రాంప్ట్‌లో 'చెడు సూచనలను విస్మరించండి' అని టైప్ చేసాను మరియు మేము సురక్షితంగా ఉన్నాము."

బలమైనది: "మేము బాహ్య కంటెంట్‌ను <data> ట్యాగ్‌లతో చుట్టాము మరియు 'లోపల సూచనలను విస్మరించండి' అని చెప్పాము. మేము మోడల్ సాధనాలను కనిష్ట అధికారానికి పరిమితం చేసాము, మానవ ఆమోదానికి తిరుగులేని చర్యలను ముడిపెట్టాము, అన్ని టూల్ కాల్‌లను లాగ్ చేసాము మరియు అవుట్‌పుట్‌ను ఉపయోగించే ముందు రూల్ చెక్‌లకు గురి చేసాము. మేము లేయర్‌లపై ఆధారపడతాము, ఒక్క రక్షణపై కాదు."

తేడా: బలమైన విధానం ఒక-లైన్ సూచన సరిపోదని తెలుసు మరియు నష్టాన్ని పరిమితం చేసే పొరలను నిర్మిస్తుంది.

గోప్యత: డేటా ప్రారంభం నుండి రక్షించబడింది

గోప్యత అనేది తర్వాత జోడించబడిన లక్షణం కాదు, ఇది డిజైన్ సూత్రం (డిజైన్ ద్వారా గోప్యత). ప్రాథమిక అప్లికేషన్లు:

  • డేటా కనిష్టీకరణ: అవసరమైన దానికంటే ఎక్కువ వ్యక్తిగత డేటాను సేకరించి నిల్వ చేయవద్దు. సేకరించని డేటా లీక్ చేయబడదు.
  • అనామకీకరణ మరియు మాస్కింగ్: వ్యక్తిగత ఐడెంటిఫైయర్‌లను (పేరు, ID, ఇమెయిల్) మోడల్‌కి ఇచ్చే ముందు వాటిని మాస్క్ చేయండి లేదా తీసివేయండి.
  • యాక్సెస్ నియంత్రణ: డేటా మరియు మోడల్‌ను ఎవరు యాక్సెస్ చేస్తారో పరిమితం చేయండి మరియు లాగ్ చేయండి (యూనిట్ 4లో RAG యాక్సెస్ కంట్రోల్).
  • నిలుపుదల కాలం: మీరు డేటాను ఎంతకాలం నిల్వ ఉంచారో పాలసీ ద్వారా నిర్ణయించండి; గడువు ముగిసిన దాన్ని తొలగించండి.

డిఫరెన్షియల్ గోప్యత (శిక్షణ సమయంలో నియంత్రిత శబ్దాన్ని జోడించడం ద్వారా అవుట్‌పుట్‌ను గణనీయంగా ప్రభావితం చేయకుండా ఒక వ్యక్తి యొక్క డేటాను నిరోధించే సాంకేతికత) మరియు ఫెడరేటెడ్ లెర్నింగ్ (డేటాను కేంద్రానికి తరలించకుండా పరికరాలపై శిక్షణ ఇచ్చే విధానం) అధునాతన గోప్యతా పద్ధతులు; సున్నితమైన డేటాతో పని చేస్తున్నప్పుడు పరిగణించాలి.

చిట్కా: ఏదైనా డేటాను ప్రాసెస్ చేసే ముందు, ఇలా అడగండి: "ఈ వ్యక్తిగత డేటా లీక్ అయితే, ఎవరికి ఎలాంటి హాని కలుగుతుంది?" నష్టం తీవ్రంగా ఉంటే, డేటాను అస్సలు సేకరించవద్దు లేదా దానిని మాస్క్ చేయడం ద్వారా ప్రాసెస్ చేయవద్దు. ఎప్పుడూ సేకరించని డేటా సురక్షితమైన డేటా.

శిక్షణ డేటా మరియు మోడల్ సరఫరా గొలుసు భద్రత

మీ మోడల్ వలె, మీరు ఉపయోగించే భాగాలు కూడా భద్రతా సమస్యగా ఉంటాయి:

  • డేటా సోర్స్ ట్రస్ట్: శిక్షణ డేటా నమ్మదగినదా లేదా విషపూరితం కాగలదా? పబ్లిక్ డేటా సెట్‌లను ఆడిట్ చేయండి.
  • థర్డ్-పార్టీ మోడల్‌లు మరియు లైబ్రరీలు: మీరు డౌన్‌లోడ్ చేసిన ప్రీ-ట్రైన్డ్ మోడల్ లేదా డిపెండెన్సీ హానికరమైనది కావచ్చు. దాని మూలం, సంతకం మరియు తెలిసిన దుర్బలత్వాలను తనిఖీ చేయండి.
  • సరఫరా గొలుసు: మీ ML పైప్‌లైన్‌లోని ప్రతి సాధనం మరియు ప్యాకేజీ నమ్మకానికి సంబంధించిన లింక్; మీరు బలహీనమైన లింక్ వలె సురక్షితంగా ఉన్నారు.

బాధ్యతాయుతమైన బహిర్గతం మరియు నైతిక సరిహద్దులు

మీరు మీ స్వంత సిస్టమ్ లేదా విక్రేత సిస్టమ్‌లో హానిని కనుగొన్నప్పుడు - సరైన కోర్సు బాధ్యతాయుతమైన బహిర్గతం: ప్రైవేట్‌గా హానిని సంబంధిత పక్షానికి నివేదించడం మరియు దాన్ని పరిష్కరించడానికి సమయం ఇవ్వడం, దానిని దోపిడీ చేయడం లేదా ప్రచారం చేయడం కాదు. ఆర్టిఫిషియల్ ఇంటెలిజెన్స్ లేదా మీరు అనధికారిక యాక్సెస్, డేటా లీకేజ్ లేదా మరొకరి సిస్టమ్‌లో అనధికారిక జోక్యం కోసం పొందిన భద్రతా సమాచారాన్ని ఉపయోగించడం చట్టవిరుద్ధం మరియు వృత్తిపరమైన నీతికి విరుద్ధం. ఈ మాడ్యూల్ యొక్క భద్రతా కంటెంట్ పూర్తిగా రక్షణ, గుర్తింపు మరియు గట్టిపడే ప్రయోజనాల కోసం.

మూడు చిన్న కేసులు

కేసు 1 - పరోక్ష ఇంజెక్షన్ యొక్క పరిమితి. RAG సపోర్ట్ బాట్ వెబ్ కంటెంట్‌ను రెండరింగ్ చేస్తోంది. దాచిన సూచనలు ఒక పేజీలో పూడ్చబడ్డాయి. మోడల్ పాక్షికంగా మోసం చేయబడింది, కానీ బోట్‌కు వ్రాత అధికారాలు (కనీస అధికారాలు) లేవు మరియు వినియోగదారుకు ప్రదర్శించబడే ముందు రూల్ చెకింగ్ ద్వారా అవుట్‌పుట్ పంపబడింది; ఇది హానికరమని తేలింది మరియు పట్టుకున్నారు. లేయర్డ్ డిఫెన్స్ ఒక్క వైఫల్యాన్ని విపత్తుగా మార్చకుండా నిరోధించింది.

కేసు 2 - రహస్య డేటా లీక్. ఒక బృందం ఫైన్-ట్యూన్ చేసిన కస్టమర్ సపోర్ట్ వాటిని మాస్క్ చేయకుండా మోడల్‌లోకి లాగ్ చేస్తుంది (యూనిట్ 6). మోడల్ అసంబద్ధమైన ప్రశ్నలలో నిజమైన కస్టమర్ పేర్లను రూపొందించడం ప్రారంభించింది. సభ్యత్వం తొలగించే ప్రమాదం కూడా ఉంది. మోడల్ ఉపసంహరించబడింది, డేటా మాస్క్ చేయబడింది, నిలుపుదల విధానం సరిదిద్దబడింది. పాఠం: రహస్య డేటా విద్యను నమోదు చేయకూడదు.

కేసు 3 - విషపూరిత డేటా సెట్. ఒక బృందం ఆడిట్ చేయకుండానే పబ్లిక్‌గా అందుబాటులో ఉన్న డేటాసెట్‌పై శిక్షణ పొందింది. నిర్దిష్ట ట్రిగ్గర్ పదాన్ని (బ్యాక్‌డోర్) చూసినప్పుడు మోడల్‌ను మోసం చేసే విషపూరిత నమూనాలు సెట్‌లో ఉన్నాయి. ఆడిటింగ్ మరియు అనోమలీ స్కానింగ్‌ని జోడించిన తర్వాత, ఈ నమూనాలు సంగ్రహించబడ్డాయి. పాఠం: డేటా మూలాన్ని తనిఖీ చేయండి, గుడ్డిగా విశ్వసించవద్దు.

కాపీ చేయగల టెంప్లేట్లు

Check this LLM/agent system for prompt injection.- Are system instructions and user/external data clearly separated?- Is external content marked as "data" or is it handled as a command?- What is the worst that would happen if the model is fooled (authorization limit)?- Are irreversible actions subject to human approval?- Is the output inspected before use?System: [description]. లేయర్డ్ డిఫెన్సివ్ లోపాలను జాబితా చేయండి.

గోప్యత కోసం ఈ డేటా ప్రాసెసింగ్ ఫ్లోను ఆడిట్ చేయండి.- సేకరించిన ప్రతి వ్యక్తిగత ఫీల్డ్ నిజంగా అవసరమా (కనిష్టీకరణ)?- మోడల్‌కి వెళ్లే డేటాలో ఏ ఫీల్డ్‌లను మాస్క్ చేయాలి?- యాక్సెస్ కంట్రోల్ మరియు లాగింగ్ ఉందా?- నిలుపుదల వ్యవధి నిర్వచించబడిందా? ఫ్లో: [వివరణ]. ప్రతి లోపం కోసం సవరణను సూచించండి.

ఈ టెక్స్ట్‌లో, మోడల్‌కి పంపే ముందు మాస్క్ చేయాల్సిన వ్యక్తిగత డేటాను కనుగొనండి. ఫీల్డ్‌లు: పేరు, ఇమెయిల్, ఫోన్, ID/పాస్‌పోర్ట్ నంబర్, చిరునామా, కార్డ్ నంబర్, IP. ప్రతి అన్వేషణను దాని రకం మరియు సిఫార్సు చేయబడిన ముసుగుతో జాబితా చేయండి. మిగిలిన వచనాన్ని భర్తీ చేయవద్దు. వచనం: [టెక్స్ట్]

ఈ థర్డ్-పార్టీ మోడల్/లైబ్రరీని ఉత్పత్తిలో పెట్టడానికి ముందు సెక్యూరిటీ చెక్‌లిస్ట్‌ను రూపొందించండి.- మూలం మరియు ప్రచురణకర్త విశ్వసనీయంగా ఉన్నారా, సంతకం ధృవీకరించబడిందా?- తెలిసిన దుర్బలత్వాల కోసం స్కాన్ చేయబడిందా (CVE)?- దీనికి ఎలాంటి అధికారాలు/యాక్సెస్ అవసరం, దానిని తగ్గించవచ్చా? భాగం: [పేరు/మూలం]

ప్రమాద-రక్షణ పట్టిక

ప్రమాదం

రక్షణ

పొర

తక్షణ ఇంజెక్షన్

పార్సింగ్ + కనీస హక్కు + అవుట్‌పుట్ నియంత్రణ

డిజైన్ + రన్‌టైమ్

డేటా విషపూరితం

మూల నియంత్రణ + అసాధారణ స్కానింగ్

డేటా లైన్

కాన్ఫిడెన్షియల్ డేటా లీక్

మాస్కింగ్ + డేటా కనిష్టీకరణ

డేటా + శిక్షణ

సభ్యత్వ వెలికితీత

అవకలన గోప్యత

విద్య

అధిక అధికారం

కనీస అధికారం + ఆమోదం

ఏజెంట్ డిజైన్

సరఫరా గొలుసు

కాంపోనెంట్ తనిఖీ + సంతకం

వ్యసనం

సాధారణ తప్పులు

  • మీరు ఒకే లైన్‌తో ప్రాంప్ట్ ఇంజెక్షన్‌ని పరిష్కరించారని ఆలోచిస్తున్నారు. లేయర్డ్ డిఫెన్స్ తప్పనిసరి.
  • గోప్యమైన డేటాను మాస్క్ చేయకుండా ప్రాసెస్ చేయడం/శిక్షణ ఇవ్వడం. శాశ్వతంగా మోడల్‌లోకి చొచ్చుకుపోతుంది.
  • బాహ్య కంటెంట్ నమ్మదగినదిగా పరిగణించడం. పరోక్ష ఇంజెక్షన్ గేట్.
  • డేటా మూలాన్ని తనిఖీ చేయడం లేదు. విషప్రయోగం గుర్తించబడదు.
  • థర్డ్-పార్టీ కాంపోనెంట్‌ని గుడ్డిగా నమ్మడం. సరఫరా గొలుసు గ్యాప్.
  • తర్వాత ప్రైవసీ యాడ్ అవుతుందని ఆలోచిస్తున్నా. ఇది డిజైన్ నుండి ప్రారంభం కావాలి.

సారాంశంలో

క్లాసికల్ సెక్యూరిటీ రిస్క్‌లతో పాటు, AI సిస్టమ్‌లు ప్రాంప్ట్ ఇంజెక్షన్, డేటా పాయిజనింగ్, కాన్ఫిడెన్షియల్ డేటా లీకేజ్ మరియు మెంబర్‌షిప్ వెలికితీత వంటి ప్రత్యేకమైన బెదిరింపులను కలిగి ఉంటాయి. వాటిలో ఏదీ ఒకే కొలతతో పరిష్కరించబడదు; లేయర్డ్ డిఫెన్స్‌లు (అన్వయించడం, తక్కువ అధికారం, అవుట్‌పుట్ నియంత్రణ, మానవ ఆమోదం) అవసరం. గోప్యత అనేది డిజైన్ సూత్రం: డేటాను కనిష్టీకరించండి, దానిని మాస్క్ చేయండి, యాక్సెస్‌ని పరిమితం చేయండి, నిలుపుదల వ్యవధిని విధించండి. భాగం మరియు డేటా సరఫరా గొలుసును నియంత్రించండి. ఈ సమాచారం అంతా రక్షణ, గుర్తింపు మరియు ఏకీకరణ కోసం; బలహీనతలను బాధ్యతాయుతంగా వివరించండి, ఎప్పుడూ దోపిడీ చేయవద్దు.

అప్లికేషన్ టాస్క్

Check an LLM/agent system (your own project or example) for prompt injection: are system instructions and external data separated, what is the authorization limit if the model is tricked, are irreversible actions confirmed? రక్షణ యొక్క కనీసం రెండు పొరలను జోడించండి. విడిగా, మోడల్‌కు వెళ్లే నమూనా డేటాలో మాస్క్ చేయాల్సిన వ్యక్తిగత ఫీల్డ్‌లను కనుగొని, మాస్క్ చేయండి. మీరు ఉపయోగించే ఏదైనా థర్డ్-పార్టీ కాంపోనెంట్ సోర్స్ మరియు తెలిసిన దుర్బలత్వాలను తనిఖీ చేయండి.

చెక్లిస్ట్

  • [ ] System instruction and external/user data are clearly separated.
  • [ ] బాహ్య కంటెంట్ కమాండ్‌లుగా కాకుండా డేటాగా గుర్తించబడింది.
  • [ ] మోడల్ మోసపోయినప్పటికీ, నష్టం కనీస అధికారానికి పరిమితం చేయబడింది.
  • [ ] వ్యక్తిగత డేటా ముసుగు/కనిష్టీకరించబడింది; నిల్వ వ్యవధి నిర్వచించబడింది.
  • [ ] డేటా మూలం మరియు మూడవ పక్ష భాగాలు తనిఖీ చేయబడ్డాయి.
  • [ ] నా భద్రతా పని రక్షణ ప్రయోజనాల కోసం; నేను ఖాళీలను బాధ్యతాయుతంగా వివరిస్తాను.