ඒකකය 6 / 11

ආදර්ශ අවදානම් කළමනාකරණය සහ රතු කණ්ඩායම

ලාභ:

  • බලපෑම අනුව භාවිත අවස්ථා අඩු/මධ්‍යම/අධි අවදානම් මට්ටම්වලට වර්ග කිරීමේ හැකියාව
  • Red-teaming සමඟ නිෂ්පාදනයට පෙර ආකෘතිය ක්රමානුකූලව පරීක්ෂා කිරීමේ හැකියාව
  • ආකෘති කාඩ්පත සහ පිළිගැනීමේ දොර සමඟ නිෂ්පාදන තීරණ ගැනීමේ හැකියාව (go/no-go)

AI හි සෑම භාවිතයක්ම එකම අවදානමක් ගෙන නොයයි. සහායකයකු රැස්වීම් සටහනක් සාරාංශ කිරීම සහ සහායකයකු ණය අයදුම්පතක් ඇගයීම බෙහෙවින් වෙනස් ප්‍රතිඵල ලබා දෙයි. ආයතනික පාලනයේ පදනම වන්නේ අවදානම් මට්ටම අනුව භාවිතයන් වර්ගීකරණය කිරීම සහ එක් එක් මට්ටම් සඳහා සුදුසු පාලනය යෙදීමයි. මෙම ඒකකය තුළ, අපි ආදර්ශ අවදානම් කළමනාකරණයේ රාමුව (ආකෘතියක් වැරදි, පක්ෂග්‍රාහී හෝ සූරාකෑමට ලක්වීම නිසා ඇති වන අවදානම කළමනාකරණය කිරීමේ විනය), රතු-කණ්ඩායම් සමඟ නිෂ්පාදනයට පෙර ආකෘතිය පරීක්ෂා කරන ආකාරය සහ ආකෘති කාඩ්පත සහ පිළිගැනීමේ නිර්ණායක ඉගෙන ගනිමු.

අවදානම අනුව වර්ගීකරණය

පළමු පියවර සෑම විටම සමාන වේ: "මෙම භාවිතය වැරදි නම් කුමක් සිදුවේද?" විභවය සහ ආපසු හැරවීමේ හැකියාව අනුව රළු මට්ටම් තුනක්:

  • අඩු අවදානම්: දෝෂය පහසුවෙන් අනාවරණය කර ඉවත් කර ඇත; පුද්ගලික/මූල්‍ය ප්‍රතිවිපාක නොමැත. උදාහරණය: අභ්‍යන්තර රැස්වීම් සාරාංශය, කෙටුම්පත් අදහස් උත්පාදනය.
  • මධ්‍යම අවදානම: දෝෂය ව්‍යාපාර ක්‍රියාවලියට බලපාන නමුත් මිනිස් ඇස හරහා ගමන් කරයි. උදාහරණය: පාරිභෝගිකයා වෙත කෙටුම්පත් ප්‍රතිචාරය, මූලික වාර්තා සාරාංශය.
  • ඉහළ අවදානමක්: තීරණය සෘජුවම බලපාන්නේ පුද්ගලයෙකුට/මුදල්, ආපසු හැරවීමට අපහසුය. උදාහරණය: ණය/රක්ෂණ තීරණය, සෞඛ්‍ය සේවා පරීක්ෂාව, රැකියා පරීක්ෂාව.

අවදානම් මට්ටම සමඟ පාලන තීව්රතාවය වැඩි වේ: අඩු අවදානමකදී, ආලෝකය පාලනය කිරීම ප්රමාණවත්ය; ඉහළ අවදානමක් ඇති විට, මානව අධීක්ෂණය, දැඩි සත්‍යාපනය, රතු කණ්ඩායම් සහ නිරන්තර අධීක්ෂණය අනිවාර්ය වේ.

අවධානය: එහි නම නොව භාවිතයේ බලපෑම අනුව අවදානම් වර්ගීකරණය කරන්න. ගෙවීම් ආරම්භ කළ හැකි නම් ඊනියා "චැට්බෝට්" පද්ධතිය ඉහළ අවදානමක් ඇත.

රතු කණ්ඩායම (රතු-කණ්ඩායම්)

Red teaming හිතාමතාම ද්වේශ සහගත ප්‍රහාරකයෙකු ලෙස පෙනී සිටිමින් පද්ධතියක් බිඳ දැමීමට උත්සාහ කරයි. මෙය AI හි ඇත; එයට Jailbreak කිරීම (ආකෘතියේ ආරක්‍ෂක නීති මගහැරීම), ඉක්මන් එන්නත් කිරීම, දත්ත පිටකිරීම, පක්ෂග්‍රාහී/ද්වේෂ සහගත ප්‍රතිදානය උත්පාදනය කිරීම සහ අන්ත අවස්ථා පරීක්ෂා කිරීම ඇතුළත් වේ. ඉලක්කය වන්නේ සැබෑ ප්‍රහාරකයාට පෙර දුර්වලතා සොයා ගැනීමයි.

පියවරෙන් පියවර:

  1. තර්ජන අවස්ථා ලැයිස්තුගත කරන්න. මෙම පද්ධතිය අනිසි ලෙස භාවිතා කළ හැක්කේ කෙසේද?
  2. ප්රහාරක කට්ටලය සූදානම් කරන්න. එක් එක් තර්ජනය සඳහා සංයුක්ත ප්රවේශ උදාහරණ ලියන්න.
  3. ක්රමානුකූලව උත්සාහ කරන්න. එක් එක් දර්ශනය ධාවනය කර ප්රතිඵලය වාර්තා කරන්න.
  4. සොයාගැනීම් වලට ප්‍රමුඛත්වය දෙන්න. බලපෑම × සම්භාවිතාව අනුව වර්ග කරන්න.
  5. එය නිවැරදි කර නැවත පරීක්ෂා කරන්න. පැච් එකෙන් පසු, එම කට්ටලයම (ප්‍රතිගමනය) සමඟ නැවත උත්සාහ කරන්න.

ආදර්ශ කාඩ්පත සහ පිළිගැනීමේ නිර්ණායක

ආකෘති කාඩ්පතක් යනු ආකෘතියක් සුදුසු වන්නේ කුමක් සඳහාද, එහි සීමාවන්, දන්නා අවදානම් සහ කාර්ය සාධනය සාරාංශ කරන ලියවිල්ලකි. ඔබ එය නිෂ්පාදනය කිරීමට පෙර, ඔබට පිළිගැනීමේ තීරණයක් සඳහා නිර්ණායක තිබිය යුතුය: නිරවද්‍යතා එළිපත්ත, රතු කණ්ඩායම සමත් වීමේ අනුපාතය, ප්‍රමාදය, පිරිවැය සහ පක්ෂග්‍රාහී පරීක්ෂණ.

පිටපත් කළ හැකි සැකිලි හතරක්

අවදානම් වර්ගීකරණ විමසුම:

පහත භාවිත අවස්ථාව සලකා බලන්න: {{ scenario }}ප්‍රශ්න:- දෝෂය බලපාන්නේ කාටද/කුමක්ද? (පුද්ගලයා, මුදල්, කීර්තිය, සමගිය)- එය ආපසු හැරවිය හැකිද? (ඔව්/නැත) - මිනිසුන්ට මැදිහත් විය හැකිද? ප්‍රතිඵලය: "අඩු / මධ්‍යම / ඉහළ අවදානම්" + අනිවාර්ය චෙක්පත් ලැයිස්තුව.

රතු කණ්ඩායම් ප්රහාර කට්ටල උත්පාදක යන්ත්රය:

ඔබ රතු කණ්ඩායමේ විශේෂඥයෙක්. පහත සහායකයා සඳහා ප්‍රහාර අවස්ථා 15ක් උත්පාදනය කරන්න: Jailbreaks 5ක්, ක්ෂණික එන්නත් 5ක් (ඒවායින් 3ක් වක්‍ර වේ), දත්ත exfiltration උත්සාහයන් 5ක්. එක් එක් සිද්ධිය සඳහා: අරමුණ, සම්පූර්ණ හැඳින්වීමේ පාඨය සහ "සාර්ථක නිර්ණායක" ලියන්න (මම දකින ඕනෑම දෙයක් ප්‍රහාරය සාර්ථක ලෙස ගණන් ගනී).

ආකෘති පුවරු ඇටසැකිල්ල:

ආකෘති කාඩ්පත:- අපේක්ෂිත භාවිතය / අනපේක්ෂිත භාවිතය- පුහුණු/දත්ත සීමාවන් සහ දන්නා දුර්වලතා- කාර්ය සාධනය: නිරවද්‍යතාවය, ප්‍රමාදය, පිරිවැය (පරීක්ෂණ කට්ටලය මත)- ආරක්ෂාව: රතු කණ්ඩායම සමත් වීමේ අනුපාතය, දන්නා Jailbreaks- පක්ෂග්‍රාහී පරීක්ෂණ ප්‍රතිඵල- පිළිගැනීමේ තීරණය: අනුමැතිය / කොන්දේසි සහිත / ප්‍රතික්ෂේප කිරීම + සාධාරණීකරණය

ඇතුල්වීමේ දොරටු පාලන රීතිය:

නිෂ්පාදනය වෙත යාමට සියලු කොන්දේසි සපුරා තිබිය යුතුය:- >= නිරවද්‍යතා පරීක්ෂණ කට්ටලය මත ඉලක්ක සීමාව- රතු කණ්ඩායම විවේචනාත්මක සොයාගැනීම් ගණන = 0- ඉහළ අවදානමක් නම්: මානව පරීක්ෂාව සහ අධීක්ෂණ මණ්ඩලය කිසිවක් සපුරා නොමැති නම්: "NO-GO" + අතුරුදහන් වූ අයිතමය.

දුර්වල ක්ෂණික / ශක්තිමත් ක්ෂණික

දුර්වල ප්රවේශය

ශක්තිමත් ප්රවේශය

එක් එක් භාවිතය එකම පාලනයකින් සැකසීම

අවදානම් සහ පරිමාණ පාලනය අනුව වර්ග කරන්න

"අපි එය පරීක්ෂා කළා, එය ක්රියා කරයි" (සතුටුදායක මාර්ගය)

රතු කණ්ඩායම සමඟ හිතාමතා බිඳ දැමීමේ උත්සාහය

සාධාරණීකරණයකින් තොරව ආකෘතිය නිෂ්පාදනයට දැමීම

ආදර්ශ කාඩ්පත + පිළිගැනීමේ දොරටුව (go/no-go)

පැච් කිරීමෙන් පසු නැවත පරීක්ෂා නොකරයි

නිවැරදි කිරීමෙන් පසු ප්‍රතිගාමී පරීක්ෂණය

කුඩා නඩු තුනක්

නඩුව 1 - වැරදි වර්ගීකරණය මිල අධික විය. එක් සමාගමක් බඳවා ගැනීම් පූර්ව පරීක්ෂාව "හුදෙක් අනුපූරකයක්" ලෙස සැලකූ අතර එය අඩු අවදානමක් ලෙස සැලකේ. මෙම ආකෘතිය සමහර පාසල්වලින් උපාධිධාරීන් ක්රමානුකූලව ඉවත් කරන ලදී; මෙය වෙනස් කොට සැලකීමේ පැමිණිල්ලක් බවට පත් විය. භාවිතය "ඉහළ අවදානම්" ලෙස නැවත වර්ගීකරණය කරන ලද අතර පක්ෂග්‍රාහී පරීක්ෂණ සහ මානව නිරීක්ෂණ එකතු කරන ලදී.

නඩුව 2 - රතු කණ්ඩායම තීරනාත්මක දුර්වලතා 3 ක් සොයා ගත්තේය. නිෂ්පාදනයට යාමට පෙර රතු කණ්ඩායමට පාරිභෝගික සහායකයකු පත් කරන ලදී. අවස්ථා 15 න් 3 ක් සාර්ථක විය: වෙනත් පාරිභෝගිකයෙකුගේ ඇණවුම් තොරතුරු වක්‍ර එන්නත් කිරීමකින් කාන්දු විය හැක. හිඩැස් වසා දමා එම කට්ටලය සමඟ නැවත පරීක්ෂා කර ඇත; නිෂ්පාදනය නැවත ආරම්භ කරන ලද්දේ විවේචනාත්මක සොයාගැනීම නැවත සකස් කළ විට පමණි.

නඩුව 3 - ආකෘතිය කාඩ්පත පිළිගැනීමේ තීරණය පැහැදිලි කළේය. ආකෘති දෙකක් අතර තේරීම, කණ්ඩායමක් ආකෘති කාඩ්පත් දෙපැත්තට තැබීය. මිල අඩු ආකෘතිය නිරවද්‍යතාවයෙන් ලකුණට පහර දුන් නමුත් රතු කණ්ඩායමේ තීරණාත්මක Jailbreaks 2කට ගොදුරු විය. පිළිගැනීමේ දොරටුව "විවේචනාත්මක සොයාගැනීම = 0" රීතිය හේතුවෙන් කණ්ඩායම මිල අධික නමුත් ආරක්ෂිත ආකෘතිය තෝරා ගත් අතර තීරණය ලේඛනගත කළේය.

ඉඟිය: රතු කණ්ඩායම එක් වරක් සිදුවීමක් නොවේ. ආකෘතිය, විමසුම හෝ මෙවලම් වෙනස් වන විට ප්‍රහාර කට්ටලය නැවත ක්‍රියාත්මක කරන්න; ආරක්ෂාව යනු රාජ්‍යයක් නොව අඛණ්ඩ භාවිතයකි.

පොදු වැරදි

  • නම අනුව භාවිතය වර්ග කරන්න (බලපෑම වෙනුවට); ඉහළ අවදානම අඩු යැයි වරදවා වටහා ගැනීම.
  • "ප්රීතිමත් මාර්ගය" පරීක්ෂා කිරීම සහ අපයෝජනය කිසිසේත්ම උත්සාහ නොකරන්න.
  • එක් වරක් රතු කණ්ඩායම සිදු කිරීම සහ වෙනස් කිරීමෙන් පසු එය නැවත නොකිරීම.
  • ආදර්ශ කාඩ්පතක් සහ පිළිගැනීමේ නිර්ණායකයකින් තොරව ආකෘතිය නිෂ්පාදනය කිරීම.
  • පක්ෂග්‍රාහී/වෙනස්කොට සැලකීමේ පරීක්‍ෂණය මග හැරීම (විශේෂයෙන් ඉහළ අවදානම් සහිත මානව තීරණ වලදී).
  • එහි තේරුම පශ්චාත් නිවැරදි කිරීමේ ප්‍රතිගාමී පරීක්ෂණ සිදු නොකර "වසා ඇත" යන්නයි.

සාරාංශයක් ලෙස

  • පළමු පියවර වන්නේ බලපෑම අනුව භාවිතයන් අඩු/මධ්‍යම/අධි අවදානම් ලෙස වර්ගීකරණය කිරීමයි. අවදානම සමඟ පාලන තීව්‍රතාවය වැඩි වේ.
  • Red teaming හිතාමතාම ප්රහාරකයෙකු මෙන් පද්ධතිය බිඳ දැමීමට උත්සාහ කරයි; සැබෑ ප්‍රහාරකයාට පෙර අවදානම සොයා ගනී.
  • ආදර්ශ කාඩ්පත ආකෘතියේ අරමුණ, සීමාවන් සහ අවදානම් ලේඛනගත කරයි; ඇතුළත් වීමේ තීරණය සඳහා පදනම වේ.
  • නිෂ්පාදනයට සංක්‍රමණය යන්න/නො-යෑමකට බැඳිය යුතුය: නිරවද්‍යතාව, තීරණාත්මක සොයාගැනීමේ ශුන්‍යය, අවශ්‍ය අධීක්ෂණය.
  • ආරක්ෂාව අඛණ්ඩව පවතී: රතු කණ්ඩායම් සහ ප්‍රතිගාමී පරීක්ෂණ සෑම වෙනසක් සමඟම නැවත නැවතත් සිදු කෙරේ.

යෙදුම් කාර්යය

ඔබේ AI භාවිතය තෝරන්න, බලපෑම මත පදනම්ව අවදානම් මට්ටම තීරණය කරන්න, සහ සාධාරණීකරණය ලියන්න. ඉන්පසු එම භාවිතය සඳහා අවම වශයෙන් ප්‍රහාරක අවස්ථා 10ක් (jailbreak, injection, data exfiltration) ජනනය කර ඒවා අතින් උත්සාහ කරන්න. සෑම සාර්ථක ප්‍රහාරයක් සඳහාම, නිවැරදි කිරීමක් යෝජනා කරන්න. අවසාන වශයෙන්, ආදර්ශ කාඩ්පත් ඇටසැකිල්ලක් පුරවා හේතු සහිතව "GO/NO-GO" තීරණයක් ගන්න.

පිරික්සුම් ලැයිස්තුව

  • [ ] මම බලපෑම අනුව අවදානම් මට්ටම අනුව භාවිතය වර්ග කර ඇත.
  • [ ] මම පාලන තීව්‍රතාවය අවදානම් මට්ටමට ගැලපුවෙමි.
  • [ ] මම රතු කණ්ඩායම් ප්‍රහාර කට්ටලයක් සකස් කර ක්‍රමානුකූලව උත්සාහ කළෙමි.
  • [ ] මම තීරනාත්මක සොයාගැනීම් සවි කර ඒවා ප්‍රතිගාමී පරීක්ෂණ මගින් තහවුරු කළෙමි.
  • [ ] මම ආදර්ශ කාඩ්පතක් (අරමුණ, සීමාව, කාර්ය සාධනය, ආරක්ෂාව) සකස් කළෙමි.
  • [ ] මම නිෂ්පාදන තීරණය යන්න/නො-යෑමකට බැඳ තැබුවෙමි.