واحد 9 / 11

نظارت مستمر، قابلیت مشاهده و رانش

سود:

  • امکان تعریف معیارهایی که سیگنال‌های استفاده، امنیت، کیفیت و عملکرد را نظارت می‌کنند
  • توانایی تشخیص تغییر کیفیت خروجی با خط مبنا و نمونه برداری
  • امکان تنظیم زنگ هشدار و حلقه بازخورد برای ناهنجاری ها و امواج فرار از زندان

تولید یک سیستم هوش مصنوعی آغاز است، نه پایان. حتی اگر مدل ثابت بماند، جهان تغییر می‌کند: رفتار کاربر، داده‌های دریافتی، تکنیک‌های حمله و زمینه کسب‌وکار دائما در حال تغییر هستند. پاسخ صحیح دیروز ممکن است امروز اشتباه باشد. بنابراین رکن نهایی امنیت، نظارت مستمر و مشاهده پذیری است – توانایی دیدن آنچه از بیرون در داخل سیستم می گذرد. در این بخش، ما یاد می‌گیریم که چه معیارهایی را باید پایش کنیم، چگونه از تغییر کیفیت خروجی بگیریم، و چگونه برای ناهنجاری‌ها هشدار دهیم.

چرا نظارت مستمر؟

در نرم افزارهای کلاسیک، "آیا کار می کند" یک سوال دودویی است: یا پاسخ می دهد یا نمی دهد. در هوش مصنوعی، در حالی که به نظر می رسد سیستم "کار می کند"، می تواند بی سر و صدا بدتر شود: پاسخ ها به آرامی نادرست می شوند، هزینه ها افزایش می یابد، تلاش های فرار از زندان افزایش می یابد. تنها راه برای گرفتن اینها اندازه گیری مداوم سیگنال های مناسب است.

توجه: خطرناک ترین نقص عملکرد بی صدا است، نه پر سر و صدا. سیستم خطا نمی کند، کیفیت آن فقط کاهش می یابد. اگر نظارت را تنظیم نکنید، اولین کسی که متوجه می شود مشتری یا حسابرس شما خواهد بود نه شما.

چهار خانواده سیگنال برای تماشا

  • استفاده و هزینه: حجم درخواست، مصرف توکن، هزینه هر کاربر. پرش ناگهانی؛ این می تواند نشانه سوء استفاده، یکپارچگی لوپی یا سوئیچ نشتی باشد.
  • سیگنال‌های امنیتی: تلاش‌های فرار از زندان/تزریق، رد تماس‌های خودرو، خطاهای مجوز. افزایش ممکن است نشان دهنده یک کمپین حمله فعال باشد.
  • کیفیت و دریفت: کاهش کیفیت خروجی در طول زمان (دریفت). به عنوان مثال، نرخ عبور تأیید، نرخ تصحیح در تأیید انسانی، رضایت کاربر.
  • عملکرد: تأخیر، میزان خطا، مهلت زمانی. این به طور مستقیم بر تجربه و هزینه کاربر تأثیر می گذارد.

Drift چیست و چگونه آن را بگیریم؟

دریفت زمانی است که کیفیت ورودی یا خروجی مدل در طول زمان بدون توجه تغییر می کند. دو نوع وجود دارد: رانش داده (توزیع درخواست های دریافتی تغییر می کند - موضوع جدید، زبان جدید) و تغییر کیفیت (خروجی برای همان کار به تدریج بدتر می شود). برای گرفتن یک خط مبنا لازم است: زمانی که سیستم سالم است، محدوده نرمال معیارها را ثبت کنید. بگذارید انحراف به زنگ خطر تبدیل شود.

گام به گام: تنظیم نظارت

  1. خط پایه را اندازه گیری کنید. زمانی که سیستم سالم است، محدوده طبیعی هر سیگنال را ثبت کنید.
  2. آستانه و زنگ هشدار را تعریف کنید. کدام انحراف به چه کسی و چگونه هشدار می دهد؟
  3. نمونه برداری + بازرسی انسانی. نمونه‌ای از خروجی‌ها را به طور منظم از یک انسان بازبینی کنید (انحراف کیفیت اغلب فقط قابل مشاهده است).
  4. یک داشبورد نصب کنید. مانیتور چهار خانواده سیگنال در یک صفحه.
  5. حلقه بازخورد. پیوند دادن یافته ها از نظارت به بهبود سریع/کنترل.

چهار قالب قابل کپی

درخواست ارزیابی نمونه‌گیری کیفیت (ردیابی رانش با LLM-as-judge):

در زیر 20 مورد قابل چاپ تصادفی از این هفته آورده شده است. به هر یک به عنوان "خوب / قابل قبول / بد" امتیاز دهید و یک توجیه کوتاه بنویسید. در نهایت نرخ بد را با نرخ هفته گذشته مقایسه خواهم کرد. اگر الگوی (تکرار همان نوع اشتباه) وجود دارد که در این هفته برجسته است، آن را علامت بزنید.<outputs>{{ نمونه‌ها }}</outputs>

دستور خلاصه ناهنجاری:

معیارهای روزانه زیر را بررسی کنید: تعداد درخواست‌ها، نشانه‌ها، هزینه، تماس ابزار رد شده، تلاش‌های فرار از زندان، تاخیر متوسط. هر معیاری را که بیش از 30٪ از خط پایه منحرف می شود به عنوان "ANOMALIT" علامت بزنید و علت احتمالی (حمله، اشکال، سوء استفاده) را تخمین بزنید.<metrics>{{ daily_data }}</metrics>

قانون تعریف آستانه هشدار:

هشدارها را برای هر سیگنال تعریف کنید: - هزینه: اگر از میانگین روزانه 2 برابر بیشتر شود -> هشدار با اولویت بالا - تلاش های فرار از زندان: اگر بیش از 10 در ساعت باشد -> به تیم امنیتی اطلاع دهید - نرخ عبور تایید: اگر کمتر از 90٪ باشد -> بررسی کیفیت - تاخیر: اگر p95 2 برابر بیشتر از هدف باشد -> بررسی عملکرد

پیشنهاد تحقیق دریفت:

نرخ عبور تأیید از 94 درصد به 78 درصد در 2 هفته گذشته کاهش یافته است. به من کمک کنید به این سؤالات پاسخ دهم: (1) آیا موضوع/زبان/فرمت جدیدی در درخواست های دریافتی ظاهر شده است؟ (2) آیا خطاها در یک دسته خاص متمرکز شده اند؟ (3) آیا زمان با تغییر اعلان / مدل / ابزار همزمان است؟ داده هایی را که باید برای هر کدام بررسی شوند نام ببرید.

اعلان ضعیف / اعلان قوی

رویکرد ضعیف

رویکرد قوی

"اگر خطایی وجود داشته باشد، خواهیم دید"

خط پایه + آستانه + زنگ هشدار فعال

فقط بررسی کنید که آیا سیستم ایستاده است یا خیر.

نظارت بر چهار خانواده سیگنال (استفاده، امنیت، کیفیت، عملکرد)

اصلا از کیفیت خروجی نمونه برداری نمی شود

نمونه گیری منظم انسانی + LLM-as-judge

جمع آوری و نگاه نکردن به معیارها

داشبورد + حلقه بازخورد

سه کیف کوچک

مورد 1 - هشدار هزینه کلید نشت را گرفت. هزینه توکن روزانه یک شرکت یک شبه سه برابر شد. زنگ آستانه به تیم امنیتی هشدار داد. تحقیقات نشان داد که یک کلید تست لو رفته و توسط یک ربات استفاده شده است. کلید در 25 دقیقه باطل شد. اگر زنگ خطر نبود، آخر ماه متوجه قبض می شد.

مورد 2 - تغییر کیفیت بی صدا. نرخ عبور تأییدیه یک دستیار پشتیبانی بی سر و صدا از 95٪ به 80٪ در سه هفته کاهش یافت. نمونه گیری هفتگی این را به دست آورد. دلیل آن این بود که مشتریان شروع به پرسیدن در مورد خط تولید جدید کردند و پایه دانش مدل در مورد آن ناقص بود. زمانی که پایگاه دانش به روز شد، نرخ بهبود یافت.

مورد 3 - موج فرار از زندان زود بود. تلاش‌های تزریق‌شده روی دستیار از 2 به 40 در ساعت در یک روز افزایش یافت. هشدار امنیتی فعال شد. مشاهده شد که یک "دستور العمل" برای کرک کردن سیستم در یک انجمن به اشتراک گذاشته شده است. این تیم اعلانات دفاعی را به‌روزرسانی کرد و حساب‌های مشکوک با نرخ محدود را به‌روزرسانی کرد. موج قبل از اینکه به یک نشت واقعی تبدیل شود خاموش شد.

نکته: فقط به معیارهای ماشین بسنده نکنید. تغییر کیفیت اغلب با خواندن خروجی های نمونه توسط یک انسان مشخص می شود. یک روال کوچک بررسی 15 تا 20 پرینت تصادفی در هفته، گرانترین خرابی های بی صدا را زود تشخیص می دهد.

اشتباهات رایج

  • قرار ندادن آن به تولید و تنظیم نظارت ("این کار می کند، خوب").
  • عدم توانایی تشخیص ناهنجاری بدون اندازه گیری خط پایه.
  • تنها با نگاه کردن به "آیا ایستاده است"، تغییر کیفیت را از دست می دهید.
  • به هیچ وجه از کیفیت خروجی از چشم انسان نمونه برداری نمی شود.
  • عدم به صدا در آوردن زنگ خطر و پی بردن به مشکل از مشتری/سرپرست.
  • عدم اتصال یافته های نظارت به بهبود (بدون حلقه بازخورد).

به طور خلاصه

  • سیستم های هوش مصنوعی می توانند بی سر و صدا خراب شوند. خطرناک ترین نقص عملکردی است که خطا ایجاد نمی کند، بلکه فقط کیفیت را کاهش می دهد.
  • چهار خانواده سیگنال را دنبال کنید: استفاده/هزینه، ایمنی، کیفیت/دریفت و عملکرد.
  • دریفت (انحراف کیفیت ورودی یا خروجی در طول زمان) فقط در مقایسه با خط مبنا ثبت می شود.
  • نمونه‌برداری منظم از انسان علاوه بر معیارهای ماشین، تغییر کیفیت را به تصویر می‌کشد.
  • مانیتورینگ را به حلقه زنگ هشدار و بازخورد متصل کنید. اندازه گیری و نگاه نکردن، نظارت نیست.

وظیفه کاربردی

حداقل یک معیار از هر چهار خانواده سیگنال را برای سیستم هوش مصنوعی خود انتخاب کنید و خطوط پایه فعلی (یا تخمینی) آنها را بنویسید. برای هر متریک یک آستانه هشدار تعریف کنید. سپس 15 مورد از خروجی های ترم آخر خود را بگیرید و با دستور نمونه گیری بالا امتیاز دهید. به نرخ "بد" توجه کنید. بگذارید این اولین خط پایه شما باشد که می توانید در آینده رانش را با آن مقایسه کنید.

چک لیست

  • [ ] من معیارهایی را از چهار خانواده سیگنال (استفاده، امنیت، کیفیت، عملکرد) تعریف کردم.
  • [ ] من یک خط پایه و آستانه هشدار برای هر متریک تنظیم کردم.
  • [ ] من به طور منظم کیفیت خروجی را از چشم انسان نمونه می کنم.
  • [ ] من سیگنال ها را روی یک صفحه با یک صفحه نمایش نظارت می کنم.
  • [ ] زنگ هشدار برای ناهنجاری ها و امواج فرار از زندان به تیم امنیتی می رود.
  • [ ] من یافته های نظارت را به بهبود سریع/کنترل نسبت می دهم.