یونٹ 7 / 12

لاگ تجزیہ اور مشاہدہ

فائدہ:

  • بڑے لاگ ڈمپ کو AI میں ماسک کرکے اور فلٹر کرکے ان کا خلاصہ کرنے اور ٹائم لائن بنانے کی صلاحیت
  • AI کی طرف سے قائم کردہ وقتی رشتوں کو فرضی تصورات کے طور پر جانچنے کے قابل ہونا، نہ کہ وجہ
  • میٹرکس اور کوڈ کے ساتھ بنیادی وجہ مفروضے کی توثیق کرنے اور پوسٹ مارٹم خاکہ تیار کرنے کی صلاحیت

جب کوئی سافٹ ویئر پروڈکشن میں چل رہا ہوتا ہے (لائیو ماحول)، صرف نشانات، میٹرکس اور لاگز (ٹائم اسٹیمپڈ لاگ لائنز جو ایپلیکیشن کے چلتے وقت تیار ہوتی ہیں) آپ کو بتاتے ہیں کہ یہ کیا کر رہا ہے۔ بندش کے دوران ہزاروں، بعض اوقات لاکھوں، لاگ لائنوں سے بامعنی سگنل کھینچنا کسی واقعے کے ردعمل کا سب سے زیادہ دباؤ اور وقت کا نازک لمحہ ہوتا ہے۔ یہاں، AI ایک مددگار ثابت ہو سکتا ہے، بڑے پیمانے پر متن کا خلاصہ، پیٹرن نکالنا، اور مفروضے پیدا کرنا — جب تک کہ آپ رازداری اور تصدیق کی حدود کا احترام کریں۔

اس یونٹ میں، ہم مشاہدے کے تناظر میں AI کا استعمال سیکھتے ہیں - کسی سسٹم کے بیرونی آؤٹ پٹس کو دیکھ کر اس کی اندرونی حالت کو سمجھنے کی صلاحیت: لاگ شور سے معنی نکالنا، بگ کی ٹائم لائن قائم کرنا، دہرائے جانے والے نمونوں کو تلاش کرنا، اور پوسٹ مارٹم کا مسودہ تیار کرنا۔ سامنے کی اہم تنبیہ: خام پیداواری لاگ میں اکثر ذاتی ڈیٹا اور راز ہوتے ہیں۔ ان کو AI ٹول میں بے ترتیبی سے چپکانا ایک سنگین خلاف ورزی ہے۔

لاگز کیوں مشکل ہیں، AI مددگار کیوں ہے؟

لاگز تین وجوہات کی بناء پر مشکل ہیں: حجم (بہت زیادہ ہیں)، شور (کئی لائنیں غیر متعلقہ ہیں)، اور بے ترتیبی (ایک واقعہ مختلف سروسز کے لاگز میں بکھرا ہوا ہے)۔ انسانی آنکھ اس ڈھیر میں تھک جاتی ہے اور اہم لائن سے محروم ہوجاتی ہے۔

AI متن کے بڑے بلاکس کا خلاصہ کرنے، دہرائے جانے والے نمونوں کو گننے، اور یہ پوچھنے میں اچھا ہے کہ "غلطیوں کے پھٹنے سے پہلے کیا بدلا؟" یہ وقت کے تعلقات قائم کرنے میں طاقتور ہے جیسے کہ تاہم، اس کی دو حدود ہیں۔ پہلی سیاق و سباق کی ونڈو ہے: لاگز کی مقدار جو آپ ماڈل میں فٹ کر سکتے ہیں محدود ہے، لہذا آپ کو پہلے فلٹر اور نمونہ لینے کی ضرورت ہے۔ دوسرا، توثیق: AI کہہ رہا ہے کہ "اصل وجہ یہ ہے" ایک مفروضہ ہے۔ میٹرکس اور کوڈ سے اس کی تصدیق کیے بغیر کوئی فیصلہ نہ کریں۔

احتیاط: خام پروڈکشن لاگز میں IP ایڈریس، ای میل، ٹوکن، سیشن ID اور بعض اوقات کھلے راز شامل ہو سکتے ہیں۔ انہیں AI کو کھلانے سے پہلے ماسک کریں، یا صرف انٹرپرائز سے منظور شدہ، ڈیٹا سے محفوظ ٹولز استعمال کریں۔ ہم یونٹ 10 میں اس موضوع کو گہرا کرتے ہیں۔

مرحلہ وار: لاگ سے جڑ تک

  1. ٹائم ونڈو کو تنگ کریں۔ منٹ کا تعین کریں جب ایونٹ شروع ہوا؛ اس کھڑکی کا جائزہ لیں، پورے دن نہیں۔
  2. شور کو فلٹر کریں۔ معروف دہرائی جانے والی، بے ضرر لائنوں کو ختم کرنا۔ غلطی (ERROR)، وارننگ (WARN) اور پہلے انحراف کے لمحے پر توجہ دیں۔
  3. حساس ڈیٹا کو ماسک کریں۔ AI کو دینے سے پہلے ذاتی ڈیٹا اور رازوں کو صاف کریں۔
  4. ایک خلاصہ اور ٹائم لائن بنائیں۔ AI سے واقعہ کا خلاصہ تاریخ سازی میں کرنے کے لیے کہیں ("پہلے یہ، پھر وہ")۔
  5. میٹرکس اور کوڈ کے ساتھ مفروضے کی توثیق کریں۔ AI کی طرف سے نشاندہی کی وجہ؛ اگر قابل اطلاق ہو تو ڈیش بورڈ، متعلقہ کوڈ اور تعیناتی کی ٹائم لائن سے تصدیق کریں۔
  6. جو کچھ سیکھا ہے اسے تحریر میں ڈالیں۔ پوسٹ مارٹم کا خاکہ بنائیں اور احتیاطی اقدامات کی فہرست بنائیں۔

تین چھوٹے کیسز

کیس 1 - 5 منٹ میں 40,000 لائنوں کا خلاصہ۔ ادائیگی کی ایک سروس نے 12 منٹ تک وقفے وقفے سے غلطی کی اطلاع دی۔ ٹیم نے AI کو 20 منٹ کی متعلقہ ونڈو ماسک شدہ لاگز (تقریباً 40,000 لائنیں، نمونے کے طور پر) فیڈ کیں اور ایک ٹائم لائن تیار کی۔ ماڈل نے ظاہر کیا کہ غلطی اس لمحے کے ساتھ ہوئی جب انحصاری سروس کا رسپانس ٹائم 200 ms سے بڑھ کر 8 سیکنڈ ہو گیا۔ ٹیم نے ڈیش بورڈ پر اس کی تصدیق کی اور 10 منٹ کے اندر وجہ کو کم کر دیا۔

کیس 2 - گمراہ کن ارتباط۔ ایک اور واقعے میں، AI نے یہ کہہ کر اس پر الزام لگایا کہ غلطیاں "ایک ہی وقت میں" کرون (شیڈولڈ ٹاسک) چلانے کے دوران ہو رہی تھیں۔ جب ٹیم نے میٹرکس کی جانچ کی، تو انہوں نے دیکھا کہ کرون واقعی ایونٹ سے پہلے ہی ختم ہو چکا تھا۔ باہمی تعلق اتفاق تھا۔ اصل وجہ یادداشت کا لیک ہونا تھا۔ سبق: AI کے ذریعہ قائم کردہ وقت کا ارتباط ایک اشارہ ہے، ثبوت نہیں۔

کیس 3 - پوسٹ مارٹم میں تیزی۔ بندش کے بعد، ٹیم نے (نقاب پوش) میسج ٹرانسکرپٹ اور ٹائم لائن کو ایونٹ چینل سے AI کو فیڈ کیا اور اس نے پوسٹ مارٹم کا خاکہ تیار کیا: خلاصہ، اثر، ٹائم لائن، بنیادی وجہ، اعمال۔ انسانی ایڈیٹر نے حقائق کو درست کیا اور عمل کے مالکان کو مقرر کیا۔ دستاویز، جس میں عام طور پر 2 گھنٹے لگتے ہیں، زیادہ مستقل ڈھانچے کے ساتھ تقریباً 40 منٹ میں مکمل کیا گیا۔

چار کاپی ایبل ٹیمپلیٹس

لاگ سمری اور ٹائم لائن (نقاب پوش لاگ کے ساتھ):

ذیل میں نقاب پوش پروڈکشن لاگ کی ایک ایونٹ ونڈو ہے۔ 1) ایونٹ کو ایک تاریخی ٹائم لائن میں ڈالیں (پہلے انحراف کے لمحے کو نشان زد کریں)۔ 2) سب سے زیادہ بار بار آنے والی غلطی/انتباہی کی اقسام کو شمار اور گروپ کریں۔ 3) "اس سے پہلے کیا بدلا؟" سوال کے لیے امیدوار کے واقعات کی فہرست بنائیں۔ یہ مفروضے ہیں؛ اسے بطور "تصدیق شدہ ہونا ضروری ہے" کے بطور نشان زد کریں۔ {{لاگز}}

پیٹرن نکالنے میں خرابی:

ان لاگ لائنوں میں بار بار آنے والی غلطی کے نمونے تلاش کریں۔ ہر پیٹرن کے لیے: نمونہ لائن (نقاب پوش)، تخمینہ شدہ ذریعہ اور ممکنہ معنی۔ ایک الگ "توجہ" کی فہرست میں نایاب لیکن اہم واحد خامیاں جمع کریں۔{{logs}}

سٹرکچرڈ استفسار/فلٹر جنریشن:

{{لاگ ٹول: grep/jq/Kibana KQL/CloudWatch Insights}} کے لیے، ایک سوال لکھیں جو درج ذیل شرط پر پورا اترتا ہو: {{مثلاً آخری 15 منٹ میں 5xx غلطیاں، صارف X}} کو چھوڑ کر۔ سوال کی وضاحت کریں؛ یقینی بنائیں کہ آپ ڈومین نام نہیں بنا رہے ہیں، پوچھیں کہ کیا آپ کو یقین نہیں ہے۔

پوسٹ مارٹم خاکہ:

مندرجہ ذیل (نقاب پوش) ایونٹ کی ٹائم لائن سے پوسٹ مارٹم خاکہ لکھیں: خلاصہ / اثر (مدت، صارف متاثر) / ٹائم لائن / بنیادی وجہ / کیا اچھا ہوا / اعمال (ہر ایک کے لئے مالک فیلڈ کو خالی چھوڑ دیں)۔ الزام لگانے والی زبان استعمال نہ کریں؛ حقائق پر مبنی اور فعال بنیں۔{{timeline}}

کمزور فوری / مضبوط اشارہ

کمزور: "ان نوشتہ جات کو دیکھو، کیا غلط ہے؟" (پورے دن کا خام لاگ، ذاتی ڈیٹا کے ساتھ، بغیر ہدف کے۔)
مضبوط: "ذیل میں 14:02–14:20 تک کا نقاب پوش پروڈکشن لاگ ہے (5xxs پر فلٹر کیا گیا)۔ اس ونڈو میں، اس لمحے کو تلاش کریں جب خرابی پھٹنا شروع ہوئی، اکثر غلطی کی قسم کو شمار کریں، اور دھماکے سے فوراً پہلے 60 سیکنڈ میں ظاہر ہونے والے انحرافات کی فہرست بنائیں؛ ان سب کو 'مفروضہ' کے طور پر نشان زد کریں۔"

طاقتور ورژن؛ یہ ٹائم ونڈو کو تنگ کرتا ہے، لاگ کو فلٹر اور ماسک کرتا ہے، ایک واضح سوال پوچھتا ہے، اور شروع سے یہ ثابت کرتا ہے کہ آؤٹ پٹ ایک مفروضہ ہے۔

جستجو

AI مضبوط ہے۔

حد / تصدیق

بڑے لاگ کا خلاصہ

ہاں، تیز

نمونے لینے کا نقصان ہو سکتا ہے۔

وقت کا رشتہ قائم کرنا

اشارے پیدا کرتا ہے۔

ارتباط ≠ وجہ

استفسار/فلٹر جنریشن

اچھا مسودہ

کیا ڈومین کے نام اصلی ہیں؟

پوسٹ مارٹم خاکہ

ساخت اور زبان

کیسز انسانی تصدیق شدہ ہیں۔

ارتباط سبب نہیں ہے۔

لاگ تجزیہ میں سب سے عام خرابی یہ ہے کہ "یہ ایک ہی وقت میں ہوا، لہذا اسی وجہ سے" غلط فہمی ہے۔ AI اس جال میں اتنی ہی آسانی سے آتا ہے، اگر زیادہ آسانی سے نہیں، تو انسانوں کے مقابلے میں۔ کیونکہ یہ سمجھتا ہے کہ متن میں بیک وقت ہونا ایک مضبوط اشارہ ہے۔ یہ کہنے کے قابل ہونا کہ ایک واقعہ درحقیقت دوسرے کی طرف لے جاتا ہے۔ وقت، طریقہ کار اور، اگر ممکن ہو تو، تکرار کی ضرورت ہے۔ ہر وجہ کے دعوے کے لیے جو AI قائم کرتا ہے، ہم پوچھتے ہیں کہ "دوسرے کون سے شواہد اس کی تصدیق کرتے ہیں؟" سوال کے ساتھ اس کی جانچ کریں۔

مشورہ: AI پر لاگ ان کرتے وقت، ٹیکسٹ ڈمپ کے بجائے، اگر ممکن ہو تو، پہلے ایک سوال/فلٹر پرنٹ کریں اور اسے اپنی گاڑی میں چلائیں۔ اس طرح آپ دونوں حساس ڈیٹا کو کم کرتے ہیں اور ماڈل کی سیاق و سباق کی ونڈو کو واقعی اہم قطاروں میں الگ کرتے ہیں۔

عام غلطیاں

  • خام، بے نقاب لاگ چسپاں کرنا۔ ذاتی ڈیٹا اور رازوں کا انکشاف؛ رازداری کی سنگین خلاف ورزی۔
  • پورا دن ایک ساتھ دینا۔ یہ سیاق و سباق کی کھڑکی سے تجاوز کرتا ہے، سگنل شور میں ڈوب جاتا ہے۔
  • وجہ کے لیے غلط تعلق۔ AI کے ذریعہ قائم کردہ وقت کا رشتہ ایک اشارہ ہے، ثبوت نہیں۔
  • میک اپ ڈومین نام کے ساتھ استفسار پر انحصار کرنا۔ ماڈل لاگ فیلڈ کا نام تجویز کر سکتا ہے جو موجود نہیں ہے۔ اسکیمیٹک کے ساتھ تصدیق کریں.
  • پوسٹ مارٹم کی تصدیق کیے بغیر اسے شائع کرنا۔ حقائق اور اثرات کے اعداد و شمار کی انسانی تصدیق ہونی چاہیے۔

خلاصہ میں

لاگ تجزیہ میں حجم اور شور کو مات دینے کے لیے AI ایک طاقتور ٹول ہے: بڑے ٹرانسکرپٹس کا خلاصہ، ٹائم لائنز قائم کرنا، پیٹرن نکالنا، اور پوسٹ مارٹم خاکے تیار کرنا۔ لیکن تین حدود یاد رکھیں: حساس ڈیٹا کو ماسک کیے بغیر ایکسپورٹ نہ کریں، سیاق و سباق کی کھڑکی میں فٹ ہونے کے لیے اسے فلٹر اور نمونہ بنائیں، اور ہر وجہ کے دعوے کی میٹرکس اور کوڈ سے تصدیق کریں۔ ارتباط سبب نہیں ہے۔ AI اشارہ دیتا ہے، آپ ثبوت کے ساتھ فیصلہ کرتے ہیں۔

درخواست کا کام

آپ کے پاس موجود ایونٹ یا ٹیسٹ ماحول کے لاگ سے 15-20 منٹ کی ونڈو منتخب کریں۔ پہلے ذاتی ڈیٹا اور رازوں کو چھپائیں (یا مصنوعی لاگ تیار کریں)۔ پھر "لاگ سمری اور ٹائم لائن" ٹیمپلیٹ کے ساتھ AI سے ایک تاریخ اور اکثر غلطی کی قسمیں نکالیں۔ AI نے آپ کے پاس موجود میٹرک یا کوڈ کے ٹکڑے کے ساتھ پیش کردہ بنیادی وجہ مفروضے کی تصدیق کرنے کی کوشش کریں: کیا مفروضہ برقرار تھا، یا یہ ایک گمراہ کن ارتباط تھا؟ اپنی تلاش کو ایک جملے میں لکھیں۔

چیک لسٹ

  • [ ] میں AI کو لاگ دینے سے پہلے ذاتی ڈیٹا اور رازوں کو چھپاتا ہوں۔
  • [ ] میں تجزیہ کو ایک تنگ ٹائم ونڈو اور فلٹر تک کم کرتا ہوں۔
  • [ ] میں AI کے ذریعہ قائم کردہ وقت کے رشتوں کو مفروضے کے طور پر دیکھتا ہوں، نہ کہ وجہ۔
  • [ ] میں میٹرکس اور کوڈ کے ساتھ بنیادی وجہ کے دعوے کی تصدیق کرتا ہوں۔
  • میں تصدیق کرتا ہوں کہ میرے تیار کردہ سوالات/فلٹرز کے ڈومین نام اصلی ہیں۔
  • میں پوسٹ مارٹم کے خاکے میں حقائق اور اعداد و شمار کی انسانی طور پر تصدیق کرتا ہوں۔