یونٹ 3 / 11

لاگ انالیسس اور روٹ کاز اینالیسس: شور میں سگنل تلاش کرنا

فائدہ:

  • خلاصہ، گروپ اور ٹائم لائن لاگز کے لیے AI کا استعمال کرتے ہوئے شور میں سگنل جلدی سے تلاش کریں۔
  • باہمی تعلق اور وجہ کو الگ کرنے کی صلاحیت اور مصنوعی ذہانت کی بنیادی وجہ کی تجاویز کو مفروضے کے طور پر علاج کرنے کی صلاحیت جن کی تصدیق کی ضرورت ہے۔
  • مصنوعی ذہانت کے ساتھ '5 کیوں' طریقہ کار کو چلانے اور حقیقی ثبوت کے ساتھ ہر قدم کی حمایت کرکے اصل وجہ تک پہنچنے کی صلاحیت

لاگ انالیسس اور روٹ کاز کا تجزیہ: AI کے ساتھ شور میں سگنل تلاش کرنا

جب کوئی سسٹم کریش ہو جاتا ہے تو سب سے پہلے آپ کو لاگز نظر آتے ہیں۔ لاگ ایک ٹیکسٹ اسٹریم ہے جو کسی سسٹم یا ایپلیکیشن کے "میں نے کیا کیا، کیا ہوا، کیا ٹوٹ گیا" کا ٹائم اسٹیمپڈ ریکارڈ رکھتا ہے۔ لیکن ایک جدید انفراسٹرکچر فی گھنٹہ لاگوں کی لاکھوں لائنیں تیار کرتا ہے۔ یہ معلومات کا سمندر نہیں ہے بلکہ اکثر شور کا سمندر ہے۔ لاگ انالیسس اس شور میں اہم سگنل (غلطی، اسامانیتا، پیٹرن) کو تلاش کرنے کا فن ہے۔ کسی واقعہ کے بعد "اصل وجہ کیا تھی" کے سوال کا جواب دینے کے عمل کو جڑ کا تجزیہ (RCA - Root Cause Analysis) کہا جاتا ہے۔ یہاں، AI فی سیکنڈ ہزاروں لائنوں کا خلاصہ کرنے، پیٹرن نکالنے، ٹائم لائنز قائم کرنے اور ممکنہ وجوہات کی فہرست میں بہت طاقتور ہے۔ لیکن احتیاط کا ایک لفظ: AI ممکنہ وجوہات پیدا کرتا ہے۔ آپ وہ ہیں جو نظام میں تصدیق کرتے ہیں کہ کون سا حقیقی ہے اور فیصلہ کرتے ہیں۔

اس یونٹ میں آپ سیکھیں گے کہ AI کے ساتھ لاگز کا خلاصہ اعتماد کے ساتھ کیسے کیا جائے، کسی واقعہ کی ٹائم لائن کیسے قائم کی جائے، کس طرح ارتباط (ایک ساتھ بدلنا) اور وجہ (ایک دوسرے کا سبب بنتا ہے) کے درمیان فرق کیسے کیا جائے، اور AI کے ساتھ "5 Whys" جیسا RCA طریقہ کیسے چلایا جائے۔

ارتباط کیوں سبب نہیں ہے؟

یہ اس یونٹ کا سب سے اہم تصور ہے۔ صرف اس لیے کہ ایک ہی وقت میں دو واقعات رونما ہوتے ہیں، ایک دوسرے کا سبب نہیں بنتا۔ سرور کا CPU اور نیٹ ورک ٹریفک ایک ہی وقت میں بڑھ سکتا ہے۔ لیکن ایک دوسرے کا نتیجہ نہیں ہے، دونوں تیسرے واقعہ کا نتیجہ ہو سکتے ہیں (مثال کے طور پر، بیچ کے کام کا آغاز)۔ جب AI میٹرکس کو ایک ساتھ بدلتے ہوئے دیکھتا ہے، تو یہ قیاس کرتا ہے کہ "شاید X کی وجہ سے Y ہے۔" یہ نقطہ آغاز ہے، نتیجہ نہیں۔ وجہ کی تصدیق کرنے کے لیے، آپ کو یا تو متغیر کو الگ کرنا ہوگا (ٹیسٹ کے ماحول میں X کو متحرک کریں اور دیکھیں کہ آیا Y ہوتا ہے) یا میکانزم کو ثابت کرنا ہوگا (وہ تکنیکی ذرائع دکھائیں جن سے X Y پیدا کرتا ہے)۔

احتیاط: AI کے جملے کو "یہ شاید اس کی وجہ سے ہوا" کو ایک مفروضے کے طور پر لیں، نہ کہ تلاش کے۔ RCA میں، غلط بنیادی وجہ واقعہ کی غلط اصلاح اور تکرار کا باعث بنتی ہے۔ آپ کو پہلا مشتبہ مل گیا ہے، وجہ نہیں؛ کام وہاں سے شروع ہوتا ہے۔

مرحلہ وار: AI کے ساتھ لاگ تجزیہ کریں۔

  1. دائرہ کار تنگ کریں۔ ایونٹ ونڈو دیں، پورا لاگ نہیں: "ایونٹ 14:05 پر شروع ہوا، 14:00–14:20 تک اہم"۔ AI کو متعلقہ ٹائم سلاٹ اور سروس بتائیں۔
  2. ماسک لاگز میں اندرونی IP، میزبان کا نام، صارف اور ٹوکن ہوتا ہے۔ انہیں ماسک کریں (10.x.x.x, host-A, user1, REDACTED) پھر برآمد کریں۔
  3. خلاصہ اور گروپ بندی کی درخواست کریں۔ "اس لاگ کو شدت کے لحاظ سے گروپ کریں، بار بار آنے والی غلطیوں کو شمار کریں، پہلی غلطی کا ٹائم اسٹیمپ تلاش کریں۔" ساخت کے لئے پوچھیں، خام لاگ نہیں.
  4. ایک ٹائم لائن ترتیب دیں۔ "ان واقعات کو وقت کی ترتیب میں ترتیب دیں اور دکھائیں کہ کیا ہوتا ہے۔" پہلا ڈومینو تلاش کرنا بنیادی وجہ کا راستہ ہے۔
  5. مفروضے کے لیے پوچھیں، ثبوت نہیں۔ "امکان کی ترتیب میں ممکنہ بنیادی وجوہات کی فہرست بنائیں اور مجھے ہر ایک کے لیے سسٹم پر چلانے کے لیے ایک تصدیقی کمانڈ دیں۔" تشخیص کے لیے پوچھیں، نتیجہ نہیں۔
  6. سسٹم میں تصدیق کریں۔ ہر مفروضے کو صرف پڑھنے کے لیے تشخیصی کمانڈز (لاگ گریپ، اسٹیٹس کا سوال، میٹرک) کے ساتھ جانچیں۔ ختم کریں جب تک کہ صرف ایک تصدیق شدہ جڑ نہ ہو۔

5 کیوں طریقہ

RCA کا کلاسک اور طاقتور ٹول "5 Whys" ہے: ایک علامت سے شروع ہو کر پوچھنا "کیوں؟" پانچ بار پوچھنے سے، آپ سطحی علامات کے نیچے بنیادی وجہ تک پہنچ جاتے ہیں۔ مثال: "سائٹ کریش ہو گئی۔ کیوں؟ ایپلیکیشن مر گئی کیونکہ اس کی میموری ختم ہو گئی۔ کیوں؟ ایک استفسار نے تمام میموری استعمال کر لی۔ کیوں؟ استفسار نے انڈیکس استعمال نہیں کیا۔ کیوں؟ آخری ریلیز میں انڈیکس کو حذف کر دیا گیا تھا۔ کیوں؟ تبدیلی کے جائزے میں اس کا نوٹس نہیں لیا گیا۔" اس کی بنیادی وجہ سطح "سائٹ کریش" نہیں بلکہ "کمزور تبدیلی کا جائزہ لینے کا عمل" ہے۔ AI اس سلسلہ کو بنانے میں ایک اچھا پارٹنر ہو گا — لیکن آپ کو حقیقی ثبوت کے ساتھ ہر "کیوں" قدم کا بیک اپ لینا چاہیے، یا AI ایک قابل فہم لیکن جھوٹی زنجیر کے ساتھ سامنے آ سکتا ہے۔

تین چھوٹے مقدمات

کیس 1 - 40,000 لائنیں، 3 منٹ۔ ایک ایڈمنسٹریٹر نے راتوں رات بندش کے دوران ایپلیکیشن لاگز کی 40,000 لائنوں کو دستی طور پر اسکین کرنا شروع کر دیا تھا۔ اس نے نقاب پوش لاگ کا متعلقہ 20 منٹ کا حصہ AI کو دیا اور سمری اور گروپنگ کے لیے کہا۔ AI نے پہلے OutOfMemory بگ کو 02:14 پر، ٹائم آؤٹ بگز میں اضافے کے فوراً بعد جھنڈا لگایا۔ انجینئر کو ٹائم شیٹ 3 منٹ میں موصول ہوئی۔ اپنے میٹرک پینل پر اصل تشخیص کی تصدیق کی۔

کیس 2 - غلط بنیادی وجہ سے واپس آنا۔ ایک ٹیم نے سوچا کہ AI کا پہلا مفروضہ ("لاگ فلڈ دی ڈسک") درست تھا اور نوشتہ جات کو صاف کر دیا۔ لیکن اگلے دن یہ واقعہ دہرایا گیا۔ دوسرے راؤنڈ میں، انہوں نے نظم و ضبط کے ساتھ "5 Whys" کو لاگو کیا: اصل وجہ یہ تھی کہ درخواست کی غلطی سینکڑوں کور ڈمپ فی سیکنڈ لکھ رہی تھی۔ پہلا مفروضہ باہمی تعلق تھا۔ اصل وجہ کچھ اور تھی۔ تصدیق کے بغیر قبولیت نے صرف ایک دن کی مہلت فراہم کی تھی۔

کیس 3 - ٹائم لائن نے مجرم پایا۔ وقفے وقفے سے نیٹ ورک کی بندش کے دوران درجنوں آلات کے لاگز تھے۔ انجینئر نے نقاب پوش لاگز AI کو دیے اور اسے ایک متحد ٹائم لائن بنانے پر مجبور کیا۔ چارٹ سے ظاہر ہوتا ہے کہ ہر بندش فالتو تبدیلی کے ہیلتھ چیک پیغام کے ٹھیک 30 سیکنڈ بعد شروع ہوئی۔ یہ ارتباط ایک مضبوط اشارہ تھا۔ ٹیم نے ڈیوائس پر کلید کے فرم ویئر کی خرابی کی تصدیق کی اور اسے تبدیل کر دیا۔

چار کاپی کرنے کے قابل ٹیمپلیٹس

1) لاگ کا خلاصہ اور گروپ بندی:

ذیل میں 14:00-14:20 تک [سروس] کے لیے نقاب پوش لاگ ہے۔ مجھے بتائیں: (1) لائنوں کو گروپ بنائیں اور شدت کے لحاظ سے شمار کریں (ERROR/WARN/INFO)، (2) سب سے اوپر 5 بار بار آنے والے غلطی کے نمونوں کی فہرست بنائیں، (3) پہلی غلطی کا ٹائم اسٹیمپ تلاش کریں۔ خام لاگ کو دوبارہ نہ لکھیں، صرف ایک منظم خلاصہ دیں۔ میک اپ لائن شامل کرنا۔ لاگ: [نقاب شدہ لاگ]

2) ٹائم لائن ترتیب دینا:

ہم نے مندرجہ ذیل نقاب پوش ایونٹ کے ریکارڈز کو ایک ہی ٹائم لائن (ٹائم اسٹیمپ + سورس + ایونٹ) میں ترتیب دیا۔ دکھائیں کہ اس کے بعد کیا ہے اور اس واقعہ کو نشان زد کریں جو لگتا ہے کہ پہلا محرک ہے۔ نوٹ کریں کہ یہ ایک مفروضہ ہے اور وجہ کی تصدیق کی ضرورت ہے۔ ریکارڈنگز: [نقاب پوش ریکارڈنگز]

3) 5 وجوہات RCA پارٹنر:

آپ کا کردار: RCA سہولت کار۔ علامت: [علامت]۔میرے ساتھ "5 Whys" کریں: a "why؟" ہر قدم پر. پوچھیں، میرے پاس موجود ثبوتوں کے ساتھ جواب دوں گا، آپ اگلا سوال پوچھیں۔ اگر میرا ثبوت کمزور ہے تو مجھے خبردار کریں اور مجھے بتائیں کہ مجھے کون سا ڈیٹا اکٹھا کرنا ہے۔ ثبوت کے بغیر بنیادی وجہ کا اعلان نہ کریں۔

4) مفروضہ + تصدیقی حکم:

امکان کے لحاظ سے اس علامت [علام] کی ممکنہ بنیادی وجوہات کی فہرست بنائیں۔ ہر ایک وجہ سے: (a) آپ کو کس چیز پر شبہ ہے، (b) میرے سسٹم پر چلنے کے لیے مجھے صرف پڑھنے کے لیے تصدیقی کمانڈ دیں (کوئی حذف/تبدیل نہیں)۔ وضاحت کریں کہ کون سا نتیجہ مفروضے کی تصدیق یا تردید کرتا ہے۔

کمزور فوری / مضبوط اشارہ

کمزور اشارہ:

اس لاگ میں کیا خرابی ہے؟ خام لاگ کی 10,000 لائنیں

یہ پرامپٹ دونوں ہی حساس ڈیٹا کو بے نقاب کر دیتا ہے اور AI کو سیاق و سباق کے بغیر چھوڑ دیتا ہے۔ AI بے ترتیب لائن پر ٹھوکر کھا سکتا ہے اور سطحی یا یہاں تک کہ بنا ہوا وجہ دے سکتا ہے۔

طاقتور اشارہ:

آپ کا کردار: سینئر SRE۔ واقعہ: ادائیگی کی خدمت نے 02:10-02:25 کے درمیان 50% غلطی دی۔ ذیل میں اس ونڈو کا نقاب پوش لاگ ہے۔ مجھے (1) شدت کے لحاظ سے گروپ کردہ خلاصہ، (2) پہلی غلطی کا ٹائم اسٹیمپ، (3) امکان کے لحاظ سے ممکنہ بنیادی وجوہات، اور ہر ایک کے لیے صرف پڑھنے کے لیے تصدیقی کمانڈ دیں۔ وجہ کے دعووں کو مفروضے کے طور پر نشان زد کریں۔ لاگ: [نقاب پوش لاگ]

قدم

مقصد

AI کا کردار

آدمی کا کردار

خلاصہ/گروہ بندی

شور کو کم کریں

ہزاروں قطاروں کو ترتیب دینا

دائرہ کار اور ماسک کا تعین کریں۔

ٹائم لائن

پہلا ڈومینو تلاش کرنا

واقعات کو ترتیب دینا

ڈاک ٹکٹوں کی تصدیق کریں۔

مفروضہ نسل

ملزمان کی چھانٹی

امکانات کی فہرست بنائیں

سیاق و سباق کے لحاظ سے فلٹر کریں۔

تصدیق

اصل وجہ تلاش کریں

تشخیصی کمانڈ تجویز کریں۔

کمانڈ چلائیں اور اس پر تبصرہ کریں۔

فیصلہ

ٹھیک کرنے کا انتخاب

اختیارات پیش کرتے ہیں

فیصلہ کریں اور تصدیق کریں۔

عام غلطیاں

  • وجہ کے لیے غلط تعلق۔ "ایک کی وجہ سے دوسری" کے طور پر ایک ساتھ تبدیل ہونے والے دو میٹرکس کو قبول کرنا غلط اصلاح پیدا کرتا ہے۔
  • خام لاگ کو بغیر ماسک کے چسپاں کرنا۔ IP، ٹوکن اور صارف پر مشتمل لاگ کو اوپن ٹول کو دینا سیکیورٹی کی خلاف ورزی ہے۔
  • پہلے مفروضے کو اصل وجہ قرار دینا۔ AI کی پہلی تجویز کو بغیر تصدیق کیے قبول کرنا ایونٹ کے اعادہ کی دعوت ہے۔
  • پورا لاگ برآمد کیا جا رہا ہے۔ سیاق و سباق کے بغیر بہت بڑا لاگ اے آئی کو بے ترتیب لائن میں لگاتا ہے۔ ایونٹ ونڈو پر سمٹیں۔
  • بغیر ثبوت کے 5 وجوہات۔ اگر آپ حقیقی اعداد و شمار کے ساتھ ہر "کیوں" قدم کا بیک اپ نہیں لیتے ہیں، تو آپ کو ایک قابل فہم لیکن بنی ہوئی زنجیر ملے گی۔
مشورہ: RCA کو ختم کرنے سے پہلے، پوچھیں "اگر یہ اصل وجہ درست ہے، کیا یہ دوبارہ نہیں ہوگا؟" سوال پوچھیں۔ اگر جواب "شاید" ہے تو آپ ابھی تک بنیادی وجہ تک نہیں پہنچے ہیں۔ دوسرے سے پوچھیں "کیوں"۔

خلاصہ میں

لاگ تجزیہ شور کے سمندر میں سگنل تلاش کرنے کے بارے میں ہے۔ AI اس سمندر کو سیکنڈوں میں خلاصہ اور تشکیل دیتا ہے، ایک ٹائم لائن قائم کرتا ہے اور مفروضے پیدا کرتا ہے۔ لیکن ارتباط وجہ نہیں ہے: اے آئی کی طرف سے تجویز کردہ وجہ ایک ابتدائی شبہ ہے، جب تک اس کی تصدیق نہ ہو جائے کوئی تلاش نہیں۔ ایونٹ ونڈو میں لاگ کو سمیٹیں، اسے ماسک کریں، ساخت کے بارے میں پوچھیں، "5 Whys" کے ساتھ گہرائی میں کھودیں اور سسٹم پر ہر مفروضے کو صرف پڑھنے کے لیے کمانڈز کے ساتھ جانچیں۔ آپ وہ ہیں جو بنیادی وجہ تلاش کرتے ہیں اور درست کرنے کی تصدیق کرتے ہیں۔ AI آپ کا ساتھی ہے۔

درخواست کا کام

ماضی کے ایونٹ (یا ٹیسٹ ایونٹ) کے لاگز لیں، اسے ایونٹ ونڈو میں سمیٹیں، اور کسی بھی حساس جگہ کو ماسک کریں۔ مندرجہ بالا "لاگ سمری" اور "ٹائم لائن" ٹیمپلیٹس کے ساتھ AI سے خلاصہ اور شیڈول کی درخواست کریں۔ پھر "5 وجوہات RCA پارٹنر" ٹیمپلیٹ کے ساتھ علامت سے جڑ کی طرف بڑھیں۔ ہر قدم کے لیے اپنا ثبوت لکھیں۔ آخر میں، ایک تصدیقی کمانڈ کے ساتھ AI کے ابتدائی مفروضے کی جانچ کریں اور ریکارڈ کریں کہ آیا یہ تصدیق شدہ ہے یا غلط۔ 6 آئٹمز میں عمل کا خلاصہ کریں۔

چیک لسٹ

  • کیا میں نے ایونٹ ونڈو میں لاگ کو ختم کر دیا ہے اور حساس علاقوں کو نقاب پوش کر دیا ہے؟
  • کیا میں نے AI سے ایک منظم خلاصہ اور ٹائم لائن طلب کی تھی، نہ کہ خام لاگ؟
  • [ ] کیا میں نے AI کے سبب کے دعووں کو فرضی تصورات کے طور پر نشان زد کیا ہے؟
  • کیا میں نے سسٹم پر ہر مفروضے کو صرف پڑھنے کے لیے تصدیقی کمانڈ کے ساتھ جانچا ہے؟
  • کیا میں نے حقیقی شواہد کے ساتھ "5 Whys" کے ہر قدم کا بیک اپ لیا ہے؟
  • کیا میں نے سوال کیا اور فیصلہ کیا کہ کیا اصل وجہ واقعہ کو روکے گی؟