ইউনিট
1. সিস্টেম এবং নেটওয়ার্ক পরিচালনায় কৃত্রিম বুদ্ধিমত্তার ভূমিকা: ভূমিকা, সীমানা, প্রমাণীকরণ এবং কর্তৃপক্ষ 2. অটোমেশন স্ক্রিপ্ট: নিরাপদে ব্যাশ, পাওয়ারশেল এবং পাইথন তৈরি করা 3. লগ বিশ্লেষণ এবং মূল কারণ বিশ্লেষণ: গোলমালের মধ্যে সংকেত খুঁজে পাওয়া 4. ক্যাপাসিটি এবং পারফরম্যান্স মনিটরিং: মেট্রিক্স পড়া এবং ভবিষ্যতের জন্য পরিকল্পনা 5. কনফিগারেশন ম্যানেজমেন্ট: কনফিগারেশন তৈরি করা, যাচাই করা এবং ড্রিফ্ট ক্যাপচার করা 6. কোড (আইএসি) হিসাবে অবকাঠামো ব্যবস্থাপনা: টেরাফর্ম, উত্তরযোগ্য এবং পরিকল্পনা নিয়ন্ত্রণ 7. ডকুমেন্টেশন এবং তথ্য ব্যবস্থাপনা: রানবুক, পোস্ট-মর্টেম এবং কর্পোরেট মেমরি 8. ভবিষ্যদ্বাণীমূলক রক্ষণাবেক্ষণ: তারা ঘটার আগে ব্যর্থতা দেখা 9. পরিবর্তন ব্যবস্থাপনা: ঝুঁকি মূল্যায়ন, রোলব্যাক এবং রক্ষণাবেক্ষণ উইন্ডো 10. নিরাপত্তা এবং প্রতিরক্ষা: প্রতিরক্ষা উদ্দেশ্যে এবং কর্তৃপক্ষের সীমার মধ্যে কৃত্রিম বুদ্ধিমত্তা ব্যবহার করা 11. এন্ড-টু-এন্ড ইন্টিগ্রেশন: শুরু থেকে শেষ পর্যন্ত একটি ঘটনা পরিচালনা করা
ইউনিট 3 / 11

লগ বিশ্লেষণ এবং মূল কারণ বিশ্লেষণ: গোলমালের মধ্যে সংকেত খুঁজে পাওয়া

লাভ:

  • সংক্ষিপ্তকরণ, গ্রুপ এবং টাইমলাইন লগগুলি করতে AI ব্যবহার করে দ্রুত শব্দে সংকেত খুঁজুন
  • পারস্পরিক সম্পর্ক এবং কার্যকারণকে পৃথক করার ক্ষমতা এবং কৃত্রিম বুদ্ধিমত্তার মূল কারণের পরামর্শগুলিকে অনুমান হিসাবে বিবেচনা করা যা যাচাই করা দরকার
  • কৃত্রিম বুদ্ধিমত্তার সাথে '5 কেন' পদ্ধতিটি পরিচালনা করে এবং বাস্তব প্রমাণ সহ প্রতিটি পদক্ষেপকে সমর্থন করে আসল মূল কারণটিতে যাওয়ার ক্ষমতা

লগ অ্যানালাইসিস এবং রুট কজ অ্যানালাইসিস: এআই দিয়ে গোলমালে সিগন্যাল খুঁজে পাওয়া

যখন একটি সিস্টেম ক্র্যাশ হয়, আপনি প্রথমে যে জায়গাটি দেখেন তা হল লগগুলি৷ লগ হল একটি টেক্সট স্ট্রীম যা একটি সিস্টেম বা অ্যাপ্লিকেশনের "আমি কী করেছি, কী ঘটেছে, কী ভেঙেছে" এর একটি সময়-স্ট্যাম্পযুক্ত রেকর্ড রাখে। কিন্তু একটি আধুনিক অবকাঠামো প্রতি ঘন্টায় লক্ষ লক্ষ লাইন তৈরি করে; এটি তথ্যের সমুদ্র নয়, তবে প্রায়শই শব্দের সমুদ্র। লগ বিশ্লেষণ হল এই গোলমালের মধ্যে গুরুত্বপূর্ণ সংকেত (ত্রুটি, অস্বাভাবিকতা, প্যাটার্ন) খুঁজে বের করার শিল্প। একটি ঘটনার পর "বাস্তব কারণ কী" প্রশ্নের উত্তর দেওয়ার প্রক্রিয়াকে বলা হয় মূল কারণ বিশ্লেষণ (RCA - রুট কজ অ্যানালাইসিস)। এখানে, AI প্রতি সেকেন্ডে হাজার হাজার লাইনের সারসংক্ষেপ, প্যাটার্ন বের করা, টাইমলাইন স্থাপন এবং সম্ভাব্য কারণগুলি তালিকাভুক্ত করার ক্ষেত্রে খুবই শক্তিশালী। তবে সতর্কতার একটি শব্দ: এআই সম্ভাব্য কারণ তৈরি করে; আপনি সেই ব্যক্তি যিনি সিস্টেমে যাচাই করেন কোনটি বাস্তব এবং সিদ্ধান্ত নেন।

এই ইউনিটে আপনি শিখবেন কীভাবে AI এর সাথে লগগুলিকে আত্মবিশ্বাসের সাথে সংক্ষিপ্ত করতে হয়, কীভাবে একটি ইভেন্টের একটি টাইমলাইন স্থাপন করতে হয়, কীভাবে পারস্পরিক সম্পর্ক (একত্রে পরিবর্তন করা) এবং কার্যকারণ (একটি অন্যটির কারণ) এর মধ্যে পার্থক্য করা যায় এবং কীভাবে AI এর সাথে "5 Whys" এর মতো একটি RCA পদ্ধতি চালানো যায়।

পারস্পরিক সম্পর্ক কেন কার্যকারণ নয়?

এটি এই ইউনিটের সবচেয়ে সমালোচনামূলক ধারণা। একই সময়ে দুটি ঘটনা ঘটলে, একটি অন্যটি ঘটায় না। একটি সার্ভারের CPU এবং নেটওয়ার্ক ট্রাফিক একই সময়ে বৃদ্ধি পেতে পারে; কিন্তু একটি অন্যটির ফলাফল নয়, উভয়ই তৃতীয় ইভেন্টের ফলাফল হতে পারে (উদাহরণস্বরূপ, একটি ব্যাচের কাজের শুরু)। যখন AI মেট্রিক্স একসাথে পরিবর্তিত হতে দেখে, তখন এটি অনুমান করে যে "সম্ভবত X দ্বারা Y হয়েছে।" এটি একটি সূচনা বিন্দু, একটি উপসংহার নয়। কার্যকারণ যাচাই করার জন্য, আপনাকে হয় পরিবর্তনশীলটিকে আলাদা করতে হবে (পরীক্ষার পরিবেশে X ট্রিগার করুন এবং Y ঘটে কিনা তা দেখুন) বা প্রক্রিয়াটি প্রমাণ করতে হবে (প্রযুক্তিগত উপায়গুলি দেখান যার মাধ্যমে X Y উত্পাদন করে)।

সতর্কতা: AI এর বাক্যটিকে "এটি সম্ভবত এটি ঘটিয়েছে" একটি অনুমান হিসাবে নিন, একটি অনুসন্ধান নয়। RCA-তে, ভুল মূল কারণ ইভেন্টের ভুল সংশোধন এবং পুনরাবৃত্তি ঘটায়। আপনি প্রথম সন্দেহভাজন খুঁজে পেয়েছেন, কারণ নয়; সেখানেই কাজ শুরু হয়।

ধাপে ধাপে: AI দিয়ে বিশ্লেষণ করুন

  1. পরিধি সংকুচিত করুন। ইভেন্ট উইন্ডোটি দিন, সম্পূর্ণ লগ নয়: "ইভেন্ট 14:05 এ শুরু হয়েছে, 14:00–14:20 থেকে সমালোচনামূলক"। AI কে প্রাসঙ্গিক টাইম স্লট এবং পরিষেবা বলুন।
  2. মুখোশ। লগগুলিতে অভ্যন্তরীণ আইপি, হোস্টের নাম, ব্যবহারকারী এবং টোকেন থাকে। সেগুলিকে মাস্ক করুন (10.x.x.x, host-A, user1, REDACTED) তারপর এক্সপোর্ট করুন৷
  3. সারাংশ এবং গ্রুপিং অনুরোধ. "এই লগটিকে তীব্রতার দ্বারা গোষ্ঠীভুক্ত করুন, পুনরাবৃত্তির ত্রুটিগুলি গণনা করুন, প্রথম ত্রুটির টাইমস্ট্যাম্প খুঁজুন।" কাঠামোর জন্য জিজ্ঞাসা করুন, কাঁচা লগ নয়।
  4. একটি টাইমলাইন সেট আপ করুন। "সময় ক্রমে এই ইভেন্টগুলি সাজান এবং দেখান কি অনুসরণ করে।" প্রথম ডমিনো খোঁজা হল মূল কারণের পথ।
  5. অনুমানের জন্য জিজ্ঞাসা করুন, প্রমাণ নয়। "সম্ভাব্যতার ক্রমানুসারে সম্ভাব্য মূল কারণগুলি তালিকাভুক্ত করুন এবং প্রতিটির জন্য সিস্টেমে চালানোর জন্য আমাকে একটি যাচাইকরণ আদেশ দিন।" নির্ণয়ের জন্য জিজ্ঞাসা করুন, ফলাফল নয়।
  6. সিস্টেমে যাচাই করুন। শুধুমাত্র পঠনযোগ্য ডায়াগনস্টিক কমান্ডের সাথে প্রতিটি হাইপোথিসিস পরীক্ষা করুন (লগ গ্রেপ, স্ট্যাটাস কোয়েরি, মেট্রিক)। শুধুমাত্র একটি নিশ্চিত মূল কারণ না হওয়া পর্যন্ত নির্মূল করুন।

5 কেন পদ্ধতি

RCA এর ক্লাসিক এবং শক্তিশালী টুল হল "5 Whys": একটি উপসর্গ দিয়ে শুরু করে "কেন?" পাঁচ বার জিজ্ঞাসা করে, আপনি পৃষ্ঠ উপসর্গের নীচে মূল কারণ পেতে পারেন। উদাহরণ: "সাইটটি ক্র্যাশ হয়েছে। কেন? অ্যাপ্লিকেশনটি মারা গেছে কারণ এটির মেমরি ফুরিয়ে গেছে। কেন? একটি ক্যোয়ারী সমস্ত মেমরি গ্রাস করেছে। কেন? ক্যোয়ারী একটি সূচক ব্যবহার করেনি। কেন? সূচীটি শেষ প্রকাশে মুছে ফেলা হয়েছিল। কেন? পরিবর্তন পর্যালোচনাতে এটি লক্ষ্য করা হয়নি।" মূল কারণ পৃষ্ঠ "সাইট ক্র্যাশ" নয় বরং "দুর্বল পরিবর্তন পর্যালোচনা প্রক্রিয়া"। AI এই চেইনটি তৈরিতে একটি ভাল অংশীদার হবে — তবে আপনাকে অবশ্যই বাস্তব প্রমাণ সহ প্রতিটি "কেন" পদক্ষেপের ব্যাক আপ করতে হবে, বা AI একটি যুক্তিযুক্ত কিন্তু মিথ্যা চেইন নিয়ে আসতে পারে।

তিনটি মিনি কেস

কেস 1 — 40,000 লাইন, 3 মিনিট। রাতারাতি বিভ্রাটের সময় একজন প্রশাসক ম্যানুয়ালি 40,000 লাইনের অ্যাপ্লিকেশন লগ স্ক্যান করা শুরু করেছিলেন। তিনি মুখোশযুক্ত লগের প্রাসঙ্গিক 20-মিনিটের অংশটি এআইকে দিয়েছিলেন এবং সারাংশ এবং গ্রুপিংয়ের জন্য বলেছিলেন। AI 02:14-এ প্রথম OutOfMemory বাগটিকে ফ্ল্যাগ করেছে, বর্ধিত টাইমআউট বাগগুলির ঠিক পরে৷ প্রকৌশলী 3 মিনিটের মধ্যে টাইম শীট পেয়েছেন; নিজস্ব মেট্রিক প্যানেলে মূল নির্ণয়ের বিষয়টি নিশ্চিত করেছে।

কেস 2 - ভুল মূল কারণ থেকে ফিরে আসা। একটি দল ভেবেছিল যে AI এর প্রথম অনুমান ("লগগুলি ডিস্কে ভরাট") সঠিক ছিল এবং লগগুলি সাফ করেছে৷ কিন্তু ঘটনার পুনরাবৃত্তি ঘটে পরদিন। দ্বিতীয় রাউন্ডে, তারা শৃঙ্খলার সাথে "5 কেন" প্রয়োগ করেছিল: আসল কারণটি ছিল যে একটি অ্যাপ্লিকেশন ত্রুটি প্রতি সেকেন্ডে শত শত কোর ডাম্প লিখছিল। প্রথম অনুমান ছিল পারস্পরিক সম্পর্ক; আসল কারণ ছিল ভিন্ন। যাচাই-বাছাই ছাড়াই গ্রহণযোগ্যতা শুধুমাত্র একদিনের অবসান প্রদান করেছিল।

কেস 3 — টাইমলাইন অপরাধীকে খুঁজে পেয়েছে। মাঝে মাঝে নেটওয়ার্ক বিভ্রাটের সময় কয়েক ডজন ডিভাইসের লগ ছিল। প্রকৌশলী মুখোশযুক্ত লগগুলি AI কে দিয়েছিলেন এবং এটি একটি ইউনিফাইড টাইমলাইন তৈরি করেছিলেন। চার্ট দেখায় যে প্রতিটি বিভ্রাট একটি অপ্রয়োজনীয় সুইচ স্বাস্থ্য পরীক্ষা বার্তার ঠিক 30 সেকেন্ড পরে শুরু হয়েছিল। এই পারস্পরিক সম্পর্ক একটি শক্তিশালী সূত্র ছিল; দলটি ডিভাইসে কীটির ফার্মওয়্যার ত্রুটি যাচাই করেছে এবং এটি প্রতিস্থাপন করেছে।

চারটি অনুলিপিযোগ্য টেমপ্লেট

1) লগ সারাংশ এবং গ্রুপিং:

নীচে 14:00-14:20 থেকে [পরিষেবার] জন্য মুখোশযুক্ত লগ রয়েছে৷ আমাকে বলুন: (1) গোষ্ঠীবদ্ধ করুন এবং তীব্রতা অনুসারে লাইনগুলি গণনা করুন (ERROR/WARN/INFO), (2) শীর্ষ 5টি পুনরাবৃত্ত ত্রুটির নিদর্শন তালিকাভুক্ত করুন, (3) প্রথম ত্রুটির টাইমস্ট্যাম্প খুঁজুন৷ কাঁচা লগ পুনরায় লিখবেন না, শুধু একটি কাঠামোগত সারাংশ দিন। একটি তৈরি করা লাইন যোগ করা হচ্ছে। লগ: [মাস্কড লগ]

2) একটি টাইমলাইন সেট আপ করা:

আমরা নিম্নলিখিত মুখোশযুক্ত ইভেন্ট রেকর্ডগুলিকে একটি একক টাইমলাইনে (টাইমস্ট্যাম্প + উত্স + ইভেন্ট) সাজিয়েছি। কী অনুসরণ করে তা দেখান এবং ইভেন্টটিকে চিহ্নিত করুন যা প্রথম ট্রিগার বলে মনে হয়। মনে রাখবেন এটি একটি হাইপোথিসিস এবং কার্যকারণ যাচাই করা দরকার। রেকর্ডিং: [মাস্কড রেকর্ডিং]

3) 5টি কারণ আরসিএ অংশীদার:

আপনার ভূমিকা: RCA ফ্যাসিলিটেটর। উপসর্গ: [লক্ষণ]। আমার সাথে "5টি কেন" করুন: একটি "কেন?" প্রতিটি ধাপে জিজ্ঞাসা করুন, আমি আমার কাছে প্রমাণ সহ উত্তর দেব, আপনি পরবর্তী প্রশ্নটি করুন। যদি আমার প্রমাণ দুর্বল হয়, আমাকে সতর্ক করুন এবং আমাকে বলুন যে আমার কোন ডেটা সংগ্রহ করতে হবে। প্রমাণ ছাড়া মূল কারণ ঘোষণা করবেন না।

4) হাইপোথিসিস + যাচাইকরণ কমান্ড:

সম্ভাব্যতার ক্রমানুসারে এই লক্ষণ [লক্ষণের] সম্ভাব্য মূল কারণগুলি তালিকাভুক্ত করুন। প্রতিটি কারণে: (ক) আপনি কি সন্দেহ করেন, (খ) আমার সিস্টেমে চালানোর জন্য আমাকে একটি শুধুমাত্র-পঠন যাচাইকরণ কমান্ড দিন (কোনও মুছে ফেলুন/পরিবর্তন করবেন না)। ব্যাখ্যা করুন কোন ফলাফল অনুমানকে নিশ্চিত বা অস্বীকার করে।

দুর্বল প্রম্পট / শক্তিশালী প্রম্পট

দুর্বল প্রম্পট:

এই লগ সঙ্গে ভুল কি? [কাঁচা লগের 10,000 লাইন]

এই প্রম্পট উভয়ই সংবেদনশীল ডেটা ফাঁস করে মুখোশ ছাড়াই এবং এআইকে প্রসঙ্গ ছাড়াই ছেড়ে দেয়। এআই একটি এলোমেলো লাইনে হোঁচট খেতে পারে এবং একটি সুপারফিশিয়াল বা এমনকি তৈরি কারণও দিতে পারে।

শক্তিশালী প্রম্পট:

আপনার ভূমিকা: সিনিয়র SRE. ইভেন্ট: পেমেন্ট সার্ভিস 02:10-02:25 এর মধ্যে 50% ত্রুটি দিয়েছে। নীচে সেই উইন্ডোটির মুখোশযুক্ত লগ রয়েছে। আমাকে (1) তীব্রতা দ্বারা গোষ্ঠীবদ্ধ সারাংশ, (2) প্রথম ত্রুটির টাইমস্ট্যাম্প, (3) সম্ভাব্যতার ক্রম অনুসারে সম্ভাব্য মূল কারণগুলি এবং প্রতিটির জন্য একটি শুধুমাত্র-পঠন যাচাইকরণ আদেশ দিন৷ কার্যকারণ দাবিকে অনুমান হিসাবে চিহ্নিত করুন। লগ: [মাস্কড লগ]

পদক্ষেপ

উদ্দেশ্য

AI এর ভূমিকা

মানুষের ভূমিকা

সারাংশ/গ্রুপিং

শব্দ কমান

হাজার হাজার সারি কনফিগার করা হচ্ছে

সুযোগ এবং মুখোশ নির্ধারণ করুন

সময়রেখা

প্রথম ডমিনো খোঁজা

ঘটনা বাছাই

স্ট্যাম্প যাচাই

অনুমান প্রজন্ম

সন্দেহভাজনদের বাছাই করা

সম্ভাবনার তালিকা করুন

প্রসঙ্গ দ্বারা ফিল্টার

যাচাইকরণ

আসল কারণ খুঁজে বের করুন

ডায়গনিস্টিক কমান্ডের পরামর্শ দিন

কমান্ডটি চালান এবং এটি মন্তব্য করুন

সিদ্ধান্ত

ঠিক করা বেছে নিচ্ছে

অফার বিকল্প

সিদ্ধান্ত নিন এবং নিশ্চিত করুন

সাধারণ ভুল

  • কার্যকারণ জন্য ভুল পারস্পরিক সম্পর্ক. দুটি মেট্রিক্স গ্রহণ করা যা একসাথে পরিবর্তিত হয় "একটি অন্যটির কারণ" হিসাবে ভুল সংশোধন তৈরি করে।
  • একটি মুখোশ ছাড়া কাঁচা লগ আটকানো. একটি ওপেন টুলে আইপি, টোকেন এবং ব্যবহারকারী সম্বলিত লগ দেওয়া নিরাপত্তা লঙ্ঘন।
  • প্রথম অনুমানকে মূল কারণ হিসাবে ঘোষণা করা। AI এর প্রথম পরামর্শটি যাচাই না করেই তা গ্রহণ করা ইভেন্টের পুনরাবৃত্তির জন্য একটি আমন্ত্রণ।
  • সম্পূর্ণ লগ রপ্তানি করা হচ্ছে। প্রসঙ্গ ছাড়া বিশাল লগ এআইকে একটি এলোমেলো লাইনে প্লাগ করে; ইভেন্ট উইন্ডোতে সঙ্কুচিত করুন।
  • প্রমাণ ছাড়া 5 কারণ. আপনি যদি বাস্তব ডেটা সহ প্রতিটি "কেন" পদক্ষেপের ব্যাক আপ না করেন, তাহলে আপনি একটি যুক্তিসঙ্গত কিন্তু তৈরি চেইন পাবেন।
টিপ: একটি RCA শেষ করার আগে, জিজ্ঞাসা করুন "যদি এই মূল কারণটি আসলে ঠিক করা হয়, তাহলে কি এটি আবার ঘটবে না?" প্রশ্ন করুন। যদি উত্তর হয় "হয়তো," আপনি এখনও মূল কারণটি পাননি; আরেকজনকে জিজ্ঞাসা করুন "কেন"।

সংক্ষেপে

লগ বিশ্লেষণ হল গোলমালের সমুদ্রে সংকেত খোঁজার বিষয়ে; AI সেকেন্ডের মধ্যে এই মহাসাগরকে সংক্ষিপ্ত করে এবং গঠন করে, একটি টাইমলাইন স্থাপন করে এবং হাইপোথিসিস তৈরি করে। কিন্তু পারস্পরিক সম্পর্ক কার্যকারণ নয়: এআই দ্বারা প্রস্তাবিত কারণটি একটি প্রাথমিক সন্দেহ, নিশ্চিত না হওয়া পর্যন্ত একটি অনুসন্ধান নয়। ইভেন্ট উইন্ডোতে লগটি সঙ্কুচিত করুন, এটিকে মাস্ক করুন, কাঠামোর জন্য জিজ্ঞাসা করুন, "5 কেন" দিয়ে গভীর খনন করুন এবং সিস্টেমে প্রতিটি হাইপোথিসিসকে শুধুমাত্র-পঠন-কমান্ড দিয়ে পরীক্ষা করুন। আপনি সেই ব্যক্তি যিনি মূল কারণ খুঁজে পান এবং সমাধান নিশ্চিত করেন; এআই আপনার সঙ্গী।

আবেদন টাস্ক

একটি অতীতের ইভেন্টের (বা একটি পরীক্ষার ইভেন্ট) লগ নিন, এটিকে ইভেন্ট উইন্ডোতে ভেঙে ফেলুন এবং যেকোনো সংবেদনশীল এলাকাকে মাস্ক করুন। উপরের "লগ সারাংশ" এবং "টাইমলাইন" টেমপ্লেট সহ AI থেকে একটি সারাংশ এবং সময়সূচীর অনুরোধ করুন। তারপর "5 কারণ RCA অংশীদার" টেমপ্লেট দিয়ে লক্ষণ থেকে মূল কারণের দিকে যান; প্রতিটি পদক্ষেপের জন্য আপনার নিজের প্রমাণ লিখুন। অবশেষে, একটি যাচাইকরণ কমান্ডের মাধ্যমে AI এর প্রাথমিক অনুমান পরীক্ষা করুন এবং এটি নিশ্চিত বা অপ্রমাণিত কিনা তা রেকর্ড করুন। 6টি আইটেমে প্রক্রিয়াটি সংক্ষিপ্ত করুন।

চেকলিস্ট

  • [ ] আমি কি ইভেন্ট উইন্ডোতে লগটি ভেঙে ফেলেছি এবং সংবেদনশীল এলাকাগুলিকে মুখোশ দিয়েছি?
  • [ ] আমি কি এআইকে একটি কাঠামোগত সারাংশ এবং টাইমলাইনের জন্য জিজ্ঞাসা করেছি, একটি কাঁচা লগ নয়?
  • [ ] আমি কি AI এর কার্যকারণ দাবিকে অনুমান হিসাবে চিহ্নিত করেছি?
  • [ ] আমি কি সিস্টেমে প্রতিটি হাইপোথিসিসকে শুধুমাত্র-পঠনযোগ্য যাচাইকরণ কমান্ড দিয়ে পরীক্ষা করেছি?
  • [ ] আমি কি বাস্তব প্রমাণ সহ "5 কেন" এর প্রতিটি ধাপের ব্যাক আপ করেছি?
  • [ ] আমি কি প্রশ্ন করেছি এবং সিদ্ধান্ত নিয়েছি যে মূল কারণটি আসলে ঘটনাটি প্রতিরোধ করবে কিনা?