ইউনিট
1. DevOps এবং ক্লাউড এআই-এর ভূমিকা: ভূমিকা, সীমানা, প্রমাণীকরণ, নিরাপত্তা এবং গোপনীয়তা 2. কৃত্রিম বুদ্ধিমত্তা সহ সিআই/সিডি পাইপলাইন ডিজাইন করা: গিটহাব অ্যাকশন এবং গিটল্যাব সিআই 3. কোড হিসাবে পরিকাঠামো পরিচালনা: Terraform এবং IaC সহ কৃত্রিম বুদ্ধিমত্তা 4. কন্টেইনারাইজেশন: কৃত্রিম বুদ্ধিমত্তা সহ ডকারফাইল এবং চিত্র অপ্টিমাইজেশন 5. কুবারনেটস: ম্যানিফেস্ট, হেলম এবং এআই-চালিত অর্কেস্ট্রেশন 6. পর্যবেক্ষণ এবং পর্যবেক্ষণযোগ্যতা: মেট্রিক, লগ, ট্রেস এবং অ্যালার্ম নিয়ম 7. ঘটনা ব্যবস্থাপনা এবং পোস্টমর্টেম: কৃত্রিম বুদ্ধিমত্তার সাথে মূল কারণ বিশ্লেষণ 8. ক্লাউড কস্ট অপ্টিমাইজেশান (ফিনঅপস): কৃত্রিম বুদ্ধিমত্তার সাহায্যে বর্জ্যের জন্য শিকার করা 9. স্ক্রিপ্ট এবং অটোমেশন জেনারেশন: ব্যাশ, পাইথন এবং পাওয়ারশেল 10. নিরাপত্তা এবং গোপন ব্যবস্থাপনা: DevSecOps এবং কৃত্রিম বুদ্ধিমত্তা 11. প্রোড যাচাইকরণ, রিলিজ কৌশল এবং এন্ড-টু-এন্ড এআই ওয়ার্কফ্লো
ইউনিট 6 / 11

পর্যবেক্ষণ এবং পর্যবেক্ষণযোগ্যতা: মেট্রিক, লগ, ট্রেস এবং অ্যালার্ম নিয়ম

লাভ:

  • পর্যবেক্ষণযোগ্যতার তিনটি স্তম্ভ (মেট্রিক, লগ, ট্রেস) এবং চারটি সোনালী সংকেত বোঝার ক্ষমতা এবং কৃত্রিম বুদ্ধিমত্তা PromQL কোয়েরি, অ্যালার্ম নিয়ম এবং ড্যাশবোর্ড তৈরি করে
  • অ্যালার্ম অ্যাকশন-ভিত্তিক রেখে এবং সঠিক জরুরী ভিত্তিতে এবং আপনার নিজস্ব সিস্টেমের ঐতিহাসিক ডেটার বিরুদ্ধে থ্রেশহোল্ড পরীক্ষা করে অ্যালার্ম ক্লান্তি প্রতিরোধ করার ক্ষমতা
  • কৃত্রিম বুদ্ধিমত্তায় লগ দেওয়ার আগে সংবেদনশীল অঞ্চলগুলিকে মাস্ক করে গোপনীয়তা এবং গোপন ফাঁস প্রতিরোধ করার ক্ষমতা

একটি সিস্টেম কাজ করছে বলে মনে হতে পারে, এটি ভিতরে মারা যেতে পারে: স্মৃতি ধীরে ধীরে পূরণ হচ্ছে, প্রতিক্রিয়ার সময় বাড়ছে, ত্রুটির হার বাড়ছে। এটি লক্ষ্য করার একমাত্র উপায় হল ক্রমাগত সিস্টেম নিরীক্ষণ করা। একটি আরও উন্নত ধারণা হল পর্যবেক্ষণযোগ্যতা: সিস্টেমের বাইরের লক্ষণগুলি দেখে বোঝার ক্ষমতা। পর্যবেক্ষণযোগ্যতার তিনটি স্তম্ভ রয়েছে এবং DevOps পেশাদার তিনটিই ব্যবহার করে:

  • মেট্রিক: সময়ের সাথে পরিমাপ করা সংখ্যাসূচক মান — CPU ব্যবহার, অনুরোধের সংখ্যা, প্রতিক্রিয়া সময়, ত্রুটির হার। "কত?" প্রশ্নের উত্তর দেয়।
  • লগ: সিস্টেম দ্বারা উত্পাদিত পাঠ্য ইভেন্ট রেকর্ড—"ব্যবহারকারী লগ ইন করেছে", "ডাটাবেস সংযোগ হারিয়েছে"। "ঠিক কি হয়েছে?" প্রশ্নের উত্তর দেয়।
  • ট্রেস: সিস্টেমের মধ্যে পরিষেবা থেকে পরিষেবাতে যাওয়ার সময় অনুরোধটি যে পথ অনুসরণ করে এবং প্রতিটি পদক্ষেপের সময়কাল। "মন্থরতা কোথায়?" প্রশ্নের উত্তর দেয়।

সর্বাধিক সাধারণ সরঞ্জাম: মেট্রিক্সের জন্য প্রমিথিউস, ভিজ্যুয়ালাইজেশনের জন্য গ্রাফানা, লগের জন্য লোকি/ইএলকে, ট্রেসের জন্য জেগার/ওপেনটেলিমেট্রি। AI এই টুলগুলির জন্য কোয়েরি ভাষাগুলি (বিশেষত প্রমিথিউসের প্রমকিউএল), অ্যালার্মের নিয়ম এবং ড্যাশবোর্ড কনফিগারেশনগুলি লিখতে খুব দক্ষ। এখানেও AI সবচেয়ে শক্তিশালী: লগ এবং মেট্রিক্সের বড় অংশের সংক্ষিপ্তকরণ এবং অসঙ্গতিগুলি চিহ্নিত করা।

একটি বাক্যে পর্যবেক্ষণ এবং পর্যবেক্ষণের মধ্যে পার্থক্যটি স্পষ্ট করা যাক: পর্যবেক্ষণ হচ্ছে এমন প্রশ্ন জিজ্ঞাসা করা যা আপনি ইতিমধ্যেই জানেন ("CPU কি 90% অতিক্রম করেছে?"); পর্যবেক্ষণযোগ্যতা এমন প্রশ্ন জিজ্ঞাসা করতে সক্ষম হচ্ছে যা আপনি ইতিমধ্যে জানেন না ("কেন এই অদ্ভুত ধীরতা শুধুমাত্র একটি নির্দিষ্ট সময়ে একটি নির্দিষ্ট গ্রাহকের জন্য ঘটছে?")। আধুনিক সিস্টেমগুলি এত জটিল যে আপনি ব্যর্থতার সমস্ত মোড ভবিষ্যদ্বাণী করতে পারবেন না; অতএব, সমৃদ্ধ মেট্রিক্স, লগ এবং ট্রেস সংগ্রহ করার ক্ষমতা এবং তারপরে গভীরভাবে অনুসন্ধান করার ক্ষমতা - অর্থাৎ পর্যবেক্ষণযোগ্যতা - সমালোচনামূলক হয়ে ওঠে। "আগের অজানা প্রশ্নের" উত্তর দেওয়ার সময় AI এখানেই কার্যকর হয়: এটি আপনার কাছে থাকা কাঁচা ডেটা দ্রুত স্ক্যান করে, প্যাটার্ন এবং অসঙ্গতির পরামর্শ দেয় এবং আপনি এই ক্লুগুলি যাচাই করে মূল কারণটিতে পৌঁছান।

ধাপে ধাপে: কি এবং কিভাবে নিরীক্ষণ?

  1. সঠিক মেট্রিক্স চয়ন করুন। শিল্পে, "চারটি সোনালী সংকেত" ভিত্তি হিসাবে নেওয়া হয়: বিলম্ব, ট্র্যাফিক, ত্রুটি, স্যাচুরেশন — সম্পদ কতটা পূর্ণ। এগুলি বেশিরভাগ পরিষেবার স্বাস্থ্যের সংক্ষিপ্ত বিবরণ দেয়।
  2. মেট্রিক্স সংগ্রহ করুন। অ্যাপ্লিকেশনটিকে একটি শেষ বিন্দু উপস্থাপন করতে দিন যা প্রমিথিউস পড়তে পারে।
  3. ড্যাশবোর্ড সেট আপ করুন। Grafana এই মেট্রিক্স কল্পনা করুন.
  4. অ্যালার্ম নিয়ম লিখুন। একটি থ্রেশহোল্ড অতিক্রম করা হলে কাকে সতর্ক করা হবে এবং কিভাবে?
  5. কেন্দ্রীভূত লগ. সমস্ত পরিষেবা লগ এক জায়গায় অনুসন্ধানযোগ্য করুন।
  6. আওয়াজ কমান। অত্যধিক অ্যালার্ম "সতর্ক ক্লান্তি" তৈরি করে; গুরুত্বপূর্ণ অ্যালার্ম অদৃশ্য হয়ে যায়।
টিপ: একটি ভাল অ্যালার্ম দুটি জিনিস পূরণ করে: এটি কার্যকরী এবং সঠিক জরুরী। একটি অ্যালার্ম যা কাউকে ভোর 3 টায় ঘুম থেকে জাগায় তা অবশ্যই এমন কিছু হতে হবে যা আসলে রাতের হস্তক্ষেপের প্রয়োজন হয়। এমন কিছুর জন্য কাউকে জাগিয়ে তুলবেন না যার জন্য নিজে থেকে কিছু করার প্রয়োজন নেই, যেমন "CPU 70%"; বোর্ডে এটি প্রদর্শন করুন।

কিভাবে একটি এলার্ম নিয়ম লিখতে হয়?

একটি সতর্কতা তিনটি উপাদান নিয়ে গঠিত: অবস্থা (কোন মেট্রিক কোন থ্রেশহোল্ড অতিক্রম করে এবং কতক্ষণের জন্য), সময়কাল ("5 মিনিটের জন্য" ক্ষণিকের ওঠানামা এড়াতে), এবং গুরুত্ব/ক্রিয়া (কার কাছে, কোন চ্যানেলের মাধ্যমে)। এআই দক্ষতার সাথে এই তিনটিকে সঠিক প্রেক্ষাপটে প্রতিষ্ঠা করে। উদাহরণ স্বরূপ, PromQL-এ "ক্রিটিকাল অ্যালার্ম যদি 5 মিনিটের জন্য ত্রুটির হার 5% ছাড়িয়ে যায়" এর মতো একটি নিয়ম অনুবাদ করা AI-এর জন্য একটি বিভক্ত-সেকেন্ড কাজ — তবে আপনি সিদ্ধান্ত নিন যে থ্রেশহোল্ড আপনার সিস্টেমের জন্য সঠিক কিনা।

সতর্কতা: এআই দ্বারা প্রস্তাবিত অ্যালার্ম থ্রেশহোল্ডগুলি সাধারণ অনুমান। আপনার সিস্টেমের স্বাভাবিক লোড, সহনশীলতা এবং কাজের প্রভাব ভিন্ন। আপনি সরাসরি প্রোডে একটি থ্রেশহোল্ড স্থাপন করার আগে, আপনি আপনার ঐতিহাসিক ডেটা দেখেন এবং জিজ্ঞাসা করুন "এই থ্রেশহোল্ডটি অতীতে কতবার ট্রিগার হয়েছে, এর মধ্যে কতগুলি আসল সমস্যা ছিল?" প্রশ্নের উত্তর দাও।

লগ গোপনীয়তা: সমালোচনামূলক সতর্কতা

লগগুলি ফাঁসের সবচেয়ে ঘন ঘন উপেক্ষিত উৎস। একটি লগ লাইন দুর্ঘটনাক্রমে একটি পাসওয়ার্ড, একটি ক্রেডিট কার্ড নম্বর, বা ব্যক্তিগত ডেটা (KVKK/GDPR-এর অধীনে) থাকতে পারে। বিশ্লেষণের জন্য একটি AI-তে লগ পেস্ট করার সময়:

  1. সংবেদনশীল এলাকায় মুখোশ। মান প্রতিস্থাপন করুন যেমন টোকেন, পাসওয়ার্ড, ইমেল, আইডি নম্বর <REDACTED> দিয়ে।
  2. উদাহরণ দিন, সব না। এক মিলিয়ন লাইনের পরিবর্তে, কয়েকশ প্রতিনিধি লাইন প্রায়ই যথেষ্ট।
  3. একটি প্রতিষ্ঠান-অনুমোদিত গাড়ি চয়ন করুন। বিশেষ করে উৎপাদন লগের জন্য, এমন একটি টুল ব্যবহার করুন যার ডেটা প্রশিক্ষণে যায় না।

চারটি সোনালী সংকেত এবং অ্যালার্ম টেবিল

সংকেত

দ্বারা পরিমাপ করা হয়

অ্যালার্ম থ্রেশহোল্ডের উদাহরণ

জরুরী

বিলম্ব

প্রতিক্রিয়া সময়

p95 > 800 ms, 5 মিনিট

উচ্চ

ট্রাফিক

অনুরোধ/সেকেন্ড

হঠাৎ 300% বৃদ্ধি/কমানো

মাঝারি

ত্রুটি

ব্যর্থ অনুরোধের হার

> 5%, 5 মিনিট

সমালোচনামূলক

স্যাচুরেশন

সম্পদ দখল

ডিস্ক > 85%

উচ্চ

তিনটি মিনি কেস

কেস 1 — লগের 400 লাইন 30 সেকেন্ডে সংক্ষিপ্ত করা হয়েছে। একটি পরিষেবা ধীর হয়ে গিয়েছিল। প্রকৌশলী মুখোশযুক্ত 400 লাইনের লগ AI কে দিয়েছিলেন এবং বলেছিলেন, "পুনরাবৃত্ত ত্রুটির নিদর্শন এবং সময়ের তীব্রতা সংক্ষিপ্ত করুন।" AI দেখিয়েছে যে একটি নির্দিষ্ট বাহ্যিক API কল প্রতি 30 সেকেন্ডে শেষ হয়। 30 সেকেন্ডের মধ্যে মূল কারণ পাওয়া যায়; ম্যানুয়ালি লগ স্ক্যান করতে আধা ঘন্টা সময় লাগবে।

কেস 2 - অ্যালার্ম ক্লান্তি সমাধান করা হয়েছে। একটি দল প্রতিদিন 200টি অ্যালার্ম পেয়েছিল এবং সেগুলিকে উপেক্ষা করছিল - যতক্ষণ না একটি সত্যিকারের বিভ্রাটের অ্যালার্মকেও উপেক্ষা করা হয়নি। AI কে সমস্ত সতর্কতার নিয়মগুলি দিন এবং জিজ্ঞাসা করুন "কোনগুলি কার্যকর নয় এবং কোনগুলি একত্রিত করা যেতে পারে?" তারা জিজ্ঞাসা. অ্যালার্মের সংখ্যা প্রতিদিন 12 এ কমেছে; প্রতিটি অ্যালার্ম এখন গুরুত্ব সহকারে নেওয়া হয়েছিল।

কেস 3 - ভুল থ্রেশহোল্ড তাড়াতাড়ি ধরা। YZ ডিস্কের জন্য "95% পূর্ণ হলে সতর্ক করুন" পরামর্শ দিয়েছে। প্রকৌশলী ঐতিহাসিক তথ্য দেখেছেন: একবার ডিস্ক 95% পৌঁছে গেলে হস্তক্ষেপের জন্য খুব কম সময় ছিল। এটি থ্রেশহোল্ডকে 80% এ নামিয়েছে এবং "বৃদ্ধির হার" এর উপর ভিত্তি করে একটি দ্বিতীয় অ্যালার্ম যোগ করেছে। যাচাইকরণ একটি প্রকৃত মধ্যরাত বিভ্রাট প্রতিরোধ করেছে।

চারটি অনুলিপিযোগ্য টেমপ্লেট

1) লগ সংক্ষিপ্তকরণ (মুখোশ):

নীচের লগ উদাহরণটি বিশ্লেষণ করুন (আমি <REDACTED> দিয়ে সংবেদনশীল মানগুলি মাস্ক করেছি)। আমাকে দিন: (1) পুনরাবৃত্তির ত্রুটির ধরণ, (2) সময়ের সাথে ঘনত্ব, (3) সম্ভবত মূল কারণ, এবং (4) 3টি মেট্রিক্স আমি যাচাই করতে দেখব। লগ: [লাইন]

2) অ্যালার্ম রুল জেনারেশন:

Prometheus/Alertmanager-এর জন্য একটি অ্যালার্ম নিয়ম লিখুন: [SEVERITY] অ্যালার্ম তৈরি করুন যদি [THRESHOLD] [METRIC][DURATION] অতিক্রম করে। নিয়মটি অ্যাকশন-ভিত্তিক হওয়া উচিত এবং একটি টীকা এবং রানবুক লিঙ্ক ক্ষেত্র অন্তর্ভুক্ত করা উচিত। PromQL ব্যাখ্যা করুন এবং লিখুন কেন এই থ্রেশহোল্ড যুক্তিসঙ্গত।

3) PromQL প্রশ্ন লেখা/ঘোষণা করা:

একটি PromQL প্রশ্ন লিখুন যা পরিমাপ করে: [EX. গত 5 মিনিটে 5xx ত্রুটি হার শতাংশ]। প্রশ্নটি ধাপে ধাপে ব্যাখ্যা কর। তারপর আমাকে বলুন এই মানের জন্য স্বাস্থ্যকর পরিসীমা কি হওয়া উচিত।

4) ড্যাশবোর্ড ডিজাইন:

[সার্ভিস]-এর জন্য একটি গ্রাফানা ড্যাশবোর্ড ডিজাইন করুন: কোন প্যানেলের সাথে আমি চারটি সোনালী সংকেত (লেটেন্সি, ট্র্যাফিক, ত্রুটি, স্যাচুরেশন) প্রদর্শন করব? প্রতিটি প্যানেলের জন্য মেট্রিক, ভিজ্যুয়ালাইজেশনের ধরন এবং যুক্তিসঙ্গত থ্রেশহোল্ডের পরামর্শ দিন৷ উদ্দেশ্য: 10 সেকেন্ডের মধ্যে একজন প্রহরীর স্বাস্থ্যের অবস্থা দেখতে।

দুর্বল প্রম্পট / শক্তিশালী প্রম্পট

দুর্বল: "ওই লগে কি আছে?" (এর পরে কাঁচা লগের 5000 লাইন, এতে টোকেন)

ফলাফল: আপনি গোপনীয়তা ফাঁস করেন এবং AI একটি অলক্ষ্যবিহীন, সুপারফিশিয়াল সারাংশ দেয়।

শক্তিশালী: "নীচের 300-লাইন মাস্কড লগ উদাহরণে পুনরাবৃত্ত ত্রুটির নিদর্শন এবং সময়ের তীব্রতা খুঁজুন; আমাকে সবচেয়ে সম্ভাব্য মূল কারণ বলুন এবং যাচাই করতে আমি যে মেট্রিকগুলি দেখব তা বলুন। আমি টোকেনগুলি <REDACTED> তৈরি করেছি।"

পার্থক্য: দ্বিতীয় প্রম্পট একটি মুখোশযুক্ত এবং ফোকাসড উদাহরণ দেয়, একটি পরিষ্কার বিশ্লেষণ আউটপুট জিজ্ঞাসা করে; এটি নিরাপদ এবং দরকারী উভয়ই।

সাধারণ ভুল

  • AI এ মাস্ক না করে লগ পেস্ট করা। সবচেয়ে সাধারণ গোপন/ব্যক্তিগত ডেটা ফাঁস।
  • সবকিছুর জন্য অ্যালার্ম সেট করা হচ্ছে। অ্যালার্ম ক্লান্তি বাস্তব অ্যালার্ম burries.
  • অ-কার্যযোগ্য অ্যালার্ম। এটা সতর্কীকরণ শব্দ যে কেউ কিছু করতে পারে না.
  • প্রশ্ন ছাড়াই AI এর থ্রেশহোল্ড গ্রহণ করা। আপনার সিস্টেমের ইতিহাস অনুযায়ী থ্রেশহোল্ড সেট করা উচিত।
  • শুধু মেট্রিক দেখছি। লগ এবং ট্রেস ছাড়া, বেশিরভাগ সময় মূল কারণ খুঁজে পাওয়া যায় না।
  • একটি অ্যালার্ম সময় সেট না (এর জন্য)। ক্ষণস্থায়ী ওঠানামা মিথ্যা অ্যালার্ম তৈরি করে।

সংক্ষেপে

পর্যবেক্ষণযোগ্যতা; এটি মেট্রিক্স, লগ এবং ট্রেস সহ বাইরে থেকে সিস্টেমের ভিতরে বোঝার ক্ষমতা। চারটি সুবর্ণ সংকেত (বিলম্বন, ট্র্যাফিক, ত্রুটি, স্যাচুরেশন) বেশিরভাগ পরিষেবার স্বাস্থ্যের সংক্ষিপ্তসার করে৷ PromQL কোয়েরি, অ্যালার্ম নিয়ম এবং ড্যাশবোর্ড লিখতে এবং লগের বড় অংশের সংক্ষিপ্তকরণ এবং অসামঞ্জস্য খুঁজে বের করতে AI খুবই শক্তিশালী। কিন্তু আপনার নিজের সিস্টেমের ইতিহাসের বিরুদ্ধে অ্যালার্ম থ্রেশহোল্ডগুলি যাচাই করা, অ্যালার্মগুলিকে অ্যাকশন-ভিত্তিক রাখা এবং লগগুলিকে মাস্ক না করে কখনও ভাগ করা আপনার দায়িত্ব৷

আবেদন টাস্ক

একটি পরিষেবার জন্য (বা একটি নমুনা পরিষেবা): (1) "অ্যালার্ম রুল জেনারেশন" টেমপ্লেটের সাথে ত্রুটির হারের জন্য একটি অ্যালার্ম নিয়ম তৈরি করুন এবং প্রস্তাবিত থ্রেশহোল্ড সেট করুন "এটি অতীতে কতবার ট্রিগার হয়েছে?" প্রশ্ন দিয়ে পরীক্ষা করুন; (2) আপনার কাছে থাকা একটি লগ নমুনা মাস্ক করুন এবং এটি "লগ সংক্ষিপ্তকরণ" টেমপ্লেট দিয়ে বিশ্লেষণ করুন; (3) নোট করুন আপনি সবচেয়ে সম্ভাব্য মূল কারণ নিশ্চিত করতে কোন মেট্রিকটি দেখবেন।

চেকলিস্ট

  • [ ] আমি চারটি গোল্ডেন সিগন্যালের উপর ভিত্তি করে ট্র্যাক করার জন্য মেট্রিক্স বেছে নিয়েছি।
  • সংবেদনশীল এলাকার পরিপ্রেক্ষিতে আমি এআই-কে দেওয়া সমস্ত লগ মাস্ক করে রেখেছি।
  • [ ] আমি যাচাই করেছি যে প্রতিটি অ্যালার্ম অ্যাকশন-ভিত্তিক এবং সঠিক জরুরী।
  • [ ] আমি আমার সিস্টেমের ঐতিহাসিক ডেটার বিরুদ্ধে অ্যালার্ম থ্রেশহোল্ড পরীক্ষা করেছি৷
  • [ ] আমি অ্যালার্মগুলিতে (সময়কাল) যোগ করে তাত্ক্ষণিক ওঠানামা ফিল্টার করেছি।
  • [ ] আমি মূল কারণের জন্য মেট্রিক + লগ + ট্রেস একসাথে ব্যবহার করেছি।