એકમો
1. DevOps અને Cloud AI નો પરિચય: ભૂમિકાઓ, સીમાઓ, પ્રમાણીકરણ, સુરક્ષા અને રહસ્યો 2. આર્ટિફિશિયલ ઇન્ટેલિજન્સ સાથે CI/CD પાઇપલાઇન્સ ડિઝાઇન કરવી: GitHub ક્રિયાઓ અને GitLab CI 3. કોડ તરીકે ઈન્ફ્રાસ્ટ્રક્ચરનું સંચાલન: ટેરાફોર્મ અને IaC સાથે આર્ટિફિશિયલ ઈન્ટેલિજન્સ 4. કન્ટેનરાઇઝેશન: ડોકરફાઇલ અને કૃત્રિમ બુદ્ધિ સાથે છબી ઓપ્ટિમાઇઝેશન 5. કુબરનેટ્સ: મેનિફેસ્ટ, હેલ્મ અને એઆઈ-સંચાલિત ઓર્કેસ્ટ્રેશન 6. મોનિટરિંગ અને અવલોકનક્ષમતા: મેટ્રિક, લોગ, ટ્રેસ અને એલાર્મ નિયમો 7. ઘટના વ્યવસ્થાપન અને પોસ્ટમોર્ટમ: આર્ટિફિશિયલ ઇન્ટેલિજન્સ સાથે રુટ કોઝ એનાલિસિસ 8. ક્લાઉડ કોસ્ટ ઓપ્ટિમાઇઝેશન (ફાઇનઓપ્સ): આર્ટિફિશિયલ ઇન્ટેલિજન્સ સાથે કચરા માટે શિકાર 9. સ્ક્રિપ્ટ અને ઓટોમેશન જનરેશન: બેશ, પાયથોન અને પાવરશેલ 10. સુરક્ષા અને રહસ્યોનું સંચાલન: DevSecOps અને આર્ટિફિશિયલ ઇન્ટેલિજન્સ 11. પ્રોડ વેરિફિકેશન, રિલીઝ વ્યૂહરચના અને એન્ડ-ટુ-એન્ડ AI વર્કફ્લો
એકમ 6 / 11

મોનિટરિંગ અને અવલોકનક્ષમતા: મેટ્રિક, લોગ, ટ્રેસ અને એલાર્મ નિયમો

નફો:

  • અવલોકનક્ષમતાના ત્રણ સ્તંભો (મેટ્રિક, લોગ, ટ્રેસ) અને ચાર સુવર્ણ સંકેતોને સમજવાની ક્ષમતા અને પ્રોમક્યુએલ ક્વેરીઝ, એલાર્મ નિયમો અને ડેશબોર્ડ્સ જનરેટ કરવા માટે કૃત્રિમ બુદ્ધિ ધરાવે છે.
  • એલાર્મને એક્શન-ઓરિએન્ટેડ રાખીને અને યોગ્ય તાકીદ પર રાખીને અને તમારી પોતાની સિસ્ટમના ઐતિહાસિક ડેટા સામે થ્રેશોલ્ડનું પરીક્ષણ કરીને એલાર્મ થાકને રોકવાની ક્ષમતા
  • કૃત્રિમ બુદ્ધિમત્તાને લોગ આપતા પહેલા સંવેદનશીલ વિસ્તારોને માસ્ક કરીને ગોપનીયતા અને ગુપ્ત લિકેજને રોકવાની ક્ષમતા

જ્યારે સિસ્ટમ કામ કરતી હોય તેવું દેખાઈ શકે છે, તે અંદરથી મરી રહી હોઈ શકે છે: મેમરી ધીમે ધીમે ભરાઈ રહી છે, પ્રતિભાવનો સમય વધી રહ્યો છે, ભૂલનો દર વધી રહ્યો છે. આની નોંધ લેવાનો એકમાત્ર રસ્તો એ છે કે સિસ્ટમનું સતત નિરીક્ષણ કરવું. વધુ અદ્યતન ખ્યાલ અવલોકનક્ષમતા છે: સિસ્ટમની અંદર શું ચાલી રહ્યું છે તેના બાહ્ય સંકેતોને જોઈને સમજવાની ક્ષમતા. અવલોકનક્ષમતાનાં ત્રણ સ્તંભો છે, અને DevOps વ્યાવસાયિક ત્રણેયનો ઉપયોગ કરે છે:

  • મેટ્રિક: સંખ્યાત્મક મૂલ્યો સમય સાથે માપવામાં આવે છે — CPU વપરાશ, વિનંતીઓની સંખ્યા, પ્રતિભાવ સમય, ભૂલ દર. "કેટલું?" પ્રશ્નનો જવાબ આપે છે.
  • લોગ: સિસ્ટમ દ્વારા ઉત્પાદિત ટેક્સ્ટ ઇવેન્ટ રેકોર્ડ્સ—"વપરાશકર્તા લૉગ ઇન", "ડેટાબેઝ કનેક્શન ખોવાઈ ગયું". "બરાબર શું થયું?" પ્રશ્નનો જવાબ આપે છે.
  • ટ્રેસ: સિસ્ટમની અંદર સેવામાંથી સેવા તરફ પસાર થતી વખતે વિનંતીનો માર્ગ અને દરેક પગલાની અવધિ. "ધીમી ક્યાં છે?" પ્રશ્નનો જવાબ આપે છે.

સૌથી સામાન્ય સાધનો: મેટ્રિક્સ માટે પ્રોમિથિયસ, વિઝ્યુલાઇઝેશન માટે ગ્રાફના, લોગ માટે લોકી/ELK, ટ્રેસ માટે જેગર/ઓપનટેલેમેટ્રી. AI આ ટૂલ્સ માટે ક્વેરી લેંગ્વેજ (ખાસ કરીને પ્રોમિથિયસ પ્રોમક્યુએલ), એલાર્મ નિયમો અને ડેશબોર્ડ કન્ફિગરેશન લખવામાં ખૂબ જ કુશળ છે. તે એ પણ છે જ્યાં AI તેની સૌથી મજબૂત છે: લોગ અને મેટ્રિક્સના મોટા ભાગનો સારાંશ અને વિસંગતતાઓને ફ્લેગિંગ.

ચાલો એક વાક્યમાં મોનિટરિંગ અને અવલોકનક્ષમતા વચ્ચેના તફાવતને સ્પષ્ટ કરીએ: મોનિટરિંગ એ એવા પ્રશ્નો પૂછે છે જે તમે પહેલાથી જ જાણો છો ("શું CPU 90% થી આગળ છે?"); અવલોકનક્ષમતા એ એવા પ્રશ્નો પૂછવામાં સક્ષમ છે જે તમે પહેલાથી જાણતા ન હતા ("આ વિચિત્ર મંદતા ચોક્કસ સમયે ચોક્કસ ગ્રાહક માટે જ શા માટે થાય છે?"). આધુનિક સિસ્ટમો એટલી જટિલ છે કે તમે નિષ્ફળતાના તમામ મોડની આગાહી કરી શકતા નથી; તેથી, સમૃદ્ધ મેટ્રિક્સ, લૉગ્સ અને નિશાનો એકત્રિત કરવાની અને પછી તેમને ઊંડાણપૂર્વક પૂછવાની ક્ષમતા — એટલે કે, અવલોકનક્ષમતા — મહત્વપૂર્ણ બની જાય છે. "અગાઉના અજાણ્યા પ્રશ્ન" નો જવાબ આપતી વખતે AI અહીં જ અમલમાં આવે છે: તે તમારી પાસેના કાચા ડેટાને ઝડપથી સ્કેન કરે છે, પેટર્ન અને વિસંગતતાઓ સૂચવે છે અને તમે આ સંકેતોને ચકાસીને મૂળ કારણ સુધી પહોંચો છો.

પગલું દ્વારા પગલું: શું અને કેવી રીતે મોનિટર કરવું?

  1. યોગ્ય મેટ્રિક્સ પસંદ કરો. ઉદ્યોગમાં, "ચાર સુવર્ણ સંકેતો" આધાર તરીકે લેવામાં આવે છે: વિલંબ, ટ્રાફિક, ભૂલો, સંતૃપ્તિ — સંસાધન કેટલું ભરેલું છે. આ મોટાભાગની સેવાઓના આરોગ્યનો સારાંશ આપે છે.
  2. મેટ્રિક્સ એકત્રિત કરો. એપ્લિકેશનને એક અંતિમ બિંદુ રજૂ કરવા દો જે પ્રોમિથિયસ વાંચી શકે.
  3. ડેશબોર્ડ સેટ કરો. આ મેટ્રિક્સને ગ્રાફનામાં વિઝ્યુઅલાઈઝ કરો.
  4. એલાર્મ નિયમો લખો. જ્યારે મર્યાદા ઓળંગાઈ જાય ત્યારે કોને ચેતવણી આપવામાં આવશે અને કેવી રીતે?
  5. કેન્દ્રિય લોગ. બધા સર્વિસ લોગને એક જ જગ્યાએ શોધવા યોગ્ય બનાવો.
  6. અવાજ ઓછો કરો. અતિશય એલાર્મ "ચેતવણી થાક" બનાવે છે; મહત્વપૂર્ણ એલાર્મ અદૃશ્ય થઈ જાય છે.
ટીપ: સારો એલાર્મ બે બાબતોને પૂર્ણ કરે છે: તે કાર્યક્ષમ છે અને તેની યોગ્ય તાકીદ છે. એક એલાર્મ જે કોઈને સવારે 3 વાગ્યે જગાડે છે તે કંઈક એવું હોવું જોઈએ જેને વાસ્તવમાં રાત્રિના સમયે હસ્તક્ષેપની જરૂર હોય. "CPU 70%" જેવી પોતાની જાતે જ કાર્યવાહી કરવાની જરૂર ન હોય તેવી કોઈ વસ્તુ માટે કોઈને જગાડશો નહીં; તેને બોર્ડ પર દર્શાવો.

એલાર્મ નિયમ કેવી રીતે લખવો?

ચેતવણીમાં ત્રણ ઘટકોનો સમાવેશ થાય છે: સ્થિતિ (કયા મેટ્રિક કયા થ્રેશોલ્ડને ઓળંગે છે અને કેટલા સમય માટે), અવધિ (ક્ષણિક વધઘટને ટ્રિગર ન કરવા માટે "5 મિનિટ માટે"), અને મહત્વ/ક્રિયા (કોને, કઈ ચેનલ દ્વારા). AI આ ત્રણને યોગ્ય સંદર્ભ સાથે કુશળતાપૂર્વક સ્થાપિત કરે છે. ઉદાહરણ તરીકે, "ક્રિટીકલ એલાર્મ જો ભૂલ દર 5 મિનિટ માટે 5% થી વધી જાય" જેવા નિયમનું PromQL માં ભાષાંતર કરવું એ એઆઈ માટે સ્પ્લિટ-સેકન્ડ કાર્ય છે — પરંતુ તમે નક્કી કરો કે થ્રેશોલ્ડ તમારી સિસ્ટમ માટે યોગ્ય છે કે નહીં.

સાવધાન: AI દ્વારા સૂચવવામાં આવેલ એલાર્મ થ્રેશોલ્ડ સામાન્ય ધારણાઓ છે. તમારી સિસ્ટમનો સામાન્ય ભાર, સહિષ્ણુતા અને કામની અસર અલગ છે. તમે ઉત્પાદનમાં સીધો જ થ્રેશોલ્ડ નાખો તે પહેલાં, તમે તમારા ઐતિહાસિક ડેટાને જુઓ અને પૂછો કે "ભૂતકાળમાં આ થ્રેશોલ્ડ કેટલી વાર ટ્રિગર થઈ છે, તેમાંથી કેટલી વાસ્તવિક સમસ્યાઓ હતી?" પ્રશ્નનો જવાબ આપો.

લોગ ગોપનીયતા: જટિલ ચેતવણી

લૉગ્સ એ લિકનો સૌથી વધુ વારંવાર અવગણવામાં આવતો સ્ત્રોત છે. લોગ લાઇનમાં આકસ્મિક રીતે પાસવર્ડ, ક્રેડિટ કાર્ડ નંબર અથવા વ્યક્તિગત ડેટા (KVKK/GDPR હેઠળ) હોઈ શકે છે. વિશ્લેષણ માટે AI માં લોગ પેસ્ટ કરતી વખતે:

  1. સંવેદનશીલ વિસ્તારોને માસ્ક કરો. ટોકન, પાસવર્ડ, ઇમેઇલ, ID નંબર જેવા મૂલ્યોને <REDACTED> સાથે બદલો.
  2. ઉદાહરણો આપો, બધા નહીં. એક મિલિયન લાઇનને બદલે, કેટલીક સો પ્રતિનિધિ રેખાઓ ઘણીવાર પૂરતી હોય છે.
  3. સંસ્થા દ્વારા માન્ય વાહન પસંદ કરો. ખાસ કરીને પ્રોડક્શન લૉગ્સ માટે, એવા ટૂલનો ઉપયોગ કરો જેનો ડેટા ટ્રેનિંગમાં ન જાય.

ચાર ગોલ્ડન સિગ્નલો અને એલાર્મ ટેબલ

સંકેત

દ્વારા માપવામાં આવે છે

એલાર્મ થ્રેશોલ્ડનું ઉદાહરણ

તાકીદ

વિલંબ

પ્રતિભાવ સમય

p95 > 800 ms, 5 મિનિટ

ઉચ્ચ

ટ્રાફિક

વિનંતી/સેકન્ડ

અચાનક 300% વધારો/ઘટાડો

મધ્યમ

ભૂલ

નિષ્ફળ વિનંતી દર

> 5%, 5 મિનિટ

જટિલ

સંતૃપ્તિ

સંસાધનનો કબજો

ડિસ્ક > 85%

ઉચ્ચ

ત્રણ નાના કેસો

કેસ 1 — લોગની 400 લાઇનોનો સારાંશ 30 સેકન્ડમાં. એક સેવા ધીમી પડી હતી. એન્જિનિયરે એઆઈને લોગની માસ્ક કરેલી 400 લાઈનો આપી અને કહ્યું, "રીકરિંગ એરર પેટર્ન અને સમયની તીવ્રતાનો સારાંશ આપો." AI એ બતાવ્યું કે ચોક્કસ બાહ્ય API કૉલ દર 30 સેકન્ડમાં સમાપ્ત થાય છે. 30 સેકન્ડમાં મૂળ કારણ મળ્યું; લોગ્સ જાતે સ્કેન કરવામાં અડધો કલાક લાગશે.

કેસ 2 - એલાર્મ થાક ઉકેલાયો. એક ટીમ એક દિવસમાં 200 એલાર્મ મેળવતી હતી અને તે બધાને અવગણી રહી હતી - જ્યાં સુધી વાસ્તવિક આઉટેજ એલાર્મને પણ અવગણવામાં ન આવે ત્યાં સુધી. AI ને ચેતવણીના બધા નિયમો આપો અને પૂછો કે "કયા પગલાં લેવા યોગ્ય નથી અને કયાને જોડી શકાય?" તેઓએ પૂછ્યું. એલાર્મ્સની સંખ્યા ઘટીને 12 થઈ ગઈ; દરેક એલાર્મને હવે ગંભીરતાથી લેવામાં આવતું હતું.

કેસ 3 — ખોટો થ્રેશોલ્ડ વહેલો પકડાયો. YZ એ ડિસ્ક માટે "95% ભરાઈ જાય ત્યારે ચેતવણી આપો" સૂચવ્યું. ઇજનેરે ઐતિહાસિક ડેટા જોયો: એકવાર ડિસ્ક 95% પર પહોંચી ગયા પછી હસ્તક્ષેપ માટે થોડો સમય હતો. તેણે થ્રેશોલ્ડને 80% સુધી ઘટાડ્યું અને "વૃદ્ધિ દર" પર આધારિત બીજું એલાર્મ ઉમેર્યું. ચકાસણીએ વાસ્તવિક મધ્યરાત્રિ આઉટેજને અટકાવ્યું.

ચાર નકલ કરી શકાય તેવા નમૂનાઓ

1) લોગ સારાંશ (માસ્ક્ડ):

નીચેના લોગ ઉદાહરણનું વિશ્લેષણ કરો (મેં <REDACTED> સાથે સંવેદનશીલ મૂલ્યોને ઢાંકી દીધા છે). મને આપો: (1) રિકરિંગ એરર પેટર્ન, (2) સમય જતાં એકાગ્રતા, (3) સંભવતઃ મૂળ કારણ અને (4) 3 મેટ્રિક્સ હું ચકાસવા માટે જોઈશ. લોગ: [LINES]

2) એલાર્મ નિયમ જનરેશન:

પ્રોમિથિયસ/એલર્ટ મેનેજર માટે એલાર્મ નિયમ લખો: જો [THRESHOLD] [METRIC][DURATION] કરતાં વધી જાય તો [SEVERITY] એલાર્મ જનરેટ કરો. નિયમ એક્શન-ઓરિએન્ટેડ હોવો જોઈએ અને એનોટેશન અને રનબુક લિંક ફીલ્ડનો સમાવેશ કરવો જોઈએ. PromQL સમજાવો અને લખો કે આ થ્રેશોલ્ડ શા માટે વાજબી છે.

3) PromQL ક્વેરી લખવી/જાહેર કરવી:

PromQL ક્વેરી લખો જે માપે છે: [EX. છેલ્લી 5 મિનિટમાં 5xx ભૂલ દર ટકાવારી]. ક્વેરી સ્ટેપ બાય સ્ટેપ સમજાવો. પછી મને કહો કે આ મૂલ્ય માટે તંદુરસ્ત શ્રેણી શું હોવી જોઈએ.

4) ડેશબોર્ડ ડિઝાઇન:

[સેવા] માટે ગ્રાફના ડેશબોર્ડ ડિઝાઇન કરો: કઈ પેનલ સાથે મારે ચાર ગોલ્ડન સિગ્નલો (લેટન્સી, ટ્રાફિક, એરર, સેચ્યુરેશન) દર્શાવવા જોઈએ? દરેક પેનલ માટે મેટ્રિક, વિઝ્યુલાઇઝેશન પ્રકાર અને વાજબી થ્રેશોલ્ડ સૂચવો. હેતુ: 10 સેકન્ડમાં ગાર્ડની આરોગ્ય સ્થિતિ જોવા માટે.

નબળા પ્રોમ્પ્ટ / મજબૂત પ્રોમ્પ્ટ

નબળા: "તે લોગમાં શું છે?" (તેમાં કાચા લોગની 5000 લાઇન, ટોકન્સ દ્વારા અનુસરવામાં આવે છે)

પરિણામ: તમે રહસ્યો લીક કરો છો અને AI એક લક્ષિત, સુપરફિસિયલ સારાંશ આપે છે.

સશક્ત: "નીચેના 300-લાઇન માસ્ક્ડ લોગ ઉદાહરણમાં રિકરિંગ ભૂલ પેટર્ન અને સમયની તીવ્રતા શોધો; મને સૌથી વધુ સંભવિત મૂળ કારણ અને મેટ્રિક્સને ચકાસવા માટે હું જોઈશ તે જણાવો. મેં ટોકન્સ <REDACTED> બનાવ્યાં છે."

તફાવત: બીજો પ્રોમ્પ્ટ માસ્ક કરેલ અને કેન્દ્રિત ઉદાહરણ આપે છે, સ્પષ્ટ વિશ્લેષણ આઉટપુટ માટે પૂછે છે; તે સલામત અને ઉપયોગી બંને છે.

સામાન્ય ભૂલો

  • લૉગને માસ્ક કર્યા વિના AI માં પેસ્ટ કરવું. સૌથી સામાન્ય ગુપ્ત/વ્યક્તિગત ડેટા લીક.
  • દરેક વસ્તુ માટે એલાર્મ સેટ કરી રહ્યા છીએ. એલાર્મ થાક વાસ્તવિક એલાર્મને દફનાવે છે.
  • બિન-કાર્યક્ષમ એલાર્મ. તે ચેતવણીનો અવાજ છે જેના વિશે કોઈ કંઈ કરી શકતું નથી.
  • AI ના થ્રેશોલ્ડને પ્રશ્ન વિના સ્વીકારવું. થ્રેશોલ્ડ તમારી સિસ્ટમના ઇતિહાસ અનુસાર સેટ થવો જોઈએ.
  • માત્ર મેટ્રિક જોઈ રહ્યા છીએ. લોગ અને ટ્રેસ વિના, મોટાભાગના સમયે મૂળ કારણ શોધી શકાતું નથી.
  • એલાર્મનો સમય (માટે) સેટ કરી રહ્યો નથી. ક્ષણિક વધઘટ ખોટા એલાર્મ પેદા કરે છે.

સારાંશમાં

અવલોકનક્ષમતા; તે મેટ્રિક્સ, લૉગ્સ અને ટ્રેસ સાથે બહારથી સિસ્ટમના અંદરના ભાગને સમજવાની ક્ષમતા છે. ચાર સુવર્ણ સંકેતો (લેટન્સી, ટ્રાફિક, એરર, સેચ્યુરેશન) મોટાભાગની સેવાઓના સ્વાસ્થ્યનો સારાંશ આપે છે. AI PromQL ક્વેરીઝ, એલાર્મ નિયમો અને ડેશબોર્ડ્સ લખવામાં અને લોગના મોટા ભાગનો સારાંશ આપવા અને વિસંગતતાઓ શોધવામાં ખૂબ જ શક્તિશાળી છે. પરંતુ તમારી પોતાની સિસ્ટમના ઈતિહાસ સામે એલાર્મ થ્રેશોલ્ડને ચકાસવાની, એલાર્મને ક્રિયા-લક્ષી રાખવાની અને લૉગને માસ્ક કર્યા વિના ક્યારેય શેર કરવાની જવાબદારી તમારી છે.

એપ્લિકેશન કાર્ય

સેવા માટે (અથવા નમૂના સેવા): (1) "એલાર્મ નિયમ જનરેશન" ટેમ્પલેટ સાથે ભૂલ દર માટે એલાર્મ નિયમ જનરેટ કરો અને સૂચવેલ થ્રેશોલ્ડને "ભૂતકાળમાં તે કેટલી વખત ટ્રિગર થયું છે?" પર સેટ કરો. પ્રશ્ન સાથે તેની ચકાસણી કરો; (2) તમારી પાસેના લોગ સેમ્પલને માસ્ક કરો અને તેનું "લોગ સારાંશ" ટેમ્પલેટ વડે વિશ્લેષણ કરો; (3) સૌથી વધુ સંભવિત મૂળ કારણની પુષ્ટિ કરવા માટે તમે કયા મેટ્રિકને જોશો તેની નોંધ કરો.

ચેકલિસ્ટ

  • [ ] મેં ચાર ગોલ્ડન સિગ્નલોના આધારે ટ્રેક કરવા માટે મેટ્રિક્સ પસંદ કર્યા.
  • [ ] મેં સંવેદનશીલ વિસ્તારોની દ્રષ્ટિએ AI ને આપેલા તમામ લોગને માસ્ક કરી દીધા છે.
  • [ ] મેં ચકાસ્યું કે દરેક એલાર્મ ક્રિયાલક્ષી અને યોગ્ય તાકીદનું હતું.
  • [ ] મેં મારી સિસ્ટમના ઐતિહાસિક ડેટા સામે એલાર્મ થ્રેશોલ્ડનું પરીક્ષણ કર્યું.
  • [ ] મેં એલાર્મમાં (સમયગાળો) ઉમેરીને તાત્કાલિક વધઘટ ફિલ્ટર કરી.
  • [ ] મેં મૂળ કારણ માટે મેટ્રિક + લોગ + ટ્રેસનો એકસાથે ઉપયોગ કર્યો.