ඒකක
1. DevOps සහ Cloud AI සඳහා හැඳින්වීම: භූමිකාවන්, සීමා මායිම්, සත්‍යාපනය, ආරක්ෂාව සහ රහස් 2. කෘතිම බුද්ධිය සහිත CI/CD නල මාර්ග සැලසුම් කිරීම: GitHub ක්‍රියා සහ GitLab CI 3. කේතය ලෙස යටිතල පහසුකම් කළමනාකරණය: Terraform සහ IaC සමඟ කෘතිම බුද්ධිය 4. බහාලුම්කරණය: කෘතිම බුද්ධිය සමඟින් ඩොකර්ෆයිල් සහ රූප ප්‍රශස්තකරණය 5. කුබර්නෙටස්: මැනිෆෙස්ට්, හෙල්ම් සහ AI-බලවත් වාද්‍ය වෘන්දය 6. අධීක්‍ෂණය සහ නිරීක්ෂණ හැකියාව: මෙට්‍රික්, ලොග්, ට්‍රේස් සහ එලාම් රීති 7. සිදුවීම් කළමනාකරණය සහ පශ්චාත් මරණ පරීක්ෂණය: කෘතිම බුද්ධිය සමඟ මූල හේතුව විශ්ලේෂණය 8. Cloud Cost Optimization (FinOps): කෘතිම බුද්ධිය සමඟ අපද්‍රව්‍ය සඳහා දඩයම් කිරීම 9. ස්ක්‍රිප්ට් සහ ස්වයංක්‍රීය ජනනය: Bash, Python සහ PowerShell 10. ආරක්ෂාව සහ රහස් කළමනාකරණය: DevSecOps සහ කෘතිම බුද්ධිය 11. නිෂ්පාදන සත්‍යාපනය, මුදා හැරීමේ උපාය මාර්ග සහ අවසානය සිට අවසානය දක්වා AI කාර්ය ප්‍රවාහය
ඒකකය 6 / 11

අධීක්‍ෂණය සහ නිරීක්ෂණ හැකියාව: මෙට්‍රික්, ලොග්, ට්‍රේස් සහ එලාම් රීති

ලාභ:

  • නිරීක්‍ෂණයේ කුළුණු තුන (මෙට්‍රික්, ලඝු, හෝඩුවාවක්) සහ ස්වර්ණමය සංඥා හතර තේරුම් ගැනීමේ හැකියාව සහ කෘතිම බුද්ධිය තිබීම PromQL විමසුම්, අනතුරු ඇඟවීමේ රීති සහ උපකරණ පුවරු ජනනය කරයි.
  • එලාම් ක්‍රියාවට නැඹුරුව සහ නිවැරදි හදිසි අවශ්‍යතාවයකින් සහ ඔබේම පද්ධතියේ ඓතිහාසික දත්තවලට එරෙහිව එළිපත්ත පරීක්ෂා කිරීමෙන් අනතුරු ඇඟවීමේ තෙහෙට්ටුව වළක්වා ගැනීමේ හැකියාව
  • කෘත්‍රිම බුද්ධියට ලඝු-සටහන් ලබා දීමට පෙර සංවේදී ප්‍රදේශ ආවරණය කිරීමෙන් පුද්ගලිකත්වය සහ රහස් කාන්දුවීම් වැළැක්වීමේ හැකියාව

පද්ධතියක් ක්‍රියාත්මක වන බවක් පෙනෙන්නට තිබුණත්, එය ඇතුළත මිය යනවා විය හැක: මතකය සෙමෙන් පිරී යාම, ප්‍රතිචාර කාලය වැඩි වීම, දෝෂ අනුපාතය රිංගීම. මෙය නිරීක්ෂණය කළ හැකි එකම මාර්ගය වන්නේ පද්ධතිය නිරන්තරයෙන් අධීක්ෂණය කිරීමයි. වඩාත් දියුණු සංකල්පයක් වන්නේ නිරීක්ෂණ හැකියාවයි: පද්ධතිය තුළ සිදුවෙමින් පවතින දේ එහි බාහිර සංඥා දෙස බැලීමෙන් තේරුම් ගැනීමට ඇති හැකියාව. නිරීක්ෂණ හැකියාවේ කුළුණු තුනක් ඇති අතර, DevOps වෘත්තිකයා මේ තුනම භාවිතා කරයි:

  • මෙට්රික්: සංඛ්යාත්මක අගයන් කාලයත් සමඟ මනිනු ලැබේ - CPU භාවිතය, ඉල්ලීම් ගණන, ප්රතිචාර කාලය, දෝෂ අනුපාතය. "කොපමණ ද?" යන ප්‍රශ්නයට පිළිතුරු දෙයි.
  • ලොගය: පද්ධතිය විසින් නිෂ්පාදනය කරන ලද පෙළ සිදුවීම් වාර්තා - "පරිශීලක ලොග් වී ඇත", "දත්ත සමුදා සම්බන්ධතාවය නැති වී ඇත". "ඇත්තටම මොකද වුනේ?" යන ප්‍රශ්නයට පිළිතුරු දෙයි.
  • ලුහුබැඳීම: පද්ධතිය තුළ සේවාවෙන් සේවාව වෙත ගමන් කිරීමේදී ඉල්ලීමක් අනුගමනය කරන මාර්ගය සහ එක් එක් පියවරේ කාලසීමාව. "කොහෙද මන්දගාමිත්වය?" යන ප්‍රශ්නයට පිළිතුරු දෙයි.

වඩාත් පොදු මෙවලම්: ප්‍රමිතික සඳහා Prometheus, දෘශ්‍යකරණය සඳහා Grafana, ලොග් සඳහා Loki/ELK, සොයා ගැනීම සඳහා Jaeger/OpenTelemetry. මෙම මෙවලම් සඳහා විමසුම් භාෂා (විශේෂයෙන් Prometheus' PromQL), අනතුරු ඇඟවීමේ රීති සහ උපකරණ පුවරු වින්‍යාසයන් ලිවීමට AI ඉතා දක්ෂයි. AI එහි ප්‍රබලතම ස්ථානය ද එයයි: ලඝු-සටහන් සහ ප්‍රමිතික විශාල කොටස් සාරාංශ කිරීම සහ විෂමතා සලකුණු කිරීම.

එක් වාක්‍යයකින් අධීක්‍ෂණය සහ නිරීක්‍ෂණය අතර වෙනස පැහැදිලි කරමු: අධීක්‍ෂණය යනු ඔබ දැනටමත් දන්නා ප්‍රශ්න ඇසීමයි (“CPU එක 90% ඉක්මවා තිබේද?”); නිරීක්ෂණ හැකියාව යනු ඔබ දැනටමත් නොදැන සිටි ප්‍රශ්න ඇසීමට හැකි වීමයි ("මෙම අමුතු මන්දගාමිත්වය නිශ්චිත වේලාවක යම් පාරිභෝගිකයෙකුට පමණක් සිදු වන්නේ ඇයි?"). නවීන පද්ධති කෙතරම් සංකීර්ණද යත්, ඔබට සියලු අසාර්ථකත්වයන් ගැන අනාවැකි කිව නොහැක; එබැවින්, පොහොසත් ප්‍රමිතික, ලඝු-සටහන් සහ හෝඩුවාවන් එකතු කර ඒවා ගැඹුරින් විමසා බැලීමේ හැකියාව - එනම් නිරීක්ෂණ හැකියාව - තීරණාත්මක වේ. "කලින් නොදන්නා ප්‍රශ්නයට" පිළිතුරු දීමේදී AI ක්‍රියාත්මක වන්නේ මෙහිදීය: එය ඔබ සතුව ඇති අමු දත්ත ඉක්මනින් පරිලෝකනය කරයි, රටා සහ විෂමතා යෝජනා කරයි, සහ මෙම ඉඟි සත්‍යාපනය කිරීමෙන් ඔබ මූල හේතුවට පැමිණේ.

පියවරෙන් පියවර: නිරීක්ෂණය කරන්නේ කුමක්ද සහ කෙසේද?

  1. නිවැරදි ප්‍රමිතික තෝරන්න. කර්මාන්තයේ දී, "රන් සංඥා හතරක්" පදනම ලෙස ගනු ලැබේ: ප්‍රමාදය, ගමනාගමනය, දෝෂ, සන්තෘප්තිය - සම්පත කෙතරම් පිරී තිබේද යන්න. මේවා බොහෝ සේවාවන්හි සෞඛ්‍යය සාරාංශ කරයි.
  2. මිනුම් එකතු කරන්න. ප්‍රොමිතියස්ට කියවිය හැකි අන්ත ලක්ෂ්‍යයක් ඉදිරිපත් කිරීමට යෙදුමට ඉඩ දෙන්න.
  3. උපකරණ පුවරු සකසන්න. Grafana හි මෙම මිතික දෘශ්‍යමාන කරන්න.
  4. අනතුරු ඇඟවීමේ නීති ලියන්න. සීමාව ඉක්මවා ගිය විට අනතුරු අඟවන්නේ කාටද සහ කෙසේද?
  5. ලඝු-සටහන් මධ්යගත කරන්න. සියලුම සේවා ලොග එක තැනකින් සෙවිය හැකි බවට පත් කරන්න.
  6. ශබ්දය අඩු කරන්න. ඕනෑවට වඩා එලාම් "අවදානම තෙහෙට්ටුව" ඇති කරයි; වැදගත් අනතුරු ඇඟවීම අතුරුදහන් වේ.
ඉඟිය: හොඳ එලාම් එකක් කරුණු දෙකක් සපුරාලයි: එය ක්‍රියා කළ හැකි අතර නිවැරදි හදිසි අවශ්‍යතාවයක් ඇත. අලුයම 3ට යමෙකු අවදි කරන එලාමයක් ඇත්ත වශයෙන්ම රාත්‍රී කාලයේ මැදිහත්වීමක් අවශ්‍ය දෙයක් විය යුතුය. "CPU 70%" වැනි තනිවම ක්‍රියාවක් අවශ්‍ය නොවන දෙයක් සඳහා කිසිවෙකු අවදි නොකරන්න; පුවරුවේ එය පෙන්වන්න.

අනතුරු ඇඟවීමේ රීතියක් ලියන්නේ කෙසේද?

අනතුරු ඇඟවීමක් සංරචක තුනකින් සමන්විත වේ: කොන්දේසිය (කුමන සීමාව ඉක්මවන්නේද සහ කොපමණ කාලයක් සඳහාද), කාලසීමාව (ක්ෂණික උච්චාවචනයන් අවුලුවාලීම වැළැක්වීම සඳහා "මිනිත්තු 5ක් සඳහා") සහ වැදගත්කම/ක්‍රියාව (කාට, කුමන නාලිකාව හරහාද යන්න). AI දක්ෂ ලෙස මෙම තුන නිවැරදි සන්දර්භය සමඟ ස්ථාපිත කරයි. උදාහරණයක් ලෙස, "විනාඩි 5 ක් සඳහා දෝෂ අනුපාතය 5% ඉක්මවන්නේ නම් විවේචනාත්මක අනතුරු ඇඟවීම" වැනි රීතියක් PromQL වෙත පරිවර්තනය කිරීම AI සඳහා බෙදීම්-දෙවන කාර්යයකි - නමුත් ඔබේ පද්ධතියට සීමාව සුදුසු දැයි ඔබ තීරණය කරයි.

අවවාදයයි: AI විසින් යෝජනා කරන ලද අනතුරු ඇඟවීමේ සීමාවන් සාමාන්‍ය උපකල්පන වේ. ඔබේ පද්ධතියේ සාමාන්‍ය පැටවීම, ඉවසීම සහ වැඩ කිරීමේ බලපෑම වෙනස් වේ. ඔබ සෘජුවම නිෂ්පාදනයට එළිපත්තක් තැබීමට පෙර, ඔබ ඔබේ ඓතිහාසික දත්ත දෙස බලා "මෙම එළිපත්ත අතීතයේ කොපමණ වාර ගණනක් ක්‍රියාත්මක වී තිබේද, ඒවායින් කීයක් සැබෑ ගැටලුද?" ප්රශ්නයට පිළිතුරු දෙන්න.

ලොග් පෞද්ගලිකත්වය: විවේචනාත්මක අනතුරු ඇඟවීම

ලොග් යනු බොහෝ විට නොසලකා හරින ලද කාන්දුවීම් ප්‍රභවයකි. ලොග් රේඛාවක අහම්බෙන් මුරපදයක්, ක්‍රෙඩිට් කාඩ් අංකයක් හෝ පුද්ගලික දත්ත (KVKK/GDPR යටතේ) අඩංගු විය හැක. විශ්ලේෂණය සඳහා AI වෙත ලොග් ඇලවීමේදී:

  1. සංවේදී ස්ථාන ආවරණය කරන්න. ටෝකනය, මුරපදය, ඊමේල්, හැඳුනුම් අංකය වැනි අගයන් <REDACTED> සමඟ ප්‍රතිස්ථාපනය කරන්න.
  2. උදාහරණ දෙන්න, සියල්ලම නොවේ. පේළි මිලියනයක් වෙනුවට නියෝජිත රේඛා සිය ගණනක් බොහෝ විට ප්‍රමාණවත් වේ.
  3. ආයතනයෙන් අනුමත වාහනයක් තෝරන්න. විශේෂයෙන් නිෂ්පාදන ලඝු-සටහන් සඳහා, පුහුණුව සඳහා දත්ත නොයන මෙවලමක් භාවිතා කරන්න.

රන් සංඥා හතරක් සහ අනතුරු ඇඟවීමේ වගු

සංඥාව

විසින් මනිනු ලැබේ

උදාහරණ අනතුරු ඇඟවීමේ සීමාව

හදිසි

ප්රමාදය

ප්රතිචාර කාලය

p95 > 800 ms, 5 min

ඉහළ

ගමනාගමනය

ඉල්ලීම/තත්පර

හදිසියේ 300% වැඩිවීම/අඩුවීම

මධ්යම

දෝෂයකි

අසාර්ථක ඉල්ලීම් අනුපාතය

> 5%, විනාඩි 5

විවේචනාත්මක

සන්තෘප්තිය

සම්පත් පදිංචිය

තැටිය > 85%

ඉහළ

කුඩා නඩු තුනක්

නඩුව 1 - තත්පර 30 කින් සාරාංශගත කරන ලද ලොග් පේළි 400 ක්. සේවාවක් මන්දගාමී විය. ඉන්ජිනේරුවරයා වෙස්මුහුණු ලොග් පේළි 400 ක් AI වෙත ලබා දී, "පුනරාවර්තන දෝෂ රටා සහ කාල තීව්‍රතාවය සාරාංශ කරන්න" යැයි පැවසීය. විශේෂිත බාහිර API ඇමතුම් කාලය සෑම තත්පර 30කට වරක් බව AI පෙන්වා දුන්නේය. තත්පර 30 කින් මූල හේතුව සොයා ගැනීම; ලඝු-සටහන් අතින් පරිලෝකනය කිරීමට පැය භාගයක් ගත වේ.

නඩුව 2 - අනතුරු ඇඟවීමේ තෙහෙට්ටුව විසඳා ඇත. එක් කණ්ඩායමකට දිනකට එලාම් 200ක් ලැබෙන අතර ඒවා සියල්ල නොසලකා හරිමින් සිටියේය - සැබෑ ඇනහිටීම් අනතුරු ඇඟවීමක් ද නොසලකා හරින තුරු. AI හට සියලුම අනතුරු ඇඟවීමේ රීති ලබා දී "ක්‍රියා කළ නොහැකි ඒවා මොනවාද සහ ඒකාබද්ධ කළ හැක්කේ මොනවාද?" ඔවුන් ඇසුවා. අනතුරු ඇඟවීම් ගණන දිනකට 12 දක්වා අඩු විය; සෑම අනතුරු ඇඟවීමක්ම දැන් බැරෑරුම් ලෙස සලකනු ලැබීය.

නඩුව 3 - වැරදි එළිපත්ත ඉක්මනින් අල්ලා ගන්නා ලදී. YZ තැටිය සඳහා "95% පිරී ඇති විට අනතුරු අඟවන්න" යෝජනා කළේය. ඉංජිනේරුවරයා ඓතිහාසික දත්ත දෙස බැලීය: තැටිය 95% ට ළඟා වූ පසු මැදිහත් වීමට සුළු කාලයක් තිබුණි. එය එළිපත්ත 80% දක්වා අඩු කර "වර්ධන වේගය" මත පදනම් වූ දෙවන අනතුරු ඇඟවීමක් එක් කළේය. සත්‍යාපනය සැබෑ මධ්‍යම රාත්‍රියේ ඇණහිටීමක් වැළැක්වීය.

පිටපත් කළ හැකි සැකිලි හතරක්

1) ලඝු සාරාංශය (වෙස්මුහුණු):

පහත ලොග් උදාහරණය විශ්ලේෂණය කරන්න (මම <REDACTED> සමඟ සංවේදී අගයන් වසන් කළෙමි). මට දෙන්න: (1) පුනරාවර්තන දෝෂ රටා, (2) කාලයත් සමඟ සාන්ද්‍රණය, (3) බොහෝ දුරට ඉඩ ඇති මූල හේතුව, සහ (4) මම සත්‍යාපනය කිරීමට බලන ප්‍රමිතික 3 ක්. ලොගය: [LINES]

2) අනතුරු ඇඟවීමේ රීති උත්පාදනය:

Prometheus/Alertmanager සඳහා අනතුරු ඇඟවීමේ රීතියක් ලියන්න: [THRESHOLD] [METRIC][DURATION] ඉක්මවන්නේ නම් [SEVERITY] අනතුරු ඇඟවීමක් ජනනය කරන්න. රීතිය ක්‍රියාවට නැඹුරු විය යුතු අතර විවරණ සහ ධාවන පොත් සම්බන්ධක ක්ෂේත්‍රයක් ඇතුළත් විය යුතුය. PromQL පැහැදිලි කර මෙම සීමාව සාධාරණ වන්නේ මන්දැයි ලියන්න.

3) PromQL විමසුම ලිවීම/ප්‍රකාශ කිරීම:

මනින PromQL විමසුමක් ලියන්න: [EX. අවසාන මිනිත්තු 5 තුළ 5xxerror අනුපාත ප්‍රතිශතය]. විමසුම පියවරෙන් පියවර පැහැදිලි කරන්න. එවිට මෙම අගය සඳහා සෞඛ්ය සම්පන්න පරාසය කුමක් විය යුතුදැයි මට කියන්න.

4) උපකරණ පුවරු නිර්මාණය:

[SERVICE] සඳහා Grafana උපකරණ පුවරුවක් සැලසුම් කරන්න: මා රන් සංඥා හතර (ප්‍රමාදය, ගමනාගමනය, දෝෂය, සන්තෘප්තිය) පෙන්විය යුත්තේ කුමන පැනල සමඟද? එක් එක් පැනලය සඳහා මෙට්‍රික්, දෘශ්‍යකරණ වර්ගය සහ සාධාරණ සීමාව යෝජනා කරන්න. අරමුණ: තත්පර 10 කින් ආරක්ෂකයෙකුගේ සෞඛ්‍ය තත්ත්වය බැලීමට.

දුර්වල ක්ෂණික / ශක්තිමත් විමසුම

දුර්වල: "ඒ ලොගයේ ඇත්තේ කුමක්ද?" (අමු ලොග පේළි 5000ක්, එහි ඇති සංකේත)

ප්‍රතිඵලය: ඔබ රහස් කාන්දු කරන අතර AI ඉලක්ක නොකළ, මතුපිටින් සාරාංශයක් ලබා දෙයි.

ශක්තිමත්: "පහත ඇති පේළි 300 ආවරණ ලඝු-සටහනේ පුනරාවර්තන දෝෂ රටා සහ කාල තීව්‍රතාවය සොයන්න; මට බොහෝ දුරට ඉඩ ඇති මූල හේතුව සහ මම සත්‍යාපනය කිරීමට බලන ප්‍රමිතික මට කියන්න. මම ටෝකන <REDACTED> සෑදුවෙමි."

වෙනස: දෙවන විමසුම මඟින් පැහැදිලි විශ්ලේෂණ ප්‍රතිදානයක් ඉල්ලා වෙස්මුහුණු සහ නාභිගත උදාහරණයක් ලබා දෙයි; එය ආරක්ෂිත මෙන්ම ප්රයෝජනවත් වේ.

පොදු වැරදි

  • ලොගය වසන් නොකර AI වෙත ඇලවීම. වඩාත් පොදු රහස්/පුද්ගලික දත්ත කාන්දු වීම.
  • සෑම දෙයක් සඳහාම අනතුරු ඇඟවීම් සැකසීම. එලාම් තෙහෙට්ටුව සැබෑ අනතුරු ඇඟවීම වළලයි.
  • ක්‍රියා කළ නොහැකි අනතුරු ඇඟවීම. එය කිසිවෙකුට කිසිවක් කළ නොහැකි අනතුරු ඇඟවීමේ ශබ්දයකි.
  • ප්‍රශ්න කිරීමකින් තොරව AI හි එළිපත්ත පිළිගැනීම. ඔබේ පද්ධතියේ ඉතිහාසය අනුව එළිපත්ත සැකසිය යුතුය.
  • මෙට්‍රික් එක බලනවා විතරයි. ලොග් සහ හෝඩුවාවක් නොමැතිව, මූල හේතුව බොහෝ විට සොයාගත නොහැක.
  • අනතුරු ඇඟවීමේ වේලාවක් සකස් නොකිරීම (සඳහා). ක්ෂණික උච්චාවචනයන් ව්‍යාජ අනතුරු ඇඟවීම් නිපදවයි.

සාරාංශයකින්

නිරීක්ෂණ හැකියාව; එය මෙට්‍රික්, ලඝු-සටහන් සහ ට්‍රේස් සමඟ පිටත සිට පද්ධතියේ අභ්‍යන්තරය තේරුම් ගැනීමේ හැකියාවයි. ස්වර්ණමය සංඥා හතර (ප්‍රමාදය, ගමනාගමනය, දෝෂය, සන්තෘප්තිය) බොහෝ සේවාවන්හි සෞඛ්‍යය සාරාංශ කරයි. PromQL විමසුම්, අනතුරු ඇඟවීමේ රීති සහ උපකරණ පුවරු ලිවීමට සහ විශාල ලඝු-සටහන් සාරාංශ කිරීමට සහ විෂමතා සොයා ගැනීමට AI ඉතා බලවත් වේ. නමුත් ඔබේම පද්ධතියේ ඉතිහාසයට එරෙහිව අනතුරු ඇඟවීමේ සීමාවන් සත්‍යාපනය කිරීම, එලාම් ක්‍රියාවට නැඹුරුව තබා ගැනීම සහ ඒවා වසන් නොකර කිසි විටෙක ලොග බෙදා නොගැනීම ඔබේ වගකීමකි.

යෙදුම් කාර්යය

සේවාවක් සඳහා (හෝ නියැදි සේවාවක්): (1) "එලාම් රීති උත්පාදනය" අච්චුව සමඟ දෝෂ අනුපාතය සඳහා අනතුරු ඇඟවීමේ රීතියක් ජනනය කර යෝජිත සීමාව "අතීතයේ කොපමණ වාර ගණනක් ප්‍රේරණය කර තිබේද?" ලෙස සකසන්න. ප්රශ්නය සමඟ එය පරීක්ෂා කරන්න; (2) ඔබ සතුව ඇති ලොග් නියැදියක් ආවරණය කර එය "ලොග් සාරාංශය" අච්චුව සමඟ විශ්ලේෂණය කර ඇත; (3) බොහෝ දුරට ඉඩ ඇති මූල හේතුව තහවුරු කිරීමට ඔබ බලන්නේ කුමන මෙට්‍රික් එකද යන්න සටහන් කරන්න.

පිරික්සුම් ලැයිස්තුව

  • [ ] මම රන් සංඥා හතරක් මත පදනම්ව හඹා යාමට ප්‍රමිතික තෝරා ගත්තෙමි.
  • [ ] මම සංවේදී ප්‍රදේශ අනුව AI වෙත ලබා දුන් සියලුම ලොග් ආවරණය කළෙමි.
  • [ ] සෑම එලාමයක්ම ක්‍රියාවට නැඹුරු වූ සහ නිවැරදි හදිසි අවශ්‍යතාවයක් බව මම සත්‍යාපනය කළෙමි.
  • [ ] මම මගේ පද්ධතියේ ඓතිහාසික දත්තවලට එරෙහිව අනතුරු ඇඟවීමේ සීමාවන් පරීක්ෂා කළෙමි.
  • [ ] මම එලාම් වලට (කාලසීමාව) එකතු කිරීමෙන් ක්ෂණික උච්චාවචන පෙරහන් කළෙමි.
  • [ ] මම මූල හේතුව සඳහා මෙට්‍රික් + ලොග් + ට්‍රේස් එකට භාවිතා කළෙමි.