ಘಟಕಗಳು
1. DevOps ಮತ್ತು Cloud AI ಗೆ ಪರಿಚಯ: ಪಾತ್ರಗಳು, ಗಡಿಗಳು, ದೃಢೀಕರಣ, ಭದ್ರತೆ ಮತ್ತು ರಹಸ್ಯಗಳು 2. ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆಯೊಂದಿಗೆ CI/CD ಪೈಪ್‌ಲೈನ್‌ಗಳನ್ನು ವಿನ್ಯಾಸಗೊಳಿಸುವುದು: GitHub ಕ್ರಿಯೆಗಳು ಮತ್ತು GitLab CI 3. ಮೂಲಸೌಕರ್ಯವನ್ನು ಕೋಡ್ ಆಗಿ ನಿರ್ವಹಿಸುವುದು: ಟೆರಾಫಾರ್ಮ್ ಮತ್ತು IaC ಜೊತೆಗೆ ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆ 4. ಕಂಟೈನರೈಸೇಶನ್: ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆಯೊಂದಿಗೆ ಡಾಕರ್‌ಫೈಲ್ ಮತ್ತು ಇಮೇಜ್ ಆಪ್ಟಿಮೈಸೇಶನ್ 5. ಕುಬರ್ನೆಟ್ಸ್: ಮ್ಯಾನಿಫೆಸ್ಟ್, ಹೆಲ್ಮ್ ಮತ್ತು AI-ಚಾಲಿತ ಆರ್ಕೆಸ್ಟ್ರೇಶನ್ 6. ಮಾನಿಟರಿಂಗ್ ಮತ್ತು ವೀಕ್ಷಣೆ: ಮೆಟ್ರಿಕ್, ಲಾಗ್, ಟ್ರೇಸ್ ಮತ್ತು ಅಲಾರ್ಮ್ ನಿಯಮಗಳು 7. ಘಟನೆ ನಿರ್ವಹಣೆ ಮತ್ತು ಮರಣೋತ್ತರ ಪರೀಕ್ಷೆ: ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆಯೊಂದಿಗೆ ಮೂಲ ಕಾರಣ ವಿಶ್ಲೇಷಣೆ 8. ಕ್ಲೌಡ್ ಕಾಸ್ಟ್ ಆಪ್ಟಿಮೈಸೇಶನ್ (ಫಿನ್ಆಪ್ಸ್): ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆಯೊಂದಿಗೆ ತ್ಯಾಜ್ಯಕ್ಕಾಗಿ ಬೇಟೆಯಾಡುವುದು 9. ಸ್ಕ್ರಿಪ್ಟ್ ಮತ್ತು ಆಟೊಮೇಷನ್ ಜನರೇಷನ್: ಬ್ಯಾಷ್, ಪೈಥಾನ್ ಮತ್ತು ಪವರ್‌ಶೆಲ್ 10. ಭದ್ರತೆ ಮತ್ತು ರಹಸ್ಯ ನಿರ್ವಹಣೆ: DevSecOps ಮತ್ತು ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆ 11. ಉತ್ಪನ್ನ ಪರಿಶೀಲನೆ, ಬಿಡುಗಡೆ ತಂತ್ರಗಳು ಮತ್ತು ಎಂಡ್-ಟು-ಎಂಡ್ AI ವರ್ಕ್‌ಫ್ಲೋ
ಘಟಕ 6 / 11

ಮಾನಿಟರಿಂಗ್ ಮತ್ತು ವೀಕ್ಷಣೆ: ಮೆಟ್ರಿಕ್, ಲಾಗ್, ಟ್ರೇಸ್ ಮತ್ತು ಅಲಾರ್ಮ್ ನಿಯಮಗಳು

ಲಾಭಗಳು:

  • ವೀಕ್ಷಣೆಯ ಮೂರು ಸ್ತಂಭಗಳು (ಮೆಟ್ರಿಕ್, ಲಾಗ್, ಟ್ರೇಸ್) ಮತ್ತು ನಾಲ್ಕು ಗೋಲ್ಡನ್ ಸಿಗ್ನಲ್‌ಗಳನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವ ಸಾಮರ್ಥ್ಯ ಮತ್ತು ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆಯು PromQL ಪ್ರಶ್ನೆಗಳು, ಎಚ್ಚರಿಕೆ ನಿಯಮಗಳು ಮತ್ತು ಡ್ಯಾಶ್‌ಬೋರ್ಡ್‌ಗಳನ್ನು ಉತ್ಪಾದಿಸುತ್ತದೆ
  • ಅಲಾರಮ್‌ಗಳನ್ನು ಕ್ರಮ-ಆಧಾರಿತವಾಗಿ ಮತ್ತು ಸರಿಯಾದ ತುರ್ತುಸ್ಥಿತಿಯಲ್ಲಿ ಇರಿಸಿಕೊಳ್ಳುವ ಮೂಲಕ ಎಚ್ಚರಿಕೆಯ ಆಯಾಸವನ್ನು ತಡೆಗಟ್ಟುವ ಸಾಮರ್ಥ್ಯ ಮತ್ತು ನಿಮ್ಮ ಸ್ವಂತ ಸಿಸ್ಟಮ್‌ನ ಐತಿಹಾಸಿಕ ಡೇಟಾದ ವಿರುದ್ಧ ಮಿತಿಗಳನ್ನು ಪರೀಕ್ಷಿಸುವುದು
  • ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆಗೆ ಲಾಗ್‌ಗಳನ್ನು ನೀಡುವ ಮೊದಲು ಸೂಕ್ಷ್ಮ ಪ್ರದೇಶಗಳನ್ನು ಮರೆಮಾಚುವ ಮೂಲಕ ಗೌಪ್ಯತೆ ಮತ್ತು ರಹಸ್ಯ ಸೋರಿಕೆಯನ್ನು ತಡೆಯುವ ಸಾಮರ್ಥ್ಯ

ಒಂದು ವ್ಯವಸ್ಥೆಯು ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತಿರುವಂತೆ ತೋರುತ್ತಿರುವಾಗ, ಅದು ಒಳಗೆ ಸಾಯುತ್ತಿರಬಹುದು: ಮೆಮೊರಿ ನಿಧಾನವಾಗಿ ತುಂಬುವುದು, ಪ್ರತಿಕ್ರಿಯೆ ಸಮಯಗಳು ಹೆಚ್ಚಾಗುವುದು, ದೋಷದ ಪ್ರಮಾಣವು ಹರಿದಾಡುತ್ತಿದೆ. ಇದನ್ನು ಗಮನಿಸುವ ಏಕೈಕ ಮಾರ್ಗವೆಂದರೆ ಸಿಸ್ಟಮ್ ಅನ್ನು ನಿರಂತರವಾಗಿ ಮೇಲ್ವಿಚಾರಣೆ ಮಾಡುವುದು. ಹೆಚ್ಚು ಸುಧಾರಿತ ಪರಿಕಲ್ಪನೆಯು ವೀಕ್ಷಣೆಯಾಗಿದೆ: ಅದರ ಬಾಹ್ಯ ಚಿಹ್ನೆಗಳನ್ನು ನೋಡುವ ಮೂಲಕ ಸಿಸ್ಟಮ್ ಒಳಗೆ ಏನು ನಡೆಯುತ್ತಿದೆ ಎಂಬುದನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವ ಸಾಮರ್ಥ್ಯ. ವೀಕ್ಷಣೆಯ ಮೂರು ಸ್ತಂಭಗಳಿವೆ, ಮತ್ತು DevOps ವೃತ್ತಿಪರರು ಮೂರನ್ನೂ ಬಳಸುತ್ತಾರೆ:

  • ಮೆಟ್ರಿಕ್: ಸಂಖ್ಯಾತ್ಮಕ ಮೌಲ್ಯಗಳನ್ನು ಕಾಲಾನಂತರದಲ್ಲಿ ಅಳೆಯಲಾಗುತ್ತದೆ - CPU ಬಳಕೆ, ವಿನಂತಿಗಳ ಸಂಖ್ಯೆ, ಪ್ರತಿಕ್ರಿಯೆ ಸಮಯ, ದೋಷ ದರ. "ಎಷ್ಟು?" ಎಂಬ ಪ್ರಶ್ನೆಗೆ ಉತ್ತರಿಸುತ್ತದೆ.
  • ಲಾಗ್: ಸಿಸ್ಟಮ್‌ನಿಂದ ತಯಾರಿಸಲಾದ ಪಠ್ಯ ಈವೆಂಟ್ ದಾಖಲೆಗಳು- "ಬಳಕೆದಾರರು ಲಾಗ್ ಇನ್ ಆಗಿದ್ದಾರೆ", "ಡೇಟಾಬೇಸ್ ಸಂಪರ್ಕ ಕಳೆದುಹೋಗಿದೆ". "ಸರಿಯಾಗಿ ಏನಾಯಿತು?" ಎಂಬ ಪ್ರಶ್ನೆಗೆ ಉತ್ತರಿಸುತ್ತದೆ.
  • ಟ್ರೇಸ್: ಸಿಸ್ಟಮ್‌ನಲ್ಲಿ ಸೇವೆಯಿಂದ ಸೇವೆಗೆ ಹಾದುಹೋಗುವಾಗ ವಿನಂತಿಯು ಅನುಸರಿಸುವ ಮಾರ್ಗ ಮತ್ತು ಪ್ರತಿ ಹಂತದ ಅವಧಿ. "ನಿಧಾನತೆ ಎಲ್ಲಿದೆ?" ಎಂಬ ಪ್ರಶ್ನೆಗೆ ಉತ್ತರಿಸುತ್ತದೆ.

ಅತ್ಯಂತ ಸಾಮಾನ್ಯ ಪರಿಕರಗಳು: ಮೆಟ್ರಿಕ್‌ಗಳಿಗಾಗಿ ಪ್ರಮೀತಿಯಸ್, ದೃಶ್ಯೀಕರಣಕ್ಕಾಗಿ ಗ್ರಾಫಾನಾ, ಲಾಗ್‌ಗಾಗಿ ಲೋಕಿ/ELK, ಜಾಡಿನ ಗಾಗಿ ಜೇಗರ್/ಓಪನ್‌ಟೆಲಿಮೆಟ್ರಿ. ಈ ಪರಿಕರಗಳಿಗಾಗಿ ಪ್ರಶ್ನೆ ಭಾಷೆಗಳನ್ನು (ವಿಶೇಷವಾಗಿ ಪ್ರೊಮೆಥಿಯಸ್‌ನ PromQL), ಎಚ್ಚರಿಕೆಯ ನಿಯಮಗಳು ಮತ್ತು ಡ್ಯಾಶ್‌ಬೋರ್ಡ್ ಕಾನ್ಫಿಗರೇಶನ್‌ಗಳನ್ನು ಬರೆಯುವಲ್ಲಿ AI ಬಹಳ ಪರಿಣತಿ ಹೊಂದಿದೆ. AI ಅದರ ಪ್ರಬಲವಾಗಿರುವ ಸ್ಥಳವೂ ಇಲ್ಲಿದೆ: ಲಾಗ್‌ಗಳು ಮತ್ತು ಮೆಟ್ರಿಕ್‌ಗಳ ದೊಡ್ಡ ಭಾಗಗಳನ್ನು ಸಾರಾಂಶ ಮತ್ತು ವೈಪರೀತ್ಯಗಳನ್ನು ಫ್ಲ್ಯಾಗ್ ಮಾಡುವುದು.

ಒಂದು ವಾಕ್ಯದಲ್ಲಿ ಮೇಲ್ವಿಚಾರಣೆ ಮತ್ತು ವೀಕ್ಷಣೆಯ ನಡುವಿನ ವ್ಯತ್ಯಾಸವನ್ನು ಸ್ಪಷ್ಟಪಡಿಸೋಣ: ಮಾನಿಟರಿಂಗ್ ನಿಮಗೆ ಈಗಾಗಲೇ ತಿಳಿದಿರುವ ಪ್ರಶ್ನೆಗಳನ್ನು ಕೇಳುತ್ತಿದೆ ("CPU 90% ಕಳೆದಿದೆಯೇ?"); ವೀಕ್ಷಣಾ ಸಾಮರ್ಥ್ಯವು ನಿಮಗೆ ಈಗಾಗಲೇ ತಿಳಿದಿಲ್ಲದ ಪ್ರಶ್ನೆಗಳನ್ನು ಕೇಳಲು ಸಾಧ್ಯವಾಗುತ್ತದೆ ("ಈ ವಿಚಿತ್ರವಾದ ನಿಧಾನಗತಿಯು ನಿರ್ದಿಷ್ಟ ಸಮಯದಲ್ಲಿ ನಿರ್ದಿಷ್ಟ ಗ್ರಾಹಕರಿಗೆ ಮಾತ್ರ ಏಕೆ ನಡೆಯುತ್ತಿದೆ?"). ಆಧುನಿಕ ವ್ಯವಸ್ಥೆಗಳು ತುಂಬಾ ಸಂಕೀರ್ಣವಾಗಿದ್ದು, ನೀವು ವೈಫಲ್ಯದ ಎಲ್ಲಾ ವಿಧಾನಗಳನ್ನು ಊಹಿಸಲು ಸಾಧ್ಯವಿಲ್ಲ; ಆದ್ದರಿಂದ, ಶ್ರೀಮಂತ ಮೆಟ್ರಿಕ್‌ಗಳು, ದಾಖಲೆಗಳು ಮತ್ತು ಕುರುಹುಗಳನ್ನು ಸಂಗ್ರಹಿಸುವ ಸಾಮರ್ಥ್ಯ ಮತ್ತು ನಂತರ ಅವುಗಳನ್ನು ಆಳವಾಗಿ ಪ್ರಶ್ನಿಸುವ ಸಾಮರ್ಥ್ಯ - ಅಂದರೆ, ವೀಕ್ಷಣೆ - ನಿರ್ಣಾಯಕವಾಗುತ್ತದೆ. "ಹಿಂದೆ ತಿಳಿದಿಲ್ಲದ ಪ್ರಶ್ನೆಗೆ" ಉತ್ತರಿಸುವಾಗ AI ಕಾರ್ಯರೂಪಕ್ಕೆ ಬರುತ್ತದೆ: ಇದು ನಿಮ್ಮಲ್ಲಿರುವ ಕಚ್ಚಾ ಡೇಟಾವನ್ನು ತ್ವರಿತವಾಗಿ ಸ್ಕ್ಯಾನ್ ಮಾಡುತ್ತದೆ, ಮಾದರಿಗಳು ಮತ್ತು ವೈಪರೀತ್ಯಗಳನ್ನು ಸೂಚಿಸುತ್ತದೆ ಮತ್ತು ಈ ಸುಳಿವುಗಳನ್ನು ಪರಿಶೀಲಿಸುವ ಮೂಲಕ ನೀವು ಮೂಲ ಕಾರಣವನ್ನು ಪಡೆಯುತ್ತೀರಿ.

ಹಂತ ಹಂತವಾಗಿ: ಏನು ಮತ್ತು ಹೇಗೆ ಮೇಲ್ವಿಚಾರಣೆ ಮಾಡುವುದು?

  1. ಸರಿಯಾದ ಮೆಟ್ರಿಕ್‌ಗಳನ್ನು ಆಯ್ಕೆಮಾಡಿ. ಉದ್ಯಮದಲ್ಲಿ, "ನಾಲ್ಕು ಗೋಲ್ಡನ್ ಸಿಗ್ನಲ್‌ಗಳನ್ನು" ಆಧಾರವಾಗಿ ತೆಗೆದುಕೊಳ್ಳಲಾಗುತ್ತದೆ: ಸುಪ್ತತೆ, ದಟ್ಟಣೆ, ದೋಷಗಳು, ಶುದ್ಧತ್ವ - ಸಂಪನ್ಮೂಲವು ಎಷ್ಟು ಪೂರ್ಣವಾಗಿದೆ. ಇವುಗಳು ಹೆಚ್ಚಿನ ಸೇವೆಗಳ ಆರೋಗ್ಯವನ್ನು ಸಾರಾಂಶಗೊಳಿಸುತ್ತವೆ.
  2. ಮೆಟ್ರಿಕ್‌ಗಳನ್ನು ಸಂಗ್ರಹಿಸಿ. ಪ್ರಮೀತಿಯಸ್ ಓದಬಹುದಾದ ಅಂತಿಮ ಬಿಂದುವನ್ನು ಅಪ್ಲಿಕೇಶನ್ ಪ್ರಸ್ತುತಪಡಿಸಲಿ.
  3. ಡ್ಯಾಶ್‌ಬೋರ್ಡ್‌ಗಳನ್ನು ಹೊಂದಿಸಿ. ಗ್ರಾಫಾನಾದಲ್ಲಿ ಈ ಮೆಟ್ರಿಕ್‌ಗಳನ್ನು ದೃಶ್ಯೀಕರಿಸಿ.
  4. ಎಚ್ಚರಿಕೆಯ ನಿಯಮಗಳನ್ನು ಬರೆಯಿರಿ. ಮಿತಿ ಮೀರಿದಾಗ ಯಾರಿಗೆ ಎಚ್ಚರಿಕೆ ನೀಡಲಾಗುತ್ತದೆ ಮತ್ತು ಹೇಗೆ?
  5. ಲಾಗ್‌ಗಳನ್ನು ಕೇಂದ್ರೀಕರಿಸಿ. ಎಲ್ಲಾ ಸೇವಾ ಲಾಗ್‌ಗಳನ್ನು ಒಂದೇ ಸ್ಥಳದಲ್ಲಿ ಹುಡುಕುವಂತೆ ಮಾಡಿ.
  6. ಶಬ್ದವನ್ನು ಕಡಿಮೆ ಮಾಡಿ. ಹೆಚ್ಚು ಎಚ್ಚರಿಕೆಯು "ಎಚ್ಚರಿಕೆಯ ಆಯಾಸ"ವನ್ನು ಸೃಷ್ಟಿಸುತ್ತದೆ; ಪ್ರಮುಖ ಎಚ್ಚರಿಕೆಯು ಕಣ್ಮರೆಯಾಗುತ್ತದೆ.
ಸಲಹೆ: ಉತ್ತಮ ಅಲಾರಂ ಎರಡು ವಿಷಯಗಳನ್ನು ಪೂರೈಸುತ್ತದೆ: ಇದು ಕಾರ್ಯಸಾಧ್ಯವಾಗಿದೆ ಮತ್ತು ಸರಿಯಾದ ತುರ್ತುಸ್ಥಿತಿಯನ್ನು ಹೊಂದಿದೆ. ಬೆಳಗಿನ ಜಾವ 3 ಗಂಟೆಗೆ ಯಾರನ್ನಾದರೂ ಎಬ್ಬಿಸುವ ಅಲಾರಾಂ ನಿಜವಾಗಿ ರಾತ್ರಿಯ ಮಧ್ಯಸ್ಥಿಕೆಯ ಅಗತ್ಯವಿರುತ್ತದೆ. "CPU 70%" ನಂತಹ ತನ್ನದೇ ಆದ ಕ್ರಿಯೆಯ ಅಗತ್ಯವಿಲ್ಲದ ಯಾವುದನ್ನಾದರೂ ಯಾರನ್ನೂ ಎಚ್ಚರಗೊಳಿಸಬೇಡಿ; ಅದನ್ನು ಮಂಡಳಿಯಲ್ಲಿ ಪ್ರದರ್ಶಿಸಿ.

ಎಚ್ಚರಿಕೆಯ ನಿಯಮವನ್ನು ಬರೆಯುವುದು ಹೇಗೆ?

ಎಚ್ಚರಿಕೆಯು ಮೂರು ಘಟಕಗಳನ್ನು ಒಳಗೊಂಡಿದೆ: ಸ್ಥಿತಿ (ಯಾವ ಮೆಟ್ರಿಕ್ ಮಿತಿ ಮೀರುತ್ತದೆ ಮತ್ತು ಎಷ್ಟು ಸಮಯದವರೆಗೆ), ಅವಧಿ (ಕ್ಷಣಿಕ ಏರಿಳಿತಗಳನ್ನು ಪ್ರಚೋದಿಸುವುದನ್ನು ತಪ್ಪಿಸಲು "5 ನಿಮಿಷಗಳ ಕಾಲ"), ಮತ್ತು ಪ್ರಾಮುಖ್ಯತೆ/ಕ್ರಿಯೆ (ಯಾರಿಗೆ, ಯಾವ ಚಾನಲ್ ಮೂಲಕ). AI ಈ ಮೂರನ್ನು ಸರಿಯಾದ ಸಂದರ್ಭದೊಂದಿಗೆ ಕೌಶಲ್ಯದಿಂದ ಸ್ಥಾಪಿಸುತ್ತದೆ. ಉದಾಹರಣೆಗೆ, "5 ನಿಮಿಷಗಳವರೆಗೆ ದೋಷದ ಪ್ರಮಾಣವು 5% ಮೀರಿದರೆ ನಿರ್ಣಾಯಕ ಎಚ್ಚರಿಕೆ" ನಂತಹ ನಿಯಮವನ್ನು PromQL ಗೆ ಭಾಷಾಂತರಿಸುವುದು AI ಗೆ ವಿಭಜಿತ-ಎರಡನೆಯ ಕಾರ್ಯವಾಗಿದೆ - ಆದರೆ ನಿಮ್ಮ ಸಿಸ್ಟಮ್‌ಗೆ ಮಿತಿ ಸರಿಯಾಗಿದೆಯೇ ಎಂದು ನೀವು ನಿರ್ಧರಿಸುತ್ತೀರಿ.

ಎಚ್ಚರಿಕೆ: AI ಸೂಚಿಸಿದ ಎಚ್ಚರಿಕೆಯ ಮಿತಿಗಳು ಸಾಮಾನ್ಯ ಊಹೆಗಳಾಗಿವೆ. ನಿಮ್ಮ ಸಿಸ್ಟಂನ ಸಾಮಾನ್ಯ ಲೋಡ್, ಸಹನೆ ಮತ್ತು ಕೆಲಸದ ಪರಿಣಾಮವು ವಿಭಿನ್ನವಾಗಿದೆ. ನೀವು ನೇರವಾಗಿ ಉತ್ಪನ್ನಕ್ಕೆ ಮಿತಿ ಹಾಕುವ ಮೊದಲು, ನಿಮ್ಮ ಐತಿಹಾಸಿಕ ಡೇಟಾವನ್ನು ನೀವು ನೋಡುತ್ತೀರಿ ಮತ್ತು "ಈ ಮಿತಿಯನ್ನು ಹಿಂದೆ ಎಷ್ಟು ಬಾರಿ ಪ್ರಚೋದಿಸಲಾಗಿದೆ, ಅವುಗಳಲ್ಲಿ ಎಷ್ಟು ನೈಜ ಸಮಸ್ಯೆಗಳಾಗಿವೆ?" ಪ್ರಶ್ನೆಗೆ ಉತ್ತರಿಸಿ.

ಲಾಗ್ ಗೌಪ್ಯತೆ: ನಿರ್ಣಾಯಕ ಎಚ್ಚರಿಕೆ

ಲಾಗ್‌ಗಳು ಸೋರಿಕೆಗಳ ಆಗಾಗ್ಗೆ ಕಡೆಗಣಿಸಲ್ಪಡುವ ಮೂಲವಾಗಿದೆ. ಲಾಗ್ ಲೈನ್ ಆಕಸ್ಮಿಕವಾಗಿ ಪಾಸ್‌ವರ್ಡ್, ಕ್ರೆಡಿಟ್ ಕಾರ್ಡ್ ಸಂಖ್ಯೆ ಅಥವಾ ವೈಯಕ್ತಿಕ ಡೇಟಾವನ್ನು (KVKK/GDPR ಅಡಿಯಲ್ಲಿ) ಒಳಗೊಂಡಿರಬಹುದು. ವಿಶ್ಲೇಷಣೆಗಾಗಿ AI ಗೆ ಲಾಗ್‌ಗಳನ್ನು ಅಂಟಿಸುವಾಗ:

  1. ಸೂಕ್ಷ್ಮ ಪ್ರದೇಶಗಳನ್ನು ಮಾಸ್ಕ್ ಮಾಡಿ. ಟೋಕನ್, ಪಾಸ್‌ವರ್ಡ್, ಇಮೇಲ್, ಐಡಿ ಸಂಖ್ಯೆಯಂತಹ ಮೌಲ್ಯಗಳನ್ನು <REDACTED> ನೊಂದಿಗೆ ಬದಲಾಯಿಸಿ.
  2. ಉದಾಹರಣೆಗಳನ್ನು ನೀಡಿ, ಎಲ್ಲಾ ಅಲ್ಲ. ಒಂದು ಮಿಲಿಯನ್ ಸಾಲುಗಳ ಬದಲಿಗೆ, ಕೆಲವು ನೂರು ಪ್ರಾತಿನಿಧಿಕ ಸಾಲುಗಳು ಹೆಚ್ಚಾಗಿ ಸಾಕು.
  3. ಸಂಸ್ಥೆ-ಅನುಮೋದಿತ ವಾಹನವನ್ನು ಆಯ್ಕೆಮಾಡಿ. ವಿಶೇಷವಾಗಿ ಉತ್ಪಾದನಾ ಲಾಗ್‌ಗಳಿಗಾಗಿ, ಡೇಟಾ ತರಬೇತಿಗೆ ಹೋಗದ ಸಾಧನವನ್ನು ಬಳಸಿ.

ನಾಲ್ಕು ಗೋಲ್ಡನ್ ಸಿಗ್ನಲ್‌ಗಳು ಮತ್ತು ಎಚ್ಚರಿಕೆಯ ಕೋಷ್ಟಕಗಳು

ಸಂಕೇತ

ಮೂಲಕ ಅಳೆಯಲಾಗುತ್ತದೆ

ಉದಾಹರಣೆ ಎಚ್ಚರಿಕೆಯ ಮಿತಿ

ತುರ್ತು

ಸುಪ್ತತೆ

ಪ್ರತಿಕ್ರಿಯೆ ಸಮಯ

p95 > 800 ms, 5 ನಿಮಿಷಗಳು

ಹೆಚ್ಚು

ಸಂಚಾರ

ವಿನಂತಿ/ಸೆಕೆಂಡು

ಹಠಾತ್ 300% ಹೆಚ್ಚಳ / ಇಳಿಕೆ

ಮಧ್ಯಮ

ದೋಷ

ವಿಫಲವಾದ ವಿನಂತಿ ದರ

> 5%, 5 ನಿಮಿಷ

ನಿರ್ಣಾಯಕ

ಶುದ್ಧತ್ವ

ಸಂಪನ್ಮೂಲ ಆಕ್ಯುಪೆನ್ಸಿ

ಡಿಸ್ಕ್ > 85%

ಹೆಚ್ಚು

ಮೂರು ಸಣ್ಣ ಪ್ರಕರಣಗಳು

ಪ್ರಕರಣ 1 — 400 ಸಾಲುಗಳ ಲಾಗ್ ಅನ್ನು 30 ಸೆಕೆಂಡುಗಳಲ್ಲಿ ಸಂಕ್ಷಿಪ್ತಗೊಳಿಸಲಾಗಿದೆ. ಒಂದು ಸೇವೆ ನಿಧಾನವಾಯಿತು. ಎಂಜಿನಿಯರ್ ಮುಖವಾಡದ 400 ಸಾಲುಗಳ ಲಾಗ್ ಅನ್ನು AI ಗೆ ನೀಡಿದರು ಮತ್ತು "ಮರುಕಳಿಸುವ ದೋಷ ಮಾದರಿಗಳು ಮತ್ತು ಸಮಯದ ತೀವ್ರತೆಯನ್ನು ಸಾರಾಂಶಗೊಳಿಸಿ" ಎಂದು ಹೇಳಿದರು. ಪ್ರತಿ 30 ಸೆಕೆಂಡ್‌ಗಳಿಗೆ ನಿರ್ದಿಷ್ಟ ಬಾಹ್ಯ API ಕರೆ ಸಮಯ ಮೀರುತ್ತದೆ ಎಂದು AI ತೋರಿಸಿದೆ. 30 ಸೆಕೆಂಡುಗಳಲ್ಲಿ ಮೂಲ ಕಾರಣ ಪತ್ತೆ; ಲಾಗ್‌ಗಳನ್ನು ಹಸ್ತಚಾಲಿತವಾಗಿ ಸ್ಕ್ಯಾನ್ ಮಾಡಲು ಅರ್ಧ ಗಂಟೆ ತೆಗೆದುಕೊಳ್ಳುತ್ತದೆ.

ಪ್ರಕರಣ 2 - ಎಚ್ಚರಿಕೆಯ ಆಯಾಸವನ್ನು ಪರಿಹರಿಸಲಾಗಿದೆ. ಒಂದು ತಂಡವು ದಿನಕ್ಕೆ 200 ಅಲಾರಮ್‌ಗಳನ್ನು ಸ್ವೀಕರಿಸುತ್ತಿದೆ ಮತ್ತು ಅವೆಲ್ಲವನ್ನೂ ನಿರ್ಲಕ್ಷಿಸುತ್ತಿತ್ತು - ನಿಜವಾದ ಔಟಾಗುವ ಎಚ್ಚರಿಕೆಯನ್ನು ಸಹ ಕಡೆಗಣಿಸುವವರೆಗೆ. AI ಗೆ ಎಲ್ಲಾ ಎಚ್ಚರಿಕೆಯ ನಿಯಮಗಳನ್ನು ನೀಡಿ ಮತ್ತು "ಯಾವುವು ಕಾರ್ಯಸಾಧ್ಯವಲ್ಲ ಮತ್ತು ಯಾವುದನ್ನು ಸಂಯೋಜಿಸಬಹುದು?" ಅವರು ಕೇಳಿದರು. ಅಲಾರಂಗಳ ಸಂಖ್ಯೆ ದಿನಕ್ಕೆ 12 ಕ್ಕೆ ಕಡಿಮೆಯಾಗಿದೆ; ಪ್ರತಿ ಎಚ್ಚರಿಕೆಯನ್ನು ಈಗ ಗಂಭೀರವಾಗಿ ತೆಗೆದುಕೊಳ್ಳಲಾಗಿದೆ.

ಪ್ರಕರಣ 3 - ತಪ್ಪಾದ ಮಿತಿಯನ್ನು ಮೊದಲೇ ಹಿಡಿಯಲಾಗಿದೆ. YZ ಡಿಸ್ಕ್‌ಗಾಗಿ "95% ತುಂಬಿದಾಗ ಎಚ್ಚರಿಕೆ" ಸೂಚಿಸಿದೆ. ಎಂಜಿನಿಯರ್ ಐತಿಹಾಸಿಕ ಡೇಟಾವನ್ನು ನೋಡಿದರು: ಒಮ್ಮೆ ಡಿಸ್ಕ್ 95% ತಲುಪಿದಾಗ ಹಸ್ತಕ್ಷೇಪಕ್ಕೆ ಸ್ವಲ್ಪ ಸಮಯವಿತ್ತು. ಇದು ಮಿತಿಯನ್ನು 80% ಕ್ಕೆ ಇಳಿಸಿತು ಮತ್ತು "ಬೆಳವಣಿಗೆ ದರ" ಆಧರಿಸಿ ಎರಡನೇ ಎಚ್ಚರಿಕೆಯನ್ನು ಸೇರಿಸಿದೆ. ಪರಿಶೀಲನೆಯು ನಿಜವಾದ ಮಧ್ಯರಾತ್ರಿಯ ಸ್ಥಗಿತವನ್ನು ತಡೆಯುತ್ತದೆ.

ನಾಲ್ಕು ನಕಲಿಸಬಹುದಾದ ಟೆಂಪ್ಲೇಟ್‌ಗಳು

1) ಲಾಗ್ ಸಾರಾಂಶ (ಮುಖವಾಡ):

ಕೆಳಗಿನ ಲಾಗ್ ಉದಾಹರಣೆಯನ್ನು ವಿಶ್ಲೇಷಿಸಿ (ನಾನು ಸೂಕ್ಷ್ಮ ಮೌಲ್ಯಗಳನ್ನು <REDACTED> ಜೊತೆಗೆ ಮರೆಮಾಚಿದ್ದೇನೆ). ನನಗೆ ನೀಡಿ: (1) ಮರುಕಳಿಸುವ ದೋಷ ಮಾದರಿಗಳು, (2) ಕಾಲಾನಂತರದಲ್ಲಿ ಏಕಾಗ್ರತೆ, (3) ಹೆಚ್ಚಾಗಿ ಮೂಲ ಕಾರಣ, ಮತ್ತು (4) ನಾನು ಪರಿಶೀಲಿಸಲು 3 ಮೆಟ್ರಿಕ್‌ಗಳನ್ನು ನೋಡುತ್ತೇನೆ. ಲಾಗ್: [LINES]

2) ಎಚ್ಚರಿಕೆಯ ನಿಯಮ ರಚನೆ:

Prometheus/Alertmanager ಗಾಗಿ ಎಚ್ಚರಿಕೆಯ ನಿಯಮವನ್ನು ಬರೆಯಿರಿ: [THRESHOLD] [METRIC][DURATION] ಅನ್ನು ಮೀರಿದರೆ [ತೀವ್ರತೆ] ಎಚ್ಚರಿಕೆಯನ್ನು ರಚಿಸಿ. ನಿಯಮವು ಕ್ರಮ-ಆಧಾರಿತವಾಗಿರಬೇಕು ಮತ್ತು ಟಿಪ್ಪಣಿ ಮತ್ತು ರನ್‌ಬುಕ್ ಲಿಂಕ್ ಕ್ಷೇತ್ರವನ್ನು ಒಳಗೊಂಡಿರಬೇಕು. PromQL ಅನ್ನು ವಿವರಿಸಿ ಮತ್ತು ಈ ಮಿತಿ ಏಕೆ ಸಮಂಜಸವಾಗಿದೆ ಎಂದು ಬರೆಯಿರಿ.

3) PromQL ಪ್ರಶ್ನೆಯನ್ನು ಬರೆಯುವುದು/ಘೋಷಿಸುವುದು:

ಅಳೆಯುವ PromQL ಪ್ರಶ್ನೆಯನ್ನು ಬರೆಯಿರಿ: [EX. ಕಳೆದ 5 ನಿಮಿಷಗಳಲ್ಲಿ 5xxerror ದರ ಶೇಕಡಾವಾರು]. ಪ್ರಶ್ನೆಯನ್ನು ಹಂತ ಹಂತವಾಗಿ ವಿವರಿಸಿ. ನಂತರ ಈ ಮೌಲ್ಯಕ್ಕೆ ಆರೋಗ್ಯಕರ ಶ್ರೇಣಿ ಏನಾಗಿರಬೇಕು ಎಂದು ಹೇಳಿ.

4) ಡ್ಯಾಶ್‌ಬೋರ್ಡ್ ವಿನ್ಯಾಸ:

[ಸೇವೆ] ಗಾಗಿ ಗ್ರಾಫನಾ ಡ್ಯಾಶ್‌ಬೋರ್ಡ್ ಅನ್ನು ವಿನ್ಯಾಸಗೊಳಿಸಿ: ಯಾವ ಪ್ಯಾನೆಲ್‌ಗಳೊಂದಿಗೆ ನಾನು ನಾಲ್ಕು ಗೋಲ್ಡನ್ ಸಿಗ್ನಲ್‌ಗಳನ್ನು (ಲೇಟೆನ್ಸಿ, ಟ್ರಾಫಿಕ್, ದೋಷ, ಸ್ಯಾಚುರೇಶನ್) ಪ್ರದರ್ಶಿಸಬೇಕು? ಪ್ರತಿ ಪ್ಯಾನೆಲ್‌ಗೆ ಮೆಟ್ರಿಕ್, ದೃಶ್ಯೀಕರಣದ ಪ್ರಕಾರ ಮತ್ತು ಸಮಂಜಸವಾದ ಮಿತಿಯನ್ನು ಸೂಚಿಸಿ. ಉದ್ದೇಶ: 10 ಸೆಕೆಂಡುಗಳಲ್ಲಿ ಸಿಬ್ಬಂದಿಯ ಆರೋಗ್ಯ ಸ್ಥಿತಿಯನ್ನು ನೋಡಲು.

ದುರ್ಬಲ ಪ್ರಾಂಪ್ಟ್ / ಬಲವಾದ ಪ್ರಾಂಪ್ಟ್

ದುರ್ಬಲ: "ಆ ಲಾಗ್‌ನಲ್ಲಿ ಏನಿದೆ?" (ಕಚ್ಚಾ ಲಾಗ್‌ನ 5000 ಸಾಲುಗಳು, ಅದರಲ್ಲಿ ಟೋಕನ್‌ಗಳು ಅನುಸರಿಸುತ್ತವೆ)

ಫಲಿತಾಂಶ: ನೀವು ರಹಸ್ಯಗಳನ್ನು ಸೋರಿಕೆ ಮಾಡುತ್ತೀರಿ ಮತ್ತು AI ಗುರಿಯಿಲ್ಲದ, ಬಾಹ್ಯ ಸಾರಾಂಶವನ್ನು ನೀಡುತ್ತದೆ.

ಪ್ರಬಲ: "ಕೆಳಗಿನ 300-ಸಾಲಿನ ಮುಖವಾಡದ ಲಾಗ್ ಉದಾಹರಣೆಯಲ್ಲಿ ಮರುಕಳಿಸುವ ದೋಷ ನಮೂನೆಗಳು ಮತ್ತು ಸಮಯದ ತೀವ್ರತೆಯನ್ನು ಹುಡುಕಿ; ಹೆಚ್ಚಿನ ಸಂಭವನೀಯ ಮೂಲ ಕಾರಣ ಮತ್ತು ನಾನು ಪರಿಶೀಲಿಸಲು ಮೆಟ್ರಿಕ್‌ಗಳನ್ನು ನನಗೆ ತಿಳಿಸಿ. ನಾನು ಟೋಕನ್‌ಗಳನ್ನು <REDACTED> ಮಾಡಿದ್ದೇನೆ."

ವ್ಯತ್ಯಾಸ: ಎರಡನೇ ಪ್ರಾಂಪ್ಟ್ ಮುಖವಾಡದ ಮತ್ತು ಕೇಂದ್ರೀಕೃತ ಉದಾಹರಣೆಯನ್ನು ನೀಡುತ್ತದೆ, ಸ್ಪಷ್ಟವಾದ ವಿಶ್ಲೇಷಣೆ ಔಟ್‌ಪುಟ್‌ಗಾಗಿ ಕೇಳುತ್ತದೆ; ಇದು ಸುರಕ್ಷಿತ ಮತ್ತು ಉಪಯುಕ್ತ ಎರಡೂ ಆಗಿದೆ.

ಸಾಮಾನ್ಯ ತಪ್ಪುಗಳು

  • ಲಾಗ್ ಅನ್ನು ಮರೆಮಾಚದೆ AI ಗೆ ಅಂಟಿಸುವುದು. ಅತ್ಯಂತ ಸಾಮಾನ್ಯವಾದ ರಹಸ್ಯ/ವೈಯಕ್ತಿಕ ಡೇಟಾ ಸೋರಿಕೆ.
  • ಪ್ರತಿಯೊಂದಕ್ಕೂ ಅಲಾರಂಗಳನ್ನು ಹೊಂದಿಸಲಾಗುತ್ತಿದೆ. ಅಲಾರಾಂ ಆಯಾಸವು ನಿಜವಾದ ಎಚ್ಚರಿಕೆಯನ್ನು ಸಮಾಧಿ ಮಾಡುತ್ತದೆ.
  • ಕ್ರಿಯಾಶೀಲವಲ್ಲದ ಎಚ್ಚರಿಕೆ. ಯಾರೂ ಏನೂ ಮಾಡಲು ಸಾಧ್ಯವಿಲ್ಲ ಎಂಬ ಎಚ್ಚರಿಕೆಯ ಶಬ್ದ.
  • ಪ್ರಶ್ನೆಯಿಲ್ಲದೆ AI ಯ ಮಿತಿಯನ್ನು ಒಪ್ಪಿಕೊಳ್ಳುವುದು. ನಿಮ್ಮ ಸಿಸ್ಟಂನ ಇತಿಹಾಸದ ಪ್ರಕಾರ ಮಿತಿಯನ್ನು ಹೊಂದಿಸಬೇಕು.
  • ಕೇವಲ ಮೆಟ್ರಿಕ್ ನೋಡುತ್ತಿದ್ದೇನೆ. ಲಾಗ್ ಮತ್ತು ಜಾಡಿನ ಇಲ್ಲದೆ, ಮೂಲ ಕಾರಣವನ್ನು ಹೆಚ್ಚಾಗಿ ಕಂಡುಹಿಡಿಯಲಾಗುವುದಿಲ್ಲ.
  • ಅಲಾರಾಂ ಸಮಯವನ್ನು ಹೊಂದಿಸುತ್ತಿಲ್ಲ (ಇದಕ್ಕಾಗಿ). ಕ್ಷಣಿಕ ಏರಿಳಿತಗಳು ತಪ್ಪು ಎಚ್ಚರಿಕೆಗಳನ್ನು ಉಂಟುಮಾಡುತ್ತವೆ.

ಸಾರಾಂಶದಲ್ಲಿ

ವೀಕ್ಷಣೆ; ಮೆಟ್ರಿಕ್‌ಗಳು, ಲಾಗ್‌ಗಳು ಮತ್ತು ಕುರುಹುಗಳೊಂದಿಗೆ ಹೊರಗಿನಿಂದ ಸಿಸ್ಟಮ್‌ನ ಒಳಭಾಗವನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವ ಸಾಮರ್ಥ್ಯ ಇದು. ನಾಲ್ಕು ಗೋಲ್ಡನ್ ಸಿಗ್ನಲ್‌ಗಳು (ಸುಪ್ತತೆ, ಸಂಚಾರ, ದೋಷ, ಶುದ್ಧತ್ವ) ಹೆಚ್ಚಿನ ಸೇವೆಗಳ ಆರೋಗ್ಯವನ್ನು ಸಾರಾಂಶಗೊಳಿಸುತ್ತವೆ. PromQL ಪ್ರಶ್ನೆಗಳು, ಎಚ್ಚರಿಕೆಯ ನಿಯಮಗಳು ಮತ್ತು ಡ್ಯಾಶ್‌ಬೋರ್ಡ್‌ಗಳನ್ನು ಬರೆಯುವಲ್ಲಿ ಮತ್ತು ಲಾಗ್‌ಗಳ ದೊಡ್ಡ ತುಂಡುಗಳನ್ನು ಸಂಕ್ಷೇಪಿಸುವಲ್ಲಿ ಮತ್ತು ವೈಪರೀತ್ಯಗಳನ್ನು ಕಂಡುಹಿಡಿಯುವಲ್ಲಿ AI ಅತ್ಯಂತ ಶಕ್ತಿಶಾಲಿಯಾಗಿದೆ. ಆದರೆ ನಿಮ್ಮ ಸ್ವಂತ ಸಿಸ್ಟಂನ ಇತಿಹಾಸದ ವಿರುದ್ಧ ಎಚ್ಚರಿಕೆಯ ಮಿತಿಗಳನ್ನು ಪರಿಶೀಲಿಸುವುದು, ಅಲಾರಮ್‌ಗಳನ್ನು ಕ್ರಿಯೆ-ಆಧಾರಿತವಾಗಿರಿಸುವುದು ಮತ್ತು ಅವುಗಳನ್ನು ಮರೆಮಾಚದೆ ಲಾಗ್‌ಗಳನ್ನು ಎಂದಿಗೂ ಹಂಚಿಕೊಳ್ಳದಿರುವುದು ನಿಮ್ಮ ಜವಾಬ್ದಾರಿಯಾಗಿದೆ.

ಅಪ್ಲಿಕೇಶನ್ ಕಾರ್ಯ

ಸೇವೆಗಾಗಿ (ಅಥವಾ ಮಾದರಿ ಸೇವೆ): (1) "ಅಲಾರ್ಮ್ ನಿಯಮ ರಚನೆ" ಟೆಂಪ್ಲೇಟ್‌ನೊಂದಿಗೆ ದೋಷ ದರಕ್ಕಾಗಿ ಎಚ್ಚರಿಕೆಯ ನಿಯಮವನ್ನು ರಚಿಸಿ ಮತ್ತು ಸೂಚಿಸಲಾದ ಮಿತಿಯನ್ನು "ಹಿಂದೆ ಎಷ್ಟು ಬಾರಿ ಪ್ರಚೋದಿಸಿದೆ?" ಪ್ರಶ್ನೆಯೊಂದಿಗೆ ಅದನ್ನು ಪರೀಕ್ಷಿಸಿ; (2) ನೀವು ಹೊಂದಿರುವ ಲಾಗ್ ಮಾದರಿಯನ್ನು ಮಾಸ್ಕ್ ಮಾಡಿ ಮತ್ತು ಅದನ್ನು "ಲಾಗ್ ಸಾರಾಂಶ" ಟೆಂಪ್ಲೇಟ್‌ನೊಂದಿಗೆ ವಿಶ್ಲೇಷಿಸಿ; (3) ಹೆಚ್ಚು ಸಂಭವನೀಯ ಮೂಲ ಕಾರಣವನ್ನು ಖಚಿತಪಡಿಸಲು ನೀವು ಯಾವ ಮೆಟ್ರಿಕ್ ಅನ್ನು ನೋಡುತ್ತೀರಿ ಎಂಬುದನ್ನು ಗಮನಿಸಿ.

ಪರಿಶೀಲನಾಪಟ್ಟಿ

  • [ ] ನಾನು ನಾಲ್ಕು ಗೋಲ್ಡನ್ ಸಿಗ್ನಲ್‌ಗಳ ಆಧಾರದ ಮೇಲೆ ಟ್ರ್ಯಾಕ್ ಮಾಡಲು ಮೆಟ್ರಿಕ್‌ಗಳನ್ನು ಆರಿಸಿದೆ.
  • [ ] ನಾನು ಸೂಕ್ಷ್ಮ ಪ್ರದೇಶಗಳ ವಿಷಯದಲ್ಲಿ AI ಗೆ ನೀಡಿದ ಎಲ್ಲಾ ಲಾಗ್‌ಗಳನ್ನು ಮರೆಮಾಡಿದೆ.
  • [ ] ಪ್ರತಿ ಅಲಾರಾಂ ಕ್ರಿಯಾ-ಆಧಾರಿತ ಮತ್ತು ಸರಿಯಾದ ತುರ್ತು ಎಂದು ನಾನು ಪರಿಶೀಲಿಸಿದ್ದೇನೆ.
  • [ ] ನನ್ನ ಸಿಸ್ಟಂನ ಐತಿಹಾಸಿಕ ಡೇಟಾದ ವಿರುದ್ಧ ನಾನು ಎಚ್ಚರಿಕೆಯ ಮಿತಿಗಳನ್ನು ಪರೀಕ್ಷಿಸಿದೆ.
  • [ ] ನಾನು ಅಲಾರಮ್‌ಗಳಿಗೆ (ಅವಧಿ) ಸೇರಿಸುವ ಮೂಲಕ ತತ್‌ಕ್ಷಣದ ಏರಿಳಿತಗಳನ್ನು ಫಿಲ್ಟರ್ ಮಾಡಿದ್ದೇನೆ.
  • [ ] ನಾನು ಮೂಲ ಕಾರಣಕ್ಕಾಗಿ ಮೆಟ್ರಿಕ್ + ಲಾಗ್ + ಟ್ರೇಸ್ ಅನ್ನು ಒಟ್ಟಿಗೆ ಬಳಸಿದ್ದೇನೆ.