ಲಾಭಗಳು:
- ವೀಕ್ಷಣೆಯ ಮೂರು ಸ್ತಂಭಗಳು (ಮೆಟ್ರಿಕ್, ಲಾಗ್, ಟ್ರೇಸ್) ಮತ್ತು ನಾಲ್ಕು ಗೋಲ್ಡನ್ ಸಿಗ್ನಲ್ಗಳನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವ ಸಾಮರ್ಥ್ಯ ಮತ್ತು ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆಯು PromQL ಪ್ರಶ್ನೆಗಳು, ಎಚ್ಚರಿಕೆ ನಿಯಮಗಳು ಮತ್ತು ಡ್ಯಾಶ್ಬೋರ್ಡ್ಗಳನ್ನು ಉತ್ಪಾದಿಸುತ್ತದೆ
- ಅಲಾರಮ್ಗಳನ್ನು ಕ್ರಮ-ಆಧಾರಿತವಾಗಿ ಮತ್ತು ಸರಿಯಾದ ತುರ್ತುಸ್ಥಿತಿಯಲ್ಲಿ ಇರಿಸಿಕೊಳ್ಳುವ ಮೂಲಕ ಎಚ್ಚರಿಕೆಯ ಆಯಾಸವನ್ನು ತಡೆಗಟ್ಟುವ ಸಾಮರ್ಥ್ಯ ಮತ್ತು ನಿಮ್ಮ ಸ್ವಂತ ಸಿಸ್ಟಮ್ನ ಐತಿಹಾಸಿಕ ಡೇಟಾದ ವಿರುದ್ಧ ಮಿತಿಗಳನ್ನು ಪರೀಕ್ಷಿಸುವುದು
- ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆಗೆ ಲಾಗ್ಗಳನ್ನು ನೀಡುವ ಮೊದಲು ಸೂಕ್ಷ್ಮ ಪ್ರದೇಶಗಳನ್ನು ಮರೆಮಾಚುವ ಮೂಲಕ ಗೌಪ್ಯತೆ ಮತ್ತು ರಹಸ್ಯ ಸೋರಿಕೆಯನ್ನು ತಡೆಯುವ ಸಾಮರ್ಥ್ಯ
ಒಂದು ವ್ಯವಸ್ಥೆಯು ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತಿರುವಂತೆ ತೋರುತ್ತಿರುವಾಗ, ಅದು ಒಳಗೆ ಸಾಯುತ್ತಿರಬಹುದು: ಮೆಮೊರಿ ನಿಧಾನವಾಗಿ ತುಂಬುವುದು, ಪ್ರತಿಕ್ರಿಯೆ ಸಮಯಗಳು ಹೆಚ್ಚಾಗುವುದು, ದೋಷದ ಪ್ರಮಾಣವು ಹರಿದಾಡುತ್ತಿದೆ. ಇದನ್ನು ಗಮನಿಸುವ ಏಕೈಕ ಮಾರ್ಗವೆಂದರೆ ಸಿಸ್ಟಮ್ ಅನ್ನು ನಿರಂತರವಾಗಿ ಮೇಲ್ವಿಚಾರಣೆ ಮಾಡುವುದು. ಹೆಚ್ಚು ಸುಧಾರಿತ ಪರಿಕಲ್ಪನೆಯು ವೀಕ್ಷಣೆಯಾಗಿದೆ: ಅದರ ಬಾಹ್ಯ ಚಿಹ್ನೆಗಳನ್ನು ನೋಡುವ ಮೂಲಕ ಸಿಸ್ಟಮ್ ಒಳಗೆ ಏನು ನಡೆಯುತ್ತಿದೆ ಎಂಬುದನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವ ಸಾಮರ್ಥ್ಯ. ವೀಕ್ಷಣೆಯ ಮೂರು ಸ್ತಂಭಗಳಿವೆ, ಮತ್ತು DevOps ವೃತ್ತಿಪರರು ಮೂರನ್ನೂ ಬಳಸುತ್ತಾರೆ:
- ಮೆಟ್ರಿಕ್: ಸಂಖ್ಯಾತ್ಮಕ ಮೌಲ್ಯಗಳನ್ನು ಕಾಲಾನಂತರದಲ್ಲಿ ಅಳೆಯಲಾಗುತ್ತದೆ - CPU ಬಳಕೆ, ವಿನಂತಿಗಳ ಸಂಖ್ಯೆ, ಪ್ರತಿಕ್ರಿಯೆ ಸಮಯ, ದೋಷ ದರ. "ಎಷ್ಟು?" ಎಂಬ ಪ್ರಶ್ನೆಗೆ ಉತ್ತರಿಸುತ್ತದೆ.
- ಲಾಗ್: ಸಿಸ್ಟಮ್ನಿಂದ ತಯಾರಿಸಲಾದ ಪಠ್ಯ ಈವೆಂಟ್ ದಾಖಲೆಗಳು- "ಬಳಕೆದಾರರು ಲಾಗ್ ಇನ್ ಆಗಿದ್ದಾರೆ", "ಡೇಟಾಬೇಸ್ ಸಂಪರ್ಕ ಕಳೆದುಹೋಗಿದೆ". "ಸರಿಯಾಗಿ ಏನಾಯಿತು?" ಎಂಬ ಪ್ರಶ್ನೆಗೆ ಉತ್ತರಿಸುತ್ತದೆ.
- ಟ್ರೇಸ್: ಸಿಸ್ಟಮ್ನಲ್ಲಿ ಸೇವೆಯಿಂದ ಸೇವೆಗೆ ಹಾದುಹೋಗುವಾಗ ವಿನಂತಿಯು ಅನುಸರಿಸುವ ಮಾರ್ಗ ಮತ್ತು ಪ್ರತಿ ಹಂತದ ಅವಧಿ. "ನಿಧಾನತೆ ಎಲ್ಲಿದೆ?" ಎಂಬ ಪ್ರಶ್ನೆಗೆ ಉತ್ತರಿಸುತ್ತದೆ.
ಅತ್ಯಂತ ಸಾಮಾನ್ಯ ಪರಿಕರಗಳು: ಮೆಟ್ರಿಕ್ಗಳಿಗಾಗಿ ಪ್ರಮೀತಿಯಸ್, ದೃಶ್ಯೀಕರಣಕ್ಕಾಗಿ ಗ್ರಾಫಾನಾ, ಲಾಗ್ಗಾಗಿ ಲೋಕಿ/ELK, ಜಾಡಿನ ಗಾಗಿ ಜೇಗರ್/ಓಪನ್ಟೆಲಿಮೆಟ್ರಿ. ಈ ಪರಿಕರಗಳಿಗಾಗಿ ಪ್ರಶ್ನೆ ಭಾಷೆಗಳನ್ನು (ವಿಶೇಷವಾಗಿ ಪ್ರೊಮೆಥಿಯಸ್ನ PromQL), ಎಚ್ಚರಿಕೆಯ ನಿಯಮಗಳು ಮತ್ತು ಡ್ಯಾಶ್ಬೋರ್ಡ್ ಕಾನ್ಫಿಗರೇಶನ್ಗಳನ್ನು ಬರೆಯುವಲ್ಲಿ AI ಬಹಳ ಪರಿಣತಿ ಹೊಂದಿದೆ. AI ಅದರ ಪ್ರಬಲವಾಗಿರುವ ಸ್ಥಳವೂ ಇಲ್ಲಿದೆ: ಲಾಗ್ಗಳು ಮತ್ತು ಮೆಟ್ರಿಕ್ಗಳ ದೊಡ್ಡ ಭಾಗಗಳನ್ನು ಸಾರಾಂಶ ಮತ್ತು ವೈಪರೀತ್ಯಗಳನ್ನು ಫ್ಲ್ಯಾಗ್ ಮಾಡುವುದು.
ಒಂದು ವಾಕ್ಯದಲ್ಲಿ ಮೇಲ್ವಿಚಾರಣೆ ಮತ್ತು ವೀಕ್ಷಣೆಯ ನಡುವಿನ ವ್ಯತ್ಯಾಸವನ್ನು ಸ್ಪಷ್ಟಪಡಿಸೋಣ: ಮಾನಿಟರಿಂಗ್ ನಿಮಗೆ ಈಗಾಗಲೇ ತಿಳಿದಿರುವ ಪ್ರಶ್ನೆಗಳನ್ನು ಕೇಳುತ್ತಿದೆ ("CPU 90% ಕಳೆದಿದೆಯೇ?"); ವೀಕ್ಷಣಾ ಸಾಮರ್ಥ್ಯವು ನಿಮಗೆ ಈಗಾಗಲೇ ತಿಳಿದಿಲ್ಲದ ಪ್ರಶ್ನೆಗಳನ್ನು ಕೇಳಲು ಸಾಧ್ಯವಾಗುತ್ತದೆ ("ಈ ವಿಚಿತ್ರವಾದ ನಿಧಾನಗತಿಯು ನಿರ್ದಿಷ್ಟ ಸಮಯದಲ್ಲಿ ನಿರ್ದಿಷ್ಟ ಗ್ರಾಹಕರಿಗೆ ಮಾತ್ರ ಏಕೆ ನಡೆಯುತ್ತಿದೆ?"). ಆಧುನಿಕ ವ್ಯವಸ್ಥೆಗಳು ತುಂಬಾ ಸಂಕೀರ್ಣವಾಗಿದ್ದು, ನೀವು ವೈಫಲ್ಯದ ಎಲ್ಲಾ ವಿಧಾನಗಳನ್ನು ಊಹಿಸಲು ಸಾಧ್ಯವಿಲ್ಲ; ಆದ್ದರಿಂದ, ಶ್ರೀಮಂತ ಮೆಟ್ರಿಕ್ಗಳು, ದಾಖಲೆಗಳು ಮತ್ತು ಕುರುಹುಗಳನ್ನು ಸಂಗ್ರಹಿಸುವ ಸಾಮರ್ಥ್ಯ ಮತ್ತು ನಂತರ ಅವುಗಳನ್ನು ಆಳವಾಗಿ ಪ್ರಶ್ನಿಸುವ ಸಾಮರ್ಥ್ಯ - ಅಂದರೆ, ವೀಕ್ಷಣೆ - ನಿರ್ಣಾಯಕವಾಗುತ್ತದೆ. "ಹಿಂದೆ ತಿಳಿದಿಲ್ಲದ ಪ್ರಶ್ನೆಗೆ" ಉತ್ತರಿಸುವಾಗ AI ಕಾರ್ಯರೂಪಕ್ಕೆ ಬರುತ್ತದೆ: ಇದು ನಿಮ್ಮಲ್ಲಿರುವ ಕಚ್ಚಾ ಡೇಟಾವನ್ನು ತ್ವರಿತವಾಗಿ ಸ್ಕ್ಯಾನ್ ಮಾಡುತ್ತದೆ, ಮಾದರಿಗಳು ಮತ್ತು ವೈಪರೀತ್ಯಗಳನ್ನು ಸೂಚಿಸುತ್ತದೆ ಮತ್ತು ಈ ಸುಳಿವುಗಳನ್ನು ಪರಿಶೀಲಿಸುವ ಮೂಲಕ ನೀವು ಮೂಲ ಕಾರಣವನ್ನು ಪಡೆಯುತ್ತೀರಿ.
ಹಂತ ಹಂತವಾಗಿ: ಏನು ಮತ್ತು ಹೇಗೆ ಮೇಲ್ವಿಚಾರಣೆ ಮಾಡುವುದು?
- ಸರಿಯಾದ ಮೆಟ್ರಿಕ್ಗಳನ್ನು ಆಯ್ಕೆಮಾಡಿ. ಉದ್ಯಮದಲ್ಲಿ, "ನಾಲ್ಕು ಗೋಲ್ಡನ್ ಸಿಗ್ನಲ್ಗಳನ್ನು" ಆಧಾರವಾಗಿ ತೆಗೆದುಕೊಳ್ಳಲಾಗುತ್ತದೆ: ಸುಪ್ತತೆ, ದಟ್ಟಣೆ, ದೋಷಗಳು, ಶುದ್ಧತ್ವ - ಸಂಪನ್ಮೂಲವು ಎಷ್ಟು ಪೂರ್ಣವಾಗಿದೆ. ಇವುಗಳು ಹೆಚ್ಚಿನ ಸೇವೆಗಳ ಆರೋಗ್ಯವನ್ನು ಸಾರಾಂಶಗೊಳಿಸುತ್ತವೆ.
- ಮೆಟ್ರಿಕ್ಗಳನ್ನು ಸಂಗ್ರಹಿಸಿ. ಪ್ರಮೀತಿಯಸ್ ಓದಬಹುದಾದ ಅಂತಿಮ ಬಿಂದುವನ್ನು ಅಪ್ಲಿಕೇಶನ್ ಪ್ರಸ್ತುತಪಡಿಸಲಿ.
- ಡ್ಯಾಶ್ಬೋರ್ಡ್ಗಳನ್ನು ಹೊಂದಿಸಿ. ಗ್ರಾಫಾನಾದಲ್ಲಿ ಈ ಮೆಟ್ರಿಕ್ಗಳನ್ನು ದೃಶ್ಯೀಕರಿಸಿ.
- ಎಚ್ಚರಿಕೆಯ ನಿಯಮಗಳನ್ನು ಬರೆಯಿರಿ. ಮಿತಿ ಮೀರಿದಾಗ ಯಾರಿಗೆ ಎಚ್ಚರಿಕೆ ನೀಡಲಾಗುತ್ತದೆ ಮತ್ತು ಹೇಗೆ?
- ಲಾಗ್ಗಳನ್ನು ಕೇಂದ್ರೀಕರಿಸಿ. ಎಲ್ಲಾ ಸೇವಾ ಲಾಗ್ಗಳನ್ನು ಒಂದೇ ಸ್ಥಳದಲ್ಲಿ ಹುಡುಕುವಂತೆ ಮಾಡಿ.
- ಶಬ್ದವನ್ನು ಕಡಿಮೆ ಮಾಡಿ. ಹೆಚ್ಚು ಎಚ್ಚರಿಕೆಯು "ಎಚ್ಚರಿಕೆಯ ಆಯಾಸ"ವನ್ನು ಸೃಷ್ಟಿಸುತ್ತದೆ; ಪ್ರಮುಖ ಎಚ್ಚರಿಕೆಯು ಕಣ್ಮರೆಯಾಗುತ್ತದೆ.
ಸಲಹೆ: ಉತ್ತಮ ಅಲಾರಂ ಎರಡು ವಿಷಯಗಳನ್ನು ಪೂರೈಸುತ್ತದೆ: ಇದು ಕಾರ್ಯಸಾಧ್ಯವಾಗಿದೆ ಮತ್ತು ಸರಿಯಾದ ತುರ್ತುಸ್ಥಿತಿಯನ್ನು ಹೊಂದಿದೆ. ಬೆಳಗಿನ ಜಾವ 3 ಗಂಟೆಗೆ ಯಾರನ್ನಾದರೂ ಎಬ್ಬಿಸುವ ಅಲಾರಾಂ ನಿಜವಾಗಿ ರಾತ್ರಿಯ ಮಧ್ಯಸ್ಥಿಕೆಯ ಅಗತ್ಯವಿರುತ್ತದೆ. "CPU 70%" ನಂತಹ ತನ್ನದೇ ಆದ ಕ್ರಿಯೆಯ ಅಗತ್ಯವಿಲ್ಲದ ಯಾವುದನ್ನಾದರೂ ಯಾರನ್ನೂ ಎಚ್ಚರಗೊಳಿಸಬೇಡಿ; ಅದನ್ನು ಮಂಡಳಿಯಲ್ಲಿ ಪ್ರದರ್ಶಿಸಿ.
ಎಚ್ಚರಿಕೆಯ ನಿಯಮವನ್ನು ಬರೆಯುವುದು ಹೇಗೆ?
ಎಚ್ಚರಿಕೆಯು ಮೂರು ಘಟಕಗಳನ್ನು ಒಳಗೊಂಡಿದೆ: ಸ್ಥಿತಿ (ಯಾವ ಮೆಟ್ರಿಕ್ ಮಿತಿ ಮೀರುತ್ತದೆ ಮತ್ತು ಎಷ್ಟು ಸಮಯದವರೆಗೆ), ಅವಧಿ (ಕ್ಷಣಿಕ ಏರಿಳಿತಗಳನ್ನು ಪ್ರಚೋದಿಸುವುದನ್ನು ತಪ್ಪಿಸಲು "5 ನಿಮಿಷಗಳ ಕಾಲ"), ಮತ್ತು ಪ್ರಾಮುಖ್ಯತೆ/ಕ್ರಿಯೆ (ಯಾರಿಗೆ, ಯಾವ ಚಾನಲ್ ಮೂಲಕ). AI ಈ ಮೂರನ್ನು ಸರಿಯಾದ ಸಂದರ್ಭದೊಂದಿಗೆ ಕೌಶಲ್ಯದಿಂದ ಸ್ಥಾಪಿಸುತ್ತದೆ. ಉದಾಹರಣೆಗೆ, "5 ನಿಮಿಷಗಳವರೆಗೆ ದೋಷದ ಪ್ರಮಾಣವು 5% ಮೀರಿದರೆ ನಿರ್ಣಾಯಕ ಎಚ್ಚರಿಕೆ" ನಂತಹ ನಿಯಮವನ್ನು PromQL ಗೆ ಭಾಷಾಂತರಿಸುವುದು AI ಗೆ ವಿಭಜಿತ-ಎರಡನೆಯ ಕಾರ್ಯವಾಗಿದೆ - ಆದರೆ ನಿಮ್ಮ ಸಿಸ್ಟಮ್ಗೆ ಮಿತಿ ಸರಿಯಾಗಿದೆಯೇ ಎಂದು ನೀವು ನಿರ್ಧರಿಸುತ್ತೀರಿ.
ಎಚ್ಚರಿಕೆ: AI ಸೂಚಿಸಿದ ಎಚ್ಚರಿಕೆಯ ಮಿತಿಗಳು ಸಾಮಾನ್ಯ ಊಹೆಗಳಾಗಿವೆ. ನಿಮ್ಮ ಸಿಸ್ಟಂನ ಸಾಮಾನ್ಯ ಲೋಡ್, ಸಹನೆ ಮತ್ತು ಕೆಲಸದ ಪರಿಣಾಮವು ವಿಭಿನ್ನವಾಗಿದೆ. ನೀವು ನೇರವಾಗಿ ಉತ್ಪನ್ನಕ್ಕೆ ಮಿತಿ ಹಾಕುವ ಮೊದಲು, ನಿಮ್ಮ ಐತಿಹಾಸಿಕ ಡೇಟಾವನ್ನು ನೀವು ನೋಡುತ್ತೀರಿ ಮತ್ತು "ಈ ಮಿತಿಯನ್ನು ಹಿಂದೆ ಎಷ್ಟು ಬಾರಿ ಪ್ರಚೋದಿಸಲಾಗಿದೆ, ಅವುಗಳಲ್ಲಿ ಎಷ್ಟು ನೈಜ ಸಮಸ್ಯೆಗಳಾಗಿವೆ?" ಪ್ರಶ್ನೆಗೆ ಉತ್ತರಿಸಿ.
ಲಾಗ್ ಗೌಪ್ಯತೆ: ನಿರ್ಣಾಯಕ ಎಚ್ಚರಿಕೆ
ಲಾಗ್ಗಳು ಸೋರಿಕೆಗಳ ಆಗಾಗ್ಗೆ ಕಡೆಗಣಿಸಲ್ಪಡುವ ಮೂಲವಾಗಿದೆ. ಲಾಗ್ ಲೈನ್ ಆಕಸ್ಮಿಕವಾಗಿ ಪಾಸ್ವರ್ಡ್, ಕ್ರೆಡಿಟ್ ಕಾರ್ಡ್ ಸಂಖ್ಯೆ ಅಥವಾ ವೈಯಕ್ತಿಕ ಡೇಟಾವನ್ನು (KVKK/GDPR ಅಡಿಯಲ್ಲಿ) ಒಳಗೊಂಡಿರಬಹುದು. ವಿಶ್ಲೇಷಣೆಗಾಗಿ AI ಗೆ ಲಾಗ್ಗಳನ್ನು ಅಂಟಿಸುವಾಗ:
- ಸೂಕ್ಷ್ಮ ಪ್ರದೇಶಗಳನ್ನು ಮಾಸ್ಕ್ ಮಾಡಿ. ಟೋಕನ್, ಪಾಸ್ವರ್ಡ್, ಇಮೇಲ್, ಐಡಿ ಸಂಖ್ಯೆಯಂತಹ ಮೌಲ್ಯಗಳನ್ನು <REDACTED> ನೊಂದಿಗೆ ಬದಲಾಯಿಸಿ.
- ಉದಾಹರಣೆಗಳನ್ನು ನೀಡಿ, ಎಲ್ಲಾ ಅಲ್ಲ. ಒಂದು ಮಿಲಿಯನ್ ಸಾಲುಗಳ ಬದಲಿಗೆ, ಕೆಲವು ನೂರು ಪ್ರಾತಿನಿಧಿಕ ಸಾಲುಗಳು ಹೆಚ್ಚಾಗಿ ಸಾಕು.
- ಸಂಸ್ಥೆ-ಅನುಮೋದಿತ ವಾಹನವನ್ನು ಆಯ್ಕೆಮಾಡಿ. ವಿಶೇಷವಾಗಿ ಉತ್ಪಾದನಾ ಲಾಗ್ಗಳಿಗಾಗಿ, ಡೇಟಾ ತರಬೇತಿಗೆ ಹೋಗದ ಸಾಧನವನ್ನು ಬಳಸಿ.
ನಾಲ್ಕು ಗೋಲ್ಡನ್ ಸಿಗ್ನಲ್ಗಳು ಮತ್ತು ಎಚ್ಚರಿಕೆಯ ಕೋಷ್ಟಕಗಳು
ಸಂಕೇತ
ಮೂಲಕ ಅಳೆಯಲಾಗುತ್ತದೆ
ಉದಾಹರಣೆ ಎಚ್ಚರಿಕೆಯ ಮಿತಿ
ತುರ್ತು
ಸುಪ್ತತೆ
ಪ್ರತಿಕ್ರಿಯೆ ಸಮಯ
p95 > 800 ms, 5 ನಿಮಿಷಗಳು
ಹೆಚ್ಚು
ಸಂಚಾರ
ವಿನಂತಿ/ಸೆಕೆಂಡು
ಹಠಾತ್ 300% ಹೆಚ್ಚಳ / ಇಳಿಕೆ
ಮಧ್ಯಮ
ದೋಷ
ವಿಫಲವಾದ ವಿನಂತಿ ದರ
> 5%, 5 ನಿಮಿಷ
ನಿರ್ಣಾಯಕ
ಶುದ್ಧತ್ವ
ಸಂಪನ್ಮೂಲ ಆಕ್ಯುಪೆನ್ಸಿ
ಡಿಸ್ಕ್ > 85%
ಹೆಚ್ಚು
ಮೂರು ಸಣ್ಣ ಪ್ರಕರಣಗಳು
ಪ್ರಕರಣ 1 — 400 ಸಾಲುಗಳ ಲಾಗ್ ಅನ್ನು 30 ಸೆಕೆಂಡುಗಳಲ್ಲಿ ಸಂಕ್ಷಿಪ್ತಗೊಳಿಸಲಾಗಿದೆ. ಒಂದು ಸೇವೆ ನಿಧಾನವಾಯಿತು. ಎಂಜಿನಿಯರ್ ಮುಖವಾಡದ 400 ಸಾಲುಗಳ ಲಾಗ್ ಅನ್ನು AI ಗೆ ನೀಡಿದರು ಮತ್ತು "ಮರುಕಳಿಸುವ ದೋಷ ಮಾದರಿಗಳು ಮತ್ತು ಸಮಯದ ತೀವ್ರತೆಯನ್ನು ಸಾರಾಂಶಗೊಳಿಸಿ" ಎಂದು ಹೇಳಿದರು. ಪ್ರತಿ 30 ಸೆಕೆಂಡ್ಗಳಿಗೆ ನಿರ್ದಿಷ್ಟ ಬಾಹ್ಯ API ಕರೆ ಸಮಯ ಮೀರುತ್ತದೆ ಎಂದು AI ತೋರಿಸಿದೆ. 30 ಸೆಕೆಂಡುಗಳಲ್ಲಿ ಮೂಲ ಕಾರಣ ಪತ್ತೆ; ಲಾಗ್ಗಳನ್ನು ಹಸ್ತಚಾಲಿತವಾಗಿ ಸ್ಕ್ಯಾನ್ ಮಾಡಲು ಅರ್ಧ ಗಂಟೆ ತೆಗೆದುಕೊಳ್ಳುತ್ತದೆ.
ಪ್ರಕರಣ 2 - ಎಚ್ಚರಿಕೆಯ ಆಯಾಸವನ್ನು ಪರಿಹರಿಸಲಾಗಿದೆ. ಒಂದು ತಂಡವು ದಿನಕ್ಕೆ 200 ಅಲಾರಮ್ಗಳನ್ನು ಸ್ವೀಕರಿಸುತ್ತಿದೆ ಮತ್ತು ಅವೆಲ್ಲವನ್ನೂ ನಿರ್ಲಕ್ಷಿಸುತ್ತಿತ್ತು - ನಿಜವಾದ ಔಟಾಗುವ ಎಚ್ಚರಿಕೆಯನ್ನು ಸಹ ಕಡೆಗಣಿಸುವವರೆಗೆ. AI ಗೆ ಎಲ್ಲಾ ಎಚ್ಚರಿಕೆಯ ನಿಯಮಗಳನ್ನು ನೀಡಿ ಮತ್ತು "ಯಾವುವು ಕಾರ್ಯಸಾಧ್ಯವಲ್ಲ ಮತ್ತು ಯಾವುದನ್ನು ಸಂಯೋಜಿಸಬಹುದು?" ಅವರು ಕೇಳಿದರು. ಅಲಾರಂಗಳ ಸಂಖ್ಯೆ ದಿನಕ್ಕೆ 12 ಕ್ಕೆ ಕಡಿಮೆಯಾಗಿದೆ; ಪ್ರತಿ ಎಚ್ಚರಿಕೆಯನ್ನು ಈಗ ಗಂಭೀರವಾಗಿ ತೆಗೆದುಕೊಳ್ಳಲಾಗಿದೆ.
ಪ್ರಕರಣ 3 - ತಪ್ಪಾದ ಮಿತಿಯನ್ನು ಮೊದಲೇ ಹಿಡಿಯಲಾಗಿದೆ. YZ ಡಿಸ್ಕ್ಗಾಗಿ "95% ತುಂಬಿದಾಗ ಎಚ್ಚರಿಕೆ" ಸೂಚಿಸಿದೆ. ಎಂಜಿನಿಯರ್ ಐತಿಹಾಸಿಕ ಡೇಟಾವನ್ನು ನೋಡಿದರು: ಒಮ್ಮೆ ಡಿಸ್ಕ್ 95% ತಲುಪಿದಾಗ ಹಸ್ತಕ್ಷೇಪಕ್ಕೆ ಸ್ವಲ್ಪ ಸಮಯವಿತ್ತು. ಇದು ಮಿತಿಯನ್ನು 80% ಕ್ಕೆ ಇಳಿಸಿತು ಮತ್ತು "ಬೆಳವಣಿಗೆ ದರ" ಆಧರಿಸಿ ಎರಡನೇ ಎಚ್ಚರಿಕೆಯನ್ನು ಸೇರಿಸಿದೆ. ಪರಿಶೀಲನೆಯು ನಿಜವಾದ ಮಧ್ಯರಾತ್ರಿಯ ಸ್ಥಗಿತವನ್ನು ತಡೆಯುತ್ತದೆ.
ನಾಲ್ಕು ನಕಲಿಸಬಹುದಾದ ಟೆಂಪ್ಲೇಟ್ಗಳು
1) ಲಾಗ್ ಸಾರಾಂಶ (ಮುಖವಾಡ):
ಕೆಳಗಿನ ಲಾಗ್ ಉದಾಹರಣೆಯನ್ನು ವಿಶ್ಲೇಷಿಸಿ (ನಾನು ಸೂಕ್ಷ್ಮ ಮೌಲ್ಯಗಳನ್ನು <REDACTED> ಜೊತೆಗೆ ಮರೆಮಾಚಿದ್ದೇನೆ). ನನಗೆ ನೀಡಿ: (1) ಮರುಕಳಿಸುವ ದೋಷ ಮಾದರಿಗಳು, (2) ಕಾಲಾನಂತರದಲ್ಲಿ ಏಕಾಗ್ರತೆ, (3) ಹೆಚ್ಚಾಗಿ ಮೂಲ ಕಾರಣ, ಮತ್ತು (4) ನಾನು ಪರಿಶೀಲಿಸಲು 3 ಮೆಟ್ರಿಕ್ಗಳನ್ನು ನೋಡುತ್ತೇನೆ. ಲಾಗ್: [LINES]
2) ಎಚ್ಚರಿಕೆಯ ನಿಯಮ ರಚನೆ:
Prometheus/Alertmanager ಗಾಗಿ ಎಚ್ಚರಿಕೆಯ ನಿಯಮವನ್ನು ಬರೆಯಿರಿ: [THRESHOLD] [METRIC][DURATION] ಅನ್ನು ಮೀರಿದರೆ [ತೀವ್ರತೆ] ಎಚ್ಚರಿಕೆಯನ್ನು ರಚಿಸಿ. ನಿಯಮವು ಕ್ರಮ-ಆಧಾರಿತವಾಗಿರಬೇಕು ಮತ್ತು ಟಿಪ್ಪಣಿ ಮತ್ತು ರನ್ಬುಕ್ ಲಿಂಕ್ ಕ್ಷೇತ್ರವನ್ನು ಒಳಗೊಂಡಿರಬೇಕು. PromQL ಅನ್ನು ವಿವರಿಸಿ ಮತ್ತು ಈ ಮಿತಿ ಏಕೆ ಸಮಂಜಸವಾಗಿದೆ ಎಂದು ಬರೆಯಿರಿ.
3) PromQL ಪ್ರಶ್ನೆಯನ್ನು ಬರೆಯುವುದು/ಘೋಷಿಸುವುದು:
ಅಳೆಯುವ PromQL ಪ್ರಶ್ನೆಯನ್ನು ಬರೆಯಿರಿ: [EX. ಕಳೆದ 5 ನಿಮಿಷಗಳಲ್ಲಿ 5xxerror ದರ ಶೇಕಡಾವಾರು]. ಪ್ರಶ್ನೆಯನ್ನು ಹಂತ ಹಂತವಾಗಿ ವಿವರಿಸಿ. ನಂತರ ಈ ಮೌಲ್ಯಕ್ಕೆ ಆರೋಗ್ಯಕರ ಶ್ರೇಣಿ ಏನಾಗಿರಬೇಕು ಎಂದು ಹೇಳಿ.
4) ಡ್ಯಾಶ್ಬೋರ್ಡ್ ವಿನ್ಯಾಸ:
[ಸೇವೆ] ಗಾಗಿ ಗ್ರಾಫನಾ ಡ್ಯಾಶ್ಬೋರ್ಡ್ ಅನ್ನು ವಿನ್ಯಾಸಗೊಳಿಸಿ: ಯಾವ ಪ್ಯಾನೆಲ್ಗಳೊಂದಿಗೆ ನಾನು ನಾಲ್ಕು ಗೋಲ್ಡನ್ ಸಿಗ್ನಲ್ಗಳನ್ನು (ಲೇಟೆನ್ಸಿ, ಟ್ರಾಫಿಕ್, ದೋಷ, ಸ್ಯಾಚುರೇಶನ್) ಪ್ರದರ್ಶಿಸಬೇಕು? ಪ್ರತಿ ಪ್ಯಾನೆಲ್ಗೆ ಮೆಟ್ರಿಕ್, ದೃಶ್ಯೀಕರಣದ ಪ್ರಕಾರ ಮತ್ತು ಸಮಂಜಸವಾದ ಮಿತಿಯನ್ನು ಸೂಚಿಸಿ. ಉದ್ದೇಶ: 10 ಸೆಕೆಂಡುಗಳಲ್ಲಿ ಸಿಬ್ಬಂದಿಯ ಆರೋಗ್ಯ ಸ್ಥಿತಿಯನ್ನು ನೋಡಲು.
ದುರ್ಬಲ ಪ್ರಾಂಪ್ಟ್ / ಬಲವಾದ ಪ್ರಾಂಪ್ಟ್
ದುರ್ಬಲ: "ಆ ಲಾಗ್ನಲ್ಲಿ ಏನಿದೆ?" (ಕಚ್ಚಾ ಲಾಗ್ನ 5000 ಸಾಲುಗಳು, ಅದರಲ್ಲಿ ಟೋಕನ್ಗಳು ಅನುಸರಿಸುತ್ತವೆ)
ಫಲಿತಾಂಶ: ನೀವು ರಹಸ್ಯಗಳನ್ನು ಸೋರಿಕೆ ಮಾಡುತ್ತೀರಿ ಮತ್ತು AI ಗುರಿಯಿಲ್ಲದ, ಬಾಹ್ಯ ಸಾರಾಂಶವನ್ನು ನೀಡುತ್ತದೆ.
ಪ್ರಬಲ: "ಕೆಳಗಿನ 300-ಸಾಲಿನ ಮುಖವಾಡದ ಲಾಗ್ ಉದಾಹರಣೆಯಲ್ಲಿ ಮರುಕಳಿಸುವ ದೋಷ ನಮೂನೆಗಳು ಮತ್ತು ಸಮಯದ ತೀವ್ರತೆಯನ್ನು ಹುಡುಕಿ; ಹೆಚ್ಚಿನ ಸಂಭವನೀಯ ಮೂಲ ಕಾರಣ ಮತ್ತು ನಾನು ಪರಿಶೀಲಿಸಲು ಮೆಟ್ರಿಕ್ಗಳನ್ನು ನನಗೆ ತಿಳಿಸಿ. ನಾನು ಟೋಕನ್ಗಳನ್ನು <REDACTED> ಮಾಡಿದ್ದೇನೆ."
ವ್ಯತ್ಯಾಸ: ಎರಡನೇ ಪ್ರಾಂಪ್ಟ್ ಮುಖವಾಡದ ಮತ್ತು ಕೇಂದ್ರೀಕೃತ ಉದಾಹರಣೆಯನ್ನು ನೀಡುತ್ತದೆ, ಸ್ಪಷ್ಟವಾದ ವಿಶ್ಲೇಷಣೆ ಔಟ್ಪುಟ್ಗಾಗಿ ಕೇಳುತ್ತದೆ; ಇದು ಸುರಕ್ಷಿತ ಮತ್ತು ಉಪಯುಕ್ತ ಎರಡೂ ಆಗಿದೆ.
ಸಾಮಾನ್ಯ ತಪ್ಪುಗಳು
- ಲಾಗ್ ಅನ್ನು ಮರೆಮಾಚದೆ AI ಗೆ ಅಂಟಿಸುವುದು. ಅತ್ಯಂತ ಸಾಮಾನ್ಯವಾದ ರಹಸ್ಯ/ವೈಯಕ್ತಿಕ ಡೇಟಾ ಸೋರಿಕೆ.
- ಪ್ರತಿಯೊಂದಕ್ಕೂ ಅಲಾರಂಗಳನ್ನು ಹೊಂದಿಸಲಾಗುತ್ತಿದೆ. ಅಲಾರಾಂ ಆಯಾಸವು ನಿಜವಾದ ಎಚ್ಚರಿಕೆಯನ್ನು ಸಮಾಧಿ ಮಾಡುತ್ತದೆ.
- ಕ್ರಿಯಾಶೀಲವಲ್ಲದ ಎಚ್ಚರಿಕೆ. ಯಾರೂ ಏನೂ ಮಾಡಲು ಸಾಧ್ಯವಿಲ್ಲ ಎಂಬ ಎಚ್ಚರಿಕೆಯ ಶಬ್ದ.
- ಪ್ರಶ್ನೆಯಿಲ್ಲದೆ AI ಯ ಮಿತಿಯನ್ನು ಒಪ್ಪಿಕೊಳ್ಳುವುದು. ನಿಮ್ಮ ಸಿಸ್ಟಂನ ಇತಿಹಾಸದ ಪ್ರಕಾರ ಮಿತಿಯನ್ನು ಹೊಂದಿಸಬೇಕು.
- ಕೇವಲ ಮೆಟ್ರಿಕ್ ನೋಡುತ್ತಿದ್ದೇನೆ. ಲಾಗ್ ಮತ್ತು ಜಾಡಿನ ಇಲ್ಲದೆ, ಮೂಲ ಕಾರಣವನ್ನು ಹೆಚ್ಚಾಗಿ ಕಂಡುಹಿಡಿಯಲಾಗುವುದಿಲ್ಲ.
- ಅಲಾರಾಂ ಸಮಯವನ್ನು ಹೊಂದಿಸುತ್ತಿಲ್ಲ (ಇದಕ್ಕಾಗಿ). ಕ್ಷಣಿಕ ಏರಿಳಿತಗಳು ತಪ್ಪು ಎಚ್ಚರಿಕೆಗಳನ್ನು ಉಂಟುಮಾಡುತ್ತವೆ.
ಸಾರಾಂಶದಲ್ಲಿ
ವೀಕ್ಷಣೆ; ಮೆಟ್ರಿಕ್ಗಳು, ಲಾಗ್ಗಳು ಮತ್ತು ಕುರುಹುಗಳೊಂದಿಗೆ ಹೊರಗಿನಿಂದ ಸಿಸ್ಟಮ್ನ ಒಳಭಾಗವನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವ ಸಾಮರ್ಥ್ಯ ಇದು. ನಾಲ್ಕು ಗೋಲ್ಡನ್ ಸಿಗ್ನಲ್ಗಳು (ಸುಪ್ತತೆ, ಸಂಚಾರ, ದೋಷ, ಶುದ್ಧತ್ವ) ಹೆಚ್ಚಿನ ಸೇವೆಗಳ ಆರೋಗ್ಯವನ್ನು ಸಾರಾಂಶಗೊಳಿಸುತ್ತವೆ. PromQL ಪ್ರಶ್ನೆಗಳು, ಎಚ್ಚರಿಕೆಯ ನಿಯಮಗಳು ಮತ್ತು ಡ್ಯಾಶ್ಬೋರ್ಡ್ಗಳನ್ನು ಬರೆಯುವಲ್ಲಿ ಮತ್ತು ಲಾಗ್ಗಳ ದೊಡ್ಡ ತುಂಡುಗಳನ್ನು ಸಂಕ್ಷೇಪಿಸುವಲ್ಲಿ ಮತ್ತು ವೈಪರೀತ್ಯಗಳನ್ನು ಕಂಡುಹಿಡಿಯುವಲ್ಲಿ AI ಅತ್ಯಂತ ಶಕ್ತಿಶಾಲಿಯಾಗಿದೆ. ಆದರೆ ನಿಮ್ಮ ಸ್ವಂತ ಸಿಸ್ಟಂನ ಇತಿಹಾಸದ ವಿರುದ್ಧ ಎಚ್ಚರಿಕೆಯ ಮಿತಿಗಳನ್ನು ಪರಿಶೀಲಿಸುವುದು, ಅಲಾರಮ್ಗಳನ್ನು ಕ್ರಿಯೆ-ಆಧಾರಿತವಾಗಿರಿಸುವುದು ಮತ್ತು ಅವುಗಳನ್ನು ಮರೆಮಾಚದೆ ಲಾಗ್ಗಳನ್ನು ಎಂದಿಗೂ ಹಂಚಿಕೊಳ್ಳದಿರುವುದು ನಿಮ್ಮ ಜವಾಬ್ದಾರಿಯಾಗಿದೆ.
ಅಪ್ಲಿಕೇಶನ್ ಕಾರ್ಯ
ಸೇವೆಗಾಗಿ (ಅಥವಾ ಮಾದರಿ ಸೇವೆ): (1) "ಅಲಾರ್ಮ್ ನಿಯಮ ರಚನೆ" ಟೆಂಪ್ಲೇಟ್ನೊಂದಿಗೆ ದೋಷ ದರಕ್ಕಾಗಿ ಎಚ್ಚರಿಕೆಯ ನಿಯಮವನ್ನು ರಚಿಸಿ ಮತ್ತು ಸೂಚಿಸಲಾದ ಮಿತಿಯನ್ನು "ಹಿಂದೆ ಎಷ್ಟು ಬಾರಿ ಪ್ರಚೋದಿಸಿದೆ?" ಪ್ರಶ್ನೆಯೊಂದಿಗೆ ಅದನ್ನು ಪರೀಕ್ಷಿಸಿ; (2) ನೀವು ಹೊಂದಿರುವ ಲಾಗ್ ಮಾದರಿಯನ್ನು ಮಾಸ್ಕ್ ಮಾಡಿ ಮತ್ತು ಅದನ್ನು "ಲಾಗ್ ಸಾರಾಂಶ" ಟೆಂಪ್ಲೇಟ್ನೊಂದಿಗೆ ವಿಶ್ಲೇಷಿಸಿ; (3) ಹೆಚ್ಚು ಸಂಭವನೀಯ ಮೂಲ ಕಾರಣವನ್ನು ಖಚಿತಪಡಿಸಲು ನೀವು ಯಾವ ಮೆಟ್ರಿಕ್ ಅನ್ನು ನೋಡುತ್ತೀರಿ ಎಂಬುದನ್ನು ಗಮನಿಸಿ.
ಪರಿಶೀಲನಾಪಟ್ಟಿ
- [ ] ನಾನು ನಾಲ್ಕು ಗೋಲ್ಡನ್ ಸಿಗ್ನಲ್ಗಳ ಆಧಾರದ ಮೇಲೆ ಟ್ರ್ಯಾಕ್ ಮಾಡಲು ಮೆಟ್ರಿಕ್ಗಳನ್ನು ಆರಿಸಿದೆ.
- [ ] ನಾನು ಸೂಕ್ಷ್ಮ ಪ್ರದೇಶಗಳ ವಿಷಯದಲ್ಲಿ AI ಗೆ ನೀಡಿದ ಎಲ್ಲಾ ಲಾಗ್ಗಳನ್ನು ಮರೆಮಾಡಿದೆ.
- [ ] ಪ್ರತಿ ಅಲಾರಾಂ ಕ್ರಿಯಾ-ಆಧಾರಿತ ಮತ್ತು ಸರಿಯಾದ ತುರ್ತು ಎಂದು ನಾನು ಪರಿಶೀಲಿಸಿದ್ದೇನೆ.
- [ ] ನನ್ನ ಸಿಸ್ಟಂನ ಐತಿಹಾಸಿಕ ಡೇಟಾದ ವಿರುದ್ಧ ನಾನು ಎಚ್ಚರಿಕೆಯ ಮಿತಿಗಳನ್ನು ಪರೀಕ್ಷಿಸಿದೆ.
- [ ] ನಾನು ಅಲಾರಮ್ಗಳಿಗೆ (ಅವಧಿ) ಸೇರಿಸುವ ಮೂಲಕ ತತ್ಕ್ಷಣದ ಏರಿಳಿತಗಳನ್ನು ಫಿಲ್ಟರ್ ಮಾಡಿದ್ದೇನೆ.
- [ ] ನಾನು ಮೂಲ ಕಾರಣಕ್ಕಾಗಿ ಮೆಟ್ರಿಕ್ + ಲಾಗ್ + ಟ್ರೇಸ್ ಅನ್ನು ಒಟ್ಟಿಗೆ ಬಳಸಿದ್ದೇನೆ.