ਲਾਭ:
- ਨਿਰੀਖਣਯੋਗਤਾ ਦੇ ਤਿੰਨ ਥੰਮ੍ਹਾਂ (ਮੈਟ੍ਰਿਕ, ਲੌਗ, ਟਰੇਸ) ਅਤੇ ਚਾਰ ਸੁਨਹਿਰੀ ਸਿਗਨਲਾਂ ਨੂੰ ਸਮਝਣ ਦੀ ਸਮਰੱਥਾ ਅਤੇ ਨਕਲੀ ਬੁੱਧੀ ਨਾਲ ਪ੍ਰੋਮਕਿਊਐਲ ਸਵਾਲ, ਅਲਾਰਮ ਨਿਯਮ ਅਤੇ ਡੈਸ਼ਬੋਰਡ ਤਿਆਰ ਕੀਤੇ ਗਏ ਹਨ।
- ਅਲਾਰਮ ਨੂੰ ਐਕਸ਼ਨ-ਓਰੀਐਂਟਿਡ ਰੱਖ ਕੇ ਅਤੇ ਸਹੀ ਫੌਰੀ ਤੌਰ 'ਤੇ ਅਤੇ ਤੁਹਾਡੇ ਆਪਣੇ ਸਿਸਟਮ ਦੇ ਇਤਿਹਾਸਕ ਡੇਟਾ ਦੇ ਵਿਰੁੱਧ ਥ੍ਰੈਸ਼ਹੋਲਡ ਦੀ ਜਾਂਚ ਕਰਕੇ ਅਲਾਰਮ ਥਕਾਵਟ ਨੂੰ ਰੋਕਣ ਦੀ ਸਮਰੱਥਾ
- ਨਕਲੀ ਬੁੱਧੀ ਨੂੰ ਲੌਗ ਦੇਣ ਤੋਂ ਪਹਿਲਾਂ ਸੰਵੇਦਨਸ਼ੀਲ ਖੇਤਰਾਂ ਨੂੰ ਮਾਸਕ ਕਰਕੇ ਗੋਪਨੀਯਤਾ ਅਤੇ ਗੁਪਤ ਲੀਕ ਨੂੰ ਰੋਕਣ ਦੀ ਸਮਰੱਥਾ
ਜਦੋਂ ਕੋਈ ਸਿਸਟਮ ਕੰਮ ਕਰਦਾ ਜਾਪਦਾ ਹੈ, ਇਹ ਅੰਦਰੋਂ ਮਰ ਰਿਹਾ ਹੋ ਸਕਦਾ ਹੈ: ਮੈਮੋਰੀ ਹੌਲੀ-ਹੌਲੀ ਭਰ ਰਹੀ ਹੈ, ਪ੍ਰਤੀਕਿਰਿਆ ਦੇ ਸਮੇਂ ਵਧ ਰਹੇ ਹਨ, ਗਲਤੀ ਦਰ ਵਧ ਰਹੀ ਹੈ। ਇਸ ਨੂੰ ਨੋਟਿਸ ਕਰਨ ਦਾ ਇੱਕੋ ਇੱਕ ਤਰੀਕਾ ਹੈ ਸਿਸਟਮ ਦੀ ਨਿਰੰਤਰ ਨਿਗਰਾਨੀ ਕਰਨਾ। ਇੱਕ ਹੋਰ ਉੱਨਤ ਧਾਰਨਾ ਨਿਰੀਖਣਯੋਗਤਾ ਹੈ: ਇਸਦੇ ਬਾਹਰੀ ਸੰਕੇਤਾਂ ਨੂੰ ਦੇਖ ਕੇ ਸਿਸਟਮ ਦੇ ਅੰਦਰ ਕੀ ਹੋ ਰਿਹਾ ਹੈ ਇਹ ਸਮਝਣ ਦੀ ਯੋਗਤਾ। ਨਿਰੀਖਣਯੋਗਤਾ ਦੇ ਤਿੰਨ ਥੰਮ੍ਹ ਹਨ, ਅਤੇ DevOps ਪੇਸ਼ੇਵਰ ਤਿੰਨਾਂ ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹਨ:
- ਮੈਟ੍ਰਿਕ: ਸਮੇਂ ਦੇ ਨਾਲ ਮਾਪਿਆ ਗਿਆ ਸੰਖਿਆਤਮਕ ਮੁੱਲ — CPU ਵਰਤੋਂ, ਬੇਨਤੀਆਂ ਦੀ ਗਿਣਤੀ, ਜਵਾਬ ਸਮਾਂ, ਗਲਤੀ ਦਰ। "ਕਿੰਨੇ ਹੋਏ?" ਸਵਾਲ ਦਾ ਜਵਾਬ ਦਿੰਦਾ ਹੈ।
- ਲੌਗ: ਸਿਸਟਮ ਦੁਆਰਾ ਤਿਆਰ ਕੀਤੇ ਟੈਕਸਟ ਇਵੈਂਟ ਰਿਕਾਰਡ—"ਉਪਭੋਗਤਾ ਲੌਗ ਇਨ", "ਡਾਟਾਬੇਸ ਕੁਨੈਕਸ਼ਨ ਗੁਆਚ ਗਿਆ"। "ਕੀ ਹੋਇਆ?" ਸਵਾਲ ਦਾ ਜਵਾਬ ਦਿੰਦਾ ਹੈ।
- ਟਰੇਸ: ਸਿਸਟਮ ਦੇ ਅੰਦਰ ਸੇਵਾ ਤੋਂ ਸੇਵਾ ਤੱਕ ਲੰਘਣ ਦੌਰਾਨ ਬੇਨਤੀ ਦਾ ਮਾਰਗ ਅਤੇ ਹਰੇਕ ਪੜਾਅ ਦੀ ਮਿਆਦ। “ਮੰਦੀ ਕਿੱਥੇ ਹੈ?” ਸਵਾਲ ਦਾ ਜਵਾਬ ਦਿੰਦਾ ਹੈ।
ਸਭ ਤੋਂ ਆਮ ਟੂਲ: ਮੈਟ੍ਰਿਕਸ ਲਈ ਪ੍ਰੋਮੀਥੀਅਸ, ਵਿਜ਼ੂਅਲਾਈਜ਼ੇਸ਼ਨ ਲਈ ਗ੍ਰਾਫਾਨਾ, ਲੌਗ ਲਈ ਲੋਕੀ/ਈਐਲਕੇ, ਟਰੇਸ ਲਈ ਜੈਗਰ/ਓਪਨ ਟੈਲੀਮੈਟਰੀ। AI ਇਹਨਾਂ ਸਾਧਨਾਂ ਲਈ ਪੁੱਛਗਿੱਛ ਭਾਸ਼ਾਵਾਂ (ਖਾਸ ਕਰਕੇ ਪ੍ਰੋਮੀਥੀਅਸ 'ਪ੍ਰੋਮਕਿਯੂਐਲ), ਅਲਾਰਮ ਨਿਯਮ, ਅਤੇ ਡੈਸ਼ਬੋਰਡ ਕੌਂਫਿਗਰੇਸ਼ਨਾਂ ਨੂੰ ਲਿਖਣ ਵਿੱਚ ਬਹੁਤ ਹੁਨਰਮੰਦ ਹੈ। ਇਹ ਉਹ ਥਾਂ ਵੀ ਹੈ ਜਿੱਥੇ AI ਸਭ ਤੋਂ ਮਜ਼ਬੂਤ ਹੈ: ਲੌਗਸ ਅਤੇ ਮੈਟ੍ਰਿਕਸ ਦੇ ਵੱਡੇ ਹਿੱਸਿਆਂ ਦਾ ਸਾਰ ਦੇਣਾ ਅਤੇ ਗੜਬੜੀਆਂ ਨੂੰ ਫਲੈਗ ਕਰਨਾ।
ਆਉ ਇੱਕ ਵਾਕ ਵਿੱਚ ਨਿਗਰਾਨੀ ਅਤੇ ਨਿਰੀਖਣਯੋਗਤਾ ਵਿੱਚ ਅੰਤਰ ਨੂੰ ਸਪੱਸ਼ਟ ਕਰੀਏ: ਨਿਗਰਾਨੀ ਉਹ ਸਵਾਲ ਪੁੱਛ ਰਹੀ ਹੈ ਜੋ ਤੁਸੀਂ ਪਹਿਲਾਂ ਹੀ ਜਾਣਦੇ ਹੋ ("ਕੀ CPU 90% ਤੋਂ ਵੱਧ ਹੈ?"); ਨਿਰੀਖਣਯੋਗਤਾ ਉਹਨਾਂ ਸਵਾਲਾਂ ਨੂੰ ਪੁੱਛਣ ਦੇ ਯੋਗ ਹੋਣਾ ਹੈ ਜੋ ਤੁਸੀਂ ਪਹਿਲਾਂ ਤੋਂ ਨਹੀਂ ਜਾਣਦੇ ਸੀ ("ਇਹ ਅਜੀਬ ਸੁਸਤੀ ਸਿਰਫ਼ ਇੱਕ ਨਿਸ਼ਚਿਤ ਸਮੇਂ 'ਤੇ ਇੱਕ ਖਾਸ ਗਾਹਕ ਲਈ ਕਿਉਂ ਹੋ ਰਹੀ ਹੈ?")। ਆਧੁਨਿਕ ਪ੍ਰਣਾਲੀਆਂ ਇੰਨੀਆਂ ਗੁੰਝਲਦਾਰ ਹਨ ਕਿ ਤੁਸੀਂ ਅਸਫਲਤਾ ਦੇ ਸਾਰੇ ਢੰਗਾਂ ਦੀ ਭਵਿੱਖਬਾਣੀ ਨਹੀਂ ਕਰ ਸਕਦੇ; ਇਸ ਲਈ, ਅਮੀਰ ਮੈਟ੍ਰਿਕਸ, ਲੌਗਸ ਅਤੇ ਟਰੇਸ ਨੂੰ ਇਕੱਠਾ ਕਰਨ ਅਤੇ ਫਿਰ ਉਹਨਾਂ ਨੂੰ ਡੂੰਘਾਈ ਵਿੱਚ ਪੁੱਛਣ ਦੀ ਯੋਗਤਾ - ਯਾਨੀ, ਨਿਰੀਖਣਯੋਗਤਾ - ਮਹੱਤਵਪੂਰਨ ਬਣ ਜਾਂਦੀ ਹੈ। ਇਹ ਉਹ ਥਾਂ ਹੈ ਜਿੱਥੇ "ਪਹਿਲਾਂ ਅਣਜਾਣ ਸਵਾਲ" ਦਾ ਜਵਾਬ ਦੇਣ ਵੇਲੇ AI ਖੇਡ ਵਿੱਚ ਆਉਂਦਾ ਹੈ: ਇਹ ਤੁਹਾਡੇ ਕੋਲ ਮੌਜੂਦ ਕੱਚੇ ਡੇਟਾ ਨੂੰ ਤੇਜ਼ੀ ਨਾਲ ਸਕੈਨ ਕਰਦਾ ਹੈ, ਪੈਟਰਨਾਂ ਅਤੇ ਅਸੰਗਤੀਆਂ ਦਾ ਸੁਝਾਅ ਦਿੰਦਾ ਹੈ, ਅਤੇ ਤੁਸੀਂ ਇਹਨਾਂ ਸੁਰਾਗਾਂ ਦੀ ਪੁਸ਼ਟੀ ਕਰਕੇ ਮੂਲ ਕਾਰਨ ਤੱਕ ਪਹੁੰਚ ਜਾਂਦੇ ਹੋ।
ਕਦਮ ਦਰ ਕਦਮ: ਕੀ ਅਤੇ ਕਿਵੇਂ ਨਿਗਰਾਨੀ ਕਰਨੀ ਹੈ?
- ਸਹੀ ਮੈਟ੍ਰਿਕਸ ਚੁਣੋ। ਉਦਯੋਗ ਵਿੱਚ, "ਚਾਰ ਸੁਨਹਿਰੀ ਸਿਗਨਲ" ਨੂੰ ਆਧਾਰ ਵਜੋਂ ਲਿਆ ਜਾਂਦਾ ਹੈ: ਲੇਟੈਂਸੀ, ਟ੍ਰੈਫਿਕ, ਤਰੁੱਟੀਆਂ, ਸੰਤ੍ਰਿਪਤਾ — ਸਰੋਤ ਕਿੰਨਾ ਭਰਿਆ ਹੋਇਆ ਹੈ। ਇਹ ਜ਼ਿਆਦਾਤਰ ਸੇਵਾਵਾਂ ਦੀ ਸਿਹਤ ਦਾ ਸਾਰ ਦਿੰਦੇ ਹਨ।
- ਮੈਟ੍ਰਿਕਸ ਇਕੱਠੇ ਕਰੋ। ਐਪਲੀਕੇਸ਼ਨ ਨੂੰ ਇੱਕ ਅੰਤਮ ਬਿੰਦੂ ਪੇਸ਼ ਕਰਨ ਦਿਓ ਜੋ ਪ੍ਰੋਮੀਥੀਅਸ ਪੜ੍ਹ ਸਕਦਾ ਹੈ।
- ਡੈਸ਼ਬੋਰਡ ਸੈਟ ਅਪ ਕਰੋ। ਗ੍ਰਾਫਾਨਾ ਵਿੱਚ ਇਹਨਾਂ ਮੈਟ੍ਰਿਕਸ ਦੀ ਕਲਪਨਾ ਕਰੋ।
- ਅਲਾਰਮ ਨਿਯਮ ਲਿਖੋ। ਕਿਸ ਨੂੰ ਚੇਤਾਵਨੀ ਦਿੱਤੀ ਜਾਵੇਗੀ ਜਦੋਂ ਇੱਕ ਸੀਮਾ ਪਾਰ ਕੀਤੀ ਜਾਂਦੀ ਹੈ ਅਤੇ ਕਿਵੇਂ?
- ਲੌਗਾਂ ਨੂੰ ਕੇਂਦਰਿਤ ਕਰੋ। ਸਾਰੇ ਸੇਵਾ ਲੌਗਾਂ ਨੂੰ ਇੱਕ ਥਾਂ 'ਤੇ ਖੋਜਣਯੋਗ ਬਣਾਓ।
- ਰੌਲਾ ਘਟਾਓ। ਬਹੁਤ ਜ਼ਿਆਦਾ ਅਲਾਰਮ "ਸੁਚੇਤ ਥਕਾਵਟ" ਪੈਦਾ ਕਰਦਾ ਹੈ; ਮਹੱਤਵਪੂਰਨ ਅਲਾਰਮ ਅਲੋਪ ਹੋ ਜਾਂਦਾ ਹੈ।
ਸੰਕੇਤ: ਇੱਕ ਚੰਗਾ ਅਲਾਰਮ ਦੋ ਚੀਜ਼ਾਂ ਨੂੰ ਪੂਰਾ ਕਰਦਾ ਹੈ: ਇਹ ਕਾਰਵਾਈ ਕਰਨ ਯੋਗ ਹੈ ਅਤੇ ਸਹੀ ਜ਼ਰੂਰੀ ਹੈ। ਇੱਕ ਅਲਾਰਮ ਜੋ ਕਿਸੇ ਨੂੰ ਸਵੇਰੇ 3 ਵਜੇ ਜਗਾਉਂਦਾ ਹੈ ਉਹ ਅਜਿਹਾ ਹੋਣਾ ਚਾਹੀਦਾ ਹੈ ਜਿਸ ਲਈ ਅਸਲ ਵਿੱਚ ਰਾਤ ਦੇ ਸਮੇਂ ਦੇ ਦਖਲ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ। ਕਿਸੇ ਨੂੰ ਵੀ ਅਜਿਹੀ ਚੀਜ਼ ਲਈ ਨਾ ਜਗਾਓ ਜਿਸ ਲਈ ਆਪਣੇ ਆਪ ਕਾਰਵਾਈ ਦੀ ਲੋੜ ਨਾ ਹੋਵੇ, ਜਿਵੇਂ ਕਿ "CPU 70%"; ਇਸ ਨੂੰ ਬੋਰਡ 'ਤੇ ਪ੍ਰਦਰਸ਼ਿਤ ਕਰੋ।
ਅਲਾਰਮ ਨਿਯਮ ਕਿਵੇਂ ਲਿਖਣਾ ਹੈ?
ਇੱਕ ਚੇਤਾਵਨੀ ਵਿੱਚ ਤਿੰਨ ਭਾਗ ਹੁੰਦੇ ਹਨ: ਸਥਿਤੀ (ਕਿਹੜੀ ਮੀਟ੍ਰਿਕ ਕਿਸ ਥ੍ਰੈਸ਼ਹੋਲਡ ਤੋਂ ਵੱਧ ਜਾਂਦੀ ਹੈ ਅਤੇ ਕਿੰਨੀ ਦੇਰ ਲਈ), ਮਿਆਦ ("5 ਮਿੰਟਾਂ ਲਈ" ਪਲ-ਪਲ ਉਤਰਾਅ-ਚੜ੍ਹਾਅ ਤੋਂ ਬਚਣ ਲਈ), ਅਤੇ ਮਹੱਤਵ/ਕਿਰਿਆ (ਜਿਸ ਨੂੰ, ਕਿਸ ਚੈਨਲ ਰਾਹੀਂ)। AI ਇਹਨਾਂ ਤਿੰਨਾਂ ਨੂੰ ਸਹੀ ਸੰਦਰਭ ਨਾਲ ਨਿਪੁੰਨਤਾ ਨਾਲ ਸਥਾਪਿਤ ਕਰਦਾ ਹੈ। ਉਦਾਹਰਨ ਲਈ, "ਨਾਜ਼ੁਕ ਅਲਾਰਮ ਜੇ ਗਲਤੀ ਦੀ ਦਰ 5 ਮਿੰਟਾਂ ਲਈ 5% ਤੋਂ ਵੱਧ ਜਾਂਦੀ ਹੈ" ਵਰਗੇ ਨਿਯਮ ਦਾ PromQL ਵਿੱਚ ਅਨੁਵਾਦ ਕਰਨਾ AI ਲਈ ਇੱਕ ਸਪਲਿਟ-ਸੈਕੰਡ ਕਾਰਜ ਹੈ — ਪਰ ਤੁਸੀਂ ਫੈਸਲਾ ਕਰਦੇ ਹੋ ਕਿ ਕੀ ਥ੍ਰੈਸ਼ਹੋਲਡ ਤੁਹਾਡੇ ਸਿਸਟਮ ਲਈ ਸਹੀ ਹੈ।
ਸਾਵਧਾਨ: AI ਦੁਆਰਾ ਸੁਝਾਏ ਗਏ ਅਲਾਰਮ ਥ੍ਰੈਸ਼ਹੋਲਡ ਆਮ ਧਾਰਨਾਵਾਂ ਹਨ। ਤੁਹਾਡੇ ਸਿਸਟਮ ਦਾ ਆਮ ਲੋਡ, ਸਹਿਣਸ਼ੀਲਤਾ ਅਤੇ ਕੰਮ ਦਾ ਪ੍ਰਭਾਵ ਵੱਖਰਾ ਹੈ। ਇਸ ਤੋਂ ਪਹਿਲਾਂ ਕਿ ਤੁਸੀਂ ਇੱਕ ਥ੍ਰੈਸ਼ਹੋਲਡ ਨੂੰ ਸਿੱਧੇ ਉਤਪਾਦ ਵਿੱਚ ਪਾਉਂਦੇ ਹੋ, ਤੁਸੀਂ ਆਪਣੇ ਇਤਿਹਾਸਕ ਡੇਟਾ ਨੂੰ ਦੇਖਦੇ ਹੋ ਅਤੇ ਪੁੱਛਦੇ ਹੋ ਕਿ "ਅਤੀਤ ਵਿੱਚ ਇਹ ਥ੍ਰੈਸ਼ਹੋਲਡ ਕਿੰਨੀ ਵਾਰ ਸ਼ੁਰੂ ਹੋਇਆ ਹੈ, ਇਹਨਾਂ ਵਿੱਚੋਂ ਕਿੰਨੀਆਂ ਅਸਲ ਸਮੱਸਿਆਵਾਂ ਸਨ?" ਸਵਾਲ ਦਾ ਜਵਾਬ ਦਿਓ।
ਲੌਗ ਗੋਪਨੀਯਤਾ: ਨਾਜ਼ੁਕ ਚੇਤਾਵਨੀ
ਲੌਗਸ ਲੀਕ ਦੇ ਸਭ ਤੋਂ ਵੱਧ ਅਕਸਰ ਨਜ਼ਰਅੰਦਾਜ਼ ਕੀਤੇ ਜਾਂਦੇ ਸਰੋਤ ਹਨ। ਇੱਕ ਲੌਗ ਲਾਈਨ ਵਿੱਚ ਗਲਤੀ ਨਾਲ ਇੱਕ ਪਾਸਵਰਡ, ਇੱਕ ਕ੍ਰੈਡਿਟ ਕਾਰਡ ਨੰਬਰ, ਜਾਂ ਨਿੱਜੀ ਡੇਟਾ (KVKK/GDPR ਅਧੀਨ) ਹੋ ਸਕਦਾ ਹੈ। ਵਿਸ਼ਲੇਸ਼ਣ ਲਈ AI ਵਿੱਚ ਲੌਗ ਪੇਸਟ ਕਰਦੇ ਸਮੇਂ:
- ਸੰਵੇਦਨਸ਼ੀਲ ਖੇਤਰਾਂ ਨੂੰ ਮਾਸਕ ਕਰੋ। ਮੁੱਲਾਂ ਜਿਵੇਂ ਕਿ ਟੋਕਨ, ਪਾਸਵਰਡ, ਈਮੇਲ, ID ਨੰਬਰ ਨੂੰ <REDACTED> ਨਾਲ ਬਦਲੋ।
- ਉਦਾਹਰਣਾਂ ਦਿਓ, ਸਾਰੀਆਂ ਨਹੀਂ। ਇੱਕ ਮਿਲੀਅਨ ਲਾਈਨਾਂ ਦੀ ਬਜਾਏ, ਕੁਝ ਸੌ ਪ੍ਰਤੀਨਿਧ ਲਾਈਨਾਂ ਅਕਸਰ ਕਾਫ਼ੀ ਹੁੰਦੀਆਂ ਹਨ।
- ਸੰਸਥਾ ਦੁਆਰਾ ਪ੍ਰਵਾਨਿਤ ਵਾਹਨ ਚੁਣੋ। ਖਾਸ ਤੌਰ 'ਤੇ ਉਤਪਾਦਨ ਲੌਗਸ ਲਈ, ਇੱਕ ਟੂਲ ਦੀ ਵਰਤੋਂ ਕਰੋ ਜਿਸਦਾ ਡੇਟਾ ਸਿਖਲਾਈ ਲਈ ਨਹੀਂ ਜਾਂਦਾ ਹੈ.
ਚਾਰ ਸੁਨਹਿਰੀ ਸਿਗਨਲ ਅਤੇ ਅਲਾਰਮ ਟੇਬਲ
ਸਿਗਨਲ
ਦੁਆਰਾ ਮਾਪਿਆ ਗਿਆ
ਉਦਾਹਰਨ ਅਲਾਰਮ ਥ੍ਰੈਸ਼ਹੋਲਡ
ਜ਼ਰੂਰੀ
ਲੇਟੈਂਸੀ
ਜਵਾਬ ਸਮਾਂ
p95 > 800 ms, 5 ਮਿੰਟ
ਉੱਚ
ਆਵਾਜਾਈ
ਬੇਨਤੀ/ਸੈਕਿੰਡ
ਅਚਾਨਕ 300% ਵਾਧਾ/ਘਟਣਾ
ਮੱਧਮ
ਗਲਤੀ
ਅਸਫਲ ਬੇਨਤੀ ਦਰ
> 5%, 5 ਮਿੰਟ
ਨਾਜ਼ੁਕ
ਸੰਤ੍ਰਿਪਤਾ
ਸਰੋਤ ਦਾ ਕਬਜ਼ਾ
ਡਿਸਕ > 85%
ਉੱਚ
ਤਿੰਨ ਛੋਟੇ ਕੇਸ
ਕੇਸ 1 - 30 ਸਕਿੰਟਾਂ ਵਿੱਚ ਸੰਖੇਪ ਵਿੱਚ ਲੌਗ ਦੀਆਂ 400 ਲਾਈਨਾਂ। ਇੱਕ ਸੇਵਾ ਹੌਲੀ ਹੋ ਗਈ ਸੀ। ਇੰਜੀਨੀਅਰ ਨੇ AI ਨੂੰ ਲੌਗ ਦੀਆਂ 400 ਲਾਈਨਾਂ ਮਾਸਕ ਦਿੱਤੀਆਂ ਅਤੇ ਕਿਹਾ, "ਆਵਰਤੀ ਗਲਤੀ ਪੈਟਰਨ ਅਤੇ ਸਮੇਂ ਦੀ ਤੀਬਰਤਾ ਦਾ ਸੰਖੇਪ ਕਰੋ।" AI ਨੇ ਦਿਖਾਇਆ ਕਿ ਇੱਕ ਖਾਸ ਬਾਹਰੀ API ਕਾਲ ਹਰ 30 ਸਕਿੰਟਾਂ ਵਿੱਚ ਖਤਮ ਹੁੰਦੀ ਹੈ। 30 ਸਕਿੰਟਾਂ ਵਿੱਚ ਜੜ੍ਹ ਕਾਰਨ ਲੱਭਿਆ; ਲੌਗਸ ਨੂੰ ਹੱਥੀਂ ਸਕੈਨ ਕਰਨ ਵਿੱਚ ਅੱਧਾ ਘੰਟਾ ਲੱਗੇਗਾ।
ਕੇਸ 2 - ਅਲਾਰਮ ਥਕਾਵਟ ਦਾ ਹੱਲ. ਇੱਕ ਟੀਮ ਇੱਕ ਦਿਨ ਵਿੱਚ 200 ਅਲਾਰਮ ਪ੍ਰਾਪਤ ਕਰ ਰਹੀ ਸੀ ਅਤੇ ਉਹਨਾਂ ਸਾਰਿਆਂ ਨੂੰ ਨਜ਼ਰਅੰਦਾਜ਼ ਕਰ ਰਹੀ ਸੀ - ਜਦੋਂ ਤੱਕ ਇੱਕ ਅਸਲ ਆਊਟੇਜ ਅਲਾਰਮ ਨੂੰ ਵੀ ਨਜ਼ਰਅੰਦਾਜ਼ ਨਹੀਂ ਕੀਤਾ ਜਾਂਦਾ ਸੀ। AI ਨੂੰ ਸਾਰੇ ਚੇਤਾਵਨੀ ਨਿਯਮ ਦਿਓ ਅਤੇ ਪੁੱਛੋ ਕਿ "ਕਿਹੜੇ ਕਾਰਵਾਈਯੋਗ ਨਹੀਂ ਹਨ ਅਤੇ ਕਿਨ੍ਹਾਂ ਨੂੰ ਜੋੜਿਆ ਜਾ ਸਕਦਾ ਹੈ?" ਉਹਨਾਂ ਨੇ ਪੁੱਛਿਆ। ਅਲਾਰਮ ਦੀ ਗਿਣਤੀ ਪ੍ਰਤੀ ਦਿਨ 12 ਤੱਕ ਘਟ ਗਈ; ਹਰ ਅਲਾਰਮ ਨੂੰ ਹੁਣ ਗੰਭੀਰਤਾ ਨਾਲ ਲਿਆ ਗਿਆ ਸੀ.
ਕੇਸ 3 - ਗਲਤ ਥ੍ਰੈਸ਼ਹੋਲਡ ਜਲਦੀ ਫੜਿਆ ਗਿਆ। YZ ਨੇ ਡਿਸਕ ਲਈ "95% ਭਰ ਜਾਣ 'ਤੇ ਚੇਤਾਵਨੀ ਦਿਓ" ਦਾ ਸੁਝਾਅ ਦਿੱਤਾ। ਇੰਜੀਨੀਅਰ ਨੇ ਇਤਿਹਾਸਕ ਡੇਟਾ ਨੂੰ ਦੇਖਿਆ: ਇੱਕ ਵਾਰ ਡਿਸਕ 95% ਤੱਕ ਪਹੁੰਚ ਗਈ ਤਾਂ ਦਖਲਅੰਦਾਜ਼ੀ ਲਈ ਬਹੁਤ ਘੱਟ ਸਮਾਂ ਸੀ. ਇਸਨੇ ਥ੍ਰੈਸ਼ਹੋਲਡ ਨੂੰ 80% ਤੱਕ ਘਟਾ ਦਿੱਤਾ ਅਤੇ "ਵਿਕਾਸ ਦਰ" ਦੇ ਅਧਾਰ ਤੇ ਇੱਕ ਦੂਜਾ ਅਲਾਰਮ ਜੋੜਿਆ। ਤਸਦੀਕ ਨੇ ਇੱਕ ਅਸਲ ਅੱਧੀ ਰਾਤ ਆਊਟੇਜ ਨੂੰ ਰੋਕਿਆ।
ਚਾਰ ਕਾਪੀ ਕਰਨ ਯੋਗ ਟੈਂਪਲੇਟ
1) ਲੌਗ ਸੰਖੇਪ (ਮਾਸਕਡ):
ਹੇਠਾਂ ਲੌਗ ਉਦਾਹਰਨ ਦਾ ਵਿਸ਼ਲੇਸ਼ਣ ਕਰੋ (ਮੈਂ <REDACTED> ਨਾਲ ਸੰਵੇਦਨਸ਼ੀਲ ਮੁੱਲਾਂ ਨੂੰ ਮਾਸਕ ਕੀਤਾ ਹੈ)। ਮੈਨੂੰ ਦਿਓ: (1) ਆਵਰਤੀ ਗਲਤੀ ਪੈਟਰਨ, (2) ਸਮੇਂ ਦੇ ਨਾਲ ਇਕਾਗਰਤਾ, (3) ਸਭ ਤੋਂ ਸੰਭਾਵਿਤ ਮੂਲ ਕਾਰਨ, ਅਤੇ (4) 3 ਮੈਟ੍ਰਿਕਸ ਜੋ ਮੈਂ ਪੁਸ਼ਟੀ ਕਰਨ ਲਈ ਦੇਖਾਂਗਾ। ਲੌਗ: [LINES]
2) ਅਲਾਰਮ ਨਿਯਮ ਬਣਾਉਣਾ:
Prometheus/Alertmanager ਲਈ ਇੱਕ ਅਲਾਰਮ ਨਿਯਮ ਲਿਖੋ: [SEVERITY] ਅਲਾਰਮ ਪੈਦਾ ਕਰੋ ਜੇਕਰ [THRESHOLD] [METRIC][DURATION] ਤੋਂ ਵੱਧ ਹੈ। ਨਿਯਮ ਕਾਰਵਾਈ-ਅਧਾਰਿਤ ਹੋਣਾ ਚਾਹੀਦਾ ਹੈ ਅਤੇ ਇੱਕ ਐਨੋਟੇਸ਼ਨ ਅਤੇ ਰਨਬੁੱਕ ਲਿੰਕ ਖੇਤਰ ਸ਼ਾਮਲ ਕਰਨਾ ਚਾਹੀਦਾ ਹੈ। PromQL ਦੀ ਵਿਆਖਿਆ ਕਰੋ ਅਤੇ ਲਿਖੋ ਕਿ ਇਹ ਥ੍ਰੈਸ਼ਹੋਲਡ ਵਾਜਬ ਕਿਉਂ ਹੈ।
3) PromQL ਪੁੱਛਗਿੱਛ ਲਿਖਣਾ/ ਘੋਸ਼ਣਾ ਕਰਨਾ:
ਇੱਕ PromQL ਪੁੱਛਗਿੱਛ ਲਿਖੋ ਜੋ ਮਾਪਦੀ ਹੈ: [EX. ਪਿਛਲੇ 5 ਮਿੰਟਾਂ ਵਿੱਚ 5xx ਗਲਤੀ ਦਰ ਪ੍ਰਤੀਸ਼ਤ]। ਪੁੱਛਗਿੱਛ ਨੂੰ ਕਦਮ ਦਰ ਕਦਮ ਸਮਝਾਓ। ਫਿਰ ਮੈਨੂੰ ਦੱਸੋ ਕਿ ਇਸ ਮੁੱਲ ਲਈ ਸਿਹਤਮੰਦ ਰੇਂਜ ਕੀ ਹੋਣੀ ਚਾਹੀਦੀ ਹੈ।
4) ਡੈਸ਼ਬੋਰਡ ਡਿਜ਼ਾਈਨ:
[ਸੇਵਾ] ਲਈ ਇੱਕ ਗ੍ਰਾਫਾਨਾ ਡੈਸ਼ਬੋਰਡ ਡਿਜ਼ਾਈਨ ਕਰੋ: ਮੈਨੂੰ ਕਿਹੜੇ ਪੈਨਲਾਂ ਨਾਲ ਚਾਰ ਸੁਨਹਿਰੀ ਸਿਗਨਲ (ਲੇਟੈਂਸੀ, ਟ੍ਰੈਫਿਕ, ਗਲਤੀ, ਸੰਤ੍ਰਿਪਤਾ) ਪ੍ਰਦਰਸ਼ਿਤ ਕਰਨੇ ਚਾਹੀਦੇ ਹਨ? ਹਰੇਕ ਪੈਨਲ ਲਈ ਮੈਟ੍ਰਿਕ, ਵਿਜ਼ੂਅਲਾਈਜ਼ੇਸ਼ਨ ਕਿਸਮ ਅਤੇ ਵਾਜਬ ਥ੍ਰੈਸ਼ਹੋਲਡ ਦਾ ਸੁਝਾਅ ਦਿਓ। ਉਦੇਸ਼: 10 ਸਕਿੰਟਾਂ ਵਿੱਚ ਇੱਕ ਗਾਰਡ ਦੀ ਸਿਹਤ ਸਥਿਤੀ ਨੂੰ ਵੇਖਣ ਲਈ।
ਕਮਜ਼ੋਰ ਪ੍ਰੋਂਪਟ / ਮਜ਼ਬੂਤ ਪ੍ਰੋਂਪਟ
ਕਮਜ਼ੋਰ: "ਉਸ ਲੌਗ ਵਿੱਚ ਕੀ ਹੈ?" (ਇਸ ਤੋਂ ਬਾਅਦ ਕੱਚੇ ਲੌਗ ਦੀਆਂ 5000 ਲਾਈਨਾਂ, ਇਸ ਵਿੱਚ ਟੋਕਨ)
ਨਤੀਜਾ: ਤੁਸੀਂ ਭੇਦ ਲੀਕ ਕਰਦੇ ਹੋ ਅਤੇ AI ਇੱਕ ਗੈਰ-ਨਿਸ਼ਾਨਾ, ਸਤਹੀ ਸੰਖੇਪ ਦਿੰਦਾ ਹੈ।
ਮਜਬੂਤ: "ਹੇਠਾਂ 300-ਲਾਈਨ ਮਾਸਕਡ ਲੌਗ ਉਦਾਹਰਨ ਵਿੱਚ ਆਵਰਤੀ ਗਲਤੀ ਪੈਟਰਨ ਅਤੇ ਸਮੇਂ ਦੀ ਤੀਬਰਤਾ ਲੱਭੋ; ਮੈਨੂੰ ਸਭ ਤੋਂ ਸੰਭਾਵਿਤ ਮੂਲ ਕਾਰਨ ਅਤੇ ਮੈਟ੍ਰਿਕਸ ਦੱਸੋ ਜੋ ਮੈਂ ਪੁਸ਼ਟੀ ਕਰਨ ਲਈ ਦੇਖਾਂਗਾ। ਮੈਂ ਟੋਕਨ <REDACTED> ਬਣਾਏ ਹਨ।"
ਅੰਤਰ: ਦੂਜਾ ਪ੍ਰੋਂਪਟ ਇੱਕ ਮਾਸਕ ਅਤੇ ਫੋਕਸਡ ਉਦਾਹਰਨ ਦਿੰਦਾ ਹੈ, ਇੱਕ ਸਪਸ਼ਟ ਵਿਸ਼ਲੇਸ਼ਣ ਆਉਟਪੁੱਟ ਲਈ ਪੁੱਛਦਾ ਹੈ; ਇਹ ਸੁਰੱਖਿਅਤ ਅਤੇ ਲਾਭਦਾਇਕ ਦੋਨੋ ਹੈ.
ਆਮ ਗਲਤੀਆਂ
- AI ਵਿੱਚ ਲੌਗ ਨੂੰ ਮਾਸਕ ਕੀਤੇ ਬਿਨਾਂ ਪੇਸਟ ਕਰਨਾ। ਸਭ ਤੋਂ ਆਮ ਗੁਪਤ/ਨਿੱਜੀ ਡਾਟਾ ਲੀਕ।
- ਹਰ ਚੀਜ਼ ਲਈ ਅਲਾਰਮ ਸੈੱਟ ਕਰਨਾ। ਅਲਾਰਮ ਥਕਾਵਟ ਅਸਲ ਅਲਾਰਮ ਨੂੰ ਦੱਬ ਦਿੰਦੀ ਹੈ।
- ਗੈਰ-ਕਾਰਵਾਈ ਅਲਾਰਮ। ਇਹ ਚੇਤਾਵਨੀ ਸ਼ੋਰ ਹੈ ਜਿਸ ਬਾਰੇ ਕੋਈ ਵੀ ਕੁਝ ਨਹੀਂ ਕਰ ਸਕਦਾ.
- ਬਿਨਾਂ ਸਵਾਲ ਦੇ AI ਦੀ ਥ੍ਰੈਸ਼ਹੋਲਡ ਨੂੰ ਸਵੀਕਾਰ ਕਰਨਾ। ਥ੍ਰੈਸ਼ਹੋਲਡ ਤੁਹਾਡੇ ਸਿਸਟਮ ਦੇ ਇਤਿਹਾਸ ਦੇ ਅਨੁਸਾਰ ਸੈੱਟ ਕੀਤਾ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ.
- ਸਿਰਫ਼ ਮੈਟ੍ਰਿਕ ਨੂੰ ਦੇਖ ਰਿਹਾ ਹੈ। ਲੌਗ ਅਤੇ ਟਰੇਸ ਤੋਂ ਬਿਨਾਂ, ਮੂਲ ਕਾਰਨ ਜ਼ਿਆਦਾਤਰ ਸਮਾਂ ਨਹੀਂ ਲੱਭਿਆ ਜਾ ਸਕਦਾ ਹੈ।
- ਅਲਾਰਮ ਟਾਈਮ (ਲਈ) ਸੈੱਟ ਨਹੀਂ ਕਰ ਰਿਹਾ। ਪਲ-ਪਲ ਉਤਰਾਅ-ਚੜ੍ਹਾਅ ਝੂਠੇ ਅਲਾਰਮ ਪੈਦਾ ਕਰਦੇ ਹਨ।
ਸਾਰੰਸ਼ ਵਿੱਚ
ਨਿਰੀਖਣਯੋਗਤਾ; ਇਹ ਮੈਟ੍ਰਿਕਸ, ਲੌਗਸ ਅਤੇ ਟਰੇਸ ਦੇ ਨਾਲ ਬਾਹਰੋਂ ਸਿਸਟਮ ਦੇ ਅੰਦਰਲੇ ਹਿੱਸੇ ਨੂੰ ਸਮਝਣ ਦੀ ਸਮਰੱਥਾ ਹੈ। ਚਾਰ ਸੁਨਹਿਰੀ ਸਿਗਨਲ (ਲੇਟੈਂਸੀ, ਟ੍ਰੈਫਿਕ, ਗਲਤੀ, ਸੰਤ੍ਰਿਪਤਾ) ਜ਼ਿਆਦਾਤਰ ਸੇਵਾਵਾਂ ਦੀ ਸਿਹਤ ਦਾ ਸਾਰ ਦਿੰਦੇ ਹਨ। AI PromQL ਸਵਾਲਾਂ, ਅਲਾਰਮ ਨਿਯਮਾਂ ਅਤੇ ਡੈਸ਼ਬੋਰਡਾਂ ਨੂੰ ਲਿਖਣ, ਅਤੇ ਲੌਗਸ ਦੇ ਵੱਡੇ ਭਾਗਾਂ ਨੂੰ ਸੰਖੇਪ ਕਰਨ ਅਤੇ ਅਸੰਗਤੀਆਂ ਨੂੰ ਲੱਭਣ ਵਿੱਚ ਬਹੁਤ ਸ਼ਕਤੀਸ਼ਾਲੀ ਹੈ। ਪਰ ਇਹ ਤੁਹਾਡੀ ਜ਼ਿੰਮੇਵਾਰੀ ਹੈ ਕਿ ਤੁਸੀਂ ਆਪਣੇ ਸਿਸਟਮ ਦੇ ਇਤਿਹਾਸ ਦੇ ਵਿਰੁੱਧ ਅਲਾਰਮ ਥ੍ਰੈਸ਼ਹੋਲਡ ਦੀ ਪੁਸ਼ਟੀ ਕਰੋ, ਅਲਾਰਮ ਨੂੰ ਕਾਰਵਾਈ-ਅਧਾਰਿਤ ਰੱਖੋ, ਅਤੇ ਉਹਨਾਂ ਨੂੰ ਮਾਸਕ ਕੀਤੇ ਬਿਨਾਂ ਲੌਗਸ ਨੂੰ ਕਦੇ ਵੀ ਸਾਂਝਾ ਨਾ ਕਰੋ।
ਐਪਲੀਕੇਸ਼ਨ ਦਾ ਕੰਮ
ਕਿਸੇ ਸੇਵਾ (ਜਾਂ ਇੱਕ ਨਮੂਨਾ ਸੇਵਾ ਲਈ): (1) "ਅਲਾਰਮ ਨਿਯਮ ਬਣਾਉਣ" ਟੈਮਪਲੇਟ ਨਾਲ ਗਲਤੀ ਦਰ ਲਈ ਇੱਕ ਅਲਾਰਮ ਨਿਯਮ ਤਿਆਰ ਕਰੋ ਅਤੇ ਸੁਝਾਏ ਗਏ ਥ੍ਰੈਸ਼ਹੋਲਡ ਨੂੰ "ਅਤੀਤ ਵਿੱਚ ਇਹ ਕਿੰਨੀ ਵਾਰ ਚਾਲੂ ਹੋਇਆ ਹੈ?" 'ਤੇ ਸੈੱਟ ਕਰੋ। ਸਵਾਲ ਦੇ ਨਾਲ ਇਸ ਦੀ ਜਾਂਚ ਕਰੋ; (2) ਤੁਹਾਡੇ ਕੋਲ ਮੌਜੂਦ ਲੌਗ ਨਮੂਨੇ ਨੂੰ ਮਾਸਕ ਕਰੋ ਅਤੇ "ਲਾਗ ਸੰਖੇਪ" ਟੈਮਪਲੇਟ ਨਾਲ ਇਸਦਾ ਵਿਸ਼ਲੇਸ਼ਣ ਕਰੋ; (3) ਨੋਟ ਕਰੋ ਕਿ ਤੁਸੀਂ ਸਭ ਤੋਂ ਵੱਧ ਸੰਭਾਵਿਤ ਮੂਲ ਕਾਰਨ ਦੀ ਪੁਸ਼ਟੀ ਕਰਨ ਲਈ ਕਿਸ ਮੈਟ੍ਰਿਕ ਨੂੰ ਦੇਖੋਗੇ।
ਚੈੱਕਲਿਸਟ
- [ ] ਮੈਂ ਚਾਰ ਸੁਨਹਿਰੀ ਸਿਗਨਲਾਂ ਦੇ ਆਧਾਰ 'ਤੇ ਟਰੈਕ ਕਰਨ ਲਈ ਮੈਟ੍ਰਿਕਸ ਦੀ ਚੋਣ ਕੀਤੀ।
- [ ] ਮੈਂ ਸੰਵੇਦਨਸ਼ੀਲ ਖੇਤਰਾਂ ਦੇ ਰੂਪ ਵਿੱਚ AI ਨੂੰ ਦਿੱਤੇ ਸਾਰੇ ਲੌਗਾਂ ਨੂੰ ਮਾਸਕ ਕੀਤਾ ਹੈ।
- [ ] ਮੈਂ ਤਸਦੀਕ ਕੀਤਾ ਹੈ ਕਿ ਹਰੇਕ ਅਲਾਰਮ ਕਾਰਵਾਈ-ਮੁਖੀ ਅਤੇ ਸਹੀ ਜ਼ਰੂਰੀ ਸੀ।
- [ ] ਮੈਂ ਆਪਣੇ ਸਿਸਟਮ ਦੇ ਇਤਿਹਾਸਕ ਡੇਟਾ ਦੇ ਵਿਰੁੱਧ ਅਲਾਰਮ ਥ੍ਰੈਸ਼ਹੋਲਡ ਦੀ ਜਾਂਚ ਕੀਤੀ।
- [ ] ਮੈਂ ਅਲਾਰਮ ਵਿੱਚ (ਅਵਧੀ) ਜੋੜ ਕੇ ਤਤਕਾਲ ਉਤਰਾਅ-ਚੜ੍ਹਾਅ ਨੂੰ ਫਿਲਟਰ ਕੀਤਾ।
- ਮੈਂ ਮੂਲ ਕਾਰਨ ਲਈ ਮੀਟ੍ਰਿਕ + ਲੌਗ + ਟਰੇਸ ਦੀ ਵਰਤੋਂ ਕੀਤੀ ਹੈ।