ਲਾਭ:
- ਕਿਸੇ ਘਟਨਾ ਦੇ ਜੀਵਨ ਚੱਕਰ ਨੂੰ ਸਮਝਣ ਦੀ ਯੋਗਤਾ (ਖੋਜ, ਤ੍ਰਿਏਜ, ਨਿਵਾਰਣ, ਰੈਜ਼ੋਲੂਸ਼ਨ, ਪੋਸਟਮਾਰਟਮ), MTTD/MTTR ਮੈਟ੍ਰਿਕਸ ਅਤੇ 'ਪਹਿਲਾਂ ਘਟਾਓ, ਬਾਅਦ ਵਿੱਚ ਜਾਂਚ ਕਰੋ' ਦੇ ਸਿਧਾਂਤ।
- ਘਟਨਾ ਦੇ ਸਮੇਂ ਅਨੁਮਾਨਾਂ ਨੂੰ ਘੱਟ ਕਰਨ ਲਈ AI ਦੀ ਵਰਤੋਂ ਕਰਨ ਦੀ ਸਮਰੱਥਾ ਅਤੇ ਇੱਕ ਦੋਸ਼ ਰਹਿਤ ਪੋਸਟਮਾਰਟਮ ਸਕੈਚ ਤਿਆਰ ਕਰਨਾ, ਡੇਟਾ ਦੇ ਨਾਲ ਹਰੇਕ ਮੂਲ ਕਾਰਨ ਨੂੰ ਪ੍ਰਮਾਣਿਤ ਕਰਨਾ
- ਅਜਿਹੀ ਭਾਸ਼ਾ ਵਿੱਚ ਲਿਖਣ ਦੇ ਅਨੁਸ਼ਾਸਨ ਨੂੰ ਲਾਗੂ ਕਰਨ ਦੀ ਸਮਰੱਥਾ ਜੋ ਪੋਸਟਮਾਰਟਮ ਨੂੰ ਦੋਸ਼ ਨਹੀਂ ਦਿੰਦੀ ਹੈ ਅਤੇ ਇਸ ਨੂੰ ਮਾਸਕ ਕਰਕੇ ਘਟਨਾ ਡੇਟਾ ਨੂੰ ਸਾਂਝਾ ਕਰਦਾ ਹੈ।
ਹਰ ਸਿਸਟਮ ਆਖਰਕਾਰ ਟੁੱਟ ਜਾਂਦਾ ਹੈ। ਫਰਕ ਇਹ ਹੈ ਕਿ ਚੰਗੀਆਂ ਟੀਮਾਂ ਇਸ ਅਟੱਲ ਈਵੈਂਟ ਲਈ ਕਿਵੇਂ ਤਿਆਰੀ ਕਰਦੀਆਂ ਹਨ ਅਤੇ ਉਹ ਕਿਵੇਂ ਸਿੱਖਦੀਆਂ ਹਨ। ਘਟਨਾ ਇੱਕ ਅਣਕਿਆਸੀ ਘਟਨਾ ਹੈ ਜੋ ਸੇਵਾ ਵਿੱਚ ਵਿਘਨ ਪਾਉਂਦੀ ਹੈ ਜਾਂ ਉਸ ਨੂੰ ਵਿਗਾੜਨ ਦੀ ਧਮਕੀ ਦਿੰਦੀ ਹੈ: ਇੱਕ ਸੇਵਾ ਕ੍ਰੈਸ਼, ਪ੍ਰਤੀਕਿਰਿਆ ਸਮਾਂ ਅਸਮਾਨੀ ਚੜ੍ਹਨਾ, ਡੇਟਾ ਦਾ ਨੁਕਸਾਨ। ਘਟਨਾ ਪ੍ਰਬੰਧਨ ਦਾ ਅਰਥ ਹੈ ਘਟਨਾ ਦਾ ਪਤਾ ਲਗਾਉਣਾ, ਘਟਾਉਣਾ, ਜਿੰਨੀ ਜਲਦੀ ਹੋ ਸਕੇ ਹੱਲ ਕਰਨਾ, ਅਤੇ ਫਿਰ ਇਸ ਤੋਂ ਸਿੱਖਣਾ। ਇਹ ਉਹ ਅਨੁਸ਼ਾਸਨ ਹੈ ਜੋ DevOps ਅਤੇ SRE (ਸਾਈਟ ਭਰੋਸੇਯੋਗਤਾ ਇੰਜੀਨੀਅਰਿੰਗ) ਪੇਸ਼ੇਵਰਾਂ ਨੂੰ ਦਿਨ-ਰਾਤ ਚਲਾਉਂਦਾ ਹੈ।
ਦੋ ਨਾਜ਼ੁਕ ਮੈਟ੍ਰਿਕਸ ਇਵੈਂਟ ਦੀ ਗੁਣਵੱਤਾ ਨੂੰ ਮਾਪਦੇ ਹਨ: MTTD (ਖੋਜਣ ਦਾ ਸਮਾਂ) ਅਤੇ MTTR (ਮੁੜ ਪ੍ਰਾਪਤ ਕਰਨ ਲਈ ਸਮਾਂ)। ਟੀਚਾ ਦੋਵਾਂ ਨੂੰ ਸੁੰਗੜਨਾ ਹੈ. AI ਇੱਥੇ ਦੋ ਵੱਡੇ ਮੁੱਲਾਂ ਨੂੰ ਜੋੜਦਾ ਹੈ: ਘਟਨਾ ਦੇ ਸਮੇਂ 'ਤੇ ਲਾਗਾਂ ਅਤੇ ਮੈਟ੍ਰਿਕਸ ਦਾ ਸੰਖੇਪ ਸੰਭਾਵੀ ਮੂਲ ਕਾਰਨ ਨੂੰ ਘਟਾਉਣ ਲਈ, ਅਤੇ ਘਟਨਾ ਤੋਂ ਬਾਅਦ ਪੋਸਟਮਾਰਟਮ (ਪੋਸਟ-ਇਵੈਂਟ ਜਾਂਚ ਰਿਪੋਰਟ) ਨੂੰ ਜਲਦੀ ਤਿਆਰ ਕਰਨਾ। ਪਰ ਘਟਨਾਵਾਂ ਦੇ ਕੋਰਸ ਬਾਰੇ ਫੈਸਲੇ - ਕਿਹੜੀ ਸੇਵਾ ਨੂੰ ਬੰਦ ਕਰਨਾ ਹੈ, ਰੋਲਬੈਕ ਕਰਨਾ ਹੈ, ਗਾਹਕ ਨੂੰ ਕੀ ਕਹਿਣਾ ਹੈ - ਤੁਹਾਡੇ ਹਨ।
ਇੱਕ ਘਟਨਾ ਦਾ ਜੀਵਨ ਚੱਕਰ
- ਪਤਾ ਲਗਾਉਣਾ: ਅਲਾਰਮ ਵੱਜਦਾ ਹੈ ਜਾਂ ਗਾਹਕ ਦੀ ਸ਼ਿਕਾਇਤ ਆਉਂਦੀ ਹੈ। ਜਿੰਨੀ ਜਲਦੀ ਹੋਵੇ ਓਨਾ ਹੀ ਚੰਗਾ।
- ਤ੍ਰਿਏਜ: ਇਹ ਕਿੰਨਾ ਗੰਭੀਰ ਹੈ? ਡੋਮੇਨ ਕੀ ਹੈ? ਗੰਭੀਰਤਾ ਦੇ ਪੱਧਰ ਨਿਰਧਾਰਤ ਕੀਤੇ ਗਏ ਹਨ-ਆਮ ਤੌਰ 'ਤੇ SEV1 (ਸਭ ਤੋਂ ਨਾਜ਼ੁਕ, ਪੂਰਾ ਸਿਸਟਮ) ਨੂੰ SEV4 (ਨਾਬਾਲਗ)।
- ਆਪਣੀ ਜਵਾਬੀ ਟੀਮ ਨੂੰ ਇਕੱਠਾ ਕਰੋ। ਨਾਜ਼ੁਕ ਘਟਨਾਵਾਂ ਵਿੱਚ, ਇੱਕ ਘਟਨਾ ਕਮਾਂਡਰ ਤਾਲਮੇਲ ਨੂੰ ਮੰਨਦਾ ਹੈ।
- ਘਟਾਓ: ਪਹਿਲਾਂ ਖੂਨ ਵਹਿਣਾ ਬੰਦ ਕਰੋ — ਅਕਸਰ ਇੱਕ ਰੋਲਬੈਕ ਜਾਂ ਝੰਡੇ ਨੂੰ ਢੱਕਣਾ। ਤੁਹਾਨੂੰ ਬਾਅਦ ਵਿੱਚ ਮੂਲ ਕਾਰਨ ਪਤਾ ਲੱਗੇਗਾ।
- ਹੱਲ: ਸਥਾਈ ਹੱਲ ਲਾਗੂ ਕਰੋ।
- ਜਾਣੋ (ਪੋਸਟਮਾਰਟਮ): ਕੀ ਹੋਇਆ, ਕਿਉਂ ਹੋਇਆ, ਇਸ ਨੂੰ ਦੁਬਾਰਾ ਹੋਣ ਤੋਂ ਕਿਵੇਂ ਰੋਕਿਆ ਜਾਵੇ?
ਸੰਕੇਤ: ਘਟਨਾ ਦੇ ਸਮੇਂ ਸਭ ਤੋਂ ਮਹਿੰਗੀਆਂ ਗਲਤੀਆਂ ਵਿੱਚੋਂ ਇੱਕ ਖੂਨ ਵਹਿਣ ਨੂੰ ਰੋਕਣ ਵਿੱਚ ਦੇਰੀ ਕਰਨਾ ਹੈ ਕਿਉਂਕਿ "ਆਓ ਪਹਿਲਾਂ ਸਹੀ ਮੂਲ ਕਾਰਨ ਨੂੰ ਜਾਣੀਏ।" ਨਿਯਮ: ਪਹਿਲਾਂ ਘਟਾਓ (ਸੇਵਾ ਨੂੰ ਬਹਾਲ ਕਰੋ/ਬਹਾਲ ਕਰੋ), ਫਿਰ ਪੁੱਛਗਿੱਛ ਕਰੋ। ਕਿਸੇ ਜਾਣੇ-ਪਛਾਣੇ-ਚੰਗੇ ਸੰਸਕਰਣ 'ਤੇ ਵਾਪਸ ਆਉਣਾ ਅਕਸਰ ਸਭ ਤੋਂ ਤੇਜ਼ ਨਿਘਾਰ ਹੁੰਦਾ ਹੈ।
ਦੋਸ਼-ਮੁਕਤ ਪੋਸਟਮਾਰਟਮ ਸੱਭਿਆਚਾਰ
ਸਿਹਤਮੰਦ ਟੀਮਾਂ ਦੀ ਰੀੜ੍ਹ ਦੀ ਹੱਡੀ ਨਿਰਦੋਸ਼ ਪੋਸਟਮਾਰਟਮ ਦਾ ਸਭਿਆਚਾਰ ਹੈ: ਟੀਚਾ "ਇਹ ਕਿਸਨੇ ਕੀਤਾ" ਨਹੀਂ ਹੈ, ਪਰ "ਕਿਹੜੀ ਪ੍ਰਣਾਲੀ ਅਤੇ ਪ੍ਰਕਿਰਿਆ ਨੇ ਇਸ ਗਲਤੀ ਦੀ ਇਜਾਜ਼ਤ ਦਿੱਤੀ?" ਸਵਾਲ ਹੈ। ਲੋਕ ਗਲਤੀ ਨੂੰ ਛੁਪਾਉਂਦੇ ਹਨ ਜੇ ਉਹ ਜਾਣਦੇ ਹਨ ਕਿ ਉਨ੍ਹਾਂ ਨੂੰ ਸਜ਼ਾ ਮਿਲੇਗੀ; ਲੁਕਵੀਂ ਗਲਤੀ ਦੁਹਰਾਈ ਜਾਂਦੀ ਹੈ। ਪੋਸਟਮਾਰਟਮ ਇੱਕ ਇਲਜ਼ਾਮ ਰਿਪੋਰਟ ਨਹੀਂ ਹੈ, ਪਰ ਇੱਕ ਸਿੱਖਣ ਦਾ ਦਸਤਾਵੇਜ਼ ਹੈ।
ਇੱਕ ਚੰਗੇ ਪੋਸਟਮਾਰਟਮ ਵਿੱਚ ਸ਼ਾਮਲ ਹਨ: ਸਾਰਾਂਸ਼, ਪ੍ਰਭਾਵ (ਕਿੰਨੇ ਉਪਭੋਗਤਾ, ਕਿੰਨਾ ਸਮਾਂ, ਕਿੰਨਾ ਪੈਸਾ), ਸਮਾਂ-ਰੇਖਾ, ਮੂਲ ਕਾਰਨ (ਕਾਰ), ਕੀ ਚੰਗਾ/ਬੁਰਾ ਹੋਇਆ, ਅਤੇ ਕਾਰਵਾਈ ਆਈਟਮਾਂ — ਠੋਸ ਉਪਾਅ, ਹਰ ਇੱਕ ਮਾਲਕ ਅਤੇ ਮਿਤੀ ਦੇ ਨਾਲ।
ਸਾਵਧਾਨ: AI ਨਾਲ ਪੋਸਟਮਾਰਟਮ ਲਿਖਣ ਵੇਲੇ, ਇਲਜ਼ਾਮ ਵਾਲੀ ਭਾਸ਼ਾ ਨੂੰ ਖਤਮ ਕਰਨਾ ਯਕੀਨੀ ਬਣਾਓ (ਜਿਵੇਂ ਕਿ "ਵਿਅਕਤੀ X ਨੇ ਗਲਤੀ ਕੀਤੀ")। AI ਨੂੰ ਇਵੈਂਟ ਡੇਟਾ ਫੀਡ ਕਰਦੇ ਸਮੇਂ ਕਲਾਇੰਟ ਆਈਡੀ, ਅੰਦਰੂਨੀ IP ਅਤੇ ਰਾਜ਼ ਨੂੰ ਵੀ ਮਾਸਕ ਕਰੋ — ਪੋਸਟਮਾਰਟਮ ਅਕਸਰ ਵਿਆਪਕ ਤੌਰ 'ਤੇ ਸਾਂਝੇ ਕੀਤੇ ਜਾਂਦੇ ਹਨ।
ਮੂਲ ਕਾਰਨ ਵਿਸ਼ਲੇਸ਼ਣ: 5 ਕਿਉਂ ਅਤੇ ਏ.ਆਈ
ਇੱਕ ਕਲਾਸਿਕ ਤਕਨੀਕ "5 ਕਿਉਂ" ਹੈ: "ਕਿਉਂ?" ਇੱਕ ਸਮੱਸਿਆ ਨੂੰ. ਬਾਰ ਬਾਰ ਪੁੱਛਣ ਨਾਲ ਤੁਸੀਂ ਸਤਹੀ ਲੱਛਣ ਤੋਂ ਅਸਲ ਜੜ੍ਹ ਤੱਕ ਪਹੁੰਚ ਜਾਂਦੇ ਹੋ। "ਸੇਵਾ ਕਰੈਸ਼ ਹੋ ਗਈ। ਕਿਉਂ? ਮੈਮੋਰੀ ਖਤਮ ਹੋ ਗਈ। ਕਿਉਂ? ਇੱਕ ਲੀਕ ਸੀ। ਕਿਉਂ? ਇੱਕ ਲਾਇਬ੍ਰੇਰੀ ਅੱਪਡੇਟ..." AI ਇਸ ਲੜੀ ਨੂੰ ਬਣਾਉਣ ਅਤੇ ਸੰਭਵ ਸ਼ਾਖਾਵਾਂ ਦਾ ਸੁਝਾਅ ਦੇਣ ਲਈ ਤੇਜ਼ ਹੈ — ਪਰ ਤੁਹਾਨੂੰ ਆਪਣੇ ਡੇਟਾ ਨਾਲ ਹਰੇਕ "ਕਿਉਂ" ਦੀ ਪੁਸ਼ਟੀ ਕਰਨੀ ਚਾਹੀਦੀ ਹੈ; AI ਇੱਕ ਵਾਜਬ ਪਰ ਗਲਤ ਚੇਨ ਵੀ ਬਣਾ ਸਕਦਾ ਹੈ।
ਗੰਭੀਰਤਾ ਸਾਰਣੀ
ਪੱਧਰ
ਪ੍ਰਭਾਵ
ਉਦਾਹਰਨ
ਦਖਲ
SEV1
ਪੂਰਾ ਸਿਸਟਮ/ਨਾਜ਼ੁਕ ਕਾਰੋਬਾਰੀ ਨੁਕਸਾਨ
ਭੁਗਤਾਨ ਪੂਰੀ ਤਰ੍ਹਾਂ ਘਟ ਗਿਆ
ਤੁਰੰਤ, ਪੂਰੀ ਟੀਮ, ਕਮਾਂਡਰ
SEV2
ਮੁੱਖ ਨਪੁੰਸਕਤਾ
ਲੌਗਇਨ ਅਸਫਲ ਹੋਏ
ਤੇਜ਼, ਆਨ-ਕਾਲ + ਸਹਾਇਤਾ
SEV3
ਅੰਸ਼ਕ/ਸੀਮਤ ਪ੍ਰਭਾਵ
ਇੱਕ ਰਿਪੋਰਟ ਵਿੱਚ ਦੇਰੀ ਹੈ
ਕੰਮ ਦੇ ਘੰਟੇ ਦੌਰਾਨ
SEV4
ਛੋਟਾ/ਕਾਸਮੈਟਿਕ
ਟਾਈਪੋ
ਆਮ ਕੰਮ ਦੀ ਕਤਾਰ
ਤਿੰਨ ਛੋਟੇ ਕੇਸ
ਕੇਸ 1 — MTTR 45 ਮਿੰਟ ਤੋਂ 8 ਮਿੰਟ ਤੱਕ। ਭੁਗਤਾਨ ਸੇਵਾ ਕ੍ਰੈਸ਼ ਹੋ ਗਈ। ਡਿਊਟੀ 'ਤੇ ਮੌਜੂਦ ਇੰਜੀਨੀਅਰ ਨੇ AI ਨੂੰ ਨਕਾਬਬੰਦ ਲੌਗ ਅਤੇ ਆਖਰੀ ਤੈਨਾਤੀ ਦੀ ਜਾਣਕਾਰੀ ਦਿੱਤੀ ਅਤੇ ਪੁੱਛਿਆ, "ਪਿਛਲੇ 20 ਮਿੰਟਾਂ ਵਿੱਚ ਸਭ ਤੋਂ ਵੱਧ ਸੰਭਾਵਿਤ ਟਰਿੱਗਰ ਕੀ ਹੈ?" ਉਸ ਨੇ ਪੁੱਛਿਆ। AI ਨੇ ਦਿਖਾਇਆ ਕਿ ਢਹਿਣਾ ਆਖਰੀ ਤੈਨਾਤੀ ਦੇ ਉਸੇ ਮਿੰਟ 'ਤੇ ਸ਼ੁਰੂ ਹੋਇਆ ਸੀ। ਇੰਜੀਨੀਅਰ ਨੇ ਤੁਰੰਤ ਉਸ ਸੰਸਕਰਣ ਨੂੰ ਵਾਪਸ ਲਿਆ; ਸੇਵਾ 8 ਮਿੰਟਾਂ ਵਿੱਚ ਵਾਪਸ ਆ ਗਈ। ਮੂਲ ਕਾਰਨ (ਨਵੇਂ ਸੰਸਕਰਣ ਵਿੱਚ ਇੱਕ ਕੁਨੈਕਸ਼ਨ ਪੂਲ ਬੱਗ) ਦੀ ਫਿਰ ਸੁਵਿਧਾਜਨਕ ਜਾਂਚ ਕੀਤੀ ਗਈ ਸੀ।
ਕੇਸ 2 - 20 ਮਿੰਟਾਂ ਵਿੱਚ ਪੋਸਟਮਾਰਟਮ ਦਾ ਸਕੈਚ। ਇੱਕ SEV2 ਤੋਂ ਬਾਅਦ, ਟੀਮ ਥੱਕ ਗਈ ਸੀ ਅਤੇ ਰਿਪੋਰਟ ਲਿਖਣ ਦੀ ਤਾਕਤ ਨਹੀਂ ਸੀ; ਅਕਸਰ ਰਿਪੋਰਟ ਹਫ਼ਤਿਆਂ ਲਈ ਦੇਰੀ ਹੁੰਦੀ ਸੀ। ਇਸ ਵਾਰ, ਉਨ੍ਹਾਂ ਨੇ ਏਆਈ ਨੂੰ ਸਮਾਂ ਸੀਮਾ ਅਤੇ ਘਟਨਾ ਦੇ ਨੋਟ ਦਿੱਤੇ ਅਤੇ ਅਪਰਾਧ-ਮੁਕਤ ਪੋਸਟਮਾਰਟਮ ਸਕੈਚ ਤਿਆਰ ਕੀਤਾ। AI ਨੇ ਪ੍ਰਭਾਵ, ਸਮਾਂਰੇਖਾ ਅਤੇ ਐਕਸ਼ਨ ਆਈਟਮਾਂ ਲਈ ਇੱਕ ਸਾਫ਼-ਸੁਥਰਾ ਢਾਂਚਾ ਬਣਾਇਆ; ਟੀਮ ਨੇ ਇਸ ਨੂੰ ਤੱਥਾਂ ਨਾਲ ਭਰਿਆ ਅਤੇ 20 ਮਿੰਟਾਂ ਵਿੱਚ ਪ੍ਰਕਾਸ਼ਿਤ ਕੀਤਾ। ਸਬਕ ਹਾਰਿਆ ਨਹੀਂ ਸੀ।
ਕੇਸ 3 - ਗਲਤ ਮੂਲ ਕਾਰਨ ਫੜਿਆ ਗਿਆ। ਇੱਕ ਕੇਸ ਵਿੱਚ, AI ਨੇ ਕਿਹਾ "ਰੂਟ ਕਾਰਨ ਡੇਟਾਬੇਸ ਓਵਰਲੋਡ" ਅਤੇ ਇਹ ਵਾਜਬ ਜਾਪਦਾ ਸੀ। ਪਰ ਇੰਜੀਨੀਅਰ ਨੇ ਮੈਟ੍ਰਿਕਸ ਦੀ ਪੁਸ਼ਟੀ ਕੀਤੀ: ਘਟਨਾ ਦੇ ਸਮੇਂ ਡੇਟਾਬੇਸ ਲੋਡ ਆਮ ਸੀ. ਅਸਲ ਕਾਰਨ ਇੱਕ ਬਾਹਰੀ DNS ਸਮੱਸਿਆ ਸੀ। AI ਦੀ ਸ਼ੁਰੂਆਤੀ ਪਰਿਕਲਪਨਾ ਤਰਲ ਸੀ ਪਰ ਗਲਤ ਸੀ; ਡੇਟਾ ਦੇ ਨਾਲ ਪ੍ਰਮਾਣਿਕਤਾ ਨੇ ਰਿਪੋਰਟ ਨੂੰ ਗਲਤ ਸਿੱਟੇ ਨਾਲ ਪ੍ਰਕਾਸ਼ਿਤ ਹੋਣ ਤੋਂ ਰੋਕਿਆ।
ਚਾਰ ਕਾਪੀ ਕਰਨ ਯੋਗ ਟੈਂਪਲੇਟ
1) ਘਟਨਾ ਦੇ ਸਮੇਂ ਤੇਜ਼ ਟ੍ਰਾਈਜ:
ਅਸੀਂ ਇੱਕ ਉਤਪਾਦਨ ਘਟਨਾ ਦਾ ਅਨੁਭਵ ਕਰ ਰਹੇ ਹਾਂ। ਮਾਸਕ ਕੀਤੇ ਲੱਛਣ: [ਲੱਛਣ]।ਆਖਰੀ ਤਬਦੀਲੀਆਂ: [ਲਾਸਟ ਡਿਪਲੋਏ/ਬਦਲਣਾ]। ਮੈਨੂੰ ਦਿਓ: (1) ਸੰਭਾਵਨਾ ਦੇ ਕ੍ਰਮ ਵਿੱਚ 3 ਸਭ ਤੋਂ ਵੱਧ ਸੰਭਾਵਿਤ ਮੂਲ ਕਾਰਨ ਦੀਆਂ ਧਾਰਨਾਵਾਂ, (2) ਕਮਾਂਡ/ਮੈਟ੍ਰਿਕ ਜੋ 1 ਮਿੰਟ ਵਿੱਚ ਹਰੇਕ ਦੀ ਪੁਸ਼ਟੀ ਕਰੇਗਾ, (3) ਸਭ ਤੋਂ ਤੇਜ਼ ਸੁਰੱਖਿਅਤ ਮਿਟਾਉਣ ਵਾਲਾ ਕਦਮ (ਉਦਾਹਰਨ ਲਈ ਰੋਲਬੈਕ)। ਦੱਸੋ ਕਿ ਮੈਨੂੰ ਹਰੇਕ ਪਰਿਕਲਪਨਾ ਦੀ ਪੁਸ਼ਟੀ ਕਰਨੀ ਚਾਹੀਦੀ ਹੈ।
2) ਨਿਰਦੋਸ਼ ਪੋਸਟਮਾਰਟਮ ਸਕੈਚ:
ਹੇਠਾਂ ਦਿੱਤੇ ਘਟਨਾ ਨੋਟਸ ਤੋਂ ਇੱਕ ਨਿਰਦੋਸ਼ ਪੋਸਟਮਾਰਟਮ ਸਕੈਚ ਲਿਖੋ। ਸੈਕਸ਼ਨ: ਸਾਰਾਂਸ਼, ਪ੍ਰਭਾਵ (ਉਪਭੋਗਤਾ/ਅਵਧੀ/ਕੀਮਤ), ਸਮਾਂਰੇਖਾ, ਮੂਲ ਕਾਰਨ (ਕਾਰ), ਕੀ ਚੰਗਾ ਹੋਇਆ, ਕੀ ਮਾੜਾ ਹੋਇਆ, ਐਕਸ਼ਨ ਆਈਟਮਾਂ (ਹਰੇਕ ਮਾਲਕ + ਮਿਤੀ ਖੇਤਰ ਦੇ ਨਾਲ)। ਨਾਮਕਰਨ, ਪ੍ਰਕਿਰਿਆ ਅਤੇ ਪ੍ਰਣਾਲੀ 'ਤੇ ਧਿਆਨ ਦਿਓ। ਨੋਟ: [ਨਕਾਬ]
3) 5 ਕਿਉਂ ਵਿਸ਼ਲੇਸ਼ਣ:
ਹੇਠਾਂ ਦਿੱਤੇ ਲੱਛਣਾਂ ਨਾਲ ਸ਼ੁਰੂ ਕਰਦੇ ਹੋਏ, ਇੱਕ "5 Whys" ਲੜੀ ਬਣਾਓ: [SYMPTOM]। ਦਿਖਾਓ ਕਿ ਕੀ ਹਰ ਪੜਾਅ 'ਤੇ ਇੱਕ ਤੋਂ ਵੱਧ ਸੰਭਵ ਸ਼ਾਖਾਵਾਂ ਹਨ। ਹਰੇਕ "ਕਿਉਂ" ਦੇ ਅੱਗੇ ਸਬੂਤ (ਲੌਗ/ਮੈਟ੍ਰਿਕ) ਲਿਖੋ ਜੋ ਮੈਂ ਇਸਦੀ ਪੁਸ਼ਟੀ ਕਰਨ ਲਈ ਦੇਖਾਂਗਾ। ਅੰਤ ਵਿੱਚ, ਨਿਸ਼ਾਨ ਲਗਾਓ ਕਿ ਕਿਹੜੇ ਕਦਮ ਅਜੇ ਤਸਦੀਕ ਨਹੀਂ ਹੋਏ ਹਨ।
4) ਕਾਰਵਾਈਯੋਗ ਚੀਜ਼ਾਂ ਬਣਾਉਣਾ:
ਇਸ ਮੂਲ ਕਾਰਨ ਦੇ ਅਨੁਸਾਰ, ਕਾਰਵਾਈਯੋਗ ਆਈਟਮਾਂ ਦਾ ਸੁਝਾਅ ਦਿਓ ਜੋ ਇੱਕੋ ਘਟਨਾ ਨੂੰ ਦੁਹਰਾਉਣ ਤੋਂ ਰੋਕੇ। ਹਰੇਕ ਆਈਟਮ ਨੂੰ ਇਹਨਾਂ ਦੁਆਰਾ ਸ਼੍ਰੇਣੀਬੱਧ ਕਰੋ: (ਏ) ਰੋਕਥਾਮ, ਖੋਜ ਜਾਂ ਕਮੀ, (ਬੀ) ਅਨੁਮਾਨਿਤ ਕੋਸ਼ਿਸ਼, (ਸੀ) ਪ੍ਰਭਾਵ। ਉੱਚਤਮ ਪ੍ਰਭਾਵ/ਜਤਨ ਅਨੁਪਾਤ ਦੁਆਰਾ ਛਾਂਟੋ। ਮੂਲ ਕਾਰਨ: [X]
ਕਮਜ਼ੋਰ ਪ੍ਰੋਂਪਟ / ਮਜ਼ਬੂਤ ਪ੍ਰੋਂਪਟ
ਕਮਜ਼ੋਰ: "ਸੇਵਾ ਕਰੈਸ਼ ਹੋ ਗਈ ਹੈ, ਮੈਨੂੰ ਕੀ ਕਰਨਾ ਚਾਹੀਦਾ ਹੈ?"
ਨਤੀਜਾ: ਕੋਈ ਪ੍ਰਸੰਗ ਨਹੀਂ; AI ਆਮ ਸਿਫ਼ਾਰਸ਼ਾਂ ਕਰ ਸਕਦਾ ਹੈ ਜੋ ਤੁਹਾਡੇ ਕੇਸ ਵਿੱਚ ਫਿੱਟ ਨਹੀਂ ਹੁੰਦੇ, ਅਤੇ ਇੱਕ ਨਿਸ਼ਚਿਤ ਮੂਲ ਕਾਰਨ ਵੀ ਲੈ ਸਕਦੇ ਹਨ।
ਮਜ਼ਬੂਤ: "ਉਤਪਾਦਨ ਭੁਗਤਾਨ ਸੇਵਾ 5 ਮਿੰਟ ਲਈ 5xx ਦੇ ਰਹੀ ਹੈ। ਆਖਰੀ ਤੈਨਾਤੀ 6 ਮਿੰਟ ਪਹਿਲਾਂ ਕੀਤੀ ਗਈ ਸੀ। ਸੰਭਾਵਤਤਾ ਦੇ ਕ੍ਰਮ ਵਿੱਚ 3 ਸਭ ਤੋਂ ਵੱਧ ਸੰਭਾਵਿਤ ਮੂਲ ਕਾਰਨਾਂ ਦੀਆਂ ਧਾਰਨਾਵਾਂ ਦਿਓ, ਉਹਨਾਂ ਕਮਾਂਡਾਂ ਨੂੰ ਦੱਸੋ ਜੋ ਉਹਨਾਂ ਵਿੱਚੋਂ ਹਰੇਕ ਦੀ ਪੁਸ਼ਟੀ ਕਰੇਗੀ, ਅਤੇ ਸਭ ਤੋਂ ਤੇਜ਼ ਸੁਰੱਖਿਅਤ ਮਿਟਾਉਣ ਦਾ ਸੁਝਾਅ ਦੇਵੇਗੀ। ਖਾਸ ਨਾ ਬਣੋ, ਦੱਸੋ ਕਿ ਮੈਨੂੰ ਪੁਸ਼ਟੀ ਕਰਨ ਦੀ ਲੋੜ ਹੈ।"
ਅੰਤਰ: ਦੂਜਾ ਪ੍ਰੋਂਪਟ ਲੱਛਣ, ਸਮਾਂ ਅਤੇ ਆਖਰੀ ਤਬਦੀਲੀ ਦਿੰਦਾ ਹੈ; ਇਹ ਅਨੁਮਾਨ + ਤਸਦੀਕ + ਕਟੌਤੀ ਦੀ ਮੰਗ ਕਰਦਾ ਹੈ ਅਤੇ AI ਨੂੰ ਅਸ਼ੁੱਧ ਰੱਖਦਾ ਹੈ।
ਆਮ ਗਲਤੀਆਂ
- ਘਟਾਉਣ ਤੋਂ ਪਹਿਲਾਂ ਸਹੀ ਮੂਲ ਕਾਰਨ ਦੀ ਭਾਲ ਕਰੋ। ਇਹ ਖੂਨ ਵਹਿਣ ਨੂੰ ਰੋਕਣ ਵਿੱਚ ਦੇਰੀ ਕਰਦਾ ਹੈ ਅਤੇ MTTR ਨੂੰ ਵਧਾਉਂਦਾ ਹੈ।
- AI ਦੀ ਪਹਿਲੀ ਪਰਿਕਲਪਨਾ ਨੂੰ ਪ੍ਰਮਾਣਿਤ ਕੀਤੇ ਬਿਨਾਂ ਪ੍ਰਕਾਸ਼ਿਤ ਕਰਨਾ। ਤਰਲ ਪਰ ਝੂਠੇ ਮੂਲ ਕਾਰਨ ਰਿਪੋਰਟ ਵਿੱਚ ਲੀਕ ਹੋ ਜਾਂਦੀ ਹੈ।
- ਇਲਜ਼ਾਮ ਵਾਲੀ ਭਾਸ਼ਾ। ਗੁਮਨਾਮ ਰੂਪ ਵਿੱਚ ਲਿਖਿਆ ਪੋਸਟਮਾਰਟਮ ਛੁਪਾਉਣ ਅਤੇ ਦੁਹਰਾਉਣ ਵਾਲੀ ਗਲਤੀ ਨੂੰ ਉਤਸ਼ਾਹਿਤ ਕਰਦਾ ਹੈ।
- ਬੁਲੇਟ ਪੁਆਇੰਟਾਂ ਤੋਂ ਬਿਨਾਂ ਕਾਰਵਾਈ-ਮੁਖੀ ਰਿਪੋਰਟ। ਇੱਕ ਮਾਲਕ ਅਤੇ ਮਿਤੀ ਤੋਂ ਬਿਨਾਂ ਇੱਕ ਪ੍ਰਸਤਾਵ ਕਦੇ ਵੀ ਲਾਗੂ ਨਹੀਂ ਕੀਤਾ ਜਾਵੇਗਾ।
- ਇਵੈਂਟ ਡੇਟਾ ਨੂੰ ਮਾਸਕ ਕੀਤੇ ਬਿਨਾਂ ਸਾਂਝਾ ਕਰਨਾ। ਪੋਸਟਮਾਰਟਮ ਇੱਕ ਵਿਸ਼ਾਲ ਹਾਜ਼ਰੀਨ ਨੂੰ ਜਾਂਦਾ ਹੈ; ਗੁਪਤ/ਨਿੱਜੀ ਡਾਟਾ ਲੀਕ ਹੋਇਆ ਹੈ।
- ਰੋਲਬੈਕ ਮਾਰਗ ਨੂੰ ਪਹਿਲਾਂ ਤੋਂ ਤਿਆਰ ਨਹੀਂ ਕਰਨਾ। ਜੇਕਰ ਉਲਟਾਉਣਾ ਅਮਲੀ ਨਹੀਂ ਹੈ, ਤਾਂ ਕਟੌਤੀ ਹੌਲੀ ਹੋ ਜਾਂਦੀ ਹੈ।
ਸਾਰੰਸ਼ ਵਿੱਚ
ਘਟਨਾ ਪ੍ਰਬੰਧਨ ਅਟੱਲ ਘਟਨਾਵਾਂ ਤੋਂ ਜਲਦੀ ਖੋਜਣ, ਘਟਾਉਣ, ਹੱਲ ਕਰਨ ਅਤੇ ਸਿੱਖਣ ਬਾਰੇ ਹੈ; MTTD ਅਤੇ MTTR ਮੁੱਖ ਮੈਟ੍ਰਿਕਸ ਹਨ। ਸੁਨਹਿਰੀ ਨਿਯਮ ਹੈ "ਪਹਿਲਾਂ ਘਟਾਓ, ਬਾਅਦ ਵਿਚ ਜਾਂਚ ਕਰੋ" ਅਤੇ ਜਾਣੇ-ਪਛਾਣੇ-ਚੰਗੇ ਸੰਸਕਰਣ 'ਤੇ ਵਾਪਸ ਜਾਣਾ ਅਕਸਰ ਸਭ ਤੋਂ ਤੇਜ਼ੀ ਨਾਲ ਘਟਾਉਣਾ ਹੁੰਦਾ ਹੈ। ਘਟਨਾ ਦੇ ਸਮੇਂ ਲੌਗਸ ਨੂੰ ਸੰਖੇਪ ਕਰਨ, ਅਨੁਮਾਨਾਂ ਨੂੰ ਘਟਾਉਣ, ਅਤੇ ਘਟਨਾ ਤੋਂ ਬਾਅਦ ਦੋਸ਼ ਰਹਿਤ ਪੋਸਟਮਾਰਟਮ ਸਕੈਚ ਤਿਆਰ ਕਰਨ ਵਿੱਚ AI ਅਨਮੋਲ ਹੈ — ਪਰ ਇਹ ਤੁਹਾਡੀ ਜ਼ਿੰਮੇਵਾਰੀ ਹੈ ਕਿ ਹਰ ਮੂਲ ਕਾਰਨ ਦੀ ਕਲਪਨਾ ਨੂੰ ਡੇਟਾ ਨਾਲ ਪ੍ਰਮਾਣਿਤ ਕਰਨਾ, ਦੋਸ਼ ਦੀ ਭਾਸ਼ਾ ਨੂੰ ਸਾਫ਼ ਕਰਨਾ, ਅਤੇ ਘਟਨਾ ਡੇਟਾ ਨੂੰ ਮਾਸਕ ਕਰਨਾ।
ਐਪਲੀਕੇਸ਼ਨ ਦਾ ਕੰਮ
ਇੱਕ ਅਤੀਤ (ਜਾਂ ਕਾਲਪਨਿਕ) ਘਟਨਾ 'ਤੇ ਵਿਚਾਰ ਕਰੋ। (1) AI ਨੂੰ "ਮੌਨ-ਦੀ-ਸੀਨ ਰੈਪਿਡ ਟ੍ਰਾਈਏਜ" ਟੈਂਪਲੇਟ ਦੇ ਨਾਲ ਅਨੁਮਾਨਾਂ ਅਤੇ ਪੁਸ਼ਟੀਕਰਨ ਕਦਮਾਂ ਨੂੰ ਤਿਆਰ ਕਰੋ; ਨੋਟ ਕਰੋ ਕਿ ਡੇਟਾ ਦੁਆਰਾ ਕਿਹੜੀ ਪਰਿਕਲਪਨਾ ਦੀ ਪੁਸ਼ਟੀ ਕੀਤੀ ਜਾ ਸਕਦੀ ਹੈ। (2) “ਦੋਸ਼ੀ ਨਹੀਂ ਪੋਸਟਮਾਰਟਮ ਰੂਪਰੇਖਾ” ਟੈਮਪਲੇਟ ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹੋਏ ਇੱਕ ਰਿਪੋਰਟ ਤਿਆਰ ਕਰੋ ਅਤੇ ਇਸ ਨੂੰ ਤੱਥਾਂ ਨਾਲ ਭਰੋ। (3) ਘੱਟੋ-ਘੱਟ ਦੋ ਕਾਰਵਾਈਯੋਗ ਆਈਟਮਾਂ ਦੀ ਪਛਾਣ ਕਰੋ ਅਤੇ ਹਰੇਕ ਨੂੰ ਇੱਕ ਮਾਲਕ ਅਤੇ ਮਿਤੀ ਨਿਰਧਾਰਤ ਕਰੋ।
ਚੈੱਕਲਿਸਟ
- [] ਘਟਨਾ ਦੇ ਸਮੇਂ, ਮੈਂ ਪਹਿਲਾਂ ਘੱਟ ਕਰਨ (ਰੋਲਬੈਕ/ਬੰਦ) ਬਾਰੇ ਸੋਚਿਆ ਅਤੇ ਬਾਅਦ ਵਿੱਚ ਮੂਲ ਕਾਰਨ ਨੂੰ ਛੱਡ ਦਿੱਤਾ।
- [ ] ਮੈਂ ਲੌਗ/ਮੈਟ੍ਰਿਕ ਨਾਲ AI ਦੇ ਹਰ ਮੂਲ ਕਾਰਨ ਦੀ ਪਰਿਕਲਪਨਾ ਦੀ ਪੁਸ਼ਟੀ ਕੀਤੀ।
- [ ] ਮੈਂ ਇਸਨੂੰ ਅਜਿਹੀ ਭਾਸ਼ਾ ਵਿੱਚ ਲਿਖਿਆ ਜੋ ਪੋਸਟਮਾਰਟਮ ਨੂੰ ਦੋਸ਼ੀ ਨਹੀਂ ਠਹਿਰਾਉਂਦੀ, ਪ੍ਰਕਿਰਿਆ ਅਤੇ ਪ੍ਰਣਾਲੀ 'ਤੇ ਧਿਆਨ ਕੇਂਦਰਿਤ ਕਰਦੀ ਹੈ।
- [ ] ਮੈਂ ਹਰੇਕ ਕਾਰਵਾਈਯੋਗ ਆਈਟਮ ਨੂੰ ਇੱਕ ਮਾਲਕ ਅਤੇ ਇੱਕ ਮਿਤੀ ਨਿਰਧਾਰਤ ਕੀਤੀ ਹੈ।
- [ ] ਮੈਂ AI ਨੂੰ ਦਿੱਤੇ ਇਵੈਂਟ ਡੇਟਾ ਤੋਂ ਗੁਪਤ ਅਤੇ ਨਿੱਜੀ ਜਾਣਕਾਰੀ ਨੂੰ ਨਕਾਬਪੋਸ਼ ਕੀਤਾ।
- [] ਮੈਂ ਪ੍ਰਭਾਵ ਦੇ ਅਨੁਸਾਰ ਗੰਭੀਰਤਾ ਦੇ ਪੱਧਰ ਨੂੰ ਸਹੀ ਢੰਗ ਨਾਲ ਨਿਰਧਾਰਤ ਕੀਤਾ ਹੈ।