وحدة 11 / 11

التكامل الشامل: إدارة الحادث من البداية إلى النهاية

المكاسب:

  • إدارة شاملة للحادث مع دعم الذكاء الاصطناعي في الكشف والتشخيص والتخفيف والحل الدائم ومراحل التعلم
  • القدرة على الحفاظ على انضباط التحقق حتى في أوقات الذعر من خلال فصل الخطوات التي يمكن نقلها إلى الذكاء الاصطناعي وتلك التي تتطلب قرارًا بشريًا في كل مرحلة.
  • القدرة على تحويل القاعدة الذهبية التي تقول بأن الذكاء الاصطناعي له الأسبقية على أسئلة "ما يحدث، وكيفية كتابة"، وللبشر الأولوية على أسئلة "هل يجب أن أفعل ذلك، ومن هو الضامن"، إلى رد فعل تجاري

التكامل الشامل: إدارة الحادث من النهاية إلى النهاية باستخدام الذكاء الاصطناعي

لقد تعلمت الأجزاء الموجودة في الوحدات العشر السابقة: البرمجة النصية، وتحليل السجل، والمراقبة، والتكوين، وIaC، والتوثيق، والصيانة التنبؤية، وإدارة التغيير، والأمان. لكن في العالم الحقيقي، لا تأتي هذه الأجزاء واحدة تلو الأخرى، بل تتشابك داخل الحدث. في هذه الوحدة النهائية، نجمع القطع معًا: سترى في مجملها كيفية إدارة حادث بدأ في منتصف الليل، من البداية إلى النهاية، بدءًا من الاكتشاف وحتى السبب الجذري، ومن العلاج إلى التوثيق، واستخدام الجرعة المناسبة من الذكاء الاصطناعي في كل مرحلة. الهدف ليس تعليم تقنية جديدة؛ ربط ما تعلمته كرد فعل مهندس، مما يعزز الحقيقة الواحدة التي تتكرر في جميع أنحاء الوحدة: يقوم الذكاء الاصطناعي بالتسريع والإضاءة والمخططات في كل مرحلة؛ ولكن دائما الإنسان هو الذي يؤكد التشخيص، ويدير الأمر، ويؤكد التغيير، ويتحمل مسؤولية النتيجة.

في هذه الوحدة، ستدمج دورة حياة الحادث - الاكتشاف والتشخيص والتدخل والحل والتعلم - ودور الذكاء الاصطناعي وحدوده في كل مرحلة من خلال مثال.

دورة حياة الحدث

كل حادثة خطيرة تمر بمراحل مماثلة، وللذكاء الاصطناعي دور مختلف في كل مرحلة. الكشف: صدور إنذار، شكوى مستخدم، انحراف المقياس عن خط الأساس (الوحدة 4). التحقق من الصحة والنطاق: هل هي مشكلة حقًا، وما مدى اتساعها؟ التشخيص: الوصول إلى السبب الجذري من السجلات والمقاييس (الوحدة 3). الاستجابة والتخفيف: إيقاف الضرر، الحل البديل. الحل الدائم: الإصلاح باستخدام إدارة التغيير (الوحدة 9)، أو البرنامج النصي (الوحدة 2)، أو التكوين إذا لزم الأمر (الوحدة 5). التعلم: تحديث ما بعد الوفاة وكتاب التشغيل (الوحدة 7). يحدد الذكاء الاصطناعي الشذوذ في الكشف، وينتج فرضيات في التشخيص، ويقدم خيارات في التدخل، ويكتب المسودات في الحلول، وينتج المستندات في التعلم - ولكن في كل مرحلة، يقف البشر عند نقطة اتخاذ القرار.

نصيحة: إن أخطر لحظة في أي حادث هي لحظة التشخيص والاستجابة عندما يكون التوتر في أعلى مستوياته - على وجه التحديد عندما تكون الرغبة في الثقة العمياء في الذكاء الاصطناعي أقوى. كلما اندفعت أكثر، كلما تمسكت بصرامة بردة الفعل "اقرأ، تحقق، استعد للعودة". إن تخطي عملية تحقق واحدة في لحظة الذعر يضاعف الحدث.

مثال من البداية إلى النهاية

دعونا نجعلها ملموسة. إنذار عند الساعة 02:10: زمن استجابة خدمة الدفع p99 هو 6 ثوانٍ، وهو أعلى بكثير من خط الأساس (250-400 مللي ثانية). الكشف صحيح: تم التتبع. التأكيد: تأكيد من مواقع متعددة، حدث حقيقي. التشخيص: يقدم المهندس سجلًا ومقاييس مقنعة لآخر 20 دقيقة إلى الذكاء الاصطناعي؛ يحدد الذكاء الاصطناعي جدولًا زمنيًا ويحدد أن التباطؤ يبدأ فورًا بعد النشر في الساعة 02:08 - وهو ارتباط قوي، ولكنه لا يزال مجرد فرضية. يؤكد المهندس ذلك من خلال سجل النشر: نعم، تم إصدار الإصدار في الساعة 02:08. الرد: أسرع تخفيض هو التراجع عن التوزيع؛ خطوة التراجع في طلب التغيير جاهزة (الوحدة 9). يقوم المهندس أولاً بتنفيذ عملية التراجع على الخادم باستخدام منطق الكناري، ويحسن وقت الاستجابة، ثم ينشرها. الحل الدائم: سيتم إصلاح السبب الجذري الحقيقي (الاستعلام غير المفهرس في الإصدار الجديد) بهدوء في اليوم التالي. التعلم: تتم صياغة تقرير ما بعد الوفاة بدون استخدام الذكاء الاصطناعي، كما تتم إضافة خطوة "مراقبة ما بعد النشر p99" إلى دليل التشغيل. وفي كل مرحلة، تسارع الذكاء الاصطناعي؛ التحقق من صحة الإنسان في كل نقطة قرار.

القاعدة الذهبية لتقسيم العمل بين الإنسان والذكاء الاصطناعي

يصبح التمييز الذي تراه خلال الوحدة قاعدة هنا: يتقدم الذكاء الاصطناعي في أسئلة "ما يحدث، وما يمكن أن يحدث، وكيفية الكتابة"؛ يتقدم الناس عندما يتعلق الأمر بأسئلة مثل "هل يجب أن أفعل هذا الآن، من يستطيع أن يضمن ذلك؟" الذكاء الاصطناعي لا يكل، وسريع، ويقوم بمسح معلومات ضخمة وإنشاء مخططات - ولكنه لا يعرف السياق الكامل، ويمكن أن يسبب الهلوسة، ولا يمكنه التعامل مع المساءلة، ولا يرى التبعيات الخفية لمؤسستك. الإنسان بطيء، لكنه يحمل السياق والمسؤولية والحكم. أفضل نتيجة هي التقسيم الصحيح للعمل بين الاثنين: تفويض العمل المتكرر والنصي والقابل للإنتاج إلى الذكاء الاصطناعي؛ الحفاظ على التحقق والقرار والتنفيذ الإنسان.

ثلاث حالات صغيرة

الحالة 1 - 40 دقيقة من النهاية إلى النهاية. في حدث امتلاء القرص، قام SRE بتسريع السلسلة بأكملها باستخدام الذكاء الاصطناعي: أكد الإنذار بخط الأساس (5 دقائق)، وتم تلخيص السجل المقنع إلى YZ ووجد الخطأ الأول (5 دقائق)، والتحقق من فرضية "توقف دوران السجل" الخاصة بالذكاء الاصطناعي على النظام الحقيقي (5 دقائق)، وتشغيل وتنفيذ نص تنظيف جاهز مع التشغيل الجاف (10 دقائق)، وتم كتابة رسم ما بعد الوفاة إلى الذكاء الاصطناعي والتحقق من الحقائق (15 دقيقة). إجمالي 40 دقيقة؛ ما يقرب من ضعف ذلك بدون الذكاء الاصطناعي. ولكن كانت هناك خطوة تحقق في كل مرحلة.

الحالة 2 - تخطي التحقق في لحظة الذعر. هرع فريق آخر إلى القطع. لقد قبلت فرضية السبب الجذري الأول للذكاء الاصطناعي (خدمة التبعية) دون التحقق منها وأعادت تشغيل تلك الخدمة. لم يتم حل المشكلة لأن السبب الحقيقي كان شيئا آخر؛ علاوة على ذلك، أدت عملية إعادة التشغيل غير الضرورية إلى حدوث انقطاع ثانٍ. الدرس المستفاد: التسرع ليس مبررا لتخطي التحقق؛ قبل تأكيد فرضية الذكاء الاصطناعي، يعمل الإجراء على تصعيد الحدث.

الحالة الثالثة - إدراك الحد. كان أحد المهندسين على وشك تنفيذ تغيير في التكوين كان الذكاء الاصطناعي يحث عليه بشأن مشكلة معقدة في الشبكة. لكن التغيير بدا لا رجعة فيه، ولم يكن الذكاء الاصطناعي يعرف قواعد التوجيه المحددة للوكالة. توقف المهندس واستشار أحد كبار خبراء الشبكات، وعلم أن اقتراح الذكاء الاصطناعي من شأنه أن ينشئ حلقة توجيه في هذه الهيكلية المحددة. معرفة حدود الذكاء الاصطناعي حالت دون حدوث أي خلل.

أربعة قوالب قابلة للنسخ

1) ملخص مشغل الحدث (الفرز):

دورك: كبير SRE، مساعد قائد الحادث. هناك حدث نشط. يمنحني التنبيه/المقياس/السجل المقنع الذي أقدمه لك فرزًا سريعًا: (1) ما هو العرض، (2) ما هو نطاق التأثير، (3) 3 مناطق يجب النظر إليها أولاً، (4) أمر تحكم للقراءة فقط لكل منها. القرار والتنفيذ لي. أرسل الطريق. البيانات: [ملثمين]

2) دليل إدارة الحوادث المرحلية:

خذني خطوة بخطوة عبر دورة حياة الحادث للأعراض [الأعراض]: تأكيد الاكتشاف، والتشخيص، والتخفيف، والحل الدائم، والتعلم. في كل مرحلة، أخبرني (أ) ما الذي يجب أن أفعله، (ب) متى يمكنني تفويض ذلك بأمان إلى الذكاء الاصطناعي، (ج) ما هو القرار الذي يجب أن أتخذه بنفسي. قم بوضع علامة على خطوات التحقق التي لا يجب أن أتخطاها حتى لو استعجلت.

3) التحكم في نقطة القرار:

أنا في منتصف حدث ما وعلى وشك اتخاذ الإجراء التالي: [إجراء]. قبل التنفيذ، اسألني: (1) هل هذا الأمر قابل للتراجع، (2) ما هو التحقق الذي قمت به/لم أفعله، (3) هل لدي خطة التراجع، (4) هل لدي دليل على أن هذا الإجراء قد أدى بالفعل إلى حل السبب الجذري؟ إذا رأيت أي شيء مفقود، أوقفني.

4) التعلم المتكامل بعد الحدث:

بالنسبة للحادث الذي تم حله للتو، يعطيني [الملخص] ما يلي: (1) مسودة ما بعد الوفاة دون إلقاء اللوم، (2) 3 تحسينات دائمة (المراقبة/الأتمتة/التكوين) من شأنها منع هذا الحادث، (3) خطوات دليل التشغيل التي تحتاج إلى تحديث، (4) اقتراح إشارة إنذار مبكر لحادث مماثل. كتابة السبب الجذري دون دليل؛ بناء على الحقائق.

موجه ضعيف / موجه قوي

حث ضعيف:

لقد تعطل النظام، ماذا علي أن أفعل؟

مذعورًا، بدون سياق وبدون التحقق، يتلقى هذا الموجه نصيحة عامة وربما خطيرة من الذكاء الاصطناعي. التسرع يؤدي إلى الأخطاء في هذه المرحلة أكثر من غيرها.

مطالبة قوية:

دورك: مساعد قائد الحادث. الحدث النشط: وقت استجابة خدمة الدفع ip99 15 مرة من خط الأساس (250-400 مللي ثانية) منذ الساعة 02:10. أعلم أنه كان هناك توزيع في الساعة 02:08. أعطني: (1) الفرضية الأكثر ترجيحًا وكيفية التحقق منها للقراءة فقط، (2) خيار التخفيف الأسرع والقابل للعكس، (3) المخاطر التي أحتاج إلى التحكم فيها قبل تطبيق هذا التخفيف. عندي التنفيذ والموافقة. بيانات إضافية: [قياس/سجل مقنع]

مرحلة الحدث

دور الذكاء الاصطناعي

قرار إنساني حاسم

الكشف

ضع علامة على الشذوذ

هل هو الحدث الفعلي، ما هو نطاقه؟

التشخيص

توليد الفرضيات

ما هي الفرضية التي تم تأكيدها؟

تخفيض

لا تقدم خيارات

ما هو التخفيض الذي يمكن عكسه؟

الحل الدائم

مسودة/نص

الموافقة على التغيير وتنفيذه

التعلم

رسم ما بعد الوفاة

التحقق من الحقائق والدروس

الأخطاء الشائعة

  • تخطي التحقق في حالة من الذعر. التسرع ليس مبررا للتخلي عن منعكس "القراءة والتحقق والتحضير للعودة". مع زيادة التوتر، يجب أن يزيد الانضباط.
  • الخلط بين الفرضية والأدلة. سيؤدي اتخاذ إجراء دون تأكيد اقتراح السبب الجذري الأول للذكاء الاصطناعي إلى تصعيد الحادث.
  • نسيان حدود سياق الذكاء الاصطناعي. الذكاء الاصطناعي لا يعرف التبعيات الخفية للمنظمة؛ في التغيير النقدي، يسود الحكم البشري.
  • تخطي مرحلة التعلم. يبدأ الحدث مرة أخرى في نفس الليلة، دون تحديثات ما بعد الوفاة أو دليل التشغيل.
  • إلقاء المسؤولية على الذكاء الاصطناعي. "قال الذكاء الاصطناعي" ليس دفاعًا؛ ومسؤولية التنفيذ تقع دائما على عاتق الإنسان.
تنبيه: استخدام الذكاء الاصطناعي في إدارة الحوادث لا يحل محل إدارة حوادث التعلم. قد تتعطل السيارة أو تتحطم أو يتعذر الوصول إليها. المهندس الذي يعرف الأساسيات يكون أسرع مع الذكاء الاصطناعي؛ المهندس الذي لا يعرف الأساسيات سوف يرتكب الأخطاء بشكل أسرع مع الذكاء الاصطناعي. قم أولاً بتأسيس الانضباط، ثم احصل على السرعة من الذكاء الاصطناعي.

في ملخص

في العالم الحقيقي، لا تأتي الأجزاء واحدة تلو الأخرى، بل تتشابك داخل الحدث. عند إدارة حدث ما، بدءًا من الكشف وحتى التعلم، يقوم الذكاء الاصطناعي بالتسريع في كل مرحلة: وضع علامة على الشذوذ، وإنشاء الفرضيات، وتقديم الخيارات، والمسودات، والتحضير لما بعد الوفاة. ولكن عند كل نقطة قرار يتوقف المرء - يؤكد التشخيص، ويختار التقليل، ويوافق على التغيير، ويمتلك النتيجة. القاعدة الذهبية واضحة: الذكاء الاصطناعي متقدم في أسئلة "ماذا يحدث، كيف نكتب"، والبشر متقدمون في أسئلة "هل يجب أن أفعل ذلك، من هو الضامن؟" في أوقات الذعر، قم بزيادة الانضباط، وفصل الفرضيات عن الأدلة، وتذكر حدود سياق الذكاء الاصطناعي، واستخلص درسًا كتابيًا من كل حدث. جوهر هذه الوحدة هو جملة واحدة: الذكاء الاصطناعي هو مساعد قوي؛ لا يمكن تفويض المسؤولية الهندسية.

مهمة التطبيق

فكر في حدث مررت به (أو تخيلته) في ماضيك، من البداية إلى النهاية. باستخدام نموذج "دليل إدارة الحوادث المرحلية" أعلاه، اطلب من الذكاء الاصطناعي توجيه الحادث خلال مراحل الكشف والتشخيص والتخفيف والحل والتعلم؛ في كل مرحلة، اكتب بشكل منفصل الخطوة التي يمكنك تفويضها إلى الذكاء الاصطناعي والخطوة التي تحتاج إلى اتخاذ القرار بنفسك. قم بتأكيد فرضية واحدة على الأقل للذكاء الاصطناعي باستخدام أمر التحقق أثناء مرحلة التشخيص. أخيرًا، قم بإعداد مسودة تحديث بعد الوفاة ودليل التشغيل باستخدام قالب "التعلم المتكامل بعد الحدث". قم بتلخيص تقسيم العمل بين الإنسان والذكاء الاصطناعي في العملية برمتها في 7 عناصر.

قائمة مرجعية

  • [ ] هل قمت بتقسيم الحادثة إلى مراحل الكشف والتشخيص والتخفيف والحل والتعلم؟
  • [ ] هل ميزت بين الخطوات التي يمكن تفويضها للذكاء الاصطناعي وتلك التي تتطلب اتخاذ قرار بشري في كل مرحلة؟
  • [ ] في التشخيص، هل قمت بفصل فرضية الذكاء الاصطناعي عن الأدلة وأكدتها بأمر التحقق؟
  • [ ] هل قمت بتقييم عملية التخفيف من حيث خطة التراجع والتراجع؟
  • [ ] هل حافظت على رد الفعل "القراءة والتحقق والتحضير للعودة" حتى في أوقات الذعر؟
  • [ ] هل تعلمت درسًا بعد الوفاة ودرسًا من الحادثة؟

امتحان الوحدة

1. أي مما يلي هو الموضع الأكثر دقة للذكاء الاصطناعي في إدارة النظام والشبكة؟

  • أ) الذكاء الاصطناعي هو أداة مساعدة ودعم القرار؛ المسؤولية والموافقة النهائية على القرارات التنفيذية الحاسمة تقع على عاتق الإنسان✔
  • ب) يمكن للذكاء الاصطناعي تشغيل الأوامر وتنفيذ التغييرات في الإنتاج دون موافقة الإنسان
  • ج) الذكاء الاصطناعي يعمل فقط في كتابة النص، ولا علاقة له بعمل النظام والشبكة
  • د) يتخذ الذكاء الاصطناعي دائمًا قرارات أكثر دقة من البشر، لذا فإن التحقق ليس ضروريًا

الوصف: الذكاء الاصطناعي هو أداة مساعدة ودعم اتخاذ القرار تنتج المسودات والتحليلات مثل البرامج النصية وتحليل السجلات والمستندات. المسؤولية والموافقة النهائية على القرارات التنفيذية التي تؤثر على التوقف وفقدان البيانات والأمن، مثل تنفيذ أمر أو الموافقة على التغيير، تعود إلى المهندس المختص.

2. ما هي الخطوات الأربع لرد التحقق الذي يجب تنفيذه قبل تشغيل أمر تم إنشاؤه بواسطة الذكاء الاصطناعي في الإنتاج؟

  • أ) نسخ، لصق، تشغيل، أمل
  • ب) اقرأ وافهم، وثق، حاول في بيئة معزولة، استعد للملاحظات ✔
  • ج) الإعجاب والمشاركة والحفظ والأرشفة
  • د) الحذف، إعادة الكتابة، الضغط، الإرسال

الوصف: أربع خطوات لتطبيقها على المخرجات المهمة: (1) قراءة سطر الأوامر وفهمه سطرًا، (2) ربط الإشارات وبناء الجملة بالوثائق الرسمية، (3) تجربته في بيئة معزولة/اختبارية، والتشغيل التجريبي إذا أمكن، (4) إعداد خطة احتياطية (نسخ احتياطي، لقطة) إذا حدث خطأ.

3. ماذا يعني أن يكون البرنامج النصي الآلي "عاجزًا" وما سبب أهميته؟

  • أ) ينتج البرنامج النصي نتائج مختلفة في كل عملية تشغيل
  • ب) يمكن تشغيل البرنامج النصي مرة واحدة فقط ثم يتم حذفه
  • ج) لا يسبب البرنامج أي ضرر عند تشغيله للمرة الثانية؛ ✔ آمن حتى لو تم تشغيله مرة أخرى
  • د) لا يحتوي البرنامج النصي على إدارة الأخطاء

Explanation: Idempotency تعني أنه عند تشغيل نفس البرنامج النصي مرتين أو أكثر، فإنه لا يسبب ضررًا أو ينتج أخطاء في التشغيل الثاني. تم إنشاء منطق مثل "تخطي إذا كان المستخدم موجودًا بالفعل"، و"إنشاء الدليل إذا لم يكن موجودًا، ولا تلمسه إذا كان موجودًا". وهذا يضمن أن الأتمتة تعمل بأمان حتى لو تم تشغيلها مرة أخرى عن طريق الخطأ.

4. ما هي الطريقة الأساسية لتأمين البرنامج النصي الذي يحتوي على عمليات تدميرية (الحذف، إعادة التشغيل)؟

  • أ) قم بتشغيل البرنامج النصي في أسرع وقت ممكن
  • ب) إخفاء رسائل الخطأ
  • ج) اختبار النص مباشرة في الإنتاج
  • د) وضع العمليات التدميرية خلف التشغيل التجريبي الافتراضي وربط التنفيذ الفعلي بعلامة تحديد صريحة ✔

Explanation: الاحتفاظ بالعمليات التدميرية في وضع التشغيل الجاف بشكل افتراضي وتشغيل التطبيق الفعلي فقط مع إشارة موافقة صريحة (على سبيل المثال --apply) يسمح لك برؤية ما سيحدث عند تشغيل البرنامج النصي أولاً. كما يمنع التحقق من المتغيرات الخالية (VAR:؟) أخطاء المسار.

5. ماذا يعني مبدأ "الارتباط ليس السببية" في تحليل السجل؟

  • أ) الحدثان اللذان يتغيران معًا ليسا بالضرورة في علاقة سببية؛ ويجب أيضًا التحقق من السببية✔
  • ب) البحث عن الارتباط في السجلات هو مضيعة للوقت
  • ج) من بين حدثين يتغيران معًا، يكون أحدهما سببًا للآخر بالتأكيد.
  • د) لا يمكن تحديد السببية إلا عن طريق الذكاء الاصطناعي

Explanation: مجرد وقوع حدثين في نفس الوقت (الارتباط) لا يعني أن أحدهما يسبب الآخر (السببية)؛ وكلاهما قد يكون نتيجة لحدث ثالث. إن اقتراح الذكاء الاصطناعي بأن "X ربما تسبب في Y" هو فرضية ولا يعتبر نتيجة حتى يتم التحقق منها في النظام.

6. لماذا يفضل المئين (p95/p99) على المتوسط ​​عند قياس زمن الاستجابة في مراقبة الأداء؟

  • أ) حساب النسبة المئوية أسهل من حساب المتوسط
  • ب) يخفي المتوسط التجربة السيئة للأقلية؛ المئوي يكشف هذه المشاكل الخفية✔
  • ج) المتوسط دائمًا خاطئ ولا يجب استخدامه
  • د) تنطبق النسبة المئوية فقط على مقاييس وحدة المعالجة المركزية

توضيح: المتوسط يخفي التجربة السيئة للغاية التي يمر بها جزء صغير من المستخدمين. على الرغم من أن المتوسط ​​يبدو 200 مللي ثانية، إلا أن p99 قد يكون 6 ثوانٍ؛ وهذا يعني أن واحدًا من كل مائة طلب يكون بطيئًا للغاية. يُظهر المئين ألم هذه الأقلية الذي يخفيه المتوسط.

7. ما هو "الانجراف" في إدارة التكوين ولماذا يعتبر خطيرًا؟

  • أ) تنخفض حركة مرور الشبكة ليلاً
  • ب) النقل الفعلي للخادم
  • ج) تنحرف الخوادم عن بعضها البعض وعن المعيار بمرور الوقت؛ ✔ غير مرئية حتى تحدث مشكلة
  • د) النسخ الاحتياطي التلقائي لملفات التكوين

الوصف: الانحراف هو انحراف الخوادم عن بعضها البعض وعن المعيار من خلال تغييرات يدوية غير موثقة مع مرور الوقت. وتكمن خطورته في صمته: فهو لا يكون مرئيًا إلا بعد حدوث المشكلة، ثم يتصرف أحد الخوادم بشكل مختلف عن الخوادم الأخرى ويستغرق التشخيص ساعات. الذكاء الاصطناعي يجعل الانجراف مرئيا بالمقارنة؛ يمنع مبدأ اللحام بالذهب.

8. لماذا تعتبر خطوة "الخطة" هي حاجز الأمان الأكثر أهمية في أدوات IaC (مثل Terraform)؟

  • أ) تعمل الخطة على تشغيل الكود بشكل أسرع
  • ب) حذف ملف حالة الخطة
  • ج) تعمل الخطة على إصلاح تنسيق التعليمات البرمجية فقط
  • د) توضح الخطة ما سيتم إضافته وتغييره وحذفه قبل التنفيذ؛ يمنع فقدان البيانات ✔

الوصف: توفر الخطة (خطة Terraform / ansible --check) معاينة "ما سيتغير" قبل تنفيذ الكود: عدد الموارد التي ستتم إضافتها أو تغييرها أو حذفها. وعلى وجه الخصوص، يشير خطا "التدمير" و"استبدال القوات" إلى خطر فقدان البيانات قبل التنفيذ. يعد التقديم دون قراءة الخطة من أغلى الأخطاء.

9. لماذا يجب حماية ملف حالة Terraform بعناية وعدم لصقه في الذكاء الاصطناعي أو المستودعات المفتوحة؟

  • أ) يجوز تضمين أسرار النص العادي في ملف الدولة؛ وفي حالة التسريب سيتم الكشف عن معلومات الهوية ✔
  • ب) لأن ملف الحالة كبير جدًا
  • ج) ملف الحالة مشفر بالفعل بشكل غير قابل للقراءة.
  • د) يعمل الكود بشكل أسرع عند مشاركة ملف الحالة

الوصف: يحتفظ ملف الحالة بالحالة الحالية للبنية التحتية المُدارة ويمكن أن يتضمن أسرار نص عادي (كلمات مرور قاعدة البيانات، والمفاتيح). لذلك، يجب الاحتفاظ بها في واجهة خلفية بعيدة مشفرة ومقيدة الوصول ومقفلة؛ ولا ينبغي أبدًا وضعها في مركبة عامة أو مستودع، وإلا فسوف يتسرب السر.

10. ما الذي تؤكده عبارة "وجود دليل خاطئ أكثر خطورة من عدم وجود دليل" في الوثائق؟

  • أ) كتابة دليل التشغيل مضيعة للوقت
  • ب) يتم تطبيق دليل تشغيل لم يتم اختباره بشكل أعمى في الأزمات؛ خطوة واحدة خاطئة قد تؤدي إلى كارثة✔
  • ج) تتم كتابة Runbooks للمسؤولين فقط
  • د) لا ينبغي أبدا تحديث الوثائق

الشرح: الفريق الذي ليس لديه دليل إرشادي يتسم بالحذر والشك أثناء الأزمات؛ لكن الشخص الذي لديه دليل تشغيل "رسمي" يطبقه تحت الضغط دون استجواب. إذا لم يتم اختبار دليل التشغيل وكان به خطوة واحدة خاطئة، فإن التنفيذ الأعمى سيؤدي إلى كارثة. ولهذا السبب يجب اختبار كل دليل تشغيل بشكل كامل وختمه في بيئة حقيقية.

11. في الصيانة التنبؤية، ما هو الأسلوب الصحيح لفهم متى يقترب القرص من الفشل؟

  • أ) استبدل قرص SMART واحدًا تالفًا على الفور
  • ب) التجاهل التام لبيانات SMART
  • ج) النظر في اتجاه القيم مع مرور الوقت؛ ✔ زيادة متسقة ومتسارعة في عدد الإشارات
  • د) عدم اتخاذ الإجراء إلا بعد انهيار القرص بالكامل

شرح: قراءة واحدة سيئة لـ SMART لا تسبب الذعر؛ من الطبيعي أن يتم تصحيح الأخطاء العرضية للأقراص. الإشارة الحقيقية هي الاتجاه: الزيادة المستمرة والمتسارعة في القيم مثل إعادة تخصيص القطاع بمرور الوقت. ولهذا السبب يُعطى الذكاء الاصطناعي سلسلة زمنية، وليس قراءة واحدة.

12. ما هما الجزءان الأكثر أهمية في عملية تغيير الإنتاج، ولكنهما يتم التغاضي عنهما في كثير من الأحيان؟

  • أ) لون واسم التغيير
  • ب) عنوان وقسم الشخص الذي يقوم بالتغيير
  • ج) الإعلان عن التغيير على وسائل التواصل الاجتماعي
  • د) خطة التراجع ومعايير التحقق من النجاح ✔

توضيح: إذا لم تكن هناك إجابة مكتوبة على الأسئلة "كيف يمكنني بالضبط التراجع إذا ساءت" (خطة التراجع) و"كيف يمكنني إثبات نجاحها" (معايير التحقق من النجاح) قبل تنفيذ التغيير، فإن هذا التغيير ليس جاهزًا بعد. وبدون هذين الأمرين، يمكن اعتبار التغيير المعطل "كاملاً".

13. لماذا يُفضل أسلوب "الكناري" بدلاً من نشر الأمان (الإصدار/التصحيح الجديد) على جميع الخوادم في نفس الوقت؟

  • أ) يتم تطبيق التغيير أولاً على جزء صغير؛ يؤثر الخلل على جزء صغير، وليس الأسطول بأكمله، ويتم اكتشافه مبكرًا ✔
  • ب) توزيع الكناري يستهلك كهرباء أقل
  • ج) يجعل Canary التحقق من النشر غير ضروري على الإطلاق
  • د) ينطبق نشر Canary فقط على قواعد البيانات

الوصف: نشر Canary هو تطبيق التغيير على جزء صغير (خادم واحد، 5% من المستخدمين) أولاً والمراقبة. بهذه الطريقة، يؤثر الخلل على جزء صغير، وليس الأسطول بأكمله، ويتم اكتشافه مبكرًا. خطأ ينتشر مرة واحدة ويصيب جميع المستخدمين في نفس الوقت.

14. ما هي القاعدة الأخلاقية والقانونية الثابتة عند استخدام الذكاء الاصطناعي في العمل الأمني؟

  • أ) يمكن استخدام الذكاء الاصطناعي بحرية للبحث عن نقاط الضعف في أي نظام
  • ب) لا تنطبق قواعد الأخلاق إلا على المؤسسات الكبيرة
  • ج) يتم استخدامه فقط في الأنظمة المصرح بها ولأغراض الدفاع؛ يعتبر الاستخدام للوصول غير المصرح به أو الهجوم جريمة ✔
  • د) حرية التسلل إلى نظام شخص آخر من أجل التعلم.

الوصف: معلومات النظام والشبكة ذات استخدام مزدوج. لا يمكن استخدام الذكاء الاصطناعي إلا في الأنظمة التي حصلت على تصريح كتابي لها ولأغراض دفاعية (اكتشاف تهديدات السجل، والتعزيز، والاستجابة للحوادث). ويعتبر استخدامه لمسح نظام لا ينتمي إليك أو التسلل إليه بمثابة وصول غير مصرح به وجريمة؛ يجب استخدام مختبر معزول للتعلم.