وحدة 7 / 11

التوثيق وإدارة المعلومات: دليل التشغيل، وما بعد الوفاة، وذاكرة الشركة

المكاسب:

  • القدرة على إنتاج كتيب التشغيل وهيكل المستندات بعد الوفاة والوثائق المعمارية من الملاحظات المتناثرة باستخدام الذكاء الاصطناعي
  • القدرة على فرض الانضباط المتمثل في فرض "حظر على التصنيع" واختبار كل دليل تشغيل بدقة ووضع علامات عليه في بيئة حقيقية
  • القدرة على فهم أن دليل التشغيل الخاطئ أكثر خطورة من لا شيء والحفاظ على الوثائق حية خلال عملية التغيير

التوثيق وإدارة المعلومات: دليل التشغيل والهندسة المعمارية والذاكرة المؤسسية باستخدام الذكاء الاصطناعي

إن مهمة إدارة النظام الأكثر إهمالًا ولكنها تنقذ الحياة هي التوثيق. عندما يتعطل نظام ما ويكون الشخص الذي قام ببنائه في إجازة ولا توجد كلمة مكتوبة حول كيفية التعافي، فهي ليلة طويلة للجميع. التوثيق هو الذاكرة المؤسسية التي تجعل كيفية إعداد النظام، وكيفية عمله، وماذا تفعل في حالة حدوث مشكلة مكتوبة ومتاحة. النوع الأكثر أهمية من هذه الذاكرة هو دليل التشغيل: دليل تشغيلي يخبرك خطوة بخطوة بما يجب القيام به في موقف معين (تعطلت الخدمة، امتلاء القرص، فشل النسخ الاحتياطي). هنا يحل الذكاء الاصطناعي مشكلة "الصفحة الفارغة" و"الكسل"، وهما أكبر أعداء كتابة الوثائق: فهو ينتج دليل تشغيل منظمًا من ملاحظاتك المتناثرة، وإجراءً من سجل الأوامر، ووصفًا من الهندسة المعمارية. لكن المبدأ الحاسم هو أن الذكاء الاصطناعي ينتج المخططات والهياكل العظمية؛ أنت الشخص الذي يقوم باختبار كل خطوة والتحقق من صحتها لمعرفة ما إذا كانت صحيحة بالفعل - فكتاب التشغيل الخاطئ أكثر خطورة من عدم وجود دليل تشغيل على الإطلاق.

في هذه الوحدة، دليل التشغيل، تقرير ما بعد الوفاة (تقرير التحقيق بعد الحدث)، التوثيق المعماري وكتابة قاعدة المعرفة؛ إنشاء المسودات باستخدام الذكاء الاصطناعي؛ والأهم من ذلك أنك ستتعرف على مخاطر الوثائق التي لم يتم التحقق منها.

لماذا يعتبر دليل التشغيل الخاطئ أسوأ من عدم وجود دليل تشغيل؟

وهذا هو المفهوم الأكثر أهمية لهذه الوحدة. الفريق الذي ليس لديه دليل تشغيل يكون حذرًا ومريبًا في أوقات الذعر. يفكر مرتين في كل أمر. لكن الشخص الذي لديه دليل تشغيل "رسمي" يثق به ثقة عمياء - في منتصف الليل، تحت الضغط، ينفذ الخطوات دون سؤال. إذا تم إصدار دليل التشغيل هذا دون إنتاجه واختباره بواسطة الذكاء الاصطناعي، وكان به خطوة واحدة خاطئة (أمر خاطئ، أو شرط أساسي مفقود، أو خطوة احتياطية تم تخطيها)، فستكون النتيجة كارثية. ولهذا السبب يجب تشغيل كل دليل تشغيل تم إنتاجه باستخدام الذكاء الاصطناعي من البداية إلى النهاية في بيئة حقيقية ويجب التحقق من كل خطوة قبل نشرها. إن دليل التشغيل الذي لم يتم اختباره يشبه الوعد المطمئن ولكنه فارغ.

تحذير: قم بختم دليل التشغيل بـ "تم الاختبار: [التاريخ]، [الشخص]". قم بوضع علامة واضحة على المسودات غير المختبرة مع تسمية "مسودة - لم يتم التحقق منها". لذا، لن يطبق أحد بشكل آمن خطوات لم يتم التحقق منها في أزمة حقيقية.

تشريح كتاب جيد

يتكون دليل التشغيل الجيد من أجزاء محددة، والذكاء الاصطناعي جيد في بناء هذا الهيكل: العنوان والغرض (لأي موقف)، المتطلبات الأساسية (ما هو الوصول، ما هي الأداة المطلوبة)، الأعراض (متى أستخدم دليل التشغيل هذا)، الخطوات (مع أوامر مرقمة وقابلة للنسخ)، التحقق من الصحة (كيفية التعرف على النجاح بعد كل خطوة)، التراجع (كيفية التراجع إذا ساءت الخطوة)، والتصعيد (بمن أتصل إذا لم أتمكن من معرفة ذلك). يمكنك إعطاء الذكاء الاصطناعي ملاحظاتك المتناثرة وتطلب منه وضعها في هذا الهيكل؛ أنت فقط تضمن دقة المحتوى.

خطوة بخطوة: إنتاج التوثيق باستخدام الذكاء الاصطناعي

  1. جمع المواد الخام. سجل أوامرك، وملاحظاتك، وبريدك الإلكتروني القديم، وسجل الدردشة - المواد الحقيقية، حتى لو كانت فوضوية، أفضل من تلفيق الذكاء الاصطناعي.
  2. اسأل عن الهيكل. "اجعل هذا دليل التشغيل بالعناوين التالية: الغرض، والشرط الأساسي، والأعراض، والخطوات، والتحقق، والتراجع، والتصعيد."
  3. حظر التصنيع. "لا تضف أي أوامر أو عناوين IP أو إصدارات أو خطوات لم أقدمها لك؛ ضع علامة على أي أجزاء مفقودة على أنها [مطلوب ملؤها]." وهذا يمنع الخطأ الأكثر خطورة، وهو الخطوات التي تبدو معقولة.
  4. قناع. استخدم العنصر النائب بدلاً من المضيف الفعلي، IP، المستخدم؛ إذا تمت مشاركة الوثيقة، فلا ينبغي تسريب السر.
  5. اختبره. قم بتشغيل دليل التشغيل من البداية إلى النهاية في بيئة حقيقية (يفضل الاختبار). أصلح أي خطوات لا تعمل أو مفقودة أو غير واضحة.
  6. ختم ونشر. إضافة تاريخ الاختبار، واختبار، وآخر تحديث. التوثيق حيوي. ويجب تحديثه عندما يتغير النظام.

ثلاث حالات صغيرة

الحالة 1 - ساعتان من العمل، 15 دقيقة. كان أحد المسؤولين يؤجل توثيق إجراء استعادة النسخة الاحتياطية لعدة أشهر. لقد أعطى سجل الأوامر الطرفية (مقنعًا) وبعض الملاحظات المتفرقة إلى الذكاء الاصطناعي وأدخلها في إطار عمل دليل التشغيل. أنتج الذكاء الاصطناعي مخططًا أنيقًا في 15 دقيقة. أمضى المسؤول الـ 45 دقيقة التالية في تشغيل المسودة من البداية إلى النهاية على خادم اختبار وإصلاح الخطوتين المفقودتين. النتيجة: دليل تشغيل تم اختباره وموثوق به.

الحالة 2 - تم القبض عليه زورا. طلب فريق من الذكاء الاصطناعي كتابة دليل تشغيل الخدمة لكنه نسي حظر "التلفيق". أضاف YZ أمر "مسح ذاكرة التخزين المؤقت أولاً"، والذي يبدو منطقيًا ولكنه غير موجود في تلك الخدمة. ولحسن الحظ، قام المهندس بتشغيل دليل التشغيل في بيئة الاختبار؛ أعطى هذا الأمر خطأ. لقد صورت خطوة الاختبار خطوة مفتعلة من شأنها أن تخلق ارتباكا في أزمة حقيقية.

الحالة 3 - تسريع عملية ما بعد الوفاة. بعد انقطاع كبير، احتاج الفريق إلى كتابة تقرير بعد الوفاة، لكن لم يتمكن أحد من البدء. لقد سلموا الجدول الزمني للحدث والسجلات المقنعة إلى الذكاء الاصطناعي وطلبوا هيكلًا عظميًا خاليًا من اللوم بعد الوفاة - ملخص، وتأثير، وجدول زمني، والسبب الجذري، والإجراءات التصحيحية. لقد خفض مخطط الذكاء الاصطناعي ساعة العمل إلى عشر دقائق؛ وكرس الفريق طاقته للتحقق من الحقائق وتوضيح بنود العمل.

أربعة قوالب قابلة للنسخ

1) إنشاء هيكل عظمي لدليل التشغيل:

دورك: كبير SRE. قم بإنشاء دليل تشغيل من الملاحظات/سجل الأوامر المقنعة أدناه. العناوين: الغرض، المتطلبات الأساسية، الأعراض (متى يتم الاستخدام)، الخطوات (مرقمة، يمكن نسخها)، التحقق في كل خطوة، التراجع، التصعيد. القاعدة: لا تقم بتكوين أي أمر/IP/إصدار/خطوة لا أقدمها لك؛ اكتب الأجزاء المفقودة [ليتم ملؤها]. المادة: [ملاحظة مقنعة]

2) بعد الوفاة دون لوم:

دورك: ميسر التحقيق في الحوادث. اكتب رسمًا تخطيطيًا خاليًا من اللوم بعد الوفاة من الجدول الزمني والسجلات المقنعة التالية: الملخص، التأثير (المدة/النطاق)، الجدول الزمني، السبب الجذري (إذا تم التحقق منه)، العوامل المساهمة، الإجراءات التصحيحية (المالك + الأولوية). لا تلوم الشخص، ركز على النظام. لا تكتب السبب الجذري بدون دليل. البيانات: [...]

3) وصف الهندسة المعمارية / الخدمة:

اكتب مستند خدمة من معلومات التكوين/المخطط المقنعة التالية: ماذا تفعل الخدمة، وما هي المكونات التي تتكون منها، وما هي تبعياتها، وكيف تتدفق البيانات، وما هي المنافذ/البروتوكولات. اجعلها تقنية ولكن قابلة للقراءة. ضع علامة على العلاقة التي لست متأكدًا منها على أنها "تحتاج إلى التحقق". معلومات: [مقنعة]

4) التدقيق التنشيطي للوثائق:

قم بمراجعة المستند الحالي التالي وتحقق من العملة: (1) ما هي الأقسام المفقودة/الغامضة، (2) ما الخطوات التي تبدو غير مختبرة، (3) ما هي المعلومات التي قد تكون قديمة؟ اكتب ما يجب أن أطلبه/أتحقق منه لكل نتيجة. الوثيقة: [وثيقة ملثمة]

موجه ضعيف / موجه قوي

حث ضعيف:

اكتب لي دليل صيانة الخادم.

لا توجد مادة حقيقية. يُنتج الذكاء الاصطناعي نصًا، بالكامل من معرفته العامة، لا يناسب بيئتك أو حتى يحتوي على خطوات مُصطنعة. وهذا مصدر خطير للثقة الزائفة.

مطالبة قوية:

دورك: كبير SRE. يوجد أدناه سجل الأوامر المقنعة وملاحظاتي التي قمت بتنفيذها في حدث "قرص خدمة الدفع ممتلئ". قم بإنشاء دليل تشغيل مما يلي: الغرض، والمتطلبات الأساسية (الوصول/الأداة)، والأعراض، والخطوات المرقمة (مع أوامري)، والتحقق في كل خطوة، والتراجع، والتصعيد. لا تجعلني أتبع أمراً لم أعطه؛ اجعل الفراغ [مطلوب ملؤه]. ضع تحذير "لم يتم اختباره" في النهاية. المادة: [سجل الأوامر المقنعة]

نوع الوثيقة

مساهمة الذكاء الاصطناعي

المساهمة الإلزامية للرجل

runbook

هيكل عظمي + تخطيط

الاختبار في بيئة حقيقية، والدقة

بعد الوفاة

الخطوط العريضة + الهيكل

التحقق من الحقائق والسبب الجذري

وثيقة معمارية

الوصف + التدفق

تأكيد العلاقات والتبعيات

مقالة قاعدة المعرفة

مسودة سريعة

التحقق من الحداثة والدقة

الأخطاء الشائعة

  • نشر كتيبات التشغيل غير المختبرة. يتم تنفيذ الخطوات التي لم يتم التحقق منها بشكل أعمى في الأزمات؛ دليل التشغيل الخاطئ هو كارثة.
  • عدم فرض الحظر على التصنيع. إذا لم تقل للذكاء الاصطناعي "لا تضيف ما لم أقدمه"، فسيؤدي ذلك إلى خطوات معقولة ولكنها غير واقعية.
  • تخطي اخفاء. يتم تسريب السر عند مشاركة المستند الذي يحتوي على المضيف الحقيقي وIP والمستخدم.
  • عدم تحديث الوثيقة. المستندات التي لا يتم تحديثها عندما يتغير النظام تصبح مضللة بمرور الوقت.
  • النشر بدون ختم. ليس من الواضح ما إذا كانت الوثيقة التي لا تحتوي على تاريخ الاختبار وحالته موثوقة أم مسودة.
نصيحة: أفضل طريقة لإبقاء الوثائق "مباشرة" هي ربطها بعملية التغيير: عندما يتغير نظام ما، دع تحديث دليل التشغيل ذي الصلة يكون أحد معايير إكمال التغيير. يعمل الذكاء الاصطناعي على تسريع عملية التحديث، لكنك أنت من يقوم بعملية التشغيل.

في ملخص

التوثيق هو الذاكرة المؤسسية؛ دليل التشغيل هو دليل تشغيلي ينقذ الأرواح في أوقات الأزمات. يُنتج الذكاء الاصطناعي مسودات منظمة من ملاحظاتك الفوضوية، مما يحل مشكلة الصفحات الفارغة والكسل. ولكن الحقيقة الأكثر أهمية هي أن وجود دليل خاطئ أكثر خطورة من عدم وجود أي دليل على الإطلاق لأنه يتم تطبيقه بشكل أعمى في الأزمات. لذا، امنع الذكاء الاصطناعي من "التلفيق"، وقم بإخفائه، واختبر كل دليل تشغيل وختمه بدقة في بيئة حقيقية. احتفظ بالمستند حيًا أثناء تغير النظام. الذكاء الاصطناعي يبني الإطار؛ أنت من يضمن الدقة والاختبار.

مهمة التطبيق

اختر إجراءً غير موثق في فريقك (على سبيل المثال، إعادة تشغيل خدمة أو استعادة نسخة احتياطية). قم بإخفاء سجل الأوامر والملاحظات ذات الصلة واطلب من الذكاء الاصطناعي إنشاء مسودة باستخدام قالب "Runbook Skeleton Generation" أعلاه؛ تأكد من فرض حظر على الافتراءات. قم بتشغيل المسودة في بيئة اختبار ووضع علامة على أي خطوات معطلة/مفقودة وإصلاحها. أضف تاريخ الاختبار ومعلومات الاختبار إلى دليل التشغيل. قم بتدوين الاختلافات التي ينتجها الذكاء الاصطناعي وقم بتصحيحها في العملية في 5 عناصر.

قائمة مرجعية

  • [ ] لقد قمت بإنشاء دليل التشغيل من مادة حقيقية (ملاحظة، سجل الأوامر)، ألم أصنعه من الصفر؟
  • [ ] هل منعت الذكاء الاصطناعي من "إضافة أوامر/عناوين IP/خطوات لم أقدمها"؟
  • [ ] هل قمت بإخفاء معلومات حساسة مثل المضيف وIP والمستخدم؟
  • [ ] هل قمت بتشغيل دليل التشغيل والتحقق من صحته في بيئة حقيقية/اختبارية؟
  • [ ] هل قمت بإضافة تاريخ الاختبار ومعلومات الاختبار وآخر تحديث؟
  • [ ] هل خططت لربط المستند بعملية تغيير النظام وإبقائه محدثًا؟