หน่วย
1. ความรู้เบื้องต้นเกี่ยวกับปัญญาประดิษฐ์ในการจัดการระบบและเครือข่าย: บทบาท ขอบเขต การรับรองความถูกต้อง และอำนาจหน้าที่ 2. สคริปต์อัตโนมัติ: การสร้าง Bash, PowerShell และ Python อย่างปลอดภัย 3. การวิเคราะห์บันทึกและการวิเคราะห์สาเหตุหลัก: การค้นหาสัญญาณในสัญญาณรบกวน 4. การตรวจสอบความสามารถและประสิทธิภาพ: การอ่านตัวชี้วัดและการวางแผนสำหรับอนาคต 5. การจัดการการกำหนดค่า: การสร้างการกำหนดค่า การตรวจสอบ และการจับดริฟท์ 6. การจัดการโครงสร้างพื้นฐานเป็นรหัส (IaC): Terraform, Ansible และ Plan Control 7. การจัดการเอกสารและสารสนเทศ: Runbook, Post-mortem และ Corporate Memory 8. การบำรุงรักษาเชิงคาดการณ์: การมองเห็นความล้มเหลวก่อนที่จะเกิดขึ้น 9. การจัดการการเปลี่ยนแปลง: การประเมินความเสี่ยง การย้อนกลับ และช่วงเวลาการบำรุงรักษา 10. การรักษาความปลอดภัยและการป้องกัน: การใช้ปัญญาประดิษฐ์เพื่อวัตถุประสงค์ในการป้องกันและอยู่ภายในขอบเขตอำนาจ 11. การบูรณาการแบบครบวงจร: การจัดการเหตุการณ์ตั้งแต่ต้นจนจบ
หน่วย 4 / 11

การตรวจสอบความสามารถและประสิทธิภาพ: การอ่านตัวชี้วัดและการวางแผนสำหรับอนาคต

กำไร:

  • ความสามารถในการตีความหน่วยวัดอย่างถูกต้องด้วยการสนับสนุนปัญญาประดิษฐ์โดยใช้เปอร์เซ็นไทล์ (p95/p99) และเส้นพื้นฐานแทนค่าเฉลี่ย
  • ความสามารถในการแยกฤดูกาลออกจากแนวโน้มและสร้างการคาดการณ์กำลังการผลิตเป็นช่วงในแง่ดี-แง่ร้ายแทนที่จะเป็นตัวเลขตัวเดียว
  • การทำความเข้าใจว่าการลงทุนทรัพยากรและการตัดสินใจตามเกณฑ์การแจ้งเตือนนั้นขึ้นอยู่กับมนุษย์ พร้อมด้วยระยะเวลารอคอยทรัพยากรและบริบททางธุรกิจ

การตรวจสอบความสามารถและประสิทธิภาพ: การอ่านตัวชี้วัดด้วย AI และการวางแผนอนาคต

คุณไม่สามารถมองเห็นความสมบูรณ์ของระบบด้วยตาของคุณเอง คุณเข้าใจมันผ่านการวัด ตัวชี้วัดคือค่าตัวเลขขึ้นอยู่กับเวลาของคุณลักษณะที่สามารถวัดได้ของระบบ: การใช้งาน CPU, การใช้หน่วยความจำ, พื้นที่ว่างในดิสก์, เวลาแฝงของเครือข่าย, คำขอต่อวินาที การตรวจสอบประสิทธิภาพจะรวบรวมตัวชี้วัดเหล่านี้อย่างต่อเนื่องและตอบคำถาม "ระบบโอเคตอนนี้หรือไม่" การวางแผนกำลังการผลิตก้าวไปอีกขั้น: ตอบคำถาม "ในอัตรานี้ ฉันจะไม่เพียงพอเมื่อใด ฉันควรซื้อทรัพยากรใหม่เมื่อใด" ที่นี่ AI เป็นผู้ช่วยที่มีทักษะสูงในการตีความกองเมตริก การทำเครื่องหมายความผิดปกติ การอ่านแนวโน้ม และสร้างการคาดการณ์ในอนาคต แต่ข้อแม้ประการหนึ่งมีชัยเหนือสิ่งอื่นใด: AI แยกรูปแบบจากข้อมูลในอดีต คุณเป็นคนหนึ่งที่ตัดสินใจลงทุน ปรับขนาด และแจ้งเตือนตามเกณฑ์ตามบริบท

ในหน่วยนี้ แนวคิดในการติดตาม เช่น เส้นพื้นฐาน (เส้นพฤติกรรมปกติ) ความผิดปกติ (เบี่ยงเบนจากปกติ) เปอร์เซ็นไทล์ (เปอร์เซ็นไทล์) การตีความหน่วยเมตริกด้วย AI; การพยากรณ์แนวโน้มและการเติบโต และคุณจะได้เรียนรู้การตั้งค่าเกณฑ์การเตือนที่ถูกต้อง

ค่าเฉลี่ยอยู่: ทำไมต้องเปอร์เซ็นไทล์?

ข้อผิดพลาดที่พบบ่อยที่สุดในการติดตามคือการวัดทุกอย่างด้วยค่าเฉลี่ย สมมติว่าเวลาตอบสนองของคุณคือ 200 มิลลิวินาทีโดยเฉลี่ย ฟังดูดี. แต่ผู้ใช้ 5% อาจรอ 8 วินาที ค่าเฉลี่ยซ่อนสิ่งนี้ไว้ นั่นเป็นสาเหตุที่ผู้เชี่ยวชาญใช้เปอร์เซ็นไทล์: p95 = "95% ของคำขออยู่ต่ำกว่าช่วงเวลานี้" หากเวลาตอบสนองของ p95 คือ 8 วินาที ผู้ใช้ 1 ใน 20 คนกำลังเผชิญกับประสบการณ์ที่แย่มาก โดยเฉลี่ยแล้วไม่เคยแสดงให้เห็นเลย เมื่อให้การวัดแก่ AI ต้องชัดเจนว่าคุณต้องการสถิติใด: "ตีความ p50, p95 และ p99 ให้ฉัน ไม่ใช่ค่าเฉลี่ย" นิสัยข้อนี้เผยให้เห็นปัญหาที่ซ่อนอยู่

เคล็ดลับ: ดูเปอร์เซ็นไทล์ของทุกตัวชี้วัดที่เกี่ยวข้องกับประสบการณ์ของผู้ใช้ (เวลาตอบสนอง เวลาแฝง) p95/p99 แทนที่จะเป็นค่าเฉลี่ย พาคุณไปสู่ชนกลุ่มน้อยที่ทุกข์ทรมานอย่างแท้จริง ในการวัดทรัพยากร (CPU, หน่วยความจำ) ให้ดูที่ทั้งค่าสูงสุดและค่าที่ยั่งยืน

ไม่มีความผิดปกติหากไม่มีพื้นฐาน

ก่อนที่คุณจะสามารถบอกได้ว่าตัวชี้วัดนั้น “ผิดปกติ” หรือไม่ คุณต้องรู้ “ปกติ” ก่อน ข้อมูลพื้นฐานคือช่วงพฤติกรรมทั่วไปของระบบในวันที่มีสุขภาพดี: "โดยทั่วไป CPU เที่ยงวันธรรมดาของบริการนี้คือ 40–60%" หากไม่มีเส้นพื้นฐาน คุณจะไม่มีทางรู้ได้ว่าค่า 70% นั้นน่ากลัวหรือเป็นเรื่องปกติ คุณสามารถกำหนดพื้นฐานได้ด้วยการให้ข้อมูลประวัติที่ดีแก่ AI และพูดว่า "แยกช่วงปกติและรูปแบบรายวัน/รายสัปดาห์ของตัวชี้วัดนี้" จากนั้นคุณตีความข้อมูลใหม่ตามพื้นฐานนี้: "ค่านี้อยู่ที่ไหนในภาวะปกติ" ความผิดปกติคือการเบี่ยงเบนที่สำคัญและต่อเนื่องจากเส้นฐาน การกระโดดกะทันหันเพียงครั้งเดียวมักมีเสียงรบกวน

ทีละขั้นตอน: การฉายภาพความจุ

  1. รวบรวมประวัติที่สะอาดและเพียงพอ แนวโน้มต้องใช้ข้อมูลอย่างน้อยสองสามสัปดาห์ โดยควรเป็นรายเดือน การฉายภาพโดยใช้ข้อมูลเพียงเล็กน้อยถือเป็นการคาดเดา ไม่ใช่การคาดการณ์
  2. แยกฤดูกาล. การเข้าชมลดลงในช่วงสุดสัปดาห์ เพิ่มขึ้นในช่วงปลายเดือน และระเบิดระหว่างการรณรงค์ บอกวงจรเหล่านี้ให้ AI ทราบ จะได้ไม่สับสนการเติบโตกับความผันผวนตามฤดูกาล
  3. ถอดเทรนด์. "ดิสก์นี้เพิ่มขึ้นโดยเฉลี่ยกี่ GB ต่อสัปดาห์ในช่วง 8 สัปดาห์ที่ผ่านมา" AI คำนวณอัตราการเติบโต
  4. ขอเครื่องฉาย เว้นระยะไว้ “ในอัตรานี้ดิสก์จะเต็ม 90% เมื่อใด” — แต่ขอให้มีช่วงในแง่ดี/แง่ร้าย ไม่ใช่นัดเดียว อนาคตเป็นสิ่งที่ไม่แน่นอน เลขคี่คือความแม่นยำที่ผิดพลาด
  5. กำหนดเกณฑ์การตัดสินใจร่วมกับผู้คน หากการคาดการณ์ระบุว่า "จะแล้วเสร็จใน 6 สัปดาห์" คุณจะต้องพิจารณาเวลาในการจัดหา (การซื้อ การอนุมัติ) และตัดสินใจว่าจะดำเนินการในวันนี้หรือไม่
  6. ตั้งปลุกให้ถูกต้อง สัญญาณเตือนที่มีความไวสูงทำให้เกิดเสียงรบกวนและความเมื่อยล้าของสัญญาณเตือน หลวมเกินไปสัญญาณเตือนจะพลาดเหตุการณ์ รับคำแนะนำเกณฑ์จาก AI แต่กำหนดเกณฑ์สุดท้ายด้วยการยอมรับความเสี่ยงของคุณเอง

มินิเคสสามอัน

กรณีที่ 1 — ปกปิดโดยเฉลี่ย p99 แสดง ทีมหนึ่งคิดว่า API ของพวกเขาคือ "โดยเฉลี่ย 180 มิลลิวินาที ก็โอเค" เมื่อฉันป้อนการวัดไปยัง AI และขอการตีความเปอร์เซ็นไทล์ ปรากฎว่า p99 อยู่ที่ 6,400 ms — หนึ่งในทุกๆ ร้อยคำขอช้ากว่า 6 วินาที สาเหตุที่แท้จริงคือการสืบค้นฐานข้อมูลที่ช้า แม้ว่าค่าเฉลี่ยจะดูมีสุขภาพดี แต่ส่วนน้อยก็มีประสบการณ์ที่แย่มาก

กรณีที่ 2 — การฉายภาพเตือนล่วงหน้า 3 สัปดาห์ ผู้ดูแลระบบให้ข้อมูลการใช้ดิสก์บันทึกแก่ AI AI สรุปแนวโน้มการเติบโตรายสัปดาห์ที่ ~7 GB และคาดการณ์ว่าในอัตราปัจจุบัน จะถึง 90% ภายใน 19 วัน โดยมีช่วงมองในแง่ดี-แง่ร้ายอยู่ที่ 16–23 วัน เนื่องจากต้องใช้เวลา 10 วันในการจัดหาดิสก์ใหม่ ทีมงานจึงสั่งทันทีและป้องกันการหยุดทำงานก่อนที่จะเกิดขึ้น

กรณีที่ 3 — กลับมาจากความผิดปกติที่ผิดพลาด สัญญาณเตือนการตรวจสอบดังขึ้นทุกคืนวันอาทิตย์โดยแจ้งว่า CPU สูงถึง 95% ก่อนที่จะตื่นตระหนก วิศวกรได้สั่งให้ AI ยกระดับพื้นฐาน การกระโดดครั้งนี้เป็นงานสำรองข้อมูลที่วางแผนไว้ซึ่งเกิดขึ้นในเวลาเดียวกันทุกสัปดาห์ ดังนั้นจึงเป็นส่วนหนึ่งของบรรทัดฐาน มันไม่ใช่ความผิดปกติ พื้นฐานหายไป เกณฑ์การเตือนได้รับการแก้ไขในช่วงเวลาดังกล่าว และการปลุกตอนกลางคืนโดยไม่จำเป็นก็หมดไป

เทมเพลตที่สามารถคัดลอกได้สี่แบบ

1) การตีความเมตริก (เปอร์เซ็นไทล์):

ด้านล่างนี้คือเมตริกเวลาตอบสนองของ [บริการ] (มาสก์) แสดงความคิดเห็นกับฉัน p50, p95 และ p99 ไม่ใช่ค่าเฉลี่ย ความแตกต่างระหว่าง p99 และ p50 หมายความว่าอย่างไร ซึ่งบ่งบอกถึงปัญหาประสบการณ์การใช้งานของผู้ใช้ อย่าเพิ่มค่าที่สร้างขึ้น เพียงตีความข้อมูลที่ฉันให้คุณ ข้อมูล: [เมตริก]

2) การลบพื้นฐาน:

ด้านล่างนี้คือข้อมูล [เมตริก] ที่ดีในช่วง 4 สัปดาห์ที่ผ่านมา แยก (1) ช่วงปกติ (2) รูปแบบรายวันและรายสัปดาห์ (เช่น เวลากลางคืน เวลาสูงตอนเที่ยง) ของเมตริกนี้ แล้วเราจะให้คุณค่าใหม่ประการหนึ่ง จัดประเภทเป็น "ปกติ/ข้อควรระวัง/ผิดปกติ" ตามข้อมูลพื้นฐานนี้ ข้อมูล: [ตัวชี้วัดในอดีต]

3) การฉายภาพความจุ (พร้อมช่วง):

ด้านล่างนี้คือข้อมูลการเข้าใช้ [ทรัพยากร] ในช่วง 8 สัปดาห์ล่าสุด (1) คำนวณอัตราการเติบโตเฉลี่ยรายสัปดาห์ (2) ระบุผลกระทบตามฤดูกาล (3) ประมาณการเวลาที่จะถึงเกณฑ์ 90% ในอัตราปัจจุบัน โดยมีช่วงในแง่ดีและแง่ร้าย ระบุวันที่เดียว กำหนดช่วง และจดสมมติฐานของคุณ ข้อมูล: [อนุกรมเวลา]

4) คำแนะนำเกณฑ์การเตือน:

พื้นฐานของฉันสำหรับ [เมตริก] คือ [ช่วง] เป้าหมายของฉันคือลดการแจ้งเตือนที่ผิดพลาดให้เหลือน้อยที่สุดโดยไม่พลาดปัญหาที่แท้จริง ให้คำแนะนำแก่ฉันสำหรับ (1) คำเตือนและ (2) เกณฑ์วิกฤต โดยให้เหตุผลแต่ละข้อและประเมินความเสี่ยงของความล้าของสัญญาณเตือน ฉันจะกำหนดเกณฑ์สุดท้าย

พรอมต์อ่อน / พรอมต์แข็งแกร่ง

พรอมต์ที่อ่อนแอ:

เซิร์ฟเวอร์ของฉันช้าหรือไม่?

ไม่มีบริบท ไม่มีตัวชี้วัด และไม่มีพื้นฐาน AI ไม่ทราบคำจำกัดความของ "ช้า" และไม่มีค่าปกติที่จะเปรียบเทียบด้วย คำตอบคือการคาดเดาที่ไม่ได้ใช้งาน

พรอมต์อันทรงพลัง:

บทบาทของคุณ: ผู้เชี่ยวชาญด้านการวางแผนกำลังการผลิต ด้านล่างนี้คือเวลาตอบสนอง p95 และข้อมูลคำขอ/วินาทีของ API (มาสก์) ในช่วง 14 วันที่ผ่านมา พื้นฐานของฉันคือ 250-400 ms สำหรับ p95 บอกฉันว่า (1) ทำเครื่องหมายวันที่ออกจากเส้นฐานในช่วง 14 วันที่ผ่านมา (2) บอกฉันว่ามีความสัมพันธ์ที่มองเห็นได้ระหว่างเวลาตอบสนองและการโหลดคำขอหรือไม่ (ตามสมมติฐาน) (3) ทำนายว่า p95 จะไปที่ไหนใน 30 วันหากแนวโน้มนี้ดำเนินต่อไป ข้อมูล: [อนุกรมเวลา]

ประเภทเมตริก

การวัดผิด

การวัดที่แม่นยำ

เวลาตอบสนอง

แค่ปานกลาง

หน้า 50, หน้า 95, หน้า 99

ซีพียู/หน่วยความจำ

มูลค่าทันที

จุดสูงสุด + ยั่งยืน + พื้นฐาน

การเติบโตของแผ่นดิสก์

อัตราการเข้าพักวันนี้

แนวโน้มรายสัปดาห์ + การประมาณการ

ความผิดปกติ

ตีกลับเพียงครั้งเดียว

การเบี่ยงเบนอย่างต่อเนื่องจากเส้นฐาน

ปลุก

เกณฑ์เดียวโดยพลการ

คำเตือนที่สมเหตุสมผล + เกณฑ์วิกฤติ

ข้อผิดพลาดทั่วไป

  • วัดทุกอย่างด้วยค่าเฉลี่ย ค่าเฉลี่ยมักซ่อนประสบการณ์ที่ไม่ดีของคนเพียงไม่กี่คน ดูเปอร์เซ็นไทล์
  • ค้นหาความผิดปกติโดยไม่มีพื้นฐาน คุณไม่สามารถพูดได้ว่าค่านั้นผิดปกติโดยไม่รู้ว่าค่าใดเป็นค่าปกติ คุณสร้างสัญญาณเตือนที่ผิดพลาด
  • ฤดูกาลที่เข้าใจผิดสำหรับแนวโน้ม การรักษาจุดสูงสุดของแคมเปญให้เป็นการเติบโตอย่างถาวร และการใช้ทรัพยากรที่ไม่จำเป็นต้องเสียค่าใช้จ่าย
  • อาศัยการฉายภาพเลขคี่ “19 วันพอดี” เป็นความแม่นยำที่ผิดพลาด ใช้ช่วงในแง่ดี-แง่ร้าย
  • ลืมเวลาการจัดหา ทีมที่ไม่พิจารณาเกณฑ์การฉายภาพและเวลาจัดซื้อร่วมกันจะหยุดชะงัก
ข้อควรระวัง: การคาดคะเนแนวโน้มของ AI ถือว่าอดีตจะดำเนินต่อไปสู่อนาคต การเปิดตัวผลิตภัณฑ์ใหม่ การโยกย้ายลูกค้า หรือการเปลี่ยนแปลงทางสถาปัตยกรรม ขัดขวางสมมติฐานนี้ เป็นหน้าที่ของคุณที่จะแก้ไขการฉายภาพให้สอดคล้องกับบริบทของคุณ

โดยสรุป

การตรวจสอบประสิทธิภาพตอบคำถาม "ตอนนี้ดีแล้วหรือยัง" และการวางแผนกำลังการผลิตตอบคำถามว่า “เมื่อไหร่จะไม่เพียงพอ” AI เป็นพันธมิตรที่ทรงพลังในการตีความตัวชี้วัด สร้างพื้นฐาน แจ้งความผิดปกติ และคาดการณ์แนวโน้ม แต่ค่าเฉลี่ยอยู่ — ใช้เปอร์เซ็นไทล์; หากไม่มีพื้นฐาน ก็ไม่มีความผิดปกติ — สร้างภาวะปกติก่อน แยกฤดูกาลออกจากเทรนด์ และเอาเส้นโครงเป็นช่วงไม่ใช่เลขตัวเดียว การลงทุนด้านทรัพยากรและการตัดสินใจตามเกณฑ์การแจ้งเตือนนั้นขึ้นอยู่กับมนุษย์ พร้อมด้วยระยะเวลารอคอยทรัพยากรและบริบททางธุรกิจ

งานสมัคร

ใช้ข้อมูลในช่วงสองสามสัปดาห์ที่ผ่านมาสำหรับทรัพยากร (ดิสก์ หน่วยความจำ เวลาตอบสนอง) จากระบบของคุณเองและปกปิดพื้นที่ละเอียดอ่อน ลบช่วงและรูปแบบปกติด้วยเทมเพลต "การลบพื้นฐาน" ด้านบน จากนั้นให้เทมเพลต "การฉายภาพความจุ" คาดการณ์ว่าเมื่อใดคุณจะถึงเกณฑ์ โดยมีช่วงในแง่ดี-แง่ร้าย นอกจากนี้ ให้ตีความการวัดเวลาตอบสนองของคุณโดยใช้เทมเพลต "เปอร์เซ็นไทล์" และดูว่ามีอะไรที่ค่าเฉลี่ยซ่อนอยู่หรือไม่ เขียนสิ่งที่คุณค้นพบและการดำเนินการที่คุณจะทำใน 5 รายการ

รายการตรวจสอบ

  • [ ] ฉันดูที่ p95/p99 แทนที่จะเป็นค่าเฉลี่ยในเมตริกเวลาตอบสนองหรือไม่
  • [ ] ฉันได้สร้างพื้นฐานจากข้อมูลที่ดีก่อนที่จะมองหาความผิดปกติหรือไม่?
  • [ ] ฉันได้แยกแยะความผันผวนตามฤดูกาลจากแนวโน้มถาวรหรือไม่
  • [ ] ฉันถือว่าการคาดการณ์นี้เป็นช่วงที่มองโลกในแง่ดีและมองโลกในแง่ร้ายมากกว่าการนัดวันเดียวหรือไม่?
  • [ ] ฉันได้ประเมินเวลาในการจัดหาร่วมกับเกณฑ์การฉายภาพแล้วหรือยัง?
  • [ ] ฉันตั้งค่าเกณฑ์การแจ้งเตือนตามการยอมรับความเสี่ยงของตัวเอง ไม่ใช่คำแนะนำจาก AI หรือไม่