Lợi nhuận:
- Quản lý sự cố từ đầu đến cuối với sự hỗ trợ của trí tuệ nhân tạo trong các giai đoạn phát hiện, chẩn đoán, giảm nhẹ, giải pháp lâu dài và học tập
- Khả năng duy trì kỷ luật xác minh ngay cả trong thời điểm hoảng loạn bằng cách tách biệt các bước có thể chuyển sang trí tuệ nhân tạo và những bước đòi hỏi quyết định của con người ở mọi giai đoạn.
- Khả năng biến quy tắc vàng rằng trí tuệ nhân tạo được ưu tiên hơn các câu hỏi 'chuyện gì đang xảy ra, viết như thế nào' và con người được ưu tiên hơn các câu hỏi 'tôi có nên làm điều đó không, ai là người bảo lãnh', thành một phản xạ kinh doanh
Tích hợp từ đầu đến cuối: Quản lý sự cố từ đầu đến cuối bằng AI
Bạn đã học các nội dung trong mười bài trước: viết kịch bản, phân tích nhật ký, giám sát, cấu hình, IaC, tài liệu, bảo trì dự đoán, quản lý thay đổi và bảo mật. Nhưng trong thế giới thực, những phần này không đến từng phần một mà gắn bó với nhau trong một sự kiện. Trong phần cuối cùng này, chúng tôi tập hợp các phần lại với nhau: bạn sẽ thấy toàn bộ cách quản lý sự cố bắt đầu vào lúc nửa đêm, từ đầu đến cuối, từ phát hiện đến nguyên nhân gốc rễ, từ khắc phục đến lập hồ sơ và sử dụng đúng liều lượng AI ở từng giai đoạn. Mục đích không phải là dạy một kỹ thuật mới; kết hợp những gì bạn đã học được với nhau như phản xạ của một kỹ sư, củng cố một sự thật được lặp lại trong suốt mô-đun: AI tăng tốc, chiếu sáng và lập kế hoạch ở mọi giai đoạn; nhưng con người luôn là người xác nhận chẩn đoán, ra lệnh, xác nhận thay đổi và chịu trách nhiệm về kết quả.
Trong phần này, bạn sẽ tích hợp vòng đời của một sự cố—phát hiện, chẩn đoán, can thiệp, giải quyết, tìm hiểu—cũng như vai trò và giới hạn của AI ở từng giai đoạn thông qua một ví dụ.
Vòng đời của một sự kiện
Mọi sự cố nghiêm trọng đều trải qua các giai đoạn tương tự nhau và AI có vai trò khác nhau trong mỗi giai đoạn. Phát hiện: âm thanh cảnh báo, người dùng phàn nàn, số liệu sai lệch so với đường cơ sở (Đơn vị 4). Xác thực và phạm vi: nó có thực sự là một vấn đề không, nó rộng đến mức nào? Chẩn đoán: tìm ra nguyên nhân gốc rễ từ nhật ký và số liệu (Bài 3). Ứng phó và giảm thiểu: ngăn chặn thiệt hại, cách giải quyết. Giải pháp lâu dài: khắc phục bằng quản lý thay đổi (Bài 9), tập lệnh (Bài 2) hoặc cấu hình nếu cần (Bài 5). Học tập: cập nhật sổ ghi chép và khám nghiệm tử thi (Đơn vị 7). AI đánh dấu sự bất thường trong quá trình phát hiện, đưa ra các giả thuyết trong chẩn đoán, đưa ra các phương án can thiệp, viết bản nháp trong giải pháp, tạo ra tài liệu trong quá trình học tập - nhưng ở mọi giai đoạn, con người đều đứng ở điểm quyết định.
Mẹo: Thời điểm nguy hiểm nhất của sự cố là thời điểm chẩn đoán và ứng phó khi căng thẳng lên cao nhất - chính xác là khi sự thôi thúc tin tưởng một cách mù quáng vào AI mạnh nhất. Càng vội vàng, bạn càng giữ chặt phản xạ “đọc, xác minh, chuẩn bị trả lại”. Một lần xác minh bị bỏ qua trong lúc hoảng loạn sẽ nhân đôi sự kiện.
Một ví dụ từ đầu đến cuối
Hãy làm cho nó cụ thể. Cảnh báo lúc 02:10: thời gian phản hồi của dịch vụ thanh toán p99 là 6 giây, cao hơn nhiều so với mức cơ bản (250–400 mili giây). Phát hiện đúng: theo dõi đã hoạt động. Xác nhận: xác nhận từ nhiều địa điểm, một sự kiện có thật. Chẩn đoán: kỹ sư cung cấp nhật ký và số liệu bị che giấu trong 20 phút qua cho AI; AI thiết lập dòng thời gian và đánh dấu sự chậm lại là bắt đầu ngay sau khi triển khai lúc 02:08 — một mối tương quan chặt chẽ nhưng vẫn chỉ là giả thuyết. Kỹ sư xác nhận điều này với nhật ký triển khai: có, bản phát hành đã được phát hành lúc 02:08. Phản hồi: cách giảm nhanh nhất là thu hồi phân phối; Bước khôi phục trong yêu cầu thay đổi đã sẵn sàng (Bài 9). Trước tiên, kỹ sư thực hiện khôi phục trên máy chủ bằng logic canary, thời gian phản hồi được cải thiện và sau đó truyền bá nó. Giải pháp lâu dài: nguyên nhân cốt lõi thực sự (truy vấn không được lập chỉ mục trong phiên bản mới) sẽ được khắc phục một cách bình tĩnh vào ngày hôm sau. Học tập: Một quá trình khám nghiệm tử thi không có AI được soạn thảo và bước “giám sát p99 sau triển khai” được thêm vào sổ tay. Ở mọi giai đoạn, AI đều tăng tốc; con người xác nhận ở mọi thời điểm quyết định.
Nguyên tắc vàng trong phân công lao động Human-AI
Sự khác biệt mà bạn thấy trong suốt mô-đun trở thành một quy tắc ở đây: AI đi trước trong các câu hỏi "điều gì đang xảy ra, điều gì có thể xảy ra, cách viết"; Mọi người đi trước khi đặt ra những câu hỏi như "tôi có nên làm việc này bây giờ không, ai có thể đảm bảo cho việc này?" AI hoạt động không mệt mỏi, nhanh chóng, quét thông tin rộng lớn và tạo ra các bản thiết kế — nhưng nó không biết bối cảnh đầy đủ, có thể tạo ra ảo giác, không thể xử lý trách nhiệm và không nhìn thấy những phụ thuộc tiềm ẩn trong tổ chức của bạn. Con người chậm chạp nhưng mang trong mình bối cảnh, trách nhiệm và sự phán xét. Kết quả tốt nhất là sự phân công lao động hợp lý giữa hai bên: giao công việc lặp đi lặp lại, văn bản, có năng suất cho AI; Giữ việc xác minh, quyết định và thực hiện của con người.
ba trường hợp nhỏ
Trường hợp 1 - 40 phút từ đầu đến cuối. Trong trường hợp ổ đĩa đầy, SRE đã tăng tốc toàn bộ chuỗi bằng AI: xác nhận cảnh báo với đường cơ sở (5 phút), tóm tắt nhật ký bị che cho YZ và tìm ra lỗi đầu tiên (5 phút), xác minh giả thuyết "đã dừng quay nhật ký" của AI trên hệ thống thực (5 phút), chạy và triển khai tập lệnh dọn dẹp tạo sẵn với chế độ chạy khô (10 phút), ghi bản phác thảo sau khám nghiệm vào AI và xác minh sự thật (15 phút). Tổng cộng 40 phút; Khoảng gấp đôi nếu không có AI. Nhưng có một bước xác minh ở mọi giai đoạn.
Trường hợp 2 - Bỏ qua xác minh trong lúc hoảng loạn. Một đội khác lao vào cắt. Nó chấp nhận giả thuyết nguyên nhân gốc rễ đầu tiên của AI (một dịch vụ phụ thuộc) mà không cần xác minh và khởi động lại dịch vụ đó. Sự cố vẫn chưa được khắc phục vì nguyên nhân thực sự là do nguyên nhân khác; Hơn nữa, việc khởi động lại không cần thiết đã tạo ra sự cố ngừng hoạt động thứ hai. Bài học: vội vàng không phải là lý do biện minh cho việc bỏ qua việc xác minh; Trước khi giả thuyết AI được xác nhận, hành động sẽ đẩy sự kiện lên cao hơn.
Trường hợp 3 - Nhận thức được giới hạn. Một kỹ sư sắp thực hiện thay đổi cấu hình mà AI đã thúc giục đối với một vấn đề mạng phức tạp. Nhưng sự thay đổi dường như không thể đảo ngược và AI không biết các quy tắc định tuyến cụ thể của cơ quan. Người kỹ sư dừng lại, tham khảo ý kiến của một chuyên gia mạng cấp cao và được biết rằng đề xuất của AI sẽ tạo ra một vòng lặp định tuyến trong cấu trúc liên kết cụ thể này. Biết giới hạn của AI đã ngăn chặn sự gián đoạn.
Bốn mẫu có thể sao chép
1) Tóm tắt trình kích hoạt sự kiện (phân loại):
Vai trò của bạn: SRE cấp cao, trợ lý chỉ huy sự cố. Có một sự kiện đang diễn ra. Cảnh báo/số liệu/nhật ký được che giấu mà tôi cung cấp cho bạn giúp tôi phân loại nhanh: (1) triệu chứng là gì, (2) phạm vi tác động là gì, (3) 3 lĩnh vực cần xem xét đầu tiên, (4) lệnh kiểm soát chỉ đọc cho mỗi lĩnh vực. Quyết định và thi hành là của tôi; Gửi đường đi. Dữ liệu: [bị che]
2) Hướng dẫn quản lý sự cố theo từng giai đoạn:
Đưa tôi đi từng bước trong vòng đời sự cố đối với triệu chứng [triệu chứng]: xác nhận phát hiện, chẩn đoán, giảm thiểu, giải quyết lâu dài, học hỏi. Ở MỖI giai đoạn, hãy cho tôi biết (a) những gì tôi cần làm, (b) khi nào tôi có thể ủy thác việc đó cho AI một cách an toàn, (c) tôi PHẢI tự đưa ra quyết định nào. Đánh dấu các bước xác minh mà mình không nên bỏ qua dù có vội vàng.
3) Kiểm soát điểm quyết định:
Tôi đang tham gia một sự kiện và sắp thực hiện hành động sau: [hành động]. Trước khi triển khai, hãy hỏi tôi: (1) điều này có thể đảo ngược được không, (2) tôi đã thực hiện/không thực hiện xác minh nào, (3) tôi có kế hoạch khôi phục không, (4) tôi có bằng chứng cho thấy hành động này thực sự đã giải quyết được nguyên nhân gốc rễ không? Nếu bạn thấy thiếu gì thì ngăn tôi lại.
4) Học tập tích hợp sau sự kiện:
Đối với sự cố vừa được giải quyết, [tóm tắt] cung cấp cho tôi: (1) bản thảo khám nghiệm tử thi không có lỗi, (2) 3 cải tiến vĩnh viễn (giám sát/tự động hóa/cấu hình) sẽ ngăn chặn sự cố này, (3) các bước trong sổ chạy cần được cập nhật, (4) gợi ý tín hiệu cảnh báo sớm cho sự cố tương tự. Viết nguyên nhân gốc rễ mà không có bằng chứng; dựa trên sự thật.
Dấu nhắc yếu / Dấu nhắc mạnh
Dấu nhắc yếu:
Hệ thống bị lỗi, tôi phải làm gì?
Hoảng sợ, không có bối cảnh và không có xác minh, lời nhắc này nhận được lời khuyên chung chung và có thể nguy hiểm từ AI. Việc vội vã dẫn đến sai lầm ở thời điểm này nhiều nhất.
Lời nhắc mạnh mẽ:
Vai trò của bạn: trợ lý chỉ huy sự cố. Sự kiện đang hoạt động: thời gian phản hồi của dịch vụ thanh toánip99 gấp 15 lần đường cơ sở (250-400 mili giây) kể từ 02:10. Tôi biết đã có sự phân phối vào lúc 02:08. Hãy cho tôi:(1) giả thuyết có khả năng xảy ra nhất và cách xác minh nó CHỈ ĐỌC, (2) tùy chọn giảm thiểu nhanh nhất và CÓ THỂ ĐẢO NGƯỢC, (3) những rủi ro tôi cần kiểm soát trước khi áp dụng biện pháp giảm thiểu này. Tôi có sự thực thi và phê duyệt. Dữ liệu bổ sung: [số liệu/nhật ký được che giấu]
giai đoạn sự kiện
Vai trò của AI
Quyết định quan trọng của con người
phát hiện
Đánh dấu sự bất thường
Đây có phải là sự kiện thực tế không, phạm vi là gì?
Chẩn đoán
tạo giả thuyết
Giả thuyết nào đã được xác nhận?
giảm bớt
Không đưa ra lựa chọn
Sự giảm nào có thể đảo ngược?
giải pháp lâu dài
Bản nháp/kịch bản
Phê duyệt và thực hiện thay đổi
học tập
Bản phác thảo khám nghiệm tử thi
Xác thực sự thật và bài học
Những lỗi thường gặp
- Bỏ qua xác minh trong hoảng loạn. Vội vàng không phải là lý do biện minh cho việc từ bỏ phản xạ “đọc-xác minh-chuẩn bị trả lại”; Khi căng thẳng tăng lên, kỷ luật phải tăng lên.
- Nhầm một giả thuyết với bằng chứng. Hành động mà không xác nhận đề xuất nguyên nhân gốc rễ đầu tiên của AI sẽ khiến vụ việc leo thang.
- Quên đi ranh giới bối cảnh của AI. AI không biết những phụ thuộc tiềm ẩn của tổ chức; Trong sự thay đổi quan trọng, sự phán xét của con người chiếm ưu thế.
- Bỏ qua giai đoạn học tập. Sự kiện, không có bản cập nhật khám nghiệm tử thi và sổ chạy, sẽ bắt đầu lại vào cùng đêm.
- Đổ trách nhiệm lên AI. “AI đã nói như vậy” không phải là lời bào chữa; Trách nhiệm thực hiện luôn thuộc về con người.
Thận trọng: Sử dụng AI trong quản lý sự cố không thay thế việc học quản lý sự cố. Xe có thể bị va chạm, va chạm hoặc không thể tiếp cận được. Kỹ sư biết những điều cơ bản sẽ nhanh hơn với AI; Một kỹ sư không biết căn bản sẽ mắc lỗi nhanh hơn với AI. Đầu tiên hãy thiết lập kỷ luật, sau đó lấy tốc độ từ AI.
Tóm lại
Trong thế giới thực, các bộ phận không đến từng phần một mà đan xen vào nhau trong một sự kiện. Khi quản lý một sự kiện từ phát hiện đến tìm hiểu, AI sẽ tăng tốc ở mọi giai đoạn: đánh dấu sự bất thường, đưa ra giả thuyết, đưa ra các lựa chọn, dự thảo, chuẩn bị khám nghiệm tử thi. Nhưng tại mỗi thời điểm quyết định, người ta dừng lại - xác nhận chẩn đoán, chọn giảm bớt, chấp thuận thay đổi, sở hữu kết quả. Quy tắc vàng rất rõ ràng: AI đi trước trong các câu hỏi “điều gì xảy ra, viết như thế nào” và con người đi trước trong các câu hỏi “tôi có nên làm điều đó không, ai là người bảo lãnh?” Trong thời điểm hoảng loạn, hãy tăng cường kỷ luật, tách biệt giả thuyết khỏi bằng chứng, ghi nhớ giới hạn bối cảnh của AI và rút ra bài học kinh nghiệm từ mọi sự kiện. Bản chất của mô-đun này là một câu: AI là trợ lý đắc lực; Trách nhiệm kỹ thuật không thể được ủy quyền.
Nhiệm vụ ứng dụng
Hãy xem xét một sự kiện mà bạn đã trải qua (hoặc tưởng tượng) trong quá khứ, từ đầu đến cuối. Với mẫu “Hướng dẫn quản lý sự cố theo từng giai đoạn” ở trên, hãy yêu cầu AI hướng dẫn sự cố qua các giai đoạn phát hiện-chẩn đoán-giảm nhẹ-giải quyết-học tập; Ở mỗi giai đoạn, hãy viết riêng bước bạn có thể ủy quyền cho AI và bước bạn cần tự quyết định. Xác nhận ít nhất một giả thuyết AI bằng lệnh xác minh trong giai đoạn chẩn đoán. Cuối cùng, tạo bản dự thảo cập nhật sổ tay và sổ ghi chép với mẫu “Học tập tích hợp sau sự kiện”. Tóm tắt sự phân công lao động giữa con người và AI trong toàn bộ quá trình trong 7 mục.
danh sách kiểm tra
- [ ] Tôi đã chia sự cố thành các giai đoạn phát hiện, chẩn đoán, giảm nhẹ, giải pháp và học hỏi chưa?
- [ ] Tôi đã phân biệt giữa các bước có thể được ủy quyền cho AI và những bước yêu cầu con người đưa ra quyết định ở từng giai đoạn chưa?
- [ ] Trong chẩn đoán, tôi đã tách giả thuyết AI khỏi bằng chứng và xác nhận nó bằng lệnh xác minh chưa?
- [ ] Tôi đã đánh giá biện pháp giảm nhẹ về mặt khả năng đảo ngược và kế hoạch khôi phục chưa?
- [ ] Tôi có duy trì phản xạ "đọc-xác minh-chuẩn bị trả lại" ngay cả trong lúc hoảng loạn không?
- [ ] Tôi có học được bài học khám nghiệm tử thi và sổ sách từ vụ việc không?
Thi học phần
1. Định vị nào sau đây là chính xác nhất cho trí tuệ nhân tạo trong quản lý hệ thống, mạng?
- A) Trí tuệ nhân tạo là công cụ trợ giúp, hỗ trợ ra quyết định; Trách nhiệm và phê duyệt cuối cùng đối với các quyết định điều hành quan trọng thuộc về con người ✔
- B) Trí tuệ nhân tạo có thể chạy lệnh và thực hiện các thay đổi trong sản xuất mà không cần sự chấp thuận của con người
- C) Trí tuệ nhân tạo chỉ hoạt động bằng văn bản, nó không liên quan gì đến hệ thống và mạng
- D) Trí tuệ nhân tạo luôn đưa ra quyết định chính xác hơn con người nên việc xác minh là không cần thiết
Mô tả: Trí tuệ nhân tạo là một công cụ trợ lý và hỗ trợ quyết định tạo ra các bản nháp và phân tích như tập lệnh, phân tích nhật ký và tài liệu. Trách nhiệm và phê duyệt cuối cùng đối với các quyết định điều hành có ảnh hưởng đến thời gian ngừng hoạt động, mất dữ liệu và bảo mật, chẳng hạn như thực hiện lệnh hoặc phê duyệt thay đổi, thuộc về kỹ sư có thẩm quyền.
2. Bốn bước của phản xạ xác minh phải được thực hiện trước khi chạy lệnh do trí tuệ nhân tạo tạo ra trong sản xuất là gì?
- A) Sao chép, dán, chạy, hy vọng
- B) Đọc và hiểu, ghi chép, thử trong môi trường biệt lập, chuẩn bị phản hồi ✔
- C) Thích, chia sẻ, lưu, lưu trữ
- D) Xóa, viết lại, nén, gửi
Mô tả: Bốn bước áp dụng cho đầu ra quan trọng: (1) đọc và hiểu từng dòng lệnh, (2) liên kết các cờ và cú pháp với tài liệu chính thức, (3) thử trong môi trường thử nghiệm/cách ly, chạy thử nếu có thể, (4) chuẩn bị kế hoạch dự phòng (sao lưu, ảnh chụp nhanh) nếu xảy ra sự cố.
3. Việc một tập lệnh tự động hóa “bình thường” có nghĩa là gì và tại sao nó lại quan trọng?
- A) Tập lệnh tạo ra các kết quả khác nhau trong mỗi lần chạy
- B) Đoạn script chỉ chạy được một lần rồi xóa
- C) Tập lệnh không gây hại khi chạy lần thứ hai; ✔ An toàn ngay cả khi được kích hoạt lại
- D) Tập lệnh không chứa chức năng quản lý lỗi
Giải thích: Idempotency có nghĩa là khi cùng một tập lệnh được chạy hai lần trở lên, nó không gây ra hư hỏng hoặc tạo ra lỗi trong lần chạy thứ hai. Logic như 'bỏ qua nếu người dùng đã tồn tại', 'tạo thư mục nếu nó không tồn tại, không chạm vào nó nếu nó tồn tại' được thiết lập. Điều này đảm bảo rằng quá trình tự động hóa hoạt động an toàn ngay cả khi vô tình được kích hoạt lại.
4. Cách cơ bản nhất để bảo mật tập lệnh chứa các thao tác phá hoại (xóa, khởi động lại) là gì?
- A) Chạy tập lệnh nhanh nhất có thể
- B) Ẩn thông báo lỗi
- C) Kiểm tra kịch bản trực tiếp trong quá trình sản xuất
- D) Đặt các hoạt động phá hoại đằng sau quá trình chạy thử mặc định và ràng buộc việc triển khai thực tế với cờ đánh dấu rõ ràng ✔
Giải thích: Theo mặc định, việc giữ các quy trình phá hủy ở chế độ chạy khô và chỉ chạy ứng dụng thực tế có cờ phê duyệt rõ ràng (ví dụ: --apply) cho phép bạn trước tiên xem điều gì sẽ xảy ra khi tập lệnh chạy. Ngoài ra, việc kiểm tra biến null (VAR:?) cũng ngăn ngừa lỗi đường dẫn.
5. Nguyên tắc “tương quan không phải nhân quả” trong phân tích log nghĩa là gì?
- A) Hai sự kiện cùng thay đổi không nhất thiết có mối quan hệ nhân quả; Quan hệ nhân quả cũng phải được xác minh ✔
- B) Tìm kiếm mối tương quan trong nhật ký là một sự lãng phí thời gian
- C) Trong hai sự kiện cùng thay đổi, một sự kiện chắc chắn là nguyên nhân của sự kiện kia.
- D) Quan hệ nhân quả chỉ có thể được xác định bằng trí tuệ nhân tạo
Giải thích: Chỉ vì hai sự kiện xảy ra cùng lúc (tương quan) không có nghĩa là cái này gây ra cái kia (nhân quả); Cả hai đều có thể là kết quả của sự kiện thứ ba. Đề xuất của AI rằng 'X có thể gây ra Y' là một giả thuyết và không được coi là phát hiện cho đến khi nó được xác minh trong hệ thống.
6. Tại sao phân vị (p95/p99) được ưu tiên hơn mức trung bình khi đo thời gian phản hồi trong giám sát hiệu suất?
- A) Phần trăm dễ tính hơn mức trung bình
- B) Người trung bình che giấu trải nghiệm tồi tệ của thiểu số; phần trăm tiết lộ những vấn đề tiềm ẩn này ✔
- C) Số trung bình luôn sai và không nên sử dụng
- D) Phần trăm chỉ áp dụng cho số liệu CPU
Giải thích: Mức trung bình che giấu trải nghiệm rất tệ mà một bộ phận nhỏ người dùng gặp phải. Mặc dù mức trung bình có vẻ là 200 ms, nhưng p99 có thể là 6 giây; Điều này có nghĩa là cứ một trăm yêu cầu thì có một yêu cầu chậm khủng khiếp. Tỷ lệ phần trăm làm rõ nỗi đau của thiểu số này vốn bị người bình thường che giấu.
7. “Trôi dạt” trong quản lý cấu hình là gì và tại sao lại nguy hiểm?
- A) Lưu lượng mạng giảm vào ban đêm
- B) Di dời vật lý của máy chủ
- C) Các máy chủ có sự khác biệt với nhau và tiêu chuẩn theo thời gian; ✔ Vô hình cho đến khi xảy ra sự cố
- D) Tự động sao lưu các tập tin cấu hình
Mô tả: Độ lệch là sự sai lệch của các máy chủ với nhau và so với tiêu chuẩn thông qua các thay đổi thủ công không có giấy tờ theo thời gian. Điều nguy hiểm của nó là sự im lặng: nó không thể nhìn thấy cho đến khi sự cố xảy ra, khi đó một máy chủ hoạt động khác với các máy chủ khác và quá trình chẩn đoán mất hàng giờ. AI làm cho sự trôi dạt có thể nhìn thấy được bằng cách so sánh; Nguyên tắc hàn vàng ngăn cản.
8. Tại sao bước 'kế hoạch' lại là bước bảo vệ an ninh quan trọng nhất trong các công cụ IaC (như Terraform)?
- A) Kế hoạch chạy mã nhanh hơn
- B) Xóa tệp trạng thái kế hoạch
- C) Kế hoạch chỉ sửa định dạng mã
- D) Kế hoạch thể hiện những nội dung sẽ được bổ sung, thay đổi, XÓA trước khi thực hiện; Ngăn ngừa mất dữ liệu ✔
Mô tả: Plan (terraform plan / ansible --check) đưa ra bản xem trước 'điều gì sẽ thay đổi' trước khi thực thi mã: bao nhiêu tài nguyên sẽ được thêm, thay đổi, xóa. Đặc biệt, dòng “hủy” và “lực lượng thay thế” biểu thị nguy cơ mất dữ liệu trước khi thực hiện. Nộp đơn mà không đọc kế hoạch là một trong những sai lầm đắt giá nhất.
9. Tại sao file trạng thái Terraform phải được bảo vệ cẩn thận và không được dán vào AI hoặc các kho lưu trữ mở?
- A) Bí mật văn bản đơn giản có thể được đưa vào hồ sơ Nhà nước; Nếu bị rò rỉ, thông tin nhận dạng sẽ bị tiết lộ ✔
- B) Vì tệp trạng thái quá lớn
- C) Tệp trạng thái đã được mã hóa không thể đọc được.
- D) Mã chạy nhanh hơn khi tệp trạng thái được chia sẻ
Mô tả: Tệp trạng thái lưu giữ trạng thái hiện tại của cơ sở hạ tầng được quản lý và có thể bao gồm các bí mật văn bản đơn giản (mật khẩu cơ sở dữ liệu, khóa). Do đó, nó phải được giữ trong một chương trình phụ trợ từ xa được mã hóa, hạn chế truy cập, khóa; Nó không bao giờ được đặt trong phương tiện công cộng hoặc kho lưu trữ, nếu không bí mật sẽ bị rò rỉ.
10. Câu nói 'một sổ sách chạy sai còn nguy hiểm hơn là không có sổ sách chạy' nhấn mạnh điều gì trong tài liệu?
- A) Viết runbook là một sự lãng phí thời gian
- B) Một runbook chưa được kiểm tra được thực hiện một cách mù quáng trong một cuộc khủng hoảng; Một bước sai lầm có thể dẫn đến thảm họa ✔
- C) Runbooks chỉ được viết cho quản trị viên
- D) Tài liệu không bao giờ được cập nhật
Giải thích: Một nhóm không có sổ sách sẽ thận trọng và nghi ngờ trong thời kỳ khủng hoảng; nhưng người có sổ ghi chép 'chính thức' sẽ áp dụng nó trong tình trạng căng thẳng mà không thắc mắc. Nếu runbook chưa được kiểm tra và sai một bước, việc triển khai mù quáng sẽ dẫn đến thảm họa. Đó là lý do tại sao mỗi runbook phải được kiểm tra kỹ lưỡng và đóng dấu trong môi trường thực tế.
11. Trong bảo trì dự đoán, đâu là cách tiếp cận chính xác để hiểu khi nào đĩa sắp hỏng?
- A) Thay thế ngay một đĩa SMART bị hỏng
- B) Hoàn toàn bỏ qua dữ liệu SMART
- C) Nhìn vào xu hướng giá trị theo thời gian; ✔ Số lượng tín hiệu tăng liên tục và tăng tốc
- D) Chỉ thực hiện hành động sau khi đĩa đã bị sập hoàn toàn
Giải thích: Một lần đọc SMART kém không phải là nguyên nhân gây hoảng sợ; Việc đĩa thỉnh thoảng được sửa lỗi là điều bình thường. Tín hiệu thực sự là xu hướng: sự gia tăng nhất quán và nhanh chóng của các giá trị như khu vực được phân bổ lại theo thời gian. Đó là lý do tại sao AI được cung cấp một chuỗi thời gian chứ không phải một lần đọc.
12. Hai phần quan trọng nhưng thường bị bỏ qua nhất trong quá trình chuyển đổi sản xuất là gì?
- A) Màu sắc và tên của sự thay đổi
- B) Chức danh và bộ phận của người thực hiện thay đổi
- C) Thông báo về sự thay đổi trên phương tiện truyền thông xã hội
- D) Kế hoạch khôi phục và tiêu chí xác minh thành công ✔
Giải thích: Nếu không có câu trả lời bằng văn bản cho các câu hỏi 'làm cách nào để khôi phục chính xác nếu nó xấu đi' (kế hoạch khôi phục) và 'làm cách nào để chứng minh nó thành công' (tiêu chí xác minh thành công) trước khi thay đổi được triển khai, thì thay đổi đó vẫn chưa sẵn sàng. Nếu không có hai điều này, một thay đổi bị hỏng có thể được coi là 'hoàn thành'.
13. Tại sao phương pháp 'canary' được ưa thích hơn là triển khai bảo mật (phiên bản/bản vá mới) cho tất cả các máy chủ cùng một lúc?
- A) Sự thay đổi đầu tiên được áp dụng cho một phần nhỏ; Một lỗi ảnh hưởng đến một phần nhỏ chứ không phải toàn bộ nhóm và được phát hiện sớm ✔
- B) Phân phối Canary tiêu thụ ít điện năng hơn
- C) Canary khiến việc xác minh triển khai hoàn toàn không cần thiết
- D) Triển khai Canary chỉ áp dụng cho cơ sở dữ liệu
Mô tả: Việc triển khai Canary trước tiên áp dụng thay đổi cho một phần nhỏ (một máy chủ, 5% người dùng) và giám sát. Bằng cách này, lỗi sẽ ảnh hưởng đến một phần nhỏ chứ không phải toàn bộ nhóm và sẽ được phát hiện sớm. Một lỗi lây lan cùng một lúc tấn công tất cả người dùng cùng một lúc.
14. Quy tắc đạo đức và pháp lý bất di bất dịch khi sử dụng trí tuệ nhân tạo trong công tác an ninh là gì?
- A) Trí tuệ nhân tạo có thể được sử dụng tự do để quét các lỗ hổng trong bất kỳ hệ thống nào
- B) Quy tắc đạo đức chỉ áp dụng cho các tổ chức lớn
- C) Nó chỉ được sử dụng trong các hệ thống được ủy quyền và cho mục đích quốc phòng; Sử dụng để truy cập hoặc tấn công trái phép là một tội ác ✔
- D) Có thể tự do xâm nhập vào hệ thống của người khác để học hỏi.
Mô tả: Thông tin hệ thống và mạng được sử dụng kép. Trí tuệ nhân tạo chỉ có thể được sử dụng trong các hệ thống mà bạn có ủy quyền bằng văn bản và cho mục đích phòng thủ (phát hiện mối đe dọa nhật ký, tăng cường, ứng phó sự cố). Sử dụng nó để quét hoặc xâm nhập vào hệ thống không thuộc về bạn là hành vi truy cập trái phép và là tội phạm; Một phòng thí nghiệm biệt lập phải được sử dụng để học hỏi.