Lợi nhuận:
- Hiểu các chiến lược phát hành giảm thiểu rủi ro (xanh lam, xanh hoàng yến, cờ tính năng) và kỷ luật xác minh sản phẩm (kiểm tra tình trạng, kiểm tra khói, giám sát tín hiệu vàng)
- Khả năng thực hiện thói quen chuẩn bị kế hoạch khôi phục rõ ràng trước khi triển khai và xác minh các lộ trình kinh doanh quan trọng sau khi triển khai
- Khả năng kết hợp tất cả các phần đã học trong mô-đun trong quy trình làm việc toàn diện được hỗ trợ bởi AI và áp dụng nguyên tắc 'AI tạo ra, con người xác minh và đảm bảo' ở mọi bước
Toàn bộ mô-đun này hướng tới một điểm: phân phối mã và cơ sở hạ tầng an toàn cho sản xuất (môi trường trực tiếp được sử dụng bởi khách hàng thực). Bây giờ chúng ta đang ở khâu quan trọng và căng thẳng nhất trong chuỗi: thực hiện thay đổi và xác minh rằng nó thực sự hiệu quả ở đó. Sai lầm ở đây không hề trừu tượng - nó ảnh hưởng trực tiếp đến khách hàng, doanh thu và danh tiếng. Đó là lý do tại sao các đội trưởng thành đi vào sản xuất không phải bằng "hy vọng" mà bằng chiến lược phát hành có kiểm soát và xác minh có hệ thống.
Trong phần cuối cùng này, chúng tôi kết hợp hai điều: (1) phát hành các phương pháp giảm rủi ro (canary, blue-green, feature flag) và kỷ luật xác minh sản phẩm; (2) cách mọi phần chúng tôi đã học trong mô-đun—CI/CD, IaC, vùng chứa, giám sát, sự cố, chi phí, tập lệnh, bảo mật—kết hợp với nhau thành một quy trình làm việc toàn diện do AI hỗ trợ. Hãy lặp lại câu trích dẫn ban đầu lần cuối: AI tạo và tăng tốc các bản nháp ở mỗi bước; Nhưng bạn là người nhấn nút "Tôi đang phát sóng trực tiếp" và xác nhận kết quả.
Đưa ra các chiến lược giảm thiểu rủi ro
Đẩy một sự thay đổi đến tất cả người dùng cùng một lúc là cách rủi ro nhất. Phương pháp trưởng thành:
- Triển khai Xanh-Xanh: Hai môi trường giống hệt nhau được duy trì — “xanh lam” (trực tiếp) và “xanh lục” (phiên bản mới). Phiên bản mới được chuẩn bị và thử nghiệm có màu xanh lục, sau đó giao thông đột ngột chuyển sang màu xanh lục. Nếu có sự cố, giao thông ngay lập tức trở lại màu xanh. Khôi phục nhanh là lợi thế lớn nhất của nó.
- Triển khai Canary: Phiên bản mới lần đầu tiên được phát hành cho một tỷ lệ nhỏ người dùng (ví dụ: 5%); Nếu số liệu tốt thì tăng dần lên 100%. Một sự cố ảnh hưởng đến một phần nhỏ người dùng chứ không phải toàn bộ người dùng.
- Cờ tính năng: Tính năng mới nhập mã nhưng bị chặn bởi cờ; Nó được mở cho một số người dùng nhất định khi được yêu cầu. Có sự khác biệt giữa triển khai và "phát hành"; Nếu có vấn đề, cờ sẽ bị tắt mà không khôi phục mã.
Mẹo: Mạng lưới an toàn nhanh nhất là chuẩn bị sẵn sàng khôi phục trước mỗi lần triển khai. “Nếu xảy ra sự cố, làm cách nào tôi có thể quay lại phiên bản cũ sau 60 giây?” Nếu không có câu trả lời rõ ràng cho câu hỏi thì bạn chưa sẵn sàng thực hiện việc triển khai đó.
Xác minh sản phẩm: công việc không kết thúc khi quá trình triển khai kết thúc
Việc triển khai có vẻ "xanh" không có nghĩa là nó đang hoạt động. Xác minh có hệ thống:
- Kiểm tra tình trạng: Dịch vụ có hoạt động không, /healthz có phản hồi không?
- Kiểm tra khói: Một số đường dẫn người dùng quan trọng nhất (đăng nhập, thanh toán, tìm kiếm) có thực sự hoạt động không? Tự động và nhanh chóng.
- Chú ý các tín hiệu vàng: Tỷ lệ lỗi sau triển khai, độ trễ, lưu lượng truy cập có bình thường không? (Bốn tín hiệu trên thiết bị 6.)
- Mở rộng dần dần: Xem số liệu ở mỗi bước khi bạn tăng tỷ lệ phần trăm Canary.
- Khoảng thời gian quan sát: Theo dõi chặt chẽ trong một khoảng thời gian (ví dụ: 30 phút) sau khi triển khai; Những vấn đề ngấm ngầm không được nhìn thấy ngay lập tức.
Thận trọng: AI có thể đưa ra danh sách các thử nghiệm hoặc xác minh khói, nhưng nhiệm vụ của bạn là xác định đường dẫn người dùng nào là "quan trọng". AI đưa ra danh sách chung; Chỉ bạn mới biết rằng luồng thanh toán, con đường tạo doanh thu cao nhất của bạn, phải được kiểm tra.
So sánh chiến lược phát hành
Chiến lược
Ưu điểm chính
Chi phí/độ phức tạp
phù hợp nhất
Xanh lam
Khôi phục ngay lập tức
Hai môi trường = tài nguyên gấp đôi
Nếu việc truy xuất nhanh là rất quan trọng
chim hoàng yến
Hạn chế tác động đến lát nhỏ
Yêu cầu quản lý giao thông
Cơ sở người dùng khổng lồ
Tính năngCờ
Tách biệt triển khai khỏi bản phát hành
Nợ quản lý cờ
Mở dần dần/có mục tiêu
Cập nhật cuộn
Đơn giản, thân thiện với tài nguyên
quay lại chậm
Dịch vụ đơn giản
Quy trình làm việc được hỗ trợ bởi AI từ đầu đến cuối
Bây giờ hãy kết hợp toàn bộ mô-đun thành một luồng duy nhất. Giả sử bạn đang xuất bản một microservice mới. AI tạo bản nháp ở mỗi bước; bạn xác minh ở mỗi bước:
- Mã & vùng chứa (Đơn vị 4): AI tạo ra Dockerfile an toàn, tối ưu hóa; Bạn xác minh không có bí mật và kích thước.
- CI/CD (Đơn vị 2): Viết quy trình thử nghiệm-xây dựng-triển khai AI; Bạn thu hẹp quyền và kiểm tra các tài liệu tham khảo bí mật.
- Cơ sở hạ tầng (Bài 3): Xác định các tài nguyên cần thiết với AI Terraform; Bạn đọc đầu ra của kế hoạch và không tìm kiếm những thao tác xóa không mong muốn.
- Điều phối (Đơn vị 5): AI tạo ra các bảng kê khai Kubernetes; bạn xác minh giới hạn tài nguyên, thăm dò và RBAC.
- Bảo mật (Đơn vị 10): Ưu tiên đầu ra quét AI; Bạn lấy những cái có thể khai thác được trước.
- Giám sát (Đơn vị 6): AI tạo ra các quy tắc và bảng điều khiển cảnh báo; Bạn kiểm tra các ngưỡng với dữ liệu trong quá khứ của mình.
- Phát hành & xác nhận (đơn vị này): Phác thảo kế hoạch khôi phục và kiểm tra khói AI; bạn bắt đầu canary, xem số liệu, nhấn nút.
- Nếu xảy ra sự cố (Bài 7): AI tạo ra giả thuyết và bản phác thảo khám nghiệm tử thi; Bạn xác minh và học những bài học.
- Chi phí (Đơn vị 8): AI giám sát sự lãng phí tài nguyên mới; Bạn đưa ra quyết định đúng kích cỡ.
Ở mỗi bước, quy tắc chung không đổi: AI sản xuất và tăng tốc, con người xác minh và chứng thực. Đây là bản chất của mô-đun.
ba trường hợp nhỏ
Trường hợp 1 - chim hoàng yến hạn chế thảm họa ở mức 5%. Một nhóm đã đưa ra phiên bản mới cho 5% người dùng có chim hoàng yến. Bảng điều khiển mà AI tạo ra ngay lập tức cho thấy tỷ lệ lỗi đã tăng lên 8% trong lát cắt này. Nhóm đã lấy lại mà không tăng lên 100%; Sự cố chỉ ảnh hưởng đến 5% người dùng và điều đó chỉ xảy ra trong vài phút. Nếu có một đợt triển khai lớn, tất cả khách hàng sẽ bị ảnh hưởng.
Trường hợp 2 - kiểm tra khói đã tìm thấy đường dẫn bị thiếu. AI cung cấp bộ thử nghiệm khói nhưng không có quy trình "thanh toán". Người kỹ sư đã thêm nó vào vì biết rằng nguồn doanh thu quan trọng nhất là thanh toán. Quá trình kiểm tra sau triển khai đã bị hỏng ngay ở bước thanh toán — khóa của bên thứ ba đã hết hạn. Việc xác minh đã phát hiện ra sự mất doanh thu âm thầm trong vòng vài phút.
Trường hợp 3 - khôi phục sẵn sàng được lưu trong 90 giây. Nhóm cài đặt màu xanh lam đã chuyển phiên bản mới sang màu xanh lục; Sau 2 phút độ trễ tăng gấp đôi. Họ đã biến giao thông thành màu xanh trong 90 giây bằng cách lùi xe mà họ đã chuẩn bị trước. Họ tìm ra nguyên nhân gốc rễ (truy vấn chậm ở bản mới) không bị áp lực, rồi bình tĩnh. Đường dẫn quay lại sẵn sàng khiến cho sự gián đoạn gần như vô hình.
Bốn mẫu có thể sao chép
1) Lựa chọn chiến lược phát hành:
Tôi sẽ cung cấp dịch vụ sau: [DỊCH VỤ/BỐI CẢNH: số lượng người dùng, khả năng ngừng hoạt động, cơ sở hạ tầng]. Bạn đề xuất cái nào giữa cờ xanh lam, cờ hoàng yến và cờ đặc trưng? So sánh lợi thế, chi phí và tốc độ khôi phục của từng loại trong bối cảnh này. Đưa ra gợi ý nhưng nói rõ rằng tôi sẽ đưa ra quyết định cuối cùng.
2) Danh sách kiểm tra/xác minh khói:
Tạo danh sách xác minh và kiểm tra khói nháp cho [SERVICE] mà tôi sẽ chạy sau khi triển khai: kiểm tra tình trạng, đường dẫn người dùng quan trọng nhất, tôi nên theo dõi số liệu nào trong bao nhiêu phút? Giả sử rằng tôi sẽ đánh dấu những con đường kinh doanh quan trọng nhất và để trống trường đó.
3) Kế hoạch khôi phục:
Tôi sử dụng [PHƯƠNG PHÁP TRIỂN KHAI]. Viết cho tôi một kế hoạch khôi phục rõ ràng: với lệnh/bước nào để tôi quay lại phiên bản cũ, mất bao lâu, rủi ro của việc khôi phục là gì (ví dụ: không thể khôi phục di chuyển cơ sở dữ liệu), tôi nên kiểm tra những gì trước khi khôi phục?
4) Danh sách kiểm tra phát hành từ đầu đến cuối:
Tạo danh sách kiểm tra chuẩn bị từ đầu đến cuối để phát hành cho dự án [DỊCH VỤ] mới: bảo mật mã/hình ảnh, quy trình, kế hoạch cơ sở hạ tầng, giám sát và cảnh báo, quét bảo mật, chiến lược phát hành, khôi phục và xác minh. Kiểm tra từng mục với câu hỏi "Tôi đã sẵn sàng chưa?" Hãy biến nó thành một câu hỏi.
Dấu nhắc yếu / Dấu nhắc mạnh
Yếu: "Làm cách nào để đưa cái này vào sản phẩm?"
Kết quả: không có bối cảnh; AI liệt kê các bước triển khai chung, nó không giải quyết được mức độ chấp nhận rủi ro, quy mô người dùng và nhu cầu khôi phục của bạn.
Güçlü: "Tôi sẽ thúc đẩy một dịch vụ thanh toán với 10 triệu người dùng, khả năng chịu đựng thời gian ngừng hoạt động của tôi rất thấp. Bạn đề xuất Canary hay Blue-Green, tại sao? Tôi nên kiểm tra những đường dẫn quan trọng nào sau khi triển khai, những số liệu nào tôi nên theo dõi trong bao nhiêu phút và kế hoạch khôi phục trong 60 giây nên như thế nào? Tôi sẽ đưa ra quyết định cuối cùng."
Sự khác biệt: lời nhắc thứ hai cung cấp thang đo, dung sai và kỳ vọng khôi phục; Nó yêu cầu chiến lược + xác minh + hoàn tác và để con người quyết định.
Những lỗi thường gặp
- Triển khai mà không có kế hoạch khôi phục. Nếu không còn đường quay lại thì mỗi lần triển khai đều là một canh bạc.
- Triển khai vụ nổ lớn. Cung cấp nó cho toàn bộ người dùng cùng một lúc sẽ tối đa hóa rủi ro.
- Giả sử "xanh = đang hoạt động". Dịch vụ đã vượt qua kiểm tra tình trạng có thể bị hỏng trên đường quan trọng.
- Nghĩ rằng bạn đang rời bỏ những con đường kinh doanh quan trọng để chuyển sang AI. Bạn phải đánh dấu các phương thức như thanh toán.
- Không giám sát sau khi triển khai. Những vấn đề quỷ quyệt không xuất hiện ngay phút đầu tiên; cửa sổ quan sát là cần thiết.
- Nghĩ rằng việc di chuyển cơ sở dữ liệu có thể đảo ngược được. Một số thay đổi không được khôi phục; được quy hoạch riêng.
Tóm lại
Việc chuyển sang sản xuất là liên kết quan trọng nhất trong chuỗi và được thực hiện không phải bằng "hy vọng" mà bằng các chiến lược được kiểm soát: màu xanh lam mang lại khả năng khôi phục ngay lập tức, hạn chế hiệu ứng canary ở một phần nhỏ, tách việc triển khai cờ tính năng khỏi bản phát hành. Công việc vẫn chưa kết thúc khi quá trình triển khai kết thúc; Việc xác minh có hệ thống thông qua kiểm tra sức khỏe, kiểm tra khói và theo dõi tín hiệu vàng là điều cần thiết. AI tạo và tăng tốc các bản nháp ở mọi bước trong toàn bộ mô-đun — từ Dockerfile đến đường ống, từ Terraform đến quy tắc cảnh báo, từ khám nghiệm tử thi đến phân tích chi phí. Nhưng người có thẩm quyền vẫn là người xác minh từng bước, nhấn nút đưa vào hoạt động và xác nhận kết quả. Đây là nguyên tắc vàng của DevOps hỗ trợ AI từ đầu đến cuối.
Nhiệm vụ ứng dụng
Chọn một dịch vụ (có thật hoặc hư cấu) để xuất bản. (1) Chọn chiến lược phù hợp với bối cảnh của bạn với mẫu “Lựa chọn chiến lược phát hành” và viết lý do. (2) Tạo danh sách xác minh bằng mẫu "Kiểm tra khói / danh sách xác minh" và tự thêm các đường dẫn kinh doanh quan trọng nhất. (3) Chuẩn bị kế hoạch khôi phục 60 giây với mẫu "Kế hoạch khôi phục" và kiểm tra xem có bất kỳ bước nào không thể đảo ngược trong đó hay không.
danh sách kiểm tra
- [ ] Tôi đã chọn chiến lược phát hành (canary/blue-green/flag) phù hợp với bối cảnh của mình.
- [ ] Tôi có sẵn kế hoạch khôi phục nhanh chóng và rõ ràng trước khi triển khai.
- [ ] Tôi đã tự mình thêm các lộ trình kinh doanh quan trọng nhất (ví dụ: thanh toán) vào các thử nghiệm Smoke của mình.
- [ ] Sau khi triển khai, tôi theo dõi các tín hiệu vàng thông qua cửa sổ quan sát.
- [ ] Tôi cũng đã lên kế hoạch cho các bước không thể đảo ngược (di chuyển cơ sở dữ liệu, v.v.).
- [ ] Tôi đã xác minh bản thiết kế AI ở mọi bước; Tôi đã quyết định phát trực tiếp.
Thi học phần
1. Điều nào sau đây là vị trí tốt nhất cho DevOps và AI trên đám mây?
- A) Trí tuệ nhân tạo là công cụ trợ giúp, hỗ trợ ra quyết định; Mọi người chịu trách nhiệm về những quyết định quan trọng ảnh hưởng đến sản phẩm ✔
- B) Trí tuệ nhân tạo có thể hoàn tất việc triển khai sản phẩm và luân chuyển bí mật mà không cần sự chấp thuận của con người
- C) Trí tuệ nhân tạo chỉ hữu ích cho việc viết tài liệu, nó không liên quan gì đến cơ sở hạ tầng
- D) Kiểm toán là không cần thiết vì trí tuệ nhân tạo luôn tạo ra các lệnh đáng tin cậy hơn kỹ sư
Mô tả: Đây là một công cụ trợ lý và hỗ trợ quyết định giúp tăng tốc các tác vụ sử dụng nhiều văn bản như đường dẫn, cấu hình, tập lệnh và nhật ký trí tuệ nhân tạo. Trách nhiệm đối với các quyết định ảnh hưởng đến thời gian ngừng hoạt động, tiền bạc và bảo mật, chẳng hạn như phát hành sản phẩm, quản lý bí mật và ứng dụng cuối cùng, vẫn thuộc về kỹ sư có thẩm quyền.
2. Biểu thức nào chính xác nhất cho kỷ luật xác minh trước khi triển khai lệnh hoặc cấu hình DevOps do trí tuệ nhân tạo tạo ra?
- A) Nếu đầu ra trông mượt mà và chắc chắn thì nó có thể chạy trực tiếp trong sản phẩm
- B) Đầu ra chỉ an toàn nếu không có lỗi cú pháp, không cần kiểm tra thêm
- C) Kết nối đầu ra với nguồn, lập kế hoạch/chạy thử và lọc nó theo ngữ cảnh hệ thống của bạn; sau đó nộp đơn ✔
- D) Thực hiện lần thử đầu tiên trực tiếp trong sản phẩm và xem kết quả là cách xác minh nhanh nhất
Giải thích: Xác minh ba bước là cần thiết: kết nối đầu ra với nguồn (lệnh/cờ thực sự có trong tài liệu chính thức), chạy thử (xem điều gì xảy ra với kế hoạch/--chạy thử) và chuyển nó qua bộ lọc hệ thống (nó có phù hợp với bối cảnh kiến trúc và bảo mật của nó không). Sự trôi chảy không có nghĩa là sự chính xác.
3. Cách tiếp cận chính xác khi hỏi trí tuệ nhân tạo về lỗi hoặc vấn đề triển khai với tệp .env chứa mật khẩu cơ sở dữ liệu thực là gì?
- A) Che giấu những bí mật thực sự bằng <PLACEHOLDER>; chỉ chia sẻ lỗi và ngữ cảnh bị che giấu ✔
- B) Dán toàn bộ tệp .env sẽ giải quyết vấn đề nhanh hơn
- C) Vì các bí mật đã có dạng base64 nên việc dán đơn giản là an toàn
- D) Dán mật khẩu là an toàn vì trí tuệ nhân tạo không bao giờ lưu trữ nó
Mô tả: Không có bí mật thực sự nào được dán vào lời nhắc AI. Các giá trị như mật khẩu và mã thông báo được che dấu bằng <PLACEHOLDER>; chỉ có thông báo lỗi và ngữ cảnh cần thiết mới được chia sẻ. Nếu Bí mật đã bị rò rỉ thì nó phải bị hủy và luân chuyển ngay lập tức.
4. Cách nào sau đây là cách quản lý chính xác các bí mật (mật khẩu, mã thông báo) trong quy trình CI/CD?
- A) Nó được lưu giữ trong kho lưu trữ bí mật của nền tảng và được gọi theo tham chiếu (ví dụ: ${{ secret.X }}), không được viết bằng văn bản thuần túy ✔
- B) Được viết bằng văn bản gốc vào đường dẫn YAML để thuận tiện
- C) Nó được xác minh bằng cách nhấn echo và log khi bắt đầu mỗi công việc.
- D) Nếu được xác định với quyền rộng nhất (ghi tất cả), tính bảo mật sẽ tăng lên
Giải thích: Bí mật không được ghi vào YAML bằng văn bản thuần túy; Nó được giữ trong kho lưu trữ bí mật của nền tảng và được gọi với các tham chiếu như ${{ secret.X }}. Ngoài ra, với nguyên tắc có ít quyền hạn nhất, quyền truy cập mã thông báo bị thu hẹp và nhật ký bí mật không được ghi lại.
5. Trong quản lý cơ sở hạ tầng với Terraform, bước quan trọng nhất cần thực hiện trước khi triển khai thay đổi trực tiếp là gì?
- A) Chạy trực tiếp 'áp dụng địa hình'; kế hoạch này thật lãng phí thời gian
- B) Sao lưu tệp Trạng thái vào kho lưu trữ công cộng
- C) Chạy 'kế hoạch địa hình' và kiểm tra các dòng hủy/thay thế trong đầu ra, sau đó áp dụng ✔
- D) Gỡ cài đặt phiên bản Nhà cung cấp và đảm bảo rằng phiên bản mới nhất sẽ tự động xuất hiện
Giải thích: 'sơ đồ địa hình' phải được chạy trước khi 'áp dụng địa hình'. Kế hoạch chỉ ra những gì cần thêm, những gì cần thay đổi và đặc biệt là những gì cần xóa (hủy) mà không cần làm gì cả. Nếu thấy một dòng hủy hoặc thay thế không mong muốn, không nên áp dụng áp dụng.
6. Điều đó có nghĩa là gì và nên làm gì nếu dòng '-/+ thay thế' cho cơ sở dữ liệu sản xuất xuất hiện trong đầu ra của kế hoạch Terraform?
- A) Nguồn sẽ chỉ được cập nhật tại chỗ, không có rủi ro
- B) Tài nguyên sẽ bị xóa và tạo lại; Có nguy cơ mất dữ liệu, nên dừng áp dụng nếu không mong muốn ✔
- C) Thêm tài nguyên mới, cơ sở dữ liệu hiện có không bị ảnh hưởng
- D) Đây chỉ là cảnh báo, có thể bỏ qua một cách an toàn
Giải thích: '-/+ thay thế' có nghĩa là tài nguyên sẽ bị xóa và tạo lại; Đối với cơ sở dữ liệu, điều này có nghĩa là mất dữ liệu. Nếu không được mong đợi, việc áp dụng sẽ bị dừng lại, thay đổi sẽ được chuyển đổi sang một phương thức an toàn hoặc trường bất biến sẽ không bị ảnh hưởng.
7. Điều nào sau đây đúng khi Dockerfile sẵn sàng sản xuất xét về mặt bảo mật và kích thước của nó?
- A) Để thuận tiện, hãy nhúng bí mật vào ảnh bằng ENV và chạy nó dưới quyền root
- B) Luôn sử dụng thẻ ':latest' và giữ hình ảnh cơ sở lớn nhất có thể
- C) Xây dựng một giai đoạn và để lại tất cả các công cụ xây dựng trong hình ảnh cuối cùng
- D) Không nhúng Bí mật, làm việc với NGƯỜI DÙNG trái phép, sử dụng hình ảnh cơ sở nhỏ và ổn định và xây dựng nhiều giai đoạn ✔
Mô tả: Hình ảnh sẵn sàng sản xuất: không nhúng bí mật (chèn nó trong thời gian chạy), chạy với NGƯỜI DÙNG trái phép thay vì root, sử dụng hình ảnh cơ sở nhỏ và có phiên bản (slim/alpine, không phải :mới nhất) và được thu nhỏ bằng bản dựng nhiều giai đoạn. Nó cũng được quét các lỗ hổng trước khi xuất bản.
8. Rủi ro quan trọng nhất khi không xác định giới hạn tài nguyên cho quá trình Triển khai trong Kubernetes là gì?
- A) Pod không bao giờ bắt đầu vì giới hạn là trường bắt buộc
- B) Chỉ hiện cảnh báo trên bảng giám sát, hoạt động không bị ảnh hưởng
- C) Kubernetes tự động thực thi các giới hạn mặc định an toàn, không có rủi ro
- D) Nhóm có thể phát triển không giới hạn và tiêu tốn tài nguyên của nút, do đó làm hỏng các dịch vụ lân cận ✔
Giải thích: Một Pod không có giới hạn tài nguyên có thể phát triển không giới hạn, tiêu thụ tất cả tài nguyên của nút mà nó đang chạy và làm hỏng các dịch vụ lân cận, chẳng hạn như rò rỉ bộ nhớ. Đó là lý do tại sao việc xác định yêu cầu/giới hạn là cơ sở của sự chắc chắn.
9. Làm thế nào để tránh hiện tượng 'cảnh báo mệt mỏi' trong quá trình giám sát và thiết lập cảnh báo?
- A) Đặt cảnh báo trên nhiều số liệu nhất có thể và tạo cảnh báo theo mọi biến động.
- B) Đặt tất cả các cảnh báo ở mức độ nghiêm trọng cao nhất
- C) Kích hoạt cảnh báo với các giá trị tức thời mà không cần đặt thời gian (cho)
- D) Giữ cảnh báo theo định hướng hành động và ở mức độ khẩn cấp phù hợp, kiểm tra các ngưỡng với dữ liệu lịch sử, hợp nhất các ngưỡng không cần thiết ✔
Mô tả: Mỗi cảnh báo phải có tính khả thi và có mức độ khẩn cấp phù hợp; Thông tin không yêu cầu hành động được hiển thị trên bảng, nó không đánh thức bất cứ ai. Ngưỡng cảnh báo được kiểm tra dựa trên dữ liệu lịch sử của hệ thống và các cảnh báo không cần thiết/lặp lại được hợp nhất. Bằng cách này, báo động thực sự sẽ không bị lẫn vào tiếng ồn.
10. Thứ tự ưu tiên tốt nhất khi xảy ra sự cố sản xuất là gì?
- A) Trước tiên hãy tìm ra nguyên nhân gốc rễ chính xác và chỉ giảm thiểu nó khi nguyên nhân đã rõ ràng.
- B) Đầu tiên hãy viết báo cáo khám nghiệm tử thi, sau đó chạm vào dịch vụ
- C) Giảm trước (khôi phục/khôi phục dịch vụ), để lại phân tích nguyên nhân gốc rễ sau ✔
- D) Trước tiên hãy tìm người chịu trách nhiệm về vụ việc và báo cáo
Giải thích: Nguyên tắc vàng là “giảm trước, điều tra sau”. Mục tiêu trước tiên là khôi phục dịch vụ hoặc khôi phục dịch vụ về phiên bản đã biết rõ (giảm nhẹ); Phân tích nguyên nhân gốc rễ được thực hiện một cách bình tĩnh sau khi áp lực giảm bớt. Chờ đợi để tìm ra nguyên nhân gốc rễ chính xác sẽ làm tăng thời gian phục hồi (MTTR).
11. Mục đích chính của văn hóa khám nghiệm tử thi vô tội là gì?
- A) Xác định người mắc lỗi và quy trách nhiệm cho người đó
- B) Tập trung vào hệ thống, quy trình và khuyến khích học tập; ✔ Học những bài học ngăn chặn sự lặp lại thay vì đổ lỗi
- C) Không bao giờ báo cáo sự việc và đảm bảo rằng nó bị lãng quên
- D) Chỉ viết chi tiết kỹ thuật và không thêm các mục có thể thực hiện được
Giải thích: Khám nghiệm tử thi không đáng trách tập trung vào câu hỏi 'hệ thống và quy trình nào đã gây ra lỗi này', chứ không phải 'ai đã gây ra lỗi đó'. Mọi người chia sẻ lỗi lầm một cách công khai nếu biết mình sẽ không bị trừng phạt; Lỗi ẩn được lặp lại. Báo cáo không phải là báo cáo tố cáo mà là một tài liệu học tập chứa đầy những nội dung định hướng hành động.
12. Trong tối ưu hóa chi phí trên nền tảng đám mây (FinOps), bước hợp lý nhất cần thực hiện trước khi chuyển sang chiết khấu cam kết (Gói dự trữ/tiết kiệm) là gì?
- A) Thực hiện cam kết lâu dài nhất có thể trước, nghĩ đến lãng phí sau
- B) Đầu tiên, dọn sạch rác thải (đóng cửa không tải, đúng kích cỡ), sau đó cam kết sử dụng ✔
- C) Di chuyển tất cả tài nguyên sang dung lượng Spot ngay lập tức
- D) Xóa mặt hàng đắt nhất mà không xem lại dữ liệu hóa đơn
Giải thích: Chất thải phải được dọn sạch trước tiên (đóng các tài nguyên nhàn rỗi, giảm tài nguyên quá khổ). Nếu không, bạn sẽ khóa mức sử dụng lãng phí ở mức giá chiết khấu trong 1-3 năm. Kích thước phù hợp và việc dọn dẹp không cần thiết không cần phải cam kết và gần như không có rủi ro.
13. Biện pháp bảo mật quan trọng nhất là gì nếu tập lệnh do AI đề xuất có dòng 'rm -rf "$DIR"/'?
- A) Chạy tập lệnh trực tiếp trong sản phẩm mà không đọc nó sẽ tăng tốc
- B) Thêm set -euo pipefail và điều khiển biến trống và thử chạy thử trước ✔
- C) Rút gọn tên biến là đủ
- D) Sử dụng rm -rf --force thay vì rm sẽ giải quyết được vấn đề
Giải thích: Nếu $DIR trống, câu lệnh này có thể cố gắng xóa thư mục gốc. Dừng ở biến không xác định bằng 'set -u' và kiểm tra xem biến đó không trống trước khi xóa nó (ví dụ: [ -n "$DIR" ] || exit 1) sẽ tránh được thảm họa. Ngoài ra, trước tiên nên thử các hoạt động phá hủy bằng phương pháp chạy khô.
14. Điều đầu tiên cần làm nếu khóa truy cập đám mây vô tình bị rò rỉ vào kho lưu trữ công cộng là gì?
- A) Hủy và gia hạn (xoay) chìa khóa ngay lập tức; Xóa thôi chưa đủ ✔
- B) Chỉ cần xóa tệp khỏi bộ lưu trữ và khóa vẫn an toàn
- C) Không làm gì cả vì không ai nhìn thấy
- D) Việc lưu trữ ở chế độ riêng tư sẽ loại bỏ nhu cầu xoay chìa khóa
Giải thích: Bí mật bị rò rỉ phải được hủy bỏ và luân chuyển ngay lập tức. Chỉ xóa tệp là không đủ vì bí mật vẫn còn trong lịch sử Git và các kho lưu trữ công khai sẽ được bot quét trong vòng vài giây. Sau khi hủy/trả lại, tác động sẽ được đánh giá và một máy quét bí mật được thêm vào để ngăn ngừa tái diễn.
15. Cách tiếp cận nào sau đây giúp giảm thiểu rủi ro khi phát hành phiên bản Prod mới?
- A) Cung cấp phiên bản mới cho tất cả người dùng cùng một lúc (lớn) và không chuẩn bị kế hoạch khôi phục
- B) Coi việc triển khai đã kết thúc ngay khi nó xuất hiện màu 'xanh', không thực hiện xác minh bổ sung
- C) Sử dụng chiến lược được kiểm soát như cờ canary/blue-green/feature, kế hoạch khôi phục được tạo sẵn và kiểm tra khói + giám sát số liệu sau khi triển khai ✔
- D) Hoàn toàn để việc thử nghiệm các con đường kinh doanh quan trọng cho trí tuệ nhân tạo và không xác định chúng chút nào.
Giải thích: Các chiến lược phát hành có kiểm soát (bắt đầu với một tỷ lệ nhỏ với cờ hoàng yến, khôi phục ngay lập tức với màu xanh lam, tách biệt việc triển khai với bản phát hành bằng cờ tính năng) hạn chế rủi ro. Ngoài ra, cần có kế hoạch khôi phục rõ ràng trước khi triển khai và giám sát tín hiệu vàng bằng thử nghiệm khói sau khi triển khai; 'trông có vẻ xanh' không có nghĩa là nó hoạt động.