Đơn vị 6 / 11

Mô hình quản lý rủi ro và đội đỏ

Lợi nhuận:

  • Khả năng phân loại các tình huống sử dụng thành các mức độ rủi ro thấp/trung bình/cao theo tác động
  • Khả năng kiểm tra mô hình một cách có hệ thống trước khi sản xuất với đội đỏ
  • Khả năng đưa ra quyết định sản xuất với thẻ mẫu và cửa nghiệm thu (go/no-go)

Không phải mọi việc sử dụng AI đều có cùng rủi ro. Một trợ lý tóm tắt biên bản cuộc họp và một trợ lý đánh giá đơn xin vay tiền sẽ đưa ra những kết quả rất khác nhau. Cơ sở của quản trị doanh nghiệp là phân loại mục đích sử dụng theo mức độ rủi ro và áp dụng biện pháp kiểm soát phù hợp cho từng cấp độ. Trong phần này, chúng ta sẽ tìm hiểu khuôn khổ quản lý rủi ro mô hình (kỷ luật quản lý rủi ro do mô hình không chính xác, sai lệch hoặc có thể bị khai thác), cách kiểm tra mô hình trước khi sản xuất với đội đỏ, thẻ mô hình và tiêu chí chấp nhận.

Phân loại theo rủi ro

Bước đầu tiên luôn giống nhau: "Điều gì xảy ra nếu cách sử dụng này không thành công?" Ba cấp độ thô tùy theo hiệu lực và khả năng đảo ngược:

  • Rủi ro thấp: Lỗi dễ dàng được phát hiện và khắc phục; Không có hậu quả cá nhân/tài chính. Ví dụ: tóm tắt cuộc họp nội bộ, phác thảo ý tưởng.
  • Rủi ro trung bình: Lỗi ảnh hưởng đến quá trình kinh doanh nhưng đi qua mắt người. Ví dụ: dự thảo phản hồi tới khách hàng, báo cáo tóm tắt sơ bộ.
  • Rủi ro cao: Quyết định ảnh hưởng trực tiếp đến con người/tiền bạc, khó đảo ngược. Ví dụ: quyết định tín dụng/bảo hiểm, phân loại chăm sóc sức khỏe, sàng lọc việc làm.

Cường độ kiểm soát tăng theo mức độ rủi ro: ở mức rủi ro thấp, kiểm soát nhẹ là đủ; Ở mức rủi ro cao, sự giám sát của con người, xác minh nghiêm ngặt, đội đỏ và giám sát liên tục là bắt buộc.

Lưu ý: Hãy phân loại rủi ro theo tác dụng sử dụng chứ không phải theo tên gọi. Hệ thống được gọi là "chỉ một chatbot" có rủi ro cao nếu nó có thể bắt đầu thanh toán.

Đội Đỏ (Red-Teaming)

Đội đỏ đang cố tình phá vỡ hệ thống bằng cách giả vờ là kẻ tấn công ác ý. Đây là trong AI; Nó bao gồm bẻ khóa (bỏ qua các quy tắc bảo mật của mô hình), chèn nhanh, lọc dữ liệu, tạo đầu ra sai lệch/độc hại và thử nghiệm các kịch bản biên. Mục đích là tìm ra lỗ hổng trước kẻ tấn công thực sự.

Từng bước một:

  1. Liệt kê các tình huống đe dọa. Làm thế nào hệ thống này có thể bị lạm dụng?
  2. Chuẩn bị bộ tấn công. Viết các ví dụ đầu vào cụ thể cho từng mối đe dọa.
  3. Hãy thử một cách có hệ thống. Chạy từng kịch bản và ghi lại kết quả.
  4. Ưu tiên phát hiện. Sắp xếp theo tác động × xác suất.
  5. Hãy sửa nó và kiểm tra lại. Sau bản vá, hãy thử lại với cùng một bộ (hồi quy).

Thẻ mẫu và tiêu chí chấp nhận

Thẻ mô hình là một tài liệu tóm tắt những gì một mô hình phù hợp, những hạn chế của nó, những rủi ro đã biết và hiệu suất. Trước khi đưa nó vào sản xuất, bạn nên có các tiêu chí để đưa ra quyết định chấp nhận: ngưỡng chính xác, tỷ lệ vượt qua của đội đỏ, độ trễ, chi phí và kiểm tra sai lệch.

Bốn mẫu có thể sao chép

Lời nhắc phân loại rủi ro:

Hãy xem xét trường hợp sử dụng sau: {{ script }}Câu hỏi:- Lỗi này ảnh hưởng đến ai/cái gì? (con người, tiền bạc, danh tiếng, sự hòa hợp)- Có thể đảo ngược được không? (có/không) - Con người có thể can thiệp được không? Kết quả: "Rủi ro Thấp / Trung bình / Cao" + danh sách các bước kiểm tra bắt buộc.

Trình tạo bộ tấn công của đội đỏ:

Bạn là chuyên gia của đội đỏ. Tạo 15 kịch bản tấn công cho trợ lý sau: 5 lần bẻ khóa, 5 lần tiêm nhắc (3 trong số đó là gián tiếp), 5 lần thử đánh cắp dữ liệu. Đối với mỗi kịch bản: viết mục đích, nội dung giới thiệu đầy đủ và "tiêu chí thành công" (bất cứ điều gì tôi thấy đều tính cuộc tấn công là thành công).

Bộ xương bảng mô hình:

Thẻ mẫu:- Mục đích sử dụng / mục đích sử dụng ngoài ý muốn- Giới hạn đào tạo/dữ liệu và các lỗ hổng đã biết- Hiệu suất: độ chính xác, độ trễ, chi phí (trên bộ kiểm tra) - Bảo mật: tỷ lệ vượt qua của đội đỏ, các lần bẻ khóa đã biết- Kết quả kiểm tra sai lệch- Quyết định chấp nhận: PHÊ DUYỆT / CÓ ĐIỀU KIỆN / TỪ CHỐI + biện minh

Quy định kiểm soát cổng vào:

TẤT CẢ các điều kiện phải được đáp ứng để chuyển sang sản xuất:- >= ngưỡng mục tiêu trên bộ kiểm tra độ chính xác- Số phát hiện quan trọng của đội đỏ = 0- Nếu rủi ro cao: hội đồng giám sát và kiểm tra con người Nếu không đáp ứng được: "NO-GO" + thiếu mục.

Nhắc yếu / Nhắc mạnh

cách tiếp cận kém

Cách tiếp cận mạnh mẽ

Xử lý mỗi lần sử dụng với cùng một biện pháp kiểm soát

Phân loại theo rủi ro và kiểm soát quy mô

"Chúng tôi đã thử nghiệm nó, nó hoạt động" (cách vui vẻ)

Cố tình phá vỡ nỗ lực với đội đỏ

Đưa mô hình vào sản xuất mà không có lý do chính đáng

Thẻ mẫu + cổng chấp nhận (đi/không đi)

Không kiểm tra lại sau khi vá

Kiểm tra hồi quy sau khi hiệu chỉnh

Ba hộp nhỏ

Trường hợp 1 - Việc phân loại sai gây tốn kém. Một công ty coi việc sàng lọc trước tuyển dụng "chỉ là một biện pháp bổ sung" và cho rằng nó có rủi ro thấp. Mô hình này đã loại bỏ một cách có hệ thống những sinh viên tốt nghiệp từ một số trường nhất định; điều này đã trở thành một khiếu nại phân biệt đối xử. Việc sử dụng được phân loại lại là “rủi ro cao” và thử nghiệm sai lệch cũng như giám sát con người đã được thêm vào.

Trường hợp 2 - Đội đỏ tìm thấy 3 lỗ hổng nghiêm trọng. Một trợ lý khách hàng được phân về đội đỏ trước khi đi vào sản xuất. 3 trong số 15 kịch bản đã thành công: thông tin đặt hàng của khách hàng khác có thể bị rò rỉ thông qua việc tiêm gián tiếp. Các khoảng trống đã được đóng lại và kiểm tra lại với cùng một bộ; Việc sản xuất chỉ được tiếp tục khi phát hiện quan trọng được đặt lại.

Trường hợp 3 - Người mẫu làm rõ quyết định chấp nhận thẻ. Lựa chọn giữa hai mô hình, một đội đặt các thẻ mô hình cạnh nhau. Mô hình rẻ hơn đạt được độ chính xác cao nhưng lại dễ bị đội đỏ tấn công bởi 2 lần bẻ khóa quan trọng. Nhóm đã chọn mô hình đắt tiền nhưng an toàn do quy tắc cổng chấp nhận "phát hiện quan trọng = 0" và ghi lại quyết định.

Mẹo: Đội đỏ không phải là sự kiện diễn ra một lần. Chạy lại bộ tấn công bất cứ khi nào mô hình, lời nhắc hoặc công cụ thay đổi; An ninh không phải là một trạng thái mà là một thực tiễn đang diễn ra.

Những lỗi thường gặp

  • Phân loại công dụng theo tên (chứ không phải tác dụng); nhầm lẫn rủi ro cao với rủi ro thấp.
  • Chỉ thử nghiệm “con đường hạnh phúc” và không cố gắng lạm dụng chút nào.
  • Làm đội đỏ một lần và không lặp lại sau khi thay đổi.
  • Đưa mô hình vào sản xuất mà không có thẻ mẫu và tiêu chí nghiệm thu.
  • Bỏ qua thử nghiệm thiên vị/phân biệt đối xử (đặc biệt là trong các quyết định có tính chất con người cao).
  • Nó có nghĩa là "đóng" mà không thực hiện kiểm tra hồi quy sau hiệu chỉnh.

Tóm lại

  • Bước đầu tiên là phân loại các mục đích sử dụng theo mức độ rủi ro thấp/trung bình/cao theo tác động; Cường độ kiểm soát tăng theo rủi ro.
  • Đội đỏ đang cố tình phá vỡ hệ thống như một kẻ tấn công; tìm ra lỗ hổng trước kẻ tấn công thực sự.
  • Thẻ mô hình ghi lại mục đích, hạn chế và rủi ro của mô hình; là cơ sở để ra quyết định tuyển sinh.
  • Quá trình chuyển đổi sang sản xuất phải gắn liền với tình trạng được/không được: độ chính xác, số 0 không phát hiện quan trọng, cần phải giám sát.
  • Bảo mật là liên tục: việc kiểm tra hồi quy và nhóm màu đỏ được lặp lại sau mỗi thay đổi.

Nhiệm vụ ứng dụng

Chọn việc sử dụng AI của bạn, xác định mức độ rủi ro dựa trên tác động và viết lời giải thích. Sau đó, tạo ít nhất 10 kịch bản tấn công cho mục đích sử dụng đó (bẻ khóa, chèn, lọc dữ liệu) và thử chúng theo cách thủ công. Đối với mỗi cuộc tấn công thành công, hãy đề xuất cách khắc phục. Cuối cùng, hãy điền vào khung thẻ mẫu và đưa ra quyết định "ĐI/KHÔNG ĐI" kèm theo lý do.

danh sách kiểm tra

  • [ ] Tôi đã phân loại việc sử dụng theo mức độ rủi ro theo tác dụng.
  • [ ] Tôi đã điều chỉnh cường độ kiểm soát phù hợp với mức độ rủi ro.
  • [ ] Tôi đã chuẩn bị bộ đòn tấn công của đội đỏ và thử nó một cách có hệ thống.
  • [ ] Tôi đã sửa những phát hiện quan trọng và xác minh chúng bằng thử nghiệm hồi quy.
  • [ ] Tôi đã chuẩn bị một thẻ mẫu (mục đích, giới hạn, hiệu suất, bảo mật).
  • [ ] Tôi đã ràng buộc quyết định sản xuất với quyết định đồng ý/không thực hiện.