Lợi nhuận:
- Khả năng xác định các số liệu giám sát tín hiệu sử dụng, bảo mật, chất lượng và hiệu suất
- Khả năng phát hiện độ lệch chất lượng đầu ra với đường cơ sở và lấy mẫu
- Khả năng thiết lập vòng báo động và phản hồi cho các điểm bất thường và các đợt bẻ khóa
Đưa hệ thống AI vào sản xuất chỉ là bước khởi đầu chứ không phải là kết thúc. Ngay cả khi mô hình vẫn giữ nguyên thì thế giới vẫn thay đổi: hành vi của người dùng, dữ liệu đến, kỹ thuật tấn công và bối cảnh kinh doanh liên tục thay đổi. Câu trả lời đúng của ngày hôm qua có thể sai ngày hôm nay. Vì vậy, trụ cột cuối cùng của bảo mật là khả năng giám sát và quan sát liên tục — khả năng nhìn từ bên ngoài những gì đang diễn ra bên trong hệ thống. Trong phần này, chúng ta sẽ tìm hiểu những số liệu cần theo dõi, cách nắm bắt sự chênh lệch chất lượng đầu ra và cách cảnh báo những điểm bất thường.
Tại sao phải giám sát liên tục?
Trong phần mềm cổ điển, "nó có hoạt động không" là một câu hỏi nhị phân: nó trả lời hoặc không. Trong AI, mặc dù hệ thống có vẻ “hoạt động” nhưng nó có thể âm thầm xấu đi: các câu trả lời dần dần trở nên không chính xác, chi phí leo thang, số lần bẻ khóa tăng lên. Cách duy nhất để nắm bắt được những điều này là liên tục đo các tín hiệu phù hợp.
Chú ý: Sự cố nguy hiểm nhất là sự cố im lặng chứ không phải sự cố ồn ào. Hệ thống không đưa ra lỗi, chất lượng của nó chỉ giảm đi. Nếu bạn không thiết lập giám sát, người đầu tiên nhận thấy sẽ là khách hàng hoặc kiểm toán viên của bạn chứ không phải bạn.
Bốn gia đình tín hiệu đáng xem
- Cách sử dụng và chi phí: Khối lượng yêu cầu, mức tiêu thụ mã thông báo, chi phí cho mỗi người dùng. Nhảy đột ngột; Đó có thể là dấu hiệu của sự lạm dụng, sự tích hợp không ổn định hoặc công tắc bị rò rỉ.
- Tín hiệu bảo mật: Các nỗ lực bẻ khóa/tiêm, các cuộc gọi phương tiện bị từ chối, lỗi ủy quyền. Sự gia tăng có thể cho thấy một chiến dịch tấn công đang hoạt động.
- Chất lượng và độ trôi: Giảm chất lượng đầu ra theo thời gian (trôi). Ví dụ: tỷ lệ vượt qua xác minh, tỷ lệ sửa chữa trong sự chấp thuận của con người, sự hài lòng của người dùng.
- Hiệu suất: Độ trễ, tỷ lệ lỗi, thời gian chờ. Nó ảnh hưởng trực tiếp đến trải nghiệm người dùng và chi phí.
Trôi dạt là gì và làm thế nào để bắt nó?
Độ lệch là khi chất lượng đầu vào hoặc đầu ra của mô hình thay đổi mà không được chú ý theo thời gian. Có hai loại: trôi dạt dữ liệu (sự phân bổ các thay đổi trong yêu cầu đến - chủ đề mới, ngôn ngữ mới) và trôi dạt chất lượng (đầu ra cho cùng một công việc dần trở nên tồi tệ hơn). Cần có đường cơ sở để nắm bắt: ghi lại phạm vi số liệu bình thường khi hệ thống hoạt động tốt; Hãy để sự sai lệch trở thành một báo động.
Từng bước: Thiết lập giám sát
- Đo đường cơ sở. Ghi lại phạm vi bình thường của từng tín hiệu khi hệ thống hoạt động tốt.
- Xác định ngưỡng và báo động. Sự sai lệch nào sẽ cảnh báo ai và như thế nào?
- Lấy mẫu + kiểm tra con người. Nhờ con người đánh giá một mẫu kết quả đầu ra thường xuyên (sự thay đổi chất lượng thường chỉ có thể nhìn thấy được).
- Cài đặt một bảng điều khiển. Giám sát bốn họ tín hiệu trên một màn hình.
- Vòng phản hồi. Liên kết các phát hiện từ việc giám sát với việc cải tiến nhanh chóng/kiểm soát.
Bốn mẫu có thể sao chép
Lời nhắc đánh giá lấy mẫu chất lượng (theo dõi độ trôi với LLM-với tư cách là người đánh giá):
Dưới đây là 20 bản in ngẫu nhiên từ tuần này. Đánh giá từng điều là "tốt / chấp nhận được / xấu" và viết lời giải thích ngắn gọn. Cuối cùng tôi sẽ so sánh tỷ giá xấu với tỷ giá của tuần trước; Nếu có một dạng lỗi nào đó (tái diễn cùng loại lỗi) nổi bật trong tuần này, hãy đánh dấu nó.<outputs>{{ ví dụ }</outputs>
Lời nhắc tóm tắt bất thường:
Kiểm tra các số liệu hàng ngày sau: số lượng yêu cầu, mã thông báo, chi phí, cuộc gọi công cụ bị từ chối, số lần bẻ khóa, độ trễ trung bình. Đánh dấu bất kỳ chỉ số nào sai lệch hơn 30% so với đường cơ sở là "KHÔNG THƯỜNG" và ước tính nguyên nhân có thể xảy ra (tấn công, lỗi, lạm dụng).<metrics>{{ daily_data }</metrics>
Quy tắc xác định ngưỡng cảnh báo:
Xác định cảnh báo cho từng tín hiệu:- Chi phí: nếu vượt quá 2 lần mức trung bình hàng ngày -> cảnh báo có mức độ ưu tiên cao- Số lần bẻ khóa: nếu vượt quá 10 lần mỗi giờ -> thông báo cho nhóm bảo mật- Tỷ lệ vượt qua xác minh: nếu giảm xuống dưới 90% -> đánh giá chất lượng- Độ trễ: nếu p95 vượt quá mục tiêu gấp 2 lần -> đánh giá hiệu suất
Lời nhắc nghiên cứu về sự trôi dạt:
Tỷ lệ vượt qua xác minh đã giảm từ 94% xuống 78% trong 2 tuần qua. Hãy giúp tôi trả lời những câu hỏi sau: (1) Chủ đề/ngôn ngữ/định dạng mới có xuất hiện trong các yêu cầu gửi đến không? (2) Các lỗi có tập trung vào một phạm trù cụ thể không? (3) Thời gian có trùng với thời điểm thay đổi lời nhắc/model/công cụ không? Đặt tên cho dữ liệu cần kiểm tra cho từng dữ liệu.
Nhắc yếu / Nhắc mạnh
cách tiếp cận kém
Cách tiếp cận mạnh mẽ
"Nếu có sai sót, chúng tôi sẽ xem xét"
Đường cơ sở + ngưỡng + cảnh báo chủ động
Chỉ cần kiểm tra xem hệ thống có đứng vững không.
Giám sát bốn nhóm tín hiệu (cách sử dụng, bảo mật, chất lượng, hiệu suất)
Không lấy mẫu chất lượng đầu ra chút nào
Lấy mẫu con người thường xuyên + LLM-với tư cách là thẩm phán
Không thu thập và xem xét số liệu
Bảng điều khiển + vòng phản hồi
Ba hộp nhỏ
Trường hợp 1 - Cảnh báo chi phí bắt được chìa khóa bị rò rỉ. Giá token hàng ngày của công ty tăng gấp ba lần chỉ sau một đêm. Ngưỡng cảnh báo đã cảnh báo đội an ninh; Cuộc điều tra cho thấy khóa kiểm tra đã bị rò rỉ và bị bot sử dụng. Chìa khóa bị thu hồi sau 25 phút; Nếu không có báo động, hóa đơn sẽ được thông báo vào cuối tháng.
Trường hợp 2 - Độ trôi chất lượng im lặng. Tỷ lệ vượt qua xác minh của trợ lý hỗ trợ đã giảm dần từ 95% xuống 80% trong ba tuần. Việc lấy mẫu hàng tuần đã nắm bắt được điều này; Nguyên nhân là do khách hàng bắt đầu hỏi về dòng sản phẩm mới và nền tảng kiến thức của mô hình về dòng sản phẩm đó còn chưa đầy đủ. Tỷ lệ được phục hồi khi cơ sở kiến thức được cập nhật.
Trường hợp 3 - Làn sóng jailbreak diễn ra sớm. Số lần tiêm thuốc được thực hiện cho trợ lý đã tăng từ 2 lên 40 lần mỗi giờ trong một ngày. Báo động an ninh được kích hoạt; Người ta thấy một "công thức" bẻ khóa hệ thống đã được chia sẻ trên một diễn đàn. Nhóm đã cập nhật lời nhắc bảo vệ và các tài khoản đáng ngờ có tỷ lệ giới hạn; Làn sóng đã tắt trước khi nó biến thành một vụ rò rỉ thực sự.
Mẹo: Đừng chỉ quan tâm đến số liệu máy. Sự sai lệch về chất lượng thường bị phát hiện khi chỉ cần con người đọc kết quả đầu ra của mẫu. Một thói quen nhỏ là xem lại 15-20 bản in ngẫu nhiên mỗi tuần sẽ sớm phát hiện được những lỗi thầm lặng đắt giá nhất.
Những lỗi thường gặp
- Không đưa nó vào sản xuất và thiết lập giám sát ("nó hoạt động, được thôi").
- Không thể xác định được điểm bất thường nếu không đo đường cơ sở.
- Thiếu chất drift do chỉ nhìn vào "nó có đứng lên được không".
- Hoàn toàn không lấy mẫu chất lượng đầu ra qua mắt người.
- Không báo động và tìm hiểu vấn đề từ khách hàng/người giám sát.
- Không kết nối các phát hiện giám sát với cải tiến (không có vòng phản hồi).
Tóm lại
- Hệ thống AI có thể xuống cấp một cách âm thầm; Trục trặc nguy hiểm nhất là trục trặc không gây ra lỗi mà chỉ làm giảm chất lượng.
- Theo dõi bốn nhóm tín hiệu: mức sử dụng/chi phí, độ an toàn, chất lượng/độ lệch và hiệu suất.
- Độ lệch (độ lệch của chất lượng đầu vào hoặc đầu ra theo thời gian) chỉ được ghi lại so với đường cơ sở.
- Việc lấy mẫu thường xuyên của con người cùng với các số liệu máy sẽ ghi lại sự sai lệch về chất lượng.
- Kết nối giám sát với vòng báo động và phản hồi; Đo lường mà không nhìn không phải là giám sát.
Nhiệm vụ ứng dụng
Chọn ít nhất một số liệu từ mỗi nhóm trong số bốn họ tín hiệu cho hệ thống AI của riêng bạn và viết ra đường cơ sở hiện tại (hoặc ước tính) của chúng. Xác định ngưỡng cảnh báo cho từng số liệu. Sau đó lấy 15 kết quả của học kỳ trước và chấm điểm chúng bằng lời nhắc lấy mẫu ở trên; Lưu ý tỷ lệ “xấu”. Hãy coi đây là đường cơ sở đầu tiên của bạn để so sánh sự trôi dạt trong tương lai.
danh sách kiểm tra
- [ ] Tôi đã xác định số liệu từ bốn nhóm tín hiệu (mức sử dụng, bảo mật, chất lượng, hiệu suất).
- [ ] Tôi đặt ngưỡng cơ sở và ngưỡng cảnh báo cho từng số liệu.
- [ ] Tôi thường xuyên lấy mẫu chất lượng đầu ra qua mắt người.
- [ ] Tôi theo dõi các tín hiệu trên một màn hình bằng bảng hiển thị.
- [ ] Cảnh báo được gửi tới nhóm bảo mật về các điểm bất thường và các đợt bẻ khóa.
- [ ] Tôi cho rằng những phát hiện giám sát là do sự cải thiện nhanh chóng/kiểm soát.