Đơn vị 8 / 11

Đánh giá và giám sát: Biết mô hình thực sự làm gì trong sản xuất

Lợi nhuận:

  • Khả năng nhận biết các nguyên nhân thầm lặng làm suy thoái mô hình (trôi dạt dữ liệu, trôi dạt khái niệm, lỗi ngược dòng) và thiết lập giám sát ba lớp (vận hành, đầu vào, đầu ra)
  • Khả năng đánh giá hệ thống LLM theo nhiều lớp bằng kiểm tra quy tắc, đánh giá con người và trọng tài LLM, đồng thời hiệu chỉnh bằng neo con người của trọng tài LLM
  • Khả năng thiết kế một bộ đánh giá chứa các trường hợp cạnh và bảo mật, đồng thời biến từng lỗi phát hiện thành trường hợp kiểm tra vĩnh viễn

Khi một mô hình được đưa vào sản xuất, công việc của bạn vẫn chưa hoàn thành; Trách nhiệm thực sự chỉ mới bắt đầu. Bởi mô hình có thể âm thầm bị hỏng khi không có ai để ý. Trong học phần này, chúng tôi đề cập đến hai nguyên tắc bổ sung: đánh giá (đo lường chất lượng của mô hình một cách có hệ thống) và giám sát (giám sát liên tục mô hình trong sản xuất). Đặc biệt trong các hệ thống LLM, việc đánh giá khó khăn hơn và cần được cẩn thận hơn so với ML cổ điển.

Vì sao mô hình sản xuất đang âm thầm sụp đổ

Một lỗi xảy ra, nhật ký được in, báo thức tắt. Mặt khác, một mô hình ML có thể sai mà không gây ra lỗi. Ba nguyên nhân chính gây suy thoái:

  • Sự trôi dạt dữ liệu: Sự phân bổ dữ liệu đầu vào thay đổi theo thời gian (sản phẩm mới, hành vi người dùng thay đổi, tính thời vụ). Mô hình vẫn như cũ nhưng thế giới thay đổi.
  • Sự trôi dạt khái niệm: Mối quan hệ đầu vào-đầu ra thay đổi. Chiến thuật lừa đảo và mô hình thư rác ngày càng phát triển; Điều gì đúng ngày hôm qua sẽ sai ngày hôm nay.
  • Lỗi ngược dòng: Nguồn dữ liệu thay đổi định dạng, một khu vực trở nên trống; Mô hình âm thầm chảy nước dãi với đầu vào bị hỏng.

Truy tìm đang làm cho những biến dạng im lặng này có thể nghe được.

Những gì cần xem: ba lớp

Giám sát tốt bao gồm ba lớp:

  1. Số liệu hoạt động: Độ trễ, tỷ lệ lỗi, khối lượng yêu cầu, mức sử dụng tài nguyên. "Hệ thống có đứng vững được không?"
  2. Số liệu dữ liệu/đầu vào: Việc phân phối đầu vào có giống như trong đào tạo không? Tỷ lệ giá trị còn thiếu có tăng lên không? Các danh mục mới đã đến chưa? “Mô hình có nhìn thấy dữ liệu quen thuộc không?”
  3. Số liệu mô hình/đầu ra: Nhật ký phân phối dự đoán? Điểm tin cậy có giảm không? Và nếu có thể thì độ chính xác so với thực tế mặt đất là bao nhiêu? “Mô hình vẫn chính xác chứ?”

Lớp thứ ba có giá trị nhất nhưng khó khăn nhất; bởi vì kết quả thực sự thường đi kèm với sự chậm trễ (sau nhiều tháng mọi chuyện sẽ rõ ràng liệu khoản vay có được hoàn trả hay không).

Mẹo: Nếu kết quả thực tế bị trễ, trước tiên hãy theo dõi phân phối đầu vào và dự đoán. Sự thay đổi phân bố đầu vào là dấu hiệu sớm của sự suy giảm độ chính xác và có thể đưa ra cảnh báo mà không cần đợi kết quả thực tế.

Đánh giá hệ thống LLM: thách thức đặc biệt

Trong ML cổ điển, "câu trả lời đúng" là rõ ràng (loại 0 hoặc 1). Mặt khác, kết quả LLM có kết quả mở: có thể có nhiều câu trả lời đúng cho cùng một câu hỏi, “tính đúng đắn” không khớp với một con số duy nhất. Phương pháp đánh giá LLM:

  • Số liệu được tham chiếu: So sánh kết quả đầu ra với câu trả lời lý tưởng. Giới hạn; bởi vì nó có thể coi câu trả lời đúng được thể hiện khác nhau là "sai".
  • Kiểm tra dựa trên quy tắc: JSON đầu ra có hợp lệ không? Có từ nào bị cấm không? Nó có chứa các trường mong muốn không? Giá rẻ, đáng tin cậy, chặt chẽ.
  • LLM-thẩm phán (LLM-as-thẩm phán): Đừng làm người mẫu hỏi "câu trả lời này có tốt theo tiêu chí này không?" Nó cân, nhưng bản thân trọng tài phải được xác minh.
  • Đánh giá của con người: Tiêu chuẩn vàng nhưng đắt và chậm. Nó được sử dụng trên mẫu.

Trong thực tế, chúng được sử dụng cùng nhau: kiểm tra quy tắc rẻ tiền trên mỗi đầu ra, đánh giá LLM trên một mẫu lớn, đánh giá con người trên một mẫu nhỏ nhưng nghiêm ngặt.

Cách tiếp cận yếu/Cách tiếp cận mạnh mẽ

Yếu: "LLM-Tôi đã hỏi trọng tài, 92% câu trả lời của chúng tôi là tốt. Hệ thống rất tuyệt."

Güçlü: "Trước tiên, chúng tôi gắn nhãn 100 bản in do con người dán nhãn. Chúng tôi cho giám khảo LLM dựa trên 100 bản in đó và đo lường mức độ đồng ý giữa con người với giám khảo — 85% đồng ý, có thể chấp nhận được. Chúng tôi ghi lại những điểm mà thẩm phán đã sai một cách có hệ thống (xu hướng tìm ra những câu trả lời dài một cách không công bằng) và sửa lời nhắc của ông ấy. Chỉ khi đó, chúng tôi mới tin tưởng vào điểm số của giám khảo."

Sự khác biệt: cách tiếp cận mạnh mẽ xác minh trọng tài bằng con người chứ không phải một cách mù quáng. Một trọng tài LLM chưa được xác minh mang lại sự tự tin đẹp đẽ nhưng sai lầm.

Lưu ý: Trọng tài LLM cũng là một hình mẫu; gây ảo giác, thiên vị (thích câu trả lời dài/tự tin), có thể không nhất quán. Hiệu chỉnh điểm trọng tài bằng thẻ người trước khi đưa ra quyết định sản xuất.

Bộ đánh giá: được thiết kế cẩn thận

Một bộ đánh giá tốt thể hiện sự đa dạng trong cách sử dụng thực tế và các trường hợp khó. Một đánh giá chỉ chứa đầy những ví dụ đơn giản sẽ khiến bạn mất tự tin. Hãy chắc chắn đặt nó trong cụm eval:

  • Các trường hợp đặc biệt: Đầu vào trống, đầu vào rất dài, định dạng bất thường.
  • Các trường hợp khó đã biết: Ví dụ trong đó mô hình đã mắc lỗi trong quá khứ (dưới dạng kiểm tra hồi quy).
  • Sự cố bảo mật: Nỗ lực tiêm nhắc, yêu cầu độc hại, bẫy vi phạm quyền riêng tư.

Cụm đánh giá phát triển theo thời gian: mỗi lỗi mới bạn phát hiện được trong quá trình sản xuất sẽ trở thành trường hợp kiểm thử cho lần đánh giá tiếp theo.

Báo động và can thiệp

Giám sát vẫn chưa đầy đủ nếu không có báo động. Cần có ngưỡng và kế hoạch phản hồi cho từng chỉ số quan trọng: “Thông báo cho kỹ sư nếu độ lệch đầu vào vượt quá X”, “Tự động quay lại nếu tỷ lệ lỗi vượt quá Y”. Giữ cho các cảnh báo có ý nghĩa — quá nhiều cảnh báo sai sẽ khiến nhóm mất cảm giác và khiến họ bỏ lỡ cảnh báo thực sự.

ba trường hợp nhỏ

Trường hợp 1 - Cảnh báo sớm. Độ chính xác thực sự của mô hình dự báo nhu cầu chỉ trở nên rõ ràng vào cuối tuần. Nhóm đang theo dõi việc phân phối đầu vào và nhận thấy sự gia tăng đột ngột của một danh mục sản phẩm mới vào thứ Ba - điều mà mô hình chưa từng thấy. Họ đã cập nhật mô hình mà không cần chờ độ chính xác giảm xuống. Giám sát đầu vào đã lưu ngày.

Trường hợp 2 - Trọng tài chưa được xác minh. Một nhóm đã báo cáo "chất lượng của chúng tôi rất xuất sắc" dựa trên người đánh giá LLM. Khi khiếu nại của khách hàng tăng lên, sự giám sát của con người đã được đưa ra: trọng tài coi những câu trả lời tự tin nhưng không chính xác là "tốt". Sau khi trọng tài được hiệu chỉnh bằng thẻ người, chất lượng thực sự đã lộ ra và thấp hơn nhiều. Bài học: đừng tin trọng tài khi chưa xác minh.

Trường hợp 3 - Kiểm tra hồi quy. Một sự thay đổi nhanh chóng đã giải quyết được một vấn đề trong khi âm thầm phá vỡ một vấn đề khác. Nhưng nhóm đã giữ lại các lỗi đã qua trong nhóm eval; Khi thay đổi mới được thử nghiệm trên cụm này, trường hợp hỏng ngay lập tức được phát hiện và thay đổi đã được sửa. Bài học: mọi lỗi được sửa sẽ trở thành trường hợp thử nghiệm vĩnh viễn.

Mẫu có thể sao chép

Lập kế hoạch theo dõi cho mô hình sản xuất này. Bao gồm ba lớp:1) Hoạt động (độ trễ, tỷ lệ lỗi, âm lượng)2) Đầu vào/dữ liệu (sự thay đổi phân phối, giá trị bị thiếu, danh mục mới)3) Mô hình/đầu ra (phân phối dự đoán, độ tin cậy, độ chính xác nếu có thể) Mô hình: [mô tả]. Mất bao lâu để có kết quả thực tế: [duration]Thêm ngưỡng và đề xuất can thiệp cho từng chỉ số.

Đề xuất chiến lược đánh giá (eval) cho hệ thống LLM này. Nhiệm vụ: [description]Xác định các lớp:- Những kiểm tra dựa trên quy tắc nào sẽ chạy trên mỗi đầu ra?- Trọng tài LLM nên đánh giá những tiêu chí nào và chúng nên được xác thực như thế nào (neo con người)?- Nên thực hiện đánh giá con người trong mẫu nào?Liệt kê các trường hợp cạnh và an toàn mà tôi nên đưa vào bộ eval.

Kiểm tra lời nhắc của trọng tài LLM này:- Tiêu chí đánh giá rõ ràng hay chủ quan?- Nó có thiên về độ dài/độ tin cậy không?- Làm cách nào để hiệu chỉnh trọng tài bằng thẻ con người? Lời nhắc của trọng tài: [nhắc nhở]

Viết sổ tay phản hồi cho cảnh báo giám sát này. Cảnh báo: [ví dụ: vượt quá ngưỡng trôi đầu vào]Phải chứa: các bước kiểm soát ban đầu, nguyên nhân có thể, tiêu chí khôi phục, người cần thông báo.

Bảng nguyên nhân hư hỏng

sự bóp méo

triệu chứng

Cách phát hiện sớm

trôi dạt dữ liệu

Thay đổi phân phối đầu vào

Giám sát phân phối đầu vào

sự thay đổi khái niệm

Sự công bình rơi vào im lặng

Dự đoán + so sánh thực tế

lỗi ngược dòng

Các trường bị bỏ trống/thay đổi định dạng

Xác thực lược đồ + tỷ lệ thiếu

Sự không nhất quán của mô hình

Sự thay đổi phân phối đầu ra

Giám sát phân phối đầu ra

Những lỗi thường gặp

  • Không thiết lập giám sát. Mô hình bị phá vỡ trong im lặng, không ai nhìn thấy.
  • Chỉ theo dõi số liệu hoạt động. Hệ thống đã hoạt động nhưng dự đoán có thể sai.
  • Sử dụng LLM mà không xác minh trọng tài. Nó mang lại sự tự tin sai lầm.
  • Đánh giá bằng các ví dụ dễ dàng. Nó không cho thấy khó khăn thực sự.
  • Không bao gồm các lỗi trong quá khứ trong eval. Lỗi tương tự lại quay trở lại.
  • Báo động lớn. Nhóm trở nên mất nhạy cảm, mất đi cảnh báo thực sự.

Tóm lại

Mô hình có thể không chính xác mà không gây ra sai sót trong sản xuất; vì vậy việc đánh giá và giám sát cũng quan trọng như sự phát triển. Thiết lập giám sát ở ba lớp (vận hành, đầu vào, đầu ra); Sử dụng độ lệch đầu vào làm cảnh báo sớm nếu kết quả thực tế bị trễ. Trong hệ thống LLM, eval có kết thúc mở; Sử dụng kết hợp các biện pháp kiểm tra quy tắc, trọng tài LLM và đánh giá con người - nhưng hãy đảm bảo xác thực trọng tài LLM bằng con người. Làm phong phú thêm cụm Eval của bạn với các trường hợp bảo mật và biên, đồng thời biến mọi lỗi phát hiện thành trường hợp kiểm thử vĩnh viễn.

Nhiệm vụ ứng dụng

Viết kế hoạch giám sát ba lớp cho mô hình sản xuất (hoặc gần sản xuất) và xác định ngưỡng + cảnh báo cho ít nhất một chỉ số phân phối đầu vào. Nếu bạn có hệ thống LLM: gắn thẻ 30 đầu ra có con người, chạy trọng tài LLM trên cùng đầu ra và đo lường sự đồng ý giữa con người và trọng tài; Lưu ý sự thiên vị mang tính hệ thống của trọng tài. Thêm ít nhất 3 cạnh và 2 trường hợp bảo mật vào cụm eval của bạn.

danh sách kiểm tra

  • [ ] Giám sát bao gồm cả ba lớp (vận hành, đầu vào, đầu ra).
  • [ ] Tôi sử dụng độ lệch đầu vào làm cảnh báo sớm nếu kết quả thực tế bị trễ.
  • [ ] Tôi đã hiệu chỉnh trọng tài LLM bằng nhãn của con người.
  • [ ] Cụm Eval chứa các trường hợp biên và bảo mật.
  • [ ] Tôi đã biến mọi lỗi tôi gặp phải thành một trường hợp thử nghiệm vĩnh viễn.
  • [ ] Mỗi số liệu quan trọng đều có ngưỡng và kế hoạch phản hồi.