Lợi nhuận:
- Xác định các số liệu đo lường riêng chất lượng giữ chân và chất lượng tạo
- Thiết lập bộ câu hỏi vàng và chạy đánh giá tự động với LLM-với tư cách là giám khảo
- Duy trì chất lượng thông qua phản hồi, giám sát và thử nghiệm hồi quy trong sản xuất
Câu "Tôi đã cài đặt trợ lý, nó có vẻ hoạt động tốt" không phải là một tuyên bố kỹ thuật. Hệ thống RAG bị hỏng một cách âm thầm: một loại tài liệu mới đánh lừa việc truy xuất, một thay đổi kịp thời làm giảm độ chính xác, chỉ mục trở nên cũ kỹ. Cách duy nhất để nhận ra điều này là đo lường. Trong phần này, chúng tôi đề cập đến cách đo lường chất lượng RAG (truy xuất và tạo riêng), đánh giá tự động (LLM-với tư cách là người đánh giá) và duy trì chất lượng trong sản xuất (giám sát, hồi quy). “Bạn không thể cải thiện những gì bạn không đo lường được” là phương châm của đơn vị này.
Đo hai thứ riêng biệt
RAG có hai chân và phải được đo riêng vì sự cố có thể nằm ở một trong hai chân:
- Chất lượng truy xuất: Phần chính xác đã đến chưa?
- Chất lượng tạo ra: Câu trả lời đúng có được tạo ra từ phần được gửi đến không?
Nếu câu trả lời dở thì bạn cần biết chân nào dở trước. Nếu phần bên phải không bao giờ đến, ngay cả lời nhắc tốt nhất cũng không thể lưu được (sự cố truy xuất). Nếu phần chính xác đã đến nhưng mô hình đọc sai thì việc cải thiện khả năng truy xuất là vô ích (vấn đề tạo).
Số liệu truy xuất
Truy xuất là một vấn đề sắp xếp/truy cập; được đo bằng số liệu truy xuất thông tin cổ điển. Để làm được điều này, bạn phải có cụm vàng: kiến thức về phần nào là "đúng" cho mỗi câu hỏi.
thước đo
biện pháp gì
Định nghĩa đơn giản
Nhớ lại@k
Mảnh ghép có nằm trong top k đúng không?
Tỷ lệ chụp phần chính xác
độ chính xác@k
Có bao nhiêu phần k được trả lại có liên quan?
Dọn dẹp những gì được mang theo
MRR (Xếp hạng đối ứng trung bình)
Theo thứ tự nào là phần đúng?
Phần thưởng nằm ở hàng đầu
Tỷ lệ trúng
Có ít nhất một mảnh chính xác đến?
Thước đo thành công cơ bản nhất
Nhận xét thực tế: Nếu Recall@k ở mức thấp, chiến lược phân nhóm hoặc tìm kiếm (kết hợp, k, xếp hạng lại) nên được làm lại. Nếu độ chính xác thấp nhưng khả năng thu hồi lại cao thì việc thêm lại xếp hạng là một động thái tốt.
Số liệu thế hệ
Khi phần chính xác đến, chúng tôi sẽ đo lường chất lượng phản hồi do mô hình tạo ra. Ba kích thước cơ bản:
- Tính trung thực: Mỗi khẳng định trong câu trả lời có được ngữ cảnh hỗ trợ không? Có phù hợp không? Đó là thước đo trực tiếp của ảo giác.
- Trả lời mức độ liên quan: Câu trả lời có thực sự trả lời được câu hỏi hay nó lạc đề?
- Tính đầy đủ: Tất cả thông tin liên quan trong ngữ cảnh đã được sử dụng hay còn thiếu?
Chúng thường được tính điểm trên cơ sở phân loại (ví dụ: 1-5), thay vì nhị phân như “đúng/sai”.
Mẹo: Theo dõi mức độ trung thành dưới dạng số liệu riêng biệt. Nếu độ trung thực giảm khi độ chính xác giảm thì vấn đề nằm ở việc tạo ra; Nếu độ trung thực cao nhưng đáp án sai thì vấn đề là mảnh ghép sai (truy xuất). Cùng với nhau, hai số liệu này là một chiếc la bàn hiển thị vị trí của lỗi.
Thiết lập bộ câu hỏi vàng
Mỗi phép đo yêu cầu một bộ dữ liệu đánh giá/bộ vàng: câu hỏi thực tế + câu trả lời đúng mong đợi + phần nguồn chính xác. Bắt đầu với 30-50 câu hỏi được lựa chọn kỹ lưỡng sẽ tốt hơn 500 câu hỏi ngẫu nhiên. Bao gồm những phần sau trong bộ: câu hỏi thực tế thường gặp, câu hỏi khó đã biết, câu hỏi bẫy không có câu trả lời (nên nói "Tôi không biết"), câu hỏi có nguồn mâu thuẫn.
# Ví dụ về cụm vàng (khái niệm)[ {"question": "Bao nhiêu ngày nghỉ phép hàng năm?", "expected_answer": "14 ngày cho thâm niên 1-5 năm", " Correct_part_id": "two-part-3", "category": "leave"}, {"question": "Văn phòng Mars của công ty ở đâu?", "expected_answer": "NO_INFORMATION", # bẫy: Tôi không biết " Correct_part_id": null, "danh mục": "bẫy"}]
LLM-as-Judge: Đánh giá tự động
Việc ghi hàng trăm câu trả lời bằng tay thật mệt mỏi. Mô hình LLM-với tư cách là giám khảo là khi một mô hình chấm điểm và biện minh cho câu trả lời của mô hình khác dựa trên các tiêu chí nhất định. Lời nhắc của thẩm phán tốt sẽ xác định rõ ràng các tiêu chí, đưa ra ví dụ và yêu cầu giải thích.
# Lời nhắc LLM với tư cách là thẩm phán (khái niệm)Bạn là người đánh giá khách quan. Đánh giá CÂU TRẢ LỜI dưới đây theo BỐI CẢNH đã cho và CÂU TRẢ LỜI DỰ KIẾN. Cho điểm (1-5) và chứng minh:- tính trung thực: mỗi nhận định trong câu trả lời có được hỗ trợ trong ngữ cảnh không?- độ chính xác: câu trả lời có khớp với câu trả lời mong đợi không?- tính đầy đủ: thông tin liên quan có đầy đủ không? Đặc biệt: nếu câu trả lời chứa thông tin không nằm trong ngữ cảnh, hãy đưa ra mức độ trung thực1 và cho biết tuyên bố nào là bịa đặt.CONTEXT: {context}EXPECTED: {expected}TRẢ LỜI: {answer}Kết quả: {trung thực, chính xác, đầy đủ, chính đáng}
Thận trọng: LLM-với tư cách là thẩm phán không hoàn hảo; Họ có thể có những thành kiến riêng (câu trả lời dài, thích phong cách riêng của họ). Đồng thời xác minh Thẩm phán: có một số câu trả lời được cả thẩm phán và con người chấm điểm và đo lường mức độ đồng ý giữa họ. Nếu Thẩm phán nhất quán với điểm số của con người, bạn có thể tin tưởng anh ta.
Xếp hạng Yếu/Mạnh
Yếu ("điều đó tốt cho tôi"):
Tôi đã hỏi một vài câu hỏi và câu trả lời có vẻ tốt. Tôi đã có nó trực tiếp.# Vấn đề: không có phép đo, hồi quy không thể nhận thấy, cải tiến không rõ ràng.
Mạnh mẽ (cụm vàng + số liệu riêng biệt + phán đoán tự động + hồi quy):
Cụm vàng gồm 40 câu hỏi. Với mỗi thay đổi, callcall@5, độ trung thực và độ chính xác sẽ được đo lường tự động. Nếu điểm giảm xuống, thay đổi sẽ được khôi phục. Trong quá trình sản xuất, phản hồi của người dùng được thu thập và thêm vào bộ.
Giám sát và hồi quy trong sản xuất
Việc đánh giá không được thực hiện một lần là xong. Ba thực hành liên tục:
- Kiểm tra hồi quy: Tự động chạy cụm vàng trên mỗi lần nhắc/truy xuất/thay đổi mô hình. Nếu số điểm giảm đi thì sự thay đổi sẽ bị đảo ngược. Điều này ngăn cản việc "phá vỡ nó trong khi cố gắng làm cho nó tốt hơn".
- Giám sát sản xuất: Tỷ lệ "Tôi không thể tìm thấy thông tin" trong các câu hỏi thực tế, độ trễ trung bình, chi phí, phản hồi của người dùng (👍/👎) đều được theo dõi. Việc "Tôi không biết" tăng đột ngột thường là dấu hiệu đầu tiên của sự cố về chỉ mục hoặc truy xuất.
- Vòng phản hồi: Các câu hỏi thực tế do người dùng 👎 cung cấp sẽ được xem xét và thêm vào cọc vàng; Nhờ đó, bộ này trở nên phong phú hơn theo thời gian và các điểm mù của hệ thống được đóng lại.
Ba hộp nhỏ
Trường hợp 1 - Hồi quy im lặng. Một nhóm đã sửa đổi lời nhắc để "cải thiện" nó; Độ chính xác chung tăng lên, nhưng độ trung thực giảm 30% ở các câu hỏi bẫy (mô hình bắt đầu phù hợp hơn). Nó sẽ không được chú ý nếu không có những câu hỏi về bẫy trong cụm vàng; Kiểm tra hồi quy đã hoàn nguyên thay đổi.
Trường hợp 2 - Duỗi thẳng chân sai. Ở một trợ lý, câu trả lời rất tệ; Nhóm đã làm việc theo lời nhắc trong nhiều tuần. Khi chúng tôi đo lường các số liệu truy xuất, khả năng thu hồi@5 chỉ là 48% — vấn đề nằm ở khả năng truy xuất chứ không phải ở việc tạo. Khi kết hợp + sắp xếp lại được thêm vào, tỷ lệ thu hồi tăng lên 89% và độ chính xác cũng tăng theo.
Trường hợp 3 - Cảnh báo sản xuất. Một ngày nọ, tỷ lệ "Tôi không thể tìm thấy thông tin" đối với trợ lý hỗ trợ đã tăng từ 6% lên 34%. Bàn di chuột đã cảnh báo; Nguyên nhân là do công việc lập chỉ mục chạy vào ban đêm đã âm thầm thất bại và các bài viết mới không được tải lên. Nếu không có sự giám sát, những câu nói "Tôi không biết" không chính xác sẽ tiếp tục tồn tại trong nhiều ngày.
Những lỗi thường gặp
- Hài lòng với “nó hoạt động tốt với tôi”: Nếu không đo lường, sự hồi quy sẽ không được chú ý.
- Không tách rời việc thu hồi và tạo: Bạn sẽ sửa sai chân và lãng phí thời gian.
- Không đặt những câu hỏi bẫy: Xu hướng bịa chuyện không xuất hiện ở cụm vàng.
- Không xác minh Thẩm phán: Bồi thẩm đoàn thiên vị đưa ra sự tin tưởng sai lầm.
- Không giám sát sản xuất: Thất bại về chỉ số, bùng nổ giá thành tiếp tục âm thầm
Tóm lại
- Trong RAG, chất lượng truy xuất và tạo được đo lường riêng biệt; Đầu tiên phải xác định chân nào bị hư.
- thu hồi@k, Precision@k, MRR để truy xuất; Sự chung thủy, sự phù hợp, sự trọn vẹn được sử dụng cho thế hệ.
- Mỗi phép đo yêu cầu một cụm vàng; Đặt những câu hỏi thực tế, khó, bẫy và mâu thuẫn trong đó.
- LLM-với tư cách là giám khảo tự động ghi điểm lớn; nhưng chính thẩm phán phải được biện minh chống lại con người.
- Kiểm tra hồi quy, giám sát sản xuất và vòng phản hồi duy trì chất lượng theo thời gian.
Nhiệm vụ ứng dụng
(1) Tạo bộ vàng ít nhất 15 câu hỏi cho trợ lý của mình: gồm ít nhất 3 bẫy (không có đáp án), 3 câu khó, 2 câu nguồn trái ngược nhau. Viết câu trả lời mong đợi và phần đúng cho mỗi câu hỏi. (2) So sánh thủ công hai phiên bản nhắc nhở khác nhau với bộ này; Cho mỗi câu trả lời từ 1-5 điểm về độ trung thực và chính xác. (3) Điều chỉnh lời nhắc LLM với tư cách là giám khảo ở trên theo tiêu chí của riêng bạn. (4) Xác định 3 số liệu bạn sẽ theo dõi trong quá trình sản xuất và với mỗi số liệu hãy hỏi “tôi nên cảnh báo ở ngưỡng nào?” ghi giá trị.
danh sách kiểm tra
- [ ] Tôi có thể đo lường chất lượng duy trì và tạo bằng các số liệu riêng biệt.
- [ ] Tôi biết các số liệu như thu hồi@k, lòng trung thành nghĩa là gì.
- [ ] Tôi có thể xây dựng một cụm vàng bao gồm các câu hỏi thực tế, khó, bẫy và mâu thuẫn.
- [ ] Tôi có thể thiết lập đánh giá tự động và xác minh thẩm phán bằng LLM-với tư cách là thẩm phán.
- [ ] Tôi có thể vận hành thử nghiệm hồi quy, giám sát sản xuất và vòng phản hồi.