Lợi nhuận:
- Khả năng thiết lập các lớp xác thực đầu ra dựa trên quy tắc và lược đồ
- Khả năng yêu cầu có sự tham gia của con người trong các quyết định có tác động lớn một cách có ý nghĩa
- Khả năng thiết kế định tuyến dựa trên ngưỡng xác minh và tin cậy với mô hình thứ hai
Một mô hình ngôn ngữ tạo ra sự trôi chảy, thuyết phục và thường chính xác—nhưng “thuyết phục” không đồng nghĩa với “chính xác”. Mô hình có thể âm thầm khớp với số lượng, ngày tháng hoặc trường JSON; Đây được gọi là ảo giác (mô hình tự tin tạo ra thông tin không tồn tại trong thực tế). Trong hệ thống doanh nghiệp, nếu kết quả đầu ra đó chuyển sang bước tiếp theo — thanh toán, email, ghi cơ sở dữ liệu — thì lỗi sẽ lan sang thế giới thực. Trong phần này, chúng ta sẽ học cách lọc đầu ra bằng các lớp xác minh trước khi nó đưa vào hệ thống và yêu cầu con người tham gia vào các quyết định có tác động cao.
Tại sao cần phải xác thực đầu ra?
Đầu ra của mô hình có thể bị hỏng theo hai cách chính: định dạng (không phù hợp với lược đồ JSON dự kiến, trường bị thiếu/thừa) và nội dung (định dạng đúng nhưng giá trị sai - mã sản phẩm không tồn tại, ngày tháng không hợp lý). Có một khía cạnh thứ ba về mặt bảo mật: đầu ra độc hại (một lệnh độc hại được tạo ra do bị tiêm hoặc rò rỉ). Một hệ thống vững chắc dừng cả ba ở cửa.
Thận trọng: "Mô hình nói chung chính xác" không phải là tiêu chí sản xuất. Trong một hệ thống không có xác minh, thậm chí một phần nghìn lỗi có nghĩa là có 100 giao dịch sai sót mỗi ngày trong 100.000 yêu cầu mỗi ngày.
Các lớp xác thực: Từng bước
- Xác thực lược đồ. Kiểm tra với máy xem đầu ra có phù hợp với cấu trúc dự kiến hay không: các trường có hiện diện không, loại của chúng có đúng không, các trường bắt buộc có được điền không?
- Xác thực quy tắc/logic kinh doanh. Các giá trị có khớp với quy tắc kinh doanh không? (Số lượng > 0, ngày không ở tương lai, mã sản phẩm thuộc danh mục.)
- Kiểm soát tài liệu tham khảo/nguồn. Nếu mô hình tạo ra một xác nhận, nó có thể được liên kết với nguồn không? (Trích dẫn RAG có thực sự có trong tài liệu không?)
- Xác thực bằng mô hình thứ hai (LLM-as-thẩm phán). Một mô hình độc lập đánh giá kết quả đầu ra là "đúng/không đầy đủ/rủi ro".
- Ngưỡng tin cậy và định hướng. Nếu mô hình hoặc trình xác nhận báo cáo độ tin cậy thấp thì kết quả đầu ra sẽ không tự động vượt qua; được hướng tới con người.
- Sự kiểm soát của con người. Kết quả có hiệu lực cao hay an toàn thấp phụ thuộc vào sự chấp thuận của chuyên gia.
Bốn mẫu có thể sao chép
Đề án + “không biết thì bù đắp”:
CHỈ trả về phản hồi trong lược đồ JSON sau: Viết "thấp". KHÔNG BAO GIỜ viết ước tính như thể nó chính xác.
Xác minh bằng mô hình thứ hai (nhắc nhở của giám khảo):
Bạn là người xác nhận độc lập. Dưới đây là văn bản <nguồn> và <claim>. Kiểm tra xem MỌI số và ngày trong tuyên bố có xuất hiện đúng nguyên văn trong nguồn hay không. Đối với mỗi câu, hãy nói: "đã được xác minh | không có trong nguồn | nguồn mâu thuẫn." Nếu thậm chí một trong số chúng là 'vắng mặt/xung đột', hãy đánh dấu kết quả là "BẮT BUỘC ĐÁNH GIÁ CON NGƯỜI".<source>{{ text }</source><claim>{{ model_output }</claim>
Quy tắc định tuyến ngưỡng tin cậy:
Quy tắc định tuyến:- emin_misin = "cao" VÀ số tiền < 10.000 TL -> xử lý tự động- emin_misin = "trung bình" HOẶC số tiền 10.000-100.000 TL -> xác minh mô hình thứ hai- emin_misin = "thấp" HOẶC số tiền > 100.000 TL -> cần có sự phê duyệt của con người
Thẻ tóm tắt đánh giá con người (tăng tốc độ đánh giá):
Khi trình bày quyết định với một người, hãy xuất trình thẻ này:- Điều gì đang được đề xuất? (một câu)- Dựa vào nguồn nào? (tham khảo bài viết/tài liệu)- 2 giả định yếu nhất là gì?- Nếu được chấp thuận thì có thể đảo ngược được không? (có/không)
Nhắc yếu / Nhắc mạnh
cách tiếp cận kém
Cách tiếp cận mạnh mẽ
"Trừ số tiền từ hóa đơn" (văn bản miễn phí)
Lược đồ JSON nghiêm ngặt + null + trường tin cậy
Viết đầu ra trực tiếp vào hệ thống thanh toán
Lược đồ → quy tắc → sự chấp thuận của con người (nếu cần)
Chỉ cần nói với người mẫu "hãy chắc chắn"
Xác thực số/ngày với mô hình thứ hai
Xử lý mọi đầu ra với độ tin cậy như nhau
Định tuyến dựa trên ảnh hưởng và sự tin cậy
Cách tiếp cận mạnh mẽ không hy vọng rằng mô hình là đúng; Nó tạo ra một cánh cửa sẽ bắt bạn khi bạn mắc sai lầm.
Ba hộp nhỏ
Trường hợp 1 - Chỉ kế hoạch thôi là chưa đủ. Tự động hóa kế toán đang trích xuất số tiền từ hóa đơn dưới dạng JSON. Lược đồ đúng, nhưng mô hình tạo ra "125.000" thay vì "1.250,00" trên hóa đơn (dịch chuyển thập phân). Kế hoạch không nắm bắt được điều này; xác minh quy tắc ("số tiền phải phù hợp với tổng số mục hóa đơn ± 1%") đã bị phát hiện và việc ghi sai 112.500 TL đã bị ngăn chặn.
Trường hợp 2 - Mô hình thứ hai bắt được ảo giác. “Thông báo chấm dứt 30 ngày,” một trợ lý hỗ trợ pháp lý cho biết trong bản tóm tắt hợp đồng; Tuy nhiên, trong hợp đồng là 90 ngày. Khi thẩm phán độc lập gắn cờ mô hình là "xung đột với nguồn", kết quả đầu ra sẽ được chuyển tiếp đến con người và sửa chữa. Nếu là tự động, khách hàng sẽ thông báo hủy do sai ngày.
Trường hợp 3 - Định tuyến giảm tải 70%. Hệ thống yêu cầu bồi thường bảo hiểm tự động phê duyệt các yêu cầu bồi thường số tiền thấp và bảo mật cao, đồng thời chỉ gửi những yêu cầu trên ngưỡng/bảo mật thấp cho chuyên gia. Trong số 3.200 nhu cầu hàng ngày, chỉ có 950 là của con người; các chuyên gia đã dành thời gian của họ cho 30% thực sự rủi ro, với thời gian giao dịch trung bình giảm từ 4 giờ xuống còn 40 phút.
Mẹo: Đừng thiết lập sự kiểm soát của con người để "mọi người có thể nhìn thấy mọi thứ" - điều này sẽ khiến mọi người mệt mỏi và sự chấp thuận sẽ trở thành một con dấu cao su. Thay vào đó, chỉ gửi những kết quả đầu ra có tác động cao và độ tin cậy thấp đến con người; Điều này tập trung sự chú ý vào những gì thực sự quan trọng.
Làm cho việc kiểm soát con người trở nên có ý nghĩa
Con người trong vòng lặp không phải là đặt một hộp kiểm lên giấy. Người đánh giá phải có (1) bối cảnh để hiểu quyết định, (2) quyền tiếp cận nguồn và (3) quyền nói “không”. Nếu không, việc kiểm soát vẫn mang tính thẩm mỹ. Thẻ đánh giá (mẫu thứ tư ở trên) chỉ nhằm mục đích cung cấp bối cảnh đó.
Những lỗi thường gặp
- Chỉ thực hiện xác thực lược đồ và bỏ qua lỗi nội dung/giá trị.
- Nghĩ rằng bằng cách nói với mô hình "hãy đảm bảo" bạn đang thực hiện xác minh thực sự.
- Tự động thực hiện các quyết định có tác động cao, không thể đảo ngược.
- Đặt sự kiểm soát của con người lên mọi đầu ra và biến sự phê duyệt thành một con dấu cao su vô nghĩa.
- Nói “phê duyệt” với người đánh giá mà không đưa ra nguồn và ngữ cảnh.
- Xử lý tất cả các đầu ra có cùng rủi ro mà không thiết lập ngưỡng tin cậy và định tuyến.
Tóm lại
- Đầu ra bị hỏng theo ba cách: hình thức, nội dung và mục đích xấu; một hệ thống vững chắc dừng cả ba ở cửa.
- Các lớp: xác thực lược đồ, logic quy tắc/kinh doanh, kiểm soát nguồn, mô hình thứ hai (LLM-as-thẩm phán) và định tuyến ngưỡng tin cậy.
- Con người trong vòng lặp phải là yếu tố bắt buộc đối với các đầu ra có tác động cao và độ an toàn thấp.
- Đánh giá của con người phải có ý nghĩa: người đánh giá phải có bối cảnh, quyền truy cập tài nguyên và có quyền nói “không”.
- Cả sự an toàn và hiệu quả đều đạt được bằng cách chỉ hướng những rủi ro đến con người chứ không phải mọi đầu ra.
Nhiệm vụ ứng dụng
Lấy một ví dụ từ kết quả AI của riêng bạn. Trước tiên hãy xác định một lược đồ JSON và buộc đầu ra cho nó. Sau đó viết ít nhất hai quy tắc kinh doanh (ví dụ: “số tiền khớp với tổng số mục”). Cuối cùng, hãy thiết lập một bảng định tuyến: sự kết hợp tin cậy/ảnh hưởng nào sẽ tự động diễn ra, mô hình nào sẽ chuyển sang mô hình thứ hai, mô hình nào sẽ chuyển đến con người? Tạo một mẫu bị lỗi và quan sát xem mỗi lớp lấy mẫu đó ở đâu.
danh sách kiểm tra
- [ ] Tôi xác định một lược đồ nghiêm ngặt cho đầu ra và xác minh nó bằng máy.
- [ ] Tôi đã thêm ít nhất một xác thực doanh nghiệp/quy tắc (logic giá trị).
- [ ] Tôi có thể liên kết các xác nhận với nguồn và kiểm tra chúng.
- [ ] Có sẵn mô hình thứ hai hoặc xác nhận của con người cho kết quả có tác động cao/an toàn thấp.
- [ ] Quy tắc định tuyến được xác định dựa trên sự tin cậy và ảnh hưởng.
- [ ] Người đánh giá được cung cấp bối cảnh, nguồn và thẩm quyền để từ chối.