Lợi nhuận:
- Khả năng phân biệt xem vấn đề là thông tin hay hành vi và đánh giá việc tinh chỉnh các vấn đề về hành vi chỉ sau khi hết dấu nhắc, số lần chụp và RAG.
- Hiểu các phương pháp tinh chỉnh (SFT, LoRA/PEFT, RLHF) và các thuộc tính dữ liệu xác định chất lượng (tính nhất quán, đa dạng, bảo mật)
- Khả năng đo lường giá trị thực sự của việc tinh chỉnh bằng các bài kiểm tra đánh giá trước sau, học tập quá mức và quên thảm khốc
Tinh chỉnh (tùy chỉnh hành vi của nó bằng cách đào tạo thêm mô hình được đào tạo trước bằng dữ liệu của riêng bạn) là một công cụ mạnh mẽ nhưng đắt tiền trong kho vũ khí của kỹ sư làm việc với LLM. Khi sử dụng không đúng chỗ thì lãng phí tiền bạc và thời gian nhưng khi sử dụng đúng chỗ lại mang lại chất lượng mà không nơi nào có được. Trong phần này, chúng tôi đề cập đến trường hợp cần tinh chỉnh, các phương pháp cơ bản và rủi ro. Mục đích là giúp bạn đưa ra quyết định.
Đầu tiên là câu hỏi đúng: việc tinh chỉnh có cần thiết không?
Sai lầm đắt giá nhất của người mới bắt đầu là vội vàng điều chỉnh ngay một vấn đề có thể giải quyết được. Đặt thứ tự như thế này:
- Kỹ thuật nhanh chóng: Một lời nhắc hay giải thích nhiệm vụ sẽ giải quyết rõ ràng hầu hết các vấn đề. Tiêu thụ ở đây đầu tiên.
- Học tập trong thời gian ngắn: Đưa một vài ví dụ vào lời nhắc sẽ hiển thị cho mô hình định dạng và hành vi mong muốn.
- RAG: Nếu vấn đề là “thiếu thông tin” (cần dữ liệu mà mô hình không biết) thì giải pháp là RAG (đơn vị 4), không tinh chỉnh.
- Tinh chỉnh: Nó phát huy tác dụng nếu những điều trên là không đủ và vấn đề là "hành vi/định dạng/kiểu dáng".
Điểm khác biệt chính: Tinh chỉnh yếu và rủi ro trong việc dạy thông tin mới cho mô hình; nhưng nó rất mạnh trong việc dạy cách cư xử (một dạng thức cụ thể, giọng điệu, biệt ngữ hiện trường, cấu trúc nhất quán). “Người mẫu của tôi không biết thông tin công ty của chúng tôi” → RAG. "Hãy để mô hình của tôi luôn đưa ra kết quả ở định dạng chính xác mà chúng tôi muốn" → ứng viên tinh chỉnh.
Mẹo: Trước khi quyết định tinh chỉnh, hãy hỏi: "Đây là vấn đề về kiến thức hay vấn đề về hành vi?" Các vấn đề về thông tin được giải quyết tốt hơn với RAG, các vấn đề về hành vi được giải quyết tốt hơn nhờ tinh chỉnh.
Phương pháp tinh chỉnh
Tinh chỉnh hoàn toàn: Đào tạo lại tất cả các thông số của mô hình. Mạnh nhất nhưng đắt nhất; Nó đòi hỏi phần cứng (GPU) lớn và dữ liệu cẩn thận. Nó không cần thiết đối với hầu hết các đội.
Tinh chỉnh tham số hiệu quả (PEFT): Các phương pháp đóng băng phần lớn mô hình, chỉ đào tạo một tập hợp nhỏ các tham số bổ sung. Phổ biến nhất là LoRA (Thích ứng cấp thấp: đào tạo các lớp "adapter" nhỏ được thêm vào mô hình). LoRA cung cấp kết quả gần như tinh chỉnh hoàn toàn, với ít bộ nhớ và chi phí hơn nhiều; Đó là lý do tại sao nó là sự lựa chọn đầu tiên trong thực tế.
Tinh chỉnh có giám sát (SFT): Dạy mô hình "phản hồi đầu vào này như thế này" với dữ liệu bao gồm các cặp đầu vào-đầu ra lý tưởng. Đó là kịch bản phổ biến nhất.
Học tập tăng cường từ phản hồi của con người (RLHF): Điều chỉnh hành vi của mô hình cho phù hợp với phản hồi ưa thích của mọi người. Nó phức tạp và đắt tiền; Nhu cầu của hầu hết các nhóm ứng dụng đều được đáp ứng với SFT. Chỉ cần biết RLHF như một khái niệm là đủ.
Dữ liệu: trung tâm của việc tinh chỉnh
Chất lượng tinh chỉnh phụ thuộc hoàn toàn vào chất lượng của dữ liệu huấn luyện. Vài trăm mẫu nhất quán, chất lượng cao sẽ tốt hơn hàng nghìn mẫu cẩu thả. Khi chuẩn bị dữ liệu:
- Tính nhất quán: Tất cả các ví dụ đều thể hiện nhất quán định dạng và giọng điệu mà bạn muốn. Các ví dụ mâu thuẫn khiến mô hình bị nhầm lẫn.
- Sự đa dạng: Các ví dụ bao gồm sự đa dạng trong sử dụng thực tế nhưng không đồng nhất.
- Làm sạch: Các phiên bản chứa dữ liệu không chính xác, sai lệch hoặc bị ẩn sẽ được chuyển vĩnh viễn vào mô hình. Dữ liệu tinh chỉnh phải được đọc cẩn thận như một hợp đồng.
Thận trọng: Mọi thông tin sai lệch, sai sót và ẩn đi vào dữ liệu tinh chỉnh đều được khắc vào mô hình và xuất hiện lại ở đầu ra của mô hình. Kiểm tra dữ liệu đào tạo của bạn một cách tỉ mỉ như thể bạn đang xuất bản nó; Không đăng dữ liệu cá nhân.
Đánh giá: việc tinh chỉnh có hiệu quả không?
Trước khi tinh chỉnh, hãy đặt trước bộ đánh giá đã có sẵn và đo điểm của mô hình mà không cần tinh chỉnh (mô hình cơ sở). Sau khi tinh chỉnh, đo lại trong cùng một dãy. Bạn không thể nói "nó đã tốt hơn" mà không so sánh. Ngoài ra còn có hai cái bẫy cần lưu ý:
- Học tập quá mức: Đào tạo quá mức với dữ liệu nhỏ khiến mô hình mất khả năng ghi nhớ và khái quát hóa các ví dụ đào tạo.
- Sự quên lãng nghiêm trọng: Tập luyện quá sức trong một nhiệm vụ hẹp có thể làm giảm khả năng tổng thể của người mẫu. Kiểm tra xem các kỹ năng cũ có được giữ lại trong khi tiếp thu hành vi mới hay không.
Cách tiếp cận yếu/Cách tiếp cận mạnh mẽ
Yếu: "Tôi có 3000 nhật ký trò chuyện, hãy tinh chỉnh tất cả để người mẫu có thể nói chuyện giống chúng ta."
Güçlü: "Đầu tiên, tôi đánh giá mô hình cơ sở với 100 tác vụ thực, ghi lại điểm số. Tôi đo lường mức độ cải thiện của nó bằng các lời nhắc và vài lần chụp — vẫn chưa đủ. Sau đó, từ 3000 nhật ký, tôi chỉ chọn và làm sạch 400 mẫu có chất lượng cao, định dạng nhất quán và không có dữ liệu ẩn. Tôi tinh chỉnh bằng LoRA, đo lại với 100 tác vụ tương tự và xác nhận bằng một bài kiểm tra riêng rằng các chức năng chung vẫn nguyên vẹn."
Sự khác biệt: trước tiên, cách tiếp cận mạnh mẽ sẽ loại bỏ các lựa chọn thay thế, dữ liệu chọn lọc, các biện pháp trước và sau và kiểm tra tác dụng phụ.
Thực tế về chi phí và bảo trì
Tinh chỉnh không phải là công việc làm một lần; Đó là nghĩa vụ chăm sóc. Có thể cần phải đào tạo lại khi mô hình cơ sở được cập nhật, cần thay đổi hoặc dữ liệu bị mất. Ngoài ra, việc lưu trữ một mô hình tinh chỉnh sẽ mang lại thêm chi phí và hoạt động. So sánh tổng chi phí sở hữu này với sự gia tăng về chất lượng mà nó mang lại. Hầu hết, một dấu nhắc + RAG tốt sẽ rẻ hơn và linh hoạt hơn so với việc tinh chỉnh.
ba trường hợp nhỏ
Trường hợp 1 - Tinh chỉnh không cần thiết. Một nhóm bắt tay vào một dự án tinh chỉnh tốn kém vì "người mẫu của chúng tôi không biết sản phẩm của chúng tôi". Nhiều tháng và ngân sách đã được chi tiêu, kết quả thật mong manh - mô hình trở nên lỗi thời mỗi khi danh mục sản phẩm thay đổi. Cuối cùng, họ chuyển sang RAG: họ lấy dữ liệu sản phẩm từ cơ sở tài liệu, cập nhật tức thời và chi phí giảm xuống. Bài học: vấn đề thông tin không được giải quyết bằng cách tinh chỉnh.
Trường hợp 2 - Tinh chỉnh đúng. Một công ty bảo hiểm muốn mô hình này luôn tạo ra các bản tóm tắt hợp đồng theo cùng một cấu trúc cứng nhắc (từng mục một, với các tiêu đề cụ thể). Tính nhất quán với lời nhắc bị kẹt ở mức 70%. Sau khi LoRA tinh chỉnh với 300 mẫu tốt, tính nhất quán về định dạng tăng lên 98%. Đây là một vấn đề về hành vi và việc tinh chỉnh là công cụ phù hợp.
Trường hợp 3 - Quyền riêng tư thoát vào dữ liệu. Một nhóm đã gửi nhật ký trò chuyện để tinh chỉnh mà không làm sạch chúng. Nhật ký chứa tên khách hàng thực và số nhận dạng. Mô hình được tinh chỉnh bắt đầu "rò rỉ" những tên này dưới dạng đầu ra trong các câu hỏi không liên quan. Mô hình đã bị thu hồi, ẩn dữ liệu và đào tạo lại. Bài học: Thông tin ẩn trong dữ liệu tinh chỉnh được chuyển vĩnh viễn vào mô hình.
Mẫu có thể sao chép
Hãy giúp tôi quyết định xem việc tinh chỉnh có cần thiết cho vấn đề này của tôi không. Vấn đề: [mô tả] Đây có phải là vấn đề THÔNG TIN (mô hình không biết điều gì đó) hay vấn đề HÀNH VI (mô hình không tạo ra định dạng/giọng điệu/cấu trúc mà tôi muốn)? Liệu nó có thể được giải quyết bằng cách nhắc nhở, bắn vài phát và RAG trước không? Tại sao nên thử/không thử từng cái một? Bạn mới đề xuất tinh chỉnh trong điều kiện nào?
Kiểm tra tập dữ liệu tinh chỉnh này:1) Các ví dụ có nhất quán về định dạng và giọng điệu không?2) Chúng có bao gồm các biến thể trong cách sử dụng thực tế không?3) Nó có chứa dữ liệu bí mật/cá nhân (phải được che giấu) không?4) Có các ví dụ xung đột không? Một tập hợp con của các ví dụ: [ví dụ]Liệt kê từng vấn đề và cách khắc phục mà bạn tìm thấy.
Lập kế hoạch đánh giá trước và sau khi tinh chỉnh. Nhiệm vụ: [giải thích]- Nên chọn bộ eval đã giữ lại như thế nào? - Điểm của mô hình cơ sở được đo như thế nào? - Nó được so sánh với số liệu nào sau khi tinh chỉnh? - Làm cách nào để kiểm tra xem các khả năng chung không bị suy giảm (quên thảm khốc)?
Đề xuất siêu tham số ban đầu để tinh chỉnh với kích thước LoRA.Data: [số mẫu]Mục đích: [dạy định dạng/giai điệu]Đề xuất kỷ nguyên, tốc độ học tập và dừng sớm để tránh học quá mức.
Bảng quyết định: công cụ nào khi
cần
thử trước
Tinh chỉnh?
Người mẫu không biết bất kỳ thông tin nào
RAG
không
Dữ liệu hiện tại cần thiết
RAG
không
Định dạng cứng nhắc cụ thể
vài bức ảnh
Nếu không đủ thì có
Giọng điệu/phong cách nhất quán
nhắc nhở + vài lần
Nếu không đủ thì có
Biệt ngữ/kiểu hiện trường
nhắc nhở
Nếu thế vẫn chưa đủ thì LoRA
Tối ưu hóa nhiệm vụ đơn giản
kỹ thuật nhanh chóng
Nói chung là không
Những lỗi thường gặp
- Đang cố gắng giải quyết vấn đề thông tin bằng cách tinh chỉnh. RAG là công cụ phù hợp.
- Tiến hành tinh chỉnh mà không tốn dấu nhắc/vài lần chụp/RAG. Đắt tiền và không cần thiết.
- Đào tạo với dữ liệu chất lượng thấp/xung đột. Dữ liệu ít hơn nhưng rõ ràng thì tốt hơn.
- Đưa dữ liệu bí mật vào giáo dục. Xâm nhập vĩnh viễn vào mô hình.
- Không đo lường trước và sau. Bạn không thể chứng minh sự phục hồi.
- Không kiểm tra sự quên lãng thảm khốc. Kỹ năng mới có thể phá vỡ kỹ năng cũ.
Tóm lại
Tinh chỉnh là một công cụ mạnh mẽ nhưng đắt tiền và chỉ nên được xem xét đối với các vấn đề về hành vi/định dạng sau khi sử dụng RAG nhắc nhở vài lần bắn; vấn đề thông tin thuộc về RAG. Các phương pháp hiệu quả về tham số như LoRA là lựa chọn thực tế đầu tiên. Chất lượng phụ thuộc hoàn toàn vào chất lượng dữ liệu; Sử dụng dữ liệu nhỏ nhưng sạch sẽ, nhất quán và bí mật. Đo lường trước và sau, kiểm tra khả năng học tập quá mức và mất năng lực. Tinh chỉnh là một nhiệm vụ quan tâm; Cân nhắc tổng chi phí so với chất lượng mà nó mang lại.
Nhiệm vụ ứng dụng
Chọn một vấn đề và quyết định xem có cần điều chỉnh hay không bằng cách phân biệt giữa "kiến thức hoặc hành vi" và viết lời giải thích của bạn. Nếu đó là vấn đề về hành vi, hãy chuẩn bị 20-30 mẫu nhất quán, kiểm tra dữ liệu ẩn và ghi lại kế hoạch đánh giá trước và sau (cụm được tổ chức, điểm cơ bản, chỉ số so sánh, bài kiểm tra quên). Nếu vấn đề có thể được giải quyết bằng RAG/few-shot thay vì tinh chỉnh, hãy ghi lại điều này.
danh sách kiểm tra
- [ ] Tôi đã xác định được vấn đề là kiến thức hay hành vi.
- [ ] Lần đầu tiên tôi đánh giá các lựa chọn thay thế nhắc nhở, bắn vài phát và RAG.
- [ ] Tôi đã kiểm tra dữ liệu tinh chỉnh để đảm bảo tính nhất quán, đa dạng và bảo mật.
- [ ] Tôi đã phân bổ một cụm đánh giá được tổ chức sẵn và đo điểm cơ bản.
- [ ] Tôi đã lên kế hoạch cho một bài kiểm tra so sánh trước sau và quên.
- [ ] Tôi đã so sánh tổng chi phí với chất lượng mà nó mang lại.