단위 6 / 11

미세 조정 기반: 언제, 어떻게, 어떤 위험을 감수해야 할까요?

이득:

  • 문제가 정보인지 행동인지 구별하고 프롬프트, 퓨샷, RAG가 소진된 후에만 행동 문제에 대한 미세 조정을 평가하는 능력입니다.
  • 미세 조정 방법(SFT, LoRA/PEFT, RLHF) 및 품질을 결정하는 데이터 속성(일관성, 다양성, 기밀성) 이해
  • 사전 사후 평가, 과잉 학습 및 치명적인 망각 테스트를 통해 미세 조정의 진정한 가치를 측정하는 능력

미세 조정(자신의 데이터로 사전 훈련된 모델을 추가로 훈련하여 동작을 사용자 정의)은 LLM으로 작업하는 엔지니어의 무기고에 있는 강력하지만 비용이 많이 드는 도구입니다. 엉뚱한 곳에 사용하면 돈과 시간이 낭비되지만, 올바른 곳에 사용하면 다른 방법으로는 이룰 수 없는 품질을 제공한다. 본 단원에서는 미세 조정이 필요한 경우와 기본 방법 및 위험에 대해 다룹니다. 목표는 당신이 의사결정을 내리는 것입니다.

먼저 올바른 질문입니다. 미세 조정이 필요한가요?

초보자가 저지르는 가장 큰 실수는 해결할 수 있는 문제를 즉시 미세 조정하기 위해 서두르는 것입니다. 다음과 같이 순서를 설정하세요.

  1. 프롬프트 엔지니어링: 작업을 명확하게 설명하는 좋은 프롬프트는 대부분의 문제를 해결합니다. 먼저 여기에서 소비하세요.
  2. 퓨샷 학습: 프롬프트에 몇 가지 예를 넣으면 모델에 원하는 형식과 동작이 표시됩니다.
  3. RAG: 문제가 "정보 부족"(모델이 모르는 데이터의 필요성)인 경우 해결책은 미세 조정이 아닌 RAG(단위 4)입니다.
  4. 미세 조정: 위의 내용이 충분하지 않고 문제가 "행동/형식/스타일"인 경우 작동됩니다.

주요 차이점: 미세 조정은 모델에 새로운 정보를 가르치는 데 약하고 위험합니다. 그러나 행동 방법(특정 형식, 어조, 현장 전문 용어, 일관된 구조)을 가르치는 데는 강력합니다. “내 모델은 우리 회사 정보를 모릅니다.” → RAG. "내 모델이 항상 우리가 원하는 정확한 형식으로 출력을 제공하도록 하세요." → 미세 조정 후보.

팁: 미세 조정을 결정하기 전에 "이것은 지식 문제입니까, 아니면 행동 문제입니까?"라고 질문하십시오. 정보 문제는 RAG로 더 잘 해결되고, 행동 문제는 미세 조정으로 더 잘 해결됩니다.

미세 조정 방법

전체 미세 조정: 모델의 모든 매개변수를 재교육합니다. 가장 강력하지만 가장 비쌉니다. 대규모 하드웨어(GPU)와 세심한 데이터가 필요합니다. 대부분의 팀에서는 불필요합니다.

매개변수 효율적 미세 조정(PEFT): 모델의 대부분을 동결하고 소수의 추가 매개변수 세트만 훈련하는 방법입니다. 가장 일반적인 것은 LoRA(Low-Rank Adaptation: 모델에 추가된 작은 "어댑터" 계층 훈련)입니다. LoRA는 훨씬 적은 메모리와 비용으로 완전한 미세 조정에 가까운 결과를 제공합니다. 그렇기 때문에 실제로는 첫 번째 선택입니다.

SFT(Supervised Fine-Tuning): 입력-이상적 출력 쌍으로 구성된 데이터를 사용하여 "이 입력에 이렇게 응답"하도록 모델을 교육합니다. 가장 일반적인 시나리오입니다.

인간 피드백을 통한 강화 학습(RLHF): 사람들이 선호하는 반응에 따라 모델의 행동을 조정합니다. 복잡하고 비용이 많이 듭니다. SFT는 대부분의 애플리케이션 팀의 요구 사항을 충족합니다. RLHF를 개념으로 알아두시면 충분합니다.

데이터: 미세 조정의 핵심

미세 조정의 품질은 전적으로 훈련 데이터의 품질에 따라 달라집니다. 수백 개의 고품질의 일관된 샘플이 수천 개의 엉성한 샘플보다 낫습니다. 데이터를 준비할 때:

  • 일관성: 모든 예는 원하는 형식과 톤을 일관되게 보여줍니다. 모순되는 예는 모델을 혼란스럽게 만듭니다.
  • 다양성: 예제는 실제 사용의 다양성을 포괄하지만 균일하지는 않습니다.
  • 정리: 부정확하거나 편향되거나 숨겨진 데이터가 포함된 인스턴스는 영구적으로 모델에 전달됩니다. 미세 조정 데이터는 계약서처럼 주의 깊게 읽어야 합니다.
주의: 미세 조정 데이터에 입력되는 모든 편향, 오류 및 숨겨진 정보는 모델에 반영되어 출력에 다시 나타납니다. 학습 데이터를 게시하는 것처럼 꼼꼼하게 감사하세요. 개인 데이터를 게시하지 마십시오.

검토: 미세 조정이 효과가 있었나요?

미세 조정 전에 보유 평가 세트를 예약하고 미세 조정 없이 모델(기본 모델)의 점수를 측정합니다. 미세 조정 후 동일한 뱅크에서 다시 측정하십시오. 비교하지 않고는 "더 좋아졌다"고 말할 수는 없습니다. 또한 알아야 할 두 가지 함정은 다음과 같습니다.

  • 과잉 학습: 작은 데이터로 과잉 학습하면 모델이 학습 사례를 기억하고 일반화하는 능력이 상실됩니다.
  • 치명적인 망각: 좁은 작업에 대한 과도한 훈련은 모델의 전반적인 능력을 손상시킬 수 있습니다. 새로운 행동을 획득하는 동안 기존 기술이 유지되는지 테스트합니다.

약한 접근 / 강력한 접근

약함: "채팅 로그가 3000개 있습니다. 모델이 우리처럼 말할 수 있도록 모두 미세 조정하도록 하겠습니다."

Güçlü: "먼저 100개의 실제 작업으로 기본 모델을 평가하고 점수를 기록했습니다. 프롬프트와 몇 번의 샷으로 얼마나 개선되었는지 측정했는데 충분하지 않았습니다. 그런 다음 3000개의 로그에서 고품질, 일관된 형식 및 숨겨진 데이터가 없는 400개의 샘플만 선택하고 정리했습니다. LoRA로 미세 조정하고 동일한 100개의 작업으로 다시 측정한 후 별도의 테스트를 통해 일반 기능이 손상되지 않았음을 확인했습니다."

차이점: 강력한 접근 방식은 대안을 먼저 소진하고, 데이터를 선별하고, 전후 측정을 수행하고, 부작용을 테스트합니다.

비용과 유지관리의 현실

미세 조정은 일회성 작업이 아닙니다. 주의의무입니다. 기본 모델이 업데이트되거나 변경이 필요하거나 데이터가 손실되면 재학습이 필요할 수 있습니다. 또한 미세 조정된 모델을 호스팅하면 추가 비용과 운영이 발생합니다. 이 총 소유 비용과 이를 통해 제공되는 품질 향상을 비교해 보십시오. 대부분의 경우 좋은 프롬프트 + RAG가 미세 조정보다 저렴하고 유연합니다.

세 개의 미니 케이스

사례 1 - 불필요한 미세 조정. "우리 모델이 우리 제품을 모르기" 때문에 한 팀이 비용이 많이 드는 미세 조정 프로젝트에 착수했습니다. 수개월과 예산이 소비되었고 결과는 취약했습니다. 제품 카탈로그가 변경될 때마다 모델이 쓸모 없게 되었습니다. 마침내 그들은 RAG로 전환했습니다. 문서 기반에서 제품 데이터를 가져왔고 업데이트가 즉시 이루어졌으며 비용이 절감되었습니다. 교훈: 정보 문제는 미세 조정으로 해결되지 않습니다.

사례 2 - 미세 조정을 수정합니다. 한 보험 회사는 모델이 항상 동일한 엄격한 구조(특정 제목이 포함된 조항별 항목)로 정책 요약을 생성하기를 원했습니다. 프롬프트와의 일관성이 70%에서 멈춰 있습니다. 300개의 좋은 샘플을 사용하여 LoRA 미세 조정 후 형식 일관성이 98%로 향상되었습니다. 이는 동작 문제였으며 미세 조정이 올바른 도구였습니다.

사례 3 - 개인 정보가 데이터로 유출됩니다. 한 팀은 채팅 로그를 정리하지 않고 미세 조정을 위해 제출했습니다. 로그에는 실제 고객 이름과 식별 번호가 포함되어 있었습니다. 미세 조정된 모델은 관련 없는 질문의 출력으로 이러한 이름을 "유출"하기 시작했습니다. 모델이 철회되고 데이터가 마스킹되고 재교육되었습니다. 교훈: 미세 조정 데이터에 숨겨진 정보는 모델에 영구적으로 전송됩니다.

복사 가능한 템플릿

내 문제에 대해 미세 조정이 필요한지 결정하는 데 도움을 주세요. 문제: [설명] 이것은 정보 문제(모델이 무엇인가 알지 못함)입니까 아니면 행동 문제(모델이 내가 원하는 형식/톤/구조를 생성하지 않음)입니까? 프롬프트, 퓨샷, RAG 우선으로 해결될 수 있나요? 각각을 시도하거나 시도하지 않는 이유는 무엇입니까? 어떤 조건에서만 미세 조정을 권장합니까?

이 미세 조정 데이터세트를 확인하세요. 1) 예시의 형식과 어조가 일관적인가요?2) 실제 사용의 변화를 다루고 있나요?3) 기밀/개인 데이터가 포함되어 있나요(마스크 처리해야 함)?4) 충돌하는 예시가 있나요? 예시의 하위 집합: [예]각 문제를 나열하고 발견한 수정 사항을 나열하세요.

미세 조정 전후의 평가 계획을 작성합니다. 작업: [설명]- 보유 평가 세트는 어떻게 선택해야 합니까?- 기본 모델의 점수는 어떻게 측정합니까?- 미세 조정 후 어떤 측정항목으로 비교합니까?- 일반 기능이 손상되지 않았는지(치명적인 망각) 테스트하려면 어떻게 해야 합니까?

LoRA를 통한 미세 조정을 위한 초기 하이퍼파라미터를 제안합니다. 데이터 크기: [샘플 수] 목적: [형식/톤 티칭] 과잉 학습을 피하기 위한 에포크, 학습 속도 및 조기 중단을 제안합니다.

결정 테이블: 언제 어떤 도구를 사용할지

필요

먼저 시도해 보세요

미세 조정?

모델은 어떤 정보도 모릅니다

걸레

아니

현재 데이터가 필요합니다

걸레

아니

특정 강체 형식

몇 장의 샷

부족하다면 예

일관된 톤/스타일

프롬프트 + 퓨샷

부족하다면 예

현장 전문 용어/스타일

프롬프트

그래도 부족하다면 LoRA

간단한 작업 최적화

신속한 엔지니어링

일반적으로 아니요

일반적인 실수

  • 미세 조정을 통해 정보 문제를 해결하려고 합니다. RAG가 올바른 도구입니다.
  • 프롬프트/퓨샷/RAG를 소비하지 않고 미세 조정을 실행합니다. 비싸고 불필요합니다.
  • 품질이 낮거나 충돌하는 데이터를 사용한 교육입니다. 적지만 명확한 데이터가 더 좋습니다.
  • 기밀 데이터를 교육에 활용합니다. 모델에 영구적으로 침투합니다.
  • 전후를 측정하지 않습니다. 회복을 증명할 수 없습니다.
  • 치명적인 망각을 테스트하지 않습니다. 새로운 기술이 기존 기술을 방해할 수 있습니다.

요약하면

미세 조정은 강력하지만 비용이 많이 드는 도구이므로 신속한 몇 장의 RAG를 사용한 후에 동작/형식 문제에 대해서만 고려해야 합니다. 정보 문제는 RAG에 속합니다. LoRA와 같은 매개변수 효율적인 방법이 실용적인 첫 번째 선택입니다. 품질은 전적으로 데이터 품질에 달려 있습니다. 작지만 깨끗하고 일관되며 기밀인 데이터를 사용하세요. 전후를 측정하고, 과잉 학습 및 능력 상실을 테스트합니다. 미세 조정은 주의의 의무입니다. 제공하는 품질과 총 비용을 비교해 보세요.

응용과제

문제를 선택하고 '지식과 행동'을 구분하여 미세 조정이 필요한지 판단하고 그 근거를 작성합니다. 행동 문제인 경우 일관된 샘플 20~30개를 준비하고 숨겨진 데이터를 확인하고 전후 평가 계획(유지 클러스터, 기본 점수, 비교 지표, 망각 테스트)을 문서화합니다. 미세조정이 아닌 RAG/few-shot으로 해결이 가능하다면 이 점도 메모해 두시기 바랍니다.

체크리스트

  • [ ] 문제가 지식인지 행동인지 판단했습니다.
  • [ ] 먼저 프롬프트, 퓨샷 및 RAG 대안을 평가했습니다.
  • [ ] 일관성, 다양성 및 기밀성을 위해 데이터를 미세 조정하여 감사했습니다.
  • [ ] 보류 평가 클러스터를 할당하고 기본 점수를 측정했습니다.
  • [ ] 전후 비교 및 ​​망각 테스트를 계획했습니다.
  • [ ] 총 비용과 그것이 제공하는 품질을 비교했습니다.