Единица 6 / 11

Основа за фино подесување: кога, како и со каков ризик

Добивки:

  • Способност да се разликува дали проблемот е информација или однесување и да се процени дотерувањето за проблемите во однесувањето само откако ќе се исцрпат брзото, неколку снимки и RAG.
  • Разбирање на методите за дотерување (SFT, LoRA/PEFT, RLHF) и атрибути на податоци што го одредуваат квалитетот (конзистентност, разновидност, доверливост)
  • Способност да се измери вистинската вредност на дотерувањето со тестови пред-после, прекумерно учење и катастрофално заборавање

Фино подесување (приспособување на неговото однесување со дополнително обучување на претходно обучен модел со ваши сопствени податоци) е моќна, но скапа алатка во арсеналот на инженерот кој работи со LLM. Кога се користи на погрешно место, тоа е губење пари и време, но кога се користи на вистинското место, дава квалитет што не може да се постигне поинаку. Во оваа единица, ги покриваме кога е неопходно дотерување, неговите основни методи и ризици. Целта е да ве натера да одлучувате.

Прво вистинското прашање: дали е потребно дотерување?

Најскапата грешка на почетниците е веднаш да брзаат со фино подесување на проблемот што може да се реши. Поставете ја нарачката вака:

  1. Брзо инженерство: Доброто известување кое ја објаснува задачата јасно ги решава повеќето проблеми. Прво консумирајте овде.
  2. Учење со неколку снимки: Ставањето неколку примери во промптот му го покажува посакуваниот формат и однесување на моделот.
  3. RAG: Ако проблемот е „недостаток на информации“ (потреба од податоци што моделот не ги знае), решението е RAG (единица 4), а не дотерување.
  4. Фино подесување: Влегува во игра ако горенаведеното не е доволно и проблемот е „однесување/формат/стил“.

Клучна разлика: Дотерувањето е слабо и ризично при предавањето на моделот за нови информации; но е силен во учењето како да се однесуваме (специфичен формат, тон, теренски жаргон, конзистентна структура). „Мојот модел не ги знае информациите за нашата компанија“ → RAG. „Нека мојот модел секогаш го дава излезот во точниот формат што го сакаме“ → кандидат за фино подесување.

Совет: Пред да одлучите за дотерување, прашајте: „Дали ова е проблем со знаење или проблем во однесувањето?“ Проблемите со информациите подобро се решаваат со RAG, а проблемите во однесувањето подобро се решаваат со фино подесување.

Методи за фино подесување

Целосно фино подесување: Преквалификација на сите параметри на моделот. Најмоќен, но најскап; Потребен е голем хардвер (GPU) и внимателни податоци. Тоа е непотребно за повеќето тимови.

Параметарски ефикасно дотерување (PEFT): Методи кои го замрзнуваат огромното мнозинство на моделот, обучувајќи само мал сет на дополнителни параметри. Најчеста е LoRA (Adaptation со низок ранг: обука на мали слоеви „адаптер“ додадени на моделот). LoRA обезбедува резултати блиску до целосно дотерување, со многу помала меморија и цена; Затоа е прв избор во пракса.

Надгледувано фино подесување (SFT): Подучување на моделот да „одговара на овој влез вака“ со податоци што се состојат од парови влезно-идеален излез. Тоа е најчестото сценарио.

Засилено учење од човечки повратни информации (RLHF): Усогласување на однесувањето на моделот со претпочитаните одговори на луѓето. Тоа е сложено и скапо; Потребите на повеќето тимови за апликации се задоволуваат со SFT. Доволно е да се знае RLHF како концепт.

Податоци: срцето на дотерувањето

Квалитетот на дотерувањето целосно зависи од квалитетот на податоците за обуката. Неколку стотици висококвалитетни, конзистентни примероци се подобри од илјадници невешт. При подготовка на податоци:

  • Конзистентност: Сите примери постојано го покажуваат форматот и тонот што го сакате. Контрадикторните примери го оставаат моделот збунет.
  • Разновидност: Примерите ја покриваат сортата во вистинска употреба, но не се униформни.
  • Чистење: примероците што содржат неточни, пристрасни или скриени податоци трајно се пренесуваат во моделот. Податоците за фино подесување треба да се читаат внимателно како договор.
Внимание: Секоја пристрасност, грешка и скриени информации што влегуваат во податоците за фино подесување се врежани во моделот и повторно се појавуваат на неговите излези. Ревидирајте ги вашите податоци за обука толку прецизно како да ги објавувате; Не објавувајте лични податоци.

Преглед: дали дотерувањето функционираше?

Пред фино подесување, резервирајте содржан евален сет и измерете го резултатот на моделот без дотерување (основен модел). По дотерувањето, измерете повторно во истата банка. Не можете да кажете „подобро“ без споредба. Исто така, две стапици за кои треба да знаете:

  • Прекумерно учење: Претренирањето со мали податоци предизвикува моделот да ја изгуби способноста да меморира и генерализира примери за обука.
  • Катастрофално заборавање: Претренираноста на тесна задача може да ги наруши севкупните способности на моделот. Тестирајте дали старите вештини се задржани додека стекнувате ново однесување.

Слаб пристап / Силен пристап

Слабо: „Имам 3000 дневници за разговори, ајде да ги дадеме сите на дотерување, за да може моделот да зборува како нас“.

Ѓучлу: „Прво го оценив основниот модел со 100 реални задачи, го забележав резултатот. Мерев колку се подобри со потсетници и неколку снимки - тоа не беше доволно. Потоа од 3000 логови, избрав и исчистив само 400 примероци со висок квалитет, конзистентен формат и без скриени податоци измерени повторно со LoRA-t. се потврди со посебен тест дека општите способности се недопрени“.

Разликата: силниот пристап прво ги исцрпува алтернативите, ги избира податоците, мерките пред и потоа и тестовите за несакани ефекти.

Реалноста на трошоците и одржувањето

Дотерувањето не е еднократна работа; Тоа е должност за грижа. Можеби ќе биде неопходно да се преквалификува кога основниот модел се ажурира, има потреба од промена или кога податоците се изгубени. Дополнително, хостирањето на фино подесен модел носи дополнителни трошоци и операции. Споредете го овој вкупен трошок за сопственост со зголемувањето на квалитетот што го обезбедува. Поголемиот дел од времето доброто известување + RAG е поевтино и пофлексибилно од дотерувањето.

три мини футроли

Случај 1 - Непотребно фино подесување. Тим се впушти во скап проект за дотерување бидејќи „нашиот модел не ги знае нашите производи“. Беа потрошени месеци и буџет, резултатот беше кревок - моделот стануваше застарен секогаш кога се менуваше каталогот на производи. Конечно се префрлија на RAG: ги превземаа податоците за производот од базата на документи, ажурирањето беше моментално и цената падна. Поука: проблемот со информациите не се решава со фино подесување.

Случај 2 - Правилно дотерување. Осигурителна компанија сакаше моделот секогаш да произведува резимеа на полисите во иста ригидна структура (точка по клаузула, со специфични наслови). Доследноста со промптот е заглавена на 70%. По дотерувањето на LoRA со 300 добри примероци, конзистентноста на форматот се зголеми на 98%. Ова беше проблем со однесувањето и дотерувањето беше вистинската алатка.

Случај 3 - Приватноста бега во податоци. Еден тим ги достави дневниците за разговор на дотерување без да ги исчисти. Дневниците содржеле вистински имиња на клиенти и идентификациски броеви. Добро подесениот модел почна да ги „протекува“ овие имиња како резултат во неповрзани прашања. Моделот беше повлечен, податоците беа маскирани и преквалификувани. Лекција: Скриените информации при фино подесување на податоците трајно се пренесуваат на моделот.

Шаблони за копирање

Помогнете ми да одлучам дали е неопходно дотерување за овој мој проблем. Проблем: [опис] Дали е ова ИНФОРМАЦИСКИ проблем (моделот не знае нешто) или проблем ОДНЕСУВАЊЕ (моделот не го произведува форматот/тонот/структурата што ја сакам)? Може ли да се реши со брзо, неколку снимки и RAG прво? Зошто да го пробате/не пробате секој од нив? Само под кој услов би препорачале фино подесување?

Проверете ја оваа база на податоци за дотерување:1) Дали примерите се конзистентни по формат и тон?2) Дали ја покриваат варијацијата во вистинска употреба?3) Дали содржи доверливи/лични податоци (мора да бидат маскирани)?4) Дали има конфликтни примери? Подгрупа од примерите: [примери]Наведете го секој проблем и поправете го што сте го нашле.

Направете план за евалуација пред и по дотерувањето. Задача: [објаснување]- Како треба да се одбере задржаното вредносно множество?- Како се мери резултатот на основниот модел?- Со која метрика се споредува по дотерувањето?- Како да тестирам дека општите способности не се нарушени (катастрофално заборавање)?

Предложете ги почетните хиперпараметри за дотерување со LoRA. Големина на податоци: [број на примероци] Цел: [настава со формат/тон] Предложете епоха, стапка на учење и рано запирање за да се избегне прекумерно учење.

Табела со одлуки: која алатка кога

потреба

обидете се прво

Дотерување?

Моделот не знае никакви информации

RAG

бр

Потребни се моментални податоци

RAG

бр

Специфичен ригиден формат

неколку снимки

Ако не е доволно да

Конзистентен тон/стил

брза + неколку-шут

Ако не е доволно да

Теренски жаргон/стил

брза

Ако тоа не е доволно, LoRA

Едноставна оптимизација на задачи

брзо инженерство

Генерално не

Вообичаени грешки

  • Се обидуваме да го решиме информацискиот проблем со фино подесување. RAG е вистинската алатка.
  • Вклучување во дотерување без трошење на prompt/few-shot/RAG. Скапо и непотребно.
  • Обука со низок квалитет/конфликтни податоци. Помалку, но јасни податоци се подобри.
  • Внесување доверливи податоци во образованието. Трајно се инфилтрира во моделот.
  • Не се мери пред и потоа. Не можете да докажете закрепнување.
  • Не тестирање на катастрофално заборавање. Новата вештина може да ја наруши старата.

Сумирано

Фино подесувањето е моќна, но скапа алатка и треба да се земе предвид само за проблеми со однесувањето/форматирањето откако ќе се конзумира prompt-few-shot-RAG; информациските проблеми припаѓаат на RAG. Параметарски ефикасните методи како што е LoRA се практичниот прв избор. Квалитетот целосно зависи од квалитетот на податоците; Користете мали, но чисти, конзистентни и доверливи податоци. Мери пред и потоа, тест за прекумерно учење и губење на способноста. Дотерувањето е должност на грижа; Измерете ги неговите вкупни трошоци наспроти квалитетот што го дава.

Задача за апликација

Изберете проблем и одлучете дали е неопходно дотерување со правење разлика помеѓу „знаење или однесување“ и напишете го вашето оправдување. Ако се работи за проблем со однесувањето, подгответе 20-30 конзистентни примероци, проверете дали има скриени податоци и документирајте план за евалуација пред и потоа (оддржан кластер, основен резултат, споредбена метрика, тест за заборавање). Ако може да се реши со RAG/few-shot наместо фино подесување, забележете го и ова.

листа за проверка

  • [ ] Утврдив дали проблемот е знаењето или однесувањето.
  • [ ] Прво ги проценив алтернативите за брза, неколку снимки и RAG.
  • [ ] Ги ревидирав податоците за дотерување за конзистентност, разновидност и доверливост.
  • [ ] Доделив задржан евален кластер и го измерив основниот резултат.
  • [ ] Планирав тест пред-после споредба и заборавање.
  • [ ] Ги споредив вкупните трошоци со квалитетот што го дава.