Јединица 6 / 11

Основа финог подешавања: када, како и са којим ризиком

Добици:

  • Способност да се разликује да ли је проблем информација или понашање и процени фино подешавање за проблеме у понашању тек након што се исцрпе брзи, неколико хитаца и РАГ.
  • Разумевање метода финог подешавања (СФТ, ЛоРА/ПЕФТ, РЛХФ) и атрибута података који одређују квалитет (доследност, разноликост, поверљивост)
  • Способност мерења праве вредности финог подешавања са тестовима пре-после евалуације, прекомерног учења и катастрофалног заборављања

Фино подешавање (прилагођавање његовог понашања додатном обуком унапред обученог модела са вашим сопственим подацима) је моћно, али скупо средство у арсеналу инжењера који ради са ЛЛМ. Када се користи на погрешном месту, то је губитак новца и времена, али када се користи на правом месту, даје квалитет који се не може постићи другачије. У овој јединици покривамо када је потребно фино подешавање, његове основне методе и ризике. Циљ је да вас натера на доношење одлука.

Прво право питање: да ли је потребно фино подешавање?

Најскупља грешка почетника је да одмах пожуре са финим подешавањем проблема који се може решити. Поставите редослед овако:

  1. Промпт инжењеринг: Добар упит који објашњава задатак јасно решава већину проблема. Прво конзумирајте овде.
  2. Учење у неколико корака: Стављање неколико примера у промпт показује моделу жељени формат и понашање.
  3. РАГ: Ако је проблем „недостатак информација“ (потреба за подацима које модел не познаје), решење је РАГ (јединица 4), а не фино подешавање.
  4. Фино подешавање: долази у обзир ако горе наведено није довољно и проблем је „понашање/формат/стил“.

Кључна разлика: Фино подешавање је слабо и ризично у подучавању модела новим информацијама; али је јак у подучавању како се понашати (специфичан формат, тон, жаргон поља, конзистентна структура). „Мој модел не зна информације о нашој компанији“ → РАГ. „Нека мој модел увек даје излаз у тачном формату који желимо“ → кандидат за фино подешавање.

Савет: Пре него што се одлучите за фино подешавање, питајте: „Да ли је ово проблем са знањем или проблем у понашању?“ Проблеми са информацијама се боље решавају помоћу РАГ-а, проблеми у понашању се боље решавају финим подешавањем.

Методе финог подешавања

Потпуно фино подешавање: Поновна обука свих параметара модела. Најмоћнији али најскупљи; Захтева велики хардвер (ГПУ) и пажљиве податке. То је непотребно за већину тимова.

Параметарско ефикасно фино подешавање (ПЕФТ): Методе које замрзавају огромну већину модела, обучавају само мали скуп додатних параметара. Најчешћи је ЛоРА (Лов-Ранк Адаптатион: обука малих „адаптерских“ слојева који се додају моделу). ЛоРА пружа резултате близу потпуног финог подешавања, са много мање меморије и трошкова; Зато је то први избор у пракси.

Надзирано фино подешавање (СФТ): Учење модела да „на овај улаз одговори овако“ са подацима који се састоје од улазно-идеалних излазних парова. То је најчешћи сценарио.

Учење са појачањем из повратних информација од људи (РЛХФ): Усклађивање понашања модела са преферираним одговорима људи. Сложен је и скуп; Потребе већине апликативних тимова су задовољене са СФТ. Довољно је познавати РЛХФ као појам.

Подаци: срце финог подешавања

Квалитет финог подешавања у потпуности зависи од квалитета података о обуци. Неколико стотина висококвалитетних, конзистентних узорака боље је од хиљада аљкавих. Приликом припреме података:

  • Доследност: Сви примери доследно показују формат и тон који желите. Контрадикторни примери чине модел збуњеним.
  • Разноврсност: Примери покривају разноликост у стварној употреби, али нису уједначени.
  • Чишћење: Инстанце које садрже нетачне, пристрасне или скривене податке се трајно прослеђују у модел. Податке за фино подешавање треба читати пажљиво као и уговор.
Опрез: Свака пристрасност, грешка и скривене информације које уносе податке финог подешавања се урезују у модел и поново се појављују у његовим излазима. Прегледајте своје податке о обуци тако пажљиво као да их објављујете; Немојте објављивати личне податке.

Преглед: да ли је фино подешавање успело?

Пре финог подешавања, резервишите задржани сет за процену и измерите резултат модела без финог подешавања (основни модел). Након финог подешавања, поново измерите у истој банци. Не можете рећи „постало је боље“ без поређења. Такође треба имати на уму две замке:

  • Прекомерно учење: Претеривање са малим подацима доводи до тога да модел изгуби способност да запамти и генерализује примере обуке.
  • Катастрофално заборављање: Претренираност на уском задатку може нарушити укупне способности модела. Тестирајте да ли су старе вештине задржане док усвајате ново понашање.

Слаб приступ / Снажан приступ

Слабо: „Имам 3000 дневника ћаскања, хајде да их све дамо на фино подешавање, тако да модел може да прича као ми.“

Гуцлу: „Прво сам проценио основни модел са 100 стварних задатака, забележио резултат. Измерио сам колико се побољшао са упутствима и неколико снимака — то није било довољно. Затим сам од 3000 евиденција одабрао и очистио само 400 узорака високог квалитета, конзистентног формата и без скривених података, поново сам потврдио са 0 финих мера 1 и потврдио сам исти задатак. уз посебан тест да су опште способности нетакнуте“.

Разлика: снажан приступ прво исцрпљује алтернативе, податке о избору трешања, мере пре и после и тестира нежељене ефекте.

Реалност трошкова и одржавања

Фино подешавање није једнократни посао; То је дужност бриге. Можда ће бити потребно поново обучити када се основни модел ажурира, када је потребна промена или се подаци изгубе. Поред тога, хостовање фино подешеног модела доноси додатне трошкове и операције. Упоредите овај укупни трошак власништва са повећањем квалитета који он пружа. Већину времена добар промпт + РАГ је јефтинији и флексибилнији од финог подешавања.

три мини кофера

Случај 1 - Непотребно фино подешавање. Тим се упустио у скуп пројекат финог подешавања јер „наш модел не познаје наше производе“. Месеци и буџет су потрошени, резултат је био крхак — модел је застаревао сваки пут када се мења каталог производа. Коначно су прешли на РАГ: преузели су податке о производу из базе докумената, ажурирање је било тренутно и цена је опала. Поука: проблем са информацијама није решен финим подешавањем.

Случај 2 - Исправно фино подешавање. Осигуравајућа компанија је желела да модел увек производи резиме полиса у истој ригидној структури (ставку по клаузулу, са специфичним насловима). Доследност са промптом је заглављена на 70%. Након ЛоРА финог подешавања са 300 добрих узорака, конзистентност формата је порасла на 98%. Ово је био проблем у понашању и фино подешавање је било право средство.

Случај 3 – Приватност прелива у податке. Један тим је поднео евиденцију ћаскања на фино подешавање без њиховог чишћења. Дневници су садржали права имена купаца и идентификационе бројеве. Фино подешен модел почео је да "цури" ова имена као излаз у неповезаним питањима. Модел је повучен, подаци маскирани и поново обучени. Лекција: Скривене информације у подацима финог подешавања се трајно преносе у модел.

Шаблони који се могу копирати

Помозите ми да одлучим да ли је потребно фино подешавање за овај мој проблем. Проблем: [опис] Да ли је ово проблем ИНФОРМАЦИЈЕ (модел нешто не зна) или проблем ПОНАШАЊА (модел не производи формат/тон/структуру који желим)? Може ли се то решити брзим, неколико хитаца и прво РАГ? Зашто пробати/не испробати сваки од њих? Само под којим условима бисте препоручили фино подешавање?

Проверите овај скуп података за фино подешавање: 1) Да ли су примери доследни у формату и тону? 2) Да ли покривају варијације у стварној употреби? 3) Да ли садржи поверљиве/личне податке (морају бити маскирани)? 4) Да ли постоје конфликтни примери? Подскуп примера: [примери]Наведите сваки проблем и исправку коју сте пронашли.

Направите план евалуације пре и после финог подешавања. Задатак: [објашњење]- Како би требало да се изабере скуп за процену који се задржава?- Како се мери резултат основног модела?- Са којом метриком се пореди након финог подешавања?- Како да тестирам да опште способности нису нарушене (катастрофално заборављање)?

Предложите почетне хиперпараметре за фино подешавање са ЛоРА. Величина података: [број узорака]Сврха: [настава формата/тона]Предложите епоху, брзину учења и рано заустављање да бисте избегли претерано учење.

Табела одлука: који алат када

потреба

пробај прво

Фино подешавање?

Модел не зна никакве информације

РАГ

бр

Потребни су тренутни подаци

РАГ

бр

Специфичан крути формат

неколико снимака

Ако није довољно да

Доследан тон/стил

брз + неколико хитаца

Ако није довољно да

Теренски жаргон/стил

промпт

Ако то није довољно, ЛоРА

Једноставна оптимизација задатака

промпт инжењеринг

Генерално не

Уобичајене грешке

  • Покушавам да решим проблем са информацијама финим подешавањем. РАГ је прави алат.
  • Упадање у фино подешавање без конзумирања промпт/неколико снимака/РАГ. Скупо и непотребно.
  • Обука са ниским квалитетом/конфликтним подацима. Мање, али јасни подаци су бољи.
  • Стављање поверљивих података у образовање. Трајно се инфилтрира у модел.
  • Не мери се пре и после. Не можете доказати опоравак.
  • Не тестирајући катастрофално заборављање. Нова вештина може пореметити стару.

Укратко

Фино подешавање је моћан али скуп алат и треба га узети у обзир само за проблеме у понашању/формату након конзумирања промпт-фев-схот-РАГ; информациони проблеми припадају РАГ-у. Параметарски ефикасне методе као што је ЛоРА су практичан први избор. Квалитет у потпуности зависи од квалитета података; Користите мале, али чисте, доследне и поверљиве податке. Мерите пре и после, тестирајте прекомерно учење и губитак способности. Фино подешавање је обавеза бриге; Одмерите његову укупну цену у односу на квалитет који испоручује.

Задатак апликације

Изаберите проблем и одлучите да ли је потребно фино подешавање тако што ћете направити разлику између „знања или понашања“ и напишите своје образложење. Ако је проблем у понашању, припремите 20-30 конзистентних узорака, проверите да ли постоје скривени подаци и документујте план евалуације пре и после (одржани кластер, основни резултат, метрика поређења, тест заборављања). Ако се то може решити помоћу РАГ-а/неколико снимака уместо финог подешавања, забележите и ово.

контролна листа

  • [ ] Утврдио сам да ли је проблем знање или понашање.
  • [ ] Прво сам проценио брзе, неколико хитаца и РАГ алтернативе.
  • [ ] Проверио сам конзистентност, разноврсност и поверљивост података финог подешавања.
  • [ ] Одредио сам кластер за процену и измерио основни резултат.
  • [ ] Планирао сам поређење пре-после и тест заборављања.
  • [ ] Упоредио сам укупне трошкове са квалитетом који он пружа.