واحد 6 / 11

اساس تنظیم دقیق: چه زمانی، چگونه و با چه ریسکی

سود:

  • توانایی تشخیص اینکه آیا یک مشکل اطلاعات است یا رفتار و ارزیابی دقیق تنظیم برای مشکلات رفتاری تنها پس از اتمام سریع، چند شات و RAG.
  • درک روش های تنظیم دقیق (SFT، LoRA/PEFT، RLHF) و ویژگی های داده ای که کیفیت را تعیین می کنند (ثبات، تنوع، محرمانه بودن)
  • امکان اندازه گیری ارزش واقعی تنظیم دقیق با آزمون های قبل و بعد از ارزیابی، یادگیری بیش از حد و فراموشی فاجعه بار

تنظیم دقیق (سفارشی کردن رفتار آن با آموزش بیشتر یک مدل از پیش آموزش دیده با داده های خود) ابزاری قدرتمند اما گران قیمت در زرادخانه مهندسانی است که با LLM کار می کنند. وقتی در مکان نامناسب استفاده می شود، اتلاف وقت و پول است، اما زمانی که در مکان مناسب استفاده شود، کیفیتی را ارائه می دهد که در غیر این صورت نمی توان به آن دست یافت. در این واحد در مواقعی که تنظیم دقیق ضروری است، روش های اساسی و خطرات آن را پوشش می دهیم. هدف این است که شما را تصمیم گیری کند.

ابتدا سوال درست: آیا تنظیم دقیق لازم است؟

گرانترین اشتباه مبتدیان این است که فوراً برای تنظیم دقیق مشکلی که قابل حل است عجله کنند. ترتیب را به این صورت تنظیم کنید:

  1. مهندسی سریع: یک اعلان خوب که کار را به وضوح توضیح می دهد اکثر مشکلات را حل می کند. اول اینجا مصرف کنید
  2. یادگیری چند شات: قرار دادن چند مثال در اعلان، قالب و رفتار مورد نظر را به مدل نشان می دهد.
  3. RAG: اگر مشکل "فقدان اطلاعات" باشد (نیاز به داده هایی که مدل نمی داند)، راه حل RAG (واحد 4) است، نه تنظیم دقیق.
  4. تنظیم دقیق: اگر موارد فوق کافی نباشد و مشکل «رفتار/قالب/سبک» باشد، وارد عمل می شود.

تمایز کلیدی: تنظیم دقیق در آموزش مدل اطلاعات جدید ضعیف و خطرناک است. اما در آموزش نحوه رفتار کردن قوی است (یک قالب خاص، لحن، اصطلاحات تخصصی، ساختار سازگار). "مدل من اطلاعات شرکت ما را نمی داند" → RAG. "اجازه دهید مدل من همیشه خروجی را با فرمت دقیقی که ما می خواهیم ارائه دهد" → نامزد تنظیم دقیق.

نکته: قبل از تصمیم گیری در مورد تنظیم دقیق، بپرسید: "این یک مشکل دانش است یا یک مشکل رفتاری؟" مشکلات اطلاعاتی با RAG بهتر حل می شوند، مشکلات رفتاری با تنظیم دقیق بهتر حل می شوند.

روش های تنظیم دقیق

تنظیم دقیق کامل: بازآموزی تمام پارامترهای مدل. قدرتمندترین اما گرانترین به سخت افزار بزرگ (GPU) و داده های دقیق نیاز دارد. برای اکثر تیم ها غیر ضروری است.

تنظیم دقیق با کارآمدی پارامتر (PEFT): روش هایی که اکثریت قریب به اتفاق مدل را منجمد می کند و تنها مجموعه کوچکی از پارامترهای اضافی را آموزش می دهد. رایج ترین آنها LoRA (تطبیق با رتبه پایین: آموزش لایه های کوچک "آداپتور" اضافه شده به مدل) است. LoRA نتایج نزدیک به تنظیم دقیق کامل را با حافظه و هزینه بسیار کمتر ارائه می دهد. به همین دلیل در عمل اولین انتخاب است.

تنظیم دقیق نظارت شده (SFT): آموزش مدل برای "پاسخ دادن به این ورودی مانند این" با داده های متشکل از جفت های ورودی-خروجی ایده آل. رایج ترین سناریو است.

یادگیری تقویتی از بازخورد انسانی (RLHF): همسو کردن رفتار مدل با پاسخ های ترجیحی افراد. پیچیده و گران است. نیازهای اکثر تیم های کاربردی با SFT برآورده می شود. کافی است RLHF را به عنوان یک مفهوم بدانیم.

داده: قلب تنظیم دقیق

کیفیت تنظیم دقیق کاملاً به کیفیت داده های آموزشی بستگی دارد. چند صد نمونه با کیفیت بالا و ثابت بهتر از هزاران نمونه درهم و برهم هستند. هنگام تهیه داده ها:

  • سازگاری: همه نمونه ها به طور مداوم قالب و لحن مورد نظر شما را نشان می دهند. مثال های متناقض مدل را گیج می کند.
  • تنوع: نمونه ها تنوع را در استفاده واقعی پوشش می دهند، اما یکنواخت نیستند.
  • پاکسازی: مواردی که حاوی داده های نادرست، مغرضانه یا پنهان هستند به طور دائم به مدل منتقل می شوند. داده های تنظیم دقیق باید مانند قرارداد با دقت خوانده شوند.
احتیاط: هر سوگیری، خطا و اطلاعات پنهانی که وارد داده های تنظیم دقیق می شود در مدل حک می شود و دوباره در خروجی های آن ظاهر می شود. داده های آموزشی خود را با دقت بررسی کنید که گویی در حال انتشار آن هستید. داده های شخصی را ارسال نکنید.

بررسی: آیا تنظیم دقیق کار کرد؟

قبل از تنظیم دقیق، یک مجموعه ارزشی نگه داشته شده رزرو کنید و امتیاز مدل را بدون تنظیم دقیق اندازه گیری کنید (مدل پایه). پس از تنظیم دقیق، دوباره در همان بانک اندازه گیری کنید. بدون مقایسه نمی توان گفت "بهتر شد". همچنین دو تله که باید از آنها آگاه بود:

  • یادگیری بیش از حد: تمرین بیش از حد با داده های کوچک باعث می شود که مدل توانایی خود را در به خاطر سپردن و تعمیم نمونه های آموزشی از دست بدهد.
  • فراموشی فاجعه بار: تمرین بیش از حد در یک کار باریک می تواند توانایی های کلی مدل را مختل کند. تست کنید که آیا مهارت های قدیمی در حین کسب رفتار جدید حفظ می شوند یا خیر.

رویکرد ضعیف / رویکرد قوی

ضعیف: "من 3000 گزارش چت دارم، بیایید همه آنها را به تنظیم دقیق بدهیم، تا مدل بتواند مانند ما صحبت کند."

گوچلو: "ابتدا مدل پایه را با 100 کار واقعی ارزیابی کردم، امتیاز را یادداشت کردم. با اعلان ها و چند عکس اندازه گیری کردم که چقدر بهبود یافته است - کافی نبود. سپس از بین 3000 گزارش، تنها 400 نمونه را با کیفیت بالا، فرمت سازگار و بدون داده های پنهان اندازه گیری شده با تکلیف ریز، انتخاب کردم و پاک کردم. با یک آزمایش جداگانه تأیید کرد که قابلیت‌های کلی دست نخورده هستند."

تفاوت: رویکرد قوی ابتدا جایگزین ها را خسته می کند، داده های گیلاس را انتخاب می کند، قبل و بعد را اندازه گیری می کند و عوارض جانبی را آزمایش می کند.

واقعیت هزینه و نگهداری

تنظیم دقیق یک کار یکبار مصرف نیست. وظیفه مراقبت است. زمانی که مدل پایه به روز می شود، نیاز به تغییر دارد یا داده ها از بین می روند، ممکن است نیاز به آموزش مجدد باشد. علاوه بر این، میزبانی یک مدل تنظیم شده هزینه ها و عملیات اضافی را به همراه دارد. این هزینه کل مالکیت را با افزایش کیفیت آن مقایسه کنید. اغلب اوقات یک Prompt + RAG خوب ارزان تر و انعطاف پذیرتر از تنظیم دقیق است.

سه کیف کوچک

مورد 1 - تنظیم دقیق غیر ضروری. تیمی به دلیل اینکه "مدل ما محصولات ما را نمی شناسد" پروژه گران قیمت تنظیم دقیق را آغاز کردند. ماه ها و بودجه صرف شد، نتیجه شکننده بود - هر بار که کاتالوگ محصول تغییر می کرد، مدل منسوخ می شد. سرانجام آنها به RAG تغییر مکان دادند: آنها داده های محصول را از پایه اسناد دریافت کردند، به روز رسانی آنی بود و هزینه کاهش یافت. درس: مشکل اطلاعات با تنظیم دقیق حل نمی شود.

مورد 2 - تنظیم دقیق. یک شرکت بیمه می‌خواست این مدل همیشه خلاصه‌های بیمه‌نامه را در همان ساختار سفت و سخت (موارد به بند، با عناوین خاص) تولید کند. سازگاری با اعلان در 70٪ گیر کرده است. پس از تنظیم دقیق LoRA با 300 نمونه خوب، سازگاری فرمت به 98٪ افزایش یافت. این یک مشکل رفتاری بود و تنظیم دقیق ابزار مناسبی بود.

مورد 3 - فرار از حریم خصوصی به داده ها. یک تیم گزارش‌های چت را بدون تمیز کردن آنها برای تنظیم دقیق ارسال کرد. گزارش‌ها حاوی نام‌های واقعی مشتریان و شماره‌های شناسایی بود. مدل دقیق تنظیم شده شروع به "نشت" این نام ها به عنوان خروجی در سوالات نامرتبط کرد. مدل برداشته شد، داده ها پوشانده شد و دوباره آموزش داده شد. درس: اطلاعات پنهان در تنظیم دقیق داده ها به طور دائم به مدل منتقل می شود.

قالب های قابل کپی

به من کمک کنید تصمیم بگیرم که آیا تنظیم دقیق برای این مشکل من ضروری است یا خیر. مشکل: [توضیح] آیا این یک مشکل INFORMATION است (مدل چیزی نمی داند) یا یک مشکل رفتاری (مدل قالب/تن/ساختار مورد نظر من را تولید نمی کند)؟ آیا می توان ابتدا با سریع، چند شات و RAG حل کرد؟ چرا هر یک از آنها را امتحان کنید یا امتحان نکنید؟ فقط تحت چه شرایطی تنظیم دقیق را توصیه می کنید؟

این مجموعه داده تنظیم دقیق را بررسی کنید:1) آیا نمونه‌ها از نظر قالب و لحن سازگار هستند؟2) آیا تنوع در استفاده واقعی را پوشش می‌دهند؟3) آیا حاوی داده‌های محرمانه/شخصی است (باید پوشانده شود)؟

یک طرح ارزیابی قبل و بعد از تنظیم دقیق تهیه کنید. وظیفه: [توضیح]- چگونه باید مجموعه ارزش نگهدارنده انتخاب شود؟- امتیاز مدل پایه چگونه اندازه گیری می شود؟- بعد از تنظیم دقیق با کدام متریک مقایسه می شود؟- چگونه می توانم آزمایش کنم که قابلیت های عمومی مختل نشده است (فراموشی فاجعه بار)؟

پیشنهاد فراپارامترهای اولیه برای تنظیم دقیق با LoRA. اندازه داده: [تعداد نمونه] هدف: [آموزش قالب/تن] برای جلوگیری از یادگیری بیش از حد، دوره، سرعت یادگیری و توقف اولیه را پیشنهاد دهید.

جدول تصمیم: کدام ابزار چه زمانی

نیاز دارند

اول امتحان کن

تنظیم دقیق؟

مدل هیچ اطلاعاتی نمی داند

RAG

نه

داده های فعلی مورد نیاز است

RAG

نه

فرمت سفت و سخت خاص

چند عکس

اگر کافی نیست بله

لحن/سبک منسجم

سریع + چند شات

اگر کافی نیست بله

اصطلاحات تخصصی/سبک میدانی

سریع

اگر این کافی نیست، LoRA

بهینه سازی کار ساده

مهندسی سریع

به طور کلی خیر

اشتباهات رایج

  • تلاش برای حل مشکل اطلاعات با تنظیم دقیق. RAG ابزار مناسبی است.
  • اجرای تنظیمات دقیق بدون مصرف سریع/چند شات/RAG. گران و غیر ضروری.
  • آموزش با کیفیت پایین/ داده های متناقض. داده های کمتر اما واضح بهتر است.
  • قرار دادن اطلاعات محرمانه در آموزش به طور دائم به مدل نفوذ می کند.
  • عدم اندازه گیری قبل و بعد شما نمی توانید بهبودی را اثبات کنید.
  • آزمایش نکردن فراموشی فاجعه بار. مهارت جدید ممکن است مهارت قبلی را مختل کند.

به طور خلاصه

تنظیم دقیق ابزاری قدرتمند اما پرهزینه است و فقط باید برای مشکلات رفتاری/قالبی پس از مصرف prompt-few-shot-RAG در نظر گرفته شود. مشکلات اطلاعاتی متعلق به RAG است. روش های کارآمد پارامتر مانند LoRA اولین انتخاب عملی هستند. کیفیت کاملاً به کیفیت داده ها بستگی دارد. از داده های کوچک اما تمیز، ثابت و محرمانه استفاده کنید. قبل و بعد را اندازه گیری کنید، برای یادگیری بیش از حد و از دست دادن توانایی تست کنید. تنظیم دقیق وظیفه مراقبت است. هزینه کل آن را در مقابل کیفیتی که ارائه می دهد وزن کنید.

وظیفه کاربردی

یک مشکل را انتخاب کنید و تصمیم بگیرید که آیا تنظیم دقیق با تمایز بین "دانش یا رفتار" ضروری است یا خیر و توجیه خود را بنویسید. اگر یک مشکل رفتاری است، 20 تا 30 نمونه ثابت تهیه کنید، داده های پنهان را بررسی کنید، و یک طرح ارزیابی قبل و بعد (خوشه ای برگزار شده، امتیاز پایه، متریک مقایسه، آزمون فراموشی) را مستند کنید. اگر به جای تنظیم دقیق با RAG/few-shot قابل حل است، این را نیز یادداشت کنید.

چک لیست

  • [ ] تعیین کردم که مشکل دانش است یا رفتار.
  • [ ] من ابتدا گزینه های سریع، چند شات و RAG را ارزیابی کردم.
  • [ ] من داده های تنظیم دقیق را برای سازگاری، تنوع و محرمانه بودن حسابرسی کردم.
  • [ ] من یک خوشه ارزشی نگه داشته شده را اختصاص دادم و امتیاز پایه را اندازه گرفتم.
  • [ ] من یک تست قبل و بعد از مقایسه و فراموشی برنامه ریزی کردم.
  • [ ] من کل هزینه را با کیفیتی که ارائه می دهد مقایسه کردم.