Unit 5 / 11

Pemilihan Model: Model yang Tepat untuk Kerja yang Tepat

Keuntungan:

  • Boleh membandingkan keluarga model (pantas/seimbang/berkuasa) pada keupayaan, kelajuan dan kos
  • Mereka bentuk strategi pemilihan model dan laluan mengikut kerumitan tugas
  • Asas pemilihan model pada bukti dengan set kecil eval

Keputusan tunggal yang menentukan anda paling hebat untuk wang dan kualiti anda dalam penyepaduan LLM ialah model yang anda gunakan. Refleks biasa ialah "pilih model terkuat"; Walau bagaimanapun, ini selalunya bermakna kos dan kelewatan yang tidak perlu. Pendekatan yang betul ialah memilih model paling ringan yang menyelesaikan setiap tugas dan asas pilihan itu pada pengukuran, bukan tekaan. Dalam unit ini, anda akan membandingkan keluarga model pada paksi keupayaan/kelajuan/kos, mewujudkan strategi penghalaan model mengikut kerumitan tugasan dan membuktikan pemilihan dengan set penilaian yang kecil.

Memahami Keluarga Model

Penyedia biasanya menawarkan tiga kelas: cepat/murah, stabil dan berkuasa. Hubungan antara mereka diringkaskan pada tiga paksi: keupayaan (kuasa untuk menyelesaikan tugas yang sukar), kelajuan (kependaman), kos (harga token).

kelas

contoh

bakat

kelajuan

kos

Tugasan yang tersedia

cepat

Haiku 4.5

sederhana

sangat tinggi

rendah

Pengelasan, pelabelan, ringkasan ringkas, orientasi

seimbang

soneta 5

tinggi

tinggi

sederhana

Tujuan umum, pengekodan, aliran berbilang langkah, kebanyakan kerja ejen

kuat

Opus 4.8

tertinggi

sederhana

tinggi

Penaakulan yang kompleks, tugas autonomi jarak jauh, analisis yang sukar

Wawasan kritikal: model yang lebih berkuasa tidak menunjukkan prestasi yang lebih baik pada setiap kerja. Dalam pelabelan mudah "mendesak atau tidak", model kuat dan model pantas memberikan jawapan betul yang sama; satu-satunya perbezaan ialah yang berkuasa adalah 5 kali lebih mahal dan lebih perlahan. Bakat tambahan menghasilkan nilai hanya apabila misi memerlukannya.

Langkah demi Langkah: Bagaimana Memilih Model?

  1. Kelaskan tugasan. Adakah ia rutin/bercorak (pelabelan, inferens), atau terbuka/berbilang langkah (analisis, perancangan, kod)?
  2. Mulakan dengan calon yang paling ringan. Cubalah dengan model pantas. Jika sudah cukup, berhenti.
  3. Jika tidak mencukupi, naik ke kelas yang lebih tinggi. Jika ketepatannya rendah, pergi ke yang seimbang, jika itu tidak mencukupi, pergi ke yang kuat.
  4. Ukur, jangan meneka. Bandingkan ketepatan dan kos setiap calon dengan set kecil eval (di bawah).
  5. Sediakan ubah hala. Daripada menyambung kepada model tunggal, edarkan tugas kepada model yang betul dengan "penghala".

Penghalaan Model

Beban kerja sebenar bercampur-campur: kebanyakan permintaan masuk adalah mudah, ada yang sukar. Ia adalah satu pembaziran untuk menghantar mereka semua kepada model yang berkuasa; Menghantar semuanya kepada model pantas mengurangkan kualiti. Penghalaan menyelesaikannya: model murah (atau peraturan mudah) mengklasifikasikan tugas dahulu, kemudian tugas itu pergi ke model yang sesuai.

# Router prompt (berfungsi dengan model murah) Kelaskan permintaan masuk mengikut kesukarannya. Kembalikan JSON berikut sahaja:{"difficulty": "simple|complex"}Mudah: satu langkah, formulaik, jawapan pendek. Kompleks: memerlukan penaakulan berbilang langkah, analisis atau penjanaan panjang. Permintaan: """{{permintaan}}"""

  • pergi ke model mudah → pantas (murah, cepat).
  • pergi ke kompleks → model berkuasa (mahal tetapi perlu).

Corak ini mengurangkan kos purata dengan ketara kerana kebanyakan trafik secara amnya mudah.

Petua: Keputusan rujukan tidak selalu memerlukan LLM. Peraturan mudah seperti "Pergi ke model pantas jika teks kurang daripada 20 perkataan" juga merupakan panduan dan membawa sifar kos token tambahan. Cuba peraturan dahulu.

Menghubungkan Pilihan kepada Bukti: Kluster Eval Kecil

Jangan pilih model berdasarkan "ia kelihatan lebih baik kepada saya". Eval (set penilaian) ialah set kecil sampel yang mana jawapan yang betul diketahui; anda menjalankan setiap model pada set ini dan mengukur ketepatan, kos dan kependaman.

# Templat persediaan Eval1) Kumpul 20-50 contoh sebenar, tulis tangan "jawapan yang betul" pada setiap satu.2) Jalankan setiap model (cepat/seimbang/kuat) pada set ini.3) Untuk setiap model: bilangan pembetulan, token pemprosesan purata, kos setiap permintaan, purata masa.4) Pilih model yang "memberi ketepatan yang mencukupi paling murah".

# Jadual perbandingan Eval (isi)Model | Ketepatan | Kos setiap permintaan | Tempoh purataHaiku | ...% | ... $ | ... snSonnet | ...% | ... $ | ... snOpus | ...% | ... $ | ...sek

Gesaan lemah / Gesaan kuat (keputusan pemilihan model)

# LEMAH (tiada asas untuk membuat keputusan)Jom guna model terbaik, bajet tak penting.

# KUAT (keputusan berdasarkan ukuran) Dalam penilaian 50 sampel, Haiku memberikan ketepatan 96%, Sonnet memberikan ketepatan 97%; Perbezaannya secara statistik tidak ketara. Haiku dipilih kerana 5 kali ganda lebih murah dan 2 kali ganda lebih pantas. Jika ketepatan menurun di bawah 95%, keputusan untuk menaik taraf kepada Sonnet akan dibuat secara automatik.

Versi berkuasa; mengikat pemilihan kepada nombor, ambang dan peraturan peningkatan. Ini kedua-duanya mempertahankan keputusan hari ini dan menguruskan perubahan masa depan.

Tiga Kes Mini

Kes 1 — Melarikan diri daripada model yang sangat berkuasa. Sebuah pusat panggilan sedang menghasilkan semua ringkasan perbualan dengan Opus; bil bulanan adalah tinggi. Pada eval 40 sampel, Sonnet berada 1% di belakang Opus dalam ketepatan tetapi menelan kos satu pertiga. Mereka memindahkan kerja ringkasan ke Sonnet; kos bulanan menurun daripada $9,000 kepada $3,100, tanpa aduan kualiti.

Kes 2 — Trafik bercampur dengan ubah hala. 80% daripada permintaan pasukan teknologi undang-undang adalah penandaan dokumen mudah, 20% adalah analisis kontrak yang kompleks. Mereka menghantar mereka semua kepada model yang berkuasa. Mereka menambah penghala murah dan mengedarkan kerja mudah kepada Haiku dan pekerjaan kompleks kepada Opus; kos permintaan purata menurun sebanyak 64%, manakala kualiti analisis dikekalkan.

Kes 3 — Kos mengecilkan saiz tanpa mengukur. Untuk mengurangkan kos, satu pasukan mengurangkan pengekstrakan kod perubatan kompleks terus kepada model pantas; Mereka tidak eval. Secara langsung, ketepatan menurun daripada 92% kepada 78%, menyebabkan pengembalian inferens yang salah. Mereka perlu menilai terlebih dahulu: tugas itu memerlukan model yang berkuasa. Pengajaran: kedua-dua pengurangan dan ketinggian dilakukan melalui pengukuran.

Kesilapan biasa

  • Refleks "model terkuat": Pembaziran dan kelewatan yang tidak perlu dalam tugas mudah.
  • Menukar model tanpa mengukur: Kedua-dua pengurangan dan pembesaran adalah berisiko tanpa eval.
  • Mengunci ke dalam satu model: Penghalaan dalam trafik bercampur selalunya lebih cekap.
  • Sentiasa salah mengira penghala untuk LLM: Peraturan mudah boleh berfungsi pada kos sifar.
  • Tidak menetapkan ambang rangsangan: Apa yang berlaku jika ketepatan menurun harus ditakrifkan lebih awal.
  • Tidak membetulkan versi model: Rekod model/versi yang anda sedang usahakan dalam pengeluaran; Perubahan versi mungkin mengubah tingkah laku.

Lebih mendalam: Mengekalkan Eval dan Percubaan Bertambah

Pemilihan model bukan keputusan sekali sahaja. Penyedia memperkenalkan model baharu, harga berubah, huraian kerja anda berkembang. Jadi sediakan kluster eval sekali dan jangan lupa; pegang ia seperti makhluk hidup. Apabila model baharu keluar, anda menjalankan 20-50 sampel yang sama melaluinya, mengemas kini jadual dan membuat keputusan anda semula. Ini melindungi anda daripada perangkap "intuisi menukar corak".

Teknik lanjutan kedua ialah corak sandaran / lata. Anda memberi tugas kepada model murah dahulu; Jika output mempunyai keyakinan rendah atau lapisan pengesahan (unit 11) menolaknya, anda meningkatkan permintaan yang sama. Jadi kebanyakan trafik diselesaikan pada model murah, dengan hanya baki minoriti pergi ke model mahal. Ini lebih murah dan lebih tahan lama daripada pendekatan model tunggal tetap.

Perkara ketiga ialah eval merangkumi bukan sahaja ketepatan tetapi juga kos dan kependaman. Jika model 1% lebih tepat tetapi 3 kali lebih mahal dan 2 kali lebih perlahan, pertukaran itu tidak berbaloi untuk kebanyakan pekerjaan. Buat keputusan di sepanjang tiga paksi (ketepatan, kos, kependaman) dan tentukan "ambang kecukupan": "jika ketepatan melebihi 95%, pilih yang paling murah."

Akhir sekali, rekod model/versi yang anda gunakan dalam pengeluaran. Jika suatu hari kualiti output berubah, perkara pertama yang anda akan lihat ialah sama ada versi model telah berubah. Kebolehkesanan versi menjadikannya lebih cepat untuk mencari punca masalah kualiti.

Satu lagi kaveat: kelompok eval harus mewakili beban kerja sebenar anda. Eval yang hanya terdiri daripada contoh mudah menyembunyikan tempat model tersandung dalam kes sukar dan membuai anda kepada keyakinan palsu. Eval yang baik; Ia termasuk contoh mudah biasa serta kes sudut yang anda hadapi dalam realiti (input samar-samar, tidak lengkap, bercanggah). Minoriti yang sukar ini menentukan pilihan model anda, kerana setiap model berjaya dalam majoriti mudah. Pastikan Eval anda sentiasa segar dan mewakili dengan memberinya contoh sebenar baharu secara berkala.

Secara ringkasnya

Model yang betul ialah model paling ringan yang menyelesaikan tugas; Lebih berkuasa tidak lebih baik pada setiap kerja, cuma lebih mahal dan lebih perlahan. Mengelaskan tugas dan bermula daripada calon yang paling ringan, mengagihkan trafik bercampur dengan penghalaan, dan mengesahkan pemilihan dengan set kecil eval mengurangkan kos berkali-kali sambil mengekalkan kualiti.

Tugasan permohonan

Pilih beban kerja. (1) Kelaskan tugasan sebagai mudah/kompleks. (2) Reka set eval kecil 20 contoh sebenar (dengan jawapan yang betul). (3) Buat rancangan untuk mengisi jadual perbandingan ketepatan/kos/masa untuk tiga kelas model. (4) Jika anda mempunyai trafik bercampur, tulis peraturan penghalaan dan tetapkan ambang peningkatan.

senarai semak

  • [ ] Saya boleh membandingkan keluarga model pada paksi keupayaan/kelajuan/kos.
  • [ ] Saya boleh menggunakan prinsip "model berjaya paling ringan".
  • [ ] Saya boleh menyediakan penghalaan model mengikut kerumitan tugas.
  • [ ] Dengan set kecil eval saya boleh mengikat pemilihan kepada bukti.
  • [ ] Saya boleh menentukan ambang naik taraf/turun pangkat.