Enhed 7 / 10

Modelniveauer og -evner: Begrundelse, hastighed og lille/stor modelvalg

Gevinster:

  • Genkender lette, afbalancerede og kraftfulde modeltrin og ræsonnement
  • Valg af det passende modelniveau baseret på en opgaves sværhedsgrad
  • Evne til bevidst at etablere balancen mellem latens, nøjagtighed og omkostninger

Vi lærte at beregne prisen; Lad os nu tale om, hvad vi får for den pris, nemlig modelniveauer og muligheder. Tre kræfter konkurrerer konstant, når man vælger en model: kvalitet (nøjagtighed), hastighed (latency) og pris. At forbedre to af disse tre betyder ofte at kompromittere den tredje. I enheden lærer du om lette, afbalancerede og kraftfulde niveauer, ræsonneringstilstand og præference for små/store modeller; Du vil være i stand til bevidst at etablere den rette balance alt efter opgavens sværhedsgrad.

Tre niveauer, tre forskellige jobkarakterer

Næsten hver udbyder tilbyder tre niveauer inden for samme familie. Lad os matche disse med opgavens karakter:

  • Let tier (lille model): Meget hurtig, meget billig, "god nok". Ideel til enkle, gentagne opgaver med store mængder: klassificering, briefing, tagging, datarensning, enkle svarudkast.
  • Balanceret niveau (medium model): God kvalitet, rimelig hastighed, rimelige omkostninger. "Standard"-valget for det meste daglige arbejde: indholdsproduktion, mellemlang analyse, kundesvar.
  • Kraftig niveau (stor model): Højeste kvalitet, langsomste, dyreste. Til komplekse ræsonnementer, lang og multi-trin analyse, vanskelig kode, præcis juridisk/økonomisk evaluering.
Tip: En god startregel: Start med et afbalanceret niveau. Hvis kvaliteten er dårlig, gå op til det stærke niveau; Hvis kvaliteten er ekstremt god, og lydstyrken er høj, skal du gå ned til lysniveauet. "Start med godt nok"-tilgangen, ikke "start med den stærkeste", sparer både penge og tid.

Hvad er Reasoning Mode?

Nogle modeller "tænker" måske først svaret trin for trin i stedet for at generere det direkte. Dette kaldes ræsonnement. Modellen opdeler et problem i dele, bearbejder de mellemliggende trin i sig selv og giver først derefter det endelige svar. Dette svarer til, at en elev løser et matematisk problem trin for trin på papir.

Hvornår er det værdifuldt? I flertrins, logiske problemer: en kompleks beregning, modsigelsesdetektering, en lang kæde af slutninger, en vanskelig kodefejl. I denne type arbejde øger ræsonnement markant nøjagtigheden.

Hvad koster det? Begrundelse øger omkostninger og latens, da modellen genererer flere "tænke-tokens". Så det bliver både dyrere og langsommere. Et simpelt "er denne anmeldelse positiv?" At ræsonnere på spørgsmålet er som at dræbe en flue med en hammer; skaber unødvendige omkostninger og forsinkelser.

Forsigtig: Lad ikke begrundelsestilstand stå åben for hver opgave. Det er både hurtigere og billigere at holde lukket til simple opgaver. Nogle af de moderne modeller kommer med en "adaptiv" tænkemåde, der selv bestemmer, hvornår den skal tænke; Det er dog din opgave at styre det bevidst.

Kvalitet, hastighed, omkostningstrekant

prioritet

Passende niveau

ræsonnement

Laveste pris, høj volumen

letvægts

Lukket

Balance (de fleste job)

afbalanceret

afhængig af situationen

Højeste nøjagtighed, kritisk beslutning

stærk

åben

Øjeblikkelig respons, lav forsinkelse (chat)

Let/balanceret

Lukket

Kompleks analyse i flere trin

stærk

åben

Når du ser på denne tabel, så spørg dig selv: "Hvad vil det koste, hvis jeg laver en fejl i denne opgave?" Hvis prisen er høj (forkert juridisk vurdering, forkert økonomisk beslutning) er investeringen af ​​stærk kaliber og ræsonnement berettiget. Hvis prisen er lav (fejlklassificering af et produktmærke), er en let og hurtig model tilstrækkelig.

Lille model eller stor model?

I modsætning til hvad mange tror, ​​kræver det ikke ethvert job en stor model. Mindre modeller er blevet overraskende dygtige og udfører mange opgaver til en tiendedel af prisen og flere gange hurtigere end den større model. Tre spørgsmål til afgørelse:

  1. Er opgaven enkel og formel? (Klassificering, udtræk, kort opsummering) → Lille model.
  2. Er lydstyrken for høj og hastigheden kritisk? → Lille model, fordi stor model er dyr og langsom.
  3. Kræver opgaven nuanceret ræsonnement, udvidet kontekst eller kreativitet? → Stor model.

Tre realistiske sager

Tilfælde 1 — Letvægtsmodellen er tilstrækkelig. Et e-handelsteam sorterer 40.000 kundekommentarer om dagen i positive/negative/neutrale. De prøver det med den kraftige model og sammenligner det derefter med letvægtsmodellen: Nøjagtigheden er næsten den samme (96% vs 94%), men letvægtsmodellen er 8 gange billigere og 3 gange hurtigere. Letvægtsmodellen er langt det rigtige valg til denne opgave; Den ekstra 2% nøjagtighed retfærdiggør ikke 8x prisen.

Case 2 — Stærk model + ræsonnement er et must. Et skattekonsulentfirma ønsker at beregne et komplekst skattescenarie i flere faser. Letvægtsmodellen laver fejl i mellemtrin og giver forkerte resultater. Når de bruger den kraftfulde model med ræsonneringstilstand slået til, skrider modellen frem trin for trin og når frem til den korrekte konklusion. Her er ekstra omkostninger og forsinkelser acceptable, fordi omkostningerne ved fejl er høje; En ekspert bekræfter dog resultatet.

Tilfælde 3 — Blandet brug. Et callcenter behandler opkaldstransskriptioner i to trin: For det første opsummerer det kort hvert opkald med en letvægtsmodel (høj volumen, simpel opgave), derefter giver det kun de opkald, der er markeret som "klager" til den kraftfulde model og udfører en grundlæggende årsagsanalyse (lav volumen, kompleks opgave). Så de behandler hovedparten af ​​volumen billigt, mens de reserverer kraften i det stærke mønster til de få opkald, der virkelig betyder noget.

Svag prompt / stærk prompt

Svag prompt:

Løs dette skattescenarie. [komplekst scenarie]

Det er uklart, hvor nøje modellen vil overveje.

Kraftig prompt:

Din rolle: senior skattespecialist. Opgave: Løs følgende flertrinsscenarie trin for trin. List først antagelserne, beregn og vis derefter hvert trin for sig, og giv til sidst nettoresultatet. Hvis der er et punkt, du ikke er sikker på, eller som afhænger af lovgivningen, så marker det som "ekspertbekræftelse påkrævet". Springer mellemtrin over.[scenario]

Den kraftfulde prompt guider modellen gennem trin-for-trin-tænkning (opmuntrende ræsonnement) og gør mellemtrin synlige for verificerbarhed.

Kopierbare skabeloner

Fase 1 diagnose:

Min mission: [OPGAVE]. Volumen: [NUMBER/dag]. Fejlpris: [LAV/MIDDEL/HØJ]. Hastighedsprioritet: [LAV/HØJ]. Baseret på denne profil, hvilket niveau (let/afbalanceret/stærkt) og ræsonnement (åbent/lukket) vil du anbefale? retfærdiggøre.

2. Lille/stor modelbeslutning:

Jeg definerer følgende opgave: [OPGAVE]. Kan dette problem løses med en lille (let) model, eller kræves der en stor model? Foreslå 3 testcases og en succestærskel for mig at prøve at løse med den lille model.

3. Relevansen af begrundelsen:

Ville ræsonnementet (trin-for-trin-tænkning) være fordelagtigt eller dyrt i følgende opgave: [OPGAVE]? Begrund din beslutning ud fra antallet af trin og opgavens logiske kompleksitet.

4. To-trins workflow design:

Design et to-trins flow for at reducere omkostningerne på følgende højvolumenopgave [OPGAVE]: hvilken del skal gå til letvægtsmodellen, hvilken del skal gå til den kraftige model? Skriv niveauet og begrundelsen for hvert trin.

Almindelige fejl

  • En kraftfuld model til ethvert job: Skaber unødvendige omkostninger og forsinkelser ved at bruge den mest kraftfulde model til enkle og omfangsrige job.
  • Forlad altid ræsonnementet på: At holde tænketilstanden på i enkle opgaver og spilde tid og penge forgæves.
  • At træffe beslutninger uden at måle kvalitet: Antag "større er bedre" uden at sammenligne to niveauer med dine egne data.
  • At glemme behovet for hastighed: På steder, hvor der kræves et øjeblikkeligt svar, såsom chat, valg af en langsom kraftfuld model og at lade brugeren vente.
  • Tænker slet ikke på to-trins flowet: Ikke at have hele volumen bygget af en enkelt model og ikke spare på den del, der kan gøres billigt.

Sammenfattende

  • Modelvalg er en balancegang i trekanten af kvalitet, hastighed og pris; At forbedre to kræver ofte at gå på kompromis med den tredje.
  • Let scene er velegnet til simple/voluminøse job, stærk scene er velegnet til komplekse/kritiske job; Den afbalancerede fase er en god start for de fleste job.
  • Begrundelsestilstand forbedrer nøjagtigheden i problemer med flere trin, men øger omkostningerne og latenstiden; Det bør ikke stå åbent for enhver opgave.
  • "Hvad koster det at fejle i denne mission?" Spørgsmålet er kompasset for beslutningen om niveau og begrundelse. To-trins flow giver store besparelser i volumenjob.

Ansøgningsopgave

Vælg en opgave i dit job og afgør, hvilken fase og ræsonnement indstilling der er passende med skabelon 1 (stadiediagnose). Hvis opgaven er høj volumen, så kom med et design, der leder noget af volumen til letvægtsmodellen og den kritiske del til den stærke model med skabelon 4 (to-trins workflow). Vi vil bruge dette design i modelporteføljestudiet i enhed 9.

tjekliste

  • [ ] Jeg kan matche arbejdskarakteren af lette, afbalancerede og kraftfulde scener.
  • [ ] Jeg kan forklare, hvad ræsonnement mode gør, og hvad det koster.
  • [ ] Jeg kan bevidst etablere balancen mellem kvalitet, hastighed og omkostning for en opgave.
  • [ ] Jeg kan besvare spørgsmålet om lille eller stor model med tre spørgsmål.
  • [ ] Jeg kan designe et to-trins flow til et job med stor volumen.