Enhed 6 / 10

Prislogik: Tokenøkonomi og omkostningskvalitetsbalance

Gevinster:

  • Mulighed for at læse input/output token-priser og fakturaposter
  • Evne til at estimere de månedlige omkostninger ved en arbejdsgang med en grov formel
  • Implementering af omkostningsbesparende metoder såsom caching, batchbehandling og modelinddeling

At kunne vurdere, hvor meget en model vil koste, er en af ​​beslutningstagerens mest praktiske færdigheder. "Hvad betaler jeg månedligt?" Hvis du ikke kan svare på spørgsmålet, kan du hverken planlægge et budget eller vælge det rigtige niveau. Den gode nyhed er, at prisen er enklere, end den lyder, og når du først har fået styr på det, kan du selv lave et groft skøn. I denne enhed lærer du, hvordan du læser input/output-token-priser, estimerer de månedlige omkostninger for en arbejdsgang med en simpel formel og metoder, der faktisk reducerer omkostningerne.

Tommelfingerregel: Input og output prissættes separat

I modeller med lukket vægt beregnes prisen baseret på mængden af behandlede tokens, og der er to separate elementer:

  • Input token (input): Den tekst, du sender til modellen. Din prompt, dine dokumenter, dine prøver.
  • Output token: Svaret, som modellen producerer til dig.

Kritisk punkt: Output-tokenet er ofte flere gange dyrere end input-tokenet. Dette skyldes, at det er beregningsmæssigt dyrere for modellen at producere output. For eksempel kan inputtet i én model være $3 pr. million tokens, mens outputtet kan være $15; Så output er fem gange dyrere. Det betyder, at lange og unødvendige svar hurtigt kan tære på budgettet.

Tip: En af de nemmeste måder at reducere omkostningerne på er ikke at bede modellen om unødvendigt lange svar. Begrænsninger såsom "maks. 5 artikler", "enkelt afsnit", "eksport kun tabellen" øger kvaliteten og gemmer output-tokenet.

Eksempler på nuværende pris

Nedenfor er de omtrentlige priser på flere modeller (pr. million tokens, amerikanske dollars). Disse værdier hører til den periode, hvor dette modul blev udarbejdet og ændres ofte; Tjek udbyderens aktuelle prisside for den nøjagtige beslutning.

model

Scene

Input $/1M

Output $/1M

Claude Opus 4.8

stærk

~5

~25

Claude Sonnet 5

afbalanceret

~3

~15

Claude Haiku 4.5

letvægts

~1

~5

Som det ses i tabellen, kan der være en prisforskel på op til fem gange mellem det stærke niveau og det lette niveau. Det er derfor, at "fittest model for all business"-tilgangen ofte er spild af penge. At få det enkle arbejde udført af en billig model og det vanskelige arbejde af en kraftfuld model giver store besparelser uden tab af kvalitet. Vi vil uddybe denne idé i enhed 7 og 9.

Estimering af månedlige omkostninger: Simpel formel

For et groft skøn over månedlige omkostninger kan du bruge denne formel:

Månedlig pris ≈ (Antal anmodninger pr. måned × Gennemsnitlig inputtoken × Inputpris / 1.000.000)+ (Antal anmodninger pr. måned × Gennemsnitlig outputtoken × Outputpris / 1.000.000)

Lad os køre et eksempel. Lad os sige, at et e-handelsteam producerer 50.000 produktbeskrivelser om måneden. Hver anmodning sender et gennemsnit på 500 tokens af input (produktinformation) og modtager 300 tokens af output (beskrivelse). I en afbalanceret model (input ~3, output ~15):

  • Inputpris: 50.000 × 500 × 3 / 1.000.000 = 75 USD
  • Outputpris: 50.000 × 300 × 15 / 1.000.000 = 225 USD
  • I alt ≈ $300/måned

Hvis de gjorde det samme arbejde i en letvægtsmodel (input ~1, output ~5):

  • Input: 50.000 × 500 × 1 / 1.000.000 = 25 USD
  • Output: 50.000 × 300 × 5 / 1.000.000 = 75 USD
  • I alt ≈ $100/måned

Så blot scenevalg kan reducere det samme job fra $300 til $100. Til en forholdsvis simpel opgave som en produktbeskrivelse er letvægtsmodellen ofte mere end tilstrækkelig.

Forsigtig: Denne formel er et groft skøn; faktisk fakturering varierer med faktorer som cachebrug, genforsøg og ræsonnement. Alligevel er det en meget god start for at få en budgetbekræftelse eller sammenligne to modeller. Det er bedst at måle det reelle tal med en lille pilot, før du træffer en beslutning.

Fem metoder til at reducere omkostningerne

  1. Vælg det rigtige niveau. Enkel, letvægtsmodel. Dette er den største enkeltkilde til besparelser.
  2. Gør input mindre. I stedet for at udfylde enorme dokumenter for hver anmodning, send kun det relevante afsnit (kontekstoptimering i enhed 5).
  3. Begræns output. Afklar svarets længde og format; Unødvendigt langt svar = unødvendig omkostning.
  4. Brug caching. Many providers allow you to cache and re-read repeated fixed inputs (e.g. the same system instruction) much cheaper. Dette giver betydelige besparelser, hvis du sender den samme store instruktion tusindvis af gange.
  5. Udfør batchbehandling. Hvis du ikke har travlt, reducerer "batch"-muligheder, som sender mange anmodninger i bulk og behandler dem med rabat, omkostningerne betydeligt.

Tre realistiske sager

Case 1 — Besparelser med trinskift. Et kundeserviceteam opsummerede alle indgående e-mails med den stærkeste model, og deres månedlige regning var ~$900. At opsummere var en simpel opgave; Da de flyttede til det afbalancerede niveau, forblev outputkvaliteten næsten den samme, men regningen faldt til ~$250. Besparelser ~$7.800 om året, blot ved at vælge det rigtige niveau.

Sag 2 — Gemmer med cache. Et softwareteam sendte det samme 8.000 token "kodningsstandarder"-dokument med hver anmodning om kodegennemgang. 400 anmodninger om dagen × 8.000 tokens = stort gentagne input. Da de tændte for cache-funktionen, begyndte denne faste partition at blive læst meget billigere, og en betydelig del af inputomkostningerne forsvandt.

Tilfælde 3 — Besparelser ved at begrænse output. Når et marketingteam bad om en produktbeskrivelse, producerede modellen lange, blomstrende afsnit ad gangen. Da de tilføjede begrænsningen "maks. 60 ord, enkelt afsnit", blev forklaringerne mere nyttige, og output-tokenet blev halveret. Mens kvaliteten steg, faldt omkostningerne; win-win.

Svag prompt / stærk prompt

Svag prompt:

Skriv mig en god beskrivelse af dette produkt. [produktinformation]

Modellen kan skrive så længe hun vil; Output-tokenet er ukontrolleret.

Kraftig prompt:

Din rolle: e-handelstekstforfatter. Produkt: [INFORMATION]. Opgave: Skriv en produktbeskrivelse. Begrænsninger: Maksimalt 60 ord, et afsnit, appellerer til ikke-tekniske kunder, indeholder 2 fordele + 1 use case. Undgå smarte adjektiver.

Den kraftfulde prompt styrer både kvalitet og outputlængde (og derfor omkostninger).

Kopierbare skabeloner

1. Månedlige omkostningsoverslag:

Jeg foretager [QUANTITY] anmodninger hver måned. Gennemsnitlig input ~[NUM] tokens, output ~[NUM] tokens. Beregn de månedlige omkostninger for følgende modeller ([MODEL A], [MODEL B]) med formlen og sammenlign i en tabel. Accepter input/output priser [PRISER].

Tier 2 sammenligning:

Min pligt [OPGAVE]. Kræver dette job virkelig en kraftig model, eller er en letvægts/afbalanceret model tilstrækkelig? Evaluer med hensyn til kvalitet og omkostninger og foreslå 2 niveauer for mig at pilotteste.

3. Omkostningsreduktionsscreening:

Identificer måder at reducere omkostningerne i følgende workflow: [WORKFLOW]. Skriv gennemførlighed og estimerede besparelser for hver af de kaskade-, inputreduktions-, output-bundne, cache- og batchbehandlingsoverskrifter.

4. Outputbegrænsning:

Omskriv følgende prompt for at reducere output-tokenet uden at reducere kvaliteten: "[PROMPT]". Optimer til længde, format og unødvendig gentagelse.

Almindelige fejl

  • Spring over input/output forskellen: Tillad lange svar uden at vide, at output er meget dyrere.
  • Den mest kraftfulde model til ethvert job: At udføre et simpelt arbejde med en dyr model og betale mange gange mere unødigt.
  • Frigivelse af outputlængden: Giver ubegrænset skrivetilladelse til modellen uden at pålægge format- eller længdebegrænsninger.
  • Ignorer cache og batch: Manglende seriøse besparelsesmuligheder for gentagne input og ikke-hastende opgaver.
  • Tænker at priserne er up-to-date: At stole på en gammel pristabel og planlægge budgettet forkert; priserne ændres ofte.

Sammenfattende

  • Prisen er beregnet ud fra poletter; input og output prissættes separat, og output er ofte flere gange dyrere.
  • Du kan groft estimere de månedlige omkostninger ved formlen antal anmodninger × gennemsnitlig token × pris.
  • Korrekt valg af trin alene kan reducere omkostningerne mange gange.
  • Inputminimering, outputbegrænsning, caching og batchbehandling er praktiske metoder, der reducerer regningen markant.

Ansøgningsopgave

Få de tokenværdier, du estimerede i den forrige enhed. Få de månedlige omkostninger for din virksomhed beregnet for to forskellige niveauer med skabelon 1 i denne enhed (månedlig prisoverslag). Derefter, med den 3. skabelon (omkostningsreduktionsscanning), skal du udlede, hvor mange besparelser hver metode kan give din arbejdsgang. Planlæg at vælge de to mest lovende metoder og anvende dem på dit næste måneds budget.

tjekliste

  • [ ] Jeg ved, at input og output token prissættes separat, og output er dyrere.
  • [ ] Jeg kan groft estimere de månedlige omkostninger ved en arbejdsgang med den simple formel.
  • [ ] Jeg kan vise omkostningseffekten ved at vælge det rigtige niveau med et eksempel.
  • [ ] Jeg kan genkende fem omkostningsreduktionsmetoder og vælge den passende.
  • [ ] Jeg kan omskrive en prompt for at reducere output-tokenet.