Vienība 2 / 11

Tokens un cenu noteikšanas loģika

Ieguvumi:

  • Izskaidrojiet marķiera jēdzienu, ievades/izvades marķiera atšķiršanu un marķieri.
  • No žetonu skaita un vienības cenas var aprēķināt pieprasījuma izmaksas un ikmēneša darba slodzi
  • Var salīdzināt modeļa izvēles un tūlītējā garuma ietekmi uz izmaksām

Jūs nevarat izveidot liela mēroga risinājumu, neizprotot LLM API ekonomiku. Demonstrācija tiek palaista vienreiz; Galvenais ir spēt paredzēt, kāds būs rēķins, kad mēnesī tiks veikti tūkstošiem zvanu. Šajā nodaļā mēs iestatām lietu naudas pusi: kas ir marķieris, kāpēc ievades un izvades cena ir atšķirīga, kā aprēķināt pieprasījuma izmaksas un kā plānot ikmēneša darba slodzi. Šī informācija ļauj izmērīt optimizācijas metožu atdevi (kešatmiņa, modeļa izvēle, partija) nākamajās vienībās.

Kas ir Token?

Tokens ir mazākā vienība, kurā modelis apstrādā tekstu. Vārds ne vienmēr ir simbols; marķieris parasti ir vārda daļa. Aptuveni runājot, angļu valodā 1 marķieris ir ≈ 4 rakstzīmes ≈ 0,75 vārdi. Turku valodā un kodā attiecība atšķiras: sufiksu struktūras un alfabēta dēļ turku valodas vārdi bieži tiek sadalīti vairākos žetonos nekā angļu valodā. Tāpēc ir nepieciešams izmērīt marķieru skaitu ar pakalpojumu sniedzēja marķieru skaitīšanas rīku, nevis uzminēt ar aci.

Tokenizācija (teksta sadalīšanas marķieros) katram modelim var būt atšķirīga. Tam ir divas praktiskas sekas: (1) viens un tas pats teksts dažādos modeļos var radīt atšķirīgu marķieru skaitu; (2) Prognozes, kas veiktas, izmantojot citu pakalpojumu sniedzēju marķierus (piemēram, OpenAI tiktoken bibliotēku), Klodam būs neprecīzas — izmantojiet marķieru skaitīšanas padomu izmantotajam modelim.

Padoms: "Cik žetonu?" Neatbildiet uz jautājumu akli. Nosūtiet reprezentatīvu tekstu caur marķieru skaitīšanas API; Budžeta lēmumus pamatojiet ar mērījumiem.

Ievades un izvades marķieri

Rēķins sastāv no divām vienībām:

  • Ievades marķieri: viss, ko sūtāt modelim — sistēmas uzvedne, iepriekšējās ekskursijas, lietotāja ziņojums, dokumentācija, ja tāda ir. Tie tiek apstrādāti uzreiz.
  • Izvades marķieri: modeļa radītā atbilde. Katram izvades marķierim modelis veic aprēķinu soli pa solim.

Lielākajai daļai pakalpojumu sniedzēju izvade ir vairākas reizes dārgāka nekā ievade. Iemesls ir vienkāršs: nolasīt ievadi uzreiz ir lētāk nekā izveidot izvades marķieri pa vienam. Zinot šo asimetriju, ir izskaidrots, kāpēc tādas optimizācijas kā “nepieciešamas īsas atbildes” ir tik efektīvas.

Cenas paraugi (par 1 miljonu žetonu, USD)

Zemāk esošā tabula ir atsauce; Cenas laika gaitā var mainīties, lūdzu, apstipriniet sava pakalpojumu sniedzēja pašreizējo sarakstu.

modeļu klase

modeļa paraugs

Ievade ($/1 miljons)

Izlaide ($/1 miljons)

Tipisks lietojums

ātri/lēti

Haiku 4.5

1.00

5.00

Klasifikācija, marķēšana, vienkāršs kopsavilkums

līdzsvarots

sonets 5

3.00

15.00

Vispārējais mērķis, kodēšana, aģentu darbs

stiprs

Opus 4.8

5.00

25.00

Sarežģīta spriešana, liela attāluma uzdevumi

Katrā klasē izvade ir 5 reizes lielāka par ievadi; Turklāt pat jaudīgā modeļa ievade ir 5 reizes lielāka nekā lētā modeļa ievade. Šīs divas asis (ievades↔izejas un modeļa klase) veido jūsu izmaksu lēmumu ietvaru.

Kā aprēķināt izmaksas?

Formula ir vienkārša:

izmaksas = (ievades_tokens / 1 000 000) × ievades_cena + (izejas_tokens / 1 000 000) × izlaides_cena

Konta paraugs. Pieprasījums ar Sonnet 5: 1500 ievades marķieri, 400 izvades marķieri.

ievade = 1 500 / 1 000 000 × 3,00 = 0,0045 ASV dolāri, izvade = 400 / 1 000 000 × 15,00 = 0,0060 ASV dolāri kopā = 0,0105 ASV dolāri (apmēram 1 cents)

Viens zvans izskatās lēts. Bet reiziniet ar apjomu: 20 000 zvanu dienā → 210 USD dienā, ~ 6 300 USD mēnesī. Šeit parādās mērogs.

Mēneša budžeta veidne

Lai iegūtu darba slodzes mēneša izmaksas, izmantojiet šo veidni:

1) Vidējais ievades marķieris vienam pieprasījumam: ......2) Vidējais izvades marķieris vienam pieprasījumam: ......3) Pieprasījumu skaits dienā: ......4) Nostrādātās dienas mēnesī: ......5) Maksa par pieprasījumu = (1)/1M × ievades_cena + (2)/1M × izvades_cena6) Mēneša izmaksas = (5) × (3) × (

Šī modeļa ieliešana izklājlapā un summa, kas izpaužas, mainot modeli, ietver modeļa atlases (5. vienība) un kešatmiņas (6. vienība) lēmumus.

Uzvednes saīsināšana ar kopējamām veidnēm

Lielāko daļu izmaksu rada nevajadzīgi garas uzvednes un izšķērdēta produkcija. Tālāk norādītās veidnes nodrošina tiešus ietaupījumus.

# Ierobežojiet izvades garumu. Atbildiet ar ne vairāk kā 3 vienumiem. Pievienojiet pamatojumu vai ievadteikumu.

# Atgriezt tikai pieprasīto lauku Atgriezt tikai šo JSON, nepievienot nekādu citu tekstu:{"category": "...", "urency": "low|medium|high"}

# Noņemt nevajadzīgo kontekstuNoņemiet tikai datumu un summu no nākamā teksta. Neatkārtojiet visu tekstu.Teksts: """{{text}}"""

# Apkopojiet garo runu (ievades saglabāšana) Apkopojiet šo runu 5 vienībās. Turpmākajās kārtās izmantošu šo kopsavilkumu, nevis pilnu pagātni. Runa: """{{past}}"""

Vāja uzvedne / spēcīga uzvedne (izmaksu ziņā)

# VĀJS (izlaidi, dārgi) Analizējiet šo atbalsta pieprasījumu un uzrakstiet man visaptverošu pārskatu.

# STRONG (ierobežo izlaidi, lēts un paredzams)Klasificējiet šo atbalsta pieprasījumu. Vienkārši atgrieziet šo JSON:{"category":"rēķins|tehniskais|atmaksa|cits","urency":"zems|vidējs|augsts"}Nerakstiet aprakstu.

Vāja versija rada varbūt 500 izvades marķierus; stiprā versija ~15. Tā kā izvade ir dārga, tā ir būtiska atšķirība vienam zvanam un reizina ar skaļumu.

Trīs mini futrāļi

1. gadījums — garās uzvednes slēptās izmaksas. Tā kā grāmatvedības automatizācija sakārtoja katru rēķinu, tā pievienoja 40 lappušu “noteikumu grāmatu” kā ievadi katram pieprasījumam: aptuveni 12 000 ievades marķieru vienam pieprasījumam. Ar Sonnet 5 12 000/1M×3 = tikko ievadīti 0,036 USD. 5000 rēķinu dienā → 180 USD dienā. Saglabājot noteikumu grāmatu kešatmiņā (6. vienība), ievades izmaksas samazinājās par ~90%.

2. gadījums — modeļa samazināšanas atmaksāšanās. Viena komanda veica vienkāršu “pozitīvu/negatīvu” noskaņojumu iezīmēšanu ar Opus 4.8: 300 ievades + 10 izvades marķieri. Opuss maksā 300/1M×5 + 10/1M×25 = 0,00175 USD. Pārejot uz Haiku, 300/1M×1 + 10/1M×5 = $0,00035 — 5x lētāk, precizitātes atšķirība bija neizmērojama. 3 miljoniem zvanu mēnesī starpība ir 5250 $ → 1050 ASV dolāri.

3. gadījums — izvades atbrīvošana. Kad mārketinga komanda izstrādāja produkta aprakstu, tā nenosaka nekādus izlaides ierobežojumus; modele dažreiz teica 1500 žetonus. Kad pievienoju instrukciju "maksimums 60 vārdi", vidējā izvade samazinājās no 900 uz 90 žetoniem. Tā kā drukāšana bija dārga, ikmēneša rēķins samazinājās par trešdaļu, un teksti kļuva noderīgāki.

Biežas kļūdas

  • Marķiera uzminēšana pēc acs: jūs varat kļūdīties, it īpaši turku valodā un kodā. Pasākums.
  • Pieņemot, ka ievade un izvade ir vienādas: izvade parasti ir daudz dārgāka; Lielākā daļa optimizācijas tiek veikta, saīsinot izvadi.
  • Neļaujiet sevi apmānīt ar viena zvana lētumu: lēmumu pieņem pēc apjoma. USD 0,01 × miljons = 10 000 USD.
  • Prognoze ar cita pakalpojumu sniedzēja marķieri: sniedz nepareizus rezultātus; Izmantojiet modeļa marķieru skaitīšanas rīku.
  • Neierobežots sarunu vēstures palielinājums: katra kārta tiek pievienota ierakstam; apkopot garās sarunās.
  • Nevajadzīgi augstu saglabājot `max_tokens': slēpj budžeta plānu un risku tikt samazinātam; Piešķiriet reālu vērtību.

Deeper: konteksta logs un garās ievades izmaksas

Ir ļoti svarīgi redzēt, kā cena veidojas "visā sarunā", nevis tikai "vienā pieprasījuma gadījumā". Kopējais teksta apjoms, ko modelis var apstrādāt, tiek saukts par konteksta logu; Ievades un izvades summai jāiekļaujas šajā logā. Mūsdienu modeļi piedāvā ļoti lielus logus (simtiem tūkstošu, pat miljoniem žetonu), taču tas nenozīmē, ka varat to "piepildīt bezgalīgi" — viss, ko ievietojat logā, tiek iekasēts kā ievade.

Slazds garās sarunās ir šāds: ar katru jaunu kārtu jūs atkal nosūtāt visu vēsturi (bezvalstniecība 1. vienībā). 20 raundu sarunā 20. pieprasījums kā ievadi izmanto visas pirmās 19 kārtas. Tādējādi, sarunai kļūstot garākai, maksa par pieprasījumu pieaug kumulatīvi, nevis lineāri. 50 kārtu saruna ar aģenta palīgu var radīt ievades izmaksas desmitiem reižu pirmajā kārtā.

Ir divi veidi, kā to pārvaldīt. Pirmais ir apkopojums: vecāku kārtu saspiešana vienā atkārtojuma blokā, saglabājot tikai dažas pēdējās kārtas neapstrādātas. Otrais ir tūlītēja kešatmiņa (6. vienība): fiksētā konteksta lasīšana par desmito daļu no cenas, nevis atkārtoti apstrādāta par pilnu cenu. Kopā tie ievērojami samazina rēķinu par ilgstošām, kontekstietilpīgām darba slodzēm. Tātad token ekonomika ir par visas sesijas noformējumu, nevis vienu pieprasījumu.

Rezumējot

Token ir mazākā vienība, kurā tiek apstrādāts teksts; izejmateriālu un izlaidi nosaka atsevišķi, un izlaide bieži vien ir daudz dārgāka. Izmaksas ir žetonu skaits, kas reizināts ar vienības cenu, un patiesais lēmums tiek pieņemts pēc apjoma. Uzvednes saīsināšana, jaudas ierobežošana un vieglākā modeļa izvēle, kas veic uzdevumu, ir vistiešākās sviras, kas vairākas reizes samazina izmaksas.

Lietojumprogrammas uzdevums

Izvēlieties savu uzdevumu. (1) Nosakiet ievades un aptuveno izvades marķieru skaitu reprezentatīvai uzvednei (ja iespējams, veiciet mērījumu, izmantojot marķieru skaitīšanas rīku). (2) Aprēķiniet izmaksas par pieprasījumu trīs modeļu klasēm. (3) Novērtējiet savu pieprasījumu skaitu dienā un nosakiet mēneša budžetu trim modeļiem. (4) Pievienojiet norādījumu, lai saīsinātu izvadi un atzīmētu paredzamos ietaupījumus.

kontrolsaraksts

  • [ ] Es varu izskaidrot marķieru jēdzienu un to, ka marķieri atšķiras atkarībā no modeļa.
  • [ ] Es zinu, kāpēc ievades un izvades marķieriem ir atšķirīgas cenas.
  • [ ] Es varu aprēķināt pieprasījuma izmaksas ar formulu.
  • [ ] Varu izveidot ikmēneša budžetu darba slodzei, izmantojot veidni.
  • [ ] Ar piemēru varu parādīt ieguvumu no izlaides saīsināšanas un modeļa samazināšanas.