Câștiguri:
- Explicați conceptul de token, distincția de intrare/ieșire și tokenizare.
- Poate calcula costul unei cereri și o sarcină de lucru lunară din numărul de jetoane și prețul unitar
- Poate compara impactul selecției modelului și lungimea promptă asupra costului
Nu puteți construi o soluție la scară fără a înțelege economia API-urilor LLM. Un demo rulează o dată; Principalul lucru este să poți prezice care va fi factura atunci când se fac mii de apeluri pe lună. În această unitate am configurat partea de bani a lucrurilor: ce este un simbol, de ce intrarea și ieșirea au prețuri diferite, cum se calculează costul unei solicitări și cum se bugetează un volum de lucru lunar. Aceste informații vă permit să măsurați randamentul tehnicilor de optimizare (caching, selecție model, lot) în unitățile ulterioare.
Ce este Token?
Tokenul este cea mai mică unitate în care modelul procesează text. Un cuvânt nu este întotdeauna un semn; simbolul este de obicei o parte a unui cuvânt. Aproximativ vorbind, în engleză, 1 simbol este ≈ 4 caractere ≈ 0,75 cuvinte. În turcă și cod, raportul variază: cuvintele turcești sunt adesea împărțite în mai multe jetoane decât în engleză datorită structurii și alfabetului sufixat. Prin urmare, este necesar să se măsoare numărul de jetoane cu instrumentul de numărare a jetoanelor furnizorului, mai degrabă decât să se ghicească cu ochii.
Tokenizarea (procesul de împărțire a textului în jetoane) poate fi diferită pentru fiecare model. Acest lucru are două consecințe practice: (1) Același text poate produce un număr diferit de jetoane în diferite modele; (2) Predicțiile făcute cu tokenizer de la alți furnizori (de exemplu, biblioteca tiktoken a OpenAI) vor fi inexacte pentru Claude - utilizați sfatul de numărare a jetonelor pentru modelul pe care îl utilizați.
Sugestie: „Aproximativ câte jetoane?” Nu răspunde orbește la întrebare. Treceți un text reprezentativ prin API-ul de numărare a simbolurilor; Bazați deciziile bugetare pe măsurare.
Jetoane de intrare și de ieșire
Factura este formată din două articole:
- Jetoane de intrare: orice trimiteți modelului - prompt de sistem, tururi anterioare, mesaj de utilizator, documentație, dacă există. Acestea sunt procesate dintr-o dată.
- Jetoane de ieșire: răspunsul produs de model. Pentru fiecare jeton de ieșire, modelul efectuează calculul pas cu pas.
Cu majoritatea furnizorilor, producția este de câteva ori mai scumpă decât intrarea. Motivul este simplu: citirea intrării dintr-o dată este mai ieftină decât producerea de ieșire token cu token. Cunoașterea acestei asimetrii explică de ce optimizări precum „necesită răspunsuri concise” sunt atât de eficiente.
Prețuri eșantion (pe 1 milion de jetoane, USD)
Tabelul de mai jos este o referință; Prețurile se pot schimba în timp, vă rugăm să confirmați lista curentă a propriului furnizor.
clasa de model
model de probă
Intrare ($/1 milion)
Ieșire ($/1 milion)
Utilizare tipică
rapid/ieftin
Haiku 4.5
1.00
5.00
Clasificare, etichetare, rezumat simplu
echilibrat
sonetul 5
3.00
15.00
Scop general, codificare, lucru de agent
puternic
Opusul 4.8
5.00
25.00
Raționament complex, sarcini de lungă durată
În fiecare clasă, ieșirea este de 5 ori intrarea; Mai mult, chiar și intrarea modelului puternic este de 5 ori mai mare decât aportul modelului ieftin. Aceste două axe (intrare↔ieșire și clasă de model) formează cadrul deciziilor dumneavoastră de cost.
Cum se calculează costul?
Formula este simplă:
cost = (input_token / 1.000.000) × input_price + (output_token / 1.000.000) × output_price
Exemplu de cont. O cerere cu Sonetul 5: 1.500 de jetoane de intrare, 400 de jetoane de ieșire.
intrare = 1.500 / 1.000.000 × 3,00 = 0,0045 USD ieșire = 400 / 1.000.000 × 15,00 = 0,0060 USD total = 0,0105 USD (aproximativ 1 cent)
Un apel pare ieftin. Dar înmulțiți cu volum: 20.000 de apeluri pe zi → 210 USD pe zi, ~6.300 USD pe lună. Aici intervine scara.
Șablon de buget lunar
Pentru a extrage costul lunar al unei sarcini de lucru, utilizați acest șablon:
1) Indicativ mediu de intrare per cerere: ......2) Indicativ mediu de ieșire per cerere: ......3) Număr de solicitări pe zi: ......4) Zile lucrate pe lună: ......5) Cost pe cerere = (1)/1M×preț_intrare + (2)/1M×preț_ieșire6) Cost lunar = (5) × (3) × (4)
Turnarea acestui model într-o foaie de calcul și vedea cum se desfășoară suma atunci când schimbați modelul încorporează deciziile de selecție a modelului (unitatea 5) și de cache (unitatea 6).
Scurtarea promptului cu șabloane copiabile
Cea mai mare parte a costurilor provine din solicitări inutil de lungi și din rezultate irosite. Șabloanele de mai jos oferă economii directe.
# Limitați lungimea de ieșire. Răspundeți cu maximum 3 itemi. Adăugați o rațiune sau o propoziție introductivă.
# Returnează numai câmpul solicitat Returnează doar următorul JSON, nu adăugați niciun alt text:{"category": "...", "urgency": "low|medium|high"}
# Eliminați contextul inutil. Eliminați numai data și suma din textul următor. Nu repetați întregul text.Text: """{{text}}"""
# Rezumați discursul lung (salvarea intrării) Rezumați acest discurs în 5 elemente. Voi folosi acest rezumat în loc de trecutul complet în rundele ulterioare. Discurs: """{{trecut}}"""
Prompt slab / Prompt puternic (din punct de vedere al costului)
# SLAB (emite rezultate, scump) Analizați această solicitare de asistență și scrieți-mi o recenzie cuprinzătoare.
# PUTERNIC (constrânge rezultatul, ieftin și previzibil)Clasificați această solicitare de asistență. Doar returnați următorul JSON:{"category":"invoice|technical|refund|other","urgency":"low|medium|high"}Nu scrieți o descriere.
Versiunea slabă produce poate 500 de jetoane de ieșire; versiune puternică ~15. Deoarece producția este scumpă, aceasta este o diferență semnificativă pe apel și se înmulțește cu volumul.
Trei mini carcase
Cazul 1 — Costul ascuns al promptului lung. Pe măsură ce o automatizare contabilă sorta fiecare factură, a adăugat un „cadru de reguli” de 40 de pagini ca intrare la fiecare solicitare: ~12.000 de jetoane de intrare per cerere. Cu Sonnet 5 12.000/1M×3 = 0,036 USD tocmai ați introdus. 5.000 de facturi pe zi → 180 USD pe zi. Prin memorarea în cache a cachei de reguli (unitatea 6), costul de intrare a scăzut cu ~90%.
Cazul 2 – Reducerea modelului. O echipă făcea etichetare simplă de sentiment „pozitiv/negativ” cu Opus 4.8: 300 de intrare + 10 jetoane de ieșire. Opus cost 300/1M×5 + 10/1M×25 = 0,00175 USD. Trecând la Haiku, 300/1M×1 + 10/1M×5 = 0,00035 USD — de 5 ori mai ieftin, diferența de precizie a fost incomensurabilă. La 3 milioane de apeluri pe lună, diferența este de 5.250 USD → 1.050 USD.
Cazul 3 — Eliberarea ieșirii. Când o echipă de marketing a produs o descriere a produsului, nu a stabilit nicio limită de producție; modelul spunea uneori 1.500 de jetoane. Când am adăugat instrucțiunea „60 de cuvinte maximum”, producția medie a scăzut de la 900 la 90 de jetoane. Deoarece tipărirea era costisitoare, factura lunară a fost redusă cu o treime, iar textele au devenit mai utile.
Greșeli comune
- Ghicirea simbolului cu ochiul: puteți greși mai ales în turcă și cod. Măsură.
- Presupunând că intrarea și ieșirea sunt aceleași: ieșirea este de obicei mult mai scumpă; Cea mai mare parte a optimizării provine din scurtarea producției.
- Nu vă lăsați păcăliți de ieftinitatea unui singur apel: decizia se ia în volum. 0,01 $ × milion = 10.000 $.
- Predicție cu tokenizer al altui furnizor: Oferă rezultate incorecte; Utilizați instrumentul de numărare a jetoanelor modelului.
- Mărire nelimitată a istoricului conversațiilor: Fiecare rundă este adăugată la intrare; rezumați în conversații lungi.
- Menținerea `max_tokens` inutil de mare: ascunde planul bugetar și riscul de a fi tăiat; Oferiți o valoare realistă.
Mai profund: fereastră de context și cost lung de intrare
Este esențial să vedem cum se ridică prețul „pe parcursul conversației” și nu doar „pe cerere”. Cantitatea totală de text pe care modelul o poate procesa se numește fereastra de context; Suma de intrare și de ieșire trebuie să se încadreze în această fereastră. Modelele moderne oferă ferestre foarte mari (sute de mii, chiar milioane de jetoane), dar asta nu înseamnă că poți „umple la infinit” – orice ai pune în fereastră este facturat ca intrare.
Capcana în conversațiile lungi este aceasta: cu fiecare nouă rundă trimiteți din nou întreaga istorie (apatridie în unitatea 1). Într-o conversație de 20 de runde, a 20-a cerere poartă toate primele 19 runde ca intrare. Astfel, pe măsură ce conversația devine mai lungă, costul pe cerere crește mai degrabă cumulativ decât liniar. O conversație de 50 de runde cu un asistent de agent poate produce costuri de intrare de zeci de ori în prima rundă.
Există două moduri de a gestiona acest lucru. Primul este recapitularea: comprimarea rundelor mai vechi într-un singur bloc de recapitulare, păstrând doar ultimele runde brute. Al doilea este memorarea în cache promptă (unitatea 6): citirea contextului fix la o zecime din preț în loc să-l proceseze în mod repetat la prețul complet. Împreună, reduc în mod semnificativ factura pentru sarcinile de lucru lungi, intense în context. Deci, economia simbolului se referă la proiectarea întregii sesiuni, nu la o singură cerere.
Pe scurt
Tokenul este cea mai mică unitate în care este procesat textul; intrarea și ieșirea sunt evaluate separat, iar producția este adesea mult mai scumpă. Costul este numărul de jetoane înmulțit cu prețul unitar, iar decizia reală este luată în funcție de volum. Scurtarea promptului, limitarea randamentului și alegerea celui mai ușor model care îndeplinește sarcina sunt pârghiile cele mai directe care reduc costul de mai multe ori.
Sarcina de aplicare
Alegeți o sarcină proprie. (1) Determinați numărul de jetoane de intrare și de ieșire estimate pentru un prompt reprezentativ (măsurați cu un instrument de numărare a jetoanelor, dacă este posibil). (2) Calculați costul pe cerere pentru cele trei clase de model. (3) Estimați numărul zilnic de solicitări și obțineți bugetul lunar pentru cele trei modele. (4) Adăugați o instrucțiune pentru a scurta rezultatul și notați economiile așteptate.
lista de verificare
- [ ] Pot explica conceptul de jetoane și că tokenizarea variază în funcție de model.
- [ ] Știu de ce jetoanele de intrare și de ieșire au prețuri diferite.
- [ ] Pot calcula costul unei cereri cu formula.
- [ ] Pot crea un buget lunar pentru un volum de lucru folosind un șablon.
- [ ] Pot arăta cu un exemplu beneficiul scurtării producției și reducerii modelului.