Yunit 6 / 10

Lohika ng Pagpepresyo: Token Economy at Cost-Quality Balance

Mga nadagdag:

  • Kakayahang basahin ang input/output token pricing at invoice item
  • Kakayahang tantyahin ang buwanang gastos ng isang daloy ng trabaho gamit ang isang magaspang na formula
  • Pagpapatupad ng mga pamamaraan sa pagtitipid tulad ng pag-cache, pagproseso ng batch, at pagtatanghal ng modelo

Ang kakayahang matantya kung magkano ang magagastos ng isang modelo ay isa sa mga pinakapraktikal na kasanayan ng gumagawa ng desisyon. "Ano ang babayaran ko buwan-buwan?" Kung hindi mo masagot ang tanong, hindi ka maaaring magplano ng badyet o pumili ng tamang antas. Ang magandang balita ay ang pagpepresyo ay mas simple kaysa sa tila, at kapag nakuha mo na ito maaari kang gumawa ng magaspang na pagtatantya sa iyong sarili. Sa unit na ito, matututunan mo kung paano basahin ang pagpepresyo ng input/output token, tantyahin ang buwanang gastos ng isang daloy ng trabaho gamit ang isang simpleng formula, at mga pamamaraan na talagang nagpapababa sa gastos.

Rule of thumb: Ang input at output ay magkahiwalay na presyo

Sa mga closed-weight na modelo, ang presyo ay kinakalkula batay sa dami ng mga token na naproseso at mayroong dalawang magkahiwalay na item:

  • Input token (input): Ang text na ipinadala mo sa modelo. Ang iyong prompt, ang iyong mga dokumento, ang iyong mga sample.
  • Output token: Ang sagot na ginawa ng modelo para sa iyo.

Kritikal na punto: Ang output token ay madalas na ilang beses na mas mahal kaysa sa input token. Ito ay dahil ito ay computationally mas magastos sa modelo upang makabuo ng output. Halimbawa, sa isang modelo, ang input ay maaaring $3 bawat milyong token habang ang output ay maaaring $15; Kaya ang output ay limang beses na mas mahal. Nangangahulugan ito na ang mahaba at hindi kinakailangang mga sagot ay mabilis na makakain sa badyet.

Tip: Isa sa mga pinakamadaling paraan upang mabawasan ang gastos ay ang hindi pagtatanong sa modelo ng hindi kinakailangang mahabang sagot. Ang mga paghihigpit gaya ng "maximum 5 articles", "solong paragraph", "export only the table" ay nagpapataas ng kalidad at nag-save ng output token.

Mga Halimbawa ng Kasalukuyang Presyo

Nasa ibaba ang mga tinatayang presyo ng ilang modelo (bawat milyong token, US dollars). Ang mga halagang ito ay nabibilang sa panahon kung saan ang modyul na ito ay inihanda at madalas na nagbabago; Tingnan ang kasalukuyang page ng presyo ng provider para sa eksaktong desisyon.

modelo

entablado

Input $/1M

Output $/1M

Claude Opus 4.8

malakas

~5

~25

Claude Sonnet 5

balanse

~3

~15

Claude Haiku 4.5

magaan ang timbang

~1

~5

Gaya ng nakikita sa talahanayan, maaaring magkaroon ng pagkakaiba sa presyo ng hanggang limang beses sa pagitan ng malakas na tier at ng light tier. Iyon ang dahilan kung bakit ang "fittest model for all business" approach ay kadalasang isang pag-aaksaya ng pera. Ang pagkakaroon ng simpleng gawain na ginawa ng isang murang modelo at ang mahirap na trabaho ng isang makapangyarihang modelo ay nagbibigay ng mahusay na pagtitipid nang walang pagkawala ng kalidad. Palalimin natin ang ideyang ito sa mga yunit 7 at 9.

Pagtatantya ng Buwanang Gastos: Simpleng Formula

Para sa isang magaspang na buwanang pagtatantya ng gastos, maaari mong gamitin ang formula na ito:

Buwanang gastos ≈ (Bilang ng mga kahilingan bawat buwan × Average na input token × Input na presyo / 1,000,000)+ (Bilang ng mga kahilingan bawat buwan × Average na output token × Output na presyo / 1,000,000)

Magpatakbo tayo ng isang halimbawa. Sabihin nating ang isang e-commerce team ay gumagawa ng 50,000 paglalarawan ng produkto bawat buwan. Ang bawat kahilingan ay nagpapadala ng average na 500 token ng input (impormasyon ng produkto) at tumatanggap ng 300 token ng output (paglalarawan). Sa isang balanseng modelo (input ~3, output ~15):

  • Gastos sa pag-input: 50,000 × 500 × 3 / 1,000,000 = $75
  • Gastos ng output: 50,000 × 300 × 15 / 1,000,000 = $225
  • Kabuuan ≈ $300/buwan

Kung ginawa nila ang parehong trabaho sa isang magaan na modelo (input ~1, output ~5):

  • Input: 50,000 × 500 × 1 / 1,000,000 = $25
  • Output: 50,000 × 300 × 5 / 1,000,000 = $75
  • Kabuuan ≈ $100/buwan

Kaya ang pagpili lang sa entablado ay maaaring mabawasan ang parehong trabaho mula $300 hanggang $100. Para sa isang medyo simpleng gawain tulad ng isang paglalarawan ng produkto, ang magaan na modelo ay kadalasang higit pa sa sapat.

Mag-ingat: Ang formula na ito ay isang magaspang na pagtatantya; ang aktwal na pagsingil ay nag-iiba ayon sa mga salik gaya ng paggamit ng cache, muling pagsubok, at mode ng pangangatwiran. Gayunpaman, isa itong napakagandang simula para sa pagkuha ng kumpirmasyon sa badyet o paghahambing ng dalawang modelo. Pinakamainam na sukatin ang tunay na numero gamit ang isang maliit na piloto bago gumawa ng desisyon.

Limang Paraan para Bawasan ang Gastos

  1. Piliin ang tamang antas. Simple, magaan na modelo. Ito ang nag-iisang pinakamalaking pinagmumulan ng pagtitipid.
  2. Gawing mas maliit ang input. Sa halip na punan ang malalaking dokumento para sa bawat kahilingan, ipadala lamang ang nauugnay na seksyon (pag-optimize ng konteksto sa unit 5).
  3. Limitahan ang output. Linawin ang haba at pormat ng sagot; Hindi kinakailangang mahabang sagot = hindi kinakailangang gastos.
  4. Gumamit ng caching. Many providers allow you to cache and re-read repeated fixed inputs (e.g. the same system instruction) much cheaper. Nagbibigay ito ng makabuluhang pagtitipid kung nagpapadala ka ng parehong malaking tagubilin nang libu-libong beses.
  5. Magsagawa ng batch processing. Kung hindi ka nagmamadali, ang mga "batch" na opsyon, na nagpapadala ng maraming kahilingan nang maramihan at nagpoproseso sa mga ito nang may diskwento, ay makabuluhang bawasan ang gastos.

Tatlong Makatotohanang Kaso

Kaso 1 — Mga pagtitipid na may pagbabago sa hakbang. Binubuod ng isang customer service team ang lahat ng papasok na email gamit ang pinakamalakas na modelo, at ang kanilang buwanang singil ay ~$900. Ang pagbubuod ay isang simpleng gawain; Nang lumipat sila sa balanseng tier, nanatiling halos pareho ang kalidad ng output, ngunit bumaba ang bill sa ~$250. Savings ~$7,800 bawat taon, sa pamamagitan lamang ng pagpili ng tamang tier.

Case 2 — Pag-save gamit ang cache. Ang isang software team ay nagpapadala ng parehong 8,000 token na "coding standards" na dokumento sa bawat kahilingan sa pagsusuri ng code. 400 kahilingan bawat araw × 8,000 token = malaking paulit-ulit na input. Nang i-on nila ang tampok na cache, ang nakapirming partisyon na ito ay nagsimulang basahin nang mas mura at nawala ang isang makabuluhang bahagi ng mga gastos sa pag-input.

Case 3 — Pagtitipid sa pamamagitan ng paglilimita sa output. Nang humingi ang isang marketing team para sa isang paglalarawan ng produkto, ang modelo ay gumawa ng mahaba at mabulaklak na mga talata sa isang pagkakataon. Noong idinagdag nila ang "maximum 60 words, single paragraph" na paghihigpit, ang mga paliwanag ay naging mas kapaki-pakinabang at ang output token ay nahati. Habang tumaas ang kalidad, bumaba ang gastos; manalo-manalo.

Mahina Prompt / Malakas na Prompt

Mahinang prompt:

Sumulat sa akin ng magandang paglalarawan para sa produktong ito. [impormasyon ng produkto]

Ang modelo ay maaaring magsulat hangga't gusto niya; Ang output token ay hindi nakokontrol.

Napakahusay na prompt:

Ang iyong tungkulin: e-commerce copywriter. Produkto: [IMPORMASYON]. Gawain: Sumulat ng paglalarawan ng produkto. Mga Paghihigpit: Maximum na 60 salita, isang talata, apela sa mga hindi teknikal na customer, naglalaman ng 2 benepisyo + 1 use case. Iwasan ang magarbong adjectives.

Kinokontrol ng malakas na prompt ang parehong kalidad at haba ng output (at samakatuwid ay gastos).

Mga Kopyadong Template

1. Buwanang pagtatantya ng gastos:

Gumagawa ako ng [QUANTITY] mga kahilingan buwan-buwan. Average na input ~[NUM] token, output ~[NUM] token. Kalkulahin ang buwanang gastos para sa mga sumusunod na modelo ([MODEL A], [MODEL B]) gamit ang formula at ihambing sa isang talahanayan. Tanggapin ang mga presyo ng input/output [PRICES].

Paghahambing ng Tier 2:

Ang aking tungkulin [TASK]. Nangangailangan ba talaga ang trabahong ito ng makapangyarihang modelo, o sapat ba ang magaan/balanseng modelo? Suriin sa mga tuntunin ng kalidad at gastos at magmungkahi ng 2 tier para sa akin sa pilot test.

3. Pagsusuri sa pagbabawas ng gastos:

Tukuyin ang mga paraan upang bawasan ang gastos sa sumusunod na daloy ng trabaho: [WORKFLOW]. Sumulat ng pagiging posible at tinantyang mga matitipid para sa bawat isa sa cascade, pagbabawas ng input, output bound, cache, at mga header ng pagproseso ng batch.

4. Limitasyon sa output:

Isulat muli ang sumusunod na prompt upang bawasan ang output token nang hindi binabawasan ang kalidad: "[PROMPT]". Mag-optimize para sa haba, format at hindi kinakailangang pag-uulit.

Mga karaniwang pagkakamali

  • Nilaktawan ang pagkakaiba sa input/output: Pagpapahintulot sa mahahabang sagot nang hindi nalalaman na mas mahal ang output.
  • Ang pinakamakapangyarihang modelo para sa bawat trabaho: Gumagawa ng isang simpleng trabaho gamit ang isang mamahaling modelo at nagbabayad ng maraming beses nang hindi kinakailangan.
  • Pagpapalabas ng haba ng output: Pagbibigay ng walang limitasyong pahintulot sa pagsulat sa modelo nang hindi nagpapataw ng anumang format o mga paghihigpit sa haba.
  • Hindi pinapansin ang cache at batch: Nawawala ang mga seryosong pagkakataon sa pagtitipid para sa mga paulit-ulit na input at hindi agarang gawain.
  • Iniisip na ang mga presyo ay napapanahon: Umaasa sa isang lumang talahanayan ng presyo at hindi tama ang pagpaplano ng badyet; ang mga presyo ay madalas na nagbabago.

Sa buod

  • Ang presyo ay kinakalkula batay sa mga token; magkahiwalay ang presyo ng input at output, at madalas na ilang beses na mas mahal ang output.
  • Maaari mong halos tantiyahin ang buwanang gastos sa pamamagitan ng formula na bilang ng mga kahilingan × average na token × presyo.
  • Ang tamang pagpili ng hakbang lamang ay maaaring mabawasan ang gastos nang maraming beses.
  • Ang pag-minimize ng input, paglilimita sa output, pag-cache at pagpoproseso ng batch ay mga praktikal na paraan na makabuluhang nagpapababa sa singil.

Gawain ng aplikasyon

Kunin ang mga halaga ng token na iyong tinantya sa nakaraang yunit. Ipakalkula ang buwanang gastos ng iyong negosyo para sa dalawang magkaibang antas na may template 1 sa unit na ito (buwanang pagtatantya ng gastos). Pagkatapos, gamit ang ika-3 template (pag-scan sa pagbabawas ng gastos), alamin kung magkano ang matitipid na maidudulot ng bawat paraan sa iyong daloy ng trabaho. Magplanong piliin ang dalawang pinaka-maaasahan na paraan at ilapat ang mga ito sa iyong badyet sa susunod na buwan.

checklist

  • [ ] Alam kong magkahiwalay ang presyo ng input at output token at mas mahal ang output.
  • [ ] Halos matantya ko ang buwanang gastos ng isang daloy ng trabaho gamit ang simpleng formula.
  • [ ] Maaari kong ipakita ang epekto sa gastos ng pagpili ng tamang antas na may isang halimbawa.
  • [ ] Nakikilala ko ang limang paraan ng pagbabawas ng gastos at piliin ang naaangkop.
  • [ ] Maaari akong muling magsulat ng prompt upang bawasan ang output token.