Fitimet:
- Shpjegoni konceptin e tokenit, dallimit të shenjave hyrëse/dalëse dhe tokenizimit.
- Mund të llogarisë koston e një kërkese dhe ngarkesën mujore nga numri i argumenteve dhe çmimi i njësisë
- Mund të krahasojë ndikimin e zgjedhjes së modelit dhe gjatësisë së shpejtë në kosto
Ju nuk mund të ndërtoni një zgjidhje në shkallë pa kuptuar ekonominë e API-ve LLM. Një demonstrim ekzekutohet një herë; Gjëja kryesore është të jesh në gjendje të parashikosh se cila do të jetë fatura kur të bëhen mijëra telefonata në muaj. Në këtë njësi ne vendosim anën e parave të gjërave: çfarë është një shenjë, pse inputet dhe outputet kanë çmime të ndryshme, si të llogaritet kostoja e një kërkese dhe si të buxhetohet një ngarkesë mujore. Ky informacion ju lejon të matni kthimin e teknikave të optimizimit (caching, përzgjedhja e modelit, grupi) në njësitë pasuese.
Çfarë është Token?
Token është njësia më e vogël në të cilën modeli përpunon tekstin. Një fjalë nuk është gjithmonë një shenjë; token është zakonisht një pjesë e një fjale. Përafërsisht, në anglisht, 1 shenjë është ≈ 4 karaktere ≈ 0,75 fjalë. Në turqisht dhe në kod, raporti ndryshon: fjalët turke shpesh ndahen në më shumë shenja sesa në anglisht për shkak të strukturës dhe alfabetit të prapashtesës. Prandaj, është e nevojshme të matet numri i shenjave me mjetin e numërimit të shenjave të ofruesit në vend që të hamendësohet me sy.
Tokenizimi (procesi i ndarjes së tekstit në token) mund të jetë i ndryshëm për secilin model. Kjo ka dy pasoja praktike: (1) I njëjti tekst mund të japë numra të ndryshëm argumentesh në modele të ndryshme; (2) Parashikimet e bëra me tokenizues nga ofruesit e tjerë (p.sh. biblioteka tiktoken e OpenAI) do të jenë të pasakta për Claude - përdorni këshillën e numërimit të tokenit për modelin që po përdorni.
Këshillë: "Rreth sa argumente?" Mos iu përgjigj pyetjes verbërisht. Kaloni një tekst përfaqësues përmes API-së së numërimit të shenjave; Bazë vendimet buxhetore në matje.
Shenjat hyrëse dhe dalëse
Fatura përbëhet nga dy artikuj:
- Shenjat e hyrjes: Çdo gjë që i dërgoni modelit - kërkesa e sistemit, udhëtimet e kaluara, mesazhi i përdoruesit, dokumentacioni nëse ka. Këto përpunohen të gjitha përnjëherë.
- Shenjat e daljes: Përgjigja e prodhuar nga modeli. Për çdo shenjë dalëse, modeli kryen llogaritjen hap pas hapi.
Me shumicën e ofruesve, prodhimi është disa herë më i shtrenjtë se hyrja. Arsyeja është e thjeshtë: leximi i hyrjes të gjitha përnjëherë është më i lirë se prodhimi i daljes shenjë për shenjë. Njohja e kësaj asimetrie shpjegon pse optimizimet si "kërkojnë përgjigje koncize" janë kaq efektive.
Çmimet e mostrës (për 1 milion argumente, USD)
Tabela e mëposhtme është një referencë; Çmimet mund të ndryshojnë me kalimin e kohës, ju lutemi konfirmoni listën aktuale të ofruesit tuaj.
klasë model
model model
Hyrja ($/1 milion)
Prodhimi ($/1 milion)
Përdorimi tipik
i shpejtë / i lirë
Haiku 4.5
1.00
5.00
Klasifikimi, etiketimi, përmbledhja e thjeshtë
i balancuar
sonet 5
3.00
15.00
Qëllimi i përgjithshëm, kodimi, puna e agjentit
të fortë
Opus 4.8
5.00
25.00
Arsyetim kompleks, detyra me rreze të gjatë
Në çdo klasë, prodhimi është 5 herë më i madh se hyrja; Për më tepër, edhe inputi i modelit të fuqishëm është 5 herë më i madh se ai i modelit të lirë. Këto dy akse (input↔output dhe klasa model) formojnë kornizën e vendimeve tuaja për koston.
Si të llogarisni koston?
Formula është e thjeshtë:
kosto = (token_hyrës / 1,000,000) × çmimi_hyrës + (token_dalje / 1,000,000) × çmimi_dalje
Shembull i llogarisë. Një kërkesë me Sonet 5: 1500 argumente hyrëse, 400 shenja dalëse.
hyrje = 1,500 / 1,000,000 × 3,00 = 0,0045 dollarë prodhimi = 400 / 1,000,000 × 15,00 = 0,0060 dollarë gjithsej = 0,0105 dollarë (rreth 1 cent)
Një telefonatë duket e lirë. Por shumëzojeni me vëllim: 20,000 telefonata në ditë → 210 dollarë në ditë, ~ 6,300 dollarë në muaj. Këtu hyn në lojë shkalla.
Modeli i buxhetit mujor
Për të nxjerrë koston mujore të një ngarkese pune, përdorni këtë shabllon:
1) Shenja mesatare e hyrjes për kërkesë: ......2) Shenja mesatare e daljes për kërkesë: ......3) Numri i kërkesave në ditë: ......4) Ditët e punuara në muaj: ......5) Kostoja për kërkesë = (1)/1M×çmimi_hyrës + (2)/1M×çmimi_dalës6) Kostoja mujore = (5) × (4)
Derdhja e këtij modeli në një fletëllogaritëse dhe shikimi se si del shuma kur ndryshoni modelin, mishëron vendimet e zgjedhjes së modelit (njësia 5) dhe e memories (njësia 6).
Shkurtimi i kërkesës me modele të kopjueshme
Pjesa më e madhe e kostos vjen nga kërkesat e panevojshme të gjata dhe prodhimi i humbur. Modelet e mëposhtme ofrojnë kursime të drejtpërdrejta.
# Kufizoni gjatësinë e daljes. Përgjigjuni me maksimum 3 artikuj. Shtoni një arsyetim ose fjali hyrëse.
# Ktheje vetëm fushën e kërkuar Ktheje vetëm JSON-in e mëposhtëm, mos shtoni asnjë tekst tjetër:{"category": "...", "urgency": "i ulët|mesatar|i lartë"}
# Hiq kontekstin e panevojshëm Hiq vetëm datën dhe shumën nga teksti i mëposhtëm. Mos e përsëritni të gjithë tekstin. Teksti: """{{text}}"""
# Përmblidhni fjalimin e gjatë (ruajtja e hyrjes) Përmblidheni këtë fjalim në 5 artikuj. Unë do ta përdor këtë përmbledhje në vend të të kaluarës së plotë në raundet pasuese. Fjalimi: """{{past}}"""
Prompt i dobët / Prompt i fortë (për sa i përket kostos)
# I DOBËT (lëshon rezultatin, i shtrenjtë) Analizoni këtë kërkesë për mbështetje dhe më shkruani një përmbledhje gjithëpërfshirëse.
# I FORTË (kufizon prodhimin, i lirë dhe i parashikueshëm) Klasifiko këtë kërkesë për mbështetje. Thjesht ktheni JSON-in e mëposhtëm:{"category":"faturë|teknike|rimbursim|tjetër","urgency":"low|mesatar|i lartë"}Mos shkruani një përshkrim.
Versioni i dobët prodhon ndoshta 500 shenja dalëse; version i fortë ~ 15. Për shkak se prodhimi është i shtrenjtë, ky është një ndryshim domethënës për thirrje dhe shumëfishohet me volumin.
Tre Mini Rastet
Rasti 1 - Kostoja e fshehur e kërkesës së gjatë. Ndërsa një automatizimi i kontabilitetit renditi çdo faturë, shtoi një "libër rregullash" me 40 faqe si hyrje për secilën kërkesë: ~ 12,000 shenja hyrëse për kërkesë. Me Sonet 5 12,000/1M×3 = 0,036$ sapo keni hyrë. 5000 fatura në ditë → 180 dollarë në ditë. Me ruajtjen e rregullores (njësia 6) kostoja e hyrjes ra me ~90%.
Rasti 2 - Shpërblimi i zvogëlimit të modelit. Një ekip po bënte etiketim të thjeshtë të ndjenjave "pozitive/negative" me Opus 4.8: 300 hyrje + 10 shenja dalëse. Kostoja e opusit 300/1M×5 + 10/1M×25 = 0,00175 dollarë. Duke kaluar në Haiku, 300/1M×1 + 10/1M×5 = 0,00035 dollarë — 5 herë më lirë, diferenca në saktësi ishte e pamatshme. Në 3 milionë telefonata në muaj, diferenca është 5,250 dollarë → 1,050 dollarë.
Rasti 3 - Lëshimi i prodhimit. Kur një ekip marketingu prodhoi një përshkrim produkti, ai nuk vendosi kufizime për produktin; modeli ndonjëherë thoshte 1500 argumente. Kur shtova udhëzimin "60 fjalë maksimale", prodhimi mesatar ra nga 900 në 90 shenja. Meqenëse printimi ishte i shtrenjtë, fatura mujore u ul me një të tretën dhe tekstet u bënë më të dobishme.
Gabimet e zakonshme
- Marrja me mend e shenjës me sy: Mund të gaboni veçanërisht në turqisht dhe kod. Masa.
- Duke supozuar se inputi dhe outputi janë të njëjta: Outputi zakonisht është shumë më i shtrenjtë; Shumica e optimizimit vjen nga shkurtimi i prodhimit.
- Mos u mashtroni nga liria e një telefonate të vetme: Vendimi merret nga vëllimi. 0,01 $ × milion = 10,000 $.
- Parashikimi me tokenizuesin e një ofruesi tjetër: Jep rezultate të pasakta; Përdorni mjetin e numërimit të shenjave të modelit.
- Zgjerim i pakufizuar i historisë së bisedave: Çdo raund i shtohet hyrjes; përmbledh në biseda të gjata.
- Mbajtja e "max_tokens" në mënyrë të panevojshme të larta: Fsheh planin e buxhetit dhe rrezikun për t'u shkurtuar; Jepni një vlerë realiste.
Më e thellë: Dritarja e kontekstit dhe kostoja e gjatë e hyrjes
Është kritike të shihet se si rritet çmimi "përgjatë bisedës" dhe jo vetëm "për kërkesë". Sasia totale e tekstit që modeli mund të përpunojë quhet dritarja e kontekstit; Shuma e hyrjes dhe daljes duhet të përshtatet në këtë dritare. Modelet moderne ofrojnë dritare shumë të mëdha (qindra mijëra, madje edhe miliona argumente), por kjo nuk do të thotë që ju mund ta "mbushni pafundësisht" - çdo gjë që vendosni në dritare faturohet si hyrje.
Kurthi në bisedat e gjata është ky: me çdo raund të ri ju dërgoni përsëri të gjithë historinë (pashtetësia në njësinë 1). Në një bisedë prej 20 raundesh, kërkesa e 20-të mbart të gjitha 19 raundet e para si hyrje. Kështu, ndërsa biseda zgjatet, kostoja për kërkesë rritet në mënyrë kumulative dhe jo lineare. Një bisedë prej 50 raundesh me një asistent agjenti mund të prodhojë kosto të dhënash dhjetëra herë më shumë se raundi i parë.
Ka dy mënyra për ta menaxhuar këtë. E para është përmbledhja: ngjeshja e raundeve të vjetra në një bllok të vetëm përmbledhës, duke i mbajtur vetëm raundet e fundit të papërpunuara. E dyta është memoria e shpejtë (njësia 6): leximi i kontekstit fiks me një të dhjetën e çmimit në vend që të përpunohet vazhdimisht me çmimin e plotë. Së bashku, ato reduktojnë ndjeshëm faturën për ngarkesat e gjata dhe intensive të punës. Pra, ekonomia simbolike ka të bëjë me hartimin e të gjithë sesionit, jo një kërkesë të vetme.
Në përmbledhje
Token është njësia më e vogël në të cilën përpunohet teksti; inputi dhe outputi vlerësohen veçmas, dhe outputi shpesh është shumë më i shtrenjtë. Kostoja është numri i argumenteve të shumëzuar me çmimin e njësisë, dhe vendimi real merret nga vëllimi. Shkurtimi i kërkesës, kufizimi i prodhimit dhe zgjedhja e modelit më të lehtë që përmbush detyrën janë levat më të drejtpërdrejta që ulin koston shumë herë.
Detyra e aplikimit
Zgjidhni një detyrë tuajën. (1) Përcaktoni numrin e shenjave hyrëse dhe të vlerësuara të daljes për një kërkesë përfaqësuese (masë me një mjet numërimi token nëse është e mundur). (2) Llogaritni koston për kërkesë për tre klasat e modelit. (3) Vlerësoni numrin tuaj ditor të kërkesave dhe nxirrni buxhetin mujor për të tre modelet. (4) Shtoni një udhëzim për të shkurtuar prodhimin dhe për të shënuar kursimet e pritshme.
listë kontrolli
- [ ] Unë mund të shpjegoj konceptin e argumenteve dhe se tokenizimi ndryshon në varësi të modelit.
- [ ] Unë e di pse shenjat hyrëse dhe dalëse kanë çmime të ndryshme.
- [ ] Unë mund të llogaris koston e një kërkese me formulën.
- [ ] Mund të krijoj një buxhet mujor për një ngarkesë pune duke përdorur një shabllon.
- [ ] Mund të tregoj me një shembull përfitimin e shkurtimit të prodhimit dhe reduktimit të modelit.