Печалби:
- Обяснете концепцията за токен, разграничаване на входно/изходни токени и токенизация.
- Може да изчисли цената на заявка и месечното натоварване от броя токени и единичната цена
- Може да сравни влиянието на избора на модел и бързата дължина върху разходите
Не можете да създадете решение в мащаб, без да разбирате икономиката на LLM API. Демонстрацията се изпълнява веднъж; Основното нещо е да можете да предвидите каква ще бъде сметката, когато се правят хиляди разговори на месец. В този раздел ние настройваме паричната страна на нещата: какво е токен, защо входът и изходът се оценяват по различен начин, как да се изчисли цената на заявка и как да се планира месечното натоварване. Тази информация ви позволява да измервате връщането на техниките за оптимизация (кеширане, избор на модел, партида) в следващите единици.
Какво е Токен?
Token е най-малката единица, в която моделът обработва текст. Една дума не винаги е знак; токенът обикновено е част от дума. Грубо казано, на английски 1 токен е ≈ 4 знака ≈ 0,75 думи. В турския и кода съотношението варира: турските думи често се разделят на повече токени, отколкото в английския, поради структурата на суфиксите и азбуката. Следователно е необходимо да се измери броят на токените с инструмента за броене на токени на доставчика, вместо да се гадае на око.
Токенизацията (процесът на разделяне на текст на токени) може да е различен за всеки модел. Това има две практически последици: (1) Един и същ текст може да даде различен брой токени в различни модели; (2) Прогнозите, направени с токенизатори от други доставчици (напр. tiktoken библиотеката на OpenAI), ще бъдат неточни за Клод — използвайте съвета за броене на токени за модела, който използвате.
Подсказка: "Приблизително колко токена?" Не отговаряйте на въпроса сляпо. Прекарайте представителен текст през API за броене на токени; Базирайте бюджетните решения на измерване.
Входни и изходни токени
Фактурата се състои от два елемента:
- Входящи токени: Всичко, което изпратите на модела — системна подкана, минали обиколки, потребителско съобщение, документация, ако има такава. Те се обработват всички наведнъж.
- Изходни жетони: Отговорът, произведен от модела. За всеки изходен токен моделът извършва изчислението стъпка по стъпка.
При повечето доставчици изходът е няколко пъти по-скъп от входа. Причината е проста: четенето на входа наведнъж е по-евтино от генерирането на изходния токен по токен. Познаването на тази асиметрия обяснява защо оптимизации като „изискват кратки отговори“ са толкова ефективни.
Примерни цени (за 1 милион токени, USD)
Таблицата по-долу е референтна; Цените може да се променят с времето, моля, потвърдете текущия списък на вашия собствен доставчик.
модел клас
примерен модел
Вход ($/1 млн.)
Резултат ($/1 млн.)
Типична употреба
бързо/евтино
Хайку 4.5
1,00
5.00
Класификация, етикетиране, просто резюме
балансиран
сонет 5
3.00
15.00 часа
Обща цел, кодиране, агентска работа
силен
Опус 4.8
5.00
25.00 часа
Сложни разсъждения, дългосрочни задачи
Във всеки клас изходът е 5 пъти по-голям от входа; Нещо повече, дори входът на мощния модел е 5 пъти повече от входа на евтиния модел. Тези две оси (вход↔изход и клас на модела) формират рамката на вашите решения за разходите.
Как да изчислим разходите?
Формулата е проста:
цена = (input_token / 1 000 000) × input_price + (output_token / 1 000 000) × output_price
Примерна сметка. Заявка със Сонет 5: 1500 входни токена, 400 изходни токена.
вход = 1,500 / 1,000,000 × 3,00 = $0,0045 изход = 400 / 1,000,000 × 15,00 = $0,0060 общо = $0,0105 (около 1 цент)
Едно обаждане изглежда евтино. Но умножете по обем: 20 000 обаждания на ден → $210 на ден, ~$6300 на месец. Тук мащабът влиза в действие.
Шаблон за месечен бюджет
За да извлечете месечните разходи за натоварване, използвайте този шаблон:
1) Среден входен токен на заявка: ......2) Среден изходен токен на заявка: ......3) Брой заявки на ден: ......4) Работени дни на месец: ......5) Цена на заявка = (1)/1M×input_price + (2)/1M×output_price6) Месечна цена = (5) × (3) × (4)
Изливането на този модел в електронна таблица и виждането как се разиграва сумата, когато промените модела, въплъщава решенията за избор на модел (единица 5) и кеша (единица 6).
Съкращаване на подканата с копируеми шаблони
По-голямата част от разходите идват от ненужно дълги подкани и пропилян резултат. Шаблоните по-долу осигуряват директни спестявания.
# Ограничете изходната дължина. Отговорете с максимум 3 елемента. Добавете обосновка или уводно изречение.
# Върни само заявеното поле Върни само следния JSON, не добавяй друг текст:{"category": "...", "urency": "low|medium|high"}
# Премахнете ненужния контекст Премахнете само датата и сумата от следния текст. Не повтаряйте целия текст. Текст: """{{text}}"""
# Обобщете дългата реч (запаметяване на въведеното) Обобщете тази реч в 5 елемента. Ще използвам това резюме вместо пълното минало в следващите кръгове. Реч: """{{past}}"""
Слаба подкана/Силна подкана (по отношение на разходите)
# СЛАБ (пуска изход, скъп) Анализирайте тази заявка за поддръжка и ми напишете изчерпателен преглед.
# СИЛЕН (ограничава изхода, евтин и предвидим) Класифицирайте тази заявка за поддръжка. Просто върнете следния JSON:{"category":"invoice|technical|refund|other","urency":"low|medium|high"}Не пишете описание.
Слабата версия произвежда може би 500 изходни токена; силна версия ~15. Тъй като изходът е скъп, това е значителна разлика за повикване и се умножава с обема.
Три мини калъфа
Случай 1 — Скритата цена на дългата подкана. Тъй като автоматизацията на счетоводството сортира всяка фактура, тя добави „книга с правила“ от 40 страници като вход към всяка заявка: ~12 000 жетона за въвеждане на заявка. Със сонет 5 12 000/1M×3 = току-що въведени $0,036. 5000 сметки на ден → $180 на ден. Чрез кеширане на книгата с правила (единица 6) входната цена спадна с ~90%.
Случай 2 — Печалбата от намаляването на модела. Един екип правеше просто маркиране на „положително/отрицателно“ настроение с Opus 4.8: 300 входа + 10 изхода. Opus струва 300/1M×5 + 10/1M×25 = $0,00175. Преминавайки към Haiku, 300/1M×1 + 10/1M×5 = $0,00035 — 5 пъти по-евтино, разликата в точността беше неизмерима. При 3 милиона обаждания на месец разликата е $5,250 → $1,050.
Случай 3 — Освобождаване на изхода. Когато маркетинговият екип създаде описание на продукта, той не постави ограничения за продукцията; моделът понякога казваше 1500 токена. Когато добавих инструкцията „максимум 60 думи“, средният изход спадна от 900 на 90 символа. Тъй като печатът беше скъп, месечната сметка беше намалена с една трета и текстовете станаха по-полезни.
Често срещани грешки
- Познаване на лексемата по око: Може да сгрешите, особено в турския и кода. Измерете.
- Ако приемем, че входът и изходът са еднакви: Изходът обикновено е много по-скъп; По-голямата част от оптимизацията идва от съкращаване на изхода.
- Не се заблуждавайте от евтиността на едно обаждане: решението се взема според обема. $0,01 × милион = $10 000.
- Прогноза с токенизатор на друг доставчик: Дава неправилни резултати; Използвайте инструмента за броене на токени на модела.
- Неограничено разширяване на историята на разговорите: Всеки кръг се добавя към записа; обобщават в дълги разговори.
- Поддържане на `max_tokens` ненужно високо: Скрива бюджетния план и риска от съкращаване; Дайте реалистична стойност.
По-дълбоко: контекстен прозорец и дълги входни разходи
Изключително важно е да видите как цената се натрупва „в целия разговор“, а не само „на заявка“. Общото количество текст, което моделът може да обработи, се нарича контекстен прозорец; Сумата от входа и изхода трябва да се побере в този прозорец. Модерните модели предлагат много големи прозорци (стотици хиляди, дори милиони токени), но това не означава, че можете да го „пълните безкрайно“ — каквото и да поставите в прозореца, се таксува като вход.
Капанът в дългите разговори е следният: с всеки нов кръг изпращате отново цялата история (без гражданство в блок 1). В разговор от 20 кръга, 20-тата заявка носи всичките първи 19 кръга като вход. По този начин, когато разговорът става по-дълъг, цената на заявка расте кумулативно, а не линейно. Разговор от 50 рунда с асистент агент може да доведе до входни разходи десетки пъти в сравнение с първия рунд.
Има два начина да управлявате това. Първият е recap: компресиране на по-стари рундове в един блок recap, като се запазват само последните няколко рунда необработени. Второто е бързо кеширане (единица 6): четене на фиксирания контекст на една десета от цената, вместо многократно обработване на пълната цена. Заедно те значително намаляват сметката за дълги, контекстно-интензивни работни натоварвания. Така че токен икономиката е за дизайна на цялата сесия, а не на една заявка.
В обобщение
Token е най-малката единица, в която се обработва текст; входът и изходът се оценяват отделно, а изходът често е много по-скъп. Цената е броят токени, умножен по единичната цена, а истинското решение се взема според обема. Съкращаването на подканата, ограничаването на изхода и изборът на най-лекия модел, който изпълнява задачата, са най-преките лостове, които намаляват разходите многократно.
Задача за приложение
Изберете своя задача. (1) Определете броя на входните и очакваните изходни жетони за представителна подкана (измерете с инструмент за броене на жетони, ако е възможно). (2) Изчислете цената на заявка за трите моделни класа. (3) Оценете дневния си брой заявки и извлечете месечния бюджет за трите модела. (4) Добавете инструкция за съкращаване на изхода и отбележете очакваните спестявания.
контролен списък
- [ ] Мога да обясня концепцията на токените и че токенизацията варира в зависимост от модела.
- [ ] Знам защо входните и изходните жетони имат различна цена.
- [ ] Мога да изчисля цената на заявка с формулата.
- [ ] Мога да създам месечен бюджет за натоварване с помощта на шаблон.
- [ ] Мога да покажа с пример ползата от съкращаването на изхода и намаляването на модела.