Прибуток:
- Поясніть поняття маркера, розрізнення маркерів введення/виведення та токенізації.
- Може розрахувати вартість запиту та місячне навантаження з кількості токенів та ціни за одиницю
- Можна порівняти вплив вибору моделі та швидкої довжини на вартість
Ви не можете створити масштабне рішення без розуміння економіки LLM API. Демо запускається один раз; Головне – вміти передбачити, який буде рахунок при тисячах дзвінків на місяць. У цьому розділі ми встановлюємо грошову сторону речей: що таке токен, чому вхід і вихід мають різну ціну, як розрахувати вартість запиту та як спланувати місячне робоче навантаження. Ця інформація дозволяє виміряти віддачу методів оптимізації (кешування, вибір моделі, партія) у наступних одиницях.
Що таке токен?
Токен — це найменша одиниця, в якій модель обробляє текст. Слово не завжди є лексемою; лексема зазвичай є частиною слова. Грубо кажучи, в англійській мові 1 токен — це ≈ 4 символи ≈ 0,75 слова. У турецькій і кодовій мовах співвідношення змінюється: турецькі слова часто поділяються на більше лексем, ніж англійські, через суфіксну структуру та алфавіт. Тому необхідно вимірювати кількість токенів за допомогою інструменту підрахунку токенів постачальника, а не вгадувати на око.
Токенізація (процес поділу тексту на токени) може відрізнятися для кожної моделі. Це має два практичних наслідки: (1) той самий текст може давати різну кількість токенів у різних моделях; (2) Прогнози, зроблені за допомогою токенізаторів від інших постачальників (наприклад, бібліотеки tiktoken OpenAI), будуть неточними для Клода — скористайтеся порадою щодо підрахунку токенів для моделі, яку ви використовуєте.
Підказка: "Скільки приблизно жетонів?" Не відповідайте на запитання сліпо. Передайте типовий текст через API підрахунку маркерів; Базуйте бюджетні рішення на вимірюванні.
Вхідні та вихідні маркери
Рахунок-фактура складається з двох пунктів:
- Вхідні маркери: усе, що ви надсилаєте моделі — системне повідомлення, минулі тури, повідомлення користувача, документація, якщо така є. Вони обробляються відразу.
- Вихідні маркери: відповідь, створена моделлю. Для кожного вихідного токена модель виконує обчислення крок за кроком.
У більшості провайдерів вихід у декілька разів дорожчий за вхід. Причина проста: зчитувати всі вхідні дані одночасно дешевше, ніж створювати вихідні дані маркер за маркером. Знання цієї асиметрії пояснює, чому такі ефективні оптимізації, як «вимагати лаконічних відповідей».
Приклади цін (за 1 мільйон токенів, USD)
Таблиця нижче є довідковою; Ціни можуть змінюватися з часом, підтвердьте поточний список свого постачальника.
модельний клас
зразок моделі
Вхід ($/1 млн.)
Вихід ($/1 млн)
Типове використання
швидко/дешево
Хайку 4.5
1,00
5.00
Класифікація, маркування, простий короткий зміст
збалансований
сонет 5
3.00
15.00
Загальне призначення, кодування, агентська робота
сильний
Опус 4.8
5.00
25.00
Складне міркування, довгострокові завдання
У кожному класі вихід у 5 разів перевищує вхід; Більш того, навіть потужна модель в 5 разів перевищує витрату дешевої моделі. Ці дві осі (вхід↔вихід і клас моделі) формують основу ваших рішень щодо витрат.
Як розрахувати вартість?
Формула проста:
вартість = (input_token / 1 000 000) × input_price + (output_token / 1 000 000) × output_price
Зразок рахунку. Запит із Sonnet 5: 1500 вхідних токенів, 400 вихідних токенів.
вхід = 1 500 / 1 000 000 × 3,00 = 0,0045 дол. США вихід = 400 / 1 000 000 × 15,00 = 0,0060 дол.
Один дзвінок виглядає дешево. Але помножте на обсяг: 20 000 дзвінків на день → $210 на день, ~$6300 на місяць. Тут грає роль масштаб.
Шаблон місячного бюджету
Щоб отримати місячну вартість робочого навантаження, скористайтеся цим шаблоном:
1) Середній вхідний токен на запит: ......2) Середній вихідний токен на запит: ......3) Кількість запитів на день: ......4) Відпрацьовані дні на місяць: ......5) Вартість одного запиту = (1)/1M×input_price + (2)/1M×output_price6) Щомісячна вартість = (5) × (3) × (4)
Перенесення цього шаблону в електронну таблицю та перегляд суми, коли ви змінюєте модель, втілюють рішення щодо вибору моделі (блок 5) і кешу (блок 6).
Скорочення підказки за допомогою шаблонів, які можна копіювати
Більша частина витрат пов’язана з надто довгими підказками та марними результатами. Наведені нижче шаблони забезпечують пряму економію.
# Обмежте вихідну довжину. Дайте відповідь не більше 3 пунктів. Додайте обґрунтування або вступне речення.
# Повернути лише запитане поле Повернути лише наступний JSON, не додавати жодного іншого тексту:{"category": "...", "urency": "low|medium|high"}
# Видаліть непотрібний контекст. Видаліть лише дату та суму з наступного тексту. Не повторювати весь текст. Текст: """{{text}}"""
# Підсумуйте довгу промову (збереження введених даних) Підсумуйте цю промову в 5 пунктах. Я буду використовувати це резюме замість повного минулого в наступних раундах. Мова: """{{past}}"""
Слабка підказка / Сильна підказка (з точки зору вартості)
# СЛАБКО (випуск випуску, дорого) Проаналізуйте цей запит у підтримку та напишіть мені вичерпний огляд.
# СИЛЬНИЙ (обмежує вихід, дешевий і передбачуваний) Класифікуйте цей запит на підтримку. Просто поверніть такий JSON:{"category":"invoice|technical|refund|other","urency":"low|medium|high"}Не пишіть опис.
Слабка версія створює, можливо, 500 токенів виводу; сильна версія ~15. Оскільки вихідні дані є дорогими, це суттєва різниця на виклик і збільшується на обсяг.
Три міні-чохли
Випадок 1 — Прихована вартість довгого запиту. Коли система автоматизації бухгалтерського обліку сортувала кожен рахунок-фактуру, вона додавала 40-сторінковий «книгу правил» як вхідні дані для кожного запиту: ~12 000 маркерів введення на запит. Із Sonnet 5 12 000/1M×3 = $0,036 щойно введено. 5000 рахунків на день → $180 на день. За рахунок кешування книги правил (блок 6) вхідні витрати знизилися на ~90%.
Випадок 2 — виграш від зменшення розміру моделі. Одна команда виконувала просте тегування «позитивних/негативних» настроїв за допомогою Opus 4.8: 300 вхідних + 10 вихідних токенів. Вартість Opus 300/1M×5 + 10/1M×25 = $0,00175. Перейшовши на Haiku, 300/1M×1 + 10/1M×5 = $0,00035 — у 5 разів дешевше, різниця в точності була невимірною. При 3 мільйонах дзвінків на місяць різниця становить 5 250 $ → 1 050 $.
Випадок 3 — Звільнення результату. Коли маркетингова команда підготувала опис продукту, вона не встановила жодних обмежень на випуск; іноді модель говорила про 1500 жетонів. Коли я додав інструкцію «максимум 60 слів», середній результат впав з 900 до 90 токенів. Оскільки друк був дорогим, щомісячний рахунок зменшився на третину, а тексти стали кориснішими.
Поширені помилки
- Вгадування лексеми на око: Ви можете помилятися, особливо в турецькій і коді. Виміряти.
- Припускаючи, що вхідні та вихідні дані однакові: вихідні дані зазвичай набагато дорожчі; Більшість оптимізації відбувається за рахунок скорочення результату.
- Нехай вас не вводить в оману дешевизна одного дзвінка: рішення приймається за обсягом. $0,01 × мільйон = $10 000.
- Прогноз за допомогою токенізера іншого постачальника: дає неправильні результати; Використовуйте інструмент підрахунку жетонів моделі.
- Необмежене збільшення історії розмов: кожен раунд додається до запису; підсумовувати в довгих розмовах.
- Зберігання `max_tokens` без потреби високим: приховує бюджетний план і ризик скорочення; Дайте реалістичне значення.
Глибше: вікно контексту та довгострокова вартість введення
Дуже важливо спостерігати за тим, як ціна змінюється «в розмові», а не лише «за запит». Загальний обсяг тексту, який може обробити модель, називається контекстним вікном; Сума введення та виведення має вміщуватися в це вікно. Сучасні моделі пропонують дуже великі вікна (сотні тисяч, навіть мільйони токенів), але це не означає, що ви можете «заповнювати його нескінченно» — все, що ви вставляєте у вікно, виставляється як вхідні дані.
Пастка довгих розмов полягає в наступному: з кожним новим раундом ви надсилаєте всю історію заново (безгромадянства у блоці 1). У 20-раундовій розмові 20-й запит містить усі перші 19 раундів як вхідні дані. Таким чином, коли розмова стає довшою, вартість запиту зростає кумулятивно, а не лінійно. 50-раундова розмова з помічником агента може призвести до вхідних витрат у десятки разів, ніж у першому раунді.
Є два способи впоратися з цим. Перший — це резюме: стиснення старих раундів в один блок резюме, зберігаючи необробленими лише кілька останніх раундів. Другий — оперативне кешування (блок 6): читання фіксованого контексту за десяту частину ціни замість повторної обробки за повною ціною. Разом вони значно зменшують витрати на тривалі, контекстно-інтенсивні робочі навантаження. Таким чином, економіка токенів стосується розробки всього сеансу, а не окремого запиту.
Підсумовуючи
Токен — найменша одиниця, в якій обробляється текст; вхід і вихід оцінюються окремо, а вихід часто набагато дорожчий. Вартість — це кількість токенів, помножена на ціну за одиницю, а реальне рішення приймається за обсягом. Скорочення підказки, обмеження виходу та вибір найлегшої моделі, яка впорається із завданням, є найпрямішими важелями, які зменшують вартість у багато разів.
Аплікаційне завдання
Виберіть собі завдання. (1) Визначте кількість вхідних і передбачуваних вихідних токенів для репрезентативного підказки (виміряйте за допомогою інструменту для підрахунку токенів, якщо можливо). (2) Обчисліть вартість запиту для трьох класів моделей. (3) Оцініть щоденну кількість запитів і розрахуйте місячний бюджет для трьох моделей. (4) Додайте інструкцію, щоб скоротити результат і зазначити очікувану економію.
контрольний список
- [ ] Я можу пояснити концепцію токенів і те, що токенізація залежить від моделі.
- [ ] Я знаю, чому вхідні та вихідні токени мають різні ціни.
- [ ] Я можу розрахувати вартість запиту за формулою.
- [ ] Я можу створити місячний бюджет для робочого навантаження за допомогою шаблону.
- [ ] Я можу показати на прикладі переваги скорочення результату та зменшення моделі.