Единица 2 / 11

Токен и логика ценообразования

Прибыль:

  • Объясните концепцию токена, различия токенов ввода/вывода и токенизации.
  • Может рассчитать стоимость запроса и ежемесячную нагрузку от количества токенов и цены за единицу.
  • Может сравнить влияние выбора модели и продолжительности запроса на стоимость.

Невозможно создать масштабное решение, не понимая экономики API-интерфейсов LLM. Демо-версия запускается один раз; Главное — уметь предсказать, каким будет счет при тысячах звонков в месяц. В этом модуле мы настраиваем денежную сторону вопроса: что такое токен, почему входные и выходные данные оцениваются по-разному, как рассчитать стоимость запроса и как составить бюджет ежемесячной рабочей нагрузки. Эта информация позволяет измерить отдачу от методов оптимизации (кэширование, выбор модели, пакетная обработка) в последующих модулях.

Что такое токен?

Токен — это наименьшая единица, в которой модель обрабатывает текст. Слово не всегда является знаком; токен обычно является частью слова. Грубо говоря, в английском языке 1 токен — это ≈ 4 символа ≈ 0,75 слова. В турецком языке и коде соотношение варьируется: турецкие слова часто делятся на большее количество токенов, чем в английском, из-за его суффиксальной структуры и алфавита. Поэтому необходимо измерять количество токенов с помощью инструмента подсчета токенов провайдера, а не гадать на глаз.

Токенизация (процесс разделения текста на токены) может быть разной для каждой модели. Это имеет два практических последствия: (1) один и тот же текст может давать разное количество токенов в разных моделях; (2) Прогнозы, сделанные с помощью токенизаторов других поставщиков (например, библиотеки tiktoken OpenAI), будут неточными для Клода — используйте совет по подсчету токенов для модели, которую вы используете.

Подсказка: «Сколько жетонов?» Не отвечайте на вопрос вслепую. Передайте репрезентативный текст через API подсчета токенов; Основывайте бюджетные решения на измерениях.

Токены ввода и вывода

Счет-фактура состоит из двух пунктов:

  • Токены ввода: все, что вы отправляете в модель — системное приглашение, прошлые обзоры, сообщения пользователя, документация, если таковая имеется. Все они обрабатываются одновременно.
  • Выходные токены: ответ, создаваемый моделью. Для каждого выходного токена модель выполняет расчет шаг за шагом.

У большинства поставщиков продукция в несколько раз дороже, чем затраты. Причина проста: чтение всех входных данных одновременно обходится дешевле, чем создание выходных токенов. Знание этой асимметрии объясняет, почему такие оптимизации, как «требуют кратких ответов», настолько эффективны.

Примерные цены (за 1 миллион токенов, доллары США)

Таблица ниже является справочной; Цены могут со временем меняться. Пожалуйста, подтвердите текущий список вашего поставщика услуг.

класс модели

образец модели

Вклад ($/1 млн)

Выход ($/1 млн)

Типичное использование

быстро/дешево

Хайку 4.5

1.00

5.00

Классификация, маркировка, простое резюме

сбалансированный

сонет 5

3.00

15.00

Общее назначение, кодирование, агентская работа

сильный

Опус 4.8

5.00

25.00

Сложные рассуждения, долгосрочные задачи

В каждом классе выход в 5 раз превышает вход; Более того, даже мощность мощной модели в 5 раз превышает мощность дешевой модели. Эти две оси (затраты↔выход и класс модели) формируют основу ваших решений по затратам.

Как рассчитать стоимость?

Формула проста:

стоимость = (входной_токен / 1 000 000) × входная_цена + (выходной_токен / 1 000 000) × выходная_цена

Образец аккаунта. Запрос с Сонетом 5: 1500 входных токенов, 400 выходных токенов.

вход = 1 500/1 000 000 × 3,00 = 0,0045 доллара США выход = 400/1 000 000 × 15,00 = 0,0060 доллара США общая сумма = 0,0105 доллара США (около 1 цента)

Один звонок выглядит дешево. Но умножьте на объем: 20 000 звонков в день → 210 долларов в день, ~6 300 долларов в месяц. Здесь в игру вступает масштаб.

Шаблон ежемесячного бюджета

Чтобы получить ежемесячную стоимость рабочей нагрузки, используйте этот шаблон:

1) Средний входной токен на запрос: ......2) Средний выходной токен на запрос: ......3) Количество запросов в день: ......4) Количество рабочих дней в месяце: ......5) Стоимость одного запроса = (1)/1M×input_price + (2)/1M×output_price6) Ежемесячная стоимость = (5) × (3) × (4)

Занесение этого шаблона в электронную таблицу и наблюдение за тем, как меняется сумма при изменении модели, воплощает в себе решения о выборе модели (блок 5) и кэшировании (блок 6).

Сокращение приглашения с помощью копируемых шаблонов

Большая часть затрат приходится на неоправданно длинные запросы и напрасную трату результатов. Приведенные ниже шаблоны обеспечивают прямую экономию.

# Ограничить длину вывода. В ответе не более 3 пунктов. Добавьте обоснование или вводное предложение.

# Возвращаем только запрошенное поле. Возвращаем только следующий JSON, не добавляйте никакого другого текста: {"category": "...", "urgency": "low|medium|high"}

# Удалите ненужный контекст. Удалите из следующего текста только дату и сумму. Не повторяйте весь текст. Текст: """{{text}}"""

# Подведите итог длинной речи (сохранение ввода) Подведите итог этой речи в 5 пунктах. Я буду использовать это резюме вместо полного прошлого в последующих раундах. Речь: """{{past}}"""

Слабая подсказка/Сильная подсказка (с точки зрения стоимости)

# WEAK (выводит выходные данные, дорого) Проанализируйте этот запрос в службу поддержки и напишите мне подробный обзор.

# СИЛЬНЫЙ (ограничивает вывод, дешевый и предсказуемый) Классифицируйте этот запрос на поддержку. Просто верните следующий JSON:{"category":"счет|технические|возврат|другое","срочность":"низкий|средний|высокий"}Не пишите описание.

Слабая версия производит около 500 токенов вывода; сильная версия ~15. Поскольку выпуск стоит дорого, это значительная разница в расчете на вызов, которая умножается на объем.

Три мини-кейса

Случай 1. Скрытая стоимость длинного приглашения. Поскольку автоматизация бухгалтерского учета сортировала каждый счет, она добавляла 40-страничную «книгу правил» в качестве входных данных для каждого запроса: ~ 12 000 входных жетонов на запрос. В Sonnet 5 только что введено 12 000/1M×3 = 0,036 доллара США. 5000 счетов в день → 180 долларов в день. Благодаря кэшированию книги правил (блок 6) стоимость ввода снизилась примерно на 90%.

Случай 2. Выигрыш от сокращения модели. Одна команда делала простую маркировку «положительных/негативных» настроений с помощью Opus 4.8: 300 входных + 10 выходных токенов. Стоимость Opus 300/1M×5 + 10/1M×25 = 0,00175 доллара США. При переходе на Haiku 300/1M×1 + 10/1M×5 = 0,00035 доллара — в 5 раз дешевле, разница в точности была неизмерима. При 3 миллионах звонков в месяц разница составляет $5250 → $1050.

Случай 3 — Освобождение вывода. Когда команда маркетинга составляла описание продукта, она не устанавливала ограничений на выпуск; модель иногда говорила 1500 жетонов. Когда я добавил инструкцию «максимум 60 слов», средний результат упал с 900 до 90 токенов. Поскольку печать стоила дорого, ежемесячный счет сократился на треть, а тексты стали полезнее.

Распространенные ошибки

  • Угадывание токена на глаз: вы можете ошибаться, особенно в турецком языке и коде. Мера.
  • Предположим, что входные и выходные данные одинаковы: выход обычно намного дороже; Большая часть оптимизации происходит за счет сокращения вывода.
  • Не обманывайтесь дешевизной одного звонка: решение принимается по объему. 0,01 доллара США × миллион = 10 000 долларов США.
  • Прогнозирование с помощью токенизатора другого провайдера: дает неправильные результаты; Используйте инструмент подсчета токенов модели.
  • Неограниченное расширение истории разговоров: Каждый раунд добавляется к записи; подводить итоги в долгих беседах.
  • Чрезмерное сохранение `max_tokens`: скрывает бюджетный план и риск сокращения; Дайте реальную стоимость.

Глубже: контекстное окно и стоимость длинного ввода

Крайне важно видеть, как меняется цена «в ходе разговора», а не только «за запрос». Общий объем текста, который может обработать модель, называется контекстным окном; Сумма ввода и вывода должна уместиться в это окно. Современные модели предлагают очень большие окна (сотни тысяч, даже миллионы токенов), но это не значит, что вы можете «заполнять его бесконечно» — все, что вы помещаете в окно, оплачивается как входные данные.

Ловушка в долгих разговорах вот в чем: с каждым новым раундом вы отправляете всю историю заново (безгражданство в блоке 1). В 20-раундовом диалоге 20-й запрос содержит в качестве входных данных все первые 19 раундов. Таким образом, по мере увеличения продолжительности разговора стоимость запроса растет кумулятивно, а не линейно. Разговор из 50 раундов с помощником агента может привести к увеличению затрат в десятки раз по сравнению с первым раундом.

Есть два способа справиться с этим. Первый — это резюме: сжатие старых раундов в один блок резюме, оставляя необработанными только несколько последних раундов. Второе — оперативное кэширование (блок 6): чтение фиксированного контекста за десятую часть цены вместо его повторной обработки по полной цене. Вместе они значительно сокращают расходы на длительные, контекстно-емкие рабочие нагрузки. Таким образом, экономика токенов заключается в разработке всей сессии, а не отдельного запроса.

В заключение

Токен — это наименьшая единица обработки текста; Затраты и выпуск оцениваются отдельно, а выпуск зачастую намного дороже. Стоимость — это количество токенов, умноженное на цену за единицу, а реальное решение принимается по объему. Сокращение времени, ограничение производительности и выбор самой легкой модели, выполняющей поставленную задачу, — это самые прямые рычаги, многократно снижающие стоимость.

Задача приложения

Выберите задачу самостоятельно. (1) Определите количество входных и предполагаемых выходных токенов для репрезентативной подсказки (если возможно, измерьте с помощью инструмента подсчета токенов). (2) Рассчитайте стоимость запроса для трех классов моделей. (3) Оцените ежедневное количество запросов и определите ежемесячный бюджет для трех моделей. (4) Добавьте инструкцию по сокращению выпуска и отметьте ожидаемую экономию.

контрольный список

  • [ ] Я могу объяснить концепцию токенов и то, что токенизация варьируется в зависимости от модели.
  • [ ] Я знаю, почему входные и выходные токены оцениваются по-разному.
  • [ ] Я могу рассчитать стоимость запроса по формуле.
  • [ ] Я могу создать ежемесячный бюджет для рабочей нагрузки с помощью шаблона.
  • [ ] Я могу на примере показать преимущества сокращения выходных данных и сокращения модели.