Unité 2 / 11

Jeton et logique de tarification

Gains :

  • Expliquez le concept de jeton, de distinction de jeton d'entrée/sortie et de tokenisation.
  • Peut calculer le coût d'une demande et une charge de travail mensuelle à partir du nombre de jetons et du prix unitaire
  • Peut comparer l'impact de la sélection du modèle et de la durée de l'invite sur le coût

Vous ne pouvez pas créer une solution à grande échelle sans comprendre les aspects économiques des API LLM. Une démo s'exécute une fois ; L’essentiel est de pouvoir prédire quelle sera la facture lorsque des milliers d’appels seront passés par mois. Dans cette unité, nous définissons l'aspect financier des choses : qu'est-ce qu'un jeton, pourquoi les entrées et les sorties sont tarifées différemment, comment calculer le coût d'une demande et comment budgétiser une charge de travail mensuelle. Ces informations permettent de mesurer le retour des techniques d'optimisation (caching, sélection de modèle, batch) dans les unités suivantes.

Qu’est-ce que le jeton ?

Le jeton est la plus petite unité dans laquelle le modèle traite le texte. Un mot n’est pas toujours un signe ; le jeton fait généralement partie d'un mot. En gros, en anglais, 1 jeton équivaut à ≈ 4 caractères ≈ 0,75 mots. En turc et en code, le rapport varie : les mots turcs sont souvent divisés en plus de jetons qu'en anglais en raison de leur structure suffixée et de leur alphabet. Par conséquent, il est nécessaire de mesurer le nombre de jetons avec l'outil de comptage de jetons du fournisseur plutôt que de le deviner à l'œil nu.

La tokenisation (le processus de division du texte en jetons) peut être différente pour chaque modèle. Cela a deux conséquences pratiques : (1) Le même texte peut donner différents nombres de jetons dans différents modèles ; (2) Les prédictions faites avec des tokenizers d'autres fournisseurs (par exemple la bibliothèque tiktoken d'OpenAI) seront inexactes pour Claude — utilisez l'astuce de comptage de tokens pour le modèle que vous utilisez.

Indice : « Environ combien de jetons ? » Ne répondez pas aveuglément à la question. Transmettez un texte représentatif via l'API de comptage de jetons ; Baser les décisions budgétaires sur la mesure.

Jetons d'entrée et de sortie

La facture se compose de deux éléments :

  • Jetons d'entrée : tout ce que vous envoyez au modèle : invite système, visites passées, message utilisateur, documentation le cas échéant. Ceux-ci sont traités en une seule fois.
  • Jetons de sortie : la réponse produite par le modèle. Pour chaque jeton de sortie, le modèle effectue le calcul étape par étape.

Chez la plupart des fournisseurs, la production coûte plusieurs fois plus cher que l’entrée. La raison est simple : lire l’entrée en une seule fois coûte moins cher que de produire la sortie jeton par jeton. Connaître cette asymétrie explique pourquoi les optimisations du type « exiger des réponses concises » sont si efficaces.

Exemples de prix (pour 1 million de jetons, USD)

Le tableau ci-dessous est une référence ; Les prix peuvent changer au fil du temps, veuillez confirmer la liste actuelle de votre propre fournisseur.

classe de modèle

exemple de modèle

Entrée ($/1 million)

Production ($/1 million)

Utilisation typique

rapide/pas cher

Haïku 4.5

1h00

5h00

Classification, étiquetage, résumé simple

équilibré

sonnet 5

3h00

15h00

Usage général, codage, travail d'agent

fort

Opus 4.8

5h00

25h00

Raisonnement complexe, tâches à long terme

Dans chaque classe, la sortie est 5 fois supérieure à l’entrée ; De plus, même l’apport du modèle puissant est 5 fois supérieur à celui du modèle bon marché. Ces deux axes (entrée↔sortie et classe de modèle) forment le cadre de vos décisions en matière de coûts.

Comment calculer le coût ?

La formule est simple :

coût = (input_token / 1 000 000) × input_price + (output_token / 1 000 000) × output_price

Exemple de compte. Une requête avec Sonnet 5 : 1 500 jetons d'entrée, 400 jetons de sortie.

entrée = 1 500 / 1 000 000 × 3,00 = 0,0045 $ sortie = 400 / 1 000 000 × 15,00 = 0,0060 $ total = 0,0105 $ (environ 1 cent)

Un appel semble bon marché. Mais multipliez par le volume : 20 000 appels par jour → 210 $ par jour, ~ 6 300 $ par mois. C’est là que l’échelle entre en jeu.

Modèle de budget mensuel

Pour extraire le coût mensuel d'une charge de travail, utilisez ce modèle :

1) Jeton d'entrée moyen par requête : ......2) Jeton de sortie moyen par requête : ......3) Nombre de requêtes par jour : ......4) Jours travaillés par mois : ......5) Coût par requête = (1)/1M×input_price + (2)/1M×output_price6) Coût mensuel = (5) × (3) × (4)

Verser ce modèle dans une feuille de calcul et voir comment la somme se joue lorsque vous modifiez le modèle incarne les décisions de sélection de modèle (unité 5) et de cache (unité 6).

Raccourcir l'invite avec des modèles copiables

La majeure partie du coût provient d’invites inutilement longues et d’un gaspillage de production. Les modèles ci-dessous permettent de réaliser des économies directes.

# Limiter la longueur de sortie. Répondez avec un maximum de 3 éléments. Ajoutez une justification ou une phrase d’introduction.

# Renvoie uniquement le champ demandé Renvoie uniquement le JSON suivant, n'ajoute aucun autre texte :{"category": "...", "urgency": "low|medium|high"}

# Supprimez le contexte inutileSupprimez uniquement la date et le montant du texte suivant. Ne répétez pas tout le texte.Texte : """{{text}}"""

# Résumer le long discours (sauvegarde des entrées) Résumez ce discours en 5 éléments. J'utiliserai ce résumé au lieu du passé complet lors des tours suivants. Discours : """{{passé}}"""

Invite faible/Invite forte (en termes de coût)

# FAIBLE (sortie de sortie, cher) Analysez cette demande d'assistance et écrivez-moi une critique complète.

# FORT (limite la production, bon marché et prévisible)Classez cette demande d'assistance. Renvoyez simplement le JSON suivant :{"category":"invoice|technical|refund|other","urgency":"low|medium|high"}N'écrivez pas de description.

La version faible produit peut-être 500 jetons de sortie ; version forte ~15. Étant donné que la production coûte cher, il s’agit d’une différence significative par appel et elle se multiplie avec le volume.

Trois mini-étuis

Cas 1 — Le coût caché de la longue invite. Au fur et à mesure qu'une automatisation comptable triait chaque facture, elle ajoutait un « livre de règles » de 40 pages en entrée à chaque demande : environ 12 000 jetons d'entrée par demande. Avec Sonnet 5, 12 000/1M×3 = 0,036 $ viennent d'être saisis. 5 000 factures par jour → 180 $ par jour. En mettant en cache le livre de règles (unité 6), le coût d'entrée a diminué d'environ 90 %.

Cas 2 — Les avantages de la réduction de la taille du modèle. Une équipe effectuait un simple marquage de sentiments « positif/négatif » avec l'Opus 4.8 : 300 jetons d'entrée + 10 jetons de sortie. L'opus coûte 300/1M×5 + 10/1M×25 = 0,00175 $. En passant à Haiku, 300/1M×1 + 10/1M×5 = 0,00035 $ — 5 fois moins cher, la différence de précision était incommensurable. Sur 3 millions d’appels par mois, la différence est de 5 250 $ → 1 050 $.

Cas 3 — Libération de la sortie. Lorsqu’une équipe marketing produisait une description de produit, elle ne fixait aucune limite de production ; le modèle disait parfois 1 500 jetons. Lorsque j'ai ajouté l'instruction "60 mots maximum", la sortie moyenne est passée de 900 à 90 jetons. L’impression étant coûteuse, la facture mensuelle a été réduite d’un tiers et les textes sont devenus plus utiles.

Erreurs courantes

  • Deviner le jeton à l'œil nu : vous pouvez vous tromper, surtout en turc et en code. Mesure.
  • En supposant que l’entrée et la sortie soient les mêmes : la sortie est généralement beaucoup plus chère ; L'essentiel de l'optimisation provient du raccourcissement de la sortie.
  • Ne vous laissez pas tromper par le faible coût d'un seul appel : la décision est prise en fonction du volume. 0,01 × million = 10 000 $.
  • Prédiction avec le tokenizer d'un autre fournisseur : donne des résultats incorrects ; Utilisez l'outil de comptage de jetons du modèle.
  • Agrandissement illimité de l'historique des conversations : Chaque tour est ajouté à l'entrée ; résumer dans de longues conversations.
  • Garder `max_tokens` inutilement élevé : masque le plan budgétaire et le risque de réduction ; Donnez une valeur réaliste.

Plus profond : fenêtre contextuelle et coût d'entrée long

Il est essentiel de voir comment le prix s'accumule « tout au long de la conversation » et pas seulement « par demande ». La quantité totale de texte que le modèle peut traiter est appelée la fenêtre contextuelle ; La somme des entrées et des sorties doit tenir dans cette fenêtre. Les modèles modernes offrent de très grandes fenêtres (des centaines de milliers, voire des millions de jetons), mais cela ne signifie pas que vous pouvez « les remplir à l'infini » : tout ce que vous mettez dans la fenêtre est facturé comme entrée.

Le piège des longues conversations est le suivant : à chaque nouveau tour, vous renvoyez à nouveau toute l’histoire (apatridie dans l’unité 1). Dans une conversation de 20 tours, la 20ème requête contient l'intégralité des 19 premiers tours en entrée. Ainsi, à mesure que la conversation s’allonge, le coût par requête augmente de manière cumulative plutôt que linéaire. Une conversation de 50 tours avec un assistant d'agent peut produire des coûts d'entrée des dizaines de fois supérieurs au premier tour.

Il existe deux manières de gérer cela. La première est la récapitulation : compresser les tours plus anciens en un seul bloc récapitulatif, en ne gardant que les derniers tours bruts. La seconde est la mise en cache rapide (unité 6) : lire le contexte fixe au dixième du prix au lieu de le traiter de manière répétée au prix fort. Ensemble, ils réduisent considérablement la facture des charges de travail longues et gourmandes en contexte. L’économie symbolique concerne donc la conception de l’ensemble de la session, et non une seule demande.

En résumé

Le jeton est la plus petite unité dans laquelle le texte est traité ; les intrants et les extrants sont évalués séparément, et les extrants sont souvent beaucoup plus chers. Le coût est le nombre de jetons multiplié par le prix unitaire, et la véritable décision est prise en volume. Raccourcir l'invite, limiter le rendement et choisir le modèle le plus léger qui accomplit la tâche sont les leviers les plus directs qui réduisent les coûts plusieurs fois.

Tâche de candidature

Choisissez votre propre tâche. (1) Déterminez le nombre de jetons d'entrée et de sortie estimés pour une invite représentative (mesurez avec un outil de comptage de jetons si possible). (2) Calculez le coût par demande pour les trois classes modèles. (3) Estimez votre nombre quotidien de demandes et en déduisez le budget mensuel pour les trois modèles. (4) Ajoutez une instruction pour raccourcir la sortie et notez les économies attendues.

liste de contrôle

  • [ ] Je peux expliquer le concept de tokens et que la tokenisation varie selon le modèle.
  • [ ] Je sais pourquoi les jetons d'entrée et de sortie ont un prix différent.
  • [ ] Je peux calculer le coût d'une demande avec la formule.
  • [ ] Je peux créer un budget mensuel pour une charge de travail à l'aide d'un modèle.
  • [ ] Je peux montrer avec un exemple l'avantage de raccourcir la sortie et la réduction du modèle.