Unità 2 / 11

Token e logica dei prezzi

Guadagni:

  • Spiegare il concetto di token, distinzione dei token di input/output e tokenizzazione.
  • Può calcolare il costo di una richiesta e un carico di lavoro mensile dal numero di token e dal prezzo unitario
  • Può confrontare l'impatto della selezione del modello e della durata del prompt sul costo

Non è possibile creare una soluzione su larga scala senza comprendere gli aspetti economici delle API LLM. Una demo viene eseguita una volta; L'importante è poter prevedere quale sarà la bolletta quando verranno effettuate migliaia di chiamate al mese. In questa unità definiamo il lato monetario delle cose: cos'è un token, perché input e output hanno un prezzo diverso, come calcolare il costo di una richiesta e come preventivare un carico di lavoro mensile. Queste informazioni consentono di misurare il rendimento delle tecniche di ottimizzazione (caching, selezione del modello, batch) in unità successive.

Cos'è il token?

Il token è l'unità più piccola in cui il modello elabora il testo. Una parola non è sempre un segno; token è solitamente una parte di una parola. In parole povere, in inglese, 1 token equivale a ≈ 4 caratteri ≈ 0,75 parole. In turco e nel codice, il rapporto varia: le parole turche sono spesso divise in più token rispetto all'inglese a causa della struttura con suffisso e dell'alfabeto. Pertanto, è necessario misurare il numero di token con lo strumento di conteggio dei token del fornitore anziché indovinarlo a occhio.

La tokenizzazione (il processo di suddivisione del testo in token) può essere diversa per ciascun modello. Ciò ha due conseguenze pratiche: (1) lo stesso testo può produrre numeri diversi di token in modelli diversi; (2) Le previsioni fatte con tokenizzatori di altri fornitori (ad esempio la libreria tiktoken di OpenAI) saranno imprecise per Claude: utilizza il suggerimento per il conteggio dei token per il modello che stai utilizzando.

Suggerimento: "Quanti gettoni circa?" Non rispondere alla domanda alla cieca. Passare un testo rappresentativo attraverso l'API di conteggio dei token; Basare le decisioni di budget sulla misurazione.

Token di input e output

La fattura è composta da due voci:

  • Token di input: tutto ciò che invii al modello: prompt di sistema, tour precedenti, messaggio utente, documentazione eventuale. Questi vengono elaborati tutti in una volta.
  • Token di output: la risposta prodotta dal modello. Per ciascun token di output, il modello esegue il calcolo passo dopo passo.

Con la maggior parte dei fornitori, l’output è molte volte più costoso dell’input. Il motivo è semplice: leggere l’input tutto in una volta è più economico che produrre l’output token per token. Conoscere questa asimmetria spiega perché ottimizzazioni come “richiedono risposte concise” sono così efficaci.

Prezzi campione (per 1 milione di token, USD)

La tabella seguente è un riferimento; I prezzi possono cambiare nel tempo, conferma l'elenco attuale del tuo fornitore.

classe del modello

modello campione

Ingresso ($/1 milione)

Produzione ($/1 milione)

Utilizzo tipico

veloce/economico

Haiku 4.5

1.00

5.00

Classificazione, etichettatura, sintesi semplice

equilibrato

sonetto 5

3.00

15.00

Scopo generale, codifica, lavoro dell'agente

forte

Opera 4.8

5.00

25.00

Ragionamento complesso, compiti a lungo termine

In ogni classe, l'output è 5 volte l'input; Inoltre, anche l’input del modello potente è 5 volte superiore a quello del modello economico. Questi due assi (input↔output e classe del modello) costituiscono la struttura delle vostre decisioni sui costi.

Come calcolare il costo?

La formula è semplice:

costo = (token_input / 1.000.000) × prezzo_input + (token_output / 1.000.000) × prezzo_output

Conto campione. Una richiesta con Sonetto 5: 1.500 gettoni di input, 400 gettoni di output.

input = 1.500 / 1.000.000 × 3,00 = $ 0,0045 output = 400 / 1.000.000 × 15,00 = $ 0,0060 totale = $ 0,0105 (circa 1 centesimo)

Una chiamata sembra economica. Ma moltiplica per il volume: 20.000 chiamate al giorno → $ 210 al giorno, ~ $ 6.300 al mese. È qui che entra in gioco la scala.

Modello di budget mensile

Per estrarre il costo mensile di un carico di lavoro, utilizza questo modello:

1) Token di input medio per richiesta: ......2) Token di output medio per richiesta: ......3) Numero di richieste al giorno: ......4) Giorni lavorati al mese: ......5) Costo per richiesta = (1)/1M×input_price + (2)/1M×output_price6) Costo mensile = (5) × (3) × (4)

Versare questo modello in un foglio di calcolo e vedere come si sviluppa la somma quando si modifica il modello incarna le decisioni di selezione del modello (unità 5) e memorizzazione nella cache (unità 6).

Accorciare la richiesta con modelli copiabili

La maggior parte del costo deriva da richieste inutilmente lunghe e da output sprecati. I modelli seguenti forniscono risparmi diretti.

# Limita la lunghezza dell'output. Rispondi con un massimo di 3 elementi. Aggiungi una motivazione o una frase introduttiva.

# Restituisce solo il campo richiesto Restituisce solo il seguente JSON, non aggiungere altro testo:{"category": "...", "urgency": "low|medium|high"}

# Rimuovi il contesto non necessarioRimuovi solo la data e l'importo dal testo seguente. Non ripetere l'intero testo.Testo: """{{text}}"""

# Riassumi il lungo discorso (salvataggio dell'input) Riassumi questo discorso in 5 elementi. Utilizzerò questo riassunto invece del passato completo nei turni successivi. Discorso: """{{passato}}"""

Pronto debole / Pronto forte (in termini di costo)

# DEBOLE (rilascia output, costoso)Analizza questa richiesta di supporto e scrivimi una recensione completa.

# FORTE (vincola l'output, economico e prevedibile) Classifica questa richiesta di supporto. Restituisci semplicemente il seguente JSON:{"category":"invoice|technical|refund|other","urgency":"low|medium|high"}Non scrivere una descrizione.

La versione debole produce forse 500 token di output; versione forte ~15. Poiché l'output è costoso, si tratta di una differenza significativa per chiamata e si moltiplica con il volume.

Tre mini custodie

Caso 1: il costo nascosto del prompt lungo. Mentre un sistema di automazione della contabilità ordinava ogni fattura, aggiungeva un “regolamento” di 40 pagine come input per ciascuna richiesta: circa 12.000 token di input per richiesta. Con Sonetto 5 12.000/1M×3 = $0,036 appena inserito. 5.000 fatture al giorno → $ 180 al giorno. Memorizzando nella cache il regolamento (unità 6), il costo di input è diminuito del 90% circa.

Caso 2 – Il vantaggio di ridimensionare il modello. Un team stava eseguendo un semplice tagging del sentiment “positivo/negativo” con Opus 4.8: 300 token di input + 10 token di output. Costo dell'opera 300/1 milione×5 + 10/1 milione×25 = $ 0,00175. Passando a Haiku, 300/1M×1 + 10/1M×5 = $ 0,00035 – 5 volte più economico, la differenza di precisione era incommensurabile. Su 3 milioni di chiamate al mese, la differenza è di $ 5.250 → $ 1.050.

Caso 3: rilascio dell'output. Quando un team di marketing produceva una descrizione del prodotto, non fissava limiti alla produzione; il modello a volte diceva 1.500 gettoni. Quando ho aggiunto l'istruzione "60 parole massime", l'output medio è sceso da 900 a 90 token. Poiché la stampa era costosa, la fattura mensile si ridusse di un terzo e i testi diventarono più utili.

Errori comuni

  • Indovinare il token a occhio: puoi sbagliare soprattutto in turco e in codice. Misura.
  • Supponendo che input e output siano gli stessi: l’output è solitamente molto più costoso; La maggior parte dell'ottimizzazione deriva dalla riduzione dell'output.
  • Non fatevi ingannare dall'economicità di una singola chiamata: la decisione viene presa in base al volume. $ 0,01 × milione = $ 10.000.
  • Previsione con il tokenizzatore di un altro provider: fornisce risultati errati; Utilizza lo strumento di conteggio dei token del modello.
  • Ampliamento illimitato della cronologia delle conversazioni: ogni round viene aggiunto alla voce; riassumere in lunghe conversazioni.
  • Mantenere `max_tokens` inutilmente alto: nasconde il piano di budget e il rischio di essere tagliati; Dai un valore realistico.

Più in profondità: finestra di contesto e costi di input lunghi

È fondamentale vedere come si accumula il prezzo "nel corso della conversazione" e non solo "per richiesta". La quantità totale di testo che il modello può elaborare è chiamata finestra di contesto; La somma di input e output deve rientrare in questa finestra. I modelli moderni offrono finestre molto grandi (centinaia di migliaia, persino milioni di token), ma ciò non significa che puoi "riempirlo all'infinito": qualunque cosa inserisci nella finestra viene fatturata come input.

La trappola nelle conversazioni lunghe è questa: ad ogni nuovo giro si rimanda l’intera storia (apolidia nell’unità 1). In una conversazione di 20 round, la ventesima richiesta porta come input tutti i primi 19 round. Pertanto, man mano che la conversazione si allunga, il costo per richiesta cresce in modo cumulativo anziché lineare. Una conversazione di 50 round con un assistente agente può produrre costi di input decine di volte superiori al primo round.

Esistono due modi per gestirlo. Il primo è il riepilogo: comprime i round più vecchi in un unico blocco di riepilogo, mantenendo grezzi solo gli ultimi round. Il secondo è il caching immediato (unità 6): leggere il contesto fisso a un decimo del prezzo invece di elaborarlo ripetutamente al prezzo intero. Insieme, riducono significativamente i costi relativi a carichi di lavoro lunghi e ad alta intensità di contesto. Quindi l’economia dei token riguarda la progettazione dell’intera sessione, non una singola richiesta.

In sintesi

Il token è l'unità più piccola in cui viene elaborato il testo; input e output hanno prezzi separati e l’output è spesso molto più costoso. Il costo è il numero di token moltiplicato per il prezzo unitario e la vera decisione viene presa in base al volume. Accorciare i tempi, limitare la produzione e scegliere il modello più leggero che svolga il compito sono le leve più dirette che riducono notevolmente i costi.

Compito dell'applicazione

Scegli un compito tutto tuo. (1) Determinare il numero di token di input e di output stimati per un prompt rappresentativo (misurare con uno strumento di conteggio dei token, se possibile). (2) Calcolare il costo per richiesta per le tre classi di modelli. (3) Stimare il numero giornaliero di richieste e ricavare il budget mensile per i tre modelli. (4) Aggiungere un'istruzione per abbreviare l'output e annotare i risparmi attesi.

lista di controllo

  • [ ] Posso spiegare il concetto di token e che la tokenizzazione varia a seconda del modello.
  • [] So perché i token di input e output hanno un prezzo diverso.
  • [ ] Posso calcolare il costo di una richiesta con la formula.
  • [ ] Posso creare un budget mensile per un carico di lavoro utilizzando un modello.
  • [ ] Posso mostrare con un esempio il vantaggio di accorciare l'output e la riduzione del modello.