Guadagni:
- Capacità di leggere i prezzi dei token di input/output e gli elementi della fattura
- Capacità di stimare il costo mensile di un flusso di lavoro con una formula approssimativa
- Implementazione di metodi di riduzione dei costi come memorizzazione nella cache, elaborazione batch e gestione temporanea dei modelli
Essere in grado di stimare quanto costerà un modello è una delle abilità più pratiche del decisore. "Cosa pago mensilmente?" Se non puoi rispondere alla domanda, non puoi né pianificare un budget né scegliere il livello giusto. La buona notizia è che stabilire i prezzi è più semplice di quanto sembri e, una volta capito come funziona, puoi fare una stima approssimativa da solo. In questa unità imparerai come leggere i prezzi dei token di input/output, stimare il costo mensile di un flusso di lavoro con una formula semplice e metodi che riducono effettivamente i costi.
Regola empirica: input e output hanno prezzi separati
Nei modelli a peso chiuso il prezzo viene calcolato in base alla quantità di token processati e sono presenti due voci distinte:
- Token di input (input): il testo inviato al modello. La tua richiesta, i tuoi documenti, i tuoi campioni.
- Gettone di output: la risposta che il modello produce per te.
Punto critico: il token di output è spesso molte volte più costoso del token di input. Questo perché è computazionalmente più costoso per il modello produrre output. Ad esempio, in un modello, l'input potrebbe essere di 3 dollari per milione di token mentre l'output potrebbe essere di 15 dollari; Quindi la produzione è cinque volte più costosa. Ciò significa che risposte lunghe e non necessarie possono rapidamente erodere il budget.
Suggerimento: uno dei modi più semplici per ridurre i costi è non chiedere al modello risposte inutilmente lunghe. Restrizioni come "massimo 5 articoli", "paragrafo singolo", "esporta solo la tabella" aumentano la qualità e salvano il token di output.
Esempi di prezzi attuali
Di seguito sono riportati i prezzi approssimativi di diversi modelli (per milione di token, dollari USA). Questi valori appartengono al periodo in cui è stato preparato questo modulo e cambiano frequentemente; Controlla la pagina dei prezzi attuali del fornitore per la decisione esatta.
modello
Palcoscenico
Inserisci $/1 milione
Produzione $/1 milione
Claude Opus 4.8
forte
~5
~25
Claude Sonetto 5
equilibrato
~3
~15
ClaudeHaiku4.5
leggero
~1
~5
Come si vede nella tabella, può esserci una differenza di prezzo fino a cinque volte tra il livello forte e quello leggero. Ecco perché l'approccio del "modello più adatto per tutte le aziende" è spesso uno spreco di denaro. Fare in modo che il lavoro semplice venga svolto da un modello economico e il lavoro difficile da un modello potente offre grandi risparmi senza perdita di qualità. Approfondiremo questo concetto nelle unità 7 e 9.
Stima del costo mensile: formula semplice
Per una stima approssimativa del costo mensile, puoi utilizzare questa formula:
Costo mensile ≈ (Numero di richieste al mese × Token di input medio × Prezzo di input / 1.000.000)+ (Numero di richieste al mese × Token di output medio × Prezzo di output / 1.000.000)
Facciamo un esempio. Supponiamo che un team di e-commerce produca 50.000 descrizioni di prodotti al mese. Ogni richiesta invia in media 500 token di input (informazioni sul prodotto) e riceve 300 token di output (descrizione). In un modello bilanciato (ingresso ~3, uscita ~15):
- Costo di input: 50.000 × 500 × 3 / 1.000.000 = $ 75
- Costo di produzione: 50.000 × 300 × 15 / 1.000.000 = $ 225
- Totale ≈ $ 300 al mese
Se hanno svolto lo stesso lavoro in un modello leggero (input ~ 1, output ~ 5):
- Ingresso: 50.000 × 500 × 1/1.000.000 = $ 25
- Produzione: 50.000 × 300 × 5 / 1.000.000 = $ 75
- Totale ≈ $ 100 al mese
Quindi semplicemente la selezione della fase può ridurre lo stesso lavoro da $ 300 a $ 100. Per un compito relativamente semplice come la descrizione di un prodotto, il modello leggero è spesso più che sufficiente.
Attenzione: questa formula è una stima approssimativa; la fatturazione effettiva varia in base a fattori quali l'utilizzo della cache, i nuovi tentativi e la modalità di ragionamento. Tuttavia, è un ottimo inizio per ottenere una conferma del budget o confrontare due modelli. È meglio misurare il numero reale con un piccolo pilota prima di prendere una decisione.
Cinque metodi per ridurre i costi
- Scegli il livello giusto. Modello semplice e leggero. Questa è la principale fonte di risparmio.
- Rimpicciolisci l'input. Invece di compilare enormi documenti per ogni richiesta, invia solo la sezione pertinente (ottimizzazione del contesto nell'unità 5).
- Limitare l'uscita. Chiarire la lunghezza e il formato della risposta; Risposta inutilmente lunga = costo inutile.
- Utilizza la memorizzazione nella cache. Many providers allow you to cache and re-read repeated fixed inputs (e.g. the same system instruction) much cheaper. Ciò garantisce risparmi significativi se si inviano le stesse istruzioni di grandi dimensioni migliaia di volte.
- Eseguire l'elaborazione batch. Se non hai fretta, le opzioni "batch", che inviano molte richieste in blocco e le elaborano con uno sconto, riducono significativamente i costi.
Tre casi realistici
Caso 1 – Risparmi con cambio di passo. Un team dell'assistenza clienti stava riepilogando tutte le e-mail in arrivo con il modello più efficace e la loro fattura mensile era di circa $ 900. Riassumere è stato un compito semplice; Quando sono passati al livello bilanciato, la qualità dell'output è rimasta quasi la stessa, ma il conto è sceso a ~$250. Risparmi ~$7.800 all'anno, semplicemente scegliendo il livello giusto.
Caso 2: salvataggio con cache. Un team di software inviava lo stesso documento di “standard di codifica” da 8.000 token con ogni richiesta di revisione del codice. 400 richieste al giorno × 8.000 token = input ripetitivo di grandi dimensioni. Quando hanno attivato la funzione cache, questa partizione fissa ha iniziato a essere letta in modo molto più economico e una parte significativa dei costi di input è scomparsa.
Caso 3 – Risparmi derivanti dalla limitazione della produzione. Quando un team di marketing chiedeva una descrizione del prodotto, il modello produceva paragrafi lunghi e fioriti alla volta. Quando hanno aggiunto la restrizione "massimo 60 parole, singolo paragrafo", le spiegazioni sono diventate più utili e il token di output è stato dimezzato. Mentre la qualità aumentava, i costi diminuivano; vantaggioso per tutti.
Prompt debole / Prompt forte
Suggerimento debole:
Scrivimi una bella descrizione per questo prodotto. [informazioni sul prodotto]
La modella può scrivere quanto vuole; Il token di output non è controllato.
Suggerimento potente:
Il tuo ruolo: copywriter e-commerce. Prodotto: [INFORMAZIONI]. Compito: scrivere una descrizione del prodotto. Restrizioni: massimo 60 parole, un paragrafo, rivolto a clienti non tecnici, contiene 2 vantaggi + 1 caso d'uso. Evita aggettivi fantasiosi.
Il potente prompt controlla sia la qualità che la lunghezza dell'output (e quindi il costo).
Modelli copiabili
1. Preventivo di costo mensile:
Faccio richieste di [QUANTITÀ] mensilmente. Ingresso medio ~[NUM] token, output ~[NUM] token. Calcola il costo mensile per i seguenti modelli ([MODELLO A], [MODELLO B]) con la formula e confrontalo in una tabella. Accettare i prezzi di input/output [PREZZI].
Confronto livello 2:
Il mio dovere [COMPITO]. Questo lavoro richiede davvero un modello potente o è sufficiente un modello leggero/equilibrato? Valuta in termini di qualità e costo e suggeriscimi 2 livelli per il test pilota.
3. Screening della riduzione dei costi:
Identificare i modi per ridurre i costi nel seguente flusso di lavoro: [FLUSSO DI LAVORO]. Scrivere la fattibilità e i risparmi stimati per ciascuna delle intestazioni di elaborazione a cascata, riduzione dell'input, limite di output, cache ed elaborazione batch.
4. Limitazione dell'output:
Riscrivere la seguente richiesta per ridurre il token di output senza ridurre la qualità: "[PROMPT]". Ottimizza per lunghezza, formato e ripetizioni non necessarie.
Errori comuni
- Tralasciare la differenza input/output: consentire risposte lunghe senza sapere che l'output è molto più costoso.
- Il modello più potente per ogni lavoro: svolgere un lavoro semplice con un modello costoso e pagare molte volte di più inutilmente.
- Rilascio della lunghezza di output: concessione di un permesso di scrittura illimitato al modello senza imporre alcuna restrizione di formato o lunghezza.
- Ignorare cache e batch: perdere gravi opportunità di risparmio per input ripetitivi e attività non urgenti.
- Pensare che i prezzi siano aggiornati: Affidarsi ad una vecchia tabella dei prezzi e pianificare il budget in modo errato; i prezzi cambiano frequentemente.
In sintesi
- Il prezzo è calcolato in base ai token; input e output hanno un prezzo separato e l'output è spesso molte volte più costoso.
- Puoi stimare approssimativamente il costo mensile utilizzando la formula numero di richieste × token medio × prezzo.
- La sola selezione corretta del passaggio può ridurre i costi molte volte.
- La minimizzazione dell'input, la limitazione dell'output, la memorizzazione nella cache e l'elaborazione batch sono metodi pratici che riducono significativamente la bolletta.
Compito dell'applicazione
Ottieni i valori dei token stimati nell'unità precedente. Calcola il costo mensile della tua attività per due diversi livelli con il modello 1 in questa unità (stima del costo mensile). Quindi, con il terzo modello (scansione per la riduzione dei costi), deduci il risparmio che ciascun metodo può apportare al tuo flusso di lavoro. Pianifica di scegliere i due metodi più promettenti e applicali al budget del mese prossimo.
lista di controllo
- [] So che i token di input e output hanno un prezzo separato e l'output è più costoso.
- [ ] Posso stimare approssimativamente il costo mensile di un flusso di lavoro con la semplice formula.
- [ ] Posso mostrare l'impatto sui costi della scelta del livello giusto con un esempio.
- [ ] Sono in grado di riconoscere cinque metodi di riduzione dei costi e di scegliere quello appropriato.
- [] Posso riscrivere un prompt per ridurre il token di output.