Einheit 2 / 11

Token- und Preislogik

Gewinne:

  • Erklären Sie das Konzept des Tokens, der Eingabe-/Ausgabe-Token-Unterscheidung und der Tokenisierung.
  • Kann die Kosten einer Anfrage und einen monatlichen Arbeitsaufwand aus der Anzahl der Token und dem Stückpreis berechnen
  • Kann die Auswirkungen der Modellauswahl und der Eingabeaufforderungslänge auf die Kosten vergleichen

Sie können keine maßstabsgetreue Lösung erstellen, ohne die Wirtschaftlichkeit von LLM-APIs zu verstehen. Eine Demo läuft einmal; Das Wichtigste ist, vorhersagen zu können, wie hoch die Rechnung sein wird, wenn pro Monat Tausende von Anrufen getätigt werden. In dieser Einheit erklären wir die finanzielle Seite der Dinge: Was ist ein Token, warum werden Input und Output unterschiedlich bepreist, wie berechnet man die Kosten einer Anfrage und wie budgetiert man eine monatliche Arbeitslast? Mit diesen Informationen können Sie den Ertrag von Optimierungstechniken (Caching, Modellauswahl, Batch) in nachfolgenden Einheiten messen.

Was ist ein Token?

Token ist die kleinste Einheit, in der das Modell Text verarbeitet. Ein Wort ist nicht immer ein Zeichen; Token ist normalerweise ein Teil eines Wortes. Grob gesagt entspricht 1 Token im Englischen ≈ 4 Zeichen ≈ 0,75 Wörtern. Im Türkischen und im Code variiert das Verhältnis: Türkische Wörter werden aufgrund ihrer Suffixstruktur und des Alphabets oft in mehr Token unterteilt als im Englischen. Daher ist es notwendig, die Anzahl der Token mit dem Token-Zähltool des Anbieters zu messen, anstatt sie nach Augenmaß zu erraten.

Die Tokenisierung (der Prozess der Aufteilung von Text in Token) kann für jedes Modell unterschiedlich sein. Dies hat zwei praktische Konsequenzen: (1) Derselbe Text kann in verschiedenen Modellen eine unterschiedliche Anzahl von Token ergeben; (2) Vorhersagen, die mit Tokenizern anderer Anbieter (z. B. der Tiktoken-Bibliothek von OpenAI) gemacht werden, sind für Claude ungenau – verwenden Sie den Token-Zähltipp für das von Ihnen verwendete Modell.

Hinweis: „Ungefähr wie viele Token?“ Beantworten Sie die Frage nicht blind. Übergeben Sie einen repräsentativen Text über die Token-Zähl-API. Basieren Sie Budgetentscheidungen auf Messungen.

Eingabe- und Ausgabetoken

Die Rechnung besteht aus zwei Posten:

  • Eingabetokens: Alles, was Sie an das Modell senden – Systemaufforderung, vergangene Touren, Benutzermeldung, Dokumentation, falls vorhanden. Diese werden alle auf einmal verarbeitet.
  • Ausgabetoken: Die vom Modell erzeugte Antwort. Für jeden Ausgabetoken führt das Modell die Berechnung Schritt für Schritt durch.

Bei den meisten Anbietern ist der Output um ein Vielfaches teurer als der Input. Der Grund ist einfach: Die Eingabe auf einmal zu lesen ist günstiger, als die Ausgabe Token für Token zu erzeugen. Die Kenntnis dieser Asymmetrie erklärt, warum Optimierungen wie „prägnante Antworten erfordern“ so effektiv sind.

Beispielpreise (pro 1 Million Token, USD)

Die folgende Tabelle dient als Referenz. Die Preise können sich im Laufe der Zeit ändern. Bitte überprüfen Sie die aktuelle Liste Ihres Anbieters.

Modellklasse

Beispielmodell

Input ($/1 Mio.)

Produktion ($/1 Mio.)

Typische Verwendung

schnell/günstig

Haiku 4.5

1,00

5.00

Klassifizierung, Kennzeichnung, einfache Zusammenfassung

ausgeglichen

Sonett 5

3,00

15.00

Allgemeine Zwecke, Codierung, Agentenarbeit

stark

Opus 4.8

5.00

25.00

Komplexes Denken, weitreichende Aufgaben

In jeder Klasse beträgt der Output das Fünffache des Inputs; Darüber hinaus ist selbst die Leistungsaufnahme des leistungsstarken Modells fünfmal so hoch wie die Leistungsaufnahme des günstigen Modells. Diese beiden Achsen (Input↔Output und Modellklasse) bilden den Rahmen Ihrer Kostenentscheidungen.

Wie berechnet man die Kosten?

Die Formel ist einfach:

Kosten = (Eingabetoken / 1.000.000) × Eingabepreis + (Ausgabetoken / 1.000.000) × Ausgabepreis

Beispielkonto. Eine Anfrage mit Sonnet 5: 1.500 Input-Tokens, 400 Output-Tokens.

Input = 1.500 / 1.000.000 × 3,00 = 0,0045 $ Output = 400 / 1.000.000 × 15,00 = 0,0060 $ Gesamt = 0,0105 $ (ca. 1 Cent)

Ein Anruf sieht billig aus. Aber mit dem Volumen multiplizieren: 20.000 Anrufe pro Tag → 210 $ pro Tag, ~6.300 $ pro Monat. Hier kommt die Skalierung ins Spiel.

Monatliche Budgetvorlage

Verwenden Sie diese Vorlage, um die monatlichen Kosten einer Arbeitslast zu extrahieren:

1) Durchschnittlicher Input-Token pro Anfrage: ......2) Durchschnittlicher Output-Token pro Anfrage: ......3) Anzahl der Anfragen pro Tag: ......4) Arbeitstage pro Monat: ......5) Kosten pro Anfrage = (1)/1M×Eingabepreis + (2)/1M×Ausgabepreis6) Monatliche Kosten = (5) × (3) × (4)

Dieses Muster in eine Kalkulationstabelle zu übertragen und zu sehen, wie sich die Summe auswirkt, wenn Sie das Modell ändern, verkörpert die Entscheidungen zur Modellauswahl (Einheit 5) und Cache (Einheit 6).

Mit kopierbaren Vorlagen die Eingabeaufforderung verkürzen

Der größte Teil der Kosten entsteht durch unnötig lange Eingabeaufforderungen und verschwendete Ausgaben. Die folgenden Vorlagen ermöglichen direkte Einsparungen.

# Ausgabelänge begrenzen. Antworten Sie mit maximal 3 Items. Fügen Sie eine Begründung oder einen einleitenden Satz hinzu.

# Nur das angeforderte Feld zurückgeben. Nur den folgenden JSON-Code zurückgeben, keinen weiteren Text hinzufügen:{"category": "...", "urgency": "low|medium|high"}

# Unnötigen Kontext entfernenEntfernen Sie nur das Datum und den Betrag aus dem folgenden Text. Wiederholen Sie nicht den gesamten Text.Text: „““{{text}}““

# Fassen Sie die lange Rede zusammen (Eingabespeicherung). Fassen Sie diese Rede in 5 Elementen zusammen. Ich werde diese Zusammenfassung in den folgenden Runden anstelle der vollständigen Vergangenheit verwenden. Rede: „““{{past}}““

Schwache Eingabeaufforderung / Starke Eingabeaufforderung (in Bezug auf die Kosten)

# SCHWACH (Veröffentlichungsausgabe, teuer) Analysieren Sie diese Supportanfrage und schreiben Sie mir eine umfassende Bewertung.

# STARK (schränkt die Ausgabe ein, günstig und vorhersehbar)Klassifizieren Sie diese Supportanfrage. Geben Sie einfach den folgenden JSON-Code zurück:{"category": "invoice|technical|refund|other", "urgency": "low|medium|high"}Schreiben Sie keine Beschreibung.

Die schwache Version produziert vielleicht 500 Ausgabetoken; starke Version ~15. Da die Ausgabe teuer ist, ist dies ein erheblicher Unterschied pro Anruf und vervielfacht sich mit dem Volumen.

Drei Mini-Hüllen

Fall 1 – Die versteckten Kosten der langen Eingabeaufforderung. Während eine Buchhaltungsautomatisierung jede Rechnung sortierte, fügte sie jeder Anfrage ein 40-seitiges „Regelwerk“ als Eingabe hinzu: ~12.000 Eingabe-Tokens pro Anfrage. Mit Sonnet 5 12.000/1M×3 = 0,036 $ gerade eingegeben. 5.000 Rechnungen pro Tag → 180 $ pro Tag. Durch die Zwischenspeicherung des Regelwerks (Einheit 6) sanken die Eingabekosten um etwa 90 %.

Fall 2 – Der Nutzen der Verkleinerung des Modells. Ein Team führte mit Opus 4.8 ein einfaches „positives/negatives“ Sentiment-Tagging durch: 300 Input- + 10 Output-Tokens. Opus kostet 300/1M×5 + 10/1M×25 = 0,00175 $. Beim Wechsel zu Haiku, 300/1M×1 + 10/1M×5 = 0,00035 $ – 5x günstiger, war der Unterschied in der Genauigkeit unermesslich. Bei 3 Millionen Anrufen pro Monat beträgt die Differenz 5.250 $ → 1.050 $.

Fall 3 – Ausgabe freigeben. Wenn ein Marketingteam eine Produktbeschreibung erstellte, setzte es der Ausgabe keine Grenzen; Das Modell sagte manchmal 1.500 Token. Als ich die Anweisung „maximal 60 Wörter“ hinzufügte, sank die durchschnittliche Ausgabe von 900 auf 90 Token. Da das Drucken teuer war, wurde die monatliche Rechnung um ein Drittel reduziert und Texte wurden nützlicher.

Häufige Fehler

  • Erraten des Tokens mit dem Auge: Vor allem im Türkischen und im Code kann man sich irren. Messen.
  • Unter der Annahme, dass Input und Output gleich sind: Der Output ist in der Regel deutlich teurer; Der größte Teil der Optimierung ergibt sich aus der Verkürzung der Ausgabe.
  • Lassen Sie sich nicht von der Billigkeit eines einzelnen Anrufs täuschen: Die Entscheidung wird durch das Volumen getroffen. 0,01 $ × Millionen = 10.000 $.
  • Vorhersage mit dem Tokenizer eines anderen Anbieters: Liefert falsche Ergebnisse; Verwenden Sie das Token-Zähltool des Modells.
  • Unbegrenzte Erweiterung des Gesprächsverlaufs: Jede Runde wird dem Eintrag hinzugefügt; in langen Gesprächen zusammenfassen.
  • „max_tokens“ unnötig hoch halten: Verbirgt den Budgetplan und das Risiko einer Kürzung; Geben Sie einen realistischen Wert an.

Tiefer: Kontextfenster und lange Eingabekosten

Es ist wichtig zu sehen, wie sich der Preis „im gesamten Gespräch“ und nicht nur „pro Anfrage“ verhält. Die gesamte Textmenge, die das Modell verarbeiten kann, wird als Kontextfenster bezeichnet. Die Summe aus Ein- und Ausgabe muss in dieses Fenster passen. Moderne Modelle bieten sehr große Fenster (Hunderttausende oder sogar Millionen von Token), aber das bedeutet nicht, dass Sie es „unendlich füllen“ können – alles, was Sie in das Fenster eingeben, wird als Eingabe abgerechnet.

Die Falle bei langen Gesprächen ist folgende: Mit jeder neuen Runde sendet man die gesamte Historie erneut (Staatenlosigkeit in Einheit 1). In einem 20-Runden-Gespräch enthält die 20. Anfrage die gesamten ersten 19 Runden als Eingabe. Wenn das Gespräch länger wird, steigen die Kosten pro Anfrage also kumulativ und nicht linear. Ein 50-Runden-Gespräch mit einem Agentenassistenten kann in der ersten Runde ein Dutzend Mal mehr Eingabekosten verursachen.

Es gibt zwei Möglichkeiten, dies zu verwalten. Die erste ist die Zusammenfassung: Komprimieren älterer Runden in einem einzigen Zusammenfassungsblock, wobei nur die letzten paar Runden roh bleiben. Die zweite Möglichkeit ist das prompte Caching (Einheit 6): Das Lesen des festen Kontexts kostet nur ein Zehntel des Preises, anstatt ihn wiederholt zum vollen Preis zu verarbeiten. Zusammen reduzieren sie die Kosten für lange, kontextintensive Arbeitslasten erheblich. Bei der Token-Ökonomie geht es also um die Gestaltung der gesamten Sitzung und nicht um eine einzelne Anfrage.

Zusammenfassend

Token ist die kleinste Einheit, in der Text verarbeitet wird; Input und Output werden separat berechnet, und der Output ist oft viel teurer. Die Kosten sind die Anzahl der Token multipliziert mit dem Stückpreis, und die eigentliche Entscheidung wird anhand des Volumens getroffen. Die Verkürzung der Eingabeaufforderung, die Begrenzung der Leistung und die Auswahl des leichtesten Modells, das die Aufgabe erfüllt, sind die direktesten Hebel, die die Kosten um ein Vielfaches senken.

Anwendungsaufgabe

Wählen Sie eine eigene Aufgabe. (1) Bestimmen Sie die Anzahl der Eingabe- und geschätzten Ausgabe-Tokens für eine repräsentative Eingabeaufforderung (messen Sie nach Möglichkeit mit einem Token-Zähltool). (2) Berechnen Sie die Kosten pro Anfrage für die drei Modellklassen. (3) Schätzen Sie Ihre tägliche Anzahl an Anfragen und leiten Sie das monatliche Budget für die drei Modelle ab. (4) Fügen Sie eine Anweisung zur Verkürzung der Ausgabe hinzu und notieren Sie die erwarteten Einsparungen.

Checkliste

  • [ ] Ich kann das Konzept von Token erklären und dass die Tokenisierung je nach Modell unterschiedlich ist.
  • [ ] Ich weiß, warum Input- und Output-Token unterschiedliche Preise haben.
  • [ ] Mit der Formel kann ich die Kosten einer Anfrage berechnen.
  • [ ] Ich kann mithilfe einer Vorlage ein Monatsbudget für einen Arbeitsaufwand erstellen.
  • [ ] Ich kann an einem Beispiel zeigen, welchen Nutzen die Verkürzung der Ausgabe und die Modellreduzierung haben.