Gewinne:
- Möglichkeit zum Lesen von Ein-/Ausgabe-Token-Preisen und Rechnungspositionen
- Möglichkeit, die monatlichen Kosten eines Workflows anhand einer groben Formel abzuschätzen
- Implementierung kostensenkender Methoden wie Caching, Stapelverarbeitung und Modell-Staging
Abschätzen zu können, wie viel ein Modell kosten wird, ist eine der praktischsten Fähigkeiten des Entscheidungsträgers. „Was bezahle ich monatlich?“ Wenn Sie die Frage nicht beantworten können, können Sie weder ein Budget planen noch das richtige Niveau wählen. Die gute Nachricht ist, dass die Preisgestaltung einfacher ist, als es sich anhört, und sobald Sie den Dreh raus haben, können Sie selbst eine grobe Schätzung erstellen. In dieser Einheit erfahren Sie, wie Sie die Preise für Eingabe-/Ausgabe-Tokens lesen, die monatlichen Kosten eines Workflows mit einer einfachen Formel abschätzen und Methoden kennen lernen, mit denen sich die Kosten tatsächlich senken lassen.
Faustregel: Input und Output werden separat berechnet
Bei Closed-Weight-Modellen wird der Preis auf der Grundlage der Menge der verarbeiteten Token berechnet und es gibt zwei separate Elemente:
- Eingabetoken (Eingabe): Der Text, den Sie an das Modell senden. Ihr Prompt, Ihre Unterlagen, Ihre Muster.
- Ausgabetoken: Die Antwort, die das Modell für Sie generiert.
Kritischer Punkt: Der Output-Token ist oft um ein Vielfaches teurer als der Input-Token. Dies liegt daran, dass es für das Modell rechenintensiver ist, eine Ausgabe zu erzeugen. In einem Modell könnte der Input beispielsweise 3 US-Dollar pro Million Token betragen, während der Output 15 US-Dollar betragen könnte; Der Output ist also fünfmal teurer. Das bedeutet, dass lange und unnötige Antworten schnell das Budget verschlingen können.
Tipp: Eine der einfachsten Möglichkeiten, Kosten zu senken, besteht darin, das Modell nicht um unnötig lange Antworten zu bitten. Einschränkungen wie „maximal 5 Artikel“, „einzelner Absatz“, „nur die Tabelle exportieren“ erhöhen die Qualität und schonen den Ausgabetoken.
Aktuelle Preisbeispiele
Nachfolgend finden Sie die ungefähren Preise mehrerer Modelle (pro Million Token, US-Dollar). Diese Werte stammen aus dem Zeitraum, in dem dieses Modul erstellt wurde, und ändern sich häufig; Die genaue Entscheidung entnehmen Sie bitte der aktuellen Preisseite des Anbieters.
Modell
Bühne
Geben Sie 1 Mio. $ ein
Ausgabe $/1 Mio
Claude Opus 4.8
stark
~5
~25
Claude Sonett 5
ausgeglichen
~3
~15
Claude Haiku 4.5
leicht
~1
~5
Wie aus der Tabelle hervorgeht, kann es zwischen der starken und der leichten Stufe einen Preisunterschied von bis zu fünffachen geben. Aus diesem Grund ist der Ansatz „das beste Modell für alle Unternehmen“ oft Geldverschwendung. Wenn die einfache Arbeit von einem günstigen Modell und die schwierige Arbeit von einem leistungsstarken Modell erledigt wird, können Sie große Einsparungen ohne Qualitätsverlust erzielen. Wir werden diesen Gedanken in den Einheiten 7 und 9 vertiefen.
Schätzung der monatlichen Kosten: Einfache Formel
Für eine grobe monatliche Kostenschätzung können Sie diese Formel verwenden:
Monatliche Kosten ≈ (Anzahl der Anfragen pro Monat × Durchschnittlicher Eingabetoken × Eingabepreis / 1.000.000)+ (Anzahl der Anfragen pro Monat × Durchschnittlicher Ausgabetoken × Ausgabepreis / 1.000.000)
Lassen Sie uns ein Beispiel ausführen. Nehmen wir an, ein E-Commerce-Team erstellt monatlich 50.000 Produktbeschreibungen. Jede Anfrage sendet durchschnittlich 500 Input-Tokens (Produktinformationen) und empfängt 300 Output-Tokens (Beschreibung). In einem ausgeglichenen Modell (Eingang ~3, Ausgang ~15):
- Eingabekosten: 50.000 × 500 × 3 / 1.000.000 = 75 $
- Produktionskosten: 50.000 × 300 × 15 / 1.000.000 = 225 $
- Insgesamt ≈ 300 $/Monat
Wenn sie die gleiche Aufgabe in einem leichten Modell erledigt hätten (Eingabe ~1, Ausgabe ~5):
- Eingabe: 50.000 × 500 × 1 / 1.000.000 = 25 $
- Ausgabe: 50.000 × 300 × 5 / 1.000.000 = 75 $
- Gesamt ≈ 100 $/Monat
Allein durch die Auswahl der einzelnen Phasen kann die gleiche Arbeit von 300 auf 100 US-Dollar reduziert werden. Für eine relativ einfache Aufgabe wie eine Produktbeschreibung ist das Lightweight-Modell oft mehr als ausreichend.
Achtung: Bei dieser Formel handelt es sich um eine grobe Schätzung; Die tatsächliche Abrechnung variiert je nach Faktoren wie Cache-Nutzung, Wiederholungsversuchen und Argumentationsmodus. Dennoch ist es ein sehr guter Anfang, um eine Budgetbestätigung zu erhalten oder zwei Modelle zu vergleichen. Am besten messen Sie die tatsächliche Zahl mit einem kleinen Piloten, bevor Sie eine Entscheidung treffen.
Fünf Methoden zur Kostensenkung
- Wählen Sie das richtige Level. Einfaches, leichtes Modell. Dies ist die größte Einsparquelle.
- Verkleinern Sie die Eingabe. Anstatt für jede Anfrage riesige Dokumente auszufüllen, senden Sie nur den relevanten Abschnitt (Kontextoptimierung in Einheit 5).
- Begrenzen Sie die Ausgabe. Klären Sie die Länge und das Format der Antwort; Unnötig lange Antwort = unnötige Kosten.
- Verwenden Sie Caching. Many providers allow you to cache and re-read repeated fixed inputs (e.g. the same system instruction) much cheaper. Dies führt zu erheblichen Einsparungen, wenn Sie dieselbe große Anweisung tausende Male senden.
- Führen Sie eine Stapelverarbeitung durch. Wenn Sie es nicht eilig haben, können Sie mit „Batch“-Optionen, bei denen viele Anfragen in großen Mengen gesendet und mit einem Rabatt bearbeitet werden, die Kosten erheblich senken.
Drei realistische Fälle
Fall 1 – Einsparungen durch schrittweise Änderung. Ein Kundendienstteam fasste alle eingehenden E-Mails mit dem stärksten Modell zusammen und seine monatliche Rechnung betrug etwa 900 US-Dollar. Das Zusammenfassen war eine einfache Aufgabe; Als sie zur ausgewogenen Stufe wechselten, blieb die Ausgabequalität nahezu gleich, aber die Rechnung sank auf etwa 250 US-Dollar. Einsparungen von ca. 7.800 US-Dollar pro Jahr, allein durch die Wahl der richtigen Stufe.
Fall 2 – Speichern mit Cache. Ein Softwareteam schickte bei jeder Codeüberprüfungsanfrage dasselbe Dokument mit 8.000 Token „Codierungsstandards“. 400 Anfragen pro Tag × 8.000 Token = große repetitive Eingabe. Als sie die Cache-Funktion aktivierten, begann das Lesen dieser festen Partition viel kostengünstiger und ein erheblicher Teil der Eingabekosten verschwand.
Fall 3 – Einsparungen durch Produktionsbegrenzung. Als ein Marketingteam nach einer Produktbeschreibung fragte, produzierte das Model jeweils lange, blumige Absätze. Als sie die Beschränkung „maximal 60 Wörter, einzelner Absatz“ hinzufügten, wurden die Erklärungen nützlicher und der Ausgabetoken wurde halbiert. Während die Qualität stieg, sanken die Kosten; Win-Win.
Schwache Eingabeaufforderung / Starke Eingabeaufforderung
Schwache Eingabeaufforderung:
Schreiben Sie mir eine schöne Beschreibung für dieses Produkt. [Produktinformationen]
Das Model kann so lange schreiben, wie es möchte; Das Ausgabetoken ist unkontrolliert.
Kraftvolle Aufforderung:
Ihre Rolle: E-Commerce-Texter. Produkt: [INFORMATIONEN]. Aufgabe: Verfassen Sie eine Produktbeschreibung. Einschränkungen: Maximal 60 Wörter, ein Absatz, richtet sich an technisch nicht versierte Kunden, enthält 2 Vorteile + 1 Anwendungsfall. Vermeiden Sie ausgefallene Adjektive.
Die leistungsstarke Eingabeaufforderung steuert sowohl die Qualität als auch die Ausgabelänge (und damit die Kosten).
Kopierbare Vorlagen
1. Monatlicher Kostenvoranschlag:
Ich stelle monatlich [MENGE] Anfragen. Durchschnittliche Eingabe ~[NUM] Token, Ausgabe ~[NUM] Token. Berechnen Sie die monatlichen Kosten für die folgenden Modelle ([MODELL A], [MODELL B]) mit der Formel und vergleichen Sie sie in einer Tabelle. Akzeptieren Sie Input-/Output-Preise [PREISE].
Tier-2-Vergleich:
Meine Pflicht [AUFGABE]. Ist für diesen Job wirklich ein leistungsstarkes Modell erforderlich oder reicht ein leichtes/ausgeglichenes Modell aus? Bewerten Sie die Qualität und die Kosten und schlagen Sie mir zwei Stufen für einen Pilottest vor.
3. Kostensenkungsscreening:
Identifizieren Sie Möglichkeiten zur Kostenreduzierung im folgenden Workflow: [WORKFLOW].Schreiben Sie die Machbarkeit und die geschätzten Einsparungen für jeden der Kaskaden-, Eingabereduzierungs-, Ausgabebindungs-, Cache- und Stapelverarbeitungsheader.
4. Leistungsbegrenzung:
Schreiben Sie die folgende Eingabeaufforderung um, um das Ausgabetoken zu reduzieren, ohne die Qualität zu beeinträchtigen: „[PROMPT]“. Optimieren Sie Länge, Format und unnötige Wiederholungen.
Häufige Fehler
- Den Eingabe-/Ausgabeunterschied überspringen: Lange Antworten zulassen, ohne zu wissen, dass die Ausgabe viel teurer ist.
- Das leistungsstärkste Modell für jeden Job: Eine einfache Arbeit mit einem teuren Modell erledigen und unnötigerweise ein Vielfaches mehr bezahlen.
- Ausgabelänge freigeben: Dem Modell uneingeschränkte Schreibberechtigung erteilen, ohne Format- oder Längenbeschränkungen aufzuerlegen.
- Cache und Batch ignorieren: Es werden ernsthafte Einsparmöglichkeiten für sich wiederholende Eingaben und nicht dringende Aufgaben verpasst.
- Denken, dass die Preise auf dem neuesten Stand sind: Sich auf eine alte Preistabelle verlassen und das Budget falsch planen; Die Preise ändern sich häufig.
Zusammenfassend
- Der Preis wird auf Basis von Token berechnet; Input und Output werden separat bepreist, und der Output ist oft um ein Vielfaches teurer.
- Sie können die monatlichen Kosten anhand der Formel Anzahl der Anfragen × durchschnittlicher Token × Preis grob abschätzen.
- Allein durch die richtige Auswahl der Schritte können die Kosten um ein Vielfaches gesenkt werden.
- Eingabeminimierung, Ausgabebegrenzung, Caching und Stapelverarbeitung sind praktische Methoden, die die Rechnung deutlich reduzieren.
Anwendungsaufgabe
Rufen Sie die Tokenwerte ab, die Sie in der vorherigen Einheit geschätzt haben. Lassen Sie mit der Vorlage 1 in dieser Einheit (monatliche Kostenschätzung) die monatlichen Kosten Ihres Unternehmens für zwei verschiedene Ebenen berechnen. Ermitteln Sie dann anhand der dritten Vorlage (Kostenreduzierungsscan), wie viel Einsparungen jede Methode für Ihren Arbeitsablauf bringen kann. Planen Sie, die beiden vielversprechendsten Methoden auszuwählen und sie auf Ihr Budget für den nächsten Monat anzuwenden.
Checkliste
- [ ] Ich weiß, dass Eingabe- und Ausgabe-Token separat berechnet werden und die Ausgabe teurer ist.
- [ ] Mit der einfachen Formel kann ich die monatlichen Kosten eines Workflows grob abschätzen.
- [ ] Ich kann anhand eines Beispiels zeigen, welche Kostenauswirkungen die Wahl des richtigen Niveaus hat.
- [ ] Ich kann fünf Kostensenkungsmethoden erkennen und die geeignete auswählen.
- [] Ich kann eine Eingabeaufforderung umschreiben, um das Ausgabetoken zu reduzieren.