Einheit 5 / 11

Modelauswahl: Das richtige Model für den richtigen Job

Gewinne:

  • Kann die Modellfamilie (schnell/ausgewogen/leistungsstark) hinsichtlich Leistungsfähigkeit, Geschwindigkeit und Kosten vergleichen
  • Entwirft Modellauswahl- und Routing-Strategien entsprechend der Aufgabenkomplexität
  • Basiert die Modellauswahl auf Beweisen mit einer kleinen Anzahl von Bewertungen

Die einzige Entscheidung, die das beste Preis-Leistungs-Verhältnis und die beste Qualität bei der LLM-Integration bestimmt, ist, welches Modell Sie verwenden. Der übliche Reflex ist „Wähle das stärkste Modell“; Allerdings bedeutet dies oft unnötige Kosten und Verzögerungen. Der richtige Ansatz besteht darin, das leichteste Modell zu wählen, das jede Aufgabe erfüllt, und diese Wahl auf Messungen und nicht auf Vermutungen zu stützen. In dieser Einheit vergleichen Sie die Modellfamilie auf der Achse Fähigkeit/Geschwindigkeit/Kosten, erstellen eine Modell-Routing-Strategie entsprechend der Aufgabenkomplexität und belegen die Auswahl anhand einer kleinen Reihe von Bewertungen.

Die Modellfamilie verstehen

Anbieter bieten im Allgemeinen drei Klassen an: schnell/günstig, stabil und leistungsstark. Die Beziehung zwischen ihnen lässt sich auf drei Achsen zusammenfassen: Fähigkeit (Fähigkeit, schwierige Aufgaben zu lösen), Geschwindigkeit (Latenz), Kosten (Token-Preis).

Klasse

Beispiel

Talent

Geschwindigkeit

Kosten

Verfügbare Aufgaben

schnell

Haiku 4.5

mittel

sehr hoch

niedrig

Klassifizierung, Kennzeichnung, Kurzzusammenfassung, Orientierung

ausgeglichen

Sonett 5

hoch

hoch

mittel

Allgemeine Zwecke, Codierung, mehrstufiger Ablauf, die meisten Agentenarbeiten

stark

Opus 4.8

am höchsten

mittel

hoch

Komplexes Denken, weitreichende autonome Aufgaben, schwierige Analyse

Kritische Erkenntnis: Das leistungsstärkere Modell schneidet nicht bei jeder Aufgabe besser ab. Bei einer einfachen „dringend oder nicht“-Kennzeichnung geben das starke Modell und das schnelle Modell die gleiche richtige Antwort; Der einzige Unterschied besteht darin, dass die leistungsstarken Modelle fünfmal teurer und langsamer sind. Zusätzliches Talent schafft nur dann einen Wert, wenn die Mission es erfordert.

Schritt für Schritt: Wie wähle ich ein Modell aus?

  1. Klassifizieren Sie die Aufgabe. Ist es routinemäßig/gemustert (Kennzeichnung, Schlussfolgerung) oder ergebnisoffen/mehrschrittig (Analyse, Planung, Code)?
  2. Beginnen Sie mit dem leichtesten Kandidaten. Versuchen Sie es mit dem schnellen Modell. Wenn das reicht, hör auf.
  3. Wenn es nicht reicht, steigen Sie in eine höhere Klasse auf. Wenn die Genauigkeit gering ist, gehen Sie zur ausgewogenen Variante, wenn das nicht ausreicht, gehen Sie zur starken Variante.
  4. Messen, nicht raten. Vergleichen Sie die Genauigkeit und die Kosten jedes Kandidaten mit einem kleinen Bewertungssatz (unten).
  5. Umleitung einrichten. Anstatt eine Verbindung zu einem einzelnen Modell herzustellen, verteilen Sie die Aufgabe mit einem „Router“ auf das richtige Modell.

Modellrouting

Die tatsächliche Arbeitsbelastung ist gemischt: Die meisten eingehenden Anfragen sind einfach, einige sind schwierig. Es ist eine Verschwendung, sie alle dem leistungsstarken Modell zuzuordnen. Wenn Sie sie alle an das schnelle Modell senden, verringert sich die Qualität. Routing löst dieses Problem: Ein billiges Modell (oder eine einfache Regel) klassifiziert zuerst die Aufgabe, dann geht der Job an das entsprechende Modell.

# Router-Eingabeaufforderung (funktioniert mit günstigem Modell) Klassifizieren Sie die eingehende Anfrage nach ihrer Schwierigkeit. Geben Sie nur das folgende JSON zurück:{"difficulty": "simple|complex"}Einfach: einschrittig, formelhaft, kurze Antwort. Komplex: erfordert mehrstufige Argumentation, Analyse oder lange Generierung. Anfrage: """{{request}}"""

  • Gehen Sie zum einfachen → schnellen Modell (günstig, schnell).
  • Gehen Sie zu komplex → leistungsstarkes Modell (teuer, aber notwendig).

Dieses Muster reduziert die durchschnittlichen Kosten erheblich, da der Großteil des Datenverkehrs im Allgemeinen einfach ist.

Tipp: Für eine Überweisungsentscheidung ist nicht immer ein LLM erforderlich. Einfache Regeln wie „Gehen Sie zum Schnellmodell, wenn der Text weniger als 20 Wörter umfasst“ dienen ebenfalls als Orientierung und verursachen keine zusätzlichen Token-Kosten. Versuchen Sie es zuerst mit der Regel.

Auswahl mit Beweisen verknüpfen: Der kleine Evaluierungscluster

Wählen Sie ein Modell nicht nach dem Motto „Es sieht für mich besser aus“. Eval (Bewertungssatz) ist ein kleiner Satz von Stichproben, für die die richtige Antwort bekannt ist; Sie führen jedes Modell auf diesem Satz aus und messen Genauigkeit, Kosten und Latenz.

# Evaluierungs-Setup-Vorlage1) Sammeln Sie 20–50 reale Beispiele, schreiben Sie die „richtige Antwort“ handschriftlich auf jedes.2) Führen Sie jedes Modell (schnell/ausgewogen/stark) auf diesem Satz aus.3) Für jedes Modell: Anzahl der Korrekturen, durchschnittlicher Durchsatz-Token, Kosten pro Anfrage, durchschnittliche Zeit.4) Wählen Sie das Modell, das „ausreichende Genauigkeit am günstigsten bietet“.

# Vergleichstabelle auswerten (füllen)Modell | Genauigkeit | Kosten pro Anfrage | Durchschnittliche DauerHaiku | ...% | ... $ | ... snSonett | ...% | ... $ | ... snOpus | ...% | ... $ | ...Sek

Schwache Eingabeaufforderung / Starke Eingabeaufforderung (Modellauswahlentscheidung)

# SCHWACH (keine Entscheidungsgrundlage) Nutzen wir das beste Modell, das Budget spielt keine Rolle.

# STARK (Entscheidung basierend auf Messung) Bei der Auswertung von 50 Proben ergab Haiku eine Genauigkeit von 96 %, Sonnet eine Genauigkeit von 97 %; Der Unterschied ist statistisch unbedeutend. Haiku wurde ausgewählt, weil es 5-mal günstiger und 2-mal schneller ist. Sinkt die Genauigkeit unter 95 %, wird automatisch die Entscheidung für ein Upgrade auf Sonnet getroffen.

Leistungsstarke Version; bindet die Auswahl an eine Zahl, einen Schwellenwert und eine Eskalationsregel. Dies verteidigt sowohl die heutige Entscheidung als auch zukünftige Veränderungen.

Drei Mini-Hüllen

Fall 1 – Entkommen Sie dem übermächtigen Modell. Ein Callcenter erstellte alle Gesprächszusammenfassungen mit Opus; Die monatliche Rechnung war hoch. Bei der 40-Proben-Bewertung lag Sonnet hinsichtlich der Genauigkeit 1 % hinter Opus zurück, kostete jedoch ein Drittel. Sie verlegten das zusammenfassende Werk in das Sonett; Die monatlichen Kosten sanken von 9.000 $ auf 3.100 $, ohne dass es zu Qualitätsbeanstandungen kam.

Fall 2 – Gemischter Verkehr mit Umleitung. 80 % der Anfragen eines Legal-Tech-Teams betrafen einfache Dokumentenkennzeichnungen, 20 % komplexe Vertragsanalysen. Sie schickten sie alle zum leistungsstarken Modell. Sie fügten einen billigen Router hinzu und verteilten einfache Aufträge an Haiku und komplexe Aufträge an Opus. Die durchschnittlichen Anfragekosten sanken um 64 %, während die Analysequalität erhalten blieb.

Fall 3 – Die Kosten einer Verkleinerung ohne Messung. Um die Kosten zu senken, reduzierte ein Team die komplexe Extraktion medizinischer Codes direkt auf das schnelle Modell. Sie haben nicht bewertet. Im Live-Betrieb sank die Genauigkeit von 92 % auf 78 %, was zu einer Rückkehr falscher Schlussfolgerungen führte. Sie mussten zunächst abschätzen: Für diese Aufgabe war das leistungsstarke Modell erforderlich. Lektion: Sowohl die Reduzierung als auch die Erhöhung erfolgen durch Messung.

Häufige Fehler

  • Der Reflex des „stärksten Modells“: Verschwendung und unnötige Verzögerung bei einfachen Aufgaben.
  • Modellwechsel ohne Messung: Sowohl Verkleinerung als auch Vergrößerung sind ohne Bewertung riskant.
  • Festlegung auf ein einziges Modell: Die Routenführung im gemischten Verkehr ist oft effizienter.
  • Den Router immer mit LLM verwechseln: Einfache Regeln können ohne Kosten funktionieren.
  • Kein Boost-Schwellenwert festlegen: Was passiert, wenn Genauigkeitsabfälle im Voraus definiert werden sollen?
  • Modellversion nicht reparieren: Notieren Sie, an welchem ​​Modell/welcher Version Sie in der Produktion arbeiten; Durch eine Versionsänderung kann sich das Verhalten ändern.

Tiefer: Evaluierung und inkrementelle Prüfung fortführen

Die Modellauswahl ist keine einmalige Entscheidung. Anbieter führen neue Modelle ein, Preise ändern sich, Ihre Stellenbeschreibung entwickelt sich weiter. Richten Sie den Evaluierungscluster also einmal ein und vergessen Sie es nicht. Halte es wie ein Lebewesen. Wenn ein neues Modell auf den Markt kommt, lassen Sie die gleichen 20–50 Proben durchlaufen, aktualisieren die Tabelle und treffen Ihre Entscheidung erneut. Dies schützt Sie vor der Falle der „Musterwechsel-Intuition“.

Die zweite fortgeschrittene Technik ist das Fallback-/Kaskadenmuster. Sie geben die Aufgabe zuerst dem Billigmodell; Wenn die Ausgabe eine geringe Zuverlässigkeit aufweist oder die Verifizierungsschicht (Einheit 11) sie ablehnt, eskalieren Sie dieselbe Anfrage. Der Großteil des Datenverkehrs wird also über das günstige Modell abgewickelt, während nur die verbleibende Minderheit über das teure Modell abgewickelt wird. Dies ist sowohl kostengünstiger als auch langlebiger als der feste Einzelmodell-Ansatz.

Der dritte Punkt ist, dass die Bewertung nicht nur die Genauigkeit, sondern auch Kosten und Latenz umfasst. Wenn ein Modell 1 % genauer, aber dreimal teurer und zweimal langsamer ist, lohnt sich der Kompromiss für die meisten Aufgaben nicht. Treffen Sie die Entscheidung entlang dreier Achsen (Genauigkeit, Kosten, Latenz) und definieren Sie eine „Zulänglichkeitsschwelle“: „Wenn die Genauigkeit über 95 % liegt, wählen Sie die günstigste.“

Notieren Sie abschließend, welches Modell/welche Version Sie in der Produktion verwendet haben. Wenn sich eines Tages die Ausgabequalität ändert, werden Sie zunächst prüfen, ob sich die Modellversion geändert hat. Durch die Versionsrückverfolgbarkeit lässt sich die Ursache von Qualitätsproblemen schneller finden.

Noch eine Einschränkung: Der Evaluierungscluster sollte Ihre tatsächliche Arbeitslast darstellen. Eine Bewertung, die nur aus einfachen Beispielen besteht, verbirgt, wo das Modell in schwierigen Fällen stolpert, und wiegt Sie in falschem Vertrauen. Eine gute Bewertung; Es enthält gängige einfache Beispiele sowie Eckfälle, denen Sie in der Realität begegnen (mehrdeutige, unvollständige, widersprüchliche Eingaben). Diese schwierige Minderheit bestimmt Ihre Modellwahl, denn in der einfachen Mehrheit setzt sich ohnehin jedes Modell durch. Halten Sie Ihre Bewertung frisch und repräsentativ, indem Sie ihr regelmäßig neue reale Beispiele hinzufügen.

Zusammenfassend

Das richtige Modell ist das leichteste Modell, das die Arbeit erledigt. Leistungsstärker ist nicht bei jeder Aufgabe besser, es ist nur teurer und langsamer. Durch die Klassifizierung der Aufgabe und das Beginnen mit dem leichtesten Kandidaten, die Verteilung des gemischten Datenverkehrs mit Routing und die Untermauerung der Auswahl mit einer kleinen Anzahl von Auswertungen werden die Kosten um ein Vielfaches gesenkt, während die Qualität erhalten bleibt.

Anwendungsaufgabe

Wählen Sie eine Arbeitsbelastung. (1) Klassifizieren Sie die Aufgabe als einfach/komplex. (2) Entwerfen Sie einen kleinen Bewertungssatz mit 20 realen Beispielen (mit ihren richtigen Antworten). (3) Erstellen Sie einen Plan, um die Genauigkeits-/Kosten-/Zeit-Vergleichstabelle für die drei Modellklassen zu füllen. (4) Wenn Sie gemischten Datenverkehr haben, schreiben Sie eine Routing-Regel und legen Sie einen Eskalationsschwellenwert fest.

Checkliste

  • [ ] Ich kann die Modellfamilie auf der Achse Leistungsfähigkeit/Geschwindigkeit/Kosten vergleichen.
  • [ ] Ich kann das Prinzip „leichtestes Erfolgsmodell“ anwenden.
  • [ ] Ich kann das Modellrouting entsprechend der Aufgabenkomplexität einrichten.
  • [ ] Mit einem kleinen Satz an Auswertungen kann ich die Auswahl an die Beweise binden.
  • [ ] Ich kann einen Upgrade-/Degradierungsschwellenwert definieren.