Guadagni:
- Può confrontare famiglie di modelli (veloci/bilanciati/potenti) in termini di capacità, velocità e costi
- Progetta la selezione del modello e le strategie di instradamento in base alla complessità dell'attività
- Basa la selezione del modello sull'evidenza con un piccolo insieme di valutazioni
L'unica decisione che determina il miglior rapporto qualità-prezzo e qualità nell'integrazione LLM è quale modello utilizzare. Il riflesso comune è “scegli il modello più forte”; Tuttavia, ciò spesso comporta costi e ritardi inutili. L'approccio giusto è quello di scegliere il modello più leggero in grado di svolgere ciascuna attività e basare tale scelta sulla misurazione, non su congetture. In questa unità confronterai la famiglia di modelli sull'asse capacità/velocità/costo, stabilirai una strategia di instradamento del modello in base alla complessità del compito ed evidenzierai la selezione con un piccolo insieme di valutazioni.
Comprendere la famiglia modello
I provider generalmente offrono tre classi: veloce/economico, stabile e potente. La relazione tra loro è riassunta su tre assi: abilità (potere di risolvere compiti difficili), velocità (latenza), costo (prezzo simbolico).
classe
esempio
talento
velocità
Costo
Compiti disponibili
veloce
Haiku 4.5
medio
molto alto
basso
Classificazione, etichettatura, breve sintesi, orientamento
equilibrato
sonetto 5
alto
alto
medio
Scopo generale, codifica, flusso in più fasi, la maggior parte del lavoro degli agenti
forte
Opera 4.8
più alto
medio
alto
Ragionamento complesso, compiti autonomi a lungo termine, analisi difficili
Intuizione critica: il modello più potente non offre prestazioni migliori in ogni lavoro. In una semplice etichettatura "urgente o no", il modello forte e il modello veloce danno la stessa risposta corretta; l'unica differenza è che il potente è 5 volte più costoso e più lento. Il talento extra produce valore solo quando la missione lo richiede.
Passo dopo passo: come scegliere un modello?
- Classificare il compito. È di routine/strutturato (etichettatura, inferenza) o aperto/in più passaggi (analisi, pianificazione, codice)?
- Inizia con il candidato più leggero. Provalo con il modello veloce. Se ti basta, fermati.
- Se non bastasse, passa ad una classe superiore. Se la precisione è bassa, vai a quella bilanciata, se ciò non basta, vai a quella forte.
- Misura, non indovinare. Confronta l'accuratezza e il costo di ciascun candidato con un piccolo set di valutazioni (sotto).
- Imposta il reindirizzamento. Invece di connettersi a un singolo modello, distribuire l'attività al modello giusto con un "router".
Instradamento del modello
I carichi di lavoro reali sono misti: la maggior parte delle richieste in arrivo sono semplici, altre sono difficili. È uno spreco mandarli tutti al modello potente; Inviarli tutti al modello veloce riduce la qualità. Il routing risolve questo problema: un modello economico (o una regola semplice) classifica prima l'attività, quindi il lavoro va al modello appropriato.
# Prompt del router (funziona con il modello economico) Classifica la richiesta in arrivo in base alla sua difficoltà. Restituisce solo il seguente JSON:{"difficulty": "simple|complex"}Semplice: passaggio singolo, formulaico, risposta breve.Complesso: richiede ragionamento in più passaggi, analisi o generazione lunga.Richiesta: """{{request}}"""
- vai al modello semplice → veloce (economico, veloce).
- vai al modello complesso → potente (costoso ma necessario).
Questo modello riduce significativamente il costo medio perché la maggior parte del traffico è generalmente semplice.
Suggerimento: una decisione di rinvio non richiede sempre un LLM. Anche semplici regole come "Vai al modello veloce se il testo è inferiore a 20 parole" sono una guida e non comportano alcun costo aggiuntivo in token. Prova prima la regola.
Collegare la scelta all'evidenza: il piccolo cluster di valutazione
Non scegliere un modello basandosi sul "mi sembra migliore". Eval (set di valutazione) è un piccolo insieme di campioni per i quali è nota la risposta corretta; esegui ciascun modello su questo set e misuri l'accuratezza, i costi e la latenza.
# Modello di configurazione di valutazione1) Raccogli 20-50 esempi reali, scrivi a mano la "risposta corretta" su ciascuno.2) Esegui ciascun modello (veloce/bilanciato/forte) su questo set.3) Per ciascun modello: numero di correzioni, token di throughput medio, costo per richiesta, tempo medio.4) Scegli il modello che "fornisce una precisione sufficiente più economica".
# Tabella comparativa di valutazione (riempimento)Modello | Precisione | Costo per richiesta | Durata mediaHaiku | ...% | ... $ | ... snSonetto | ...% | ... $ | ... snOpus | ...% | ... $ | ...sec
Prompt debole / Prompt forte (decisione sulla selezione del modello)
# DEBOLE (nessuna base per decidere) Usiamo il modello migliore, il budget non è importante.
# FORTE (decisione basata sulla misurazione) Su un campione di 50 campioni, Haiku ha dato una precisione del 96%, Sonetto ha dato una precisione del 97%; La differenza è statisticamente insignificante. Haiku è stato scelto perché è 5 volte più economico e 2 volte più veloce. Se la precisione scende al di sotto del 95%, la decisione di passare a Sonnet verrà presa automaticamente.
Versione potente; associa la selezione a un numero, una soglia e una regola di escalation. Ciò difende la decisione di oggi e gestisce il cambiamento futuro.
Tre mini custodie
Caso 1 – Fuga dal modello dominante. Un call center produceva tutti i riassunti delle conversazioni con Opus; la fattura mensile era alta. Alla valutazione di 40 campioni, Sonnet era inferiore dell'1% a Opus in termini di precisione, ma costava un terzo. Spostarono l'opera riassuntiva nel Sonetto; il costo mensile è sceso da $ 9.000 a $ 3.100, senza lamentele sulla qualità.
Caso 2: traffico misto con reindirizzamento. L'80% delle richieste di un team tecnico legale riguardavano semplici tag di documenti, il 20% erano analisi contrattuali complesse. Li stavano mandando tutti al potente modello. Hanno aggiunto un router economico e distribuito lavori semplici ad Haiku e lavori complessi a Opus; il costo medio delle richieste è diminuito del 64%, mentre la qualità dell'analisi è stata mantenuta.
Caso 3 — Il costo del ridimensionamento senza misurazione. Per ridurre i costi, un team ha ridotto l'estrazione di codici medici complessi direttamente al modello veloce; Non hanno valutato. Dal vivo, la precisione è scesa dal 92% al 78%, con il risultato di un ritorno di inferenze errate. Dovevano prima valutare: quel compito richiedeva un modello potente. Lezione: sia la riduzione che l'elevazione vengono eseguite mediante misurazione.
Errori comuni
- Il riflesso del “modello più forte”: sprechi e ritardi inutili in compiti semplici.
- Cambiare il modello senza misurare: sia la riduzione che l'ingrandimento sono rischiosi senza valutazione.
- Bloccarsi in un unico modello: il routing nel traffico misto è spesso più efficiente.
- Confondendo sempre il router per LLM: semplici regole possono funzionare a costo zero.
- Non impostare una soglia di aumento: cosa succede se la precisione diminuisce deve essere definita in anticipo.
- Non correggere la versione del modello: registra su quale modello/versione stai lavorando in produzione; Il cambiamento di versione può modificare il comportamento.
Più in profondità: valutazione perpetua e prova incrementale
La selezione del modello non è una decisione una tantum. I fornitori introducono nuovi modelli, i prezzi cambiano, la descrizione del tuo lavoro si evolve. Quindi imposta il cluster di valutazione una volta e non dimenticare; tienilo come un essere vivente. Quando esce un nuovo modello, esegui gli stessi 20-50 campioni, aggiorni la tabella e prendi di nuovo la tua decisione. Questo ti protegge dalla trappola dell’intuizione che cambia modello.
La seconda tecnica avanzata è il modello fallback/cascade. Affidi prima il compito al modello economico; Se l'output ha un livello di confidenza basso o il livello di verifica (unità 11) lo rifiuta, si inoltra la stessa richiesta. Quindi la maggior parte del traffico viene risolta sul modello economico, mentre solo la restante minoranza va sul modello costoso. Questo è allo stesso tempo più economico e più duraturo rispetto all’approccio basato su un unico modello fisso.
Il terzo punto è che la valutazione include non solo l'accuratezza ma anche i costi e la latenza. Se un modello è più preciso dell'1% ma 3 volte più costoso e 2 volte più lento, il compromesso non vale la pena per la maggior parte dei lavori. Prendi la decisione lungo tre assi (precisione, costo, latenza) e definisci una “soglia di sufficienza”: “se la precisione è superiore al 95%, scegli il più economico”.
Infine, registra quale modello/versione hai utilizzato in produzione. Se un giorno la qualità dell'output cambia, la prima cosa che guarderai è se la versione del modello è cambiata. La tracciabilità delle versioni rende più veloce l'individuazione della causa principale dei problemi di qualità.
Ancora un avvertimento: il cluster di valutazione dovrebbe rappresentare il carico di lavoro effettivo. Una valutazione composta solo da esempi facili nasconde i punti in cui il modello inciampa nei casi difficili e ti induce in una falsa fiducia. Una buona valutazione; Include semplici esempi comuni e casi limite che incontri nella realtà (input ambigui, incompleti e contraddittori). Questa minoranza difficile determina la scelta del modello, perché ogni modello riesce comunque a raggiungere la maggioranza facile. Mantieni la tua Eval fresca e rappresentativa alimentandola periodicamente con nuovi esempi reali.
In sintesi
Il modello giusto è il modello più leggero che porta a termine il lavoro; Più potente non è migliore in ogni lavoro, è solo più costoso e più lento. Classificare il compito e partire dal candidato più leggero, distribuire il traffico misto con il routing e convalidare la selezione con un piccolo insieme di valutazioni riduce notevolmente i costi mantenendo la qualità.
Compito dell'applicazione
Scegli un carico di lavoro. (1) Classificare l'attività come semplice/complessa. (2) Progetta un piccolo insieme di valutazione di 20 esempi reali (con le relative risposte corrette). (3) Elaborare un piano per popolare la tabella di confronto accuratezza/costo/tempo per le tre classi di modelli. (4) Se si dispone di traffico misto, scrivere una regola di instradamento e impostare una soglia di escalation.
lista di controllo
- [ ] Posso confrontare la famiglia di modelli sull'asse capacità/velocità/costo.
- [ ] Posso applicare il principio del "modello più leggero e di successo".
- [] Posso impostare il routing del modello in base alla complessità dell'attività.
- [ ] Con un piccolo set di eval posso associare la selezione alle prove.
- [ ] Posso definire una soglia di upgrade/retrocessione.