Guadagni:
- Capacità di spiegare i concetti di token, finestra di contesto e multimodalità nel linguaggio quotidiano
- Diagnosticare se un'attività richiede un ampio contesto o multimodalità
- Capacità di tenere conto di come questi concetti influiscono sui costi e sulla selezione del modello
Finora abbiamo familiarità con i fornitori e i tipi di modelli. Tuttavia, per la giusta scelta del modello, è necessario anche capire come funzionano i modelli “dentro”; perché le decisioni su prezzo, capacità e disponibilità si basano tutte su tre concetti fondamentali: token, finestra di contesto e multimodalità. Chi non conosce questi concetti non può leggere il listino prezzi e chiedersi "questo documento sarà adatto al modello?" non può rispondere alla domanda e non riesce a vedere quando l'elaborazione visiva è essenziale. Al termine di questa unità sarai in grado di spiegare questi tre concetti nel linguaggio quotidiano, diagnosticare se un lavoro richiede un contesto ampio o multimodalità e tenere conto del loro impatto sui costi.
Token: unità utilizzata dal modello al posto della parola
I modelli di intelligenza artificiale elaborano il testo non parola per parola, ma in piccoli pezzi chiamati token. Un gettone; Può essere una parola, parte di una parola, un segno di punteggiatura o uno spazio. Per fare un calcolo approssimativo: in inglese, un token medio è di circa quattro caratteri e 100 parole equivalgono a circa 130-150 token. In turco, questo tasso potrebbe essere leggermente più alto a causa delle parole lunghe e con suffisso; In altre parole, un testo turco con lo stesso significato consuma leggermente più token dell’inglese.
Perché è importante saperlo? Perché tutto viene addebitato e misurato in gettoni. Il testo (input) inviato al modello e la risposta (output) prodotta dal modello vengono conteggiati come token separati. Sia la tua fattura che la capacità del modello sono in gettoni.
Suggerimento: per ottenere una stima approssimativa di quanti token ha un testo, dividi il numero di caratteri per quattro. Un'e-mail di 4.000 caratteri equivale a circa 1.000 token. In turco, presumi un prezzo leggermente più alto per stare sul sicuro.
Finestra di contesto: "Memoria a breve termine" del modello
La finestra di contesto è la quantità totale di token che il modello può tenere a mente alla volta. Input e output devono combaciare in questa finestra. Immaginatelo come la quantità di carta che potete stendere su un tavolo in una sola volta: la carta che non si adatta al tavolo è fuori dal vostro campo visivo in quel momento.
Se la finestra di contesto di un modello è di 200.000 token, ciò equivale a circa 150.000 parole o a diversi libri di medie dimensioni. 1 milione di token possono elaborare complessivamente documenti molto più grandi. Alcuni modelli potenti oggi (ad esempio Claude Opus 4.8 e Sonetto 5) offrono 1 milione di contesti di token, mentre i modelli leggeri spesso vengono forniti con finestre più piccole (ad esempio 200.000 token per Haiku 4.5).
Perché è importante? Perché se un documento non rientra nella finestra di contesto, il modello non può vederlo tutto insieme. Non puoi dare un contratto di 500 pagine nella sua interezza a un modello da 200.000 token; Puoi dividere il documento in parti (che potrebbero perdere la relazione tra le parti) o scegliere un modello con un contesto più ampio.
Attenzione: non è saggio compilare tutti i documenti solo perché la finestra di contesto è grande. Più gettoni metti nella finestra, più paghi e talvolta il modello può perdere i dettagli centrali in testi molto lunghi. Spesso è più economico e più accurato inviare solo la parte che funziona.
La finestra di contesto è un criterio decisionale
Ricerca
Contesto approssimativo richiesto
Livello adeguato
Breve risposta via e-mail
diverse centinaia di gettoni
leggero
Riepilogo di una pagina
diverse migliaia di gettoni
Leggero/equilibrato
Analisi del rapporto di 40 pagine
~30.000 gettoni
Equilibrato/forte
Revisione del contratto di 300 pagine
~250.000 gettoni
Potente con un ampio contesto
Elabora centinaia di documenti contemporaneamente
Oltre 500.000 gettoni
Contesto più ampio
Questa tabella risponde alla domanda "quale modello?" Mostra che a parte della domanda viene data risposta direttamente dalla dimensione del documento. È uno spreco acquistare un modello costoso con un ampio contesto per lavori brevi; Un modello con una finestra piccola non è adeguato per documenti di grandi dimensioni.
Multimodalità: andare oltre il testo
La multimodalità è la capacità di un modello di gestire più tipi di dati (immagine, audio, talvolta video), non solo testo. "Modale" qui significa "tipo di dati"; multimodale significa "molti tipi".
- Modello solo testo: legge e scrive solo testo scritto.
- Modello multimodale: può leggere la foto di una bolletta, interpretare un andamento su un grafico, decodificare una nota scritta a mano, talvolta trascrivere una registrazione vocale.
Perché è importante? Perché la natura della tua attività potrebbe richiedere la multimodalità. Un team di contabilità che estrae gli importi dalle immagini delle fatture, un team di e-commerce che classifica le foto dei prodotti o un team di assicurazioni che valuta le foto dei danni non possono svolgere questo lavoro con un modello che legge solo testo. L’elaborazione visiva è essenziale per questi compiti.
Tre casi realistici
Caso 1: sorpresa sul costo dei token. Un team di contenuti invia inoltre al modello un documento di "guida al marchio" di 20 pagine mentre produce ciascun post del blog. Questa guida contiene circa 15.000 token. Producono 2.000 articoli al mese; Quindi semplicemente inviare la guida più e più volte significa 30 milioni di token di input. Accorciando la guida e inviando solo la sezione rilevante (circa 2.000 token), riducono l'input a un settimo e riducono notevolmente la bolletta.
Caso 2: la finestra di contesto non è sufficiente. Uno studio legale vuole far rivedere un accordo di fusione di 280 pagine. Il primo modello provato aveva una rilegatura di 200.000 gettoni e il documento non rientrava; Quando il documento viene fatto a pezzi, il modello non può notare che un articolo della prima sezione contraddice un articolo dell'ultima sezione. Quando passa a un modello con contesto da 1 milione di token, legge il documento nel suo insieme e coglie la contraddizione. Qui la finestra di contesto determina direttamente la precisione.
Caso 3 — La multimodalità è un must. Una compagnia assicurativa desidera effettuare una valutazione preliminare in base alle fotografie dei danni del veicolo. Ciò è impossibile con un modello che legge solo testo; È necessario un modello multimodale che "veda" la fotografia. Quando passano a un modello multimodale, stabiliscono un sistema di pre-screening che classifica approssimativamente la posizione e la gravità del danno nella foto e indirizza l’esperto. Notano, tuttavia, che la decisione finale è presa da un esperto umano; perché il modello è uno strumento di screening preliminare, non la parola finale.
Prompt debole / Prompt forte
Suggerimento debole:
Riassumi questo documento. [documento incollato troppo lungo]
Suggerimento potente:
Riassumi il rapporto di 40 pagine di seguito. Per prima cosa stima il numero approssimativo di token nel report e dicci se rientra nella finestra di contesto di un tipico modello bilanciato. Quindi fornire il riepilogo in questo formato: riepilogo esecutivo di 5 elementi + 3 risultati rischiosi. Utilizzare solo le informazioni contenute nel report; Contrassegna la parte di cui non sei sicuro come "non chiara nel rapporto". [rapporto]
Il potente prompt è consapevole sia del token che del contesto e controlla il formato e la verificabilità dell'output.
Modelli copiabili
1. Previsione dei token:
Stimare il numero approssimativo di token per il testo seguente e interpretarlo in termini di costo di input: "[TESTO]". Arrotondate un po' il tutto, tenendo conto che è turco.
2. Verifica disponibilità contesto:
Il mio lavoro è elaborare i seguenti documenti: media di [PAGINE] di [QTÀ] documenti al mese. Quale finestra di contesto richiede questa dimensione? Quale dei livelli leggero/bilanciato/forte sarebbe sufficiente? Che rischi si corrono se deve essere smantellato?
3. Diagnosi multimodale:
Il mio flusso di lavoro: [DESCRIZIONE]. È presente un'elaborazione visiva, audio o video in questo flusso? In tal caso, è necessario un modello multimodale o è possibile convertirlo in testo (OCR/trascrizione) e risolverlo con il modello testuale? Confronta i pro/contro dei due percorsi.
4. Ottimizzazione del contesto:
Invio un documento alla modella con ogni richiesta, ma la maggior parte non è necessaria. Come estraggo le parti effettivamente richieste per [TASK] da questo documento? Suggerisci 3 modi concreti per ridurre l'input e indica il risparmio stimato in token.
Errori comuni
- Confondere il token con una parola: il token è diverso da una parola; Fattura e capacità sono sempre in gettoni, il calcolo a parole è fuorviante.
- Pensare che la finestra di contesto sia infinita: ogni modello ha un limite; Se il documento non si adatta, il modello non può vedere l'intero.
- Utilizzo di un contesto ampio non necessario: acquistare un modello costoso con un contesto ampio per un lavoro breve; oppure compilare enormi documenti per ogni richiesta e pagare invano.
- Assumendo la multimodalità: non tutti i modelli possono elaborare le immagini; Per il lavoro visivo, iniziare senza confermare che il modello sia multimodale.
- Dimenticando il carico di simboli del turco: i testi turchi generalmente consumano un po' più di simboli per lo stesso significato; ignorando questo nella stima dei costi.
In sintesi
- Un token è la piccola unità in cui il modello elabora il testo; input e output vengono misurati e fatturati separatamente come gettoni.
- La finestra di contesto rappresenta il totale dei token che il modello può tenere a mente alla volta; la dimensione del documento influisce direttamente sulla selezione del modello.
- La multimodalità è la capacità del modello di elaborare dati non testuali come quelli visivi/audio; È essenziale per le opere visive.
- Questi tre concetti sono entrambi rilevanti per la domanda "quale modello?" così come “quanto costa?” Costituisce la base delle domande.
Compito dell'applicazione
Scegli un'attività AI ricorrente nella tua azienda. Chiedi al primo modello (previsione dei token) di calcolare quanti token è un input tipico in questa attività. Determinare quindi quale livello è sufficiente con il modello 2 (verifica disponibilità contesto). Se hai un lavoro visivo, chiarisci se è richiesto un modello multimodale con il 3° modello (diagnosi multimodale). Utilizzeremo la stima simbolica risultante nel calcolo dei costi dell'unità successiva.
lista di controllo
- [ ] Conosco il concetto di token e so come stimare approssimativamente quanti token ha un testo.
- [ ] Posso spiegare la finestra di contesto con un'analogia "tabella/memoria".
- [ ] Posso valutare se un documento si adatterà a un modello.
- [ ] Posso diagnosticare quando la multimodalità è essenziale.
- [ ] Prendo in considerazione il sovraccarico simbolico del turco e il costo del contesto non necessario.