Gains :
- Capacité à expliquer les concepts de token, de fenêtre contextuelle et de multimodalité dans le langage courant
- Diagnostiquer si une tâche nécessite un contexte large ou une multimodalité
- Capacité à prendre en compte la manière dont ces concepts affectent les coûts et la sélection du modèle
Jusqu'à présent, nous connaissons les fournisseurs et les types de modèles. Cependant, pour bien sélectionner un modèle, il est également nécessaire de comprendre comment les modèles fonctionnent « à l’intérieur » ; car les décisions en matière de prix, de capacité et de disponibilité reposent toutes sur trois concepts fondamentaux : le jeton, la fenêtre contextuelle et la multimodalité. Quelqu'un qui ne connaît pas ces concepts ne peut pas lire la grille tarifaire et se demander "ce document conviendra-t-il au modèle ?" ne peut pas répondre à la question et ne peut pas voir quand le traitement visuel est essentiel. À la fin de cette unité, vous serez en mesure d'expliquer ces trois concepts dans le langage courant, de diagnostiquer si un travail nécessite un contexte large ou une multimodalité et de prendre en compte leur impact sur le coût.
Jeton : unité utilisée par le modèle au lieu d'un mot
Les modèles d’intelligence artificielle traitent le texte non pas mot par mot, mais en petits morceaux appelés jetons. Un jeton ; Il peut s'agir d'un mot, d'une partie de mot, d'un signe de ponctuation ou d'un espace. Pour faire un calcul approximatif : en anglais, un jeton moyen comporte environ quatre caractères et 100 mots représentent environ 130 à 150 jetons. En turc, ce taux peut être légèrement plus élevé en raison des mots suffixés et longs ; En d’autres termes, un texte turc ayant la même signification consomme légèrement plus de jetons qu’un texte anglais.
Pourquoi est-ce important de le savoir ? Parce que tout est facturé et mesuré en jetons. Le texte (entrée) que vous envoyez au modèle et la réponse (sortie) produite par le modèle sont comptés comme des jetons distincts. Votre facture et la capacité du modèle sont en jetons.
Astuce : Pour obtenir une estimation approximative du nombre de jetons contenus dans un texte, divisez le nombre de caractères par quatre. Un e-mail de 4 000 caractères équivaut à environ 1 000 jetons. En turc, supposez un peu plus haut pour rester prudent.
Fenêtre contextuelle : « Mémoire à court terme » du modèle
La fenêtre contextuelle correspond au nombre total de jetons que le modèle peut garder à l'esprit à la fois. L'entrée et la sortie doivent s'emboîter dans cette fenêtre. Pensez-y comme à la quantité de papier que vous pouvez étaler sur une table en même temps : le papier qui ne rentre pas sur la table est hors de votre champ de vision à ce moment-là.
Si la fenêtre contextuelle d'un modèle est de 200 000 jetons, cela équivaut à environ 150 000 mots, soit plusieurs livres de taille moyenne. 1 million de jetons peuvent traiter des documents beaucoup plus volumineux dans leur ensemble. Certains modèles puissants aujourd'hui (par exemple Claude Opus 4.8 et Sonnet 5) offrent 1 million de contextes de jetons, tandis que les modèles légers sont souvent dotés de fenêtres plus petites (par exemple 200 000 jetons pour Haiku 4.5).
Pourquoi est-ce important ? Car si un document ne rentre pas dans la fenêtre contextuelle, le modèle ne peut pas le voir dans son ensemble. Vous ne pouvez pas confier un contrat de 500 pages dans son intégralité à un modèle de 200 000 tokens ; Soit vous divisez le document en parties (ce qui peut perdre la relation entre les parties), soit vous choisissez un modèle avec un contexte plus large.
Attention : Il n'est pas judicieux de remplir tous les documents, car la fenêtre contextuelle est grande. Plus vous mettez de jetons dans la fenêtre, plus vous payez, et parfois le modèle peut manquer les détails du milieu dans des textes très longs. Il est souvent moins cher et plus précis d’envoyer uniquement la pièce qui fonctionne.
La fenêtre contextuelle est un critère de décision
Quête
Contexte approximatif requis
Niveau approprié
Réponse courte par e-mail
plusieurs centaines de jetons
léger
Résumé d'une page
plusieurs milliers de jetons
Léger/équilibré
Analyse du rapport de 40 pages
~30 000 jetons
Équilibré/fort
Examen du contrat de 300 pages
~250 000 jetons
Puissant avec un large contexte
Traitez des centaines de documents à la fois
Plus de 500 000 jetons
Contexte le plus large
Ce tableau répond à la question « quel modèle ? Cela montre qu’une partie de la question trouve une réponse directe en fonction de la taille du document. C'est du gaspillage d'acheter un modèle coûteux avec un large contexte pour des travaux courts ; Un modèle avec une petite fenêtre est inadapté aux documents volumineux.
Multimodalité : aller au-delà du texte
La multimodalité est la capacité d'un modèle à gérer plusieurs types de données (image, audio, parfois vidéo), et pas seulement du texte. « Modal » signifie ici « type de données » ; multimodal signifie « plusieurs types ».
- Modèle texte uniquement : lit et écrit uniquement du texte écrit.
- Modèle multimodal : Peut lire une photo d'une facture, interpréter une tendance sur un graphique, décoder une note manuscrite, parfois retranscrire un enregistrement vocal.
Pourquoi est-ce important ? Parce que la nature de votre activité peut nécessiter la multimodalité. Une équipe comptable qui extrait les montants des images de factures, une équipe e-commerce qui classe les photos de produits ou une équipe d'assurance qui évalue les photos des dommages ne peuvent pas faire ce travail avec un modèle qui lit uniquement du texte. Le traitement visuel est essentiel à ces tâches.
Trois cas réalistes
Cas 1 – Surprise du coût des jetons. Une équipe de contenu envoie également au modèle un document « guide de marque » de 20 pages au fur et à mesure qu'il produit chaque article de blog. Ce guide contient environ 15 000 jetons. Ils produisent 2 000 articles par mois ; Ainsi, le simple fait d’envoyer le guide encore et encore signifie 30 millions de jetons d’entrée. En raccourcissant le guide et en n'envoyant que la section concernée (environ 2 000 jetons), ils réduisent la contribution à un septième et réduisent considérablement la facture.
Cas 2 — La fenêtre contextuelle n'est pas suffisante. Un cabinet d'avocats souhaite faire réviser un accord de fusion de 280 pages. Le premier modèle qu'ils ont essayé avait une reliure de 200 000 jetons et le document ne rentrait pas ; Lorsque le document est déchiré, le modèle ne peut pas remarquer qu'un article de la première section contredit un article de la dernière section. Lorsqu'il passe à un modèle avec un contexte de 1 million de jetons, il lit le document dans son ensemble et détecte la contradiction. Ici, la fenêtre contextuelle déterminait directement la précision.
Cas 3 — La multimodalité est indispensable. Une compagnie d’assurance souhaite réaliser une évaluation préliminaire à partir de photographies des dommages causés au véhicule. C'est impossible avec un modèle qui lit uniquement du texte ; Il faut un modèle multimodal qui « voit » la photographie. Lorsqu'ils passent à un modèle multimodal, ils établissent un système de pré-sélection qui classe grossièrement l'emplacement et la gravité des dommages sur la photo et oriente l'expert. Ils notent cependant qu’un expert humain prend la décision finale ; parce que le modèle est un outil de sélection préliminaire et non le dernier mot.
Invite faible/Invite forte
Invite faible :
Résumez ce document. [document trop long collé]
Invite puissante :
Résumez le rapport de 40 pages ci-dessous. Estimez d’abord le nombre approximatif de jetons dans le rapport et dites-nous s’il s’inscrit dans la fenêtre contextuelle d’un modèle équilibré typique. Donnez ensuite le résumé dans ce format : résumé en 5 points + 3 conclusions risquées. Utilisez uniquement les informations contenues dans le rapport ; Marquez la partie dont vous n'êtes pas sûr comme « pas claire dans le rapport ». [rapport]
L'invite puissante tient à la fois compte des jetons et du contexte et contrôle le format et la vérifiabilité de la sortie.
Modèles copiables
1. Prédiction des jetons :
Estimez le nombre approximatif de jetons pour le texte suivant et interprétez-le en termes de coût d'entrée : "[TEXTE]". Arrondissez un peu, en tenant compte du fait que c'est du turc.
2. Vérification de la disponibilité du contexte :
Mon travail consiste à traiter les documents suivants : [PAGES] moyennes de [QTÉ] documents par mois. Quelle fenêtre contextuelle cette taille nécessite-t-elle ? Lequel des niveaux léger/équilibré/fort serait suffisant ? Quel risque y a-t-il s’il faut le démonter ?
3. Diagnostic multimodalité :
Mon flux de travail : [DESCRIPTION]. Y a-t-il un traitement visuel, audio ou vidéo dans ce flux ? Si tel est le cas, un modèle multimodal est-il requis ou peut-il être converti en texte (OCR/transcription) et résolu avec le modèle de texte ? Comparez les avantages/inconvénients des deux voies.
4. Optimisation du contexte :
J'envoie un document au modèle à chaque demande, mais la plupart sont inutiles. Comment puis-je extraire les parties réellement requises pour [TASK] de ce document ? Suggérez 3 façons concrètes de réduire les intrants et indiquez les économies de jetons estimées.
Erreurs courantes
- Confondre un jeton avec un mot : le jeton est différent d'un mot ; La facture et la capacité sont toujours en jetons, le calcul en mots est trompeur.
- Penser que la fenêtre contextuelle est infinie : chaque modèle a une limite ; Si le document ne rentre pas, le modèle ne peut pas voir l'ensemble.
- Utiliser un grand contexte inutile : acheter un modèle coûteux avec un grand contexte pour un travail court ; ou remplissez d'énormes documents pour chaque demande et payez en vain.
- En supposant la multimodalité : tous les modèles ne peuvent pas traiter les visuels ; Pour le travail visuel, commencez sans confirmer que le modèle est multimodal.
- Oublier la charge symbolique du turc : les textes turcs consomment généralement un peu plus de jetons pour le même sens ; en ignorant cela dans l’estimation des coûts.
En résumé
- Un jeton est la petite unité dans laquelle le modèle traite le texte ; l'entrée et la sortie sont mesurées et facturées séparément sous forme de jetons.
- La fenêtre contextuelle correspond au nombre total de jetons que le modèle peut garder à l'esprit à la fois ; la taille du document affecte directement la sélection du modèle.
- La multimodalité est la capacité du modèle à traiter des données non textuelles telles que visuelles/audio ; C’est essentiel pour les œuvres visuelles.
- Ces trois concepts sont tous deux pertinents pour la question « quel modèle ? ainsi que « combien ça coûte ? » Il constitue la base des questions.
Tâche de candidature
Choisissez une tâche d'IA récurrente dans votre entreprise. Demandez au premier modèle (prédiction de jeton) de calculer le nombre de jetons qu'une entrée typique contient dans cette tâche. Déterminez ensuite quel niveau est suffisant avec le modèle 2 (vérification de disponibilité du contexte). Si vous avez un travail visuel, précisez si un modèle multimodal est nécessaire avec le 3ème modèle (diagnostic multimodal). Nous utiliserons l’estimation symbolique résultante dans le calcul du coût de l’unité suivante.
liste de contrôle
- [ ] Je connais le concept de jeton et comment estimer approximativement le nombre de jetons d'un texte.
- [ ] Je peux expliquer la fenêtre contextuelle avec une analogie "table/mémoire".
- [ ] Je peux évaluer si un document s'intégrera dans un modèle.
- [ ] Je peux diagnostiquer quand la multimodalité est essentielle.
- [ ] Je prends en compte la surcharge symbolique du turc et le coût du contexte inutile.