Gains :
- Peut concevoir la manière dont l'invite du système guide le modèle tout au long de la conversation
- Comprend le rôle et l’impact financier de la pensée adaptative et des paramètres d’effort
- implémente des contrôles de sortie tels que max_tokens, des séquences d'arrêt et une sortie structurée
Deux produits différents du même modèle peuvent se comporter complètement différemment. La différence ne réside pas dans le modèle lui-même, mais dans l'invite du système et les paramètres qui lui sont attribués. L'invite du système est le « contrat de travail » du modèle et les paramètres sont les « paramètres de travail ». Dans cette unité, vous apprendrez comment concevoir une invite système puissante, ce que font les paramètres de réflexion et d'effort dans les modèles modernes et comment contrôler la sortie en termes de format/longueur. Définir correctement ces paramètres vous permet de gérer à la fois la qualité et le coût.
Invite système : directive permanente du modèle
L'invite système est l'instruction de haut niveau qui s'applique tout au long de la conversation. Ces règles restent valables quelle que soit la saisie de l'utilisateur. Une bonne invite système comprend les composants suivants :
- Rôle/identité : Qui est le modèle ? (« Vous êtes un assistant de support en entreprise. »)
- Portée et limites : que fait-il et que ne fait-il pas ? (« Se baser uniquement sur le document de politique fourni. »)
- Règles de format : à quoi doit ressembler le résultat ? ("Maximum 3 articles, langue officielle.")
- Comportement dans l’incertitude : Que faire en cas d’incertitude ? ("S'il n'y a pas d'information, inventez-la et dirigez-la vers l'unité compétente.")
- Sécurité/vie privée : Qu'est-ce qui ne veut pas/ne veut pas ? ("Demander des données personnelles.")
Astuce : laissez l'invite du système fixe. N'intégrez pas d'informations qui changent à chaque demande (date actuelle, nom d'utilisateur, ID de session). Cela rompt la cohérence et invalide le cache d'invite sur l'unité 6. Mettez les informations variables dans le message utilisateur.
Le piège de l’instruction trop agressive
Les modèles modernes suivent les instructions de très près. Des phrases agressives telles que « DOIT », « TOUJOURS », « CERTAINEMENT faire ceci », etc., qui fonctionnaient dans les anciens modèles, conduisent aujourd'hui à un déclenchement excessif : le modèle appelle un agent lorsqu'il n'est pas nécessaire ou s'exécute pendant une période inutilement longue. Assouplir la règle : au lieu de « DOIT utiliser l’outil de recherche », « Si la réponse ne figure pas dans la conversation, utilisez l’outil de recherche » est plus précis.
Paramètres du modèle : réflexion et effort
Les LLM classiques avaient un paramètre de température : une valeur inférieure produisait une sortie plus spécifique/cohérente, une valeur plus élevée produisait une sortie plus variée/créative. Les modèles de génération moderne (comme Opus 4.8, Sonnet 5) remplacent cette approche par deux mécanismes plus puissants et n'acceptent plus les paramètres d'échantillonnage comme la température.
- Pensée adaptative : Le modèle raisonne étape par étape dans sa « tête » avant de répondre. Le modèle décide du degré de réflexion en fonction de la difficulté de la tâche. Améliore considérablement la précision sur des problèmes complexes en plusieurs étapes ; Il réfléchit moins pour éviter des retards inutiles sur des questions simples.
- Effort : bouton de haut niveau qui ajuste la profondeur avec laquelle le modèle se plonge dans une tâche et le nombre de jetons qu'il dépense au total. Niveaux typiques : faible, moyen, élevé et supérieur. Des efforts importants peuvent améliorer la qualité, mais ils augmentent également les délais et les coûts ; Un faible effort apporte rapidité et économies.
Paramètre
Qu'est-ce que
quand
Réflexion/faible effort
Rapide, bon marché, superficiel
Classification simple, réponse courte, tâches sensibles aux délais
Pensée adaptative + effort moyen
Equilibré qualité/coût
La plupart des tâches à usage général
Pensée adaptative + effort élevé
la plus haute précision
Raisonnement complexe, codage, travail d'agent à longue portée
Attention : le réflexe « effort maximum quoi qu'il arrive » gonfle les coûts. Ajuster l'effort à la tâche ; Dans les tâches simples, un faible effort donne souvent le même résultat précis à un prix beaucoup moins élevé. Allez haut là où une précision critique est nécessaire.
Contrôle de sortie : format, longueur, structure
Outre les paramètres, vous contrôlez également la sortie elle-même :
- max_tokens : Plafond dur de la sortie (1ère et 3ème unité).
- Séquences d'arrêt : arrêter le modèle lorsqu'il voit une certaine chaîne. Utile pour définir des points d’arrêt dans une production structurée.
- Sortie structurée : forcez la réponse du modèle à se conformer à un schéma JSON que vous fournissez. Il garantit que la sortie est analysable et valide par programme. C'est plus fiable que de dire « retournez simplement JSON » avec une invite.
{ "output_config": { "format": { "type": "json_schema", "schema": { "type": "object", "additionalProperties": false, "properties": { "category": { "type": "string", "enum": ["invoice", "technical", "return", "other"] }, "urgency": { "type": "string", "enum": ["low", "medium", "high"] } }, "obligatoire": ["catégorie", "urgence"] } } }}
Modèles d'invite système copiables
# Assistant de support corporatifVous êtes un assistant de support corporatif.- Vous appuyer uniquement sur le document de politique fourni ; Si cela ne figure pas dans le document, dites « Je n'ai pas cette information ». - Donnez une réponse formelle et claire en 3 phrases maximum. - Demandez des données personnelles (numéro d'identification TC, numéro de carte) et ne les répétez pas dans votre réponse. - Si vous n'êtes pas sûr, ne devinez pas.
# Classificateur de forçage de sortie structuréVous êtes un classificateur de demande. L'entrée est un message client. Renvoyez uniquement les champs demandés, n'écrivez pas de commentaires. Si vous n'êtes pas sûr, utilisez « autre ».
# Analyste avec un comportement défini de situation d'incertitudeVous êtes un analyste de données. Tirez uniquement des conclusions vérifiables du tableau fourni. N’inventez jamais une conclusion qui n’existe pas dans les données. Si une inférence n'est pas claire, écrivez « données insuffisantes ».
# Rédacteur de contenu avec contrôle du ton et de la longueurVous êtes un rédacteur de contenu. Utilisez un ton chaleureux mais professionnel. Limitez chaque texte à 120 mots ou moins. Évitez le langage marketing cliché.
Invite faible/Invite forte
# FAIBLESoyez utile et donnez de bonnes réponses. Faites de votre mieux.
# STRONGRôle : spécialiste du support technique. Portée : guide produit fourni uniquement. Format : étape par étape, liste numérotée, 5 étapes maximum. Limite : solution recommandée ne figurant pas dans le guide ; Dites "Je ne l'ai pas trouvé dans le manuel". Confidentialité : ne répétez pas le numéro de série partagé par l'utilisateur dans la réponse.
Version puissante ; Il détermine séparément le rôle, la portée, le format, les limites et la confidentialité. La cohérence des résultats découle directement de cette clarté.
Trois mini-étuis
Cas 1 — Réduction des coûts grâce à l’ajustement des efforts. Une équipe effectuait tous ses appels avec beaucoup d'efforts et de réflexion ; Même de simples résumés d’e-mails étaient coûteux et lents à produire. Ils ont assigné des tâches simples telles que des résumés à un faible effort et l'analyse des contrats à un effort élevé. La précision a été maintenue, la latence moyenne a été réduite de moitié et le coût mensuel a été réduit d'un tiers.
Cas 2 — Garantie JSON. Une équipe opérationnelle a demandé le résultat de la classification avec une invite disant « donnez simplement JSON », mais le modèle écrivait occasionnellement « Voici le résultat : » et l'analyseur plantait. Lorsque j'ai connecté le schéma de sortie configuré, la sortie renvoyait un JSON valide à chaque fois ; les erreurs d'analyse ont été réinitialisées.
Cas 3 — Recul rapide et agressif. Une invite de l'assistant disait : « DOIT rechercher CHAQUE QUESTION » ; Le modèle effectuait des recherches inutiles, même pour des questions simples dont il connaissait déjà la réponse, ce qui ralentissait et augmentait les coûts. Ils ont assoupli la règle : « Si la réponse n'est pas contextuelle, recherchez » ; Les appels inutiles ont diminué de 70 % et les réponses se sont accélérées.
Erreurs courantes
- Intégration de données variables dans l'invite système : rompt la cohérence et invalide le cache.
- Instruction trop agressive : Déclenchement excessif et coût inutile dans les modèles modernes.
- Effort élevé dans chaque tâche : gaspillage dans les tâches simples ; ajuster l'effort à la tâche.
- Demander JSON uniquement via une invite : cela se casse de temps en temps ; si cela est critique, utilisez une sortie structurée.
- Ne pas définir le comportement de limite/ambiguïté : le modèle comble le vide par la fabrication (hallucination).
- Vieille habitude de « température » : les modèles modernes ne l’acceptent pas ; Guidez le comportement avec rapidité et effort.
Plus profond : rédiger l'invite comme un contrat
Les équipes expérimentées traitent l'invite du système comme un contrat et non comme un texte littéraire : des clauses claires, des règles mesurables, des limites sans ambiguïté. Cette approche présente trois avantages concrets. Le premier est la cohérence : la même entrée donne un résultat similaire à des moments différents. Deuxièmement, la testabilité : vous pouvez tester chaque élément séparément avec un échantillon. Troisièmement, la facilité de maintenance : si un comportement est incorrect, vous savez quel élément remplacer.
Une bonne pratique consiste à donner des exemples positifs. Plutôt que de fournir une liste de « ne pas faire cela », il est beaucoup plus efficace dans les modèles modernes de fournir un exemple indiquant « voici exactement à quoi ressemble le résultat souhaité ». Par exemple, dans un classificateur, l'ajout d'un ou deux échantillons du JSON attendu à l'invite réduit considérablement les erreurs de formatage.
Une autre technique puissante consiste à écrire explicitement le comportement d’incertitude. Une clause telle que « En cas de doute, ne devinez pas ; dites « données insuffisantes » » supprime la tendance du modèle à remplir le vide par la fabrication (hallucination). Cette simple phrase décharge la couche de vérification, que nous aborderons dans l'unité 11 : une fois que le modèle a déjà signalé l'incertitude, il devient plus facile de conduire à une validation humaine.
Enfin, réfléchissez ensemble à l’effort et à l’incitation. Avec un effort élevé, le modèle explore davantage et effectue parfois un « travail supplémentaire » indésirable (explication inutile, suggestion supplémentaire). Dire « donnez uniquement le résultat souhaité, n'ajoutez pas de commentaires supplémentaires » dans l'invite compense cet effet secondaire d'un effort élevé.
En résumé
L'invite système est la directive permanente du modèle : elle définit le rôle, la portée, le format, le comportement d'obscurité et la confidentialité. Dans les modèles modernes, le comportement est déterminé par la pensée adaptative et les paramètres d’effort plutôt que par la température ; Aligner les efforts sur la tâche gère simultanément la qualité et les coûts. Vous sécurisez la sortie avec max_tokens, des tableaux d'arrêt et une sortie structurée.
Tâche de candidature
Choisissez une tâche. (1) Rédigez une invite système avec cinq composants (rôle, portée, format, ambiguïté, confidentialité). (2) Indiquez quel niveau d’effort vous choisiriez pour cette tâche et pourquoi. (3) Si la sortie doit être structurée, esquissez un petit schéma JSON. (4) Vérifiez s'il y a un modèle trop agressif dans votre invite et adoucissez-le.
liste de contrôle
- [ ] Je peux nommer cinq composants d'une bonne invite système.
- [ ] Je peux expliquer ce que font les paramètres de pensée adaptative et d’effort.
- [ ] Je peux équilibrer qualité/coût en ajustant l'effort en fonction de la tâche.
- [ ] Je sais pourquoi la sortie structurée est plus sûre que de demander JSON via une invite.
- [ ] Je peux reconnaître le risque que présentent les modèles modernes d'instructions trop agressives.