Gains :
- Comprendre comment fonctionne l'intelligence artificielle visuelle (diffusion) et comment elle ne peut pas produire ce qui n'est pas décrit et ne peut pas bien dessiner du texte.
- Capacité à rédiger une invite visuelle forte comprenant le sujet, le contexte, le style, la composition, la lumière et les éléments techniques.
- Acquérir la possibilité de déterminer le rapport hauteur/largeur, d'empêcher le texte lisible d'être dessiné par l'intelligence artificielle et de réduire le défaut avec une description négative.
Un designer produisant des visuels avec l’IA, c’est comme donner une commande à un artiste : plus vous l’expliquez de manière claire et précise, plus le résultat sera précis. Dans cette unité, nous comprendrons en langage clair comment fonctionne l'intelligence artificielle génératrice d'images (IA d'image) et apprendrons l'anatomie de la rédaction d'une bonne invite (instruction écrite pour un visuel), étape par étape. L’objectif est de pouvoir décrire consciemment l’image que l’on souhaite, plutôt que « d’essayer au hasard et de compter sur la chance ».
Comment fonctionne l’IA d’images ? (Explication simple)
La plupart des producteurs d’images utilisent aujourd’hui une méthode appelée diffusion. Simplement : le modèle a appris les relations « quels mots correspondent à quelles images » à partir de millions de paires image-texte. Lors de la production de visuels, il part d'une image avec un bruit aléatoire (comme un écran de télévision enneigé) et nettoie ce bruit étape par étape en fonction de votre invite et le transforme en une image significative. En d’autres termes, le modèle ne « dessine » pas l’image, il construit statistiquement l’image qui correspond le mieux à votre invite.
Cela a trois conséquences pratiques. Premièrement : la même invite donne un résultat différent à chaque fois, car le bruit initial est aléatoire (nous verrons comment contrôler cela avec "seed" dans l'unité suivante). Deuxièmement : le modèle ne peut pas savoir ce que vous ne pouvez pas décrire ; Il ne peut pas lire l’image dans votre tête, il interprète simplement ce que vous écrivez. Troisièmement : le modèle ne peut pas bien dessiner le texte et les chiffres, car il imite les lettres dans leur forme et non dans leur signification ; C’est pourquoi il est risqué de laisser l’écriture des logos à l’IA.
Astuce : Ne laissez pas l'IA produire le texte clair (nom de marque, slogan) dans l'image. Vous produisez une image sans texte, puis ajoutez le texte (sous forme de vecteur) dans un programme de conception. Cela le rend à la fois lisible et modifiable.
Anatomie d'une bonne invite
Il est utile de diviser une invite visuelle forte en six composants. Vous n’avez pas besoin de tous les utiliser à chaque fois, mais choisir consciemment déterminera le résultat.
- Sujet/sujet : Quel est l'élément principal de l'image ? (« une tasse à café en céramique », « portrait de jeune femme »).
- Action/contexte : Que fait-il, où est-il ? (« à la table en bois, dans la lumière du matin »).
- Style/esthétique : Quel est le langage visuel ? (« photo minimale du produit », « illustration aquarelle », « rendu 3D isométrique »). C'est l'élément le plus décisif.
- Composition / angle : Comment est le cadre ? (« gros plan », « vue plongeante », « grand angle », « au milieu, avec espace »).
- Lumière et couleur : ("lumière naturelle douce", "palette de tons terre", "contraste élevé").
- Technique / qualité : (« haute résolution », « fréquence d'images 1:1 », « fond blanc uni »).
Il existe également une recette négative : dire des choses dont vous ne voulez pas (« pas de texte, pas de personnes, pas de fond désordonné »). Nous approfondirons cela avec « invite négative » dans la 4ème unité.
Glossaire des termes
- Rapport hauteur/largeur : Le rapport hauteur/largeur de l'image ; Cadre 1:1 (post Instagram), portrait 9:16 (histoire/bobines), paysage 16:9 (couverture).
- Résolution : Nombre de pixels dans l'image ; Un niveau élevé est suffisant pour l'impression, un niveau moyen est suffisant pour l'écran.
- Référence de style : Donner un échantillon au modèle en disant "ressemble à ceci".
- Rendu : L'ordinateur calcule et produit une image ; « Rendu 3D » signifie vue volumétrique réaliste.
Pas à pas : décrire une image
Disons que nous voulons une image de produit pour une marque d'huile d'olive.
Étape 1 — Concentrez-vous sur le sujet : « l'huile d'olive extra vierge dans une bouteille en verre vert foncé ».
Étape 2 — Ajoutez du contexte : « sur le comptoir rustique en bois, avec quelques branches d'olivier fraîches à côté. »
Étape 3 — Choisissez le style : « photo de produit premium, réaliste ».
Étape 4 — Donnez la composition : « produit au milieu, espace pour le texte en haut ».
Étape 5 — Lumière/couleur : « côté doux lumière naturelle, tons terre chauds ».
Étape 6 — Technique : « Fréquence d'images 1:1, haute résolution, fond uni ».
Lorsque vous les combinez tous, vous obtenez un projet réalisable qui correspond à l'identité de la marque.
trois mini-cases
Cas 1 — De l'incertitude à la clarté. Un designer a écrit « image d’un bureau moderne » et a fait 12 tentatives, mais aucune n’a fonctionné (perdu 30 minutes). Il a réécrit l'invite en six éléments : "bureau lumineux et minimaliste ; bureau en bois ; lumière naturelle provenant d'une grande fenêtre ; tons neutres et chauds ; grand angle ; espace de texte en haut". 2 des 4 premières tentatives ont été utilisables ; Le temps a été réduit à 10 minutes.
Cas 2 — Piège à texte. Un stagiaire a demandé à une IA de produire une affiche de café du début à la fin ; Le texte « COFFEE » dans l'image s'est avéré être « COFEEE » et les prix n'étaient pas lisibles. Les instructions ont changé : l'image a été réalisée sans texte, le texte a été ajouté ultérieurement dans le programme de conception. L'erreur est tombée à zéro et l'affiche était prête à être imprimée.
Cas 3 — Perte de rapport. Un expert des médias sociaux a produit une image carrée 1:1 pour l'histoire Instagram ; 9:16 Lorsque je l'ai placé dans la zone verticale, le haut et le bas ont été coupés et l'élément important a été perdu. Lorsque j'ai spécifié le rapport hauteur/largeur comme « 9:16 vertical » dans l'invite, l'image correspondait à son format et aucune reproduction n'était requise.
Modèles copiables
1) Squelette d'image de produit à six composants :
[Sujet : décrire le produit] , [Contexte : où/comment] .Style : [par ex. photo produit premium, réaliste] .Composition : [ex. produit au milieu, espace pour le texte en haut]. Lumière et couleur : [par ex. lumière naturelle douce, tons terre] .Technique : [rapport hauteur/largeur, haute résolution, fond uni] .Remarque : Aucun texte/logo lisible dans l'image ; J'ajouterai le texte plus tard.
2) Squelette d’illustration :
Sujet : [que dessiner]. Style : [par ex. illustration vectorielle couleur plate / aquarelle / 3D isométrique] .Palette de couleurs : [2-3 couleurs primaires] .Humeur : [par ex. joyeux, calme, sérieux] .Fond : [uni / à motifs / transparent] .Ratio : [1:1 / 9:16 / 16:9] .
3) Exploration de style (même sujet, esthétique différente) :
Décrivez le sujet suivant avec la même composition dans 4 styles visuels différents : vecteur plat minimal, photo réaliste, aquarelle, 3D isométrique. Écrivez une invite d’une ligne pour chacun. Objet : [coller]
4) Ajout d'une description négative :
Améliorez l'invite suivante et ajoutez les invites indésirables à la fin : "pas de texte, pas de filigrane, pas d'arrière-plan en désordre, pas de mauvaises mains/doigts, pas trop d'objets". Invite : [coller]
Invite faible/Invite forte
Faible : une belle photo de café
Résultat : angle aléatoire, style peu clair, image accessoire qui ne colle pas à la marque.
Puissant : tasse en céramique remplie d'un latte chaud, sur une table en bois clair, sur le côté dans la douce lumière du matin ; photo de produit premium minimale ; tons neutres chauds; gros plan, espace pour le texte en haut à droite ; Carré 1:1, fond uni ; Il ne doit y avoir aucun texte lisible.
Le résultat : un croquis adapté à la marque avec une composition, une lumière et des proportions contrôlées.
Différence : une invite forte remplit clairement les six composants (sujet, contexte, style, composition, lumière, technique) et laisse le texte de côté.
Composants d'invite et tableau des effets
composant
exemple
Effet sur le résultat
sujet
"huile d'olive dans une bouteille en verre"
détermine ce qui apparaît
Style
"photo produit premium"
L'élément qui détermine le plus le langage visuel
composition
"au milieu, avec un espace de texte"
Augmente la convivialité
lumière/couleur
"lumière douce, tons terre"
Transmet le sentiment de la marque
rapport hauteur/largeur
"9h16 verticalement"
Permet de respecter le format
description négative
"pas de texte"
Réduit les défauts
Erreurs courantes
- Ne pas préciser le style : En omettant l'élément le plus décisif, le résultat devient cliché et aléatoire.
- Faire dessiner le texte par l'IA : Lettres corrompues, illisibles ; ajoutez le texte plus tard dans le programme de conception.
- Oublier le rapport : un mauvais rapport hauteur/largeur entraîne un écrêtage et une perte d'éléments dans la publication.
- Invite surchargée : empiler 20 concepts les uns sur les autres perturbe le modèle ; gardez-le clair et hiérarchisé.
- Abandonner d’un seul coup : La diffusion est aléatoire ; Il est normal de produire plusieurs variantes et de choisir la meilleure.
En résumé
L'IA génératrice d'images construit progressivement l'image pour l'adapter à votre invite à partir du bruit aléatoire ; Il ne peut pas lire l’image dans votre tête, il interprète simplement ce que vous écrivez. Une bonne invite se compose de six éléments : le sujet, le contexte, le style, la composition, la lumière/couleur et la technique. Le style est l’élément le plus décisif ; Assurez-vous de spécifier le rapport hauteur/largeur ; Ne laissez pas le texte lisible à l'IA, vous l'ajoutez plus tard. À mesure que la clarté augmente, le nombre de tentatives et la perte de temps diminuent.
Tâche de candidature
Choisissez un produit ou un sujet. Tout d’abord, écrivez-le en une phrase (« un joli X »), essayez-le dans un générateur d’images et notez le résultat. Décrivez ensuite à nouveau le même sujet en remplissant le squelette à six composants, en ajoutant le rapport hauteur/largeur et la description négative. Mettez les deux résultats côte à côte et écrivez en trois puces comment la clarté modifie le résultat.
liste de contrôle
- [ ] J'ai clairement indiqué le sujet, le contexte et le style dans mon invite.
- [ ] J'ai ajouté des composants de composition et de lumière/couleur.
- [ ] J'ai spécifié le rapport hauteur/largeur (1:1 / 9:16 / 16:9).
- [ ] Je n'ai pas demandé à l'IA de dessiner le texte lisible, je l'ai laissé pour plus tard.
- [ ] J'ai exclu les indésirables avec la description négative.
- [ ] Je n'ai fait confiance à aucune expérience et j'ai produit plusieurs variantes.