Gains :
- Comprendre le fonctionnement de l'intelligence artificielle génératrice d'images (diffusion) et les composants de recette nécessaires au réalisme photographique
- Capacité à rédiger une invite photographique solide comprenant le sujet, la lumière, l'objectif/appareil photo, la composition, l'atmosphère et les composants techniques.
- Capacité à distinguer la différence entre une image produite et une photographie prise, les limites d'utilisation et l'importance de la déclaration d'authenticité
Un photographe utilise l'IA visuelle générative à trois fins légitimes : produire des ébauches de références pour des moodboards et des concepts, créer des éléments qui complètent la prise de vue réelle (arrière-plan, texture, pièce composite) et créer des images entièrement produites (par exemple, pour une vente de stock ou un concept publicitaire). Dans cette unité, nous apprendrons comment fonctionnent ces outils et comment rédiger des invites pour le réalisme photographique. Le but n’est pas d’attendre un joli coup par hasard ; Cela signifie décrire ce que l’on veut dans le langage d’un photographe et orienter le résultat.
Diffusion : comment le modèle produit-il des « photographies » ?
La plupart des IA génératrices d’images actuelles fonctionnent avec une méthode appelée diffusion. Simplement : le modèle a appris à passer « du bruit à l’image significative » sur des millions d’images. Il part d'un bruit aléatoire pendant la production (comme une capture d'écran enneigée) et crée une image en nettoyant progressivement le bruit pour l'adapter à votre texte (invite). Deux faits fondamentaux en ressortent :
Premièrement, le modèle ne peut pas produire ce qui n’est pas décrit. Si vous ne dites pas la lumière, une lumière aléatoire viendra ; Si l’on ne considère pas la vue objective, la « sensation de photographie » restera une coïncidence. Deuxièmement, le modèle ne comprend pas, il prédit. C'est pourquoi il fait des erreurs (hallucinations) dans des endroits qui nécessitent de la logique, comme les mains, le texte, la réflexion, la symétrie. Si vous voulez un réalisme photographique, vous devez décrire clairement les décisions techniques (lumière, objectif, composition) qui font d'une photographie une photographie.
Attention : Bien qu'une image générée puisse ressembler à une « photo », ce n'est pas une photo ; il ne documente pas un moment réel. L’utiliser dans un reportage, un documentaire ou dans un contexte affirmant que « cela s’est réellement produit » est trompeur et viole les limites éthiques que nous aborderons dans l’unité 9.
Anatomie photographique rapide
Une invite photographique puissante se compose de six éléments. Pensez-y comme si vous planifiiez un tournage :
- Sujet : Quoi/qui ? Âge, vêtements, expression, action, nombre. ("un charpentier d'âge moyen, en tablier, travaillant à l'établi")
- Lumière : Direction, dureté, source, heure. C'est le cœur de la photographie. ("lumière douce des vitres latérales, matin, faible contraste")
- Vue de l'objectif et de la caméra : distance focale, profondeur de champ, angle. ("Sensation d'un objectif portrait 85 mm, faible profondeur de champ, bokeh d'arrière-plan doux, niveau des yeux")
- Composition : Cadrage, placement, cadrage. ("gros plan, règle des tiers, sujet à gauche")
- Ambiance et couleur : Ton, ambiance, palette. ("tons chauds de la terre, calmes, nostalgiques")
- Tech/qualité : Texture, notes de réalisme, rapport hauteur/largeur. ("texture naturelle de la peau, grain du film, rapport 3:2")
Lorsque vous introduisez ces composants en séquence, le modèle produit un résultat « photographique » beaucoup plus contrôlé. Tout composant que vous omettez est laissé au hasard.
Astuce : Ne laissez pas l'IA dessiner le texte/logo. Les modèles de diffusion ne peuvent pas produire de manière fiable un texte lisible et des logos propriétaires ; ajoutez-les dans la phase de conception proprement dite. De plus, dans une image qui nécessite un texte lisible, utilisez l’IA uniquement pour la toile de fond/l’atmosphère.
Rapport hauteur/largeur et utilisation prévue
Le rapport hauteur/largeur est le rapport largeur/hauteur de l'image et détermine son utilisation : 9:16 pour une histoire verticale sur les réseaux sociaux, 3:2 pour une impression standard, 1:1 pour une publication carrée, 16:9 pour une large bannière. Il est préférable de spécifier le rapport dans l'invite dès le début plutôt que de le réduire plus tard et de perdre en qualité. Choisissez la résolution et le ratio dès le début, en connaissant l'utilisation prévue (impression ou affichage).
Recette négative et variation
La plupart des outils ont également une invite négative : une zone dans laquelle vous écrivez des choses que vous ne voulez pas dans l'image ("main déformée, doigts supplémentaires, texte, filigrane, reliure en plastique"). Cela réduit mais n’empêche pas complètement les défauts courants ; la vérification reste essentielle. Il y a aussi le concept de graine – la graine du hasard à partir de laquelle commence la production ; La même graine et la même invite produisent à nouveau un résultat similaire, ce qui vous aide à créer un ensemble cohérent (nous y reviendrons plus en profondeur dans la 4ème unité).
trois mini-cases
Cas 1 — Le pouvoir de la recette. Un photographe de stock a écrit « femme buvant du café » et a obtenu des résultats lamentables. Lorsque Prompta a ajouté de la lumière (éclairage de la fenêtre latérale), un objectif (50 mm, faible profondeur de champ), une atmosphère (matin chaud et calme) et une texture (peau naturelle), le résultat est devenu utilisable. Le taux de génération d'images acceptable est passé d'environ 1/20 à 1/4 ; Le temps de production a été réduit d'un tiers.
Cas 2 — Perte due à une hallucination. Un designer-photographe a mis une image de « gens d'affaires se serrant la main » dans une présentation sans la vérifier. Lors de la réunion, on a remarqué qu'un manager avait trois mains. Le défaut négligé sur le petit écran a été amplifié en projection. Un scan de la main et du doigt de 30 secondes aurait évité cet embarras.
Cas 3 — Choisir le bon outil. Un photographe de produits souhaitait placer une vraie montre qu'il avait photographiée dans un environnement différent. Au lieu de le produire à partir de zéro, il a conservé le cadre réel du produit, seul l'arrière-plan/l'atmosphère a été produit avec l'IA et rendu composite. Ainsi, les détails réels du produit (marque, cadran) n'ont pas été déformés ; la crédibilité et l'exactitude ont été préservées.
Modèles copiables
1) Squelette d'invite photographique :
[sujet : qui/quoi, âge, vêtement, expression, action],[lumière : direction, dureté, source, temps],[objectif/appareil photo : sens de la focale, profondeur de champ, angle],[composition : cadrage, placement, convention],[ambiance/couleur : ton, humeur, palette],[technique : texture naturelle, grain, rapport hauteur/largeur].Photographique, réaliste. Ajoutez du texte/logo.
2) Brouillon d'invite négatif :
Points négatifs (ce que je ne veux pas) : main mal formée, doigts supplémentaires/manquants, visage tordu, peau plastique/cireuse, texte illisible, filigrane, texture répétitive, ombre impossible, couleur sursaturée.
3) Pour référence au moodboard (direction, pas livraison) :
Objectif : référence moodboard pour un shooting (pas le livrable).Concept : [concept]. Décrivez l'esthétique avec des attributs uniquement : lumière [..], palette de couleurs [..], atmosphère [..], composition [..]. N’utilisez aucun nom de personne/marque/photographe. Générez 4 variantes.
4) Plan composite protégeant le produit réel :
J'ai une vraie photo de [produit] ; Le produit lui-même ne changera pas. Écrivez l'invite pour que l'image soit produite pour l'arrière-plan/l'atmosphère uniquement : [lumière, surface, couleur, environnement]. La direction de l'ombre et la dureté de la lumière du produit doivent être [..] pour que le composite soit convaincant.
Invite faible/Invite forte
Faible : « Belle photo de portrait. »
Fort : "Femme de ferme d'âge moyen, visage usé par le soleil, léger sourire, dans un champ de blé ; lumière dorée de l'heure de côté, faible contraste ; vue portrait de 85 mm, faible profondeur de champ, arrière-plan doux ; gros plan, sujet à gauche, règle des tiers ; tons chauds de la terre, ambiance calme et digne ; texture naturelle de la peau, grain de film léger, 3:2. Photographique, réaliste. Ajout de texte. "
La volonté faible est entièrement laissée au hasard ; Étant donné qu’une forte demande décrit la lumière, la lentille, la composition et l’atmosphère, elle augmente considérablement la probabilité de produire le résultat souhaité.
Erreurs courantes
- Ne décrivant pas la lumière et l'objectif. Ces deux éléments sont en grande partie ce qui fait d’une photographie une photographie ; Si vous le laissez vide, le résultat sera laissé au hasard.
- Demander à l'IA de dessiner un texte/logo lisible. Le modèle ne peut pas les produire de manière fiable ; Il peut s'avérer défectueux et protégé par le droit d'auteur.
- Présenter l'image produite comme une « photographie ». C’est trompeur dans un contexte documentaire/actualité ; Une déclaration de fait est requise.
- Copie du style avec le nom de la personne/de la marque. Risque d’imitation et de droit d’auteur ; Décrivez l’esthétique avec des qualités.
- Ignorer la vérification. Les mains, les yeux, les reflets, les ombres et les textures répétitives doivent être vérifiés dans chaque image produite.
En résumé
L’IA visuelle générative fonctionne par diffusion : elle passe du bruit à l’image qui s’adapte au texte, ne peut pas produire ce qui n’est pas décrit et se trompe là où la logique est requise. Pour un réalisme photographique, décrivez le sujet, la lumière, l'objectif, la composition, l'atmosphère et la technique comme un photographe. Choisissez le rapport hauteur/largeur en fonction de l'objectif, réduisez l'artefact avec une recette négative, ne laissez pas l'IA dessiner le texte et vérifiez chaque sortie. N'utilisez jamais une image produite prétendant être une « photo prise ».
Tâche de candidature
Choisissez un concept et rédigez une invite photographique, en remplissant les six éléments avec le modèle 1. Produisez (ou décrivez) le même concept d'abord en une seule phrase, comme « une belle photo », puis avec le squelette complet, et comparez les deux résultats. Marquez au moins trois points de défauts possibles dans l'image que vous produisez en agrandissant les mains, les yeux, les reflets et les ombres.
liste de contrôle
- [ ] Dans l'invite, j'ai décrit séparément le sujet, la lumière, l'objectif, la composition, l'atmosphère et la technique.
- [ ] J'ai déterminé le rapport hauteur/largeur en fonction de l'utilisation prévue.
- [ ] J'ai réduit les défauts courants avec la recette négative.
- [ ] Je n'avais pas le texte/logo lisible dessiné par l'IA.
- [ ] Je me suis assuré de ne pas présenter l'image générée comme une "photo".
- [ ] J'ai vérifié le résultat pour la main/l'œil/la réflexion/l'ombre.