Unità 3 / 11

Produzione visiva fotografica e anatomia rapida: come funziona la diffusione?

Guadagni:

  • Comprendere come funziona l'intelligenza artificiale (diffusione) per la generazione di immagini e quali componenti della ricetta sono necessari per il realismo fotografico
  • Capacità di scrivere un forte suggerimento fotografico composto da soggetto, luce, obiettivo/fotocamera, composizione, atmosfera e componenti tecnici.
  • Capacità di distinguere la differenza tra un'immagine prodotta e una fotografia scattata, i limiti di utilizzo e l'importanza della dichiarazione di autenticità

Un fotografo utilizza l'intelligenza artificiale visiva generativa per tre scopi legittimi: produrre bozze di riferimenti per moodboard e concetti, creare elementi che completino lo scatto reale (sfondo, trama, pezzo composito) e creare immagini completamente prodotte (ad esempio, per una vendita di azioni o un concetto pubblicitario). In questa unità impareremo come funzionano questi strumenti e come scrivere suggerimenti per il realismo fotografico. L'obiettivo non è aspettare un bel tiro per caso; Significa descrivere ciò che si desidera nel linguaggio di un fotografo e indirizzare il risultato.

Diffusione: come fa il modello a produrre “fotografie”?

La maggior parte delle attuali IA che generano immagini funzionano con un metodo chiamato diffusione. Semplicemente: il modello ha imparato a passare “dal rumore all'immagine significativa” su milioni di immagini. Inizia da un rumore casuale durante la produzione (come uno screenshot innevato) e crea un'immagine ripulendo gradualmente il rumore per adattarlo al testo (prompt). Da ciò emergono due fatti fondamentali:

Innanzitutto il modello non può produrre ciò che non è descritto. Se non dici la luce, arriverà una luce casuale; Se non si considera la visione oggettiva, la "sensazione della fotografia" rimarrà una coincidenza. In secondo luogo, il modello non capisce, prevede. Ecco perché commette errori (allucinazioni) in luoghi che richiedono logica, come le mani, il testo, la riflessione, la simmetria. Se vuoi il realismo fotografico, devi descrivere chiaramente le decisioni tecniche – luce, obiettivo, composizione – che rendono una fotografia una fotografia.

Attenzione: anche se un'immagine generata può sembrare "simile a una foto", non è una foto; non documenta un momento reale. Usarlo in una notizia, in un documentario o in un contesto affermando che "questo è realmente accaduto" è fuorviante e viola il confine etico, di cui parleremo nell'unità 9.

Anatomia del suggerimento fotografico

Un potente suggerimento fotografico è composto da sei componenti. Pensa a questi come alla pianificazione di una ripresa:

  1. Oggetto: cosa/chi? Età, abbigliamento, espressione, azione, numero. ("un falegname di mezza età, in grembiule, che lavora al banco da lavoro")
  2. Luce: direzione, durezza, fonte, tempo. È il cuore della fotografia. ("luce morbida del finestrino laterale, mattina, basso contrasto")
  3. Vista dell'obiettivo e della fotocamera: lunghezza focale, profondità di campo, angolo. ("Sensazione dell'obiettivo verticale da 85 mm, profondità di campo ridotta, bokeh morbido sullo sfondo, livello degli occhi")
  4. Composizione: Inquadratura, posizionamento, inquadratura. ("primo piano, regola dei terzi, soggetto a sinistra")
  5. Atmosfera e colore: tono, stato d'animo, tavolozza. ("toni caldi della terra, calmi, nostalgici")
  6. Tecnologia/qualità: texture, note di realismo, proporzioni. ("struttura naturale della pelle, grana della pellicola, rapporto 3:2")

Quando si introducono questi componenti in sequenza, il modello produce un risultato "fotografico" molto più controllato. Qualsiasi componente tralasciato è lasciato al caso.

Suggerimento: non lasciare che l'intelligenza artificiale disegni il testo/logo. I modelli di diffusione non possono produrre in modo affidabile testo leggibile e loghi proprietari; aggiungerli nella fase di progettazione vera e propria. Inoltre, in un'immagine che richiede testo leggibile, utilizza l'intelligenza artificiale solo per lo sfondo/l'atmosfera.

Proporzioni e destinazione d'uso

Le proporzioni sono il rapporto larghezza-altezza dell'immagine e ne determinano l'utilizzo: 9:16 per una storia verticale sui social media, 3:2 per la stampa standard, 1:1 per un post quadrato, 16:9 per un banner largo. È meglio specificare il rapporto nel prompt fin dall'inizio piuttosto che ritagliarlo in seguito e perdere qualità. Scegli fin dall'inizio la risoluzione e il rapporto, conoscendo la destinazione d'uso (stampa o display).

Ricetta e variazione negativa

La maggior parte degli strumenti ha anche un suggerimento negativo: un'area in cui scrivi cose che non vuoi nell'immagine ("mano deformata, dita extra, testo, filigrana, rilegatura in plastica"). Ciò riduce ma non previene completamente i difetti comuni; la verifica è ancora essenziale. Esiste anche il concetto di seme: il seme della casualità da cui inizia la produzione; Lo stesso seme e lo stesso prompt producono nuovamente un risultato simile, che ti aiuta a creare un set coerente (andremo più in profondità nella quarta unità).

tre mini custodie

Caso 1 – Il potere della ricetta. Un fotografo di stock ha scritto "donna che beve caffè" e ha ottenuto risultati tristi. Quando Prompta ha aggiunto la luce (luce del finestrino laterale), l'obiettivo (50 mm, profondità di campo ridotta), l'atmosfera (mattina calda e calma) e la consistenza (pelle naturale), il risultato è diventato utilizzabile. La velocità di generazione dei fotogrammi accettabile è aumentata da circa 1/20 a 1/4; Il tempo di produzione è stato ridotto di un terzo.

Caso 2 — Perdita dovuta ad allucinazione. Un designer-fotografo ha inserito in una presentazione l'immagine di "uomini d'affari che si stringono la mano" senza controllarla. Durante l'incontro si è notato che un manager aveva tre mani. Il difetto che veniva trascurato sul piccolo schermo veniva ingigantito in proiezione. Una scansione delle mani/delle dita di 30 secondi avrebbe evitato questo imbarazzo.

Caso 3 — Scegliere lo strumento giusto. Un fotografo di prodotti desiderava collocare un vero orologio da lui scattato in un ambiente diverso. Invece di produrlo da zero, ha mantenuto la struttura reale del prodotto, solo lo sfondo/l'atmosfera è stato prodotto con l'intelligenza artificiale e reso composito. In questo modo i dettagli reali del prodotto (marchio, quadrante) non sono stati distorti; sia la credibilità che l'accuratezza sono state preservate.

Modelli copiabili

1) Scheletro del suggerimento fotografico:

[soggetto: chi/cosa, età, abbigliamento, espressione, azione],[luce: direzione, durezza, fonte, tempo],[obiettivo/fotocamera: senso della lunghezza focale, profondità di campo, angolo],[composizione: inquadratura, posizionamento, convenzione],[atmosfera/colore: tono, umore, tavolozza],[tecnica: struttura naturale, grana, proporzioni].Fotografico, realistico. Aggiungi testo/logo.

2) Bozza immediata negativa:

Aspetti negativi (cosa non voglio): mano malformata, dita extra/mancanti, viso storto, pelle plastica/simile alla cera, testo illeggibile, filigrana, texture ripetuta, ombra impossibile, colore troppo saturo.

3) Per riferimento al moodboard (direzione, non consegna):

Scopo: riferimento al moodboard per uno scatto (non il risultato finale).Concetto: [concetto]. Descrivi l'estetica solo con attributi: luce [..], tavolozza dei colori [..], atmosfera [..], composizione [..]. Non utilizzare nomi di persone/marchi/fotografi. Genera 4 varianti.

4) Piano composito che protegge il prodotto reale:

Ho una vera possibilità [di prodotto]; Il prodotto stesso non cambierà. Scrivi la richiesta per l'immagine da produrre solo per lo sfondo/atmosfera: [luce, superficie, colore, ambiente]. La direzione dell'ombra e la durezza della luce del prodotto dovrebbero essere [..] affinché il composito sia convincente.

Prompt debole / Prompt forte

Debole: "Bel ritratto".

Forte: "Donna di campagna di mezza età, viso segnato dal sole, lieve sorriso, in un campo di grano; luce dorata laterale, basso contrasto; visualizzazione verticale da 85 mm, profondità di campo ridotta, sfondo morbido; primo piano, soggetto a sinistra, regola dei terzi; tonalità calde della terra, umore calmo e dignitoso; struttura naturale della pelle, grana leggera della pellicola, 3:2. Fotografico, realistico. Aggiunta di testo."

La volontà debole è lasciata interamente al caso; Poiché una forte domanda descrive la luce, l'obiettivo, la composizione e l'atmosfera, aumenta notevolmente la probabilità di produrre il risultato desiderato.

Errori comuni

  • Non descrivere la luce e l'obiettivo. Questi due sono in gran parte ciò che rende una fotografia una fotografia; Se lo lasci vuoto, il risultato sarà lasciato al caso.
  • Fare in modo che l'IA disegni testo/logo leggibile. Il modello non può produrli in modo affidabile; Potrebbe rivelarsi difettoso e protetto da copyright.
  • Presentare l'immagine prodotta come una "fotografia". È fuorviante in un contesto documentaristico/notiziario; È necessaria una dichiarazione di fatto.
  • Copiare lo stile con il nome della persona/del marchio. Rischio di imitazione e diritto d'autore; Descrivere l'estetica con le qualità.
  • Saltare la verifica. Mani, occhi, riflessi, ombre e trame ripetute devono essere controllati in ogni immagine prodotta.

In sintesi

L’intelligenza artificiale visiva generativa funziona per diffusione: passa dal rumore all’immagine che si adatta al testo, non può produrre ciò che non è descritto e sbaglia dove è richiesta la logica. Per il realismo fotografico, descrivi il soggetto, la luce, l'obiettivo, la composizione, l'atmosfera e la tecnica come un fotografo. Scegli le proporzioni in base allo scopo, riduci l'artefatto con una ricetta negativa, non lasciare che l'intelligenza artificiale disegni il testo e verifica ogni output. Non utilizzare mai un'immagine prodotta che affermi di essere una "foto scattata".

Compito dell'applicazione

Scegli un concetto e scrivi un suggerimento fotografico, compilando tutti e sei i componenti con il modello 1. Produci (o descrivi) lo stesso concetto prima in una singola frase, ad esempio "una bella foto", quindi con lo scheletro completo, e confronta i due risultati. Segna almeno tre possibili punti difettosi nell'immagine che produci ingrandendo mani, occhi, riflessi e ombre.

lista di controllo

  • [ ] Nella richiesta ho descritto separatamente soggetto, luce, obiettivo, composizione, atmosfera e tecnica.
  • [ ] Ho determinato le proporzioni in base all'uso previsto.
  • [ ] Ho ridotto i difetti comuni con la ricetta negativa.
  • [] Non avevo il testo/logo leggibile dell'AI.
  • [ ] Mi sono assicurato di non presentare l'immagine generata come una "foto".
  • [ ] Ho verificato l'output per mano/occhio/riflesso/ombra.