Unità 2 / 11

Fondamenti di produzione visiva: come funziona l'intelligenza artificiale delle immagini e anatomia rapida

Guadagni:

  • Comprendere come funziona l'intelligenza artificiale visiva (diffusione) e come non può produrre ciò che non è descritto e non può disegnare bene il testo.
  • Capacità di scrivere un forte suggerimento visivo composto da soggetto, contesto, stile, composizione, luce e componenti tecniche.
  • Acquisire la capacità di determinare le proporzioni, impedire che il testo leggibile venga disegnato dall'intelligenza artificiale e ridurre il difetto con una descrizione negativa.

Un designer che produce immagini con l’intelligenza artificiale è come dare un ordine a un artista: più lo spieghi in modo chiaro e accurato, più accurato sarà il risultato. In questa unità comprenderemo in un linguaggio semplice come funziona l'intelligenza artificiale che genera immagini (AI immagine) e impareremo l'anatomia della scrittura di un buon prompt (istruzioni scritte per un messaggio visivo), passo dopo passo. L'obiettivo è riuscire a descrivere consapevolmente l'immagine desiderata, piuttosto che "provare a caso e affidarsi alla fortuna".

Come funziona l'intelligenza artificiale delle immagini? (Spiegazione semplice)

La maggior parte dei produttori di immagini oggi utilizza un metodo chiamato diffusione. Semplicemente: il modello ha imparato le relazioni "quali parole corrispondono a quali immagini" da milioni di coppie immagine-testo. Quando si producono immagini, inizia da un'immagine con rumore casuale (come uno schermo televisivo innevato) e pulisce questo rumore passo dopo passo per adattarlo alla tua richiesta e trasformarlo in un'immagine significativa. In altre parole, il modello non "disegna" l'immagine, ma costruisce statisticamente l'immagine che meglio si adatta alle tue richieste.

Ciò ha tre conseguenze pratiche. Primo: lo stesso prompt fornisce ogni volta un risultato diverso, perché il rumore iniziale è casuale (vedremo come controllarlo con "seed" nella prossima unità). Secondo: il modello non può sapere ciò che non puoi descrivere; Non può leggere l'immagine nella tua testa, interpreta semplicemente ciò che scrivi. Terzo: il modello non riesce a disegnare bene testo e numeri, perché imita le lettere nella forma e non nel significato; Ecco perché è rischioso lasciare la scrittura nei loghi all'intelligenza artificiale.

Suggerimento: non lasciare che l'intelligenza artificiale produca il testo chiaro (nome del marchio, slogan) nell'immagine. Produci un'immagine senza testo e poi aggiungi il testo (come vettore) in un programma di progettazione. Ciò lo rende leggibile e modificabile.

Anatomia di un buon prompt

Aiuta a suddividere un forte suggerimento visivo in sei componenti. Non è necessario utilizzarli tutti ogni volta, ma scegliere consapevolmente determinerà il risultato.

  1. Soggetto/soggetto: Qual è l'elemento principale dell'immagine? ("una tazzina da caffè in ceramica", "ritratto di giovane donna").
  2. Azione/contesto: cosa sta facendo, dov'è? (“alla tavola di legno, nella luce del mattino”).
  3. Stile/estetica: qual è il linguaggio visivo? (“foto minima del prodotto”, “illustrazione ad acquerello”, “rendering 3D isometrico”). Questa è la componente più decisiva.
  4. Composizione/angolo: Com'è l'inquadratura? ("primo piano", "veduta dall'alto", "grandangolo", "al centro, con spazio").
  5. Luce e colore: ("luce naturale morbida", "tavolozza dei toni della terra", "contrasto elevato").
  6. Tecnica/qualità: ("alta risoluzione", "frame rate 1:1", "sfondo bianco").

Esiste anche una ricetta negativa: dire cose che non vuoi ("nessun testo, nessuna persona, nessuno sfondo disordinato"). Approfondiremo questo aspetto con il "suggerimento negativo" nella 4a unità.

Glossario dei termini

  • Proporzioni: le proporzioni dell'immagine; Fotogramma 1:1 (post Instagram), verticale 9:16 (storia/bobine), orizzontale 16:9 (copertina).
  • Risoluzione: numero di pixel nell'immagine; Alto è sufficiente per la stampa, medio è sufficiente per lo schermo.
  • Riferimento di stile: dare un campione al modello dicendo "assomiglia a questo".
  • Render: il computer calcola e produce un'immagine; "Rendering 3D" significa vista volumetrica realistica.

Passo dopo passo: descrivere un'immagine

Diciamo che vogliamo un'immagine di prodotto per un marchio di olio d'oliva.

Passaggio 1: concentrati sull'argomento: "olio extravergine di oliva in una bottiglia di vetro verde scuro".

Passaggio 2 — Aggiungi il contesto: "sul bancone di legno rustico, con alcuni rami di ulivo fresco accanto."

Passaggio 3: scegli lo stile: "foto di prodotto premium, realistica".

Passaggio 4: fornire la composizione: "prodotto al centro, spazio per il testo in alto".

Passo 5 — Luce/colore: “luce naturale morbida, toni caldi della terra”.

Passaggio 6 — Tecnica: “Frame rate 1:1, alta risoluzione, sfondo semplice”.

Combinandoli tutti, ottieni una bozza praticabile che si adatta all'identità del marchio.

tre mini custodie

Caso 1 – Dall’incertezza alla chiarezza. Un designer ha scritto “immagine di un ufficio moderno” e ha fatto 12 tentativi, nessuno dei quali ha funzionato (30 minuti persi). Ha riscritto il suggerimento in sei componenti: "ufficio luminoso e minimale; scrivania in legno; luce naturale proveniente da una grande finestra; toni neutri caldi; grandangolo; spazio del testo in alto". 2 dei primi 4 tentativi erano utilizzabili; Il tempo è stato ridotto a 10 minuti.

Caso 2: trappola del testo. Uno stagista ha chiesto a un'intelligenza artificiale di produrre un poster di un bar dall'inizio alla fine; Il testo "COFFEE" nell'immagine risulta essere "COFEEE" e i prezzi non erano leggibili. Le istruzioni sono cambiate: l'immagine è stata prodotta senza testo, il testo è stato aggiunto successivamente nel programma di progettazione. L'errore è sceso a zero e il poster era pronto per la stampa.

Caso 3 — Perdita di rapporto. Un esperto di social media ha prodotto un'immagine quadrata 1:1 per la storia di Instagram; 9:16 Quando l'ho inserito nell'area verticale, la parte superiore e quella inferiore sono state tagliate e l'elemento importante è andato perso. Quando ho specificato le proporzioni come "9:16 verticale" nel prompt, l'immagine si adattava al suo formato e non era necessaria alcuna riproduzione.

Modelli copiabili

1) Scheletro dell'immagine del prodotto a sei componenti:

[Oggetto: descrivi il prodotto] , [Contesto: dove/come] .Stile: [es. foto del prodotto premium, realistica].Composizione: [ad es. prodotto al centro, spazio per il testo in alto].Luce e colore: [es. luce naturale morbida, tonalità della terra]. Tecnica: [proporzioni, alta risoluzione, sfondo semplice]. Nota: nessun testo/logo leggibile nell'immagine; Aggiungerò il testo più tardi.

2) Scheletro dell'illustrazione:

Oggetto: [cosa disegnare].Stile: [es. illustrazione vettoriale a colori piatti / acquerello / 3D isometrico] .Tavolozza dei colori: [2-3 colori primari] .Umore: [es. allegro, calmo, serio] .Sfondo: [semplice / fantasia / trasparente] .Rapporto: [1:1 / 9:16 / 16:9] .

3) Esplorazione dello stile (stesso soggetto, estetica diversa):

Descrivi il seguente soggetto con la stessa composizione in 4 diversi stili visivi: vettoriale piatto minimale, foto realistica, acquerello, 3D isometrico. Scrivi un messaggio di una riga per ciascuno. Oggetto: [incolla]

4) Aggiunta descrizione negativa:

Migliora il seguente messaggio e aggiungi quelli indesiderati alla fine: "nessun testo, nessuna filigrana, nessuno sfondo disordinato, nessuna mano/dita difettosa, nessun oggetto eccessivo". Suggerimento: [incolla]

Prompt debole / Prompt forte

Debole: una bella foto del caffè

Risultato: angolazione casuale, stile poco chiaro, immagine incidentale che non si adatta al marchio.

Potente: tazza di ceramica piena di latte caldo, su un tavolo di legno chiaro, di lato nella morbida luce mattutina; foto minima del prodotto premium; toni neutri caldi; primo piano, spazio per il testo in alto a destra; Quadrato 1:1, sfondo semplice; Non dovrebbe esserci testo leggibile.

Il risultato: uno schizzo adattivo al marchio con composizione, luce e proporzioni controllate.

Differenza: un suggerimento forte riempie chiaramente le sei componenti (soggetto, contesto, stile, composizione, luce, tecnica) e lascia fuori il testo.

Componenti del prompt e tabella degli effetti

componente

esempio

Effetto sul risultato

soggetto

"olio d'oliva in bottiglia di vetro"

determina ciò che appare

Stile

"foto del prodotto premium"

L'elemento che più determina il linguaggio visivo

composizione

"al centro, con spazio per il testo"

Aumenta l'usabilità

luce/colore

"luce soffusa, toni della terra"

Trasmette la sensazione del marchio

proporzioni

"9:16 verticale"

Permette di rispettare il formato

descrizione negativa

"nessun testo"

Riduce il difetto

Errori comuni

  • Non specificando lo stile: Tralasciando la componente più decisiva, il risultato diventa cliché e casuale.
  • Far disegnare il testo all'IA: lettere corrotte e illeggibili; aggiungere il testo più tardi nel programma di progettazione.
  • Dimenticare le proporzioni: le proporzioni errate creano ritaglio e perdita di elementi nella pubblicazione.
  • Prompt sovraccarico: impilare 20 concetti uno sopra l'altro confonde il modello; mantenerlo chiaro e con priorità.
  • Arrendersi in un colpo solo: la diffusione è casuale; È normale produrre diverse varianti e scegliere quella migliore.

In sintesi

L'intelligenza artificiale che genera l'immagine costruisce gradualmente l'immagine per adattarla al tuo suggerimento dal rumore casuale; Non può leggere l'immagine nella tua testa, interpreta semplicemente ciò che scrivi. Un buon suggerimento è composto da sei componenti: soggetto, contesto, stile, composizione, luce/colore e tecnica. Lo stile è l'elemento più decisivo; Assicurati di specificare le proporzioni; Non lasciare il testo leggibile all'IA, lo aggiungi in seguito. All'aumentare della chiarezza, il numero di tentativi e la perdita di tempo diminuiscono.

Compito dell'applicazione

Scegli un prodotto o un argomento. Per prima cosa, scrivilo in una frase (“una bella X”), provalo in un generatore di immagini e annota il risultato. Quindi descrivi nuovamente lo stesso argomento compilando lo scheletro a sei componenti, aggiungendo le proporzioni e la descrizione negativa. Affianca i due risultati e scrivi in ​​tre punti elenco come la chiarezza cambia l'output.

lista di controllo

  • [ ] Ho indicato chiaramente l'argomento, il contesto e lo stile nel mio suggerimento.
  • [ ] Ho aggiunto composizione e componenti luce/colore.
  • [ ] Ho specificato le proporzioni (1:1 / 9:16 / 16:9).
  • [ ] Non ho lasciato che l'IA disegnasse il testo leggibile, l'ho lasciato per dopo.
  • [ ] Ho escluso gli indesiderabili con la descrizione negativa.
  • [ ] Non mi sono fidato di un singolo esperimento e ho prodotto diverse varianti.