Unitate 2 / 11

Fundamentele producției vizuale: Cum funcționează AI pentru imagine și Anatomie promptă

Câștiguri:

  • Înțelegerea modului în care funcționează inteligența artificială vizuală (difuzia) și cum nu poate produce ceea ce nu este descris și nu poate desena bine textul.
  • Abilitatea de a scrie un prompt vizual puternic, constând din subiect, context, stil, compoziție, lumină și componente tehnice.
  • Obținerea capacității de a determina raportul de aspect, de a preveni desenarea textului lizibil de către inteligența artificială și de a reduce defectul cu o descriere negativă.

Un designer care produce imagini cu inteligență artificială este ca și cum ai da o comandă unui artist: cu cât o explici mai clar și mai precis, cu atât rezultatul va fi mai precis. În această unitate, vom înțelege într-un limbaj simplu cum funcționează inteligența artificială generatoare de imagini (imagine AI) și vom învăța pas cu pas anatomia scrierii unui prompt bun (instrucțiuni scrise pentru un vizual). Scopul este să poți descrie în mod conștient imaginea pe care o dorești, mai degrabă decât să „încerci la întâmplare și să te bazezi pe noroc”.

Cum funcționează Image AI? (explicație simplă)

Majoritatea producătorilor de imagini folosesc astăzi o metodă numită difuzie. Pur și simplu: modelul a învățat relațiile „ce cuvinte corespund căror imagini” din milioane de perechi imagine-text. Când produceți imagini, pornește de la o imagine cu zgomot aleatoriu (cum ar fi un ecran de televizor înzăpezit) și curăță acest zgomot pas cu pas pentru a se potrivi promptului dvs. și îl transformă într-o imagine semnificativă. Cu alte cuvinte, modelul nu „desenează” imaginea, el construiește statistic imaginea care se potrivește cel mai bine promptului tău.

Acest lucru are trei consecințe practice. În primul rând: Același prompt dă un rezultat diferit de fiecare dată, deoarece zgomotul inițial este aleatoriu (vom vedea cum să controlăm acest lucru cu „seed” în unitatea următoare). În al doilea rând: modelul nu poate ști ceea ce nu poți descrie; Nu poate citi poza din capul tău, doar interpretează ceea ce scrii. În al treilea rând: Modelul nu poate desena bine textul și numărul, deoarece imită literele ca formă și nu ca sens; De aceea este riscant să lași scrisul în logo-uri în seama AI.

Sfat: nu lăsați AI să producă textul clar (numele mărcii, sloganul) din imagine. Produceți o imagine fără text și apoi adăugați textul (ca vector) într-un program de proiectare. Acest lucru îl face atât citibil, cât și editabil.

Anatomia unui prompt bun

Ajută la împărțirea unui prompt vizual puternic în șase componente. Nu trebuie să le folosiți pe toate de fiecare dată, dar alegerea în mod conștient va determina rezultatul.

  1. Subiect/subiect: Care este elementul principal al imaginii? („o ceașcă de cafea din ceramică”, „portretul unei tinere”).
  2. Acțiune/context: Ce face, unde este? („la masa de lemn, în lumina dimineții”).
  3. Stil/estetică: Ce este limbajul vizual? („fotografie minimă a produsului”, „ilustrare acuarelă”, „redare izometrică 3D”). Aceasta este componenta cea mai decisivă.
  4. Compoziție / unghi: Cum este cadrul? („prim-plan”, „vizualizare de pasăre”, „unghi larg”, „în mijloc, cu spațiu”).
  5. Lumină și culoare: („lumină naturală moale”, „paletă de tonuri de pământ”, „contrast ridicat”).
  6. Tehnica/calitate: („rezoluție înaltă”, „rată de cadre 1:1”, „fond alb simplu”).

Există și o rețetă negativă: să spui lucruri pe care nu le dorești („fără text, fără oameni, fără fundal dezordonat”). Vom aprofunda acest lucru cu „prompt negativ” în a 4-a unitate.

Glosar de termeni

  • Raport de aspect: raportul de aspect al imaginii; Cadru 1:1 (postare pe Instagram), portret 9:16 (poveste/role), peisaj 16:9 (copertă).
  • Rezoluție: Numărul de pixeli din imagine; Mare este suficient pentru imprimare, mediu este suficient pentru ecran.
  • Referință de stil: oferirea unui eșantion modelului care spune „arata așa”.
  • Redare: computerul calculează și produce o imagine; „Randarea 3D” înseamnă vizualizare volumetrică realistă.

Pas cu pas: descrierea unei imagini

Să presupunem că vrem o imagine de produs pentru o marcă de ulei de măsline.

Pasul 1 — Concentrați-vă pe subiect: „ulei de măsline extravirgin într-o sticlă de sticlă verde închis”.

Pasul 2 — Adăugați context: „pe blatul rustic din lemn, cu câteva ramuri de măslin proaspete lângă el.”

Pasul 3 — Alegeți stilul: „fotografie de produs premium, realistă”.

Pasul 4 — Dați compoziția: „produs în mijloc, spațiu pentru text în partea de sus”.

Pasul 5 — Lumină/culoare: „lumină naturală din partea moale, tonuri calde de pământ”.

Pasul 6 — Tehnica: „Rata de cadre 1:1, rezoluție înaltă, fundal simplu”.

Când le combinați pe toate, obțineți o schiță funcțională care se potrivește identității mărcii.

trei mini cutii

Cazul 1 – De la incertitudine la claritate. Un designer a scris „imaginea unui birou modern” și a făcut 12 încercări, dintre care niciuna nu a funcționat (a pierdut 30 de minute). El a rescris promptul în șase componente: „birou luminos, minimal; birou din lemn; lumină naturală de la fereastra mare; tonuri neutre calde; unghi larg; spațiu de text în partea de sus”. 2 din primele 4 încercări au fost utilizabile; Timpul a fost redus la 10 minute.

Cazul 2 — Capcană text. Un stagiar a făcut ca un AI să producă un poster de cafenea de la început până la sfârșit; Textul „CAFEA” din imagine s-a dovedit a fi „CAFEA” iar prețurile nu erau citite. Instrucțiunile s-au schimbat: imaginea a fost produsă fără text, textul a fost adăugat ulterior în programul de proiectare. Eroarea a scăzut la zero și posterul era potrivit pentru tipărire.

Cazul 3 — Pierderea raportului. Un expert în rețelele sociale a produs o imagine pătrată 1:1 pentru povestea Instagram; 9:16 Când l-am pus în zona verticală, partea de sus și de jos au fost tăiate și elementul important s-a pierdut. Când am specificat raportul de aspect ca „9:16 vertical” în prompt, imaginea se potrivea în formatul său și nu a fost necesară reproducerea.

Șabloane copiabile

1) Schelet de imagine a produsului cu șase componente:

[Subiect: descrie produsul] , [Context: unde/cum] .Stil: [de ex. fotografie produs premium, realistă] .Compoziție: [de ex. produs în mijloc, spațiu pentru text în partea de sus].Lumină și culoare: [de ex. lumină naturală moale, tonuri pământii] .Tehnică: [raport aspect, rezoluție înaltă, fundal simplu] .Notă: nu există text/logo lizibil în imagine; Voi adăuga textul mai târziu.

2) Scheletul ilustrației:

Subiect: [ce să desenezi].Stil: [de ex. ilustrație vectorială de culoare plată / acuarelă / 3D izometric] .Paletă de culori: [2-3 culori primare] .Dispoziție: [de ex. vesel, calm, serios] .Fundal: [negru / modelat / transparent] .Raport: [1:1 / 9:16 / 16:9] .

3) Explorarea stilului (același subiect, estetică diferită):

Descrie următorul subiect cu aceeași compoziție în 4 stiluri vizuale diferite: vector plat minim, fotografie realistă, acuarelă, 3D izometric. Scrieți un prompt pe o linie pentru fiecare. Subiect: [paste]

4) Adăugarea unei descrieri negative:

Îmbunătățiți următorul prompt și adăugați-le pe cele nedorite la sfârșit: „fără text, fără filigran, fără fundal dezordonat, fără mâini/degete rele, fără prea multe obiecte”. Solicitare: [paste]

Prompt slab / Prompt puternic

Slab: o fotografie frumoasă de cafea

Rezultat: Unghi aleatoriu, stil neclar, imagine incidentală care nu se potrivește mărcii.

Puternic: ceașcă din ceramică umplută cu un latte fierbinte, pe o masă din lemn deschis, lateral în lumina blândă a dimineții; fotografie minimă a produsului premium; tonuri neutre calde; prim-plan, spațiu pentru text în dreapta sus; 1:1 pătrat, fundal simplu; Nu ar trebui să existe un text lizibil.

Rezultatul: o schiță adaptată mărcii, cu compoziție, lumină și proporție controlate.

Diferență: Un prompt puternic umple cele șase componente (subiect, context, stil, compoziție, lumină, tehnică) în mod clar și omite textul.

Componente prompte și tabel de efecte

componentă

exemplu

Efect asupra rezultatului

subiect

„ulei de măsline într-o sticlă”

determină ceea ce apare

Stil

"fotografie premium produs"

Elementul care determină cel mai mult limbajul vizual

compoziție

„în mijloc, cu spațiu pentru text”

Crește gradul de utilizare

lumină/culoare

„lumină moale, tonuri pământii”

Transmite sentimentul de brand

raportul de aspect

„9:16 vertical”

Permite respectarea formatului

descriere negativă

"fara text"

Reduce defectul

Greșeli comune

  • Nespecificarea stilului: Omitând cea mai decisivă componentă, rezultatul devine clișeu și aleatoriu.
  • Dacă AI-ul desenează textul: litere corupte, ilizibile; adăugați textul mai târziu în programul de proiectare.
  • Uitarea raportului: raportul de aspect greșit creează tăiere și pierderi de elemente în publicație.
  • Prompt supraîncărcat: stivuirea a 20 de concepte una peste alta încurcă modelul; păstrați-l clar și prioritizat.
  • Renunțarea dintr-o singură încercare: Difuzia este aleatorie; Este normal să se producă mai multe variante și să o alegi pe cea mai bună.

Pe scurt

AI care generează imagini construiește treptat imaginea pentru a se potrivi promptului dvs. din zgomot aleatoriu; Nu poate citi poza din capul tău, doar interpretează ceea ce scrii. Un prompt bun constă din șase componente: subiect, context, stil, compoziție, lumină/culoare și tehnică. Stilul este elementul cel mai decisiv; Asigurați-vă că specificați raportul de aspect; Nu lăsați textul lizibil în seama AI, îl adăugați mai târziu. Pe măsură ce claritatea crește, numărul de încercări și pierderea de timp scade.

Sarcina de aplicare

Alegeți un produs sau un subiect. Mai întâi, scrieți-l într-o singură propoziție („un X frumos”) și încercați-l într-un generator de imagini și notați rezultatul. Apoi descrieți din nou același subiect completând scheletul cu șase componente, adăugând raportul de aspect și descrierea negativă. Puneți cele două rezultate unul lângă altul și scrieți în trei puncte cum modifică claritatea rezultatul.

lista de verificare

  • [ ] Am precizat clar subiectul, contextul și stilul în promptul meu.
  • [ ] Am adăugat compoziție și componente de lumină/culoare.
  • [ ] Am specificat raportul de aspect (1:1 / 9:16 / 16:9).
  • [ ] Nu am avut AI-ul să deseneze textul lizibil, l-am lăsat pentru mai târziu.
  • [ ] Am exclus indezirabilii cu descrierea negativă.
  • [ ] Nu am avut încredere într-un singur experiment și am produs mai multe variații.