Enhed 2 / 11

Grundlæggende om visuel produktion: Sådan fungerer billed-AI og anatomi

Gevinster:

  • Forståelse af, hvordan visuel kunstig intelligens (diffusion) virker, og hvordan den ikke kan producere det, der ikke er beskrevet, og ikke kan tegne tekst godt.
  • Evne til at skrive en stærk visuel prompt bestående af emne, kontekst, stil, komposition, lys og tekniske komponenter.
  • At opnå evnen til at bestemme størrelsesforholdet, forhindre den læsbare tekst i at blive tegnet af kunstig intelligens og reducere defekten med en negativ beskrivelse.

En designer, der producerer visuals med AI, er som at give en ordre til en kunstner: Jo klarere og mere præcis du forklarer det, jo mere præcist bliver resultatet. I denne enhed vil vi i almindeligt sprog forstå, hvordan billedgenererende kunstig intelligens (image AI) fungerer, og lære anatomien i at skrive en god prompt (skriftlig instruktion til en visualisering), trin for trin. Målet er at være i stand til bevidst at beskrive det billede, du ønsker, frem for at "prøve tilfældigt og stole på heldet".

Hvordan fungerer Image AI? (Simpel forklaring)

De fleste billedproducenter bruger i dag en metode kaldet diffusion. Simpelthen: Modellen har lært "hvilke ord svarer til hvilke billeder"-relationer fra millioner af billed-tekst-par. Når du producerer billeder, starter det fra et billede med tilfældig støj (såsom en snedækket fjernsynsskærm) og renser denne støj trin for trin, så det passer til din prompt og forvandler det til et meningsfuldt billede. Modellen "tegner" med andre ord ikke billedet, den konstruerer statistisk det billede, der passer bedst til din prompt.

Dette har tre praktiske konsekvenser. For det første: Den samme prompt giver et andet resultat hver gang, fordi den indledende støj er tilfældig (vi vil se, hvordan man styrer dette med "seed" i næste enhed). For det andet: Modellen kan ikke vide, hvad du ikke kan beskrive; Den kan ikke læse billedet i dit hoved, den fortolker bare det du skriver. For det tredje: Modellen kan ikke tegne tekst og tal godt, fordi den efterligner bogstaver i form og ikke i betydning; Derfor er det risikabelt at overlade skriften i logoer til AI.

Tip: Lad ikke AI producere den klare tekst (varenavn, slogan) i billedet. Man producerer et billede uden tekst og tilføjer derefter teksten (som vektor) i et designprogram. Dette gør den både læsbar og redigerbar.

Anatomi af en god prompt

Det hjælper med at opdele en stærk visuel prompt i seks komponenter. Du behøver ikke bruge dem alle hver gang, men at vælge bevidst vil afgøre resultatet.

  1. Emne/emne: Hvad er hovedelementet i billedet? ("en keramisk kaffekop", "portræt af en ung kvinde").
  2. Handling/kontekst: Hvad laver han, hvor er han? ("ved træbordet, i morgenlyset").
  3. Stil/æstetik: Hvad er det visuelle sprog? ("minimalt produktfoto", "akvarelillustration", "isometrisk 3D-gengivelse"). Dette er den mest afgørende komponent.
  4. Sammensætning / vinkel: Hvordan er rammen? ("nærbillede", "fugleperspektiv", "vidvinkel", "i midten, med plads").
  5. Lys og farve: ("blødt naturligt lys", "jordfarvepalet", "høj kontrast").
  6. Teknik/kvalitet: ("høj opløsning", "1:1 billedhastighed", "baggrund almindelig hvid").

Der er også en negativ opskrift: at sige ting, du ikke vil have ("ingen tekst, ingen mennesker, ingen rodet baggrund"). Vi vil uddybe dette med "negativ prompt" i 4. enhed.

Ordliste over termer

  • Billedformat: Billedets billedformat; 1:1-ramme (Instagram-indlæg), 9:16 portræt (historie/ruller), 16:9 landskab (cover).
  • Opløsning: Antal pixels i billedet; Høj er nok til udskrivning, medium er nok til skærm.
  • Stilreference: Giver en prøve til modellen, hvor der står "se sådan her".
  • Render: Computeren beregner og producerer et billede; "3D-gengivelse" betyder realistisk volumetrisk visning.

Trin for trin: beskrivelse af et billede

Lad os sige, at vi ønsker et produktbillede for et olivenoliemærke.

Trin 1 — Fokus på emnet: "ekstra jomfruolivenolie i en mørkegrøn glasflaske."

Trin 2 — Tilføj kontekst: "på den rustikke trædisk med et par friske olivengrene ved siden af."

Trin 3 — Vælg stil: "Premium produktfoto, realistisk".

Trin 4 — Giv kompositionen: "produkt i midten, plads til tekst øverst".

Trin 5 — Lys/farve: "blødt naturligt sidelys, varme jordfarver".

Trin 6 — Teknik: "1:1 billedhastighed, høj opløsning, almindelig baggrund".

Når du kombinerer dem alle, får du et brugbart udkast, der passer til brandets identitet.

tre minisager

Case 1 — Fra usikkerhed til klarhed. En designer skrev "billede af et moderne kontor" og gjorde 12 forsøg, hvoraf ingen virkede (tabte 30 minutter). Han omskrev prompten til seks komponenter: "lyst, minimalistisk kontor; træskrivebord; naturligt lys fra stort vindue; varme neutrale toner; vidvinkel; tekstrum øverst". 2 af de første 4 forsøg var brugbare; Tiden blev reduceret til 10 minutter.

Case 2 - Tekstfælde. En praktikant fik en AI til at lave en cafeplakat fra start til slut; Teksten "COFFEE" på billedet viste sig at være "COFEEE", og priserne kunne ikke læses. Instruktionerne ændrede sig: billedet blev produceret uden tekst, teksten blev tilføjet senere i designprogrammet. Fejlen faldt til nul, og plakaten var velegnet til tryk.

Tilfælde 3 — Tab af ratio. En ekspert på sociale medier producerede et 1:1 kvadratisk billede til Instagram-historien; 9:16 Da jeg satte den i det lodrette område, blev toppen og bunden skåret af, og det vigtige element gik tabt. Da jeg specificerede billedformatet som "9:16 lodret" i prompten, passede billedet ind i dets format, og der krævedes ingen reproduktion.

Kopierbare skabeloner

1) Seks-komponent produktbillede skelet:

[Emne: beskriv produktet], [Kontekst: hvor/hvordan] .Stil: [f.eks. premium produktfoto, realistisk] .Komposition: [f.eks. produkt i midten, plads til tekst øverst].Lys og farve: [f.eks. blødt naturligt lys, jordfarver] .Teknik: [billedforhold, høj opløsning, almindelig baggrund] .Bemærk: Ingen læselig tekst/logo på billedet; Jeg tilføjer teksten senere.

2) Illustrationsskelet:

Emne: [hvad skal tegnes]. Stil: [f.eks. flad farve vektorillustration / akvarel / isometrisk 3D] .Farvepalet: [2-3 primære farver] .Stemning: [f.eks. munter, rolig, alvorlig] .Baggrund: [almindelig / mønstret / gennemsigtig] .Forhold: [1:1 / 9:16 / 16:9] .

3) Stiludforskning (samme emne, forskellig æstetik):

Beskriv følgende emne med samme komposition i 4 forskellige visuelle stilarter: minimal flad vektor, realistisk foto, akvarel, isometrisk 3D. Skriv en en-linje prompt for hver. Emne: [indsæt]

4) Tilføjelse af negativ beskrivelse:

Forbedre følgende prompt og tilføj de uønskede til sidst: "ingen tekst, intet vandmærke, ingen rodet baggrund, ingen dårlige hænder/fingre, ingen for mange objekter". Spørgsmål: [indsæt]

Svag prompt / Stærk prompt

Svag: et smukt kaffebillede

Resultat: Tilfældig vinkel, uklar stil, tilfældigt billede, der ikke passer til mærket.

Kraftig: Keramisk kop fyldt med en varm latte, på lyst træbord, sidelæns i blødt morgenlys; minimal premium produkt foto; varme neutrale toner; nærbillede, plads til tekst øverst til højre; 1:1 kvadratisk, almindelig baggrund; Der bør ikke være nogen læselig tekst.

Resultatet: en brand-adaptiv skitse med kontrolleret komposition, lys og proportioner.

Forskel: En stærk prompt udfylder de seks komponenter (emne, kontekst, stil, komposition, lys, teknik) tydeligt og udelader teksten.

Prompte komponenter og effekttabel

komponent

eksempel

Effekt på resultatet

emne

"olivenolie i en glasflaske"

bestemmer, hvad der vises

Stil

"Premium produkt foto"

Det element, der mest bestemmer det visuelle sprog

sammensætning

"i midten, med tekstmellemrum"

Øger brugervenligheden

lys/farve

"blødt lys, jordfarver"

Formidler mærkefølelsen

billedformat

"9:16 lodret"

Giver mulighed for at overholde formatet

negativ beskrivelse

"ingen tekst"

Reducerer defekter

Almindelige fejl

  • Uden at specificere stilen: Ved at udelade den mest afgørende komponent bliver resultatet kliché og tilfældigt.
  • Lad AI tegne teksten: Korrupte, ulæselige bogstaver; tilføje teksten senere i designprogrammet.
  • At glemme forholdet: Det forkerte billedformat skaber klipning og tab af element i publikationen.
  • Overbelastet prompt: at stable 20 koncepter oven på hinanden forvirrer modellen; holde det klart og prioriteret.
  • Giver op i ét forsøg: Diffusion er tilfældig; Det er normalt at producere flere varianter og vælge den bedste.

Sammenfattende

Den billedgenererende AI konstruerer gradvist billedet, så det passer til din prompt fra tilfældig støj; Den kan ikke læse billedet i dit hoved, den fortolker bare det du skriver. En god prompt består af seks komponenter: emne, kontekst, stil, komposition, lys/farve og teknik. Stil er det mest afgørende element; Sørg for at angive billedformatet; Overlad ikke den læsbare tekst til AI, du tilføjer den senere. Efterhånden som klarheden øges, falder antallet af forsøg og tidstab.

Ansøgningsopgave

Vælg et produkt eller emne. Skriv først det i én sætning ("et godt X") og prøv det i en billedgenerator og noter resultatet. Beskriv derefter det samme emne igen ved at udfylde skelettet med seks komponenter, tilføje billedformatet og den negative beskrivelse. Sæt de to resultater side om side, og skriv i tre punktopstillinger, hvordan klarhed ændrer outputtet.

tjekliste

  • [ ] Jeg angav emnet, konteksten og stilen tydeligt i min prompt.
  • [ ] Jeg tilføjede komposition og lys/farve komponenter.
  • [ ] Jeg specificerede billedformatet (1:1 / 9:16 / 16:9).
  • [ ] Jeg havde ikke AI til at tegne den læsbare tekst, jeg lod den stå til senere.
  • [ ] Jeg udelukkede de uønskede med den negative beskrivelse.
  • [ ] Jeg stolede ikke på et eneste eksperiment og producerede flere variationer.