Vinster:
- Förstå hur visuell artificiell intelligens (diffusion) fungerar och hur den inte kan producera det som inte beskrivs och inte kan rita text väl.
- Förmåga att skriva en stark visuell prompt bestående av ämne, sammanhang, stil, komposition, ljus och tekniska komponenter.
- Få förmågan att bestämma bildförhållandet, förhindra att den läsbara texten ritas av artificiell intelligens och minska defekten med en negativ beskrivning.
En designer som producerar bilder med AI är som att ge en order till en artist: ju tydligare och mer exakt du förklarar det, desto mer exakt blir resultatet. I denna enhet kommer vi att förstå i klartext hur bildgenererande artificiell intelligens (bild AI) fungerar och lära oss anatomin i att skriva en bra prompt (skriftlig instruktion för en visuell), steg för steg. Syftet är att medvetet kunna beskriva den bild du vill ha, snarare än att "försöka slumpmässigt och lita på tur".
Hur fungerar Image AI? (Enkel förklaring)
De flesta bildproducenter använder idag en metod som kallas diffusion. Helt enkelt: modellen har lärt sig "vilka ord som motsvarar vilka bilder"-relationer från miljontals bild-text-par. När du producerar bilder utgår den från en bild med slumpmässigt brus (som en snöig tv-skärm) och rensar detta brus steg för steg för att passa din uppmaning och förvandlar det till en meningsfull bild. Modellen "ritar" med andra ord inte bilden, den konstruerar statistiskt den bild som bäst passar din prompt.
Detta har tre praktiska konsekvenser. Först: Samma prompt ger olika resultat varje gång, eftersom det initiala bruset är slumpmässigt (vi kommer att se hur man styr detta med "seed" i nästa enhet). För det andra: Modellen kan inte veta vad du inte kan beskriva; Den kan inte läsa bilden i ditt huvud, den tolkar bara det du skriver. För det tredje: Modellen kan inte rita text och nummer bra, eftersom den imiterar bokstäver i form och inte i betydelse; Det är därför det är riskabelt att lämna skriften i logotyper till AI.
Tips: Låt inte AI producera den tydliga texten (varumärke, slogan) i bilden. Man producerar en bild utan text och lägger sedan till texten (som vektor) i ett designprogram. Detta gör den både läsbar och redigerbar.
Anatomi av en bra prompt
Det hjälper till att dela upp en stark visuell prompt i sex komponenter. Du behöver inte använda dem alla varje gång, men att välja medvetet avgör resultatet.
- Ämne/ämne: Vad är huvudelementet i bilden? ("en kaffekopp i keramik", "porträtt av en ung kvinna").
- Handling/kontext: Vad gör han, var är han? ("vid träbordet, i morgonljuset").
- Stil/estetik: Vad är det visuella språket? ("minimal produktfoto", "akvarellillustration", "isometrisk 3D-rendering"). Detta är den mest avgörande komponenten.
- Komposition / vinkel: Hur är ramen? ("närbild", "fågelperspektiv", "vidvinkel", "i mitten, med utrymme").
- Ljus och färg: ("mjukt naturligt ljus", "jordtonspalett", "hög kontrast").
- Teknik / kvalitet: ("hög upplösning", "1:1 bildhastighet", "bakgrund vanlig vit").
Det finns också ett negativt recept: att säga saker man inte vill ("ingen text, inga människor, ingen rörig bakgrund"). Vi kommer att fördjupa detta med "negativ prompt" i den 4:e enheten.
Ordlista med termer
- Bildförhållande: Bildens bildförhållande; 1:1 ram (Instagram-inlägg), 9:16 porträtt (berättelse/rullar), 16:9 landskap (omslag).
- Upplösning: Antal pixlar i bilden; Hög räcker för utskrift, medium räcker för skärm.
- Stilreferens: Ge ett prov till modellen som säger "se ut så här".
- Rendera: Datorn beräknar och producerar en bild; "3D-rendering" betyder realistisk volymetrisk vy.
Steg för steg: beskriva en bild
Låt oss säga att vi vill ha en produktbild för ett olivoljamärke.
Steg 1 — Fokusera på ämnet: "extra jungfruolja i en mörkgrön glasflaska."
Steg 2 — Lägg till sammanhang: "på den rustika träbänken, med några färska olivkvistar bredvid."
Steg 3 — Välj stil: "premiumproduktfoto, realistisk".
Steg 4 — Ge kompositionen: "produkt i mitten, utrymme för text överst".
Steg 5 — Ljus/färg: "mjuk sida naturligt ljus, varma jordfärger".
Steg 6 — Teknik: "1:1 bildhastighet, hög upplösning, vanlig bakgrund".
När du kombinerar dem alla får du ett fungerande utkast som passar varumärkets identitet.
tre minifodral
Fall 1 — Från osäkerhet till klarhet. En designer skrev "bild av ett modernt kontor" och gjorde 12 försök, varav inget fungerade (förlorade 30 minuter). Han skrev om uppmaningen till sex komponenter: "ljus, minimalt kontor; skrivbord i trä; naturligt ljus från stora fönster; varma neutrala toner; vidvinkel; textutrymme överst". 2 av de första 4 försöken var användbara; Tiden reducerades till 10 minuter.
Fall 2 — Textfälla. En praktikant lät en AI producera en caféaffisch från början till slut; Texten "COFFEE" på bilden visade sig vara "COFEEE" och priserna gick inte att läsa. Instruktionerna ändrades: bilden producerades utan text, texten lades till senare i designprogrammet. Felet minskade till noll och affischen var lämplig för tryckning.
Fall 3 — Förlust av förhållandet. En expert på sociala medier tog fram en 1:1 kvadratisk bild för Instagram-berättelsen; 9:16 När jag satte den i det vertikala området skars toppen och botten av och det viktiga elementet gick förlorat. När jag angav bildförhållandet som "9:16 vertikalt" i prompten passade bilden in i dess format och ingen reproduktion krävdes.
Kopierbara mallar
1) Sexkomponents produktbildskelett:
[Ämne: beskriv produkten], [Kontext: var/hur] .Stil: [t.ex. premiumproduktfoto, realistisk] .Komposition: [t.ex. produkt i mitten, plats för text överst].Ljus och färg: [t.ex. mjukt naturligt ljus, jordfärger] .Teknik: [bildförhållande, hög upplösning, vanlig bakgrund] .Obs: Ingen läsbar text/logotyp i bilden; Jag lägger till texten senare.
2) Illustrationsskelett:
Ämne: [vad man ska rita]. Stil: [t.ex. platt färg vektorillustration / vattenfärg / isometrisk 3D] .Färgpalett: [2-3 primärfärger] .Humör: [t.ex. glad, lugn, seriös] .Bakgrund: [vanlig / mönstrad / genomskinlig] . Förhållande: [1:1 / 9:16 / 16:9] .
3) Stilutforskning (samma ämne, annan estetik):
Beskriv följande motiv med samma komposition i 4 olika visuella stilar: minimal platt vektor, realistiskt foto, akvarell, isometrisk 3D. Skriv en uppmaning på en rad för varje. Ämne: [klistra in]
4) Lägga till negativ beskrivning:
Förbättra följande uppmaning och lägg till de oönskade i slutet: "ingen text, ingen vattenstämpel, ingen rörig bakgrund, inga dåliga händer/fingrar, inga för många föremål". Uppmaning: [klistra in]
Svag prompt / Stark prompt
Svag: ett vackert kaffefoto
Resultat: Slumpmässig vinkel, otydlig stil, tillfällig bild som inte passar varumärket.
Kraftfull: Keramikkopp fylld med en varm latte, på ljust träbord, i sidled i mjukt morgonljus; minimalt premiumproduktfoto; varma neutrala toner; närbild, utrymme för text uppe till höger; 1:1 kvadrat, vanlig bakgrund; Det ska inte finnas någon läsbar text.
Resultatet: en varumärkesanpassad skiss med kontrollerad komposition, ljus och proportioner.
Skillnad: En stark uppmaning fyller de sex komponenterna (ämne, sammanhang, stil, komposition, ljus, teknik) tydligt och utelämnar texten.
Snabbkomponenter och effekttabell
komponent
exempel
Effekt på resultatet
ämne
"olivolja i en glasflaska"
avgör vad som visas
Stil
"premiumproduktfoto"
Det element som mest bestämmer bildspråket
sammansättning
"i mitten, med textutrymme"
Ökar användbarheten
ljus/färg
"mjukt ljus, jordfärger"
Förmedlar varumärkeskänslan
bildförhållande
"9:16 vertikal"
Tillåter att följa formatet
negativ beskrivning
"ingen text"
Minskar defekter
Vanliga misstag
- Att inte specificera stilen: Genom att utelämna den mest avgörande komponenten blir resultatet klyschigt och slumpmässigt.
- Att låta AI rita texten: Korrupta, oläsbara bokstäver; lägg till texten senare i designprogrammet.
- Att glömma förhållandet: Fel bildförhållande skapar klippning och elementförlust i publikationen.
- Överbelastad prompt: att stapla 20 koncept ovanpå varandra förvirrar modellen; hålla det tydligt och prioriterat.
- Att ge upp på ett försök: Diffusion är slumpmässig; Det är normalt att producera flera varianter och välja den bästa.
Sammanfattningsvis
Den bildgenererande AI:n konstruerar gradvis bilden för att passa din prompt från slumpmässigt brus; Den kan inte läsa bilden i ditt huvud, den tolkar bara det du skriver. En bra prompt består av sex komponenter: ämne, sammanhang, stil, komposition, ljus/färg och teknik. Stil är det mest avgörande elementet; Var noga med att ange bildförhållandet; Lämna inte den läsbara texten till AI:n, du lägger till den senare. När tydligheten ökar minskar antalet försök och tidsförluster.
Applikationsuppgift
Välj en produkt eller ett ämne. Skriv först det i en mening ("ett trevligt X") och prova det i en bildgenerator och notera resultatet. Beskriv sedan samma ämne igen genom att fylla i skelettet med sex komponenter, lägga till bildförhållandet och negativ beskrivning. Lägg de två resultaten sida vid sida och skriv i tre punkter hur tydlighet ändrar utdata.
checklista
- [ ] Jag angav ämnet, sammanhanget och stilen tydligt i min uppmaning.
- [ ] Jag lade till komposition och ljus/färgkomponenter.
- [ ] Jag angav bildförhållandet (1:1 / 9:16 / 16:9).
- [ ] Jag lät inte AI rita den läsbara texten, jag lämnade den till senare.
- [ ] Jag uteslöt de oönskade med den negativa beskrivningen.
- [ ] Jag litade inte på ett enda experiment och producerade flera varianter.