Gevinster:
- Forstå hvordan visuell kunstig intelligens (diffusjon) fungerer og hvordan den ikke kan produsere det som ikke er beskrevet og ikke kan tegne tekst godt.
- Evne til å skrive en sterk visuell prompt bestående av emne, kontekst, stil, komposisjon, lys og tekniske komponenter.
- Få muligheten til å bestemme størrelsesforholdet, forhindre at den lesbare teksten tegnes av kunstig intelligens, og redusere defekten med en negativ beskrivelse.
En designer som produserer bilder med AI er som å gi en ordre til en artist: jo klarere og mer nøyaktig du forklarer det, jo mer nøyaktig blir resultatet. I denne enheten vil vi forstå i klartekst hvordan bildegenererende kunstig intelligens (image AI) fungerer og lære anatomien ved å skrive en god prompt (skriftlig instruksjon for en visuell), trinn for trinn. Målet er å bevisst kunne beskrive bildet du ønsker, fremfor å "prøve tilfeldig og stole på flaks".
Hvordan fungerer Image AI? (Enkel forklaring)
De fleste bildeprodusenter bruker i dag en metode som kalles diffusjon. Enkelt: Modellen har lært «hvilke ord tilsvarer hvilke bilder»-relasjoner fra millioner av bilde-tekst-par. Når du produserer bilder, starter den fra et bilde med tilfeldig støy (som en snødekt TV-skjerm) og renser denne støyen trinn for trinn for å passe til spørsmålet ditt og gjør det til et meningsfylt bilde. Modellen "tegner" med andre ord ikke bildet, den konstruerer statistisk det bildet som passer best for din prompt.
Dette har tre praktiske konsekvenser. For det første: Den samme prompten gir et annet resultat hver gang, fordi den første støyen er tilfeldig (vi vil se hvordan du kontrollerer dette med "seed" i neste enhet). For det andre: Modellen kan ikke vite hva du ikke kan beskrive; Den kan ikke lese bildet i hodet ditt, den tolker bare det du skriver. For det tredje: Modellen kan ikke tegne tekst og tall godt, fordi den imiterer bokstaver i form og ikke i betydning; Det er derfor det er risikabelt å overlate skriften i logoer til AI.
Tips: Ikke la AI produsere den klare teksten (merkenavn, slagord) i bildet. Du produserer et bilde uten tekst og legger så til teksten (som vektor) i et designprogram. Dette gjør den både lesbar og redigerbar.
Anatomi av en god ledetekst
Det hjelper å dele en sterk visuell melding i seks komponenter. Du trenger ikke å bruke dem alle hver gang, men å velge bevisst vil avgjøre resultatet.
- Emne/emne: Hva er hovedelementet i bildet? ("en keramisk kaffekopp", "portrett av en ung kvinne").
- Handling/kontekst: Hva gjør han, hvor er han? ("ved trebordet, i morgenlyset").
- Stil/estetikk: Hva er det visuelle språket? ("minimalt produktbilde", "akvarellillustrasjon", "isometrisk 3D-gjengivelse"). Dette er den mest avgjørende komponenten.
- Komposisjon / vinkel: Hvordan er rammen? ("nærbilde", "fugleperspektiv", "vidvinkel", "i midten, med plass").
- Lys og farge: ("mykt naturlig lys", "jordfargepalett", "høy kontrast").
- Teknikk / kvalitet: ("høy oppløsning", "1:1 bildefrekvens", "vanlig hvit bakgrunn").
Det er også en negativ oppskrift: å si ting du ikke vil ha ("ingen tekst, ingen mennesker, ingen rotete bakgrunn"). Vi vil utdype dette med "negativ prompt" i 4. enhet.
Ordliste med begreper
- Sideforhold: Sideforholdet til bildet; 1:1 ramme (Instagram-innlegg), 9:16 portrett (historie/ruller), 16:9 landskap (omslag).
- Oppløsning: Antall piksler i bildet; Høy er nok for utskrift, medium er nok for skjerm.
- Stilreferanse: Gi en prøve til modellen som sier "se slik ut".
- Render: Datamaskinen beregner og produserer et bilde; "3D-gjengivelse" betyr realistisk volumetrisk visning.
Trinn for trinn: beskrive et bilde
La oss si at vi vil ha et produktbilde for et olivenoljemerke.
Trinn 1 — Fokuser på emnet: "ekstra virgin olivenolje i en mørkegrønn glassflaske."
Trinn 2 - Legg til kontekst: "på den rustikke trebenken, med noen friske olivengrener ved siden av."
Trinn 3 — Velg stil: "Premium produktfoto, realistisk".
Trinn 4 — Gi komposisjonen: «produkt i midten, plass til tekst øverst».
Trinn 5 — Lys/farge: "myk side naturlig lys, varme jordfarger".
Trinn 6 — Teknikk: "1:1 bildefrekvens, høy oppløsning, vanlig bakgrunn".
Når du kombinerer dem alle, får du et brukbart utkast som passer til merkevarens identitet.
tre minisaker
Sak 1 — Fra usikkerhet til klarhet. En designer skrev "bilde av et moderne kontor" og gjorde 12 forsøk, hvorav ingen fungerte (tapte 30 minutter). Han omskrev forespørselen til seks komponenter: "lyst, minimalt kontor; skrivebord i tre; naturlig lys fra stort vindu; varme nøytrale toner; vidvinkel; tekstplass øverst". 2 av de første 4 forsøkene var brukbare; Tiden ble redusert til 10 minutter.
Sak 2 - Tekstfelle. En praktikant fikk en AI til å produsere en kaféplakat fra start til slutt; Teksten "KAFFE" på bildet viste seg å være "KAFFE" og prisene var ikke lesbare. Instruksjonene endret seg: bildet ble produsert uten tekst, teksten ble lagt til senere i designprogrammet. Feilen gikk ned til null og plakaten var egnet for trykking.
Tilfelle 3 – Tap av forholdstall. En ekspert på sosiale medier produserte et 1:1 kvadratisk bilde for Instagram-historien; 9:16 Da jeg satte den i det vertikale området, ble toppen og bunnen kuttet av og det viktige elementet gikk tapt. Da jeg spesifiserte sideforholdet som "9:16 vertikalt" i ledeteksten, passet bildet inn i formatet og ingen reproduksjon var nødvendig.
Kopierbare maler
1) Seks-komponent produktbildeskjelett:
[Emne: beskriv produktet], [Kontekst: hvor/hvordan] .Style: [f.eks. førsteklasses produktbilde, realistisk] .Komposisjon: [f.eks. produkt i midten, plass til tekst øverst].Lys og farge: [f.eks. mykt naturlig lys, jordfarger] .Teknikk: [sideforhold, høy oppløsning, vanlig bakgrunn] .Merk: Ingen lesbar tekst/logo i bildet; Jeg legger til teksten senere.
2) Illustrasjonsskjelett:
Emne: [hva du skal tegne]. Stil: [f.eks. flat farge vektorillustrasjon / akvarell / isometrisk 3D] .Fargepalett: [2-3 primærfarger] .Stemning: [f.eks. munter, rolig, alvorlig] .Bakgrunn: [vanlig / mønstret / gjennomsiktig] .Forhold: [1:1 / 9:16 / 16:9] .
3) Stilutforskning (samme emne, annen estetikk):
Beskriv følgende emne med samme komposisjon i 4 forskjellige visuelle stiler: minimal flat vektor, realistisk foto, akvarell, isometrisk 3D. Skriv en én-linjes melding for hver. Emne: [lim inn]
4) Legge til negativ beskrivelse:
Forbedre følgende ledetekst og legg til de uønskede på slutten: "ingen tekst, ingen vannmerke, ingen rotete bakgrunn, ingen dårlige hender/fingre, ingen for mange objekter". Spør: [lim inn]
Svak forespørsel / Sterk forespørsel
Svak: et vakkert kaffebilde
Resultat: Tilfeldig vinkel, uklar stil, tilfeldig bilde som ikke passer til merket.
Kraftig: Keramisk kopp fylt med en varm latte, på lyst trebord, sidelengs i mykt morgenlys; minimalt premium produktbilde; varme nøytrale toner; nærbilde, plass til tekst øverst til høyre; 1:1 kvadrat, vanlig bakgrunn; Det skal ikke være noen lesbar tekst.
Resultatet: en merketilpasset skisse med kontrollert komposisjon, lys og proporsjoner.
Forskjell: En sterk oppfordring fyller de seks komponentene (emne, kontekst, stil, komposisjon, lys, teknikk) tydelig og utelater teksten.
Spørrekomponenter og effekttabell
komponent
eksempel
Effekt på resultatet
emne
"olivenolje i en glassflaske"
bestemmer hva som vises
Stil
"Premium produkt bilde"
Det elementet som mest bestemmer det visuelle språket
komposisjon
"i midten, med tekstmellomrom"
Øker brukervennligheten
lys/farge
"mykt lys, jordfarger"
Formidler merkefølelsen
sideforhold
"9:16 vertikal"
Tillater å overholde formatet
negativ beskrivelse
"ingen tekst"
Reduserer defekter
Vanlige feil
- Ikke spesifisere stilen: Ved å utelate den mest avgjørende komponenten, blir resultatet klisjé og tilfeldig.
- La AI tegne teksten: Korrupte, uleselige bokstaver; legg til teksten senere i designprogrammet.
- Å glemme forholdet: Feil sideforhold skaper klipping og elementtap i publikasjonen.
- Overbelastet forespørsel: å stable 20 konsepter oppå hverandre forvirrer modellen; holde det klart og prioritert.
- Gi opp på ett forsøk: Diffusjon er tilfeldig; Det er normalt å produsere flere varianter og velge den beste.
Oppsummert
Den bildegenererende AI-en konstruerer gradvis bildet slik at det passer din melding fra tilfeldig støy; Den kan ikke lese bildet i hodet ditt, den tolker bare det du skriver. En god ledetekst består av seks komponenter: emne, kontekst, stil, komposisjon, lys/farge og teknikk. Stil er det mest avgjørende elementet; Pass på å spesifisere sideforholdet; Ikke overlat den lesbare teksten til AI, du legger den til senere. Etter hvert som klarheten øker, reduseres antall forsøk og tidstap.
Søknadsoppgave
Velg et produkt eller emne. Skriv det først i én setning ("en fin X") og prøv den i en bildegenerator og noter resultatet. Beskriv deretter det samme emnet igjen ved å fylle ut sekskomponentskjelettet, legge til sideforhold og negativ beskrivelse. Sett de to resultatene ved siden av hverandre og skriv i tre punkter hvordan klarhet endrer utdataene.
sjekkliste
- [ ] Jeg oppga emnet, konteksten og stilen tydelig i spørsmålet mitt.
- [ ] Jeg la til komposisjon og lys/farge komponenter.
- [ ] Jeg spesifiserte sideforholdet (1:1 / 9:16 / 16:9).
- [ ] Jeg hadde ikke AI til å tegne den lesbare teksten, jeg lot den stå til senere.
- [ ] Jeg ekskluderte de uønskede med den negative beskrivelsen.
- [ ] Jeg stolte ikke på et eneste eksperiment og produserte flere variasjoner.