Egység 2 / 11

A vizuális gyártás alapjai: Hogyan működik a képi mesterséges intelligencia és a gyors anatómia

Nyereség:

  • Megérteni, hogyan működik a vizuális mesterséges intelligencia (diffúzió), és hogyan nem képes előállítani azt, ami nincs leírva, és nem tud jól szöveget rajzolni.
  • Képes erős vizuális felszólítást írni, amely tárgyból, kontextusból, stílusból, kompozícióból, fényből és technikai összetevőkből áll.
  • Képesség megszerzése a képarány meghatározására, az olvasható szöveg mesterséges intelligencia általi megrajzolásának megakadályozására és a hiba csökkentésére negatív leírással.

A mesterséges intelligencia segítségével látványterveket készítő tervező olyan, mintha parancsot adna egy művésznek: minél tisztábban és pontosabban magyarázza el, annál pontosabb lesz az eredmény. Ebben az egységben közérthető nyelven megértjük a képgeneráló mesterséges intelligencia (image AI) működését, és lépésről lépésre megtanuljuk a jó prompt (írásbeli utasítás a vizualizációhoz) megírásának anatómiáját. A cél az, hogy tudatosan leírhasd a kívánt képet, ahelyett, hogy "véletlenszerűen próbálkoznál és a szerencsében bízol".

Hogyan működik az Image AI? (Egyszerű magyarázat)

A legtöbb képgyártó manapság a diffúziónak nevezett módszert alkalmazza. Egyszerűen: a modell több millió kép-szöveg párból tanulta meg a "mely szavak melyik képnek felelnek meg" kapcsolatokat. Amikor látványelemeket készít, egy véletlenszerű zajjal rendelkező képből indul ki (például egy havas televízió képernyőjén), és lépésről lépésre megtisztítja ezt a zajt, hogy megfeleljen az Ön felszólításának, és értelmes képpé alakítja. Más szóval, a modell nem "lerajzolja" a képet, hanem statisztikailag azt a képet alkotja meg, amelyik a legjobban megfelel az Ön felszólításának.

Ennek három gyakorlati következménye van. Először is: Ugyanaz a prompt minden alkalommal más eredményt ad, mert a kezdeti zaj véletlenszerű (a következő egységben meglátjuk, hogyan lehet ezt a "seed"-el szabályozni). Másodszor: A modell nem tudhatja azt, amit te nem tudsz leírni; Nem tudja kiolvasni a fejedben a képet, csak értelmezi amit írsz. Harmadszor: A modell nem tud jól szöveget és számot rajzolni, mert alakjában utánozza a betűket, jelentésében nem; Ezért kockázatos a logók írását az AI-ra bízni.

Tipp: Ne hagyja, hogy a mesterséges intelligencia egyértelmű szöveget (márkanév, szlogen) állítson elő a képen. Szöveg nélkül készít egy képet, majd hozzáadja a szöveget (vektorként) egy tervezőprogramban. Így olvasható és szerkeszthető is.

Egy jó prompt anatómiája

Segít hat összetevőre bontani egy erős vizuális felszólítást. Nem kell minden alkalommal mindegyiket használni, de a tudatos választás meghatározza az eredményt.

  1. Tárgy/tárgy: Mi a kép fő eleme? ("kerámia kávéscsésze", "fiatal nő portréja").
  2. Cselekvés/kontextus: Mit csinál, hol van? („a faasztalnál, a reggeli fényben”).
  3. Stílus/esztétika: Mi a vizuális nyelv? („minimális termékfotó”, „akvarell illusztráció”, „izometrikus 3D renderelés”). Ez a legmeghatározóbb összetevő.
  4. Összetétel / szög: Milyen a keret? ("közeli", "madártávlat", "széles látószög", "középen, szóközzel").
  5. Fény és szín: ("lágy természetes fény", "földszín paletta", "nagy kontraszt").
  6. Technika / minőség: ("nagy felbontás", "1:1 képsebesség", "háttér sima fehér").

Van egy negatív recept is: olyan dolgokat mond, amiket nem akar ("nincs szöveg, nincs ember, nincs rendetlen háttér"). Ezt a 4. egységben "negatív prompttal" fogjuk elmélyíteni.

Fogalmak szójegyzéke

  • Képarány: A kép oldalaránya; 1:1 képkocka (Instagram-bejegyzés), 9:16 portré (sztori/tekercs), 16:9 fekvő (borító).
  • Felbontás: Képpontok száma a képen; Magas a nyomtatáshoz, közepes elég a szitához.
  • Stílushivatkozás: „Nézd ki így” mintát adni a modellnek.
  • Render: A számítógép kiszámítja és elkészíti a képet; A „3D renderelés” valósághű térfogati nézetet jelent.

Lépésről lépésre: egy kép leírása

Tegyük fel, hogy egy olívaolajmárkához szeretnénk egy termékarculatot.

1. lépés – Koncentráljon a témára: „extra szűz olívaolaj sötétzöld üvegben”.

2. lépés – Kontextus hozzáadása: „a rusztikus fapulton, mellette néhány friss olajággal.”

3. lépés – Válasszon stílust: „prémium termékfotó, valósághű”.

4. lépés – Adja meg a kompozíciót: „termék középen, hely a szövegnek felül”.

5. lépés – Fény/szín: „lágy oldali természetes fény, meleg földszínek”.

6. lépés – Technika: „1:1 képkockasebesség, nagy felbontás, sima háttér”.

Ha mindegyiket kombinálja, egy működőképes vázlatot kap, amely megfelel a márka identitásának.

három mini tok

1. eset – A bizonytalanságtól a világosságig. Egy tervező „egy modern iroda imázsát” írt, és 12 kísérletet tett, de egyik sem működött (30 perc veszteség). A promptot hat részre írta át: "világos, minimális iroda; fa íróasztal; természetes fény a nagy ablakból; meleg, semleges tónusok; széles látószög; szövegtér felül". az első 4 kísérletből 2 használható volt; Az idő 10 percre csökkent.

2. eset – Szövegcsapda. Az egyik gyakornok egy mesterséges intelligenciával készített egy kávézói posztert az elejétől a végéig; A képen látható "KÁVÉ" szöveg "KÁVÉ"-nak bizonyult, és az árak nem voltak olvashatók. Változtak az utasítások: a kép szöveg nélkül készült, a szöveg később került be a tervezőprogramba. A hiba nullára csökkent és a plakát alkalmas volt a nyomtatásra.

3. eset – Az arány elvesztése. Egy közösségi média szakértő készített egy 1:1-es négyzetarányú képet az Instagram-sztorihoz; 9:16 Amikor a függőleges területre tettem, a teteje és az alsó része le volt vágva, és a fontos elem elveszett. Amikor a képarányt "9:16 függőleges"-ként adtam meg a promptban, a kép illeszkedett a formátumába, és nem volt szükség reprodukcióra.

Másolható sablonok

1) Hatkomponensű termékképváz:

[Tárgy: a termék leírása] , [Kontextus: hol/hogyan] .Stílus: [pl. prémium termékfotó, valósághű] .Összetétel: [pl. termék középen, hely a szövegnek felül].Fény és szín: [pl. lágy természetes fény, földszínek] .Technika: [képarány, nagy felbontás, sima háttér] .Megjegyzés: Nincs olvasható szöveg/logó a képen; A szöveget később kiegészítem.

2) Illusztráció csontváza:

Tárgy: [mit rajzoljunk].Stílus: [pl. lapos színes vektoros illusztráció / akvarell / izometrikus 3D] .Színpaletta: [2-3 alapszín] .Hangulat: [pl. vidám, nyugodt, komoly] .Háttér: [sima / mintás / átlátszó] .Arány: [1:1 / 9:16 / 16:9] .

3) Stílusfeltárás (azonos téma, eltérő esztétika):

Jellemezze a következő témát azonos kompozícióval 4 különböző vizuális stílusban: minimál lapos vektor, valósághű fotó, akvarell, izometrikus 3D. Írjon mindegyikhez egysoros promptot. Tárgy: [beillesztés]

4) Negatív leírás hozzáadása:

Javítsa a következő promptot, és adja hozzá a nem kívántakat a végéhez: "nincs szöveg, nincs vízjel, nincs rendetlen háttér, nincs rossz kéz/ujj, nincs túl sok tárgy". Prompt: [beillesztés]

Gyenge felszólítás / Erős felszólítás

Gyenge: gyönyörű kávéfotó

Eredmény: Véletlenszerű szög, homályos stílus, mellékes kép, amely nem illik a márkához.

Erőteljes: Forró tejeskávéval töltött kerámia csésze, világos fából készült asztalon, lágy reggeli fényben oldalra; minimális prémium termékfotó; meleg semleges tónusok; közeli kép, hely a szöveg számára a jobb felső sarokban; 1:1 négyzet, sima háttér; Nem lehet olvasható szöveg.

Az eredmény: a márkához igazodó vázlat, szabályozott kompozícióval, fénnyel és arányokkal.

Különbség: Az erős felszólítás egyértelműen kitölti a hat összetevőt (tárgy, kontextus, stílus, kompozíció, fény, technika), és elhagyja a szöveget.

Prompt összetevők és effektus táblázat

komponens

példa

Hatás az eredményre

tárgyát

"olívaolaj üvegben"

meghatározza, hogy mi jelenik meg

Stílus

"prémium termékfotó"

A vizuális nyelvet leginkább meghatározó elem

összetételét

"középen, szövegközzel"

Növeli a használhatóságot

fény/szín

"lágy fény, földszínek"

A márka érzését közvetíti

képarány

"9:16 függőleges"

Lehetővé teszi a formátumnak való megfelelést

negatív leírás

"nincs szöveg"

Csökkenti a hibát

Gyakori hibák

  • Stílus megadása nélkül: A legmeghatározóbb komponens elhagyásával az eredmény kliséssé és véletlenszerűvé válik.
  • Az AI megrajzolja a szöveget: Sérült, olvashatatlan betűk; később adja hozzá a szöveget a tervezőprogramban.
  • Az arány elfelejtése: A rossz képarány kivágást és elemvesztést okoz a kiadványban.
  • Túlterhelt prompt: 20 fogalom egymásra rakása összezavarja a modellt; tartsa világosan és prioritásként.
  • Feladás egy próbálkozással: A diffúzió véletlenszerű; Normális, hogy több variációt készítünk, és kiválasztjuk a legjobbat.

Összefoglalva

A képgenerátor mesterséges intelligencia a véletlenszerű zajból fokozatosan úgy alakítja ki a képet, hogy illeszkedjen az Ön kérésére; Nem tudja kiolvasni a fejedben a képet, csak értelmezi amit írsz. Egy jó prompt hat összetevőből áll: téma, kontextus, stílus, kompozíció, fény/szín és technika. A stílus a legmeghatározóbb elem; Feltétlenül adja meg a képarányt; Ne hagyja az olvasható szöveget az MI-re, később adja hozzá. A tisztaság növekedésével a próbálkozások száma és az időveszteség csökken.

Pályázati feladat

Válasszon egy terméket vagy témát. Először írja le egy mondatban („egy szép X”), próbálja ki egy képgenerátorban, és jegyezze fel az eredményt. Ezután írja le újra ugyanazt a témát, töltse ki a hat komponensből álló vázat, adja hozzá a képarányt és a negatív leírást. Tedd egymás mellé a két eredményt, és írd le három pontban, hogyan változtatja meg az áttekinthetőség a kimenetet.

ellenőrző lista

  • [ ] A témát, a szövegkörnyezetet és a stílust egyértelműen megfogalmaztam a felszólításomban.
  • [ ] Kompozíciós és fény/szín komponenseket adtam hozzá.
  • [ ] Megadtam a képarányt (1:1 / 9:16 / 16:9).
  • [ ] Nem rajzoltam meg az AI-val az olvasható szöveget, későbbre hagytam.
  • [ ] A nemkívánatosakat a negatív leírással kizártam.
  • [ ] Egyetlen kísérletben sem bíztam, és több variációt készítettem.