Jednostka 2 / 11

Podstawy produkcji wizualnej: jak działa sztuczna inteligencja obrazu i szybka anatomia

Zyski:

  • Zrozumienie, jak działa sztuczna inteligencja wizualna (dyfuzja) i jak nie może wyprodukować tego, co nie jest opisane i nie potrafi dobrze narysować tekstu.
  • Umiejętność napisania silnego podpowiedzi wizualnej składającej się z tematu, kontekstu, stylu, kompozycji, światła i elementów technicznych.
  • Uzyskanie możliwości określenia proporcji, uniemożliwienie rysowania czytelnego tekstu przez sztuczną inteligencję oraz redukcję wady poprzez opis negatywny.

Projektant tworzący wizualizacje za pomocą sztucznej inteligencji jest jak wydawanie zamówienia artyście: im jaśniej i dokładniej to wyjaśnisz, tym dokładniejszy będzie wynik. W tej części zrozumiemy prostym językiem, jak działa sztuczna inteligencja generująca obrazy (AI obrazu) i krok po kroku nauczymy się anatomii pisania dobrego podpowiedzi (pisemna instrukcja dotycząca wizualizacji). Celem jest umiejętność świadomego opisania pożądanego obrazu, a nie „próbowanie na chybił trafił i zdawanie się na szczęście”.

Jak działa sztuczna inteligencja obrazu? (Proste wyjaśnienie)

Większość producentów obrazów stosuje obecnie metodę zwaną dyfuzją. Po prostu: model nauczył się relacji „które słowa odpowiadają jakim obrazom” z milionów par obraz-tekst. Tworzenie materiałów wizualnych zaczyna się od obrazu z przypadkowymi szumami (np. zaśnieżonym ekranem telewizora) i krok po kroku usuwa te szumy, aby dopasować je do podpowiedzi, i przekształca je w znaczący obraz. Innymi słowy, model nie „rysuje” obrazu, lecz statystycznie konstruuje obraz, który najlepiej pasuje do podpowiedzi.

Ma to trzy praktyczne konsekwencje. Po pierwsze: ten sam monit daje za każdym razem inny wynik, ponieważ początkowy szum jest losowy (zobaczymy, jak kontrolować to za pomocą „ziarna” w następnym rozdziale). Po drugie: model nie może wiedzieć tego, czego nie możesz opisać; Nie czyta obrazu w Twojej głowie, po prostu interpretuje to, co piszesz. Po trzecie: model nie potrafi dobrze rysować tekstu i liczb, ponieważ imituje litery kształtem, a nie znaczeniem; Dlatego pozostawienie napisów w logo sztucznej inteligencji jest ryzykowne.

Wskazówka: nie pozwól, aby sztuczna inteligencja generowała wyraźny tekst (nazwa marki, hasło) na obrazie. Tworzysz obraz bez tekstu, a następnie dodajesz tekst (jako wektor) w programie do projektowania. Dzięki temu jest on czytelny i edytowalny.

Anatomia dobrego podpowiedzi

Pomaga rozbić silny sygnał wizualny na sześć elementów. Nie musisz używać ich wszystkich za każdym razem, ale świadomy wybór zadecyduje o wyniku.

  1. Temat/temat: Jaki jest główny element obrazu? („ceramiczna filiżanka kawy”, „portret młodej kobiety”).
  2. Akcja/kontekst: Co on robi, gdzie jest? („przy drewnianym stole, w porannym świetle”).
  3. Styl/estetyka: Co to jest język wizualny? („minimalne zdjęcie produktu”, „akwarela ilustracja”, „izometryczny rendering 3D”). To jest najbardziej decydujący element.
  4. Kompozycja/kąt: Jaka jest rama? („zbliżenie”, „widok z lotu ptaka”, „szeroki kąt”, „w środku, z przestrzenią”).
  5. Światło i kolor: („miękkie, naturalne światło”, „paleta odcieni ziemi”, „wysoki kontrast”).
  6. Technika/jakość: („wysoka rozdzielczość”, „liczba klatek 1:1”, „zwykłe białe tło”).

Istnieje również przepis negatywny: mówienie rzeczy, których nie chcesz („bez tekstu, bez ludzi, bez bałaganu w tle”). Pogłębimy to za pomocą „negatywnego podpowiedzi” w czwartej części.

Glosariusz terminów

  • Proporcje obrazu: Proporcje obrazu; Klatka 1:1 (post na Instagramie), portret 9:16 (historia/filmy), krajobraz 16:9 (okładka).
  • Rozdzielczość: liczba pikseli obrazu; Wysoka jest wystarczająca do druku, średnia wystarcza do ekranu.
  • Odniesienie do stylu: Daj próbkę modelowi z napisem „Wyglądaj tak”.
  • Renderowanie: komputer oblicza i tworzy obraz; „Renderowanie 3D” oznacza realistyczny widok wolumetryczny.

Krok po kroku: opisywanie obrazu

Załóżmy, że potrzebujemy obrazu produktu dla marki oliwy z oliwek.

Krok 1 — Skoncentruj się na temacie: „Oliwa z oliwek z pierwszego tłoczenia w ciemnozielonej szklanej butelce”.

Krok 2 — Dodaj kontekst: „na rustykalnym drewnianym blacie, obok kilka świeżych gałązek oliwnych”.

Krok 3 — Wybierz styl: „zdjęcie produktu premium, realistyczne”.

Krok 4 — Podaj kompozycję: „produkt pośrodku, miejsce na tekst u góry”.

Krok 5 — Światło/kolor: „miękkie naturalne światło, ciepłe odcienie ziemi”.

Krok 6 — Technika: „Częstotliwość klatek 1:1, wysoka rozdzielczość, gładkie tło”.

Kiedy je połączysz, otrzymasz wykonalny projekt, który będzie odpowiadał tożsamości marki.

trzy mini etui

Przypadek 1 – Od niepewności do jasności. Projektant napisał „obraz nowoczesnego biura” i podjął 12 prób, z których żadna nie zadziałała (strata 30 minut). Przepisał zachętę na sześć elementów: „jasne, minimalne biuro; drewniane biurko; naturalne światło z dużego okna; ciepłe, neutralne odcienie; szeroki kąt; miejsce na tekst u góry”. 2 z pierwszych 4 prób były użyteczne; Czas został skrócony do 10 minut.

Przypadek 2 — Pułapka tekstowa. Jeden ze stażystów zlecił sztucznej inteligencji stworzenie od początku do końca plakatu do kawiarni; Tekst „KAWA” na obrazku okazał się „KAWA”, a ceny były nieczytelne. Instrukcje uległy zmianie: obraz powstał bez tekstu, tekst został dodany później w programie do projektowania. Błąd spadł do zera i plakat nadawał się do druku.

Przypadek 3 – Utrata proporcji. Ekspert ds. mediów społecznościowych stworzył kwadratowy obraz o proporcjach 1:1 na potrzeby relacji na Instagramie; 9:16 Kiedy umieściłem go w obszarze pionowym, góra i dół zostały obcięte, a ważny element został utracony. Kiedy w monicie określiłem współczynnik proporcji jako „9:16 w pionie”, obraz zmieścił się w swoim formacie i nie było potrzeby reprodukowania.

Szablony do kopiowania

1) Sześcioskładnikowy szkielet obrazu produktu:

[Temat: opisz produkt], [Kontekst: gdzie/jak].Styl: [np. zdjęcie produktu premium, realistyczne] .Kompozycja: [m.in. produkt pośrodku, miejsce na tekst u góry).Światło i kolor: [np. miękkie naturalne światło, odcienie ziemi] .Technika: [format obrazu, wysoka rozdzielczość, gładkie tło] .Uwaga: brak czytelnego tekstu/logo na obrazie; Tekst dodam później.

2) Szkielet ilustracyjny:

Temat: [co narysować].Styl: [np. ilustracja wektorowa w kolorze płaskim / akwarela / izometryczny 3D] .Paleta kolorów: [2-3 kolory podstawowe] .Nastrój: [np. wesoły, spokojny, poważny.] .Tło: [gładkie / wzorzyste / przezroczyste] .Stosunek: [1:1 / 9:16 / 16:9] .

3) Eksploracja stylu (ten sam temat, inna estetyka):

Opisz następujący temat z tą samą kompozycją w 4 różnych stylach wizualnych: minimalny płaski wektor, realistyczne zdjęcie, akwarela, izometryczny 3D. Dla każdego napisz jednowierszową zachętę. Temat: [wklej]

4) Dodanie negatywnego opisu:

Popraw następujący monit i dodaj na końcu niechciane: „bez tekstu, bez znaku wodnego, bez bałaganu w tle, bez złych rąk/palców, bez zbyt wielu obiektów”. Podpowiedź: [wklej]

Słaba zachęta/silna zachęta

Słabe: piękne zdjęcie kawy

Rezultat: przypadkowy kąt, niejasny styl, przypadkowy obraz niepasujący do marki.

Mocny: Ceramiczny kubek wypełniony gorącą latte, na jasnym drewnianym stole, bokiem w delikatnym świetle poranka; minimalne zdjęcie produktu premium; ciepłe, neutralne odcienie; zbliżenie, miejsce na tekst w prawym górnym rogu; Kwadrat 1:1, gładkie tło; Nie powinno być czytelnego tekstu.

Rezultat: szkic dostosowany do marki, z kontrolowaną kompozycją, światłem i proporcjami.

Różnica: Silna podpowiedź wyraźnie wypełnia sześć elementów (temat, kontekst, styl, kompozycja, światło, technika) i pomija tekst.

Podpowiedzi dotyczące komponentów i tabeli efektów

komponent

przykład

Wpływ na wynik

temat

"oliwa z oliwek w szklanej butelce"

określa to, co się pojawia

Styl

„zdjęcie produktu premium”

Element najbardziej determinujący język wizualny

kompozycja

„w środku, z miejscem na tekst”

Zwiększa użyteczność

światło/kolor

„miękkie światło, odcienie ziemi”

Przekazuje poczucie marki

współczynnik proporcji

„9:16 pionowo”

Pozwala zachować zgodność z formatem

opis negatywny

„brak tekstu”

Redukuje wady

Typowe błędy

  • Brak określenia stylu: Pominięcie najbardziej decydującego elementu powoduje, że wynik staje się banalny i przypadkowy.
  • Poproszenie AI o narysowanie tekstu: Uszkodzone, nieczytelne litery; dodaj tekst później w programie do projektowania.
  • Zapominanie o proporcjach: Zły współczynnik proporcji powoduje przycinanie i utratę elementów w publikacji.
  • Przeciążony monit: ułożenie 20 koncepcji jeden na drugim powoduje dezorientację modelu; zachowaj jasność i priorytety.
  • Poddanie się za jednym razem: Rozproszenie jest losowe; Tworzenie kilku wariantów i wybieranie najlepszego jest rzeczą normalną.

Podsumowując

Sztuczna inteligencja generująca obraz stopniowo konstruuje obraz, aby dopasować go do podpowiedzi, na podstawie losowego szumu; Nie czyta obrazu w Twojej głowie, po prostu interpretuje to, co piszesz. Dobra podpowiedź składa się z sześciu elementów: tematu, kontekstu, stylu, kompozycji, światła/koloru i techniki. Styl jest najbardziej decydującym elementem; Pamiętaj o określeniu proporcji; Nie zostawiaj czytelnego tekstu AI, dodasz go później. Wraz ze wzrostem przejrzystości maleje liczba prób i strata czasu.

Zadanie aplikacji

Wybierz produkt lub temat. Najpierw napisz to jednym zdaniem („ładny X”), wypróbuj w generatorze obrazów i zanotuj wynik. Następnie opisz ten sam temat ponownie, uzupełniając sześcioskładnikowy szkielet, dodając współczynnik proporcji i opis negatywny. Umieść oba wyniki obok siebie i napisz w trzech punktach, jak przejrzystość zmienia wynik.

lista kontrolna

  • [ ] W monicie wyraźnie określiłem temat, kontekst i styl.
  • [ ] Dodałem kompozycję i składniki światła/koloru.
  • [ ] Określiłem proporcje (1:1 / 9:16 / 16:9).
  • [ ] Nie miałem AI narysować czytelnego tekstu, zostawiłem to na później.
  • [ ] Wykluczyłem niepożądane skutki z opisem negatywnym.
  • [ ] Nie ufałem ani jednemu eksperymentowi i stworzyłem kilka odmian.