Прибыль:
- Понимание того, как работает визуальный искусственный интеллект (диффузия) и как он не может производить то, что не описано, и не может хорошо рисовать текст.
- Умение написать сильную визуальную подсказку, состоящую из сюжета, контекста, стиля, композиции, света и технических компонентов.
- Получение возможности определять соотношение сторон, предотвращать прорисовку читаемого текста искусственным интеллектом и уменьшать дефект с негативным описанием.
Дизайнер, создающий визуальные эффекты с помощью ИИ, похож на заказ художнику: чем яснее и точнее вы это объясните, тем точнее будет результат. В этом модуле мы на простом языке поймем, как работает искусственный интеллект, генерирующий изображения (ИИ изображений), и шаг за шагом изучим анатомию написания хорошей подсказки (письменной инструкции для визуального представления). Цель состоит в том, чтобы иметь возможность сознательно описать желаемый образ, а не «пробовать наугад и полагаться на удачу».
Как работает AI изображений? (Простое объяснение)
Большинство производителей изображений сегодня используют метод, называемый диффузией. Все просто: модель выучила отношения «какие слова соответствуют каким изображениям» на миллионах пар изображение-текст. При создании визуальных эффектов он начинается с изображения со случайным шумом (например, заснеженного экрана телевизора), шаг за шагом очищает этот шум в соответствии с вашими требованиями и превращает его в осмысленное изображение. Другими словами, модель не «рисует» картинку, она статистически конструирует изображение, наиболее подходящее под вашу подсказку.
Это имеет три практических следствия. Во-первых: одно и то же приглашение каждый раз дает разный результат, потому что начальный шум является случайным (в следующем модуле мы увидим, как управлять этим с помощью «начального числа»). Во-вторых: модель не может знать того, что вы не можете описать; Он не может прочитать картинку в вашей голове, он просто интерпретирует то, что вы пишете. Третье: Модель не может хорошо прорисовывать текст и цифры, поскольку имитирует буквы по форме, а не по смыслу; Вот почему рискованно оставлять написание логотипов ИИ.
Совет: не позволяйте ИИ создавать на изображении открытый текст (название бренда, слоган). Вы создаете изображение без текста, а затем добавляете текст (в виде вектора) в программу дизайна. Это делает его одновременно читаемым и редактируемым.
Анатомия хорошей подсказки
Это помогает разбить сильную визуальную подсказку на шесть компонентов. Вам не обязательно использовать их все каждый раз, но осознанный выбор определит результат.
- Субъект/тема: Что является основным элементом изображения? («керамическая кофейная чашка», «портрет молодой женщины»).
- Действие/контекст: Что он делает, где он? («за деревянным столом, в утреннем свете»).
- Стиль/эстетика: Каков визуальный язык? («минимальное фото продукта», «акварельная иллюстрация», «изометрический 3D-рендеринг»). Это самый решающий компонент.
- Композиция/ракурс: Как кадр? («крупный план», «с высоты птичьего полета», «широкий угол», «посередине, с пространством»).
- Свет и цвет: («мягкий естественный свет», «палитра натуральных тонов», «высокий контраст»).
- Техника/качество: («высокое разрешение», «частота кадров 1:1», «чистый белый фон»).
Есть и негативный рецепт: говорить то, чего не хочешь («нет текста, нет людей, нет грязного фона»). Мы углубим это с помощью «негативной подсказки» в четвертом блоке.
Глоссарий терминов
- Соотношение сторон: соотношение сторон изображения; Кадр 1:1 (публикация в Instagram), портрет 9:16 (сюжет/ролики), пейзаж 16:9 (обложка).
- Разрешение: количество пикселей в изображении; Высокого достаточно для печати, среднего достаточно для экрана.
- Рекомендации по стилю: предоставление модели модели со словами «выгляди вот так».
- Рендеринг: компьютер рассчитывает и создает изображение; «3D-рендеринг» означает реалистичный объемный вид.
Шаг за шагом: описание изображения
Допустим, нам нужно изображение продукта для бренда оливкового масла.
Шаг 1. Сосредоточьтесь на теме: «Оливковое масло первого холодного отжима в бутылке из темно-зеленого стекла».
Шаг 2. Добавьте контекст: «на деревянной стойке в деревенском стиле, рядом с ней несколько свежих оливковых ветвей».
Шаг 3 — Выберите стиль: «фото товара премиум-класса, реалистичное».
Шаг 4 — Дайте композицию: «товар посередине, место для текста вверху».
Шаг 5 — Свет/цвет: «мягкий естественный свет, теплые земные тона».
Шаг 6 — Техника: «Частота кадров 1:1, высокое разрешение, простой фон».
Объединив их все, вы получите работоспособный проект, соответствующий идентичности бренда.
три мини-кейса
Случай 1 — От неопределенности к ясности. Дизайнер написал «образ современного офиса» и сделал 12 попыток, ни одна из которых не увенчалась успехом (потеряно 30 минут). Он переписал подсказку на шесть компонентов: «светлый минималистичный офис; деревянный стол; естественный свет из большого окна; теплые нейтральные тона; широкий угол; пространство для текста вверху». 2 из первых 4 попыток оказались пригодными; Время сократилось до 10 минут.
Случай 2 — Текстовая ловушка. Один стажер поручил ИИ создать плакат кафе от начала до конца; Текст «КОФЕ» на изображении оказался «КОФЕЕ», а цены прочитать было невозможно. Инструкция изменилась: изображение создавалось без текста, текст добавлялся позже в программе дизайна. Ошибка уменьшилась до нуля и плакат стал пригоден для печати.
Случай 3 — Потеря соотношения. Эксперт по социальным сетям создал квадратное изображение 1:1 для истории в Instagram; 9:16 Когда я поместил его в вертикальную область, верх и низ были обрезаны и важный элемент потерян. Когда я указал в подсказке соотношение сторон «9:16 по вертикали», изображение соответствовало его формату и воспроизведение не требовалось.
Копируемые шаблоны
1) Шестикомпонентный скелет изображения продукта:
[Тема: описать продукт] , [Контекст: где/как]. Стиль: [например. фотография продукта премиум-класса, реалистичная]. Состав: [например. товар посередине, место для текста вверху]. Свет и цвет: [например, мягкий естественный свет, земные тона]. Техника: [соотношение сторон, высокое разрешение, простой фон]. Примечание: на изображении отсутствует разборчивый текст/логотип; Текст добавлю позже.
2) Скелет иллюстрации:
Тема: [что нарисовать].Стиль: [например. плоская цветная векторная иллюстрация / акварель / изометрическое 3D]. Цветовая палитра: [2-3 основных цвета]. Настроение: [например. веселый, спокойный, серьезный].Фон: [однотонный/с рисунком/прозрачный].Соотношение: [1:1/9:16/16:9].
3) Исследование стиля (тот же предмет, но другая эстетика):
Опишите следующий объект с одной и той же композицией в 4 разных визуальных стилях: минимальный плоский вектор, реалистичная фотография, акварель, изометрическое 3D. Напишите однострочное приглашение для каждого. Тема: [вставить]
4) Добавление отрицательного описания:
Улучшите следующую подсказку и добавьте ненужные в конце: «Нет текста, нет водяных знаков, нет грязного фона, нет плохих рук/пальцев, нет слишком большого количества объектов». Подсказка: [вставить]
Слабая подсказка / Сильная подсказка
Слабое: красивое фото кофе
Результат: Случайный ракурс, неясный стиль, случайное изображение, не соответствующее бренду.
Мощно: керамическая чашка, наполненная горячим латте, на светлом деревянном столе, боком в мягком утреннем свете; минимальное фото товара премиум-класса; теплые нейтральные тона; крупный план, место для текста вверху справа; квадрат 1:1, однотонный фон; Разборчивого текста быть не должно.
Результат: адаптивный к бренду эскиз с контролируемой композицией, светом и пропорциями.
Отличие: сильная подсказка четко заполняет шесть компонентов (предмет, контекст, стиль, композиция, свет, техника) и оставляет за собой текст.
Подскажите компоненты и таблицу эффектов
компонент
пример
Влияние на результат
предмет
«оливковое масло в стеклянной бутылке»
определяет то, что появляется
Стиль
«фото продукта премиум-класса»
Элемент, который больше всего определяет визуальный язык
композиция
"посередине, с пространством для текста"
Повышает удобство использования
свет/цвет
«мягкий свет, земные тона»
Передает ощущение бренда
соотношение сторон
«9:16 вертикальный»
Позволяет соблюсти формат
отрицательное описание
"нет текста"
Уменьшает дефект
Распространенные ошибки
- Не указание стиля: если исключить самый решающий компонент, результат становится клише и случайным.
- Прорисовка текста с помощью ИИ: Коррумпированные, нечитаемые буквы; добавьте текст позже в программе дизайна.
- Забывание соотношения сторон: неправильное соотношение сторон приводит к обрезке и потере элементов в публикации.
- Перегруженная подсказка: наложение 20 концепций друг на друга сбивает модель; держите это ясным и расставьте приоритеты.
- Сдаться с одной попытки: Распространение происходит случайно; Это нормально — создать несколько вариантов и выбрать лучший.
В заключение
Искусственный интеллект, генерирующий изображения, постепенно создает изображение в соответствии с вашим запросом из случайного шума; Он не может прочитать картинку в вашей голове, он просто интерпретирует то, что вы пишете. Хорошая подсказка состоит из шести компонентов: предмет, контекст, стиль, композиция, свет/цвет и техника. Стиль – самый решающий элемент; Обязательно укажите соотношение сторон; Не оставляйте читаемый текст ИИ, вы добавите его позже. По мере увеличения ясности уменьшается количество попыток и потерь времени.
Задача приложения
Выберите продукт или тему. Сначала напишите это в одном предложении («красивый X»), попробуйте в генераторе изображений и запишите результат. Затем опишите тот же предмет еще раз, заполнив шестикомпонентный скелет, добавив соотношение сторон и негативное описание. Поместите два результата рядом и запишите в трех пунктах, как ясность меняет результат.
контрольный список
- [ ] В подсказке я четко указал тему, контекст и стиль.
- [ ] Я добавил компоненты композиции и света/цвета.
- [ ] Я указал соотношение сторон (1:1/9:16/16:9).
- [ ] У меня не было возможности ИИ рисовать читаемый текст, я оставил это на потом.
- [ ] Нежелательные с негативным описанием я исключил.
- [ ] Я не поверил ни одному эксперименту и предложил несколько вариаций.