Прибыль:
- Понимание того, как работает искусственный интеллект (диффузия), генерирующий изображения, и какие компоненты рецепта необходимы для фотографического реализма.
- Умение написать сильное фотографическое задание, состоящее из объекта, света, объектива/камеры, композиции, атмосферы и технических компонентов.
- Способность различать разницу между созданным изображением и сделанной фотографией, ограничения использования и важность заявления о подлинности.
Фотограф использует генеративный визуальный ИИ для трех законных целей: для создания черновых вариантов мудбордов и концепций, для создания элементов, дополняющих реальный снимок (фон, текстура, составная часть), и для создания полностью готовых изображений (например, для продажи акций или рекламной концепции). В этом модуле мы узнаем, как работают эти инструменты и как писать подсказки для фотографического реализма. Цель не в том, чтобы случайно дождаться хорошего удара; Это значит описать то, что вы хотите, на языке фотографа и направить результат.
Распространение: как модель производит «фотографии»?
Большинство современных ИИ, генерирующих изображения, работают с методом, называемым диффузией. Все просто: модель научилась переходить «от шума к осмысленному изображению» на миллионах изображений. Он начинается со случайного шума во время производства (например, заснеженного скриншота) и создает изображение путем постепенной очистки шума в соответствии с вашим текстом (подсказка). Из этого следует два основных факта:
Во-первых, модель не может производить то, что не описано. Если вы не скажете «свет», появится случайный свет; Если не учитывать объективный взгляд, «ощущение фотографии» так и останется совпадением. Во-вторых, модель не понимает, она предсказывает. Поэтому он допускает ошибки (галлюцинации) в местах, требующих логики, например, руки, текст, отражение, симметрия. Если вы хотите фотографического реализма, вы должны четко описать технические решения — свет, объектив, композицию — которые делают фотографию фотографией.
Внимание: хотя созданное изображение может выглядеть «как фотография», это не фотография; он не документирует реальный момент. Использование его в новостях, документальных фильмах или контексте, в котором утверждается, что «это действительно произошло», вводит в заблуждение и нарушает этические границы, которые мы рассмотрим в модуле 9.
Фотографическая подсказка анатомии
Мощная фотографическая подсказка состоит из шести компонентов. Думайте об этом как о планировании съемки:
- Тема: Что/кто? Возраст, одежда, выражение лица, действие, количество. («плотник средних лет, в фартуке, работает за верстаком»)
- Свет: направление, жесткость, источник, время. Это сердце фотографии. («мягкий свет из бокового окна, утро, низкий контраст»)
- Вид объектива и камеры: фокусное расстояние, глубина резкости, угол. («Ощущение портретного объектива 85 мм, малая глубина резкости, мягкое боке на фоне, уровень глаз»)
- Композиция: Обрамление, размещение, обрамление. («крупный план, правило третей, объект слева»)
- Атмосфера и цвет: Тон, настроение, палитра. («теплые землистые тона, спокойные, ностальгические»)
- Технологии/качество: Текстура, нотки реализма, соотношение сторон. («естественная текстура кожи, зернистость пленки, соотношение 3:2»)
Когда вы вводите эти компоненты последовательно, модель дает гораздо более контролируемый, «фотографический» результат. Любой компонент, который вы упускаете, остается на волю случая.
Совет: не заставляйте ИИ рисовать текст/логотип. Диффузионные модели не могут надежно создавать читаемый текст и фирменные логотипы; добавьте их на этапе фактического проектирования. Кроме того, в изображении, требующем читаемого текста, используйте AI только для фона/атмосферы.
Соотношение сторон и предполагаемое использование
Соотношение сторон — это соотношение ширины и высоты изображения, которое определяет его использование: 9:16 для вертикальной истории в социальных сетях, 3:2 для стандартной печати, 1:1 для квадратной публикации, 16:9 для широкого баннера. Лучше сразу указать соотношение в подсказке, чем потом его обрезать и потерять в качестве. Выбирайте разрешение и соотношение сторон с самого начала, зная предполагаемое использование (печать или отображение).
Отрицательный рецепт и вариация
Большинство инструментов также имеют отрицательную подсказку: область, где вы пишете на изображении то, что вам не нужно («деформированная рука, лишние пальцы, текст, водяной знак, пластиковый переплет»). Это уменьшает, но не предотвращает полностью распространенные дефекты; проверка по-прежнему необходима. Существует также понятие семени — семени случайности, из которого начинается производство; То же начальное значение и подсказка снова дает аналогичный результат, что помогает вам создать согласованный набор (более подробно мы поговорим в четвертом модуле).
три мини-кейса
Случай 1. Сила рецепта. Фотограф написал «Женщина, пьющая кофе» и получил печальные результаты. Когда Промпта добавил свет (свет из бокового окна), линзу (50 мм, малая глубина резкости), атмосферу (теплое, спокойное утро) и текстуру (натуральная кожа), результат стал пригодным для использования. Приемлемая скорость генерации кадров увеличена примерно с 1/20 до 1/4; Срок изготовления сократился на треть.
Случай 2 — Потеря из-за галлюцинаций. Дизайнер-фотограф поместил в презентацию изображение «деловых людей, пожимающих руки», не проверив его. На встрече было замечено, что у менеджера три руки. Недостаток, который не заметили на маленьком экране, в проекции увеличился. 30-секундное сканирование руки/пальцев предотвратило бы этот конфуз.
Случай 3 — Выбор правильного инструмента. Фотограф-продукт хотел поместить настоящие часы, которые он снимал, в другую среду. Вместо того, чтобы создавать его с нуля, он сохранил реальный каркас продукта, только фон/атмосфера были созданы с помощью ИИ и сделаны составными. Таким образом, реальные детали изделия (марка, циферблат) не были искажены; и достоверность, и точность были сохранены.
Копируемые шаблоны
1) Фотографический скелет:
[предмет: кто/что, возраст, одежда, выражение лица, действие], [свет: направление, резкость, источник, время], [объектив/камера: ощущение фокусного расстояния, глубина резкости, угол], [композиция: кадрирование, размещение, условность], [атмосфера/цвет: тон, настроение, палитра], [техника: естественная текстура, зернистость, соотношение сторон]. Фотографический, реалистичный. Добавьте текст/логотип.
2) Отрицательный черновой вариант:
Минусы (чего я не хочу): деформированная рука, лишние/отсутствующие пальцы, кривое лицо, пластиковая/восковая кожа, нечитаемый текст, водяной знак, повторяющаяся текстура, невозможная тень, перенасыщенный цвет.
3) Для справки по мудборду (направление, а не доставка):
Цель: ссылка на мудборд для съемки (не конечный результат). Концепция: [концепция]. Описывайте эстетику только атрибутами: свет [..], цветовая палитра [..], атмосфера [..], композиция [..]. Не используйте имена людей/брендов/фотографов. Создайте 4 варианта.
4) Составной план, защищающий реальный продукт:
У меня есть реальный шанс [продукта]; Сам продукт не изменится. Напишите подсказку для создания изображения только для фона/атмосферы: [свет, поверхность, цвет, окружающая среда]. Направление тени и светостойкость изделия должны быть [..], чтобы композиция выглядела убедительно.
Слабая подсказка / Сильная подсказка
Слабое: «Хорошее портретное фото».
Сильный: «Фермерка средних лет, утомленное солнцем лицо, легкая улыбка, на пшеничном поле; золотой час света сбоку, низкий контраст; портретный вид с расстояния 85 мм, малая глубина резкости, мягкий фон; крупный план, объект слева, правило третей; теплые земные тона, спокойное и достойное настроение; естественная текстура кожи, зернистость светлой пленки, 3:2. Фотографично, реалистично. Добавление текста».
Слабая воля полностью предоставлена на волю случая; Поскольку высокий спрос описывает свет, линзы, композицию и атмосферу, это значительно увеличивает вероятность получения желаемого результата.
Распространенные ошибки
- Не описываю свет и объектив. Именно эти два фактора во многом делают фотографию фотографией; Если вы оставите это поле пустым, результат будет зависеть от случая.
- Наличие ИИ рисует читаемый текст/логотип. Модель не может обеспечить это надежно; Он может оказаться дефектным и защищенным авторским правом.
- Представление созданного изображения как «фотографии». Это вводит в заблуждение в контексте документального фильма/новостей; Требуется констатация факта.
- Копирование стиля с именем человека/бренда. Риск имитации и авторских прав; Опишите эстетику с помощью качеств.
- Пропуск проверки. Руки, глаза, отражения, тени и повторяющиеся текстуры должны быть проверены в каждом создаваемом изображении.
В заключение
Генеративный визуальный ИИ работает путем диффузии: он переходит от шума к изображению, соответствующему тексту, не может создать то, что не описано, и ошибается там, где требуется логика. Для фотографического реализма описывайте объект, свет, объектив, композицию, атмосферу и технику, как фотограф. Выбирайте соотношение сторон в соответствии с целью, уменьшайте артефакт с помощью отрицательного рецепта, не позволяйте ИИ рисовать текст и проверяйте каждый вывод. Никогда не используйте созданное изображение, утверждающее, что оно «сфотографировано».
Задача приложения
Выберите концепцию и напишите фотоподсказку, заполнив все шесть компонентов шаблоном 1. Создайте (или опишите) одну и ту же концепцию сначала одним предложением, например «красивая фотография», затем полным скелетом и сравните два результата. Отметьте как минимум три возможных дефекта на изображении, увеличив руки, глаза, отражения и тени.
контрольный список
- [ ] В подсказке я отдельно описал предмет, свет, объектив, композицию, атмосферу и технику.
- [ ] Я определил соотношение сторон в соответствии с предполагаемым использованием.
- [ ] Я уменьшил распространенные дефекты с помощью отрицательного рецепта.
- [ ] У меня не получилось, чтобы ИИ рисовал читаемый текст/логотип.
- [ ] Я убедился, что сгенерированное изображение не представлено как «фотография».
- [ ] Я проверил вывод для руки/глаза/отражения/тени.