Прибуток:
- Розуміння того, як працює штучний інтелект (дифузія), що створює зображення, і які компоненти рецепту потрібні для фотографічного реалізму
- Здатність написати потужну фотографічну підказку, що складається з об’єкта, світла, об’єктива/камери, композиції, атмосфери та технічних компонентів.
- Здатність відрізнити створене зображення від зробленої фотографії, межі використання та важливість декларації автентичності
Фотограф використовує генеративний візуальний штучний інтелект для трьох законних цілей: для створення еталонних зразків для мудбордів і концепцій, для створення елементів, які доповнюють фактичний знімок (фон, текстура, комбінована частина), і для створення повністю створених зображень (наприклад, для розпродажу акцій або рекламної концепції). У цьому розділі ми дізнаємося, як працюють ці інструменти та як писати підказки для фотографічного реалізму. Мета полягає не в тому, щоб випадково дочекатися гарного удару; Це означає описати те, що ви хочете мовою фотографа, і скерувати результат.
Розповсюдження: як модель створює «фотографії»?
Більшість сучасних штучних інтелектів, що створюють зображення, працюють за допомогою методу, що називається дифузією. Просто: модель навчилася переходити «від шуму до значущого зображення» на мільйонах зображень. Він починається з випадкового шуму під час створення (наприклад, засніжений знімок екрана) і створює зображення, поступово очищаючи шум, щоб відповідати вашому тексту (підказка). З цього випливають два основні факти:
По-перше, модель не може створити те, що не описано. Якщо ви не скажете світло, з’явиться випадкове світло; Якщо не враховувати об'єктивний погляд, то "відчуття фотографії" так і залишиться випадковістю. По-друге, модель не розуміє, вона передбачає. Тому він робить помилки (галюцинації) у місцях, які вимагають логіки, таких як руки, текст, відображення, симетрія. Якщо ви хочете фотографічного реалізму, ви повинні чітко описати технічні рішення — світло, об’єктив, композицію — які роблять фотографію фотографією.
Застереження: хоча створене зображення може виглядати «як фото», воно не є фото; він не документує реальний момент. Використання його в новинах, документальному фільмі чи контексті, у якому стверджується, що «це справді сталося», є оманливим і порушує етичні межі, які ми розглянемо в розділі 9.
Фотографічна швидка анатомія
Потужна фотографічна підказка складається з шести компонентів. Подумайте про це як про планування зйомки:
- Тема: Що/хто? Вік, одяг, вираз, дія, число. («столяр середніх років, у фартусі, працює за верстаком»).
- Світло: напрямок, жорсткість, джерело, час. Це серце фотографії. ("м'яке світло бічного вікна, ранок, низький контраст")
- Вид об'єктива та камери: фокусна відстань, глибина різкості, кут. ("85-мм портретний об'єктив, мала глибина різкості, м'яке фонове боке, рівень очей")
- Композиція: Обрамлення, розміщення, обрамлення. ("великий план, правило третин, предмет ліворуч")
- Атмосфера і колір: тон, настрій, палітра. ("теплі земні тони, спокій, ностальгія")
- Техніка/якість: Текстура, нотки реалізму, співвідношення сторін. ("природна текстура шкіри, зернистість плівки, співвідношення 3:2")
Коли ви вводите ці компоненти послідовно, модель створює набагато більш контрольований, «фотографічний» результат. Будь-який компонент, який ви пропускаєте, залишається напризволяще.
Порада: не дозволяйте штучному інтелекту малювати текст/логотип. Дифузійні моделі не можуть надійно створювати читабельний текст і фірмові логотипи; додати їх на фактичному етапі проектування. Крім того, на зображенні, яке потребує читабельного тексту, використовуйте ШІ лише для фону/атмосфери.
Співвідношення сторін і призначення
Співвідношення сторін — це співвідношення ширини та висоти зображення, яке визначає його використання: 9:16 для вертикальної статті в соціальних мережах, 3:2 для стандартного друку, 1:1 для квадратної публікації, 16:9 для широкого банера. Краще вказати співвідношення в підказці з самого початку, ніж обрізати його пізніше і втратити якість. Виберіть роздільну здатність і співвідношення з самого початку, знаючи призначення (друк або дисплей).
Негативний рецепт і варіація
Більшість інструментів також мають негативну підказку: область, де ви пишете речі, які вам не потрібні на зображенні («деформована рука, додаткові пальці, текст, водяний знак, пластикова палітурка»). Це зменшує, але не повністю запобігає поширеним дефектам; перевірка все ще важлива. Існує також поняття насіння — насіння випадковості, з якого починається виробництво; Той самий вихідний код і підказка знову дають схожий результат, що допомагає створити послідовний набір (ми детальніше розглянемо це в 4-му блоці).
три міні-чохла
Випадок 1 — Сила рецепта. Стоковий фотограф написав "жінка п'є каву" і отримав жахливі результати. Коли Prompta додала світло (освітлення бокового вікна), об’єктив (50 мм, невелика глибина різкості), атмосферу (теплий, спокійний ранок) і текстуру (природна шкіра), результат став придатним для використання. Прийнятна швидкість генерації кадрів збільшена приблизно з 1/20 до 1/4; Час виробництва скорочено на третину.
Випадок 2 — Втрата від галюцинацій. Дизайнер-фотограф помістив у презентацію зображення «ділових людей, які тиснуть руки», не перевіривши його. На зустрічі було помічено, що у керівника три руки. Недолік, який не було помічено на маленькому екрані, був збільшений у проекції. 30-секундне сканування руки/пальця запобігло б цьому збентеженню.
Випадок 3 — Вибір правильного інструменту. Продуктовий фотограф хотів помістити справжній годинник, який він зняв, у інше середовище. Замість того, щоб створювати його з нуля, він зберіг реальну рамку продукту, лише фон/атмосферу створили за допомогою штучного інтелекту та зробили складеним. Таким чином, фактичні деталі виробу (бренд, циферблат) не були спотворені; як достовірність, так і точність були збережені.
Шаблони, які можна копіювати
1) Скелет фотографічної підказки:
[об’єкт: хто/що, вік, одяг, вираз, дія], [світло: напрямок, жорсткість, джерело, час], [об’єктив/камера: відчуття фокусної відстані, глибина різкості, кут], [композиція: кадрування, розміщення, умовність], [атмосфера/колір: тон, настрій, палітра], [техніка: природна текстура, зернистість, співвідношення сторін].Фотографічний, реалістичний. Додайте текст/логотип.
2) Негативний оперативний проект:
Мінуси (те, чого я не хочу): неправильна рука, зайві/відсутні пальці, викривлене обличчя, пластикова/воскова шкіра, нечитабельний текст, водяний знак, повторювана текстура, неможлива тінь, перенасичений колір.
3) Для довідки про moodboard (напрямок, а не доставка):
Призначення: референс дошки настроїв для зйомки (не результат). Концепція: [концепція]. Описуйте естетику лише атрибутами: світло [..], колірна палітра [..], атмосфера [..], композиція [..]. Не використовуйте імена осіб/брендів/фотографів. Згенеруйте 4 варіації.
4) Композитний план захисту реального продукту:
У мене є справжній знімок [продукту]; Сам товар не зміниться. Напишіть підказку для зображення, яке буде створено лише для фону/атмосфери: [світло, поверхня, колір, середовище]. Напрямок тіні та твердість світла продукту мають бути [..], щоб композит був переконливим.
Слабка підказка / Сильна підказка
Слабко: «Гарне портретне фото».
Сильно: «Жінка середнього віку, виснажене сонцем обличчя, легка посмішка, на пшеничному полі; світло в золоту годину збоку, низький контраст; 85 мм портрет, невелика глибина різкості, м’який фон; крупний план, об’єкт зліва, правило третин; теплі відтінки землі, спокійний і гідний настрій; натуральна текстура шкіри, легка зернистість плівки, 3:2. Фотографічна, реалістична. Додавання тексту».
Слабка воля повністю залишена на волю випадку; Оскільки високий попит описує світло, лінзу, композицію та атмосферу, це значно збільшує ймовірність досягнення бажаного результату.
Поширені помилки
- Не описуючи світло та лінзи. Ці два значною мірою роблять фотографію фотографією; Якщо ви залишите це поле порожнім, результат залишиться напризволяще.
- Штучний інтелект намалює читабельний текст/логотип. Модель не може виробляти їх надійно; Він може виявитися несправним і захищеним авторським правом.
- Представлення створеного зображення у вигляді «фотографії». Це вводить в оману в документальному/новинному контексті; Потрібна констатація факту.
- Копіювання стилю з назвою людини/бренду. Ризик імітації та авторського права; Описуйте естетику якостями.
- Пропуск перевірки. Руки, очі, відображення, тіні та повторювані текстури необхідно перевіряти на кожному створеному зображенні.
Підсумовуючи
Генеративний візуальний ШІ працює за допомогою дифузії: він переходить від шуму до зображення, яке відповідає тексту, не може створити те, що не описано, і помиляється там, де потрібна логіка. Для фотографічного реалізму опишіть об’єкт, світло, об’єктив, композицію, атмосферу та техніку, як фотограф. Виберіть співвідношення сторін відповідно до мети, зменшіть артефакт за допомогою негативного рецепту, не маліть ШІ текст і перевіряйте кожен вихід. Ніколи не використовуйте створене зображення, яке претендує на "зроблене фото".
Аплікаційне завдання
Виберіть концепцію та напишіть фотографічну підказку, заповнивши всі шість компонентів за допомогою шаблону 1. Створіть (або опишіть) ту саму концепцію спочатку в одному реченні, наприклад «гарна фотографія», потім з повним скелетом і порівняйте два результати. Позначте принаймні три можливі недоліки на зображенні, яке ви створюєте, збільшуючи руки, очі, відображення та тіні.
контрольний список
- [ ] У підказці я окремо описав предмет, світло, об’єктив, композицію, атмосферу та техніку.
- [ ] Я визначив співвідношення сторін відповідно до призначення.
- [ ] Я зменшив загальні дефекти за допомогою негативного рецепту.
- [ ] У мене не було, щоб штучний інтелект намалював читабельний текст/логотип.
- [ ] Я переконався, що не представляю згенероване зображення як "фото".
- [ ] Я перевірив результат для рук/очей/відображення/тіні.