单位 3 / 11

摄影视觉制作和即时解剖:扩散如何发挥作用?

收益:

  • 了解图像生成人工智能(扩散)的工作原理以及摄影写实主义需要哪些配方组件
  • 能够撰写强有力的摄影提示,包括主题、光线、镜头/相机、构图、氛围和技术组件。
  • 能够区分生成的图像和拍摄的照片之间的差异、使用限制以及真实性声明的重要性

摄影师将生成式视觉人工智能用于三个合法目的:为情绪板和概念生成草稿参考,创建补充实际镜头的元素(背景、纹理、合成作品),以及创建完全制作的图像(例如,用于股票销售或广告概念)。在本单元中,我们将学习这些工具的工作原理以及如何编写逼真的提示。我们的目标不是等待偶然的好机会;而是等待机会。它意味着用摄影师的语言描述你想要的东西并指导结果。

扩散:模型如何产生“照片”?

当今大多数图像生成人工智能都采用一种称为扩散的方法。简单地说:该模型已经学会了在数百万张图像上“从噪声到有意义的图像”。它从制作过程中的随机噪声(如雪花屏幕截图)开始,并通过逐渐清除噪声以适合您的文本(提示)来创建图像。由此可见两个基本事实:

首先,模型无法产生未描述的内容。如果你不说光,随机的光就会来;如果不考虑客观的观点,“摄影的感觉”仍然是一种巧合。其次,模型并不理解,它只是预测。这就是为什么他会在需要逻辑的地方犯错误(幻觉),比如手、文字、倒影、对称。如果你想要摄影般的真实感,你必须清楚地描述使照片成为照片的技术决策——光线、镜头、构图。

注意:虽然生成的图像可能看起来“像照片”,但它不是照片;它没有记录实际的时刻。在新闻报道、纪录片或声称“这确实发生过”的上下文中使用它会产生误导,并且违反道德界限,我们将在第 9 单元中介绍这一点。

摄影提示解剖

强大的摄影提示由六个部分组成。把这些想象成计划拍摄:

  1. 主题:什么/谁?年龄、衣着、表情、动作、数量。 (“一位中年木匠,系着围裙,在工作台上工作”)
  2. 光:方向、硬度、来源、时间。它是摄影的核心。 (“柔和的侧窗光,早晨,低对比度”)
  3. 镜头和相机视图:焦距、景深、角度。 (“85mm人像镜头感觉,浅景深,背景虚化柔和,视线水平”)
  4. 构图:构图、布局、构图。 (“特写镜头,三分法,主体在左侧”)
  5. 气氛和色彩:色调、情绪、调色板。 (“温暖的大地色调,平静,怀旧”)
  6. 技术/质量:纹理、真实感、长宽比。 (“自然肤质,胶片颗粒,3:2比例”)

当您按顺序引入这些组件时,模型会产生更受控制的“摄影”结果。你遗漏的任何组件都是偶然的。

提示:不要让AI绘制文字/标志。扩散模型无法可靠地生成可读文本和专有徽标;在实际设计阶段添加它们。此外,在需要可读文本的图像中,仅将 AI 用于背景/氛围。

长宽比和预期用途

宽高比是图像的宽高比,决定了其用途:社交媒体垂直故事为 9:16,标准打印为 3:2,方形帖子为 1:1,宽横幅为 16:9。最好从一开始就在提示中指定比例,而不是稍后修剪它并失去质量。从一开始就选择分辨率和比率,了解预期用途(打印或显示)。

负配方和变异

大多数工具还有一个负面提示:您可以在图像中写下您不想要的内容的区域(“变形的手、多余的手指、文本、水印、塑料装订”)。这减少但并不能完全防止常见缺陷;验证仍然是必要的。还有种子的概念——生产开始的随机性种子;相同的种子和提示会再次产生类似的结果,这有助于您创建一致的集合(我们将在第四单元中更深入地讨论)。

三个迷你箱子

案例 1——食谱的力量。一位股票摄影师写了“喝咖啡的女人”,但结果却很惨淡。当 Prompta 添加光线(侧窗光)、镜头(50mm,浅景深)、气氛(温暖、平静的早晨)和纹理(自然的皮肤)时,结果就变得可用了。可接受的帧生成率从大约 1/20 增加到 1/4;生产时间减少了三分之一。

案例 2——幻觉造成的损失。一位设计师兼摄影师在没有检查的情况下将“商务人士握手”的图像放入演示文稿中。在会议上,我们注意到一位经理有三只手。在小屏幕上被忽视的缺陷在投影中被放大了。 30 秒的手/手指扫描就可以避免这种尴尬。

案例 3 — 选择正确的工具。一位产品摄影师想要将他拍摄的真正的手表放置在不同的环境中。它没有从头开始制作,而是保留了真实的产品框架,只有背景/氛围是由AI制作并合成的。因此,产品的实际细节(品牌、表盘)没有被扭曲;可信度和准确性均得到保留。

可复制模板

1)拍照提示骨架:

[主题:谁/什么、年龄、服装、表情、动作]、[光线:方向、粗糙度、来源、时间]、[镜头/相机:焦距感、景深、角度]、[构图:取景、布局、惯例]、[气氛/颜色:色调、心情、调色板]、[技术:自然纹理、颗粒、长宽比]。摄影、写实。添加文字/徽标。

2) 负提示稿:

负面(我不想要的):畸形的手、多余/缺失的手指、弯曲的脸、塑料/蜡状皮肤、难以阅读的文本、水印、重复的纹理、不可能的阴影、过饱和的颜色。

3) 供情绪板参考(方向,而非交付):

目的:拍摄的情绪板参考(不是可交付成果)。概念:[概念]。仅用属性来描述美学:光线[..]、调色板[..]、氛围[..]、构图[..]。请勿使用任何人/品牌/摄影师的名称。生成 4 个变体。

4) 保护真实产品的综合计划:

我有一个真实的[产品]镜头;产品本身不会改变。编写仅针对背景/气氛生成的图像的提示:[光线、表面、颜色、环境]。产品的阴影方向和光硬度应该是[..],以便复合材料令人信服。

弱提示/强提示

弱:“漂亮的肖像照片。”

强:“中年农妇,晒伤的脸,浅浅的微笑,在麦田里;侧面的黄金时刻光,低对比度;85mm人像视图,浅景深,背景柔和;特写,主体左,三分法;温暖的大地色调,平静端庄的情绪;自然的皮肤纹理,轻胶片颗粒,3:2。摄影,写实。添加文字。”

意志薄弱的人完全听天由命;由于强烈的需求描述了光线、镜头、构图和氛围,因此大大增加了产生预期结果的可能性。

常见错误

  • 没有描述光线和镜头。这两点在很大程度上决定了照片之所以成为照片。如果将其留空,结果将由运气决定。
  • 让人工智能绘制可读的文本/徽标。该模型无法可靠地产生这些;它可能会被证明是有缺陷的并且受版权保护。
  • 将生成的图像呈现为“照片”。在纪录片/新闻背景下具有误导性;需要事实陈述。
  • 模仿人物/品牌名称的风格。模仿和版权风险;用品质来描述美学。
  • 跳过验证。必须在每张生成的图像中检查手、眼睛、反射、阴影和重复纹理。

综上所述

生成式视觉人工智能通过扩散来工作:它从噪声到适合文本的图像,无法产生未描述的内容,并且在需要逻辑的地方出错。对于摄影写实主义,像摄影师一样描述主题、光线、镜头、构图、氛围和技术。根据目的选择长宽比,减少负面配方的工件,不用AI绘制文本,并验证每个输出。切勿使用声称是“拍摄的照片”的生成图像。

应用任务

选择一个概念并编写一个摄影提示,用模板 1 填写所有六个组成部分。首先用一个句子产生(或描述)相同的概念,例如“一张美丽的照片”,然后用完整的骨架,并比较两个结果。通过放大手、眼睛、反射和阴影,在您生成的图像中标记至少三个可能的缺陷点。

清单

  • [ ] 在提示中,我分别描述了主题、光线、镜头、构图、氛围和技巧。
  • [ ] 我根据预期用途确定了长宽比。
  • [ ] 我用负面配方减少了常见缺陷。
  • [ ] 我没有人工智能绘制可读的文本/标志。
  • [ ] 我确保没有将生成的图像呈现为“照片”。
  • [ ] 我验证了手/眼/反射/阴影的输出。