收益:
- 了解图像生成人工智能(扩散)的工作原理以及摄影写实主义需要哪些配方组件
- 能够撰写强有力的摄影提示,包括主题、光线、镜头/相机、构图、氛围和技术组件。
- 能够区分生成的图像和拍摄的照片之间的差异、使用限制以及真实性声明的重要性
摄影师将生成式视觉人工智能用于三个合法目的:为情绪板和概念生成草稿参考,创建补充实际镜头的元素(背景、纹理、合成作品),以及创建完全制作的图像(例如,用于股票销售或广告概念)。在本单元中,我们将学习这些工具的工作原理以及如何编写逼真的提示。我们的目标不是等待偶然的好机会;而是等待机会。它意味着用摄影师的语言描述你想要的东西并指导结果。
扩散:模型如何产生“照片”?
当今大多数图像生成人工智能都采用一种称为扩散的方法。简单地说:该模型已经学会了在数百万张图像上“从噪声到有意义的图像”。它从制作过程中的随机噪声(如雪花屏幕截图)开始,并通过逐渐清除噪声以适合您的文本(提示)来创建图像。由此可见两个基本事实:
首先,模型无法产生未描述的内容。如果你不说光,随机的光就会来;如果不考虑客观的观点,“摄影的感觉”仍然是一种巧合。其次,模型并不理解,它只是预测。这就是为什么他会在需要逻辑的地方犯错误(幻觉),比如手、文字、倒影、对称。如果你想要摄影般的真实感,你必须清楚地描述使照片成为照片的技术决策——光线、镜头、构图。
注意:虽然生成的图像可能看起来“像照片”,但它不是照片;它没有记录实际的时刻。在新闻报道、纪录片或声称“这确实发生过”的上下文中使用它会产生误导,并且违反道德界限,我们将在第 9 单元中介绍这一点。
摄影提示解剖
强大的摄影提示由六个部分组成。把这些想象成计划拍摄:
- 主题:什么/谁?年龄、衣着、表情、动作、数量。 (“一位中年木匠,系着围裙,在工作台上工作”)
- 光:方向、硬度、来源、时间。它是摄影的核心。 (“柔和的侧窗光,早晨,低对比度”)
- 镜头和相机视图:焦距、景深、角度。 (“85mm人像镜头感觉,浅景深,背景虚化柔和,视线水平”)
- 构图:构图、布局、构图。 (“特写镜头,三分法,主体在左侧”)
- 气氛和色彩:色调、情绪、调色板。 (“温暖的大地色调,平静,怀旧”)
- 技术/质量:纹理、真实感、长宽比。 (“自然肤质,胶片颗粒,3:2比例”)
当您按顺序引入这些组件时,模型会产生更受控制的“摄影”结果。你遗漏的任何组件都是偶然的。
提示:不要让AI绘制文字/标志。扩散模型无法可靠地生成可读文本和专有徽标;在实际设计阶段添加它们。此外,在需要可读文本的图像中,仅将 AI 用于背景/氛围。
长宽比和预期用途
宽高比是图像的宽高比,决定了其用途:社交媒体垂直故事为 9:16,标准打印为 3:2,方形帖子为 1:1,宽横幅为 16:9。最好从一开始就在提示中指定比例,而不是稍后修剪它并失去质量。从一开始就选择分辨率和比率,了解预期用途(打印或显示)。
负配方和变异
大多数工具还有一个负面提示:您可以在图像中写下您不想要的内容的区域(“变形的手、多余的手指、文本、水印、塑料装订”)。这减少但并不能完全防止常见缺陷;验证仍然是必要的。还有种子的概念——生产开始的随机性种子;相同的种子和提示会再次产生类似的结果,这有助于您创建一致的集合(我们将在第四单元中更深入地讨论)。
三个迷你箱子
案例 1——食谱的力量。一位股票摄影师写了“喝咖啡的女人”,但结果却很惨淡。当 Prompta 添加光线(侧窗光)、镜头(50mm,浅景深)、气氛(温暖、平静的早晨)和纹理(自然的皮肤)时,结果就变得可用了。可接受的帧生成率从大约 1/20 增加到 1/4;生产时间减少了三分之一。
案例 2——幻觉造成的损失。一位设计师兼摄影师在没有检查的情况下将“商务人士握手”的图像放入演示文稿中。在会议上,我们注意到一位经理有三只手。在小屏幕上被忽视的缺陷在投影中被放大了。 30 秒的手/手指扫描就可以避免这种尴尬。
案例 3 — 选择正确的工具。一位产品摄影师想要将他拍摄的真正的手表放置在不同的环境中。它没有从头开始制作,而是保留了真实的产品框架,只有背景/氛围是由AI制作并合成的。因此,产品的实际细节(品牌、表盘)没有被扭曲;可信度和准确性均得到保留。
可复制模板
1)拍照提示骨架:
[主题:谁/什么、年龄、服装、表情、动作]、[光线:方向、粗糙度、来源、时间]、[镜头/相机:焦距感、景深、角度]、[构图:取景、布局、惯例]、[气氛/颜色:色调、心情、调色板]、[技术:自然纹理、颗粒、长宽比]。摄影、写实。添加文字/徽标。
2) 负提示稿:
负面(我不想要的):畸形的手、多余/缺失的手指、弯曲的脸、塑料/蜡状皮肤、难以阅读的文本、水印、重复的纹理、不可能的阴影、过饱和的颜色。
3) 供情绪板参考(方向,而非交付):
目的:拍摄的情绪板参考(不是可交付成果)。概念:[概念]。仅用属性来描述美学:光线[..]、调色板[..]、氛围[..]、构图[..]。请勿使用任何人/品牌/摄影师的名称。生成 4 个变体。
4) 保护真实产品的综合计划:
我有一个真实的[产品]镜头;产品本身不会改变。编写仅针对背景/气氛生成的图像的提示:[光线、表面、颜色、环境]。产品的阴影方向和光硬度应该是[..],以便复合材料令人信服。
弱提示/强提示
弱:“漂亮的肖像照片。”
强:“中年农妇,晒伤的脸,浅浅的微笑,在麦田里;侧面的黄金时刻光,低对比度;85mm人像视图,浅景深,背景柔和;特写,主体左,三分法;温暖的大地色调,平静端庄的情绪;自然的皮肤纹理,轻胶片颗粒,3:2。摄影,写实。添加文字。”
意志薄弱的人完全听天由命;由于强烈的需求描述了光线、镜头、构图和氛围,因此大大增加了产生预期结果的可能性。
常见错误
- 没有描述光线和镜头。这两点在很大程度上决定了照片之所以成为照片。如果将其留空,结果将由运气决定。
- 让人工智能绘制可读的文本/徽标。该模型无法可靠地产生这些;它可能会被证明是有缺陷的并且受版权保护。
- 将生成的图像呈现为“照片”。在纪录片/新闻背景下具有误导性;需要事实陈述。
- 模仿人物/品牌名称的风格。模仿和版权风险;用品质来描述美学。
- 跳过验证。必须在每张生成的图像中检查手、眼睛、反射、阴影和重复纹理。
综上所述
生成式视觉人工智能通过扩散来工作:它从噪声到适合文本的图像,无法产生未描述的内容,并且在需要逻辑的地方出错。对于摄影写实主义,像摄影师一样描述主题、光线、镜头、构图、氛围和技术。根据目的选择长宽比,减少负面配方的工件,不用AI绘制文本,并验证每个输出。切勿使用声称是“拍摄的照片”的生成图像。
应用任务
选择一个概念并编写一个摄影提示,用模板 1 填写所有六个组成部分。首先用一个句子产生(或描述)相同的概念,例如“一张美丽的照片”,然后用完整的骨架,并比较两个结果。通过放大手、眼睛、反射和阴影,在您生成的图像中标记至少三个可能的缺陷点。
清单
- [ ] 在提示中,我分别描述了主题、光线、镜头、构图、氛围和技巧。
- [ ] 我根据预期用途确定了长宽比。
- [ ] 我用负面配方减少了常见缺陷。
- [ ] 我没有人工智能绘制可读的文本/标志。
- [ ] 我确保没有将生成的图像呈现为“照片”。
- [ ] 我验证了手/眼/反射/阴影的输出。