收益:
- 了解视觉人工智能(扩散)如何工作,以及它如何无法产生未描述的内容并且无法很好地绘制文本。
- 能够撰写由主题、背景、风格、构图、灯光和技术组成部分组成的强有力的视觉提示。
- 获得确定长宽比的能力,防止可读文本被人工智能绘制,减少负面描述的缺陷。
设计师用人工智能制作视觉效果就像给艺术家下命令:你解释得越清晰、越准确,结果就越准确。在本单元中,我们将以通俗易懂的语言了解图像生成人工智能(图像 AI)的工作原理,并逐步学习如何编写良好的提示(视觉的书面说明)。目的是能够有意识地描述出自己想要的形象,而不是“胡乱尝试,靠运气”。
图像人工智能如何工作? (简单解释)
如今,大多数图像制作者都使用一种称为扩散的方法。简单地说:模型从数百万个图像文本对中学习了“哪些单词对应哪些图像”关系。在生成视觉效果时,它从带有随机噪声的图像(例如下雪的电视屏幕)开始,并逐步清除这些噪声以适应您的提示,并将其变成有意义的图像。换句话说,模型不会“绘制”图片,而是统计地构建最适合您的提示的图像。
这会产生三个实际后果。第一:相同的提示每次都会给出不同的结果,因为初始噪声是随机的(我们将在下一个单元中看到如何使用“种子”来控制它)。第二:模型无法知道你无法描述的东西;它无法读取您头脑中的图片,它只能解释您所写的内容。第三:模型不能很好地绘制文字和数字,因为它模仿的是形状而不是含义;这就是为什么将标志书写留给人工智能是有风险的。
提示:不要让 AI 生成图像中的明文(品牌名称、口号)。您生成没有文本的图像,然后将文本(作为矢量)添加到设计程序中。这使得它既可读又可编辑。
剖析一个好的提示
它有助于将强烈的视觉提示分解为六个部分。你不需要每次都使用它们,但有意识地选择将决定结果。
- 主题/主题:图像的主要元素是什么? (“一个陶瓷咖啡杯”,“一个年轻女子的肖像”)。
- 动作/背景:他在做什么,他在哪里? (“在木桌上,在晨光中”)。
- 风格/美学:什么是视觉语言? (“最小产品照片”、“水彩插图”、“等距 3D 渲染”)。这是最决定性的组成部分。
- 构图/角度:框架如何? (“特写”、“鸟瞰”、“广角”、“中间,有空间”)。
- 光线和颜色:(“柔和的自然光”、“大地色调调色板”、“高对比度”)。
- 技术/质量:(“高分辨率”、“1:1 帧速率”、“背景纯白色”)。
还有一个消极的秘诀:说你不想要的话(“没有文字,没有人,没有凌乱的背景”)。我们将在第四单元中通过“负面提示”来加深这一点。
术语表
- 宽高比:图像的宽高比; 1:1 画面(Instagram 帖子)、9:16 肖像(故事/卷轴)、16:9 风景(封面)。
- 分辨率:图像中的像素数量;高对于印刷来说足够了,中对于屏幕来说足够了。
- 风格参考:给模特一个样品说“看起来像这样”。
- 渲染:计算机计算并产生图像; “3D 渲染”是指逼真的体积视图。
一步一步:描述图像
假设我们想要一个橄榄油品牌的产品图片。
步骤 1 — 聚焦主题:“深绿色玻璃瓶中的特级初榨橄榄油。”
第 2 步 — 添加上下文:“在质朴的木制柜台上,旁边有几根新鲜的橄榄枝。”
第 3 步 — 选择风格:“优质产品照片,逼真”。
第 4 步 — 给出构图:“产品在中间,文本空间在顶部”。
步骤 5 — 光线/颜色:“柔和的自然光,温暖的大地色调”。
第 6 步 — 技术:“1:1 帧速率、高分辨率、纯背景”。
当你将它们全部结合起来时,你就会得到一个适合品牌形象的可行草案。
三个迷你箱子
案例 1——从不确定到清晰。一位设计师写了“现代办公室的形象”,并进行了 12 次尝试,但都没有成功(浪费了 30 分钟)。他将提示重写为六个部分:“明亮、简约的办公室;木桌;大窗户的自然光;温暖的中性色调;广角;顶部的文本空间”。前 4 次尝试中有 2 次可用;时间缩短为10分钟。
案例 2 — 文本陷阱。一名实习生让人工智能从头到尾制作了一张咖啡馆海报;图像中的文字“COFFEE”原来是“COFEEE”,并且价格不可读。说明发生了变化:生成的图像没有文本,文本是稍后在设计程序中添加的。误差降至零,海报适合印刷。
情况 3 — 比率损失。一位社交媒体专家为 Instagram 故事制作了一张 1:1 的方形图像; 9:16 当我把它放在垂直区域时,顶部和底部被切断,重要的元素丢失了。当我在提示中将宽高比指定为“9:16 垂直”时,图像符合其格式并且不需要复制。
可复制模板
1)六分量产品形象骨架:
[主题:描述产品],[上下文:地点/方式]。风格:[例如优质产品照片,逼真]。构图:[例如产品在中间,文本空间在顶部]。光线和颜色:[例如柔和的自然光,大地色调]。技术:[纵横比,高分辨率,纯背景]。注意:图像中没有清晰的文字/徽标;我稍后会添加文字。
2)插图骨架:
主题:[画什么]。风格:[例如平面颜色矢量插图/水彩/等距 3D]。调色板:[2-3 原色]。心情:[例如开朗、平静、严肃]。背景:[素色/图案/透明]。比例:[1:1/9:16/16:9]。
3)风格探索(同一题材,不同审美):
用 4 种不同的视觉风格描述以下具有相同构图的主题:最小平面矢量、写实照片、水彩、等距 3D。为每一项编写一行提示。主题:[粘贴]
4)添加负面描述:
改进以下提示,并在末尾添加不需要的提示:“没有文字,没有水印,没有杂乱的背景,没有不好的手/手指,没有太多的物体”。提示:[粘贴]
弱提示/强提示
弱项:一张漂亮的咖啡照片
结果:角度随意、风格不清晰、附带的图像与品牌不符。
强大:装满热拿铁的陶瓷杯,放在浅色木桌上,在柔和的晨光中侧身;最低限度的优质产品照片;温暖的中性色调;特写,右上角有文字空间; 1:1正方形,素色背景;不应有清晰的文字。
结果是:构图、光线和比例受控的品牌适应性草图。
区别:强烈的提示清楚地填充了六个组成部分(主题、背景、风格、构图、光线、技术),而忽略了文本。
提示成分及效果表
组件
例子
对结果的影响
主题
“玻璃瓶中的橄榄油”
决定出现什么
风格
“优质产品照片”
最决定视觉语言的元素
组成
“在中间,有文字空间”
提高可用性
光/色
“柔和的光线,大地色调”
传达品牌感觉
纵横比
“9点16分垂直”
允许遵守格式
负面描述
“没有文字”
减少缺陷
常见错误
- 不指定风格:通过省略最具决定性的组成部分,结果变得陈词滥调和随机。
- 让 AI 绘制文本:损坏、无法读取的字母;稍后在设计程序中添加文本。
- 忘记比例:错误的纵横比会导致出版物中出现剪裁和元素丢失。
- 重载提示:将 20 个概念堆叠在一起使模型变得混乱;保持清晰并确定优先顺序。
- 一试放弃:扩散是随机的;产生多种变体并选择最好的一种是正常的。
综上所述
图像生成人工智能会根据随机噪声逐渐构建适合您提示的图像;它无法读取您头脑中的图片,它只能解释您所写的内容。一个好的提示由六个部分组成:主题、上下文、风格、构图、光线/颜色和技巧。风格是最决定性的因素;请务必指定纵横比;不要把可读的文本留给人工智能,你稍后再添加。随着清晰度的提高,尝试次数和时间损失都会减少。
应用任务
选择一个产品或主题。首先,将其写在一个句子中(“一个漂亮的 X”),然后在图像生成器中尝试并记下结果。然后通过填充六部分骨架、添加长宽比和反面描述来再次描述同一主题。将两个结果并排放置,并写出清晰度如何改变输出的三个要点。
清单
- [ ] 我在提示中清楚地说明了主题、上下文和风格。
- [ ] 我添加了构图和光/颜色组件。
- [ ] 我指定了宽高比(1:1 / 9:16 / 16:9)。
- [ ] 我没有让AI画出可读的文字,留到以后再说。
- [ ] 我用负面描述排除了不受欢迎的内容。
- [ ] 我不相信单一的实验,并产生了几种变化。