单位 2 / 11

视觉制作基础知识:图像 AI 的工作原理和提示解剖

收益:

  • 了解视觉人工智能(扩散)如何工作,以及它如何无法产生未描述的内容并且无法很好地绘制文本。
  • 能够撰写由主题、背景、风格、构图、灯光和技术组成部分组成的强有力的视觉提示。
  • 获得确定长宽比的能力,防止可读文本被人工智能绘制,减少负面描述的缺陷。

设计师用人工智能制作视觉效果就像给艺术家下命令:你解释得越清晰、越准确,结果就越准确。在本单元中,我们将以通俗易懂的语言了解图像生成人工智能(图像 AI)的工作原理,并逐步学习如何编写良好的提示(视觉的书面说明)。目的是能够有意识地描述出自己想要的形象,而不是“胡乱尝试,靠运气”。

图像人工智能如何工作? (简单解释)

如今,大多数图像制作者都使用一种称为扩散的方法。简单地说:模型从数百万个图像文本对中学习了“哪些单词对应哪些图像”关系。在生成视觉效果时,它从带有随机噪声的图像(例如下雪的电视屏幕)开始,并逐步清除这些噪声以适应您的提示,并将其变成有意义的图像。换句话说,模型不会“绘制”图片,而是统计地构建最适合您的提示的图像。

这会产生三个实际后果。第一:相同的提示每次都会给出不同的结果,因为初始噪声是随机的(我们将在下一个单元中看到如何使用“种子”来控制它)。第二:模型无法知道你无法描述的东西;它无法读取您头脑中的图片,它只能解释您所写的内容。第三:模型不能很好地绘制文字和数字,因为它模仿的是形状而不是含义;这就是为什么将标志书写留给人工智能是有风险的。

提示:不要让 AI 生成图像中的明文(品牌名称、口号)。您生成没有文本的图像,然后将文本(作为矢量)添加到设计程序中。这使得它既可读又可编辑。

剖析一个好的提示

它有助于将强烈的视觉提示分解为六个部分。你不需要每次都使用它们,但有意识地选择将决定结果。

  1. 主题/主题:图像的主要元素是什么? (“一个陶瓷咖啡杯”,“一个年轻女子的肖像”)。
  2. 动作/背景:他在做什么,他在哪里? (“在木桌上,在晨光中”)。
  3. 风格/美学:什么是视觉语言? (“最小产品照片”、“水彩插图”、“等距 3D 渲染”)。这是最决定性的组成部分。
  4. 构图/角度:框架如何? (“特写”、“鸟瞰”、“广角”、“中间,有空间”)。
  5. 光线和颜色:(“柔和的自然光”、“大地色调调色板”、“高对比度”)。
  6. 技术/质量:(“高分辨率”、“1:1 帧速率”、“背景纯白色”)。

还有一个消极的秘诀:说你不想要的话(“没有文字,没有人,没有凌乱的背景”)。我们将在第四单元中通过“负面提示”来加深这一点。

术语表

  • 宽高比:图像的宽高比; 1:1 画面(Instagram 帖子)、9:16 肖像(故事/卷轴)、16:9 风景(封面)。
  • 分辨率:图像中的像素数量;高对于印刷来说足够了,中对于屏幕来说足够了。
  • 风格参考:给模特一个样品说“看起来像这样”。
  • 渲染:计算机计算并产生图像; “3D 渲染”是指逼真的体积视图。

一步一步:描述图像

假设我们想要一个橄榄油品牌的产品图片。

步骤 1 — 聚焦主题:“深绿色玻璃瓶中的特级初榨橄榄油。”

第 2 步 — 添加上下文:“在质朴的木制柜台上,旁边有几根新鲜的橄榄枝。”

第 3 步 — 选择风格:“优质产品照片,逼真”。

第 4 步 — 给出构图:“产品在中间,文本空间在顶部”。

步骤 5 — 光线/颜色:“柔和的自然光,温暖的大地色调”。

第 6 步 — 技术:“1:1 帧速率、高分辨率、纯背景”。

当你将它们全部结合起来时,你就会得到一个适合品牌形象的可行草案。

三个迷你箱子

案例 1——从不确定到清晰。一位设计师写了“现代办公室的形象”,并进行了 12 次尝试,但都没有成功(浪费了 30 分钟)。他将提示重写为六个部分:“明亮、简约的办公室;木桌;大窗户的自然光;温暖的中性色调;广角;顶部的文本空间”。前 4 次尝试中有 2 次可用;时间缩短为10分钟。

案例 2 — 文本陷阱。一名实习生让人工智能从头到尾制作了一张咖啡馆海报;图像中的文字“COFFEE”原来是“COFEEE”,并且价格不可读。说明发生了变化:生成的图像没有文本,文本是稍后在设计程序中添加的。误差降至零,海报适合印刷。

情况 3 — 比率损失。一位社交媒体专家为 Instagram 故事制作了一张 1:1 的方形图像; 9:16 当我把它放在垂直区域时,顶部和底部被切断,重要的元素丢失了。当我在提示中将宽高比指定为“9:16 垂直”时,图像符合其格式并且不需要复制。

可复制模板

1)六分量产品形象骨架:

[主题:描述产品],[上下文:地点/方式]。风格:[例如优质产品照片,逼真]。构图:[例如产品在中间,文本空间在顶部]。光线和颜色:[例如柔和的自然光,大地色调]。技术:[纵横比,高分辨率,纯背景]。注意:图像中没有清晰的文字/徽标;我稍后会添加文字。

2)插图骨架:

主题:[画什么]。风格:[例如平面颜色矢量插图/水彩/等距 3D]。调色板:[2-3 原色]。心情:[例如开朗、平静、严肃]。背景:[素色/图案/透明]。比例:[1:1/9:16/16:9]。

3)风格探索(同一题材,不同审美):

用 4 种不同的视觉风格描述以下具有相同构图的主题:最小平面矢量、写实照片、水彩、等距 3D。为每一项编写一行提示。主题:[粘贴]

4)添加负面描述:

改进以下提示,并在末尾添加不需要的提示:“没有文字,没有水印,没有杂乱的背景,没有不好的手/手指,没有太多的物体”。提示:[粘贴]

弱提示/强提示

弱项:一张漂亮的咖啡照片

结果:角度随意、风格不清晰、附带的图像与品牌不符。

强大:装满热拿铁的陶瓷杯,放在浅色木桌上,在柔和的晨光中侧身;最低限度的优质产品照片;温暖的中性色调;特写,右上角有文字空间; 1:1正方形,素色背景;不应有清晰的文字。

结果是:构图、光线和比例受控的品牌适应性草图。

区别:强烈的提示清楚地填充了六个组成部分(主题、背景、风格、构图、光线、技术),而忽略了文本。

提示成分及效果表

组件

例子

对结果的影响

主题

“玻璃瓶中的橄榄油”

决定出现什么

风格

“优质产品照片”

最决定视觉语言的元素

组成

“在中间,有文字空间”

提高可用性

光/色

“柔和的光线,大地色调”

传达品牌感觉

纵横比

“9点16分垂直”

允许遵守格式

负面描述

“没有文字”

减少缺陷

常见错误

  • 不指定风格:通过省略最具决定性的组成部分,结果变得陈词滥调和随机。
  • 让 AI 绘制文本:损坏、无法读取的字母;稍后在设计程序中添加文本。
  • 忘记比例:错误的纵横比会导致出版物中出现剪裁和元素丢失。
  • 重载提示:将 20 个概念堆叠在一起使模型变得混乱;保持清晰并确定优先顺序。
  • 一试放弃:扩散是随机的;产生多种变体并选择最好的一种是正常的。

综上所述

图像生成人工智能会根据随机噪声逐渐构建适合您提示的图像;它无法读取您头脑中的图片,它只能解释您所写的内容。一个好的提示由六个部分组成:主题、上下文、风格、构图、光线/颜色和技巧。风格是最决定性的因素;请务必指定纵横比;不要把可读的文本留给人工智能,你稍后再添加。随着清晰度的提高,尝试次数和时间损失都会减少。

应用任务

选择一个产品或主题。首先,将其写在一个句子中(“一个漂亮的 X”),然后在图像生成器中尝试并记下结果。然后通过填充六部分骨架、添加长宽比和反面描述来再次描述同一主题。将两个结果并排放置,并写出清晰度如何改变输出的三个要点。

清单

  • [ ] 我在提示中清楚地说明了主题、上下文和风格。
  • [ ] 我添加了构图和光/颜色组件。
  • [ ] 我指定了宽高比(1:1 / 9:16 / 16:9)。
  • [ ] 我没有让AI画出可读的文字,留到以后再说。
  • [ ] 我用负面描述排除了不受欢迎的内容。
  • [ ] 我不相信单一的实验,并产生了几种变化。