利益:
- 視覚人工知能 (拡散) がどのように機能するのか、説明されていないものを生成できないこと、テキストをうまく描画できないことを理解します。
- 主題、文脈、スタイル、構成、照明、技術的な要素から構成される強力な視覚的プロンプトを作成する能力。
- アスペクト比を決定する能力を獲得し、可読テキストが人工知能によって描画されるのを防ぎ、否定的な説明による欠陥を軽減します。
デザイナーが AI でビジュアルを制作するのは、アーティストに注文を与えるようなものです。説明が明確で正確であればあるほど、より正確な結果が得られます。この単元では、画像生成人工知能 (画像 AI) がどのように機能するかを平易な言葉で理解し、適切なプロンプト (ビジュアルの指示書) を書く仕組みを段階的に学びます。 「行き当たりばったりで運任せ」ではなく、意識的になりたいイメージを描けるようになることを目指します。
画像 AI はどのように機能しますか? (簡単な説明)
現在、ほとんどの画像制作者は拡散と呼ばれる方法を使用しています。単純に言うと、モデルは何百万もの画像とテキストのペアから「どの単語がどの画像に対応するか」の関係を学習しました。ビジュアルを作成するときは、ランダムなノイズのある画像 (雪の降るテレビ画面など) から開始し、プロンプトに合わせてこのノイズを段階的に除去して、意味のある画像に変換します。言い換えれば、モデルは画像を「描画」するのではなく、プロンプトに最も適した画像を統計的に構築します。
これには 3 つの実際的な影響があります。 1 つ目: 初期ノイズはランダムであるため、同じプロンプトは毎回異なる結果を返します (次の単元で「シード」を使用してこれを制御する方法を説明します)。 2 番目: モデルは、記述できないものを認識できません。頭の中の絵を読み取ることはできず、ただ書かれたものを解釈するだけです。 3 番目: モデルは文字を意味ではなく形で模倣するため、テキストと数字をうまく描画できません。だからこそ、ロゴの書き込みをAIに任せるのは危険なのです。
ヒント: AI に画像内のクリア テキスト (ブランド名、スローガン) を生成させないでください。テキストのない画像を作成し、デザイン プログラムにテキストを (ベクトルとして) 追加します。これにより、読み取りと編集の両方が可能になります。
優れたプロンプトの構造
これは、強力な視覚的プロンプトを 6 つのコンポーネントに分割するのに役立ちます。毎回すべてを使用する必要はありませんが、意識的に選択することが結果を左右します。
- 件名/件名: 画像の主な要素は何ですか? (「陶器のコーヒーカップ」、「若い女性の肖像画」)。
- アクション/コンテキスト: 彼は何をしているのか、どこにいるのか? (「朝の光の中で、木のテーブルで」)。
- スタイル/美学: 視覚言語とは何ですか? (「最小限の製品写真」、「水彩イラスト」、「アイソメトリック 3D レンダリング」)。これが最も決定的な要素です。
- 構図・アングル:フレームはどうなっていますか? (「クローズアップ」、「鳥瞰図」、「広角」、「真ん中、スペースあり」)。
- 光と色: (「柔らかな自然光」、「アーストーン パレット」、「ハイ コントラスト」)。
- 技術/品質: (「高解像度」、「1:1 フレームレート」、「背景白無地」)。
また、望まないことを言うというネガティブなレシピもあります (「テキストなし、人なし、背景が汚い」)。これを第4単元の「ネガティブプロンプト」でさらに深めていきます。
用語集
- アスペクト比: 画像のアスペクト比。 1:1 フレーム (Instagram 投稿)、9:16 ポートレート (ストーリー/リール)、16:9 風景 (カバー)。
- 解像度: 画像内のピクセル数。印刷には高、スクリーンには中程度で十分です。
- スタイルリファレンス:モデルに「こんな感じで」とサンプルを渡します。
- レンダリング: コンピューターが画像を計算して生成します。 「3D レンダリング」とは、現実的な立体ビューを意味します。
ステップバイステップ: 画像を説明する
オリーブ オイル ブランドの製品画像が必要だとします。
ステップ 1 — 主題「濃い緑色のガラス瓶に入ったエキストラバージン オリーブ オイル」に焦点を当てます。
ステップ 2 — コンテキストを追加します。「素朴な木製のカウンターの上に、その隣に新鮮なオリーブの枝が数本あります。」
ステップ 3 — スタイルを選択します: 「プレミアム製品写真、リアル」。
ステップ 4 — 「製品が中央にあり、テキスト用のスペースが上部にある」という構成を指定します。
ステップ 5 — 光/色: 「ソフトサイドの自然光、温かみのあるアースカラー」。
ステップ 6 — テクニック: 「1:1 フレーム レート、高解像度、無地の背景」。
それらをすべて組み合わせると、ブランドのアイデンティティに適した実行可能なドラフトが得られます。
ミニケース3個
ケース 1 — 不確実性から明確さへ。デザイナーは「モダンなオフィスのイメージ」を書き、12回試行しましたが、どれもうまくいきませんでした(30分のロス)。彼はこのプロンプトを 6 つの要素に書き直しました。「明るくミニマルなオフィス、木製デスク、大きな窓からの自然光、温かみのある中間色、広角、上部のテキストスペース」。最初の 4 回の試行のうち 2 回は使用可能でした。時間は10分に短縮されました。
ケース 2 — テキスト トラップ。あるインターンはAIにカフェのポスターを最初から最後まで制作させた。画像内の「COFFEE」という文字は「COFEEE」となっており、価格も判読できませんでした。指示が変更されました。画像はテキストなしで作成され、テキストは後からデザイン プログラムに追加されました。誤差はゼロに減少し、ポスターは印刷に適したものになりました。
ケース 3 — 比率の損失。ソーシャル メディアの専門家が Instagram ストーリー用に 1:1 の正方形の画像を作成しました。 9:16 縦の部分に入れたら上下が切れて肝心な要素が失われてしまいました。プロンプトでアスペクト比を「9:16 垂直」と指定すると、画像はその形式に適合し、再作成する必要はありませんでした。
コピー可能なテンプレート
1) 6 つのコンポーネントからなる製品イメージのスケルトン:
[件名: 製品の説明] 、[コンテキスト: 場所/方法] スタイル: [例:プレミアム製品写真、リアル] 。構成: [例:中央に製品、上部にテキスト用のスペース]。光と色: [例:柔らかい自然光、アースカラー] 。テクニック: [アスペクト比、高解像度、無地の背景] 。注: 画像内に判読可能なテキスト/ロゴはありません。後ほど本文を追加させていただきます。
2) イラストのスケルトン:
件名: [何を描くか]。スタイル: [例:フラット カラー ベクトル イラスト / 水彩 / アイソメトリック 3D] 。カラー パレット: [2-3 原色] 。気分: [例:明るい、穏やか、真面目] .背景:[無地 / 柄 / 透明] .比率:[1:1 / 9:16 / 16:9] .
3) スタイルの探求 (同じ主題、異なる美学):
同じ構成で次の主題を 4 つの異なる視覚スタイルで説明します: ミニマルなフラット ベクター、リアルな写真、水彩画、アイソメトリック 3D。それぞれに 1 行のプロンプトを作成します。件名: [貼り付け]
4) 否定的な説明を追加する:
次のプロンプトを改善し、最後に不要なプロンプトを追加します。「テキストなし、透かしなし、乱雑な背景なし、悪い手/指なし、多すぎるオブジェクトなし」。プロンプト: [貼り付け]
弱いプロンプト / 強いプロンプト
弱:美しいコーヒーの写真
結果: ランダムな角度、不明瞭なスタイル、ブランドに適合しない付随的な画像。
パワフル: 温かいラテが入ったセラミック カップ。軽い木のテーブルの上に横向きに置かれ、柔らかな朝の光が差し込んでいます。最小限のプレミアム製品写真。温かみのあるニュートラルトーン。クローズアップ、右上にテキスト用のスペース。 1:1 の正方形、無地の背景。判読可能なテキストがあってはなりません。
その結果、構成、光、プロポーションが制御された、ブランドに適応したスケッチが完成しました。
違い: 強力なプロンプトは 6 つの構成要素 (主題、文脈、スタイル、構成、照明、テクニック) を明確に満たし、テキストを省略します。
プロンプトコンポーネントとエフェクトテーブル
コンポーネント
例
結果への影響
件名
「ガラス瓶に入ったオリーブオイル」
何が現れるかを決める
スタイル
「プレミアム商品写真」
視覚言語を最も決定する要素
構成
「中央にテキストスペースあり」
使いやすさの向上
光/色
「柔らかな光、アースカラー」
ブランド感を伝える
アスペクト比
「9:16 垂直」
フォーマットに準拠することができます
否定的な説明
「テキストがありません」
欠陥を減らす
よくある間違い
- スタイルを指定しない: 最も決定的なコンポーネントを省略すると、結果は決まりきったランダムなものになります。
- AI にテキストを描画させる: 壊れた、読めない文字。後からデザイン プログラムにテキストを追加します。
- 比率を忘れる: アスペクト比が間違っていると、文書内でクリッピングや要素の損失が発生します。
- オーバーロードされたプロンプト: 20 個の概念を積み重ねるとモデルが混乱します。明確にして優先順位を付けてください。
- 一度で諦める: 拡散はランダムです。いくつかのバリエーションを作成し、最適なものを選択するのが通常です。
要約すると
画像生成 AI は、ランダムなノイズからプロンプトに合わせて画像を徐々に構築します。頭の中の絵を読み取ることはできず、ただ書かれたものを解釈するだけです。優れたプロンプトは、主題、文脈、スタイル、構成、光/色、テクニックの 6 つの要素で構成されます。スタイルは最も決定的な要素です。必ずアスペクト比を指定してください。読みやすいテキストは AI に任せるのではなく、後から追加します。明確さが増すにつれて、試行回数と時間のロスが減少します。
アプリケーションタスク
製品またはトピックを選択してください。まず、それを 1 つの文 (「素敵な X」) で書き、画像ジェネレーターで試して結果を確認します。次に、6 つの構成要素のスケルトンを埋め、アスペクト比と否定的な説明を追加して、同じ主題を再度説明します。 2 つの結果を並べて、明確さによって出力がどのように変化するかを 3 つの箇条書きで書きます。
チェックリスト
- [ ] 私はプロンプトで主題、文脈、スタイルを明確に述べました。
- [ ] 構図と光/色のコンポーネントを追加しました。
- [ ] アスペクト比(1:1 / 9:16 / 16:9)を指定しました。
- [ ] AI に読みやすいテキストを描画させず、後回しにしました。
- [ ] 否定的な説明で望ましくないものを除外しました。
- [ ] 私は単一の実験を信頼せず、いくつかのバリエーションを作成しました。