利益:
- 画像生成人工知能 (拡散) がどのように機能するか、また写真のリアリズムにはどのようなレシピ コンポーネントが必要かを理解する
- 被写体、光、レンズ/カメラ、構図、雰囲気、技術的要素から構成される強力な写真プロンプトを作成する能力。
- 作成された画像と撮影された写真の違い、使用の制限、および真正性の宣言の重要性を区別する能力
写真家は、次の 3 つの正当な目的で生成ビジュアル AI を使用します。それは、ムードボードとコンセプトのドラフト参照を作成すること、実際のショットを補完する要素 (背景、テクスチャ、合成作品) を作成すること、そして完全に制作された画像を作成すること (在庫販売や広告コンセプトなど) です。この単元では、これらのツールがどのように機能するか、また写真のようにリアルなプロンプトを作成する方法を学びます。目標は、偶然のナイスショットを待つことではありません。それは、あなたが望むものを写真家の言葉で説明し、結果を演出することを意味します。
拡散: モデルはどのようにして「写真」を生成するのでしょうか?
今日の画像生成 AI のほとんどは、拡散と呼ばれる方法で動作します。簡単に言えば、モデルは何百万もの画像で「ノイズから意味のある画像へ」移行することを学習しました。制作中のランダムなノイズ (雪のスクリーンショットなど) から始まり、テキスト (プロンプト) に合わせて徐々にノイズを除去して画像を作成します。このことから、次の 2 つの基本的な事実がわかります。
まず、モデルは記述されていないものを生み出すことはできません。あなたが光を言わなければ、ランダムな光がやって来ます。客観的な視点を考慮しないと「写真感」は偶然にとどまってしまいます。第二に、モデルは理解するのではなく、予測するだけです。そのため、手、文字、反射、対称性など、ロジックが必要な場所で間違い(幻覚)を起こします。写真のリアリズムを求める場合は、写真を写真たらしめている技術的な決定 (光、レンズ、構図) を明確に説明する必要があります。
注意: 生成された画像は「写真のように」見える場合がありますが、写真ではありません。実際の瞬間を記録したものではありません。 「これは実際に起こった」と主張するニュース記事、ドキュメンタリー、または文脈でこれを使用することは誤解を招き、倫理的境界に違反します。これについてはユニット 9 で説明します。
写真によるプロンプト解剖学
強力な写真プロンプトは 6 つのコンポーネントで構成されます。これらを撮影を計画するのと同じように考えてください。
- 件名: 何を/誰?年齢、服装、表情、動作、数。 (「エプロンを着て作業台で働く中年大工」)
- 光: 方向、硬さ、光源、時間。それは写真の心臓部です。 (「サイドウィンドウの柔らかな光、朝、コントラストが低い」)
- レンズとカメラのビュー: 焦点距離、被写界深度、角度。 (「85mmポートレートレンズの感触、浅い被写界深度、柔らかな背景ボケ、アイレベル」)
- 構成:フレーミング、配置、フレーミング。 (「クローズアップ、三分割法、被写体は左側」)
- 雰囲気と色: トーン、気分、パレット。 (「暖かいアースカラー、穏やか、懐かしい」)
- 技術/品質: テクスチャ、リアリズムのメモ、アスペクト比。 (「自然な肌の質感、フィルムグレイン、3:2 比率」)
これらのコンポーネントを順番に導入すると、モデルはより制御された「写真のような」結果を生成します。省略したコンポーネントは偶然に任せられます。
ヒント: AI にテキスト/ロゴを描画させないでください。拡散モデルでは、読みやすいテキストや独自のロゴを確実に生成することはできません。実際の設計段階で追加してください。また、読みやすい文字が必要な画像では、背景・雰囲気のみAIを活用します。
アスペクト比と用途
アスペクト比は画像の幅と高さの比率であり、その用途を決定します。ソーシャルメディアの縦型ストーリーの場合は 9:16、標準的な印刷の場合は 3:2、正方形の投稿の場合は 1:1、ワイドバナーの場合は 16:9 です。後でトリミングして品質を損なうよりも、最初からプロンプトで比率を指定する方が良いでしょう。使用目的 (印刷または表示) を理解した上で、最初から解像度と比率を選択します。
ネガティブレシピとバリエーション
ほとんどのツールには、画像に入れたくないもの (「変形した手、余分な指、テキスト、透かし、プラスチックの結合」) を書き込む領域という否定的なプロンプトもあります。これにより、一般的な欠陥は軽減されますが、完全に防止できるわけではありません。やはり検証は欠かせません。シードという概念もあります。つまり、生産が始まるランダム性のシードです。同じシードとプロンプトによって再び同様の結果が生成されるため、一貫したセットを作成するのに役立ちます (4 番目の単元でさらに詳しく説明します)。
ミニケース3個
ケース 1 — レシピの力。あるストックフォトグラファーが「コーヒーを飲む女性」と書いたが、悲惨な結果となった。 Prompta が光 (側窓の光)、レンズ (50mm、被写界深度が浅い)、雰囲気 (暖かく穏やかな朝)、テクスチャ (自然な肌) を追加すると、結果は使用できるようになりました。許容可能なフレーム生成レートが約 1/20 から 1/4 に増加しました。生産時間は 3 分の 1 に短縮されました。
ケース 2 — 幻覚による喪失。デザイナー兼写真家が「握手するビジネスマン」の画像を確認もせずにプレゼンテーションに入れてしまった。会議では、マネージャーが 3 本の手を持っていることに気づきました。小さな画面では見落とされていた欠陥が、投影では拡大されてしまいました。 30 秒ほど手/指をスキャンすれば、このような当惑は避けられたでしょう。
ケース 3 — 適切なツールの選択。製品写真家は、撮影した本物の時計を別の環境に置きたいと考えていました。一から制作するのではなく、実際の商品フレームをそのままに、背景・雰囲気のみをAIで制作し合成した。したがって、製品の実際の詳細 (ブランド、文字盤) は歪んでいません。信頼性と正確性の両方が保たれました。
コピー可能なテンプレート
1) 写真のプロンプト スケルトン:
[被写体: 誰/何を、年齢、服装、表現、動作]、[光: 方向、厳しさ、光源、時間]、[レンズ/カメラ: 焦点距離の感覚、被写界深度、角度]、[構図: フレーミング、配置、慣例]、[雰囲気/色: トーン、雰囲気、パレット]、[技術: 自然な質感、木目、アスペクト比]。写真的、写実的。テキスト/ロゴを追加します。
2) ネガティブプロンプトドラフト:
マイナス (望まないもの): 奇形の手、余分な指や欠落した指、曲がった顔、プラスチックやワックスのような肌、読めないテキスト、透かし、繰り返しのテクスチャ、不可能な影、過飽和な色。
3) ムードボードの参照用 (納品ではなく指示):
目的: 撮影のムードボード参考 (成果物ではありません)。コンセプト: [コンセプト]。属性のみを使用して美学を説明します: ライト [..]、カラー パレット [..]、雰囲気 [..]、構成 [..]。個人名、ブランド名、写真家の名前は使用しないでください。 4つのバリエーションを生成します。
4) 実際の製品を保護する複合計画:
本物の[製品]ショットがあります。商品自体は変わりません。背景/雰囲気のみに生成される画像のプロンプトを作成します: [光、表面、色、環境]。納得のいく合成ができるように、製品の影の方向と光の硬さは [..] である必要があります。
弱いプロンプト / 強いプロンプト
弱者:「素敵なポートレート写真ですね。」
強い: 「中年農場の女性、日に焼けた顔、わずかな笑顔、小麦畑。ゴールデンアワーの横からの光、低コントラスト。85 mm のポートレート ビュー、浅い被写界深度、背景は柔らかい。クローズ アップ、被写体は左、三分割法。暖かいアース トーン、穏やかで威厳のある雰囲気。自然な肌の質感、明るいフィルム粒子、3:2。写真的で写実的。テキストを追加。」
弱い意志は完全に偶然に任せられます。強い要求は光、レンズ、構図、雰囲気を記述するため、望ましい結果が得られる可能性が大幅に高まります。
よくある間違い
- ライトやレンズについては説明しておりません。写真を写真たらしめているのは主にこの 2 つです。空白のままにすると、結果は運任せになります。
- AIに読みやすい文字・ロゴを描画させる。モデルはこれらを確実に生成できません。欠陥があり、著作権で保護されていることが判明する可能性があります。
- 制作したイメージを「写真」として発表します。ドキュメンタリーやニュースの文脈では誤解を招きます。事実の陳述が必要です。
- 人物名やブランド名を使ったスタイルのコピー。模倣および著作権のリスク。美学を品質で説明します。
- 検証をスキップします。作成されたすべての画像で、手、目、反射、影、および繰り返しのテクスチャをチェックする必要があります。
要約すると
生成ビジュアル AI は拡散によって機能します。ノイズからテキストに適合する画像に変換され、記述されていないものは生成できず、ロジックが必要な場合にはエラーが発生します。写真のリアリズムについては、被写体、光、レンズ、構図、雰囲気、テクニックを写真家のように説明します。目的に応じてアスペクト比を選択し、ネガティブレシピでアーティファクトを軽減し、AIにテキストを描画させず、それぞれの出力を検証します。 「撮影した写真」と称して制作された画像は絶対に使用しないでください。
アプリケーションタスク
コンセプトを選択し、テンプレート 1 で 6 つのコンポーネントすべてを入力して写真のプロンプトを作成します。最初に「美しい写真」などの 1 つの文で同じコンセプトを作成 (または説明) し、次に完全な骨格を使用して、2 つの結果を比較します。手、目、反射、影を拡大して、作成した画像内に欠陥の可能性がある箇所を少なくとも 3 つマークします。
チェックリスト
- [ ] プロンプトでは、被写体、光、レンズ、構図、雰囲気、テクニックを個別に説明しました。
- [ ] 用途に合わせてアスペクト比を決めました。
- [ ] ネガティブレシピでよくある不具合を軽減しました。
- [ ] AI 描画の読み取り可能なテキスト/ロゴがありませんでした。
- [ ] 生成された画像を「写真」として提示しないようにしました。
- [ ] 手/目/反射/影の出力を検証しました。