단위 3 / 11

사진 시각적 제작 및 즉각적인 해부학: 확산은 어떻게 작동합니까?

이득:

  • 이미지 생성 인공 지능(확산)이 작동하는 방식과 사진적 사실성을 위해 필요한 레시피 구성 요소 이해
  • 피사체, 빛, 렌즈/카메라, 구도, 분위기 및 기술적 구성 요소로 구성된 강력한 사진 프롬프트를 작성하는 능력.
  • 제작된 이미지와 촬영된 사진의 차이, 사용의 한계, 진품 선언의 중요성을 구별하는 능력

사진작가는 무드보드 및 컨셉에 대한 초안 참조 생성, 실제 사진을 보완하는 요소(배경, 질감, 합성 작품) 생성, 완전히 생성된 이미지 생성(예: 재고 판매 또는 광고 컨셉)이라는 세 가지 합법적인 목적으로 생성적 시각적 AI를 사용합니다. 이번 단원에서는 이러한 도구의 작동 방식과 사진적 사실성을 위한 프롬프트 작성 방법을 학습합니다. 목표는 우연히 멋진 샷이 나올 때까지 기다리는 것이 아닙니다. 자신이 원하는 것을 사진가의 언어로 기술하고 그 결과를 연출하는 것을 의미합니다.

확산: 모델은 어떻게 "사진"을 생성합니까?

오늘날 이미지 생성 AI의 대부분은 확산이라는 방법으로 작동합니다. 간단히 말해서, 모델은 수백만 개의 이미지에 대해 "노이즈에서 의미 있는 이미지로" 이동하는 방법을 학습했습니다. 제작 중 무작위 노이즈(눈 덮인 스크린샷 등)에서 시작하여 점차적으로 텍스트에 맞게 노이즈를 정리하여 이미지를 생성합니다(프롬프트). 이로부터 두 가지 기본 사실이 드러납니다.

첫째, 모델은 설명되지 않은 것을 생산할 수 없습니다. 빛을 말하지 않으면 임의의 빛이 올 것입니다. 객관적인 시각을 고려하지 않는다면 '사진의 느낌'은 ​​우연으로 남을 것입니다. 둘째, 모델은 이해하지 못하고 예측합니다. 그렇기 때문에 그는 손, 문자, 반사, 대칭 등 논리가 필요한 곳에서 실수(환각)를 저지릅니다. 사진적 사실성을 원한다면 사진을 사진으로 만드는 기술적인 결정(빛, 렌즈, 구도)을 명확하게 설명해야 합니다.

주의: 생성된 이미지는 "사진처럼" 보일 수 있지만 사진은 아닙니다. 실제 순간을 기록하지 않습니다. 뉴스 기사, 다큐멘터리 또는 맥락에서 "이런 일이 실제로 일어났다"고 주장하는 것은 오해의 소지가 있으며 윤리적 경계를 위반하는 것입니다. 이에 대해서는 9단원에서 다룰 것입니다.

사진 프롬프트 해부학

강력한 사진 프롬프트는 6가지 구성 요소로 구성됩니다. 촬영 계획을 세우는 것처럼 다음을 생각해 보세요.

  1. 제목: 무엇/누구? 나이, 의복, 표정, 행동, 숫자. ("앞치마를 두른 중년 목수가 작업대에서 일하고 있습니다")
  2. 빛: 방향, 경도, 광원, 시간. 사진의 핵심입니다. ("부드러운 측면 창문 조명, 아침, 낮은 대비")
  3. 렌즈 및 카메라 보기: 초점 거리, 피사계 심도, 각도. ("85mm 인물 렌즈 느낌, 얕은 피사계 심도, 부드러운 배경 보케, 눈높이")
  4. 구성: 프레이밍, 배치, 프레이밍. ("클로즈업, 삼등분의 법칙, 왼쪽에 피사체")
  5. 분위기와 색상: 톤, 무드, 팔레트. ("따뜻한 흙색, 차분함, 향수를 불러일으키는")
  6. 기술/품질: 질감, 사실주의 노트, 화면 비율. ("자연스러운 피부결, 필름그레인, 3:2 비율")

이러한 구성 요소를 순서대로 도입하면 모델이 훨씬 더 제어된 "사진" 결과를 생성합니다. 생략한 구성 요소는 우연에 맡깁니다.

팁: AI가 텍스트/로고를 그리도록 하지 마세요. 확산 모델은 읽을 수 있는 텍스트와 독점 로고를 안정적으로 생성할 수 없습니다. 실제 설계 단계에 추가하세요. 또한 읽을 수 있는 텍스트가 필요한 이미지에서는 배경/분위기에만 AI를 사용하세요.

종횡비 및 용도

종횡비는 이미지의 너비 대 높이 비율이며 용도를 결정합니다. 소셜 미디어 세로 스토리의 경우 9:16, 표준 인쇄의 경우 3:2, 정사각형 게시물의 경우 1:1, 와이드 배너의 경우 16:9입니다. 나중에 잘라서 품질이 떨어지는 것보다 처음부터 프롬프트에서 비율을 지정하는 것이 좋습니다. 용도(인쇄 또는 디스플레이)를 파악하고 처음부터 해상도와 비율을 선택하십시오.

네거티브 레시피 및 변형

대부분의 도구에는 이미지에 원하지 않는 내용을 쓰는 영역("변형된 손, 여분의 손가락, 텍스트, 워터마크, 플라스틱 제본")이라는 부정적인 프롬프트도 있습니다. 이는 일반적인 결함을 줄이기는 하지만 완전히 예방하지는 않습니다. 검증은 여전히 ​​필수입니다. 생산이 시작되는 무작위성의 씨앗인 씨앗이라는 개념도 있습니다. 동일한 시드와 프롬프트는 다시 유사한 결과를 생성하므로 일관된 세트를 만드는 데 도움이 됩니다(4번째 단원에서 더 자세히 설명하겠습니다).

세 개의 미니 케이스

사례 1 — 레시피의 힘. 한 스톡 사진작가가 "커피를 마시는 여자"라고 썼는데 결과가 좋지 않았습니다. Prompta가 빛(측면창 조명), 렌즈(50mm, 얕은 피사계 심도), 분위기(따뜻하고 차분한 아침), 질감(자연스러운 피부)을 추가하면 사용할 수 있는 결과가 탄생했습니다. 허용되는 프레임 생성 속도가 약 1/20에서 1/4로 증가했습니다. 생산 시간이 3분의 1로 단축되었습니다.

사례 2 - 환각으로 인한 상실. 디자이너 겸 사진작가는 '악수하는 사업가'의 이미지를 확인도 없이 프리젠테이션에 넣었습니다. 회의에서 관리자의 손이 세 개라는 사실이 밝혀졌습니다. 작은 화면에서 간과되었던 결점이 프로젝션에서는 확대됐다. 30초 동안 손/손가락을 스캔했다면 이러한 당혹감을 방지할 수 있었을 것입니다.

사례 3 - 올바른 도구 선택. 제품 사진작가는 자신이 촬영한 실제 시계를 다른 환경에서 촬영하고 싶었습니다. 처음부터 제작하는 대신 실제 제품 프레임은 그대로 유지하고, 배경/분위기만 AI로 제작하여 합성하였습니다. 따라서 제품의 실제 디테일(브랜드, 다이얼)이 왜곡되지 않았습니다. 신뢰성과 정확성이 모두 유지되었습니다.

복사 가능한 템플릿

1) 사진 프롬프트 해골:

[주체: 누구/무엇, 나이, 의복, 표현, 동작],[빛: 방향, 거칠기, 소스, 시간],[렌즈/카메라: 초점 거리 감각, 피사계 심도, 각도],[구도: 프레이밍, 배치, 관례],[분위기/색상: 톤, 무드, 팔레트],[기술: 자연스러운 질감, 결, 화면 비율].사진적, 사실적. 텍스트/로고를 추가합니다.

2) 부정적인 프롬프트 초안:

단점(원하지 않는 점): 기형의 손, 여분의/빠진 손가락, 구부러진 얼굴, 플라스틱/밀랍 같은 피부, 읽을 수 없는 텍스트, 워터마크, 반복되는 질감, 불가능한 그림자, 과포화 색상.

3) 무드보드 참고용(전달이 아닌 방향):

목적: 촬영에 대한 무드보드 참조(제공물 아님).개념: [개념]. 빛 [..], 색상 팔레트 [..], 분위기 [..], 구성 [..] 등의 속성만으로 미학을 설명합니다. 사람/브랜드/사진작가 이름을 사용하지 마세요. 4가지 변형을 생성합니다.

4) 실제 제품을 보호하는 복합 계획:

실제 [제품] 사진이 있습니다. 제품 자체는 변경되지 않습니다. 배경/분위기에 대해서만 생성할 이미지에 대한 프롬프트를 작성합니다: [빛, 표면, 색상, 환경]. 제품의 그림자 방향과 빛의 경도가 [..]이어야 합성이 설득력이 있습니다.

약한 프롬프트 / 강한 프롬프트

약함: "멋진 인물 사진입니다."

Strong: "중년의 농장 여성, 햇볕에 지친 얼굴, 밀밭 속의 약간의 미소; 황금시간대 측면의 빛, 낮은 대비; 85mm 세로 보기, 얕은 피사계 심도, 부드러운 배경; 클로즈업, 왼쪽 피사체, 3분의 1 규칙; 따뜻한 흙색, 조용하고 위엄 있는 분위기, 자연스러운 피부 질감, 가벼운 필름 그레인, 3:2. 사진적, 사실적. 텍스트 추가."

의지가 약한 사람은 전적으로 우연에 맡깁니다. 강한 수요는 빛, 렌즈, 구성 및 분위기를 설명하므로 원하는 결과를 얻을 확률이 크게 높아집니다.

일반적인 실수

  • 빛과 렌즈를 설명하지 않습니다. 이 두 가지는 주로 사진을 사진답게 만드는 요소입니다. 공백으로 두면 결과는 운에 맡깁니다.
  • AI가 읽을 수 있는 텍스트/로고를 그리도록 합니다. 모델은 이를 안정적으로 생성할 수 없습니다. 결함이 있고 저작권이 있는 것으로 판명될 수 있습니다.
  • 제작된 이미지를 '사진'으로 표현합니다. 다큐멘터리/뉴스 맥락에서는 오해의 소지가 있습니다. 사실 진술이 필요합니다.
  • 사람/브랜드 이름으로 스타일을 복사합니다. 모방 및 저작권 위험; 특성을 갖춘 미학을 설명합니다.
  • 확인을 건너뛰는 중입니다. 생성된 모든 이미지에서 손, 눈, 반사, 그림자 및 반복되는 질감을 확인해야 합니다.

요약하면

생성적 시각적 AI는 확산 방식으로 작동합니다. 노이즈에서 텍스트에 맞는 이미지로 이동하고 설명되지 않은 것을 생성할 수 없으며 논리가 필요한 부분에서 오류가 발생합니다. 사진적 리얼리즘을 위해서는 사진작가처럼 피사체, 빛, 렌즈, 구도, 분위기, 기법 등을 묘사하세요. 목적에 맞게 종횡비를 선택하고, 네거티브 레시피로 아티팩트를 줄이고, AI가 텍스트를 그리게 하지 않고 각각의 출력을 검증합니다. "촬영한 사진"이라고 주장하는 제작된 이미지를 절대 사용하지 마세요.

응용과제

컨셉을 선택하고 사진 프롬프트를 작성하고 템플릿 1로 여섯 가지 구성 요소를 모두 채웁니다. 먼저 "아름다운 사진"과 같은 단일 문장으로 동일한 컨셉을 생성(또는 설명)한 다음 전체 골격을 사용하여 두 결과를 비교합니다. 손, 눈, 반사 및 그림자를 확대하여 생성된 이미지에 가능한 결함 지점을 세 개 이상 표시하십시오.

체크리스트

  • [ ] 프롬프트에서는 피사체, 빛, 렌즈, 구도, 분위기, 기법을 별도로 설명했습니다.
  • [ ] 용도에 맞게 화면비율을 결정했습니다.
  • [ ] 네거티브 레시피로 일반적인 결점을 줄였습니다.
  • [ ] AI가 읽을 수 있는 텍스트/로고를 그릴 수 없었습니다.
  • [ ] 생성된 이미지를 "사진"으로 제시하지 않았는지 확인했습니다.
  • [ ] 손/눈/반사/그림자 출력을 확인했습니다.