Enhet 3 / 11

Fotografisk visuell produktion och snabb anatomi: Hur fungerar diffusion?

Vinster:

  • Förstå hur bildgenererande artificiell intelligens (diffusion) fungerar och vilka receptkomponenter som krävs för fotografisk realism
  • Förmåga att skriva en stark fotografisk prompt bestående av motiv, ljus, lins/kamera, komposition, atmosfär och tekniska komponenter.
  • Förmåga att särskilja skillnaden mellan en producerad bild och ett fotografi som tagits, gränserna för användning och vikten av äkthetsförsäkran

En fotograf använder generativ visuell AI för tre legitima syften: att producera utkast till referenser för moodboards och koncept, för att skapa element som kompletterar själva bilden (bakgrund, textur, sammansatt del) och för att skapa färdigproducerade bilder (till exempel för en lagerförsäljning eller reklamkoncept). I den här enheten kommer vi att lära oss hur dessa verktyg fungerar och hur man skriver uppmaningar för fotografisk realism. Målet är inte att vänta på ett snyggt skott av en slump; Det innebär att beskriva vad du vill på en fotografs språk och regissera resultatet.

Diffusion: hur producerar modellen "fotografier"?

De flesta av dagens bildgenererande AI:er arbetar med en metod som kallas diffusion. Helt enkelt: modellen har lärt sig att gå "från brus till meningsfull bild" på miljontals bilder. Det utgår från slumpmässigt brus under produktionen (som en snöig skärmdump) och skapar en bild genom att gradvis rensa bruset så att det passar din text (prompt). Två grundläggande fakta framgår av detta:

För det första kan modellen inte producera det som inte beskrivs. Om du inte säger ljuset kommer ett slumpmässigt ljus; Om du inte överväger den objektiva synen, kommer "känslan av fotografi" att förbli en slump. För det andra, modellen förstår inte, förutspår den. Det är därför han gör misstag (hallucinationer) på platser som kräver logik, som händer, text, reflektion, symmetri. Om du vill ha fotografisk realism måste du tydligt beskriva de tekniska besluten – ljus, lins, komposition – som gör ett fotografi till ett fotografi.

Varning: Även om en genererad bild kan se "fotoliknande ut", är det inte ett foto; den dokumenterar inte ett verkligt ögonblick. Att använda det i en nyhetsartikel, dokumentär eller ett sammanhang där man hävdar att "det här verkligen hände" är missvisande och bryter mot den etiska gränsen, som vi kommer att ta upp i del 9.

Fotografisk snabb anatomi

En kraftfull fotografisk prompt består av sex komponenter. Tänk på dessa som att planera en fotografering:

  1. Ämne: Vad/vem? Ålder, kläder, uttryck, handling, antal. ("en medelålders snickare, i ett förkläde, arbetar vid arbetsbänken")
  2. Ljus: Riktning, hårdhet, källa, tid. Det är hjärtat av fotografi. ("mjukt sidofönsterljus, morgon, låg kontrast")
  3. Objektiv och kameravy: Brännvidd, skärpedjup, vinkel. ("85 mm porträttlinskänsla, grunt skärpedjup, mjuk bakgrundsbokeh, ögonhöjd")
  4. Komposition: Inramning, placering, inramning. ("närbild, tredjedelsregel, ämne till vänster")
  5. Atmosfär och färg: Ton, humör, palett. ("varma jordtoner, lugn, nostalgisk")
  6. Teknik/kvalitet: Textur, noter av realism, bildförhållande. ("naturlig hudstruktur, filmkorn, 3:2-förhållande")

När du introducerar dessa komponenter i sekvens ger modellen ett mycket mer kontrollerat, "fotografiskt" resultat. Alla komponenter du utelämnar lämnas åt slumpen.

Tips: Låt inte AI rita texten/logotypen. Diffusionsmodeller kan inte på ett tillförlitligt sätt producera läsbar text och proprietära logotyper; lägga till dem i själva designfasen. I en bild som kräver läsbar text, använd AI endast för bakgrunden/atmosfären.

Bildförhållande och avsedd användning

Bildförhållande är bredd-till-höjd-förhållandet för bilden och bestämmer dess användning: 9:16 för en vertikal berättelse på sociala medier, 3:2 för standardtryck, 1:1 för ett fyrkantigt inlägg, 16:9 för en bred banner. Det är bättre att ange förhållandet i prompten från början än att trimma det senare och förlora kvalitet. Välj upplösning och förhållande redan från början, med kunskap om den avsedda användningen (utskrift eller display).

Negativt recept och variation

De flesta verktyg har också en negativ prompt: ett område där du skriver saker du inte vill ha i bilden ("deformerad hand, extra fingrar, text, vattenstämpel, plastbindning"). Detta minskar men förhindrar inte helt vanliga defekter; verifiering är fortfarande viktigt. Det finns också begreppet frö — fröet av slumpmässighet från vilket produktionen börjar; Samma frö och prompt ger ett liknande resultat igen, vilket hjälper dig att skapa en konsekvent uppsättning (vi kommer att gå in på djupare i den 4:e enheten).

tre minifodral

Fall 1 – Receptets kraft. En stockfotograf skrev "kvinna dricker kaffe" och fick dystra resultat. När Prompta lade till ljus (sidofönsterljus), lins (50 mm, grunt skärpedjup), atmosfär (varm, lugn morgon) och textur (naturlig hud) blev resultatet användbart. Acceptabel bildgenereringshastighet ökade från cirka 1/20 till 1/4; Produktionstiden minskade med en tredjedel.

Fall 2 — Förlust av hallucinationer. En designer-fotograf satte en bild av "affärsmän som skakar hand" i en presentation utan att kontrollera den. På mötet uppmärksammades att en chef hade tre händer. Defekten som förbises på den lilla duken förstorades i projektionen. En 30-sekunders hand-/fingerskanning skulle ha förhindrat denna pinsamhet.

Fall 3 — Att välja rätt verktyg. En produktfotograf ville placera en riktig klocka han fotat i en annan miljö. Istället för att producera den från grunden behöll den den riktiga produktramen, bara bakgrunden/atmosfären producerades med AI och gjordes komposit. De faktiska detaljerna för produkten (märke, urtavla) var alltså inte förvrängda; både trovärdighet och noggrannhet bevarades.

Kopierbara mallar

1) Fotografiskt promptskelett:

[ämne: vem/vad, ålder, kläder, uttryck, handling],[ljus: riktning, hårdhet, källa, tid],[objektiv/kamera: känsla för brännvidd, skärpedjup, vinkel],[komposition: inramning, placering, konvention],[atmosfär/färg: ton, humör, palett],[teknik: naturlig struktur, realistiskt bildförhållande], korn, bildformat, bildformat Lägg till text/logotyp.

2) Negativt promptutkast:

Negativ (vad jag inte vill ha): missbildad hand, extra/saknade fingrar, krokigt ansikte, plast/vaxliknande hud, oläsbar text, vattenstämpel, repeterande textur, omöjlig skugga, övermättad färg.

3) För moodboard-referens (riktning, inte leverans):

Syfte: moodboardreferens för en fotografering (inte leveransen). Koncept: [koncept]. Beskriv det estetiska med endast attribut: ljus [..], färgpalett [..], atmosfär [..], komposition [..]. Använd inga namn på personer/varumärken/fotografer. Skapa 4 varianter.

4) Sammansatt plan som skyddar den verkliga produkten:

Jag har en riktig produktbild; Produkten i sig kommer inte att förändras. Skriv uppmaningen för att bilden ska produceras endast för bakgrund/atmosfär: [ljus, yta, färg, miljö]. Produktens skuggriktning och ljushårdhet bör vara [..] så att kompositen är övertygande.

Svag prompt / Stark prompt

Svag: "Snyggt porträttfoto."

Stark: "Medelålders bondkvinna, solsliten ansikte, lätt leende, i ett vetefält; gyllene timmesljus från sidan, låg kontrast; 85 mm porträttvy, grunt skärpedjup, bakgrund mjuk; närbild, motiv vänster, tredjedelsregel; varma jordtoner, lugn och värdig stämning; äkta hudtextur, 3 textur, äkta film.."

Den svaga viljan lämnas helt åt slumpen; Eftersom stark efterfrågan beskriver ljuset, linsen, kompositionen och atmosfären, ökar det avsevärt sannolikheten för att producera det önskade resultatet.

Vanliga misstag

  • Beskriver inte ljuset och linsen. Dessa två är till stor del det som gör ett fotografi till ett fotografi; Om du lämnar det tomt lämnas resultatet åt slumpen.
  • Att låta AI rita läsbar text/logotyp. Modellen kan inte producera dessa på ett tillförlitligt sätt; Det kan visa sig vara defekt och upphovsrättsskyddat.
  • Presentera den producerade bilden som ett "fotografi". Det är missvisande i dokumentär/nyhetssammanhang; En faktaförklaring krävs.
  • Kopieringsstil med person/varumärke. Imitation och upphovsrättsrisk; Beskriv estetik med kvaliteter.
  • Hoppa över verifiering. Händer, ögon, reflektioner, skuggor och återkommande texturer måste kontrolleras i varje producerad bild.

Sammanfattningsvis

Generativ visuell AI fungerar genom diffusion: den går från brus till bild som passar texten, kan inte producera det som inte beskrivs och felar där logik krävs. För fotografisk realism, beskriv motiv, ljus, lins, komposition, atmosfär och teknik som en fotograf. Välj bildförhållande enligt syftet, minska artefakten med negativt recept, låt inte AI:en rita texten och verifiera varje utdata. Använd aldrig en producerad bild som påstår sig vara en "fotograferad".

Applikationsuppgift

Välj ett koncept och skriv en fotografisk prompt, fyll i alla sex komponenterna med mall 1. Producera (eller beskriv) samma koncept först i en enda mening, till exempel "ett vackert foto", sedan med hela skelettet, och jämför de två resultaten. Markera minst tre möjliga felpunkter i bilden du producerar genom att förstora händer, ögon, reflektioner och skuggor.

checklista

  • [ ] I prompten beskrev jag ämne, ljus, lins, komposition, atmosfär och teknik separat.
  • [ ] Jag bestämde bildförhållandet enligt den avsedda användningen.
  • [ ] Jag minskade de vanliga defekterna med det negativa receptet.
  • [ ] Jag hade inte den läsbara texten/logotypen för AI-draw.
  • [ ] Jag såg till att jag inte presenterade den genererade bilden som ett "foto".
  • [ ] Jag verifierade resultatet för hand/öga/reflektion/skugga.