Gevinster:
- Forstå hvordan bildegenererende kunstig intelligens (diffusjon) fungerer og hvilke oppskriftskomponenter som kreves for fotografisk realisme
- Evne til å skrive en sterk fotografisk prompt bestående av motiv, lys, linse/kamera, komposisjon, atmosfære og tekniske komponenter.
- Evne til å skille forskjellen mellom et produsert bilde og et fotografi tatt, grensene for bruk og viktigheten av erklæringen om autentisitet
En fotograf bruker generativ visuell AI for tre legitime formål: å produsere utkast til referanser for moodboards og konsepter, å lage elementer som utfyller det faktiske bildet (bakgrunn, tekstur, sammensatt stykke), og å lage ferdigproduserte bilder (for eksempel for et lagersalg eller reklamekonsept). I denne enheten vil vi lære hvordan disse verktøyene fungerer og hvordan du skriver spørsmål for fotografisk realisme. Målet er ikke å vente på et fint skudd ved en tilfeldighet; Det betyr å beskrive hva du vil på en fotografs språk og regissere resultatet.
Diffusjon: hvordan produserer modellen "fotografier"?
De fleste av dagens bildegenererende AI-er jobber med en metode som kalles diffusjon. Enkelt: Modellen har lært å gå «fra støy til meningsfylt bilde» på millioner av bilder. Den starter fra tilfeldig støy under produksjon (som et snødekt skjermbilde) og skaper et bilde ved å gradvis rense støyen slik at den passer til teksten din (spørsmål). To grunnleggende fakta kommer ut av dette:
For det første kan ikke modellen produsere det som ikke er beskrevet. Hvis du ikke sier lyset, kommer et tilfeldig lys; Hvis du ikke vurderer det objektive synet, vil "følelsen av fotografering" forbli en tilfeldighet. For det andre forstår ikke modellen, spår den. Det er derfor han gjør feil (hallusinasjoner) på steder som krever logikk, som hender, tekst, refleksjon, symmetri. Hvis du vil ha fotografisk realisme, må du tydelig beskrive de tekniske avgjørelsene – lys, linse, komposisjon – som gjør et fotografi til et fotografi.
Forsiktig: Selv om et generert bilde kan se "bildelignende ut", er det ikke et bilde; den dokumenterer ikke et faktisk øyeblikk. Å bruke det i en nyhetssak, dokumentar eller kontekst som hevder at "dette virkelig skjedde" er misvisende og bryter med den etiske grensen, som vi vil dekke i enhet 9.
Fotografisk prompt anatomi
En kraftig fotografisk prompt består av seks komponenter. Tenk på disse som å planlegge en shoot:
- Emne: Hva/hvem? Alder, klær, uttrykk, handling, antall. ("en middelaldrende snekker, i et forkle, jobber ved arbeidsbenken")
- Lys: Retning, hardhet, kilde, tid. Det er hjertet i fotografiet. ("mykt sidevindulys, morgen, lav kontrast")
- Objektiv og kameravisning: Brennvidde, dybdeskarphet, vinkel. ("85 mm portrettobjektivfølelse, liten dybdeskarphet, myk bakgrunnsbokeh, øyehøyde")
- Komposisjon: Innramming, plassering, innramming. ("nærbilde, tredjedelsregel, emne til venstre")
- Atmosfære og farge: Tone, humør, palett. ("varme jordfarger, rolig, nostalgisk")
- Teknologi/kvalitet: Tekstur, noter av realisme, sideforhold. ("naturlig hudtekstur, filmkorn, 3:2-forhold")
Når du introduserer disse komponentene i rekkefølge, produserer modellen et mye mer kontrollert, "fotografisk" resultat. Enhver komponent du utelater er overlatt til tilfeldighetene.
Tips: Ikke la AI-en tegne teksten/logoen. Diffusjonsmodeller kan ikke på en pålitelig måte produsere lesbar tekst og proprietære logoer; legge dem til i selve designfasen. I et bilde som krever lesbar tekst, bruk kun AI for bakgrunnen/atmosfæren.
Sideforhold og tiltenkt bruk
Aspektforhold er bredde-til-høyde-forholdet til bildet og bestemmer bruken: 9:16 for en vertikal historie på sosiale medier, 3:2 for standard utskrift, 1:1 for et kvadratisk innlegg, 16:9 for et bredt banner. Det er bedre å spesifisere forholdet i ledeteksten fra begynnelsen enn å trimme det senere og miste kvalitet. Velg oppløsning og forhold helt fra begynnelsen, vel vitende om tiltenkt bruk (utskrift eller visning).
Negativ oppskrift og variasjon
De fleste verktøy har også en negativ ledetekst: et område hvor du skriver ting du ikke vil ha i bildet ("deformert hånd, ekstra fingre, tekst, vannmerke, plastbinding"). Dette reduserer, men forhindrer ikke helt vanlige defekter; verifisering er fortsatt viktig. Det er også begrepet frø - frøet av tilfeldighet som produksjonen starter fra; Det samme frøet og ledeteksten gir et lignende resultat igjen, noe som hjelper deg med å lage et konsistent sett (vi vil gå mer i dybden i den fjerde enheten).
tre minisaker
Case 1 - Kraften til oppskriften. En arkivfotograf skrev «kvinne som drikker kaffe» og fikk dystre resultater. Da Prompta la til lys (sidevinduslys), linse (50 mm, liten dybdeskarphet), atmosfære (varm, rolig morgen) og tekstur (naturlig hud), ble resultatet brukbart. Akseptabel bildegenereringshastighet økte fra omtrent 1/20 til 1/4; Produksjonstiden ble redusert med en tredjedel.
Tilfelle 2 - Tap fra hallusinasjon. En designer-fotograf la et bilde av "forretningsfolk som håndhilser" i en presentasjon uten å sjekke det. På møtet ble det lagt merke til at en leder hadde tre hender. Feilen som ble oversett på den lille skjermen ble forstørret i projeksjon. En 30-sekunders hånd-/fingerskanning ville ha forhindret denne forlegenheten.
Tilfelle 3 - Velge riktig verktøy. En produktfotograf ønsket å plassere en ekte klokke han tok i et annet miljø. I stedet for å produsere den fra bunnen av, beholdt den den ekte produktrammen, bare bakgrunnen/atmosfæren ble produsert med AI og laget kompositt. Dermed ble ikke de faktiske detaljene til produktet (merke, urskive) forvrengt; både troverdighet og nøyaktighet ble bevart.
Kopierbare maler
1) Fotografisk ledetekstskjelett:
[emne: hvem/hva, alder, klær, uttrykk, handling],[lys: retning, hardhet, kilde, tid],[objektiv/kamera: sans for brennvidde, dybdeskarphet, vinkel],[komposisjon: innramming, plassering, konvensjon],[atmosfære/farge: tone, stemning, palett],[teknikk: naturlig tekstur, realistisk, korn, sideforhold]. Legg til tekst/logo.
2) Negativt ledetekstutkast:
Negativer (det jeg ikke vil ha): misformet hånd, ekstra/manglende fingre, skjevt ansikt, plast/vokslignende hud, uleselig tekst, vannmerke, repeterende tekstur, umulig skygge, overmettet farge.
3) For moodboard-referanse (retning, ikke levering):
Formål: Moodboard-referanse for en shoot (ikke leveringsproduktet). Konsept: [konsept]. Beskriv estetikken med kun attributter: lys [..], fargepalett [..], atmosfære [..], komposisjon [..]. Ikke bruk noen person-/merke-/fotografnavn. Generer 4 varianter.
4) Sammensatt plan som beskytter det virkelige produktet:
Jeg har et ekte [produkt]-bilde; Selve produktet vil ikke endre seg. Skriv spørsmålet for at bildet skal produseres kun for bakgrunn/atmosfære: [lys, overflate, farge, miljø]. Produktets skyggeretning og lyshardhet bør være [..] slik at kompositten overbeviser.
Svak forespørsel / Sterk forespørsel
Svak: "Fint portrettbilde."
Sterk: "Middelaldrende gårdskvinne, solslitt ansikt, lett smil, i en hveteåker; gyldent timelys fra siden, lav kontrast; 85 mm portrettvisning, grunt dybdeskarphet, bakgrunnen myk; nærbilde, motiv venstre, tredjedelsregel; varme jordfarger, rolig og verdig stemning; naturlig hudtekstur, 3, naturlig hudtekstur, 3, naturlig hudtekstur, 3.."
Den svake viljen overlates helt til tilfeldighetene; Siden sterk etterspørsel beskriver lyset, linsen, komposisjonen og atmosfæren, øker det i stor grad sannsynligheten for å produsere ønsket resultat.
Vanlige feil
- Beskriver ikke lyset og linsen. Disse to er i stor grad det som gjør et fotografi til et fotografi; Hvis du lar det stå tomt, vil resultatet bli overlatt til tilfeldighetene.
- Å la AI tegne lesbar tekst/logo. Modellen kan ikke produsere disse pålitelig; Det kan vise seg å være defekt og opphavsrettsbeskyttet.
- Presentere det produserte bildet som et "fotografi". Det er misvisende i dokumentar/nyhetssammenheng; Det kreves en faktaerklæring.
- Kopieringsstil med person/merkenavn. Imitasjon og opphavsrettsrisiko; Beskriv estetikk med kvaliteter.
- Hopp over verifisering. Hender, øyne, refleksjoner, skygger og gjentatte teksturer må kontrolleres i hvert produserte bilde.
Oppsummert
Generativ visuell AI fungerer ved diffusjon: den går fra støy til bilde som passer til teksten, kan ikke produsere det som ikke er beskrevet, og feiler der logikk kreves. For fotografisk realisme, beskriv motivet, lyset, linsen, komposisjonen, atmosfæren og teknikken som en fotograf. Velg sideforholdet i henhold til formålet, reduser artefakten med negativ oppskrift, ikke la AI-en tegne teksten, og kontroller hver utgang. Bruk aldri et produsert bilde som hevder å være et "foto tatt".
Søknadsoppgave
Velg et konsept og skriv en fotografisk oppfordring, og fyll ut alle seks komponentene med mal 1. Produser (eller beskriv) det samme konseptet først i en enkelt setning, for eksempel "et vakkert bilde," deretter med hele skjelettet, og sammenlign de to resultatene. Marker minst tre mulige feilpunkter i bildet du produserer ved å forstørre hender, øyne, refleksjoner og skygger.
sjekkliste
- [ ] I ledeteksten beskrev jeg emne, lys, linse, komposisjon, atmosfære og teknikk separat.
- [ ] Jeg bestemte sideforholdet i henhold til tiltenkt bruk.
- [ ] Jeg reduserte de vanlige feilene med den negative oppskriften.
- [ ] Jeg hadde ikke AI Draw lesbar tekst/logo.
- [ ] Jeg sørget for at jeg ikke presenterte det genererte bildet som et "bilde".
- [ ] Jeg bekreftet utgangen for hånd/øye/refleksjon/skygge.