Unidade 2 / 11

Fundamentos da produção visual: como funciona a IA de imagens e anatomia imediata

Ganhos:

  • Compreender como funciona a inteligência artificial visual (difusão) e como ela não consegue produzir o que não está descrito e não consegue desenhar bem o texto.
  • Capacidade de escrever uma mensagem visual forte que consiste em assunto, contexto, estilo, composição, luz e componentes técnicos.
  • Ganhar a capacidade de determinar a proporção, evitar que o texto legível seja desenhado pela inteligência artificial e reduzir o defeito com uma descrição negativa.

Um designer produzindo recursos visuais com IA é como dar uma ordem a um artista: quanto mais claro e preciso você explicar, mais preciso será o resultado. Nesta unidade, entenderemos em linguagem simples como funciona a inteligência artificial geradora de imagens (IA de imagens) e aprenderemos a anatomia de escrever um bom prompt (instruções escritas para um visual), passo a passo. O objetivo é ser capaz de descrever conscientemente a imagem desejada, em vez de “tentar aleatoriamente e confiar na sorte”.

Como funciona a IA de imagem? (Explicação simples)

A maioria dos produtores de imagens hoje usa um método chamado difusão. Simplesmente: o modelo aprendeu as relações “quais palavras correspondem a quais imagens” de milhões de pares imagem-texto. Ao produzir recursos visuais, ele começa a partir de uma imagem com ruído aleatório (como uma tela de televisão com neve) e limpa esse ruído passo a passo para se adequar ao seu prompt e o transforma em uma imagem significativa. Em outras palavras, o modelo não “desenha” a imagem, ele constrói estatisticamente a imagem que melhor se adapta ao seu prompt.

Isto tem três consequências práticas. Primeiro: O mesmo prompt dá um resultado diferente a cada vez, porque o ruído inicial é aleatório (veremos como controlar isso com "seed" na próxima unidade). Segundo: o modelo não pode saber o que você não pode descrever; Ele não consegue ler a imagem na sua cabeça, apenas interpreta o que você escreve. Terceiro: O modelo não consegue desenhar bem texto e número, porque imita letras na forma e não no significado; É por isso que é arriscado deixar a escrita dos logotipos para a IA.

Dica: não deixe a IA produzir texto simples (nome da marca, slogan) na imagem. Você produz uma imagem sem texto e depois adiciona o texto (como vetor) em um programa de design. Isso o torna legível e editável.

Anatomia de um bom prompt

Ajuda dividir um prompt visual forte em seis componentes. Você não precisa usá-los todos sempre, mas escolher conscientemente determinará o resultado.

  1. Assunto/assunto: Qual é o elemento principal da imagem? (“uma xícara de café de cerâmica”, “retrato de uma jovem”).
  2. Ação/contexto: O que ele está fazendo, onde está? (“na mesa de madeira, à luz da manhã”).
  3. Estilo/estética: Qual é a linguagem visual? (“foto mínima do produto”, “ilustração em aquarela”, “renderização 3D isométrica”). Este é o componente mais decisivo.
  4. Composição/ângulo: Como é o enquadramento? ("close-up", "vista aérea", "grande angular", "no meio, com espaço").
  5. Luz e cor: (“luz natural suave”, “paleta de tons terrosos”, “alto contraste”).
  6. Técnica/qualidade: ("alta resolução", "taxa de quadros 1:1", "fundo branco liso").

Também existe uma receita negativa: dizer coisas que você não quer (“sem texto, sem pessoas, sem fundo bagunçado”). Iremos aprofundar isso com o “prompt negativo” na 4ª unidade.

Glossário de termos

  • Proporção: A proporção da imagem; Quadro 1:1 (postagem no Instagram), retrato 9:16 (história/reels), paisagem 16:9 (capa).
  • Resolução: Número de pixels da imagem; Alto é suficiente para impressão, médio é suficiente para tela.
  • Referência de estilo: Dar uma amostra ao modelo dizendo "fica assim".
  • Renderizar: O computador calcula e produz uma imagem; "Renderização 3D" significa visão volumétrica realista.

Passo a passo: descrevendo uma imagem

Digamos que queremos uma imagem de produto para uma marca de azeite.

Passo 1 - Concentre-se no assunto: “azeite virgem extra em garrafa de vidro verde escuro”.

Passo 2 — Adicione contexto: “no balcão rústico de madeira, com alguns ramos de oliveira frescos ao lado”.

Passo 3 — Escolha o estilo: “foto de produto premium, realista”.

Passo 4 — Dê a composição: “produto no meio, espaço para texto no topo”.

Passo 5 — Luz/cor: “luz natural lado suave, tons terrosos quentes”.

Passo 6 — Técnica: “Taxa de quadros 1:1, alta resolução, fundo liso”.

Ao combinar todos eles, você obtém um rascunho viável que se adapta à identidade da marca.

três mini cases

Caso 1 — Da incerteza à clareza. Um designer escreveu “imagem de um escritório moderno” e fez 12 tentativas, nenhuma delas funcionou (perdeu 30 minutos). Ele reescreveu o prompt em seis componentes: "escritório minimalista e claro; mesa de madeira; luz natural da grande janela; tons neutros quentes; grande angular; espaço de texto na parte superior". 2 das primeiras 4 tentativas foram utilizáveis; O tempo foi reduzido para 10 minutos.

Caso 2 — Armadilha de texto. Um estagiário fez com que uma IA produzisse um pôster de café do início ao fim; O texto “COFFEE” na imagem era “COFEEE” e os preços não eram legíveis. As instruções mudaram: a imagem foi produzida sem texto, o texto foi adicionado posteriormente no programa de design. O erro diminuiu para zero e o pôster ficou adequado para impressão.

Caso 3 — Perda de razão. Um especialista em mídia social produziu uma imagem quadrada 1:1 para uma história no Instagram; 9:16 Quando coloquei na área vertical, a parte superior e inferior foram cortadas e o elemento importante foi perdido. Quando especifiquei a proporção como “9:16 vertical” no prompt, a imagem se encaixou em seu formato e nenhuma reprodução foi necessária.

Modelos copiáveis

1) Esqueleto da imagem do produto de seis componentes:

[Assunto: descreva o produto] , [Contexto: onde/como] .Estilo: [ex. foto de produto premium, realista] .Composição: [ex. produto no meio, espaço para texto na parte superior]. Luz e cor: [ex. luz natural suave, tons de terra] .Técnica: [proporção, alta resolução, fundo liso] .Nota: Nenhum texto/logotipo legível na imagem; Adicionarei o texto mais tarde.

2) Esqueleto da ilustração:

Assunto: [o que desenhar].Estilo: [ex. ilustração vetorial de cores planas / aquarela / 3D isométrico]. Paleta de cores: [2-3 cores primárias]. alegre, calmo, sério] .Fundo: [liso / estampado / transparente] .Proporção: [1:1 / 9:16 / 16:9] .

3) Exploração de estilo (mesmo assunto, estética diferente):

Descreva o seguinte assunto com a mesma composição em 4 estilos visuais diferentes: vetor plano mínimo, foto realista, aquarela, 3D isométrico. Escreva um prompt de uma linha para cada um. Assunto: [colar]

4) Adicionando descrição negativa:

Melhore o seguinte prompt e adicione os indesejados no final: "sem texto, sem marca d'água, sem fundo bagunçado, sem mãos/dedos ruins, sem muitos objetos". Solicitação: [colar]

Alerta fraco / Alerta forte

Fraco: uma linda foto de café

Resultado: ângulo aleatório, estilo pouco claro, imagem incidental que não combina com a marca.

Poderoso: Xícara de cerâmica cheia de café com leite quente, sobre uma mesa de madeira clara, lateralmente sob a luz suave da manhã; foto mínima de produto premium; tons neutros quentes; close-up, espaço para texto no canto superior direito; Quadrado 1:1, fundo liso; Não deve haver nenhum texto legível.

O resultado: um esboço adaptável à marca com composição, luz e proporção controladas.

Diferença: um prompt forte preenche os seis componentes (assunto, contexto, estilo, composição, luz, técnica) de forma clara e deixa o texto de fora.

Componentes de prompt e tabela de efeitos

componente

exemplo

Efeito no resultado

assunto

"azeite em garrafa de vidro"

determina o que aparece

Estilo

"foto de produto premium"

O elemento que mais determina a linguagem visual

composição

"no meio, com espaço para texto"

Aumenta a usabilidade

luz/cor

"luz suave, tons de terra"

Transmite o sentimento da marca

proporção

"9:16 verticais"

Permite cumprir o formato

descrição negativa

"sem texto"

Reduz defeito

Erros comuns

  • Não especificar o estilo: Ao omitir o componente mais decisivo, o resultado torna-se clichê e aleatório.
  • Fazer com que a IA desenhe o texto: Letras corrompidas e ilegíveis; adicione o texto posteriormente no programa de design.
  • Esquecendo a proporção: A proporção errada cria recortes e perda de elementos na publicação.
  • Prompt sobrecarregado: empilhar 20 conceitos uns sobre os outros confunde o modelo; mantenha-o claro e priorizado.
  • Desistir de uma só vez: a difusão é aleatória; É normal produzir diversas variações e escolher a melhor.

Em resumo

A IA de geração de imagem constrói gradualmente a imagem para se adequar ao seu prompt a partir de ruído aleatório; Ele não consegue ler a imagem na sua cabeça, apenas interpreta o que você escreve. Um bom prompt consiste em seis componentes: assunto, contexto, estilo, composição, luz/cor e técnica. O estilo é o elemento mais decisivo; Certifique-se de especificar a proporção; Não deixe o texto legível para a IA, você o adiciona mais tarde. À medida que a clareza aumenta, o número de tentativas e a perda de tempo diminuem.

Tarefa de aplicativo

Escolha um produto ou tópico. Primeiro, escreva em uma frase (“um belo X”) e experimente em um gerador de imagens e observe o resultado. Em seguida, descreva o mesmo assunto novamente preenchendo o esqueleto de seis componentes, adicionando a proporção e a descrição negativa. Coloque os dois resultados lado a lado e escreva em três marcadores como a clareza altera o resultado.

lista de verificação

  • [] Afirmei o assunto, o contexto e o estilo claramente em meu prompt.
  • [] Adicionei composição e componentes de luz/cor.
  • [] Especifiquei a proporção (1:1/9:16/16:9).
  • [ ] Não mandei a IA desenhar o texto legível, deixei para depois.
  • [ ] Excluí os indesejáveis ​​com a descrição negativa.
  • [ ] Não confiei em um único experimento e produzi diversas variações.