🧰 UtlKit

Como Escrever Prompts de Imagem IA: Estrutura T2I, Vocabulário Visual e Exemplos

Como escrever prompts para modelos de texto para imagem: a estrutura de oito partes, o vocabulário visual ao qual os modelos respondem, exemplos resolvidos e erros a evitar.

Por que o prompt é tudo na imagem IA

Os modelos de texto para imagem (T2I) não "entendem" a sua ideia: comparam as suas palavras com os padrões dos milhões e milhões de imagens com que foram treinados. O prompt é a única instrução que recebem, e pequenas nuances de redação mudam o que pintam. "Um cão num parque" e "um terrier despenteado em pleno salto atrás de uma bola de ténis, luz filtrada pelas árvores, lente de 85 mm, profundidade de campo curta" produzem duas imagens completamente diferentes no mesmo modelo.

Este guia cobre a estrutura que funciona: a fórmula de oito partes do prompt T2I, o vocabulário visual ao qual os modelos respondem, como adaptar um mesmo prompt ao modelo que você usa e os erros que acham o resultado.

A fórmula do prompt T2I em oito partes

Cada prompt T2I forte responde, mais ou menos nesta ordem, a oito perguntas:

  1. Sujeito — quem ou o que há no quadro, com detalhes concretos (não "uma pessoa", mas "um pescador veterano de jaqueta de lona").
  2. Detalhes — materiais e texturas que o concretizam: tecido, pelagem, pele, pátina do metal.
  3. Cena e momento — onde se passa e a atmosfera: uma vielinha, um estúdio, uma costa. A hora do dia e o tempo definem a paleta mais do que qualquer palavra de estilo.
  4. Composição — como o quadro se organiza: regra de terços, centralizada, linhas de condução, espaço negativo, moldura dentro da moldura.
  5. Luz — o caráter da luz: hora dourada, luz de contorno, raios volumétricos, néon, velas, luz suave de estúdio, claro-escuro.
  6. Cor — a direção da paleta: teal e laranja, tons de terra amortecidos, pastel, monocromático, tons de joia.
  7. Estilo, meio e tom — a linguagem visual (fotorrealista, cinematográfico, anime, óleo, pixel art) e o tom emocional (dramático, sereno, melancólico).
  8. Câmera e formato — tamanho do plano (close, corpo inteiro, grande angular), distância focal (35 mm, 85 mm), ângulo e a proporção que você realmente precisa.

Exemplo resolvido

Montado com as oito partes acima, um retrato fotorrealista:

"um pescador velho com o rosto marcado pelo sol, jaqueta de lona com salpicos de sal, de pé na ponta de um pequeno cais ao amanhecer, névoa subindo da água, composição centralizada com espaço negativo acima, luz suave da hora dourada vinda da esquerda, tons de terra amortecidos, fotografia fotorrealista, tom melancólico, lente de retrato 85 mm, close médio, 4:5"

Conte: sujeito, textura, lugar, hora, névoa, composição, luz, cor, estilo, meio, tom, focal, plano e formato — catorze elementos, cada cláusula fazendo um trabalho, nada de enfeite. Uma frase curta de qualidade no final — "ultra detalhado, iluminação natural" — o modelo lê como meta de qualidade.

Vocabulário visual que os modelos de imagem entendem

Os modelos de imagem treinam em fotos e obras de arte anotadas com terminologia técnica, por isso os termos padrão funcionam. Os que mais você vai usar:

  • Tamanho do plano — grande close, close, plano médio, plano integral, plano geral, grande plano geral, vista de cima, sobre o ombro, plano com dois personagens.
  • Ângulo — nível dos olhos, de baixo para cima, de cima para baixo, vista aérea, do nível do chão, holandesa, POV.
  • Focal e profundidade — 24 mm grande angular, 35 mm de rua, 50 mm, 85 mm de retrato, 135 mm tele, macro 1:1; profundidade de campo curta com bokeh aveludado em f/1.4, ou f/16 com tudo nítido.
  • Luz — hora dourada, hora azul, contra-luz, luz de contorno, luz volumétrica, raios de luz, néon, velas, luar, high-key, low-key, luz Rembrandt, claro-escuro, sombra dramática.
  • Filme e textura — fotografia em filme 35 mm, Kodak Portra 400, grão de filme, vazamento de luz, flash direto de compacta, quadro VHS.
  • Meios artísticos — óleo impasto, aquarela, carvão, linha de tinta, lápis de cor, pixel art, arte isométrica, anime cel-shade, halftone de quadrinhos, pop art, xilogravura ukiyo-e, glitch art.

Você não precisa nomear tudo. Uma ou duas escolhas técnicas — "lente de retrato 85 mm, profundidade de campo curta" ou "óleo impasto" — frequentemente mexem mais no resultado do que três adjetivos de estilo.

Adaptar o prompt ao modelo

Os principais modelos de imagem vêm de laboratórios diferentes: Midjourney V7 (Midjourney), DALL·E 3 (OpenAI), Flux.1 (Black Forest Labs), Imagen 3 (Google) e Stable Diffusion 3.5 (Stability AI), mais os modelos chineses Seedream (ByteDance), Kolors (Kuaishou), Wan e Z-Image Turbo (Alibaba), MiniMax Image e ERNIE ViLG (Baidu). Suas estratégias de prompting diferem em duas coisas práticas:

  • Idioma. Os modelos chineses são nativos em chinês — prompts em chinês soam mais naturais para eles; os demais foram treinados sobretudo em inglês. Escreva no idioma em que o modelo é mais forte.
  • Frase de qualidade. Cada modelo tem seu fecho preferido — Flux.1 "photorealistic, accurate detail", Midjourney V7 "cinematic, highly detailed, artistic composition". Acrescentar a certa faz a mesma seleção soar como prompt nativo em cada modelo.

O Gerador de prompts de imagem IA cuida das duas: ajusta o idioma de saída ao modelo (chinês para os modelos chineses na página em chinês, inglês em todo o resto) e acrescenta o sufixo de qualidade próprio de cada modelo.

Sete erros que acham a imagem IA

  • Sujeito vago. "Alguém em algum lugar" deixa o modelo inventar o protagonista; seja concreto sobre quem ou o que está no quadro.
  • Estilos em conflito. "Óleo fotorrealista" se anula; escolha uma linguagem visual e cumpra.
  • Sem intenção de luz. Sem direção de luz, o modelo por padrão dá uma luz plana, neutra e de catálogo; nomeie sua luz.
  • Sopa de adjetivos. Vinte palavras de estilo diluem cada instrução; dez descritores concretos costumam vencer cinquenta adjetivos.
  • Idiomas misturados. Mantenha o prompt em um idioma; prompt meio traduzido confunde o modelo.
  • Ignorar a proporção. O quadrado padrão não serve para papel de parede, banners ou capas — declare 16:9, 4:5 ou 3:2 desde o início.
  • Negações no lugar de afirmações. "Sem desfoque, sem dedos a mais" funciona pior do que descrever o que você quer: foco nítido, mãos limpas, um único sujeito.

Monte prompts com estrutura

Em vez de texto livre, você pode escolher opções de uma grade estruturada. O Gerador de prompts de imagem IA cobre 10 categorias — tipo de sujeito, cena, composição, luz, paleta de cores, estilo artístico, meio, atmosfera, câmera e proporção — com uma imagem de referência para cada opção, e monta sua escolha única por categoria em um prompt ajustado ao modelo de destino. Ele roda inteiramente no navegador: nada do que você escreve é enviado.

Ferramentas Relacionadas

Perguntas Frequentes

O que é um prompt de texto para imagem (T2I)?

O conjunto de palavras que você entrega ao modelo de imagem para descrever o que deve pintar: o sujeito mais a direção visual — cena, composição, luz, cor, estilo, câmera, proporção. Diferente de uma busca, a ordem e a concretude importam: quanto mais concreto um detalhe e quanto mais cedo aparece, mais peso o modelo lhe dá.

O que um prompt de imagem IA deve incluir?

Oito elementos: um sujeito concreto, detalhes de textura e material, cena com hora do dia, composição, luz, paleta de cores, estilo com meio e tom, e câmera com proporção. Mantenha cerca de 30-80 descritores concretos em um único idioma e feche com uma frase curta de qualidade.

Qual deve ser o comprimento de um prompt de imagem IA?

Depende do modelo: Midjourney e DALL·E funcionam melhor com prompts concisos (cerca de 20-40 palavras), enquanto Flux e Stable Diffusion recompensam mais detalhe e aguentam 100+. Como regra, 30-80 palavras de descritores concretos e sem ambiguidade é o ponto ideal; um parágrafo de 200 palavras costuma render menos.

Preciso de um prompt diferente para cada modelo (Midjourney, DALL·E, Flux)?

A descrição central pode permanecer a mesma, mas duas coisas devem ser adaptadas: o idioma (os modelos chineses como Seedream, Kolors, Wan, Z-Image Turbo, MiniMax Image e ERNIE ViLG são treinados para responder a prompts em chinês; o resto responde melhor em inglês) e a frase de qualidade final, que varia por modelo. Um gerador estruturado cuida das duas automaticamente.

Por que minhas imagens IA parecem genéricas ou lavadas?

Geralmente é porque o prompt deixou as grandes decisões com o modelo. Nomeie a luz (a luz plana e neutra é o padrão silencioso), escolha um estilo e corte adjetivos em conflito, acrescente um ou dois detalhes técnicos — lente, tamanho do plano, filme — e declare a proporção. Dez descritores concretos costumam vencer uma lista de adjetivos.

Artigos Relacionados