Por que o prompt é tudo no vídeo IA
Os modelos de texto para vídeo (T2V) e imagem para vídeo (I2V) não "entendem" a sua ideia — eles casam suas palavras com os padrões do material fílmico em que foram treinados. O prompt é a única instrução que recebem, e pequenas escolhas de redação mudam o que geram. "Um carro em uma estrada" e "um carro vermelho vintage dirigindo por uma estrada costeira ao entardecer, plano de acompanhamento" produzem dois clipes completamente diferentes com o mesmo modelo.
Este guia cobre a estrutura que funciona: o prompt T2V de seis partes, o vocabulário de câmera ao qual os modelos de vídeo respondem, como os prompts I2V diferem e como adaptar um prompt ao modelo que você está usando.
T2V e I2V: dois modos, dois prompts diferentes
- T2V (texto para vídeo) — você escreve a tomada inteira em palavras: sujeito, ação, cenário, câmera, luz e estilo. O modelo inventa o aspecto de tudo.
- I2V (imagem para vídeo) — você fornece uma imagem fixa que define o aspecto, e o prompt descreve apenas o que acontece: o movimento e o deslocamento de câmera.
A diferença importa porque muda para que servem as suas palavras. Em T2V, o prompt é o storyboard completo. Em I2V, é uma nota de movimento anexada a uma imagem que você já escolheu.
A fórmula de seis partes do prompt T2V
Cada prompt T2V forte responde a seis perguntas, nesta ordem aproximada:
- Sujeito — quem ou o que aparece na tela, com detalhes concretos (não "uma pessoa", mas "um vigia de farol com casaco encerado").
- Ação — uma ação principal por tomada. Empilhar três ações geralmente produz uma mistura borrada de todas.
- Ambiente e horário — onde, que hora do dia e qual o tempo. O horário do dia determina mais a paleta do que qualquer palavra de estilo.
- Câmera — tamanho do plano (close, plano geral...), ângulo (na altura dos olhos, contra-picado...), movimento (fixa, pan, dolly, câmera na mão...). Nomear apenas um deles impede que o modelo chute.
- Luz e cor — o aspecto da luz: golden hour, blue hour, neon, luz de vela; e uma direção de cor como teal & orange ou monocromático.
- Estilo e tom — a linguagem visual (cinematográfico, documental, anime, noir) e o tom emocional (melancólico, tenso, lúdico).
Exemplo resolvido
Montado com as seis partes acima:
"plano médio da cintura para cima, um vigia de farol com casaco encerado caminhando por um muro de contenção do mar, ondas quebrando abaixo, entardecer com vento no casaco, plano de acompanhamento seguindo o sujeito, luz da blue hour com um único brilho quente de lampião, visual de filme, tom melancólico"
Conte: tamanho de plano + sujeito + ação + cenário + horário + movimento + luz + estilo + tom. Cada cláusula cumpre uma função; nenhuma é adorno.
O vocabulário de câmera que os modelos de vídeo entendem
Os modelos de vídeo são treinados em material anotado com terminologia de filmagem, então os termos cinematográficos padronizados funcionam. As palavras que você mais usará:
- Tamanho do plano — close extremo, close, close médio, plano médio, plano médio aberto, plano integral, plano geral, plano geral extremo, plano zenital, plano a dois.
- Ângulo — na altura dos olhos, contra-picado, picado, vista de pássaro, vista de formiga, neerlandês (dutch angle), sobre o ombro, ponto de vista (POV).
- Movimento — fixa, pan, tilt, dolly in, dolly out, acompanhamento, órbita, grua, câmera na mão, zoom.
- Ritmo — câmera lenta, tempo real, câmera rápida, time-lapse. Nomear o ritmo é uma das alavancas menos usadas: "câmera lenta" sozinho pode transformar um clipe.
Você não precisa nomear todos. Uma única decisão de câmera — "plano de acompanhamento" ou "câmera na mão" — costuma mover o resultado mais do que três adjetivos de estilo.
Como funcionam os prompts I2V
No modo imagem para vídeo, a imagem fixa já é metade do prompt. A imagem define o sujeito, o cenário, a paleta e grande parte do estilo; seu texto deve descrever apenas o movimento e a câmera:
- O que acontece: "as ondas começam a chegar, a figura acende um lampião".
- Como a câmera se comporta: "dolly in lento", "câmera fixa, o sujeito se move", "acompanhamento com câmera na mão".
- Ritmo: "câmera lenta" ou "tempo real".
Mantenha a descrição curta — uma ou duas frases costumam bastar. Se você descrever novamente o conteúdo da imagem com palavras, o modelo mistura seu texto com a foto e o resultado deriva de ambos. O Gerador de prompts de vídeo IA acrescenta o prefixo "Following the input image" neste modo e oculta as categorias que a imagem já decide, como o tamanho do plano e a composição.
Adaptar o prompt ao modelo
Os principais modelos de vídeo vêm de laboratórios diferentes: Kling (Kuaishou), Seedance (ByteDance), Hailuo (MiniMax), Wan 2.2 (Alibaba) e Vidu (Shengshu Technology), além de Sora 2 (OpenAI), Veo 3 (Google), Runway Gen-4 (Runway), Luma Dream Machine (Luma AI) e Pika 2.2 (Pika). Suas estratégias de prompting diferem de duas formas práticas:
- Idioma. Os modelos chineses são nativos em chinês — prompts em chinês soam mais naturais para eles; o restante foi treinado principalmente em inglês. Escreva o prompt no idioma em que o modelo é mais forte.
- Frase de qualidade. Cada modelo tem uma frase de fechamento preferida — ao Kling vai bem "qualidade cinematográfica, luz e sombra delicadas, rico detalhe", ao Pika 2.2 "cinematic, vibrant, smooth motion, crisp detail". Acrescentar a certa faz a mesma seleção soar como um prompt nativo para cada modelo.
O gerador cuida das duas coisas: ajusta o idioma de saída ao modelo (chinês para os modelos chineses no site em chinês, inglês em todas as outras combinações) e acrescenta o sufixo de qualidade próprio de cada modelo.
Sete erros que arruínam prompts de vídeo IA
- Sujeito vago. "Alguém em algum lugar" deixa o modelo inventar o elenco; seja concreto sobre quem ou o que aparece.
- Várias ações. Empilhar três ações produz uma mistura borrada; uma ação por clipe.
- Estilos em conflito. "Documental com câmera na mão" e "visual de estúdio glamoroso" se anulam; escolha uma única linguagem visual.
- Sem intenção de câmera. Sem tamanho de plano nem movimento, o modelo chuta; declare explicitamente.
- Sobrecarga. Um parágrafo de 200 palavras dilui cada instrução; 30-80 palavras de descritores concretos costumam vencer um ensaio longo.
- Idiomas misturados. Mantenha o prompt em um idioma; prompts meia-tradução confundem o modelo.
- Ignorar o ritmo. Se quer câmera lenta ou time-lapse, diga; tempo real é o padrão silencioso.
Monte prompts com estrutura
Em vez de texto livre, você pode escolher opções de uma grade estruturada. O Gerador de prompts de vídeo IA cobre 11 categorias — tamanho do plano, ângulo e movimento de câmera, ritmo do movimento, horário e tempo, luz, gradeção de cores, estilo, tom, efeitos e composição — com imagens de referência para cada opção, e monta sua escolha única por categoria em um prompt ajustado ao modelo de destino. Ele roda inteiramente no navegador: nada do que você escreve é enviado.