Como escrever prompts de vídeo de IA que realmente funcionam
A maioria dos “guias de prompt de IA” são escritos por pessoas que geraram talvez dez vídeos. Eles dizem para você ser específico. Eles dizem para você adicionar “4K cinematográfico”. Então eles deixam você perdido no momento em que seu assunto se transforma em um esboço de Cronenberg na terceira tentativa.
Um prompt de vídeo de IA funcional faz quatro coisas ao mesmo tempo. Ele nomeia um assunto claro. Coloca esse assunto em uma cena com geografia real. Diz à câmera o que fazer. E especifica um clima ou estilo ao qual o modelo pode aderir. Pule qualquer um deles e você terá esperança. Acerte todos os quatro e você estará dirigindo.
Este guia é a versão longa. Vamos analisar a anatomia de um bom prompt, os padrões que funcionam no Veo 3.1, Seedance 2.0 e Kling 3.0, os erros que destroem seus resultados, o ciclo de iteração que realmente se compõe e os modelos que você pode criar para curtas do TikTok, fotos de heróis de produtos, cenas de diálogo e rolos B. Sem boatos, sem “desbloquear a criatividade”, sem exemplos falsos. Exatamente o que aprendemos enviando milhares de clipes de IA.
Se você é novo, comece com como fazer vídeos de IA. Se você quiser recomendações de plataforma, consulte nosso detalhamento sobre melhores geradores de vídeo de IA. Caso contrário, vamos entrar no assunto.
Botão CTA: > Experimente muvi.video gratuitamente
A anatomia de um prompt de trabalho
Todo bom prompt de vídeo de IA é construído com os mesmos seis ingredientes. Você pode descartar um ocasionalmente, mas os prompts mais fortes incluem todos eles e os colocam aproximadamente nesta ordem:
1. Assunto, quem ou o que está no quadro 2. Cena, onde eles estão, o que está ao seu redor, a geografia 3. Ação/Movimento, o que está acontecendo, quem se move como 4. Câmera, ângulo, distância, movimento, lente 5. Iluminação, direção, cor, clima 6. Estilo, referência visual ou sinal estético
Aqui está uma sugestão fraca: "Um chef cozinhando."
Aqui está a mesma ideia construída a partir dos seis ingredientes:
"Um chef de meia-idade com um avental azul-marinho gasto fica em um fogão de aço inoxidável em um izakaya mal iluminado de Tóquio. Ele vira um pequeno pedaço de peixe em uma panela de ferro fundido fumegante; o peixe faz um arco uma vez e cai plano. Close-up médio na altura do peito, câmera empurrando lentamente a panela. Luz quente de tungstênio vinda de cima misturada com o brilho azul frio de uma janela atrás dele. Lente cinematográfica anamórfica, leve granulação de filme."
A primeira versão faz a modelo adivinhar tudo. O segundo informa exatamente onde colocar a câmera, como o chef está iluminado e como é a ação, batida por batida. Modelos como o Veo 3.1 não recompensam bobagens detalhadas, mas recompensam esse tipo de especificidade em camadas.
A regra prática de 30 a 80 palavras
Procure usar de 30 a 80 palavras para a maioria das fotos. Abaixo de 30 você está subdirigindo. Acima de 100 você começa a sentir fadiga imediata, os modelos eliminam os elementos que você escreveu posteriormente na frase. Se a sua cena realmente precisar de mais, divida-a em dois clipes e costure-os.
Padrões de prompt que funcionam em todos os modelos
Algumas estruturas imediatas generalizam. Eles trabalham no Veo 3.1, trabalham no Seedance 2.0, trabalham no Kling 3.0. Memorize-os e você terá uma base para 80% das tomadas que precisar escrever.
Padrão 1: Assunto, Ação, Cenário, Câmera, Estilo
O padrão para todos os fins. Use isso quando não tiver certeza por onde começar.
"Um labrador preto (objeto) corre por um beco molhado de paralelepípedos (ação + cenário), foto baixa lateral no nível do solo (câmera), reflexos neon nas poças, paleta de cores cyberpunk temperamental (estilo)."
Padrão 2: Estabelecer, Mover, Revelar
Melhor quando você deseja que a câmera conte histórias.
"Grande foto aérea de uma vila adormecida nas montanhas nevadas ao amanhecer. A câmera desce lentamente e avança pela rua principal, finalmente revelando uma única janela iluminada onde um padeiro está amassando massa. Luz rosa suave do nascer do sol, neve suave."
Padrão 3: Espera, Acionamento, Reação
A fórmula do momento do diálogo/personagem. Forte no Veo 3.1, ele lida bem com cenas multi-beat e gera nativamente áudio ambiente e de diálogo junto com o vídeo (de acordo com a documentação do produto do Google, verifique na plataforma).
"Close de uma mulher lendo uma carta em uma mesa de madeira da cozinha. Ela termina de ler, exala e seus olhos marejam. A luz quente da tarde entra por uma janela atrás dela. Câmera estática, lente 35mm, profundidade de campo rasa."
Padrão 4: Herói do Produto
O carro-chefe do comércio eletrônico. Funciona igualmente bem como um prompt de texto para vídeo ou como um prompt de imagem para vídeo com uma foto do produto anexada.
"Foto de estúdio de um case de fone de ouvido sem fio preto fosco em um pedestal de concreto polido. O case gira lentamente 90 graus enquanto a câmera orbita na direção oposta. Luz de tecla suave no canto superior esquerdo, luz sutil no aro por trás, queda profunda de sombra. Estética limpa, mínima e premium."
Padrão 5: Textura B-Roll
Para cortes e fotos de atmosfera que preenchem uma edição mais longa.
"Foto macro de café expresso enchendo lentamente uma pequena xícara de cerâmica branca. Vapor subindo. Luz quente da manhã vinda da janela à esquerda. Profundidade de campo rasa, granulação leve do filme, sem música."
Padrão 6: Estilizado/Animado
Quando você não quer fotorreal.
"Animação 2D desenhada à mão, estilo Studio Ghibli. Uma jovem com uma capa de chuva amarela pula em uma poça em uma rua chuvosa de uma vila. A água espirra em câmera lenta. Fundos suaves em aquarela, paleta pastel suave, textura suave pintada à mão."
Padrão 7: Dialogue Beat (modelos habilitados para áudio)
Para Veo 3.1 e qualquer modelo que faça áudio nativo.
"Dois amigos sentam-se frente a frente em uma mesa de lanchonete. O da esquerda diz: 'Você vai ficar bem', baixinho. O outro acena com a cabeça, mas não fala. Luz suave e quente no teto. Câmera média estática de duas tomadas. Ruído ambiente do restaurante, conversa baixa, tilintar de talheres distantes."
Escolha um padrão, preencha os espaços em branco e gere. Itere a partir daí.
Nuances de prompt específicas do modelo
Os padrões generalizam. Mas cada modelo tem sua própria personalidade, e os estímulos que o levam a um excelente trabalho são diferentes. Aqui está o que aprendemos com o uso diário intenso dos três.
Veo 3.1, recompensa a linguagem cinematográfica
O Veo 3.1 foi treinado em muitas filmagens filmadas profissionalmente e isso fica evidente. Quando você escreve em termos cinematográficos, “lente anamórfica”, “foco de rack”, “dolly in”, “luz principal em 3/4”, “profundidade de campo rasa”, Veo traduz isso de forma surpreendentemente literal. É também o único modelo convencional que reproduz bem o áudio nativo, portanto, se a sua cena tiver algum design de som (diálogo, ambiente, SFX), o Veo é o ideal. Resista à tentação de sobrecarregar o prompt com adjetivos. Veo prefere uma direção estruturada e específica em vez de uma parede de vibrações. Para obter informações completas sobre o Veo 3.1, consulte nosso guia completo do Veo 3.1.
Seedance 2.0, recompensa tomadas contínuas mais longas
Seedance 2.0 suporta qualquer duração de clipe inteiro de 4 a 15 segundos, a faixa mais ampla no catálogo muvi.video. Quando uma cena precisa de um arco de movimento sustentado que o teto de 8 segundos do Veo 3.1 não consegue acomodar, o Seedance é o caminho. Ele também suporta seis proporções (1:1, 9:16, 16:9, 4:3, 3:4, 21:9) versus apenas 16:9/9:16 do Veo, portanto, para formatos verticais plus, quadrados ou ultralargos, oferece mais espaço de composição. A resolução é limitada a 720p (1440p na variante Start/End Frame), então reserve o Seedance para cenas onde a duração e a flexibilidade da proporção são mais importantes do que a fidelidade no nível de pixel. A variante Omni-Reference aceita até nove referências de imagem, três de vídeo e três de áudio, úteis para continuidade de caracteres em uma série de clipes.
Kling 3.0, recompensa brevidade e clareza
Kling é rápido, o que significa que é perfeito para iteração. Mas tem um desempenho pior do que Veo ou Seedance quando os prompts ficam longos ou técnicos. Reduza o vocabulário cinematográfico, mantenha suas instruções com menos de 50 palavras e confie em descrições visuais simples. Kling brilha especialmente em assuntos humanos, rostos expressivos e clipes rápidos em formato social. Se o seu prompt precisar de três vírgulas para descrever a iluminação, você está escrevendo para Veo, não para Kling. Três variantes estão disponíveis: Texto para Vídeo, Imagem para Vídeo e Kling O3.
Um atalho: crie um protótipo de sua foto no Kling porque é barato e rápido. Assim que o enquadramento e o movimento estiverem corretos, gere novamente a versão final no Veo 3.1 usando o prompt que você refinou agora. O fluxo de trabalho de dois modelos economiza horas.
Erros comuns na redação de prompts (e como corrigi-los)
Esses são os padrões que vemos repetidamente em prompts que não funcionam. Cada um vem com uma versão ruim e uma reescrita.
Erro 1: assunto vago
Ruim: "Uma pessoa andando pela rua."
Conserto: "Uma mulher de trinta e poucos anos com um longo sobretudo bege caminha por uma rua estreita de Paris, com as mãos nos bolsos."
O modelo precisa de uma face para renderizar. “Uma pessoa” não dá nada, ela escolhe tudo o que a média do conjunto de dados sugere, e a média raramente é interessante.
Erro 2: Sem geografia de cena
Ruim: "Um cachorro correndo em um parque."
Correção: "Um golden retriever corre do lado esquerdo para o direito do quadro, através de um amplo gramado salpicado de sol e pontilhado de folhas de outono, com árvores altas ao fundo."
Se o modelo não souber onde o sujeito está no espaço, o sujeito acaba flutuando. Dê à câmera uma noção de onde as coisas estão em relação umas às outras.
Erro 3: Sem direção de movimento
Ruim: "O carro vai embora."
Correção: "O carro vermelho se afasta da câmera, acelerando ao longe, a estrada curvando ligeiramente para a direita."
"Afasta-se" é ambíguo. Em direção à câmera? Longe disso? Lateralmente? Diga ao modelo o vetor.
Erro 4: empilhar adjetivos em vez de especificar
Ruim: "Um vídeo lindo, cinematográfico, impressionante e profissional de um pôr do sol."
Correção: "Uma imagem estática ampla do sol se pondo atrás de uma fileira de pinheiros em uma encosta, o céu mudando de dourado para magenta profundo, lapso de tempo, 4K."
O empilhamento de adjetivos não adiciona informações. Os modelos não conseguem distinguir "bonito" de "deslumbrante". Eles podem distinguir uma cena ampla de um close-up.
Erro 5: dicas de estilo conflitantes
Ruim: "Anime fotorrealista em estilo documentário noir dos anos 1950."
Correção: Escolha uma. Noir fotorreal. Ou anime de inspiração noir. Não misture estéticas incompatíveis, o modelo faz a média delas e você fica com lama visual.
Erro 6: ignorar a proporção no prompt
Ruim: "Uma foto vertical no estilo TikTok, mas gerada em 16:9 e depois cortada."
Correção: Gere na proporção em que você publicará. O modelo compõe a foto para a tela que você fornecer. Uma foto 16:9 cortada para 9:16 sempre perde o assunto.
Erro 7: Sem direção de áudio (em modelos com capacidade de áudio)
Ruim: "Uma cena de cafeteria." (no Veo 3.1)
Correção: "Uma cena de cafeteria. Conversa ambiente, máquina de café expresso sibilando ao fundo, jazz suave tocando baixo."
O Veo 3.1 gera áudio, quer você o direcione ou não. Se você não especificar, receberá uma cama ambiente genérica. Passe dois segundos contando como é o som da sala.
O ciclo de iteração (como bons prompts são realmente criados)
Ninguém escreve um ótimo prompt na primeira tentativa. Os criadores que obtêm resultados consistentemente bons não são mais talentosos, eles iteram com disciplina. Aqui está o loop que funciona.
Etapa 1: escreva seu prompt de linha de base
Use um dos padrões da Seção 3. Não otimize ainda. Basta anotar os seis ingredientes.
Etapa 2: gerar uma vez em um modelo rápido
Use Kling 2.0 ou outro modelo rápido. Você não está tentando produzir o clipe final, você está testando se o modelo entendeu a cena.
Etapa 3: diagnosticar, não reescrever
Observe o resultado e pergunte: o que o modelo errou? Foi o assunto? O movimento da câmera? A iluminação? Seja específico. “Não era o que eu queria” não é um diagnóstico.
Etapa 4: altere uma variável de cada vez
Esta é a disciplina que a maioria das pessoas ignora. Se a câmera estava errada, altere apenas a linha da câmera. Se a iluminação estiver errada, troque apenas a linha de iluminação. Se você reescrever todo o prompt, não saberá qual alteração resolveu o problema e cometerá o mesmo erro novamente na próxima tentativa.
Passo 5: Mantenha um andaime estável
Salve os prompts que funcionam em um documento, organizados por tipo, fotos de produtos, cenas de diálogo, paisagens, momentos de personagens. Quando uma cena semelhante surge mais tarde, você começa a partir de um andaime em bom estado, em vez de partir do zero. Depois de algumas semanas, você terá uma biblioteca imediata que fará a maior parte do trabalho pesado para você.
Etapa 6: Promova o vencedor
Quando um prompt estiver produzindo bons resultados confiáveis no modelo rápido, gere novamente a versão final no Veo 3.1 Standard com o mesmo prompt. A cinematografia permanece a mesma; a qualidade da produção aumenta.
Este loop parece lento. Não é. Depois de três ou quatro iterações em um projeto, é mais rápido do que adivinhar, e a qualidade aumenta porque seu andaime fica melhor a cada semana.
Modelos de prompt específicos de formato
Entregas diferentes, estruturas de alerta diferentes. Copie-os e modifique os colchetes.
TikTok / Momentos (9:16, 5-15s)
"[Objeto com roupa interessante] faz [uma única ação clara] em [ambiente urbano ou natural reconhecível]. Enquadramento vertical estilo telefone, vibração energética, luz do dia brilhante, [paleta de cores em alta]. Movimento rápido, sem câmera lenta."
Notas: Os modelos verticais compõem melhor quando você nomeia explicitamente o formato. Mantenha as ações simples, os clipes verticais não têm espaço para cenas multi-beat.
Foto do herói do YouTube (16:9, 5-10s)
"Imagem ampla cinematográfica de [assunto] em [ambiente]. Câmera lentamente [empurrar / dolly para trás / órbita]. Luz dourada da hora, lente anamórfica, profundidade de campo rasa, 4K. Design de som ambiente sutil."
Notas: 16:9 é onde o Veo 3.1 brilha. Use este formato para aberturas, fotos de heróis e rolos B.
Herói do produto (1:1 ou 16:9, 5-8s)
"Foto de estúdio do [produto] na [superfície]. O produto lentamente [gira/eleva/acende]. Luz de tecla suave de [direção], luz de borda por trás, queda profunda de sombra. Premium, estética mínima, sem pessoas, fundo limpo."
Notas: Consulte aqui a imagem para o vídeo para obter fotos precisas da marca. Bloqueie o fundo. Ambientes simples e movimentados distraem o produto.
Cena de diálogo (16:9 ou 4:3, 5-10s)
"[Duas fotos ou close-up] de [Personagem A] e [Personagem B] em [cenário]. O personagem A diz, '[linha]'. Personagem B [reação]. [Iluminação]. Câmera estática, lente de 35 mm. Ambiente [tom da sala]."
Notas: Somente Veo 3.1. Outros modelos falsificam mal o diálogo. Mantenha as linhas curtas, pois as linhas longas ficam fora de sincronia.
B-Roll / corte de textura (qualquer proporção, 3-5s)
"Macro / close-up de [objeto texturizado ou detalhe]. Sutil [movimento: vapor, ondulação, oscilação, oscilação]. [Hora da luz do dia]. Profundidade de campo rasa. Sem música, apenas ambiente."
notas: Clipes curtos parecem mais nítidos. Não estique uma sequência B-roll por mais de 5 segundos, a IA começa a inventar o movimento.
Prompts reais, resultados reais
Abaixo estão cinco prompts que testamos em muvi.video usando Veo 3.1, Seedance 2.0 e Kling 3.0. As descrições de saída são qualitativas, sua geração variará de acordo com a versão do modelo, a nuance do prompt e a data, portanto, trate-as como ilustrativas do tipo de saída que o prompt produz, e não como resultados garantidos.
Exemplo 1, paisagem cinematográfica (Veo 3.1)
"Imagem aérea ampla de um lago alpino vítreo ao nascer do sol, névoa flutuando baixa sobre a água, picos cobertos de neve refletidos na superfície. A câmera recua lentamente e inclina-se para cima para revelar a cordilheira. Luz azul suave e fria mudando para rosa quente. Cinematográfico 4K, anamórfico, sem música, vento ambiente."
Tipo de resultado: uma cena cinematográfica limpa. O pull-back e o tilt-up geralmente funcionam bem no Veo. O movimento da névoa parece natural.
Exemplo 2, Rotação de produto (Kling 2.0, imagem para vídeo)
"Rotação lenta de 360 graus. Iluminação de estúdio, superfície de concreto polido, luz de tecla programável no canto superior esquerdo, borda sutil na parte traseira. Sem movimento de câmera, moldura central do produto." (Anexado: foto do produto de um relógio)
Tipo de resultado: uma rotação confiável de heróis do comércio eletrônico. Kling lida com rotações curtas de maneira limpa quando o prompt é curto.
Exemplo 3, Momento do personagem (Veo 3.1)
"Uma jovem com um longo casaco vermelho caminha por uma praça nevada da cidade à noite, a neve caindo pesadamente. Ela para, olha para cima e sorri. Brilho suave e quente da luz da rua, fundo azul frio. Foto de rastreamento médio de lado, então ela vira e a câmera segura. Lente de 35 mm, profundidade de campo rasa."
Tipo de resultado: Momento de caractere multi-beat. O clipe de 8 segundos do Veo 3.1 se ajusta à sequência "andar, parar, olhar para cima, sorrir" com espaço para acertar cada batida, e o áudio ambiente nativo (neve leve, tom de cidade distante) é impresso ao lado do vídeo sem uma passagem de pontuação separada.
Exemplo 4, close-up de comida (Veo 3.1)
"Foto macro de chocolate amargo derretido sendo derramado lentamente sobre um morango fresco em mármore branco. Luz quente no teto, leve vapor subindo. Profundidade de campo rasa, reflexo brilhante no chocolate. Som sutil de derramamento, sem música."
Tipo de resultado: dose de comida crocante. O movimento de derramamento e a superfície reflexiva do chocolate são onde o mecanismo de física do Veo 3.1 compensa.
Exemplo 5, Animação estilizada (Kling 3.0)
"Animação 2D pintada à mão, estilo aquarela. Uma pequena raposa entra cautelosamente em uma clareira em uma floresta densa ao entardecer. Vaga-lumes flutuam ao redor dela. Paleta suave, contornos suaves, textura suave desenhada à mão, vento ambiente e insetos distantes."
Tipo de resultado: um clipe estilizado com linhas consistentes. Kling 3.0 lida com a estética de movimento estilizado, a textura em aquarela pintada à mão cai de forma mais confiável aqui do que nos modelos com inclinação fotorreal.
Uma observação sobre reprodutibilidade: os modelos de vídeo de IA mudam com frequência, e o mesmo prompt executado no mesmo modelo com seis meses de intervalo pode produzir resultados visivelmente diferentes. Trate as instruções como andaimes, não como receitas exatas.
Perguntas frequentes sobre prompts de vídeo de IA
Devo escrever avisos de vídeo de IA da mesma forma que escrevo avisos no meio da jornada?+
Os avisos no meio da jornada funcionam como listas de tags separadas por vírgula ("mulher, casaco vermelho, cinematográfico, 4k, --ar 16:9"). Os modelos de vídeo funcionam muito melhor com frases completas que descrevem ação, movimento e tempo. Escreva instruções de vídeo da mesma forma que descreveria uma cena para um diretor de fotografia, e não da mesma forma que marcaria uma imagem estática.
P2: Por que meu prompt produz resultados diferentes cada vez que eu gero? Os modelos de vídeo de IA usam sementes aleatórias, portanto, cada geração é um novo lançamento de dados com seu prompt como restrição. Mesmo o mesmo prompt executado duas vezes produzirá resultados diferentes. A maioria das plataformas permite bloquear uma semente se você precisar de reprodutibilidade, o que é útil quando você deseja testar alterações imediatas sem que o ruído da semente atrapalhe.
Qual deve ser a duração de um prompt de vídeo de IA?+
30-80 palavras é o ponto ideal para a maioria dos modelos. Com menos de 30 anos e você está com falta de direção, o modelo preenche lacunas com padrões genéricos. Mais de 100 e você atinge a fadiga imediata, onde o modelo começa a ignorar os elementos (geralmente aqueles que você escreveu por último). Para Kling 3.0, fique perto de 30 a 50 palavras. Para Veo 3.1 e Seedance 2.0, você pode avançar para 80.
Devo incluir o idioma da câmera nas minhas solicitações?+
Sim, especialmente no Veo 3.1. "Dolly in", "rack focus", "baixo ângulo", "lente 35 mm", "anamórfico", tudo isso se traduz no comportamento real da câmera que o modelo pode renderizar. Kling responde menos ao vocabulário cinematográfico, portanto, no Kling, opte por descrições mais simples, como "a câmera se move lentamente em direção ao assunto".
Os prompts negativos funcionam em modelos de vídeo de IA?+
Às vezes. Veo 3.1 e Seedance 2.0 respondem à negação simples ("sem pessoas no fundo", "sem texto na tela", "sem música"). Eles não respondem de forma confiável à negação abstrata como "não embaçado" ou "sem artefatos", pois são aspiracionais, não direcionáveis. Use negativos com moderação e para coisas específicas que você possa nomear.
P6: Posso reutilizar o mesmo prompt em modelos diferentes? Principalmente, sim. Os padrões na Seção 3 são independentes de modelo. Mas você obterá melhores resultados se ajustar por modelo, retirar o vocabulário cinematográfico do Kling 3.0, se concentrar na flexibilidade de duração e proporção de aspecto do Seedance 2.0, adicionar direção de áudio e termos cinematográficos para o Veo 3.1. Mesmo andaime, edições leves.
Existe uma maneira "correta" de combinar prompts de texto para vídeo e de imagem para vídeo?+
Para imagem para vídeo, o prompt só precisa descrever o movimento desejado, a identidade visual já está na imagem. Mantenha as instruções de imagem para vídeo curtas (10 a 30 palavras) e focadas no que deve mudar ou mudar. Prompts descritivos longos na imagem para vídeo podem combater a imagem de referência e produzir resultados confusos.
Crie uma biblioteca de prompts, não um ótimo prompt
Os criadores que obtêm uma excelente saída de vídeo de IA confiável não estão escrevendo prompts mágicos. Eles estão usando os mesmos seis ingredientes, o mesmo conjunto de padrões e a disciplina de mudar uma variável de cada vez. É isso. Depois de construir uma biblioteca pessoal de prompts, algumas dezenas de andaimes organizados por tipo de cena, você para de começar do zero e a qualidade de sua produção aumenta semana após semana.
Abra muvi.video, escolha um modelo, escreva um prompt usando um dos padrões acima e repita. O primeiro não será perfeito. O décimo será ótimo. O centésimo estará na sua biblioteca e você nunca mais o escreverá do zero.
Botão CTA: > Comece a criar vídeos de IA
Última atualização: maio de 2026. Atualizamos este guia à medida que os modelos mudam e aprendemos novos padrões no trabalho de produção.