Blog
Glossário de vídeos de IA: 35 termos que todo criador deve saber em 2026
Definições práticas para a terminologia por trás de texto para vídeo, imagem para vídeo, modelos de difusão, engenharia imediata e o catálogo de vídeo de IA em muvi.video, Veo 3.1, Seedance 2.0 e Kling 3.0.
Por Gürsu Yaman · Fundador, muvi.video ·
Por que um glossário é importante em vídeos de IA
O vídeo de IA se move rapidamente. Novos modelos são enviados mensalmente, novos nomes de variantes aparecem e a terminologia pode variar de semana para semana. Um criador que começou em 2024 pode ter aprendido "texto para vídeo" e "imagem para vídeo", então precisou absorver "quadro inicial/final", "omni-referência", "pincel de movimento", "esquema falável" e uma dúzia de outros até 2026. Este glossário coleta os 35 termos mais úteis em 2026, tanto os fundamentais (o que é um "modelo de difusão"?) quanto os operacionais que um criador trabalhando em muvi.video verá na interface do usuário e na documentação do produto.
Os termos são agrupados por tópico e listados em ordem alfabética dentro de cada grupo. Cada entrada é uma definição de 50 a 80 palavras, além de um exemplo de uma linha ou link para uma fonte canônica em muvi.video onde o termo se aplica. Use-o como referência, não como um livro didático, procure o termo que você precisa.
Conceitos básicos de vídeo de IA
Proporção A proporção largura/altura de um quadro de vídeo. As duas proporções mais comuns em vídeos de IA são 16:9 (paisagem, usada para YouTube, vídeo de desktop e saída mais cinematográfica) e 9:16 (retrato, usada para TikTok, Instagram Reels e YouTube Shorts). O Seedance 2.0 no muvi.video também suporta 1:1, 4:3, 3:4 e 21:9, a faixa de proporção de aspecto mais ampla do catálogo.
Modelo de difusão A família de modelos generativos de IA que produz imagens e vídeos começando com ruído aleatório e removendo-o iterativamente (eliminação de ruído) em direção a um alvo descrito por um prompt. Quase todos os modelos modernos de vídeo de IA, Veo 3.1, Seedance 2.0, Kling 3.0, Runway Gen-3, Pika 2, são modelos de difusão. A matemática por trás da etapa de eliminação de ruído é o que diferencia uma família de modelos de outra.
Taxa de quadros (fps) Quadros por segundo, quantas imagens estáticas constituem um segundo de vídeo. 24fps é o padrão cinematográfico; 30fps é comum para transmissão e redes sociais; 60fps são usados para esportes e jogos. A maioria dos modelos de vídeo de IA produz em taxas de quadros fixas (normalmente 24 ou 30 fps). O fps raramente é um controle por prompt.
Imagem para vídeo (I2V) Um fluxo de trabalho em que a entrada é uma imagem estática (mais um prompt opcional) e a saída é um vídeo que anima essa imagem. A imagem de referência ancora a composição, a iluminação e a identidade do assunto, enquanto o prompt descreve o movimento ou ação. Veo 3.1 ECL Image-to-Video, Seedance 2.0 Image-to-Video e Kling 3.0 Image-to-Video são as três variantes I2V no catálogo muvi.video.
Espaço latente Uma representação numérica abstrata do mundo visual em que os modelos de difusão funcionam, em vez de trabalhar diretamente em pixels. Quando você escreve um prompt, o modelo primeiro converte seu texto em uma posição no espaço latente e, em seguida, "reduz o ruído" em direção aos quadros de vídeo que correspondem a essa posição. A maioria das implicações práticas do "espaço latente" com as quais você não precisa se preocupar, o modelo cuida da matemática.
Resolução As dimensões em pixels do vídeo de saída. As resoluções de vídeo AI comuns em 2026 são 1080p (1920×1080), 720p (1280×720) e 480p. Em muvi.video: Veo 3.1 produz 1080p; Seedance 2.0 produz 480p ou 720p, com a variante Start/End Frame atingindo 1440p; A resolução do Kling 3.0 depende da variante e da configuração do provedor.
Texto para vídeo (T2V) O fluxo de trabalho principal do vídeo de IA moderno: digite um prompt descrevendo uma cena e o modelo gera o vídeo. A entrada é somente texto, sem imagem de referência, sem quadros-chave. Todos os três modelos do catálogo muvi.video suportam T2V como modo padrão.
Termos vinculados a modelos específicos
ECL (Veo 3.1) O prefixo variante usado em muvi.video para os modos condicionados por imagem e quadro-chave do Veo 3.1, ECL Image-to-Video e ECL Start/End Frame. Essas variantes aceitam imagens de referência além do prompt, proporcionando mais controle espacial do que a geração padrão somente de texto.
Kling O3 Variante de terceira geração do Kling, distinta do Kling Text-to-Video e Kling Image-to-Video. A variante O3 concentra-se na estética de movimento estilizado, útil quando a aparência de referência de um projeto está vinculada a uma suavidade de movimento específica ou impressão digital de renderização, em vez de a uma especificação técnica específica.
Pincel de movimento (Pista Gen-3) Uma ferramenta de direção exclusiva do Runway Gen-3, onde um criador pinta uma sobreposição de caminho de movimento diretamente em uma imagem de entrada, informando ao modelo como os objetos e a câmera devem se mover. Não há equivalente no catálogo muvi.video; os análogos mais próximos são Veo 3.1 Image-to-Video (frame-âncora) e Seedance 2.0 Start/End Frame (movimento limitado por quadro-chave).
Omni-Referência (Seedance 2.0) Uma variante do Seedance 2.0 que aceita até nove referências de imagem, três referências de vídeo e três referências de áudio em uma única geração. Útil para a continuidade do personagem em uma série de clipes, composições com vários recursos ou para combinar uma estética específica estabelecida em muitas tomadas.
Pikaframes (Pika 2) Recurso de animação baseado em quadro-chave do Pika 2, onde o criador fornece quadros iniciais e finais e Pika interpola o movimento entre eles. Não há equivalente direto no catálogo muvi.video com esse nome exato; Seedance 2.0 Start/End Frame e Veo 3.1 ECL Start/End cobrem a mesma intenção criativa.
Pikaffects (Pika 2) Um recurso do Pika 2 onde "prompts de efeito" curtos e predefinidos (por exemplo, "explodir", "desmoronar", "derreter") transformam uma imagem de entrada com um único clique. Útil para trabalhos inovadores em formato social; atualmente não é espelhado nos modelos muvi.video.
Sora 2 (obsoleto em muvi.video) Modelo de vídeo da OpenAI, anteriormente oferecido em muvi.video e agora removido. Qualquer orientação que você encontrar on-line sobre "usar Sora 2 para X em muvi.video" está desatualizada, o padrão cinematográfico atual em muvi.video é Veo 3.1. Consulte a página do modelo Veo 3.1 para obter a alternativa.
Quadro inicial/final Uma variante disponível em vários modelos (Veo 3.1 ECL Start/End, Seedance 2.0 Start/End Frame) onde o criador fornece duas imagens de referência, o primeiro quadro e o último quadro, e o modelo gera o movimento entre elas. Útil para batidas narrativas bem delimitadas, transições e tomadas correspondentes a filmagens existentes.
Veo 3.1 (linha Veo) O modelo de vídeo atual do Google em muvi.video. Gera clipes de 4, 6 ou 8 segundos a 1080p em 16:9 ou 9:16, com ambiente nativo e áudio de diálogo na saída (de acordo com a documentação do produto do Google, verifique o comportamento atual na plataforma). Quatro variantes no catálogo: Rápido (padrão), Qualidade, ECL Image-to-Video, ECL Start/End Frame.
Termos da Prompt Engineering
Vocabulário de prompt cinematográfico Os termos de gramática do filme, lente (por exemplo, "anamórfica", "telefoto de 85 mm"), estilo de iluminação (por exemplo, "chave Rembrandt", "hora de ouro"), movimento da câmera (por exemplo, "entrada lenta", "guindaste para baixo"), grau de cor (por exemplo, "verde-azulado e laranja", "tons de terra silenciados"), composição e atmosfera, que os modelos de vídeo de IA reconhecem e respondem. Consulte o guia Cinematic Prompts para dez exemplos prontos para cópia no Veo 3.1.
Aviso negativo Uma instrução informando ao modelo o que NÃO produzir, por exemplo, "sem pessoas no fundo", "sem texto na tela", "sem música". Veo 3.1 e Seedance 2.0 respondem de forma confiável à simples negação. Eles não respondem de forma confiável à negação abstrata como "não embaçado" ou "sem artefatos", pois são aspiracionais, não direcionáveis.
Anatomia imediata Os componentes estruturados de um prompt de vídeo de IA forte devem incluir: assunto, ambiente, ação, linguagem da câmera, iluminação, qualidade de cor, atmosfera, proporção de aspecto. Seguir uma estrutura consistente melhora a confiabilidade da saída e torna mensurável a iteração imediata. Consulte o pilar Prompt-Writing para obter informações completas.
Loop de iteração imediata O processo de refinar um prompt através de múltiplas gerações, alterando uma variável por vez e acompanhando o resultado. O ciclo típico: protótipo em uma variante rápida (por exemplo, Veo 3.1 Fast ou Kling pelo custo), bloqueie o modelo e, em seguida, selecione estilo e atmosfera na variante Padrão ou Qualidade para entrega final.
Imagem de referência Uma imagem estática passada junto com um prompt para ancorar a composição, a identidade do personagem ou a estética para uma geração de imagem para vídeo ou omni-referência. A referência é interpretada pelo modelo como uma restrição visual rígida, não uma sugestão suave; quanto maior a resolução e clareza da referência, mais fielmente a saída adere a ela.
Semente (semente determinística) Um valor numérico que, quando passado junto com um prompt para um modelo de suporte de valor inicial, produz um resultado quase idêntico em cada execução com o mesmo prompt e valor inicial. Útil para tomadas reproduzíveis e consistência entre cortes. Veo 3.1 NÃO suporta sementes determinísticas; Sora 2 suportava sementes opcionais antes de sua descontinuação em muvi.video. A maioria dos modelos do catálogo muvi.video em 2026 não expõe o controle de sementes.
Token (token de prompt) A unidade de texto que um modelo consome ao ler um prompt, aproximadamente uma palavra, mas geralmente mais curta para termos comuns ou mais longa para termos raros. A maioria dos modelos impõe uma contagem máxima de tokens por prompt (normalmente algumas centenas); acima do limite, o modelo trunca ou ignora a parte final. Efeito prático: mantenha as instruções com menos de 80 palavras para um comportamento previsível.
Esquema, rastreadores e pesquisa de IA
Rastreador de IA Um rastreador da web operado por uma empresa de IA para coletar páginas para treinamento ou para navegação ao vivo. Rastreadores de IA comuns em 2026 incluem GPTBot (treinamento OpenAI), ChatGPT-User (navegação ao vivo), ClaudeBot (treinamento antrópico), Claude-Web (navegação ao vivo), PerplexityBot, Google-Extended e Applebot-Extended. O robots.txt do muvi.video concede explicitamente a esses rastreadores acesso a páginas públicas.
Diretiva Content-Signal Uma diretiva robots.txt emergente especificando quais usos de conteúdo rastreado o site permite, indexação de pesquisa, treinamento de IA, recuperação de IA, personalização de IA, como quatro opções separadas. muvi.video emite Content-Signal: search=yes, ai-train=yes, ai-retrieval=yes, ai-personalization=no em robots.txt e como um cabeçalho HTTP.
E-E-A-T (Experiência, Conhecimento, Autoridade, Confiabilidade) Estrutura de qualidade do Google para avaliação de conteúdo editorial. Fortemente vinculado à autoria vinculada à pessoa: um artigo com uma entidade de autor humano real (com uma página de perfil, biografia e experiência demonstrada) tem classificação mais elevada e é citado com mais frequência por assistentes de IA do que um artigo publicado anonimamente ou atribuído apenas à organização editora.
Entidade (@id referência) Em dados estruturados JSON-LD, uma entidade é algo distinto (uma pessoa, organização, produto, artigo) identificada por um URL @id. Quando os esquemas fazem referência cruzada entre si por @id, por exemplo, o campo author de um artigo referenciando uma pessoa @id que reside na página de perfil do autor, o Knowledge Graph do Google pode conectá-los em um único gráfico, em vez de tratá-los como menções isoladas.
Esquema da página FAQ Um tipo JSON-LD que transforma a lista de perguntas e respostas de uma página na pesquisa aprimorada "As pessoas também perguntam" do Google. Cada par de pergunta/resposta torna-se individualmente citável por assistentes de IA. O esquema é mais eficaz quando a lista Q em prosa e a matriz JSON-LD mainEntity correspondem exatamente, o desvio entre eles prejudica a confiança.
Gráfico de conhecimento O banco de dados de entidades e relacionamentos do Google, usado para desambiguar consultas de pesquisa e potencializar recursos como painéis de informações e visões gerais de IA. Páginas que emitem referências de entidade claras (com referências cruzadas @id) e nomenclatura consistente são vinculadas ao Mapa de conhecimento de forma mais confiável do que páginas que usam referências de texto ad-hoc.
llms.txt Um arquivo markdown na raiz do site (/llms.txt) que informa aos sistemas de IA como o site está estruturado e quais páginas são importantes. Análogo ao robots.txt, mas para compreensão de IA, não para controle de rastreamento. Adotado por menos de 5% dos sites no início de 2026, adotá-lo agora é um diferencial.
Marcação de esquema (JSON-LD) Dados estruturados incorporados em uma página como um bloco <script type="application/ld+json">, descrevendo o tipo de conteúdo da página e os campos-chave em formato legível por máquina. Tipos comuns em 2026: Artigo, FAQPage, BreadcrumbList, Organization, WebSite, SoftwareApplication, Person, Speakable. Os assistentes do Google e de IA usam a marcação de esquema como um sinal de alta confiança do assunto de uma página.
Esquema falável Um campo JSON-LD (speakable no artigo) que sinaliza quais seletores CSS de uma página são lidos em voz alta, normalmente o H1, o primeiro parágrafo e o bloco FAQ. Usado pelo Google Assistant e pelas visões gerais de IA ao gerar respostas faladas a partir de conteúdo da web.
Fluxo de trabalho e termos da plataforma
Catálogo (catálogo de modelos) O conjunto de modelos que uma plataforma disponibiliza aos criadores em um espaço de trabalho. O catálogo muvi.video em 2026 contém três famílias de modelos: Veo 3.1 (1080p cinematográfico com áudio nativo), Seedance 2.0 (clipes de 4 a 15 segundos, seis proporções) e Kling 3.0 (movimento estilizado). Todos os três acessíveis em um único estúdio, sem alternar entre plataformas.
Tempo de execução do Edge (renderização) Um ambiente de execução sem servidor que é executado geograficamente próximo ao usuário, usado para renderização de conteúdo dinâmico com baixa latência. As imagens de gráfico aberto por rota do muvi.video são renderizadas no tempo de execução do Edge, cada página obtém uma imagem OG recém-renderizada sob demanda, armazenada em cache agressivamente pelo CDN após o primeiro acesso.
Fluxo de trabalho multimodelo A prática de combinar vários modelos de vídeo de IA em um projeto, por exemplo, criar um protótipo de uma cena no Kling 3.0 porque ele itera rapidamente e, em seguida, regenerar o final no Veo 3.1 porque é fornecido em 1080p com áudio. muvi.video está estruturado para tornar fluxos de trabalho multimodelos perfeitos: histórico de prompts compartilhado, comparação lado a lado, superfície de faturamento única.
Moeda por clipe/faturamento baseado em moeda Modelo de cobrança do muvi.video: cada geração deduz moedas da cota mensal do seu plano. O número de moedas por geração varia de acordo com o modelo, variante, resolução e duração do clipe. Consulte a página de preços para saber os custos atuais por geração. Diferente das plataformas somente de assinatura que cobram uma taxa mensal fixa, independentemente do uso.
Variante (variante do modelo) Uma configuração específica de um modelo básico. Exemplo: Veo 3.1 tem quatro variantes, Fast, Quality, ECL Image-to-Video, ECL Start/End Frame, cada uma otimizada para uma intenção diferente. As variantes normalmente compartilham a mesma gramática de prompt, mas diferem em velocidade, fidelidade de saída ou modalidade de entrada (somente texto vs. condicionada por imagem).
Colocando estes termos em prática
O glossário é mais útil quando você está lendo outras páginas do muvi.video e precisa de uma definição rápida, abra esta página em uma aba e pesquise (⌘F / Ctrl+F) pelo termo. Cada definição é independente; você pode citar uma única definição sem precisar do contexto circundante.
Se você é novo no vídeo de IA, comece com a seção Conceitos Básicos (Seção 3), seis termos que cobrem a base. A partir daí, a seção Termos Específicos do Modelo (Seção 4) explica o que cada modelo oferece no catálogo muvi.video. A seção Prompt Engineering (Seção 5) é onde acontece a maior parte do trabalho prático do dia a dia, anatomia, loop de iteração, prompts negativos.
Se você estiver avaliando muvi.video em relação a outra plataforma, a seção Esquema e pesquisa de IA (Seção 6) explica os fundamentos dos dados estruturados que afetam como os assistentes de IA apresentam nossas páginas em comparação com as dos concorrentes. A seção Fluxo de trabalho e plataforma (Seção 7) cobre o vocabulário operacional que você verá na interface do produto e nas discussões sobre preços.
Perguntas frequentes
Qual é o termo de vídeo de IA mais importante para aprender primeiro?+
Para a maioria dos criadores em 2026, o termo mais importante a ser internalizado é anatomia do prompt, os componentes estruturados (assunto, ambiente, ação, linguagem da câmera, iluminação, classificação de cores, atmosfera, proporção de aspecto) que um prompt de vídeo de IA forte deve incluir. Todos os outros termos neste glossário se conectam à anatomia do prompt em algum nível, porque o prompt é onde acontece quase todo o controle por geração.
Esses termos são transferidos entre modelos de vídeo de IA?+
Principalmente, sim. Os Conceitos Básicos (Seção 3) e os Termos de Engenharia de Prompt (Seção 5) são em grande parte independentes do modelo, um "prompt negativo" significa a mesma coisa no Veo 3.1, Seedance 2.0, Kling 3.0 ou qualquer outro modelo de vídeo de IA baseado em difusão. Os termos específicos do modelo (Seção 4) são obviamente específicos do modelo por definição, mas geralmente têm análogos funcionais em outros modelos (por exemplo, ECL Start/End do Veo 3.1 cobre a mesma intenção que os Pikaframes do Pika 2).
Por que Sora 2 não está listado no catálogo muvi.video?+
Sora 2 foi oferecido anteriormente em muvi.video e agora está obsoleto. O padrão cinematográfico atual no muvi.video é o Veo 3.1, que gera clipes de 4, 6 ou 8 segundos a 1080p com áudio ambiente nativo. Se você chegou a este glossário procurando orientação sobre prompts do Sora 2, consulte o Guia de prompts do Veo 3.1 para obter o equivalente em muvi.video hoje.
Com que frequência este glossário é atualizado?+
Nosso objetivo é revisitar o glossário cada vez que muvi.video adiciona ou remove uma variante de modelo, ou quando um novo termo amplamente adotado (como "diretiva Content-Signal" ou "llms.txt") se torna comum o suficiente para que os criadores o encontrem na documentação cotidiana. Os 35 termos aqui refletem o que é mais útil em meados de 2026, esperando-se de 5 a 10 adições e revisões por ano à medida que o campo evolui.
P5: Faltam termos neste glossário? Quase certamente, o campo de vídeo de IA gera nova terminologia mais rápido do que qualquer glossário consegue acompanhar. Se você encontrar um termo na documentação do muvi.video ou na comunidade mais ampla de vídeos de IA que não esteja aqui, os candidatos mais prováveis para inclusão futura são: condicionamento ControlNet, ajustes finos de LoRA, vetores de movimento, orientação de fluxo óptico e geração com reconhecimento de profundidade. Cada um é mais avançado do que a base abordada nesta versão.
P6: Onde posso aprender mais especificamente sobre engenharia imediata? Consulte o pilar de escrita de prompt, um guia extenso que cobre anatomia de prompt, padrões de modelos cruzados no Veo 3.1, Seedance 2.0 e Kling 3.0, erros comuns e um loop de iteração funcional. É a próxima leitura natural após este glossário se o seu foco for a arte prática e imediata.
P7: Como posso citar este glossário se estou escrevendo sobre vídeos de IA? Use o URL canônico https://muvi.video/blog/ai-video-glossary e a data de publicação listada no topo da página. O esquema do artigo nesta página expõe os metadados de citação (título, autor, data de publicação, dataModificada) para assistentes de IA e para o Gráfico de conhecimento do Google. Eles podem citar definições de termos individuais com atribuição quando respondem às perguntas dos usuários.
Aplique estes Termos em muvi.video
A maneira mais rápida de internalizar esse vocabulário é usá-lo, gerar alguns clipes no muvi.video e observar quais termos descrevem o que você está fazendo. Veo 3.1 para tomadas de estabelecimento cinematográficas e batidas narrativas, Seedance 2.0 para tomadas contínuas mais longas em mais proporções, Kling 3.0 para movimentos estilizados. Todos os três acessíveis a partir de um estúdio.
CTA:
Gere vídeo AI gratuitamente →
Related Guides
Glossário de vídeos de IA: 35 termos que todo criador deve saber em 2026
Definições práticas para a terminologia por trás de texto para vídeo, imagem para vídeo, modelos de difusão, engenharia imediata e o catálogo de vídeo de IA em muvi.video, Veo 3.1, Seedance 2.0 e Kling 3.0.