H2 : Pourquoi un glossaire est important dans la vidéo IA
La vidéo IA se déplace rapidement. De nouveaux modèles sont expédiés mensuellement, de nouveaux noms de variantes apparaissent et la terminologie peut dériver de semaine en semaine. Un créateur qui a débuté en 2024 a peut-être appris le « texte en vidéo » et « l'image en vidéo », puis a dû apprendre « image de début/fin », « omni-référence », « pinceau de mouvement », « schéma parlant » et une douzaine d'autres d'ici 2026. Ce glossaire rassemble les 35 termes les plus utiles en 2026, à la fois les termes fondamentaux (qu'est-ce qu'un « modèle de diffusion » ?) et les termes opérationnels d'un créateur. travailler sur muvi.video sera visible dans l'interface utilisateur et la documentation du produit.
Les termes sont regroupés par sujet et classés par ordre alphabétique au sein de chaque groupe. Chaque entrée est une définition de 50 à 80 mots plus un exemple d'une ligne ou un lien vers une source canonique sur muvi.video où le terme s'applique. Utilisez-le comme référence, pas comme manuel, parcourez le terme dont vous avez besoin.
H2 : Concepts vidéo de base de l'IA
Rapport hauteur/largeur Le rapport largeur/hauteur d’une image vidéo. Les deux ratios les plus courants dans la vidéo IA sont 16:9 (paysage, utilisé pour YouTube, la vidéo de bureau et la plupart des sorties cinéma) et 9:16 (portrait, utilisé pour TikTok, Instagram Reels et YouTube Shorts). Seedance 2.0 sur muvi.video prend également en charge 1:1, 4:3, 3:4 et 21:9, la plage de formats d'image la plus large du catalogue.
Modèle de diffusion Famille de modèles d'IA génératifs qui produit des images et des vidéos en commençant par du bruit aléatoire et en le supprimant de manière itérative (débruitage) vers une cible décrite par une invite. Presque tous les modèles vidéo d'IA modernes, Veo 3.1, Seedance 2.0, Kling 3.0, Runway Gen-3, Pika 2, sont un modèle de diffusion. Le calcul derrière l’étape de débruitage est ce qui différencie une famille de modèles d’une autre.
Fréquence d'images (ips) Images par seconde, combien d’images fixes représentent une seconde de vidéo. 24 ips est la norme cinématographique ; 30 ips est courant pour la diffusion et les réseaux sociaux ; 60 ips est utilisé pour le sport et les jeux. La plupart des modèles vidéo IA produisent à des fréquences d'images fixes (généralement 24 ou 30 ips), les images par seconde sont rarement un contrôle par invite.
Image vers vidéo (I2V) Un flux de travail dans lequel l'entrée est une image fixe (plus une invite facultative) et la sortie est une vidéo qui anime cette image. L'image de référence ancre la composition, l'éclairage et l'identité du sujet, tandis que l'invite décrit le mouvement ou l'action. Veo 3.1 ECL Image-to-Video, Seedance 2.0 Image-to-Video et Kling 3.0 Image-to-Video sont les trois variantes I2V du catalogue muvi.video.
Espace latent Une représentation numérique abstraite du monde visuel dans lequel fonctionnent les modèles de diffusion, plutôt que de travailler directement sur les pixels. Lorsque vous écrivez une invite, le modèle convertit d'abord votre texte en une position dans l'espace latent, puis « débruit » vers les images vidéo qui correspondent à cette position. Les implications les plus pratiques de « l'espace latent » dont vous n'avez pas à vous soucier, le modèle gère les mathématiques.
Résolution Les dimensions en pixels de la vidéo de sortie. Les résolutions vidéo AI courantes en 2026 sont 1080p (1920×1080), 720p (1280×720) et 480p. Sur muvi.video : Veo 3.1 produit 1080p ; Seedance 2.0 produit 480p ou 720p, la variante Start/End Frame atteignant 1440p ; La résolution du Kling 3.0 dépend de la variante et de la configuration du fournisseur.
Texte vers vidéo (T2V) Le flux de travail principal de la vidéo IA moderne : saisissez une invite décrivant une scène et le modèle génère la vidéo. L'entrée est uniquement du texte, pas d'image de référence, pas d'images clés. Les trois modèles de catalogue muvi.video prennent en charge T2V comme mode par défaut.
H2 : Termes liés à des modèles spécifiques
ECL (Véo 3.1) Le préfixe de variante utilisé dans muvi.video pour les modes conditionnés par image et par image clé de Veo 3.1, ECL Image-to-Video et ECL Start/End Frame. Ces variantes acceptent les images de référence en plus de l'invite, offrant ainsi plus de contrôle spatial que la génération de texte uniquement par défaut.
Kling O3 Variante de troisième génération de Kling, distincte de Kling Text-to-Video et Kling Image-to-Video. La variante O3 se concentre sur l'esthétique du mouvement stylisé, utile lorsque l'aspect de référence d'un projet est lié à une fluidité de mouvement ou à une empreinte de rendu spécifique plutôt qu'à une spécification technique spécifique.
Brosse de mouvement (Runway Gen-3) Un outil de direction unique à Runway Gen-3 dans lequel un créateur peint une superposition de trajectoire de mouvement directement sur une image d'entrée, indiquant au modèle comment les sujets et la caméra doivent se déplacer. Il n'y a pas d'équivalent dans le catalogue muvi.video ; les analogues les plus proches sont Veo 3.1 Image-to-Video (ancre d'image) et Seedance 2.0 Start/End Frame (mouvement délimité par une image clé).
Omni-Référence (Seedance 2.0) Une variante Seedance 2.0 qui accepte jusqu'à neuf références d'image, trois références vidéo et trois références audio en une seule génération. Utile pour la continuité des personnages à travers une série de clips, des compositions multi-actifs ou pour faire correspondre une esthétique spécifique établie sur de nombreuses prises.
Cadres Pika (Pika 2) Fonction d'animation basée sur des images clés de Pika 2, dans laquelle le créateur fournit des images de début et de fin et Pika interpole le mouvement entre elles. Il n'y a pas d'équivalent direct dans le catalogue muvi.video sous ce nom exact ; Seedance 2.0 Start/End Frame et Veo 3.1 ECL Start/End couvrent la même intention créative.
Pikaffects (Pika 2) Une fonctionnalité de Pika 2 dans laquelle de courtes « invites d'effet » prédéfinies (par exemple, « exploser », « s'émietter », « fondre ») transforment une image d'entrée en un seul clic. Utile pour les travaux de nouveauté au format social ; pas actuellement reflété dans les modèles muvi.video.
Sora 2 (obsolète sur muvi.video) Le modèle vidéo d'OpenAI, précédemment proposé sur muvi.video et désormais supprimé. Tous les conseils que vous trouvez en ligne sur "utiliser Sora 2 pour X sur muvi.video" sont obsolètes, la cinématique actuelle par défaut sur muvi.video est Veo 3.1. Voir la page modèle Veo 3.1 pour l'alternative.
Image de début/fin Une variante disponible sur plusieurs modèles (Veo 3.1 ECL Start/End, Seedance 2.0 Start/End Frame) où le créateur fournit deux images de référence, la première image et la dernière image, et le modèle génère le mouvement entre elles. Utile pour les rythmes narratifs étroitement délimités, les transitions et la correspondance des plans avec les séquences existantes.
Veo 3.1 (ligne Veo) Modèle vidéo actuel de Google sur muvi.video. Génère des clips de 4, 6 ou 8 secondes en 1080p en 16:9 ou 9:16, avec un son d'ambiance et de dialogue natif dans la sortie (selon la documentation produit de Google, vérifiez le comportement actuel sur la plate-forme). Quatre variantes au catalogue : Rapide (standard), Qualité, ECL Image-to-Video, ECL Start/End Frame.
H2 : Termes de Prompt Engineering
Vocabulaire d'invite cinématographique Les termes de la grammaire du film, l'objectif (par exemple, « anamorphique », « téléobjectif 85 mm »), le style d'éclairage (par exemple, « touche Rembrandt », « heure d'or »), le mouvement de la caméra (par exemple, « chariot lent », « grue vers le bas »), la qualité des couleurs (par exemple « bleu sarcelle et orange », « tons terre sourds »), la composition et l'atmosphère, que les modèles vidéo d'IA reconnaissent et auxquels ils répondent. Consultez le Guide des invites cinématiques pour dix exemples prêts à copier sur Veo 3.1.
Invite négative Une instruction indiquant au modèle ce qu'il ne doit PAS produire, par exemple « pas de personnes en arrière-plan », « pas de texte à l'écran », « pas de musique ». Veo 3.1 et Seedance 2.0 répondent de manière fiable à une simple négation. Ils ne répondent pas de manière fiable à une négation abstraite comme « pas flou » ou « pas d'artefacts », ceux-ci sont ambitieux et non orientables.
Anatomie rapide Les composants structurés qu'une invite vidéo IA forte doit inclure : le sujet, l'environnement, l'action, le langage de la caméra, l'éclairage, la qualité des couleurs, l'atmosphère, le rapport hauteur/largeur. Suivre une structure cohérente améliore la fiabilité de la sortie et rend les itérations rapides mesurables. Voir le Pilier d'écriture rapide pour la répartition complète.
Boucle d'itération rapide Processus consistant à affiner une invite sur plusieurs générations, en modifiant une variable à la fois et en suivant le résultat. La boucle typique : prototyper sur une variante rapide (par exemple, Veo 3.1 Fast ou Kling pour le coût), verrouiller le modèle, puis composer le style et l'atmosphère sur la variante Standard ou Qualité pour la livraison finale.
Image de référence Une image fixe accompagnée d'une invite pour ancrer la composition, l'identité du personnage ou l'esthétique pour une génération d'image en vidéo ou d'omni-référence. La référence est interprétée par le modèle comme une contrainte visuelle dure, et non comme une suggestion douce, plus la résolution et la clarté de la référence sont élevées, plus la sortie y adhère fidèlement.
Graine (graine déterministe) Valeur numérique qui, lorsqu'elle est transmise avec une invite à un modèle prenant en charge la valeur de départ, produit un résultat presque identique à chaque exécution avec la même invite et la même valeur de départ. Utile pour des prises reproductibles et une cohérence entre les coupes. Veo 3.1 ne prend PAS en charge les graines déterministes ; Sora 2 prenait en charge les graines facultatives avant sa dépréciation sur muvi.video. La plupart des modèles du catalogue muvi.video en 2026 n'exposent pas le contrôle des semences.
Jeton (jeton d'invite) Unité de texte qu'un modèle consomme lors de la lecture d'une invite, environ un mot mais souvent plus court pour les termes courants ou plus long pour les termes rares. La plupart des modèles imposent un nombre maximum de jetons par invite (généralement quelques centaines) ; au-delà de la limite, le modèle tronque ou ignore la partie finale. Effet pratique : limitez les invites à 80 mots pour un comportement prévisible.
H2 : Recherche de schémas, d'explorations et d'IA
Explorateur d'IA Un robot d'exploration Web exploité par une société d'IA pour rassembler des pages à des fins de formation ou pour une utilisation en direct. Les robots d'exploration d'IA courants en 2026 incluent GPTBot (formation OpenAI), ChatGPT-User (navigation en direct), ClaudeBot (formation Anthropic), Claude-Web (navigation en direct), PerplexityBot, Google-Extended et Applebot-Extended. Le robots.txt de muvi.video accorde explicitement à ces robots l'accès aux pages publiques.
Directive Content-Signal Une directive robots.txt émergente spécifiant les utilisations du contenu exploré autorisées par le site, l'indexation de recherche, la formation de l'IA, la récupération de l'IA, la personnalisation de l'IA, sous la forme de quatre commutateurs distincts. muvi.video émet Content-Signal : search=yes, ai-train=yes, ai-retrieval=yes, ai-personalization=no dans robots.txt et comme en-tête HTTP.
E-E-A-T (Expérience, Expertise, Autorité, Fiabilité) Le cadre de qualité de Google pour évaluer le contenu éditorial. Fortement lié à la paternité liée à la personne : un article avec une véritable entité d'auteur humaine (avec une page de profil, une biographie et une expertise démontrée) est mieux classé et est plus souvent cité par les assistants IA qu'un article publié de manière anonyme ou attribué uniquement à l'organisation éditrice.
Entité (@référence id) Dans les données structurées JSON-LD, une entité est une chose distincte (une personne, une organisation, un produit, un article) identifiée par une URL « @id ». Lorsque les schémas se croisent par « @id », par exemple, le champ « auteur » d'un article faisant référence à une personne « @id » qui se trouve sur la page de profil de l'auteur, le Knowledge Graph de Google peut les connecter en un seul graphique plutôt que de les traiter comme des mentions isolées.
Schéma de la page FAQ Un type JSON-LD qui transforme la liste de questions-réponses d'une page en résultat riche « Les gens demandent également » de Google. Chaque paire question/réponse devient individuellement citable par les assistants IA. Le schéma est plus efficace lorsque la liste Q en prose et le tableau JSON-LD mainEntity correspondent exactement, la dérive entre eux sape la confiance.
Graphique des connaissances Base de données d'entités et de relations de Google, utilisée pour lever l'ambiguïté des requêtes de recherche et alimenter des fonctionnalités telles que les panneaux d'information et les aperçus de l'IA. Les pages qui émettent des références d'entité claires (avec des références croisées @id) et une dénomination cohérente sont liées dans le Knowledge Graph de manière plus fiable que les pages qui utilisent des références de texte ad hoc.
llms.txt Un fichier de démarque à la racine du site (/llms.txt) qui indique aux systèmes d'IA comment le site est structuré et quelles pages sont importantes. Analogue à robots.txt mais pour la compréhension de l'IA, pas pour le contrôle de l'exploration. Adopté par moins de 5 % des sites début 2026, l’adopter dès maintenant constitue un différenciateur.
Marquage de schéma (JSON-LD) Données structurées intégrées dans une page sous forme de bloc <script type="application/ld+json">, décrivant le type de contenu de la page et les champs clés sous une forme lisible par machine. Types courants en 2026 : article, page FAQ, liste de fils d'Ariane, organisation, site Web, application logicielle, personne, parlant. Google et les assistants IA utilisent le balisage de schéma comme signal de haute confiance sur le sujet d'une page.
Schéma parlant Un champ JSON-LD (« speakable » sur l'article) qui indique quels sélecteurs CSS d'une page lisent bien à haute voix, généralement le H1, le premier paragraphe et le bloc FAQ. Utilisé par Google Assistant et AI Overviews lors de la génération de réponses vocales à partir de contenu Web.
H2 : Conditions relatives au workflow et à la plateforme
Catalogue (catalogue de modèles) L'ensemble des modèles qu'une plateforme met à la disposition des créateurs dans un seul espace de travail. Le catalogue muvi.video en 2026 contient trois familles de modèles : Veo 3.1 (cinématique 1080p avec audio natif), Seedance 2.0 (clips de 4 à 15 secondes, six formats d'image) et Kling 3.0 (mouvement stylisé). Tous les trois accessibles depuis un seul studio sans basculer entre les plateformes.
Exécution Edge (rendu) Un environnement d'exécution sans serveur qui s'exécute à proximité géographique de l'utilisateur, utilisé pour le rendu à faible latence du contenu dynamique. Les images graphiques ouvertes par route de muvi.video sont rendues sur le runtime Edge, chaque page reçoit une image OG fraîchement rendue à la demande, mise en cache de manière agressive par le CDN après le premier accès.
Flux de travail multimodèle La pratique consistant à combiner plusieurs modèles vidéo IA dans un seul projet, par exemple, prototyper un plan sur Kling 3.0 car il itère rapidement, puis régénérer le final sur Veo 3.1 car il est livré en 1080p avec audio. muvi.video est structuré pour rendre les flux de travail multimodèles transparents : historique des invites partagé, comparaison côte à côte, surface de facturation unique.
Pièce par clip/facturation par pièce Le modèle de facturation de muvi.video : chaque génération déduit les pièces de votre allocation mensuelle. Le nombre de pièces par génération varie selon le modèle, la variante, la résolution et la longueur du clip, consultez la page de tarification pour connaître les coûts actuels par génération. Différent des plates-formes par abonnement uniquement qui facturent des frais mensuels fixes quelle que soit l'utilisation.
Variante (variante de modèle) Une configuration spécifique d'un modèle de base. Exemple : Veo 3.1 comporte quatre variantes : Rapide, Qualité, ECL Image-to-Video, ECL Start/End Frame, chacune optimisée pour une intention différente. Les variantes partagent généralement la même grammaire d'invite mais diffèrent en termes de vitesse, de fidélité de sortie ou de modalité de saisie (texte uniquement ou conditionné par image).
H2 : Mettre ces termes en pratique
Le glossaire est très utile lorsque vous lisez d'autres pages muvi.video et avez besoin d'une définition rapide, ouvrez cette page dans un onglet et recherchez (⌘F / Ctrl+F) le terme. Chaque définition est autonome ; vous pouvez citer une seule définition sans avoir besoin du contexte environnant.
Si vous débutez dans la vidéo IA, commencez par la section Concepts de base (Section 3), six termes qui couvrent les bases. À partir de là, la section Conditions spécifiques au modèle (Section 4) explique ce que propose chaque modèle dans le catalogue muvi.video. La section Ingénierie des invites (Section 5) est l'endroit où se déroule la plupart des travaux pratiques quotidiens, anatomie, boucle d'itération, invites négatives.
Si vous évaluez muvi.video par rapport à une autre plate-forme, la section Schéma et recherche IA (Section 6) explique les fondements des données structurées qui affectent la façon dont les assistants IA présentent nos pages par rapport à celles de nos concurrents. La section Workflow et plateforme (Section 7) couvre le vocabulaire opérationnel que vous verrez dans l'interface utilisateur du produit et dans les discussions sur les prix.
H2 : Questions fréquemment posées
Q1 : Quel est le terme vidéo IA le plus important à apprendre en premier ? Pour la plupart des créateurs en 2026, le terme le plus important à internaliser est l'anatomie de l'invite, les composants structurés (sujet, environnement, action, langage de la caméra, éclairage, qualité des couleurs, atmosphère, rapport hauteur/largeur) qu'une invite vidéo d'IA forte devrait inclure. Tous les autres termes de ce glossaire sont liés à l'anatomie de l'invite à un certain niveau, car c'est à l'invite que se produit presque tout le contrôle par génération.
Q2 : Ces termes sont-ils transférables entre les modèles vidéo IA ? Surtout, oui. Les concepts de base (section 3) et les termes d'ingénierie d'invite (section 5) sont en grande partie indépendants du modèle, une « invite négative » signifie la même chose sur Veo 3.1, Seedance 2.0, Kling 3.0 ou tout autre modèle vidéo d'IA basé sur la diffusion. Les termes spécifiques au modèle (section 4) sont évidemment spécifiques au modèle par définition, mais ils ont souvent des analogues fonctionnels sur d'autres modèles (par exemple, l'ECL Start/End de Veo 3.1 couvre la même intention que les Pikaframes de Pika 2).
Q3 : Pourquoi Sora 2 n'est-il pas répertorié dans le catalogue muvi.video ? Sora 2 était auparavant proposé sur muvi.video et est désormais obsolète. La valeur cinématographique actuelle par défaut sur muvi.video est Veo 3.1, qui génère des clips de 4, 6 ou 8 secondes en 1080p avec un son ambiant natif. Si vous êtes arrivé à ce glossaire à la recherche de conseils d'invite pour Sora 2, consultez le Guide d'invite Veo 3.1 pour l'équivalent sur muvi.video aujourd'hui.
Q4 : À quelle fréquence ce glossaire est-il mis à jour ? Notre objectif est de revoir le glossaire chaque fois que muvi.video ajoute ou supprime une variante de modèle, ou lorsqu'un nouveau terme largement adopté (comme « directive Content-Signal » ou « llms.txt ») devient suffisamment courant pour que les créateurs le rencontrent dans la documentation quotidienne. Les 35 termes ici reflètent ce qui est le plus utile à la mi-2026, attendez-vous à 5 à 10 ajouts et révisions par an à mesure que le domaine évolue.
Q5 : Y a-t-il des termes manquants dans ce glossaire ? Il est presque certain que le domaine de la vidéo IA génère une nouvelle terminologie plus rapidement qu’aucun glossaire ne peut suivre. Si vous rencontrez un terme dans la documentation muvi.video ou dans la communauté vidéo IA plus large qui ne figure pas ici, les candidats les plus probables pour une inclusion future sont : le conditionnement ControlNet, les réglages fins LoRA, les vecteurs de mouvement, le guidage du flux optique et la génération sensible à la profondeur. Chacun est plus avancé que la base couverte dans cette version.
Q6 : Où puis-je en savoir plus sur l'ingénierie des invites en particulier ? Consultez le Prompt-Writing Pillar, un guide détaillé couvrant l'anatomie des invites, les modèles inter-modèles dans Veo 3.1, Seedance 2.0 et Kling 3.0, les erreurs courantes et une boucle d'itération fonctionnelle. C'est la prochaine lecture naturelle après ce glossaire si vous vous concentrez sur l'artisanat rapide et pratique.
Q7 : Comment puis-je citer ce glossaire si j'écris sur la vidéo IA ? Utilisez l'URL canonique « https://muvi.video/blog/ai-video-glossary » et la date de publication indiquée en haut de la page. Le schéma de l'article sur cette page expose les métadonnées de citation (titre, auteur, datePublished, dateModified) pour les assistants IA et le Knowledge Graph de Google, ils peuvent citer des définitions de termes individuels avec attribution lorsqu'ils répondent aux questions des utilisateurs.
H2 : Appliquer ces conditions sur muvi.video
Le moyen le plus rapide d'intérioriser ce vocabulaire est de l'utiliser, de générer quelques clips sur muvi.video et de remarquer quels termes décrivent ce que vous faites. Veo 3.1 pour les plans cinématographiques et les rythmes narratifs, Seedance 2.0 pour des prises continues plus longues dans plus de formats, Kling 3.0 pour un mouvement stylisé. Tous les trois accessibles depuis un seul studio.
CTA :
Générer une vidéo AI gratuitement →