Blog
El glosario de vídeos de IA: 35 términos que todo creador debería conocer en 2026
Definiciones prácticas de la terminología detrás de texto a video, imagen a video, modelos de difusión, ingeniería rápida y el catálogo de videos de IA en muvi.video, Veo 3.1, Seedance 2.0 y Kling 3.0.
Por Gürsu Yaman · Fundador, muvi.video ·
Por qué es importante un glosario en un vídeo de IA
El vídeo con IA se mueve rápido. Los nuevos modelos se envían mensualmente, aparecen nuevos nombres de variantes y la terminología puede variar de una semana a otra. Un creador que comenzó en 2024 puede haber aprendido "texto a video" e "imagen a video", y luego tuvo que absorber "cuadro inicial/final", "omnireferencia", "pincel de movimiento", "esquema descriptivo" y una docena más para 2026. Este glosario recopila los 35 términos más útiles en 2026, tanto los fundamentales (¿qué es un "modelo de difusión"?) como los operativos de un creador que trabaja en muvi.video se verá en la interfaz de usuario y la documentación del producto.
Los términos están agrupados por tema y enumerados alfabéticamente dentro de cada grupo. Cada entrada es una definición de 50 a 80 palabras más un ejemplo de una línea o un enlace a una fuente canónica en muvi.video donde se aplica el término. Úselo como referencia, no como libro de texto, busque el término que necesita.
Conceptos básicos de vídeo de IA
Relación de aspecto La relación ancho-alto de un fotograma de vídeo. Las dos proporciones más comunes en videos con IA son 16:9 (paisaje, usado para YouTube, videos de escritorio y la mayoría de salidas cinematográficas) y 9:16 (vertical, usado para TikTok, Instagram Reels y YouTube Shorts). Seedance 2.0 en muvi.video también admite 1:1, 4:3, 3:4 y 21:9, el rango de relaciones de aspecto más amplio del catálogo.
Modelo de difusión La familia de modelos de IA generativa que produce imágenes y videos comenzando con ruido aleatorio y eliminándolo iterativamente (eliminación de ruido) hacia un objetivo descrito mediante un mensaje. Casi todos los modelos de vídeo de IA modernos, Veo 3.1, Seedance 2.0, Kling 3.0, Runway Gen-3, Pika 2, son modelos de difusión. La matemática detrás del paso de eliminación de ruido es lo que diferencia una familia modelo de otra.
Velocidad de fotogramas (fps) Fotogramas por segundo, cuántas imágenes fijas componen un segundo de vídeo. 24 fps es el estándar cinematográfico; 30 fps es común para transmisiones y redes sociales; 60 fps se utilizan para deportes y juegos. La mayoría de los modelos de vídeo con IA emiten a velocidades de fotogramas fijas (normalmente 24 o 30 fps), los fps rara vez son un control por mensaje.
Imagen a vídeo (I2V) Un flujo de trabajo donde la entrada es una imagen fija (más un mensaje opcional) y la salida es un vídeo que anima esa imagen. La imagen de referencia ancla la composición, la iluminación y la identidad del sujeto, mientras que el mensaje describe el movimiento o la acción. Veo 3.1 ECL Image-to-Video, Seedance 2.0 Image-to-Video y Kling 3.0 Image-to-Video son las tres variantes de I2V en el catálogo de muvi.video.
Espacio latente Una representación numérica abstracta del mundo visual en el que funcionan los modelos de difusión, en lugar de trabajar directamente en píxeles. Cuando escribe un mensaje, el modelo primero convierte su texto en una posición en el espacio latente, luego "elimina ruido" hacia los fotogramas de video que coinciden con esa posición. No necesita preocuparse por la mayoría de las implicaciones prácticas del "espacio latente", el modelo se encarga de las matemáticas.
Resolución Las dimensiones en píxeles del vídeo de salida. Las resoluciones de vídeo de IA comunes en 2026 son 1080p (1920×1080), 720p (1280×720) y 480p. En muvi.video: Veo 3.1 produce 1080p; Seedance 2.0 produce 480p o 720p, y la variante de cuadro inicial/final alcanza 1440p; La resolución de Kling 3.0 depende de la variante y la configuración del proveedor.
Texto a vídeo (T2V) El flujo de trabajo principal del vídeo con IA moderno: escriba un mensaje que describa una escena y el modelo generará el vídeo. La entrada es solo texto, sin imagen de referencia ni fotogramas clave. Los tres modelos del catálogo de muvi.video admiten T2V como modo predeterminado.
Términos vinculados a modelos específicos
ECL (Veo 3.1) El prefijo variante utilizado en muvi.video para los modos de imagen condicionada y fotograma clave de Veo 3.1, ECL Imagen a vídeo y ECL Marco inicial/final. Estas variantes aceptan imágenes de referencia además del mensaje, lo que brinda más control espacial que la generación predeterminada de solo texto.
Kling O3 Variante de tercera generación de Kling, distinta de Kling Text-to-Video y Kling Image-to-Video. La variante O3 se centra en una estética de movimiento estilizada, útil cuando el aspecto de referencia de un proyecto está vinculado a una suavidad de movimiento específica o una huella digital de representación en lugar de una especificación técnica específica.
Cepillo de movimiento (Runway Gen-3) Una herramienta de dirección exclusiva de Runway Gen-3 donde un creador pinta una superposición de ruta de movimiento directamente sobre una imagen de entrada, indicándole al modelo cómo deben moverse los sujetos y la cámara. No existe ningún equivalente en el catálogo de muvi.video; los análogos más cercanos son Veo 3.1 Image-to-Video (anclaje de cuadros) y Seedance 2.0 Start/End Frame (movimiento limitado por fotogramas clave).
Omni-Referencia (Seedance 2.0) Una variante de Seedance 2.0 que acepta hasta nueve referencias de imágenes, tres referencias de vídeo y tres referencias de audio en una sola generación. Útil para la continuidad del personaje en una serie de clips, composiciones de múltiples recursos o para combinar una estética establecida específica en muchas tomas.
Pikaframes (Pika 2) La función de animación basada en fotogramas clave de Pika 2, donde el creador proporciona fotogramas iniciales y finales y Pika interpola el movimiento entre ellos. No existe un equivalente directo en el catálogo de muvi.video con ese nombre exacto; Seedance 2.0 Start/End Frame y Veo 3.1 ECL Start/End cubren la misma intención creativa.
Pika efectos (Pika 2) Una característica de Pika 2 donde "mensajes de efectos" breves y predefinidos (por ejemplo, "explotar", "desmoronarse", "derretirse") transforman una imagen de entrada con un solo clic. Útil para trabajos novedosos de formato social; Actualmente no se refleja en los modelos de muvi.video.
Sora 2 (obsoleto en muvi.video) Modelo de vídeo de OpenAI, ofrecido anteriormente en muvi.video y ahora eliminado. Cualquier guía que encuentre en línea sobre "usar Sora 2 para X en muvi.video" está desactualizada; la cinemática predeterminada actual en muvi.video es Veo 3.1. Consulte la página del modelo Veo 3.1 para conocer la alternativa.
Marco inicial/final Una variante disponible en varios modelos (Veo 3.1 ECL Start/End, Seedance 2.0 Start/End Frame) donde el creador proporciona dos imágenes de referencia, el primer fotograma y el último fotograma, y el modelo genera el movimiento entre ellos. Útil para ritmos narrativos muy delimitados, transiciones y tomas coincidentes con metraje existente.
Veo 3.1 (línea Veo) Modelo de vídeo actual de Google en muvi.video. Genera clips de 4, 6 u 8 segundos a 1080p en 16:9 o 9:16, con audio ambiental y de diálogo nativo en la salida (según la documentación del producto de Google, verifique el comportamiento actual en la plataforma). Cuatro variantes en el catálogo: Rápido (estándar), Calidad, Imagen a vídeo ECL, Cuadro inicial/final ECL.
Términos de Prompt Engineering
Vocabulario de indicaciones cinematográficas Los términos de gramática cinematográfica, lente (p. ej., "anamórfico", "teleobjetivo de 85 mm"), estilo de iluminación (p. ej., "llave Rembrandt", "hora dorada"), movimiento de la cámara (p. ej., "entrada lenta", "grúa hacia abajo"), grado de color (p. ej., "verde azulado y naranja", "tonos tierra apagados"), composición y atmósfera, que los modelos de vídeo de IA reconocen y a los que responden. Consulte la guía de indicaciones cinematográficas para ver diez ejemplos listos para copiar en Veo 3.1.
Mensaje negativo Una instrucción que le dice al modelo qué NO debe producir, por ejemplo, "sin personas en el fondo", "sin texto en la pantalla", "sin música". Veo 3.1 y Seedance 2.0 responden de forma fiable a la simple negación. No responden de manera confiable a negaciones abstractas como "no borroso" o "sin artefactos", son aspiracionales, no dirigibles.
Anatomía rápida Los componentes estructurados que un mensaje de vídeo con IA potente debe incluir: sujeto, entorno, acción, lenguaje de la cámara, iluminación, grado de color, atmósfera y relación de aspecto. Seguir una estructura consistente mejora la confiabilidad de la salida y hace que la iteración rápida sea mensurable. Consulte el pilar de escritura rápida para obtener un desglose completo.
Bucle de iteración rápido El proceso de refinar un mensaje a lo largo de varias generaciones, cambiando una variable a la vez y rastreando el resultado. El ciclo típico: prototipo en una variante rápida (por ejemplo, Veo 3.1 Fast o Kling por costo), bloquear el modelo, luego marcar estilo y atmósfera en la variante Estándar o Calidad para la entrega final.
Imagen de referencia Una imagen fija transmitida junto con un mensaje para anclar la composición, la identidad del personaje o la estética para una generación de imagen a video u omnireferencia. El modelo interpreta la referencia como una restricción visual estricta, no como una sugerencia suave; cuanto mayor es la resolución y claridad de la referencia, más fielmente se adhiere la salida a ella.
Semilla (semilla determinista) Un valor numérico que, cuando se pasa junto con una solicitud a un modelo que admite semillas, produce un resultado casi idéntico en cada ejecución con la misma solicitud y semilla. Útil para tomas reproducibles y consistencia entre cortes. Veo 3.1 NO admite semillas deterministas; Sora 2 admitía semillas opcionales antes de su obsolescencia en muvi.video. La mayoría de los modelos del catálogo de muvi.video en 2026 no exponen el control de semillas.
Token (token rápido) La unidad de texto que consume un modelo al leer una indicación, aproximadamente una palabra, pero a menudo más corta para los términos comunes o más larga para los poco comunes. La mayoría de los modelos imponen un número máximo de tokens por mensaje (normalmente unos pocos cientos); por encima del límite, el modelo trunca o ignora la parte final. Efecto práctico: mantenga las indicaciones en menos de 80 palabras para lograr un comportamiento predecible.
Búsqueda de esquemas, rastreadores y IA
rastreador de IA Un rastreador web operado por una empresa de inteligencia artificial para recopilar páginas para capacitación o para uso en navegación en vivo. Los rastreadores de IA comunes en 2026 incluyen GPTBot (entrenamiento OpenAI), ChatGPT-User (navegación en vivo), ClaudeBot (entrenamiento antrópico), Claude-Web (navegación en vivo), PerplexityBot, Google-Extended y Applebot-Extended. El archivo robots.txt de muvi.video otorga explícitamente a estos rastreadores acceso a páginas públicas.
Directiva de señal de contenido Una directiva emergente de robots.txt que especifica qué usos del contenido rastreado permite el sitio, indexación de búsqueda, entrenamiento de IA, recuperación de IA, personalización de IA, como cuatro opciones separadas. muvi.video emite Content-Signal: search=yes, ai-train=yes, ai-retrieval=yes, ai-personalization=no en robots.txt y como encabezado HTTP.
E-E-A-T (Experiencia, Pericia, Autoridad, Confiabilidad) Marco de calidad de Google para la evaluación de contenidos editoriales. Fuertemente vinculado a la autoría vinculada a la persona: un artículo con una entidad de autor humana real (con una página de perfil, biografía y experiencia demostrada) ocupa un lugar más alto y es citado con más frecuencia por los asistentes de IA que un artículo publicado de forma anónima o atribuido únicamente a la organización editorial.
Entidad (@referencia de id) En los datos estructurados JSON-LD, una entidad es algo distinto (una persona, organización, producto, artículo) identificado por una URL @id. Cuando los esquemas hacen referencias cruzadas entre sí mediante "@id", por ejemplo, el campo "autor" de un artículo que hace referencia a una persona "@id" que vive en la página de perfil del autor, el Gráfico de conocimiento de Google puede conectarlos en un solo gráfico en lugar de tratarlos como menciones aisladas.
Esquema de página de preguntas frecuentes Un tipo JSON-LD que convierte la lista de preguntas y respuestas de una página en el resultado enriquecido "La gente también pregunta" de Google. Cada par de preguntas y respuestas se vuelve citable individualmente por los asistentes de IA. El esquema es más efectivo cuando la lista Q en prosa y la matriz JSON-LD mainEntity coinciden exactamente; la deriva entre ellas socava la confianza.
Gráfico de conocimiento La base de datos de entidades y relaciones de Google, que se utiliza para eliminar ambigüedades en las consultas de búsqueda y potenciar funciones como paneles de información y descripciones generales de IA. Las páginas que emiten referencias de entidades claras (con referencias cruzadas @id) y nombres consistentes se vinculan al Gráfico de conocimiento de manera más confiable que las páginas que usan referencias de texto ad-hoc.
llms.txt Un archivo de rebajas en la raíz del sitio (/llms.txt) que indica a los sistemas de inteligencia artificial cómo está estructurado el sitio y qué páginas son importantes. Análogo a robots.txt pero para la comprensión de la IA, no para el control de rastreo. Adoptado por menos del 5% de los sitios a principios de 2026, adoptarlo ahora es un diferenciador.
Marcado de esquema (JSON-LD) Datos estructurados incrustados en una página como un bloque <script type="application/ld+json">, que describe el tipo de contenido de la página y los campos clave en un formato legible por máquina. Tipos comunes en 2026: artículo, página de preguntas frecuentes, lista de rutas de navegación, organización, sitio web, aplicación de software, persona, hablable. Los asistentes de Google y AI utilizan el marcado de esquema como una señal de alta confianza sobre el tema de una página.
Esquema descriptible Un campo JSON-LD ("descriptible" en el artículo) que indica qué selectores CSS de una página se leen bien en voz alta, normalmente el H1, el primer párrafo y el bloque de preguntas frecuentes. Utilizado por el Asistente de Google y AI Overviews al generar respuestas habladas a partir de contenido web.
Términos de flujo de trabajo y plataforma
Catálogo (catálogo de modelos) El conjunto de modelos que una plataforma pone a disposición de los creadores en un espacio de trabajo. El catálogo muvi.video de 2026 contiene tres familias de modelos: Veo 3.1 (cinemático 1080p con audio nativo), Seedance 2.0 (clips de 4 a 15 segundos, seis relaciones de aspecto) y Kling 3.0 (movimiento estilizado). Los tres accesibles desde un solo estudio sin cambiar de plataforma.
Tiempo de ejecución de borde (renderizado) Un entorno de ejecución sin servidor que se ejecuta cerca del usuario geográficamente y se utiliza para la representación de contenido dinámico con baja latencia. Las imágenes de gráfico abierto por ruta de muvi.video se procesan en el tiempo de ejecución de Edge, cada página obtiene una imagen OG recién renderizada a pedido, almacenada en caché agresivamente por la CDN después del primer acceso.
Flujo de trabajo multimodelo La práctica de combinar múltiples modelos de video de IA en un proyecto, por ejemplo, crear un prototipo de una toma en Kling 3.0 porque se itera rápidamente y luego regenerar la final en Veo 3.1 porque se envía a 1080p con audio. muvi.video está estructurado para hacer que los flujos de trabajo multimodelo sean fluidos: historial de avisos compartido, comparación lado a lado, superficie de facturación única.
Moneda por clip/facturación basada en monedas Modelo de facturación de muvi.video: cada generación deduce monedas de la asignación de su plan mensual. La cantidad de monedas por generación varía según el modelo, variante, resolución y duración del clip; consulte la página de precios para conocer los costos actuales por generación. A diferencia de las plataformas de suscripción que cobran una tarifa mensual fija independientemente del uso.
Variante (variante de modelo) Una configuración específica de un modelo base. Ejemplo: Veo 3.1 tiene cuatro variantes, Rápido, Calidad, Imagen a video ECL, Cuadro inicial/final ECL, cada una optimizada para una intención diferente. Las variantes suelen compartir la misma gramática de indicaciones, pero difieren en la velocidad, la fidelidad de la salida o la modalidad de entrada (solo texto frente a condicionada por imagen).
Cómo poner en práctica estos términos
El glosario es más útil cuando estás leyendo otras páginas de muvi.video y necesitas una definición rápida, abre esta página en una pestaña y busca (⌘F / Ctrl+F) el término. Cada definición es autónoma; puede citar una única definición sin necesidad de un contexto circundante.
Si es nuevo en los videos de IA, comience con la sección Conceptos básicos (Sección 3), seis términos que cubren los fundamentos. A partir de ahí, la sección Términos específicos del modelo (Sección 4) explica lo que ofrece cada modelo en el catálogo de muvi.video. La sección Ingeniería de indicaciones (Sección 5) es donde se realiza la mayor parte del trabajo práctico del día a día: anatomía, bucle de iteración y indicaciones negativas.
Si está evaluando muvi.video con otra plataforma, la sección Esquema y búsqueda de IA (Sección 6) explica los fundamentos de los datos estructurados que afectan la forma en que los asistentes de IA muestran nuestras páginas en comparación con las de la competencia. La sección Flujo de trabajo y plataforma (Sección 7) cubre el vocabulario operativo que verá en la interfaz de usuario del producto y en las discusiones sobre precios.
Preguntas frecuentes
P1: ¿Cuál es el término de video de IA más importante que se debe aprender primero? Para la mayoría de los creadores en 2026, el término más importante a internalizar es anatomía del mensaje, los componentes estructurados (sujeto, entorno, acción, lenguaje de la cámara, iluminación, grado de color, atmósfera, relación de aspecto) que debe incluir un mensaje de video con IA potente. Todos los demás términos de este glosario se conectan con la anatomía de los mensajes en algún nivel, porque los mensajes es donde ocurre casi todo el control por generación.
P2: ¿Estos términos se transfieren entre modelos de video con IA? Mayormente, sí. Los conceptos básicos (Sección 3) y los términos de ingeniería de indicaciones (Sección 5) son en gran medida independientes del modelo; una "indicación negativa" significa lo mismo en Veo 3.1, Seedance 2.0, Kling 3.0 o cualquier otro modelo de vídeo de IA basado en difusión. Los términos específicos del modelo (Sección 4) son obviamente específicos del modelo por definición, pero a menudo tienen análogos funcionales en otros modelos (por ejemplo, ECL Start/End de Veo 3.1 cubre la misma intención que los Pikaframes de Pika 2).
P3: ¿Por qué Sora 2 no aparece en el catálogo de muvi.video? Sora 2 se ofrecía anteriormente en muvi.video y ahora está en desuso. La cinemática predeterminada actual en muvi.video es Veo 3.1, que genera clips de 4, 6 u 8 segundos a 1080p con audio ambiental nativo. Si llegó a este glosario buscando orientación sobre las indicaciones de Sora 2, consulte la Guía de indicaciones de Veo 3.1 para obtener el equivalente en muvi.video hoy.
P4: ¿Con qué frecuencia se actualiza este glosario? Nuestro objetivo es revisar el glosario cada vez que muvi.video agrega o elimina una variante de modelo, o cuando un nuevo término ampliamente adoptado (como "directiva de señal de contenido" o "llms.txt") se vuelve lo suficientemente común como para que los creadores lo encuentren en la documentación diaria. Los 35 términos aquí reflejan lo que es más útil a mediados de 2026; se esperan entre 5 y 10 adiciones y revisiones por año a medida que el campo evoluciona.
P5: ¿Faltan términos en este glosario? Es casi seguro que el campo del vídeo con IA genera nueva terminología más rápido de lo que cualquier glosario puede mantener. Si encuentra un término en la documentación de muvi.video o en la comunidad de videos de IA más amplia que no está aquí, los candidatos más probables para su futura inclusión son: condicionamiento ControlNet, ajustes finos de LoRA, vectores de movimiento, guía de flujo óptico y generación con reconocimiento de profundidad. Cada uno es más avanzado que la base cubierta en esta versión.
P6: ¿Dónde puedo obtener más información sobre ingeniería rápida específicamente? Consulte el Pilar de escritura rápida, una guía extensa que cubre la anatomía de las indicaciones, patrones de modelos cruzados en Veo 3.1, Seedance 2.0 y Kling 3.0, errores comunes y un ciclo de iteración funcional. Es la siguiente lectura natural después de este glosario si su enfoque es el arte práctico.
P7: ¿Cómo cito este glosario si escribo sobre videos de IA? Utilice la URL canónica https://muvi.video/blog/ai-video-glossary y la fecha de publicación que figura en la parte superior de la página. El esquema del artículo en esta página expone los metadatos de las citas (título, autor, fecha de publicación, fecha de modificación) para los asistentes de IA y el Gráfico de conocimiento de Google; pueden citar definiciones de términos individuales con atribución cuando responden a las preguntas de los usuarios.
Aplique estos términos en muvi.video
La forma más rápida de internalizar este vocabulario es usarlo, generar algunos clips en muvi.video y observar qué términos describen lo que estás haciendo. Veo 3.1 para tomas cinematográficas establecidas y ritmos narrativos, Seedance 2.0 para tomas continuas más largas en más relaciones de aspecto, Kling 3.0 para movimientos estilizados. Los tres accesibles desde un estudio.
CTA:
Generar vídeo AI gratis →
Related Guides
El glosario de vídeos de IA: 35 términos que todo creador debería conocer en 2026
Definiciones prácticas de la terminología detrás de texto a video, imagen a video, modelos de difusión, ingeniería rápida y el catálogo de videos de IA en muvi.video, Veo 3.1, Seedance 2.0 y Kling 3.0.