Todo modelo de vídeo abre al menos dos puertas: un prompt de texto, o una imagen inicial más un prompt. Algunos añaden una tercera: imágenes de referencia de un personaje. Elegir la puerta en cada escena es una decisión de enrutamiento, no de gusto, y un estudio que enruta bien produce mejores películas por menos dinero que otro que siempre usa la misma puerta.

Texto a vídeo

El modelo recibe un prompt y lo inventa todo: decorado, luz, sujeto, movimiento. Es la puerta adecuada para los planos de situación y para las escenas sin un personaje recurrente: paisajes, multitudes, fenómenos meteorológicos, movimiento abstracto, una ciudad de noche. Es también la puerta más barata en tiempo humano, porque no hay nada que preparar.

Su debilidad es que no recuerda nada. Cada llamada reinventa el mundo, de modo que dos escenas de texto a vídeo sobre "la casita del zorro" producen dos casitas distintas. Usada en escenas con personajes, es la causa principal de las películas incoherentes. Su segunda debilidad es el control: el prompt puede pedir una composición, pero no garantizarla, y los modelos ignoran con frecuencia instrucciones espaciales como "a la izquierda".

Imagen a vídeo

El modelo recibe un fotograma inicial y lo anima. El primer fotograma queda fijado; el modelo añade el movimiento y, según el modelo, el movimiento de cámara. Es la puerta adecuada siempre que deba aparecer una composición concreta o un personaje concreto, lo que en una película narrativa corresponde a la mayoría de las escenas. Es también como funciona la continuidad: una escena que continúa la anterior parte del último fotograma del clip previo.

Su debilidad es que el movimiento queda limitado por el encuadre. La acción muy dinámica, como un personaje que corre hacia la cámara o una pelea, puede verse contenida porque el modelo se resiste a abandonar la composición que se le dio. Algunos modelos también derivan: pasados cinco o seis segundos, el rostro del personaje empieza a cambiar. La solución son clips más cortos y un fotograma clave nuevo para la escena siguiente.

Endpoints de referencia de personaje

Algunos proveedores aceptan unas cuantas imágenes de referencia y un prompt, y prometen mantener la coherencia del personaje mientras inventan la composición. En la práctica, estos endpoints favorecen los rostros humanos, tienen dificultades con animales y objetos, y los proveedores los han retirado o sustituido sin aviso más de una vez. Trátelos como opcionales: úselos cuando estén disponibles para personajes humanos fotorrealistas, nunca como única vía, y mantenga siempre la ruta del fotograma clave como alternativa. Una línea de producción que depende del endpoint propietario de un proveedor es una línea de producción que se romperá con la próxima decisión de producto de ese proveedor.

Reglas de enrutamiento

  • La escena tiene un miembro del reparto: componer un fotograma clave a partir de las hojas de referencia y después imagen a vídeo.
  • La escena continúa la anterior en el mismo lugar: último fotograma del clip anterior y después imagen a vídeo.
  • La persona ha aportado un fotograma: imagen a vídeo a partir de ese fotograma.
  • La escena es un plano de situación o no tiene un sujeto recurrente: texto a vídeo.
  • En cualquier otro caso: texto a vídeo, anteponiendo la guía de estilo al prompt para que el aspecto coincida.

Un modelo director puede aplicar estas reglas por sí mismo si el guion marca en cada escena su reparto y su relación de continuidad con la escena anterior. Por eso el esquema del guion incluye ambos campos.

Duraciones

Los modelos rápidos suelen ofrecer 5 o 10 segundos; los cinematográficos, 4, 6 u 8. El director debe elegir solo entre la lista permitida para el nivel para el que escribe, porque una escena escrita para 7 segundos en un modelo que solo genera 5 o 10 se redondeará en silencio, y la narración escrita para 7 segundos no encajará. Los clips más largos cuestan más y derivan más; para estilos dibujados, entre 5 y 8 segundos por escena es el punto óptimo, con la narración llevando la historia de un corte a otro.

Prompts para cada puerta

Los prompts de texto a vídeo deben describir el plano como lo haría un director de fotografía: sujeto, acción, cámara, luz y estilo, en ese orden. Los prompts de imagen a vídeo deben describir solo lo que cambia: el movimiento, el movimiento de cámara, la expresión. Volver a describir al sujeto invita al modelo a redibujarlo. En ambos casos, la frase de estilo va al principio y las instrucciones negativas ("sin texto, sin borde") van al final.

Preguntas frecuentes

¿Puede una película mezclar las tres puertas? Sí, y la mayoría de las buenas películas lo hacen: texto a vídeo para el plano de situación, imagen a vídeo para las escenas con personajes y fotogramas de continuidad para las secuencias. El ensamblaje normaliza la resolución y la frecuencia de fotogramas.

¿Qué puerta es mejor para el anime? Imagen a vídeo a partir de un fotograma clave en estilo anime. El texto a vídeo en los niveles cinematográficos tiende a añadir una textura fotorrealista que rompe el aspecto.

¿Y si el modelo de vídeo ignora el fotograma clave? Reduzca la intensidad del movimiento si el modelo lo permite, acorte el clip y compruebe que el fotograma clave no tenga bordes ni texto; los modelos tratan las imágenes enmarcadas como carteles y las reinterpretan.