Pida a un modelo de vídeo «la niña luciérnaga se esconde bajo una hoja» y obtendrá una niña luciérnaga distinta cada vez. Pida lo mismo a un modelo de imagen mientras le muestra su hoja de referencia, y obtendrá a ella. Después pida a un modelo de vídeo que anime esa imagen, y se moverá. Esa es toda la idea detrás de la línea de escenas que lanzamos con De historia a película, y es la herramienta de coherencia más eficaz que tenemos.
Por qué el texto a vídeo olvida
Una instrucción de texto describe una distribución, no un individuo. «Una pequeña niña luciérnaga con alas translúcidas» encaja con miles de dibujos, y cada llamada toma uno distinto. Los modelos de vídeo lo empeoran: además tienen que mantener al personaje estable de un fotograma a otro, y sacrifican la fidelidad a cualquier referencia a cambio de calidad de movimiento. Sin ingeniería, treinta llamadas independientes de texto a vídeo le dan treinta heroínas ligeramente distintas y una película que necesita subtítulos para decirle quién es quién.
El camino anterior
Las escenas con personajes usaban un punto de acceso de referencia multimagen del proveedor de vídeo: unas cuantas imágenes de referencia más una instrucción, con la promesa de que el personaje se mantendría coherente mientras el modelo inventaba la composición. Funcionaba razonablemente con rostros humanos. Nunca manejó bien a los personajes no humanos, y hace poco el proveedor lo retiró sin apenas aviso. Una línea de producción que depende del punto de acceso propietario de un solo proveedor se rompe con la siguiente decisión de producto de ese proveedor, así que tomamos la retirada como un motivo para cambiar el diseño y no para buscar un punto de acceso sustituto.
El nuevo camino
- El director escribe la instrucción de la escena y enumera los personajes presentes por su identificador de reparto.
- El estudio renderiza un fotograma clave: el modelo de imagen recibe las hojas de reparto, la instrucción de la escena y la guía de estilo, con la orden de mantener cada diseño fiel a su referencia.
- El fotograma clave se convierte en el primer fotograma del clip mediante imagen a vídeo, en cualquier nivel de calidad. La instrucción de vídeo describe solo lo que cambia: el movimiento, el movimiento de cámara, la expresión.
Las escenas sin miembros del reparto, como un plano de situación del valle, siguen yendo directamente a texto a vídeo con la frase de estilo antepuesta. Las escenas marcadas como continuas parten del último fotograma del clip anterior en lugar de un fotograma clave nuevo, de modo que el decorado y la iluminación se mantienen.
Efectos secundarios que nos gustan
- Los niveles Cinema ahora pueden usar personajes; antes solo podían los niveles rápidos, porque el punto de acceso de referencia solo existía ahí.
- Puede revisar el fotograma clave antes de que exista el clip, y la Biblioteca lo guarda junto con su instrucción.
- Un fotograma clave fallido falla de forma barata; el costoso paso de vídeo nunca llega a ejecutarse.
- La composición se separa del movimiento. Si una escena se ve mal, el problema es visible en la imagen fija, y corregirlo consiste en editar una sola instrucción.
Cuánto cuesta
Una generación de imagen por escena, unos pocos céntimos a coste real. Comparado con el clip de vídeo al que precede, es casi gratis. Una película de cuatro minutos con unas 32 escenas añade aproximadamente 1,30 dólares en fotogramas clave a unos 30 dólares en clips. Nos planteamos hacer el fotograma clave opcional para ahorrar esa cantidad y lo descartamos; el ahorro es insignificante y la pérdida de coherencia no lo es.
Cómo sacarle el máximo partido
- Describa al sujeto en la instrucción del fotograma clave, y solo el movimiento en la instrucción de vídeo. Volver a describir al personaje en la fase de vídeo invita al modelo a redibujarlo.
- Mantenga la frase de estilo al principio de cada instrucción. Los modelos dan más peso al comienzo.
- Prohíba los bordes y el texto en el fotograma clave. Los modelos de imagen a veces dibujan una línea de marco o un pie de imagen, y entonces el modelo de vídeo anima un póster.
- Para estilos dibujados, prefiera Estándar. El nivel rápido mantiene planos los colores planos; los niveles Cinema pueden añadir textura fotorrealista a un fotograma clave dibujado.
Errores habituales
El movimiento de imagen a vídeo está limitado por el encuadre. Un personaje que corre hacia la cámara o una pelea pueden parecer forzados, porque el modelo se resiste a abandonar la composición que se le ha dado. Los clips más cortos ayudan, y también un fotograma clave nuevo para el siguiente momento. Algunos modelos además se desvían hacia el final de un clip largo; en el nivel rápido, entre 5 y 8 segundos por escena es el punto óptimo, con la narración llevando la historia de un corte a otro.
A partir de tres miembros del reparto en un mismo encuadre, los modelos actuales empiezan a mezclar rasgos. Al director se le indica que limite las escenas a los personajes que importan, y las instrucciones nombran posiciones («la rana a la izquierda, el búho a la derecha») cuando dos comparten encuadre.
Preguntas frecuentes
¿El camino del fotograma clave funciona en todos los niveles? Sí. Borrador, Estándar, Cinema y Cinema Pro animan todos a partir del fotograma clave; solo cambian las duraciones: 5 o 10 segundos en los niveles rápidos y 4, 6 u 8 en Cinema.
¿Puedo aportar mi propio primer fotograma? Sí. En el flujo de trabajo escena por escena, un fotograma del guion gráfico que usted apruebe se convierte en el primer fotograma del clip mediante el mismo paso de imagen a vídeo; el modelo parte de su imagen, no de una descripción de ella.
¿Y si el modelo de vídeo ignora el fotograma clave? Acorte el clip, compruebe que el fotograma clave no tenga borde ni texto y limite la instrucción de vídeo al movimiento. Una imagen enmarcada se interpreta como un póster y se reinterpreta.
