La consistencia es la propiedad de que un mismo personaje sea reconociblemente el mismo en todas las escenas: rostro, proporciones, vestuario, paleta. Los modelos generativos no tienen memoria entre llamadas; cada petición parte de cero. Por tanto, la consistencia tiene que incorporarse en las entradas, y las técnicas que funcionan son variaciones de una misma idea: decidir una sola vez cómo es el personaje, en una forma que el modelo pueda copiar, y entregarle esa forma en cada ocasión.

Por qué es difícil

Un prompt de texto describe una distribución, no un individuo. "Un zorro con chaqueta azul" produce un zorro distinto cada vez, porque miles de zorros encajan en la descripción. Incluso una descripción muy larga deja margen: la forma de las orejas, la longitud del hocico, el color de los ojos, el corte de la chaqueta. Los modelos de vídeo lo empeoran, porque además deben mantener estable al personaje de un fotograma a otro, y sacrifican fidelidad a la referencia a cambio de calidad de movimiento. El resultado, sin ingeniería, es una película en la que el espectador necesita subtítulos para saber quién es quién.

Técnica 1: hojas de referencia

Dibuje cada personaje una sola vez: cuerpo entero, pose neutra, fondo liso, en el estilo de la película. Esa es el ancla visual. Una hoja funciona porque una imagen fija todo lo que una descripción deja abierto. Guárdela junto al personaje para poder reutilizarla en otras películas, y conserve el prompt que la produjo para poder regenerarla en otro estilo.

Reglas prácticas: un personaje por hoja, sin accesorios que no vayan a aparecer en todas las escenas, sin iluminación dramática. La hoja es una especificación, no un cartel. Una hoja dramática arrastra su iluminación a todas las escenas que la toman como referencia.

Técnica 2: una descripción escrita del aspecto

Junto a la imagen, mantenga una descripción de 30–60 palabras: especie o edad, rostro, pelo, vestuario, colores y un rasgo distintivo. Inclúyala en el prompt de cada escena. Las palabras orientan al modelo incluso cuando la referencia visual es débil o no existe, y fijan lo que una imagen no puede fijar, como el nombre o el papel del personaje. La descripción escrita es también lo que lee un modelo de lenguaje cuando redacta los prompts de las escenas, así que debe escribirse pensando en un modelo: sustantivos y colores concretos, sin adjetivos como "precioso".

Técnica 3: primero el fotograma clave

No pida al modelo de vídeo que coloque al personaje. Pida al modelo de imagen que componga la escena como imagen fija, con las hojas de referencia incluidas y la instrucción de respetar fielmente cada diseño. Después, anime esa imagen. Los modelos de imagen respetan las referencias bastante mejor que los de vídeo, porque resuelven un solo fotograma y no una secuencia, y son entre diez y cincuenta veces más baratos. Un fotograma clave fallido cuesta céntimos y se regenera en segundos; un clip fallido cuesta dólares y minutos.

La ruta del fotograma clave tiene una segunda ventaja: separa la composición del movimiento. Si una escena se ve mal, el problema es visible en la imagen fija antes de añadir ningún movimiento, y puede corregirse editando el prompt de ese único fotograma.

Técnica 4: un solo ser por entrada

A los modelos de lenguaje les gusta economizar. Ante una historia con un zorro y un oso, un modelo director a veces genera una única entrada de reparto llamada "los animales". Prohíbalo en el contrato: cada entrada del reparto describe exactamente un ser. Una hoja fusionada no puede anclar a dos personajes, y todas las etapas posteriores heredan la fusión.

Técnica 5: fotogramas de continuidad

Cuando una escena continúa la anterior en el mismo lugar, inicie el nuevo clip a partir del último fotograma del clip anterior en lugar de un fotograma clave nuevo. El personaje, la iluminación y el decorado se trasladan automáticamente. Úselo solo para continuaciones reales; un lugar nuevo necesita un fotograma clave nuevo, o el decorado anterior se colará en él.

Lo que no funcionó

Los endpoints de referencia con varias imágenes en modelos de vídeo: aceptables para rostros humanos, flojos para animales y objetos, y expuestos a que el proveedor los retire sin aviso. Varios de estos endpoints han desaparecido a los pocos meses de su lanzamiento. Los prompts solo de texto con un nombre: el modelo nunca ha visto ese nombre y lo trata como ruido. Los prompts muy largos: pasadas unas cuantas cientos de palabras, los modelos dan más peso al principio e ignoran el resto, así que el aspecto debe ir al principio, no al final. Las semillas: una semilla fija reproduce una sola imagen, no un personaje a través de composiciones distintas.

Cómo medir la consistencia

Elija tres escenas con el mismo personaje y compare rostro, vestuario y paleta en paralelo. Puntúe cada dimensión de 0 a 2: 2 si es idéntica a simple vista, 1 si es reconocible con esfuerzo, 0 si podría ser otro personaje. Cada personaje obtiene una puntuación sobre 6; una película promedia la de sus personajes. Por debajo de 4, regenere las hojas antes de regenerar ninguna escena: el fallo está casi siempre en el ancla, no en las escenas que la toman como referencia.

Una aproximación más barata es la prueba de los subtítulos: vea la película sin sonido y pregúntese si sabe quién está hablando. Si necesita el nombre en pantalla, la consistencia ha fallado.

Preguntas frecuentes

¿Sirve la foto de una persona real como hoja de referencia? Solo para estilos fotorrealistas, y solo con el consentimiento de esa persona. Para estilos dibujados, genere la hoja en ese estilo; una foto arrastra realismo a todas las escenas.

¿Cuántas imágenes de referencia por personaje? Una buena hoja de cuerpo entero basta para la mayoría de las películas. Una segunda hoja con un primer plano del rostro ayuda en las escenas dominadas por caras.

¿Pueden dos personajes compartir escena de forma fiable? Sí, si ambas hojas se pasan a la etapa de fotogramas clave y el prompt los nombra por su posición ("el zorro a la izquierda, el oso a la derecha"). Con tres o más en un mismo fotograma es cuando los modelos actuales empiezan a mezclar rasgos.