Demandez deux fois la même personne à un générateur et vous obtenez des frères et sœurs. La cohérence est le problème le plus dur du film généré, et de meilleurs prompts ne le résolvent pas.

Pourquoi ça dérive

Une description textuelle est un filet large. « Femme, trentaine, cheveux bruns » correspond à des millions de visages, et le modèle en choisit un différent à chaque fois. Lumière, angle et style tirent le résultat plus loin.

Levier un : les références

Donnez des images au générateur, pas des adjectifs. La bible des personnages stocke jusqu’à quatre visages de référence et les transmet à chaque scène. Cela seul élimine l’essentiel de la dérive.

Levier deux : les variantes

Une seule référence de face n’aide pas un plan de profil. Des variantes de pose, générées une fois depuis la bible, couvrent les angles dont vos scènes ont besoin.

Levier trois : les images d’ancrage

Validez une image de storyboard où le personnage est juste, puis générez la vidéo depuis cette image. Le clip hérite du visage au lieu de le réinventer.

Utilisez les trois et la dérive devient l’exception que vous corrigez, non la règle que vous combattez.