La cohérence est la propriété qui fait qu'un même personnage reste reconnaissable d'une scène à l'autre : visage, proportions, costume, palette. Les modèles génératifs n'ont aucune mémoire entre deux appels ; chaque requête part de zéro. La cohérence doit donc être construite dans les entrées, et les techniques qui fonctionnent sont toutes des variantes d'une même idée : décider une fois pour toutes de l'apparence du personnage, sous une forme que le modèle peut copier, et lui fournir cette forme à chaque fois.
Pourquoi c'est difficile
Un prompt textuel décrit une distribution statistique, pas un individu. « Un renard en veste bleue » produit un renard différent à chaque fois, parce que des milliers de renards correspondent à la description. Même une description très longue laisse de la marge : la forme des oreilles, la longueur du museau, la couleur des yeux, la coupe de la veste. Les modèles vidéo aggravent le problème, car ils doivent aussi garder le personnage stable d'une image à l'autre, et ils sacrifient la fidélité à la référence au profit de la qualité du mouvement. Le résultat, sans travail d'ingénierie, est un film où le spectateur a besoin de sous-titres pour savoir qui est qui.
Technique 1 : les fiches de référence
Dessinez chaque personnage une seule fois : en pied, pose neutre, fond uni, dans le style du film. C'est l'ancrage visuel. Une fiche fonctionne parce qu'une image fixe tout ce qu'une description laisse ouvert. Enregistrez-la avec le personnage pour pouvoir la réutiliser d'un film à l'autre, et conservez le prompt qui l'a produite afin de pouvoir la régénérer dans un autre style.
Règles pratiques : un personnage par fiche, aucun accessoire qui n'apparaîtra pas dans chaque scène, pas d'éclairage dramatique. La fiche est une spécification, pas une affiche. Une fiche dramatique entraîne son éclairage dans chaque scène qui y fait référence.
Technique 2 : une apparence écrite
À côté de l'image, conservez une description de 30 à 60 mots : espèce ou âge, visage, cheveux, costume, couleurs, un signe distinctif. Incluez-la dans chaque prompt de scène. Les mots orientent le modèle même quand la référence visuelle est faible ou absente, et ils fixent ce qu'une image ne peut pas fixer, comme le nom ou le rôle du personnage. L'apparence écrite est aussi ce que lit un modèle de langage lorsqu'il rédige les prompts de scène ; elle doit donc être écrite pour un modèle : des noms concrets et des couleurs, pas d'adjectifs comme « beau ».
Technique 3 : l'image clé d'abord
Ne demandez pas au modèle vidéo de placer le personnage. Demandez au modèle d'image de composer la scène sous forme d'image fixe, avec les fiches de référence intégrées et la consigne de rester fidèle à chaque design. Animez ensuite cette image. Les modèles d'image respectent nettement mieux les références que les modèles vidéo, parce qu'ils résolvent une seule image plutôt qu'une séquence, et ils coûtent dix à cinquante fois moins cher. Une image clé ratée coûte quelques centimes et se régénère en quelques secondes ; un clip raté coûte des dollars et des minutes.
La voie des images clés présente un second avantage : elle sépare la composition du mouvement. Si une scène a l'air fausse, le problème est visible dans l'image fixe avant l'ajout de tout mouvement, et il se corrige en modifiant le prompt de cette seule image.
Technique 4 : une entité par entrée
Les modèles de langage aiment économiser. Face à une histoire avec un renard et un ours, un modèle réalisateur produira parfois une seule entrée de distribution appelée « les animaux ». Interdisez-le dans le contrat : chaque entrée de distribution décrit exactement un être. Une fiche fusionnée ne peut pas ancrer deux personnages, et toutes les étapes suivantes héritent de la fusion.
Technique 5 : les images de continuité
Lorsqu'une scène prolonge la précédente dans le même lieu, faites partir le nouveau clip de la dernière image du clip précédent plutôt que d'une nouvelle image clé. Le personnage, l'éclairage et le décor sont repris automatiquement. Réservez cette technique aux véritables continuations ; un nouveau lieu exige une nouvelle image clé, sans quoi l'ancien décor s'y infiltre.
Ce qui n'a pas fonctionné
Les points d'accès vidéo à références multiples : acceptables pour les visages humains, faibles pour les animaux et les objets, et susceptibles d'être supprimés par le fournisseur sans préavis. Plusieurs de ces points d'accès ont disparu quelques mois après leur lancement. Les prompts purement textuels avec un nom : le modèle n'a jamais vu ce nom et le traite comme du bruit. Les prompts très longs : au-delà de quelques centaines de mots, les modèles privilégient le début et ignorent le reste ; l'apparence doit donc venir en premier, pas en dernier. Les graines (seeds) : une graine fixe reproduit une image unique, pas un personnage à travers des compositions différentes.
Mesurer la cohérence
Choisissez trois scènes avec le même personnage et comparez côte à côte le visage, le costume et la palette. Notez chaque dimension de 0 à 2 : 2 si c'est identique au premier coup d'œil, 1 si c'est reconnaissable avec effort, 0 si ce pourrait être un autre personnage. Un personnage est noté sur 6 ; un film fait la moyenne de ses personnages. En dessous de 4, régénérez les fiches avant de régénérer la moindre scène : le défaut se trouve presque toujours dans l'ancrage, pas dans les scènes qui y font référence.
Un indicateur moins coûteux est le test des sous-titres : regardez le film sans le son et demandez-vous si vous savez qui parle. Si vous avez besoin du nom à l'écran, la cohérence a échoué.
Questions fréquentes
La photo d'une personne réelle peut-elle servir de fiche de référence ? Seulement pour les styles photoréalistes, et seulement avec le consentement de la personne. Pour les styles dessinés, générez la fiche dans ce style ; une photo introduit du réalisme dans chaque scène.
Combien d'images de référence par personnage ? Une bonne fiche en pied suffit pour la plupart des films. Une seconde fiche avec un gros plan du visage aide pour les scènes composées surtout de visages.
Deux personnages peuvent-ils partager une scène de manière fiable ? Oui, si les deux fiches sont transmises à l'étape des images clés et que le prompt les désigne par leur position (« le renard à gauche, l'ours à droite »). C'est à partir de trois personnages dans une même image que les modèles actuels commencent à mélanger les traits.
