Chaque modèle vidéo ouvre au moins deux portes : un prompt textuel, ou une image de départ accompagnée d'un prompt. Certains en ajoutent une troisième : des images de référence d'un personnage. Choisir la porte pour chaque scène est une décision d'aiguillage, pas une affaire de goût, et un studio qui aiguille bien produit de meilleurs films pour moins d'argent qu'un studio qui passe toujours par la même porte.
Texte vers vidéo
Le modèle reçoit un prompt et invente tout : décor, lumière, sujet, mouvement. C'est la bonne porte pour les plans d'exposition et pour les scènes sans personnage récurrent : paysages, foules, météo, mouvement abstrait, une ville la nuit. C'est aussi la porte la moins coûteuse en temps humain, puisqu'il n'y a rien à préparer.
Sa faiblesse est qu'elle ne se souvient de rien. Chaque appel réinvente le monde, si bien que deux scènes en texte vers vidéo de « la maisonnette du renard » produisent deux maisonnettes différentes. Utilisée pour des scènes de personnages, elle est la principale cause des films incohérents. Sa seconde faiblesse est le contrôle : le prompt peut demander une composition sans pouvoir la garantir, et les modèles ignorent régulièrement les consignes spatiales comme « à gauche ».
Image vers vidéo
Le modèle reçoit une image de départ et l'anime. La première image est fixée ; le modèle ajoute le mouvement et, selon le modèle, le mouvement de caméra. C'est la bonne porte chaque fois qu'une composition précise ou un personnage précis doit apparaître, ce qui, dans un film narratif, concerne la plupart des scènes. C'est aussi ainsi que fonctionne la continuité : une scène qui prolonge la précédente part de la dernière image du clip précédent.
Sa faiblesse est que le mouvement reste borné par l'image. Une action très dynamique, un personnage qui court vers la caméra ou un combat, peut paraître contrainte parce que le modèle hésite à quitter la composition qu'on lui a donnée. Certains modèles dérivent aussi : au bout de cinq ou six secondes, le visage du personnage commence à changer. Des clips plus courts et une nouvelle image clé pour la scène suivante règlent le problème.
Points d'accès à référence de personnage
Certains fournisseurs acceptent quelques images de référence et un prompt, et promettent de garder le personnage cohérent tout en inventant la composition. En pratique, ces points d'accès favorisent les visages humains, peinent avec les animaux et les objets, et ont été supprimés ou remplacés par les fournisseurs sans préavis à plus d'une reprise. Considérez-les comme facultatifs : utilisez-les lorsqu'ils sont disponibles pour des personnages humains photoréalistes, jamais comme unique chemin, et gardez toujours la voie des images clés en solution de repli. Une chaîne qui dépend du point d'accès propriétaire d'un seul fournisseur est une chaîne qui casse à la prochaine décision produit de ce fournisseur.
Règles d'aiguillage
- La scène comporte un membre de la distribution : composer une image clé à partir des fiches de référence, puis image vers vidéo.
- La scène prolonge la précédente dans le même lieu : dernière image du clip précédent, puis image vers vidéo.
- La personne a fourni une image : image vers vidéo à partir de cette image.
- La scène est un plan d'exposition ou n'a pas de sujet récurrent : texte vers vidéo.
- Sinon : texte vers vidéo, avec le guide de style placé en tête du prompt pour que l'apparence corresponde.
Un modèle réalisateur peut appliquer ces règles lui-même si le scénario indique, pour chaque scène, sa distribution et sa relation de continuité avec la scène précédente. C'est pourquoi le schéma du scénario comporte ces deux champs.
Durées
Les modèles rapides proposent généralement 5 ou 10 secondes ; les modèles cinéma 4, 6 ou 8. Le réalisateur doit choisir uniquement dans la liste autorisée pour la gamme visée, car une scène écrite pour 7 secondes sur un modèle qui ne produit que 5 ou 10 secondes sera arrondie sans avertissement, et la narration écrite pour 7 secondes ne tiendra pas. Les clips plus longs coûtent plus cher et dérivent davantage ; pour les styles dessinés, 5 à 8 secondes par scène est l'idéal, la narration portant l'histoire d'un plan à l'autre.
Des prompts pour chaque porte
Les prompts texte vers vidéo doivent décrire le plan comme le ferait un directeur de la photographie : sujet, action, caméra, lumière, style, dans cet ordre. Les prompts image vers vidéo ne doivent décrire que ce qui change : le mouvement, le déplacement de caméra, l'expression. Décrire à nouveau le sujet incite le modèle à le redessiner. Dans les deux cas, la phrase de style vient en premier et les consignes négatives (« pas de texte, pas de bordure ») en dernier.
Questions fréquentes
Un film peut-il mélanger les trois portes ? Oui, et la plupart des bons films le font : texte vers vidéo pour le plan d'exposition, image vers vidéo pour les scènes de personnages, images de continuité pour les séquences. L'assemblage normalise la résolution et la cadence d'images.
Quelle porte convient le mieux à l'anime ? L'image vers vidéo à partir d'une image clé dans le style anime. Le texte vers vidéo sur les gammes cinéma a tendance à ajouter une texture photoréaliste qui casse le rendu.
Que faire si le modèle vidéo ignore l'image clé ? Réduisez l'intensité du mouvement si le modèle le permet, raccourcissez le clip et vérifiez que l'image clé ne comporte ni bordure ni texte ; les modèles traitent les images encadrées comme des affiches et les réinterprètent.
