Demandez à un modèle vidéo « la petite luciole se cache sous une feuille » et vous obtiendrez une petite luciole différente à chaque fois. Demandez la même chose à un modèle d'image en lui montrant sa fiche de référence, et vous obtiendrez la bonne. Demandez ensuite à un modèle vidéo d'animer cette image, et elle bouge. C'est toute l'idée de la chaîne de scènes que nous avons livrée avec Histoire en film, et c'est l'outil de cohérence le plus efficace dont nous disposons.

Pourquoi le texte vers vidéo oublie

Un prompt texte décrit une distribution, pas un individu. « Une petite fille luciole aux ailes translucides » correspond à des milliers de dessins, et chaque appel en tire un différent. Les modèles vidéo aggravent le problème : ils doivent aussi garder le personnage stable d'une image à l'autre, et ils sacrifient la fidélité à toute référence au profit de la qualité du mouvement. Sans ingénierie, trente appels indépendants de texte vers vidéo vous donnent trente héroïnes légèrement différentes et un film qui a besoin de sous-titres pour vous dire qui est qui.

L'ancien parcours

Les scènes avec personnages utilisaient un point d'accès du fournisseur vidéo acceptant plusieurs images de référence : quelques images plus un prompt, avec la promesse que le personnage resterait cohérent pendant que le modèle inventait la composition. Cela fonctionnait raisonnablement pour les visages humains. Cela n'a jamais bien géré les personnages non humains, et le fournisseur l'a récemment retiré sans beaucoup de préavis. Une chaîne qui dépend du point d'accès propriétaire d'un seul fournisseur casse à la prochaine décision produit de ce fournisseur ; nous avons donc vu ce retrait comme une raison de changer de conception plutôt que de chercher un point d'accès de remplacement.

Le nouveau parcours

  1. Le réalisateur écrit le prompt de la scène et liste les personnages présents, par identifiant de distribution.
  2. Le studio rend une image clé : le modèle d'image reçoit les fiches de casting, le prompt de la scène et le guide de style, avec pour consigne de rester fidèle à la référence de chaque personnage.
  3. L'image clé devient la première image du clip grâce à l'image vers vidéo, quel que soit le niveau de qualité. Le prompt vidéo ne décrit que ce qui change : le mouvement, le déplacement de caméra, l'expression.

Les scènes sans membre de la distribution, comme un plan d'ensemble de la vallée, passent toujours directement en texte vers vidéo, avec la phrase de style placée en tête. Les scènes marquées comme continues démarrent à partir de la dernière image du clip précédent au lieu d'une nouvelle image clé, pour que le décor et l'éclairage se prolongent.

Les effets secondaires qui nous plaisent

  • Les niveaux Cinéma peuvent désormais utiliser des personnages ; auparavant, seuls les niveaux rapides le pouvaient, parce que le point d'accès de référence n'existait que là.
  • Vous pouvez examiner l'image clé avant que le clip n'existe, et la Bibliothèque la conserve avec son prompt.
  • Une image clé ratée échoue à moindre coût ; l'étape vidéo coûteuse n'est jamais lancée.
  • La composition est séparée du mouvement. Si une scène a l'air fausse, le problème se voit sur l'image fixe, et le corriger revient à modifier un seul prompt.

Ce que cela coûte

Une génération d'image par scène, quelques centimes en coût réel. Comparé au clip vidéo qui la suit, c'est presque gratuit. Un film de quatre minutes d'environ 32 scènes ajoute à peu près 1,30 dollar d'images clés à environ 30 dollars de clips. Nous avons envisagé de rendre l'image clé facultative pour économiser ce montant, et nous y avons renoncé : l'économie est dérisoire, la perte de cohérence ne l'est pas.

Comment en tirer le meilleur

  • Décrivez le sujet dans le prompt de l'image clé, et uniquement le mouvement dans le prompt vidéo. Décrire à nouveau le personnage à l'étape vidéo incite le modèle à le redessiner.
  • Placez toujours la phrase de style en premier dans chaque prompt. Les modèles accordent plus de poids au début.
  • Interdisez les bordures et le texte dans l'image clé. Les modèles d'image dessinent parfois un cadre ou une légende, et le modèle vidéo anime alors une affiche.
  • Pour les styles dessinés, préférez Standard. Le niveau rapide garde les aplats plats ; les niveaux Cinéma peuvent ajouter une texture photoréaliste à une image clé dessinée.

Les pièges

Le mouvement en image vers vidéo est limité par le cadre. Un personnage qui court vers la caméra ou une bagarre peuvent sembler contraints, parce que le modèle hésite à quitter la composition qu'on lui a donnée. Des clips plus courts aident, tout comme une nouvelle image clé pour le moment suivant. Certains modèles dérivent aussi vers la fin d'un clip long ; au niveau rapide, 5 à 8 secondes par scène est le bon compromis, la narration portant l'histoire d'un plan à l'autre.

À partir de trois membres de la distribution dans une même image, les modèles actuels commencent à mélanger les traits. Le réalisateur a pour consigne de limiter les scènes aux personnages qui comptent, et les prompts précisent les positions (« la grenouille à gauche, le hibou à droite ») quand deux personnages partagent une image.

Questions fréquentes

Le parcours par image clé fonctionne-t-il à tous les niveaux ? Oui. Brouillon, Standard, Cinéma et Cinéma Pro animent tous à partir de l'image clé ; seules les durées diffèrent, 5 ou 10 secondes sur les niveaux rapides et 4, 6 ou 8 sur Cinéma.

Puis-je fournir ma propre première image ? Oui. Dans le flux de travail scène par scène, une image de storyboard que vous approuvez devient la première image du clip grâce à la même étape d'image vers vidéo ; le modèle part de votre image, pas d'une description de celle-ci.

Et si le modèle vidéo ignore l'image clé ? Raccourcissez le clip, vérifiez que l'image clé n'a ni bordure ni texte, et limitez le prompt vidéo au mouvement. Une image encadrée est lue comme une affiche et réinterprétée.