Bitten Sie ein Videomodell um „das Glühwürmchenmädchen versteckt sich unter einem Blatt“, und Sie bekommen jedes Mal ein anderes Glühwürmchenmädchen. Bitten Sie ein Bildmodell um dasselbe und zeigen Sie ihm dabei ihr Referenzblatt, dann bekommen Sie sie. Bitten Sie anschließend ein Videomodell, dieses Bild zu animieren, und sie bewegt sich. Das ist die ganze Idee hinter der Szenen-Pipeline, die wir mit Geschichte zu Film veröffentlicht haben, und sie ist das wirksamste Werkzeug für Konsistenz, das wir haben.

Warum Text-zu-Video vergisst

Ein Text-Prompt beschreibt eine Verteilung, kein Individuum. „Ein kleines Glühwürmchenmädchen mit durchscheinenden Flügeln“ passt zu Tausenden von Zeichnungen, und jeder Aufruf zieht eine andere daraus. Videomodelle verschlimmern das: Sie müssen die Figur zusätzlich über viele Einzelbilder hinweg stabil halten und opfern dafür die Treue zu jeder Referenz zugunsten der Bewegungsqualität. Ohne gezielte Technik ergeben dreißig unabhängige Text-zu-Video-Aufrufe dreißig leicht unterschiedliche Heldinnen und einen Film, der Untertitel braucht, damit man weiß, wer wer ist.

Der alte Weg

Szenen mit Figuren nutzten beim Videoanbieter einen Endpunkt mit mehreren Referenzbildern: ein paar Referenzbilder plus ein Prompt und das Versprechen, dass die Figur konsistent bleibt, während das Modell die Komposition erfindet. Bei menschlichen Gesichtern funktionierte das halbwegs. Mit nichtmenschlichen Figuren kam es nie gut zurecht, und der Anbieter hat den Endpunkt kürzlich ohne große Vorankündigung eingestellt. Eine Pipeline, die vom proprietären Endpunkt eines einzigen Anbieters abhängt, zerbricht an dessen nächster Produktentscheidung. Deshalb nahmen wir die Einstellung zum Anlass, das Design zu ändern, statt einen Ersatz-Endpunkt zu suchen.

Der neue Weg

  1. Die Regie schreibt den Szenen-Prompt und listet die anwesenden Figuren nach ihrer Besetzungs-ID auf.
  2. Das Studio rendert einen Keyframe: Das Bildmodell erhält die Besetzungsblätter, den Szenen-Prompt und den Stilleitfaden mit der Anweisung, jedes Design seiner Referenz treu zu halten.
  3. Der Keyframe wird per Bild-zu-Video zum ersten Bild des Clips, auf jeder Qualitätsstufe. Der Video-Prompt beschreibt nur, was sich ändert: die Bewegung, die Kamerafahrt, den Gesichtsausdruck.

Szenen ohne Besetzungsmitglied, etwa eine Übersichtseinstellung des Tals, gehen weiterhin direkt an Text-zu-Video, mit dem vorangestellten Stilsatz. Szenen, die als durchgehend markiert sind, beginnen mit dem letzten Bild des vorherigen Clips statt mit einem neuen Keyframe, sodass Kulisse und Licht erhalten bleiben.

Nebeneffekte, die uns gefallen

  • Die Kino-Stufen können jetzt Figuren verwenden; vorher ging das nur in den schnellen Stufen, weil es den Referenz-Endpunkt nur dort gab.
  • Sie können den Keyframe prüfen, bevor der Clip existiert, und die Bibliothek bewahrt ihn samt Prompt auf.
  • Ein misslungener Keyframe scheitert günstig; der teure Videoschritt läuft gar nicht erst.
  • Komposition und Bewegung sind getrennt. Wenn eine Szene falsch aussieht, ist das Problem im Standbild sichtbar, und die Korrektur ist eine Änderung an einem einzigen Prompt.

Was es kostet

Eine Bildgenerierung pro Szene, zu tatsächlichen Kosten ein paar Cent. Verglichen mit dem Videoclip, der darauf folgt, ist das nahezu kostenlos. Ein vierminütiger Film mit etwa 32 Szenen fügt rund 1,30 Dollar für Keyframes zu etwa 30 Dollar für Clips hinzu. Wir haben überlegt, den Keyframe optional zu machen, um diesen Betrag zu sparen, und uns dagegen entschieden; die Ersparnis ist unbedeutend, der Verlust an Konsistenz nicht.

So holen Sie das Beste heraus

  • Beschreiben Sie das Motiv im Keyframe-Prompt und nur die Bewegung im Video-Prompt. Wer die Figur in der Videostufe erneut beschreibt, lädt das Modell ein, sie neu zu zeichnen.
  • Setzen Sie den Stilsatz in jedem Prompt an den Anfang. Modelle gewichten den Anfang stärker.
  • Verbieten Sie Rahmen und Text im Keyframe. Bildmodelle zeichnen manchmal eine Rahmenlinie oder eine Bildunterschrift, und das Videomodell animiert dann ein Poster.
  • Bevorzugen Sie bei gezeichneten Stilen Standard. Die schnelle Stufe hält flache Farben flach; die Kino-Stufen können einem gezeichneten Keyframe eine fotorealistische Textur hinzufügen.

Fallstricke

Die Bewegung bei Bild-zu-Video ist durch das Bild begrenzt. Eine Figur, die auf die Kamera zuläuft, oder ein Kampf kann eingeengt wirken, weil das Modell ungern die vorgegebene Komposition verlässt. Kürzere Clips helfen, ebenso ein neuer Keyframe für den nächsten Moment. Manche Modelle driften außerdem gegen Ende eines langen Clips ab; in der schnellen Stufe sind 5 bis 8 Sekunden pro Szene ideal, und die Erzählung trägt die Geschichte über die Schnitte hinweg.

Ab drei Besetzungsmitgliedern in einem Bild beginnen aktuelle Modelle, Merkmale zu vermischen. Die Regie ist angewiesen, Szenen auf die Figuren zu beschränken, auf die es ankommt, und die Prompts nennen Positionen („der Frosch links, die Eule rechts“), wenn sich zwei ein Bild teilen.

Häufige Fragen

Funktioniert der Keyframe-Weg in jeder Stufe? Ja. Entwurf, Standard, Kino und Kino Pro animieren alle aus dem Keyframe; nur die Dauern unterscheiden sich, 5 oder 10 Sekunden in den schnellen Stufen und 4, 6 oder 8 in Kino.

Kann ich mein eigenes erstes Bild liefern? Ja. Im Szene-für-Szene-Ablauf wird ein von Ihnen freigegebenes Storyboard-Bild über denselben Bild-zu-Video-Schritt zum ersten Bild des Clips; das Modell startet von Ihrem Bild, nicht von einer Beschreibung davon.

Was, wenn das Videomodell den Keyframe ignoriert? Kürzen Sie den Clip, prüfen Sie, dass der Keyframe weder Rahmen noch Text enthält, und beschränken Sie den Video-Prompt auf die Bewegung. Ein gerahmtes Bild wird als Poster gelesen und neu interpretiert.