Jedes Videomodell öffnet mindestens zwei Türen: einen Text-Prompt oder ein Startbild plus Prompt. Manche bieten eine dritte: Referenzbilder einer Figur. Die Tür pro Szene zu wählen ist eine Routing-Entscheidung, keine Geschmacksfrage, und ein Studio, das gut routet, produziert bessere Filme für weniger Geld als eines, das immer dieselbe Tür nimmt.
Text-zu-Video
Das Modell erhält einen Prompt und erfindet alles: Kulisse, Licht, Motiv, Bewegung. Das ist die richtige Tür für Establishing Shots und für Szenen ohne wiederkehrende Figur: Landschaften, Menschenmengen, Wetter, abstrakte Bewegung, eine Stadt bei Nacht. Es ist auch die Tür mit dem geringsten menschlichen Zeitaufwand, weil nichts vorbereitet werden muss.
Ihre Schwäche: Sie erinnert sich an nichts. Jeder Aufruf erfindet die Welt neu, sodass zwei Text-zu-Video-Szenen von „dem Häuschen des Fuchses“ zwei verschiedene Häuschen ergeben. Für Figurenszenen eingesetzt, ist sie die Hauptursache inkonsistenter Filme. Ihre zweite Schwäche ist die Kontrolle: Der Prompt kann eine Komposition verlangen, aber nicht garantieren, und Modelle ignorieren räumliche Anweisungen wie „links“ regelmäßig.
Bild-zu-Video
Das Modell erhält ein Startbild und animiert es. Das erste Frame steht fest; das Modell fügt Bewegung und, je nach Modell, Kamerabewegung hinzu. Das ist die richtige Tür, wann immer eine bestimmte Komposition oder eine bestimmte Figur erscheinen muss – in einem Geschichtenfilm also bei den meisten Szenen. So funktioniert auch Kontinuität: Eine Szene, die die vorherige fortsetzt, beginnt mit dem letzten Frame des vorherigen Clips.
Ihre Schwäche: Die Bewegung ist durch das Bild begrenzt. Sehr dynamische Action, etwa eine Figur, die auf die Kamera zuläuft, oder ein Kampf, kann eingeengt wirken, weil das Modell die vorgegebene Komposition nur ungern verlässt. Manche Modelle driften zudem: Nach fünf oder sechs Sekunden beginnt sich das Gesicht der Figur zu verändern. Kürzere Clips und ein frisches Keyframe für die nächste Szene sind die Lösung.
Endpunkte mit Figurenreferenz
Manche Anbieter akzeptieren einige Referenzbilder und einen Prompt und versprechen, die Figur konsistent zu halten, während sie die Komposition erfinden. In der Praxis bevorzugen diese Endpunkte menschliche Gesichter, tun sich mit Tieren und Gegenständen schwer und wurden von Anbietern mehr als einmal ohne Vorankündigung entfernt oder ersetzt. Betrachten Sie sie als optional: Nutzen Sie sie, wenn verfügbar, für fotorealistische menschliche Figuren, niemals als einzigen Weg, und behalten Sie immer den Keyframe-Weg als Rückfallebene. Eine Pipeline, die vom proprietären Endpunkt eines einzigen Anbieters abhängt, ist eine Pipeline, die bei der nächsten Produktentscheidung dieses Anbieters bricht.
Routing-Regeln
- Die Szene enthält ein Besetzungsmitglied: aus den Referenzblättern ein Keyframe komponieren, dann Bild-zu-Video.
- Die Szene setzt die vorherige am selben Ort fort: letztes Frame des vorherigen Clips, dann Bild-zu-Video.
- Die Person hat ein Bild geliefert: Bild-zu-Video ab diesem Bild.
- Die Szene ist ein Establishing Shot oder hat kein wiederkehrendes Motiv: Text-zu-Video.
- Andernfalls: Text-zu-Video, wobei der Stilleitfaden dem Prompt vorangestellt wird, damit der Look passt.
Ein Regiemodell kann diese Regeln selbst anwenden, wenn das Drehbuch jede Szene mit ihrer Besetzung und ihrer Kontinuitätsbeziehung zur vorherigen Szene kennzeichnet. Deshalb enthält das Drehbuchschema beide Felder.
Dauern
Schnelle Modelle bieten typischerweise 5 oder 10 Sekunden, Kino-Modelle 4, 6 oder 8. Die Regie darf nur aus der zulässigen Liste der Stufe wählen, für die sie schreibt, denn eine Szene, die für 7 Sekunden geschrieben ist, wird bei einem Modell, das nur 5 oder 10 kann, stillschweigend gerundet, und die für 7 Sekunden geschriebene Erzählung passt dann nicht mehr. Längere Clips kosten mehr und driften stärker; bei gezeichneten Stilen sind 5–8 Sekunden pro Szene der ideale Bereich, während die Erzählung die Geschichte über die Schnitte hinweg trägt.
Prompts für jede Tür
Text-zu-Video-Prompts sollten die Einstellung so beschreiben, wie es ein Kameramann täte: Motiv, Handlung, Kamera, Licht, Stil, in dieser Reihenfolge. Bild-zu-Video-Prompts sollten nur beschreiben, was sich verändert: die Bewegung, die Kamerafahrt, den Ausdruck. Das Motiv erneut zu beschreiben, verleitet das Modell dazu, es neu zu zeichnen. In beiden Fällen gehört der Stilsatz an den Anfang und die negativen Anweisungen („kein Text, kein Rahmen“) ans Ende.
Häufige Fragen
Kann ein Film die drei Türen mischen? Ja, und die meisten guten Filme tun das: Text-zu-Video für den Establishing Shot, Bild-zu-Video für Figurenszenen, Kontinuitäts-Frames für Sequenzen. Der Zusammenbau normalisiert Auflösung und Bildrate.
Welche Tür ist am besten für Anime? Bild-zu-Video ab einem Keyframe im Anime-Stil. Text-zu-Video auf Kino-Stufen fügt tendenziell fotorealistische Texturen hinzu, die den Look zerstören.
Was tun, wenn das Videomodell das Keyframe ignoriert? Senken Sie die Bewegungsstärke, falls das Modell sie anbietet, kürzen Sie den Clip und prüfen Sie, ob das Keyframe keinen Rahmen und keinen Text enthält; Modelle behandeln gerahmte Bilder als Plakate und interpretieren sie neu.
