Definition. Eine Geschichte-zu-Film-Pipeline ist ein Softwaresystem, das einen erzählenden Text als Eingabe nimmt und ohne menschliche Einstellungsliste ein fertiges Video als Ausgabe erzeugt. Sie kombiniert ein Sprachmodell, das die Geschichte liest und strukturiert, Bild- und Videomodelle, die die Szenen zeichnen, Sprachsynthesemodelle für die Stimmen, ein Musikmodell und einen deterministischen Editor, der alles zu einer einzigen Datei zusammensetzt. Die Person, die sie nutzt, trifft zu Beginn eine Handvoll kreativer Entscheidungen; die Pipeline trifft die Hunderte kleiner Entscheidungen, die sonst ein Filmteam treffen würde.
Es lohnt sich, den Begriff genau zu definieren, weil er oft mit zwei Nachbarn verwechselt wird. Ein Text-zu-Video-Modell ist ein einzelnes Modell, das aus einem Prompt einen Clip macht; es kennt weder Figuren noch Akte noch Kontinuität. Ein Videoeditor mit KI-Funktionen hilft jemandem, der bereits Filmmaterial hat. Eine Pipeline steht über beiden: Sie entscheidet, welche Clips gebraucht werden, erzeugt sie in der richtigen Reihenfolge mit gemeinsamen Referenzen und schneidet sie zusammen.
Die sieben Stufen
- Aufnahme. Der Text wird bereinigt (Formatierung, Notizen und Chatzeilen werden entfernt), seine Sprache erkannt und seine Länge gemessen. Die Bereinigung ist wichtiger, als es klingt: Geschichten, die aus einem Chatfenster eingefügt werden, enthalten oft Zeilen wie „Wenn Sie möchten, kann ich das umschreiben“, und ein Modell, das sie als Teil der Geschichte liest, bringt einen Assistenten in den Film.
- Regie. Ein Sprachmodell erzeugt ein strukturiertes Drehbuch: einen Titel, eine einzeilige Logline, einen Stilleitfaden, eine Besetzung mit visuellen und stimmlichen Profilen sowie eine Liste von Szenen. Jede Szene enthält eine Kurzfassung, einen Bild-Prompt, eine Dauer, die anwesenden Besetzungsmitglieder, eine gesprochene Zeile und einen Erzählsatz. Die Ausgabe wird gegen ein Schema validiert und bei einem Fehler einmal mit der Fehlerliste wiederholt.
- Besetzung. Ein Bildmodell zeichnet pro Figur ein Referenzblatt im gewählten Stil: Ganzkörper, neutrale Pose, schlichter Hintergrund. Diese Blätter sind der visuelle Anker für jede spätere Stufe und lassen sich über mehrere Filme hinweg wiederverwenden.
- Keyframes. Für jede Szene komponiert das Bildmodell aus den Referenzblättern und dem Szenen-Prompt ein Standbild. Hier werden die Figuren platziert, beleuchtet und in Pose gebracht. Bildmodelle folgen Referenzen weit besser als Videomodelle; diese Stufe vor die Animation zu setzen, ist daher die wichtigste Designentscheidung der gesamten Pipeline.
- Animation. Ein Videomodell animiert jedes Keyframe für die Dauer der Szene (Bild-zu-Video). Szenen ohne Besetzungsmitglied, etwa Establishing Shots, werden aus Text erzeugt. Szenen, die eine vorherige fortsetzen, beginnen mit dem letzten Frame des vorherigen Clips.
- Ton. Gesprochene Zeilen werden mit Stimmen synthetisiert, die zum Profil der jeweiligen Figur passen, und – sofern ein Lippensynchronisationsanbieter verfügbar ist – von der Figur im Clip mit den Lippen mitgesprochen. Die Erzählung wird pro Szene mit einer eigenen Erzählerstimme synthetisiert. Die Musik wird einmal aus dem Stilleitfaden erzeugt und unter den gesamten Film gemischt.
- Zusammenbau. Die Clips werden auf eine Auflösung und Bildrate normalisiert, in der richtigen Reihenfolge aneinandergereiht, mit Erzählung, Dialog und Musik gemischt und kodiert. Der Zusammenbau ist deterministisch: Dieselben Eingaben ergeben immer dieselbe Datei, wodurch Wiederholungen gefahrlos sind.
Was zwischen den Stufen fließt
Die Stufen sind durch ein einziges Objekt verbunden: das Drehbuch. Die Regie schreibt es; jede spätere Stufe liest daraus und schreibt ihre Ergebnisse zurück: die URLs der Blätter in die Besetzungseinträge, die URLs von Keyframes und Clips in die Szenen, die Audiopfade in den Audioblock. Da das Objekt nach jeder Stufe gespeichert wird, lässt sich ein Film an jeder Stelle fortsetzen. Fällt der Videoanbieter bei Szene neun aus, zeichnet die Pipeline weder die Besetzung noch die ersten acht Szenen neu; sie wiederholt Szene neun und macht weiter.
Dasselbe Objekt prüft die Person zwischen Besetzung und Produktion. Sie sieht den Titel, die Besetzungsblätter und die Szenenliste, bevor teures Video erzeugt wird, und kann das Aussehen einer Figur ändern, eine Szene streichen oder eine Zeile umschreiben. Dieser Prüfpunkt ist die Antwort der Pipeline auf das Storyboard.
Warum die Reihenfolge wichtig ist
Die Besetzung vor den Keyframes hält die Figuren konsistent: Das Blatt wird einmal gezeichnet und überall referenziert. Die Keyframes vor der Animation halten die Szenen werktreu: Die Komposition wird in einem günstigen Bild festgelegt, bevor ein teurer Clip dafür ausgegeben wird. Der Ton nach der Animation erlaubt es der Lippensynchronisation, den echten Clip statt einer Vermutung zu verwenden. Die Musik zuletzt lässt die Mischung dem endgültigen Schnitt folgen. Vertauscht man zwei dieser Schritte, entsteht ein schlechterer Film für mehr Geld.
Wohin die Kosten fließen
Fast die gesamten Kosten entfallen auf die Animationsstufe. Ein vierminütiger Film hat rund dreißig Szenen; jeder Clip kostet je nach Modellstufe zwischen einigen Cent und einigen Dollar. Die Regie kostet mit einem Modell der Flash-Klasse Cent-Beträge, mit einem Frontier-Modell einige Dutzend Cent. Besetzung und Keyframes zusammen kosten weniger als ein einziger Clip. Sprache und Musik fallen kaum ins Gewicht. Deshalb lässt eine gute Pipeline die Person die Videostufe pro Film wählen, und deshalb erzeugt sie zuerst die Keyframes: Ein misslungenes Bild kostet Cent, ein misslungener Clip kostet Dollar.
Fehlerfälle, die eine Pipeline abfangen muss
- Das Sprachmodell liefert eine fehlerhafte Struktur: validieren, einmal mit der Fehlerliste wiederholen und den Auftrag dann scheitern lassen, bevor Geld für Video ausgegeben wird.
- Ein Anbieter lehnt ab oder hat sein Kontingent aufgebraucht: den einzelnen Auftrag scheitern lassen, erstatten und den Film wo möglich am Leben halten. Ein Fehler bei der Lippensynchronisation etwa sollte den Film nicht stoppen; die Zeile kann trotzdem in der Tonspur gesprochen werden.
- Die Ziellänge ist kürzer als die Geschichte: weniger Ereignisse auswählen, niemals Sätze zerstückeln. Eine Regie, die einen ganzen Roman in sechzig Sekunden presst, indem sie die Erzählung beschleunigt, produziert Kauderwelsch.
- Zwei Figuren verschmelzen zu einem Besetzungseintrag: ein Wesen pro Eintrag erzwingen. Ein Blatt, das „die Tiere“ zeigt, kann einen Fuchs und einen Bären nicht getrennt verankern.
- Ein Anbieter entfernt einen Endpunkt: darum herum routen. Video-Endpunkte mit Figurenreferenz sind schon ohne Vorankündigung verschwunden; der Keyframe-Weg überlebt, weil er nur Bild-zu-Video braucht, was jeder Anbieter bietet.
Was eine gute Pipeline der Person anbietet
Vier Entscheidungen am Anfang: die Geschichte, ein visueller Stil, eine Ziellänge und eine Qualitätsstufe. Ein Prüfpunkt nach der Besetzung. Eine fertige Datei am Ende, wobei das Drehbuch aufbewahrt wird, damit einzelne Szenen später neu erzeugt werden können. Alles andere, von der Stimmenauswahl bis zur Cliplänge, ist eine Entscheidung, die die Pipeline standardmäßig gut treffen und nur für diejenigen offenlegen sollte, die danach fragen.
Häufige Fragen
Braucht es noch ein Storyboard? Das Drehbuchobjekt ist das Storyboard; die Keyframes sind seine Bilder. Die Person prüft es zwischen Besetzung und Produktion und kann es bearbeiten, bevor ein Clip erzeugt wird.
Wie lange dauert ein Film? Die Regie dauert weniger als eine Minute, die Besetzung einige Minuten und die Animation je nach Stufe und Warteschlange des Anbieters zwischen zehn Minuten und einer Stunde. Der Zusammenbau dauert Sekunden.
Können dieselben Figuren in einem zweiten Film auftreten? Ja. Die Referenzblätter werden mit der Figur gespeichert, sodass eine zweite Geschichte dieselbe Besetzung mit demselben Aussehen wiederverwenden kann.
Was kostet das? Fast ausschließlich die Videostufe; die Zahlen pro Stufe finden Sie im Artikel zur Kostenanatomie.
