Konsistenz ist die Eigenschaft, dass dieselbe Figur über alle Szenen hinweg erkennbar dieselbe bleibt: Gesicht, Proportionen, Kostüm, Farbpalette. Generative Modelle haben zwischen zwei Aufrufen kein Gedächtnis; jede Anfrage beginnt bei null. Konsistenz muss daher in die Eingaben hineinkonstruiert werden, und alle funktionierenden Techniken sind Varianten einer einzigen Idee: einmal festlegen, wie die Figur aussieht, in einer Form, die das Modell kopieren kann, und ihm diese Form jedes Mal mitgeben.

Warum es schwierig ist

Ein Text-Prompt beschreibt eine Verteilung, kein Individuum. „Ein Fuchs in einer blauen Jacke“ ergibt jedes Mal einen anderen Fuchs, weil Tausende Füchse auf die Beschreibung passen. Selbst eine sehr lange Beschreibung lässt Spielraum: Ohrenform, Schnauzenlänge, Augenfarbe, Schnitt der Jacke. Videomodelle verschärfen das Problem, weil sie die Figur zusätzlich über viele Frames stabil halten müssen und dabei Treue zur Referenz gegen Bewegungsqualität eintauschen. Ohne gezielte Technik entsteht ein Film, bei dem die Zuschauer Untertitel brauchen, um zu wissen, wer wer ist.

Technik 1: Referenzblätter

Zeichnen Sie jede Figur einmal: Ganzkörper, neutrale Pose, schlichter Hintergrund, im Stil des Films. Das ist der visuelle Anker. Ein Blatt funktioniert, weil ein Bild alles festlegt, was eine Beschreibung offenlässt. Speichern Sie es mit der Figur, damit es in weiteren Filmen wiederverwendet werden kann, und bewahren Sie den Prompt auf, der es erzeugt hat, damit es in einem anderen Stil neu erzeugt werden kann.

Praktische Regeln: eine Figur pro Blatt, keine Requisiten, die nicht in jeder Szene vorkommen, keine dramatische Beleuchtung. Das Blatt ist eine Spezifikation, kein Plakat. Ein dramatisches Blatt schleppt seine Beleuchtung in jede Szene, die es referenziert.

Technik 2: ein schriftlich festgehaltenes Aussehen

Halten Sie neben dem Bild eine Beschreibung von 30–60 Wörtern bereit: Spezies oder Alter, Gesicht, Haare, Kostüm, Farben, ein unverwechselbares Merkmal. Nehmen Sie sie in jeden Szenen-Prompt auf. Worte steuern das Modell auch dann, wenn die visuelle Referenz schwach ist oder fehlt, und sie legen fest, was ein Bild nicht kann, etwa den Namen oder die Rolle der Figur. Das schriftliche Aussehen ist außerdem das, was ein Sprachmodell liest, wenn es Szenen-Prompts schreibt; es sollte daher für ein Modell geschrieben sein: konkrete Substantive und Farben, keine Adjektive wie „schön“.

Technik 3: Keyframe zuerst

Bitten Sie nicht das Videomodell, die Figur zu platzieren. Bitten Sie das Bildmodell, die Szene als Standbild zu komponieren, mit den Referenzblättern im Aufruf und der Anweisung, jedes Design getreu beizubehalten. Animieren Sie dann das Standbild. Bildmodelle halten sich deutlich besser an Referenzen als Videomodelle, weil sie ein einzelnes Bild statt einer Sequenz lösen, und sie sind zehn- bis fünfzigmal günstiger. Ein misslungenes Keyframe kostet Cent und ist in Sekunden neu erzeugt; ein misslungener Clip kostet Dollar und Minuten.

Der Keyframe-Weg hat einen zweiten Vorteil: Er trennt Komposition von Bewegung. Wirkt eine Szene falsch, ist das Problem im Standbild sichtbar, bevor Bewegung hinzukommt, und es lässt sich beheben, indem man den Prompt für genau dieses eine Bild anpasst.

Technik 4: ein Wesen pro Eintrag

Sprachmodelle sparen gern. Bei einer Geschichte mit einem Fuchs und einem Bären erzeugt ein Regiemodell manchmal einen einzigen Besetzungseintrag namens „die Tiere“. Verbieten Sie das im Vertrag: Jeder Besetzungseintrag beschreibt genau ein Wesen. Ein zusammengelegtes Blatt kann nicht zwei Figuren verankern, und jede spätere Stufe erbt die Verschmelzung.

Technik 5: Kontinuitäts-Frames

Setzt eine Szene die vorherige am selben Ort fort, beginnen Sie den neuen Clip mit dem letzten Frame des vorherigen Clips statt mit einem neuen Keyframe. Figur, Beleuchtung und Kulisse werden automatisch übernommen. Nutzen Sie das nur für echte Fortsetzungen; ein neuer Ort braucht ein neues Keyframe, sonst sickert die alte Kulisse hinein.

Was nicht funktioniert hat

Endpunkte für mehrere Referenzbilder bei Videomodellen: akzeptabel für menschliche Gesichter, schwach bei Tieren und Gegenständen und anfällig dafür, vom Anbieter ohne Vorankündigung entfernt zu werden. Mehrere solcher Endpunkte sind innerhalb weniger Monate nach dem Start verschwunden. Reine Text-Prompts mit einem Namen: Das Modell hat diesen Namen nie gesehen und behandelt ihn als Rauschen. Sehr lange Prompts: Ab einigen hundert Wörtern gewichten Modelle den Anfang und ignorieren den Rest; das Aussehen gehört deshalb an den Anfang, nicht ans Ende. Seeds: Ein fester Seed reproduziert ein einzelnes Bild, nicht eine Figur über verschiedene Kompositionen hinweg.

Konsistenz messen

Wählen Sie drei Szenen mit derselben Figur und vergleichen Sie Gesicht, Kostüm und Farbpalette nebeneinander. Bewerten Sie jede Dimension mit 0–2: 2, wenn sie auf einen Blick identisch ist, 1, wenn sie mit Mühe erkennbar ist, 0, wenn es eine andere Figur sein könnte. Eine Figur erreicht maximal 6 Punkte; ein Film ergibt sich aus dem Durchschnitt seiner Figuren. Unter 4 sollten Sie die Blätter neu erzeugen, bevor Sie eine Szene neu erzeugen: Der Fehler liegt fast immer im Anker, nicht in den Szenen, die ihn referenzieren.

Ein günstigerer Ersatz ist der Untertiteltest: Sehen Sie sich den Film ohne Ton an und fragen Sie sich, ob Sie erkennen, wer spricht. Brauchen Sie den Namen auf dem Bildschirm, ist die Konsistenz gescheitert.

Häufige Fragen

Funktioniert ein Foto einer realen Person als Referenzblatt? Nur bei fotorealistischen Stilen und nur mit Einwilligung der Person. Bei gezeichneten Stilen sollten Sie das Blatt in diesem Stil erzeugen; ein Foto zieht Realismus in jede Szene.

Wie viele Referenzbilder pro Figur? Ein gutes Ganzkörperblatt genügt für die meisten Filme. Ein zweites Blatt mit einer Nahaufnahme des Gesichts hilft bei Szenen, die überwiegend aus Gesichtern bestehen.

Können zwei Figuren zuverlässig eine Szene teilen? Ja, wenn beide Blätter an die Keyframe-Stufe übergeben werden und der Prompt sie nach Position benennt („der Fuchs links, der Bär rechts“). Ab drei Figuren in einem Bild beginnen aktuelle Modelle, Merkmale zu vermischen.