Lippensynchronität in KI-Animation bedeutet, dass die Mundbewegung einer Figur zu ihren gesprochenen Worten passt. Bei Yeşilçam Studios haben wir uns für einen Weg entschieden, bei dem zuerst die Stimme feststeht: Jede Figur spricht in jeder Szene mit derselben Stimme, und diese Stimme wird Wort für Wort an die Mundbewegung ausgerichtet. Hier erklären wir, warum wir diese Reihenfolge gewählt haben und wie die Ausrichtung funktioniert.
Das Problem mit generischer Lippensynchronität
Es gibt grob zwei Ansätze, eine Figur sprechen zu lassen. Beim ersten wird zuerst eine Tonspur erzeugt und dann ein Mund dazu animiert. Beim zweiten erzeugt ein Videomodell eine Szene, in der die Figur spricht, und liefert dabei oft gleich eine eigene Stimme mit. Der zweite Weg sieht auf den ersten Blick bequem aus, hat aber einen Haken, der in einem einzelnen Clip nicht auffällt und in einem ganzen Film unerträglich wird: Die Stimme ändert sich von Szene zu Szene. Die Heldin klingt in Szene eins wie eine junge Frau, in Szene drei wie jemand anderes, und in Szene fünf hat sie plötzlich einen Akzent.
In unseren Tests war das der Fehler, den Zuschauer am schnellsten bemerkten. Ein leicht ungenauer Mund wird verziehen, weil das Auge ihn als Stil liest. Eine fremde Stimme dagegen reißt sofort aus der Geschichte. Deshalb haben wir entschieden: Die Stimme ist fest, und alles andere passt sich an.
Wie es in Cinemation funktioniert
Die Lippensynchronität arbeitet in den acht Cinemation-Stilen mit Videomodell (Wuxiamation, Celmation, Neonmation, Toymation, Toonmation, Claymation, Postermation und Panelmation), wenn Figuren Dialog sprechen. Der Ablauf besteht aus vier Schritten:
- Das Videomodell animiert die Szene und bewegt dabei den Mund der Figur, die gerade spricht.
- Ein Sprachmodell spricht die Zeile in der festen Stimme genau dieser Figur, also in der Stimme, die Sie unter „Stimme“ gewählt haben oder die automatisch vergeben wurde.
- Die gesprochene Zeile wird transkribiert, um für jedes Wort den genauen Zeitpunkt zu erhalten.
- Die Zeile wird Wort für Wort zeitlich an die Mundbewegung angeglichen, sodass Anfang und Ende der Sprache dort liegen, wo sich der Mund bewegt.
Das Ergebnis: Die Figur klingt in jeder Szene gleich, und die Worte fallen dorthin, wo der Mund sie formt.
Strecken statt schneiden
Ein Detail, an dem wir lange gearbeitet haben, ist der Umgang mit Zeiten, die nicht exakt passen. Ein naheliegender Ansatz wäre, jedes Wort einzeln zu verschieben oder abzuschneiden, wenn es zu lang ist. Das klingt im Ergebnis gehackt: Silben fehlen, Satzenden brechen ab, und das letzte Wort einer Frage geht verloren. Wir strecken stattdessen die ganze Zeile als Einheit, damit sie in das Zeitfenster der Mundbewegung passt. Die Wortzeiten aus der Transkription dienen als Orientierung, aber geschnitten wird nicht pro Wort. So bleiben Satzenden vollständig, und die natürliche Betonung der Stimme bleibt erhalten.
Stimmen richtig wählen
Die Stimmwahl ist der Teil, den Sie selbst steuern. Unter „Figuren“ hat jede Figur ein Feld „Stimme“. Die Voreinstellung „Stimme: automatisch“ wählt eine passende männliche oder weibliche Stimme. Wenn Ihnen das genügt, müssen Sie nichts tun. Wenn Sie zwei Figuren gleichen Geschlechts haben, lohnt es sich, bewusst zwei deutlich verschiedene Stimmen auszuwählen, damit man sie auch ohne Bild unterscheiden kann. Für Kinderfilme empfehlen wir eine warme Stimme für die Hauptfigur und eine kontrastierende für den Gegenspieler. Mehr Tipps stehen im Leitfaden Lippensynchronität und Figurenstimmen.
Was Sie beim Schreiben beachten sollten
- Kurze Zeilen. Eine Szene hat eine begrenzte Dauer. Eine Zeile mit ein bis zwei Sätzen lässt sich sauber ausrichten; ein ganzer Monolog muss stark gestreckt werden.
- Klare Sprecher. Wenn Sie den Dialog selbst schreiben, ordnen Sie jede Zeile einer Figur zu. Das Studio weiß dann genau, welcher Mund sich bewegen und welche Stimme sprechen soll.
- Figuren sichtbar halten. Lippensynchronität braucht ein Gesicht. Szenen, in denen die sprechende Figur nur von hinten zu sehen ist, eignen sich eher für den Erzähler.
- Untertitel einschalten. Im Dialog zeigen die Untertitel den Namen der sprechenden Figur. Das hilft, wenn das Video stumm abgespielt wird.
Was wir bewusst nicht versprechen
Unsere Ausrichtung ist keine Animation einzelner Mundformen für jeden Laut. Das Videomodell erzeugt die Mundbewegung, und wir richten die Stimme daran aus. Shadowmation und Pixelmation zeichnet dagegen eine 2,5D-Animations-Engine statt eines Videomodells: Dort sprechen die Figuren ebenfalls mit ihrer festen Stimme, und Untertitel zeigen den Sprecher, aber es gibt keine Mundanimation und keine Clipprüfung. Wir halten das für den ehrlicheren Kompromiss: lieber eine konsistente Figur mit gutem Timing als eine perfekt artikulierende Figur, die in jeder Szene anders klingt.
Zusammenspiel mit der Clipprüfung
Auf der Premium-Stufe prüft ein prüfendes Modell jeden Clip auf grobe Fehler, etwa eine falsche Figur in der Szene. Das ist auch für die Lippensynchronität wichtig: Wenn statt der Sprecherin plötzlich eine andere Figur im Bild ist, passt die Stimme nicht mehr. Solche schweren Fehler lösen eine Neuerzeugung aus. Wie diese Prüfung arbeitet, beschreibt Jeder Clip wird ein zweites Mal angesehen. Ausprobieren können Sie alles auf der Seite Animation.
Häufige Fragen
In welchen Stilen gibt es Lippensynchronität? In den acht Cinemation-Stilen mit Videomodell (Wuxiamation, Celmation, Neonmation, Toymation, Toonmation, Claymation, Postermation und Panelmation), sobald Figuren im Dialog sprechen, also mit der Einstellung „Dialog“ oder „Beides“. In Shadowmation und Pixelmation wird Dialog mit fester Stimme und Untertiteln vertont, aber ohne Mundanimation.
Klingt eine Figur in jeder Szene gleich? Ja. Jede Figur hat eine feste Stimme, die für den ganzen Film gilt. Genau darauf ist das Verfahren ausgelegt.
Werden Satzenden abgeschnitten, wenn die Zeile zu lang ist? Nein. Die Zeile wird als Ganzes gestreckt, um in die Mundbewegung zu passen, statt Wort für Wort gekürzt zu werden.
Kann ich die Stimme einer Figur selbst wählen? Ja. Im Feld „Stimme“ jeder Figur wählen Sie eine männliche oder weibliche Stimme oder lassen „Stimme: automatisch“ stehen.
