Definition. Lippensynchronität (englisch Lip Sync) bezeichnet die zeitliche und formale Übereinstimmung zwischen gesprochener Sprache und sichtbaren Mundbewegungen einer Figur. In KI-Animation entsteht sie auf zwei grundsätzlich verschiedenen Wegen: Entweder erzeugt ein Modell die Mundbewegung passend zu einer vorhandenen Tonspur, oder eine Tonspur wird an eine bereits vorhandene Mundbewegung angepasst. Beide Wege haben eigene Stärken, eigene Kosten und eigene typische Fehler.

Dass Menschen schon kleine Abweichungen bemerken, liegt an der engen Verknüpfung von Hören und Sehen bei der Sprachwahrnehmung. Ein bekanntes Beispiel ist der McGurk-Effekt: Wer die Lippenbewegung einer Silbe sieht und gleichzeitig eine andere Silbe hört, nimmt oft eine dritte wahr. Das Gehirn verrechnet also beide Kanäle, und wenn sie nicht zusammenpassen, wirkt eine Figur schnell hölzern oder „nachsynchronisiert“.

Grundbegriffe: Phoneme, Viseme und Timing

  • Phonem. Die kleinste bedeutungsunterscheidende Lauteinheit einer Sprache, etwa /m/, /a/ oder /f/.
  • Visem. Die sichtbare Mundform, die zu einer Gruppe von Phonemen gehört. Mehrere Laute sehen gleich aus: /m/, /b/ und /p/ schließen die Lippen, /f/ und /v/ legen die Oberzähne auf die Unterlippe, gerundete Vokale wie /o/ und /u/ spitzen den Mund. Deshalb kommt die Animation mit deutlich weniger Mundformen aus, als eine Sprache Laute hat.
  • Timing. Die zeitliche Lage der Mundform relativ zum Ton. Im Zeichentrick wird die Mundform oft ein bis zwei Bilder vor dem Laut gezeigt, weil das Auge die Vorbereitung einer Bewegung wahrnimmt.
  • Koartikulation. Laute beeinflussen einander. Das „o“ in „Rose“ sieht anders aus als in „Post“, weil der Mund schon den nächsten Laut vorbereitet. Wer jeden Laut isoliert animiert, erhält ein mechanisches Klappern.

In der klassischen Animation arbeitete man mit Mundformtabellen, in denen für jede Figur eine kleine Zahl von Mundpositionen gezeichnet war. Das Tonband wurde Bild für Bild ausgewertet und für jedes Bild die passende Form eingetragen. Die japanische Fernsehanimation kommt traditionell mit sehr wenigen Mundstellungen aus, ohne dass das Publikum es als Fehler empfindet. Das zeigt: Perfekte Mundformen sind weniger wichtig als stimmiges Timing und ein glaubwürdiger Rhythmus.

Verfahren 1: audiogesteuerte Mundgenerierung

Hier ist der Ton zuerst da. Ein Modell erhält ein Bild oder Video eines Gesichts und eine Tonspur und erzeugt die Mundregion neu, sodass sie zu den gesprochenen Lauten passt. Diese Verfahren liefern oft sehr präzise Mundformen und eignen sich gut für frontal gefilmte Sprecher, etwa Moderationen oder Präsentationen.

Ihre Grenzen zeigen sich bei stilisierten Figuren. Tiere, Puppen, Anime-Gesichter oder Figuren aus Knete haben andere Proportionen als die Gesichter, mit denen solche Modelle hauptsächlich arbeiten. Das Ergebnis kann einen realistischen Mund in ein gezeichnetes Gesicht setzen, Zähne erfinden, die der Stil nicht vorsieht, oder bei Profilansichten und verdeckten Gesichtern versagen. Außerdem bedeutet jeder zusätzliche Bearbeitungsschritt am Video weitere Rechenkosten und ein weiteres Risiko für Bildfehler.

Verfahren 2: Ausrichtung wie bei der Synchronisation

Der umgekehrte Weg kommt aus der Filmsynchronisation. Dort bleibt das Bild unangetastet, und Sprecherinnen und Sprecher passen Text und Tempo so an, dass der neue Ton zu den sichtbaren Lippen passt. Übertragen auf KI-Animation heißt das: Ein Videomodell erzeugt die Szene samt sprechender Figur, und die Tonspur wird anschließend zeitlich so ausgerichtet, dass Wortanfänge und Pausen mit der Mundbewegung zusammenfallen.

  1. Die Szene wird mit einer sprechenden Figur erzeugt; die Mundbewegung entsteht im Stil der Figur, weil sie Teil desselben Clips ist.
  2. Die Zeile wird mit der festen Stimme der Figur synthetisiert.
  3. Die synthetisierte Sprache wird transkribiert, um die Zeitmarken jedes Wortes zu gewinnen.
  4. Die Tonspur wird so gedehnt oder gestaucht und platziert, dass sie zur sichtbaren Sprechphase passt.

Der Vorteil liegt in der Stiltreue: Eine Knetfigur bewegt ihren Mund wie eine Knetfigur, eine Anime-Figur wie eine Anime-Figur. Die Herausforderung liegt in der Ausrichtung. Wer jedes Wort einzeln verschiebt oder abschneidet, erhält verstümmelte Wortenden und unnatürliche Sprünge. Robuster ist es, die ganze Zeile als Einheit anzupassen.

Typische Fallstricke

  • Abgeschnittene Enden. Wenn die Zeile länger ist als die sichtbare Sprechphase und hart gekürzt wird, fehlen die letzten Silben.
  • Drift. Kleine Abweichungen summieren sich über eine lange Zeile, sodass der Ton am Ende deutlich hinter dem Bild liegt.
  • Wechselnde Stimmen. Wird für jede Szene eine neue Stimme gewählt, klingt dieselbe Figur in Szene drei anders als in Szene eins; das stört mehr als ein leicht ungenauer Mund.
  • Falsche Sprecherin. Sind mehrere Figuren im Bild, bewegt womöglich die falsche Figur den Mund.
  • Überdeutlichkeit. Zu große Mundbewegungen wirken bei ruhigen Zeilen übertrieben, besonders in Nahaufnahmen.
  • Sprache. Unterschiedliche Sprachen haben unterschiedliche Silbenrhythmen; eine deutsche Zeile ist oft länger als ihre englische Entsprechung und braucht mehr Zeit im Bild.

Vergleich der Ansätze

Audiogesteuerte Mundgenerierung ist stark bei realistischen, frontalen Gesichtern und wenn exakte Mundformen Vorrang haben. Die Ausrichtung nach Synchronisationsprinzip ist stark bei stilisierten Figuren, wenn der Look erhalten bleiben soll und wenn eine Figur über viele Szenen gleich klingen muss. In Geschichten mit mehreren Figuren und wiederkehrenden Auftritten ist Stimmkonsistenz für das Publikum meist wichtiger als perfekte Viseme.

Umsetzung in Yeşilçam Studios

In den acht Cinemation-Stilen von Yeşilçam Studios, die mit einem Videomodell arbeiten (Wuxiamation, Celmation, Neonmation, Toymation, Toonmation, Claymation, Postermation und Panelmation), folgt Dialog dem zweiten Ansatz. Das Videomodell animiert den Mund der sprechenden Figur; die Zeile wird dann mit der festen Stimme genau dieser Figur vertont und Wort für Wort an die Mundbewegung angepasst, sodass die Figur in jeder Szene gleich klingt. Um die Wortzeiten zu erhalten, wird die Sprache transkribiert; die ganze Zeile wird passend gedehnt statt pro Wort abgeschnitten, damit keine Wortenden verloren gehen. Die Stimme jeder Figur lässt sich unter „Stimme“ automatisch wählen oder gezielt aus männlichen und weiblichen Stimmen festlegen. Shadowmation und Pixelmation zeichnet dagegen eine 2,5D-Animations-Engine: Dort wird jede Zeile ebenfalls mit der festen Stimme der Figur vertont und der Untertitel nennt den Sprecher, eine Mundanimation, Lippensynchronität oder Clipprüfung gibt es aber nicht.

Mehr dazu im Leitfaden Lippensynchronität und Figurenstimmen, im Beitrag Lippensynchronität, die die Stimme hält und im Artikel Dialoge mit mehreren Figuren erzeugen. Einen Überblick über alle Stile bietet die Seite Animation.

Häufige Fragen

Was ist ein Visem? Die sichtbare Mundform für eine Gruppe von Lauten, die gleich aussehen, zum Beispiel geschlossene Lippen für m, b und p. Animation braucht daher weniger Mundformen als eine Sprache Laute hat.

Warum wirkt Lippensynchronität bei Cartoonfiguren oft schlechter? Viele Verfahren sind auf realistische Gesichter ausgelegt und übertragen deren Mundformen auf stilisierte Figuren. Besser wirkt eine Mundbewegung, die im Stil der Figur selbst entsteht.

Ist perfekte Lippensynchronität wichtiger als eine konstante Stimme? In Geschichten mit wiederkehrenden Figuren meist nicht. Eine Figur, die in jeder Szene anders klingt, fällt dem Publikum stärker auf als eine leicht ungenaue Mundform.

Wie vermeidet man abgeschnittene Wortenden? Indem man die gesamte Zeile als Einheit zeitlich anpasst, statt einzelne Wörter zu kürzen oder zu verschieben.