Definition. Mehrstimmige Dialoggenerierung bezeichnet das automatische Schreiben und Vertonen von Gesprächen zwischen zwei oder mehr Figuren, bei dem jede Zeile eindeutig einer sprechenden Figur zugeordnet, mit deren eigener Stimme gesprochen und im Bild richtig platziert wird. Ein Sprachmodell entwirft die Zeilen aus Geschichte und Figurenbeschreibungen, eine Sprachsynthese vertont sie, und die Produktion sorgt dafür, dass Stimme, Mund, Untertitel und Szene zusammenpassen.

Einen einzelnen Erzähler zu erzeugen ist vergleichsweise einfach: ein Text, eine Stimme, eine Tonspur. Sobald Figuren miteinander sprechen, vervielfacht sich die Zahl der Entscheidungen. Wer spricht wann? Wie unterscheiden sich die Figuren in Wortwahl und Tonfall? Wie erkennt das Publikum, wer gerade spricht? Und wie bleibt eine Stimme über zwanzig Szenen hinweg dieselbe?

Die Bestandteile eines generierten Dialogs

  • Besetzungsliste. Eine feste Liste von Figuren mit Namen, Aussehen und Stimme. Sie ist die Referenz für alle weiteren Schritte.
  • Skript. Eine geordnete Liste von Zeilen, jede mit Sprecher und Text. Diese einfache Struktur, Sprecher plus Zeile, ist das Datenformat, auf das sich Schreiben, Vertonen und Untertiteln einigen.
  • Szenenzuordnung. Jede Zeile gehört zu einer Szene, in der die sprechende Figur auch anwesend sein muss.
  • Stimmenbesetzung. Die Zuordnung einer festen synthetischen Stimme zu jeder Figur.
  • Untertitel. Der gesprochene Text als Einblendung, bei Dialogen mit dem Namen der sprechenden Figur.

Wie ein Sprachmodell Dialog schreibt

Ein Sprachmodell erzeugt Dialog, indem es aus der Geschichte, den Figuren und dem gewünschten Ton wahrscheinliche Zeilen ableitet. Damit das Ergebnis brauchbar ist, braucht es klare Vorgaben. Bewährt haben sich:

  1. Feste Namen. Das Modell darf nur Figuren aus der Besetzungsliste sprechen lassen. Erfundene Nebenfiguren führen dazu, dass Zeilen keiner Stimme zugeordnet werden können.
  2. Strukturierte Ausgabe. Statt Fließtext liefert das Modell eine Liste aus Sprecher und Zeile, die sich maschinell prüfen lässt.
  3. Längengrenzen. Eine Zeile muss in die Szenendauer passen. Gesprochene Sprache braucht Zeit, und eine zu lange Zeile lässt sich nur durch Kürzen oder hektisches Sprechen unterbringen.
  4. Unterscheidbare Stimmen im Text. Jede Figur sollte an ihrer Sprache erkennbar sein: eine redet knapp, eine andere umständlich, eine dritte stellt Fragen.
  5. Handlung vor Erklärung. Gute Dialoge treiben die Szene voran. Das bekannte Schreibprinzip „zeigen statt erklären“ gilt auch für generierten Text: Figuren sollten einander nicht erzählen, was beide längst wissen.

Nach der Erzeugung folgt eine Prüfung: Kommen nur bekannte Sprecher vor? Sind die Zeilen nicht zu lang? Gibt es leere Zeilen? Fehler werden korrigiert oder die Ausgabe wird neu angefordert.

Sprecherzuordnung: das unterschätzte Problem

In einem Drehbuch ist klar, wer spricht, weil der Name über der Zeile steht. Im Bild ist es das nicht automatisch. Stehen zwei Figuren nebeneinander, muss die Produktion sicherstellen, dass die richtige den Mund bewegt, dass bei Comics die Sprechblase auf die richtige Figur zeigt und dass der Untertitel den richtigen Namen trägt. Fehler an dieser Stelle verwirren mehr als jede andere Schwäche, weil das Publikum den Faden verliert.

Hilfreich sind klare Namen in der Szenenbeschreibung, eine überschaubare Zahl von Figuren pro Szene und, wo möglich, eine Analyse des erzeugten Bildes, die ermittelt, wo sich der Kopf der sprechenden Figur befindet.

Stimmenbesetzung und Konsistenz

Die Stimme ist für das Publikum ebenso sehr Teil einer Figur wie ihr Aussehen. Deshalb sollte jede Figur genau eine feste Stimme erhalten, die über den ganzen Film gleich bleibt. Bei der Auswahl hilft es, auf Kontrast zu achten: Zwei ähnlich klingende Stimmen in einem Gespräch erschweren das Zuhören, besonders ohne Untertitel. Unterschiede in Stimmlage, Tempo und Klangfarbe machen Szenen leichter verständlich. Eine automatische Auswahl kann sinnvoll sein, wenn sie Geschlecht und Beschreibung der Figur berücksichtigt; wer eine bestimmte Wirkung erreichen will, legt die Stimme selbst fest.

Erzähler, Dialog oder beides

Nicht jede Geschichte braucht Dialog. Ein Erzähler eignet sich für Märchen, Dokumentarisches und Geschichten mit großen Zeitsprüngen. Dialog eignet sich für Szenen, in denen Figuren aufeinander reagieren, streiten oder etwas aushandeln. Die Kombination aus Erzähler und Dialog verbindet Überblick und Nähe, verlangt aber Disziplin, damit die Tonspur nicht überladen wird. Und manchmal ist Stille die beste Wahl: nur Musik, Bild und Bewegung.

Untertitel mit Sprechernamen

Untertitel machen Videos ohne Ton verständlich, was in sozialen Netzwerken häufig vorkommt, und sie erleichtern Menschen mit Hörbeeinträchtigung das Verstehen. Bei Dialogen sollte der Name der sprechenden Figur vor der Zeile stehen, damit klar ist, wer spricht, auch wenn die Figur gerade nicht im Bild ist. Kurze Zeilen, ausreichende Standzeit und guter Kontrast zum Hintergrund sind die wichtigsten Regeln.

Dialog in Yeşilçam Animation

In den Figurenstilen von Yeşilçam Studios lassen sich bis zu vier Figuren pro Projekt anlegen, jeweils mit Namen, Aussehen und Stimme. Der Wähler „Sprache“ bietet in allen Figurenstilen außer Puppetmation die Modi Erzähler, Dialog, Beides und Stumm; „Untertitel“ lässt sich an- oder ausschalten, bei Dialog mit Sprechernamen. Für den Text gibt es drei Wege: Das Feld leer lassen, dann schreibt der Regisseur (ein Sprachmodell) den Dialog; „Dialog selbst schreiben“ mit bis zu 30 Zeilen aus Sprecher und Zeile, jede höchstens 200 Zeichen, die wörtlich verwendet werden; oder „Dialog mit Sam schreiben“, das Zeilen aus Geschichte und Figuren entwirft und dafür eine kleine Tokenmenge berechnet, die danach angezeigt wird. Typemation und Popbook haben keinen Dialog, weil dort der Text selbst der Inhalt ist.

Vertiefend: der Leitfaden Dialog mit Sam schreiben, der Leitfaden Erzähler, Dialog und Untertitel, der Beitrag Figuren, die sprechen und die Seite Animation.

Häufige Fragen

Wie viele Figuren sollte ein generierter Dialog haben? Zwei bis drei Figuren pro Szene sind am besten verständlich. Mehr Sprecher erschweren die Zuordnung für das Publikum und für die Produktion.

Warum sollte jede Figur eine feste Stimme haben? Weil das Publikum Figuren auch über ihre Stimme erkennt. Wechselt die Stimme zwischen Szenen, wirkt es, als spräche eine andere Person.

Sollte ich Dialog selbst schreiben oder generieren lassen? Eigene Zeilen lohnen sich, wenn Wortlaut wichtig ist, etwa bei Markennamen oder Pointen. Generierte Zeilen sparen Zeit und eignen sich als Entwurf, den man anschließend überarbeitet.

Brauchen Dialoge Untertitel? Empfehlenswert ist es fast immer, weil viele Videos ohne Ton angesehen werden. Bei Dialogen helfen Sprechernamen, die Zeilen zuzuordnen.