Bei der Sprache klingen automatisierte Filme am häufigsten automatisiert. Eine einzige Stimme, die alles liest, Zeilen, die nicht zum Bild passen, ein Erzähler, der wiederholt, was eine Figur gerade gesagt hat: Jedes davon ist ein struktureller Fehler, kein Modellfehler. Auch die Lösung ist strukturell: zwei Ebenen mit klar getrennten Aufgaben, bewusst gewählte Stimmen und ein Text, der auf das Bild abgestimmt ist.

Die zwei Ebenen

Der Erzähler trägt Zeit und Ort: „In jener Nacht erreichte der Fuchs den Fluss.“ Die Figuren tragen die Absicht: „Ich gehe nicht zurück.“ Eine Zeile gehört einer Figur, die im Bild ist; der Erzähler wiederholt sie nie und beschreibt nie, was das Bild bereits zeigt. Setzen Sie das als Vertrag in den Drehbuchdaten durch, nicht als Stilhinweis. Das Regiemodell erhält pro Szene zwei getrennte Felder, einen Erzählsatz und eine optionale gesprochene Zeile mit Sprecher, und das Schema weist eine Erzählung zurück, die Anführungszeichen enthält.

Nicht jede Szene braucht beides. Establishing Shots kommen meist nur mit Erzählung aus; eine Konfrontation kann nur eine Zeile tragen, umgeben von Stille. Ein Film, in dem jede Szene beide Ebenen hat, klingt wie ein Dokumentarfilm über sich selbst.

Stimmen besetzen

Geben Sie jeder Figur ein Profil: Geschlecht, Altersgruppe (Kind, jung, erwachsen, alt) und einen in Worten beschriebenen Ton („warm, gelassen“, „scharf, ungeduldig“). Bewerten Sie den Stimmenkatalog des Anbieters anhand der eigenen Tags der Stimmen gegen das Profil, bevorzugen Sie Stimmen, die keine andere Figur in diesem Film verwendet, und greifen Sie auf die Erzählerstimme zurück, wenn nichts passt. Speichern Sie die gewählte Stimme mit der Figur, damit ein zweiter Film dieselbe Stimme verwendet: Eine Figur, deren Stimme sich zwischen Filmen ändert, irritiert ebenso wie eine, deren Gesicht sich ändert.

Der Erzähler verdient eine eigene Besetzung. Er sollte sich von jeder Figur in Geschlecht oder Altersgruppe unterscheiden, damit das Ohr die Ebenen mühelos trennt. Ein häufiger Fehler ist, dem Erzähler die angenehmste Stimme des Katalogs zu geben und dann festzustellen, dass sie auch am besten zur Hauptfigur passt.

Sprache auf das Bild abstimmen

Synthetisierte Sprache läuft in den meisten Sprachen mit etwa neun bis zehn Zeichen pro Sekunde, im Deutschen langsamer und im Spanischen schneller. Die Erzählung einer Szene muss mit Spielraum für die Zeile in deren Dauer passen: Bei einer Szene von acht Sekunden mit einer Zeile von zwei Sekunden erhält die Erzählung etwa fünf Sekunden, also rund 45 Zeichen. Begrenzen Sie Zeilen auf einen Satz, damit kein einzelner Clip eine Rede trägt. Ist eine Geschichte länger als die Ziellänge, muss die Regie Ereignisse streichen, nicht Sätze komprimieren; die Sprache zu beschleunigen, damit sie passt, ist der schnellste Weg, einen Film unverständlich zu machen.

Planen Sie in Zeichen, nicht in Wörtern, weil das Sprachmodell nach Zeichen abrechnet und taktet und weil die Wortlänge zwischen Sprachen weit stärker schwankt als die Zeichenzahl.

Platzierung auf der Zeitleiste

Platzieren Sie jeden Erzählclip am Anfang seiner eigenen Szene auf der Zeitleiste, statt alles zu einer langen Erzähldatei zusammenzufügen. Eine einzelne Datei driftet gegenüber den Schnitten, sobald ein Clip auch nur einen Bruchteil länger läuft, und spätestens bei Szene zwanzig beschreibt der Erzähler die vorherige Szene. Die Platzierung pro Szene ermöglicht außerdem das Neuerzeugen einzelner Szenen: Clip und Erzählung werden gemeinsam ersetzt.

Zeilen stehen dort, wo die Figur spricht, bei einem lippensynchronisierten Clip also am Anfang des Clips. Lassen Sie eine kurze Pause zwischen Erzählung und Zeile; die beiden Ebenen zu überlagern ist schlimmer als Stille.

Musik unter der Sprache

Erzeugen Sie die Musik einmal aus dem Stilleitfaden in voller Länge und senken Sie sie unter der Sprache um einen festen Betrag ab, statt nach Gehör zu mischen. Automatisches Ducking um 8–10 dB genügt für die Erzählung; stärkeres Ducking lässt die Musik pumpen. Blenden Sie über die erste Szene ein und über die letzte aus; schneiden Sie die Musik nicht an Szenengrenzen, es sei denn, das Drehbuch markiert einen harten Stimmungswechsel.

Eleganter Rückfall

Die Lippensynchronisation hängt von einem einzigen Anbieter ab, und Anbieter fallen aus: Kontingent, Störung, ein entfernter Endpunkt. Scheitert sie, behalten Sie den Clip und vertonen die Zeile trotzdem in der Tonspur. Der Mund bewegt sich dann vielleicht nicht, aber die Geschichte bleibt intakt und der fehlgeschlagene Auftrag wird erstattet. Lassen Sie niemals einen Audiofehler einen fertigen Clip verwerfen. Dieselbe Regel gilt für Musik: Ein Film ohne Musik ist ein Film; ein Film, der scheitert, weil das Musikmodell nicht erreichbar war, ist ein Bug.

Für Stimmen schreiben

Zeilen in Anführungszeichen, der Sprecher direkt daneben; kurze Sätze; eine Idee pro Szene. Emotions-Tags („leise“, „aufgeregt“) helfen Modellen, die sie unterstützen, und werden von anderen harmlos ignoriert. Vermeiden Sie Zahlen und Abkürzungen in der Erzählung; Sprachmodelle lesen „3D“ und „DXF“ uneinheitlich, und eine ausgeschriebene Form ist sicherer. Eigennamen sollten im schriftlichen Aussehen vorkommen, damit das Modell sie gesehen hat, bevor es sie aussprechen muss.

Häufige Fragen

Kann der Erzähler eine Figur sein? Ja, in Ich-Erzählungen. Dann ist die Erzählerstimme die Stimme dieser Figur, und ihre Zeilen im Bild verwenden dieselbe Stimme in leicht anderem Tempo. Die Zwei-Ebenen-Regel gilt weiterhin: Die Erzählung beschreibt, die Zeilen handeln.

Was ist mit Sprachen, die der Stimmenanbieter schlecht abdeckt? Besetzen Sie den Erzähler mit der besten verfügbaren Stimme für die Sprache und halten Sie die Zeilen der Figuren kurz. Schwache Stimmen fallen bei langer Erzählung am stärksten auf.

Wie wird die Sprache überprüft? Lassen Sie das synthetisierte Audio durch eine Spracherkennung laufen und vergleichen Sie das Ergebnis mit dem Skript. Eine Abweichung von mehr als einigen Prozent bedeutet, dass die Stimme einen Namen falsch ausgesprochen hat oder der Text etwas enthielt, das das Modell nicht lesen konnte.