Kurze Antwort: Für eine türkische Sprachausgabe mit KI bereiten Sie den Text zuerst für die Stimme vor: Zahlen und Daten schreiben Sie aus, Abkürzungen so, wie sie gesprochen werden, Zirkumflex und türkische Sonderzeichen bleiben erhalten, lange Sätze werden geteilt. Danach wählen Sie eine passende Sprecherstimme, hören das Ergebnis ohne Bild an und korrigieren falsch gelesene Wörter. Der größte Teil der Qualität kommt aus dem Text.
Beim ersten Versuch erleben die meisten dasselbe: Die Stimme klingt natürlich, aber der Satz „3. kat“ (3. Stock) wird als „üç kat“ (drei Stockwerke) gelesen, bei einem Preis stolpert das Modell zwischen den Ziffern, und im Wort „hikaye“ ohne Zirkumflex klingt das k hart. Das Problem liegt meist nicht an der Stimme selbst, sondern daran, wie der Text an sie übergeben wird. Türkischer Text ist für das Auge gebaut, ein Sprachmodell liest jedoch buchstabengetreu. Dieser Beitrag liefert die Regeln, die diese Lücke schließen, und eine Checkliste für die Zeit vor der Veröffentlichung.
Wie erstellt man eine KI-Sprachausgabe?
Eine KI-Sprachausgabe entsteht in fünf Schritten: Sie schreiben den Text für Zuhörer um, lösen Zahlen und Abkürzungen in ihre gesprochene Form auf, wählen eine Erzähl- oder Figurenstimme, erzeugen den Ton und hören ihn ohne Bild an, und schließlich korrigieren Sie falsch gelesene Stellen im Text und erzeugen nur diesen Teil neu. Die Tonerzeugung dauert Sekunden; die eigentliche Arbeit steckt in der Textvorbereitung.
- Schreiben Sie für das Ohr. Kurze Sätze, ein Gedanke pro Satz, keine verschachtelten Nebensätze.
- Lösen Sie die Aussprache auf. Ziffern, Daten, Uhrzeiten, Währungen, Abkürzungen und Symbole in Worten schreiben.
- Wählen Sie die Stimme. Erzähler oder Figur; warm, ruhig oder energisch.
- Hören Sie zu. Schalten Sie das Bild aus und hören Sie einmal von Anfang bis Ende; ohne Bild fallen Fehler leichter auf.
- Korrigieren Sie stückweise. Ändern Sie das fehlerhafte Wort im Text und erzeugen Sie nur diesen Satz oder diese Szene neu.
Ist die Sprachausgabe Teil eines Videos, ändert sich die Reihenfolge etwas: Zuerst kommt der Szenenplan, der Text wird auf Szenen verteilt und die Stimme nach der Dauer jeder Szene geschrieben. Den gesamten Ablauf finden Sie im Leitfaden zum Erstellen von Videos mit KI, die Planung von Szenen auf Papier im Beitrag „Was ist ein Storyboard?“.
Wo machen Sprachmodelle bei türkischem Text die meisten Fehler?
Im Türkischen stolpern Sprachmodelle vor allem an sechs Stellen: Ziffern und Daten, Abkürzungen und Symbole, Buchstaben mit Zirkumflex, Wörter mit fehlenden türkischen Sonderzeichen, fremde Eigennamen und Frageintonation. Gemeinsam ist allen: Die Aussprache, die ein Leser selbstverständlich aus dem Kontext erschließt, kann das Modell nicht immer ableiten, und meist wählt es die Form, die es am häufigsten gesehen hat.
Der Verlust türkischer Sonderzeichen ist am heimtückischsten. In Text, der aus einem anderen System kopiert oder eilig getippt wurde, können ı, ğ, ş, ç, ö und ü wegfallen. Ein als „Isik“ geschriebenes Wort wird nicht wie „ışık“ (Licht) gelesen, sondern mit hellen Vokalen; bei der Schreibung „dag“ fehlt die Dehnung, die das ğ in „dağ“ (Berg) bewirkt, vollständig. Wer den Text vor der Vertonung durch eine türkische Rechtschreibprüfung schickt, fängt die meisten dieser Fehler schon vor der Generierung ab.
Wie sollten Zahlen, Daten und Abkürzungen geschrieben werden?
Schreiben Sie Zahlen, Daten und Abkürzungen in Worten, und zwar so, wie die Zuhörer sie hören sollen. Ein Sprachmodell kann ein Datum mit Punkten Ziffer für Ziffer lesen, den Punkt einer Ordnungszahl überspringen oder eine Abkürzung wie „A.Ş.“ Buchstabe für Buchstabe buchstabieren. Soll die Ziffer auf dem Bildschirm erscheinen, lassen Sie sie im Untertitel stehen und lösen sie im Sprechtext auf. Zwei getrennte Texte zu führen ist der sicherste Weg.
| Im Text steht | Was passieren kann | Schreiben Sie in den Sprechtext |
|---|---|---|
| 15.04.2026 | Die Ziffern werden mit Punkten einzeln gelesen | on beş nisan iki bin yirmi altı (fünfzehnter April zweitausendsechsundzwanzig) |
| 3. katta | Der Punkt wird übersprungen, es wird „üç katta“ (in drei Stockwerken) | üçüncü katta (im dritten Stock) |
| %40 indirim | Das Symbol wird übersprungen oder die Reihenfolge vertauscht | yüzde kırk indirim (vierzig Prozent Rabatt) |
| ₺1.499 | Der Tausenderpunkt wird für ein Dezimaltrennzeichen gehalten | bin dört yüz doksan dokuz lira (eintausendvierhundertneunundneunzig Lira) |
| 2,5 m² | Die Einheit wird nicht gelesen | iki buçuk metrekare (zweieinhalb Quadratmeter) |
| saat 14.30 | „on dört nokta otuz“ (vierzehn Punkt dreißig) | saat on dört otuz (vierzehn Uhr dreißig) |
| KDV dahil | Die Buchstaben werden durcheinander gelesen | katma değer vergisi dahil (inklusive Mehrwertsteuer) |
| Demir Yapı A.Ş. | Wird als „a ş“ buchstabiert | Demir Yapı Anonim Şirketi (Demir Yapı Aktiengesellschaft) |
| Dr. Ayşe Kaya, vb. | Die Abkürzung wird Buchstabe für Buchstabe gelesen | Doktor Ayşe Kaya, ve benzeri (Doktor Ayşe Kaya, und Ähnliches) |
| TBMM | Es wird versucht, sie wie ein Wort zu lesen | te be me me (Buchstabenaussprache des Kürzels für das türkische Parlament) |
Manche Abkürzungen werden wie Wörter gesprochen (NATO, TÜBİTAK), andere Buchstabe für Buchstabe (TBMM). Statt zu raten, welche Variante das Modell wählt, schreiben Sie die Aussprache selbst aus. Für Währungen gilt dasselbe Prinzip: „lira“ statt „TL“, „dolar“ statt „USD“. Lange Ziffernfolgen wie Telefonnummern oder Bestellcodes gruppieren Sie in Zweier- oder Dreierblöcke mit Kommas dazwischen; so findet das Modell Stellen zum Atmen.
Wie verändern Zirkumflex und fremde Namen die Aussprache?
Der Zirkumflex verändert im Türkischen die Aussprache; fehlt er, liest das Modell ein anderes Wort. „Hâlâ bekliyoruz“ und „hala bekliyoruz“ sind verschiedene Sätze: Das erste bedeutet „wir warten immer noch“, im zweiten ist „hala“ die Tante väterlicherseits. „Kâr“ ist Gewinn, „kar“ ist Schnee. Nach den Rechtschreibregeln der Türkischen Sprachgesellschaft (Türk Dil Kurumu) hat das Zeichen drei Aufgaben, und alle drei wirken sich direkt auf den Klang aus.
- Es unterscheidet Bedeutungen: hâlâ und hala, kâr und kar, âdet und adet. Hier wird der Vokal lang gesprochen.
- Es macht den vorangehenden Konsonanten weich: kâğıt, dükkân, hikâye, rüzgâr, Elâzığ. Ohne Zirkumflex können k, g und l hart gelesen werden.
- Es kennzeichnet das Zugehörigkeitssuffix: „resmî tatil“ (staatlicher Feiertag) und „resmi duvarda“ (sein Bild hängt an der Wand), „millî“ (national) und „milli“ (mit Achse) sind nicht dasselbe Wort.
Fremde Eigennamen
Ein fremder Personen- oder Ortsname kann verunglücken, je nachdem, nach den Regeln welcher Sprache das Modell ihn liest. Probieren Sie ihn zuerst so, wie er geschrieben wird; klingt er falsch, verwenden Sie nur im Sprechtext eine türkische Schreibung, die der Aussprache nahekommt: „Jak“ statt „Jacques“, „Mişel“ statt „Michelle“, „Siyatıl“ statt „Seattle“. In Untertiteln und Bildschirmtext bleibt die Originalschreibung. Bei Firmen- und Produktnamen gilt die Aussprache, die der Inhaber selbst verwendet.
Wie beeinflussen Fragepartikel, Komma und Satzlänge die Intonation?
Ein Sprachmodell liest die Intonation aus der Zeichensetzung und der Schreibweise der Suffixe. Wird die Fragepartikel „mi“ getrennt geschrieben, wird der Satz als Frage gebildet, und die Betonung fällt auf das Wort davor; bei zusammengeschriebenen Formen wie „geliyormusun“ kann der Frageton verloren gehen. Ein Komma bedeutet eine kurze, ein Punkt eine lange Pause. Lange, verschachtelte Sätze führen dazu, dass die Stimme atemlos, flach und eintönig klingt.
- Die Partikel trägt die Betonung: In der Frage „Sen mi geldin?“ (Bist du es, der gekommen ist?) steht „sen“ im Vordergrund, in „Sen geldin mi?“ (Bist du gekommen?) das Wort „geldin“. Setzen Sie die Partikel je nachdem, wonach Sie fragen.
- Das Komma ist eine Atemstelle: In „Evet, hazırız“ (Ja, wir sind bereit) erhält „evet“ einen eigenen Schlag. Ohne Komma werden beide Wörter in einem Zug gelesen.
- Der Fokus steht nahe am Prädikat: Im Türkischen steht das betonte Element meist direkt vor dem Prädikat. In „Toplantıya Ayşe geldi“ (Zur Besprechung kam Ayşe) steht Ayşe im Vordergrund.
- Teilen Sie lange Sätze: Einen Satz, den man nicht bequem in einem Atemzug sprechen kann, teilen Sie in zwei. Ketten mit „ki“ und „olan“, die geschrieben gut wirken, lassen Zuhörer beim lauten Lesen den Faden verlieren.
Auch die Dauer bestimmt der Text. Stand Oktober 2026 kalkuliert die Regie von Yeşilçam die Erzählstimme mit etwa 9 Zeichen pro Sekunde; auf eine 10-Sekunden-Szene entfallen höchstens 90 Zeichen. Kürzen Sie einen Satz, der nicht in die Szene passt, statt ihn zu beschleunigen: Beschleunigtes Türkisch wird zu einem Murmeln, in dem die Suffixe verschluckt werden.
Welche Stimme sollten Sie wählen, Erzählstimme oder Dialog?
Wählen Sie die Stimme nach der Art des Projekts: für Imagefilm und Schulungsvideo eine warme oder ruhige Erzählstimme, für einen Trailer eine tiefe Stimme, im Erzählfilm für jede Figur eine eigene, gleichbleibende Stimme. Die Erzählstimme sollte sich in Geschlecht oder Alter von den Figuren unterscheiden, damit das Ohr die beiden Ebenen nicht verwechselt. Eine einmal gewählte Figurenstimme sollte sich im ganzen Film nicht ändern.
Im Ablauf für Website-Imagefilme in Yeşilçam Studio gibt es sechs Erzählstimmen: warm weiblich, warm männlich, energisch weiblich, energisch männlich, ruhiger Erzähler und tiefe Trailerstimme. In der Geschichte-zu-Film-Pipeline wird die Stimme jeder Figur zusammen mit ihrem Gesicht in der Charakterbibel gespeichert. Die Regel der zwei Ebenen, nach der die Erzählstimme Zeit und Ort trägt und die Figuren ihre Absicht, erklärt der Beitrag Erzählstimme oder Dialog; wie man eine Stimmbesetzung aufbaut, beschreibt der Artikel über Erzählstimme und Stimmbesetzung mit KI ausführlich.
Wann braucht es Lippensynchronisation?
Lippensynchronisation ist nur nötig, wenn der sprechende Mund im Bild zu sehen ist. In der Totalen, bei einer Figur, die mit dem Rücken zur Kamera steht, oder in einer Erzählszene genügt es, den Ton auf der Tonspur abzuspielen, und Sie sparen die Kosten des Schritts. In der Nahaufnahme schaut das Publikum auf den Mund; dort fallen Qualitätsunterschiede der Synchronisation sofort auf. Die Stufen können Sie im Beitrag über Sprachausgabe und Lippensynchronisation ohne Tonstudio vergleichen.
Ist KI-Sprachausgabe kostenlos, und was kostet sie bei Yeşilçam?
Bei Yeşilçam erfordert die Sprachausgabe kein eigenes Abonnement; sie fließt als Posten in die Film- oder Animationsschätzung ein, und der Betrag wird vor der Generierung angezeigt. Der Free-Plan bietet 250.000 Token pro Monat, Vorgänge werden jedoch mit dem Multiplikator ×1,3 berechnet. Die Kosten tonbezogener Vorgänge wie der Lippensynchronisation stehen gesondert in der Preistabelle, und der Plan-Multiplikator wird auf diese Kosten angewendet.
| Vorgang | Tabellenpreis (Token) | ≈ $ zum Basic-Tarif | Pro (×0,8) | Free (×1,3) |
|---|---|---|---|---|
| Stimmbibliothek öffnen | 1.000 | 0,01 $ | 800 | 1.300 |
| Lippensynchronisation | 29.167 | 0,18 $ | 23.334 | 37.917 |
| Lippensynchronisation (Premium-Stimme) | 43.751 | 0,26 $ | 35.001 | 56.876 |
| Lippensynchronisation (Pro) | 175.001 | 1,05 $ | 140.001 | 227.501 |
| Musikstück | 29.167 | 0,18 $ | 23.334 | 37.917 |
Stand Oktober 2026 kostet die Standard-Lippensynchronisation laut Yeşilçam-Preistabelle 29.167 Token, die Pro-Lippensynchronisation 175.001 Token; zum Basic-Tarif sind das etwa 0,18 $ und 1,05 $. Der Dollarwert wird aus dem Monatskontingent des Basic-Plans berechnet: 30 $ für 5 Millionen Token, also 1 Million Token für etwa 6 $.
Eine kleine Rechnung erleichtert die Entscheidung. Geben Sie in einem einminütigen Film mit sechs Dialogszenen jeder Szene eine Standard-Synchronisation, zahlen Sie 6 × 29.167 = 175.002 Token; das ist fast genau so viel wie eine einzige Pro-Synchronisation. Deshalb ist es sinnvoll, die Pro-Stufe für die eine Nahaufnahme aufzuheben, in der das Publikum wirklich auf den Mund schaut. Die 250.000 Token des Free-Plans reichen mit dem Multiplikator ×1,3 für sechs Standard-Synchronisationen (6 × 37.917 = 227.502). Fehlgeschlagene Generierungen werden automatisch erstattet; aktuelle Preise finden Sie auf der Preisseite, den Ablauf selbst auf der Seite zu Yeşilçam Studio.
Darf man die Stimme eines anderen klonen oder eine bekannte Stimme nachahmen?
Grundsätzlich nein, es braucht eine Erlaubnis. Die Stimme eines Menschen ist ein persönliches Merkmal, an dem man ihn erkennt; sie ohne Zustimmung zu kopieren, ihr Worte in den Mund zu legen, die die Person nie gesagt hat, oder sie kommerziell zu nutzen, kann rechtliche Probleme verursachen. Arbeiten Sie mit einer anderen Stimme als Ihrer eigenen, holen Sie eine schriftliche Erlaubnis mit klar festgelegtem Umfang ein.
- Persönlichkeitsrecht: Artikel 24 des türkischen Zivilgesetzbuchs gibt einer Person, deren Persönlichkeitsrecht widerrechtlich verletzt wird, die Möglichkeit, gerichtlichen Schutz zu verlangen. Ohne Einwilligung der Person, ohne überwiegendes öffentliches oder privates Interesse und ohne gesetzliche Befugnis gilt die Verletzung als widerrechtlich.
- Personenbezogene Daten: Artikel 6 des türkischen Datenschutzgesetzes Nr. 6698 zählt biometrische Daten zu den besonderen Kategorien personenbezogener Daten. Die Verarbeitung einer Stimme, um eine Person zu erkennen oder nachzuahmen, kann in diesem Rahmen bewertet werden; Einzelheiten finden Sie in den Veröffentlichungen der türkischen Datenschutzbehörde.
- Vertrag mit Sprecherinnen und Sprechern: Halten Sie klar fest, in welchem Projekt, wie lange und in welchen Sprachen die Aufnahme genutzt wird und ob aus der Stimme ein Sprachmodell erstellt werden darf.
- Heikle Fälle: Die Stimme einer verstorbenen Person, eines Kindes, einer Politikerin oder eines Prominenten erfordert besondere Sorgfalt. Täuschen Sie das Publikum auch bei einer Parodie nicht und kennzeichnen Sie, dass die Stimme mit KI erzeugt wurde.
Dieser Abschnitt ist eine allgemeine Information und keine Rechtsberatung. Wenden Sie sich für ein konkretes Projekt, eine Veröffentlichung oder einen Vertrag an eine Anwältin oder einen Anwalt.
Was löst KI-Sprachausgabe nicht?
KI-Sprachausgabe trägt sachliche Erzählung, Schulungsvideos, Werbetexte und Dialogentwürfe gut; die Interpretation eines Schauspielers, feine Ironie, eine tränenerstickte Stimme oder den Rhythmus eines Gedichts trifft sie jedoch nicht immer. Wo der Stimmkatalog schwach ist, klingt lange Erzählung ermüdend und flach. Für solche Projekte ist eine professionelle Sprecherin oder ein Sprecher der bessere Weg.
- Markenstimme und Sendung: Für eine langfristige Werbekampagne, Fernsehen oder Radio sind Studioaufnahme und menschliche Stimme sicherer.
- Regionaler Dialekt: Sprachmodelle sprechen nahe am türkischen Standard; einen Dialekt nachahmen zu lassen, wird schnell zur Karikatur.
- Langes Hörbuch: Bei stundenlanger Erzählung summiert sich die Eintönigkeit, die Zuhörer ermüden.
- Rechtliche und medizinische Inhalte: Ein Aussprachefehler kann zu einem Bedeutungsfehler werden; jeder Satz sollte von einem Menschen angehört werden.
Es gibt auch einen Mittelweg: Sie vertonen den Entwurf mit KI, legen Timing und Schnitt fest und lassen die Endfassung von einer Sprecherin oder einem Sprecher einsprechen. Ebenso können Sie Ihre eigene Aufnahme hochladen und mit der Pro-Lippensynchronisation verwenden; dann ist die Performance nicht synthetisch, sondern Ihre. Was die Synchronisationsstufen in der Animation bedeuten, finden Sie im Leitfaden zu Lippensynchronisation und Figurenstimmen.
Häufig gestellte Fragen
Kann man KI-Sprachausgabe kostenlos nutzen? Zum Testen ja. Der Free-Plan von Yeşilçam bietet 250.000 Token pro Monat, Vorgänge werden mit dem Multiplikator ×1,3 berechnet; das reicht, um eine kurze Erzählung und einige Standard-Lippensynchronisationen auszuprobieren. Im kostenlosen Plan tragen heruntergeladene Dateien ein kleines Yeşilçam-Studios-Logo, die Dateien von Abonnenten sind sauber.
Was ist der häufigste Fehler bei türkischer Sprachausgabe? Den Text so an die Stimme zu geben, wie er geschrieben ist. Ziffern, Daten, Abkürzungen und Symbole bleiben dann der Vermutung des Modells überlassen; Wörter ohne Zirkumflex oder türkische Sonderzeichen werden wie andere Wörter gelesen. Lösen Sie diese im Sprechtext in Worte auf und hören Sie das Ergebnis einmal ohne Bild an.
Wie viele Zeichen sollte ein Sprechtext haben? Rechnen Sie nach der Dauer. Die Regie von Yeşilçam kalkuliert die Erzählstimme mit etwa neun Zeichen pro Sekunde; für 30 Sekunden Erzählung genügt grob ein Text von 270 Zeichen. Einen längeren Text zu kürzen, statt ihn durch Beschleunigen passend zu machen, erhält die Verständlichkeit.
Kann ich meine eigene Stimme verwenden? Ja. Wenn Sie in einem ruhigen Raum eine saubere Aufnahme machen und als Asset hochladen, verwendet die Pro-Lippensynchronisation diese Aufnahme direkt, und die Performance ist Ihre. Beschränken Sie die Aufnahme auf die Zeile, lassen Sie an beiden Enden eine kurze Stille und vermeiden Sie Raumhall.
Muss ich wegen eines einzigen falsch gelesenen Wortes den ganzen Film neu erzeugen? Nein. Sie öffnen die Szenenkarte, korrigieren das Wort im Text oder wählen eine andere Stimme und erzeugen nur diese Szene neu; berechnet wird auch nur diese Szene. Da die Erzählclips pro Szene platziert werden, verschiebt die Korrektur die anderen Szenen nicht.

