Kurze Antwort: Es gibt drei Wege, mit KI ein Video zu erstellen: Text-zu-Video (Sie schreiben einen Prompt, das Modell erfindet die Szene), Bild-zu-Video (Sie erwecken ein einzelnes Bild zum Leben) und die Geschichte-zu-Film-Pipeline (Drehbuch, Figuren, Storyboard, Clips und Ton entstehen nacheinander). Für kurze Arbeiten mit einer einzigen Einstellung genügen die ersten beiden; bei Projekten mit Figuren, Ton und mehreren Szenen geht in der Pipeline deutlich weniger schief.
Die meisten ersten Versuche scheitern an derselben Stelle: Sie schreiben einen Satz und erhalten einen beeindruckenden Fünf-Sekunden-Clip; im zweiten Clip hat die Hauptfigur ein anderes Gesicht, die Schrift auf dem Ladenschild zerfällt in sinnlose Buchstaben, und Ton gibt es gar nicht. Das Problem liegt meist nicht am Werkzeug, sondern am falsch gewählten Weg. Dieser Leitfaden erklärt die drei Wege, welcher zu welcher Aufgabe passt, die Schritte zu Ihrem ersten 30-Sekunden-Video und die Kosten in Token und Dollar. Einen ausführlichen Vergleich von Text- und Bild-zu-Video finden Sie im Artikel Text-zu-Video vs. Bild-zu-Video; diese Details wiederholen wir hier nicht.
Wie viele Wege gibt es, mit KI ein Video zu erstellen?
Es gibt drei Wege, und jeder beginnt mit einer anderen Eingabe. Bei Text-zu-Video schreiben Sie nur einen Prompt; das Modell erfindet Kulisse, Licht, Motiv und Bewegung selbst. Bei Bild-zu-Video geben Sie ein Startbild vor, das das Modell animiert. In der Geschichte-zu-Film-Pipeline wird der Text zum Drehbuch, das Drehbuch zu Figuren, Storyboard-Bildern, Clips und Ton; jede Stufe wird einzeln freigegeben.
- Text-zu-Video: Der schnellste Einstieg. Geeignet für Einstellungen ohne wiederkehrende Figur, etwa Eröffnungsbilder, Landschaften, Wetterphänomene oder abstrakte Bewegung. Die Schwäche ist das fehlende Gedächtnis: Wenn Sie denselben Prompt zweimal ausführen, erhalten Sie zwei verschiedene Welten.
- Bild-zu-Video: Komposition und Motiv stehen von Anfang an fest; das Modell ergänzt nur Bewegung und Kamera. Das ist der richtige Weg für jede Einstellung, in der ein bestimmtes Produkt, eine bestimmte Person oder Zeichnung zu sehen sein muss. Die Bewegung bleibt allerdings auf die Grenzen des Bildes beschränkt.
- Geschichte-zu-Film-Pipeline: Für Arbeiten mit mehreren Szenen, Figuren und Erzählstimme. Die Clips entstehen einzeln per Bild-zu-Video, speisen sich aber alle aus derselben Charakterbibel und derselben Stilbeschreibung; so verrutschen die Gesichter nicht von Szene zu Szene.
Die drei Wege schließen einander nicht aus. Ein gut aufgebauter Kurzfilm erzeugt die Eröffnung oft per Text, die Szenen mit Figuren per Bild und führt alles in einer Pipeline zusammen. Der Beitrag darüber, was ein KI-Filmstudio tatsächlich tut, erklärt, warum diese Reihenfolge Verschwendung reduziert.
Welcher Weg passt zu welcher Aufgabe?
Für die Entscheidung reichen drei Fragen: Gibt es eine wiederkehrende Figur oder ein Produkt im Bild, wie viele Sekunden soll das Video dauern, und werden Ton und Sprache gebraucht? Gibt es kein wiederkehrendes Motiv und bleibt die Arbeit unter 10 Sekunden, genügt Text-zu-Video. Steht das Motiv fest, wählen Sie Bild-zu-Video. Bei mehreren Szenen, Figuren und Ton nutzen Sie die Geschichte-zu-Film-Pipeline.
| Ihr Bedarf | Empfohlener Weg | Warum | Achtung |
|---|---|---|---|
| 5-Sekunden-Stimmungsbild für Social Media | Text-zu-Video | Keine Vorbereitung nötig | Jeder Versuch liefert ein anderes Ergebnis |
| Ihr Produktfoto soll sich drehen oder herangezoomt werden | Bild-zu-Video | Das Produkt bleibt im Bild, seine Form bleibt erhalten | Schrift auf dem Produkt kann verzerrt werden |
| Ein Familienfoto oder eine Zeichnung zum Leben erwecken | Bild-zu-Video | Gesicht und Komposition stammen aus Ihrem Bild | Einwilligung und Kennzeichnung |
| Eine Geschichte mit Figuren, 30 bis 90 Sekunden | Geschichte-zu-Film-Pipeline | Die Charakterbibel verbindet die Szenen | Lesen Sie zuerst das Drehbuch |
| Erklär- oder Werbevideo mit Erzählstimme | Erzählstimmen- und Musikschritte der Pipeline | Der Ton wird auf die Filmlänge abgestimmt | Bildschirmtext im Schnitt ergänzen |
| Imagefilm für Ihre Website | Werbeablauf aus der Website-Adresse | Es werden echte Aufnahmen der Website verwendet | Zusätzliche filmische Einstellungen werden separat berechnet |
Wie erstellen Sie Schritt für Schritt Ihr erstes 30-Sekunden-Video?
30 Sekunden bedeuten sechs Szenen zu je fünf Sekunden. Schreiben Sie zuerst den Text Szene für Szene, prüfen Sie dann jede Szene mit einem günstigen Entwurfsbild, animieren Sie die gelungenen Bilder und fügen Sie zuletzt Ton und Musik hinzu. Weil diese Reihenfolge nur freigegebene Bilder an den teuren Videoschritt schickt, sinken Neugenerierungen und verschwendete Token.
- Formulieren Sie das Ziel in einem Satz. Etwa: „Die morgendliche Öffnung unseres Cafés in warmer Atmosphäre zeigen.“ Ohne klares Ziel wird die Szenenauswahl beliebig.
- Teilen Sie den Text in sechs Szenen. Jede Szene braucht einen Ort, eine Handlung und ein Bild. „Sie war glücklich“ lässt sich nicht drehen; „Sie hält die Tasse mit beiden Händen und lächelt“ schon.
- Beschreiben Sie die Figur einmal, mit konkreten Details. Eine Beschreibung wie „Barista mit kurzen braunen Haaren und grüner Schürze“ ist der Ankerpunkt für jede weitere Szene.
- Erzeugen Sie die Storyboard-Bilder in der Stufe Entwurf. Komposition, Bildausschnitt und Licht werden hier festgelegt, wo Fehler noch günstig sind. Korrigieren Sie den Text der misslungenen Bilder.
- Animieren Sie die gelungenen Bilder. Für kurze Szenen mit wenig Bewegung reicht meist die Stufe Standard; heben Sie nur die Eröffnung oder die Einstellung, in der die Stimmung kippt, auf eine höhere Stufe.
- Fügen Sie Ton und Musik hinzu. Halten Sie die Sätze der Erzählstimme kurz. Spricht eine Figur, ist die Lippensynchronisation ein eigener Schritt.
- Zusammenfügen und exportieren. Wählen Sie 9:16 für Hochformat-Plattformen und 16:9 quer für Websites; 1080p genügt für die meisten Zwecke.
Dieser Ablauf wird im Leitfaden zu Ihrem ersten Film Bildschirm für Bildschirm erklärt. Eine Rechennotiz: Bei 24 Bildern pro Sekunde, dem Kinostandard seit Ende der 1920er-Jahre, ergeben 30 Sekunden 720 Bilder. Da jede Sekunde ihren Preis hat, ist es die direkteste Ersparnis, die Länge auf das zu begrenzen, was die Geschichte wirklich braucht.
Wie schreibt man einen guten Video-Prompt?
Ein guter Prompt beschreibt die Aufnahme wie ein Kameramann: Motiv, Handlung, Kamera, Licht und Stil, in dieser Reihenfolge. Bei Bild-zu-Video beschreiben Sie das Motiv dagegen nicht erneut, sondern nur, was sich verändert: Bewegung, Kamerafahrt, Ausdruck. Wer das Motiv neu beschreibt, lädt das Modell ein, es neu zu zeichnen, und die Figur verrutscht.
Ein Beispiel für Text-zu-Video: „Ein kleines Café im Morgenlicht, eine Barista mit grüner Schürze füllt am Tresen eine Tasse, die Kamera gleitet langsam von rechts nach links, geringe Schärfentiefe, dokumentarischer Ton, kein Text im Bild.“ Der Bild-zu-Video-Prompt für dieselbe Einstellung beschreibt nur die Bewegung: „Die Barista hebt die Tasse und reicht sie in Richtung Kamera, die Kamera fährt leicht heran, Dampf steigt auf.“

- Setzen Sie den Stilsatz an den Anfang; Modelle gewichten den Anfang des Prompts stärker.
- Verlangen Sie eine Handlung pro Einstellung. „Läuft, stürzt, steht auf und lacht“ sind vier verschiedene Szenen.
- Richtungsangaben wie „links“ oder „im Hintergrund“ können Sie bei Bedarf verwenden, verlassen Sie sich aber nicht darauf; Modelle ignorieren räumliche Anweisungen häufig.
- Schreiben Sie negative Anweisungen („kein Text, kein Rahmen, kein Logo“) ans Ende.
- Versuchen Sie nicht, lesbaren Bildschirmtext per Prompt zu erzeugen; fügen Sie ihn im Schnitt als Textebene hinzu.
Was kostet es, ein Video mit KI zu erstellen?
Den größten Teil der Kosten verursachen die Videoclips; Drehbuch, Storyboard und Musik fallen daneben kaum ins Gewicht. Der Preis eines Clips hängt von zwei Dingen ab: Qualitätsstufe und Sekunden. Stand Oktober 2026 kostet ein 5-Sekunden-Clip in der Stufe Entwurf laut Yeşilçam-Preistabelle 122.501 Token, ein gleich langer Standard-Clip 166.251 Token.
| Stufe | Mögliche Längen | Preis pro Clip (Token) | ≈ $ zum Basic-Tarif | Token pro Sekunde |
|---|---|---|---|---|
| Entwurf | 5 oder 10 s | 122.501 / 245.001 | 0,74 / 1,47 | 24.500 |
| Standard | 5 oder 10 s | 166.251 / 329.584 | 1,00 / 1,98 | etwa 33.000 |
| Cinema | 4, 6 oder 8 s | 175.001 / 262.501 / 350.001 | 1,05 / 1,58 / 2,10 | 43.750 |
| Cinema Pro | 4, 6 oder 8 s | 466.668 / 700.001 / 933.335 | 2,80 / 4,20 / 5,60 | etwa 116.667 |
Die Dollarspalte ist aus dem monatlichen Kontingent des Basic-Plans berechnet: 30 $ für 5 Millionen Token, also rund 6 $ pro 1 Million Token. Ohne Plan kostet 1 Million Token mit dem einmaligen Starter-Paket 9 $. Im Pro-Plan wird für jeden Vorgang mit dem Faktor ×0,8 rund 20 Prozent weniger abgebucht.
Beispielbudget für 30 Sekunden
Für ein 30-Sekunden-Video mit sechs Szenen in der Stufe Standard, ohne Erzählstimme, aber mit Musik, summieren sich die Posten aus der Tabelle im Standardablauf der Pipeline wie folgt:
- Sechs Storyboard-Bilder: 6 × 4.376 = 26.256 Token
- Sechs Keyframes: 6 × 11.667 = 70.002 Token
- Sechs Standard-Clips à 5 Sekunden: 6 × 166.251 = 997.506 Token
- Ein Musikstück: 29.167 Token
- Zusammenfügen des Films 5.834 Token, Rendern in 1080p 202 Token
Insgesamt 1.128.967 Token, zum Basic-Tarif etwa 6,77 $. Das monatliche Kontingent von 5 Millionen Token im Basic-Plan reicht für vier Videos dieser Art, für ein fünftes nicht mehr. Erzeugen Sie die Clips in der Stufe Entwurf, sinkt die Summe auf 866.467 Token (etwa 5,20 $); im Pro-Plan werden für die Standard-Version 903.174 Token abgebucht. Mit einer Charakterbibel (Basisversion 160.417 Token) oder Lippensynchronisation für eine sprechende Figur (29.167 Token pro Dialogzeile) steigen die Kosten. Das Budget für einen langen Film finden Sie im Leitfaden zu Länge und Kosten, die Kostenstruktur der Branche im Artikel zur Kostenanatomie.
Kann man mit KI kostenlos Videos erstellen?
Teilweise. Kostenlose Pläne sind zum Ausprobieren gedacht, nicht für regelmäßige Produktion. Stand Oktober 2026 enthält der Free-Plan von Yeşilçam 250.000 Token pro Monat, berechnet aber jeden Vorgang mit dem Faktor ×1,3. Ein 5-Sekunden-Clip in der Stufe Entwurf kostet in diesem Plan 122.501 × 1,3 = 159.251 Token. Das Monatskontingent reicht also für einen 5-Sekunden-Clip, aber nicht für einen zweiten.
Im Free-Plan sind die Stufen Entwurf und Standard freigeschaltet, die Cinema-Stufen gesperrt, und Video- und Bildausgaben tragen unten rechts ein kleines Wasserzeichen. Drei Entwurfsbilder pro Monat sind kostenlos; für Tests von Komposition und Stil ist das ausreichend Spielraum. Am saubersten ist es, mit dem kostenlosen Plan Stil und Geschichte festzulegen und die finale Version im Abonnement zu erzeugen; die Unterschiede finden Sie im Leitfaden zu Plänen und Wasserzeichen. Lesen Sie auch bei Diensten, die „komplett kostenlos und unbegrenzt“ versprechen, die Qualitätsgrenze, das Wasserzeichen und die Bedingungen für kommerzielle Nutzung gesondert.
Wo versagen Videomodelle?
Die bekannten Schwächen von Videomodellen konzentrieren sich auf wenige Punkte: Text im Bild, Hände, Kontinuität von Figuren über Szenen hinweg, die kurze maximale Länge sowie schnelle oder komplexe Bewegung. Die meisten davon rühren daher, dass das Modell jeden Clip als unabhängige Wahrscheinlichkeitsrechnung erzeugt. Deshalb liegt die Lösung meist nicht im Prompt, sondern im Arbeitsablauf.
| Problem | Wie es aussieht | Was zu tun ist |
|---|---|---|
| Text im Bild | Sinnlose Buchstaben auf Schildern und Etiketten; häufiger bei Sonderzeichen wie den türkischen ğ, ş, İ | Text im Schnitt als Ebene hinzufügen, im Prompt „kein Text“ angeben |
| Hände und Finger | Zu viele oder verschmolzene Finger, eine Hand, die beim Greifen zerfließt | Hände ruhig oder außerhalb des Bildausschnitts halten, kurze Clips wählen |
| Kontinuität der Figuren | Gesicht, Haare und Kleidung ändern sich von Szene zu Szene | Charakterbibel und Bild-zu-Video aus einem Keyframe |
| Längenbegrenzung | Clips dauern 4 bis 10 Sekunden; gegen Ende langer Clips beginnt das Gesicht zu verrutschen | Die Geschichte in kurze Einstellungen teilen, Schnitte von der Erzählstimme tragen lassen |
| Schnelle Bewegung und Physik | Verzerrungen bei Kämpfen, Laufen, verschütteten Flüssigkeiten und Menschenmengen | Handlung in Teile zerlegen, Menschenmengen im Hintergrund halten |
| Lippensynchronisation | Bei langen Dialogzeilen laufen Mund und Ton auseinander | Dialogzeilen unter zwölf Wörtern halten |
Warum Figurenkontinuität so schwierig ist und welche Techniken helfen, haben wir ausführlich im Beitrag über konsistente Figuren beschrieben.
Wie wählt man zwischen Websites zur KI-Videoerstellung?
Legen Sie zuerst fest, in welcher Kategorie Sie suchen: Videogeneratoren für Einzelclips, Anbieter von Videos mit sprechendem Moderator (Avatar), vorlagenbasierte Schnittwerkzeuge und Geschichte-zu-Film-Pipelines erfüllen unterschiedliche Aufgaben. Prüfen Sie dann, ob der Preis vor der Erzeugung angezeigt wird, ob fehlgeschlagene Generierungen erstattet werden und ob türkische Sprachausgabe unterstützt wird, falls Sie sie brauchen.
- Sehen Sie den Preis vor der Erzeugung, oder erfahren Sie ihn erst am Monatsende?
- Werden fehlgeschlagene Generierungen automatisch erstattet?
- Wählen Sie die Qualitätsstufe pro Szene oder pro Projekt?
- Gibt es ein Werkzeug, das Figuren über Szenen hinweg konsistent hält (Referenzblatt, Charakterbibel)?
- Gibt es eine Oberfläche und eine Erzählstimme in Ihrer Sprache, und haben Sie die Aussprache an einem Beispiel getestet?
- Welche Wasserzeichen- und Nutzungsgrenzen gelten im kostenlosen Plan für kommerzielle Zwecke?
- Passen Ausgabeformate und Seitenverhältnisse (MP4, 9:16, 16:9) zu Ihrem Projekt?
Manche Chat-Assistenten können sich mit einem Videomodell verbinden und kurze Clips erzeugen; die meisten sind jedoch stärker darin, Prompts, Drehbücher und Szenenaufschlüsselungen zu schreiben. Das Drehbuch mit einem Assistenten zu schreiben und die Produktion in einem Videostudio durchzuführen, ist eine verbreitete und sinnvolle Arbeitsteilung.
Wie funktioniert die Geschichte-zu-Film-Pipeline in Yeşilçam Studio?
Yeşilçam Studio verwandelt eine geschriebene Geschichte Stufe für Stufe in einen Film und zeigt den Token-Preis jeder Stufe an, bevor Sie sie freigeben. Sie fügen die Geschichte ein; danach folgen ein Drehbuch mit Szenenaufschlüsselung, die Charakterbibel, Storyboard, Bild und Video pro Szene und zuletzt Sprachausgabe, Lippensynchronisation, Musik und Zusammenfügen.
- Sie fügen eine Geschichte oder einen Text ein; der Drehbuchschritt teilt ihn in Szenen mit Zusammenfassung und Dialoghinweisen. Diese Stufe ist reiner Text, Lesen und Korrigieren kostet wenig.
- Die Charakterbibel wird angelegt: konsistentes Gesicht, Kostüm und Stimme. Die Basisversion kostet 160.417, die Vollversion 291.667 Token.
- Jede Szene erhält ein Storyboard-Bild (4.376 Token pro Szene). Ein falsches Bild hier auszutauschen ist weit günstiger als im fertigen Clip.
- Die gelungenen Bilder werden zu Keyframes (11.667 Token) und in der gewählten Stufe zum Clip: Entwurf, Standard, Cinema oder Cinema Pro.
- Die Dialogzeilen werden mit der Stimme der Figur gesprochen; Lippensynchronisation (29.167 Token) und ein auf die Filmlänge abgestimmtes Musikstück (29.167 Token) kommen hinzu.
- Der Film wird zusammengefügt (5.834 Token) und in 720p, 1080p oder 4K gerendert (100, 202 oder 601 Token); Sie laden ihn als MP4, WebP oder GIF herunter.
Die Stufe wählen Sie nicht für den Film, sondern pro Szene. Stand Oktober 2026 kostet ein 8-Sekunden-Clip in der Stufe Cinema 350.001 Token, ein gleich langer Cinema-Pro-Clip 933.335 Token. Wer die teure Stufe der Eröffnung und ein, zwei Einstellungen mit Stimmungswechsel vorbehält, schont daher das Budget; die Wahl der Stufe erklären wir im Beitrag zu Entwurf, Standard und Cinema. Fehlgeschlagene Generierungen werden automatisch erstattet, und die aktuelle Tabelle steht immer auf der Preisseite. Wenn Sie eine kurze, animierte Geschichte für Social Media möchten, produziert Inkmation im selben Studio in 11 Plattformformaten.
Was KI-Video nicht löst
KI-Video ist stark darin, etwas zu zeigen, das es nicht gibt, und schwach darin, etwas Vorhandenes zu dokumentieren. Müssen Sie Ihre echte Fabrik, Ihr Team, die tatsächliche Haptik Ihres Produkts oder eine Veranstaltung zeigen, sind Kamera und Drehteam nach wie vor der richtige Weg; generierte Bilder können all das nur nachahmen.
- Dokumentarischer Charakter: Nachrichten, Interviews, Kundenfallstudien, der reale Einsatz eines Produkts. Generierte Bilder untergraben hier das Vertrauen.
- Reale und bekannte Personen: Gesicht oder Stimme einer Person ohne Erlaubnis zu erzeugen, ist ein rechtliches und ethisches Risiko. Je nach Veröffentlichungsort müssen Sie zudem unter Umständen deutlich kennzeichnen, dass der Inhalt mit KI erstellt wurde.
- Lange und feine Schauspielkunst: Lange Plansequenzen, subtile Mimik und lange Dialoge zwischen zwei Figuren bringen aktuelle Modelle an ihre Grenzen.
- Sendespezifikationen: Fernsehausstrahlung oder Kinovorführung verlangen Farb-, Ton- und Lieferstandards; dafür braucht es ein Postproduktionsteam.
- Gefühl eines Markenfilms: Bei einem Markenfilm, der jahrelang im Einsatz sein soll, machen die Erfahrung von Regie, Schauspiel und Kameraführung den Unterschied.
Selbst in diesen Fällen lohnt sich KI in der Ideenphase: Mit einem Storyboard und einem groben Animatic gehen Sie mit einem deutlich klareren Briefing zur Agentur oder ins Team. Der Beitrag darüber, warum Storyboards noch immer wichtig sind, beschreibt diesen Zwischenschritt.
Häufig gestellte Fragen
Wie viele Szenen hat ein einminütiges KI-Video? Meist 6 bis 8 Szenen. Da Entwurfs- und Standard-Clips 5 oder 10 Sekunden und Cinema-Clips 4, 6 oder 8 Sekunden dauern, landet ein Ziel von 60 Sekunden in diesem Bereich. Eine vierminütige Geschichte wird zu etwa 30 Szenen.
Wie lange dauert die Erzeugung eines Videoclips? In den schnellen Stufen ist ein Clip von 5 oder 10 Sekunden meist in wenigen Minuten fertig; die filmischen Stufen sind langsamer. Die Dauer des ganzen Films hängt von der Zahl der Szenen ab. Während die Clips entstehen, können Sie die Warteschlange verfolgen und an anderen Szenen weiterarbeiten.
Darf ich ein mit KI erstelltes Video kommerziell nutzen? In den Plänen Basic und Pro sind die Ausgaben frei von Wasserzeichen und dürfen in Kundenprojekten, Werbung und Veröffentlichungen verwendet werden; im Free-Plan gibt es ein kleines Wasserzeichen. Für Inhalte, die einer realen Person, einer anderen Marke oder einer urheberrechtlich geschützten Figur ähneln, ist eine gesonderte Erlaubnis nötig; Einzelheiten stehen in den Nutzungsbedingungen.
Kann man ein KI-Video mit türkischer Sprachausgabe erstellen? Ja. Yeşilçam arbeitet in sechs Sprachen; es spricht türkische Erzählstimmen und Dialogzeilen der Figuren, und bei sprechenden Figuren wird die Lippensynchronisation als eigener Schritt ergänzt. Zahlen, Abkürzungen und fremde Eigennamen so zu schreiben, wie sie ausgesprochen werden, verbessert die Aussprache deutlich.
Soll ich mit Text oder mit einem Bild beginnen? Wenn eine bestimmte Person, ein Produkt oder eine Zeichnung im Bild erscheinen soll, beginnen Sie mit einem Bild, denn die Komposition stammt dann aus Ihrer Vorlage. Gibt es kein wiederkehrendes Motiv, etwa bei einer Landschaft oder einem Eröffnungsbild, ist Text-zu-Video schneller und braucht keine Vorbereitung.

