Kurze Antwort: Ein Foto in ein Video zu verwandeln, sind eigentlich zwei verschiedene Aufgaben. Aus mehreren Fotos eine Diashow oder einen Clip zu machen, ist Videoschnitt; dafür genügt die Galerie- oder Schnitt-App Ihres Smartphones. Ein einzelnes Foto mit KI zu animieren, ist dagegen Bild-zu-Video: Das Foto wird zum ersten Frame, Sie beschreiben Kamera- und Motivbewegung, und das Modell erzeugt einen Clip von 4 bis 10 Sekunden.
Ein kurzes Erinnerungsvideo aus einem Hochzeitsalbum, eine rotierende Schaufenstereinstellung aus einem Produktfoto oder ein Lächeln, das auf dem alten Porträt Ihres Großvaters erscheint: Alle drei landen als „Foto zu Video“ im Suchfeld, sind aber nicht dieselbe Aufgabe. Wer auf dem falschen Weg beginnt, verbraucht entweder unnötig Token oder bekommt die erwartete Bewegung gar nicht. Dieser Beitrag trennt die beiden Aufgaben und erklärt, wie Sie ein Foto für die Animation auswählen, wie Sie den Prompt schreiben und was was kostet.
Was bedeutet es, ein Foto in ein Video umzuwandeln?
Diese Suche umfasst zwei unterschiedliche Aufgaben. Die erste ist Schnitt: Mehrere Fotos werden aneinandergereiht, dazwischen kommen Übergänge, langsame Zooms, Musik und Text; innerhalb der Fotos bewegt sich nichts. Die zweite ist Bild-zu-Video: Ein einzelnes Foto wird zum ersten Frame, und ein KI-Modell erzeugt, wie sich Haare im Wind bewegen, ein Kopf sich dreht oder die Kamera vorwärtsfährt.
| Diashow-Video aus Fotos (Schnitt) | Einzelnes Foto animieren (Bild-zu-Video) | |
|---|---|---|
| Eingabe | Mehrere Fotos | Ein Foto, der erste Frame des Clips |
| Bewegung im Foto | Keine, nur der Bildausschnitt wandert | Ja, Motiv und Kamera bewegen sich |
| Was auf dem Bildschirm zu sehen ist | Ausschließlich Ihre eigenen Fotos | Frames, die nicht im Foto enthalten sind, schätzt das Modell |
| Dauer | Abhängig von der Zahl der Fotos, kann mehrere Minuten dauern | 4 bis 10 Sekunden pro Clip |
| Werkzeug | Galerie- oder Schnitt-App des Smartphones | Ein KI-Studio, das Bild-zu-Video unterstützt |
| Kosten | Meist kostenlos | Token pro Clip |
| Geeignet für | Erinnerungsvideo, Veranstaltungsrückblick, Immobilienrundgang | Produkteinstellung, Porträtanimation, Szeneneinstieg |
Beides lässt sich kombinieren: Wenn Sie mehrere Fotos einzeln animieren und anschließend im Schnitt hintereinandersetzen, erhalten Sie sowohl die Echtheit der Fotos als auch Bewegung. Den Unterschied zwischen Bild-zu-Video und Text-zu-Video erklären wir im ausführlichen Vergleichsartikel.
Wie erstellt man auf dem Smartphone ein Video aus Fotos?
Für ein Video aus Fotos auf dem Smartphone brauchen Sie keine KI. Die Rückblick- oder Filmfunktion der Galerie-App oder eine beliebige Schnitt-App reiht die Fotos aneinander, gibt jedem ein paar Sekunden und fügt Musik und Übergänge hinzu. Dieser Weg ist kostenlos und fügt dem Bild nichts hinzu, deshalb ist er für Erinnerungsvideos und dokumentarische Arbeiten die ehrlichste Wahl.
- Wählen Sie die Fotos in der Reihenfolge der Geschichte aus; von drei ähnlichen Aufnahmen desselben Moments behalten Sie nur die beste.
- Legen Sie das Zielformat von Anfang an fest. Smartphone-Kameras fotografieren meist im Format 4:3, um den ganzen Sensor zu nutzen; ein Hochformatvideo ist 9:16, daher werden die Ränder beschnitten. Halten Sie wichtige Gesichter in der Bildmitte.
- Geben Sie jedem Foto eine Dauer, die zum Tempo der Musik passt: bei schneller Musik kurz, bei ruhiger Musik länger.
- Fügen Sie einen langsamen Zoom oder einen seitlichen Schwenk hinzu. Dieser aus Dokumentarfilmen bekannte Effekt verleiht einem Standbild ein Gefühl von Bewegung.
- Fügen Sie Texte und Daten in der Schnitt-App hinzu; so bleiben sie lesbar, und Sonderzeichen werden korrekt dargestellt.
Wie funktioniert die Fotoanimation mit KI?
Bei einem Bild-zu-Video-Modell ist Ihr Foto der erste Frame des Clips und bleibt unverändert. Das Modell erzeugt die folgenden Frames aus seiner Vorhersage, wie sich die Szene im Foto bewegen wird; Ihr Prompt lenkt diese Vorhersage. Da die Komposition aus dem Foto stammt, bleiben Gesicht und Produkt erkennbar, die Bewegung ist jedoch durch die Grenzen des Bildes eingeschränkt.
Das hat eine Folge: Alles, was im Foto nicht zu sehen ist, wird erfunden. Dreht sich der Kopf, ist die Rückseite des Ohres eine Schätzung des Modells; fährt die Kamera zurück, gilt das für den Raum außerhalb des Bildausschnitts; öffnet sich eine Hand, für die Handfläche. Je länger der Clip, desto mehr summieren sich diese Schätzungen; bei vielen Modellen beginnt sich das Gesicht nach fünf oder sechs Sekunden langsam zu verändern. Kurze Clips mit begrenzter Bewegung liefern deshalb die verlässlichsten Ergebnisse. Wie wir dasselbe Prinzip in unserer Film-Pipeline nutzen, beschreiben wir im Beitrag über den Keyframe-zuerst-Ansatz.
Welche Fotos eignen sich gut für die Animation?
Ein gut geeignetes Foto ist scharf, gut ausgeleuchtet, hat ein einziges Motiv und einen ruhigen Hintergrund. Das Gesicht ist von vorn oder leicht seitlich zu sehen, die Hände sind entweder vollständig im Bild oder gar nicht, und es gibt keinen Text, der lesbar bleiben muss. Weil das Modell jeden Fehler im Foto durch die Bewegung verstärkt, macht die Wahl der Vorlage mehr aus als das Formulieren des Prompts.
- Auflösung: Das Foto sollte nicht kleiner sein als das Zielvideo. Ein 1080p-Video bedeutet 1920 × 1080 Pixel; ein Foto, dessen kurze Seite deutlich darunter liegt, wird beim Hochskalieren weich.
- Seitenverhältnis: Beschneiden Sie das Foto vorab selbst auf das Format des Videos. Überlassen Sie den Zuschnitt dem Modell, kann ein wichtiges Detail aus dem Bild fallen.
- Gesichtswinkel: Frontal oder im Dreiviertelprofil, Augen offen und sichtbar. Ein im Profil fotografiertes Gesicht zur Kamera zu drehen, heißt, die Hälfte des Gesichts zu erfinden.
- Hintergrund: Ein schlichter, unscharfer Hintergrund ist am besten. Gesichter und Gegenstände in einem unruhigen Hintergrund zerfließen während der Bewegung.
- Hände: Hände sollten entweder vollständig sichtbar oder außerhalb des Bildes sein. Halb angeschnittene Finger sind das Detail, das am häufigsten fehlerhaft wird.
- Text, Logo, Rahmen: Schilder, Etiketten und Logos verzerren sich in der Bewegung. Gerahmte Fotos oder solche mit eingefügtem Text werden wie ein Plakat gelesen und neu interpretiert.
- Alte Fotos: Entfernen Sie Kratzer, Flecken und Risse zuerst in einem Restaurierungsschritt; das Modell kann einen Fleck sonst für einen Teil der Szene halten und mitbewegen.
Wie schreibt man einen Bewegungs-Prompt?
Ein Bewegungs-Prompt besteht aus drei Teilen: Kamerabewegung, Motivbewegung und Tempo. Beschreiben Sie das Motiv, das im Foto ohnehin zu sehen ist, nicht noch einmal; schreiben Sie nur, was sich verändern soll. Ein einzelner Satz wie „Die Kamera fährt langsam heran, die Frau lächelt leicht und dreht den Kopf nach links, ihr Haar bewegt sich im Wind, ruhiges Tempo“ genügt meistens.
| Schwacher Prompt | Warum er schwach ist | Besserer Prompt |
|---|---|---|
| „Erwecke das Foto zum Leben“ | Keine Bewegung definiert, das Modell wählt zufällig | „Die Kamera fährt langsam heran, der Mann blinzelt und lächelt leicht“ |
| „Eine junge Frau im gelben Kleid am Strand“ | Beschreibt das Motiv aus dem Foto erneut | „Ihr Rock weht im Wind, Wellen schlagen ans Ufer, statische Kamera“ |
| „Läuft los, umarmt ihre Freundin und tanzt“ | Drei Handlungen in einem Clip | „Macht zwei Schritte auf die Kamera zu“ |
| „Das Produkt soll sich drehen, das Logo glänzen, Text erscheinen“ | Text und Logo verzerren sich | „Die Flasche dreht sich langsam um eine Vierteldrehung um die eigene Achse, Studiolicht gleitet über die Oberfläche“ |
Für die Kamerabewegung reichen wenige Muster: langsame Heranfahrt, Rückfahrt, seitliche Fahrt nach rechts oder links, leichtes Anheben und statische Kamera. Wenn sich Kamera und Motiv gleichzeitig schnell bewegen, ist das die häufigste Ursache für Fehler; bewegen Sie das eine, halten Sie das andere ruhig.
Wo stößt die Fotoanimation an ihre Grenzen?
Fehler beginnen dort, wo das Modell Informationen erfinden muss, die im Foto nicht vorhanden sind. Am häufigsten sind fünf Situationen: schnelle Drehungen, Hände, Text, Menschenmengen und lange Dauer. Wer diese Fälle nicht per Prompt erzwingt, sondern durch Fotoauswahl und kurze Clips vermeidet, braucht weniger Neugenerierungen und weniger Token.
- Schnelle Drehung: Eine starke Drehung von Kopf oder Körper zwingt das Modell, das unsichtbare Gesicht zu erfinden; die Person kann sich in jemanden verwandeln, der ihr nicht mehr ähnelt.
- Hände und Gegenstände halten: Eine Hand, die ein Glas hebt, kann Anzahl und Form der Finger verändern.
- Text: Schrift auf einem Schild oder T-Shirt wird innerhalb weniger Frames zu sinnlosen Buchstaben.
- Menschenmengen: Auf Gruppenfotos verschwimmen die Gesichter in den hinteren Reihen; das Modell weiß nicht, wer das Motiv ist.
- Langer Clip: Je länger die Dauer, desto stärker verschieben sich Gesicht und Kleidung. Brauchen Sie einen längeren Moment, erzeugen Sie zwei kurze Clips und verbinden Sie sie im Schnitt.
Ist es richtig, das Foto eines verstorbenen Angehörigen oder einer anderen Person zu animieren?
Technisch ist es möglich, doch die Frage nach Einwilligung und Kontext kommt vor der Technik. Das Foto eines verstorbenen Angehörigen als Erinnerung im Familienkreis zu animieren, ist etwas anderes, als dasselbe Bild öffentlich zu verbreiten. Das Gesicht einer anderen Person ohne deren Erlaubnis zu animieren oder sprechen zu lassen, birgt sowohl ethische als auch rechtliche Risiken.
In der Türkei gilt nach dem Datenschutzgesetz Nr. 6698 das Foto einer bestimmten oder bestimmbaren Person als personenbezogenes Datum. Artikel 50 der KI-Verordnung der Europäischen Union verlangt zudem seit dem 2. August 2026, dass erzeugte Bilder, die realen Personen, Orten oder Ereignissen ähneln und für echt gehalten werden könnten, klar als künstlich gekennzeichnet werden. Dies ist keine Rechtsberatung; für eine kommerzielle oder öffentliche Nutzung wenden Sie sich bitte an eine juristische Fachperson.
- Fragen Sie selbst bei einer Erinnerung im Familienkreis die Angehörigen der abgebildeten Person; nicht jeder empfindet ein animiertes Gesicht auf dieselbe Weise.
- Animieren Sie keine Kinderfotos für die öffentliche Verbreitung; bedenken Sie, dass Kinder keine Einwilligung geben können.
- Vermerken Sie im geteilten Video, dass es mit KI animiert wurde, und präsentieren Sie das Bild nicht als echte Aufnahme.
- Verwenden Sie Fotos von bekannten Persönlichkeiten, Kundinnen und Kunden oder Mitarbeitenden nicht ohne schriftliche Erlaubnis.
Wie sichtbare und unsichtbare Kennzeichnungen bei generativen Medien funktionieren, erklären wir im Artikel über Wasserzeichen und Herkunftsnachweise.
Wie viele Token kostet es, bei Yeşilçam ein Foto in ein Video umzuwandeln?
In Yeşilçam Studio laden Sie Ihr Foto als Asset hoch; das bereitgestellte Bild wird zum ersten Frame des Clips und in der gewählten Qualitätsstufe animiert. Der Preis hängt von Stufe und Dauer ab, wird vor jeder Generierung auf dem Bildschirm angezeigt, und fehlgeschlagene Generierungen werden automatisch erstattet. Stand Oktober 2026 kostet die Zeile für die Bildreferenz in der Preistabelle 2.626 Token.
| Stufe | Dauer | Clip (Token) | Gesamt mit Bildreferenz | ≈ $ zum Basic-Tarif |
|---|---|---|---|---|
| Entwurf | 5 s | 122.501 | 125.127 | 0,75 |
| Standard | 5 s | 166.251 | 168.877 | 1,01 |
| Cinema | 6 s | 262.501 | 265.127 | 1,59 |
| Cinema Pro | 6 s | 700.001 | 702.627 | 4,22 |
Die Dollar-Spalte wurde zum Tarif des Basic-Plans berechnet: 5 Millionen Token für 30 $ pro Monat, also etwa 6 $ pro 1 Million Token. Im Free-Plan gilt der Multiplikator ×1,3; ein 5-Sekunden-Clip in Entwurf mit Bildreferenz kostet dort 125.127 × 1,3 = 162.665 Token und passt genau einmal in das monatliche Kontingent von 250.000 Token. Free-Ausgaben tragen ein Wasserzeichen, die Cinema-Stufen werden mit dem Basic-Plan freigeschaltet. Im Pro-Plan werden für denselben Vorgang mit ×0,8 nur 100.102 Token abgebucht.
Ein 30-Sekunden-Erinnerungsvideo aus sechs Fotos
Sechs Fotos in der Stufe Standard je fünf Sekunden zu animieren und zusammenzufügen, kostet 6 × 168.877 = 1.013.262 Token; hinzu kommen 5.834 Token für das Zusammenfügen des Films und 202 Token für das Rendern in 1080p. Insgesamt sind das 1.019.298 Token, zum Basic-Tarif etwa 6,12 $. Dieselben sechs Fotos als unbewegte Diashow in einer Schnitt-App aneinanderzureihen, ist kostenlos; die Differenz ist der Preis für die Bewegung in den Fotos.
Die Regel für die Stufenwahl ist einfach: Prüfen Sie zuerst in Entwurf, ob die Bewegung stimmt, erzeugen Sie die Fassung dann in Standard und reservieren Sie die Cinema-Stufen für das eine Foto, bei dem Licht und Bewegung wirklich zählen. Die Unterschiede finden Sie im Beitrag über Entwurf, Standard und Cinema, die aktuellen Preise auf der Preisseite. Möchten Sie das Foto nicht realistisch, sondern gezeichnet animieren, können Sie es im Animation-Studio als Figurenreferenz hochladen (JPG, PNG oder WebP, höchstens 25 MB); der gewählte Stil, etwa Claymation, übersetzt das Foto in seine eigene Bildsprache. Wenn Sie zu einem Projekt mit mehreren Szenen und Erzählstimme übergehen, beschreibt die Anleitung zum Erstellen von Videos mit KI die gesamte Pipeline.
Was kann die Fotoanimation nicht leisten?
Eine Animation erschafft einen Moment, sie zeichnet keinen auf. Der entstandene Clip zeigt nicht, wie sich die Person im Foto an jenem Tag tatsächlich bewegt hat, sondern eine Bewegung, die das Modell für plausibel hält. Bei Arbeiten mit dokumentarischem Wert, etwa einem Film über die Familiengeschichte oder einem Nachrichtenbeitrag, sind unbewegte Fotos und Schnitt die ehrlichere Wahl.
- Sie macht ein unscharfes oder sehr kleines Foto nicht scharf; Restaurierung und Hochskalierung sind eine eigene Aufgabe.
- Die Person im Foto sprechen zu lassen, erfordert Stimme, Text und Lippensynchronisation und damit zusätzlich die Erlaubnis der Person oder ihrer Angehörigen.
- Sie erzeugt keine lange Szene; Clips von 4 bis 10 Sekunden werden im Schnitt zusammengefügt.
- Bei Produktfotos belegt sie weder den Fall eines Stoffes noch die echte Haptik eines Materials; für Details, die eine Kaufentscheidung beeinflussen, braucht es echte Aufnahmen.
Häufig gestellte Fragen
Ist es kostenlos, ein Foto in ein Video umzuwandeln? Eine Diashow aus Fotos ist mit der Galerie- oder Schnitt-App Ihres Smartphones kostenlos. Ein einzelnes Foto mit KI zu animieren, kostet dagegen Token pro Clip; der Free-Plan von Yeşilçam bietet ein monatliches Kontingent, das für einen 5-Sekunden-Clip in Entwurf reicht, und die Ausgabe trägt ein Wasserzeichen.
Wie viele Sekunden dauert ein animiertes Foto? Ein Clip dauert je nach Stufe 4 bis 10 Sekunden: Entwurf und Standard 5 oder 10, die Cinema-Stufen 4, 6 oder 8 Sekunden. Für ein längeres Video liefern mehrere kurze, im Schnitt verbundene Clips ein konsistenteres Ergebnis als ein einziger langer Clip.
Lassen sich alte Schwarz-Weiß-Fotos animieren? Ja, entfernen Sie aber zuerst Kratzer, Flecken und Risse; das Modell könnte sie für Teile der Szene halten. Farbe ist eine eigene Entscheidung: Wenn Sie im Prompt nicht ausdrücklich verlangen, dass das Bild schwarz-weiß bleibt, kann das Modell Farbe hinzufügen und damit die Zeitstimmung des Fotos stören.
Kann ich die Person im Foto sprechen lassen? Technisch ist das mit Stimme, Text und einem Schritt zur Lippensynchronisation möglich; bei Yeşilçam beginnt die Lippensynchronisation bei 29.167 Token. Einer Person Worte in den Mund zu legen, die sie nie gesagt hat, ist jedoch die heikelste Anwendung. Tun Sie es nicht ohne ausdrückliche Erlaubnis der Person oder ihrer Angehörigen, und kennzeichnen Sie im Video, dass es künstlich erzeugt ist.
In welchem Format wird das animierte Video heruntergeladen? Bei Yeşilçam wird der zusammengefügte Film in 720p, 1080p oder 4K gerendert und als MP4, WebP oder GIF heruntergeladen. Für Auslieferung und Teilen eignet sich MP4, für Vorschauen auf einer Webseite WebP oder GIF; wählen Sie das Seitenverhältnis von Anfang an passend zum Ort der Veröffentlichung.

