Risposta breve: Trasformare una foto in video sono due lavori diversi. Creare uno slideshow o una clip da più foto è montaggio; basta l'app galleria o di montaggio del telefono. Animare una singola foto con l'IA, invece, è immagine a video: la foto diventa il primo fotogramma, Lei scrive il movimento di camera e del soggetto e il modello genera una clip da 4 a 10 secondi.

Un breve video ricordo da un album di nozze, un'inquadratura rotante da vetrina a partire dalla foto di un prodotto o un sorriso che compare sul vecchio ritratto del nonno: tutti e tre si cercano con «trasformare foto in video», ma non sono lo stesso lavoro. Partendo dalla strada sbagliata si spendono token inutilmente oppure non si ottiene affatto il movimento sperato. Questo articolo separa i due lavori; per l'animazione spiega come scegliere la foto, come scrivere il prompt e quanto costa cosa.

Cosa significa trasformare una foto in video?

Questa ricerca copre due lavori diversi. Il primo è il montaggio: più foto vengono messe in fila, con transizioni, lenti zoom, musica e testi; all'interno delle foto non si muove nulla. Il secondo è l'immagine a video: una singola foto diventa il primo fotogramma e un modello di IA genera l'ondeggiare dei capelli, il girarsi della testa o l'avanzare della camera.

Slideshow da foto (montaggio)Animare una singola foto (immagine a video)
InputPiù fotoUna sola foto, primo fotogramma della clip
Movimento dentro la fotoNessuno, scorre solo l'inquadraturaSì, soggetto e camera si muovono
Cosa si vede sullo schermoSolo le Sue fotoI fotogrammi assenti nella foto vengono ipotizzati dal modello
DurataDipende dal numero di foto, può durare minutiDa 4 a 10 secondi per clip
StrumentoApp galleria o di montaggio del telefonoUno studio IA che supporti l'immagine a video
CostoSpesso gratuitoToken per clip
Per chi è adattoVideo ricordo, riepilogo di un evento, tour immobiliareInquadratura di prodotto, ritratto animato, apertura di scena

Le due cose si possono combinare: animare singolarmente alcune foto e poi metterle in sequenza al montaggio dà sia l'autenticità delle foto sia il movimento. La differenza tra immagine a video e testo a video è spiegata nell'articolo di confronto dettagliato.

Come si crea un video dalle foto sul telefono?

Per creare un video dalle foto del telefono non serve l'IA. La funzione ricordi o film dell'app galleria, o qualsiasi app di montaggio, mette in fila le foto, dà a ciascuna qualche secondo e aggiunge musica e transizioni. Questa strada è gratuita e, poiché non aggiunge nulla all'immagine, è l'opzione più onesta per video ricordo e lavori di valore documentale.

  1. Scelga le foto nell'ordine della storia; di tre scatti simili dello stesso momento tenga solo il migliore.
  2. Stabilisca subito la proporzione di destinazione. Le fotocamere dei telefoni scattano per lo più in 4:3 per sfruttare tutto il sensore; il video verticale è 9:16, quindi i bordi vengono tagliati. Tenga i volti importanti al centro dell'inquadratura.
  3. Dia a ogni foto una durata adatta al tempo della musica: breve con musica veloce, lunga con musica calma.
  4. Aggiunga un lento zoom o una panoramica orizzontale. Questo effetto, noto dai documentari, dà un senso di movimento alla foto statica.
  5. Aggiunga testi e date nell'app di montaggio; così restano leggibili e i caratteri accentati appaiono corretti.

Come funziona l'animazione di foto con l'IA?

In un modello da immagine a video la Sua foto è il primo fotogramma della clip ed è fissa. Il modello genera i fotogrammi successivi con un'ipotesi su come si muoverà la scena della foto; il Suo prompt guida questa ipotesi. Poiché la composizione viene dalla foto, volto e prodotto restano riconoscibili, mentre il movimento è vincolato ai confini del fotogramma.

Questo metodo ha una conseguenza: tutto ciò che non si vede nella foto viene inventato. Se la testa si gira, il retro dell'orecchio; se la camera arretra, la stanza fuori campo; se la mano si apre, il palmo: sono tutte ipotesi del modello. Più la clip si allunga, più le ipotesi si accumulano; in molti modelli dopo cinque o sei secondi il volto comincia lentamente a cambiare. Per questo clip brevi e movimento limitato danno il risultato più affidabile. Come usiamo lo stesso principio nella nostra pipeline cinematografica lo abbiamo spiegato nell'articolo sul keyframe prima di tutto.

Quale foto dà buoni risultati da animare?

La foto che dà buoni risultati è nitida, ben illuminata, con un solo soggetto e uno sfondo semplice. Il volto si vede di fronte o leggermente di lato, le mani sono o del tutto nell'inquadratura o assenti, e non ci sono scritte da leggere. Poiché il modello amplifica con il movimento ogni difetto della foto, scegliere la fonte fa più differenza che scrivere il prompt.

  • Risoluzione: la foto non deve essere più piccola del video di destinazione. Un video a 1080p significa 1920 × 1080 pixel; una foto con il lato corto molto al di sotto si ammorbidisce quando viene ingrandita.
  • Proporzione: ritagli Lei la foto nella proporzione del video. Se lascia il ritaglio al modello, un dettaglio importante può finire fuori campo.
  • Angolazione del volto: frontale o di tre quarti, occhi aperti e visibili. Girare verso la camera un volto ripreso di profilo significa inventarne metà.
  • Sfondo: uno sfondo semplice e sfocato è l'ideale. Volti e oggetti in uno sfondo affollato si sciolgono durante il movimento.
  • Mani: le mani devono vedersi per intero o restare fuori campo. Le dita tagliate a metà sono il dettaglio che si deforma più spesso.
  • Testi, loghi, cornici: insegne, etichette e loghi si deformano in movimento. Le foto con cornice o con testo sovrapposto vengono lette come un manifesto e reinterpretate.
  • Foto vecchie: elimini prima graffi, macchie e strappi con un passaggio di restauro; il modello potrebbe considerare anche la macchia parte della scena e muoverla.

Come si scrive il prompt di movimento?

Il prompt di movimento si costruisce con tre parti: movimento di camera, movimento del soggetto e ritmo. Non descriva di nuovo il soggetto già visibile nella foto; scriva solo cosa cambierà. Spesso basta una sola frase come «La camera si avvicina lentamente, la donna sorride appena e gira la testa a sinistra, i capelli si muovono nel vento, ritmo calmo».

Prompt debolePerché è debolePrompt migliore
«Anima la foto»Movimento non definito, il modello sceglie a caso«La camera si avvicina lentamente, l'uomo sbatte le palpebre e sorride appena»
«Una giovane donna in abito giallo sulla spiaggia»Descrive di nuovo il soggetto della foto«La gonna ondeggia nel vento, le onde si infrangono sulla riva, camera fissa»
«Corre ad abbracciare l'amica e balla»Tre azioni in una sola clip«Fa due passi verso la camera»
«Il prodotto ruota, il logo brilla, appare la scritta»Testo e logo si deformano«La bottiglia compie lentamente un quarto di giro sul proprio asse, la luce da studio scorre sulla superficie»

Per il movimento di camera bastano pochi schemi: lento avvicinamento, allontanamento, scorrimento a destra o a sinistra, leggero movimento verso l'alto e camera fissa. Il movimento rapido simultaneo di camera e soggetto è la causa più frequente di deformazioni; se muove uno dei due, tenga calmo l'altro.

Dove si deforma l'animazione di foto?

La deformazione inizia dove il modello è costretto a inventare informazioni assenti nella foto. I casi più frequenti sono cinque: rotazione rapida, mani, testo, folla e durata lunga. Prevenirli con la scelta della foto e con clip brevi, invece di forzarli con il prompt, significa meno rigenerazioni e meno token.

  • Rotazione rapida: una forte rotazione della testa o del corpo costringe a inventare il volto non visibile; la persona può trasformarsi in qualcuno che non le somiglia.
  • Mani e oggetti tenuti in mano: la mano che solleva un bicchiere può cambiare numero e forma delle dita.
  • Testo: la scritta su un'insegna o su una maglietta diventa in pochi fotogrammi una sequenza di lettere senza senso.
  • Folla: in una foto di gruppo i volti delle file dietro si confondono; il modello non sa chi sia il soggetto.
  • Clip lunga: con il passare dei secondi volto e abiti derivano. Se serve un momento lungo, generi due clip brevi e le unisca in montaggio.

È giusto animare la foto di un caro scomparso o di un'altra persona?

Tecnicamente è possibile, ma la questione del consenso e del contesto viene prima della tecnica. Animare in famiglia la foto di un caro scomparso come ricordo e diffondere pubblicamente la stessa immagine sono cose diverse. Animare o far parlare il volto di un'altra persona senza il suo permesso comporta invece rischi sia etici sia legali.

In Turchia la Legge n. 6698 sulla protezione dei dati personali considera dato personale la foto di una persona identificata o identificabile. Anche l'articolo 50 del Regolamento dell'Unione europea sull'intelligenza artificiale (AI Act) richiede dal 2 agosto 2026 che le immagini generate che somigliano a persone, luoghi o eventi reali e che potrebbero essere scambiate per vere dichiarino chiaramente la loro natura artificiale. Questo non è un parere legale; per un uso commerciale o pubblico consulti un giurista.

  • Anche per un ricordo di famiglia chieda ai parenti della persona ritratta; non tutti accolgono con la stessa emozione un volto animato.
  • Non animi e non condivida pubblicamente foto di bambini; tenga conto che non possono dare il proprio consenso.
  • Nel video che condivide scriva che è stato animato con l'IA e non presenti l'immagine come una registrazione reale.
  • Non usi foto di personaggi noti, clienti o dipendenti senza un consenso scritto.

Come funzionano le etichette visibili e invisibili nei media generativi lo abbiamo spiegato nell'articolo su filigrane e informazioni di provenienza.

Quanti token costa trasformare una foto in video su Yeşilçam?

In Yeşilçam Studio carica la Sua foto come risorsa; il fotogramma che fornisce diventa il primo fotogramma della clip e viene animato al livello di qualità scelto. Il costo dipende da livello e durata, viene mostrato sullo schermo prima di ogni generazione e le generazioni fallite vengono rimborsate automaticamente. A ottobre 2026 nel listino la voce riferimento visivo costa 2.626 token.

LivelloDurataClip (token)Totale con riferimento visivo≈ $ alla tariffa Basic
Bozza5 s122.501125.1270,75
Standard5 s166.251168.8771,01
Cinema6 s262.501265.1271,59
Cinema Pro6 s700.001702.6274,22

La colonna in dollari è calcolata alla tariffa del piano Basic: 5 milioni di token per 30 $, quindi 1 milione di token costa circa 6 $. Nel piano Free si applica il moltiplicatore ×1,3; una clip Bozza di 5 secondi con riferimento visivo costa 125.127 × 1,3 = 162.665 token e rientra una sola volta nella quota mensile di 250.000 token. I risultati Free hanno la filigrana e i livelli Cinema si sbloccano con il piano Basic. Con il piano Pro la stessa operazione scala 100.102 token grazie al ×0,8.

Video ricordo di 30 secondi da sei foto

Animare sei foto per cinque secondi ciascuna al livello Standard e unirle costa 6 × 168.877 = 1.013.262 token; a questi si aggiungono 5.834 token per il montaggio del film e 202 token per il render a 1080p. Il totale è 1.019.298 token, circa 6,12 $ alla tariffa Basic. Mettere in fila le stesse sei foto come slideshow statico in un'app di montaggio è gratuito; la differenza è il prezzo del movimento dentro le foto.

Per il livello la regola è semplice: verifichi prima in Bozza che il movimento sia giusto, se funziona produca in Standard e riservi i livelli Cinema all'unica foto in cui luce e movimento contano davvero. Le differenze sono nell'articolo su bozza, standard e cinema, i prezzi aggiornati nella pagina dei prezzi. Se vuole animare la foto non in modo realistico ma come disegno, può caricarla nello studio Animation come riferimento del personaggio (JPG, PNG o WebP, massimo 25 MB); lo stile scelto, per esempio Claymation, traduce la foto nel proprio linguaggio. Se passa a un lavoro con più scene e narrazione, la guida su come fare video con l'IA descrive l'intera pipeline.

Cosa non risolve l'animazione di foto?

L'animazione crea un momento, non registra un ricordo. La clip che ne esce non mostra come si muoveva davvero quel giorno la persona della foto, ma un movimento che il modello ritiene plausibile. Nei lavori di valore documentale, per esempio un documentario di storia familiare o una notizia, la foto statica e il montaggio sono la scelta più onesta.

  • Non rende nitida una foto sfocata o troppo piccola; restauro e ingrandimento sono un lavoro a parte.
  • Far parlare la persona della foto richiede voce, testo e sincronizzazione labiale; questo a sua volta richiede un consenso specifico della persona o dei suoi familiari.
  • Non genera una scena lunga; le clip da 4 a 10 secondi si uniscono in montaggio.
  • Nella foto di un prodotto non dimostra la caduta del tessuto o la reale consistenza del materiale; per il dettaglio che influisce sulla decisione d'acquisto servono riprese reali.

Domande frequenti

Trasformare una foto in video è gratuito? Creare uno slideshow da foto con l'app galleria o di montaggio del telefono è gratuito. Animare una singola foto con l'IA, invece, consuma token per ogni clip; il piano Free di Yeşilçam offre una quota mensile sufficiente per una clip Bozza di 5 secondi e il risultato ha la filigrana.

Quanti secondi dura una foto animata? Una clip dura da 4 a 10 secondi a seconda del livello: Bozza e Standard 5 o 10, i livelli Cinema 4, 6 o 8 secondi. Per un video più lungo, generare alcune clip brevi e unirle in montaggio dà un risultato più coerente di un'unica clip lunga.

Si possono animare vecchie foto in bianco e nero? Sì, ma prima elimini graffi, macchie e strappi; il modello potrebbe considerarli parte della scena. Il colore è una decisione a parte: se nel prompt non scrive esplicitamente di mantenere il bianco e nero, il modello può aggiungere colore e questo può rovinare l'atmosfera d'epoca della foto.

Posso far parlare la persona della foto? Tecnicamente è possibile con voce, testo e un passaggio di sincronizzazione labiale; su Yeşilçam la sincronizzazione labiale parte da 29.167 token. Far dire a una persona parole mai pronunciate, però, è l'uso più delicato. Non lo faccia senza il consenso esplicito della persona o dei suoi familiari e indichi nel video che è artificiale.

In quale formato si scarica il video animato? Su Yeşilçam il film montato viene renderizzato a 720p, 1080p o 4K e si scarica in MP4, WebP o GIF. MP4 è adatto alla consegna e alla condivisione, WebP o GIF all'anteprima nelle pagine; scelga la proporzione fin dall'inizio in base a dove lo condividerà.