Risposta breve: Esistono tre modi per fare video con l'intelligenza artificiale: da testo a video (scrive un prompt e il modello inventa la scena), da immagine a video (anima un fotogramma) e la pipeline Da storia a film (sceneggiatura, personaggi, storyboard, clip e audio generati in sequenza). Per lavori brevi di una sola inquadratura bastano i primi due; per lavori con personaggi, voce e più scene la pipeline si rompe molto meno.

Il primo tentativo della maggior parte delle persone si blocca nello stesso punto: scrive una frase e arriva una clip di cinque secondi d'effetto; nella seconda clip il volto del protagonista cambia, la scritta sull'insegna diventa una sequenza di lettere senza senso e manca del tutto l'audio. Di solito il problema non è lo strumento, ma la strada scelta. Questa guida spiega le tre strade, quale si adatta a quale lavoro, i passaggi per il primo video di 30 secondi e il costo in token e in dollari. Per un confronto dettagliato tra testo e immagine come punto di partenza può consultare l'articolo su da testo a video e da immagine a video; qui non ripetiamo quei dettagli.

In quanti modi si può creare un video con l'IA?

I modi sono tre e ciascuno parte da un input diverso. Con il testo a video scrive soltanto un prompt; il modello inventa da sé ambientazione, luce, soggetto e movimento. Con l'immagine a video fornisce un fotogramma di partenza e il modello lo anima. Nella pipeline Da storia a film, invece, il testo diventa sceneggiatura e la sceneggiatura diventa personaggi, fotogrammi di storyboard, clip e audio; ogni fase viene approvata separatamente.

  • Da testo a video: la partenza più rapida. Adatto a inquadrature senza personaggi ricorrenti, come un'apertura, un paesaggio, un fenomeno atmosferico o un movimento astratto. Il punto debole è la mancanza di memoria: se esegue due volte lo stesso prompt ottiene due mondi diversi.
  • Da immagine a video: composizione e soggetto sono fissati fin dall'inizio; il modello aggiunge solo il movimento e la camera. È la porta giusta per ogni inquadratura in cui deve comparire un prodotto, una persona o un disegno preciso. Il movimento però resta vincolato ai confini del fotogramma.
  • Pipeline Da storia a film: per lavori con più scene, personaggi e narrazione. Le clip vengono generate una per una da immagine a video, ma tutte attingono alla stessa bibbia del personaggio e alla stessa descrizione di stile; così i volti non cambiano da una scena all'altra.

Le tre strade non si escludono a vicenda. Un cortometraggio ben costruito spesso genera l'apertura dal testo, le scene con i personaggi dalle immagini e le unisce in un'unica pipeline. L'articolo su cosa fa davvero uno studio cinematografico con IA spiega perché questa sequenza riduce gli sprechi.

Quale strada per quale lavoro?

Per decidere bastano tre domande: sullo schermo c'è un personaggio o un prodotto ricorrente, quanti secondi durerà il video, servono voce e dialoghi? Se non c'è un soggetto ricorrente e il lavoro dura meno di 10 secondi, basta il testo a video. Se il soggetto è definito, scelga l'immagine a video. Se ci sono più scene, personaggi e audio, usi la pipeline Da storia a film.

EsigenzaStrada consigliataPerchéAttenzione
Inquadratura d'atmosfera di 5 secondi per i socialDa testo a videoNon richiede preparazioneOgni tentativo dà un risultato diverso
Far ruotare o avvicinare la foto del Suo prodottoDa immagine a videoIl prodotto resta nel fotogramma e conserva la formaLe scritte sul prodotto possono deformarsi
Animare una foto di famiglia o un disegnoDa immagine a videoVolto e composizione vengono dal Suo fotogrammaConsenso ed etichettatura
Una storia con personaggi tra 30 e 90 secondiPipeline Da storia a filmLa bibbia del personaggio collega le sceneLegga prima la sceneggiatura
Video didattico o promozionale con narrazionePassi di narrazione e musica della pipelineL'audio viene costruito sulla durata del filmAggiunga i testi a schermo in montaggio
Video di presentazione del Suo sito webFlusso promozionale a partire dall'indirizzo del sitoUsa le immagini reali del sitoLe inquadrature cinematografiche extra sono a pagamento

Come si crea passo passo il primo video di 30 secondi?

30 secondi corrispondono a sei scene da cinque secondi. Prima scriva il testo scena per scena, poi verifichi ogni scena con un fotogramma di bozza economico, animi i fotogrammi che la convincono e infine aggiunga voce e musica e unisca il tutto. Questo ordine invia al costoso passaggio video solo i fotogrammi approvati, riducendo le rigenerazioni e i token sprecati.

  1. Scriva l'obiettivo in una frase. Per esempio: «Mostrare l'apertura mattutina della nostra caffetteria con un'atmosfera calda». Senza un obiettivo chiaro la scelta delle scene diventa casuale.
  2. Divida il testo in sei scene. Ogni scena deve contenere un luogo, un'azione e un'immagine. «Era felice» non si può girare; «tiene la tazza con due mani e sorride» sì.
  3. Descriva il personaggio una sola volta, con dettagli concreti. Una descrizione come «barista con capelli castani corti e grembiule verde» è il punto d'appoggio di tutte le scene successive.
  4. Generi i fotogrammi di storyboard al livello Bozza. Composizione, inquadratura e luce si decidono qui, dove l'errore costa poco. Corregga il testo dei fotogrammi venuti male.
  5. Animi i fotogrammi che La convincono. Per scene brevi e con poco movimento il livello Standard di solito basta; porti a un livello superiore solo l'apertura o l'inquadratura in cui cambia l'emozione.
  6. Aggiunga voce e musica. Le frasi della narrazione devono essere brevi. Se c'è un personaggio che parla, la sincronizzazione labiale è un passaggio a parte.
  7. Unisca ed esporti. Scelga 9:16 per le piattaforme di video verticali e 16:9 orizzontale per il sito web; 1080p basta per la maggior parte degli usi.

Questo flusso è descritto schermata per schermata nella guida al primo film. Un appunto di calcolo: a 24 fotogrammi al secondo, lo standard del cinema dalla fine degli anni Venti, 30 secondi equivalgono a 720 fotogrammi. Poiché ogni secondo ha un costo, mantenere la durata a quanto la storia richiede davvero è il risparmio più diretto.

Come si scrive un buon prompt video?

Un buon prompt descrive la ripresa come farebbe un direttore della fotografia: soggetto, azione, camera, luce e stile, in quest'ordine. Nell'immagine a video, invece, non si descrive di nuovo il soggetto; si scrive solo ciò che cambia: movimento, movimento di camera, espressione. Descrivere di nuovo il soggetto invita il modello a ridisegnarlo e il personaggio deriva.

Un esempio da testo a video: «Una piccola caffetteria nella luce del mattino, un barista con grembiule verde riempie una tazza al bancone, la camera scorre lentamente da destra a sinistra, profondità di campo ridotta, tono documentaristico, nessuna scritta a schermo.» Il prompt da immagine a video per la stessa inquadratura descrive solo il movimento: «Il barista solleva la tazza e la porge verso la camera, la camera si avvicina leggermente, sale il vapore.»

In una piccola caffetteria alla luce del mattino, un barista con grembiule verde versa il latte in una tazza
Un fotogramma generato dal prompt di esempio dell'articolo: luce del mattino, barista con grembiule verde, profondità di campo ridotta. Immagine rappresentativa, generata con Image Studio di Yeşilçam Studios.
  • Metta la frase sullo stile all'inizio; i modelli danno più peso all'inizio del prompt.
  • Chieda una sola azione per inquadratura. «Corre, cade, si rialza e ride» sono quattro scene diverse.
  • Usi indicazioni come «a sinistra» o «sullo sfondo» quando servono, ma non le consideri garantite; i modelli ignorano spesso le istruzioni spaziali.
  • Scriva le istruzioni negative («nessuna scritta, nessuna cornice, nessun logo») alla fine.
  • Non cerchi di generare con il prompt un testo che deve essere leggibile a schermo; lo aggiunga come livello di testo in fase di montaggio.

Quanto costa fare video con l'IA?

La parte principale del costo è data dalle clip video; sceneggiatura, storyboard e musica restano piccole al confronto. Il prezzo di una clip dipende da due fattori: livello di qualità e secondi. A ottobre 2026, nel listino Yeşilçam una clip Bozza di 5 secondi costa 122.501 token e una clip Standard della stessa durata 166.251 token.

LivelloDurate disponibiliPrezzo della clip (token)≈ $ alla tariffa BasicToken al secondo
Bozza5 o 10 s122.501 / 245.0010,74 / 1,4724.500
Standard5 o 10 s166.251 / 329.5841,00 / 1,98circa 33.000
Cinema4, 6 o 8 s175.001 / 262.501 / 350.0011,05 / 1,58 / 2,1043.750
Cinema Pro4, 6 o 8 s466.668 / 700.001 / 933.3352,80 / 4,20 / 5,60circa 116.667

La colonna in dollari è calcolata sulla quota mensile del piano Basic: 5 milioni di token a 30 $, quindi 1 milione di token costa circa 6 $. Senza piano, con il pacchetto una tantum Starter, 1 milione di token costa 9 $. Con il piano Pro ogni operazione scala il 20 per cento di token in meno grazie al moltiplicatore ×0,8.

Budget di esempio per 30 secondi

Per un video di 30 secondi con sei scene al livello Standard, senza narrazione e con musica, le voci del listino si sommano così secondo il flusso predefinito della pipeline:

  • Sei fotogrammi di storyboard: 6 × 4.376 = 26.256 token
  • Sei keyframe: 6 × 11.667 = 70.002 token
  • Sei clip Standard da 5 secondi: 6 × 166.251 = 997.506 token
  • Un brano musicale: 29.167 token
  • Montaggio del film 5.834 token, render a 1080p 202 token

Il totale è di 1.128.967 token, circa 6,77 $ alla tariffa Basic. La quota mensile di 5 milioni di token del piano Basic copre quattro video con questa struttura, non il quinto. Se genera le clip al livello Bozza il totale scende a 866.467 token (circa 5,20 $); con il piano Pro la versione Standard scala 903.174 token. Se aggiunge una bibbia del personaggio (base 160.417 token) o la sincronizzazione labiale per un personaggio che parla (29.167 token per battuta), il costo aumenta. Il budget di un film lungo è nella guida su durata e costi, la struttura dei costi del settore nell'articolo sull'anatomia dei costi.

Si possono fare video con l'IA gratis?

In parte. I piani gratuiti servono a provare, non a produrre con regolarità. A ottobre 2026 il piano Free di Yeşilçam offre 250.000 token al mese, ma applica a ogni operazione un moltiplicatore ×1,3. Una clip Bozza di 5 secondi costa su questo piano 122.501 × 1,3 = 159.251 token. In pratica la quota mensile basta per una clip di 5 secondi, non per la seconda.

Nel piano Free sono disponibili i livelli Bozza e Standard, i livelli Cinema sono bloccati e i video e le immagini in uscita portano una piccola filigrana nell'angolo in basso a destra. Tre immagini in bozza al mese sono gratuite; è uno spazio sufficiente per provare composizione e stile. La strada più pulita è usare il piano gratuito per definire stile e storia e produrre la versione finale con un abbonamento; le differenze sono nella guida a piani e filigrana. Per un servizio che promette «tutto gratis e senza limiti», legga a parte i limiti di qualità, la filigrana e le condizioni d'uso commerciale.

Dove sbagliano i modelli video?

I punti deboli noti dei modelli video si concentrano in pochi ambiti: testo a schermo, mani, continuità dei personaggi tra le scene, limite di durata e movimenti rapidi o complessi. La maggior parte nasce dal fatto che il modello genera ogni clip con un calcolo probabilistico indipendente. Per questo anche la soluzione di solito non sta nel prompt, ma nel flusso di lavoro.

ProblemaCome si presentaCosa fare
Testo a schermoLettere senza senso su insegne ed etichette; più frequenti con lettere turche come ğ, ş, İAggiunga il testo come livello in montaggio e scriva «nessuna scritta» nel prompt
Mani e ditaDita in più o fuse, la mano che regge un oggetto si scioglieTenga le mani ferme o fuori campo, scelga clip brevi
Continuità dei personaggiVolto, capelli e abiti cambiano da una scena all'altraBibbia del personaggio e immagine a video dal keyframe
Limite di durataClip tra 4 e 10 secondi; verso la fine delle clip lunghe il volto comincia a derivareDivida la storia in inquadrature brevi e lasci che la narrazione regga i tagli
Movimento rapido e fisicaDeformazioni in lotte, corse, liquidi versati e folleScomponga l'azione in parti e tenga la folla sullo sfondo
Sincronizzazione labialeNelle battute lunghe bocca e voce si separanoTenga le battute sotto le dodici parole

Perché la continuità dei personaggi sia difficile e quali tecniche funzionino lo abbiamo spiegato in dettaglio nell'articolo sui personaggi coerenti.

Come scegliere tra i siti per creare video con l'IA?

Prima stabilisca in quale categoria sta cercando: i generatori che producono una singola clip, quelli che producono video con presentatore parlante (avatar), gli strumenti di montaggio a modelli e le pipeline Da storia a film fanno lavori diversi. Poi verifichi se il costo viene mostrato prima della generazione, se le generazioni fallite vengono rimborsate e se c'è il supporto per la voce in turco.

  • Il costo è visibile prima della generazione o lo scopre a fine mese?
  • Le generazioni fallite vengono rimborsate automaticamente?
  • Il livello di qualità si sceglie per scena o per progetto?
  • Esiste uno strumento che mantiene il personaggio tra le scene (scheda di riferimento, bibbia del personaggio)?
  • C'è un'interfaccia in turco e una narrazione in turco, e ha provato la pronuncia con un esempio?
  • Quali sono la filigrana e il limite d'uso commerciale nel piano gratuito?
  • Formati e proporzioni in uscita (MP4, 9:16, 16:9) sono adatti al Suo lavoro?

Alcuni assistenti di chat possono collegarsi a un modello video e produrre brevi clip; la maggior parte, però, è più forte nello scrivere prompt, sceneggiature e scalette delle scene. Scrivere la sceneggiatura con un assistente e produrre il video in uno studio video è una divisione del lavoro diffusa e sensata.

Come funziona la pipeline Da storia a film in Yeşilçam Studio?

Yeşilçam Studio trasforma una storia scritta in un film fase per fase e mostra il costo in token di ogni fase prima che Lei la approvi. Incolla la storia; seguono una sceneggiatura suddivisa in scene, la bibbia del personaggio, lo storyboard per ogni scena, immagini e video e infine voce, sincronizzazione labiale, musica e montaggio.

  1. Si incolla una storia o un testo; il passo della sceneggiatura lo divide in scene con sintesi e indicazioni di dialogo. Questa fase è testo: leggerla e correggerla costa poco.
  2. Si apre la bibbia del personaggio: volto, costume e voce coerenti. La bibbia di base costa 160.417 token, quella completa 291.667.
  3. Ogni scena riceve un fotogramma di storyboard (4.376 token per scena). Cambiare qui un fotogramma sbagliato costa molto meno che cambiarlo in una clip finita.
  4. I fotogrammi che La convincono diventano keyframe (11.667 token) e si trasformano in clip al livello scelto: Bozza, Standard, Cinema o Cinema Pro.
  5. Le battute vengono lette con la voce del personaggio; si aggiungono la sincronizzazione labiale (29.167 token) e un brano musicale sulla durata del film (29.167 token).
  6. Il film viene montato (5.834 token) e renderizzato a 720p, 1080p o 4K (100, 202 o 601 token); si scarica in MP4, WebP o GIF.

Il livello si sceglie per scena, non per film. A ottobre 2026 una clip Cinema di 8 secondi costa 350.001 token e una clip Cinema Pro della stessa durata 933.335 token. Per questo riservare il livello costoso all'apertura e a una o due inquadrature in cui cambia l'emozione protegge il budget; la scelta del livello è spiegata nell'articolo su bozza, standard e cinema. Le generazioni fallite vengono rimborsate automaticamente e il listino aggiornato è sempre nella pagina dei prezzi. Se desidera una storia animata breve per i social, Inkmation, nello stesso studio, produce nei formati di 11 piattaforme.

Cosa non risolve il video con l'IA?

Il video con l'IA è forte nel mostrare ciò che non esiste e debole nel documentare ciò che esiste. Se deve mostrare la Sua vera fabbrica, il Suo team, la reale consistenza del Suo prodotto o un evento, la telecamera e una troupe restano la strada giusta; un'immagine generata può solo imitarli.

  • Valore documentale: notizie, interviste, casi cliente, uso reale del prodotto. Qui l'immagine generata riduce la fiducia.
  • Persone reali e note: generare il volto o la voce di una persona senza il suo consenso è un rischio legale ed etico. A seconda di dove pubblica, può essere necessario anche dichiarare chiaramente che il contenuto è generato con l'IA.
  • Recitazione lunga e sottile: un lungo piano sequenza, espressioni facciali sottili, un lungo dialogo tra due personaggi spingono i modelli attuali al limite.
  • Specifiche di trasmissione: la messa in onda televisiva o la proiezione in sala richiedono standard di colore, audio e consegna; per questo lavoro serve un team di post-produzione.
  • L'anima di un film di marca: in un film di marca destinato a durare anni, l'esperienza di regista, attori e direttore della fotografia fa la differenza.

Anche in questi casi usare l'IA nella fase di ideazione ha valore: con uno storyboard e un animatic grezzo porta all'agenzia o al team un brief molto più chiaro. L'articolo sul perché lo storyboard conta ancora descrive questo passaggio intermedio.

Domande frequenti

Quante scene ha un video con l'IA di un minuto? Di solito tra 6 e 8. Poiché le clip Bozza e Standard durano 5 o 10 secondi e le clip Cinema 4, 6 o 8 secondi, un obiettivo di 60 secondi rientra in questo intervallo. Una storia di quattro minuti diventa invece una trentina di scene.

Quanto tempo serve per generare una clip video? Ai livelli rapidi una clip di 5 o 10 secondi è pronta quasi sempre in pochi minuti; i livelli cinematografici sono più lenti. La durata dell'intero film dipende dal numero di scene. Mentre le clip vengono generate, può seguire la coda dei lavori e continuare a lavorare sulle altre scene.

Posso usare un video fatto con l'IA per un lavoro commerciale? Nei piani Basic e Pro i risultati sono senza filigrana e si possono usare per lavori per clienti, pubblicità e pubblicazioni; nel piano Free c'è una piccola filigrana. Per contenuti che ricordano una persona reale, un altro marchio o un personaggio protetto da copyright serve un'autorizzazione specifica; i dettagli sono nelle condizioni d'uso.

Si può fare un video con l'IA con voce fuori campo in turco? Sì. Yeşilçam funziona in sei lingue; legge la narrazione in turco e le battute dei personaggi, e per i personaggi che parlano la sincronizzazione labiale si aggiunge come passaggio separato. Scrivere numeri, sigle e nomi propri stranieri nel testo come vanno letti migliora sensibilmente la pronuncia.

Devo partire dal testo o dall'immagine? Se sullo schermo deve comparire una persona, un prodotto o un disegno preciso, parta dall'immagine, perché la composizione viene dal Suo fotogramma. Se non c'è un soggetto ricorrente, per esempio un paesaggio o un'inquadratura d'apertura, il testo a video è più rapido e non richiede preparazione.