Ogni modello video apre almeno due porte: un prompt testuale, oppure un'immagine di partenza più un prompt. Alcuni ne aggiungono una terza: immagini di riferimento di un personaggio. Scegliere la porta per ogni scena è una decisione di instradamento, non una questione di gusto, e uno studio che instrada bene produce film migliori spendendo meno di uno che usa sempre la stessa porta.
Text-to-video
Il modello riceve un prompt e inventa tutto: ambientazione, luce, soggetto, movimento. È la porta giusta per le inquadrature di ambientazione e per le scene senza un personaggio ricorrente: paesaggi, folle, fenomeni atmosferici, movimento astratto, una città di notte. È anche la porta più economica in termini di tempo umano, perché non c'è nulla da preparare.
Il suo punto debole è che non ricorda nulla. Ogni chiamata reinventa il mondo, per cui due scene text-to-video della "casetta della volpe" producono due casette diverse. Usato per le scene con personaggi, è la causa principale dei film incoerenti. Il suo secondo punto debole è il controllo: il prompt può chiedere una composizione ma non può garantirla, e i modelli ignorano regolarmente istruzioni spaziali come "a sinistra".
Image-to-video
Il modello riceve un fotogramma di partenza e lo anima. Il primo fotogramma è fisso; il modello aggiunge il movimento e, a seconda del modello, i movimenti di macchina. È la porta giusta ogni volta che deve comparire una composizione specifica o un personaggio specifico, il che in un film narrativo riguarda la maggior parte delle scene. È anche il meccanismo della continuità: una scena che prosegue la precedente parte dall'ultimo fotogramma della clip precedente.
Il suo punto debole è che il movimento resta vincolato al fotogramma. Le azioni molto dinamiche, come un personaggio che corre verso la macchina da presa o un combattimento, possono apparire costrette, perché il modello è restio ad abbandonare la composizione ricevuta. Alcuni modelli inoltre derivano: dopo cinque o sei secondi il volto del personaggio comincia a cambiare. La soluzione sono clip più brevi e un nuovo keyframe per la scena successiva.
Endpoint con riferimento al personaggio
Alcuni fornitori accettano qualche immagine di riferimento e un prompt, promettendo di mantenere coerente il personaggio mentre inventano la composizione. In pratica questi endpoint privilegiano i volti umani, faticano con animali e oggetti e sono stati rimossi o sostituiti dai fornitori senza preavviso più di una volta. Vanno considerati opzionali: usarli quando disponibili per personaggi umani fotorealistici, mai come unico percorso, mantenendo sempre il percorso tramite keyframe come alternativa. Una pipeline che dipende dall'endpoint proprietario di un solo fornitore è una pipeline che si rompe alla prossima decisione di prodotto di quel fornitore.
Regole di instradamento
- La scena contiene un membro del cast: comporre un keyframe dalle schede di riferimento, poi image-to-video.
- La scena prosegue la precedente nello stesso luogo: ultimo fotogramma della clip precedente, poi image-to-video.
- La persona ha fornito un fotogramma: image-to-video a partire da quel fotogramma.
- La scena è un'inquadratura di ambientazione o non ha un soggetto ricorrente: text-to-video.
- In tutti gli altri casi: text-to-video, con la guida di stile anteposta al prompt perché l'aspetto sia coerente.
Un modello regista può applicare queste regole da solo se la sceneggiatura contrassegna ogni scena con il suo cast e con il suo rapporto di continuità rispetto alla scena precedente. È per questo che lo schema della sceneggiatura contiene entrambi i campi.
Durate
I modelli rapidi offrono in genere 5 o 10 secondi; quelli cinematografici 4, 6 o 8. Il regista deve scegliere solo dall'elenco consentito per il livello per cui sta scrivendo, perché una scena scritta per 7 secondi su un modello che produce solo 5 o 10 verrà arrotondata senza avviso, e la narrazione scritta per 7 secondi non ci starà. Le clip più lunghe costano di più e derivano di più; per gli stili disegnati, 5–8 secondi per scena sono la misura ideale, con la narrazione che porta la storia attraverso i tagli.
Prompt per ciascuna porta
I prompt text-to-video dovrebbero descrivere l'inquadratura come farebbe un direttore della fotografia: soggetto, azione, macchina da presa, luce, stile, in quest'ordine. I prompt image-to-video dovrebbero descrivere solo ciò che cambia: il movimento, il movimento di macchina, l'espressione. Descrivere di nuovo il soggetto invita il modello a ridisegnarlo. In entrambi i casi la frase di stile va per prima e le istruzioni negative ("nessun testo, nessun bordo") per ultime.
Domande frequenti
Un film può mescolare le tre porte? Sì, e la maggior parte dei buoni film lo fa: text-to-video per l'inquadratura di ambientazione, image-to-video per le scene con personaggi, fotogrammi di continuità per le sequenze. L'assemblaggio normalizza risoluzione e frequenza di fotogrammi.
Qual è la porta migliore per l'anime? L'image-to-video a partire da un keyframe in stile anime. Il text-to-video sui livelli cinematografici tende ad aggiungere texture fotorealistiche che rompono l'estetica.
E se il modello video ignora il keyframe? Ridurre l'intensità del movimento, se il modello lo consente, accorciare la clip e verificare che il keyframe non abbia bordi né testo; i modelli trattano le immagini incorniciate come poster e le reinterpretano.
