Chieda a un modello video "la ragazza lucciola si nasconde sotto una foglia" e otterrà ogni volta una ragazza lucciola diversa. Chieda la stessa cosa a un modello di immagini mostrandogli la sua scheda di riferimento, e otterrà lei. Poi chieda a un modello video di animare quell'immagine, e lei si muove. È tutta qui l'idea alla base della pipeline delle scene che abbiamo rilasciato con Da storia a film, ed è lo strumento di coerenza più efficace che abbiamo.
Perché il text-to-video dimentica
Un prompt testuale descrive una distribuzione, non un individuo. "Una piccola ragazza lucciola con ali traslucide" corrisponde a migliaia di disegni, e ogni chiamata ne campiona uno diverso. I modelli video peggiorano le cose: devono anche mantenere il personaggio stabile tra i fotogrammi, e sacrificano la fedeltà a qualsiasi riferimento in favore della qualità del movimento. Senza un lavoro di ingegneria, trenta chiamate text-to-video indipendenti danno trenta eroine leggermente diverse e un film che ha bisogno dei sottotitoli per dire chi è chi.
Il vecchio percorso
Le scene con personaggi usavano un endpoint di riferimento multi-immagine del fornitore video: alcune immagini di riferimento più un prompt, con la promessa che il personaggio sarebbe rimasto coerente mentre il modello inventava la composizione. Con i volti umani funzionava abbastanza bene. Non ha mai gestito bene i personaggi non umani, e di recente il fornitore l'ha dismesso quasi senza preavviso. Una pipeline che dipende dall'endpoint proprietario di un solo fornitore si rompe alla successiva decisione di prodotto di quel fornitore, quindi abbiamo preso la dismissione come un motivo per cambiare il design, non per cercare un endpoint sostitutivo.
Il nuovo percorso
- Il regista scrive il prompt della scena ed elenca i personaggi presenti, tramite l'id del cast.
- Lo studio renderizza un keyframe: il modello di immagini riceve le schede del cast, il prompt della scena e la guida di stile, con l'istruzione di mantenere ogni design fedele al suo riferimento.
- Il keyframe diventa il primo fotogramma della clip tramite image-to-video, a qualsiasi livello di qualità. Il prompt video descrive solo ciò che cambia: il movimento, lo spostamento della camera, l'espressione.
Le scene senza membri del cast, come un'inquadratura d'ambientazione della valle, passano ancora direttamente al text-to-video con la frase di stile anteposta. Le scene segnate come continue partono dall'ultimo fotogramma della clip precedente invece che da un nuovo keyframe, così scenografia e luce si mantengono.
Effetti collaterali che ci piacciono
- Ora i livelli Cinema possono usare i personaggi; prima potevano farlo solo i livelli rapidi, perché l'endpoint di riferimento esisteva solo lì.
- Può esaminare il keyframe prima che la clip esista, e la Libreria lo conserva insieme al suo prompt.
- Un keyframe fallito fallisce a basso costo; il costoso passaggio video non parte mai.
- La composizione è separata dal movimento. Se una scena non va, il problema è visibile nell'immagine fissa, e correggerlo significa modificare un solo prompt.
Quanto costa
Una generazione di immagine per scena, pochi centesimi a costo reale. Rispetto alla clip video che la segue, è quasi gratis. Un film di quattro minuti con circa 32 scene aggiunge circa 1,30 dollari di keyframe a circa 30 dollari di clip. Abbiamo valutato di rendere il keyframe facoltativo per risparmiare quella cifra e abbiamo deciso di no: il risparmio è irrisorio, la perdita di coerenza no.
Come sfruttarlo al meglio
- Descriva il soggetto nel prompt del keyframe, e solo il movimento nel prompt video. Descrivere di nuovo il personaggio nella fase video invita il modello a ridisegnarlo.
- Metta sempre la frase di stile all'inizio di ogni prompt. I modelli danno più peso all'inizio.
- Vieti bordi e testo nel keyframe. I modelli di immagini a volte disegnano una cornice o una didascalia, e il modello video finisce per animare un poster.
- Per gli stili disegnati, preferisca Standard. Il livello rapido mantiene piatti i colori piatti; i livelli Cinema possono aggiungere texture fotorealistiche a un keyframe disegnato.
Insidie
Il movimento image-to-video è limitato dall'inquadratura. Un personaggio che corre verso la camera o una lotta possono sembrare costretti, perché il modello è restio ad abbandonare la composizione ricevuta. Le clip più brevi aiutano, e così un nuovo keyframe per il momento successivo. Alcuni modelli inoltre derivano verso la fine di una clip lunga; sul livello rapido, da 5 a 8 secondi per scena è l'intervallo ideale, con la narrazione che porta la storia attraverso i tagli.
Con tre o più membri del cast nella stessa inquadratura i modelli attuali cominciano a mescolare i tratti. Al regista viene chiesto di limitare le scene ai personaggi che contano, e quando due condividono un'inquadratura i prompt ne indicano la posizione ("la rana a sinistra, il gufo a destra").
Domande frequenti
Il percorso con keyframe funziona a ogni livello? Sì. Bozza, Standard, Cinema e Cinema Pro animano tutti a partire dal keyframe; cambiano solo le durate, 5 o 10 secondi sui livelli rapidi e 4, 6 o 8 su Cinema.
Posso fornire il mio primo fotogramma? Sì. Nel flusso di lavoro scena per scena, un fotogramma di storyboard da Lei approvato diventa il primo fotogramma della clip tramite lo stesso passaggio image-to-video; il modello parte dalla Sua immagine, non da una sua descrizione.
E se il modello video ignora il keyframe? Accorci la clip, verifichi che il keyframe non abbia bordi o testo e limiti il prompt video al solo movimento. Un'immagine incorniciata viene letta come un poster e reinterpretata.
