Definizione. Una pipeline da storia a film è un sistema software che riceve in ingresso un testo narrativo e restituisce un video finito, senza che nessuno debba scrivere una lista di inquadrature. Combina un modello linguistico che legge e struttura la storia, modelli di immagini e video che disegnano le scene, modelli vocali per le voci, un modello musicale e un montatore deterministico che assembla tutto in un unico file. Chi la usa compie una manciata di scelte creative all'inizio; la pipeline prende le centinaia di piccole decisioni che normalmente spetterebbero a una troupe.

Vale la pena definire il termine con precisione, perché viene spesso confuso con due concetti vicini. Un modello text-to-video è un singolo modello che trasforma un prompt in una clip; non ha alcuna nozione di personaggi, atti o continuità. Un editor video con funzioni AI aiuta chi dispone già di girato. Una pipeline si colloca sopra entrambi: decide quali clip servono, le genera nell'ordine giusto con riferimenti condivisi e le monta insieme.

Le sette fasi

  1. Acquisizione. Il testo viene ripulito (formattazione, note e righe di chat rimosse), se ne rileva la lingua e se ne misura la lunghezza. La pulizia conta più di quanto sembri: le storie incollate da una finestra di chat contengono spesso righe come "se vuoi posso riscriverla", e un modello che le legge come parte della storia finirà per mettere un assistente nel film.
  2. Regia. Un modello linguistico produce una sceneggiatura strutturata: un titolo, una logline di una riga, una guida di stile, un cast con profili visivi e vocali e un elenco di scene. Ogni scena contiene una sinossi, un prompt per l'immagine, una durata, i membri del cast presenti, una battuta parlata e una frase di narrazione. L'output viene validato rispetto a uno schema e, se non supera la verifica, rigenerato una volta insieme all'elenco degli errori.
  3. Casting. Un modello di immagini disegna una scheda di riferimento per ciascun personaggio nello stile scelto: figura intera, posa neutra, sfondo uniforme. Queste schede sono l'ancora visiva di tutte le fasi successive e possono essere riutilizzate da un film all'altro.
  4. Keyframe. Per ogni scena, il modello di immagini compone un fotogramma a partire dalle schede di riferimento e dal prompt della scena. È qui che i personaggi vengono collocati, illuminati e messi in posa. I modelli di immagini seguono i riferimenti molto meglio dei modelli video, per cui collocare questa fase prima dell'animazione è la scelta progettuale più importante dell'intera pipeline.
  5. Animazione. Un modello video anima ogni keyframe per la durata della scena (image-to-video). Le scene senza membri del cast, come le inquadrature di ambientazione, vengono generate dal testo. Le scene che proseguono la precedente partono dall'ultimo fotogramma della clip precedente.
  6. Audio. Le battute vengono sintetizzate con voci scelte in base al profilo di ciascun personaggio e, quando è disponibile un fornitore di lip sync, articolate dal personaggio nella clip. La narrazione viene sintetizzata scena per scena con una voce narrante distinta. La musica viene generata una sola volta a partire dalla guida di stile e mixata sotto l'intero film.
  7. Assemblaggio. Le clip vengono normalizzate a un'unica risoluzione e frequenza di fotogrammi, concatenate in ordine, mixate con narrazione, dialoghi e musica e infine codificate. L'assemblaggio è deterministico: gli stessi input producono sempre lo stesso file, il che rende sicuri i nuovi tentativi.

Che cosa passa tra le fasi

Le fasi sono collegate da un unico oggetto: la sceneggiatura. La regia la scrive; ogni fase successiva la legge e vi riscrive i propri risultati: gli URL delle schede nelle voci del cast, gli URL di keyframe e clip nelle scene, i percorsi audio nel blocco audio. Poiché l'oggetto viene salvato dopo ogni fase, un film può essere ripreso da qualsiasi punto. Se il fornitore video fallisce sulla scena nove, la pipeline non ridisegna il cast né le prime otto scene: ritenta la scena nove e prosegue.

Lo stesso oggetto è ciò che una persona esamina tra il casting e la produzione. Vede il titolo, le schede del cast e l'elenco delle scene prima che venga generato qualsiasi video costoso, e può cambiare l'aspetto di un personaggio, tagliare una scena o riscrivere una battuta. Questo punto di revisione è la risposta della pipeline allo storyboard.

Perché l'ordine conta

Fare il casting prima dei keyframe è ciò che mantiene coerenti i personaggi: la scheda viene disegnata una volta e richiamata ovunque. Fare i keyframe prima dell'animazione è ciò che mantiene fedeli le scene: la composizione viene fissata in un'immagine economica prima di spendere per una clip costosa. L'audio dopo l'animazione consente al lip sync di lavorare sulla clip reale anziché su un'ipotesi. La musica per ultima permette al mix di seguire il montaggio definitivo. Invertire due qualsiasi di questi passaggi produce un film peggiore a un costo maggiore.

Dove va il costo

Quasi tutto il costo si concentra nella fase di animazione. Un film di quattro minuti ha circa trenta scene; ogni clip costa da pochi centesimi a qualche dollaro a seconda del livello del modello. La regia costa pochi centesimi su un modello di classe flash e qualche decina di centesimi su un modello di frontiera. Casting e keyframe insieme costano meno di una singola clip. Voce e musica sono cifre trascurabili. Per questo una buona pipeline lascia scegliere il livello video per ogni film e genera prima i keyframe: un fotogramma fallito costa centesimi, una clip fallita costa dollari.

Modalità di errore che una pipeline deve gestire

  • Il modello linguistico restituisce una struttura malformata: validare, ritentare una volta con l'elenco degli errori e, se necessario, far fallire il lavoro prima di spendere denaro per il video.
  • Un fornitore rifiuta la richiesta o esaurisce la quota: far fallire il singolo lavoro, rimborsarlo e, dove possibile, mantenere in vita il film. Un errore di lip sync, per esempio, non dovrebbe fermare il film; la battuta può comunque essere pronunciata nella traccia audio.
  • La durata obiettivo è più breve della storia: scegliere meno eventi, mai spezzare le frasi. Un regista che fa entrare un intero romanzo in sessanta secondi accelerando la narrazione produce un discorso incomprensibile.
  • Due personaggi si fondono in un'unica voce del cast: imporre un solo essere per voce. Una scheda che mostra "gli animali" non può ancorare separatamente una volpe e un orso.
  • Un fornitore elimina un endpoint: aggirarlo. Gli endpoint video con riferimento al personaggio sono scomparsi senza preavviso; il percorso tramite keyframe sopravvive perché richiede soltanto l'image-to-video, che ogni fornitore offre.

Che cosa una buona pipeline mostra alla persona

Quattro scelte all'inizio: la storia, uno stile visivo, una durata obiettivo e un livello di qualità. Un punto di revisione dopo il casting. Un file finito alla fine, con la sceneggiatura conservata in modo che le singole scene possano essere rigenerate in seguito. Tutto il resto, dalla scelta delle voci alla durata delle clip, è una decisione che la pipeline dovrebbe prendere bene per impostazione predefinita, esponendola solo a chi la richiede.

Domande frequenti

Serve ancora uno storyboard? L'oggetto sceneggiatura è lo storyboard; i keyframe ne sono i riquadri. Le persone lo esaminano tra il casting e la produzione e possono modificarlo prima che venga generata qualsiasi clip.

Quanto tempo richiede un film? La regia richiede meno di un minuto, il casting qualche minuto e l'animazione da dieci minuti a un'ora, a seconda del livello e della coda del fornitore. L'assemblaggio richiede pochi secondi.

Gli stessi personaggi possono comparire in un secondo film? Sì. Le schede di riferimento vengono salvate insieme al personaggio, quindi una seconda storia può riutilizzare lo stesso cast con lo stesso aspetto.

Quanto costa? Quasi interamente la fase video; per le cifre per livello si veda l'articolo sull'anatomia dei costi.