La coerenza è la proprietà per cui uno stesso personaggio resta riconoscibile da una scena all'altra: volto, proporzioni, costume, tavolozza. I modelli generativi non hanno memoria tra una chiamata e l'altra; ogni richiesta parte da zero. La coerenza va quindi progettata negli input, e le tecniche che funzionano sono tutte variazioni di un'unica idea: decidere una volta sola che aspetto ha il personaggio, in una forma che il modello possa copiare, e fornirgli quella forma ogni volta.
Perché è difficile
Un prompt testuale descrive una distribuzione, non un individuo. "Una volpe con una giacca blu" produce ogni volta una volpe diversa, perché migliaia di volpi corrispondono a quella descrizione. Anche una descrizione molto lunga lascia margini: la forma delle orecchie, la lunghezza del muso, il colore degli occhi, il taglio della giacca. I modelli video peggiorano la situazione, perché devono anche mantenere stabile il personaggio tra i fotogrammi e sacrificano la fedeltà al riferimento a favore della qualità del movimento. Il risultato, senza un'adeguata progettazione, è un film in cui lo spettatore ha bisogno dei sottotitoli per capire chi è chi.
Tecnica 1: le schede di riferimento
Disegnare ogni personaggio una volta sola: figura intera, posa neutra, sfondo uniforme, nello stile del film. Questa è l'ancora visiva. Una scheda funziona perché un'immagine fissa tutto ciò che una descrizione lascia aperto. Va salvata insieme al personaggio, così da poterla riutilizzare in altri film, conservando anche il prompt che l'ha prodotta per poterla rigenerare in un altro stile.
Regole pratiche: un personaggio per scheda, nessun oggetto di scena che non compaia in ogni scena, nessuna illuminazione drammatica. La scheda è una specifica, non un poster. Una scheda drammatica trascina la propria illuminazione in ogni scena che la richiama.
Tecnica 2: un aspetto descritto per iscritto
Accanto all'immagine, conservare una descrizione di 30–60 parole: specie o età, volto, capelli, costume, colori, un segno distintivo. Includerla in ogni prompt di scena. Le parole orientano il modello anche quando il riferimento visivo è debole o assente, e fissano ciò che un'immagine non può fissare, come il nome o il ruolo del personaggio. L'aspetto scritto è anche ciò che un modello linguistico legge quando redige i prompt delle scene, quindi va scritto per un modello: sostantivi e colori concreti, nessun aggettivo come "bellissimo".
Tecnica 3: prima il keyframe
Non chiedere al modello video di collocare il personaggio. Chiedere al modello di immagini di comporre la scena come fotogramma fisso, con le schede di riferimento allegate e l'istruzione di mantenere fedele ogni design. Poi animare il fotogramma. I modelli di immagini rispettano i riferimenti molto meglio dei modelli video, perché risolvono un singolo fotogramma anziché una sequenza, e costano da dieci a cinquanta volte meno. Un keyframe fallito costa centesimi e si rigenera in pochi secondi; una clip fallita costa dollari e minuti.
Il percorso tramite keyframe ha un secondo vantaggio: separa la composizione dal movimento. Se una scena non va, il problema è visibile nel fotogramma fisso prima che venga aggiunto qualsiasi movimento, e si può correggere modificando il prompt di quel solo fotogramma.
Tecnica 4: un soggetto per voce
I modelli linguistici tendono a economizzare. Data una storia con una volpe e un orso, un modello regista a volte produce un'unica voce del cast chiamata "gli animali". Occorre vietarlo nel contratto: ogni voce del cast descrive esattamente un essere. Una scheda unificata non può ancorare due personaggi, e ogni fase successiva eredita la fusione.
Tecnica 5: fotogrammi di continuità
Quando una scena prosegue la precedente nello stesso luogo, far partire la nuova clip dall'ultimo fotogramma della clip precedente anziché da un nuovo keyframe. Personaggio, illuminazione e ambientazione si trasferiscono automaticamente. Usare questa tecnica solo per vere continuazioni; un nuovo luogo richiede un nuovo keyframe, altrimenti la vecchia ambientazione vi filtra dentro.
Che cosa non ha funzionato
Gli endpoint di riferimento multi-immagine dei modelli video: accettabili per i volti umani, deboli per animali e oggetti, e soggetti a essere rimossi dal fornitore senza preavviso. Diversi endpoint di questo tipo sono scomparsi a pochi mesi dal lancio. I prompt solo testuali con un nome: il modello non ha mai visto quel nome e lo tratta come rumore. I prompt molto lunghi: oltre qualche centinaio di parole, i modelli danno peso all'inizio e ignorano il resto, quindi l'aspetto va messo per primo, non per ultimo. I seed: un seed fisso riproduce una singola immagine, non un personaggio attraverso composizioni diverse.
Misurare la coerenza
Scegliere tre scene con lo stesso personaggio e confrontare volto, costume e tavolozza affiancati. Assegnare a ciascuna dimensione un punteggio da 0 a 2: 2 se identica a colpo d'occhio, 1 se riconoscibile con un certo sforzo, 0 se potrebbe trattarsi di un altro personaggio. Un personaggio ottiene un punteggio su 6; un film fa la media dei suoi personaggi. Sotto 4, rigenerare le schede prima di rigenerare qualsiasi scena: il difetto sta quasi sempre nell'ancora, non nelle scene che la richiamano.
Un indicatore più economico è il test dei sottotitoli: guardare il film senza audio e chiedersi se si riesce a capire chi sta parlando. Se serve il nome sullo schermo, la coerenza ha fallito.
Domande frequenti
La foto di una persona reale funziona come scheda di riferimento? Solo per gli stili fotorealistici, e solo con il consenso della persona. Per gli stili disegnati, generare la scheda in quello stile; una foto trascina il realismo in ogni scena.
Quante immagini di riferimento servono per personaggio? Una buona scheda a figura intera basta per la maggior parte dei film. Una seconda scheda con un primo piano del volto aiuta nelle scene composte soprattutto da volti.
Due personaggi possono condividere una scena in modo affidabile? Sì, se entrambe le schede vengono passate alla fase dei keyframe e il prompt li indica per posizione ("la volpe a sinistra, l'orso a destra"). Con tre o più personaggi nello stesso fotogramma, i modelli attuali cominciano a mescolarne i tratti.
