"Anime" è un'etichetta ampia che abbraccia decenni di studi e tecniche. Per un modello generativo è un insieme di convenzioni visive: cel shading, tratto pulito, occhi grandi ed espressivi, nasi semplificati, sfondi pittorici, un'illuminazione particolare. Un prompt dovrebbe nominare le convenzioni anziché la parola, perché la parola da sola lascia al modello la scelta tra una dozzina di sottostili, e ne sceglierà uno diverso per ogni scena.

Che cosa conosce davvero il modello

I modelli di immagini hanno visto milioni di fotogrammi anime, illustrazioni e fan art, etichettati in modo incoerente. Nei loro dati di addestramento "anime" copre l'animazione a cel degli anni Ottanta, il digitale degli anni Duemila, gli sfondi moderni di qualità cinematografica, l'arte chibi da merchandising e le imitazioni occidentali. Nominare le convenzioni restringe la distribuzione a un angolo di questo spazio. Nominare un'epoca o una tecnica di produzione la restringe ulteriormente; nominare uno studio specifico è inaffidabile e, per un prodotto commerciale, poco saggio.

Il vocabolario che funziona

Japanese anime style, cel-shaded 2D animation look, clean confident line art, large expressive eyes, soft painterly backgrounds, warm rim light, subtle bloom. Aggiungere una nota di ripresa (35 mm anamorphic framing) per uniformare le inquadrature e una nota cromatica (muted teal and amber palette) per uniformare le scene. Mantenere la frase sotto le quaranta parole e metterla per prima in ogni prompt; i modelli danno peso all'inizio.

Per i prompt video, aggiungere il vocabolario del movimento proprio del mezzo: limited animation, held frames, slow camera pan, capelli e stoffa mossi dal vento. I modelli video a cui si chiede "anime" senza indicazioni sul movimento producono un movimento di macchina fotorealistico su un fotogramma disegnato, che sembra un poster ripreso con la telecamera.

Trappole

  • Bordi decorativi. I modelli di immagini a volte disegnano una linea di cornice o il bordo di una vignetta manga. Scrivere "fills the whole image edge to edge, no border" e controllare i keyframe prima di animare; un keyframe incorniciato diventa una clip incorniciata.
  • Deriva realistica. I livelli video cinematografici aggiungono texture fotorealistiche, pori della pelle e profondità di campo agli stili piatti. I livelli rapidi preservano meglio l'aspetto disegnato e costano una frazione. Per l'anime, il livello più economico è di solito quello migliore.
  • Proporzioni miste. Senza una scheda di riferimento, una scena disegna un personaggio in stile chibi e quella successiva in modo realistico. Le schede risolvono il problema; la sola frase di stile no.
  • Umanizzazione del non umano. Una lucciola diventa una ragazza alata, a meno che l'aspetto non dica "an actual firefly, an insect" e la scheda non ne mostri una. I dati di addestramento anime sono pieni di animali umanizzati, e il modello tende a ricorrervi.
  • Testo e didascalie. I modelli aggiungono testo giapponese, onomatopee disegnate o un titolo. Vietare esplicitamente il testo; dopo l'animazione non si può più rimuovere.

Mantenere l'estetica per tutto il film

Scrivere lo stile una volta sola, in un'unica frase, e anteporla a ogni prompt delle schede del cast e a ogni prompt di scena. Disegnare prima le schede dei personaggi in quello stile; ricavare i keyframe delle scene dalle schede; animare i keyframe. La coerenza è una proprietà della pipeline, non del prompt: la stessa frase in trenta chiamate text-to-video indipendenti produce comunque trenta estetiche leggermente diverse, perché ogni chiamata ricampiona. Sono le schede e i keyframe a fissarla.

Gli sfondi meritano una frase propria nella guida di stile, perché l'anime li tratta diversamente dai personaggi: pittorici, dettagliati, statici. Un prompt di keyframe che menziona "painterly background, cel-shaded character" ottiene il contrasto giusto; uno che dice solo "anime" produce spesso uno sfondo in cel shading che sembra un videogioco.

La scelta del livello

Per l'anime e gli altri stili disegnati, il livello video rapido è la scelta predefinita corretta. Mantiene piatto il colore piatto, costa un quarto del livello cinematografico e le sue clip più brevi (5 secondi) si adattano all'animazione limitata, in cui pause e tagli fanno parte del linguaggio. Usare il livello cinematografico solo per una scena che richiede un movimento complesso, come l'acqua o una folla, accettando lì un po' di deriva nella texture.

Altri stili disegnati

Lo stesso metodo si applica anche altrove. Acquerello: bordi bagnati, texture della carta, colore che sfuma morbidamente, nessun contorno. Inchiostro a pennello: monocromatico, pennellate, spazio negativo. Fumetto: contorni a inchiostro marcati, retino, colori piatti e saturi, nessun bordo e nessun balloon. Pastello: texture gessosa, bordi morbidi, tavolozza tenue. In ogni caso: nominare le convenzioni del mezzo, vietare testo e cornici, fissare la frase e lasciare che siano le schede e i keyframe a sostenerla.

Domande frequenti

Perché il modello continua ad aggiungere una didascalia? Nei dati di addestramento i fotogrammi anime riportano spesso sottotitoli o titoli. "No text, no caption, no subtitles" alla fine del prompt di solito è sufficiente; in caso contrario, ritagliare il keyframe prima di animarlo.

Una foto può essere trasformata in un personaggio anime? Sì, come riferimento per la scheda, con il consenso della persona. Generare la scheda nello stile a partire dalla foto, poi usare a valle soltanto la scheda, così che il realismo non filtri.

I prompt negativi funzionano sui modelli video? In modo incoerente. Inserire gli elementi vietati nel prompt del keyframe, dove i modelli di immagini li rispettano, e dedicare il prompt video al solo movimento.