La voce è l'ambito in cui i film automatizzati suonano più spesso automatizzati. Un'unica voce che legge tutto, battute che non corrispondono all'immagine, un narratore che ripete ciò che un personaggio ha appena detto: ciascuno di questi è un difetto strutturale, non un difetto del modello. Anche la soluzione è strutturale: due livelli con compiti distinti, voci scelte con criterio e un testo dosato sulle immagini.
I due livelli
Il narratore porta il tempo e il luogo: "Quella notte, la volpe raggiunse il fiume." I personaggi portano l'intenzione: "Non tornerò indietro." Una battuta appartiene a un personaggio in scena; il narratore non la ripete mai e non descrive mai ciò che l'immagine mostra già. Questa regola va imposta come contratto nei dati della sceneggiatura, non come suggerimento di stile. Il modello regista riceve due campi separati per scena, una frase di narrazione e una battuta parlata facoltativa con il relativo parlante, e lo schema rifiuta una narrazione che contiene virgolette.
Non tutte le scene richiedono entrambi. Le inquadrature di ambientazione di solito hanno solo la narrazione; uno scontro può avere solo una battuta, circondata dal silenzio. Un film in cui ogni scena ha entrambi i livelli suona come un documentario su se stesso.
Il casting delle voci
Assegnare a ogni personaggio un profilo: genere, fascia d'età (bambino, giovane, adulto, anziano) e un tono descritto a parole ("caldo, pacato", "tagliente, impaziente"). Valutare il catalogo di voci del fornitore rispetto al profilo usando i tag delle voci stesse, preferire voci che nessun altro personaggio del film utilizza e ricorrere alla voce narrante se nulla è adatto. Salvare la voce scelta insieme al personaggio, così che un secondo film usi la stessa voce: un personaggio la cui voce cambia da un film all'altro disorienta quanto uno il cui volto cambia.
Il narratore merita un casting a sé. Dovrebbe differire da ogni personaggio per genere o fascia d'età, così che l'orecchio separi i livelli senza sforzo. Un errore comune è assegnare al narratore la voce più gradevole del catalogo, per poi scoprire che è anche la più adatta al protagonista.
Dosare il parlato sulle immagini
Il parlato sintetizzato procede a circa nove-dieci caratteri al secondo nella maggior parte delle lingue, più lentamente in tedesco e più velocemente in spagnolo. La narrazione di una scena deve rientrare nella sua durata lasciando spazio alla battuta: per una scena di otto secondi con una battuta di due secondi, la narrazione dispone di circa cinque secondi, quindi di circa 45 caratteri. Limitare le battute a una frase, così che nessuna clip contenga un discorso. Quando una storia è più lunga della durata obiettivo, il regista deve tagliare eventi, non comprimere frasi; accelerare il parlato per farlo rientrare è il modo più rapido per rendere un film incomprensibile.
Il dosaggio va fatto in caratteri, non in parole, perché il modello vocale fattura e cadenza in base ai caratteri, e perché la lunghezza delle parole varia da una lingua all'altra molto più del numero di caratteri.
Collocazione sulla timeline
Collocare ogni clip di narrazione all'inizio della propria scena sulla timeline, anziché concatenarle in un unico lungo file di narrazione. Un file unico va fuori sincrono rispetto ai tagli non appena una clip dura una frazione di secondo in più, e alla scena venti il narratore sta descrivendo la scena precedente. La collocazione per scena rende inoltre possibile rigenerare una singola scena: si sostituiscono insieme la clip e la sua narrazione.
Le battute vanno dove il personaggio parla, che per una clip con lip sync è l'inizio della clip. Lasciare una breve pausa tra narrazione e battuta; sovrapporre i due livelli è peggio del silenzio.
La musica sotto il parlato
Generare la musica una sola volta a partire dalla guida di stile, per l'intera durata, e abbassarla sotto il parlato di una quantità fissa anziché mixare a orecchio. Un ducking automatico di 8–10 dB è sufficiente per la narrazione; un ducking più marcato fa "pompare" la musica. Inserire una dissolvenza in entrata sulla prima scena e in uscita sull'ultima; non tagliare la musica ai confini delle scene, a meno che la sceneggiatura non indichi un netto cambio di atmosfera.
Degradare con eleganza
Il lip sync dipende da un solo fornitore, e i fornitori falliscono: quota esaurita, interruzioni, un endpoint rimosso. Quando fallisce, conservare la clip e far comunque pronunciare la battuta nella traccia audio. La bocca potrebbe non muoversi, ma la storia resta intatta e il lavoro fallito viene rimborsato. Un errore audio non deve mai far scartare una clip finita. La stessa regola vale per la musica: un film senza musica è comunque un film; un film che fallisce perché il modello musicale era fuori servizio è un bug.
Scrivere per le voci
Battute tra virgolette con il parlante indicato accanto; frasi brevi; un'idea per scena. I tag emotivi ("sottovoce", "eccitato") aiutano i modelli che li supportano e vengono ignorati senza danni da quelli che non li supportano. Evitare numeri e abbreviazioni nella narrazione; i modelli vocali leggono "3D" e "DXF" in modo incoerente, e la forma scritta per esteso è più sicura. I nomi propri dovrebbero comparire nell'aspetto scritto, così che il modello li abbia già visti prima di doverli pronunciare.
Domande frequenti
Il narratore può essere un personaggio? Sì, nelle storie in prima persona. In quel caso la voce narrante è la voce di quel personaggio, e le sue battute in scena usano la stessa voce con un ritmo leggermente diverso. La regola dei due livelli resta valida: la narrazione descrive, le battute agiscono.
E le lingue che il fornitore di voci non copre bene? Scegliere il narratore tra le migliori voci disponibili per quella lingua e mantenere brevi le battute dei personaggi. Le voci scadenti si notano soprattutto nelle narrazioni lunghe.
Come si verifica il parlato? Passare l'audio sintetizzato attraverso un sistema di speech-to-text e confrontarlo con il copione. Uno scostamento superiore a qualche punto percentuale significa che la voce ha pronunciato male un nome o che il testo conteneva qualcosa che il modello non era in grado di leggere.
