Il lip sync con l’IA di Yeşilçam Studios parte da una scelta precisa: un personaggio deve avere la stessa voce in ogni scena. Il modello video anima la bocca del personaggio che parla, poi la battuta viene pronunciata con la voce fissa di quel personaggio e allineata parola per parola al movimento delle labbra. In questo articolo raccontiamo perché abbiamo preferito questa strada a un lip sync generico e come funziona l’allineamento.

Il problema: una voce diversa in ogni clip

Quando abbiamo iniziato a far parlare i personaggi negli stili Cinemation, il primo risultato sembrava promettente. Le bocche si muovevano, le battute si sentivano. Poi abbiamo guardato un film intero, dall’inizio alla fine, e il difetto era evidente: lo stesso personaggio aveva un timbro leggermente diverso da una scena all’altra. In una clip sembrava più giovane, nella successiva più roco, poi di nuovo diverso. Preso da solo, ogni frammento era accettabile. Montati insieme, davano l’impressione di tre attori che si alternavano nello stesso costume.

Per uno spettatore questa incoerenza è più fastidiosa di una bocca che non segue perfettamente ogni sillaba. Riconosciamo le persone dalla voce molto prima che dai dettagli del labiale. Per questo abbiamo deciso che la coerenza della voce sarebbe stata il punto fermo, e che il resto della pipeline si sarebbe adattato a questa regola.

Come funziona, in quattro passaggi

  1. La scena viene animata. Il modello video genera la clip e anima la bocca del personaggio che in quel momento sta parlando.
  2. La battuta viene registrata con la voce del personaggio. Un modello vocale pronuncia la battuta con la voce assegnata a quel personaggio. È la stessa voce in tutte le scene del film, scelta da Lei o assegnata automaticamente.
  3. Il parlato viene trascritto. La registrazione viene trascritta per ricavare quando inizia e finisce ogni parola.
  4. La battuta viene allineata. Con queste tempistiche la battuta viene adattata al movimento della bocca: l’intera frase viene allungata o compressa per entrare nel tempo giusto.

Perché allunghiamo la frase intera e non tagliamo le parole

Una tentazione tecnica era sincronizzare ogni singola parola, tagliando e spostando piccoli frammenti di audio. Sulla carta sembra più preciso. In pratica produce il difetto che tutti riconoscono nei doppiaggi fatti male: finali di parola troncati, respiri spariti, un ritmo innaturale. Abbiamo preferito trattare la battuta come un’unità. L’intera frase viene adattata alla durata del movimento labiale, così l’intonazione resta naturale e nessuna parola perde la sua coda. Le tempistiche parola per parola servono a capire dove si trova il parlato rispetto alla bocca, non a fare a pezzi la voce.

Scegliere le voci

Nella sezione Personaggi, ogni personaggio ha l’impostazione Voce. Con “Voce: automatica” il sistema sceglie una voce adatta al personaggio; in alternativa può scegliere direttamente tra voci maschili e femminili. Alcuni suggerimenti nati dai nostri test:

  • Contrasto tra le voci. Se due personaggi dialogano a lungo, scelga voci ben distinguibili. Lo spettatore deve capire chi parla anche a occhi chiusi.
  • Voce coerente con l’aspetto. Un personaggio anziano e severo, descritto come tale, regge male una voce squillante. Descrizione e voce si rafforzano a vicenda.
  • Narratore diverso dai personaggi. Con Parlato su Entrambi, il narratore dovrebbe distinguersi da tutte le voci del cast.

Buone pratiche per battute che suonano bene

Il lip sync funziona meglio con battute pensate per essere dette. Frasi brevi, una sola idea per riga, punteggiatura chiara. Una battuta lunga che deve stare in una clip breve viene compressa, e una compressione forte si sente. Se scrive il dialogo con Scrivo io il dialogo, ha a disposizione fino a 30 battute di massimo 200 caratteri ciascuna, ma raramente conviene usare tutto lo spazio: due o tre frasi per scena sono di solito il ritmo giusto. In alternativa, Scrivi il dialogo con Sam prepara una bozza pensata per la durata del film, che può poi rifinire. Abbiamo raccontato le tre strade in Personaggi che parlano.

I Sottotitoli aiutano anche qui: nelle scene di dialogo mostrano il nome di chi parla, utile quando il film viene guardato senza audio nei social.

Dove funziona e dove no

Il lip sync con voce coerente riguarda otto stili Cinemation (Wuxiamation, Celmation, Neonmation, Toymation, Toonmation, Claymation, Postermation e Panelmation), quando il film ha dialogo, cioè con Parlato su Dialogo o Entrambi. Con Narratore c’è una sola voce fuori campo e nessuna bocca da animare; con Muto c’è solo musica. Negli stili a motore proprio, come Foliomation o Puppetmation, i personaggi non hanno un labiale generato da un modello video. Lo stesso vale per Shadowmation e Pixelmation, disegnati da un motore di animazione 2.5D: le battute vengono pronunciate con la voce fissa di ciascun personaggio e i sottotitoli indicano chi parla, ma la bocca non viene animata e non c’è revisione automatica delle clip. In Panelmation, il motion comic, le battute compaiono anche nei balloon, che puntano verso chi parla grazie alla revisione automatica delle clip: ne parliamo in Motion comic con Panelmation.

Cosa ci ha insegnato

La lezione più utile è stata guardare i film per intero e non le clip una per una. Molti problemi che in una singola clip sembrano irrilevanti diventano evidenti nella sequenza: una voce che cambia, un ritmo che si spezza, un finale di frase tagliato. Oggi valutiamo ogni modifica sulla pipeline vocale su film completi, con più personaggi e più scene, perché è così che le persone li guardano. Può provarlo sulla pagina Animation con uno dei look Cinemation.

Domande frequenti

Il personaggio ha la stessa voce in tutte le scene? Sì. Ogni personaggio ha una voce fissa, scelta da Lei o automatica, e tutte le sue battute vengono pronunciate con quella voce.

Il lip sync taglia le parole per sincronizzarle? No. Il parlato viene trascritto per ricavare le tempistiche delle parole, ma l’intera battuta viene adattata alla durata del movimento della bocca, senza tagli che tronchino i finali.

In quali stili c’è il lip sync? In Wuxiamation, Celmation, Neonmation, Toymation, Toonmation, Claymation, Postermation e Panelmation, quando Parlato è impostato su Dialogo o Entrambi. In Shadowmation e Pixelmation le battute hanno la voce fissa del personaggio e i sottotitoli con il nome, ma senza animazione della bocca.

Posso scegliere voci maschili o femminili? Sì. Per ogni personaggio può lasciare la voce automatica oppure scegliere una voce maschile o femminile.