Dans les huit styles Cinemation de Yeşilçam Studios animés par un modèle vidéo, la synchronisation labiale fonctionne à l’envers de ce que l’on attend : le modèle vidéo anime d’abord la bouche du personnage qui parle, puis la réplique est dite avec la voix fixe de ce personnage et alignée mot à mot sur ce mouvement. Résultat, un personnage a la même voix dans chaque scène. Cet article explique pourquoi nous avons fait ce choix et comment fonctionne l’alignement.

Le problème : des bouches justes, des voix qui changent

La manière la plus répandue de faire parler un personnage généré consiste à laisser le modèle vidéo produire en même temps l’image et le son. La bouche bouge bien, le son colle aux lèvres, et pourtant quelque chose cloche dès la deuxième scène : la voix n’est plus tout à fait la même. Le timbre change, l’âge apparent aussi, parfois même l’accent. Sur un clip isolé, personne ne le remarque. Sur un film de deux minutes où deux personnages dialoguent, le spectateur finit par se demander qui parle.

Nous avons donc posé une règle simple : l’identité d’un personnage, c’est son nom, son apparence et sa voix. Si l’un des trois varie d’une scène à l’autre, le personnage n’existe plus vraiment. La synchronisation labiale devait servir cette règle, pas l’inverse.

Notre approche : l’image d’abord, la voix ensuite

Le pipeline de dialogue suit trois étapes pour chaque réplique.

  1. Animation de la bouche. Le modèle vidéo anime la scène en faisant parler le personnage concerné. C’est lui qui produit un mouvement de lèvres naturel, avec les expressions et les gestes qui vont avec.
  2. Voix fixe. La réplique est ensuite dite par un modèle vocal, avec la voix attribuée une fois pour toutes à ce personnage. Cette voix ne change pas d’une scène à l’autre.
  3. Alignement mot à mot. La parole est transcrite pour obtenir le moment exact de chaque mot, puis la réplique entière est calée dans le temps sur le mouvement de la bouche.

Ce découpage permet à chaque modèle de faire ce qu’il fait le mieux : l’un anime des visages, l’autre produit une voix stable et expressive. L’alignement fait le lien entre les deux.

Étirer la réplique plutôt que la couper

La partie la plus délicate a été l’alignement lui-même. Notre première idée était de découper la réplique mot par mot et de caler chaque mot sur un mouvement de bouche. Sur le papier, c’était précis. À l’écoute, c’était désastreux : des fins de mots coupées, des respirations perdues, une diction hachée.

Nous avons donc changé de méthode. La transcription sert à connaître le début et la fin de la parole et le rythme des mots, puis la réplique entière est étirée ou resserrée pour tenir dans la fenêtre où la bouche bouge. Aucun mot n’est coupé individuellement, les fins de phrase restent intactes, et l’intonation choisie par le modèle vocal est préservée. C’est moins spectaculaire qu’un calage phonème par phonème, mais c’est ce qui sonne juste.

Choisir la voix de chaque personnage

Dans la carte de chaque personnage, le réglage « Voix » propose par défaut « Voix : auto » : le studio choisit une voix adaptée au personnage. Vous pouvez aussi choisir vous-même parmi des voix d’homme et de femme. Quelques conseils issus de nos tests :

  • Donnez à deux personnages qui dialoguent des voix bien contrastées ; le spectateur les distinguera sans effort, même les yeux fermés.
  • Si vous utilisez le mode Les deux, gardez en tête que le narrateur a sa propre voix : évitez de donner la même à un personnage.
  • Pour un personnage récurrent, notez la voix choisie et reprenez-la dans vos projets suivants.

Le guide synchronisation labiale et voix des personnages détaille les réglages pas à pas.

Écrire des répliques qui se synchronisent bien

L’alignement fonctionne mieux avec des répliques de longueur raisonnable. Une phrase courte ou moyenne tient confortablement dans une scène ; un long monologue devra être fortement resserré. Si vous écrivez le dialogue vous-même avec « J’écris le dialogue », gardez à l’esprit la limite de 200 caractères par réplique : c’est aussi une bonne limite dramatique. Vous pouvez aussi laisser le réalisateur écrire, ou utiliser « Écrire le dialogue avec Sam » pour obtenir un brouillon. Nous comparons ces trois options dans Des personnages qui parlent.

Où cela s’applique

La synchronisation labiale avec voix fixe concerne les répliques de dialogue dans huit looks Cinemation : Wuxiamation, Celmation, Neonmation, Toymation, Toonmation, Claymation, Postermation et Panelmation. Shadowmation et Pixelmation sont dessinés par un moteur d’animation 2.5D et non par un modèle vidéo : leurs répliques sont toujours dites avec la voix fixe de chaque personnage, et les sous-titres indiquent qui parle, mais la bouche n’est pas animée et les clips ne sont pas relus. En mode Narrateur, il n’y a pas de bouche à synchroniser : une seule voix raconte par-dessus les images. En mode Muet, il n’y a pas de voix du tout, et la musique est mixée plus fort.

Les sous-titres, réglables sur Oui ou Non, affichent le nom du personnage devant chaque réplique. Dans Panelmation, la même information sert à placer les bulles : le modèle de relecture repère la tête de chaque locuteur pour que la bulle pointe vers la bonne personne.

Ce que nous avons gagné, et ce qui reste difficile

Le gain principal est la continuité. Un film de deux minutes avec trois personnages garde trois voix reconnaissables du début à la fin, et le spectateur n’a plus besoin des sous-titres pour savoir qui parle. Ce qui reste difficile, ce sont les scènes où plusieurs personnages sont de dos ou très petits dans le cadre : il y a alors peu de bouche à suivre, et l’alignement s’appuie davantage sur le rythme de la scène. Pour ces moments, une réplique courte ou un passage en narration donne souvent un meilleur résultat.

Vous pouvez essayer tout cela sur la page Animation, en choisissant un look Cinemation et le mode Dialogue.

Questions fréquentes

Mon personnage aura-t-il la même voix dans toutes les scènes ? Oui. Chaque personnage reçoit une voix fixe, utilisée pour toutes ses répliques du film.

Les fins de phrase peuvent-elles être coupées ? Non. La réplique entière est étirée ou resserrée pour tenir dans la fenêtre du mouvement de bouche ; elle n’est pas découpée mot par mot.

Puis-je choisir la voix moi-même ? Oui. Laissez « Voix : auto » ou choisissez une voix d’homme ou de femme dans la carte du personnage.

La synchronisation labiale est-elle disponible dans tous les styles ? Elle concerne les répliques de dialogue dans huit styles Cinemation ; Shadowmation et Pixelmation font parler leurs personnages avec une voix fixe et des sous-titres, sans animation de la bouche. Typemation et Popbook n’ont pas de dialogue.