Définition. La synchronisation labiale dans l’animation par IA désigne l’ensemble des techniques qui font correspondre les mouvements de bouche d’un personnage généré avec la parole qu’on entend. Il existe deux grandes approches : générer ou modifier la bouche à partir de l’audio, ou bien générer d’abord l’image qui parle puis caler la voix sur ce mouvement, comme en doublage. Le choix entre les deux dépend de ce qui compte le plus : la précision de chaque syllabe ou la stabilité de la voix du personnage.
La synchronisation labiale est l’un des détails qui trahissent le plus vite une animation bâclée. Le cerveau humain est extrêmement sensible au décalage entre ce qu’il voit et ce qu’il entend : un retard de quelques images suffit à rendre un dialogue étrange. C’est pourquoi le sujet occupe une place centrale dès qu’une animation contient des personnages qui se parlent.
Les notions de base
Phonèmes et visèmes
Un phonème est une unité de son de la langue ; un visème est la forme de bouche correspondante. Plusieurs phonèmes partagent le même visème : « p », « b » et « m » ferment tous les lèvres. L’animation traditionnelle travaille avec une dizaine de formes de bouche de base, que l’animateur place sur la piste de dialogue. Les systèmes automatiques reprennent la même idée, de façon explicite ou implicite.
Le calage temporel
Pour aligner une bouche sur une voix, il faut savoir quand chaque mot commence et finit. On l’obtient en transcrivant la parole avec un modèle de reconnaissance vocale qui fournit des horodatages par mot. Ces repères permettent de placer la réplique sur la timeline et de mesurer si elle tient dans la durée du plan.
Approche 1 : la bouche pilotée par l’audio
Dans cette approche, la voix est produite en premier. Un modèle reçoit ensuite l’image ou la vidéo du personnage et l’audio, puis redessine la région de la bouche pour qu’elle articule chaque son. C’est la méthode la plus précise syllabe par syllabe, et elle fonctionne bien pour les visages de face, réalistes et bien éclairés.
Ses limites apparaissent avec les styles non réalistes. Un personnage d’anime, de pâte à modeler ou une marionnette d’ombre n’a pas une bouche humaine ; le modèle peut produire une zone floue, une texture qui ne correspond pas au reste de l’image ou une bouche qui change de forme d’un plan à l’autre. Elle ajoute aussi une étape de traitement par clip, avec son coût et ses risques d’échec.
Approche 2 : l’alignement façon doublage
Ici, c’est le modèle vidéo qui anime la bouche du personnage qui parle, en même temps que le reste de la scène, dans le style choisi. La réplique est ensuite dite par une voix fixe attribuée à ce personnage, puis alignée sur le mouvement de bouche : on transcrit la parole pour connaître le moment de chaque mot, et on étire légèrement la réplique entière pour qu’elle occupe la même fenêtre que l’articulation. C’est exactement ce que fait un studio de doublage quand il adapte un film étranger.
L’avantage principal est la cohérence : le personnage garde la même voix dans toutes les scènes, et la bouche reste dessinée dans le style de l’animation. La précision syllabique est un peu moindre qu’avec une bouche redessinée, mais l’œil la tolère très bien dans les styles stylisés.
Les pièges courants
- Couper la fin des mots. Si l’on découpe l’audio mot par mot pour le forcer dans la fenêtre, les finales sont tronquées. Étirer la réplique entière de façon uniforme évite ce défaut.
- Changer de voix entre deux scènes. Choisir une voix « au mieux » à chaque plan produit un personnage qui sonne différemment d’une scène à l’autre. La voix doit être fixée une fois par personnage.
- Répliques trop longues pour le plan. Un étirement excessif rend la voix artificielle. Mieux vaut écrire des répliques courtes ou allonger la scène.
- Bouche du mauvais personnage. Dans un plan à deux, il faut préciser qui parle, sinon le modèle anime les deux bouches ou la mauvaise.
- Oublier le mixage. Une voix parfaitement calée mais noyée sous la musique paraît décalée. La musique doit baisser pendant les répliques.
La démarche de Yeşilçam Studios
Dans les huit styles Cinemation animés par un modèle vidéo de la section Animation (Shadowmation et Pixelmation, dessinés par un moteur d’animation 2.5D, gardent la voix fixe et les sous-titres, sans animation de la bouche), Yeşilçam Studios a choisi l’alignement façon doublage : le modèle vidéo anime la bouche du personnage qui parle, la réplique est dite avec la voix fixe de ce personnage, puis calée mot par mot sur le mouvement grâce à une transcription. La réplique entière est étirée, jamais coupée mot par mot, si bien que les fins de phrase restent intactes et qu’un personnage sonne pareil dans chaque scène. Le guide synchronisation labiale et voix des personnages explique comment choisir les voix, et le billet sur ce choix de conception en raconte les raisons.
Comment juger une synchronisation labiale
Regardez d’abord les consonnes fermées (p, b, m) : les lèvres doivent se toucher au bon moment. Vérifiez ensuite que la bouche s’arrête quand la voix s’arrête, et que le personnage qui ne parle pas garde la bouche fermée. Écoutez enfin la même voix sur plusieurs scènes : si le timbre change, le problème n’est pas visuel mais de distribution vocale.
Questions fréquentes
Qu’est-ce qu’un visème ? C’est la forme visible de la bouche associée à un ou plusieurs sons. Les lettres p, b et m partagent par exemple le même visème, lèvres fermées.
Quelle méthode est la plus précise ? Redessiner la bouche à partir de l’audio est plus précis syllabe par syllabe, surtout pour des visages réalistes. L’alignement façon doublage est plus stable pour les styles stylisés et garde la voix identique.
Pourquoi la voix d’un personnage change-t-elle parfois entre les scènes ? Parce que la voix est choisie scène par scène au lieu d’être fixée une fois par personnage. Une voix attribuée au personnage règle le problème.
Faut-il écrire des répliques courtes ? Oui. Une réplique qui tient naturellement dans la durée du plan demande peu d’étirement et sonne plus naturelle.
