C'est dans la parole que les films automatisés sonnent le plus souvent automatisés. Une seule voix qui lit tout, des répliques qui ne correspondent pas à l'image, un narrateur qui répète ce qu'un personnage vient de dire : chacun de ces défauts est structurel, pas lié au modèle. La solution est structurelle elle aussi : deux couches aux rôles distincts, des voix choisies délibérément et un texte dimensionné à l'image.

Les deux couches

Le narrateur porte le temps et le lieu : « Cette nuit-là, le renard atteignit la rivière. » Les personnages portent l'intention : « Je ne reviendrai pas. » Une réplique appartient à un personnage à l'écran ; le narrateur ne la répète jamais et ne décrit jamais ce que l'image montre déjà. Imposez cela comme un contrat dans les données du scénario, pas comme une simple indication de style. Le modèle réalisateur reçoit deux champs distincts par scène, une phrase de narration et une réplique facultative avec son locuteur, et le schéma rejette toute narration contenant des guillemets.

Toutes les scènes n'ont pas besoin des deux. Les plans d'exposition ne prennent généralement que de la narration ; une confrontation peut ne prendre qu'une réplique, entourée de silence. Un film où chaque scène comporte les deux couches sonne comme un documentaire sur lui-même.

Choisir les voix

Donnez à chaque personnage un profil : genre, tranche d'âge (enfant, jeune, adulte, âgé) et un ton exprimé en mots (« chaleureux, posé », « sec, impatient »). Évaluez le catalogue de voix du fournisseur par rapport au profil à l'aide des étiquettes propres aux voix, privilégiez les voix qu'aucun autre personnage du film n'utilise, et revenez à la voix du narrateur si rien ne convient. Enregistrez la voix choisie avec le personnage afin qu'un second film utilise la même : un personnage dont la voix change d'un film à l'autre est aussi déroutant qu'un personnage dont le visage change.

Le narrateur mérite son propre casting. Il doit se distinguer de chaque personnage par le genre ou la tranche d'âge, pour que l'oreille sépare les couches sans effort. Une erreur courante consiste à confier au narrateur la voix la plus agréable du catalogue, puis à découvrir qu'elle est aussi la mieux adaptée au protagoniste.

Dimensionner la parole à l'image

La parole synthétisée avance à environ neuf à dix caractères par seconde dans la plupart des langues, plus lentement en allemand et plus vite en espagnol. La narration d'une scène doit tenir dans sa durée en laissant de la place pour la réplique : pour une scène de huit secondes avec une réplique de deux secondes, la narration dispose d'environ cinq secondes, soit à peu près 45 caractères. Limitez les répliques à une phrase afin qu'aucun clip ne porte un discours. Quand une histoire est plus longue que la durée cible, le réalisateur doit couper des événements, pas comprimer des phrases ; accélérer la parole pour la faire tenir est le moyen le plus rapide de rendre un film inintelligible.

Comptez en caractères et non en mots, parce que le modèle de parole facture et rythme au caractère, et parce que la longueur des mots varie bien plus d'une langue à l'autre que le nombre de caractères.

Placement sur la timeline

Placez chaque clip de narration au début de sa propre scène sur la timeline, plutôt que de tout concaténer dans un long fichier de narration. Un fichier unique se décale par rapport aux coupes dès qu'un clip dure une fraction de seconde de trop, et à la vingtième scène, le narrateur décrit la scène précédente. Le placement par scène rend aussi possible la régénération d'une scène isolée : on remplace le clip et sa narration ensemble.

Les répliques se placent là où le personnage parle, c'est-à-dire, pour un clip synchronisé sur les lèvres, au début du clip. Laissez un court intervalle entre la narration et la réplique ; superposer les deux couches est pire que le silence.

La musique sous la parole

Générez la musique une seule fois à partir du guide de style, sur toute la durée, et atténuez-la sous la parole d'une valeur fixe plutôt que de mixer à l'oreille. Une atténuation automatique (ducking) de 8 à 10 dB suffit pour la narration ; une atténuation plus forte fait « pomper » la musique. Faites-la entrer en fondu sur la première scène et sortir sur la dernière ; ne coupez pas la musique aux limites des scènes, sauf si le scénario signale un changement d'ambiance franc.

Dégradation maîtrisée

La synchronisation labiale dépend d'un seul fournisseur, et les fournisseurs tombent en panne : quota, interruption, point d'accès supprimé. Quand elle échoue, conservez le clip et faites tout de même entendre la réplique dans la piste audio. La bouche ne bougera peut-être pas, mais l'histoire reste intacte et la tâche échouée est remboursée. Ne laissez jamais un échec audio faire jeter un clip terminé. La même règle vaut pour la musique : un film sans musique reste un film ; un film qui échoue parce que le modèle de musique était indisponible est un bug.

Écrire pour les voix

Des répliques entre guillemets avec le locuteur à côté ; des phrases courtes ; une idée par scène. Les étiquettes d'émotion (« doucement », « avec excitation ») aident les modèles qui les prennent en charge et sont ignorées sans dommage par les autres. Évitez les chiffres et les abréviations dans la narration ; les modèles de parole lisent « 3D » et « DXF » de façon irrégulière, et une forme écrite en toutes lettres est plus sûre. Les noms propres doivent figurer dans l'apparence écrite, afin que le modèle les ait déjà vus avant de devoir les prononcer.

Questions fréquentes

Le narrateur peut-il être un personnage ? Oui, dans les récits à la première personne. La voix du narrateur est alors celle de ce personnage, et ses répliques à l'écran utilisent la même voix à un rythme légèrement différent. La règle des deux couches s'applique toujours : la narration décrit, les répliques agissent.

Et les langues que le fournisseur de voix couvre mal ? Choisissez pour le narrateur la meilleure voix disponible dans la langue et gardez les répliques des personnages courtes. Les voix médiocres sont le plus exposées sur les longues narrations.

Comment la parole est-elle vérifiée ? Passez l'audio synthétisé dans un système de transcription automatique et comparez le résultat au script. Un écart de plus de quelques pour cent signifie que la voix a mal prononcé un nom ou que le texte contenait quelque chose que le modèle ne savait pas lire.