La voz es donde las películas automatizadas suenan más a automatizadas. Una sola voz que lo lee todo, líneas que no encajan con la imagen, un narrador que repite lo que un personaje acaba de decir: cada uno de estos problemas es un fallo estructural, no un fallo del modelo. La solución también es estructural: dos capas con funciones distintas, voces elegidas de forma deliberada y un texto ajustado a la imagen.
Las dos capas
El narrador aporta el tiempo y el lugar: "Esa noche, el zorro llegó al río". Los personajes aportan la intención: "No pienso volver". Una línea pertenece a un personaje que está en pantalla; el narrador nunca la repite ni describe lo que la imagen ya muestra. Imponga esto como un contrato en los datos del guion, no como una sugerencia de estilo. El modelo director recibe dos campos separados por escena, una frase de narración y una línea de diálogo opcional con su hablante, y el esquema rechaza cualquier narración que contenga comillas.
No todas las escenas necesitan ambas capas. Los planos de situación suelen llevar solo narración; un enfrentamiento puede llevar solo una línea, rodeada de silencio. Una película en la que todas las escenas tienen las dos capas suena a documental sobre sí misma.
Elegir las voces
Asigne a cada personaje un perfil: género, franja de edad (niño, joven, adulto, mayor) y un tono descrito con palabras ("cálido, pausado", "cortante, impaciente"). Puntúe el catálogo de voces del proveedor frente al perfil usando las propias etiquetas de las voces, prefiera voces que ningún otro personaje de la película esté usando y, si nada encaja, recurra a la voz del narrador. Guarde la voz elegida con el personaje para que una segunda película use la misma: un personaje cuya voz cambia de una película a otra resulta tan chocante como uno cuyo rostro cambia.
El narrador merece su propio casting. Debería diferenciarse de todos los personajes en género o franja de edad, para que el oído separe las capas sin esfuerzo. Un error habitual es darle al narrador la voz más agradable del catálogo y descubrir después que también es la que mejor encaja con el protagonista.
Ajustar la voz a la imagen
La voz sintetizada avanza a unos nueve o diez caracteres por segundo en la mayoría de los idiomas, más despacio en alemán y más deprisa en español. La narración de una escena debe caber en su duración dejando margen para la línea de diálogo: en una escena de ocho segundos con una línea de dos segundos, la narración dispone de unos cinco segundos, es decir, unos 45 caracteres. Limite las líneas a una frase para que ningún clip cargue con un discurso. Cuando una historia es más larga que la duración objetivo, el director debe recortar acontecimientos, no comprimir frases; acelerar la voz para que quepa es la forma más rápida de volver ininteligible una película.
Presupueste en caracteres, no en palabras, porque el modelo de voz factura y marca el ritmo por caracteres, y porque la longitud de las palabras varía entre idiomas mucho más que el número de caracteres.
Colocación en la línea de tiempo
Coloque cada clip de narración al inicio de su propia escena en la línea de tiempo, en lugar de concatenarlos en un único archivo de narración largo. Un solo archivo se desincroniza respecto a los cortes en cuanto un clip dura una fracción de más, y hacia la escena veinte el narrador está describiendo la escena anterior. La colocación por escena también permite regenerar una sola escena: se sustituyen juntos el clip y su narración.
Las líneas se colocan donde habla el personaje, que en un clip con sincronización labial es el inicio del clip. Deje una breve pausa entre la narración y la línea; superponer las dos capas es peor que el silencio.
Música bajo la voz
Genere la música una sola vez a partir de la guía de estilo, con la duración completa, y atenúela bajo la voz en una cantidad fija en lugar de mezclar de oído. Una atenuación automática de 8–10 dB basta para la narración; una atenuación mayor hace que la música "bombee". Haga un fundido de entrada durante la primera escena y uno de salida durante la última; no corte la música en los límites de escena a menos que el guion marque un cambio de ambiente brusco.
Degradación elegante
La sincronización labial depende de un proveedor, y los proveedores fallan: cuota, caídas, un endpoint retirado. Cuando falle, conserve el clip y haga que la línea siga sonando en la pista de audio. Puede que la boca no se mueva, pero la historia queda intacta y el trabajo fallido se reembolsa. Nunca permita que un fallo de audio descarte un clip terminado. La misma regla vale para la música: una película sin música sigue siendo una película; una película que falla porque el modelo de música estaba caído es un error de software.
Escribir para las voces
Líneas entre comillas con el hablante al lado; frases cortas; una idea por escena. Las etiquetas de emoción ("en voz baja", "emocionado") ayudan a los modelos que las admiten y los que no las admiten las ignoran sin causar daño. Evite números y abreviaturas en la narración; los modelos de voz leen "3D" y "DXF" de forma irregular, y escribirlos con letras es más seguro. Los nombres propios deberían aparecer en la descripción escrita del aspecto, para que el modelo los haya visto antes de tener que pronunciarlos.
Preguntas frecuentes
¿Puede el narrador ser un personaje? Sí, en historias en primera persona. En ese caso, la voz del narrador es la de ese personaje, y sus líneas en pantalla usan la misma voz a un ritmo ligeramente distinto. La regla de las dos capas sigue aplicándose: la narración describe, las líneas actúan.
¿Qué ocurre con los idiomas que el proveedor de voz no cubre bien? Elija para el narrador la mejor voz disponible en ese idioma y mantenga cortas las líneas de los personajes. Las voces de baja calidad quedan más en evidencia en las narraciones largas.
¿Cómo se verifica la voz? Pase el audio sintetizado por un sistema de voz a texto y compárelo con el guion. Una discrepancia superior a unos pocos puntos porcentuales indica que la voz pronunció mal un nombre o que el texto contenía algo que el modelo no pudo leer.
