Clonar una voz se ha vuelto trivial. Eso es justo lo que lo hace un problema, porque la pregunta técnica —¿puedo?— dejó de ser la interesante hace tiempo. La interesante es la otra.
Vamos con las dos.
Para que un clonado salga bien, el fichero de referencia tiene que cumplir cuatro cosas:
Entre 6 y 12 segundos. No más. Por debajo de seis se pierde profundidad tonal; por encima de doce no mejora proporcionalmente y solo añade latencia al cargarla. La intuición de que «cuanto más audio, mejor» es falsa aquí.
Una frase completa, con entonación natural. No una palabra suelta, no una lectura monótona. El modelo está capturando cómo sube y baja esa voz, y necesita verla hacerlo.
Cero ruido de fondo. Esto es lo que más gente falla. Sin música, sin efectos, sin eco de habitación, sin el aire acondicionado. Cualquier frecuencia ajena contamina la voz de salida y aparecerá en todo lo que generes después. Diez segundos grabados en un armario con ropa dan mejor resultado que un minuto grabado en un salón.
WAV de 16 bits o coma flotante de 32, a 22.050 Hz o más. 44.100 va mejor. Mono o estéreo da igual, se normaliza solo.
La guía detallada, con el flujo completo desde una fuente cualquiera hasta la muestra final,
está en CLONE_VOICES.md dentro de
uttera-tts-hotcold.
Una voz es un atributo de una persona identificable. En España está protegida expresamente —la Ley Orgánica 1/1982 la nombra junto a la imagen y el nombre— y en el resto de Europa el razonamiento es equivalente.
Eso significa que hay una lista corta de cosas que sí y una lista larga de cosas que no.
Puedes, con tranquilidad:
No puedes, aunque técnicamente funcione:
Si dudas, una pregunta suele resolverlo: ¿la persona a la que pertenece esa voz estaría cómoda viendo lo que vas a generar con ella?
No es un criterio jurídico, pero acierta casi siempre. Y cuando la respuesta es «bueno, no se va a enterar», ya tienes la respuesta.
Las voces de referencia para clonado no vienen incluidas en el código publicado, y es deliberado: no es material que se pueda repartir. Pones tus propias muestras y las registras; no hay que tocar código.
Y cuando clonas una voz al vuelo por la API, ese audio nunca entra en la caché, lo pidas o no. En el caso más sensible, la decisión por defecto no debería depender de que el cliente se acuerde de pedirlo. Lo cuenta con detalle la entrada sobre la caché de voz.
¿Algo que añadir o que corregir? Escríbenos a support@uttera.ai. Si nos corriges, editamos la entrada y te damos crédito.