UtteraUttera

Música

Describes la música que necesitas y sale una pieza completa, de hasta seis minutos y veinte segundos. No son bucles ni fragmentos para montar: es una pieza con principio y final.

Está pensado para quien necesita música de fondo con una licencia clara —un vídeo, un pódcast, una presentación, una sala de espera— y no quiere pelearse con un catálogo de librería ni con los derechos de nadie.

La salida es WAV estéreo a 48 kHz. El modelo genera a 44,1 kHz y nosotros lo subimos a 48 antes de entregarlo; subir no pierde nada de lo que el modelo hizo.

Todo el audio va marcado. Lleva una marca de agua inaudible que lo identifica como generado por una máquina. Es obligatoria por el artículo 50.2 del Reglamento europeo de IA y no se puede desactivar, ni por la API ni desde el Estudio.
Powered by Stability AI. La música la genera Stable Audio 3, de Stability AI, entrenado con 1.278.902 grabaciones licenciadas de AudioSparx y Freesound. Lo que generes es tuyo, con el alcance que explica la licencia de uso de tu plan.

Duración y calidad

Hay dos mandos, y los dos cambian lo que cuesta. Es la diferencia importante con Sonidos, donde un clip vale lo mismo dure lo que dure.

Duración. De 10 segundos a 6 min 20 s. La pieza se construye entera para la duración que pidas: una de tres minutos no es una de treinta segundos repetida seis veces.

Calidad. Es el número de pasos que da el motor, de 32 a 128. Más pasos es más coherencia rítmica y más estructura, no más fidelidad de sonido: el ancho de banda es el mismo a 32 que a 128, medido.

Por debajo de 32 pasos no se ahorra nada. Está medido: 16 y 32 pasos tardan lo mismo, porque a esas cifras el trabajo real queda por debajo del ruido. Por eso el mando empieza en 32 y no en 16.

Y un tercer mando que no cuesta nada: la semilla. La misma descripción con la misma semilla da la misma pieza. Si te gusta una y quieres volver a ella, guárdate el número.

Por la API

Una ruta. Requiere un plan de pago, desde Startup.

POST /v1/audio/music — cuerpo JSON, devuelve el WAV.

CampoTipoQué es
prompttextoObligatorio. Qué música quieres. El modelo entiende inglés mucho mejor que castellano; decir el estilo, los instrumentos y los BPM ayuda bastante.
secondsnúmeroDuración, de 1 a 380. Por defecto 60.
stepsenteroPasos, de 32 a 128. Por defecto 32.
seedenteroLa misma semilla con la misma descripción da la misma pieza. Si no la mandas, el motor elige una y te la devuelve.
negative_prompttextoQué NO quieres —«voces», «batería»—. Si lo mandas, se activa la guía; si no, no.
translatebooleanotrue traduce tu descripción al inglés antes de generar.

La respuesta trae estas cabeceras:

CabeceraQué dice
X-SeedLa semilla que se ha usado. Si no mandaste ninguna, ésta es la única forma de repetir la pieza.
X-StepsLos pasos aplicados.
X-Audio-SecondsSegundos de audio entregados.
X-GenerationsCuántas generaciones se han hecho.
X-WatermarkQué marca de agua lleva.
X-Translated1 si tu texto se tradujo.

Límites y coste

El tope son 380 segundos. Por encima no es que falle: es que el modelo no sabe, y preferimos decirlo a entregar algo peor sin avisar.

Se cobra por duración y por calidad

A diferencia de Sonidos, aquí el coste depende de las dos cosas, porque el trabajo del motor también:

créditos = 0,333 + segundos × pasos × 0,001167 + segundos × 0,02184

El último sumando es la marca de agua. A partir de unos dos minutos, marcar cuesta más que generar: no es un error de cuentas, es que el motor es muy rápido y marcar va con la duración.

Una pieza de un minuto a 32 pasos sale por unos 3,9 créditos. La misma a 128 pasos, por unos 11. La aplicación te enseña el número antes de generar, precisamente para que mover un mando no sea una sorpresa.