Generar música está resuelto. Escribes «bossa nova lenta, guitarra nailon, 90 BPM» y a los pocos segundos tienes tres minutos de pieza. La parte técnica ya no es la difícil.
La difícil es la siguiente: ¿puedes usarla? En un vídeo de empresa, en un anuncio, en un videojuego que vendes. Y ahí la respuesta no la da el motor, la dan las licencias — que en este caso son dos, no una.
La música la genera stable-audio-3-medium, de Stability AI, bajo la Stability AI
Community License: libre por debajo de 1.000.000 de dólares de facturación anual,
contando filiales. Por encima de esa cifra hace falta una licencia comercial con ellos.
⚠ Y ahí está lo que casi nadie cuenta: ese modelo incorpora T5Gemma, el codificador de texto de Google, que arrastra sus propios Gemma Terms of Use. Son dos licencias apiladas, y cumplir una no te libra de la otra.
Si facturas menos de un millón —que es el caso de casi todo el mundo que lee esto— puedes usar lo que generes. Si facturas más, esto no es un detalle que se resuelva en el despliegue: se resuelve antes, hablando con Stability.
No somos tus abogados. Te damos los datos para que alguien que sí lo sea los mire en diez minutos en vez de en una semana.
La licencia exige «Powered by Stability AI» de forma visible. No una nota al pie en la página de términos: visible donde se usa. Es una condición de la licencia, no una cortesía.
Aquí hay un mito cómodo que conviene romper: «está entrenado con dominio público».
No lo está. Son 1.278.902 grabaciones: 806.284 licenciadas de AudioSparx y 472.618 de Freesound. Es material licenciado, que es una situación distinta —y mejor documentada— que el dominio público, pero no es lo mismo. Si vas a poner una frase sobre el origen del material en tu propia página, que diga la verdad de este modelo.
La pieza se paga por segundo generado, y hay un detalle que no esperábamos al medirlo: marcar cuesta más que generar. A partir de unos dos minutos, la marca de agua es el grueso de la factura, no el modelo.
Suena raro hasta que ves el porqué: Stable Audio 3 hace ocho pasos de difusión y es rapidísimo —una pieza de seis minutos se genera en segundos—, mientras que marcar recorre el audio entero. Cuanto más largo, más pesa la marca.
La cifra concreta de tu plan está en /v1/plans y en la documentación; no la escribimos
aquí porque los precios cambian y un artículo no se entera.
curl -X POST https://api.uttera.ai/v1/audio/music \
-H "Authorization: Bearer $UTTERA_API_KEY" \
-H "Content-Type: application/json" \
-d '{"prompt":"slow bossa nova, nylon guitar, brushed drums, 90 BPM","seconds":180}' \
-o pieza.wav
Hasta seis minutos y veinte segundos por pieza. seed para repetir exactamente la que
te gustó, negative_prompt para lo que no quieres —«voces», «batería»—, y translate si
prefieres describirla en castellano: el modelo entiende inglés mucho mejor, y te devolvemos
en X-Prompt con qué texto se generó de verdad.
Requiere plan de pago, desde Startup.
Como todo lo que generamos. Marca de agua inaudible, obligatoria por el artículo 50.2 del Reglamento europeo de IA, imposible de desactivar.
Para música esto tiene una lectura práctica que conviene entender: la marca no prueba que la pieza sea tuya —prueba que la hizo una máquina—. Si lo que necesitas es demostrar autoría frente a un tercero, la marca de agua no es la herramienta; el registro de la obra sí. Lo que la marca resuelve es la obligación legal de declarar que el contenido es sintético, y esa la resuelve entera.
¿Algo que añadir o que corregir? Escríbenos a support@uttera.ai. Si nos corriges, editamos la entrada y te damos crédito.