UtteraUttera

Sonidos

Describes un sonido y sale un clip. Describes una escena entera y sale repartida en sucesos colocados en el tiempo, que puedes corregir antes de generarlos, y luego mezclada.

Está pensado para quien monta vídeo: lo que no tiene no es una línea de tiempo —ésa ya la tiene en su editor— sino el sonido concreto. Por eso esto entrega clips y no proyectos.

La salida es WAV estéreo a 48 kHz, que es el ritmo con el que trabaja el vídeo. El modelo genera a 44,1 kHz y nosotros lo subimos a 48 antes de entregarlo; subir no pierde nada de lo que el modelo hizo.

Todo el audio va marcado. Lleva una marca de agua inaudible que lo identifica como generado por una máquina. Es obligatoria por el artículo 50.2 del Reglamento europeo de IA y no se puede desactivar, ni por la API ni desde el Estudio. La marca sobrevive a la compresión y a una llamada de teléfono.
Powered by Stability AI. El sonido lo genera Stable Audio Open, de Stability AI, entrenado sólo con audio de dominio público y con licencia libre, excepto donde se indique expresamente lo contrario. Lo que generes es tuyo, con el alcance que explica la licencia de uso de tu plan.

Una escena

Una escena va en dos pasos, y el intermedio es editable a propósito:

  1. El plan. Describes la escena en lenguaje normal —«una moto para a los ocho segundos, se baja y anda hasta el mar»— y un modelo de lenguaje la descompone en sucesos con su momento de inicio y su duración. Aquí no se genera audio.
  2. La generación. Con el plan ya corregido, cada suceso se genera y todos se mezclan respetando los tiempos.

Son dos pasos y no uno porque seis sucesos son seis generaciones: gastarlas en un plan que no era el que querías es tirarlas. Y ver el plan enseña cómo piensa la herramienta, que es la mitad de aprender a usarla.

Los sucesos pueden solaparse, y conviene que lo hagan: un ambiente de fondo que dura toda la escena con los golpes encima suena a escena; pegados uno detrás de otro suenan a lista de clips.

Por la API

Tres rutas. Todas requieren un plan de pago.

Un sonido

POST /v1/audio/sfx — cuerpo JSON, devuelve el WAV.

CampoTipoQué es
descripciontextoObligatorio. Qué sonido quieres. El modelo entiende inglés mucho mejor que castellano.
segundosnúmeroDuración, de 1 a 30. Por defecto 10.
seedenteroLa misma semilla con la misma descripción da el mismo sonido. Si no la mandas, el motor elige una y te la devuelve.
traducirbooleanotrue traduce la descripción al inglés antes de generar, y te dice en X-Prompt con qué texto se generó.
curl -X POST https://api.uttera.ai/v1/audio/sfx \
  -H "Authorization: Bearer $UTTERA_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"descripcion":"waves breaking on a pebble beach","segundos":12}' \
  -o sonido.wav

Cabeceras de la respuesta: X-Seed (la semilla usada), X-Seconds, X-Generations, X-Watermark, X-Prompt y X-Translated.

El plan de una escena

POST /v1/audio/sfx/plan — recibe descripcion y segundos (4 a 120) y devuelve la lista de sucesos. No genera audio: se cobra sólo el trabajo del modelo de lenguaje.

La escena

POST /v1/audio/sfx/scene — recibe el plan, ya corregido si quieres, y devuelve JSON con la mezcla y las piezas sueltas, todas en WAV codificado en base64 y todas marcadas.

{"segundos": 20,
 "sucesos": [{"inicio": 0.0, "duracion": 20.0, "prompt": "quiet kitchen ambience"},
             {"inicio": 4.0, "duracion": 4.0,  "prompt": "fridge door opening"}]}

Límites y coste

QuéCuánto
Duración de un sonido30 s
Duración de una escena120 s
Sucesos por escena6, de 2 a 30 s cada uno
Cuerpo de la petición64 kB (es JSON, no un fichero)
PlanDe pago. No está en el gratuito.

Se cobra por generación, no por segundo

Y no es un redondeo nuestro: es difusión, y el coste lo marcan los pasos del muestreador, no la duración que pidas. Medido en nuestro nodo, un clip de 5 segundos y uno de 30 tardan lo mismo. Cobrar por segundo haría que el corto costara seis veces menos por exactamente el mismo trabajo.

Un sonido son 11,636 créditos fijos, más 0,026 por segundo de audio, que es lo que cuesta marcarlo. Un clip de 10 s sale a 11,90. Una escena son tantas generaciones como sucesos, más los tokens del planificador, que se cobran como los del resumen.

Una generación a la vez en todo el sistema. Es difusión y no caben dos en la memoria de la tarjeta. Hay cola corta: si está muy pedido, esperas unos segundos. Si la cola está llena, la respuesta es 503.