UtteraUttera

Efectos de sonido para una escena, sin bajarlos de YouTube

22 de septiembre de 2026

Hay un momento, en cualquier montaje, en el que hace falta una puerta de nevera. O un grillo. O el murmullo de una cafetería a las ocho de la mañana. Y hay una costumbre muy extendida para resolverlo: buscarlo en YouTube, extraer el audio y recortarlo.

Funciona. Y tiene tres problemas que no se ven hasta que ya es tarde.

Los tres problemas

El primero es la licencia. Que un vídeo sea público no lo hace libre. El sonido que extraes pertenece a alguien —al que lo grabó, o a la biblioteca de la que lo sacó él— y usarlo en algo que publicas es exactamente el supuesto que esa licencia cubre o prohíbe. Nadie te va a reclamar por un montaje que ven doce personas; el problema aparece cuando la cosa funciona.

El segundo es técnico. Ese audio ha pasado por una compresión con pérdida, a veces dos, y trae encima lo que hubiera sonando: una voz de fondo, el reverb de una habitación que no es la tuya, música. Recortar no quita nada de eso.

Y el tercero es el que más tiempo cuesta: nunca dura lo que necesitas. Necesitas cuatro segundos y tienes once, o al revés.

La alternativa

Describes el sonido con palabras y sale un WAV:

curl -X POST https://api.uttera.ai/v1/audio/sfx \
  -H "Authorization: Bearer $UTTERA_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"prompt":"fridge door opening and closing, kitchen ambience","seconds":4}' \
  -o nevera.wav

Cuatro segundos, porque has pedido cuatro. Sin voces de fondo. Sin la sala de otro.

El modelo entiende inglés mucho mejor que castellano. Puedes mandar "translate": true y lo traducimos antes de generar, y te decimos en la cabecera X-Prompt con qué texto se generó de verdad. Merece la pena mirarlo: a veces la traducción es lo que explica por qué ha salido otra cosa.

Y si algo te gusta, la semilla lo reproduce. La respuesta trae X-Seed; mándala otra vez con la misma descripción y sale el mismo sonido. Eso es lo que permite ajustar la duración sin perder el que ya te convencía.

Una escena entera, no un sonido suelto

Lo interesante no es la puerta de la nevera: es la cocina. Y una cocina no es un sonido, son varios que se solapan.

Primero pides el plan:

curl -X POST https://api.uttera.ai/v1/audio/sfx/plan \
  -H "Authorization: Bearer $UTTERA_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"prompt":"cocina por la mañana: alguien prepara café","seconds":20}'

Y te devuelve una lista de sucesos con su momento y su duración: el ambiente de fondo los veinte segundos, la nevera en el segundo 4, la cafetera a partir del 9. No genera nada todavía.

Eso es a propósito. Puedes leer el plan, quitar lo que no quieres, mover un suceso dos segundos, cambiarle la descripción — y entonces mandarlo a generar:

curl -X POST https://api.uttera.ai/v1/audio/sfx/scene \
  -H "Authorization: Bearer $UTTERA_API_KEY" \
  -H "Content-Type: application/json" \
  -d @plan-corregido.json

La respuesta trae la mezcla y cada pieza suelta, todas en WAV. Las piezas sueltas están ahí porque en cuanto lleves esto a un editor vas a querer bajarle el volumen a la cafetera, y con la mezcla ya hecha no se puede.

Lo que NO hace

Hay que decirlo, porque lo contrario es vender humo:

Todo sale marcado, y eso te conviene

Cada audio que generamos lleva una marca de agua inaudible que dice que lo ha hecho una máquina. No se puede desactivar: lo exige el artículo 50.2 del Reglamento Europeo de IA.

Conviene saberlo por dos razones opuestas. La primera es que si entregas ese sonido a un cliente, está marcado, y debes poder decírselo. La segunda es la buena: puedes demostrarlo. El día que alguien discuta de dónde salió ese audio, la marca contesta. Bajado de YouTube, lo único que puedes demostrar es de dónde lo bajaste.

¿Algo que añadir o que corregir? Escríbenos a support@uttera.ai. Si nos corriges, editamos la entrada y te damos crédito.

← Todas las entradas