Transcribir
Audio a texto, con el idioma detectado solo.
POST /v1/audio/transcriptions
Transcribe, resume, traduce y pone voz. Por API o desde el navegador, sin instalar nada. Compatible con la API de OpenAI: si ya la usas, cambias dos líneas.
Probar aquí mismo Ver la documentación
Procesado íntegramente en España · No guardamos tus audios · No entrenamos con tus datos · Código abierto
Cumple el RGPD (GDPR) y la LOPDGDD
Cinco servicios sobre el mismo audio. Se pagan por segundo, no por petición.
Audio a texto, con el idioma detectado solo.
POST /v1/audio/transcriptionsTexto a audio, con catálogo de voces o con una voz que tú aportas.
POST /v1/audio/speechUna grabación en un idioma, texto y voz en otro.
POST /v1/translateTono, perfil del hablante y quién habla en cada momento.
?extras=sentiment,profile,diarizeUna grabación entera, en un resumen estructurado.
POST /v1/summarizeLa voz se entrega mientras se genera: el primer sonido sale al instante.
POST /v1/audio/speech/streamY las dos aplicaciones web, para usarlo sin programar nada →
Mismas rutas, mismos parámetros, mismos nombres de voz. El SDK oficial funciona sin parchear nada: cambias la dirección y la clave.
Y con una diferencia que para muchas empresas es la que decide: el audio no sale de la Unión Europea.
from openai import OpenAI
c = OpenAI(
api_key="sk-echo-…",
base_url="https://api.uttera.ai/v1",
)
audio = c.audio.speech.create(
model="tts-1", voice="nova",
input="Su pedido sale mañana.",
)
Nada más. Uttera no es un archivo.
La privacidad de tus datos es absoluta.
El audio se procesa en memoria y se descarta al responder. La transcripción, el análisis y el resumen viajan en la respuesta y no se almacenan. Lo único que se escribe —el audio que generamos, una hora— lo puedes desactivar tú en cada petición.
Centros de datos propios en el sur de España. Sin nubes de terceros y sin transferencias internacionales que justificar.
Los modelos —incluido el que resume— corren en nuestro hardware. No hay llamadas a OpenAI, ni a Google, ni a nadie.
Tu audio y tu texto no entrenan ningún modelo. Tampoco se convierten en estadísticas, ni en «datos anonimizados», ni en material de estudio. No hay letra pequeña detrás de esa frase: no queda copia con la que hacerlo. Los modelos no aprenden de lo que pasa por ellos: cada petición empieza y acaba sin dejar rastro. Si algún día entrenamos uno nuestro será con datos licenciados para eso, nunca con los tuyos.
Apache 2.0, y son los mismos que corren en producción. Puedes leer y auditar nuestro código. Si tu caso no admite que el audio salga de tu red, móntalo tú.
Un minuto de audio o un párrafo de texto. Sin cuenta, sin tarjeta.
La demostración usa la voz estándar y va limitada. Con una cuenta gratuita tienes el catálogo entero, el análisis de voz y los resúmenes.
Una cuenta, una clave y créditos para probar. Sin tarjeta y sin pagos.