Qué es Uttera
Uttera trabaja con voz. Le das audio y te devuelve texto, análisis o más audio; le das texto y te devuelve voz.
Está pensada para lo que pasa después de una conversación grabada —una llamada, una reunión, una entrevista, una nota de voz—: transcribirla, saber quién habló y en qué tono, traducirla o resumirla. No es un traductor de texto ni un lector de documentos: el audio está en un extremo o en el otro, siempre.
Dos formas de usarlo
No hace falta saber programar para usar Uttera. Hay dos puertas, y la mayoría de la gente solo necesita la primera:
El Estudio
Una aplicación web. Entras con tu cuenta, subes un fichero, marcas lo que quieres y descargas el resultado. Sin instalar nada y sin escribir una línea de código. Cómo se usa.
La API
Para que tu propio software hable con el nuestro: integrar Uttera en tu centralita, tu CRM o tu aplicación, y que el trabajo ocurra solo, sin que nadie suba ficheros a mano. Cómo se usa.
Las dos hacen exactamente lo mismo y cuestan lo mismo: el Estudio no es una versión recortada ni una demostración, es la misma máquina con un botón delante. Lo único que cambia es quién aprieta el botón — una persona o un programa.
¿Qué es una API?
API son las siglas de Application Programming Interface, en castellano interfaz de programación de aplicaciones. Dicho sin jerga: es la puerta por la que un programa le pide algo a otro programa.
La comparación que mejor funciona es la de un restaurante. Tú no entras en la cocina: le dices al camarero lo que quieres, él lo lleva dentro y vuelve con el plato. No necesitas saber cómo está montada la cocina, ni qué horno usan, ni cuántos cocineros hay. Solo necesitas saber qué puedes pedir y cómo pedirlo. La API es el camarero, y esta documentación es la carta.
En la práctica, un programa tuyo envía por internet un fichero de audio a una dirección nuestra, acompañado de una clave que dice quién eres, y recibe de vuelta el resultado. Nada se instala en tu ordenador: el trabajo ocurre en nuestras máquinas y solo viajan la petición y la respuesta.
El nombre
Uttera /ˈʌt.ər.ə/ viene del verbo inglés to utter: pronunciar, decir en voz alta, dar expresión audible a algo.
Formalmente es también un retroacrónimo de Universal Text Transformer Engine for Realtime Audio, que recoge su origen —un servidor de voz a texto y de texto a voz— y la arquitectura Transformer de inteligencia artificial sobre la que está construido.
Lo que sabe hacer
Transcribir
Audio → texto, con detección automática de idioma.
Convertir texto en voz
Texto → audio, con catálogo de voces.
Traducir
Audio en un idioma → texto y voz en otro.
Analizar la voz
Tono, perfil del hablante, quién habla y cuándo.
Resumir
Una grabación entera → resumen estructurado.
Conceptos
Créditos
Todo se cobra en créditos. Un crédito equivale a un segundo de GPU, y cada servicio tiene su coeficiente según lo que consume de verdad. No hay tarifas por petición ni mínimos: pagas por segundo de audio procesado o generado.
Tu plan te da una bolsa mensual de créditos que se renueva en la fecha de tu suscripción, no el día 1 del mes. Lo que no gastas no se acumula.
Voces
Hay dos familias. Las voces estándar son un catálogo fijo, rápidas y baratas. La voz clonada reproduce un timbre concreto a partir de una muestra, cuesta unas 19 veces más por segundo y no está en todos los planes.
Duración, no tamaño
El cobro va por segundos de audio, no por megabytes. Un mismo minuto de voz cuesta lo mismo en WAV que en MP3, aunque el fichero pese veinte veces más.
Tu primera petición
Necesitas una clave. La creas en tu cuenta; empieza por
sk-echo- y se muestra una sola vez.
curl -X POST https://api.uttera.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $UTTERA_API_KEY" \
-F file=@grabacion.mp3 \
-F model=whisper-1 \
-F response_format=text
Respuesta:
Buenos días, llamaba por el pedido de la semana pasada...