UtteraUttera

Qué es el Estudio

El Estudio es la aplicación web de Uttera: una página donde subes un fichero o pegas un texto, marcas lo que quieres y descargas el resultado. No hay que instalar nada, no hay que pedir ninguna clave y no hay que escribir una línea de código.

Por dentro es exactamente el mismo servicio que describe el resto de esta documentación. El Estudio no es una demostración con límites recortados: llama a la misma API, con tu mismo plan, y consume créditos de tu misma bolsa. Cuando esta documentación dice que transcribir cuesta tanto por segundo, cuesta lo mismo por las dos puertas.

Para entrar necesitas una cuenta y sesión iniciada. Si no la tienes, el Estudio te devuelve a la portada. La cabecera de la página te recuerda con qué correo has entrado y en qué plan estás, porque de eso depende lo que puedes hacer.

El audio no pasa por el portal: viaja desde tu navegador directamente a la API, con un permiso temporal que la página pide al cargar. Es la razón de que subir un fichero grande vaya a la velocidad de tu línea y no a la del portal. Si dejas la pestaña abierta muchas horas, ese permiso caduca: recarga la página.

Cómo está montada la pantalla

Hay cuatro tarjetas, una por trabajo:

TarjetaQué haceEquivale a
Transcribir audioGrabación → texto, con análisis y resumen opcionales/v1/audio/transcriptions · /v1/summarize
Convertir texto en voz digitalTexto → audio con una voz del catálogo/v1/audio/speech
Convertir texto en voz clonadaTexto → audio con una voz que tú aportas/v1/audio/speech
Traducir una grabaciónGrabación → texto y voz en otro idioma/v1/translate

Si tu plan no incluye algo, la tarjeta sigue ahí pero apagada, en gris y sin botón, diciendo qué plan hace falta. Se enseña a propósito: es mejor ver lo que existe y lo que cuesta que descubrirlo por un error. Lo mismo pasa dentro de Transcribir con las casillas de análisis y de resumen, que se apagan por separado sin quitarte la transcripción.

Todas las tarjetas funcionan igual, de arriba abajo:

  1. Los campos. El fichero o el texto, y las opciones de ese trabajo.
  2. La línea de coste. Aparece en cuanto eliges un fichero y dice cuánto va a costar, antes de gastar nada.
  3. El botón Ejecutar.
  4. El resultado. Mientras trabaja verás el logo de Uttera animado y un contador de segundos, para que se note que sigue vivo; los audios largos tardan. Al terminar, el logo se queda quieto y el contador se convierte en el tiempo que ha tardado.

Transcribir audio

La tarjeta más completa: transcribe, y de paso puede analizar y resumir.

  1. Elige el fichero. Admite wav, mp3, flac, ogg, opus, aiff, m4a y webm. Hasta 400 MB y 3 horas de audio.
  2. Marca los extras que quieras (cada uno tiene su precio y se cobra aparte):
    CasillaQué añade
    tonoLa emoción dominante de la grabación, con su confianza y las otras candidatas.
    perfil del hablanteRango de edad y género estimados a partir de la voz.
    quién habla y cuándoLos turnos de palabra con marcas de tiempo por interlocutor.
    resumen de la grabaciónUn resumen estructurado de lo que se dijo.
  3. Ejecutar. El fichero se sube una sola vez aunque marques los cuatro: el análisis se reparte por dentro sobre el audio ya subido.

El resultado se pinta siempre en este orden:

  1. La transcripción, y debajo el tono en una línea de prosa si lo pediste, con el botón Descargar texto (transcripcion.txt) cerrando el bloque.
  2. El resumen, si lo pediste, con Descargar resumen (resumen.txt). Va detrás del texto a propósito: el resumen se entiende mejor con la transcripción delante, y la transcripción es lo que siempre está.
  3. El perfil y quién habla y cuándo, en crudo. Son datos estructurados y quien los pide los quiere enteros, no redactados.
  4. Descargar análisis (analisis.json): un único fichero con todo lo que se analizó —incluido el vector completo del tono—, no uno por apartado.
  5. La línea del cobro, que cierra la operación.
El resumen no es un extra de la transcripción. Marcarlo cambia el trabajo entero: se atiende por /v1/summarize, que transcribe por su cuenta y además analiza. Por eso el audio no se transcribe dos veces, y por eso las tres casillas de análisis siguen significando lo mismo con el resumen marcado o sin marcar.

Si un análisis concreto falla, se dice: la transcripción se entrega igual y debajo aparece qué parte no se pudo hacer. No se calla ni se inventa.

Convertir texto en voz digital

Escribe o pega un texto y elige cómo quieres oírlo.

CampoQué hace
TextoLo que hay que decir.
VozEl catálogo se carga de la API al abrir la página, con el idioma delante de cada nombre. El idioma no se elige aparte: lo lleva la voz. Un selector de idioma suelto se leería como si tradujera, y esta tarjeta no traduce.
VelocidadDe lenta (0,8) a muy rápida (1,5). Cambia la duración del audio y, como la voz se cobra por segundo generado, también el precio: leer a 1,25 cuesta alrededor de un 20 % menos que a 1,0.
Formato de audiomp3 · wav · opus · flac · pcm

El resultado es un reproductor, la línea del cobro y Descargar audio (voz.mp3, o la extensión que elijas).

Si eliges pcm no verás un reproductor normal sino un botón ▶ Reproducir. El pcm es audio crudo sin cabecera: el navegador no sabe a qué frecuencia va y no puede sonarlo por sí solo, pero el Estudio sí lo sabe y lo descodifica. El fichero que descargues necesitará que le digas esos parámetros al programa con que lo abras — están en Formatos.

Convertir texto en voz clonada

Igual que la anterior, pero la voz la pones tú: subes una muestra y el texto se lee con ella.

CampoQué hace
TextoLo que hay que decir.
Muestra de vozUn audio de la voz a imitar, en cualquiera de los formatos de entrada.
Velocidad y FormatoComo en la voz digital.

La muestra no se cobra. Se cobra el audio generado, que depende de lo largo que sea el texto, no de lo larga que sea la muestra. Clonar tarda bastante más que la voz digital: la tarjeta lo avisa mientras trabaja. La descarga sale como voz-clonada.mp3.

Solo voces que puedas usar. Clonar una voz sin permiso de su titular es problema tuyo, no nuestro: en España la voz es un dato de la persona y está protegida. Lo mismo que dice el apartado de Seguridad sobre lo que entra en el sistema vale aquí para lo que sale de él.

Traducir una grabación

La cadena entera en un paso: transcribe el audio, traduce el texto y lo vuelve a decir en el idioma destino.

CampoQué hace
FicheroLa grabación de origen. El idioma de partida se detecta solo.
Idioma destinoSolo aparecen los idiomas que tienen voz. Se traduce a muchos más, pero aquí hay que poder decirlo en voz alta.
VozDel catálogo estándar. Se ajusta sola al idioma destino al cambiarlo: una voz castellana leyendo la traducción inglesa suena a extranjero leyendo en voz alta.
VelocidadComo en la voz digital, y con el mismo efecto en el precio.
Texto y audio / solo textoSi no necesitas oírlo, solo texto se salta la síntesis y cuesta menos.
Formato de audioLos mismos cinco de la voz digital.

El resultado enseña el original transcrito y la traducción, y debajo el reproductor con Descargar audio (traduccion.mp3) si pediste audio. Si alguna parte de la cadena tuvo algo que advertir, aparece como aviso en vez de perderse.

Lo que cuesta, antes y después

El Estudio es también donde se aprende lo que valen las cosas, así que dice el precio dos veces: una estimación antes y el cargo real después.

Antes. En cuanto eliges un fichero, el navegador lee su duración y la multiplica por el precio de lo que has marcado. Marcar o desmarcar una casilla vuelve a calcularlo sin tener que elegir el fichero otra vez. Dice coste aproximado porque lo es: la duración que mide un navegador sobre un mp3 de tasa variable no siempre es exacta, y quien factura es el motor.

Las dos tarjetas de voz no llevan estimación previa, y no es un olvido: se cobran por los segundos de audio generado, y cuánto audio saldrá de un texto no se sabe hasta generarlo.

Después. Al terminar aparece una línea con el tiempo que tardó en procesarse y lo consumido; un segundo más tarde se sustituye por el cargo real, tal y como lo apuntó el sistema de facturación:

29 s · Cobrado: 144 créditos · por 2.424,0 s de audio ·
transcripción 79 · tono 12 · perfil 8 · interlocutores 24 · resumen 21
Lo que vesQué es
29 sTiempo de proceso, no duración del audio. Cuarenta minutos de grabación se transcriben en menos de un minuto.
Cobrado: 144 créditosLo que se te ha cargado de verdad. Si esto no llegase por lo que sea, se queda la estimación en su lugar.
por 2.424,0 s de audioLa duración exacta que midió el motor, que es la cifra sobre la que se factura.
El desgloseAparece cuando hubo más de un trabajo, para ver a dónde se fue cada crédito.
servido de caché (10 % del precio)Habías pedido exactamente lo mismo hace poco y no hubo que volver a generarlo.

Los precios que usa esta pantalla son los mismos coeficientes publicados en esta documentación, leídos en vivo: si cambian, cambian aquí a la vez.

Cuando algo va mal

Los mensajes del Estudio son los errores de la API en castellano llano:

Lo que diceQué ha pasado
Tu sesión ha caducado. Recarga la página.El permiso temporal se agotó. Recargar basta; no se pierde nada.
Te has quedado sin créditos este periodo.Se renuevan al empezar tu siguiente ciclo de facturación, o puedes cambiar de plan.
Tu plan no incluye este servicio.Igual que las tarjetas apagadas, pero visto desde el servidor.
El fichero es demasiado grande.Por encima de 400 MB o de 3 horas.
El servicio ha rechazado el fichero.El audio no se puede descodificar: suele ser un fichero incompleto o con la extensión cambiada a mano.
Demasiadas peticiones a la vez.Has lanzado varias tarjetas en paralelo. Espera unos segundos.

Y si lo que quieres es que todo esto ocurra solo, sin que nadie suba ficheros a mano, eso es la otra puerta: Integrar Uttera en tu código.