Qué es el Estudio
El Estudio es la aplicación web de Uttera: una página donde subes un fichero o pegas un texto, marcas lo que quieres y descargas el resultado. No hay que instalar nada, no hay que pedir ninguna clave y no hay que escribir una línea de código.
Por dentro es exactamente el mismo servicio que describe el resto de esta documentación. El Estudio no es una demostración con límites recortados: llama a la misma API, con tu mismo plan, y consume créditos de tu misma bolsa. Cuando esta documentación dice que transcribir cuesta tanto por segundo, cuesta lo mismo por las dos puertas.
Para entrar necesitas una cuenta y sesión iniciada. Si no la tienes, el Estudio te devuelve a la portada. La cabecera de la página te recuerda con qué correo has entrado y en qué plan estás, porque de eso depende lo que puedes hacer.
Cómo está montada la pantalla
Hay cuatro tarjetas, una por trabajo:
| Tarjeta | Qué hace | Equivale a |
|---|---|---|
| Transcribir audio | Grabación → texto, con análisis y resumen opcionales | /v1/audio/transcriptions · /v1/summarize |
| Convertir texto en voz digital | Texto → audio con una voz del catálogo | /v1/audio/speech |
| Convertir texto en voz clonada | Texto → audio con una voz que tú aportas | /v1/audio/speech |
| Traducir una grabación | Grabación → texto y voz en otro idioma | /v1/translate |
Si tu plan no incluye algo, la tarjeta sigue ahí pero apagada, en gris y sin botón, diciendo qué plan hace falta. Se enseña a propósito: es mejor ver lo que existe y lo que cuesta que descubrirlo por un error. Lo mismo pasa dentro de Transcribir con las casillas de análisis y de resumen, que se apagan por separado sin quitarte la transcripción.
Todas las tarjetas funcionan igual, de arriba abajo:
- Los campos. El fichero o el texto, y las opciones de ese trabajo.
- La línea de coste. Aparece en cuanto eliges un fichero y dice cuánto va a costar, antes de gastar nada.
- El botón Ejecutar.
- El resultado. Mientras trabaja verás el logo de Uttera animado y un contador de segundos, para que se note que sigue vivo; los audios largos tardan. Al terminar, el logo se queda quieto y el contador se convierte en el tiempo que ha tardado.
Transcribir audio
La tarjeta más completa: transcribe, y de paso puede analizar y resumir.
- Elige el fichero. Admite
wav,mp3,flac,ogg,opus,aiff,m4aywebm. Hasta 400 MB y 3 horas de audio. - Marca los extras que quieras (cada uno tiene su precio y se cobra aparte):
Casilla Qué añade tono La emoción dominante de la grabación, con su confianza y las otras candidatas. perfil del hablante Rango de edad y género estimados a partir de la voz. quién habla y cuándo Los turnos de palabra con marcas de tiempo por interlocutor. resumen de la grabación Un resumen estructurado de lo que se dijo. - Ejecutar. El fichero se sube una sola vez aunque marques los cuatro: el análisis se reparte por dentro sobre el audio ya subido.
El resultado se pinta siempre en este orden:
- La transcripción, y debajo el tono en una línea de prosa si lo
pediste, con el botón Descargar texto
(
transcripcion.txt) cerrando el bloque. - El resumen, si lo pediste, con Descargar resumen
(
resumen.txt). Va detrás del texto a propósito: el resumen se entiende mejor con la transcripción delante, y la transcripción es lo que siempre está. - El perfil y quién habla y cuándo, en crudo. Son datos estructurados y quien los pide los quiere enteros, no redactados.
- Descargar análisis (
analisis.json): un único fichero con todo lo que se analizó —incluido el vector completo del tono—, no uno por apartado. - La línea del cobro, que cierra la operación.
/v1/summarize, que transcribe por su cuenta y
además analiza. Por eso el audio no se transcribe dos veces, y por eso las tres casillas
de análisis siguen significando lo mismo con el resumen marcado o sin marcar.Si un análisis concreto falla, se dice: la transcripción se entrega igual y debajo aparece qué parte no se pudo hacer. No se calla ni se inventa.
Convertir texto en voz digital
Escribe o pega un texto y elige cómo quieres oírlo.
| Campo | Qué hace |
|---|---|
| Texto | Lo que hay que decir. |
| Voz | El catálogo se carga de la API al abrir la página, con el idioma delante de cada nombre. El idioma no se elige aparte: lo lleva la voz. Un selector de idioma suelto se leería como si tradujera, y esta tarjeta no traduce. |
| Velocidad | De lenta (0,8) a muy rápida (1,5). Cambia la duración del audio y, como la voz se cobra por segundo generado, también el precio: leer a 1,25 cuesta alrededor de un 20 % menos que a 1,0. |
| Formato de audio | mp3 · wav · opus · flac · pcm |
El resultado es un reproductor, la línea del cobro y
Descargar audio (voz.mp3, o la extensión que
elijas).
pcm no verás un reproductor normal sino un
botón ▶ Reproducir. El pcm es audio crudo sin cabecera: el navegador
no sabe a qué frecuencia va y no puede sonarlo por sí solo, pero el Estudio sí lo sabe y
lo descodifica. El fichero que descargues necesitará que le digas esos parámetros al
programa con que lo abras — están en Formatos.Convertir texto en voz clonada
Igual que la anterior, pero la voz la pones tú: subes una muestra y el texto se lee con ella.
| Campo | Qué hace |
|---|---|
| Texto | Lo que hay que decir. |
| Muestra de voz | Un audio de la voz a imitar, en cualquiera de los formatos de entrada. |
| Velocidad y Formato | Como en la voz digital. |
La muestra no se cobra. Se cobra el audio generado, que depende de lo largo que
sea el texto, no de lo larga que sea la muestra. Clonar tarda bastante más que la voz
digital: la tarjeta lo avisa mientras trabaja. La descarga sale como
voz-clonada.mp3.
Traducir una grabación
La cadena entera en un paso: transcribe el audio, traduce el texto y lo vuelve a decir en el idioma destino.
| Campo | Qué hace |
|---|---|
| Fichero | La grabación de origen. El idioma de partida se detecta solo. |
| Idioma destino | Solo aparecen los idiomas que tienen voz. Se traduce a muchos más, pero aquí hay que poder decirlo en voz alta. |
| Voz | Del catálogo estándar. Se ajusta sola al idioma destino al cambiarlo: una voz castellana leyendo la traducción inglesa suena a extranjero leyendo en voz alta. |
| Velocidad | Como en la voz digital, y con el mismo efecto en el precio. |
| Texto y audio / solo texto | Si no necesitas oírlo, solo texto se salta la síntesis y cuesta menos. |
| Formato de audio | Los mismos cinco de la voz digital. |
El resultado enseña el original transcrito y la traducción, y debajo el
reproductor con Descargar audio
(traduccion.mp3) si pediste audio. Si alguna parte de la cadena tuvo algo que
advertir, aparece como aviso en vez de perderse.
Lo que cuesta, antes y después
El Estudio es también donde se aprende lo que valen las cosas, así que dice el precio dos veces: una estimación antes y el cargo real después.
Antes. En cuanto eliges un fichero, el navegador lee su duración y la multiplica
por el precio de lo que has marcado. Marcar o desmarcar una casilla vuelve a calcularlo
sin tener que elegir el fichero otra vez. Dice coste aproximado porque lo es: la
duración que mide un navegador sobre un mp3 de tasa variable no siempre es
exacta, y quien factura es el motor.
Las dos tarjetas de voz no llevan estimación previa, y no es un olvido: se cobran por los segundos de audio generado, y cuánto audio saldrá de un texto no se sabe hasta generarlo.
Después. Al terminar aparece una línea con el tiempo que tardó en procesarse y lo consumido; un segundo más tarde se sustituye por el cargo real, tal y como lo apuntó el sistema de facturación:
29 s · Cobrado: 144 créditos · por 2.424,0 s de audio ·
transcripción 79 · tono 12 · perfil 8 · interlocutores 24 · resumen 21
| Lo que ves | Qué es |
|---|---|
29 s | Tiempo de proceso, no duración del audio. Cuarenta minutos de grabación se transcriben en menos de un minuto. |
Cobrado: 144 créditos | Lo que se te ha cargado de verdad. Si esto no llegase por lo que sea, se queda la estimación en su lugar. |
por 2.424,0 s de audio | La duración exacta que midió el motor, que es la cifra sobre la que se factura. |
| El desglose | Aparece cuando hubo más de un trabajo, para ver a dónde se fue cada crédito. |
servido de caché (10 % del precio) | Habías pedido exactamente lo mismo hace poco y no hubo que volver a generarlo. |
Los precios que usa esta pantalla son los mismos coeficientes publicados en esta documentación, leídos en vivo: si cambian, cambian aquí a la vez.
Cuando algo va mal
Los mensajes del Estudio son los errores de la API en castellano llano:
| Lo que dice | Qué ha pasado |
|---|---|
| Tu sesión ha caducado. Recarga la página. | El permiso temporal se agotó. Recargar basta; no se pierde nada. |
| Te has quedado sin créditos este periodo. | Se renuevan al empezar tu siguiente ciclo de facturación, o puedes cambiar de plan. |
| Tu plan no incluye este servicio. | Igual que las tarjetas apagadas, pero visto desde el servidor. |
| El fichero es demasiado grande. | Por encima de 400 MB o de 3 horas. |
| El servicio ha rechazado el fichero. | El audio no se puede descodificar: suele ser un fichero incompleto o con la extensión cambiada a mano. |
| Demasiadas peticiones a la vez. | Has lanzado varias tarjetas en paralelo. Espera unos segundos. |
Y si lo que quieres es que todo esto ocurra solo, sin que nadie suba ficheros a mano, eso es la otra puerta: Integrar Uttera en tu código.