Si has visto «STT» o «speech-to-text» y no tienes claro qué es, la idea es sencilla: es la tecnología que convierte lo que alguien dice en texto que puedes leer, buscar y guardar. Vale la pena entender qué hace y en qué fijarte antes de elegir una.
La transcripción automática —speech-to-text, STT— convierte audio hablado en texto escrito. Le das una grabación o un flujo de voz en directo y te devuelve las palabras escritas. Es lo que hay detrás de los subtítulos de un vídeo, del dictado en el móvil, de las notas de una reunión o de una centralita que registra sus llamadas.
No es lo mismo que síntesis de voz —eso es el camino contrario, de texto a audio— ni un modelo de lenguaje que entiende qué significa lo dicho. El STT hace una cosa: poner por escrito, con fidelidad, lo que se ha dicho.
Pasar de sonido a palabras no es tan directo como parece. A grandes rasgos, el sistema:
Los sistemas modernos hacen todo esto con redes entrenadas con miles de horas de voz real, en muchos idiomas y acentos. Por eso hoy una transcripción puede acercarse mucho a lo que escribiría una persona —aunque, como veremos, no siempre—.
Cuatro cosas, y ninguna es el logo del proveedor.
Precisión. Se suele medir por la tasa de error de palabra: cuántas se equivoca de cada cien. Pero el número de portada se saca con audio de laboratorio. Lo que importa es cómo se porta con tu audio: acentos reales, ruido de fondo, gente que se pisa al hablar, jerga y nombres propios de tu sector.
Idiomas. Comprueba que cubre los idiomas que necesitas, y con qué calidad cada uno —no todos rinden igual—. Y si tu audio mezcla idiomas en la misma frase, pruébalo así, porque ahí es donde muchos sistemas se rompen.
Latencia. ¿Necesitas el texto en directo, según se habla, o vale con procesar la grabación después? El directo es más exigente y suele salir a costa de algo de precisión. Elige según tu caso; pagar por tiempo real que no usas es tirar dinero.
Coste. El modelo de cobro importa tanto como el número: por minuto de audio, por segundo o por petición cambian mucho la factura según cómo trocees el trabajo. Estima tus minutos reales al mes —salen de tus informes de llamadas o de tu calendario, no de una adivinanza— y multiplícalos por el modelo de cada candidato.
Ninguna transcripción es perfecta. Con audio malo —micrófono lejano, mucho ruido, varias voces solapadas— cualquier sistema falla, y conviene saberlo antes de montar algo encima que dé por buena cada palabra. Un sistema honesto marca su nivel de confianza en lugar de disimular. Y ojo con un detalle: algunos modelos, cuando no entienden un tramo, se inventan texto plausible en vez de callar. Un fragmento inventado con buena gramática es más peligroso que un hueco, porque no se nota. Sepáralo del que reconoce el habla de verdad.
Uttera transcribe, y también el camino de vuelta y lo de alrededor: pone voz a un texto, traduce, resume, separa quién habla, puntúa pronunciación y genera efectos de sonido y música. Si tu código ya habla con la API de OpenAI para transcribir, no tienes que reescribirlo: hablamos el mismo dialecto —mismas rutas, mismos parámetros—, así que cambiar de proveedor es cuestión de la URL base y la clave. Tienes las capacidades, con ejemplos que se ejecutan contra la API real, en cómo se usa.
El STT convierte voz en texto, y hoy lo hace lo bastante bien como para construir cosas serias encima. Pero elige mirando tu audio real, no una cifra de laboratorio, y desconfía del sistema que nunca duda: el que admite lo que no entiende te ahorra el error que no verías venir.
¿Algo que añadir o que corregir? Escríbenos a support@uttera.ai. Si nos corriges, editamos la entrada y te damos crédito.