UtteraUttera

¿Qué es Whisper?

24 de septiembre de 2026

Si transcribes audio, tarde o temprano aparece la palabra «Whisper». Vale la pena saber qué es exactamente, porque probablemente ya lo estás usando aunque no lo hayas instalado tú.

Qué es, en una frase

Whisper es el modelo de reconocimiento de voz de OpenAI, publicado en 2022 con licencia abierta (MIT). Convierte audio en texto —lo que se llama speech-to-text o STT— y es el que está por debajo de casi todo lo que transcribe hoy en día.

Es el modelo por defecto del propio servicio de transcripción de OpenAI —el whisper-1 de su API— y es también lo que usa la inmensa mayoría de proyectos que se montan uno por su cuenta, porque los pesos están publicados y funciona muy bien en unos noventa y nueve idiomas.

Cómo funciona

Whisper se entrenó con unas 680.000 horas de audio recogido de internet, emparejado con su transcripción. De ahí sale casi todo lo que hace bien y lo que hace raro.

Por dentro es un modelo encoder-decoder: el encoder convierte el audio en una representación intermedia, y el decoder genera el texto palabra a palabra, igual que un modelo de lenguaje. Eso tiene una consecuencia importante: no transcribe letra a letra lo que oye, sino que predice el texto más probable dado el audio y lo que ya ha escrito. La mayoría de las veces acierta; cuando el audio es ambiguo o vacío, se inventa lo plausible.

Viene en varios tamaños —de tiny a large—: los pequeños corren en una CPU modesta pero se equivocan más; los grandes piden GPU y aciertan mucho más. Hay además reimplementaciones más rápidas, como faster-whisper, que dan el mismo resultado con menos recursos.

Cuándo te conviene montártelo tú

Como los pesos son abiertos, puedes ejecutar Whisper en tu propia máquina. Tiene sentido cuando:

Montártelo tú no es gratis en trabajo: hay que dimensionar la GPU, gestionar las colas, y mantenerlo. Para volúmenes bajos o irregulares, llamar a una API suele salir mejor.

Qué límites tiene

Whisper es bueno, pero no es magia, y conviene conocer sus trampas antes de automatizar sobre él:

En resumen

Whisper es la pieza que convirtió la transcripción de calidad en algo que cualquiera puede usar, con licencia abierta y en decenas de idiomas. Puedes llamarlo por una API o levantarlo tú mismo, y la elección depende de tu volumen y de dónde tenga que quedarse el audio.

En Uttera tienes transcripción que puedes llamar por API o montar en tu propia infraestructura, junto al resto del flujo —traducir, resumir y saber quién habla sobre la misma grabación—. Puedes ver cómo encaja en los casos de uso. Tú decides dónde vive tu audio.

¿Algo que añadir o que corregir? Escríbenos a support@uttera.ai. Si nos corriges, editamos la entrada y te damos crédito.

← Todas las entradas