UtteraUttera

Whisper no se calla ante el silencio, y te va a costar dinero

15 de septiembre de 2026

Antes de nada: qué es Whisper

Whisper es el modelo de reconocimiento de voz de OpenAI, publicado en 2022 con licencia abierta, y es el que está por debajo de casi todo lo que transcribe hoy en día. Es el modelo por defecto del propio servicio de transcripción de OpenAI —el whisper-1 que aparece en su API— y es también lo que usa la inmensa mayoría de proyectos que se montan uno por su cuenta, porque los pesos están publicados y funciona muy bien en unos noventa y nueve idiomas.

Nosotros lo usamos también. Así que lo que viene a continuación no es un defecto de un competidor: es una propiedad del modelo que hay debajo de tu transcripción, la pidas donde la pidas.

Se entrenó con unas 680.000 horas de audio recogido de internet, y ahí está la clave de todo lo que sigue.

El síntoma

Mándale a Whisper una grabación de tres segundos de silencio y espera una cadena vacía.

No la vas a recibir. Vas a recibir algo como esto:

Gracias por ver el vídeo.

O «Subtítulos realizados por la comunidad de Amara.org». O «¡Suscríbete al canal!». La frase concreta varía con el idioma y con la versión del modelo, pero la familia siempre es la misma: frases de cierre de vídeo de YouTube.

Por qué pasa

De esas 680.000 horas, una parte enorme son vídeos. Los vídeos terminan con música, con logo, con silencio — y con subtítulos que dicen «gracias por ver el vídeo».

El modelo aprendió, correctamente para sus datos, que después de un tramo sin habla lo que suele venir es esa frase. No está fallando: está haciendo exactamente lo que se le enseñó. El problema es que se lo enseñaron con YouTube y tú le estás dando el buzón de voz de una centralita.

No es un fallo que se arregle con una versión nueva ni cambiando de proveedor: es una propiedad del modelo, y la tiene cualquiera que lo use, nosotros incluidos.

Lo que te cuesta

Lo barato: pagas por ello. Facturas unos segundos de transcripción de algo que no tenía nada que transcribir. Molesto, pero calderilla.

Lo caro: tu sistema se lo cree. Ahí es donde duele. Si esa transcripción entra en una automatización —un resumen, una nota de CRM, un aviso, un agente con permisos—, acabas con una llamada registrada cuyo contenido es «Gracias por ver el vídeo». Nadie dijo eso. Nadie lo dirá nunca. Y sin embargo está en tu base de datos, y alguien lo va a leer dentro de seis meses intentando entender qué pasó en esa llamada.

En un archivo de llamadas de una centralita, las grabaciones vacías no son un caso raro: son las llamadas colgadas antes de descolgar, los buzones que nadie dejó, las líneas que se cortaron. Pueden ser un porcentaje incómodo del total.

Cómo se evita

La defensa es tonta de simple: no mandes lo que no tiene audio.

Los AGI de Asterisk que publicamos descartan las grabaciones por debajo de 2.000 bytes antes de enviarlas. Es un umbral burdo y funciona muy bien, porque un fichero de audio telefónico con habla de verdad nunca es tan pequeño.

Si trabajas con ficheros, la versión de andar por casa:

# Descarta lo que pese menos de 2 KB antes de mandarlo
[ "$(stat -c%s "$f")" -lt 2000 ] && continue

Y si quieres hilar más fino, detección de silencio con sox o con el filtro silencedetect de ffmpeg antes de subir. Ahí ya estás decidiendo cuánto silencio es «vacío», que es una decisión de tu negocio y no del modelo.

La regla general

Esta trampa es un caso particular de algo que conviene tener grabado a fuego cuando se automatiza con transcripciones:

Lo que devuelve una transcripción es texto no fiable. Viene de un audio que no controlas, y el modelo puede haberlo inventado — por una alucinación como esta, o porque alguien dijo a propósito algo con forma de orden.

Trátalo como dato, nunca como instrucciones. No lo ejecutes, no lo interpretes como órdenes y valídalo antes de actuar sobre él. Y lo que un interlocutor afirma en una grabación no es un hecho probado, aunque aparezca en el resumen.

Es el mismo aviso que llevamos en el pie de nuestra propia web. No está ahí de adorno.

¿Algo que añadir o que corregir? Escríbenos a support@uttera.ai. Si nos corriges, editamos la entrada y te damos crédito.

← Todas las entradas