Cada vez es más difícil saber si una voz la ha grabado una persona o la ha generado un modelo. La marca de agua es la respuesta técnica a esa pregunta, y conviene entender qué promete de verdad, porque es fácil venderla como algo que no es.
Una marca de agua en audio es una señal imperceptible incrustada dentro del propio sonido que permite a una máquina reconocer que ese audio se generó artificialmente. No la oyes, no cambia lo que dice la voz, y no es un aviso escrito ni un logo: vive en las muestras de sonido, por debajo del umbral de lo que percibe el oído.
La palabra clave es imperceptible. No estropea el audio y no se puede quitar subiendo el volumen o cortando un trozo. Está tejida en la señal, no pegada encima.
La tentación es marcar el fichero: meter una etiqueta en las cabeceras del mp3 que diga «generado por IA». Eso es un metadato, y el problema es que se cae solo. Reconviertes el audio a otro formato, lo subes a una red social que lo recomprime, lo pasas por un editor —y la etiqueta desaparece sin dejar rastro—. El sonido sigue ahí; la procedencia, no.
La marca de agua resuelve justo eso. Como va dentro de las muestras y no en la envoltura del fichero, sobrevive a que recomprimas el audio, lo cambies de formato o le recortes el principio. Viaja con el sonido, no con el envase. Esa es toda la diferencia, y es la razón de que exista una técnica aparte en vez de conformarse con una etiqueta.
Saber de dónde viene un audio ha pasado de ser una curiosidad a ser un requisito. El Reglamento europeo de IA obliga desde 2026 a marcar el contenido sintético de forma que una máquina pueda detectarlo, precisamente porque la vía humana —«se nota que es falso»— ya no funciona.
Pero más allá de la ley, la procedencia es lo que te deja separar dos casos que hoy se confunden: un audio real que alguien afirma que es sintético, y un audio sintético que alguien hace pasar por real. Sin una marca comprobable, esa discusión es tu palabra contra la suya. Con ella, hay algo que mirar.
Aquí está el matiz que casi nadie cuenta bien. Una marca de agua puede llevar, además de la señal de «esto es sintético», un pequeño mensaje: una firma. Y con la firma la gente espera demasiado.
La herramienta que usamos para marcar es pública y libre. Eso significa que cualquiera puede producir una marca igual de válida con el mismo software. Así que la sola presencia de una marca —incluso con una firma— no prueba quién generó el audio. Decir lo contrario sería venderte una garantía que no existe.
Lo que sí se puede probar es lo contrario, y esa es la parte útil. Nosotros incrustamos en la marca una firma fija, las letras UT, en todo el audio que sale de Uttera, sin forma de desactivarla: un servidor nuestro que no supiera marcar, sencillamente no arrancaría. De ahí sale una conclusión firme en un solo sentido:
Si un audio no lleva la firma UT, no lo generamos nosotros.
Y eso se usa a diario. Si alguien te atribuye una grabación que no reconoces, la ausencia de la firma la descarta. Si alguien hace pasar por salida de Uttera una voz que no pediste, la ausencia de la firma lo desmiente.
Es un escudo, no una medalla. Su valor no está en decir «esto es nuestro» —eso no lo puede garantizar ninguna marca pública—, sino en poder decir con seguridad «esto no es nuestro». Preferimos contarlo así a vender la versión bonita.
Conviene ser claro, porque la confusión aquí sale cara:
Una marca de agua es una señal escondida en el sonido que sobrevive al viaje del fichero y permite a una máquina reconocer audio generado. No prueba autoría por sí sola, pero una firma fija sí permite descartar con certeza lo que no es tuyo, que suele ser lo que de verdad protege. Si quieres verlo funcionar —subir un audio o un informe y que te diga qué lleva dentro—, está en uttera.ai/verificar.
¿Algo que añadir o que corregir? Escríbenos a support@uttera.ai. Si nos corriges, editamos la entrada y te damos crédito.