Si has visto una transcripción con S0 y S1 delante de cada frase y te has preguntado de dónde salen esas etiquetas, la respuesta es la diarización. Merece la pena entenderla antes de montar nada encima, porque promete menos de lo que la gente cree.
La diarización de audio es el proceso de partir una grabación en tramos y decidir cuántas voces distintas hay y en qué momento habla cada una. Su nombre técnico completo es speaker diarization, y la pregunta que responde es exactamente esa: quién habla, cuándo. Ni una palabra más.
Lo que recibes es algo así:
S0 — Buenos días, le llamo por el pedido 4471. S1 — Un momento que lo miro. S0 — Sin prisa.
S0 y S1 no son nombres. Son etiquetas de hablante, locales a esa grabación. Ahí está la confusión que conviene aclarar de entrada.
La diarización no entiende lo que se dice; trabaja con el sonido. El proceso, a grandes rasgos, tiene tres pasos:
Por eso es un problema de agrupación acústica, no de reconocimiento. El sistema no compara tu voz contra ninguna base de datos: solo mira cuáles de los tramos de esta grabación se parecen entre sí. A menudo la diarización se combina con la transcripción, y así cada frase transcrita queda asignada a su etiqueta.
Casi siempre que tengas más de una persona en la misma pista y quieras algo más que un bloque de texto:
Si tu audio es de una sola persona —un dictado, un buzón, una nota de voz—, no necesitas diarización para nada. Ahí solo estorba.
Esto es lo que la diarización no hace, y conviene tenerlo claro antes de prometérselo a nadie:
S0 del martes no tiene por qué ser el S0 del miércoles. Son locales a cada fichero.Y hay una frontera que conviene no cruzar: identificar a una persona por su voz es tratamiento de datos biométricos, que el RGPD mete en categorías especiales y que exige un régimen completamente distinto. La diarización no es eso, y casi nadie que la pide necesita de verdad llegar tan lejos.
La diarización te da el reparto de turnos de una conversación: cuántas voces y cuándo habla cada una. Es una herramienta muy útil cuando la usas por lo que es, y una decepción cara cuando esperas que te diga quiénes son.
En Uttera la tienes junto al resto del flujo de audio —transcribir, traducir, resumir y saber quién habla, sobre la misma grabación—, y puedes ver cómo encaja en los casos de uso. Las etiquetas las pone la máquina; los nombres, el contexto que tú ya tienes.
¿Algo que añadir o que corregir? Escríbenos a support@uttera.ai. Si nos corriges, editamos la entrada y te damos crédito.