Ir al contenido principal

¿Quién dijo eso? Atribuir hablantes cuando habla mucha gente

· Zeyu Si

En esta página

Una conversación de siete personas, de 37 minutos. Le dimos la grabación completa a ElevenLabs y le pedimos que etiquetara quién decía cada frase.

Encontró nueve personas.

El problema mayor era que las etiquetas de la gente no dejaban de cambiar. Un hablante fue etiquetado como A del minuto 8 al minuto 18, pasó a ser B justo después del 18:30, volvió a ser A hacia el minuto 30 y se convirtió de nuevo en B en el 32:47. Entre los siete hablantes, las identidades cambiaron 16 veces. Medido por palabras, solo el 68,6 % de la transcripción se atribuyó a la persona correcta.

Para la investigación con entrevistas eso es peor que unas cuantas palabras mal oídas. No puedes fiarte de quién dijo nada.

Con más personas, las etiquetas de hablante integradas se desvían

Esa grabación procede de AISHELL-4, un conjunto de datos público de grabaciones de reuniones en chino, cada una con cinco a siete personas alrededor de una mesa. Probamos repetidamente con él el etiquetado de hablantes integrado de ElevenLabs:

  • En clips de 10 a 15 minutos, según la configuración, entre el 67,5 % y el 97,8 % del contenido se atribuyó correctamente, y la identidad de una persona llegó a cambiar hasta 12 veces.
  • Más personas lo empeoraban. En clips de siete personas, incluso diciéndole que había siete hablantes, solo alcanzó entre el 77 % y el 82 %.
  • No era capaz de contar a las personas de forma fiable. Cuando lo dejamos averiguarlo solo, acertó el número 4 veces de 12, y en todos los fallos faltaba una persona: los uno o dos hablantes más callados se fundían con otro.

Ejecutar la misma configuración dos veces podía dar resultados muy distintos. Un clip obtuvo un 81,9 % en una ejecución y un 93,8 % en la siguiente.

Los clips cortos maquillan los resultados

Esos números esconden una trampa propia: cuanto más corto es el clip, mejor parece.

En la misma sala de reuniones, los clips de 15 minutos obtuvieron entre el 78 % y el 93 %. La grabación completa de 37 minutos cayó al 68,6 %, de 10 a 25 puntos menos, y el fallo pasó de "falta una persona" a "personas de más e identidades que se intercambian una y otra vez".

Hemos visto lo mismo en otros sitios. Un enfoque de código abierto obtuvo un 99,8 % en identificación de hablantes en un clip de 10 minutos. Ejecutado sobre la grabación completa, cayó al 63,9 %.

Así que ahora solo juzgamos con grabaciones completas.

El método de puntuación también puede engañar

Hay otra trampa en la propia vara de medir.

Las transcripciones de referencia humanas suelen poner marcas de tiempo redondeadas al segundo, y por convención varias líneas pueden compartir el mismo segundo (una persona termina y otra entra directamente). En una referencia que usamos, el 55 % de las líneas compartía marca de tiempo con una línea vecina.

Si puntúas por la línea de tiempo, un desfase de un segundo cuenta como una frase entera atribuida a la persona equivocada. La misma salida obtuvo un 81 % por línea de tiempo y un 99,7 % por alineación de texto.

Algunos hallazgos contraintuitivos

  • Admitir más hablantes no encuentra más hablantes. Lo probamos con un sistema de código abierto: dale margen para una persona más y, en lugar de encontrar un tercer hablante, parte en dos a la persona que más habla.
  • Un modelo distinto no es necesariamente distinto. Cinco modelos de voz del mismo desarrollador produjeron una salida idéntica palabra por palabra. Solo un modelo de otro desarrollador cambió algo.
  • La configuración por defecto borra los "mm" y los "ajá". Las señales de asentimiento de menos de medio segundo se desechaban como ruido. Cuando dejamos de hacerlo, se detectaron más cambios de hablante, y con más precisión.

Nuestro enfoque: aprender antes cada voz y luego atribuir frase por frase

Lo que acabamos teniendo consta de tres pasos:

  1. Una "tarjeta de voz" para cada persona: de 10 a 30 segundos de habla limpia de esa persona, como una ronda de presentaciones al principio. Por debajo de 10 segundos empeora notablemente; por encima de 30 segundos deja de mejorar.
  2. Atribuir cada frase: ElevenLabs solo transcribe y divide las frases. Quién dijo cada una se decide comparando la voz de esa frase con cada tarjeta, no con las propias etiquetas de hablante de ElevenLabs. Esas etiquetas no son coherentes a lo largo del tiempo: atribuir por etiqueta solo llegó al 71,5 %.
  3. Ordenar por confianza: las atribuciones seguras se hacen directamente; las dudosas se marcan para que una persona las confirme. En dos reuniones de prueba, el grupo seguro cubrió 564 segmentos sin un solo error.

Los "sí" y los "mm" muy cortos no tienen suficiente voz para identificarse por sí solos, así que toman la identidad de las frases más largas de la misma persona que los rodean.

Resultados: por encima del 99 % en datos públicos de reuniones, sin desviaciones

Dos reuniones completas de AISHELL-4:

Integrado de ElevenLabs Nuestro enfoque
5 personas, 36 minutos 97,28 % 99,76 %
7 personas, 37 minutos 68,6 % (16 cambios de identidad) 99,32 %

Ambas acertaron el número de personas y tuvieron cero cambios de identidad.

También probamos seis clips de 10 a 15 minutos y un debate público de cinco personas (99,75 %). Los nueve superaron el 97 %.

Casi todos los errores restantes son un "sí", un "vale" o un "de acuerdo" de menos de un segundo.

El límite: gente hablando a la vez

Eso son datos públicos. Los grupos focales reales han sido más difíciles.

  • Una conversación abierta de cinco personas: la moderadora plantea un tema y cuatro participantes intervienen libremente. Las cinco son mujeres, y alrededor de una quinta parte del tiempo de conversación hay gente hablando a la vez. Las atribuciones seguras acertaron alrededor del 97 %, pero entre el 30 y el 40 % de los segmentos solo pudieron marcarse como dudosos.
  • Un grupo focal de ocho personas grabado con calidad telefónica: una vez que cada participante tuvo una tarjeta de voz como es debido, las atribuciones seguras acertaron el 98,1 %, pero el material dudoso seguía suponiendo el 17,5 % del texto. Nuestro propio listón es "atribuciones seguras por encima del 99 %, material dudoso como máximo del 5 %". Este no lo superó.

Volver a escuchar los errores dejó una cosa clara: cuando varias personas hablan a la vez, el oído humano tampoco puede separarlas. Los tomadores de notas profesionales presentes en la sala se apoyan en el vídeo.

Así que nuestro compromiso en la atribución de hablantes cubre las conversaciones de varias personas en las que se respetan los turnos: una persona habla y las demás escuchan. Dentro de eso, mantenemos la identidad de cada persona coherente de principio a fin. La gente hablando a la vez queda fuera.

Escrito por Zeyu Si