Ir al contenido principal

El WER miente. Así medimos la precisión en entrevistas reales

· Zeyu Si

En esta página

Una vez probamos una entrevista sobre libros de un magacín matinal de la televisión sueca. La transcribieron cuatro motores de voz. Según el WER, la métrica que usa casi todo el mundo, sus tasas de error quedaron entre el 194 % y el 216 %. Más errores que palabras.

Luego leímos las cuatro transcripciones línea por línea. Eran las más completas de todo el lote. Títulos de libros, nombres, detalles de la trama, todo correcto. Incluso captaron cosas que la transcripción de referencia había omitido.

El problema era la referencia.

Esta entrada trata dos cosas: por qué el WER falla con las entrevistas y a qué nos pasamos. Es el método que usamos para elegir motores para nuestros 27 idiomas.

Cinco maneras en que el WER te engaña con el audio de entrevistas

Nos topamos con los mismos pocos problemas en más de 20 idiomas. Cada uno produce un número que parece preciso y dice lo que no es.

1. La referencia ya viene recortada. La mayoría de nuestras referencias salen de subtítulos para personas sordas y con discapacidad auditiva de películas y televisión. Los subtítulos tienen que poder leerse deprisa, así que comprimen habitualmente lo que la gente dice de verdad. Cuanto más fielmente transcribe un motor, más discrepa del subtítulo y más se le penaliza. Eso fue lo que pasó con la entrevista sueca. En una escena de una película española en la que todos se gritan unos encima de otros, todos los motores obtuvieron entre un 63 % y un 80 % de WER. Leídos línea por línea, todos habían transmitido el significado.

2. La lengua escrita y la lengua hablada no son lo mismo. El árabe escrito y el árabe que la gente habla a diario pueden estar muy alejados. Puntuamos el mismo motor contra una referencia escrita en árabe estándar moderno y obtuvimos un 49 %. Contra una referencia que recogía fielmente el dialecto, un 16 %. El motor no había cambiado. La referencia sí.

El tamil es más extremo. Por convención, los subtítulos se escriben en el registro literario, mientras que la gente habla el coloquial. Usa los subtítulos como referencia y gana el motor que "reescribe" el habla en tamil literario. El motor que transcribe fielmente queda el último. La clasificación se invierte.

3. El chino y el japonés no ponen espacios entre palabras. Si separas por espacios, una frase entera en chino se convierte en una sola "palabra". La tasa de error puede salir por encima del 1000 %. Ese número no significa nada.

4. La ortografía difiere, el significado no. El griego y el árabe suelen puntuar alto. Mira con atención y muchos de los "errores" son flexión y convenciones ortográficas, como si se escribió o no un pequeño signo árabe llamado hamza. Ningún lector malinterpretaría la frase. La métrica lo cuenta igualmente.

5. Así que el WER es una prueba de humo, nada más. Te dice si un motor se ha venido abajo por completo: pasajes enteros que faltan, pantallas de galimatías. Para decidir cuál de dos motores que funcionan es más preciso, ya no lo miramos.

Las referencias deben ser conversación real

Las entrevistas reales tienen pausas, muletillas, interrupciones y gente hablando a la vez. Prueba con presentadores de informativos o con audio leído en voz alta y todos los motores parecen estupendos. Las entrevistas son otra historia.

Así que nuestros clips de prueba son solo habla espontánea. Las escenas de cine van primero: tienen subtítulos para personas sordas y con discapacidad auditiva que siguen de cerca el diálogo, y están disponibles. Cuando no encontramos una película adecuada, recurrimos por orden a series de televisión y documentales, grabaciones parlamentarias o judiciales, y luego pódcasts con transcripciones literales.

Hay tres niveles de dificultad, cada uno construido sobre el anterior:

  • Básico: una o dos personas, ritmo pausado, sin ruido de fondo, acento estándar, pero conversación real al fin y al cabo. Este nivel por sí solo elimina a unos cuantos motores flojos.
  • Más difícil: el básico más una o dos complicaciones, como habla más rápida, un grupo pequeño, turnos más rápidos, algo de ruido de fondo o un acento.
  • Extremo: voces solapadas, ruido intenso o música, dialecto marcado, audio de mala calidad, todo a la vez.

Cuando un idioma tiene mucha variación regional, cada región tiene sus propios clips. Español de España, México y Argentina. Árabe del Golfo, Egipto y el Levante.

Revisa la referencia antes de revisar el motor

Este es el paso que la gente se salta. Lo añadimos después de que nos saliera caro. Antes de usar una referencia para puntuar nada, confirmamos que la propia referencia es correcta.

En una auditoría descartamos muchos clips que parecían estar bien:

  • Un programa etiquetado como tagalo estaba en realidad en cebuano, otro idioma filipino.
  • Un clip en tailandés tenía los subtítulos desfasados unos 30 segundos respecto al audio.
  • Una entrevista en cantonés resultó estar en coreano. El invitado era coreano y los subtítulos en cantonés eran una traducción. Todos los motores obtuvieron cerca del 100 % de error con ella.

Cada uno de estos habría producido una puntuación de apariencia precisa y sin sentido. Peor aún, algunas conclusiones anteriores se habían construido sobre clips como estos.

Hay tres idiomas para los que todavía no encontramos una referencia utilizable: tamil, bengalí y filipino. Aún no los admitimos. Preferimos no ofrecer un idioma a publicar un número que no podemos respaldar.

Contar los errores que cambian el significado

Quien investiga lee las transcripciones de entrevistas por su significado. Escribir "em" como "eh" no importa. Escribir "no lo hizo" como "lo hizo" sí. Así que para cada motor contamos los errores de línea roja, en seis categorías:

  1. Frases inventadas: aparece una frase que nadie dijo. Un motor con una tasa de error perfectamente respetable produjo, en un clip con un acento marcado, una frase completa que terminaba en "compra unos plátanos". Nadie dijo nada parecido. No usamos ese motor.
  2. Negación invertida: "no" se convierte en "sí" o al revés. Se lee perfectamente y significa lo contrario. Nuestra próxima entrada trata de esto.
  3. Bucles: la misma palabra repetida decenas o cientos de veces.
  4. Contenido insertado: material añadido que no estaba en el audio.
  5. Pasajes perdidos: un tramo de habla que falta por completo. En una escena de cine con dialecto marcado y una multitud ruidosa, un motor perdió los primeros 54 segundos.
  6. Deriva de idioma: cambiar de idioma a mitad de camino. Un motor convirtió largos pasajes en español en portugués. "Soy abogado" se convirtió en "Sou advogado".

Todos los motores se miden con la misma vara. Las diferencias en cómo se escriben los nombres, o en si un número se escribe "6" o "seis", no cuentan como líneas rojas.

Quien lee transcripciones también pasa cosas por alto, así que además ejecutamos dos comprobaciones automáticas:

  • Proporción de salida: el número de palabras que produjo un motor dividido por el número de la referencia. Muy por debajo de 1 suele significar que se perdieron pasajes grandes; hemos visto 0,1. Muy por encima de 1 con muchas palabras repetidas suele significar bucles; hemos visto 1,8.
  • Repeticiones: con qué frecuencia se repite la misma palabra en un tramo corto.

Ninguna de las dos depende del formato de audio ni de la dificultad del clip, así que se pueden comparar entre idiomas. El WER no.

Reglas para no engañarnos a nosotros mismos

Cada una de ellas salió de un error.

Cuando varios motores coinciden y solo la referencia discrepa, sospecha primero de la referencia. Nos equivocamos dos veces con esto en turco. Registramos habla real como "alucinación" cuando los subtítulos simplemente habían omitido esa frase.

Cuando varios motores cometen el mismo error en el mismo sitio, no se lo atribuyas a uno de ellos. Normalmente el audio es de verdad poco claro ahí y cualquiera se equivocaría. Contárselo a un solo motor es injusto con ese motor, y te lleva a elegir el equivocado.

No te fíes de los clips cortos. Ejecuta siempre la grabación completa. Un enfoque que examinamos obtuvo un 99,8 % en identificación de hablantes en un clip de 10 minutos. Ejecutado sobre la grabación completa, bajó al 63,9 %.

Ejecuta cada configuración al menos dos veces. La misma entrada no siempre da la misma salida. Una vez, un motor repitió un solo "em" 99 veces y se tragó las tres frases siguientes. Si lo ejecutas una sola vez, no puedes saber si es lo habitual o una casualidad.

Dónde se queda corto este método

La mayoría de nuestros clips de prueba salen del cine y la televisión, no de entrevistas de investigación. El diálogo de cine está guionizado y grabado con cuidado. Una sola grabadora sobre la mesa de una sala de reuniones es otra cosa. Así que lo que estos resultados te dicen es cómo fallan los motores con conversación real, no lo precisa que será tu entrevista en concreto.

Por eso tampoco publicamos una única cifra destacada de precisión de transcripción. Lo que sí podemos compartir es cómo probamos, qué encontramos y qué seguimos sin saber.

Próximamente: la más peligrosa de las seis líneas rojas, cuando el significado se invierte y la frase se sigue leyendo perfectamente.

Escrito por Zeyu Si