Cuando las entrevistas cambian de idioma
· Zeyu Si
En esta página
La investigación transfronteriza produce muchas grabaciones como esta: el entrevistado habla español, quien hace las preguntas habla chino y un intérprete se sienta entre ambos. La conversación va y viene entre dos idiomas.
Pensábamos que sería sencillo. Leímos la documentación de cada motor, hicimos una ronda de pruebas de laboratorio y llegamos a unas conclusiones. Luego probamos una grabación real y las conclusiones se invirtieron.
Dos tipos de mezcla, resultados muy distintos
Primero hay que separar dos situaciones:
- El inciso ocasional: un idioma principal, con alguna palabra o frase suelta en otro, menos de una décima parte de la grabación.
- Turnos alternos: por ejemplo, la interpretación consecutiva, en la que los dos idiomas se alternan y cada uno ocupa aproximadamente la mitad.
Los motores se comportan de forma muy distinta en estos dos casos. No deben meterse en el mismo saco.
Primero, una buena noticia: mezclar con inglés suele ir bien. El soporte multilingüe de casi todos los motores está construido en torno a "idioma X más inglés". Nuestro motor principal escribe una frase entera en inglés tal como se dijo, incluso en mitad del español.
Los problemas empiezan cuando ninguno de los dos idiomas es el inglés, como el español mezclado con el chino.
El mismo ajuste de "idioma" significa cuatro cosas distintas
La mayoría de los motores tienen un parámetro de idioma. Podrías suponer que hace más o menos lo mismo en todas partes. Repasamos la documentación de cada proveedor y luego probamos cada uno. Son cuatro cosas distintas:
- ElevenLabs: le dice en qué idioma está principalmente la grabación.
- Soniox: una pista hacia la que se inclinará, sin impedirle reconocer otros idiomas.
- Doubao: elige qué modelo de idioma ejecutar. Curiosamente, dejarlo en blanco es la peor opción: entonces escucha chino e inglés y fuerza el español a inglés.
- AssemblyAI: decide en qué idioma está todo el archivo y luego entrega el archivo entero al modelo de ese único idioma. De los dos idiomas que puede manejar juntos, uno tiene que ser el inglés.
Esto último tiene una consecuencia tajante. En una grabación con un 45 % de chino, AssemblyAI decidió aun así que era español (confianza 0,84). Probamos cuatro configuraciones. No salió ni un solo carácter chino.
También hubo una sorpresa en la dirección contraria. Según la documentación de Doubao, fijar el idioma en español debería bloquear todo el archivo en español. En la práctica no fue así. Siguió transcribiendo el chino intercalado.
El peor resultado es la traducción
Con el inciso ocasional, nuestro motor principal falla de una de dos maneras, según cómo lo configures. (Esto se probó con grabaciones empalmadas. La sección siguiente trata el problema de los empalmes, pero si el motor se equivoca cuando el cambio de idioma es tan evidente, una grabación real no se lo pondrá más fácil).
- Dile que el idioma principal es el español y las frases en chino simplemente desaparecen. La línea de tiempo se las salta y no deja rastro.
- No se lo digas y las frases en chino se traducen a un español fluido. "你是谁?" se convirtió en "¿Quién eres?". Ni un solo carácter chino en toda la transcripción.
Lo primero deja un hueco. Lo segundo añade español que nadie dijo. Lo segundo es peor, porque la transcripción se lee de forma impecable y quien investiga daría por hecho que el entrevistado de verdad lo dijo en español.
Otro motor, uno que usa un modelo de lenguaje grande para transcribir, se atascó en un cambio de idioma y repitió la misma palabra unas 370 veces.
El audio real desmintió los resultados de laboratorio
Para probar el caso de turnos alternos, empezamos con audio empalmado: clips existentes en español y clips en chino montados juntos. Las transcripciones de referencia venían gratis y no costaba casi nada.
Las pruebas con empalmes decían:
- Dile al motor principal que el idioma principal es el español y todo se rompe: el chino se traduce, aparece contenido inventado y la línea de tiempo se desmorona.
- Déjale averiguar el idioma por sí mismo y lo acierta todo.
Luego conseguimos una entrevista real con interpretación: 66 minutos, español y chino, con una investigadora, un intérprete y un entrevistado. Los resultados fueron exactamente los contrarios:
- Decirle que el idioma principal es el español dio una transcripción casi perfecta. Los dos idiomas cambiaron correctamente, y los tres hablantes se mantuvieron separados. Incluso el intérprete, que iba y venía entre idiomas, se reconoció correctamente como una sola persona.
- Dejándole decidir, concluyó que todo era chino (confianza 0,86), transcribió con el chino como hilo principal y perdió pasajes enteros en español.
¿Por qué? El audio empalmado tiene una costura evidente entre idiomas: la sala, el volumen y el ruido de fondo cambian a la vez, así que a un motor le resulta fácil notar el cambio. Una grabación real es una sala y un micrófono. No hay costura.
El ritmo también era distinto del de nuestros empalmes. El chino suponía el 29 %, alternando como "respuestas largas en español de uno a cuatro minutos, intervenciones cortas en chino de quince segundos a un minuto más o menos", que caía justo en el rango que nuestros empalmes no habían cubierto.
Qué sacamos en claro
Lo bien que se transcribe una entrevista en varios idiomas depende de tres cosas: qué dos idiomas, si es un inciso ocasional o turnos alternos, y cómo está configurado el motor. La documentación de los proveedores no puede responder a esas preguntas, y el audio de prueba empalmado tampoco.
Solo las grabaciones reales pueden.
Escrito por Zeyu Si