Ir al contenido principal

Parte de la serie: 27 idiomas, uno a uno

Turco: cómo una actualización de modelo rompió un historial limpio

· Zeyu Si

En esta página

En turco, AssemblyAI empezó con un historial limpio: cuatro clips y ni una sola frase en la que invirtiera el significado. Luego su fabricante lanzó una nueva generación del modelo y nos pasamos a ella brevemente. Los cuatro clips en turco empeoraron, algunos casi con el doble de tasa de error, y convirtió la orden indirin ("bájalo") en indirmez ("no lo bajará"). Ahí se acabó el historial limpio. Volvimos al modelo anterior.

El mismo motor, otra versión, y puede que la conclusión ya no se sostenga. Ese es el telón de fondo de cómo está configurado el turco.

Los clips de prueba

Cuatro escenas de cine turco de aproximadamente un minuto y medio cada una, puntuadas contra subtítulos en turco para personas sordas y con discapacidad auditiva:

  • Vizontele (2001): el alcalde de un pueblo recibe a unos visitantes, con réplicas rápidas, interrupciones y gritos.
  • Düğün Dernek (2013): un camello ha perdido a la novia; cuatro o más personas hablan a la vez, murmurando y soltando palabrotas.
  • G.O.R.A. (2004): el embarque en una nave espacial en una comedia de ciencia ficción, con órdenes que se amontonan sobre efectos de sonido y música densos.
  • Bergen (2022): una madre biológica se presenta para un enfrentamiento; intercambios rápidos y emotivos en dialecto de Adana, con palabrotas.

Los dos primeros son de nivel máximo en nuestra escala de dificultad de tres niveles y los otros dos de nivel medio. No hay ningún clip fácil.

Motores que probamos

Cuatro en la primera ronda: ElevenLabs Scribe v2, AssemblyAI, Speechmatics y Doubao. Soniox se evaluó en una revisión posterior. Gemini se probó por separado.

Dónde cruzaron líneas rojas los motores

Frases inventadas. Speechmatics produjo dos o tres en Vizontele. Hiç lüzüm yok ("no hace falta") se convirtió en İç sesim yok ("no tengo voz interior"), y añadió gazeteye getirip ("llevarlo al periódico") a una frase que no dice eso.

Una negación añadida. El mismo motor, el mismo clip: Fikri benim adım ("me llamo Fikri") volvió con un yok ("no") al final.

Finales perdidos. En dos clips difíciles la transcripción de Gemini está bien hasta el último tramo, y entonces faltan de 20 a 25 palabras, cuatro frases enteras en un caso. Quedó segundo por WER en ambos, así que la puntuación no da ninguna pista.

Deriva de idioma. Las primeras ejecuciones de Doubao en turco volvieron como galimatías en inglés, por ejemplo "I'm shaking these diseases". No habíamos enviado un código de idioma turco. Con tr-TR configurado, los cuatro clips volvieron como turco coherente.

AssemblyAI (con el modelo anterior) y Doubao no tuvieron frases inventadas ni inversiones en los cuatro clips.

Qué elegimos

Principal: ElevenLabs Scribe v2. Primero en todos los clips salvo G.O.R.A., donde los efectos de sonido igualan a todos.

Referencias, por orden: AssemblyAI, Doubao, Gemini. Las tres se ejecutan sobre cada archivo en turco.

  • AssemblyAI: el motor más preciso después del principal, sin frases inventadas ni inversiones. Sí oye mal nombres, por ejemplo Belgin como belli ("obvio"), pero las demás pistas pueden detectar ese tipo de error.
  • Doubao: último por WER en todos los clips, hasta caer al 28,6 % en la escena en dialecto. Casi todos sus errores son de ortografía. Escribe la pronunciación dialectal tal como la oye, así que pabuç se convierte en pafuç. Pero nunca inventó ni invirtió nada. Para una pista de referencia nos importaba más si un motor escribe cosas equivocadas con aplomo que el puesto en que queda.
  • Gemini: funciona como tercera referencia.

A Soniox le fue bien en la revisión: ningún error de línea roja de ningún tipo, y segundo entre los motores que no son el principal. No lo pusimos en lugar de otro, porque AssemblyAI ya es el motor no principal más fuerte y el cambio no tenía nada que ganar. Es el primero en la lista de reserva y entraría si Doubao empezara a lastrar los resultados en producción.

Pruebas en contra de nuestra elección

  • La historia de la actualización muestra que el "sin inversiones" de AssemblyAI es un historial de una versión concreta del modelo. Una versión nueva significa volver a probar.
  • Doubao es el más flojo de los cuatro. Con dialecto marcado y habla rápida aporta información limitada.
  • Gemini solo tiene un clip de prueba en turco de tipo conversación, lo cual no basta para juzgarlo. En G.O.R.A. su final perdido vino además con cambios de significado: "quítate las gafas" se convirtió en "sácate los ojos", y palabras como Ölmüş ("está muerto") aparecieron de la nada.
  • El informe registra una expresión inventada menor del principal en cada uno de los dos primeros clips. Pero la revisión también encontró que estos subtítulos omiten mucho, y dos veces se había tomado por alucinación habla real por ese motivo. No podemos estar del todo seguros de que esas dos cuenten en contra del principal.

Problemas abiertos

  • Los cuatro clips son películas. No hay ninguna entrevista real ni ninguna conversación cotidiana y fácil.
  • Los subtítulos omiten tanto que, cuando varios motores coinciden en algo que falta en los subtítulos, hay que volver a comprobar los subtítulos antes de llamarlo alucinación.
  • Los finales perdidos de Gemini no se reflejan en la puntuación. Solo una lectura línea por línea los detecta.

Nuestra página de transcripción en turco

Escrito por Zeyu Si