Ir al contenido principal

Notas de campo de 27 idiomas: cómo elegimos los motores para cada uno

· Zeyu Si

En esta página

Admitimos 27 idiomas. Los motores que hay detrás de cada uno se probaron por separado. No existe una única configuración aplicada a todos por igual.

Esta serie abre las pruebas de cada idioma: qué fragmentos usamos, qué motores probamos, qué errores cometió cada uno, qué elegimos y por qué, y qué sigue sin resolverse.

La versión corta

No existe «el mejor motor». Un motor que lidera en español puede quedar último en japonés. Uno que no comete errores con audio limpio puede saltarse pasajes enteros en cuanto hay un dialecto o personas hablando a la vez.

Para cada idioma buscamos la combinación que comete menos errores en ese idioma y falla en lugares distintos que los demás. La segunda mitad importa tanto como la primera: los motores que fallan una y otra vez en las mismas palabras no pueden corregirse entre sí. Explicamos por qué en Por qué un solo motor no basta.

El método de prueba en sí está en El WER miente: conversación real como referencia, revisar primero la referencia y después contar los errores que cambian el significado.

La alineación actual

Cada idioma tiene un motor principal, que produce la transcripción y distingue a los hablantes, más dos o tres motores de apoyo que la contrastan.

El motor principal es actualmente ElevenLabs Scribe v2 para todos los idiomas. Los motores de apoyo se agrupan en ocho combinaciones:

Motores de apoyo Idiomas
AssemblyAI + Doubao Inglés, alemán, español, francés, italiano, neerlandés, portugués, ruso, turco, ucraniano
Soniox + Doubao Indonesio, japonés, malayo, polaco, rumano, tailandés
Soniox + Speechmatics Árabe, checo, noruego
Speechmatics + Soniox Danés, griego
AssemblyAI + Soniox Húngaro, sueco
Doubao + Soniox Coreano, vietnamita
Speechmatics + AssemblyAI Finés
Doubao + FunASR + iFlytek Chino (el único idioma con tres)

Desde agosto de 2026, Gemini también funciona como motor de apoyo adicional para los 27 idiomas.

Notas de cada idioma

Idiomas que todavía no admitimos

Probamos tamil, bengalí y filipino, pero no encontramos una referencia utilizable para ninguno de ellos. Los subtítulos en tamil se escriben por convención en el registro literario, mientras que la gente habla el coloquial. Para el bengalí no encontramos subtítulos humanos literales. Y algunos programas etiquetados como filipino resultaron estar en otro idioma.

Si no podemos medirlo, no lo ofrecemos. Cuando tengamos una referencia fiable, por ejemplo una transcripción literal hecha por un hablante nativo, volveremos a probar.

Escrito por Zeyu Si