Parte de la serie: 27 idiomas, uno a uno
Árabe: la gente habla en dialecto y los subtítulos escriben MSA. Cómo elegimos los motores de todos modos
· Zeyu Si
En esta página
Un motor, un mismo nivel de habilidad. En una grabación en árabe su tasa de error fue del 49.2%. En otra, del 18.2%.
El motor no cambió. Cambió la transcripción de referencia. La primera estaba escrita en árabe formal. La segunda recogía, palabra por palabra, el dialecto que usaba de verdad el hablante.
Los fragmentos de prueba: dos grabaciones, dos dialectos
- Talhouk: una charla pública de un hablante libanés sobre la lengua materna y la enseñanza en árabe. Habla árabe libanés coloquial. Los subtítulos lo vierten al árabe estándar moderno (MSA).
- Fenjan (روقي): una entrevista de actualidad en árabe del Golfo (saudí). Los subtítulos transcriben literalmente el dialecto hablado.
Eso es todo lo que tenemos. El material gratuito que combina audio en dialecto, subtítulos hechos por personas y fidelidad literal es muy difícil de encontrar, y nos detuvimos después de estos dos. Se eligieron por el dialecto, no por la dificultad. Nuestro nivel más difícil (personas hablando a la vez, mucho ruido de fondo) no está cubierto en árabe.
Y solo el segundo fragmento sirve para clasificar los motores. Explicamos por qué.
Motores que probamos
Diez: ElevenLabs Scribe v2, AssemblyAI, Speechmatics (enhanced y Melia-1), Doubao (ar-SA), Soniox, Deepgram, Gladia, FunASR (fun-asr-mtl) y Qwen (qwen3.5-omni). Gemini se añadió en una ronda posterior en agosto de 2026.
Líneas rojas: el árabe resultó ser un idioma «seguro»
En la entrevista de Fenjan leímos ocho transcripciones línea por línea: ElevenLabs, Soniox, Speechmatics, Qwen, Doubao, Gladia, Deepgram y FunASR. Todas conservaron el significado. Ni frases inventadas, ni negaciones invertidas, ni pasajes fabricados.
Los problemas estaban en otra parte:
- AssemblyAI entró en bucle en un tramo de la charla de Talhouk y produjo contenido que no está en el audio, asociado a marcas de tiempo de duración cero. Fue la única alucinación genuina de todo el panel de árabe.
- FunASR coló una palabra inglesa, "Also", en una frase árabe (una pequeña deriva de idioma) y convirtió el año 1990 en 2990.
- Doubao y FunASR obtuvieron un 41.4% y un 37.7% en Fenjan, aproximadamente el doble que los primeros. Leyendo con atención, la mayoría de esos «errores» venían de dos cosas: la hamza omitida y los años escritos como se dicen en dialecto (2011 como الفين واحدعش). Un lector no se habría llevado a engaño. Al principio concluimos que Doubao era flojo en árabe; después retiramos esa conclusión.
En el mismo fragmento, Speechmatics obtuvo un 15.7%, Qwen un 17.9%, Soniox un 18.2% y ElevenLabs un 20.1%. Unos pocos puntos de diferencia.
Qué elegimos y por qué
Principal: ElevenLabs Scribe v2. En Fenjan se sitúa al final del grupo de cabeza, así que el árabe no es su idioma más fuerte. Pero fue fiel en ambos fragmentos. En la charla libanesa mantuvo casi intactas palabras dialectales como بدي, هيدا y وين. En la entrevista del Golfo escribió el más genérico أيش donde el hablante dijo وش («qué»), sin perder el significado. Es nuestro motor principal en todos los idiomas sobre todo por la separación de hablantes y la estabilidad en grabaciones largas, no por esta puntuación concreta.
Referencia 1: Soniox. Sin alucinaciones en ninguno de los dos fragmentos, y la lectura más fiel del dialecto del Golfo. En la charla libanesa hizo lo contrario: escribió el dialecto como árabe formal, y por eso su WER allí fue el más bajo. Así que se equivoca en la dirección opuesta a nuestro motor principal. Uno tira hacia el dialecto; el otro, hacia la forma escrita. Eso resulta más útil para contrastar que dos motores que se equivocan de la misma manera.
Referencia 2: Speechmatics. La tasa de error más baja en Fenjan, salida limpia, sin fallos graves. Es un modelo acústico convencional, construido de forma distinta a Soniox. Sus transcripciones llegan sin puntuación, lo cual es un ajuste de la API y no afecta a las palabras.
Referencia 3: Gemini. En la ronda de agosto, el árabe entró en el grupo de «se puede añadir»: sin líneas rojas en al menos dos fragmentos de conversación o discurso.
No elegidos: Qwen fue tan preciso como los dos primeros, pero es un transcriptor basado en un gran modelo de lenguaje, como Gemini, y no da marcas de tiempo por palabra, así que se queda en el banquillo. Doubao funciona de forma distinta a todo lo demás de la alineación; es un posible respaldo, pero no está conectado.
Pruebas en contra de nuestra elección
- En su momento incluimos «Soniox es el más fiel al dialecto libanés» como motivo para elegirlo. Una nueva revisión palabra por palabra mostró que lo teníamos al revés. Los motores que conservaron las palabras dialectales fueron ElevenLabs, FunASR, Qwen y Doubao. Soniox fue el que más formalizó. Ese motivo ha desaparecido; Soniox se queda por los motivos expuestos arriba.
- La única clasificación fiable se apoya en una sola grabación. Speechmatics, Qwen y Soniox están a dos o tres puntos de distancia, y un fragmento no basta para separarlos.
- Nuestra primera pasada por el árabe se basó sobre todo en el WER y en la estructura de la salida. La lectura por significado llegó después, y anuló el veredicto de que «Doubao y FunASR son flojos en árabe».
Pendiente
- Solo se probaron el árabe levantino y el del Golfo. El egipcio y otros dialectos no están cubiertos.
- En cuanto encontremos una tercera y una cuarta grabación fieles al dialecto, habrá que repetir la clasificación.
- Los dos fragmentos son una charla pública y una entrevista en medios, no entrevistas de investigación.
Nuestra página de transcripción en árabe
Escrito por Zeyu Si