Série : 27 langues, une par une
Arabe : on parle le dialecte, les sous-titres écrivent l'arabe standard. Comment nous avons quand même choisi les moteurs
· Zeyu Si
Sur cette page
Un seul moteur, un seul niveau de compétence. Sur un enregistrement en arabe, son taux d'erreur était de 49,2 %. Sur un autre, de 18,2 %.
Le moteur n'avait pas changé. La transcription de référence, si. La première était rédigée en arabe soutenu. La seconde notait, mot à mot, le dialecte que l'orateur employait réellement.
Les extraits de test : deux enregistrements, deux dialectes
- Talhouk : une conférence publique d'un orateur libanais sur la langue maternelle et l'enseignement de l'arabe. Il parle en arabe libanais familier. Les sous-titres le rendent en arabe standard moderne (MSA).
- Fenjan (روقي) : un entretien d'actualité en arabe du Golfe (saoudien). Les sous-titres transcrivent le dialecte parlé mot à mot.
C'est tout ce que nous avons. Un matériau gratuit qui réunit audio dialectal, sous-titres faits par des humains et fidélité mot à mot est très difficile à trouver, et nous nous sommes arrêtés après ces deux-là. Ils ont été choisis pour le dialecte, pas pour la difficulté. Notre niveau le plus difficile (personnes qui parlent en même temps, fort bruit de fond) n'est pas couvert pour l'arabe.
Et seul le second extrait permet de classer les moteurs. Voici pourquoi.
Les moteurs testés
Dix : ElevenLabs Scribe v2, AssemblyAI, Speechmatics (enhanced et Melia-1), Doubao (ar-SA), Soniox, Deepgram, Gladia, FunASR (fun-asr-mtl) et Qwen (qwen3.5-omni). Gemini a été ajouté lors d'une série de tests complémentaire en août 2026.
Lignes rouges : l'arabe s'est révélé une langue « sûre »
Sur l'entretien Fenjan, nous avons lu huit transcriptions ligne par ligne : ElevenLabs, Soniox, Speechmatics, Qwen, Doubao, Gladia, Deepgram et FunASR. Toutes ont conservé le sens. Pas de phrases inventées, pas de négations inversées, pas de passages fabriqués.
Les problèmes étaient ailleurs :
- AssemblyAI a bouclé sur un passage de la conférence Talhouk et produit un contenu absent de l'audio, rattaché à des horodatages de durée nulle. Ce fut la seule véritable hallucination de tout le panel arabe.
- FunASR a glissé un mot anglais, « Also », dans une phrase arabe (une petite dérive de langue) et transformé l'année 1990 en 2990.
- Doubao et FunASR ont obtenu 41,4 % et 37,7 % sur Fenjan, à peu près le double des meilleurs. À la lecture attentive, la plupart de ces « erreurs » venaient de deux choses : la hamza omise, et des années écrites en toutes lettres comme on les prononce en dialecte (2011 écrit الفين واحدعش). Un lecteur ne serait pas induit en erreur. Nous avions d'abord conclu que Doubao était faible en arabe ; nous sommes ensuite revenus sur cette conclusion.
Sur le même extrait, Speechmatics a obtenu 15,7 %, Qwen 17,9 %, Soniox 18,2 % et ElevenLabs 20,1 %. Quelques points d'écart.
Ce que nous avons choisi, et pourquoi
Moteur principal : ElevenLabs Scribe v2. Sur Fenjan, il se situe en queue du groupe de tête ; l'arabe n'est donc pas sa langue la plus forte. Mais il a été fidèle sur les deux extraits. Sur la conférence libanaise, il a conservé presque intacts des mots dialectaux comme بدي, هيدا et وين. Sur l'entretien du Golfe, il a écrit le plus générique أيش là où l'orateur disait وش (« quoi »), sans perdre le sens. C'est notre moteur principal dans toutes les langues, surtout pour la séparation des locuteurs et la stabilité sur les longs enregistrements, pas pour ce score en particulier.
Référence 1 : Soniox. Aucune hallucination sur les deux extraits, et la lecture la plus fidèle du dialecte du Golfe. Sur la conférence libanaise, il a fait l'inverse : il a écrit le dialecte en arabe soutenu, ce qui explique que son WER y ait été le plus bas. Il se trompe donc dans la direction opposée à celle de notre moteur principal. L'un penche vers le dialecte, l'autre vers la forme écrite. C'est plus utile pour le recoupement que deux moteurs qui se trompent de la même façon.
Référence 2 : Speechmatics. Le taux d'erreur le plus bas sur Fenjan, une sortie propre, aucune défaillance. C'est un modèle acoustique classique, construit différemment de Soniox. Ses transcriptions arrivent sans ponctuation, ce qui relève d'un réglage de l'API et n'affecte pas les mots.
Référence 3 : Gemini. Lors de la série d'août, l'arabe est entré dans le groupe « peut être ajouté » : aucune ligne rouge franchie sur au moins deux extraits de conversation ou de discours.
Non retenus : Qwen était aussi précis que les deux premiers, mais c'est un transcripteur à base de grand modèle de langage comme Gemini et il ne fournit pas d'horodatage au niveau du mot ; il reste donc sur le banc. Doubao fonctionne différemment de tous les autres moteurs de la configuration ; c'est une solution de secours possible, mais il n'est pas branché.
Les éléments qui contredisent notre choix
- Nous avions un temps cité « Soniox est le plus fidèle au dialecte libanais » comme raison de le choisir. Une nouvelle vérification mot à mot a montré que nous avions tout inversé. Les moteurs qui conservaient les mots dialectaux étaient ElevenLabs, FunASR, Qwen et Doubao. Soniox était celui qui passait le plus au registre soutenu. Cette raison est tombée ; Soniox reste pour les raisons exposées plus haut.
- Le seul classement fiable repose sur un seul enregistrement. Speechmatics, Qwen et Soniox sont à deux ou trois points d'écart, et un seul extrait ne peut pas les départager.
- Notre premier passage sur l'arabe s'appuyait surtout sur le WER et la structure de la sortie. La lecture pour le sens est venue plus tard, et elle a renversé le verdict « Doubao et FunASR sont faibles en arabe ».
Encore en suspens
- Seuls l'arabe levantin et l'arabe du Golfe ont été testés. L'égyptien et les autres dialectes ne sont pas couverts.
- Dès que nous trouverons un troisième et un quatrième enregistrement fidèle au dialecte, il faudra refaire le classement.
- Les deux extraits sont une conférence publique et un entretien médiatique, pas des entretiens de recherche.
Notre page transcription en arabe
Par : Zeyu Si