Aller au contenu principal

Série : 27 langues, une par une

Malais : l'interlocuteur est passé à l'anglais, et le moteur l'a retraduit

· Zeyu Si

Sur cette page

Dans une interview d'actualité malaisienne, l'invité passe à l'anglais en cours de route : "enforcing the letter of the law, without looking at … mood music around you."

ElevenLabs a transcrit cet anglais mot pour mot. AssemblyAI a produit à la place une quinzaine de mots en malais. À peu près le même sens, parfaitement fluide, et pas ce que l'invité a dit.

Pour les chercheurs, c'est l'erreur la plus dangereuse en malais. Le moteur a fait une traduction à la place de la personne interviewée, et rien sur la page ne le trahit.

Les extraits de test : trois, choisis pour l'alternance de langues

  • Une scène d'une série télévisée malaisienne : une mère et son fils qui discutent, puis une arrestation par la brigade des stupéfiants, avec des cris et quelques répliques en anglais ("under arrest" et autres).
  • Deux interviews de talk-shows politiques malaisiens : des commentateurs qui passent du malais à l'anglais d'une phrase à l'autre, des propositions entières en anglais, et beaucoup de noms de personnes et de partis.

Il y avait un quatrième extrait, une conférence TEDx, mais ses sous-titres bénévoles étaient un résumé, 170 mots pour trois minutes : il ne pouvait pas servir de référence et nous l'avons écarté. Le matériel en malais libre, conversationnel et verbatim est rare, et nous nous sommes arrêtés à trois. Les extraits ont été choisis pour la quantité d'alternance de langues qu'ils contiennent, pas pour correspondre à nos trois niveaux de difficulté. Nous n'avons pas testé spécifiquement le bruit fort avec des gens qui parlent en même temps.

Les moteurs testés

Onze : ElevenLabs Scribe v2, Soniox, Doubao (ms-MY), AssemblyAI, FunASR, Qwen, Speechmatics (enhanced et Melia-1), Gladia et Deepgram, plus Gemini, ajouté en août 2026.

Lignes rouges, moteur par moteur

Réécrire l'anglais en malais : AssemblyAI et Gladia l'ont fait tous les deux sur le passage juridique ci-dessus. Dans l'autre interview, AssemblyAI a aussi transformé "asking for the removal" en l'équivalent malais de « restauration », le sens opposé. Gladia a transformé « nous examinerons les commentaires » en « nous supprimerons les commentaires ».

Sens inversé :

  • Deepgram a transformé « fait l'objet d'une enquête » en « s'est évadé ».
  • FunASR a transformé la réplique de la série « vous vous trompez de personne » en « vous tenez la bonne personne ».
  • Speechmatics a transformé l'anglais "I don't know what that means" en "I know What I means".

Passages perdus : Deepgram a coupé la série après 2:11, en perdant environ 30 %. FunASR a sauté environ 20 secondes d'une interview.

Mots insérés : Speechmatics a glissé "menipu" (« tromper ») dans une phrase.

Boucles : la version Melia-1 de Speechmatics a répété "eh" une cinquantaine de fois à la fin de la série, et a produit une série de "ada ada ada" dans une interview. Cette série avait d'abord été attribuée à Qwen ; la relecture a montré que nous l'avions mise sur le compte du mauvais moteur.

Ce que nous avons choisi, et pourquoi

Principal : ElevenLabs Scribe v2. Le plus propre sur l'alternance de langues dans les trois extraits, les propositions anglaises conservées mot pour mot, et le plus précis sur les noms.

Référence 1 : Soniox. Aucune hallucination ni inversion sur aucun extrait, et le taux d'erreur le plus bas sur les trois (seulement 0,4 point devant AssemblyAI sur la série). Son seul petit faux pas : "latter" au lieu de "letter".

Référence 2 : Doubao. Aucune hallucination ni inversion non plus, et le seul moteur à n'avoir rien « traduit » sur les trois extraits. Il a gardé telles quelles les répliques anglaises de la série, "You got the wrong person" et "under arrest". Ses erreurs portaient sur des noms et des mots proches à l'oreille, comme "gelap" (sombre) pour "gelak" (rire).

Référence 3 : Gemini. Lors de la série de tests d'août, il a eu au plus une expression floue sur le premier talk-show, avec tous les noms de partis et d'institutions justes. Sur la conférence TEDx, il a produit 304 mots cohérents sans aucune hallucination.

Les éléments qui plaident contre notre choix

  • Soniox « malaisifie » aussi. Dans la série, il a écrit la réplique anglaise "You are under arrest" sous la forme malaise "awak ditangkap". Le sens est juste et rien n'est inversé, mais c'est le même type de comportement que nous avons reproché à AssemblyAI, et le rapport initial ne l'avait pas signalé. La relecture recommande de contrôler par sondage les passages à alternance de langues dès les débuts en production.
  • Doubao n'est pas un deuxième évident. Sur les talk-shows, son taux d'erreur alterne avec ceux de FunASR et de Qwen. L'une des raisons de le choisir était que FunASR perdait de gros morceaux et que Qwen bouclait, alors que Doubao ne faisait ni l'un ni l'autre. La seconde moitié de cet argument s'est révélée attribuée au mauvais moteur (voir le dernier point).
  • AssemblyAI est en fait très bon sur la série : 17,4 %, à égalité avec Soniox en tête. Il ne décroche que sur l'alternance dense des interviews. C'est désormais un moteur de secours.
  • Qwen a été condamné sur deux éléments qui se sont tous deux effondrés : la boucle venait de Melia-1, et la « phrase inventée » était l'interlocuteur qui commençait réellement une phrase puis se reprenait. C'est désormais un secours utilisable mais pas une piste permanente, car ses horodatages forment une grille régulière plutôt que de vrais temps.

Questions ouvertes

  • Trois extraits, c'est un petit échantillon.
  • Aucun test dédié au bruit fort avec des gens qui parlent en même temps.
  • L'alternance dense n'a été testée que dans un seul contexte : les talk-shows politiques.

Notre page transcription en malais

Par : Zeyu Si