Aller au contenu principal

Série : 27 langues, une par une

Thaï : une partie du score de notre moteur principal venait de notre propre bug

· Zeyu Si

Sur cette page

Dans nos tests en thaï, une partie du bon score du moteur principal venait d'un bug dans notre propre code.

Une fonction de notre chaîne de traitement retire la ponctuation en bout de mot. Les signes de voyelle et de ton du thaï sont des caractères combinants qui se placent au-dessus ou en dessous des lettres, et cette fonction les traitait comme de la ponctuation et les supprimait. Les transcriptions ElevenLabs stockées avaient donc perdu tous leurs signes de voyelle et de ton, et leur taux d'erreur avait été calculé comme si ces signes n'existaient pas. Le bug est corrigé, mais la précision réelle d'ElevenLabs sur les diacritiques thaïs doit encore être contrôlée par sondage.

Gardez cette réserve en tête pour chacun des chiffres ci-dessous.

Les extraits de test

Trois extraits, notés par rapport à des sous-titres thaïs faits à la main, issus de la même source :

  • Une interview culinaire : une ou deux personnes qui parlent à un rythme modéré avec peu de bruit de fond. C'est notre extrait de base, proche du niveau facile sur notre échelle de difficulté à trois niveaux.
  • Une émission de téléréalité : plusieurs invités qui parlent en même temps et rient, avec une musique de fond et des effets sonores. Nous la classons au niveau intermédiaire.
  • Un débat de type loup-garou : des gens qui s'accusent mutuellement, parlent vite, se coupent la parole et glissent des mots anglais comme Seer et defend. Niveau le plus élevé.

Nous avions un quatrième extrait, mais la vérification a montré que l'audio et les sous-titres étaient décalés d'environ 30 secondes, ce qui serait revenu à noter par rapport à de mauvaises réponses : nous l'avons donc écarté. Les sous-titres thaïs libres, conversationnels et verbatim sont rares, et trois extraits sont le maximum que nous ayons pu trouver.

Les moteurs essayés

Dix : ElevenLabs Scribe v2, AssemblyAI, Speechmatics (deux versions), Doubao, Soniox, Deepgram, Gladia, FunASR et Qwen. Gemini a été testé séparément.

Où les moteurs ont franchi des lignes rouges

Boucles de répétition. Le débat s'ouvre sur un éclat de rire que les sous-titres notent comme un seul rire bref. Après le rire ฮ่า, Gladia a écrit le signe de répétition thaï ๆ plus de 400 fois d'affilée, sur deux lignes, puis a enchaîné quatre fois les deux mêmes phrases. C'est ce qui l'a poussé à 83,9 %. Il n'a jamais bouclé ainsi sur les deux autres extraits. AssemblyAI boucle aussi : à la relecture, nous avons trouvé qu'il avait répété un mot sur environ 22 lignes dans la téléréalité et enchaîné une autre expression environ 25 fois.

Passages perdus. Sur le débat, AssemblyAI a sauté de grands passages, par endroits près de dix secondes sans aucune sortie. Il est arrivé dernier sur les deux premiers extraits, et sur le débat, seul l'effondrement de Gladia l'a empêché d'être en queue.

Contenu inséré (retiré). À un moment, nous avons cru que Qwen avait inventé un passage au début du débat. À la relecture, les sous-titres se sont révélés décalés d'environ 10 secondes au début, et Soniox, Doubao et FunASR avaient tous transcrit le même contenu au même endroit. Quelqu'un l'a vraiment dit. Nous avons retiré ce constat.

Ce que nous avons choisi

Principal : ElevenLabs Scribe v2. Aucun effondrement et aucune répétition incontrôlée sur aucun extrait ; 12,6 % sur l'interview culinaire et le score le plus bas sur la téléréalité. Avec la réserve ci-dessus.

Références, dans l'ordre : Soniox, Doubao, Gemini. Les trois tournent sur chaque fichier thaï.

  • Soniox : le plus régulier sur les trois extraits, avec la segmentation la plus propre, qui suit les sous-titres ligne par ligne, sans boucle et sans rien de gros laissé de côté.
  • Doubao : produit du vrai thaï, arrive au niveau de Soniox et du principal sur le débat, et laisse tel quel le mot d'emprunt defend. Le rapport disait d'abord que Doubao n'avait pas été lancé sur l'interview culinaire. Il l'avait été, et il y était par endroits plus précis que Soniox ; le résultat n'a simplement jamais été reporté dans le tableau. Il vient aussi d'une lignée technique différente des deux premiers.
  • Gemini : sur le débat, il s'est trompé sur un nom dans le résultat du vote, et les quatre moteurs ont fini à moins de 1,9 point les uns des autres.

Ce que nous avons laissé de côté : Qwen avait le meilleur score sur le débat (18,3 %), mais il a rendu les trois minutes en une seule ligne, sans horodatage au niveau des mots, ce que notre étape d'alignement ne peut pas exploiter. Le score de FunASR était correct aussi, mais sa sortie est un bloc de caractères continu, sans coupure de phrase. Gladia est écarté pour ses boucles et AssemblyAI pour ce qu'il perd.

Les éléments qui plaident contre notre choix

  • Le plus important est en tête d'article : le score thaï du principal est gonflé, et sa précision réelle sur les diacritiques n'a pas encore été contrôlée.
  • Nos relecteurs ne lisent pas le thaï. Le rapport n'a jugé que ce qu'on peut voir sans connaître la langue : répétitions incontrôlées, sauts de longueur soudains, morceaux manquants, tout rendu en un seul bloc. Si un moteur a inversé ou déformé le sens d'une réplique, nous ne l'avons pas vérifié phrase par phrase.
  • Gemini n'a qu'un seul extrait de test thaï de type conversation, ce qui ne suffit pas. Lors d'un tour précédent, il avait aussi produit des choses comme des balises de rire et des étiquettes non thaïes ; ni les unes ni les autres ne sont réapparues sur cet extrait. Le thaï a aussi une fois atteint sa limite de longueur de sortie.
  • Soniox est lui-même un transcripteur de type grand modèle de langage. Nous craignons en général que ce type de moteur lisse les passages qu'il n'entend pas. Nous ne l'avons pas vu en thaï, mais nous n'avons pas non plus vérifié ligne par ligne.

Problèmes ouverts

  • Le thaï ne marque pas les frontières de mots par des espaces et nous n'avons pas encore de segmenteur de mots thaï : notre étape d'alignement travaille donc au niveau de la phrase et reste assez grossière.
  • Aucun des trois extraits n'est une vraie interview de recherche.
  • La précision du moteur principal sur les diacritiques reste à vérifier.

Notre page transcription en thaï

Par : Zeyu Si